
Gemini 3.5 Transcribe Live לעומת Gemini 3.5 Transcribe: לאיזה endpoint האפליקציה שלך צריכה לקרוא
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123אינטליגנציה49כתיבת קוד
כאשר Google השיקה את משפחת Gemini 3.5 Transcribe ב-26 באוגוסט 2026, היא שלחה שני דגמים שחולקים שם ומשימה אבל בנויים לשלבים שונים של שיחה: Gemini 3.5 Transcribe Live, נקודת הקצה הזורמת המוגשת דרך Live API, ו-Gemini 3.5 Transcribe, נקודת הקצה המוקלטת מראש המוגשת דרך Interactions API. הטעות שרוב הצוותים עושים בשבוע הראשון היא להתייחס לזה כאל מודל אחד עם שני כפתורים. זה שני SKUs — APIs שונים, מחירים שונים, מגבלות נוקשות שונות — והשוואת הדיוק ביניהם אינה קרב הוגן, כי הם נמדדים תחת כללים שונים. מאמר זה מציג את השניים זה לצד זה, כך שההחלטה תלויה בעומס העבודה שלך, לא בטבלת דירוג.
השניים במבט חטוף
• API — {{1}}Gemini 3.5 Transcribe Live{{/1}} פועל על {{2}}Live API (WebSocket, סטרימינג דו-כיווני){{/2}} לעומת {{3}}Gemini 3.5 Transcribe{{/3}} על ה-Interactions API (קובץ פנימה, תמלול החוצה).
• עבודה — שיחה חיה, כתוביות, סוכני קול מול פגישות, יומני שיחות, אודיו בארכיון.
• דיוק — 4.0% WER בסטרימינג לעומת 2.6% WER ללא סטרימינג, לפי Artificial Analysis, מצוטט על ידי Google; משטרי מדידה שונים, לא ניתנים להשוואה ישירה.
• השהיה — תמליל סופי 0.40 שניות לאחר סיום הדיבור לעומת עיבוד אצווה של קובץ שלם.
• סשן — מקסימום 10 דקות לסשן חי לעומת קבצים של עד 60 דקות (30 דקות עם הפעלת דיאריזציה וחותמות זמן).
• דוברים — אין בצד הסטרימינג לעומת עד שלושה דוברים עם חותמות זמן ברמת מילה בצד המוקלט מראש.
• מחיר — כ-$0.009 לדקה ממוצע לעומת כ-$0.005 לדקה ממוצע.

החלטת הארכיטקטורה: Interactions API או Live API
שני הדגמים נמצאים תחת משפחת האודיו של Google Gemini, ושניהם בתצוגה מקדימה ציבורית. ההבדל מתחיל בתעבורה. gemini-3-5-transcribe-live פותח WebSocket ומשאיר אותו פתוח: זרם האודיו הגולמי נכנס ברציפות — המבנה הנפוץ הוא חלקי PCM של 16kHz או 24kHz ב-16 סיביות — והמודל מחזיר תמלילים חלקיים בזמן שאתה מדבר, ולאחר מכן תמליל סופי לכל אמירה כשהדיבור מסתיים. gemini-3-5-transcribe מקבל קובץ מלא, מעבד אותו, ומחזיר את התמליל המוגמר עם ייחוס דובר וחותמות זמן ברמת המילה.
החלטת ההעברה מכתיבה את כל השאר. אם המוצר שלך מציג מילים בעת שהן נאמרות — כתובית חיה, סוכן קולי שקורא את הכוונה באמצע משפט, עוזר שיחות שפועל בזמן שהשיחה חיה — אתה נמצא במסלול החי. אם המוצר שלך מייצר תיעוד — תקציר פגישה, יומן שיחות, ארכיון — אתה נמצא במסלול האינטראקציות. הבלבול הוא ששניהם מייצרים טקסט; ההבדל הוא האם הטקסט הוא מצב בזמן אמת או תוצר סופי.
דיוק: מס הסטרימינג הוא אמיתי
Artificial Analysis, בית הבדיקה העצמאי שמספריו Google מצטט בפוסט ההכרזה שלו, מודד שיעור שגיאות מילים ממוצע של 4.0% עבור נקודת הקצה הזורמת (streaming) ו-2.6% עבור זו שאינה זורמת. במבחן הרב-לשוני FLEURS, Google מדווח על 5.50% בסטרימינג לעומת 5.04% ללא סטרימינג. הנתון של 2.6% ממקם את Gemini 3.5 Transcribe במקום ה-5 בטבלת ה-WER של AA בעת ההשקה, מאחורי ElevenLabs Scribe v2 עם 2.2% ו-Microsoft MAI-Transcribe-1.5 עם 2.4% — אלה המדידות של AA, לא הטענות של Google.
{{1}}המספר של הסטרימינג אינו גרסה גרועה יותר של אותו מבחן. זהו משטר שונה: המודל מתחייב למילים לפני ששמע את סוף המשפט, ומשלם על כך. אל תבחר בין השניים על סמך דיוק בלבד, כי בכל עומס עבודה נתון הפער יכול להתהפך. בחר על פי האילוצים: נקודת הקצה של הסטרימינג מוגבלת ל-10 דקות, ללא הפרדת דוברים וללא חותמות זמן; נקודת הקצה של ההקלטות המוקדמות מטפלת בקבצים באורך שעה, מייחסת עד שלושה דוברים ומחזירה חותמות זמן ברמת מילה. אם האפליקציה שלך צריכה תוויות דוברים, מודל הסטרימינג פשוט לא יכול לבצע את העבודה, יהיה אשר יהיה ה-WER שלו.{{/1}}

מה הם חולקים
שתי נקודות הקצה חולקות את מנוע "התמלול החכם", ובתכונות המשותפות הבחירה ביניהן נייטרלית:
• 85+ שפות עם זיהוי אוטומטי, כולל מעבר שפה באמצע הזרם בנתיב ה-Live.
• ניקוי אי־שטף — מילות מילוי מושמטות, תיקונים עצמיים מיושבים ("יום שלישי — לא, יום רביעי" הופך ליום המתוקן).
• עיצוב אוטומטי — פיסוק, רישיות ומבנה פסקאות המוחלים על הפלט.
• אוצר מילים מותאם אישית — עד 1,000 מונחים לז'רגון ושמות מוצרים, כשהתיעוד של Google ממליץ על כ-100 לקבלת התוצאות הטובות ביותר.
אזהרה אחת שחלה על שניהם: הניקוי ה"חכם" שהופך את הפלט לקריא הוא החלטה עיצובית שמתפשרת על נאמנות מילולית. ניסוחים מגושמים מוחלקים; הטקסט הוא קריאת הכוונה של המודל, לא פרוטוקול בית משפט. לתמלילים מדויקים תרצו אפשרות verbatim היכן שהיא זמינה, ותרצו לאמת את ההתנהגות על האודיו שלכם בכל מקרה.
עלות לדקה: הפרמיום החי
גוגל מתמחרת אודיו בטוקנים, כאשר כל שנייה של אודיו עולה 25 טוקני אודיו, והפלט הוא בערך 175 טוקני טקסט לדקת תמלול. במחירי המחירון, העלות המשולבת לדקת אודיו היא כ-$0.005 עבור gemini-3-5-transcribe וכ-$0.009 עבור gemini-3-5-transcribe-live — קלט במחיר של $2 לעומת $3.50 למיליון טוקנים, ופלט במחיר של $12 לעומת $21 למיליון טוקנים. לשתיהן יש מסלול חינמי כיום.
הפרמיום קונה את המסלול בזמן אמת, לא דיוק גבוה יותר: אתה משלם בערך 80% יותר לדקה עבור נקודת הקצה של הסטרימינג, והיא מתמללת ב-WER גבוה יותר. זו המסגרת הכנה. המודל המוקלט מראש הוא גם זול יותר וגם מדויק יותר; מודל הסטרימינג קיים כי חלק מהמוצרים לא יכולים לחכות לסיום הקובץ.
באיזה endpoint כדאי לבנות
• כיתובים חיים וכתוביות — Gemini 3.5 Transcribe Live, ובדקו את מגבלת הפלט ללא חותמות זמן אם אתם זקוקים לפלט מיושר לזמן.
סוכני קול — Gemini 3.5 Transcribe Live לזיהוי כוונה באמצע משפט; תכנן סביב מגבלת 10 הדקות לסשנים ארוכים.
• פגישות, ראיונות, ארכוב — Gemini 3.5 Transcribe, עבור 2.6% WER, ייחוס דובר, וחותמות זמן ברמת מילה.
• אנליטיקה לאחר שיחה — Gemini 3.5 Transcribe עבור הרשומה המוגמרת; Gemini 3.5 Transcribe Live רק אם יש להריץ את הניתוח במהלך השיחה.
• אודיו רציף ארוך — Gemini 3.5 Transcribe, כי קובץ של 60 דקות עדיף על תפירה ידנית של הקלטות חיות של עשר דקות.

השכבה שמעל התמליל
OrcaRouter אינו מארח אף אחד מהמודלים — אנחנו לא מנתבים דיבור-לטקסט כיום, ותקרא ישירות ל-API של Google עבור כל אחד מהקצוות. מה ששכבת ניתוב עושה עבור צינור קול הוא לשבת מעל התמליל: המסכם, מחלץ הישויות, מודל פריטי-הפעולה שהופך זרם להחלטה. השכבה הזו היא המקום שבו OrcaRouter מצדיק את קיומו — API אחד על פני למעלה מ-200 מודלים במחיר המחירון של הספק ללא תוספת, מעבר אוטומטי (failover) בין ספקים, ו-DSL ניתוב שמרכיב כמה מודלים לקריאה אחת. בחר את נקודת הקצה של התמלול לפי עומס העבודה, ולאחר מכן הפעל את המודל שקורא את התמליל באמצעות מפתח אחד.
השורה התחתונה
Gemini 3.5 Transcribe Live ו- Gemini 3.5 Transcribe הם מאותה משפחה אך מוצרים שונים. בחר ב-Live כאשר התמליל חייב להתקיים לפני סיום השיחה ואתה יכול להסתפק בסשן של 10 דקות, ללא תוויות דוברים וללא חותמות זמן. בחר ב-Transcribe כאשר הפלט הוא תיעוד ודיוק וייחוס חשובים יותר ממהירות — הוא זול יותר, מדויק יותר, והרבה פחות מוגבל. התשובה השגויה היחידה היא להניח שנקודת קצה אחת עושה את שניהם.
