Gemini 3.5 Transcribe Live לעומת Gemini 3.5 Transcribe — איזו נקודת קצה האפליקציה שלך צריכה לקרוא. איור מחודש.
Guides & Insights

Gemini 3.5 Transcribe Live לעומת Gemini 3.5 Transcribe: לאיזה endpoint האפליקציה שלך צריכה לקרוא

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כאשר Go​ogle השיקה את משפחת Ge​mini 3.5 Transcribe ב-26 באוגוסט 2026, היא שלחה שני דגמים שחולקים שם ומשימה אבל בנויים לשלבים שונים של שיחה: Ge​mini 3.5 Transcribe Live, נקודת הקצה הזורמת המוגשת דרך Live API, ו-Ge​mini 3.5 Transcribe, נקודת הקצה המוקלטת מראש המוגשת דרך Interactions API. הטעות שרוב הצוותים עושים בשבוע הראשון היא להתייחס לזה כאל מודל אחד עם שני כפתורים. זה שני SKUs — APIs שונים, מחירים שונים, מגבלות נוקשות שונות — והשוואת הדיוק ביניהם אינה קרב הוגן, כי הם נמדדים תחת כללים שונים. מאמר זה מציג את השניים זה לצד זה, כך שההחלטה תלויה בעומס העבודה שלך, לא בטבלת דירוג.

השניים במבט חטוף

• API — {{1}}Ge​mini 3.5 Transcribe Live{{/1}} פועל על {{2}}Live API (WebSocket, סטרימינג דו-כיווני){{/2}} לעומת {{3}}Ge​mini 3.5 Transcribe{{/3}} על ה-Interactions API (קובץ פנימה, תמלול החוצה).

• עבודה — שיחה חיה, כתוביות, סוכני קול מול פגישות, יומני שיחות, אודיו בארכיון.

• דיוק — 4.0% WER בסטרימינג לעומת 2.6% WER ללא סטרימינג, לפי Artificial Analysis, מצוטט על ידי Google; משטרי מדידה שונים, לא ניתנים להשוואה ישירה.

• השהיה — תמליל סופי 0.40 שניות לאחר סיום הדיבור לעומת עיבוד אצווה של קובץ שלם.

• סשן — מקסימום 10 דקות לסשן חי לעומת קבצים של עד 60 דקות (30 דקות עם הפעלת דיאריזציה וחותמות זמן).

• דוברים — אין בצד הסטרימינג לעומת עד שלושה דוברים עם חותמות זמן ברמת מילה בצד המוקלט מראש.

• מחיר — כ-$0.009 לדקה ממוצע לעומת כ-$0.005 לדקה ממוצע.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

החלטת הארכיטקטורה: Interactions API או Live API

שני הדגמים נמצאים תחת משפחת האודיו של Go​ogle Ge​mini, ושניהם בתצוגה מקדימה ציבורית. ההבדל מתחיל בתעבורה. gemini-3-5-transcribe-live פותח WebSocket ומשאיר אותו פתוח: זרם האודיו הגולמי נכנס ברציפות — המבנה הנפוץ הוא חלקי PCM של 16kHz או 24kHz ב-16 סיביות — והמודל מחזיר תמלילים חלקיים בזמן שאתה מדבר, ולאחר מכן תמליל סופי לכל אמירה כשהדיבור מסתיים. gemini-3-5-transcribe מקבל קובץ מלא, מעבד אותו, ומחזיר את התמליל המוגמר עם ייחוס דובר וחותמות זמן ברמת המילה.

החלטת ההעברה מכתיבה את כל השאר. אם המוצר שלך מציג מילים בעת שהן נאמרות — כתובית חיה, סוכן קולי שקורא את הכוונה באמצע משפט, עוזר שיחות שפועל בזמן שהשיחה חיה — אתה נמצא במסלול החי. אם המוצר שלך מייצר תיעוד — תקציר פגישה, יומן שיחות, ארכיון — אתה נמצא במסלול האינטראקציות. הבלבול הוא ששניהם מייצרים טקסט; ההבדל הוא האם הטקסט הוא מצב בזמן אמת או תוצר סופי.

דיוק: מס הסטרימינג הוא אמיתי

Artificial Analysis, בית הבדיקה העצמאי שמספריו Go​ogle מצטט בפוסט ההכרזה שלו, מודד שיעור שגיאות מילים ממוצע של 4.0% עבור נקודת הקצה הזורמת (streaming) ו-2.6% עבור זו שאינה זורמת. במבחן הרב-לשוני FLEURS, Go​ogle מדווח על 5.50% בסטרימינג לעומת 5.04% ללא סטרימינג. הנתון של 2.6% ממקם את Ge​mini 3.5 Transcribe במקום ה-5 בטבלת ה-WER של AA בעת ההשקה, מאחורי ElevenLabs Scribe v2 עם 2.2% ו-Microsoft MAI-Transcribe-1.5 עם 2.4% — אלה המדידות של AA, לא הטענות של Go​ogle.

{{1}}המספר של הסטרימינג אינו גרסה גרועה יותר של אותו מבחן. זהו משטר שונה: המודל מתחייב למילים לפני ששמע את סוף המשפט, ומשלם על כך. אל תבחר בין השניים על סמך דיוק בלבד, כי בכל עומס עבודה נתון הפער יכול להתהפך. בחר על פי האילוצים: נקודת הקצה של הסטרימינג מוגבלת ל-10 דקות, ללא הפרדת דוברים וללא חותמות זמן; נקודת הקצה של ההקלטות המוקדמות מטפלת בקבצים באורך שעה, מייחסת עד שלושה דוברים ומחזירה חותמות זמן ברמת מילה. אם האפליקציה שלך צריכה תוויות דוברים, מודל הסטרימינג פשוט לא יכול לבצע את העבודה, יהיה אשר יהיה ה-WER שלו.{{/1}}

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

מה הם חולקים

שתי נקודות הקצה חולקות את מנוע "התמלול החכם", ובתכונות המשותפות הבחירה ביניהן נייטרלית:

• 85+ שפות עם זיהוי אוטומטי, כולל מעבר שפה באמצע הזרם בנתיב ה-Live.

• ניקוי אי־שטף — מילות מילוי מושמטות, תיקונים עצמיים מיושבים (‏"יום שלישי — לא, יום רביעי"‏ הופך ליום המתוקן).

• עיצוב אוטומטי — פיסוק, רישיות ומבנה פסקאות המוחלים על הפלט.

• אוצר מילים מותאם אישית — עד 1,000 מונחים לז'רגון ושמות מוצרים, כשהתיעוד של Go​ogle ממליץ על כ-100 לקבלת התוצאות הטובות ביותר.

אזהרה אחת שחלה על שניהם: הניקוי ה"חכם" שהופך את הפלט לקריא הוא החלטה עיצובית שמתפשרת על נאמנות מילולית. ניסוחים מגושמים מוחלקים; הטקסט הוא קריאת הכוונה של המודל, לא פרוטוקול בית משפט. לתמלילים מדויקים תרצו אפשרות verbatim היכן שהיא זמינה, ותרצו לאמת את ההתנהגות על האודיו שלכם בכל מקרה.

עלות לדקה: הפרמיום החי

גוגל מתמחרת אודיו בטוקנים, כאשר כל שנייה של אודיו עולה 25 טוקני אודיו, והפלט הוא בערך 175 טוקני טקסט לדקת תמלול. במחירי המחירון, העלות המשולבת לדקת אודיו היא כ-$0.005 עבור gemini-3-5-transcribe וכ-$0.009 עבור gemini-3-5-transcribe-live — קלט במחיר של $2 לעומת $3.50 למיליון טוקנים, ופלט במחיר של $12 לעומת $21 למיליון טוקנים. לשתיהן יש מסלול חינמי כיום.

הפרמיום קונה את המסלול בזמן אמת, לא דיוק גבוה יותר: אתה משלם בערך 80% יותר לדקה עבור נקודת הקצה של הסטרימינג, והיא מתמללת ב-WER גבוה יותר. זו המסגרת הכנה. המודל המוקלט מראש הוא גם זול יותר וגם מדויק יותר; מודל הסטרימינג קיים כי חלק מהמוצרים לא יכולים לחכות לסיום הקובץ.

באיזה endpoint כדאי לבנות

• כיתובים חיים וכתוביות — Ge​mini 3.5 Transcribe Live, ובדקו את מגבלת הפלט ללא חותמות זמן אם אתם זקוקים לפלט מיושר לזמן.

סוכני קול — Gemini 3.5 Transcribe Live לזיהוי כוונה באמצע משפט; תכנן סביב מגבלת 10 הדקות לסשנים ארוכים.

• פגישות, ראיונות, ארכוב — Ge​mini 3.5 Transcribe, עבור 2.6% WER, ייחוס דובר, וחותמות זמן ברמת מילה.

• אנליטיקה לאחר שיחה — Ge​mini 3.5 Transcribe עבור הרשומה המוגמרת; Ge​mini 3.5 Transcribe Live רק אם יש להריץ את הניתוח במהלך השיחה.

• אודיו רציף ארוך — Gemini 3.5 Transcribe, כי קובץ של 60 דקות עדיף על תפירה ידנית של הקלטות חיות של עשר דקות.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

השכבה שמעל התמליל

OrcaRouter אינו מארח אף אחד מהמודלים — אנחנו לא מנתבים דיבור-לטקסט כיום, ותקרא ישירות ל-API של Go​ogle עבור כל אחד מהקצוות. מה ששכבת ניתוב עושה עבור צינור קול הוא לשבת מעל התמליל: המסכם, מחלץ הישויות, מודל פריטי-הפעולה שהופך זרם להחלטה. השכבה הזו היא המקום שבו OrcaRouter מצדיק את קיומו — API אחד על פני למעלה מ-200 מודלים במחיר המחירון של הספק ללא תוספת, מעבר אוטומטי (failover) בין ספקים, ו-DSL ניתוב שמרכיב כמה מודלים לקריאה אחת. בחר את נקודת הקצה של התמלול לפי עומס העבודה, ולאחר מכן הפעל את המודל שקורא את התמליל באמצעות מפתח אחד.

השורה התחתונה

Ge​mini 3.5 Transcribe Live ו- Ge​mini 3.5 Transcribe הם מאותה משפחה אך מוצרים שונים. בחר ב-Live כאשר התמליל חייב להתקיים לפני סיום השיחה ואתה יכול להסתפק בסשן של 10 דקות, ללא תוויות דוברים וללא חותמות זמן. בחר ב-Transcribe כאשר הפלט הוא תיעוד ודיוק וייחוס חשובים יותר ממהירות — הוא זול יותר, מדויק יותר, והרבה פחות מוגבל. התשובה השגויה היחידה היא להניח שנקודת קצה אחת עושה את שניהם.