כרטיס כותרת ראשי עבור 'תמלול חכם עם Gemini 3.5 Transcribe' המציג גל קול ההופך לטקסט מעוצב, גלובוס המסומן 85+ שפות, שבבי תוויות דובר, מספרי הכותרת 2.6% WER ללא סטרימינג ו-~$0.005/דקה בממוצע, ולוגו OrcaRouter בפינה הימנית-תחתונה.
Engineering & Research

תמלול חכם עם Gemini 3.5 Transcribe

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Gemini 3.5 Transcribe נכנס לתצוגה מקדימה ציבורית ב-26 באוגוסט 2026, וזהו מודל הדיבור-לטקסט הראשון של Google שנמכר בפועל כמודל Gemini: קוראים לו דרך Gemini API עם מזהה מודל, האודיו מתומחר בטוקנים, ו-Google מצטטת את העלות לדקת אודיו בדף המחירים שלה. הפרט האחרון הוא מה שהסיקור הצרכני חומק ממנו. סיפורי יום ההשקה עוסקים בהסרת מילות מילוי ובעריכת קול ב-Gboard, אבל מה שבאמת השתנה למפתחים הוא שהתמלול יושב עכשיו על אותו משטח API כמו שאר קו מוצרי Gemini, עם ייחוס דובר וחותמות זמן ברמת מילה במודל הבסיסי ולא בתוסף נפרד. הקטע הזה נקרא כמו מסמך עזר ל-API, כי זה הפער שהגל הראשון של הסיקור משאיר פתוח.

שתי הסתייגויות מראש, כדי שהמספרים להלן לא יטעו. Go​ogle אינה מכנה את Gemini 3.​5 Transcribe "המודל המדויק ביותר להמרת דיבור לטקסט שיש לנו" – הטענה היא שהמודל הוא המדויק ביותר לאינטראקציות קוליות חכמות, וזו טענה שונה, וההבדל חשוב כשקוראים את נתוני ה-WER. וכל מה שכאן מתאר תצוגה מקדימה ציבורית: שני מזהי המודל, המחירים ומספרי ה-benchmark הם מה ש-Go​ogle שולחת היום, והכל יכול להשתנות לפני GA.

שני נתיבי ה-API — ומזהי המודל שיש לזכור

Gemini 3.​5 Transcribe מגיע בשתי נקודות קצה, והבחירה בנקודה הנכונה היא ההחלטה הארכיטקטונית הראשונה שצוות מקבל:

• gemini-3-5-transcribe — המסלול להקלטות מוקדמות דרך ה-Interactions API. שלח קובץ, קבל בחזרה את התמליל עם ייחוס דוברים (עד שלושה דוברים; שלושה ומעלה הוא ניסיוני) וחותמות זמן ברמת המילה. זהו סוס העבודה לעיבוד באצווה ואסינכרוני.

• gemini-3-5-transcribe-live — המסלול בזמן אמת דרך ה-Live API. סטרימינג דו-כיווני עם זמן השהיה מתחת לשנייה, המיועד לשיחות חיות, תמלול ממסך, וממשקים מבוססי קול.

הפיצול משקף את האופן שבו מסודרת שאר משפחת Gemini Audio, וזה חשוב כי "live" הוא מק"ט (SKU) נפרד עם מחיר משלו. כמה קריאות מוקדמות של ההשקה הזו מניחות שמודל אחד עושה את שניהם; זה לא.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

מה 'תמלול חכם' אומר בעצם

פוסט ההשקה של Go​ogle ממסגר זאת כהתקדמות מעבר לדיוק פונטי לעבר הבנה. התכונות שנובעות מהמסגור הזה הן אלה שצריך להעריך, ולא המסגור עצמו:

• טיפול בחוסר שטף — "אממ" ו"אה" נשמטים, ותיקונים עצמיים נפתרים. "בוא ניפגש ביום שלישי — לא, רביעי" מתומלל כיום המתוקן, לא כתמליל של התחלה שגויה. זו החלטה שהמודל מקבל, ובמובן הזה Go​ogle קוראת לזה אינטליגנטי.

• עיצוב אוטומטי — הפלט חוזר כטקסט מעוצב: מוחלים סימני פיסוק, רישיות ומבנה פסקאות, ולא זרם אסימונים גולמי.

• זיהוי דוברים מרובים — עד שלושה דוברים שמיוחסים לאודיו מוקלט מראש עם חותמות זמן ברמת מילה; שלושה דוברים או יותר הוא מצב ניסיוני. זה יושב במודל הבסיס ולא בשירות דיאריזציה נפרד.

• אוצר מילים מותאם אישית — ניתן להטות את הזיהוי לכיוון מונחים מקצועיים, שמות מוצרים ואיותים חריגים על ידי אספקת אוצר מילים, שהוא המנגנון לתחומים אנכיים.

• 85+ שפות — זיהוי אוטומטי, עם ציון מפורש של מבטאים אזוריים וניבים.

• קריאת פונקציות — המודל יכול להאציל משימות כמו יצירת תמונות או ניתוח קבצים למודלי Gemini אחרים, מה שהופך את התמלול למרכיב של סוכן רחב יותר במקום לשלב סופי.

• לכידת ישויות — גוגל טוענת לביצועים חזקים על אודיו רועש מהעולם האמיתי ועל ישויות אלפאנומריות כגון מיקודים ומזהי הזמנות.

הסיקור העיתונאי דיווח גם על חלון הקשר של 96,000 אסימונים (בערך שעה של אודיו מפגש ללא פיצול) ועל זיהוי רגשות. שניהם עולים בקנה אחד עם המסגור של ההשקה, אך כרטיס המודל שגו​גל פרסמה אינו מציג אותם בכותרת, לכן יש להתייחס אליהם כאל דיווחים ולא כאישור עד שיופיע גיליון מפרטים של GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

מספרי הדיוק, מסומנים

נתוני ה-WER שגוגל מצטטת מגיעים מ-Artificial Analysis: שיעור שגיאות מילים ממוצע של 4.0% לתמלול בזרימה ו-2.6% לתמלול שאינו בזרימה. במדד הרב-לשוני FLEURS, גוגל מדווחת על 5.50% WER לתמלול בזרימה ו-5.04% לתמלול שאינו בזרימה. גוגל גם טוענת לשיפור של 70% בזמן עד לתמלול הסופי בהשוואה לקודמתה, Chirp 3.

הקריאה הכנה: אלו מדידות עצמאיות במובן שארטיפישיאל אנליסיס אינה גוגל, אבל הן מדידות שנבחרו על ידי גוגל, שפורסמו בתוך ההכרזה של גוגל עצמה, על מודל שניתן לקרוא אליו כבר יום. אף אחד מחוץ לגוגל עדיין לא הריץ התמודדות ראש בראש אדוורסרית מול המודלים בעלי המשקל הפתוח שרוב הצוותים משווים אותו אליהם, וחומרי ההשקה אינם כוללים השוואה ישירה מול משפחת Whisper או קו Parakeet של NVIDIA. הנתון של 70% מהיר יותר מ-Chirp-3 הוא טענה של ספק, נקודה. התייחסו ל-2.6% ו-4.0% כאותות ראשוניים חזקים, לא כעובדות מוסכמות.

כמה זה עולה

דף התמחור של Google מפרט כל מודל בטוקנים ובדקות שמע משוערות. עבור gemini-3-5-transcribe, האומדן המשולב הוא בערך $0.005 לדקת שמע לפי מחירי המחירון — קלט בערך $0.003 לדקה, פלט בערך $0.002 לדקה. עבור gemini-3-5-transcribe-live, האומדן המשולב הוא בערך $0.009 לדקה. שניהם כוללים כיום מסלול חינמי.

הנתונים לדקה הם הערכות המבוססות על קצב טוקנים משוער (25 טוקני אודיו לשנייה בקלט, 175 טוקני טקסט לדקה בפלט), ולכן הם משתנים אם Go​ogle משנה את חשבונאות הטוקנים. מה שמוצק הוא העיקרון: המחיר הרשום הוא המחיר. זה בדיוק העיקרון שנתב מעבר (pass-through router) כמו OrcaRouter פועל לפיו — 0% מרווח, המחיר הרשום של הספק מועבר כמות שהוא — ולכן אם Go​ogle מורידה את מחיר התמלול במהלך חלון התקופה שבין ההשקה המוקדמת (preview) ל-GA, ההנחה מתעדכנת אצלנו באותו היום, לא רק לאחר שמשווק מעדכן את כרטיס התעריפים.

היכן זה מושק

עבור מפתחים, תצוגה מקדימה ציבורית היום פירושה שני מסלולים: ה-API של Gemini ב-Google AI Studio, ופלטפורמת הסוכנים הארגונית של Gemini לעומסי עבודה ארגוניים. בצד הצרכני, Gemini 3.5 Transcribe כבר מפעיל את תכונת ההכתבה של Rambler ב-Gboard באנדרואיד ובאפליקציית Gemini ב-macOS. Chrome הוא הבא — דיבור-להקלדה בכל שדה אינטרנט — ואחריו Search Live, Gemini Live, Docs, Keep ו-Gmail. עבור צוות שבוחן את זה, התשובה המעשית פשוטה יותר: ניתן לקרוא לו מהקוד היום, באנגלית, באזורים שבהם ה-API של Gemini זמין.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

מה זה אומר עבור הצינור שלך

הדבר החדש באמת אינו מספר WER. זה ש-Google מוכרת כעת תמלול עם שתי התכונות שצוותים הרכיבו בעבר בעצמם — תוויות דובר וחותמות זמן ברמת מילה — במודל הבסיס, על גבי ממשק Gemini API שתומך בקריאות פונקציות. אם הייתם בונים צינור עיבוד לפרוטוקול פגישות עם זיהוי דוברים מתמלל פשוט, מרכיב דיאריזציה נפרד ומעבר עיצוב, זהו מודל Google הראשון שמאחד את השלבים האלה. השאלה הפתוחה היא כיצד ה-WER הלא-סטרימינג של 2.6% מתבצע על האודיו שלכם, ועד שתופיע רבייה בלתי-תלויה, הצעד האחראי לצוות הפקה הוא להריץ דוגמה אמיתית דרך ה-API במקום לתקצב לפי אמות המידה שבחרה Google. לגבי עבודת ה-LLM שרצה על גבי התמליל — סיכום, חילוץ מובנה, פריטי פעולה — זו השכבה שבה ניתוב (routing) מוכיח את עצמו, וזו השכבה ש-OrcaRouter מכסה: API אחד על פני 200+ מודלים, מעבר אוטומטי בין ספקים, ו-DSL ניתוב שמרכיב מספר מודלים לקריאה אחת. את שלב התמלול עצמו כדאי לבדוק עם האודיו שלכם לפני שאתם סומכים על הנתון הראשי של מישהו.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube