
תמלול חכם עם Gemini 3.5 Transcribe
- 智谱חדשZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 לכל 1M טוקנים
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
Gemini 3.5 Transcribe נכנס לתצוגה מקדימה ציבורית ב-26 באוגוסט 2026, וזהו מודל הדיבור-לטקסט הראשון של Google שנמכר בפועל כמודל Gemini: קוראים לו דרך Gemini API עם מזהה מודל, האודיו מתומחר בטוקנים, ו-Google מצטטת את העלות לדקת אודיו בדף המחירים שלה. הפרט האחרון הוא מה שהסיקור הצרכני חומק ממנו. סיפורי יום ההשקה עוסקים בהסרת מילות מילוי ובעריכת קול ב-Gboard, אבל מה שבאמת השתנה למפתחים הוא שהתמלול יושב עכשיו על אותו משטח API כמו שאר קו מוצרי Gemini, עם ייחוס דובר וחותמות זמן ברמת מילה במודל הבסיסי ולא בתוסף נפרד. הקטע הזה נקרא כמו מסמך עזר ל-API, כי זה הפער שהגל הראשון של הסיקור משאיר פתוח.
שתי הסתייגויות מראש, כדי שהמספרים להלן לא יטעו. Google אינה מכנה את Gemini 3.5 Transcribe "המודל המדויק ביותר להמרת דיבור לטקסט שיש לנו" – הטענה היא שהמודל הוא המדויק ביותר לאינטראקציות קוליות חכמות, וזו טענה שונה, וההבדל חשוב כשקוראים את נתוני ה-WER. וכל מה שכאן מתאר תצוגה מקדימה ציבורית: שני מזהי המודל, המחירים ומספרי ה-benchmark הם מה ש-Google שולחת היום, והכל יכול להשתנות לפני GA.
שני נתיבי ה-API — ומזהי המודל שיש לזכור
Gemini 3.5 Transcribe מגיע בשתי נקודות קצה, והבחירה בנקודה הנכונה היא ההחלטה הארכיטקטונית הראשונה שצוות מקבל:
• gemini-3-5-transcribe — המסלול להקלטות מוקדמות דרך ה-Interactions API. שלח קובץ, קבל בחזרה את התמליל עם ייחוס דוברים (עד שלושה דוברים; שלושה ומעלה הוא ניסיוני) וחותמות זמן ברמת המילה. זהו סוס העבודה לעיבוד באצווה ואסינכרוני.
• gemini-3-5-transcribe-live — המסלול בזמן אמת דרך ה-Live API. סטרימינג דו-כיווני עם זמן השהיה מתחת לשנייה, המיועד לשיחות חיות, תמלול ממסך, וממשקים מבוססי קול.
הפיצול משקף את האופן שבו מסודרת שאר משפחת Gemini Audio, וזה חשוב כי "live" הוא מק"ט (SKU) נפרד עם מחיר משלו. כמה קריאות מוקדמות של ההשקה הזו מניחות שמודל אחד עושה את שניהם; זה לא.

מה 'תמלול חכם' אומר בעצם
פוסט ההשקה של Google ממסגר זאת כהתקדמות מעבר לדיוק פונטי לעבר הבנה. התכונות שנובעות מהמסגור הזה הן אלה שצריך להעריך, ולא המסגור עצמו:
• טיפול בחוסר שטף — "אממ" ו"אה" נשמטים, ותיקונים עצמיים נפתרים. "בוא ניפגש ביום שלישי — לא, רביעי" מתומלל כיום המתוקן, לא כתמליל של התחלה שגויה. זו החלטה שהמודל מקבל, ובמובן הזה Google קוראת לזה אינטליגנטי.
• עיצוב אוטומטי — הפלט חוזר כטקסט מעוצב: מוחלים סימני פיסוק, רישיות ומבנה פסקאות, ולא זרם אסימונים גולמי.
• זיהוי דוברים מרובים — עד שלושה דוברים שמיוחסים לאודיו מוקלט מראש עם חותמות זמן ברמת מילה; שלושה דוברים או יותר הוא מצב ניסיוני. זה יושב במודל הבסיס ולא בשירות דיאריזציה נפרד.
• אוצר מילים מותאם אישית — ניתן להטות את הזיהוי לכיוון מונחים מקצועיים, שמות מוצרים ואיותים חריגים על ידי אספקת אוצר מילים, שהוא המנגנון לתחומים אנכיים.
• 85+ שפות — זיהוי אוטומטי, עם ציון מפורש של מבטאים אזוריים וניבים.
• קריאת פונקציות — המודל יכול להאציל משימות כמו יצירת תמונות או ניתוח קבצים למודלי Gemini אחרים, מה שהופך את התמלול למרכיב של סוכן רחב יותר במקום לשלב סופי.
• לכידת ישויות — גוגל טוענת לביצועים חזקים על אודיו רועש מהעולם האמיתי ועל ישויות אלפאנומריות כגון מיקודים ומזהי הזמנות.
הסיקור העיתונאי דיווח גם על חלון הקשר של 96,000 אסימונים (בערך שעה של אודיו מפגש ללא פיצול) ועל זיהוי רגשות. שניהם עולים בקנה אחד עם המסגור של ההשקה, אך כרטיס המודל שגוגל פרסמה אינו מציג אותם בכותרת, לכן יש להתייחס אליהם כאל דיווחים ולא כאישור עד שיופיע גיליון מפרטים של GA.

מספרי הדיוק, מסומנים
נתוני ה-WER שגוגל מצטטת מגיעים מ-Artificial Analysis: שיעור שגיאות מילים ממוצע של 4.0% לתמלול בזרימה ו-2.6% לתמלול שאינו בזרימה. במדד הרב-לשוני FLEURS, גוגל מדווחת על 5.50% WER לתמלול בזרימה ו-5.04% לתמלול שאינו בזרימה. גוגל גם טוענת לשיפור של 70% בזמן עד לתמלול הסופי בהשוואה לקודמתה, Chirp 3.
הקריאה הכנה: אלו מדידות עצמאיות במובן שארטיפישיאל אנליסיס אינה גוגל, אבל הן מדידות שנבחרו על ידי גוגל, שפורסמו בתוך ההכרזה של גוגל עצמה, על מודל שניתן לקרוא אליו כבר יום. אף אחד מחוץ לגוגל עדיין לא הריץ התמודדות ראש בראש אדוורסרית מול המודלים בעלי המשקל הפתוח שרוב הצוותים משווים אותו אליהם, וחומרי ההשקה אינם כוללים השוואה ישירה מול משפחת Whisper או קו Parakeet של NVIDIA. הנתון של 70% מהיר יותר מ-Chirp-3 הוא טענה של ספק, נקודה. התייחסו ל-2.6% ו-4.0% כאותות ראשוניים חזקים, לא כעובדות מוסכמות.
כמה זה עולה
דף התמחור של Google מפרט כל מודל בטוקנים ובדקות שמע משוערות. עבור gemini-3-5-transcribe, האומדן המשולב הוא בערך $0.005 לדקת שמע לפי מחירי המחירון — קלט בערך $0.003 לדקה, פלט בערך $0.002 לדקה. עבור gemini-3-5-transcribe-live, האומדן המשולב הוא בערך $0.009 לדקה. שניהם כוללים כיום מסלול חינמי.
הנתונים לדקה הם הערכות המבוססות על קצב טוקנים משוער (25 טוקני אודיו לשנייה בקלט, 175 טוקני טקסט לדקה בפלט), ולכן הם משתנים אם Google משנה את חשבונאות הטוקנים. מה שמוצק הוא העיקרון: המחיר הרשום הוא המחיר. זה בדיוק העיקרון שנתב מעבר (pass-through router) כמו OrcaRouter פועל לפיו — 0% מרווח, המחיר הרשום של הספק מועבר כמות שהוא — ולכן אם Google מורידה את מחיר התמלול במהלך חלון התקופה שבין ההשקה המוקדמת (preview) ל-GA, ההנחה מתעדכנת אצלנו באותו היום, לא רק לאחר שמשווק מעדכן את כרטיס התעריפים.
היכן זה מושק
עבור מפתחים, תצוגה מקדימה ציבורית היום פירושה שני מסלולים: ה-API של Gemini ב-Google AI Studio, ופלטפורמת הסוכנים הארגונית של Gemini לעומסי עבודה ארגוניים. בצד הצרכני, Gemini 3.5 Transcribe כבר מפעיל את תכונת ההכתבה של Rambler ב-Gboard באנדרואיד ובאפליקציית Gemini ב-macOS. Chrome הוא הבא — דיבור-להקלדה בכל שדה אינטרנט — ואחריו Search Live, Gemini Live, Docs, Keep ו-Gmail. עבור צוות שבוחן את זה, התשובה המעשית פשוטה יותר: ניתן לקרוא לו מהקוד היום, באנגלית, באזורים שבהם ה-API של Gemini זמין.

מה זה אומר עבור הצינור שלך
הדבר החדש באמת אינו מספר WER. זה ש-Google מוכרת כעת תמלול עם שתי התכונות שצוותים הרכיבו בעבר בעצמם — תוויות דובר וחותמות זמן ברמת מילה — במודל הבסיס, על גבי ממשק Gemini API שתומך בקריאות פונקציות. אם הייתם בונים צינור עיבוד לפרוטוקול פגישות עם זיהוי דוברים מתמלל פשוט, מרכיב דיאריזציה נפרד ומעבר עיצוב, זהו מודל Google הראשון שמאחד את השלבים האלה. השאלה הפתוחה היא כיצד ה-WER הלא-סטרימינג של 2.6% מתבצע על האודיו שלכם, ועד שתופיע רבייה בלתי-תלויה, הצעד האחראי לצוות הפקה הוא להריץ דוגמה אמיתית דרך ה-API במקום לתקצב לפי אמות המידה שבחרה Google. לגבי עבודת ה-LLM שרצה על גבי התמליל — סיכום, חילוץ מובנה, פריטי פעולה — זו השכבה שבה ניתוב (routing) מוכיח את עצמו, וזו השכבה ש-OrcaRouter מכסה: API אחד על פני 200+ מודלים, מעבר אוטומטי בין ספקים, ו-DSL ניתוב שמרכיב מספר מודלים לקריאה אחת. את שלב התמלול עצמו כדאי לבדוק עם האודיו שלכם לפני שאתם סומכים על הנתון הראשי של מישהו.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
