
Grok Voice Transcribe 2.0 לעומת Gemini 3.5 Transcribe: נתיב הסטרימינג שייך לאחד מהם
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 ו-Gemini 3.5 Transcribe הם שני מודלי הדיבור-לטקסט החדשים ביותר בחזית ממעבדות מתחרות, והדרך הכנה להשוות ביניהם היא להודות מראש שהם לא נבנו לאותה מטרה. Grok Voice Transcribe 2.0 של SpaceXAI, שיצא ב-18 בספטמבר 2026, הוא מודל מוכוון-סטרימינג עם מצב אצווה מצורף: הוא עומד בראש לוח AA-WER Streaming עם שיעור שגיאות מילים של 2.7% בתמלולים סופיים ו-3.4% בתוצאות חלקיות ראשונות, כששניהם מגיעים 0.49 שניות לאחר סוף הדיבור. Gemini 3.5 Transcribe, שיצא ב-26 באוגוסט 2026, הוא מודל מוכוון-אצווה עם SKU סטרימינג מצורף, ושני חלקיו מתנהגים באופן שונה מאוד — המסלול המוקלט מראש מודד 2.6% AA-WER בלוח הלא-סטרימינג של Artificial Analysis, בעוד שנקודת הקצה הנפרדת gemini-3.5-transcribe-live מודדת 4.0% בלוח הסטרימינג ב-0.40 שניות. שימו את ארבעת המספרים האלה זה לצד זה, וצורת העימות הזה ברורה: הם קרובים מבחינת דיוק במקום שבו Gemini 3.5 Transcribe חזק, והם לא קרובים במקום שבו Grok Voice Transcribe 2.0 מצטיין.
הנתיב היחיד ששניהם נלחמים בו
שני המודלים יכולים לתמלל אודיו חי, ולכן סטרימינג הוא הזירה היחידה שבה השוואה ישירה אומרת משהו. שם, Grok Voice Transcribe 2.0 מוביל על Gemini 3.5 Transcribe Live ב-1.3 נקודות בדיוק התמלול הסופי — 2.7% לעומת 4.0% WER באותו מערך בדיקה, באותן כשמונה שעות אודיו, ובאותו שקלול 50/25/25 על פני AA-AgentTalk, VoxPopuli ו-Earnings22. זה אינו הבדל של עיגול; בשיעורי שגיאה כאלה מדובר בערך במילה שגויה נוספת אחת בכל שבעים וחמישה מילים שהמודל של Google מתמלל. בתמלולים חלקיים ראשוניים הפער רחב אף יותר, 3.4% לעומת 5.8%, ותמלולים חלקיים הם התמלולים שסוכן קולי חי חייב לפעול לפיהם לפני שהדובר סיים.
ההשהיה פועלת לכיוון ההפוך, וזה החלק בהשוואה שהולך לאיבוד. Gemini 3.5 Transcribe Live מחזיר תמלול סופי 0.40 שניות לאחר סוף הדיבור, לעומת 0.49 של Grok, ותמלול חלקי ראשון תוך 0.25 שניות לעומת 0.49 של Grok — בערך פי שניים מהר יותר למילה השימושית הראשונה. אף אחד מהמודלים אינו מתחרה בקצה המהיר באמת של הלוח הזה, שבו Deepgram Flux מציג 0.02 שניות ו-Soniox v5 0.05, אבל בין שני אלה הפשרה מפורשת: Google מהיר יותר לדבר, ו-SpaceXAI סביר יותר להיות צודק כשזה קורה. עבור סוכן תורות-שיחה שאסור לו לדבר בזמן שהמתקשר מדבר, 0.24 שניות של השהיית תמלול חלקי נוספת הן עלות ממשית שהרווח בדיוק צריך להצדיק.

איפה Gemini 3.5 Transcribe באמת מנצח
כיסוי השפות הוא ההיבט הברור ביותר, והפער אינו קטן. המודל של Google תומך ביותר מ-85 שפות; Grok Voice Transcribe 2.0 תומך בעשרות שפות, עם עיצוב בצורת כתב — נרמול טקסט הפוך שהופך מספרים, תאריכים, מטבעות וכתובות דוא"ל מדוברים לצורתם הכתובה — מתועד ב-25 שפות. אם השמע שלך הוא בפורטוגזית, בווייטנאמית, או תערובת עם החלפת קוד של שתי שפות בתוך משפט אחד, השאלה איזה מודל מדויק יותר בלוח של Artificial Analysis היא בעיקרה אקדמית, מפני שהלוח הזה מוטה לאנגלית ועמוס בשיחות של סוכנים. Google מדווחת על WER של 5.50% בזרימה ו-5.04% שלא בזרימה ב-FLEURS על פני המערך הרב-לשוני שלה — נתונים שמדווחים על ידי הספק ולא שוחזרו באופן בלתי תלוי, אך לכל הפחות מתארים את המקרה הרב-לשוני בכלל.
ההישג השני הוא המסלול החינמי. Gemini 3.5 Transcribe מציע טוקנים חינמיים לקלט ולפלט ב-API של Google, עם הסתייגות שתוכן מהמסלול החינמי משמש לשיפור מוצרי Google בעוד תוכן מהמסלול בתשלום אינו משמש לכך. עבור אב-טיפוס, פרויקט צדדי או כלי פנימי שמעבד אודיו שלא הייתם משלמים על תמלולו אחרת, זו אפשרות אמיתית שאף ספק שגובה תשלום לפי שעה לא יכול להשתוות אליה. Grok Voice Transcribe 2.0 הוא בתשלום כבר מהשעה הראשונה של אודיו.
והשלישי הוא ש-Gemini 3.5 Transcribe הוא מודל מולטימודלי כללי עם מצב תמלול, ולא שירות ASR ייעודי. ניתן להזין לו פרומפט, הוא יכול לקבל טקסט כהקשר, והוא נמצא באותו משטח API כמו כל דבר אחר ש-Google משיקה. אם תמלול הוא שלב אחד בצינור עיבוד שגם צריך הסקה על התמלול, החזקת שניהם בקריאת מודל אחת שווה משהו ששיעור שגיאה לכל מילה לא משקף.
חישוב המחיר, לכל אלף דקות
Artificial Analysis מנרמל את שני המודלים לעלות ל-1,000 דקות אודיו, וזו הדרך היחידה להשוות תעריף שעתי קבוע מול חיוב לפי טוקנים:
• אצווה, מוקלט מראש — Grok Voice Transcribe 2.0 ב-1.67$ ל-1,000 דקות (0.10$ לשעה) לעומת Gemini 3.5 Transcribe ב-5.00$ ל-1,000 דקות (0.30$ לשעה, החל מ-2.00$ לכל 1M טוקני קלט ו-12.00$ לכל 1M טוקני פלט)
• סטרימינג — Grok Voice Transcribe 2.0 ב-$3.33 ל-1,000 דקות ($0.20/שעה) לעומת Gemini 3.5 Transcribe Live בכ-$5.40 ל-1,000 דקות, משוקלל מ-$3.50 ל-1M קלט אודיו ו-$21.00 ל-1M טוקנים של פלט טקסט
• תפוקת אצווה — Grok Voice Transcribe 2.0 בקצב של בערך פי 162 מזמן אמת לעומת Gemini 3.5 Transcribe בקצב של בערך פי 88 על אותו לוח, כך שהמודל הזול יותר הוא גם המהיר יותר לעבודה עם קבצים
• מגבלת מפגש חי — Grok Voice Transcribe 2.0 מזרים דרך WebSocket ללא תקרת מפגש מפורסמת מלבד 100 מפגשים במקביל לכל צוות, לעומת Gemini 3.5 Transcribe Live שמוגבל ל-10 דקות לכל מפגש
השורה האחרונה היא הפרט התפעולי שקובע יותר ארכיטקטורות מאשר מספרי הדיוק. תקרה של 10 דקות לסשן חי משמעותה ששיחות ארוכות, פגישות ארוכות וסטרימים ארוכים חייבים להיקטע ולחודש, וכל חידוש כזה הוא תפר שבו ההקשר הולך לאיבוד. נקודת הקצה לסטרימינג של Grok נושאת תקרת גודל קובץ של 500 MB במסלול האצווה ומגבלת מקבילות של 100 סשנים לכל צוות במסלול הסטרימינג, שזה סוג אחר של אילוץ — תפוקה ולא משך.
כדאי להבין את החיוב לפי טוקנים לפני שאתם מתחייבים לצד של גוגל, כי הוא הופך את החשבון שלכם לפונקציה של שני משתנים במקום אחד. ג'מיני מחייבת בנפרד על קלט אודיו ועל פלט טקסט, כך שמודל שמייצר עיצוב מפורט מדי או חוזר על עצמו עולה יותר ממודל שלא, ושפה עם מילים ארוכות יותר עולה יותר משפה עם מילים קצרות יותר. התעריף הקבוע לשעה של גרוק לא זז משום אחד מאלה. עבור עומסי עבודה בנפח גבוה, התעריף הקבוע קל יותר לחיזוי, ומכיוון ש-OrcaRouter מעביר הלאה את מחירי המחירון של הספקים בתוספת של 0%, שינוי מצד מי מהספקים מגיע לחשבון שלכם ביום שבו הוא קורה ולא בחידוש החוזה הבא.

צורות תכונה: מה כל אחת מסרבת לעשות
רשימות היכולות נבדלות זו מזו יותר ממה שמספרי הדיוק מרמזים, והפערים נמצאים במקומות שחשובים ליישומים ספציפיים:
• דיאריזציה של דוברים — כלולה ללא עלות נוספת ב-Grok Voice Transcribe 2.0; אינה נתמכת ב-Gemini 3.5 Transcribe Live, כך שתמלולים חיים עם ייחוס דוברים אינם זמינים כלל בנקודת קצה זו
• חותמות זמן ברמת המילה — Grok Voice Transcribe 2.0 מחזיר אותן עם ציוני ביטחון לכל מילה; Gemini 3.5 Transcribe Live לא מחזיר אותן כלל, מה ששולל סף ביטחון ויישור כתוביות מדויק
• אודיו רב-ערוצי — Grok Voice Transcribe 2.0 מתמלל עד 8 ערוצים בלתי־תלויים במעבר אחד; ל-Gemini 3.5 Transcribe Live אין מקבילה, ולכן הקלטות שיחות רב-ערוציות מחייבות סשנים נפרדים לכל ערוץ
• הטיית מונחי מפתח — Grok Voice Transcribe 2.0 מקבל עד 100 מונחים תחומיים לבקשה; Gemini 3.5 Transcribe מקבל אוצר מילים מותאם אישית ורמזי שפה אופציונליים
• צנרת סוכני קול — Grok Voice Transcribe 2.0 מגיע עם הסרת מילות מילוי וזיהוי סוף-תור Smart Turn; Gemini 3.5 Transcribe Live מכסה את תרחיש הסטרימינג אך משאיר את לוגיקת התור לאפליקציה
• טיפול בקלט — Grok Voice Transcribe 2.0 מקבל העלאת קבצים ישירה של עד 500 MB ב-12 פורמטי אודיו; המסלול המוקלט מראש של Gemini 3.5 Transcribe מצפה לכתובת HTTPS ציבורית עם תקרה של 15 דקות ו-300 MB, ואינו יכול לשלב את מצב Smart formatting שלו עם חותמות זמן של מילים או תוויות דובר
הדפוס ברשימה הזו הוא ש-SpaceXAI בנתה מוצר תמלול ו-Google בנתה יכולת תמלול. הפרדת דוברים, חותמות זמן, פיצול ערוצים וזיהוי תורות הם התכונות שדרושות לך כשהתמלול הוא היישום כולו; יכולת הנחיה בפרומפט, רוחב שפות ו-API אחד להכול הם מה שאתה רוצה כשהתמלול הוא שלב בתוך יישום גדול יותר. אף אחת מהרשימות לא עדיפה כשלעצמה, וצוות שבוחר על סמך דיוק בלבד יגלה בסופו של דבר שחסר לו הסט שהוא לא היה זקוק לו.

לבחור ביניהם, ומה משנה את התשובה
פנה אל Grok Voice Transcribe 2.0 כאשר התמלול חייב להיות מדויק בזמן שהאודיו עדיין מתנגן: ניהול תורות של סוכן חי, כתוביות בזמן אמת שאסור שיהיו שגויות, זרמי מוקדי קשר שבהם ייחוס דובר והפרדת ערוצים הם חלק מהדרישה, או כל צינור עיבוד באצווה שבו $1.67 ל-1,000 דקות ותפוקה של 162× שניהם חשובים. פנה אל Gemini 3.5 Transcribe כאשר האודיו רב-לשוני בשפה מחוץ לסט המתועד של Grok, כאשר התמלול מזין מודל שגם צריך לבצע הסקה לגביו, כאשר אתה רוצה מסלול חינמי לבנות מולו אב טיפוס, או כאשר 2.6% AA-WER של מסלול האצווה פשוט מספיק למה שאתה עושה וכיסוי השפות הנוסף שווה יותר מהפרש המחיר.
מה שרוב הצוותים באמת עושים כאן הוא לא לבחור. שני המודלים נגישים באמצעות מפתח API אחד של OrcaRouter לצד 200+ מודלים אחרים, מה שאומר שאפשר לנתב תעבורת סוכנים חיה אל Grok Voice Transcribe 2.0 וארכיונים רב־לשוניים ארוכים אל Gemini 3.5 Transcribe בלי לתחזק שני חוזי ספקים, שני קשרי חיוב ושני סטים של פרטי גישה. זו גם הדרך להכריע בשאלת הדיוק עבור האודיו שלכם: הריצו את שניהם על אותן הקלטות, השוו בין התמלולים שקיבלתם בפועל, ותנו ל-routing DSL לשלוח את התעבורה לאן שהיא שייכת. לוח הדירוגים אומר לכם איזה מודל מנצח בשמונה שעות של דיבור סוכנים באנגלית של מישהו אחר; רק האודיו שלכם אומר לכם איזה מהם מנצח בשלכם.
השאלה הפתוחה היא מה יקרה לפער הסטרימינג הזה כאשר Google תעדכן בפעם הבאה את נקודת הקצה Live. Gemini 3.5 Transcribe Live הושק בתצוגה מקדימה ציבורית, והנתון של 4.0% שלו נמדד בערך יום לאחר שהפך לזמין לקריאה — אות מוקדם חזק, אבל כזה שהיה לו פחות זמן להתבסס מאשר לנתון של Grok שהוא נמצא כעת מאחוריו. אם Google תסגור את פער הסטרימינג של 1.3 נקודות תוך שמירה על השהיית תוצאות חלקיות של 0.25 שניות, הפשרה מפסיקה להיות פשרה, והיתרון של Grok מצטמצם למחיר ולתכונות. עד אז החלוקה נקייה: התוצאות החלקיות המהירות ביותר הן של Google, המדויקות ביותר הן של SpaceXAI, ואף מודל על הלוח אינו גם וגם.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
