
Grok Voice Transcribe 2.0 לעומת Granite Speech 5.0 470M TurboCTC: פי 12,600 מזמן אמת פוגש חצי שנייה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTC מתמלל כ-3.5 שעות אודיו בכל שנייה על H200 בודד, ו-Grok Voice Transcribe 2.0 מחזיר תמלול חלקי ראשון 0.49 שניות אחרי שמפסיקים לדבר. שני המספרים האלה מוצבים זה לצד זה בפוסטים של השוואה כאילו היו אותו סוג של מדידה, והם ממש לא אותו סוג של מדידה — האחד הוא נתון תפוקה של מרכז נתונים בעיבוד באצוות, בלי חביון נלווה, והאחר הוא נתון חביון של מודל שאיש לא פרסם את התפוקה שלו. IBM שחררה את Granite Speech 5.0 470M TurboCTC ב-25 באוגוסט 2026 תחת רישיון Apache 2.0, תוך שהיא מוותרת לחלוטין על מפענח מודל השפה ומפענחת במעבר CTC יחיד שאינו אוטורגרסיבי. SpaceXAI השיקה את Grok Voice Transcribe 2.0 ב-18 בספטמבר 2026 כ-API מנוהל במחיר $0.10 לשעת אודיו עבור עיבוד באצוות ו-$0.20 לשעה עבור סטרימינג. שניהם מודלים מעולים לתמלול שפותרים חצאים מנוגדים של אותה בעיה, ובחירה ביניהם קלה יותר ברגע שמפסיקים להשוות את המספרים ישירות.
פי 12,600 מזמן אמת, והמילים שמסייגות אותו
הנתון של Granite הוא 12,600 RTFx, שנמדד על NVIDIA H200 בודד עם הסקה באצוות — המספר של IBM, שדווח בעת ההשקה ומאז לא שוחזר באופן עצמאי. RTFx הוא יחס בין משך האודיו לזמן העיבוד, כך ש-12,600 אומר בערך 3.5 שעות אודיו לשנייה של זמן שעון. הניסוח של IBM עצמה הוא שזה יותר מפי 20 מהתפוקה של מהדורות Granite Speech קודמות, וזו הטענה שבאמת חשובה כאן: ההאצה נבעה מהסרת עבודה, לא מהוספת חומרה.
מה שזה לא, זה נתון השהיה. עבודה באצווה שמסיימת 3.5 שעות אודיו בשנייה עדיין יכולה לקחת זמן רב כדי להחזיר את הטוקן הראשון של כל קובץ בודד, תלוי באופן שבו האצווה מורכבת וכמה אודיו מזינים לה לפני שהיא מתחילה. IBM לא מפרסמת נתוני השהיה כלל עבור TurboCTC. בלוח המובילים של השדה הרחוק (far-field) שתי נקודות הביקורת הן שתי הרשומות המהירות ביותר, אך התפוקה שם נמדדה על NVIDIA L4 בודד, שהוא מאיץ ברמת מרכז נתונים ולא טלפון.
הסיבה שזה חשוב היא שהמודל ממוצב במפורש עבור מחשבים ניידים, טלפונים והתקני קצה — הניסוח של IBM עצמה — ואף אחד לא פרסם ביצועים של זרם בודד באף אחד מאלה. עד שמישהו יעשה זאת, התייחסו ל-"12,600×" כאל הצהרה על כמה בזול אפשר לעבד backfill על GPUs שכורים, וזו טענה בעלת ערך אמיתי ומגובה היטב בראיות, ולא כאל הצהרה על כמה מהר משתמש אחד מקבל בחזרה משפט אחד.
מה ש-IBM הסירה, ומה זה עולה לך
TurboCTC הוא עיצוב מבוסס־מקודד בלבד: מקודד אקוסטי מסוג Conformer בעל 16 שכבות, שאומן עם CTC, ומפוענח בחמדנות במעבר יחיד לא־אוטורגרסיבי, עם שכבת פלט של תת־מילים בת 16,384 יחידות. אין מודל שפה בלולאה. מכאן מגיעה המהירות, ומכאן גם מגיעים הקיצוצים ביכולות, והם לא קטנים. בהשוואה למודלים קודמים של Granite Speech, TurboCTC מסיר תרגום דיבור, מסיר הטיית מילות מפתח, ואינו כולל כלי חותמות זמן או פיסוק.
העמידו זאת מול מה שהמודל המנוהל כולל במחיר המחירון שלו, וצורת העסקה הופכת למוחשית:
• הטיית מונחי מפתח — ל-Granite Speech 5.0 470M TurboCTC אין כלל, לעומת עד 100 מונחי מפתח לבקשה ב-Grok Voice Transcribe 2.0
• חותמות זמן ברמת המילה — לא מסופק עם TurboCTC לעומת כלול עם ציוני ביטחון
• תרגום דיבור — היה קיים במודלי Granite Speech קודמים, הוסר כאן לעומת שלא הוצע כלל
• כיסוי שפות — אנגלית בלבד לעומת זיהוי אוטומטי על פני מערך קלט רב־לשוני רחב עם תמיכה בעיצוב ב־25 שפות
• דיאריזציה — בעיה נפרדת שאתה פותר בעצמך לעומת כלולה במחיר הבקשה
• ערוצים — זרם אחד בכל מעבר לעומת עד שמונה ערוצי אודיו בבקשה אחת
• נרמול טקסט — ללא מול נרמול טקסט הפוך שהופך תאריכים, מטבעות ומספרי טלפון מדוברים לצורה כתובה
• פריסה — משקלים שאתם מורידים ומריצים לעומת נקודת קצה מנוהלת ב-us-east-1
קרא את הרשימה הזו כתיאור של שני מוצרים שונים ולא כלוח תוצאות. הסרת דיאריזציה, הטיה ונרמול היא מה שקנה את התפוקה. מילוי מחדש באצווה של 40,000 הקלטות שיחות לתוך אינדקס חיפוש אינו זקוק לחותמות זמן או לתורות דובר — הוא צריך להיות זול והוא צריך להסתיים — ולמשימה הזו התכונות החסרות אינן חסרות, הן משקל שנמחק.
ההפך נכון לגבי כל דבר בזמן אמת. אם אתה בונה סוכן קולי, רשימת מונחי מפתח היא הדרך שבה אתה גורם לכך ש-"Kubernetes" ו-"Granola" ושמות לקוחות ייכתבו נכון, ומתמלל ללא מנגנון הטיה יטעה בהם בכל פעם, בלי שום דרך לתקן זאת מלבד כיוונון עדין, שזה פרויקט אחר עם תקציב אחר. התכונה החסרה היחידה הזו פוסלת את TurboCTC מעומסי עבודה מסוימים, וחסרת חשיבות לאחרים, ולכן השוואת מודלים פחות שימושית מהשוואת עומסי עבודה.

השוואת הדיוק שלא ניתן לבצע באופן נקי
IBM מדווחת על שיעור שגיאות מילים מצטבר של 5.00% עבור צ'קפוינט Apache 2.0 ועל 4.85% עבור האח הלא-מסחרי ב-Open ASR Leaderboard, על פני מערכי דיבור קצר ציבוריים באנגלית. אלה נתוני באצ'ים בלוח שההערכות שלו כוללות את AMI ו-Earnings22 ומערכי שיחה ארוכים, והם מדווחים על ידי הספק — הורצו בכלי הלוח אך טרם נקלטו בטבלה הרשמית, שכוללת גם מערכי בדיקה פרטיים. הפירוט המפורסם לפי מערך בכרטיס המודל שווה קריאה, כי הממוצע מסתיר הרבה: LS Clean 1.42%, LS Other 2.66%, SPGISpeech 3.18%, Voxpopuli-Cleaned-AA 4.88%, Earnings22-Cleaned-AA-chunked 6.69%, AMI-Cleaned 7.52% ו-Gigaspeech-Cleaned 8.67%, שמסתכמים בממוצע בדיוק ל-5.00%. אותו כרטיס מביא RTFx ממוצע של 13,042.98 שנמדד על H200 אחד — גבוה מהנתון 12,600 שבו השתמש פוסט ההשקה של IBM, ושני המספרים הם של החברה, מאותו שבוע, על אותה חומרה.
הנתון של 2.7% בתמלול הסופי של Grok Voice Transcribe 2.0 אינו מדידה ברת-השוואה. הוא מגיע מלוח AA-WER Streaming של Artificial Analysis, מורכב משוקלל של AA-AgentTalk ב-50%, VoxPopuli ב-25% ו-Earnings22 ב-25% — כשמונה שעות של אודיו שיחתי באנגלית, משוקלל לפי סוכנים, הנמדד דרך ממשק סטרימינג. סטים שונים, שקלול שונה, אופן פעולה שונה. הצבת 2.7% לצד 5.00% והסקה שהמודל המנוהל מדויק בערך פי שניים היא הטעות הנפוצה ביותר שניתן לעשות בהשוואה הזו.
מה שאפשר לומר בכנות הוא צר יותר ועדיין שימושי. שני המודלים חזקים באודיו שכל אחד מהם נמדד עליו. Grok Voice Transcribe 2.0 מוביל לוח דירוג סטרימינג המנוהל באופן עצמאי שגם מודלים אחרים נמדדים עליו, מה שמאפשר לבדוק את דירוגו גם אם הערך המדויק שלו אינו ניתן להעברה. ל-Granite Speech 5.0 470M TurboCTC יש WER מצרפי על ערכות ה-ASR הפתוחות הסטנדרטיות, ולחוד, תוצאת שדה רחוק שבה הצ'קפוינט הלא-מסחרי מדורג חמישי בדיוק, וזה של Apache תשיעי — נמדדת על דיבור רועש ומהדהד, שזה התנאי הקשה ביותר בסט, ואולי הדבר הכנה ביותר במספרים של כל אחד מהמודלים.
אם האודיו שלך הוא דיבור אנגלי נקי בקריאה, סביר להניח שפער הדיוק בין השניים קטן יותר ממה שמיקומי לוח המובילים מרמזים. אם הוא רועש, עם מבטא, טלפוני או לא-אנגלי, אף אחד מהלוחות לא אומר לך הרבה, ומערך הבדיקות שלך הוא הכלי היחיד שעושה זאת.
משקולות חופשיות מול $1.67 לשעה
השוואת העלויות היא המקום היחיד שבו באמת קל להפריד בין שני הדגמים האלה, והמספר שאנשים בדרך כלל מצטטים שגוי בשני הכיוונים.
• תמלול באצווה — Grok Voice Transcribe 2.0 במחיר $0.10 לשעת אודיו, או כ-$1.67 לכל 1,000 דקות לעומת Granite Speech 5.0 470M TurboCTC ללא עלות רישיון, בתוספת זמן GPU
• סטרימינג — $0.20 לשעת אודיו, כ-$3.33 ל-1,000 דקות לעומת היעדר נתיב סטרימינג מתארח שפורסם על ידי IBM
• רישיון — API מסחרי ללא משקלים לעומת Apache 2.0 עבור הצ'קפוינט הראשי ו-CC-BY-NC-SA-4.0 עבור זה הלא-מסחרי המדויק יותר
המילה "חינם" עושה עבודה רבה בשורה הראשונה ההיא. מודל encoder-only בגודל 470M קטן מספיק כדי לרוץ על חומרה צנועה — זו כל מטרת העיצוב, וזו הסיבה ש-IBM אימנה אותו בעשרה ימים על שמונה H100 והשיקה אותו כשהוא תואם ל-`transformers>=5.16.0`, עם דמו WebGPU — אבל מישהו עדיין משלם על ה-GPU, על סטאק ההגשה, על הסקיילינג האוטומטי, על הניסיונות החוזרים ועל סבבי הכוננות. בנפחים קטנים, המחיר של שירות מנוהל בדרך כלל זול יותר מזמן ההנדסה. בנפחים גדולים ויציבים, מסלול החומרה השכורה מנצח, ונקודת המעבר היא פונקציה של הניצולת שלך ולא של נפח האודיו שלך: GPU שאתה מחזיק אותו עסוק הוא זול לשעה, ו-GPU שאתה מחזיק חם לקראת תעבורת שיא אינו.
פרט רישוי אחד ראוי להדגשה לפני שמישהו בונה ארכיטקטורה סביבו. המדויק יותר מבין שני הצ׳קפוינטים, זה שב-4.85% WER, הוא זה הלא-מסחרי תחת CC-BY-NC-SA-4.0. הצ׳קפוינט של Apache 2.0 הוא זה של 5.00%, והוא זה שמותר לך להפיץ כחלק ממוצר. זהו הבדל דיוק של 0.15 נקודות שנסחר תמורת הזכות להשתמש במודל בכלל, וזה גם אומר שכל השוואה שמצטטת 4.85% עבור "Granite Speech 5.0" ואז דנה בפריסה מסחרית מצטטת את הצ׳קפוינט הלא נכון.

כלל ההחלטה
שלוש שאלות מפרידות בין שני המודלים האלה מהר יותר מכל טבלת בנצ'מרקים.
האם התמלול נצרך בזמן אמת, בעוד הדובר עדיין מדבר? אם כן, TurboCTC אינו המועמד — לא בגלל שהוא איטי, אלא בגלל שאין לו ממשק זרימה ואין פלט חלקי, ותמלול חלקי הוא התחייבות ארכיטקטונית שונה מפענוח אצווה מהיר. אם לא, יתרון התפוקה הופך לכל הסיפור והמודל של IBM קשה מאוד להכות בעלות לשעת אודיו מעובד.
האם העבודה דורשת אוצר מילים תחומי? אם כן, מודל עם הטיה מנצח כברירת מחדל, והיעדר הטיית מונחי מפתח ב-TurboCTC מהווה פסילה, ולא רק אי-נוחות. אם לא, אתה משלם עבור תכונה שלא תשתמש בה בצד המנוהל.
האם האודיו הוא דיבור אנגלי נקרא על חומרה סבירה? אם כן, שניהם חזקים והבחירה היא עניין של תפעול. אם לא, שני הלוחות אינם מלמדים דבר ורק ההערכה שלך עצמך קובעת.
לא משנה איך זה יסתיים, שכבת התפעול היא המקום שבו ההחלטה הזו הופכת לזולה. OrcaRouter מציב יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI עם מעבר אוטומטי בין ספקים, כך שנקודת קצה מנוהלת של דיבור באזור בודד שחווה אחר צהריים רע מפסיקה להיות ההשבתה שלך, ומחיר המחירון של הספק עובר הלאה ב-0% תוספת — מה שאומר ששינוי מחיר של ספק או צ'קפוינט חדש פעילים אצלנו באותו יום. עבור עומס עבודה שבו התשובה הנכונה באמת לא ברורה, זה מסיר את העלות של לטעות: עשה בנצ'מרק לשניהם מול האודיו שלך מאחורי נקודת קצה אחת, שמור את זה שמנצח, ושנה את מחרוזת המודל כשהבא יוצא.

הגרסה הקצרה: Granite Speech 5.0 470M TurboCTC היא התשובה הטובה יותר ל"לתמלל כל מה שאי פעם הקלטנו, בזול, על חומרה שבשליטתנו", ו-Grok Voice Transcribe 2.0 היא התשובה הטובה יותר ל"לתמלל את זה בזמן אמת, בדיוק, בלי שאנחנו מריצים את סטאק ההגשה". כותרת ה-12,600× וכותרת ה-0.49 שנייה הן שתיהן נכונות ואף אחת מהן אינה ראיה לגבי האחרת.
