
Grok Voice Transcribe 2.0 לעומת Whisper Large v3 Turbo: מה שהבסיס החינמי עדיין עושה טוב יותר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Whisper Large v3 Turbo הוא התשובה המובנית ל"אנחנו צריכים תמלול" מאז שיצא תחת רישיון MIT ב-1 באוקטובר 2024, ושום דבר ב-Grok Voice Transcribe 2.0 לא משנה את הסיבה לכך. המודל החדש של SpaceXAI, שיצא ב-18 בספטמבר 2026, הוא מתמלל טוב יותר באופן ממשי ובפער ניכר — שיעור שגיאת מילים של 2.7% בתמלולים סופיים ו-3.4% בתמלולים חלקיים ראשונים בלוח AA-WER Streaming של Artificial Analysis, לעומת נתון של 4.07% למשפחת Whisper בלוח שאינו סטרימינג, כאשר Turbo עצמו בדרך כלל מפגר בעשיריות נקודה אחרי Large v3 המלא שממנו זוקק. בנוסף, מחירו עומד על $0.10 לשעת אודיו באצווה ועל $0.20 לשעה בסטרימינג. Whisper Large v3 Turbo הוא קובץ בגודל 1.6 GB עם 809 מיליון פרמטרים שרץ על החומרה שלך, לא מודד שימוש, לא שולח אודיו לשום מקום, ואין לו מגבלת קצב, תקרת מקביליות או לוח זמנים להפסקת תמיכה. ההשוואה אינה בין מודל טוב יותר למודל גרוע יותר. היא בין לשכור דיוק לבין להחזיק ברכיב.
חלון שלושים ושתיים השניות הוא הארכיטקטורה כולה
Whisper Large v3 Turbo יורש את המבנה של כל מודל Whisper: השמע מעובד בחלונות קבועים של 30 שניות, המקודד פועל פעם אחת לכל חלון, והמפענח פולט טקסט עבור אותו מקטע. Turbo הפך זאת לזול יותר — ארבע שכבות מפענח במקום שלושים ושתיים, מהיר פי 8 בערך מ-Large v3, כ-6 ג'יגה-בייט של VRAM במקום 10 — אבל הוא לא שינה את הצורה. אין תפיסה של "המשפט עד כה" בתוך המודל, כי אין מצב מתמשך בין חלונות.
העובדה העיצובית היחידה הזו מסבירה את כל מה שנובע ממנה בהמשך. אין סטרימינג ילידי, מפני שסטרימינג מחייב התחייבות לפלט חלקי באמצע אמירה ולמודל אין מנגנון לכך. פריסות Whisper בזמן אמת קיימות, אבל הן חלוקה למקטעים בתוספת זיהוי פעילות קולית בתוספת שכבת תפירה שמישהו כתב וכעת מתחזק, והשהיה הנובעת מצינור עיבוד זה נמדדת בשניות ולא בחצי השנייה ש-Grok Voice Transcribe 2.0 משיג. אין דיאריזציה של דוברים, מפני שדיאריזציה היא בעיה נפרדת של מי מדבר ולא של מה נאמר. וגרסת ה-Turbo בפרט מחזירה טקסט רגיל — בלי חותמות זמן, בלי ציוני ביטחון, בלי נרמול טקסט הפוך שהופך מספרים וכתובות דוא"ל מדוברים לצורה כתובה.
Grok Voice Transcribe 2.0 נבנה בכיוון ההפוך. סטרימינג הוא אמצעי התעבורה הראשי, עיבוד באצוות הוא אותם משקלים מאחורי נקודת קצה REST, ורשימת התכונות נקראת כמו רשימה של דברים ש-Whisper השאיר לאפליקציה: חותמות זמן ברמת המילה עם רמת ביטחון לכל מילה, דiarization של דוברים כלול ללא עלות נוספת, תמלול רב-ערוצי על פני עד 8 ערוצים בלתי תלויים, הטיית מונחי מפתח של עד 100 מונחי תחום לכל בקשה, נרמול טקסט הפוך על פני 25 שפות, הסרת מילות מילוי, וזיהוי סוף תור Smart Turn עבור סוכני קול. אם שמרתם על צינור פיצול ותפירה סביב Whisper, הרשימה הזו היא תיאור של הקוד שכתבתם.
פער הדיוק, ולמה הוא קטן ממה שהוא נראה
• דיוק תמלול סופי (סטרימינג) — Grok Voice Transcribe 2.0 ב-2.7% WER ב-AA-WER Streaming לעומת היעדר רשומה של Whisper Large v3 Turbo, מכיוון שהמודל אינו יכול לבצע סטרימינג באופן נייטיבי
• דיוק אצווה — Grok Voice Transcribe 2.0 ב-2.29% AA-WER לעומת Whisper Large v3 ב-4.07% בלוח הלא-זורם של Artificial Analysis, כאשר Turbo בדרך כלל מפגר ב-0.4 עד 0.6 נקודות אחרי Large v3 המלא בבדיקות בלתי תלויות
• אודיו אנגלי נקי — Whisper Large v3 Turbo מגיע לבערך 2.1% WER על LibriSpeech test-clean וכ-4.2% על test-other, כך שעבור דיבור באיכות אולפן הפער ל-API המוביל מצטמצם לכמעט כלום
• אודיו מהעולם האמיתי — אותם בנצ'מרקים בלתי תלויים מציבים את Turbo בכ-4.6% בשיחות עסקיות עם שני דוברים וב-8–12% באודיו רועש, וזה המקום שבו הפער של מודל החזית נפתח
• תפוקת אצווה — Grok Voice Transcribe 2.0 בקצב של בערך פי 162 מזמן אמת לעומת Whisper Large v3 Turbo בקצב של בערך פי 80 על GPU צרכני צנוע בודד, כאשר חומרת הגשה מהירה יותר מגיעה לכפולות של זה
• השהיית סטרימינג — 0.49 שניות עד לתוצאה חלקית ראשונה ב-Grok Voice Transcribe 2.0 לעומת 1–5 שניות עבור צינורות סטרימינג של Whisper באירוח עצמי, שהם קוד דבק בתוספת VAD ולא יכולת של המודל
הקריאה הכנה של הרשימה הזאת היא שהטיעון בדבר הדיוק כנימוק לתשלום הוא אמיתי אך מותנה. באנגלית נקייה, של דובר יחיד ובאיכות הקלטה טובה, Whisper Large v3 Turbo קרוב מספיק עד שההבדל לעיתים רחוקות משנה תוצאה. בטלפוניה של 8 kHz, באודיו רועש של מוקד טלפוני, בדיבור עם מבטא ובביטויים קצרים ספציפיים לתחום — אותן קבוצות בדיוק שכנגדן כיווננה SpaceXAI את 2.0, שבהן המספרים המדווחים שלה נעו מ-10.6% ל-7.1% בטלפוניה ומ-20.6% ל-6.8% בפקודות רב-לשוניות קצרות — הפער הופך להבדל בין תמלול שאפשר לנתב עליו לבין תמלול שצריך לקרוא. אלה נתונים שהחברה דיווחה עליהם, על אודיו של החברה, שלא שוחזרו בידי איש מחוץ ל-SpaceXAI, והכיוון שאליו הם מצביעים עקבי עם כל בדיקה בלתי תלויה של Whisper על אודיו באיכות ירודה.

השוואת העלויות היא לא $0.10 לעומת $0
הרישיון של Whisper לא עולה דבר; ההרצה שלו כן. מופע GPU שמחזיק מודל בגודל 1.6 GB ב-6 GB של VRAM ומתמלל במהירות של בערך פי 80 מזמן אמת הוא סעיף העלות האמיתי, ובתעריפי GPU טיפוסיים בענן זה מגיע לאותו סדר גודל כמו ממשקי ה-API המתארחים עבור עומסי עבודה רציפים — עם יוצא מן הכלל חשוב: משלמים על קיבולת בין אם אודיו זורם ובין אם לאו. נקודות קצה מתארחות של Whisper קיימות בטווח רחב של מחירים, מפחות מ-$1.20 ל-1,000 דקות בקצה הזול ועד כמה דולרים, והשונות היא תזכורת שימושית ש"Whisper" הוא מודל, לא רמת שירות. לוח המחירים המנורמל של Artificial Analysis מציב את נקודות הקצה המתארחות הזולות ביותר של Whisper Large v3 ב-$0.50 וב-$1.15 ל-1,000 דקות, ושתיהן נמוכות מתעריף האצווה של Grok Voice Transcribe 2.0 שעומד על $1.67 — אבל אף אחת מנקודות הקצה האלה אינה שלך, ושתיהן מגיעות עם מגבלות הקצב ומדיניות השימור של מישהו אחר.
מה שבו אירוח עצמי מנצח outright הוא בנפח בעל אופי מתפרץ. ארכיון מדיה של עשרת אלפים שעות עולה אותו הדבר על ה-GPU שלך בין אם תעבד אותו בשבוע ובין אם בשנה, ואף מונה לפי שעה לא רץ בזמן שאתה מתלבט. לתהליך ציות שאסור לו לשלוח אודיו מחוץ לרשת אין חלופה מתארחת בשום מחיר, משום שהדרישה היא ארכיטקטונית ולא כספית. וכיוונון עדין עומד לרשותך רק אם המשקולות בידיך: רישיון ה-MIT של Whisper מאפשר לך לקחת את המודל בעל 809 מיליון הפרמטרים ולהתאים אותו לדובר בודד, למבטא בודד או לאוצר מילים תחומי מצומצם — יכולת שאף API אינו חושף בשום נקודת מחיר.
התמונה המשתקפת היא שמחירו של מודל מתארח יכול לזוז מתחתיך. SpaceXAI השאירה את התעריף שלה ללא שינוי כשהיא עברה מ-1.0 ל-2.0 — שיפור במודל במחיר קבוע — ו-MAI-Transcribe-2 של מיקרוסופט נחתה על אותו $0.10 לשעת אודיו בדיוק, מה שאומר לך היכן נמצאת רצפת החזית. אם אתה מנתב דרך OrcaRouter, מחירי המחירון האלה עוברים הלאה עם 0% תוספת, כך שקיצוץ של ספק מגיע לחשבון שלך ביום שבו הוא קורה ולא אחרי מחזור תמחור מחדש. זה יתרון אמיתי של הצד השכור בהשוואה הזו, וכדאי לשקול אותו מול העובדה שהצד החינמי אף פעם לא שולח לך חשבונית בכלל.

למה כל אחד מהם בעצם מיועד
הישארו עם Whisper Large v3 Turbo כשהאודיו כבר קיים כקובץ, הווליום גבוה או לא אחיד, ההקלטות נקיות למדי, וגם כשהנתונים לא יכולים לצאת מהרשת שלכם או שהתקציב לא יכול לספוג מונה חיוב לפי שעה. זו עדיין הבחירה הנכונה לארכיונים לא־מקוונים, לתמלול בקצה ובמכשיר עצמו — שם מודל בגודל 1.6 GB עובר קוונטיזציה כדי להיכנס — לצינורות אצווה שבהם התפוקה היא האילוץ ולא השהיה, ולכל פרויקט שבו כיוונון עדין על האודיו שלכם הוא הדרך לדיוק שאתם צריכים. הכלים שסביבו — whisper.cpp לקצה, faster-whisper לפרודקשן, ומבני GGUF לזיכרון מוגבל — עומדות מאחוריהם שנתיים של חישול קהילתי, וזה סוג של אמינות שאין לשום API בן יומיים.
עברו ל-Grok Voice Transcribe 2.0 כאשר האודיו עדיין מגיע, כאשר ההקלטות מדורדרות, כאשר אתם צריכים לדעת מי דיבר ומתי, כאשר יש להטות אוצר מילים תחומי במקום לכוונן אותו עדין, או כאשר האפליקציה פועלת על תמלול חלקי לפני שהדובר סיים. מסלול השדרוג הוא פרמטר אחד באינטגרציה קיימת ונעיצה חזרה ל-1.0 אם משהו משתבש, מה שהופך את הניסיון לזול. ראוי לציין שההגירה ההפוכה אינה זולה: קוד שנכתב כנגד API זרימה עם דיאריזציה וזיהוי תורות דיבור אינו מדרדר באופן חלק למודל אצווה שמחזיר טקסט פשוט, וזו סיבה להוכיח את המסלול המתארח על פרוסה מהאודיו האמיתי שלכם לפני שמחייבים צינור עיבוד אליו.

איפה שההחלטה באמת מתקבלת
רוב הצוותים שמריצים את Whisper בכל קנה מידה אינם בוחרים בין שני המודלים האלה — הם מריצים תצורה היברידית: Whisper לארכיון, כי הוא חינמי וטוב מספיק באודיו נקי; API חזיתי (frontier) לנתיב החי, כי שום דבר אחר לא מזרים ב-3.4% partial WER; ומודל שלישי בהמשך השרשרת שמסכם, מסווג או פועל על כל טקסט שיוצא. השלב השלישי הזה הוא בדרך כלל המקום שבו נוצרת ההתפשטות — חוזה ספק שני עבור מודל החשיבה, סט שני של פרטי גישה, מגבלת קצב שנייה לנטר. OrcaRouter ממוטט את השכבה הזו: מפתח אחד על פני יותר מ-200 מודלים, failover אוטומטי כשספק מדרדר, ו-DSL לניתוב אם רוצים להעביר את אותה תמלול דרך כמה מודלים ולהשוות לפני שבוחרים באחד. קריאות התמלול עצמן עדיין הולכות לספק שבחרתם; מה שמפסיק להתרבות הוא כל מה שאחריהן.
הדבר שכדאי לשים לב אליו בצד של Whisper אינו צ׳קפוינט חדש — המשפחה לא זזה מאז Turbo, והקשב של OpenAI עבר לקו GPT Transcribe. זה שכבת ההגשה. בכל שנה הכלים ל-self-hosting נעשים מהירים יותר והחומרה שהם דורשים נעשית קטנה יותר, וכל שיפור שם מצמצם את ההצדקה לשלם לפי שעה. הדבר שכדאי לשים לב אליו בצד של SpaceXAI הוא היפוך ברירת המחדל: כאשר 2.0 יהפוך לברירת המחדל ו-1.0 יוצא משימוש, כל אינטגרציה שמעולם לא ציינה מודל תזוז בבת אחת, כולל השהיה. אף אחד מהפיתוחים לא משנה את הפיצול הבסיסי. מודל אחד שבבעלותך ואתה מכוון אותו, מודל אחד שאתה שוכר וקורא לו, והתשובה הכנה שרוב ערימות הייצור בסופו של דבר מריצות את שניהם.
