
VibeVoice-ASR-Streaming-7B לעומת Whisper Large v3 Turbo: מה נקודת הבידוק הסטרימינג של מיקרוסופט מוסיפה לברירת המחדל בעלת המשקלים הפתוחים
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
במשך רוב השנתיים האחרונות, התשובה ל"לתמלל את זה בעצמנו, בזול" הייתה Whisper Large v3 Turbo — מודל הקוד הפתוח של OpenAI עם 809 מיליון פרמטרים, ברישיון MIT, תומך ב־99 שפות, קטן מספיק כדי לרוץ על תחנת עבודה, וחינמי ברגע שהחומרה שלך. ב־2 בספטמבר 2026, Microsoft Research העלתה מתחרה לברירת המחדל הזו: VibeVoice-ASR-Streaming-7B, checkpoint סטרימינג ברישיון MIT ב־Hugging Face שמתמלל בזמן שהאודיו מגיע, טוען לפלט עם ייחוס דובר, ו—בניגוד למודל שרוב הצוותים כבר מריצים—מעולם לא תוכנן כעבודה אצווה. שני המודלים הם משקלים פתוחים ממעבדות גדולות. כמעט כל דבר אחר בהם הוא פשרה, והדף הזה עוסק בשאלה איזו פשרה אתה בעצם עושה.
אסימטריה אחת מעצבת את כל ההשוואה, ולכן היא באה ראשונה. Whisper Large v3 Turbo הוא מודל הדיבור ששוחזר באופן העצמאי ביותר בעולם: מספרי שגיאות המילים שלו נבדקו מחדש על ידי אלפי צוותים על מדדים ציבוריים ועל האודיו שלהם עצמם במשך שנים, והחולשות שלו מתועדות בדיוק כמו החוזקות שלו. VibeVoice-ASR-Streaming-7B הוא בן יום אחד, אין לו שום מדד עצמאי בשום מקום, ומיקרוסופט לא פרסמה שיעור שגיאות מילים בסטרימינג בטקסט קריא. כל מה שבצד של מיקרוסופט להלן נקרא מתוך המאגר — קונפיגורציה, כרטיס מודל ומסמכי הסטרימינג של מיקרוסופט — ומסומן ככזה.
ברירת המחדל של משקלים פתוחים, ולמה היא מחזיקה מעמד
Whisper Large v3 Turbo הוא הגרסה המזוקקת (distilled) של Whisper Large v3: הוא שומר על מקודד בן 32 שכבות ומקצץ את המפענח מ-32 שכבות לארבע, וכך מספר הפרמטרים יורד ל-809M והתפוקה בערך מוכפלת פי ארבעה על GPU, תוך שמירה על דיוק קרוב למקור. מכיוון שהמשקלים הם ברישיון MIT והמודל קטן, הוא הפך למנוע התמלול המוטמע כברירת מחדל עבור בוטים של פגישות, כלי כתוביות וצינורות תיעוד שיחות. המגבלות שלו ידועות לא פחות. זהו מודל אצווה (batch) — הוא מקבל קובץ שמע ומחזיר תמליל, במקום להפיק מילים בזמן שהן נאמרות. הוא לא אומן לתרגום, ומשימה זו מתפקדת בצורה גרועה מאוד. הדיוק שלו על דיבור רועש, בעל מבטא או חופף אינו אחיד, והוא מחזיר טקסט פשוט: ללא פיסוק או רישיות כברירת מחדל, ללא חלוקה לדוברים (diarization), ללא חותמות זמן בגרסה זו, וללא הטיה לפי מילות מפתח. מערכות ייצור הבנויות על Whisper מרכיבות את החלקים הללו בנפרד, וכל אחד מהם מוסיף זמן השהיה ומצבי כשל משלו.

פער המפרט
• פרמטרים — 809M (מפענח מזוקק) לעומת כ-9B בסך הכול (שדרה לשונית Qwen2-7B בתוספת מקודדי דיבור; ה-"7B" מתייחס ל-LLM, ואילו דף Hugging Face מציין 9B).
• רישיון — MIT, משקלים פתוחים, שניהם.
• סטרימינג — אצווה לפי תכנון: יישומי סטרימינג באירוח עצמי בדרך כלל מגיעים ל-1–5 שניות של השהיה לעומת סטרימינג ילידי: מקטעים של ~2.9 שניות עם הסתכלות קדימה של ~0.5 שניות, טקסט נפלט לכל מקטע, ההקשר נשמר במטמון KV.
• שפות — 99 עם שנים של שכפול קהילתי לעומת 10 מוצהרות (en, zh, es, pt, de, ja, ko, fr, ru, it).
• מעבר לתמליל — אין כברירת מחדל, לעומת טענות על פלט סטרימינג של "מי אמר מה" ומילות חימום מותאמות אישית (לא מאומת).
דיוק כפי שמדווח בפרסומים — 2.1% WER על LibriSpeech test-clean, 4.2% על test-other, כ־7.7% על Open ASR composite, ו־8–12% על אודיו רועש בבדיקות קהילה, כולם שוחזרו באופן עצמאי; לעומת זאת, לא פורסם אף נתון WER של סטרימינג כטקסט.
• טביעת רגל — רץ על מחשב נייד או GPU יחיד וצנוע, לעומת כ-18 GB של משקלי bf16 לפני KV cache; הקצו GPU מדרגת 24 GB.

מה הסטרימינג בעצם מוסיף
הסיבה שבכלל כדאי להסתכל מעבר ל־Whisper Large v3 Turbo היא הנתיב החי, וכאן שני הדגמים מפסיקים להיות ניתנים להשוואה. Whisper מוכוון אצווה: כדי לקבל מילים בעוד הדובר עדיין מדבר, צוותים מוסיפים חלוקה למקטעים, זיהוי פעילות קולית וקוד דבק, ומימושי סטרימינג באירוח עצמי מגיעים בדרך כלל להשהיה של בין שנייה לחמש שניות — ובכך הם מחמיצים את רף תת־השנייה הנדרש לסוכני טלפון ולכתוביות חיות, ללא הנדסה רצינית. VibeVoice-ASR-Streaming-7B בנוי לנתיב הזה. התצורה שלו מציגה אודיו שנדחס פי 3,200 לזרם טוקנים בקצב של 7.5 פריימים בשנייה ומעובד במקטעים של 22 פריימים, עם הסתכלות קדימה של ארבעה פריימים — כ־2.9 שניות אודיו למקטע — כשהטקסט נפלט עם סיום כל מקטע וההקשר הקודם נשמר במטמון ה־KV, כך שסשן אינו מחשב מחדש מאפס. הקצב הזה הוא מאפיין עיצובי שנגזר מהתצורה, לא השהיה מדודה, ואף אחד עדיין לא פרסם נתון מקצה לקצה לגביו; אבל הארכיטקטורה היא באופן חד־משמעי ארכיטקטורת תמלול חי, במובן ש־Whisper אינו.
הרקורד של Whisper ארוך ופתוח לציבור; זה של הצ'ק-פוינט החדש ריק לגמרי.
הדיוק הוא התחום שבו הוותק של Whisper Large v3 Turbo הוא נכס. שיעור ה-WER של 2.1% על LibriSpeech test-clean ושל 4.2% על test-other הם נתוני open-weights ששוחזרו על ידי אינספור צוותים; כ-7.7% במדד המשולב של לוח התוצאות של Open ASR נמצאים בערך נקודה אחת מאחורי ה-Large v3 המלא; וה-8–12% המתועדים על אודיו רועש בבדיקות קהילה פירושם שאיש אינו מופתע מהם. החולשות הללו הן חלק מהרשומה — הן אומרות לך בדיוק היכן המודל זקוק לעזרה לפני שאתה בונה עליו.
ל-VibeVoice-ASR-Streaming-7B אין רקורד כזה. כרטיס המודל שלו מצרף נתון הערכה כתמונה, והדוח הטכני של Microsoft על סטרימינג הוא קובץ PDF, אבל אין בפרוזה שיעור שגיאות מילים (WER) לסטרימינג שאפשר לצטט. עוגן המספרים היחיד במשפחה הוא הטבלה שדיווח היצרן בכרטיס של VibeVoice-ASR המקובץ — ממוצע WER של 7.77% על פני שמונה ערכות בדיקה באנגלית ו-2.20% על LibriSpeech clean — וזה לא המספר של נקודת הבקרה הזו; וגם הקבלה הקהילתית של המודל המקובץ עצמו הייתה מעורבת: שיבחו אותו על יכולות הפרדת דוברים (diarization) מוכנות לשימוש, וביקרו אותו ככבד וכזה שלעתים נוטה להזיות. שום דבר מזה אינו תקף למודל הסטרימינג, וזו בדיוק הנקודה: עם Whisper אתה יודע מראש מה הם מצבי הכשל; עם VibeVoice-ASR-Streaming-7B אתה הבודק הראשון.
שפות וטביעת רגל: 99 לעומת 10, 0.8B לעומת 9B
שתי עלויות המעבר הקונקרטיות ביותר הן שפות וגודל. Whisper Large v3 Turbo מתמלל 99 שפות; שפות דלות-משאבים ושפות טונאליות מתדרדרות — תאית, קנטונזית וולשית הן נקודות התורפה המוזכרות לרוב — אבל מאחורי הרשימה עומדות שנים של שחזור קהילתי. VibeVoice-ASR-Streaming-7B מצהיר על תמיכה בעשר שפות: אנגלית, סינית, ספרדית, פורטוגזית, גרמנית, יפנית, קוריאנית, צרפתית, רוסית ואיטלקית. אם התעבורה שלכם נכללת בעשר האלה, הכיסוי אינו מהווה בעיה; אם לא, ההשוואה מסתיימת כאן. הגודל הוא העלות השנייה: דגם עם 809 מיליון פרמטרים רץ על מחשב נייד, ואילו כ-9 מיליארד פרמטרים בסך הכול ב-bf16 פירושו בערך 18 GB של משקלים לפני KV cache ו-GPU ברמת 24 GB כדי להריץ אותו בנוחות. עבור צוותים שכבר מריצים את Whisper על חומרה צנועה, מדובר בקפיצת מדרגה של ממש בתשתית, המוצדקת רק בדרישה אמיתית לתמלול חי.
כשהחינם אינו הנקודה
Whisper Large v3 Turbo חינמי להרצה; העלות היא החומרה וההנדסה סביבו. פריסת faster-whisper על T4 בודד עולה בסדר גודל של 0.05–0.10 דולר לשעת אודיו בתעריף המקובל של ה-GPU, ועומס עבודה מתמשך מוסיף את סטאק הפרדת הדוברים והפיסוק שחייבים לבנות כי Whisper מחזיר טקסט פשוט. גם VibeVoice-ASR-Streaming-7B חינמי להרצה, על חומרה יקרה יותר, תמורת ארכיטקטורת סטרימינג שטוענת לייחוס דוברים ובקרות הקשר שחסרות ב-Whisper — טענות שהיית מאמת בעצמך, שכן אין בנצ'מרק עצמאי. לתמלול אצווה בנפח גדול, התפוקה וטביעת הרגל הזעירה של Whisper עדיין מנצחות. לאודיו חי עם דוברים מרובים, שבו התמליל חייב להגיע תוך כדי השיחה, Whisper פועל נגד התכנון שלו והצ'קפוינט הסטרימינגי פועל איתו — אם הוא פועל בכלל, וזו בדיוק השאלה שצריך לענות עליה עם האודיו שלך על ה-GPU שלך.

הסטאק הפרגמטי
התשובה השכיחה ביותר בעולם האמיתי אינה “או/או” אלא “גם וגם”, וזו ההמלצה כאן: להשאיר את Whisper Large v3 Turbo כמסלול עיבוד קבוצתי בנפח גבוה, שבו הרקורד וטביעת הרגל החישובית שלו הופכים אותו לבלתי מנוצח, ולהעריך את VibeVoice-ASR-Streaming-7B על המסלול החי ש-Whisper אינו יכול לשרת בזמן ההשהיה הנדרש — עם שער הערכה מפורש, כי אין שום benchmark שאפשר להישען עליו. השניים יכולים לחלוק תקציב GPU אחד ובסיס קוד אחד. המקום שבו שכבת ניתוב מצדיקה את מקומה במחסנית הזו הוא השכבה שמעל התמלילים, לא התמלול עצמו: OrcaRouter אינו מנתב דיבור לטקסט כיום, ואף אחד משני המודלים אינו בקטלוג שלו — אבל המסכמים, כללי ההתראה ומתכנני הסוכנים, הצורכים תמליל חי, הם בדיוק אותם 200+ מודלי השפה ש-OrcaRouter מספק עם API אחד, במחירי המחירון של הספקים ללא תוספת, ועם מעבר אוטומטי בין ספקים. checkpoint סטרימינג שמשוחרר בלי אפילו benchmark אחד ראוי לאותו יחס שמקבל כל מודל שלא הוכח — נתח מתעבורה אמיתית מאחורי fallback, שמרוויח או מאבד את אמונך על סמך הראיות מהפגישות שלך עצמך, ולא על סמך כרטיס מודל (model card).
