
VibeVoice-ASR-Streaming-1.5B מול Whisper Large v3 Turbo: סטרימינג מובנה מול סוס העבודה של 99 השפות
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
יש סיכוי לא רע שמודל הדיבור-לטקסט שאתם מריצים היום הוא Whisper Large v3 Turbo — ויש מודל חדש שמעלה את השאלה אם כך צריך להישאר. ה-Whisper Large v3 Turbo של OpenAI — צ'קפוינט מזוקק עם 809M פרמטרים ששוחרר באוקטובר 2024 — הוא סוס העבודה בעולם המשקלים הפתוחים: 99 שפות, מהיר פי ארבעה עד שמונה מה-large-v3 המקורי, קטן מספיק בשביל מחשב נייד, ברישיון MIT, ומגובה על ידי האקוסיסטם הגדול ביותר לתמלול שקיים. VibeVoice-ASR-Streaming-1.5B, שהועלה על ידי Microsoft Research ב-2 בספטמבר 2026, הוא המתמודד שנבנה בדיוק בשביל הדבר האחד ש-Whisper לא עושה במקור: סטרימינג. הוא מתמלל בנתחים תוך כדי הגעת האודיו במקום לבלוע חלונות זמן קבועים, הוא מציע פלט עם ייחוס דובר — ולזכותו עשר שפות ואף לא בנצ'מרק אחד שפורסם.
הסעיף האחרון הוא הסיבה שעמוד זה בנוי סביב שאלת הגירה, ולא סביב מבחן השוואתי. הנתונים של Whisper Large v3 Turbo נמדדים ופומביים — LibriSpeech, המכלול המשולב של Open ASR, Common Voice — ואילו כרטיס המודל של VibeVoice-ASR-Streaming-1.5B אינו מפרסם בטקסט שום נתון WER או זמן השהיה, ובזמן כתיבת שורות אלה אין בנמצא אף בדיקה בלתי־תלויה. כל מה שידוע על הצד של Microsoft להלן הוא מה שניתן ללמוד מהמאגר שלו: קבצי התצורה, כרטיס המודל, והתיעוד של Microsoft בנושא סטרימינג. כל מה שנוגע לצד של Whisper הוא תיעוד ציבורי מוסכם וידוע. השניים לא הופעלו זה מול זה; ההשוואה היא בין מה שהוכח לבין מה שהובטח.
המודל שכנראה אתם כבר מריצים
Whisper Large v3 Turbo זכה למקומו בדרך הלא-זוהרת: הוא מהיר, קטן, רב-לשוני, ומשעמם בדרכים שצוותי פרודקשן אוהבים. לאחר זיקוק מ-Whisper large-v3 בעל 1.55B פרמטרים למודל בעל 809M פרמטרים, הוא שומר על כיסוי של 99 שפות ועל כ-95% מהדיוק של large-v3 — כ-2.1% WER על LibriSpeech clean, בסביבות 7.7–7.8% על Open ASR composite, כשההרעה הגדולה ביותר היא בשפות דלות-משאבים וטונאליות — בעודו רץ מהר פי כמה ומתאים לכ-1.6 GB של VRAM ב-FP16. הוא מופץ ברישיון MIT, רץ דרך faster-whisper, whisper.cpp, ודרך אינטגרציות שנבנו במשך שלוש שנים, והדף שלו ב-Hugging Face מציג למעלה מ-7 מיליון הורדות בחודש אחד. אם אתם מארחים בעצמכם שירות תמלול, סביר מאוד שזה המודל שעושה את העבודה.
Whisper Large v3 Turbo אינו מודל סטרימינג, ומעולם לא טען להיות כזה. הוא קולט אודיו בחלונות קבועים של 30 שניות ומחזיר תמלול לכל חלון; אין לו זיהוי פעילות קול מובנה, אין זיהוי סיום דיבור, אין הפרדת דוברים, ואין מנגנון מילת הפעלה. תמלול חי ב-Whisper הוא תמיד תוספת בדיעבד שאתה בונה — והתוספת הזו היא המקום שבו חבויים השהות ועלות ההנדסה.
מה בעצם משתנה אם מחליפים
מודל השהיה — VibeVoice-ASR-Streaming-1.5B מפיק טקסט עבור כל גוש מעובד של כ־2.9 שניות, עם הסתכלות קדימה של כ־0.5 שניות, כמתוכנן — לעומת Whisper Large v3 Turbo: מודל אצווה עם חלון של 30 שניות, הדורש שכבת חלוקה לגושים ותפירה כדי לחקות פלט חי בקירוב.
מבנה הסשן — סשנים חיים ללא הגבלה, כשההקשר מועבר בין מקטעים במטמון קידומות, לעומת חלונות בדידים בני 30 שניות ללא מצב שיחה חוצה-חלונות.
• שפות — עשר (סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית, ספרדית) לעומת 99.
• דיוק בפרסומים: {{1}}לא פורסם דבר{{/1}} לעומת {{2}}~2.1% LibriSpeech clean, ~7.7–7.8% Open ASR composite{{/2}}, והכול נמדד ופומבי.
תוספות פלט — נטען שיש ייחוס דובר בסטרימינג ("מי אמר מה") ומילות חימום, וחותמות זמן למילים זמינות, אך אין דיאריזציה ואין מילות חימום מובנות.
• חומרה — ~5.6 ג"ב של משקלי bf16 על GPU של NVIDIA, התקנה מקוד מקור לעומת ~1.6 ג"ב FP16, פועל על מחשבים ניידים ומעבדים דרך whisper.cpp ו-faster-whisper.
• רישיון — MIT, שניהם.

בעיית ההתאמה המחודשת לסטרימינג
הדרך הכנה לבחון את ההשוואה הזו היא של-Whisper Large v3 Turbo יש בעיית סטרימינג שכבר שילמת עליה או שעדיין משלם עליה. צינור חי על Whisper פירושו גלאי פעילות קולית כדי לאתר דיבור, רכיב חיתוך לפריסת אודיו לחלונות בגודל Whisper, חלונות חופפים כך שמילים לא יאבדו בגבולות, ורכיב תפירה לאיחוד התמלילים החלקיים. יישומים קהילתיים של אותה מחסנית מגיעים לשהות מקצה לקצה של בערך אחת עד חמש שניות — מתאים לסיכומי פגישות, אך לא מגיע לרף הנדרש עבור סוכני טלפון וכתוביות חיות.
VibeVoice-ASR-Streaming-1.5B מבטל את הצורך ברטרופיט מעצם הבנייה. תצורת הפרה-מעבד שלו קובעת מקטע של 22 פריימים ומבט קדימה של 4 פריימים על זרם אסימוני דיבור בקצב של כ-7.5 הרץ — כ-2.9 שניות שמע לכל מקטע שנפלט, וחצי שניית קונטקסט עתידי — והתיעוד של Microsoft מתאר שקונטקסט ממקטעים קודמים נשמר דרך מטמון ה-KV, ולכן סשן חי אינו מחשב מחדש מאפס. אבל קראו בעיון את המילה "streaming" בשני צדדי ההשוואה: אף אחד מהמודלים אינו מנוע תמלול חלקי ברמת מילה, מהסוג שמשווקות ה-API המסחריות עם החביון הנמוך ביותר. התמליל של VibeVoice גדל בתוספות של כשלוש שניות, וזה נעשה בכוונה תחילה — קצב שונה ובדרך כלל מקובל לפגישות, אבל הוא אינו תת-שנייתי. ואם הדרישה שלכם היא מילים על המסך בתוך שנייה, כדאי למדוד את גיאומטריית המקטע הזו מול התקציב הזה לפני שבונים עליה.
דיוק: מה שאתם מוותרים עליו כדי לעבור לסטרימינג מקורי
הנה הפער שאמור להנחות את ההחלטה. ל-Whisper Large v3 Turbo יש רקורד דיוק ציבורי שאפשר לאמת — וכשההקלטה היא באחת מ-99 השפות שבהן הוא תומך, הרקורד הזה חזק. ל-VibeVoice-ASR-Streaming-1.5B אין רקורד כזה: ההערכה בכרטיס המודל היא תמונה, מיקרוסופט לא פרסמה WER לסטרימינג כטקסט, והעוגן המספרי היחיד במשפחה הוא WER ממוצע של 7.77% המדווח על ידי הספק בכרטיס VibeVoice-ASR (batch), על פני שמונה מערכי בדיקה באנגלית — נתון שמתאר מודל שונה, שאינו סטרימינג. המשפט הכנה הוא שהעברת התמלול שלך ל-VibeVoice-ASR-Streaming-1.5B היום משמעותה קבלת רמת דיוק לא ידועה על האודיו שלך — וזו בדיוק הסיבה שכל הערכה שלו צריכה להתבצע על ידך, על ההקלטות האמיתיות הקשות ביותר שלך, לפני שהוא זוכה לתעבורת ייצור.

שפות וייחוס דובר: פער התכונות פועל לשני הכיוונים
השוואת התכונות אינה חד-צדדית, וזה מה שהופך את הבחירה למעניינת באמת. אם האודיו שלך הוא רב-לשוני, ההחלטה מסתיימת מיד: 99 השפות של Whisper Large v3 Turbo מכסות את מה שעשר השפות של VibeVoice-ASR-Streaming-1.5B לא מכסות, ותקרת עשר שפות פוסלת כל צינור עיבוד שנתקל בתמהיל רחב של דיבור. אבל אם עומס העבודה שלך נמצא בתוך עשר השפות האלה והדבר שאתה באמת צריך הוא לדעת מי אמר מה בפגישה חיה, החץ מצביע לכיוון השני: Whisper אינו מציע דיאריזציה מקורית ואינו מציע מילות חום, בעוד VibeVoice-ASR-Streaming-1.5B טוען לשניהם — פלט סטרימינג עם ייחוס דובר ומילות חום למונחי תחום המועברות כהנחיית הקשר. הטענה אינה מאומתת, ודיאריזציית סטרימינג על פני גבולות מקטעים קשה מספיק כדי שתהיה ראויה לספקנות, אבל היא התכונה הקונקרטית ששום כמות של הנדסת Whisper לא מעניקה לך ישירות מהקופסה.
המתמטיקה של ההגירה
עלות ומאמץ מעדיפים את המוצר הקיים. Whisper Large v3 Turbo כבר רץ בערימה שלך על חומרה שבבעלותך — מחשב נייד, CPU, GPU צנוע — והמעבר ל-VibeVoice-ASR-Streaming-1.5B פירושו הקמת התקנת מחקר מקוד-מקור על NVIDIA GPU עם ~5.6 GB של משקלים, אימות נתיב טעינה שסיווג הארכיטקטורה שלו עדיין לא מתועד בתיעוד הציבורי של Transformers, ובניית ה-benchmark שההחלטה שלך תלויה בו מאפס. זה פרויקט של ממש, וההחזר מותנה בכך שהתכונות הלא-מאומתות אכן חשובות לך.

הדרך הזולה להריץ את הפרויקט הזה היא לא להתייחס אליו כאל החלפה. השאר את Whisper Large v3 Turbo כברירת המחדל ונתב נתח של שמע חי אל VibeVoice-ASR-Streaming-1.5B דרך API אחד – התבנית ששכבת ניתוב קיימת עבורה: 200+ מודלים מאחורי נקודת קצה אחת במחיר המחירון של הספק ללא תוספת, מעבר אוטומטי כשהמודל החדש נכשל, ו-DSL ניתוב שמאפשר לעומסי עבודה שונים לבחור מתעתיקים שונים מקריאה אחת. זה המודל של OrcaRouter, וזה ההבדל בין להמר שצינור הייצור שלך יישען על צ'קפוינט בן יומיים לבין לתת לצ'קפוינט הזה להרוויח את מקומו לצד סוס העבודה על התמלילים שלך.
שאלות נפוצות
האם Whisper Large v3 Turbo יכול לבצע סטרימינג חי בכלל?
רק כהתקן רטרופיט. Whisper Large v3 Turbo הוא מודל אצווה שמעבד חלונות קבועים של 30 שניות, ולכן תמלול חי מחייב אותך לבנות גלאי פעילות קול, מפצל (chunker), אסטרטגיית חפיפה ומרכיב (stitcher) מעליו. קיימים מימושים עובדים שמגיעים לשהות של בערך שנייה עד חמש שניות — מה שמתאים לפרוטוקולי פגישות, אבל מחמיץ את רף תת-השנייה הנדרש לסוכני טלפון ולתמלול חי. VibeVoice-ASR-Streaming-1.5B הוא סטרימינג-נטיבי — הוא פולט טקסט בכל נתח של ~2.9 שניות, עם כ־~0.5 שניות של הסתכלות קדימה — אבל זה סטרימינג מבוסס-נתחים, לא פלט חלקי לכל מילה, אז בדוק גם את הקצב הזה מול תקציב השהיה שלך.
האם VibeVoice-ASR-Streaming-1.5B מדויק יותר מאשר Whisper Large v3 Turbo?
אף אחד לא יכול לענות על כך עדיין, כולל מיקרוסופט. הדיוק של Whisper Large v3 Turbo נמדד ופומבי — כ-2.1% WER על LibriSpeech clean וכ-7.7–7.8% על Open ASR composite. ל-VibeVoice-ASR-Streaming-1.5B אין נתון WER סטרימינג מפורסם בכתב ואין אמת מידה בלתי-תלויה נכון לכתיבת שורות אלה. הדרך היחידה לענות על השאלה היא להריץ את הצ'קפוינט על האודיו שלכם ולהשוות את התמלילים מול המערכת הנוכחית שלכם — וזה בדיוק המבחן שהדף הזה ממליץ עליו לפני כל מיגרציה.
באילו שפות השתיים תומכות?
Whisper Large v3 Turbo תומך ב-99 שפות עם סט משקלים אחד. VibeVoice-ASR-Streaming-1.5B מפרט עשר: סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית. עבור כל אודיו מחוץ לסט עשר השפות הזה, Whisper הוא האפשרות היחידה בצימוד הזה, והפער הרב-לשוני הוא הסיבה הברורה ביותר לכך שרוב הצוותים יישארו במקומם.
Whisper Large v3 Turbo הוא המודל הנכון לרוב הצוותים ברוב המקרים, וצ’קופוינט בן יומיים ללא אמות מידה אינו סיבה להחליף פלטפורמה. הוא סיבה להריץ ניסוי. אם האודיו שלכם נמצא בעשר השפות שלו, וייחוס דובר בזמן אמת ישנה את המוצר שלכם, הקימו את VibeVoice-ASR-Streaming-1.5B מאחורי נתב, כוונו אליו מקטע מתעבורה אמיתית, ותנו לתמלילים — לא לחוסר אמת מידה באף אחד מהצדדים — להכריע.
