כרטיס כותרת ראשי שנוצר עבור 'VibeVoice-ASR-Streaming-1.5B לעומת Whisper Large v3 Turbo: סטרימינג מקורי מול סוס העבודה של 99 השפות', עם כותרת משנה 'סטרימינג מקורי מול סוס העבודה של 99 השפות', ועם שני כרטיסי מודל — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 בספט׳ 2026 · MIT · סטרימינג-מקורי · 10 שפות) ו-Whisper Large v3 Turbo (OpenAI · אוק׳ 2024 · MIT · אצווה · 99 שפות) — ותגיות שנושאות '~2.9 s chunks + ~0.5 s lookahead', '7M+ הורדות / חודש (Whisper)', ו-'No benchmark published yet'. הלוגו של OrcaRouter מורכב בפינה הימנית-תחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B מול Whisper Large v3 Turbo: סטרימינג מובנה מול סוס העבודה של 99 השפות

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

יש סיכוי לא רע שמודל הדיבור-לטקסט שאתם מריצים היום הוא Whisper Large v3 Turbo — ויש מודל חדש שמעלה את השאלה אם כך צריך להישאר. ה-Whisper Large v3 Turbo של OpenAI — צ'קפוינט מזוקק עם 809M פרמטרים ששוחרר באוקטובר 2024 — הוא סוס העבודה בעולם המשקלים הפתוחים: 99 שפות, מהיר פי ארבעה עד שמונה מה-large-v3 המקורי, קטן מספיק בשביל מחשב נייד, ברישיון MIT, ומגובה על ידי האקוסיסטם הגדול ביותר לתמלול שקיים. VibeVoice-ASR-Streaming-1.5B, שהועלה על ידי Microsoft Research ב-2 בספטמבר 2026, הוא המתמודד שנבנה בדיוק בשביל הדבר האחד ש-Whisper לא עושה במקור: סטרימינג. הוא מתמלל בנתחים תוך כדי הגעת האודיו במקום לבלוע חלונות זמן קבועים, הוא מציע פלט עם ייחוס דובר — ולזכותו עשר שפות ואף לא בנצ'מרק אחד שפורסם.

הסעיף האחרון הוא הסיבה שעמוד זה בנוי סביב שאלת הגירה, ולא סביב מבחן השוואתי. הנתונים של Whisper Large v3 Turbo נמדדים ופומביים — LibriSpeech, המכלול המשולב של Open ASR, Common Voice — ואילו כרטיס המודל של VibeVoice-ASR-Streaming-1.5B אינו מפרסם בטקסט שום נתון WER או זמן השהיה, ובזמן כתיבת שורות אלה אין בנמצא אף בדיקה בלתי־תלויה. כל מה שידוע על הצד של Microsoft להלן הוא מה שניתן ללמוד מהמאגר שלו: קבצי התצורה, כרטיס המודל, והתיעוד של Microsoft בנושא סטרימינג. כל מה שנוגע לצד של Whisper הוא תיעוד ציבורי מוסכם וידוע. השניים לא הופעלו זה מול זה; ההשוואה היא בין מה שהוכח לבין מה שהובטח.

המודל שכנראה אתם כבר מריצים

Whisper Large v3 Turbo זכה למקומו בדרך הלא-זוהרת: הוא מהיר, קטן, רב-לשוני, ומשעמם בדרכים שצוותי פרודקשן אוהבים. לאחר זיקוק מ-Whisper large-v3 בעל 1.55B פרמטרים למודל בעל 809M פרמטרים, הוא שומר על כיסוי של 99 שפות ועל כ-95% מהדיוק של large-v3 — כ-2.1% WER על LibriSpeech clean, בסביבות 7.7–7.8% על Open ASR composite, כשההרעה הגדולה ביותר היא בשפות דלות-משאבים וטונאליות — בעודו רץ מהר פי כמה ומתאים לכ-1.6 GB של VRAM ב-FP16. הוא מופץ ברישיון MIT, רץ דרך faster-whisper, whisper.cpp, ודרך אינטגרציות שנבנו במשך שלוש שנים, והדף שלו ב-Hugging Face מציג למעלה מ-7 מיליון הורדות בחודש אחד. אם אתם מארחים בעצמכם שירות תמלול, סביר מאוד שזה המודל שעושה את העבודה.

Whisper Large v3 Turbo אינו מודל סטרימינג, ומעולם לא טען להיות כזה. הוא קולט אודיו בחלונות קבועים של 30 שניות ומחזיר תמלול לכל חלון; אין לו זיהוי פעילות קול מובנה, אין זיהוי סיום דיבור, אין הפרדת דוברים, ואין מנגנון מילת הפעלה. תמלול חי ב-Whisper הוא תמיד תוספת בדיעבד שאתה בונה — והתוספת הזו היא המקום שבו חבויים השהות ועלות ההנדסה.

מה בעצם משתנה אם מחליפים

מודל השהיה — VibeVoice-ASR-Streaming-1.5B מפיק טקסט עבור כל גוש מעובד של כ־2.9 שניות, עם הסתכלות קדימה של כ־0.5 שניות, כמתוכנן — לעומת Whisper Large v3 Turbo: מודל אצווה עם חלון של 30 שניות, הדורש שכבת חלוקה לגושים ותפירה כדי לחקות פלט חי בקירוב.

מבנה הסשן — סשנים חיים ללא הגבלה, כשההקשר מועבר בין מקטעים במטמון קידומות, לעומת חלונות בדידים בני 30 שניות ללא מצב שיחה חוצה-חלונות.

• שפות — עשר (סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית, ספרדית) לעומת 99.

• דיוק בפרסומים: {{1}}לא פורסם דבר{{/1}} לעומת {{2}}~2.1% LibriSpeech clean, ~7.7–7.8% Open ASR composite{{/2}}, והכול נמדד ופומבי.

תוספות פלט — נטען שיש ייחוס דובר בסטרימינג ("מי אמר מה") ומילות חימום, וחותמות זמן למילים זמינות, אך אין דיאריזציה ואין מילות חימום מובנות.

• חומרה — ~5.6 ג"ב של משקלי bf16 על GPU של NVIDIA, התקנה מקוד מקור לעומת ~1.6 ג"ב FP16, פועל על מחשבים ניידים ומעבדים דרך whisper.cpp ו-faster-whisper.

• רישיון — MIT, שניהם.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

בעיית ההתאמה המחודשת לסטרימינג

הדרך הכנה לבחון את ההשוואה הזו היא של-Whisper Large v3 Turbo יש בעיית סטרימינג שכבר שילמת עליה או שעדיין משלם עליה. צינור חי על Whisper פירושו גלאי פעילות קולית כדי לאתר דיבור, רכיב חיתוך לפריסת אודיו לחלונות בגודל Whisper, חלונות חופפים כך שמילים לא יאבדו בגבולות, ורכיב תפירה לאיחוד התמלילים החלקיים. יישומים קהילתיים של אותה מחסנית מגיעים לשהות מקצה לקצה של בערך אחת עד חמש שניות — מתאים לסיכומי פגישות, אך לא מגיע לרף הנדרש עבור סוכני טלפון וכתוביות חיות.

VibeVoice-ASR-Streaming-1.5B מבטל את הצורך ברטרופיט מעצם הבנייה. תצורת הפרה-מעבד שלו קובעת מקטע של 22 פריימים ומבט קדימה של 4 פריימים על זרם אסימוני דיבור בקצב של כ-7.5 הרץ — כ-2.9 שניות שמע לכל מקטע שנפלט, וחצי שניית קונטקסט עתידי — והתיעוד של Microsoft מתאר שקונטקסט ממקטעים קודמים נשמר דרך מטמון ה-KV, ולכן סשן חי אינו מחשב מחדש מאפס. אבל קראו בעיון את המילה "streaming" בשני צדדי ההשוואה: אף אחד מהמודלים אינו מנוע תמלול חלקי ברמת מילה, מהסוג שמשווקות ה-API המסחריות עם החביון הנמוך ביותר. התמליל של VibeVoice גדל בתוספות של כשלוש שניות, וזה נעשה בכוונה תחילה — קצב שונה ובדרך כלל מקובל לפגישות, אבל הוא אינו תת-שנייתי. ואם הדרישה שלכם היא מילים על המסך בתוך שנייה, כדאי למדוד את גיאומטריית המקטע הזו מול התקציב הזה לפני שבונים עליה.

דיוק: מה שאתם מוותרים עליו כדי לעבור לסטרימינג מקורי

הנה הפער שאמור להנחות את ההחלטה. ל-Whisper Large v3 Turbo יש רקורד דיוק ציבורי שאפשר לאמת — וכשההקלטה היא באחת מ-99 השפות שבהן הוא תומך, הרקורד הזה חזק. ל-VibeVoice-ASR-Streaming-1.5B אין רקורד כזה: ההערכה בכרטיס המודל היא תמונה, מיקרוסופט לא פרסמה WER לסטרימינג כטקסט, והעוגן המספרי היחיד במשפחה הוא WER ממוצע של 7.77% המדווח על ידי הספק בכרטיס VibeVoice-ASR (batch), על פני שמונה מערכי בדיקה באנגלית — נתון שמתאר מודל שונה, שאינו סטרימינג. המשפט הכנה הוא שהעברת התמלול שלך ל-VibeVoice-ASR-Streaming-1.5B היום משמעותה קבלת רמת דיוק לא ידועה על האודיו שלך — וזו בדיוק הסיבה שכל הערכה שלו צריכה להתבצע על ידך, על ההקלטות האמיתיות הקשות ביותר שלך, לפני שהוא זוכה לתעבורת ייצור.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

שפות וייחוס דובר: פער התכונות פועל לשני הכיוונים

השוואת התכונות אינה חד-צדדית, וזה מה שהופך את הבחירה למעניינת באמת. אם האודיו שלך הוא רב-לשוני, ההחלטה מסתיימת מיד: 99 השפות של Whisper Large v3 Turbo מכסות את מה שעשר השפות של VibeVoice-ASR-Streaming-1.5B לא מכסות, ותקרת עשר שפות פוסלת כל צינור עיבוד שנתקל בתמהיל רחב של דיבור. אבל אם עומס העבודה שלך נמצא בתוך עשר השפות האלה והדבר שאתה באמת צריך הוא לדעת מי אמר מה בפגישה חיה, החץ מצביע לכיוון השני: Whisper אינו מציע דיאריזציה מקורית ואינו מציע מילות חום, בעוד VibeVoice-ASR-Streaming-1.5B טוען לשניהם — פלט סטרימינג עם ייחוס דובר ומילות חום למונחי תחום המועברות כהנחיית הקשר. הטענה אינה מאומתת, ודיאריזציית סטרימינג על פני גבולות מקטעים קשה מספיק כדי שתהיה ראויה לספקנות, אבל היא התכונה הקונקרטית ששום כמות של הנדסת Whisper לא מעניקה לך ישירות מהקופסה.

המתמטיקה של ההגירה

עלות ומאמץ מעדיפים את המוצר הקיים. Whisper Large v3 Turbo כבר רץ בערימה שלך על חומרה שבבעלותך — מחשב נייד, CPU, GPU צנוע — והמעבר ל-VibeVoice-ASR-Streaming-1.5B פירושו הקמת התקנת מחקר מקוד-מקור על NVIDIA GPU עם ~5.6 GB של משקלים, אימות נתיב טעינה שסיווג הארכיטקטורה שלו עדיין לא מתועד בתיעוד הציבורי של Transformers, ובניית ה-benchmark שההחלטה שלך תלויה בו מאפס. זה פרויקט של ממש, וההחזר מותנה בכך שהתכונות הלא-מאומתות אכן חשובות לך.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

הדרך הזולה להריץ את הפרויקט הזה היא לא להתייחס אליו כאל החלפה. השאר את Whisper Large v3 Turbo כברירת המחדל ונתב נתח של שמע חי אל VibeVoice-ASR-Streaming-1.5B דרך API אחד – התבנית ששכבת ניתוב קיימת עבורה: 200+ מודלים מאחורי נקודת קצה אחת במחיר המחירון של הספק ללא תוספת, מעבר אוטומטי כשהמודל החדש נכשל, ו-DSL ניתוב שמאפשר לעומסי עבודה שונים לבחור מתעתיקים שונים מקריאה אחת. זה המודל של OrcaRouter, וזה ההבדל בין להמר שצינור הייצור שלך יישען על צ'קפוינט בן יומיים לבין לתת לצ'קפוינט הזה להרוויח את מקומו לצד סוס העבודה על התמלילים שלך.

שאלות נפוצות

האם Whisper Large v3 Turbo יכול לבצע סטרימינג חי בכלל?

רק כהתקן רטרופיט. Whisper Large v3 Turbo הוא מודל אצווה שמעבד חלונות קבועים של 30 שניות, ולכן תמלול חי מחייב אותך לבנות גלאי פעילות קול, מפצל (chunker), אסטרטגיית חפיפה ומרכיב (stitcher) מעליו. קיימים מימושים עובדים שמגיעים לשהות של בערך שנייה עד חמש שניות — מה שמתאים לפרוטוקולי פגישות, אבל מחמיץ את רף תת-השנייה הנדרש לסוכני טלפון ולתמלול חי. VibeVoice-ASR-Streaming-1.5B הוא סטרימינג-נטיבי — הוא פולט טקסט בכל נתח של ~2.9 שניות, עם כ־~0.5 שניות של הסתכלות קדימה — אבל זה סטרימינג מבוסס-נתחים, לא פלט חלקי לכל מילה, אז בדוק גם את הקצב הזה מול תקציב השהיה שלך.

האם VibeVoice-ASR-Streaming-1.5B מדויק יותר מאשר Whisper Large v3 Turbo?

אף אחד לא יכול לענות על כך עדיין, כולל מיקרוסופט. הדיוק של Whisper Large v3 Turbo נמדד ופומבי — כ-2.1% WER על LibriSpeech clean וכ-7.7–7.8% על Open ASR composite. ל-VibeVoice-ASR-Streaming-1.5B אין נתון WER סטרימינג מפורסם בכתב ואין אמת מידה בלתי-תלויה נכון לכתיבת שורות אלה. הדרך היחידה לענות על השאלה היא להריץ את הצ'קפוינט על האודיו שלכם ולהשוות את התמלילים מול המערכת הנוכחית שלכם — וזה בדיוק המבחן שהדף הזה ממליץ עליו לפני כל מיגרציה.

באילו שפות השתיים תומכות?

Whisper Large v3 Turbo תומך ב-99 שפות עם סט משקלים אחד. VibeVoice-ASR-Streaming-1.5B מפרט עשר: סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית. עבור כל אודיו מחוץ לסט עשר השפות הזה, Whisper הוא האפשרות היחידה בצימוד הזה, והפער הרב-לשוני הוא הסיבה הברורה ביותר לכך שרוב הצוותים יישארו במקומם.

Whisper Large v3 Turbo הוא המודל הנכון לרוב הצוותים ברוב המקרים, וצ’קופוינט בן יומיים ללא אמות מידה אינו סיבה להחליף פלטפורמה. הוא סיבה להריץ ניסוי. אם האודיו שלכם נמצא בעשר השפות שלו, וייחוס דובר בזמן אמת ישנה את המוצר שלכם, הקימו את VibeVoice-ASR-Streaming-1.5B מאחורי נתב, כוונו אליו מקטע מתעבורה אמיתית, ותנו לתמלילים — לא לחוסר אמת מידה באף אחד מהצדדים — להכריע.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube