כרטיס כותרת ראשי שנוצר עבור 'VibeVoice-ASR-Streaming-1.5B לעומת Granite Speech 5.0 470M TurboCTC: שתי ההימורים השקטים בתחום הסטרימינג עם משקלים פתוחים', עם כותרת משנה 'שני מודלי ASR לסטרימינג עם משקלים פתוחים, בהפרש של שמונה ימים', עם שני כרטיסי מודל — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 בספטמבר 2026 · MIT · ~3B סה״כ · LLM לדיבור) ו-Granite Speech 5.0 470M TurboCTC (IBM · 25 באוגוסט 2026 · Apache-2.0 · 470M · מקודד CTC טהור) — ותגיות הנושאות את הכיתוב 'מהירות ברמת קצה (IBM)', 'אנגלית בלבד (IBM)', ו'מי אמר מה ב-10 שפות (Microsoft, לא מאומת)'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B לעומת Granite Speech 5.0 470M TurboCTC: שני ההימורים השקטים של משקולות פתוחות לסטרימינג

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני שחרורי הסטרימינג הפתוחים ביותר של זיהוי דיבור לטקסט מסוף אוגוסט 2026 יצאו ללא אירוע השקה. ב־25 באוגוסט IBM פרסמה את Granite Speech 5.0 470M TurboCTC ב־Hugging Face — משקולות, כרטיס מודל ופוסט בבלוג, ולא יותר — וב־2 בספטמבר Microsoft Research העלתה את VibeVoice-ASR-Streaming-1.5B תחת מרחב השם microsoft ללא כל הכרזה מלבד שורת חדשות במאגר VibeVoice ב־GitHub. הם מאותו סוג, אבל הימורים הנדסיים מנוגדים: המודל של IBM הוא מקודד CTC טהור עם 470 מיליון פרמטרים, שנועד לפעול במהירויות קצה על מחשב נייד, ואילו של מיקרוסופט הוא מודל שפת דיבור בקטגוריית 1.5B עטוף בטוקניזרים של אודיו ובראש דיפוזיה — כשלושה מיליארד פרמטרים בסך הכול — שתוכנן להבין דיבור כשפה תוך כדי התמלול.

לפני המספרים, תוויות המקור ששומרות על כנות ההשוואה. כל מה שמסומן "דווח על ידי IBM" מגיע מכרטיס המודל Granite Speech 5.0 470M TurboCTC ומהרשומות שלו בלוח התוצאות של Open ASR, כשהוא הופעל באמצעות מערך הבדיקה הרשמי על ידי IBM ביום ההשקה וטרם שוחזר באופן עצמאי. כל מה שנוגע ל-VibeVoice-ASR-Streaming-1.5B מגיע מקריאת המאגר — קובצי התצורה, כרטיס המודל ומסמכי ההזרמה של מיקרוסופט — כי מיקרוסופט לא פרסמה נתוני דיוק או השהיה בכתב ואף אחד מחוץ למיקרוסופט לא בחן את נקודת הביקורת במבחני ביצועים. השניים לא הופעלו במערך בדיקה משותף; השוואה זו בוחנת את שניהם מול אותן ראיות פומביות, וזה כל מה שכל אחת מהחברות הציעה עד כה.

שתי מהדורות שקטות בהפרש של שמונה ימים

שני המודלים הושקו באותו אופן לא חגיגי, וזה ראוי שייאמר במפורש, משום ששתי החברות לא אמרו הרבה מאז. ה-Granite Speech 5.0 470M TurboCTC של IBM הוא הגרסה בעלת רישיון Apache-2.0 בהשקה דו-גרסתית — IBM פרסמה גם גרסת אחות לא-מסחרית עם סיומת -NC ועם נתוני כותרת מעט טובים יותר — וכרטיס המודל שלו נושא תאריך שחרור של 25 באוגוסט 2026, עם תמיכה מקורית ב-Transformers והגשה ללוח המובילים של Open ASR באותו יום. צמד דגמי הסטרימינג של מיקרוסופט, VibeVoice-ASR-Streaming-7B ו-VibeVoice-ASR-Streaming-1.5B, נוצרו ב-Hugging Face באותה דקה ממש ב-2 בספטמבר; שורת החדשות ב-GitHub, המכריזה על "מודל ASR סטרימינג מאוחד שמתמלל ברציפות מי אמר מה בזמן שהדיבור מגיע", מתוארכת ל-3 בספטמבר ומציינת את ה-7B בשמו, ומותירה את ה-1.5B הנסקר כאן כגרסת האחות הקטנה יותר ששוחררה בשקט לצדו.

החלק המעניין הוא ששתי קבוצות בחרו במילה "סטרימינג" ובנו דברים הפוכים. Granite Speech 5.0 470M TurboCTC הוא מקודד קונפורמר שאומן עם CTC ומפוענח במעבר יחיד לא-אוטורגרסיבי — אין מפענח שמייצר טקסט טוקן אחרי טוקן, ולכן המודל זול ומהיר בזכות המבנה שלו. VibeVoice-ASR-Streaming-1.5B הוא LLM לדיבור: שני טוקנייזרים קונבולוציוניים הופכים שמע של 24 קילוהרץ לזרם טוקני דיבור בקצב ~7.5 הרץ, מפענח ממשפחת Qwen2 (28 שכבות, 1,536 יחידות חבויות — דגם בדרגת ה-1.5B) קורא אותו, וראש דיפוזיה מפיק את התמליל במקטעים של כ-2.9 שניות, עם כחצי שנייה של הסתכלות קדימה. האחד הוא מכונית מירוץ; השני הוא מודל שפה קטן שבמקרה גם יודע להקשיב.

בדיקת המפרט

• פרמטרים — Granite Speech 5.0 470M TurboCTC: 470M, מקודד בלבד, לעומת VibeVoice-ASR-Streaming-1.5B: ~3B בסך הכול (שלד מודל שפה בדרגת 1.5B, בתוספת טוקניזרים וראש דיפוזיה).

ארכיטקטורה — מקודד קונפורמר עם קשב-עצמי בלוקי והתנייה עצמית, מאומן ב‑CTC, פענוח חמדן שאינו אוטוריגרסיבי, לעומת טוקנייזרים אקוסטיים/סמנטיים כפולים המזינים מפענח סיבתי ממשפחת Qwen2 עם ראש דיפוזיה DDPM.

קצב פלט — ~12.5 פריימי פלט בשנייה, הזרמה במקטעים, לעומת ~7.5 הרץ של טוקני דיבור, פליטת טקסט למקטע של ~2.9 שניות עם הסתכלות קדימה של ~0.5 שניות.

• שפות — אנגלית בלבד לעומת עשר: סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית.

• משקלים — בערך 0.5B פרמטרים / שבריר של GB, ברמת קצה לעומת ~5.6 GB bf16, ברמת NVIDIA-GPU.

• דיוק בדפוס — IBM דיווחה על WER ממוצע של ~5.00% במערכי ה-Open ASR הקצרים, לעומת נתון WER שלא פורסם בטקסט.

• רישיון — Apache-2.0 לעומת MIT.

• שוחרר — 25 באוגוסט 2026 לעומת 2 בספטמבר 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

מהירות: האחד בנוי כדי להיות קטן, והשני כדי להיות מודל שפה.

הפער הארכיטקטוני ניכר קודם כל במהירות ובחומרה. Granite Speech 5.0 470M TurboCTC מכוון למחשבים ניידים, סמארטפונים והתקני קצה אחרים. כיוון שמקודד CTC טהור אינו דוגם דבר — הפלט הוא מעבר חמדן יחיד על ראש BPE בן 16,384 יחידות — ההרצה זולה במיוחד, וכרטיס המודל של IBM מדווח על מדד תפוקת Open ASR שנמדד על H200 בודד ונע בעשרות אלפי RTFx עבור קו TurboCTC, לצד הדגמת WebGPU שמתמללת בשידור חי בכרטיסיית דפדפן. הנתונים האלה נמדדו על ידי IBM ולא שוחזרו, אבל הנקודה המבנית עומדת בזכות עצמה: מקודד של 470M ללא מפענח אוטורגרסיבי הוא מודל שאפשר להריץ על חומרה שטלפון מגיע איתה.

המודל VibeVoice-ASR-Streaming-1.5B נוקט בפשרה ההפוכה. המפענח שלו הוא מודל שפה סיבתי, כלומר הטקסט נוצר בלולאה כבדה יותר מחישוב argmax של CTC, והדרכים המתועדות להרצתו הן אירוח עצמי על GPUs של NVIDIA — הדוגמאות בפייתון שבמאגר microsoft/VibeVoice או תוסף ה-vLLM שלו — עם כ־5.6 ג'יגה־בייט של משקלי bf16, עוד לפני כל מטמון KV. מיקרוסופט לא פרסמה שום טענה על תפוקה או על מקדם זמן־אמת, ולכן אין מספר ספק שאפשר להעמיד מול זה של IBM. מה שארכיטקטורת ה‑LLM קונה במקום זה הוא הקשר: המודל נושא הבנה של דוברים ותוכן לאורך התמליל, כפי שמודל שפה עושה, וזה ההבדל בין תמלול קול לבין מעקב אחר שיחה.

דיוק: ספק אחד הדפיס מספרים, והשני הדפיס תמונה

על סמך הראיות, Granite Speech 5.0 470M TurboCTC מקדים את VibeVoice-ASR-Streaming-1.5B בפער של מדד שלם ובר-פרסום. IBM הריצה את המודל שלה דרך סביבת ה-harness הרשמית של לוח התוצאות Open ASR ביום ההשקה, ומדווחת על שיעור שגיאות מילים ממוצע של כ-5.00% על ערכות הקצר הציבוריות באנגלית — נתון שנמדד על ידי הספק, לא אומת על ידי צד שלישי, ונעדר לחלוטין מהצד של מייקרוסופט בהשוואה זו. כרטיס המודל של VibeVoice-ASR-Streaming-1.5B כולל איור תוצאות הערכה כתמונה, אך ללא WER מספרי, RTF, או השהיה בטקסט; העוגן המספרי היחיד במשפחת VibeVoice הוא דיווח הספק בכרטיס ה-batch VibeVoice-ASR על ממוצע WER של 7.77% בשמונה ערכות בדיקה באנגלית, שמתאר את המודל שאינו סטרימינג ואינו ניתן להעברה. לא משנה לאן יובילו הריצות העצמאיות בסופו של דבר, הסיכום הכנה היום הוא ש-IBM פרסמה מספר ומייקרוסופט פרסמה תמונה.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

שפות ופלט: אנגלית בלבד לעומת מי-אמר-מה בעשר

Granite Speech 5.0 470M TurboCTC הוא מודל לאנגלית בלבד ומחזיר טקסט מתומלל גולמי. אין בכך חיסרון עבור עומסי העבודה ש־IBM מכוונת אליהם — תמלול אנגלי ארגוני על חומרת קצה — אבל זה שם קץ להשוואה ברגע שהשמע שלך אינו באנגלית. VibeVoice-ASR-Streaming-1.5B מפרט עשר שפות וטוען לפלט בזרימה עם ייחוס דובר: כרטיס המודל אומר שהוא "מתמלל באופן רציף מי אמר מה בזמן שהדיבור מגיע," עם מילות מפתח למונחי תחום המועברות כהנחיית קונטקסט. שתי התוספות הללו ראויות לקריאה סקפטית — דיאריזציה בזרימה על פני גבולות מקטעים היא באמת קשה, והטענה אינה מאומתת — אבל הן הסיבה שצוות עם פגישות רב־לשוניות בזמן אמת בכלל יבחן את המודל של מיקרוסופט.

רישוי ואקוסיסטם: Apache-2.0 לעומת MIT, Transformers לעומת מאגר מחקרי

שני הרישיונות מתירים שימוש מסחרי, {{1}}מה שכבר מבדיל בין הצמד הזה לבין גרסת ה--NC של IBM לאותה ארכיטקטורה.{{/1}} Granite Speech 5.0 470M TurboCTC מופץ תחת Apache-2.0 עם מענק הפטנטים הרגיל, והוא מובנה ב-Hugging Face Transformers (AutoModelForCTC מתוך transformers >= 5.16) ובנוסף ב-mlx-audio עבור Apple Silicon — כלומר הוא רץ בכל מקום שבו רצה קהילת הפריסה הגדולה ביותר באקוסיסטם, על חומרה של כל ספק. VibeVoice-ASR-Streaming-1.5B מופץ תחת MIT, {{2}}וזה פשוט עוד יותר{{/2}}, אבל מסלול ההגשה שלו הוא תצורת מחקר מקוד-מקור: מחלקת הארכיטקטורה של ה-checkpoint, VibeVoiceForASRStreamingTraining, אינה מופיעה בתיעוד הציבורי של Transformers, והתיעוד של Microsoft עצמה לסטרימינג מפנה לקוד ההדגמה של הריפו ולתוסף vLLM במקום לטעינת ספרייה רגילה. {{3}}עבור צוות ייצור, ההבדל הוא ממשי: דגם אחד נכנס היום ישירות לתוך צינור Transformers קיים, ואילו השני דורש ממך להקים ריפו מחקרי ולוודא את נתיב הטעינה בעצמך.{{/3}}

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

איזו מהדורה שקטה כדאי לך להעריך?

הערך את Granite Speech 5.0 470M TurboCTC קודם כל אם עומס העבודה שלך הוא באנגלית, החומרה שלך היא ברמת edge או מוגבלת CPU, ואתה רוצה מודל שנכנס ישירות ל-Transformers עם מספר על הכרטיס כדי לאמת מולו תקינות. זהו ההימור בעל הסיכון הנמוך יותר בכל ממד פרט לאחד — הוא לא יעזור לך עם שפה שנייה או עם תמלול פגישה חיה שצריך לדעת מי מדבר.

הערך את VibeVoice-ASR-Streaming-1.5B אם אתה צריך הזרמה רב-לשונית, אם פלט של "מי אמר מה" או הוטוורדס הם תכונות שברצונך לבדוק, או אם אתה מעדיף להמר על גישת מודל שפה לדיבור על פני מקודד טהור. תכנן תקציב ל-GPU של NVIDIA, להתקנה מקוד מקור, לכ-5.6 GB של משקלים, ולהערכה שתעצב בעצמך — כי איש לא פרסם עדיין מספר שאפשר לסמוך עליו, כולל מיקרוסופט.

מה שאף אחד מהשחרורים השקטים לא משנה הוא הערך שבשמירה על שכבת ה-ASR כניתנת להחלפה, בזמן שאתה מגלה איזה הימור משתלם. שני המודלים צעירים, ואף אחד מהם לא מוגש דרך OrcaRouter נכון לכתיבת שורות אלה; כשספק יארח אחד מהם, הדרך נטולת הסיכון לבחון אותו היא מאחורי שכבת ניתוב שמעמידה 200+ מודלים במחיר המחירון של הספק — 0% תוספת, כך ששינויי מחיר נכנסים לתוקף באותו היום — עם מעבר אוטומטי לכל מה שאתה כבר בוטח בו. נתב נתח של אודיו אמיתי למודל החדש, קרא את התמלילים, ותן לתעבורה שלך, לא לדף מדדי שחרור-יום, להכריע איזה הימור שקט היה הנכון.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube