
VibeVoice-ASR-Streaming-1.5B, מוסבר: ה-ASR הסטרימינג של מיקרוסופט הגיע ללא השקה
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0259אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0258אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0166אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
ב-2 בספטמבר 2026, Microsoft Research העלתה שני checkpoints חדשים להמרת דיבור לטקסט ל-Hugging Face, ללא הודעה לעיתונות, ללא פוסט בבלוג וללא חגיגות: microsoft/VibeVoice-ASR-Streaming-1.5B ואחיו הגדול יותר microsoft/VibeVoice-ASR-Streaming-7B. ההכרזה היחידה עד כה היא רשומת חדשות מ-3 בספטמבר 2026 במדור החדשות של מאגר GitHub של פרויקט הקוד הפתוח VibeVoice של Microsoft, המתארת את השחרור כמודל ASR סטרימינג אחיד שמתמלל מי אמר מה בזמן שהשמע עדיין מגיע, עם מילות מפתח מותאמות אישית ועשר שפות. שני ה-checkpoints הם תחת רישיון MIT, שניהם נוצרו בהפרש של כחמש דקות זה מזה בחשבון Hugging Face הרשמי של Microsoft, ושניהם הראו אפס הורדות כשבדקנו כעבור יום. לא מצאנו שום סיקור של צד שלישי לאף אחד מהם.
זה הופך את זה לכתבה יוצאת דופן: שחרור אמיתי וניתן לתיארוך — משקלים ב־Hugging Face מתוארכים ל־2 בספטמבר, והודעה בתוך המאגר מתוארכת ל־3 בספטמבר — שהעולם הרחב עוד לא התעדכן בו. כל מה שאפשר לדעת בהמשך מגיע מקריאת המאגר: קבצי הקונפיגורציה, כרטיס המודל ומסמכי הסטרימינג של מיקרוסופט עצמה. כל מה שעדיין לא אושר — דיוק, השהיה אמיתית, והאם ייחוס הדובר בסטרימינג אכן שורד שיחת שני דוברים אמיתית — מסומן ככזה. אין מדד שאפשר לצטט, שכן מיקרוסופט עדיין לא פרסמה אחד בצורת טקסט.
ההודעה היחידה היא שורת חדשות.
VibeVoice היא משפחה של מודלי דיבור בקוד פתוח ברישיון MIT מבית Microsoft Research. המודל הידוע ביותר שלה בסדרת ה-ASR, microsoft/VibeVoice-ASR, שוחרר ב-21 בינואר 2026: מודל אצווה הקולט עד שישים דקות של אודיו במעבר אחד ומחזיר תמלילים מובנים עם דובר, תזמון ותוכן — בעקבותיו נרשמו כ-700,000 הורדות ב-Hugging Face. ב-2 בספטמבר פרסם אותו ארגון את מודלי הסטרימינג האחים, microsoft/VibeVoice-ASR-Streaming-7B ו-microsoft/VibeVoice-ASR-Streaming-1.5B; ה-API של Hugging Face נותן ל-7B חותמת זמן של 2026-09-02T15:46 UTC, ול-1.5B חותמת זמן של 15:51 UTC, חמש דקות מאוחר יותר. טבלת המודלים במאגר GitHub מציגה כעת את VibeVoice-ASR-Streaming כערך עצמאי, ומדור החדשות שלו כולל עדכון מ-3 בספטמבר המודיע על כך.
מה שבאמת חדש לעומת דגם ינואר הוא מודל האינטראקציה: נקודות הביקורת בסטרימינג מתמללות עם הגעת השמע במקום לחכות לקובץ מלא. כל השאר — הארכיטקטורה הבסיסית של אסימוני הדיבור, הפלט המיוחס לדובר, מנגנון מילת ההפעלה — הוא המשך של תכנון האצווה, שהוגדל וכיוון מחדש לשימוש בזמן אמת. שימו לב להבדל השפות כבר בפתיחה: דגם האצווה מפרסם 50+ שפות, בעוד כרטיס הסטרימינג מונה עשר.

מה המשמעות של "streaming" בנקודת ביקורת זו?
המסמך של Microsoft על הזרמה מתאר את הכוונה בבירור: המודל מתמלל בזמן שהשמע עדיין מגיע, ופולט טקסט פעם אחת לכל נתח שמע, כך שתמליל מופיע בזמן שהדובר מדבר. קובץ preprocessor_config.json של ה-repo בגודל 1.5B הופך את הקצב לקונקרטי:
• קצב דגימה וקצב אסימונים — קלט שמע ב-24 קילו-הרץ, דחוס פי 3,200, מה שמניב בערך זרם של 7.5 הרץ של אסימוני דיבור (בערך אסימון אחד כל 133 אלפיות השנייה).
• מקטע — 22 פריימים, שבקצב 7.5 הרץ הוא בערך 2.9 שניות אודיו לכל מקטע נפלט.
• Lookahead — 4 פריימים, כ-0.5 שניות של אודיו עתידי לחיזוק הקטע הנוכחי.
(החשבון פשוט מהמאגר: 22 × 3,200 = 70,400 דגימות ≈ 2.93 שניות ב-24kHz; 4 × 3,200 = 12,800 דגימות ≈ 0.53 שניות. התיעוד של Microsoft עצמו מציין ש-checkpoint תמיד רץ על ה-chunk שבו אומן, ולכן אלה אינם נתונים לכיוונון בזמן ההסקה.)
זה משייך אותו למשפחת הסטרימינג המבוסס על מקטעים, ולא לזו שפועלת מילה במילה: תמליל חי גדל בתוספות של כשלוש שניות, עם כחצי שנייה של הסתכלות קדימה, ולא בתוצאות חלקיות לפי טוקן. זהו עיצוב לגיטימי ונפוץ לתמלול פגישות ושיחות, אבל פרופיל ההשהיה שלו שונה ממערכות שמפיקות תוצאות חלקיות בפחות משנייה — לכן התייחסו ל״סטרימינג״ כאל ספקטרום, ומדדו אותו מול תקציב ההשהיה שלכם לפני שתבנו עליו מוצר כתוביות חיות.
מתחת למכסה המנוע: LLM דיבור בקנה מידה של Qwen
קריאת ה-config.json של ה-checkpoint של 1.5B נותנת את המתכון המוכר כעת של VibeVoice בקנה מידה קטן יותר:
• המפענח הוא מודל שפה ממשפחת Qwen2, שממדיו תואמים בדיוק למחלקת Qwen2.5 בגודל 1.5B — 28 שכבות, 1,536 יחידות חבויות, 12 ראשי קשב עם 2 ראשי מפתח-ערך, וחלון של 65,536 טוקנים. ה-LLM הוא מה שמאפשר למודל לשאת את הבנת הדובר והתוכן לאורך התמליל.
טוקניזרים אקוסטיים וסמנטיים — מקודדים קונבולוציוניים עמוקים עם סטריידינג של 8/5/5/4/2/2 — הופכים שמע של 24 קילו-הרץ לזרם של טוקני דיבור בתדירות של כ-7.5 הרץ שהמפענח קורא.
• ראש דיפוזיה (DDPM, 20 שלבי דנויזינג, v-prediction) ממוקם בצד הייצור, בהתאם לשאר קו VibeVoice.
• כנות בנוגע לגודל: המטא-דאטה של safetensors של נקודת הביקורת עצמה מונה כ-3 מיליארד פרמטרים, בערך 5.6 ג'יגה-בייט של משקולות. ה-"1.5B" בשם הוא קנה המידה של עמוד השדרה הלשוני — הקריאה הטבעית של קונפיגורציה שהמפענח שלה הוא מודל Qwen מסוג 1.5B — עם טוקנייזר האודיו וראש הדיפוזיה שמוסיפים את שאר החלק. מחרוזת הארכיטקטורה בקונפיגורציה, VibeVoiceForASRStreamingTraining, מסמנת שזו נקודת ביקורת ממשפחת המחקר.

מי אמר מה, בעשר שפות
יכולת הדגל של כרטיס המודל היא תמלול חי עם ייחוס דובר: הוא "מתמלל ברציפות מי אמר מה כאשר הדיבור מגיע", לפי הנקודה של הכרטיס עצמו. הוא גם מפרסם מילות חימום מותאמות אישית למונחי תחום, ומפרט עשר שפות נתמכות — סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית.

Hotwords מיושמות באמצעות אותו מנגנון הטיית הקשר (context biasing) שבו משתמש מודל ה-batch. בהדגמת שורת הפקודה של Microsoft, מעבירים אותן כמידע הקשר — למשל --context_info "Microsoft,VibeVoice" — כדי להטות את הזיהוי לכיוון שמות ומונחים טכניים ללא כוונון עדין. הכרטיס אינו אומר דבר על זיהוי שפה אוטומטי או על מעבר בין שפות (code-switching) עבור מודל הסטרימינג, וזהו פער נוסף לעומת ההצהרות של מודל ה-batch.
אזהרה אחת ראויה להדגשה. דף תיעוד הסטרימינג מתמקד בפליטת נתחים וב-hotwords; הוא אינו מפרט כיצד נשמר ייחוס הדוברים במעבר בין נתחים. דיאריזציה בסטרימינג היא קשה באמת — דוברים חופפים, וגבול נתח הוא בדיוק הנקודה שבה הייחוס נוטה לסטות. המסגור "מי אמר מה" על הכרטיס הוא טענה של ספק, עד שמישהו יריץ דרכו שיחת לייב אמיתית עם שני דוברים ויבדוק.
היכן הוא ממוקם: משפחת VibeVoice ותחום ה-ASR הסטרימינג של 2026.
בתוך המשפחה, המהדורה משתלבת באופן הבא:
• microsoft/VibeVoice-ASR (21 בינואר 2026) — ספינת הדגל לעיבוד באצווה: עד 60 דקות במעבר אחד, למעלה מ-50 שפות, פלט מי/מתי/מה, מילים חמות, כ-700K הורדות.
• microsoft/VibeVoice-ASR-Streaming-7B ו-microsoft/VibeVoice-ASR-Streaming-1.5B (2 בספטמבר 2026) — גרסאות הסטרימינג החדשות; נושא המאמר הזה הוא ה-1.5B.
• microsoft/VibeVoice-ASR-BitNet (23 ביולי 2026) — מנוע קצה מכומת ומותאם למעבד (CPU) עבור מודל האצווה.
• מודלי VibeVoice-1.5B TTS ו-VibeVoice-Realtime-0.5B streaming-TTS הם חברים נפרדים באותה משפחה, ולא חלק מקו ה-ASR.
תחום ה-ASR הרחב יותר עם משקלים פתוחים נע כל השנה לכיוון זמן אמת, כך שלערך סטרימינג חדש יש נקודות השוואה ישירות. Qwen3-ASR (Alibaba, כ-1.7B) הוא מודל אחיד לסטרימינג ולעבודה לא מקוונת, המכסה יותר מ-50 שפות וניבים. Nemotron 3.5 ASR של NVIDIA הוא מודל סטרימינג בגודל 0.6B המכסה 40 שפות, תחת רישיון OpenMDW ולא MIT. ה-Granite Speech 5.0 470M TurboCTC של IBM מופץ תחת Apache-2.0, עם נתוני תפוקה המדווחים על ידי הספק שהם גבוהים במידה יוצאת דופן. לעומתם, מודל הסטרימינג של Microsoft מובחן בשלושה דברים: רישוי MIT, שלדת LLM הנושאת הבנה של דובר ותוכן במקום מודל אקוסטי טהור, ומסגור של תמלול חי המיוחס לדובר. השאלות הפתוחות שלו הן הדיוק וזמן האחזור בעולם האמיתי — ולאף אחד מהם אין עדיין נתון עצמאי.
מה שטרם אומת
קריאת ה-repo מגלה לך את העיצוב; היא לא מספרת לך עד כמה הוא עובד. ובאופן ספציפי:
• אין נתוני דיוק או השהיה בטקסט. כרטיס המודל כולל איור תוצאות כתמונה, אך אין טבלת WER, RTF או השהיה מספרית בפרוזה — אין מה לצטט באופן עצמאי.
• אין הערכה של צד שלישי. ההורדות עמדו על אפס יום אחד לאחר ההעלאה; אין מדד קהילתי, אין רישום בטבלת המובילים, ואין בדיקה עצמאית שמצאנו.
מסלול ה-serving הוא מערך מחקרי המבוסס על בנייה מקוד-מקור. מסמכי הסטרימינג של Microsoft רצים מתוך שיבוט של מאגר ה-GitHub של VibeVoice בתוך קונטיינר PyTorch של NVIDIA (nvcr.io/nvidia/pytorch, עם flash-attention מומלץ). כרטיס המודל מציג גם קטע קוד של פייפליין Transformers ומפנה את פרטי ההתקנה ל-GitHub; לא בדקנו האם גרסת ה-Transformers הנוכחית ששוחררה מריצה הסקת סטרימינג על ה-checkpoint הזה ללא התאמות נוספות.
המסגרת היא מחקר-ראשון. מאגר הקוד של מיקרוסופט מתאר את מודלי VibeVoice כמיועדים למטרות מחקר ופיתוח. המשקלים משוחררים תחת רישיון MIT; העמדה היא "הנה המדע," לא "הנה מוצר נתמך." תקצו תקציב לשער הערכה משלכם.
האם כדאי לבנות על זה?
עבור צוותים שכבר מארחים ASR בעצמם, זה שווה הערכה של סוף שבוע אם האודיו שלכם נמצא בתוך קבוצת עשר השפות ואתם זקוקים ספציפית לתמלול חי עם ייחוס לדובר ממודל ברישיון MIT. תכננו תקציב של כ-5.6 ג'יגה-בייט למשקלים של דגם ה-1.5B על GPU של NVIDIA והתקנה מקוד המקור, ותכננו למדוד את הדיוק בעצמכם על האודיו שלכם לפני שתסמכו עליו.
עבור צוותים שמשחררים היום צנרת תמלול בסביבת ייצור, התשובה הנבונה היא להמתין לאחד משלושה: פרסום נתוני הדיוק והשהיה על ידי מיקרוסופט, שקיימים כרגע רק כתמונה; מדד בלתי תלוי; או נתיב הגשה מתוחזק עם סביבת ריצה נתמכת. קצב החלוקה למקטעים של כ-3 שניות הוא גם נתון מפרטי שכדאי לאמת מול דרישת ההשהיה שלך, במקום להניח זאת מהמילה "streaming".
הדרך הזולה להשאיר את האפשרות פתוחה היא לא לנעול את היישום שלך למנוע תמלול יחיד. שכבת ניתוב שמאפשרת גישה למודלים רבים דרך API אחד פירושה שכאשר VibeVoice-ASR-Streaming — או מנוע ה-ASR הפתוח הבא — מופיע אצל ספק inference, בדיקת A/B שלו מול המודל הקיים שלך על אותה תעבורה היא שינוי קונפיגורציה, לא החלפת פלטפורמה. מאחר שנתב pass-through גובה את מחיר המחירון של הספק ללא תווך, ההשוואה הזאת נשארת זולה, ו-failover אוטומטי מונע ממודל צעיר ובלתי מוכח להפוך לנקודת כשל יחידה בצנרת שלך. זו התבנית הכללית לאימוץ כל מודל בן ימים ספורים: תן לו להרוויח את מקומו על תעבורה אמיתית לפני שתסכן עליו את סביבת הייצור.
שאלות נפוצות
האם VibeVoice-ASR-Streaming-1.5B הוא מהדורה רשמית של מיקרוסופט?
כן. הצ'קפוינט נמצא בחשבון Hugging Face הרשמי של microsoft עם חותמת זמן של 2 בספטמבר 2026, ומאגר ה-GitHub של microsoft/VibeVoice מתייחס ל-VibeVoice-ASR-Streaming בטבלת המודלים שלו עם רשומת חדשות מ-3 בספטמבר 2026. מה שיוצא דופן אינו המקור אלא השקט: אין הודעה לעיתונות, אין פוסט בבלוג, ואין סיקור של צד שלישי נכון לכתיבת שורות אלה.
למה שני גדלים, 7B ו-1.5B?
מיקרוסופט העלתה את שני ה-checkpoints באותה דקה, אך לא פרסמה השוואה. לפי ה-configs, ה-1.5B הוא הקצה הקטן — שדרה לשונית של Qwen ברמת 1.5B בתוספת מחסנית האודיו, כ-3B פרמטרים וכ-5.6 GB של משקלים. הקריאה הטבעית היא 7B בעל דיוק גבוה יותר ו-1.5B זול ומהיר יותר, אך מיקרוסופט לא אמרה זאת, ואין בנצ'מרקים המאשרים את חילופי המחיר-ביצועים.
במה זה שונה מה-VibeVoice-ASR הקודם?
מודל ה-batch של ינואר קולט עד 60 דקות אודיו במעבר יחיד ומצהיר על תמיכה ב-50+ שפות. נקודות הביקורת לסטרימינג מתמללות בזמן שהאודיו מגיע, ומפיקות תמליל בקטעים של כ-3 שניות עם כ-0.5 שניות של הסתכלות קדימה, וכרטיס המודל מפרט עשר שפות. שניהם חולקים את אותה ארכיטקטורת אסימוני דיבור, את רעיון הפלט המיוחס לדובר ואת מנגנון מילות ההפעלה.
בינתיים, VibeVoice-ASR-Streaming-1.5B הוא צ׳קפוינט ועוד שורת חדשות. אם אתם מארחים בעצמכם וצריכים ASR סטרימינג ברישיון מתירני לצורך הערכה — קראו את ה־repo; אם אתם בוחרים מנוע פרודקשן — חכו למספרים. האות המעניין הוא שמיקרוסופט דוחפת את קו הקול שלה לזמן אמת בשני גדלים בבת אחת — ועשתה זאת בשקט כזה שיום אחר כך מונה ההורדות עדיין עמד על אפס.
