
VibeVoice-ASR-Streaming-7B לעומת Muse Voice Transcribe: שני מתמודדי סטרימינג, בהפרש של יום אחד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
בתוך כ-36 שעות בתחילת ספטמבר 2026, שתי מעבדות גדולות שחררו מודלי דיבור-לטקסט בסטרימינג עם אותה הבטחת כותרת — תמלול חי שאומר לך גם מי אמר מה, בזמן שהמילים נאמרות. ב-1 בספטמבר השיקה Meta Superintelligence Labs את Muse Voice Transcribe כ-API מתארח במחיר של $3.00 ל-1,000 דקות שמע, כ-$0.18 לשעה, עם זיהוי סטרימינג, הפרדת דוברים ל-20+ וזיהוי סיום דיבור (endpointing) — הכול במעבר אחד. ב-2 בספטמבר העלתה Microsoft Research את VibeVoice-ASR-Streaming-7B ל-Hugging Face: משקלים פתוחים ברישיון MIT, ללא הודעה רשמית, כרטיס מודל שטוען לתמלול סטרימינג עם ייחוס דוברים, hotwords ועשר שפות — וללא שירות מתארח בשום מקום. אותה הצעה, מודלים עסקיים הפוכים, וראיות משני הצדדים דלילות יותר ממה שכל אחת מהמעבדות הייתה רוצה שתשימו לב אליהן.
דף זה כתוב בסגנון "מה שידוע לנו עד כה", מכיוון שלאף אחד מהמודלים אין מספר דיוק שאומת באופן בלתי תלוי. הנתונים של Muse Voice Transcribe הם הצהרות ההשקה של Meta, המדווחים על ידי הספק וללא שכפול חיצוני; VibeVoice-ASR-Streaming-7B לא פרסם שום נתון דיוק סטרימינג בטקסט כלל. ההשוואה שלהלן נשענת אפוא על מה שהוא מבני וידוע — ארכיטקטורה, מחיר, רישיון, התנהגות מתועדת — ומסמנת את מעט נתוני הספק היכן שהם מופיעים.
שני מתחרים לצינור האצווה, בהפרש של יום אחד
שני המודלים הם מתקפות על אותה הנחה: שתמלול דיבור הוא משהו שמריצים על הקלטה שהסתיימה. Muse Voice Transcribe הוא המוצר הראשון שמטה מכנה "מודל תפיסת אודיו בזמן אמת" — מעבר סטרימינג אחד שמבצע זיהוי, הפרדת דוברים על פני יותר מעשרים קולות, וזיהוי נקודת סיום, כלומר ההחלטה מתי דובר סיים בפועל ולא רק עצר לרגע. הוא מושק בשלוש פלטפורמות בבת אחת: Meta Model API במחיר של $0.18 לשעת אודיו, Meta AI ל-Mac שבו לחיצה על מקש Fn מתכתבת לתוך כל יישום, ו-Muse Code. VibeVoice-ASR-Streaming-7B של מיקרוסופט הוא החבר הסטרימינגי של משפחת VibeVoice הפתוחה, ומסלול השחרור שלו שקט בהרבה: מאגר Hugging Face שנוצר ב-2 בספטמבר (חותמות הזמן מראות 15:46 UTC, ועריכה אחרונה שלוש דקות לאחר מכן), שמונה רסיסי safetensors תחת רישיון MIT, ושורת יומן חדשות מה-3 בספטמבר במאגר microsoft/VibeVoice ב-GitHub שמכנה אותו "מודל ASR סטרימינג מאוחד שמתמלל ברציפות מי אמר מה כשהדיבור מגיע, עם תמיכה במילות חיפוש מותאמות אישית וב-10 שפות." יום לאחר ההעלאה הוא עדיין הראה אפס הורדות.

התנגשות התכונה
• מנגנון סטרימינג — Muse Voice Transcribe צורך אודיו בנתחים של 80 מילישניות ומתחייב למילים כשהן מתייצבות, לעומת VibeVoice-ASR-Streaming-7B שמעבד נתחים של כ-2.9 שניות עם כ-0.5 שניות של הסתכלות קדימה, ופולט טקסט פעם אחת לכל נתח שנפתר.
• ייחוס דובר — 20+ דוברים במעבר אחד, שגיאת דיאריזציה ממוצעת של 17.5% לפי דיווח הספק לעומת פלט זורם של "מי אמר מה" שנטען בכרטיס המודל, לא מאומת.
• זיהוי סיום אמירה — מובנה: הזרם נושא גבול של אמירה שהסתיימה, בניגוד לכך שאינו מתועד כאות פלט.
• בקרות הקשר — הטיית שפה, מילת מפתח והקשר לעומת מילות חימום מותאמות אישית באמצעות פרומפט הקשר (--context_info).
• שפות — מאומן על 70+, 25 אומתו בהרחבה בהשקה, יכולת מובנית להחלפת קוד לעומת 10 שהוכרזו (en, zh, es, pt, de, ja, ko, fr, ru, it).
• ראיות — טענות ספק ביום ההשקה: 3.1% WER על תוצאות סופיות ב-0.16 שניות לאחר הדיבור, 3.6% על החלקיים הראשונים, בציטוט לוח המובילים של Artificial Analysis לסטרימינג, לעומת נתון WER או השהיה לסטרימינג שלא פורסם כטקסט.
• עלות ורישיון — $0.18 לשעת אודיו, שירות מתארח, משקלים סגורים, לעומת $0 עבור המשקלים (MIT), כ-18 GB של bf16, אירוח עצמי.

שני רעיונות שונים מאוד של "סטרימינג"
המילה סטרימינג מכסה מגוון רחב של קצבים, והפער בין שני אלה רחב מספיק כדי לשנות את מה שאפשר לבנות על כל אחד מהם. Muse Voice Transcribe מזרים ברמת מילה. הארכיטקטורה של Meta צורכת אודיו בנתחים של 80 מילישניות ומשתמשת במה שהיא מכנה "adaptive delay" — מדיניות עיכוב הנלמדת באמצעות למידת חיזוק, שמאשרת כל מילה ברגע שהמודל בטוח בה, ומחזיקה יותר הקשר למילים שהוא פחות בטוח לגביהן במקום להחיל תקציב זמן השהיה קבוע אחד. היצרן טוען שתמלילים סופיים מתקבלים 0.16 שניות אחרי שהדובר מפסיק לדבר, ותוצאות חלקיות ראשונות תוך 0.13 שניות. הקצב הזה בנוי ללולאות אינטראקטיביות: כתוביות חיות, הקלדה קולית, סוכן קולי שצריך להגיב לאמירה שהסתיימה כמעט מיידית.
VibeVoice-ASR-Streaming-7B מבצע סטרימינג בקצב גס יותר. תצורת הפרה-מעבד שלו מראה שאודיו מגיע ב-24 קילו-הרץ, נדחס פי 3,200 לטוקנים בקצב של כ-7.5 פריימים בשנייה, ואז מעובד במנות של 22 פריימים עם הסתכלות קדימה של 4 פריימים — בערך 2.9 שניות אודיו למנה, וכחצי שנייה של הסתכלות קדימה, נתונים שנגזרים מהתצורה ולא מלטנסיות נמדדת. טקסט נפלט בכל פעם שמנה נפתרת, עם הקשר ממנות קודמות שנשמר דרך מטמון ה־KV, כך שהפעלה ארוכה לא מחשבת מחדש מאפס. תמליל שגדל במרווחים של כשלוש שניות מתאים לפרוטוקולי פגישות ולאנליטיקת שיחות; זה מוצר שונה מזרימת מילים תוך פחות משנייה לשיחה חיה. אף מעבדה לא פרסמה מדידת השהייה מקצה לקצה עבור ה־checkpoint הסטרימינגי, לכן התייחסו לקצב הזה כאל העיצוב, ולתחושה בעולם האמיתי כאל דבר שלא נבחן.
תוויות דובר וזיהוי סוף דיבור: מובנה באחד, מובטח באחר
ייחוס דובר הוא התחום שבו מוצרי סטרימינג לרוב מפריזים בהצהרותיהם, ושני אלה אכן טוענים זאת. הגרסה של Muse Voice Transcribe היא קונקרטית ומבנית: הדיאריזציה רצה בתוך אותו מעבר סטרימינג כמו הזיהוי, כך שהקלטה של שיחה עם עשרים משתתפים יכולה לשאת תוויות לפי דובר ללא צעד נפרד של "העלאה, המתנה, קבלת הדוברים בחזרה", ו-Meta מדווחת על שיעור שגיאת דיאריזציה ממוצע של 17.5% — מספר מספק, שלא שוחזר, אבל מספר המחובר למנגנון אמיתי. היא גם פולטת גבולות קצה, היכולת השקוטה יותר: יישום מקבל אות נקי ש"תורו של הדובר הזה הסתיים" בלי לבנות גלאי פעילות קולית, וזו הסיבה שעוזרים קוליים הבנויים על ASR גולמי כל כך הרבה פעמים קוטעים אנשים.
VibeVoice-ASR-Streaming-7B טוען בכרטיס המודל שלו לפלט סטרימינג של "מי אמר מה", בהתאמה לפלט המובנה של Who/When/What בגרסת ה-batch של VibeVoice-ASR — אלא שבמקרה של checkpoint הסטרימינג, הטענה אינה מאומתת, אף בדיקה עצמאית לא שחזרה אותה, ואין אות סיום (endpointing) מתועד מסוג זה ש-Muse מספקת. אם עומס העבודה שלכם הוא באמת אודיו חי עם דוברים מרובים, Muse מציעה היום מנגנון שלם יותר; אם אתם בודקים האם מודל במשקלים פתוחים יכול לבצע את אותה משימה על חומרה שבשליטתכם, הטענה של VibeVoice היא בדיוק מסוג הדברים שכדאי לבדוק עם הקלטות הפגישות שלכם לפני שמאמינים לה.
הראיות: טענות מיום ההשקה מול כרטיס ריק
כדאי להיות מדויקים לגבי מה שיש לכל צד, כי לאף אחד מהם אין את מה שקונה באמת רוצה. ל-Muse Voice Transcribe יש מערך צפוף של נתוני ספקים — 3.1% שיעור שגיאות מילים בתמלילים סופיים, 3.6% בחלקיים ראשונים, 0.16 שניות חביון סופי, 17.5% שגיאת דיאריזציה ממוצעת — כולם פורסמו על ידי Meta ביום ההשקה ומכוונים ללוח המובילים של הזרמת דיבור לטקסט של Artificial Analysis, שבו Meta טוענת למקום הראשון. אלה טענות, שלא שוחזרו על ידי אף אחד מחוץ למעבדה, אבל הן ספציפיות מספיק כדי להפריך, וזה סוג של התקדמות.
אין ל-VibeVoice-ASR-Streaming-7B שום דבר מזה. כרטיס המודל שלו כולל איור הערכה כתמונה, והדוח הטכני לסטרימינג הוא קובץ PDF, אבל אין בפרוזה נתון WER או חביון בסטרימינג שאפשר לצטט. עוגן המספרים היחיד במשפחת VibeVoice הוא הטבלה המדווחת על ידי הספק של כרטיס ה-VibeVoice-ASR האצוותי — 7.77% WER ממוצע על פני שמונה ערכות מבחן באנגלית, 2.20% על LibriSpeech clean — שאינו המספר של נקודת ביקורת זו במפורש. כאשר טענת יום השקה פוגשת כרטיס ריק, שובר השוויון הכנה הוא הכל מלבד נתון ה-WER הראשי: מחיר, רישיון, קצב סטרימינג, והתכונות שכל צד מתעד בפועל.
שפות: 25 אומתו מול 10 שהוכרזו
כיסוי השפות מבדיל בין השניים יותר מטענות הדיוק שבכותרת. Muse Voice Transcribe אומנה על 70+ שפות, אבל Meta מאמתת 25 בהשקה – והרשימה המאומתת, לא רשימת האימון, היא כיסוי הייצור, כשהמבדיל הוא החלפת שפות מובנית: היא מתוכננת לעבור בין שפות באמצע משפט בלי שאומרים לה. VibeVoice-ASR-Streaming-7B מצהיר על 10 שפות בכרטיס המודל שלו – אנגלית, סינית, ספרדית, פורטוגזית, גרמנית, יפנית, קוריאנית, צרפתית, רוסית, איטלקית – לעומת 50+ של VibeVoice-ASR (גרסת ה-batch). אם התעבורה שלך כוללת שיחות עם החלפת שפות, ל-Muse יש את הטיעון הספציפי יותר; אם היא נמצאת בתוך עשר השפות הללו, הכיסוי של המודל של מיקרוסופט לפחות מפורש – וזה יותר ממה שרוב חומרי ההשקה מציעים.
עלות ומה שנשאר לך
ההבדל במודל העסקי הוא הדרך הנקייה ביותר להחליט. Muse Voice Transcribe במחיר של 0.18$ לשעת אודיו נמוך יותר ממחירי המחירון של כל ממשקי התמלול הסטרימינג המרכזיים — בלי GPU, בלי תפעול, משקולות סגורות, והמחיר נקבע על ידי Meta. VibeVoice-ASR-Streaming-7B עולה אפס להורדה, אבל דורש כ-18 גיגה-בייט של משקולות bf16 לפני מטמון KV כדי לארח עצמית על GPU ברמה של 24 גיגה-בייט, כשנתיבי ההגשה המתועדים הם סקריפטי ההדגמה של microsoft/VibeVoice או תוסף ה-vLLM, ואין עדיין ספק הסקה שמארח אותו. רישיון MIT הוא הנכס בר-הקיימא: המשקולות הן שלך לשמור ולכוונן בדרך ששום מינוי API אינו מאפשר. שם גם תמונת התמחור עלולה להיות מעניינת — ברגע שספק כן יארח את נקודת הביקורת הפתוחה, שאלת ה-0.18$ לשעה הופכת למחיר שוק במקום למחיר מחירון של ספק יחיד, וזה בדיוק המצב שבו ראוטר מעבר מצדיק את קיומו. OrcaRouter אינו מנתב דיבור לטקסט כיום, ואף אחד משני המודלים האלה לא נמצא בקטלוג שלו; מה שהוא כן עושה הוא להעביר את מחירי המחירון של הספקים הלאה בתוספת 0% עבור יותר מ-200 מודלי שפה שצורכים תמלול חי, כך שהורדת מחיר של ספק בכל מקום בערימה הזו משתקפת בצד הקונה באותו היום שבו היא מוכרזת.

שאלות נפוצות
האם Muse Voice Transcribe, בעל WER של 3.1%, מדויק יותר מ-VibeVoice-ASR-Streaming-7B?
לא, וההשוואה עדיין אינה משמעותית. ה-3.1% של Meta היא טענת יום השקה למסלול הסטרימינג, שדווחה על ידי הספק ולא שוחזרה. VibeVoice-ASR-Streaming-7B לא פרסמה שום נתון דיוק סטרימינג בטקסט כלל. עד ששני המודלים יורצו דרך אותה מסגרת בדיקה ציבורית על אותו אודיו, ההצהרה הכנה היחידה היא שלמוז (Muse) יש טענה ספציפית שניתן לבדוק, ול-VibeVoice אין עדיין טענה כזו.
האם אני יכול להשתמש באחד מהמודלים על אודיו שכבר הוקלט?
כן לשתיהן, אך בצורות שונות. Muse Voice Transcribe מטפל בהקלטות באורך של יותר משעה דרך אותו API של סטרימינג. תוסף ה‑vLLM של VibeVoice-ASR-Streaming-7B חושף נקודת קצה לתמלול קובץ מלא לצד נקודת קצה הזרמת ה‑WebSocket שלו. אבל שתיהן מתוכננות ומתומחרות עבור מקרה השימוש החי — Muse לפי המודל העסקי של סטרימינג בלבד, ו‑VibeVoice לפי הארכיטקטורה המבוססת על מקטעים, הפולטת תוצאות ככל שהאודיו מגיע — ולכן אם עומס העבודה שלך הוא קבצי אצווה בלבד, API ייעודי לתמלול קבצים יהיה בדרך כלל זול יותר ובעל מדדים טובים יותר מכל אחת מהן.
