כרטיס כותרת ראשי המשווה בין 'VibeVoice-ASR-Streaming-7B' לבין 'Muse Voice Transcribe', עם שורת על 'Streaming ASR - ספטמבר 2026', וכותרת משנה על שני מתמודדי סטרימינג בהפרש של יום אחד - ה-API של Meta בתעריף 0.18$ לשעה וה-checkpoint של Microsoft ברישיון MIT ללא פלטפורמת אירוח, תגיות 'MIT weights - 2 בספטמבר', 'Meta API - 1 בספטמבר' ו'שניהם לא מאומתים', והערת שוליים 'אותה הבטחת כותרת'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-7B לעומת Muse Voice Transcribe: שני מתמודדי סטרימינג, בהפרש של יום אחד

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בתוך כ-36 שעות בתחילת ספטמבר 2026, שתי מעבדות גדולות שחררו מודלי דיבור-לטקסט בסטרימינג עם אותה הבטחת כותרת — תמלול חי שאומר לך גם מי אמר מה, בזמן שהמילים נאמרות. ב-1 בספטמבר השיקה Meta Superintelligence Labs את Muse Voice Transcribe כ-API מתארח במחיר של $3.00 ל-1,000 דקות שמע, כ-$0.18 לשעה, עם זיהוי סטרימינג, הפרדת דוברים ל-20+ וזיהוי סיום דיבור (endpointing) — הכול במעבר אחד. ב-2 בספטמבר העלתה Microsoft Research את VibeVoice-ASR-Streaming-7B ל-Hugging Face: משקלים פתוחים ברישיון MIT, ללא הודעה רשמית, כרטיס מודל שטוען לתמלול סטרימינג עם ייחוס דוברים, hotwords ועשר שפות — וללא שירות מתארח בשום מקום. אותה הצעה, מודלים עסקיים הפוכים, וראיות משני הצדדים דלילות יותר ממה שכל אחת מהמעבדות הייתה רוצה שתשימו לב אליהן.

דף זה כתוב בסגנון "מה שידוע לנו עד כה", מכיוון שלאף אחד מהמודלים אין מספר דיוק שאומת באופן בלתי תלוי. הנתונים של Muse Voice Transcribe הם הצהרות ההשקה של Meta, המדווחים על ידי הספק וללא שכפול חיצוני; VibeVoice-ASR-Streaming-7B לא פרסם שום נתון דיוק סטרימינג בטקסט כלל. ההשוואה שלהלן נשענת אפוא על מה שהוא מבני וידוע — ארכיטקטורה, מחיר, רישיון, התנהגות מתועדת — ומסמנת את מעט נתוני הספק היכן שהם מופיעים.

שני מתחרים לצינור האצווה, בהפרש של יום אחד

שני המודלים הם מתקפות על אותה הנחה: שתמלול דיבור הוא משהו שמריצים על הקלטה שהסתיימה. Muse Voice Transcribe הוא המוצר הראשון שמטה מכנה "מודל תפיסת אודיו בזמן אמת" — מעבר סטרימינג אחד שמבצע זיהוי, הפרדת דוברים על פני יותר מעשרים קולות, וזיהוי נקודת סיום, כלומר ההחלטה מתי דובר סיים בפועל ולא רק עצר לרגע. הוא מושק בשלוש פלטפורמות בבת אחת: Meta Model API במחיר של $0.18 לשעת אודיו, Meta AI ל-Mac שבו לחיצה על מקש Fn מתכתבת לתוך כל יישום, ו-Muse Code. VibeVoice-ASR-Streaming-7B של מיקרוסופט הוא החבר הסטרימינגי של משפחת VibeVoice הפתוחה, ומסלול השחרור שלו שקט בהרבה: מאגר Hugging Face שנוצר ב-2 בספטמבר (חותמות הזמן מראות 15:46 UTC, ועריכה אחרונה שלוש דקות לאחר מכן), שמונה רסיסי safetensors תחת רישיון MIT, ושורת יומן חדשות מה-3 בספטמבר במאגר microsoft/VibeVoice ב-GitHub שמכנה אותו "מודל ASR סטרימינג מאוחד שמתמלל ברציפות מי אמר מה כשהדיבור מגיע, עם תמיכה במילות חיפוש מותאמות אישית וב-10 שפות." יום לאחר ההעלאה הוא עדיין הראה אפס הורדות.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

התנגשות התכונה

• מנגנון סטרימינג — Muse Voice Transcribe צורך אודיו בנתחים של 80 מילישניות ומתחייב למילים כשהן מתייצבות, לעומת VibeVoice-ASR-Streaming-7B שמעבד נתחים של כ-2.9 שניות עם כ-0.5 שניות של הסתכלות קדימה, ופולט טקסט פעם אחת לכל נתח שנפתר.

• ייחוס דובר — 20+ דוברים במעבר אחד, שגיאת דיאריזציה ממוצעת של 17.5% לפי דיווח הספק לעומת פלט זורם של "מי אמר מה" שנטען בכרטיס המודל, לא מאומת.

• זיהוי סיום אמירה — מובנה: הזרם נושא גבול של אמירה שהסתיימה, בניגוד לכך שאינו מתועד כאות פלט.

• בקרות הקשר — הטיית שפה, מילת מפתח והקשר לעומת מילות חימום מותאמות אישית באמצעות פרומפט הקשר (--context_info).

• שפות — מאומן על 70+, 25 אומתו בהרחבה בהשקה, יכולת מובנית להחלפת קוד לעומת 10 שהוכרזו (en, zh, es, pt, de, ja, ko, fr, ru, it).

• ראיות — טענות ספק ביום ההשקה: 3.1% WER על תוצאות סופיות ב-0.16 שניות לאחר הדיבור, 3.6% על החלקיים הראשונים, בציטוט לוח המובילים של Artificial Analysis לסטרימינג, לעומת נתון WER או השהיה לסטרימינג שלא פורסם כטקסט.

• עלות ורישיון — $0.18 לשעת אודיו, שירות מתארח, משקלים סגורים, לעומת $0 עבור המשקלים (MIT), כ-18 GB של bf16, אירוח עצמי.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Muse Voice Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): business model - open weights MIT self-hosted; streaming cadence - ~2.9 s chunks, config-derived; speaker output - claimed who-said-what, unverified; endpointing - not documented; languages - 10 declared; price - $0 weights, ~18 GB bf16. Right column Muse Voice Transcribe (released Sep 1, 2026 - Meta Model API): hosted API closed weights; 80 ms chunks, adaptive delay, finals 0.16 s (vendor); 20+ speakers, 17.5% avg DER (vendor); built-in turn-end signal; 25 verified (70+ trained); $0.18 per audio-hour. Footer: 'Muse figures are vendor-reported launch-day claims. VibeVoice specs read from the HF repo. Neither is independently benchmarked.'

שני רעיונות שונים מאוד של "סטרימינג"

המילה סטרימינג מכסה מגוון רחב של קצבים, והפער בין שני אלה רחב מספיק כדי לשנות את מה שאפשר לבנות על כל אחד מהם. Muse Voice Transcribe מזרים ברמת מילה. הארכיטקטורה של Meta צורכת אודיו בנתחים של 80 מילישניות ומשתמשת במה שהיא מכנה "adaptive delay" — מדיניות עיכוב הנלמדת באמצעות למידת חיזוק, שמאשרת כל מילה ברגע שהמודל בטוח בה, ומחזיקה יותר הקשר למילים שהוא פחות בטוח לגביהן במקום להחיל תקציב זמן השהיה קבוע אחד. היצרן טוען שתמלילים סופיים מתקבלים 0.16 שניות אחרי שהדובר מפסיק לדבר, ותוצאות חלקיות ראשונות תוך 0.13 שניות. הקצב הזה בנוי ללולאות אינטראקטיביות: כתוביות חיות, הקלדה קולית, סוכן קולי שצריך להגיב לאמירה שהסתיימה כמעט מיידית.

VibeVoice-ASR-Streaming-7B מבצע סטרימינג בקצב גס יותר. תצורת הפרה-מעבד שלו מראה שאודיו מגיע ב-24 קילו-הרץ, נדחס פי 3,200 לטוקנים בקצב של כ-7.5 פריימים בשנייה, ואז מעובד במנות של 22 פריימים עם הסתכלות קדימה של 4 פריימים — בערך 2.9 שניות אודיו למנה, וכחצי שנייה של הסתכלות קדימה, נתונים שנגזרים מהתצורה ולא מלטנסיות נמדדת. טקסט נפלט בכל פעם שמנה נפתרת, עם הקשר ממנות קודמות שנשמר דרך מטמון ה־KV, כך שהפעלה ארוכה לא מחשבת מחדש מאפס. תמליל שגדל במרווחים של כשלוש שניות מתאים לפרוטוקולי פגישות ולאנליטיקת שיחות; זה מוצר שונה מזרימת מילים תוך פחות משנייה לשיחה חיה. אף מעבדה לא פרסמה מדידת השהייה מקצה לקצה עבור ה־checkpoint הסטרימינגי, לכן התייחסו לקצב הזה כאל העיצוב, ולתחושה בעולם האמיתי כאל דבר שלא נבחן.

תוויות דובר וזיהוי סוף דיבור: מובנה באחד, מובטח באחר

ייחוס דובר הוא התחום שבו מוצרי סטרימינג לרוב מפריזים בהצהרותיהם, ושני אלה אכן טוענים זאת. הגרסה של Muse Voice Transcribe היא קונקרטית ומבנית: הדיאריזציה רצה בתוך אותו מעבר סטרימינג כמו הזיהוי, כך שהקלטה של שיחה עם עשרים משתתפים יכולה לשאת תוויות לפי דובר ללא צעד נפרד של "העלאה, המתנה, קבלת הדוברים בחזרה", ו-Meta מדווחת על שיעור שגיאת דיאריזציה ממוצע של 17.5% — מספר מספק, שלא שוחזר, אבל מספר המחובר למנגנון אמיתי. היא גם פולטת גבולות קצה, היכולת השקוטה יותר: יישום מקבל אות נקי ש"תורו של הדובר הזה הסתיים" בלי לבנות גלאי פעילות קולית, וזו הסיבה שעוזרים קוליים הבנויים על ASR גולמי כל כך הרבה פעמים קוטעים אנשים.

VibeVoice-ASR-Streaming-7B טוען בכרטיס המודל שלו לפלט סטרימינג של "מי אמר מה", בהתאמה לפלט המובנה של Who/When/What בגרסת ה-batch של VibeVoice-ASR — אלא שבמקרה של checkpoint הסטרימינג, הטענה אינה מאומתת, אף בדיקה עצמאית לא שחזרה אותה, ואין אות סיום (endpointing) מתועד מסוג זה ש-Muse מספקת. אם עומס העבודה שלכם הוא באמת אודיו חי עם דוברים מרובים, Muse מציעה היום מנגנון שלם יותר; אם אתם בודקים האם מודל במשקלים פתוחים יכול לבצע את אותה משימה על חומרה שבשליטתכם, הטענה של VibeVoice היא בדיוק מסוג הדברים שכדאי לבדוק עם הקלטות הפגישות שלכם לפני שמאמינים לה.

הראיות: טענות מיום ההשקה מול כרטיס ריק

כדאי להיות מדויקים לגבי מה שיש לכל צד, כי לאף אחד מהם אין את מה שקונה באמת רוצה. ל-Muse Voice Transcribe יש מערך צפוף של נתוני ספקים — 3.1% שיעור שגיאות מילים בתמלילים סופיים, 3.6% בחלקיים ראשונים, 0.16 שניות חביון סופי, 17.5% שגיאת דיאריזציה ממוצעת — כולם פורסמו על ידי Meta ביום ההשקה ומכוונים ללוח המובילים של הזרמת דיבור לטקסט של Artificial Analysis, שבו Meta טוענת למקום הראשון. אלה טענות, שלא שוחזרו על ידי אף אחד מחוץ למעבדה, אבל הן ספציפיות מספיק כדי להפריך, וזה סוג של התקדמות.

אין ל-VibeVoice-ASR-Streaming-7B שום דבר מזה. כרטיס המודל שלו כולל איור הערכה כתמונה, והדוח הטכני לסטרימינג הוא קובץ PDF, אבל אין בפרוזה נתון WER או חביון בסטרימינג שאפשר לצטט. עוגן המספרים היחיד במשפחת VibeVoice הוא הטבלה המדווחת על ידי הספק של כרטיס ה-VibeVoice-ASR האצוותי — 7.77% WER ממוצע על פני שמונה ערכות מבחן באנגלית, 2.20% על LibriSpeech clean — שאינו המספר של נקודת ביקורת זו במפורש. כאשר טענת יום השקה פוגשת כרטיס ריק, שובר השוויון הכנה הוא הכל מלבד נתון ה-WER הראשי: מחיר, רישיון, קצב סטרימינג, והתכונות שכל צד מתעד בפועל.

שפות: 25 אומתו מול 10 שהוכרזו

כיסוי השפות מבדיל בין השניים יותר מטענות הדיוק שבכותרת. Muse Voice Transcribe אומנה על 70+ שפות, אבל Meta מאמתת 25 בהשקה – והרשימה המאומתת, לא רשימת האימון, היא כיסוי הייצור, כשהמבדיל הוא החלפת שפות מובנית: היא מתוכננת לעבור בין שפות באמצע משפט בלי שאומרים לה. VibeVoice-ASR-Streaming-7B מצהיר על 10 שפות בכרטיס המודל שלו – אנגלית, סינית, ספרדית, פורטוגזית, גרמנית, יפנית, קוריאנית, צרפתית, רוסית, איטלקית – לעומת 50+ של VibeVoice-ASR (גרסת ה-batch). אם התעבורה שלך כוללת שיחות עם החלפת שפות, ל-Muse יש את הטיעון הספציפי יותר; אם היא נמצאת בתוך עשר השפות הללו, הכיסוי של המודל של מיקרוסופט לפחות מפורש – וזה יותר ממה שרוב חומרי ההשקה מציעים.

עלות ומה שנשאר לך

ההבדל במודל העסקי הוא הדרך הנקייה ביותר להחליט. Muse Voice Transcribe במחיר של 0.18$ לשעת אודיו נמוך יותר ממחירי המחירון של כל ממשקי התמלול הסטרימינג המרכזיים — בלי GPU, בלי תפעול, משקולות סגורות, והמחיר נקבע על ידי Meta. VibeVoice-ASR-Streaming-7B עולה אפס להורדה, אבל דורש כ-18 גיגה-בייט של משקולות bf16 לפני מטמון KV כדי לארח עצמית על GPU ברמה של 24 גיגה-בייט, כשנתיבי ההגשה המתועדים הם סקריפטי ההדגמה של microsoft/VibeVoice או תוסף ה-vLLM, ואין עדיין ספק הסקה שמארח אותו. רישיון MIT הוא הנכס בר-הקיימא: המשקולות הן שלך לשמור ולכוונן בדרך ששום מינוי API אינו מאפשר. שם גם תמונת התמחור עלולה להיות מעניינת — ברגע שספק כן יארח את נקודת הביקורת הפתוחה, שאלת ה-0.18$ לשעה הופכת למחיר שוק במקום למחיר מחירון של ספק יחיד, וזה בדיוק המצב שבו ראוטר מעבר מצדיק את קיומו. OrcaRouter אינו מנתב דיבור לטקסט כיום, ואף אחד משני המודלים האלה לא נמצא בקטלוג שלו; מה שהוא כן עושה הוא להעביר את מחירי המחירון של הספקים הלאה בתוספת 0% עבור יותר מ-200 מודלי שפה שצורכים תמלול חי, כך שהורדת מחיר של ספק בכל מקום בערימה הזו משתקפת בצד הקונה באותו היום שבו היא מוכרזת.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

שאלות נפוצות

האם Muse Voice Transcribe, בעל WER של 3.1%, מדויק יותר מ-VibeVoice-ASR-Streaming-7B?

לא, וההשוואה עדיין אינה משמעותית. ה-3.1% של Meta היא טענת יום השקה למסלול הסטרימינג, שדווחה על ידי הספק ולא שוחזרה. VibeVoice-ASR-Streaming-7B לא פרסמה שום נתון דיוק סטרימינג בטקסט כלל. עד ששני המודלים יורצו דרך אותה מסגרת בדיקה ציבורית על אותו אודיו, ההצהרה הכנה היחידה היא שלמוז (Muse) יש טענה ספציפית שניתן לבדוק, ול-VibeVoice אין עדיין טענה כזו.

האם אני יכול להשתמש באחד מהמודלים על אודיו שכבר הוקלט?

כן לשתיהן, אך בצורות שונות. Muse Voice Transcribe מטפל בהקלטות באורך של יותר משעה דרך אותו API של סטרימינג. תוסף ה‑vLLM של VibeVoice-ASR-Streaming-7B חושף נקודת קצה לתמלול קובץ מלא לצד נקודת קצה הזרמת ה‑WebSocket שלו. אבל שתיהן מתוכננות ומתומחרות עבור מקרה השימוש החי — Muse לפי המודל העסקי של סטרימינג בלבד, ו‑VibeVoice לפי הארכיטקטורה המבוססת על מקטעים, הפולטת תוצאות ככל שהאודיו מגיע — ולכן אם עומס העבודה שלך הוא קבצי אצווה בלבד, API ייעודי לתמלול קבצים יהיה בדרך כלל זול יותר ובעל מדדים טובים יותר מכל אחת מהן.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube