כרטיס כותרת ראשי המשווה בין "VibeVoice-ASR-Streaming-7B" ל-"Gemini 3.5 Transcribe Live", עם שורת-על "דיבור לטקסט בסטרימינג — ספטמבר 2026", כתובית המציינת שנקודת הביקורת הפתוחה השקטה של מיקרוסופט פוגשת את ממשק ה-Live API השקול של גוגל, תוויות "משקלי MIT — 2 בספטמבר", "Google API — 26 באוגוסט" ו"לא פורסם WER עבור VibeVoice", והערת שוליים "מה ידוע לנו עד כה". הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

VibeVoice-ASR-Streaming-7B לעומת Gemini 3.5 Transcribe Live: שבוע אחד, שני סוגים של המרת דיבור-לטקסט בסטרימינג

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

השבוע האחרון של אוגוסט והימים הראשונים של ספטמבר 2026 הניבו שתי מערכות המרת דיבור לטקסט בזרימה, שנראות כמו יריבות — אבל הן למעשה תשובות שונות לאותה שאלה. ב־26 באוגוסט פרסמה גוגל את Gemini 3.5 Transcribe Live בתצוגה מקדימה ציבורית: נקודת קצה מתארחת וסגורה להמרת דיבור לטקסט, שמחזירה תמליל מוגמר תוך 0.40 שניות אחרי שהדובר מפסיק לדבר, ומגובה בשיעור שגיאות מילים בזרימה של 4.0% שנמדד על ידי Artificial Analysis, לצד חומרי השקה מלאים. ב־2 בספטמבר העלתה Microsoft Research את VibeVoice-ASR-Streaming-7B ל־Hugging Face תחת מרחב השמות microsoft: משקלים פתוחים ברישיון MIT, ללא הודעה לעיתונות, ללא דף השקה, וכרטיס מודל שאינו מפרסם בטקסט קריא שום שיעור שגיאות מילים ושום נתון השהיה. שתי המערכות מקבלות אודיו בעודו עדיין זורם פנימה. וזה כמעט הדבר היחיד המשותף ביניהן.

הראיות משני הצדדים אינן סימטריות, ולכן השוואה זו מנוסחת כ״מה שידוע לנו עד כה״. Gemini 3.5 Transcribe Live הוא מוצר של Google עם מחירי אסימונים שפורסמו ומדידות של צד שלישי, ואלה מסומנים להלן. VibeVoice-ASR-Streaming-7B הוא צ’קפוינט שכל טענה לגביו נקראת מתוך המאגר עצמו: קובצי התצורה, כרטיס המודל, ותיעוד הסטרימינג של Microsoft במאגר VibeVoice GitHub. עדיין לא נערכה בדיקה בלתי תלויה של הצד של Microsoft, ואנחנו מציינים זאת במפורש בכל מקום שבו מספר עלול אחרת להיראות כנושא משקל ראייתי.

מסלול השחרור: השקת API והעלאה שקטה

גוגל שחררה את Gemini 3.5 Transcribe Live בדרך הרגילה. המודל יושב תחת כותרת Gemini Audio לצד המודל האח שלו Gemini 3.5 Transcribe (מסלול ה-Interactions API להקלטות), המחיר מצוין בעמוד המודל, ולוחות מובילים עצמאיים קלטו את נקודת הקצה Live תוך ימים – משם מגיעים ה-4.0% של WER בסטרימינג והשהייה הסופית של 0.40 שניות. קיימת גם תוכנית חינמית, עם הסייג הרגיל שתוכן מהתוכנית החינמית עשוי לשמש לשיפור מוצרי גוגל.

השחרור הסטרימינג של מיקרוסופט לא כלל אף אחד מהמנגנונים הללו. מאגר Hugging Face בשם microsoft/VibeVoice-ASR-Streaming-7B נוצר ב-2026-09-02 בשעה 15:46 UTC, ונערך לאחרונה כעבור שלוש דקות; הוא מכיל שמונה קטעי safetensors, טוקנייזר ותצורת מעבד מקדים תחת רישיון MIT. הרשומה הרשמית היא שורת יומן חדשות מה-3 בספטמבר במאגר microsoft/VibeVoice, המכריזה על "מודל ASR סטרימינג אחיד שמתמלל ברציפות מי אמר מה בזמן שהדיבור מגיע, עם תמיכה במילים חמות מותאמות אישית וב-10 שפות," עם קישורים להדגמה בכתובת aka.ms/vibeasr ולדוח טכני על סטרימינג. כשבדקנו יום לאחר ההעלאה, נקודת הבידקה עדיין הראתה אפס הורדות, ואף ספק הסקה מתארח אינו מפרט אותה. כרטיס המודל אומר יותר מההכרזה, והמאגר הוא המקור לכמעט כל מה שלהלן.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

המפרטים, זה לצד זה

• מה זה — VibeVoice-ASR-Streaming-7B: ASR סטרימינג עם משקלים פתוחים, באירוח עצמי, לעומת Gemini 3.5 Transcribe Live: API סטרימינג מתארח, משקלים סגורים.

• צורת סטרימינג — פולט טקסט בנתחים של כ־2.9 שניות עם כ־0.5 שניות של ראייה קדימה (נגזר מתצורת ה־checkpoint) לעומת הפעלת WebSocket דו־כיוונית עם תמלילים חלקיים רציפים ותוצאה סופית 0.40 שניות לאחר שהדובר מפסיק לדבר.

• דיוק בפרסום — לא פורסם נתון WER או זמן השהיה, לעומת 4.0% WER בסטרימינג ו-2.6% במודל המוקלט מראש, לפי Artificial Analysis.

• דוברים — נטען כי יש ייחוס "מי אמר מה" בסטרימינג, אך הוא אינו מאומת; ובנקודת הקצה Live אין אבחנת דוברים (במודל המוקלט מראש היא זמינה, עד שלושה דוברים).

• שפות — 10 (en, zh, es, pt, de, ja, ko, fr, ru, it) לעומת זיהוי אוטומטי ביותר מ-85 עם מעבר באמצע הזרם.

• משך הסשן — מוגבל רק על ידי ה-GPU והזיכרון שלך, לעומת מגבלה קשיחה של 10 דקות לסשן Live.

• עלות — $0 עבור המשקלים, כ-18 GB של bf16 לאירוח עצמי לעומת כ-$0.54 לשעת שמע ב-Live כאשר סופרים את אסימוני פלט הטקסט.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Gemini 3.5 Transcribe Live - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): what it is - open weights self-hosted; streaming cadence - ~2.9 s chunks + ~0.5 s lookahead; WER published - none in text; speaker output - claimed, unverified; languages - 10; cost - $0 weights, ~18 GB bf16. Right column Gemini 3.5 Transcribe Live (released Aug 26, 2026 - public preview): hosted streaming API closed weights; WebSocket partials, final 0.40 s after speech (AA); 4.0% streaming / 2.6% batch (AA); none on the Live endpoint; 85+ auto-detect; ~$0.54 per audio-hour. Footer: 'Gemini figures per Google pricing + Artificial Analysis. VibeVoice specs read from the HF repo; no benchmark exists yet.'

מה המשמעות של "סטרימינג" בכל צד

המילה מסתירה הבדל עיצובי אמיתי, וכדאי להיות מדויקים, כי שתי המערכות אפילו לא מנסות להפיק את אותו הקצב. התצורה של המעבד המקדים של מיקרוסופט הופכת את המקצב של VibeVoice לקונקרטי: האודיו מגיע ב-24 קילו-הרץ ונחבט פי 3,200 לזרם טוקנים בקצב של כ-7.5 פריימים לשנייה, ואז התצורה מצהירה על נתח של 22 פריימים ומבט קדימה של 4 פריימים — כ-2.9 שניות של אודיו לכל נתח, עם בערך חצי שנייה של אודיו עתידי כדי לחזק אותו. המודל פולט טקסט פעם אחת לכל נתח שנפתר, והקונטקסט מנתחים קודמים נשמר דרך מטמון ה-KV, כך שסשן ארוך לא מחשב מחדש מאפס. התמליל המעשי גדל במרווחים של כשלוש שניות.

נקודת הקצה החיה של Google בנויה ללולאה מהירה ואינטראקטיבית יותר: שמע זורם ב‑WebSocket בנתחי PCM של 16 או 24 קילו-הרץ, תמלילים חלקיים חוזרים ברציפות בזמן שהדובר מדבר, ותמליל סופי ומעוצב נוחת 0.40 שניות אחרי סיום הדיבור — המספר הזה הוא מדידה של Artificial Analysis, שצוטטה על ידי Google. המחירים הם מגבלת הסשן (עשר דקות של שמע, שלאחריהן היישום שלך חייב להתחבר מחדש ולתפור), והתוספות החסרות: אין הפרדת דוברים ואין חותמות זמן ברמת מילה במסלול ה‑Live, שתיהן קיימות בתמלול המוקלט מראש של Gemini 3.5 Transcribe. אז הסיכום הכנה הוא שמודל הסטרימינג של Google מהיר יותר לכל אמירה, בעוד שנקודת הביקורת של הסטרימינג של Microsoft איטית יותר לנתח, אבל טוענת לייחוס הדובר ש‑Google מפילה במסלול החי, באורך סשן ש‑Google לא מציעה.

דיוק: נמדד, לעומת רווח ריק

הפער הגדול ביותר בהשוואה זו הוא פער בראיות, לא בהכרח באיכות. {{1}}Artificial Analysis מדדה את Gemini 3.5 Transcribe Live בשיעור שגיאות מילים ממוצע של 4.0% בסטרימינג, וב-2.6% במודל שאינו סטרימינג, כשהאחרון דורג חמישי בטבלת ה-WER שלה עם ההשקה; גוגל מדווחת בנפרד על 5.50% בסטרימינג ו-5.04% במודל שאינו סטרימינג במערך ה-FLEURS הרב-לשוני.{{/1}} {{2}}קראו אותם לפי התיוג שלהם: Artificial Analysis אינה תלויה בגוגל, אבל המספרים של API בן יום אחד עדיין מוקדמים, ופרמיית הסטרימינג לעומת מודל הבאצ' — 4.0% לעומת 2.6% — היא המחיר הרגיל של אספקה בזמן אמת.{{/2}}

ל-VibeVoice-ASR-Streaming-7B אין נתון דומה בשום מקום אחר. כרטיס המודל כולל נתון הערכה כתמונה, והדוח הטכני של מיקרוסופט הוא קובץ PDF, אך אף אחד מהם אינו מציע ערך WER או זמן השהיה בפורמט טקסט עבור סטרימינג שניתן לצטט או לבדוק באופן בלתי תלוי. נקודת העיגון המספרית היחידה בכל המשפחה היא כרטיס המודל האצוותי של VibeVoice-ASR, המדווח על ממוצע של 7.77% WER בהרצת ספק על פני שמונה ערכות בדיקה באנגלית ועל 2.20% ב־LibriSpeech clean — נתונים עבור המודל שאינו סטרימינג, לא עבור המודל הזה, ומודלי סטרימינג בדרך כלל מוותרים על מעט דיוק תמורת יתרון ההשהיה. עד שמישהו יבדוק את נקודת הבקרה (checkpoint) של המודל הסטרימינג דרך תשתית בדיקה ציבורית, ההצהרה ההוגנת היא שצד אחד של ההשוואה הזו נמדד ואילו הצד השני לא.

עלות: API בתשלום לפי שימוש לעומת GPU שכבר תקצבת

Google מתמחרת את Gemini 3.5 Transcribe Live לפי טוקן ומחייבת אודיו ב-25 טוקנים לשנייה. לפי תעריפי ה-Live שפורסמו — $3.50 למיליון טוקני אודיו ו-$21 למיליון טוקני פלט טקסט — שעת אודיו בחישוב משוקלל עומדת על כ-$0.54, כלומר כ-$9 ל-1,000 דקות אודיו, והמודל המוקלט מראש זול אף יותר, בכ-$0.30 לשעה. שתיקה היא בחינם רק אם הקליינט שלך לא מזרים אותה: חיבורים מחדש, אודיו משוכפל ורישום לוגים מוסיפים כולם טוקנים נמדדים לחשבון בפועל.

Microsoft מתמחרת את נקודת הביקורת בשעות-GPU במקום זאת. משקלי ה-bf16 לבדם מגיעים לכ-18 GB לפני כל מטמון KV, הנתיבים המתועדים הם הדגמות ה-Python במאגר microsoft/VibeVoice ותוסף vLLM שמשרת נקודות קצה תואמות WebSocket ו-OpenAI, ואין מחיר hosted כי אף ספק לא מארח את המודל עדיין — הוא לא נמצא על Azure AI Foundry כמו שה-API של VibeVoice-ASR נמצא מאז מרץ. אירוח עצמי של מודל דיבור-LLM מסוג 7B משמעותו תקציב ל-GPU מסוג 24 GB וזמן תפעול משלך; בתמורה מקבלים אורך סשן בלתי מוגבל ומשקלים שנשארים שלך. שני המודלים אינם סותרים זה את זה, וזו הנקודה של הסעיף האחרון.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

להשאיר את הבחירה זולה

מה שתבחר תלוי בשאלה אם אתה צריך מספר או קוד. בחר ב־Gemini 3.5 Transcribe Live אם אתה רוצה תמלול שעובד היום, עם דיוק שפורסם וללא צורך ב־GPU להרצה — ואם האודיו שלך אינו מוגבל לעשר שפות, או אם אתה מוכן לבנות תיוג דוברים בעצמך, משום שנקודת הקצה של Live אינה מספקת אותו. בחר ב־VibeVoice-ASR-Streaming-7B אם אתה מארח את המערכת בעצמך, אם אורך סשן בלתי מוגבל או פלט סטרימינג עם ייחוס לדוברים — כפי שנטען — חשוב לך, ואם אתה מוכן להריץ שער הערכה משלך, מכיוון שאין מדד שאפשר להישען עליו.

אין צורך שאף אחת מהאפשרויות תהיה קבועה, וזה בדיוק המקום שבו שכבת ניתוב מרוויחה את מקומה — עבור המודלים שמסביב לתמלול, לא עבור התמלול עצמו. OrcaRouter לא מנתב היום דיבור לטקסט, ואף אחד מהמודלים בעמוד הזה אינו בקטלוג שלה; מה שהיא עושה הוא לתת API אחד ליותר מ־200 מודלי שפה שצורכים תמלול חי — המסכם, מחלץ פריטי הפעולה, מתכנן סוכן הקול — במחירי המחירון של הספקים, המועברים ללא כל תוספת, ועם מעבר אוטומטי בין ספקים. קיצוץ מחיר של ספק על כל מודל בערימה הזו נכנס לתוקף באותו היום, כי מחירי המחירון מועברים הלאה ללא תוספת. שלב התמלול נשאר היכן שהצבת אותו; הערימה שפועלת על התמלול היא בדיוק השכבה שבה מפתח אחד ומסלול גיבוי הופכים צ׳קפוינט בן שבוע, שלא עבר בנצ׳מרק, מהימור לאופציה שניתנת לבדיקה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube