
VibeVoice-ASR-Streaming-1.5B לעומת Gemini 3.5 Transcribe: מנוע ה-ASR הסטרימינג השקט של מיקרוסופט מול ה-API החדש של גוגל.
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
שבעה ימים ופער פילוסופי אחד מפרידים בין שתי המערכות החדשות ביותר לתמלול דיבור בזרימה. ב-26 באוגוסט 2026 השיקה Google את Gemini 3.5 Transcribe בתצוגה מקדימה ציבורית: API מתארח וסגור לתמלול דיבור, המתומחר לפי טוקן אודיו, עם נקודת קצה Live נפרדת לסשנים בזמן אמת. ב-2 בספטמבר 2026 העלתה Microsoft Research את VibeVoice-ASR-Streaming-1.5B ל-Hugging Face תחת מרחב השמות microsoft — משקלים ברישיון MIT, ללא הודעה לעיתונות, ללא פוסט השקה, וללא סיקור של צד שלישי בשום מקום, נכון לכתיבת שורות אלה. שתיהן מתמללות דיבור בעודו עדיין נקלט. כמעט כל דבר אחר לגביהן — מי רשאי להריץ אותן, מה עלותן, איזו הוכחה קיימת שהן עובדות — שונה.
דף זה משווה בין השניים כפי שהם קיימים בפועל כיום, ולכן שני צדדי הראיות אינם סימטריים. Gemini 3.5 Transcribe הוא מוצר Google חי, עם מחירי טוקנים שפורסמו ומדדי דיוק של צד שלישי מ-Artificial Analysis; אלה המספרים שמסומנים AA להלן. VibeVoice-ASR-Streaming-1.5B הוא צ׳קפוינט שכרטיס המודל שלו אינו מפרסם שיעור שגיאות מילים או נתון חביון בטקסט כלל — ההערכה שמופיעה בכרטיס היא תמונה, וההודעה היחידה שפורסמה עד כה על משפחת הסטרימינג היא שורת חדשות מ-3 בספטמבר במאגר VibeVoice GitHub של Microsoft. כל מה שמצוי להלן בצד של Microsoft הוא מה שניתן ללמוד מהמאגר: קובצי התצורה, כרטיס המודל ותיעוד הסטרימינג של Microsoft עצמה. הוא עדיין לא עבר בנצ׳מרק בלתי תלוי.
שני הדגמים במבט חטוף
• {{1}}מה זה — VibeVoice-ASR-Streaming-1.5B: צ'קפוינט פתוח, {{KEEP}}MIT license{{/KEEP}}, באירוח עצמי{{/1}} לעומת {{2}}Gemini 3.5 Transcribe: API מתארח, משקלים סגורים.{{/2}}
• פרסום — משקלים ב-2 בספטמבר 2026, שורת חדשות רפו ב-3 בספטמבר, לעומת תצוגה מקדימה ציבורית ב-26 באוגוסט 2026 עם חומרי השקה מלאים.
• מבנה סטרימינג — פולט טקסט במנות של כ-2.9 שניות עם הסתכלות קדימה של כ-0.5 שניות, כשמצב הסשן נישא במטמון קידומת (prefix cache), לעומת סשן WebSocket Live שמחויב לפי אסימון שמע, ומוגבל ל-10 דקות שמע לכל סשן.
דיוק כפי שפורסם — לא פורסם נתון WER או זמן השהיה בכתב, לעומת WER שנמדד על ידי AA שעומד על 2.6% בנקודת הקצה המוקלטת מראש ו-4.0% בנקודת הקצה Live.
• פלט דובר — טוען לייחוס "מי אמר מה" בסטרימינג (לא מאומת) לעומת ללא דיאריזציית דוברים וללא חותמות זמן ברמת המילה בנקודת הקצה Live.
• Hotwords — נתמכים, באמצעות אותה הנחיית קונטקסט כמו ה-Batch VibeVoice-ASR, לעומת לא תכונה רשומה של ה-Live endpoint.
• עלות — $0 עבור המשקלים, כ-5.6 GB לאירוח עצמי, לעומת כ-$0.30 לשעת אודיו במחיר משוקלל בנקודת הקצה המוקלטת מראש וכ-$0.54 ב-Live, לפי מחירי האסימונים שמפרסמת Google.

API מתארח והעלאה שקטה, בהפרש של שבעה ימים
Gemini 3.5 Transcribe הוא מודל תמלול ברמת תחליף של Google, והוא מוצע כשני מוצרים. נקודת הקצה לאודיו מוקלט, המוגשת דרך Interactions API, מקבלת קובץ אודיו מלא ומחזירה תמליל עם התוספות הצפויות. נקודת הקצה החיה, gemini-3.5-transcribe-live, פועלת על גבי WebSocket דו-כיווני, והיא זו שמתחרה ב-VibeVoice-ASR-Streaming-1.5B על אופי המשימה: תמלול סשן בזמן אמת. Google הכריזה על כך במנגנון הרגיל — השקה בתצוגה מקדימה לציבור ב-26 באוגוסט, תמחור בדף המודל, וטבלאות דירוג של צד שלישי שכללו אותו תוך ימים.
בשחרור הסטרימינג של מיקרוסופט לא היה שום דבר מזה. ב-2 בספטמבר יצר חשבון ה-Hugging Face של מיקרוסופט שני צ'קפוינטים באותה דקה: VibeVoice-ASR-Streaming-7B ו-VibeVoice-ASR-Streaming-1.5B. טבלת המודלים במאגר GitHub מציגה כעת את VibeVoice-ASR-Streaming כחבר במשפחה, ובמדור החדשות שלו מופיעה שורת ה-3 בספטמבר המכריזה על "מודל ASR סטרימינג אחיד שמתמלל ברציפות מי אמר מה בזמן שהדיבור מגיע, עם תמיכה במילות מפתח מותאמות אישית וב-10 שפות" — אולם ההכרזה הזאת מזכירה את ה-7B, ואילו ה-1.5B הוא האח הקטן יותר ששוחרר יחד איתו מבלי שיצוין במפורש. כשבדקנו יום אחרי ההעלאה, שני הצ'קפוינטים עדיין הראו אפס הורדות.

מה המשמעות של "סטרימינג" בכל צד
המילה סטרימינג מסתירה הבדל עיצובי אמיתי. תצורת הפרה-מעבד של מיקרוסופט הופכת את הקצב של VibeVoice לקונקרטי: האודיו מגיע ב-24 קילו-הרץ ונדחס פי 3,200 לזרם של טוקני דיבור בקצב של כ-7.5 הרץ (טוקן אחד בכל ~133 אלפיות השנייה). לאחר מכן התצורה מצהירה על נתח של 22 פריימים והסתכלות קדימה של 4 פריימים — כ-2.9 שניות של אודיו לכל נתח, עם בערך חצי שנייה של אודיו עתידי שמשמש לייצוב הקטע הנוכחי. המודל פולט טקסט פעם אחת לכל נתח שנפתר, והתיעוד של מיקרוסופט מציין שהקשר מנתחים קודמים נשמר דרך מטמון ה-KV, כך שסשן ארוך אינו מחשב מההתחלה. החשבון נמצא בתצורה; התוצאה המעשית היא תמליל שגדל במרווחים של כשלוש שניות, לא בחלקים חלקיים של מילה.
ה-Live endpoint של Google הוא צורת סטרימינג שונה: סשן WebSocket דו־כיווני שבו אודיו מחויב ב־25 אסימוני אודיו לשנייה, שתוכנן לשימוש אינטראקטיבי, אך מוגבל ל־10 דקות אודיו לכל סשן — ובמיוחד ב־Live endpoint — ללא זיהוי דוברים או חותמות זמן ברמת מילה. למי שמשווה בין השניים כמנועי תמלול חי, ההבדלים שחשובים הם מגבלת הסשן (10 דקות בצד של Google Live, מוגבל רק על ידי ה־GPU והזיכרון שלך בצד של Microsoft), קצב הפלט (נתחים של כ־3 שניות לעומת מה שסשן ה־WebSocket מספק), ותוספות הפלט (ייחוס דובר והוטוורדס שנטענים בכרטיס של Microsoft, ונעדרים מרשימת התכונות של Google Live).
דיוק: בצד אחד יש מספרים, ובצד השני יש תמונה
זהו הפער הרחב ביותר במפגש, והוא פער בראיות, לא בהכרח באיכות. Artificial Analysis מודדת את Gemini 3.5 Transcribe בשיעור שגיאות מילים של 2.6% בנקודת הקצה המוקלטת מראש ו-4.0% בנקודת הקצה Live — הפרמיה שאתה משלם עבור מסירה בזמן אמת באה לידי ביטוי בשיעור השגיאות, וזוהי פשרה נפוצה והוגנת עבור מערכות סטרימינג. אלה מספרים של צד שלישי בלוח תוצאות ניטרלי, שפורסמו ימים ספורים לאחר ההשקה.
אין ל-VibeVoice-ASR-Streaming-1.5B שום נתון דומה בשום מקום. כרטיס המודל כולל איור של תוצאות הערכה כתמונה, אבל ללא ערכי WER מספריים, RTF או חביון בפרוזה — שום דבר שאפשר לצטט ושום דבר שאפשר לאמת באופן עצמאי. מיקרוסופט לא פרסמה מספרי דיוק בסטרימינג בטקסט עבור לא ה-7B ולא ה-1.5B. נקודת העיגון המספרית היחידה בכל המשפחה היא כרטיס המודל של VibeVoice-ASR במוד הלא-סטרימינג, המדווח על ממוצע WER של 7.77% מבוצע ע"י הספק על פני שמונה ערכות מבחן באנגלית ו-2.20% על LibriSpeech clean — אבל זה מתאר את המודל הלא-סטרימינג, ומודלי סטרימינג בדרך כלל מוותרים על מעט דיוק בתמורה ליתרון החביון. עד שמישהו יריץ את checkpoint הסטרימינג דרך תשתית בדיקה ציבורית, העמדה הכנה היא שהמודל של גוגל נמדד ושל מיקרוסופט לא.
עלות: לשעת אודיו לעומת שעת GPU
גוגל מוכרת את Gemini 3.5 Transcribe לפי אסימון (token), והתמחור מתחלק בצורה נקייה בין שני הקצוות. הקצה המוקלט מראש מציג מחיר של $2 לכל מיליון אסימוני אודיו בקלט ו-$12 לכל מיליון אסימוני טקסט בפלט, מה שמסתכם בערך ב-$0.30 לשעת אודיו בממוצע משוקלל. הקצה החי (Live) מציג מחיר של $3.50 לכל מיליון אסימוני אודיו ו-$21 לכל מיליון אסימוני טקסט — בערך $0.54 לשעת אודיו בממוצע משוקלל, כלומר כ-80% יותר מהמוקלט מראש, וזה המחיר של אספקה בזמן אמת. גוגל מחייבת על אודיו בקצב של 25 אסימונים לשנייה, כך ששתיקות הן בחינם רק אם הלקוח לא מזרים אותן; התחברויות מחדש, אודיו כפול ורישום (logging) יכולים כולם להגדיל את החשבון בפועל. קיימת גם תוכנית חינמית, עם הסתייגות שתוכן מהתוכנית החינמית עשוי לשמש לשיפור המוצרים של גוגל.

המודל של מיקרוסופט מתומחר בשעות GPU במקום זאת. הצ'קפוינט של 1.5B הוא בערך 5.6 GB של משקלים בפורמט bf16 (עמוד שדרה לשוני מסוג Qwen ברמת 1.5B בתוספת טוקנייזרים לאודיו וראש דיפוזיה — מטא-נתוני safetensors מסתכמים בכ-3B פרמטרים), והדרכים המתועדות להרצה הן באירוח עצמי: הדמואים בפייתון במאגר microsoft/VibeVoice, או תוסף ה-vLLM שמיקרוסופט מתארת לחשיפת נקודות קצה תואמות OpenAI ו-WebSocket. אין עדיין מחיר לשירות מתארח (hosted), משום שאף ספק אינפרנס לא מציע את המודל עדיין. שאלת העלות היא כולה האם זמן ה-GPU שלך זול יותר מהתעריף השעתי של גוגל — ובכל נפח תמלול מתמשך, התשובה היא כמעט בוודאות כן — ושאלת הרישיון נפרדת משאלת העלות, מכיוון שמשקלי MIT הם שלך לשמור, בדרך ששום מנוי API אינו כזה.
השניים אינם סותרים זה את זה בערימת הייצור. הדפוס הפרגמטי עבור צוות שזקוק לתמלול חי היום הוא לשמור על שכבת ה-ASR מאחורי נקודת קצה אחת, כך שהבחירה נותרת הפיכה: API לניתוב שחושף 200+ מודלים במחירי הרשימה של הספקים — ללא תוספת מחיר, כך ששינוי מחיר של ספק נכנס לתוקף באותו היום — עם העברה אוטומטית לספק חלופי, הוא בדיוק השכבה שמאפשרת להריץ את ה-API הנמדד של Google כברירת מחדל, בעוד שנתח תעבורה אמיתית בודק את VibeVoice-ASR-Streaming-1.5B ברגע שספק יארח אותו. זה המודל של OrcaRouter, וזאת הדרך בסיכון נמוך לאמץ צ'קפוינט שאף אחד לא אימת עדיין את דיוקו.
מי צריך לבחור איזה
בחרו ב-Gemini 3.5 Transcribe אם אתם רוצים API לתמלול שעובד כבר היום, עם נתוני דיוק מפורסמים, תמחור צפוי לשעה, וללא GPU שצריך להשגיח עליו — ובמיוחד אם האודיו שלכם לא כלול בעשר השפות ש-Microsoft מפרטת, או אם אתם זקוקים להפרדת דוברים ולחותמות זמן ברמת מילה של נקודת הקצה לתמלול קבצים מוקלטים. מכסת 10 הדקות לסשן Live היא מגבלה אמיתית שכדאי לבדוק מול מקרה השימוש שלכם לפני שמתחייבים לשימוש בו לסשנים חיים.
בחרו ב-VibeVoice-ASR-Streaming-1.5B אם אתם מארחים בעצמכם, אם אתם רוצים את המשקולות ואת השליטה בנתונים שרישיון MIT מספק, אם אתם זקוקים לאורך סשן בלתי מוגבל, או אם פלט הזרמת “מי-אמר-מה” והוט-וורדס הם תכונות שברצונכם להעריך במפורש. היערכו להתקנה מקוד המקור, כ-5.6 ג’יגה-בייט של משקולות על GPU של NVIDIA, ולשער הערכה משלכם — אין מדד שאפשר להישען עליו, ולכן שאלת הדיוק היא שלכם לענות עליה באמצעות האודיו שלכם.
המסקנה מהשבוע הראשון: גוגל השיקה את המוצר השקול, ומיקרוסופט השיקה את ההימור המעניין. Gemini 3.5 Transcribe היא ברירת המחדל הבטוחה יותר, והיא זו שמאחוריה עומדים נתונים של צד שלישי; VibeVoice-ASR-Streaming-1.5B היא החלופה הפתוחה, הניתנת לאירוח עצמי, ושלא אומתה כלל. מה שהופך את ההחלטה לזולה הוא שאינה חייבת להיות קבועה – הפכו את נקודת הקצה של ה-ASR לניתנת להחלפה, וצ'קפוינט שמשוחרר בלי ולו אמת מידה אחת יכול לזכות או לאבד את התנועה שלכם, לפי מה שיעידו התמלילים שלכם.
