
Grok Voice Transcribe 2.0 לעומת VibeVoice ASR Streaming 7B: המספר שמיקרוסופט לא פרסמה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
VibeVoice ASR Streaming 7B הוא מנוע זיהוי הדיבור הזורם המאוחד של Microsoft, שהועלה ל-Hugging Face ב-2 בספטמבר 2026 והוכרז במאגר microsoft/VibeVoice יום לאחר מכן תחת רישיון MIT, והוא עושה משהו שלא עושים לא Grok Voice Transcribe 2.0 ולא רוב המתחרים שלו: הוא פולט טקסט המיוחס לדובר כאשר האודיו מגיע, ללא שלב דיאריזציה נפרד. הדוח הטכני של Microsoft אומר שצ'קפוינט 7B משיג את ה-WER וה-CER הממוצעים הנמוכים ביותר בחמש ערכות הערכה, ואת ייחוס הדובר הטוב ביותר, או את ייחוס הדובר החולק את המקום הראשון, ב-12 מתוך 13 הגדרות הערכה. מה שכרטיס המודל לא עושה הוא לפרסם ולו מספר אחד בטקסט — אין WER, אין RTF, אין נתון השהיה; התוצאות קיימות רק כתמונות בדוח. Grok Voice Transcribe 2.0, שיצא שישה עשר ימים לאחר מכן ב-18 בספטמבר 2026 במחיר 0.10 דולר לשעת אודיו בעבור עיבוד באצווה ו-0.20 דולר לשעה בעבור זרימה, מפרסם הכול: WER של 2.7% בתמלול סופי ו-WER של 3.4% בתמלול חלקי ראשון בלוח הזרימה של Artificial Analysis, 0.49 שניות לכל אחד. לכן נקודת המוצא הכנה להשוואה הזו היא שאחד משני המודלים מתועד טוב יותר באופן מדיד מהאחר, והאסימטריה הזו היא כשלעצמה העובדה הרלוונטית ביותר להחלטה בעימות.
מה שמיקרוסופט פרסמה, ומה קורא יכול לעשות עם זה
דוח VibeVoice הוא מחקר אמיתי, והטענות בו ספציפיות בצורתן, אם לא בערכן. הוא העריך ארבעה מדדי פגישות — AliMeeting, AISHELL-4, AMI-SDM ו-AMI-IHM — ובנוסף MLC-Challenge, בתשע שפות, ומדווח על שתי תוצאות עיקריות: למודל ה-7B היה ה-WER/CER הממוצע הנמוך ביותר מבין חמשת הסטים, ושיוך הדוברים הטוב ביותר או הטוב ביותר ביחד עם אחרים ב-12 מתוך 13 הגדרות הערכה. שתיהן טענות יחסיות, וזהו סוג משמעותי של טענה: "הנמוך ביותר מבין חמשת הסטים" הוא אמירה על סדר, וסדר הוא מה שקונה צריך.
מה שחסר הוא כל נתון מוחלט. אין אחוז WER שאפשר להשוות לשום דבר, אין נתון תפוקה, אין מדידת השהיה, ואין פירוט לפי סט בטקסט. טבלת השוואה שמציבה את VibeVoice לצד Grok Voice Transcribe 2.0 ומייחסת למודל של Microsoft מספר ממציאה את המספר הזה. מה שכן אפשר לומר הוא ש-VibeVoice ניצח בהערכה שלו עצמו בת חמישה סטים, ושאיש מחוץ ל-Microsoft לא הריץ אותה מחדש — אין בנצ'מרק בלתי תלוי, אין הערכה של צד שלישי, ובזמן כתיבת שורות אלה אין ספק הסקה מתארח שמפרט את המודל בכלל. ההשוואה היא אפוא בין מספר מתועד לבין דירוג בלתי מתועד, והדירוג הבלתי מתועד אינו החלש מבין השניים רק משום שחסרה לו נקודה עשרונית.
לתיעוד של Grok Voice Transcribe 2.0 יש הבעיה ההפוכה. ה-2.7% וה-3.4% שלו מגיעים מלוח ה-AA-WER Streaming של Artificial Analysis, הרכב משוקלל של AA-AgentTalk ב-50% עם VoxPopuli ו-Earnings22 ב-25% כל אחד — כשמונה שעות של אודיו שיחות באנגלית בצורת סוכן, שהורץ באופן עצמאי, וזהו מקור חזק יותר באמת מהערכה של הספק עצמו. אבל זה פרוסה צרה אחת של אנגלית, ועמוד הלוח עצמו משרטט 27 מתוך 33 המודלים ש-SpaceXAI סופרת כשהיא טוענת למקום הראשון מתוך 32. מספר מדויק במבחן צר וטענה לא מדויקת במבחן רחב יותר אינם ניתנים להשוואה ישירה, והמאמר הזה לא יעמיד פנים אחרת.
שתי שניות וחצי לעומת חצי שנייה
השוואת השיהוי היא המקום היחיד שבו אפשר להעמיד את שני המודלים זה לצד זה בלי שום הסתייגות בנוגע למערכי נתונים, מפני ששניהם מפרסמים את תצורת הזרימה שלהם — וההבדל הוא ארכיטקטוני ולא בחירה של כיוונון.
VibeVoice ASR Streaming 7B עובד במקטעים. הצ'קפוינטים ששוחררו משתמשים ב-22 פריימים סמויים לכל מקטע, אשר בקצב של 7.5 פריימים סמויים לשנייה של המודל הם כ-2.9 שניות של אודיו לכל מקטע, עם הצצה קדימה של ארבעה פריימים סמויים — בערך 0.5 שניות של אודיו עתידי — והשהיית ייחוס דובר צפויה של כ-2.00 שניות. הוא פולט טקסט פעם אחת לכל מקטע. זוהי מערכת סטרימינג אמיתית, אך הקצב נמדד בשניות, לא במילישניות.
Grok Voice Transcribe 2.0 מחזיר תמלול חלקי ראשון 0.49 שניות לאחר שהדובר מפסיק, ומסיים 0.49 שניות לאחר סיום הדיבור. הוא קנה את המהירות הזו בדיוק — שיעור השגיאות בתמלול החלקי הראשון ירד מ-18.3% בגרסה 1.0 ל-3.4% בגרסה 2.0, במחיר של מעבר מ-0.25 שניות ל-0.49 שניות באותו מדד.
הצבו זה לצד זה:
• קצב סטרימינג — Grok Voice Transcribe 2.0 מפיק חלקים באופן רציף עם השהיית חלק ראשון של 0.49 שניות לעומת VibeVoice ASR Streaming 7B שמפיק גוש טקסט אחד בערך כל 2.9 שניות
• השהיית שיוך דובר — נכללת בתוך אותו נתיב של 0.49 שניות לעומת כ-2.00 שניות לפי התכנון
• הסתכלות קדימה — לא מפורסם לעומת ארבעה פריימים חבויים, כ-0.5 שניות של אודיו עתידי
• השפעה מעשית — סוכן קולי יכול לפעול על משפט שנמצא בעיצומו לעומת מערכת שמקבלת פסקה מתויגת לפי דובר כל שלוש שניות
אף אחד מאלה אינו שגוי. מקטע של 2.9 שניות הוא עיצוב סביר לחלוטין לתמלול פגישות, שבו הפלט הוא מסמך והערך הוא שהמסמך מגיע במהלך הפגישה ולא אחריה. זהו העיצוב הלא נכון עבור סוכן שיח, שבו שתיקה של שלוש שניות אינה הפסקה, היא כישלון. הפער בין שני הקצבים הוא בערך פי שישה, והוא ממפה כמעט בדיוק את ההבדל בין תמלול שיחה לבין השתתפות בה.

ייחוס דובר כפלט, ולא כשלב בפייפליין
כאן המודל של Microsoft באמת מוביל, וכדאי להבין את העיצוב, מכיוון שזו הסיבה לכך שהחלוקה למקטעים גסה.
VibeVoice משתמש בשני טוקנייזרים מאומנים מראש — מקודד אקוסטי ומקודד סמנטי — הפועלים ב-24 קילוהרץ עם הקטנת דגימה פי 3,200 כדי להפיק 7.5 פריימים חבויים לשנייה, אחד בכל 133 מילישניות. פריימים אלה מוקרנים לתוך שלד מודל שפה Qwen2.5, ודיבור נכנס וטקסט שנוצר משתלבים כרצף יחיד, כאשר דיבור וטקסט שנצפו קודם לכן נשמרים בהקשר של המודל. התוצאה היא שזהות הדובר אינה אף פעם בעיה נפרדת: המודל אינו מתמלל ואז מחליט מי דיבר, אלא מייצר טקסט בהתניה על היסטוריית אודיו שעדיין מכילה את הקולות. זו הסיבה שאין שלב דיאריזציה ליישר, ומדוע הטענה של מיקרוסופט לגבי ייחוס דובר ב-12 מתוך 13 הגדרות היא אמינה מבחינה ארכיטקטונית ולא תוצאה של תוספת חיצונית.
המחיר של העיצוב הזה הוא שימור היסטוריה שגדל באופן ליניארי עם אורך ההקלטה, ולכן נקודות הביקורת ששוחררו מכוונות להקלטות של עד שמונה דקות. זו תקרה ממשית והיא נאמרת בפשטות. זה פוסל את המודל לעבודה ארוכת טווח — שיחת רווחים של שעתיים, יום שלם של אודיו של מוקד תקשורת — אלא אם כן תבנה פילוח ואתחול מחדש משלך, מה שמחזיר בדיוק את המורכבות שהארכיטקטורה נועדה להסיר.
Grok Voice Transcribe 2.0 פותר את אותה בעיה בדרך אחרת, ועם סט מגבלות שונה. הוא כולל דיאריזציה ללא עלות נוספת ותומך בעד שמונה ערוצי אודיו עצמאיים בבקשה אחת. עבור טלפוניה של מרכזי קשר, שבה כל משתתף מגיע לעיתים קרובות בערוץ משלו, הפרדת ערוצים אמינה יותר מדיאריזציה ואין לה שיעור שגיאה כרוך. עבור אודיו מעורב זה תלוי באיכות הדיאריזציה, ובניגוד ל-Muse Voice Transcribe של Meta — שפרסם שיעור שגיאת דיאריזציה ממוצע של 17.5% — SpaceXAI לא פרסמה כלל נתון דיאריזציה. כך ששני המודלים משאירים פער בראיות הדיאריזציה: האחד מפרסם דירוג בלי ערך, והאחר מפרסם רשימת תכונות בלי מדידה.
שמונה עשרה ג'יגה-בייט, עשר שפות, MIT
עובדות הפריסה מתפצלות כה לחלוטין עד שכמעט אין כאן השוואה. VibeVoice ASR Streaming 7B הוא בערך 18 GB של משקולות bf16 — כרטיס Hugging Face מפרט 9B פרמטרים בסך הכול עבור הצ'קפוינט הנקרא 7B, עם דגם אחות 1.5B בנפח של כ-5.6 GB — ברישיון MIT, עם הדגמות Python ותוסף vLLM להגשה. עשר שפות: סינית, אנגלית, צרפתית, גרמנית, איטלקית, יפנית, קוריאנית, פורטוגזית, רוסית וספרדית. Microsoft ממצבת אותו למחקר ופיתוח.
Grok Voice Transcribe 2.0 הוא נקודת קצה מנוהלת ללא משקלים להורדה, 12 פורמטי קלט החל משמע טלפוני ב-8 kHz ועד 48 kHz, עד שמונה ערוצים, 100 מונחים מרכזיים לכל בקשה, זיהוי שפה אוטומטי עם החלפה תוך כדי הקלטה, נרמול טקסט הפוך ב-25 שפות, קבצים עד 500 MB, ומגבלות שירות של 10 בקשות בשנייה ו-100 הפעלות סטרימינג במקביל לכל צוות. הוא פועל ב-us-east-1 ורק ב-us-east-1.
• משקולות — MIT, 18 GB, שלך להרצה בכל מקום לעומת אין, מתארח אצל הספק בלבד
• שפות — 10 שפות בשם לעומת זיהוי אוטומטי עם תמיכה בעיצוב ב-25
• הטיית מונחי מפתח — נתמכת באמצעות מילות חמות לעומת עד 100 מונחי מפתח לבקשה
• אורך הקלטה — כשמונה דקות לנקודת ביקורת לפני ששימור ההיסטוריה הופך לאילוץ, לעומת אין תקרה מפורסמת, קבצים עד 500 MB
• שליטה באזור — מה שאתה פורס עליו לעומת us-east-1
• עלות — ללא דמי רישיון, בתוספת 18 GB של זיכרון GPU ומערכת הגשה לעומת $0.10 לשעת אצווה ו-$0.20 לשעת סטרימינג
מודל של 18 GB אינו משהו שמריצים על מחשב נייד, ותוסף vLLM פירושו GPU עם זיכרון אמיתי. לעומת זאת, רישיון MIT על מודל בגודל כזה הוא יוצא דופן ויקר ערך: זהו היחיד מבין השניים שאפשר להריץ בתוך הרשת שלך ללא כל קשר עם ספק, אשר עבור אודיו בפיקוח רגולטורי אינו העדפה אלא דרישה. החלופה המנוהלת זולה לפי שעה ובלתי אפשרית לפריסה בתשתית מקומית.

היכן מקומה של החלטת הניתוב
העלות היא המקום שבו שני המודלים סוף סוף נעשים ברי-השוואה באופן שמפיק מספר. מסלול העיבוד המקבץ של Grok Voice Transcribe 2.0 עולה $0.10 לשעת אודיו, כ-$1.67 ל-1,000 דקות, ומסלול הזרימה שלו $0.20, כ-$3.33. ל-VibeVoice ASR Streaming 7B אין עלות רישיון כלל; מה שיש לו במקום זאת הוא כ-18 GB של זיכרון GPU תושב ומערך הגשה של vLLM שאתם מפעילים. מודל בדרגת 7B בגודל כזה לא יהיה זול לשעת אודיו על חומרה שכורה, ועקומת הניצולת אינה סלחנית — GPU שנשמר חם לקראת עומס שיא עולה אותו דבר בין אם הוא מתמלל ובין אם הוא במנוחה.
זו הצורה הרגילה של הוויכוח בין בנייה לקנייה, והוא נפתר אחרת בהתאם להיקף ולאם מותר לאודיו לצאת מהרשת שלך. מה שהשתנה בחודש האחרון הוא באיזו מהירות התשובה משתנה: מוביל הדיוק בהזרמה החליף ידיים פעמיים בשלושה שבועות, ומודל ששוחרר בתחילת ספטמבר הוחלף עד אמצע ספטמבר. כל ארכיטקטורה שהופכת את בחירת המודל ליקרה להיפוך היא כעת הארכיטקטורה הלא נכונה לקטגוריה הזו.
OrcaRouter הוא המקום שבו ההיפוך הזה הופך לזול. מפתח אחד תואם OpenAI מכסה למעלה מ-200 מודלים עם מעבר אוטומטי בין ספקים, כך שנקודת קצה מנוהלת באזור בודד שנכשלת היא אירוע ניתוב ולא השבתה, ומחיר המחירון של הספק עובר הלאה בתוספת של 0% — כלומר שינוי מחיר של ספק או צ'קפוינט חדש זמין אצלנו באותו יום. עבור צוות שרוצה לבדוק את VibeVoice מול Grok Voice Transcribe 2.0 על האודיו שלו, או לשמור על גיבוי באחסון עצמי מאחורי אותו ממשק כמו עיקרי מנוהל, נקודת הקריאה מפסיקה להיות הדבר שצריך להשתנות.

המסקנה הכנה: VibeVoice ASR Streaming 7B הוא המודל המעניין יותר ו-Grok Voice Transcribe 2.0 הוא המוצר השמיש יותר, והפער בין שתי הקביעות הללו מוסבר כולו בכך שספק אחד מפרסם תרשימים והאחר מפרסם מספרים. אם הדרישה שלך היא תמלול מקומי עם ייחוס דוברים של פגישות באורך מתחת לשמונה דקות, ה-checkpoint של Microsoft הוא היחיד מבין השניים שמתאים. אם הדרישה שלך היא סוכן קולי שעונה בתוך הפוגה שיחתית, קצב מקטעים של 2.9 שניות פוסל אותו עוד לפני שדנים בדיוק. ואם אתה ממתין להשוואה שתכריע — אותו אודיו דרך שני המודלים, עם ניקוד של מישהו שלא עובד באף אחת מהחברות — המדידה הזו עדיין לא קיימת, וזה שווה לזכור בפעם הבאה שטבלה שמה מספר ליד השם של VibeVoice.
