כרטיס Hero של מאמר עם הכיתוב 'Grok Voice Transcribe 2.0 נגד Muse Voice Transcribe' עם התג 'השוואת מודלים' והכתובית המשנית 'שלטון של 17 ימים ורבע שנייה', עם צ'יפים המציגים 2.7% לעומת 3.1% WER סופי, 0.49s לעומת 0.16s לאחר דיבור, $0.20 לעומת $0.18 לשעת סטרימינג ואצווה במחצית המחיר, מעל גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Grok Voice Transcribe 2.0 מול Muse Voice Transcribe: שלטון של 17 ימים ורבע שנייה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-1 בספטמבר 2026, Meta מסרה ש-Muse Voice Transcribe תפס את המקום הראשון בהערכת זיהוי הדיבור בזרימה של Artificial Analysis עם שיעור שגיאת מילים סופי של 3.1%, והטענה הזו נותרה ללא עוררין במשך שבעה עשר יום. ב-18 בספטמבר SpaceXAI השיקה את Grok Voice Transcribe 2.0 עם 2.7% באותו לוח ונטלה את המקום. שני מודלים, דירוג אחד, בהפרש של שבעה עשר יום — וההשוואה המעניינת יותר אינה פער 0.4 הנקודות בדיוק, משום שהמודל של Meta עדיין מהיר בערך פי שלושה להשלים משפט: 0.16 שניות לאחר סיום הדיבור לעומת 0.49 שניות של Grok Voice Transcribe 2.0. Muse Voice Transcribe הוא מודל תפיסת אודיו בזמן אמת שנבנה על ידי Meta Superintelligence Labs כדי לפעול בתוך המוצרים של Meta עצמה, שם רבע שנייה היא ההבדל בין עוזר שמרגיש נוכח לבין אחד שמרגיש איטי. Grok Voice Transcribe 2.0 הוא API לתמלול שנבנה כדי שכל אחד יקרא לו, במחיר שהופך עבודת אצווה לברת-ביצוע. שני המספרים הם דיווחי ספק ביום ההשקה, ורק אחד מהשניים הוצב מאז באופן בלתי תלוי על לוח ציבורי.

מה לוח הדירוג למעשה אומר כעת

לוח ה-AA-WER Streaming הוא צירוף משוקלל — AA-AgentTalk ב-50%, VoxPopuli ב-25%, Earnings22 ב-25%, כשמונה שעות של אודיו באנגלית שרובו בצורת סוכן — ושתי המודלים נמדדים עליו, וזה מה שהופך אותו לעימות ראש-בראש הנדיר שבו המספרים לכל הפחות ניתנים להשוואה. זה לצד זה, כולל נתונים שדווחו על ידי הספקים:

• דיוק תמלול סופי — Grok Voice Transcribe 2.0 עם 2.7% WER לעומת Muse Voice Transcribe עם 3.1%

• דיוק התמלול החלקי הראשון — 3.4% לעומת 3.6%

• זמן עד לתוצאה חלקית ראשונה — 0.49 שניות לעומת 0.13 שניות

• זמן מסיום הדיבור לתמלול סופי — 0.49 שניות לעומת 0.16 שניות

• שיעור שגיאה בדיאריזציה של דוברים — נכלל, לא פורסם נתון לעומת ממוצע של 17.5% בכל ההערכה של Meta

קראו את שורות הדיוק ואת שורות השהיה בנפרד, כי הן מצביעות לכיוונים מנוגדים ושתיהן נכונות. בדיוק, שני המודלים נמצאים בטווח של ארבע עשיריות נקודה זה מזה בתמלולים סופיים ושתי עשיריות בתוצאות חלקיות ראשונות — פער קטן מספיק כדי להתהפך במהדורה הבאה של כל אחת מהחברות, וקטן מספיק כדי שאף אדם סביר לא יבחר ביניהם על בסיסו. בשיהוי הם לא קרובים. המודל של Meta מחזיר תוצאה חלקית בתוך כשמינית שנייה ומסיים בתוך כששית שנייה, לעומת כחצי שנייה בשני הכיוונים אצל זה של SpaceXAI.

כל ההשוואה הזו בשורה אחת: Grok Voice Transcribe 2.0 השקיע השהיה כדי לקנות דיוק, ו-Muse Voice Transcribe עשה את ההפוך. SpaceXAI הפחיתה את שיעור שגיאות התוצאה החלקית הראשונה מ-18.3% בגרסה 1.0 ל-3.4% בגרסה 2.0, והמחיר של זה היה מעבר מ-0.25 שניות ל-0.49 שניות באותו מדד. המודל של Meta תוכנן בכיוון ההפוך, עם מקטעי אודיו של 80 מילי־שניות ועיכוב אדפטיבי שנלמד בלמידת חיזוק, שמחליט כמה זמן להמתין לפני התחייבות לטקסט — מנגנון שכל מטרתו היא לשמור על הדיוק תוך שמירה על מהירות ההתחייבות. אף אחת מהבחירות אינה טעות. הן תשובות לשאלות שונות.

איזו שאלה אתה שואל

אם התמלול מזין סוכן קולי שצריך להגיב בתוך הפסקה שיחתית, 0.16 שניות ו-0.49 שניות הם מוצרים שונים. נטילת תורות אנושית סובלת פער של כמה מאות מילישניות לפני שהאינטראקציה מתחילה להרגיש לא נכונה, ותקציב השהיה משותף — תמלול, אחר כך הסקה, ואז סינתזת דיבור. מודל שמחזיר תמלול סופי בששית שנייה משאיר מקום לשאר הצינור; כזה שלוקח חצי שנייה צורך את רוב התקציב לפני שהמודל חשב על משהו. זה מה ש-Meta בנתה עבורו, ולכן המודל פועל בתוך Meta AI ב-Mac ובתוך Muse Code, במקום להיות מוצע בעיקר כנקודת קצה עבור הצינורות של אנשים אחרים.

אם התמלול הוא מסמך — הקלטת שיחה, פגישה, ספריית וידאו, ארכיון תאימות — אז חצי שנייה היא כלום, פער הדיוק עדיין כלום, והמספר היחיד שחשוב הוא כמה עולה שעה של אודיו. וזה בדיוק המקום שבו השניים מתפצלים בחדות, ובכיוון שמפתיע אנשים שמסתכלים רק על תעריף ההזרמה.

חצי מהמחיר באצווה, עשירית יותר בסטרימינג

Meta מציינת את Muse Voice Transcribe במחיר $0.18 לשעת אודיו, או $3.00 ל-1,000 דקות. Grok Voice Transcribe 2.0 מציין מחיר של $0.10 לשעה עבור אצווה ו-$0.20 לשעה עבור סטרימינג. אז:

• סטרימינג — Grok Voice Transcribe 2.0 במחיר $0.20 לשעה לעומת Muse Voice Transcribe ב-$0.18, כך ש-Meta זולה בכ-10% בערך

• אצווה או מוקלט — $0.10 לשעה לעומת $0.18, כך ש-SpaceXAI זול ב-44%

• כלול במחיר המחירון — דיאריזציה, חותמות זמן ברמת המילה עם ציון ביטחון, הטיית מונחי מפתח ונרמול טקסט הפוך בצד של SpaceXAI לעומת תמלול בזרימה, דיאריזציה וזיהוי נקודות קצה כמודל אחד בצד של Meta

• מסלול חינמי או אירוח עצמי — לא זה ולא זה, בשתי הבחינות

צוות שעוסק אך ורק בסטרימינג אמור להיות אדיש ביניהם מבחינת מחיר, ולבחור לפי השהיה, כלומר Meta. צוות עם נפח משמעותי כלשהו של אודיו מוקלט צריך להסתכל על שורת ה-batch, כי 0.08 דולר לשעה מצטבר: 5,000 שעות בחודש הן 500 דולר באחד ו-900 דולר באחר, ופער הדיוק ביניהם קטן מהעיגול של כל אחד מהמספרים.

מצב הרישוי זהה במובן החשוב ושונה במובן שלא. שניהם בעלי משקלים סגורים — Muse Voice Transcribe הוא קנייני וזמין רק דרך ה-API המתארח של Meta, ו-Grok Voice Transcribe 2.0 הוא API מסחרי ללא אפשרות הורדה. אף אחד מהם אינו אפשרות אם הדרישה שלך היא שהאודיו לעולם לא יצא מתשתית שבשליטתך, ושניהם מותירים אותך חשוף לכך שספק ישנה לך את המחיר, את גרסת המודל או את לוח הזמנים להוצאה משימוש. זהו שיקול אמיתי ולא היפותטי: Grok Voice Transcribe 1.0 כבר נמצא במסלול הוצאה משימוש פחות משבועיים לאחר שהממשיך שלו שוחרר.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

דיאריזציה, שהיא התכונה שאף אחד מהם לא מוביל איתה

שני המודלים מבצעים ייחוס דובר במעבר יחיד, מה שלפני שנתיים היה מערכת נפרדת שהוצמדה בדיעבד, וההשוואה כאן קונקרטית באופן יוצא דופן כי Meta פרסמה נתון ו-SpaceXAI לא.

Meta מדווחת על שיעור שגיאת דיאריזציה ממוצע של 17.5% בכל ההערכה שלה, מטפלת ב-20 דוברים או יותר ללא עיבוד שלאחר מכן, ומטפלת בהם כחלק ממודל הזרימה ולא כשלב בהמשך — ה"מי אמר מה" מגיע עם הטקסט ולא אחריו. זה קשה באמת לעשות בהקשר של זרימה, שבו ניתן לזהות תור דובר רק לאחר ששמעתם מספיק ממנו, ו-17.5% הוא מספר אמיתי עם הסתייגות אמיתית: הוא של Meta עצמה, בממוצע על פני מערך הערכה ש-Meta בחרה.

המודל של SpaceXAI כולל דיאריזציה ללא עלות נוספת, ותומך גם בעד שמונה ערוצי אודיו בלתי־תלויים בבקשה אחת, וזו דרך שונה לפתור את אותה בעיה — אם האודיו שלכם מגיע כערוצים נפרדים לכל משתתף, כפי שלעתים קרובות קורה בטלפוניה של מרכזי קשר, הפרדת ערוצים אמינה יותר מדיאריזציה ואינה דורשת שיעור שגיאות כלל. אם האודיו שלכם מגיע כזרם מעורב אחד, אתם תלויים באיכות הדיאריזציה, ורק אחד משני הספקים הללו סיפר לכם מהי.

יש הבדל מסדר שני שכדאי לציין: Muse Voice Transcribe מתייחס להפרדת דוברים, לתמלול ולזיהוי נקודות קצה כמודל אחד שמייצר פלט אחד, מה שאומר שהרכיבים אינם יכולים להיכשל באופן בלתי תלוי. Grok Voice Transcribe 2.0 מאפשר לך להתייחס לערוצים, למונחי מפתח ולהפרדת דוברים כמנופים נפרדים. מודל יחיד פשוט יותר להפעלה וקשה יותר לניפוי באגים.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

שפות, והיכן ששני כרטיסי המודל מפסיקים להיות ברי השוואה

Meta אימנה את Muse Voice Transcribe על יותר מ-70 שפות ואימתה 25 מהן באופן נרחב בעת ההשקה, עם מעברי שפה טבעיים בתוך משפטים ובין משפטים ותמיכה באודיו שארוך משעה. Grok Voice Transcribe 2.0 מטפל בזיהוי שפה אוטומטי עם מעבר בין שפות תוך כדי הקלטה ומיישם נרמול טקסט הפוך — תאריכים, מטבעות, מספרי טלפון וכתובות דוא"ל מדוברים המוצגים בצורה כתובה — ב-25 שפות.

החפיפה היא בין 25 השפות המאומתות ביסודיות מצד אחד לבין 25 שפות הנרמול מצד שני, ושתי הקבוצות אינן אותן 25 שפות, ואף אחד מהספקים לא פרסם את הרשימה. "‏70+ שפות שאומנו" ו"25 שפות עם תמיכה בפורמט" אינן טענות בנות השוואה ואין להפחית אחת מהשנייה. מה שכן ניתן לומר הוא ש-Meta מציגה טענה רב-לשונית רחבה יותר ו-SpaceXAI מציגה טענה צרה יותר אך תפעולית יותר: זיהוי השפה הוא תנאי סף, ולפרמט את מה שהמודל שמע למשהו שמערכת במורד הזרם תוכל לפרסר הוא החלק ששובר אינטגרציות כשהוא חסר.

הבחירה, והסיבה שאולי לא בידיך להכריע בה

תסיר את השיווק, וההחלטה מצטמצמת לשלושה משפטים. בחר ב-Muse Voice Transcribe אם התמלול נצרך בזמן אמת בתוך שיחה, כי 0.16 שניות זה לא פרט שולי. בחר ב-Grok Voice Transcribe 2.0 אם יש לך אודיו מוקלט בהיקפים גדולים, כי חצי ממחיר העיבוד באצווה גם הוא לא פרט שולי. אם אינך זקוק לאף אחד מהקצוות האלה, בחר לפי כל מה שמגביל אותך מעבר לכך — אזור, חוזה, אינטגרציה קיימת — כי פער הדיוק לא יכריע את הכף.

המורכבות היא שאחד משני המודלים הללו אינו באמת למכירה במובן המקובל. Muse Voice Transcribe קיים כדי לגרום לעוזר של מטא עצמה להרגיש מהיר, והוא זמין דרך ה-Meta Model API בעיקר משום שמטא החליטה שהערך האקוסיסטמי של חשיפה עולה על הערך של בלעדיות. זה יכול להשתנות, וזה יכול להשתנות במהירות: מטא הקדישה את אותו השבוע לפתיחת פלטפורמת המחברים של Muse בפני מפתחי צד שלישי — כלומר, חברה שמשקיעה בערוץ ההפצה של עצמה ולא בלהיות ספקית ניטרלית עבור זו של כל האחרים. בניית תלות ייצורית במודל פנימי של מתחרה היא הימור שהתנאים לא ישתנו, ולהימור הזה יש רקורד היסטורי עגום.

האסימטריה הזו היא הטיעון נגד קידוד קשיח של אף אחד מהם. OrcaRouter חושפת יותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI, עם מעבר אוטומטי לגיבוי בין ספקים ו-0% תוספת על מחיר המחירון של הספק — כך שכאשר SpaceXAI מחליפה את ברירת המחדל ל-2.0 ומכריזה על 1.0 כמיושן, או כאשר Meta ממצבת מחדש את ה-API לדיבור שלה, השינוי הוא מחרוזת מודל ולא פרויקט הגירה. בקטגוריה שבה המוביל החליף ידיים פעמיים בשלושה שבועות, שכבת הניתוב היא החלק בסטאק שצריך להיות יציב, והמודל הוא החלק שלא צריך להיות יציב.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

דבר אחד שכדאי לעקוב אחריו במהלך החודש הקרוב: האם Artificial Analysis ימדוד מחדש את Muse Voice Transcribe בלוח הסטרימינג, כעת לאחר ש-Grok Voice Transcribe 2.0 עקף אותו. גם הנתון של מטא – 3.1% – וגם זה של SpaceXAI – 2.7% – דווחו בעת ההשקה, אך רק הנתון של SpaceXAI נמדד באופן בלתי תלוי. אם הנתון של מטא יחזיק מעמד כשמישהו יריץ אותו מחדש, פער הדיוק קטן כפי שהוא נראה, ופער ההשהיה מכריע את הכל. ואם לא, שלטון שבעה-עשר הימים היה כל הסיפור.