כרטיס הירו של כתבה עם הכיתוב 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2', עם התג 'השוואת מודלים' וכותרת המשנה 'שני נתיבים, לא שני מתחרים', עם צ'יפים המציגים 3.4% לעומת ללא SKU של סטרימינג, 2.29% לעומת 2.04% WER באצווה, פי 162 לעומת פי 333 מזמן אמת ו-$1.67 לכל 1,000 דקות כל אחד, מעל גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

Grok Voice Transcribe 2.0 לעומת MAI Transcribe 2: שני נתיבים, לא שני יריבים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני הדגמים האלה שוחררו במרחק חמישה־עשר יום זה מזה ותומחרו זהה עד לסנט, וכמעט שלעולם לא יהיו באותה החלטת רכש. Grok Voice Transcribe 2.0, שהושק על ידי SpaceXAI ב-18 בספטמבר 2026, הוא הדגם שאליו אתה פונה כשהאודיו עדיין מגיע — הוא עושה סטרימינג דרך WebSocket, פולט תוצאות ביניים בערך כל 500 ms, ומוביל בלוח AA-WER Streaming של Artificial Analysis עם שיעור שגיאות מילים של 2.7% בתמלולים סופיים ו-3.4% בתוצאות החלקיות הראשונות. MAI-Transcribe-2, שהושק על ידי Microsoft AI ב-3 בספטמבר 2026, הוא הדגם שאליו אתה פונה כשהאודיו כבר קובץ — הוא מיועד לעיבוד באצוות בלבד, ובלוח הלא-סטרימינג של Artificial Analysis הוא הדגם המנוהל המדויק ביותר שנמדד, עם 2.04% AA-WER, לפני Grok Voice Transcribe 2.0 עם 2.29%, ומהיר פי 2 בערך בתפוקה. שניהם במחיר מחירון של $0.10 לשעת אודיו, כ-$1.67 ל-1,000 דקות. אם הדרישה שלך היא זמן אמת, אין השוואה לעשות. אם הדרישה שלך היא קובץ, יש.

הקו שאף ספק לא ימתח עבורך

תמיכה בזרימה אינה מתג תכונה. Grok Voice Transcribe 2.0 משרת את אותו מודל דרך REST עבור קבצים מוקלטים ודרך `wss://api.x.ai/v1/stt` עבור אודיו חי, כך שהדיוק שאתם מודדים בארכיון שלכם הוא הדיוק שאתם מקבלים בשיחה חיה. ל-MAI-Transcribe-2 אין SKU לזרימה כלל: חומרי ההשקה של Microsoft מציבים אותו במפורש עבור אודיו ארוך ובאצווה, ולמרות שכרטיס המודל מפרט כתוביות בזמן אמת בין תרחישי היישום שלו, הדרך לכך היא פילוח האודיו והזנת כל מקטע דרך ה-API האצוותי — וזהו צינור עיבוד שאתם בונים ומתפעלים, לא הבטחת השהיה שאתם קונים. התפוקה המוצהרת של Microsoft, בערך פי 411 מזמן אמת, היא נתון של מהירות עיבוד, לא של זמן תגובה, ושני אלה מתערבבים זה בזה כל הזמן בסיקור של ההשקה הזו.

המשמעות המעשית: אם אתם בונים סוכני קול עם חילופי תורות, כתוביות בזמן אמת, או כל דבר שבו אדם או מודל מגיב לדיבור שמתרחש, MAI-Transcribe-2 אינו מועמד, לא משנה כמה טוב הדיוק שלו. אם אתם מתמללים פגישות בדיעבד, הקלטות של מרכז קשר במהלך הלילה, ארכיוני מדיה, או צברי תאימות, סטרימינג הוא נטל מיותר והמספרים של האצווה הם כל הסיפור.

היכן ש-MAI-Transcribe-2 באמת מוביל

דיוק בקבצים, קודם כל. הפער בין 2.04% ל-2.29% נמדד על אותה ערכת בדיקה עצמאית — AA-WER v2 של Artificial Analysis, 50% AA-AgentTalk ו-25% כל אחד מ-VoxPopuli ומ-Earnings22 — מה שהופך אותו לעובדה הנקייה ביותר בהשוואה הזו. מדובר בפער של 0.25 נקודות, בערך שתיים וחצי שגיאות פחות לכל אלף מילים. האם זה משנה תלוי במה שאתה עושה עם התמלול; עבור ארכיון שניתן לחפש בו זה לא משנה, ועבור רשומה משפטית או רפואית זה עשוי לשנות.

תפוקה, שנית, ובפער גדול יותר מפער הדיוק: פי 333 מזמן אמת לעומת פי 162 של Grok Voice Transcribe 2.0. שני המספרים הם מדידות של Artificial Analysis של שניות אודיו קלט שתומללו בכל שנייה, ולא טענות של הספקים. בקצב הזה, ארכיון של אלף שעות מסתיים בכשלוש שעות מחשוב על המודל של Microsoft וכשש שעות בערך על זה של SpaceXAI. בהגירה חד-פעמית זה חסר חשיבות; בצינור עיבוד שצורך נתונים ברצף, קיצור זמן הריצה בחצי הוא הבדל אמיתי בכושר עיבוד.

כיסוי שפות, שלישי. מיקרוסופט מפרטת 60 שפות עם זיהוי אוטומטי, החלפת קוד בתוך הקלטה, ושיעור שגיאת מילים ממוצע של 5.2% בהן ב-FLEURS — מספר שדווח על ידי הספק, לא שוחזר באופן בלתי תלוי, אך לפחות הוא מתאר את המקרה הרב-לשוני על פני רשימת שפות מוצהרת. SpaceXAI מתעדת עשרות שפות עם החלפה באמצע ההקלטה ועיצוב בצורה כתובה על פני 25. אם האודיו שלך מחוץ לקבוצה המכוסה היטב של אנגלית ושפות אירופיות עיקריות, נתון FLEURS מאלף יותר מלוח דירוג שמשוקלל לאנגלית ועמוס בשיחות סוכנים.

שני הבדלים נוספים בעלי חשיבות תפעולית. MAI-Transcribe-2 מציע סגנונות תמלול ניתנים להגדרה — מילולי, המשמר אי-רציפויות בדיבור, לעומת נקי, שמסיר אותן — בעוד ש-Grok Voice Transcribe 2.0 מטפל באותה בעיה באמצעות דגל להסרת מילות מילוי. והמודל של מיקרוסופט נמצא בתצוגה מקדימה ציבורית ב-Microsoft Foundry, כלומר אין SLA והמלצה קבועה להימנע משימוש בייצור עד שיעבור ל-GA; המודל של SpaceXAI זמין באופן כללי עם מגבלות קצב מפורסמות של 10 בקשות בשנייה ו-100 הפעלות סטרימינג במקביל לכל צוות.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

איפה Grok Voice Transcribe 2.0 באמת מוביל

• סטרימינג בזמן אמת — נקודת קצה של WebSocket עם תוצאות ביניים כל ~500 מ״ש, לעומת אצווה בלבד שבה לא הוכרז SKU בזמן אמת

• דיוק התמלול החלקי הראשון — 3.4% WER תוך 0.49 שניות ב-AA-WER Streaming, קטגוריה שבה MAI-Transcribe-2 אינו מתחרה

• דיוק באצווה על אודיו של agent-talk — 2.29% בסך הכול, אך בתת-הקבוצה AA-AgentTalk של הלוח הלא-סטרימינג סדר הדירוג הדוק יותר מכפי שהכותרת מרמזת, ובתמהיל עתיר-הסוכנים של לוח הסטרימינג Grok מוביל באופן מובהק

• תשתית סוכני קול — זיהוי סוף תור מסוג Smart Turn והסרת מילות מילוי נכללים במודל עצמו, בעוד MAI-Transcribe-2 מותיר את לוגיקת התורים בידי הקורא

• אודיו רב-ערוצי — עד 8 ערוצים בלתי תלויים מתומללים במעבר אחד, מה שחשוב עבור סטריאו או הקלטות שיחות מרובות-רגליים

• ביטחון ברמת המילה — חותמות זמן נושאות ציון ביטחון לכל מילה, כך שניתן לסמן טווחים בעלי ביטחון נמוך במקום לתת בהם אמון שווה

• תנאי זמינות — זמינות כללית עם מגבלות מקביליות מפורסמות, לעומת תצוגה מקדימה ציבורית ללא SLA

• עמידות המחיר — $0.10 לשעה הוא התעריף הקבוע הן עבור batch והן כבסיס לשכבת ה-streaming ב-$0.20, בעוד שה-$0.10 הזהה של Microsoft הוא הצעת השקה לזמן מוגבל ללא תעריף תקני מוכרז לשנת 2027

הנקודה האחרונה היא זו שרוב ההשוואות מדלגות עליה. שני המודלים עולים כיום אותו דבר, ולאחד מהמחירים האלה יש תאריך תפוגה ולשני אין. Microsoft לא פרסמה תעריף לאחר המבצע, והסיקור חלוק בשאלה אם ההצעה תקפה עד סוף 2026 או שאין לה תאריך סיום מוצהר כלל. אם אתם בונים תקציב תמלול לשלוש שנים על בסיס $1.67 ל-1,000 דקות מ-Microsoft, אתם בונים על מספר שהספק לא התחייב לו.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

החפיפה אמיתית, והיא מהווה את רוב רשימת התכונות.

אם מניחים בצד את שאלת הסטרימינג, שני המוצרים מתכנסים במידה רבה. שניהם מבצעים דיאריזציה של דוברים. שניהם מחזירים חותמות זמן ברמת המילה. שניהם מטפלים בנרמול טקסט הפוך — מספרים, תאריכים, מטבעות ופרטי קשר המוצגים בצורה כתובה. שניהם מקבלים מונחים תחומיים: Grok Voice Transcribe 2.0 כעד 100 מונחי מפתח לבקשה, ו-MAI-Transcribe-2 כרשימות מונחים תחומיים וקיצורים. שניהם מזהים שפה אוטומטית ועוקבים אחרי דובר שמחליף שפות באמצע ההקלטה. שניהם מטפלים באודיו טלפוני של 8 kHz, המקרה שבו רוב מודלי התמלול נכשלים בשקט וזה שכנגדו SpaceXAI כיווננה במלוא המאמץ — מערך הטלפוניה הפנימי שלה עבר מ-10.6% ל-7.1% WER בין גרסאות, נתון שנמסר על ידי החברה על אודיו של החברה.

שניהם גם כוללים מגבלות קלט שמעצבות ארכיטקטורות ולא רק תקציבים. Grok Voice Transcribe 2.0 מקבל קבצים בגודל של עד 500 MB ב-12 פורמטי אודיו עם קצבי דגימה של 8 kHz עד 48 kHz. המגבלות של MAI-Transcribe-2 נקבעות על ידי מסלול Foundry ולא על ידי המודל, וצוותים צריכים לקרוא את התיעוד של Microsoft עצמה כדי לברר את התקרה הנוכחית, במקום להניח התאמה מלאה לשירות STT ייעודי.

המשמעות של ההתכנסות הזו היא שההחלטה מצטמצמת לשלוש שאלות לפי הסדר: האם זה חייב להיות בזמן אמת, כמה שפות יש לך בפועל, וכמה פער הדיוק עולה לך. השאלה הראשונה היא בינארית ומבטלת אפשרות אחת לחלוטין. על השנייה בדרך כלל אפשר לענות מדגימה של האודיו שלך. השלישית קטנה מספיק כדי שלרוב עומסי עבודה מבוססי קבצים היא לא תכריע דבר — פער 0.25 הנקודות הוא אמיתי, אבל גם העובדה ששני המודלים נמצאים בטווח חצי נקודה מהמספר הטוב ביותר שמישהו מדד.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

מה לעשות עם זה

התייחסו לכך כאל מחסנית בשני מסלולים ולא כאל התמודדות ראש בראש. מוקד שירות שלצדו פועלים סיוע סוכנים בזמן אמת וארכיון ציות לילי אינו בוחר בין Grok Voice Transcribe 2.0 ל-MAI-Transcribe-2 — הוא מריץ את שניהם, והשאלה היחידה היא אם הדבר עולה לו שני קשרי ספקים, שתי קבוצות הרשאות, שתי חשבוניות ושתי מגבלות קצב. אף אחד מהמודלים אינו נמצא כיום בקטלוג של OrcaRouter, ולכן קריאות התמלול עצמן פונות ל-API הפרטי של כל ספק. מה שכן מכוסה במפתח OrcaRouter אחד הוא כל מה שבמורד הזרם: מסכם, מסווג, הסוכן שמנמק על גבי התמלול, ומשימת ההערכה שמשווה את הפלט של שני הספקים על אותה הקלטה. זו הסיבה לדאוג לכך — אינכם יכולים להכריע בין המודלים האלה על סמך טבלת דירוג, כי טבלת הדירוג היא שמונה שעות של דיבור סוכנים באנגלית, והאודיו שלכם אינו כזה.

שימו לב לשני דברים. הראשון, האם מיקרוסופט תקבע מחיר תקני ל-MAI-Transcribe-2 כשמבצע ההשקה יסתיים; מחיר קבוע של 1.67 דולר ל-1,000 דקות יהפוך אותו לברירת המחדל לבחירה באצווה רק על בסיס עלות, וחזרה לכיוון 0.36 דולר לשעה של MAI-Transcribe-1 תהפוך את זה לשיחה הרבה יותר קצרה. השני, האם מיקרוסופט משיקה SKU של סטרימינג. כרטיס המודל כבר מגדיר כתוביות בזמן אמת כתרחיש יעד, והדבר היחיד שעומד בין MAI-Transcribe-2 למסלול הסטרימינג הוא נקודת קצה — אם זה יקרה, שני אלה מפסיקים להיות מסלולים ומתחילים להיות מתחרים.