כרטיס גיבור של מאמר עם הכיתוב 'MAI-Transcribe-2-Streaming זמין כעת' ועם התג 'מודל חדש · MICROSOFT AI' וכתובית המשנה 'Microsoft לוקחת את כתר התמלול בזרימה ב-2.5% WER', עם רצועת נתונים המציגה שיעור שגיאות מילים בזרימה של 2.5% ב-0.13 שניות לאחר סוף הדיבור, מסומן על הכרטיס כטענת Microsoft וכראשון הן בתמלילים סופיים והן בתמלילים חלקיים; 60 שפות עם זיהוי שפה רציף אוטומטי; ו-$9.00 ל-1,000 דקות, המתואר כ-$0.54 לשעת אודיו במחיר היכרות עד 2026; על גבי גרדיאנט מלבן לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

MAI-Transcribe-2-Streaming זמין כעת: מיקרוסופט לוקחת את כתר תמלול הזרימה עם 2.5% WER

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

MAI-Transcribe-2-Streaming הוא התשובה של Microsoft AI לשאלה האחת ששחרור ספטמבר שלה הותיר פתוחה, והיא ענתה עליה בתוך 28 ימים. MAI-Transcribe-2-Streaming, ששוחרר ב-1 באוקטובר 2026, הוא מודל תמלול דיבור לטקסט בזמן אמת שמתמלל עם הגעת המילים ולא לאחר שהקובץ מסתיים. מיקרוסופט אומרת שהוא מדורג ראשון בדיוק גם בתמלולים סופיים וגם בתמלולים חלקיים בהערכת AA-WER Streaming של Artificial Analysis, בשיעור שגיאת מילים של 2.5%, כשהתמלול הסופי מוכן 0.13 שניות לאחר סיום הדיבור. זוהי טענה של ספק על מתודולוגיה של אתר מעקב ולא שורה שהאתר מפרסם — נכון למועד הניסוח, 37 המודלים שבלוח אינם כוללים אותו, והמודל שהוא אמור להחליף הוא Gro​k Voice Transcribe 2.0 (Streaming) עם 2.73% ו-0.49 שניות. המודל שעליו הוא מבוסס, MAI-Transcribe-2, שוחרר ב-3 בספטמבר כמודל אצווה עם WER של 2.0% וללא SKU בזמן אמת; גרסת הזרימה סוגרת את הפער הזה בלי לוותר על הרבה מהדיוק שהפך את גרסת האצווה לבולטת. מה שהיא כן מוותרת עליו הוא המחיר: הזרימה יקרה פי 5.4 מתעריף האצווה בהשקה.

המסגור שמיקרוסופט רוצה הוא ניצחון מוחלט בלוח התוצאות של הסטרימינג. המסגור שהנתונים תומכים בו צר יותר ומעניין יותר — מודל שטוען להוביל בו-זמנית בדיוק ובשהיה, בחזית שבה הרשומה המדויקת ביותר בלוח איטית פי ארבעה להתייצב מהמהירות ביותר שלו, ואף לא אחת מהמהירות האלה נמצאת מתחת ל-3% שגיאת מילים, במחיר שווה לזה של השחקן הקיים ולא נמוך ממנו. הנה ההשקה כפי שאירעה, עם טענות הספקים מסומנות.

מה מיקרוסופט שחררה ב-1 באוקטובר

MAI-Transcribe-2-Streaming מוגש דרך מחסנית הדיבור של Microsoft בשירות Azure AI Speech, עם תיעוד תחת שמו של המודל עצמו ואותו מודל הפצה של API בלבד וללא משקלים כמו בגרסת ה-batch. הוא מתמלל 60 שפות עם זיהוי שפה רציף ואוטומטי, כך שסשן שמחליף שפות באמצע הזרם אינו צריך להיות מוצהר מראש. Microsoft ממקמת אותו על חזית פארטו של דיוק מול השהיה בתרשים הזרמה של Artificial Analysis — פרשנות הספק עצמו לנתוני הגשש, ופרשנות שתרשים הגשש עצמו תומך בה.

מודל הסטרימינג לא היה כל השחרור. מיקרוסופט שחררה לצידו שני מודלים קוליים: MAI-Voice-2.1, המכסה 23 שפות ב-26 לוקאלים, ו-MAI-Voice-2.1-Flash, המטפל בעד 45 שניות של אודיו בהשהיה של כ-150 מ"ש. כשקוראים אותם כמערכת אחת, ההשקה של 1 באוקטובר היא מחסנית שיחה בזמן אמת מלאה — לשמוע, להבין, לדבר — ולא השקה של מודל בודד.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

קריאת לוח המובילים של הסטרימינג

AA-WER Streaming מודד שני דברים לכל מודל: עד כמה שגוי התמלול המוגמר, וכמה זמן אחרי שהדובר מפסיק זה לוקח להסתיים. הטענה של מיקרוסופט היא ש-MAI-Transcribe-2-Streaming מוביל בשניהם: שיעור שגיאות מילים של 2.5% בתמלול הסופי ב-0.13 שניות לאחר סוף הדיבור, ואותם 2.5% בתמלול החלקי הראשון ב-0.12 שניות, שלדברי מיקרוסופט הוא הראשון מבחינת דיוק בשניהם. יש לקרוא זאת כנתון של ספק — נכון למועד כתיבת הדברים, לוח ה-Streaming של הטראקר עצמו טרם הציג את המודל, כך שאין שורה עצמאית של MAI-Transcribe-2-Streaming לקרוא. מה שהלוח כן מציג הוא השדה שהוא טוען שהוא מביס, והשדה צמוד יותר מכפי שמסגור של "כתר" מרמז:

• Grok Voice Transcribe 2.0 — WER של תמלול סופי של 2.73% ב-0.49 שניות לאחר סיום הדיבור, לפי Artificial Analysis, והמוביל הנוכחי בלוח התוצאות. זה 0.23 נקודות מאחורי ה-2.5% המוצהר של מיקרוסופט, ובערך פי ארבעה איטי יותר להתייצב — ההבדל בין כתובית שעומדת בקצב לכזו שמפגרת.

• Muse Voice Transcribe — 3.06% ב-0.16 שניות, לפי Artificial Analysis. המתחרה הקרוב ביותר מבחינת השהיה: מפגר בכ-30 מילישניות, וגרוע ב-0.5 נקודות בדיוק מהטענה של Microsoft.

• ElevenLabs Scribe v2 Realtime — 3.59% ב־0.14 שניות, לפי Artificial Analysis. למעשה תיקו במהירות, אך יותר מנקודת אחוז מאחור ברמת הדיוק.

• Gemini 3.5 Transcribe Live — 4.00% WER בזרימה ב-0.40 שניות, הנתון שפרסמה Artificial Analysis ושאותו מצטטת Google עבור מודל ה-Live API שלה. זהו פער של 1.5 נקודות, וזו ההשוואה שאליה מכוונת הגרסה הזו.

עמודת החלקי-הראשון היא המקום שבו הטענה הכי פחות דומה לשאר הלוח. באותו עוקב, החלקיים הראשונים של Grok Voice Transcribe 2.0 עומדים על 3.36% ושל Gemini 3.5 Transcribe Live על 5.77% — חלקיים אמורים להיות גרועים יותר מהתמלול הסופי, לעיתים בנקודה או יותר, מפני שהמודל מתחייב לפני שהמשפט מסתיים. תמלול חלקי ראשון שתואם את המספר הסופי הוא החלק הלא-שגרתי באמת בהשקה של Microsoft, והוא החלק שהנתונים של העוקב עצמו עדיין לא יכולים לאשר. צטט אותו כטענה עד שקיימת שורה.

ההסתייגות הכנה היא ש-0.13 שניות ו-0.16 שניות הן אותה חוויית מוצר בעיני אדם שקורא כתוביות, ו-2.5% לעומת 2.73% שמובילים כרגע את לוח התוצאות הם כ-2 שגיאות לכל 1,000 מילים. יתרון בגודל כזה הוא אמיתי אך קטן, והאם זהו יתרון שאפשר להרגיש תלוי בעומס העבודה. המקום שבו זה כן נושך הוא בזנב: זרם של מוקד שירות שפועל שמונה שעות ביום בשיעור של 2.73% לעומת 2.5% הוא עשרות אלפי מילים שגויות נוספות בשנה, ושגיאות מילים בתמלול אינן מתפלגות באופן אחיד — הן מתקבצות בדיוק על שמות העצם הפרטיים והמספרים שהופכים את התמלול לשימושי.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

מה קונים תמורת $9.00 לכל 1,000 דקות

סטרימינג עולה יותר מאצווה, ומיקרוסופט תמחרה אותו בקצה העליון של דרג הזמן-אמת ולא מתחתיו. MAI-Transcribe-2-Streaming מתומחר ב-$0.54 לשעת אודיו, שמסתכם ב-$9.00 ל-1,000 דקות של אודיו בסטרימינג, ומתואר כתעריף היכרות בתוקף עד סוף השנה. לשם השוואה, MAI-Transcribe-2 באצווה הוא $0.10 לשעת אודיו — $1.67 ל-1,000 דקות — כך שתמלול בזמן אמת עולה בערך פי 5.4 מהתעריף מבוסס הקבצים עבור אותה משפחה בסיסית, ושגיאת המילים גבוהה ב-0.5 נקודות. זה לא תמחור יתר שמיקרוסופט מסתירה; זה מחיר כנה של חיבור מתמיד ושל תמלול חלקי שצריך להיות נכון לפני שהמשפט נגמר.

לעומת שאר דרג הסטרימינג, התמונה מעורבת. MAI-Transcribe-2-Streaming משתווה ל-Gemini 3.5 Transcribe Live בכ-9 דולר לכל 1,000 דקות — מדויק יותר, באותו מחיר. הוא ממוקם מעל ElevenLabs Scribe v2 Realtime ו-Deepgram Flux בכ-6.50 דולר לכל 1,000 דקות, מעל Cartesia Ink-2 בכ-4 דולר, ובערך פי שלושה מ-Muse Voice Transcribe בכ-3 דולר. כך שההשקה היא מהלך של דיוק וזמן תגובה בתמחור שווה, לא מלחמת מחירים; צוותים שכבר מריצים מודל סטרימינג זול יותר ישלמו יותר דולרים תמורת נקודות WER.

הפשרה הזו ראויה לשם מדויק, מפני שזו אותה פשרה שהשקת האצווה הפכה על פיה. בספטמבר מיקרוסופט הפכה את הדיוק לזול. באוקטובר היא גרמה לכך שדיוק בזמן אמת עולה אותו דבר כמו אצל כל השאר. אם הפייפליין שלך זקוק לתמלילים רק בסופו של דבר, שום דבר ב-1 באוקטובר לא משנה את החשבון שלך. אם הוא זקוק להם בזמן שהשיחה עדיין בעיצומה, החישוב פשוט עבר לאיכות.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

הבנייה על גבי תמלול היא החצי השני של אותה החלטה, וכאן שכבת ריבוי-מודלים מצדיקה את קיומה. תמלול בזמן אמת הוא לעתים רחוקות סוף הצינור — הוא עובר סיכום, ניקוד, חיפוש, ניתוב והסלמה, והשלבים האלה דורשים מודלים שונים בעלויות שונות. OrcaRouter קיים בדיוק לשכבה הזו: API אחד על פני למעלה מ-200 מודלים, מחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, מעבר אוטומטי לגיבוי, ו-DSL לניתוב שיכול לשלוח תמלול חי למודל אחד לסינון תאימות ולמודל אחר להערות פגישה בלי אינטגרציה נוספת. MAI-Transcribe-2-Streaming עצמו אינו ברשימה הזו — הוא מוגש דרך מחסנית הדיבור של מיקרוסופט עצמה — אבל התמלול הזורם שהוא מפיק הוא בדיוק מסוג הקלט עתיר הנפח ורגיש להשהיה שמצדיק לשמור על השכבה שמעליו אגנוסטית למודל.

מה שלא הוכח עדיין

שלושה דברים נותרו פתוחים באמת. ראשית, דיאריזציה: מודל האצווה כולל ייחוס דוברים ללא שיעור שגיאת דיאריזציה מפורסם, והחומר הזורם של מיקרוסופט אינו טוען לדיאריזציה כלל — עבור מודל בזמן אמת שמזין סיוע חי לנציג או כתוביות, מי-אמר-מה הוא לעתים קרובות התכונה שחשובה יותר מ-WER גולמי. שנית, הפירוט הרב-לשוני: 60 שפות עם זיהוי שפה רציף אוטומטי היא טענה רחבה, והשהיה לפי שפה של מודל זורם יכולה להשתנות הרבה יותר מזו של מקבילו האצוותי, מפני שאיכות תמלול חלקי תלויה במהירות שבה המודל מתחייב לשפה. מיקרוסופט לא פרסמה טבלת זרימה לפי שפה. שלישית, WER זורם נמדד על אודיו נקי של מבחני ביצועים; מצב הכשל שפוגע בפריסות אמיתיות הוא זרם שדה-רחוק רועש, וביום ההשקה לא היה קיים השוואת זרימה בלתי תלויה בשדה-רחוק.

לאן זה משאיר את הסטאק שלך

הדבר המעניין בהשקה הזו אינו העובדה שיש ל-Microsoft את תמלול הסטרימינג המדויק ביותר. אלא הקצב: אצווה בספטמבר, סטרימינג באוקטובר, באותה משפחה, על אותו משטח docs, עם מבנה תמחור שנע כעת בין $1.67 ל-$9.00 ל-1,000 דקות עבור אותה יכולת בסיסית. זה נותן לצוותים בחירה אמיתית בפעם הראשונה — לשלם על זמן אמת רק היכן שזמן אמת חשוב, ולעבד באצווה את כל השאר — אבל זה גם אומר ששכבת התמלול היא כעת משהו שמכווננים לפי עומס עבודה במקום לתקנן פעם אחת.

קראו את הטענה בכותרת כפשוטה והיא מחזיקה כהצהרת ספק: מיקרוסופט אומרת ש-MAI-Transcribe-2-Streaming הוא הראשון הן בדיוק של תמלול סופי והן בדיוק של תמלול חלקי ראשון, ושהוא נמצא על חזית Pareto. הכוכביות הן שללוח המעקב של הטראקר טרם שרטט את המודל, שהיתרון שהוא טוען לו על המוביל הנוכחי קטן מספיק כדי להיעלם בהרצה חוזרת, שיתרון המחיר הוא אפס, ושסיפור הדיאריזציה טרם סופר. אלה הדברים שכדאי לשים לב אליהם, לא הכתר.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית