
MAI-Transcribe-2-Streaming זמין כעת: מיקרוסופט לוקחת את כתר תמלול הזרימה עם 2.5% WER
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
MAI-Transcribe-2-Streaming הוא התשובה של Microsoft AI לשאלה האחת ששחרור ספטמבר שלה הותיר פתוחה, והיא ענתה עליה בתוך 28 ימים. MAI-Transcribe-2-Streaming, ששוחרר ב-1 באוקטובר 2026, הוא מודל תמלול דיבור לטקסט בזמן אמת שמתמלל עם הגעת המילים ולא לאחר שהקובץ מסתיים. מיקרוסופט אומרת שהוא מדורג ראשון בדיוק גם בתמלולים סופיים וגם בתמלולים חלקיים בהערכת AA-WER Streaming של Artificial Analysis, בשיעור שגיאת מילים של 2.5%, כשהתמלול הסופי מוכן 0.13 שניות לאחר סיום הדיבור. זוהי טענה של ספק על מתודולוגיה של אתר מעקב ולא שורה שהאתר מפרסם — נכון למועד הניסוח, 37 המודלים שבלוח אינם כוללים אותו, והמודל שהוא אמור להחליף הוא Grok Voice Transcribe 2.0 (Streaming) עם 2.73% ו-0.49 שניות. המודל שעליו הוא מבוסס, MAI-Transcribe-2, שוחרר ב-3 בספטמבר כמודל אצווה עם WER של 2.0% וללא SKU בזמן אמת; גרסת הזרימה סוגרת את הפער הזה בלי לוותר על הרבה מהדיוק שהפך את גרסת האצווה לבולטת. מה שהיא כן מוותרת עליו הוא המחיר: הזרימה יקרה פי 5.4 מתעריף האצווה בהשקה.
המסגור שמיקרוסופט רוצה הוא ניצחון מוחלט בלוח התוצאות של הסטרימינג. המסגור שהנתונים תומכים בו צר יותר ומעניין יותר — מודל שטוען להוביל בו-זמנית בדיוק ובשהיה, בחזית שבה הרשומה המדויקת ביותר בלוח איטית פי ארבעה להתייצב מהמהירות ביותר שלו, ואף לא אחת מהמהירות האלה נמצאת מתחת ל-3% שגיאת מילים, במחיר שווה לזה של השחקן הקיים ולא נמוך ממנו. הנה ההשקה כפי שאירעה, עם טענות הספקים מסומנות.
מה מיקרוסופט שחררה ב-1 באוקטובר
MAI-Transcribe-2-Streaming מוגש דרך מחסנית הדיבור של Microsoft בשירות Azure AI Speech, עם תיעוד תחת שמו של המודל עצמו ואותו מודל הפצה של API בלבד וללא משקלים כמו בגרסת ה-batch. הוא מתמלל 60 שפות עם זיהוי שפה רציף ואוטומטי, כך שסשן שמחליף שפות באמצע הזרם אינו צריך להיות מוצהר מראש. Microsoft ממקמת אותו על חזית פארטו של דיוק מול השהיה בתרשים הזרמה של Artificial Analysis — פרשנות הספק עצמו לנתוני הגשש, ופרשנות שתרשים הגשש עצמו תומך בה.
מודל הסטרימינג לא היה כל השחרור. מיקרוסופט שחררה לצידו שני מודלים קוליים: MAI-Voice-2.1, המכסה 23 שפות ב-26 לוקאלים, ו-MAI-Voice-2.1-Flash, המטפל בעד 45 שניות של אודיו בהשהיה של כ-150 מ"ש. כשקוראים אותם כמערכת אחת, ההשקה של 1 באוקטובר היא מחסנית שיחה בזמן אמת מלאה — לשמוע, להבין, לדבר — ולא השקה של מודל בודד.

קריאת לוח המובילים של הסטרימינג
AA-WER Streaming מודד שני דברים לכל מודל: עד כמה שגוי התמלול המוגמר, וכמה זמן אחרי שהדובר מפסיק זה לוקח להסתיים. הטענה של מיקרוסופט היא ש-MAI-Transcribe-2-Streaming מוביל בשניהם: שיעור שגיאות מילים של 2.5% בתמלול הסופי ב-0.13 שניות לאחר סוף הדיבור, ואותם 2.5% בתמלול החלקי הראשון ב-0.12 שניות, שלדברי מיקרוסופט הוא הראשון מבחינת דיוק בשניהם. יש לקרוא זאת כנתון של ספק — נכון למועד כתיבת הדברים, לוח ה-Streaming של הטראקר עצמו טרם הציג את המודל, כך שאין שורה עצמאית של MAI-Transcribe-2-Streaming לקרוא. מה שהלוח כן מציג הוא השדה שהוא טוען שהוא מביס, והשדה צמוד יותר מכפי שמסגור של "כתר" מרמז:
• Grok Voice Transcribe 2.0 — WER של תמלול סופי של 2.73% ב-0.49 שניות לאחר סיום הדיבור, לפי Artificial Analysis, והמוביל הנוכחי בלוח התוצאות. זה 0.23 נקודות מאחורי ה-2.5% המוצהר של מיקרוסופט, ובערך פי ארבעה איטי יותר להתייצב — ההבדל בין כתובית שעומדת בקצב לכזו שמפגרת.
• Muse Voice Transcribe — 3.06% ב-0.16 שניות, לפי Artificial Analysis. המתחרה הקרוב ביותר מבחינת השהיה: מפגר בכ-30 מילישניות, וגרוע ב-0.5 נקודות בדיוק מהטענה של Microsoft.
• ElevenLabs Scribe v2 Realtime — 3.59% ב־0.14 שניות, לפי Artificial Analysis. למעשה תיקו במהירות, אך יותר מנקודת אחוז מאחור ברמת הדיוק.
• Gemini 3.5 Transcribe Live — 4.00% WER בזרימה ב-0.40 שניות, הנתון שפרסמה Artificial Analysis ושאותו מצטטת Google עבור מודל ה-Live API שלה. זהו פער של 1.5 נקודות, וזו ההשוואה שאליה מכוונת הגרסה הזו.
עמודת החלקי-הראשון היא המקום שבו הטענה הכי פחות דומה לשאר הלוח. באותו עוקב, החלקיים הראשונים של Grok Voice Transcribe 2.0 עומדים על 3.36% ושל Gemini 3.5 Transcribe Live על 5.77% — חלקיים אמורים להיות גרועים יותר מהתמלול הסופי, לעיתים בנקודה או יותר, מפני שהמודל מתחייב לפני שהמשפט מסתיים. תמלול חלקי ראשון שתואם את המספר הסופי הוא החלק הלא-שגרתי באמת בהשקה של Microsoft, והוא החלק שהנתונים של העוקב עצמו עדיין לא יכולים לאשר. צטט אותו כטענה עד שקיימת שורה.
ההסתייגות הכנה היא ש-0.13 שניות ו-0.16 שניות הן אותה חוויית מוצר בעיני אדם שקורא כתוביות, ו-2.5% לעומת 2.73% שמובילים כרגע את לוח התוצאות הם כ-2 שגיאות לכל 1,000 מילים. יתרון בגודל כזה הוא אמיתי אך קטן, והאם זהו יתרון שאפשר להרגיש תלוי בעומס העבודה. המקום שבו זה כן נושך הוא בזנב: זרם של מוקד שירות שפועל שמונה שעות ביום בשיעור של 2.73% לעומת 2.5% הוא עשרות אלפי מילים שגויות נוספות בשנה, ושגיאות מילים בתמלול אינן מתפלגות באופן אחיד — הן מתקבצות בדיוק על שמות העצם הפרטיים והמספרים שהופכים את התמלול לשימושי.

מה קונים תמורת $9.00 לכל 1,000 דקות
סטרימינג עולה יותר מאצווה, ומיקרוסופט תמחרה אותו בקצה העליון של דרג הזמן-אמת ולא מתחתיו. MAI-Transcribe-2-Streaming מתומחר ב-$0.54 לשעת אודיו, שמסתכם ב-$9.00 ל-1,000 דקות של אודיו בסטרימינג, ומתואר כתעריף היכרות בתוקף עד סוף השנה. לשם השוואה, MAI-Transcribe-2 באצווה הוא $0.10 לשעת אודיו — $1.67 ל-1,000 דקות — כך שתמלול בזמן אמת עולה בערך פי 5.4 מהתעריף מבוסס הקבצים עבור אותה משפחה בסיסית, ושגיאת המילים גבוהה ב-0.5 נקודות. זה לא תמחור יתר שמיקרוסופט מסתירה; זה מחיר כנה של חיבור מתמיד ושל תמלול חלקי שצריך להיות נכון לפני שהמשפט נגמר.
לעומת שאר דרג הסטרימינג, התמונה מעורבת. MAI-Transcribe-2-Streaming משתווה ל-Gemini 3.5 Transcribe Live בכ-9 דולר לכל 1,000 דקות — מדויק יותר, באותו מחיר. הוא ממוקם מעל ElevenLabs Scribe v2 Realtime ו-Deepgram Flux בכ-6.50 דולר לכל 1,000 דקות, מעל Cartesia Ink-2 בכ-4 דולר, ובערך פי שלושה מ-Muse Voice Transcribe בכ-3 דולר. כך שההשקה היא מהלך של דיוק וזמן תגובה בתמחור שווה, לא מלחמת מחירים; צוותים שכבר מריצים מודל סטרימינג זול יותר ישלמו יותר דולרים תמורת נקודות WER.
הפשרה הזו ראויה לשם מדויק, מפני שזו אותה פשרה שהשקת האצווה הפכה על פיה. בספטמבר מיקרוסופט הפכה את הדיוק לזול. באוקטובר היא גרמה לכך שדיוק בזמן אמת עולה אותו דבר כמו אצל כל השאר. אם הפייפליין שלך זקוק לתמלילים רק בסופו של דבר, שום דבר ב-1 באוקטובר לא משנה את החשבון שלך. אם הוא זקוק להם בזמן שהשיחה עדיין בעיצומה, החישוב פשוט עבר לאיכות.

הבנייה על גבי תמלול היא החצי השני של אותה החלטה, וכאן שכבת ריבוי-מודלים מצדיקה את קיומה. תמלול בזמן אמת הוא לעתים רחוקות סוף הצינור — הוא עובר סיכום, ניקוד, חיפוש, ניתוב והסלמה, והשלבים האלה דורשים מודלים שונים בעלויות שונות. OrcaRouter קיים בדיוק לשכבה הזו: API אחד על פני למעלה מ-200 מודלים, מחירי המחירון של הספקים מועברים הלאה בתוספת של 0%, מעבר אוטומטי לגיבוי, ו-DSL לניתוב שיכול לשלוח תמלול חי למודל אחד לסינון תאימות ולמודל אחר להערות פגישה בלי אינטגרציה נוספת. MAI-Transcribe-2-Streaming עצמו אינו ברשימה הזו — הוא מוגש דרך מחסנית הדיבור של מיקרוסופט עצמה — אבל התמלול הזורם שהוא מפיק הוא בדיוק מסוג הקלט עתיר הנפח ורגיש להשהיה שמצדיק לשמור על השכבה שמעליו אגנוסטית למודל.
מה שלא הוכח עדיין
שלושה דברים נותרו פתוחים באמת. ראשית, דיאריזציה: מודל האצווה כולל ייחוס דוברים ללא שיעור שגיאת דיאריזציה מפורסם, והחומר הזורם של מיקרוסופט אינו טוען לדיאריזציה כלל — עבור מודל בזמן אמת שמזין סיוע חי לנציג או כתוביות, מי-אמר-מה הוא לעתים קרובות התכונה שחשובה יותר מ-WER גולמי. שנית, הפירוט הרב-לשוני: 60 שפות עם זיהוי שפה רציף אוטומטי היא טענה רחבה, והשהיה לפי שפה של מודל זורם יכולה להשתנות הרבה יותר מזו של מקבילו האצוותי, מפני שאיכות תמלול חלקי תלויה במהירות שבה המודל מתחייב לשפה. מיקרוסופט לא פרסמה טבלת זרימה לפי שפה. שלישית, WER זורם נמדד על אודיו נקי של מבחני ביצועים; מצב הכשל שפוגע בפריסות אמיתיות הוא זרם שדה-רחוק רועש, וביום ההשקה לא היה קיים השוואת זרימה בלתי תלויה בשדה-רחוק.
לאן זה משאיר את הסטאק שלך
הדבר המעניין בהשקה הזו אינו העובדה שיש ל-Microsoft את תמלול הסטרימינג המדויק ביותר. אלא הקצב: אצווה בספטמבר, סטרימינג באוקטובר, באותה משפחה, על אותו משטח docs, עם מבנה תמחור שנע כעת בין $1.67 ל-$9.00 ל-1,000 דקות עבור אותה יכולת בסיסית. זה נותן לצוותים בחירה אמיתית בפעם הראשונה — לשלם על זמן אמת רק היכן שזמן אמת חשוב, ולעבד באצווה את כל השאר — אבל זה גם אומר ששכבת התמלול היא כעת משהו שמכווננים לפי עומס עבודה במקום לתקנן פעם אחת.
קראו את הטענה בכותרת כפשוטה והיא מחזיקה כהצהרת ספק: מיקרוסופט אומרת ש-MAI-Transcribe-2-Streaming הוא הראשון הן בדיוק של תמלול סופי והן בדיוק של תמלול חלקי ראשון, ושהוא נמצא על חזית Pareto. הכוכביות הן שללוח המעקב של הטראקר טרם שרטט את המודל, שהיתרון שהוא טוען לו על המוביל הנוכחי קטן מספיק כדי להיעלם בהרצה חוזרת, שיתרון המחיר הוא אפס, ושסיפור הדיאריזציה טרם סופר. אלה הדברים שכדאי לשים לב אליהם, לא הכתר.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
