
MAI-Transcribe-2-Streaming לעומת MAI-Transcribe-2: שלמו פי 5.4 עבור תזמון ברמת המילה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
MAI-Transcribe-2-Streaming ו-MAI-Transcribe-2 הם אותה משפחת מודלים המפוצלת לשתי מדרגות תמחור, והפיצול נקי מספיק כדי לתכנן לפיו. MAI-Transcribe-2 שוחרר ב-3 בספטמבר 2026 כמודל אצווה: שיעור שגיאות מילים של 2.0% בלוח ה-non-streaming של Artificial Analysis, בערך פי 411 מזמן אמת, ו-$0.10 לשעת אודיו — כ-$1.67 ל-1,000 דקות. MAI-Transcribe-2-Streaming שוחרר ב-1 באוקטובר 2026 כגרסת זמן אמת: שיעור שגיאות מילים מוצהר של 2.5% בזרימה, ב-0.13 שניות עד לתמלול סופי, אשר מיקרוסופט מתארת כראשונה בדיוק גם בתמלולים סופיים וגם בתמלולים חלקיים, נמדד לפי המתודולוגיה של Artificial Analysis לזרימה ולא כשורה שמופיעה עדיין בלוח המעקב. $0.54 לשעת אודיו — כ-$9.00 ל-1,000 דקות. אותם 60 שפות, אותה הפצה ב-API בלבד, ללא משקלים מפורסמים. הזרימה עולה פי 5.4 מתעריף האצווה, ולפי המספרים של מיקרוסופט עצמה, 0.5 נקודות דיוק. האם זה מציאה או מס תלוי כולו בשאלה אחת: האם משהו בצינור שלך זקוק לתמלול לפני שהמשפט נגמר?
מכיוון ששני המודלים מגיעים מספק אחד וממשטח תיעוד אחד, ההשוואה נקייה באופן יוצא דופן — בלי ניחושים לגבי שוויון תכונות, בלי אי-התאמה בין גרסאות בנצ׳מרק, בלי "המספרים שלהם מול המספרים שלנו". מדובר בספק יחיד שמתמחר שתי מהירויות של אותה יכולת, והעבודה המעניינת היא להבין אילו עומסי עבודה השכבה הזולה באמת מכסה.
המשפחה, בשתי שורות
• MAI-Transcribe-2 — אצווה, אודיו שהוקלט מראש, שוחרר ב-3 בספטמבר 2026. 2.0% AA-WER, במקום השני בלוח התוצאות ללא סטרימינג של Artificial Analysis. בערך פי 411 מזמן אמת, גם במקום השני. $0.10 לשעת אודיו, כ-$1.67 ל-1,000 דקות, כמבצע לזמן מוגבל עד סוף השנה, ללא מחיר סטנדרטי שפורסם. כולל דיאריזציה של דוברים ומחזיר חותמות זמן ברמת המילה. 60 שפות עם זיהוי שפה אוטומטי.
• MAI-Transcribe-2-Streaming — תמלול רציף בזמן אמת בסגנון WebSocket, שיצא ב-1 באוקטובר 2026. מיקרוסופט מדווחת על WER של 2.5% בתמלול הסופי 0.13 שניות לאחר סיום הדיבור, ואותם 2.5% בתמלול החלקי הראשון לאחר 0.12 שניות, שאותם היא מתארת כהישג ראשון מבחינת דיוק בשני המדדים — טענת ספק שנמדדה לפי מתודולוגיית הסטרימינג של Artificial Analysis, אם כי נכון למועד כתיבת הדברים הלוח של העוקב עצמו (37 מודלים) טרם שיבץ את המודל, והמוביל הנוכחי בו הוא Grok Voice Transcribe 2.0 עם 2.73% ו-0.49 שניות. 0.54 דולר לשעת אודיו, כ-9.00 דולר ל-1,000 דקות, מחיר היכרות עד סוף השנה. 60 שפות עם זיהוי שפה רציף אוטומטי. אין טענה מפורסמת בנוגע לדיאריזציה, ואין טענה מפורסמת בנוגע לחותמות זמן של מילים.
האסימטריה היחידה שאינה קשורה למהירות או למחיר היא היכולת: הדיאריזציה וחותמות הזמן של מילים במודל האצווה הן תכונות מתועדות, ואילו אלו של מודל הסטרימינג לא. זה חשוב יותר מפער הדיוק של 0.5 נקודות, וזו הסיבה שצוותים רבים ימצאו את עצמם מריצים את שניהם.

מה 5.4× actually קונה
במחיר של 1.67 דולר ל-1,000 דקות, תמלול באצווה ברמת הדיוק הזו הוא כמעט בחינם מבחינת עלות שולית. במחיר של 9.00 דולר ל-1,000 דקות, סטרימינג הוא סעיף הוצאה ממשי — בערך העלות של תמלול אותו אודיו חמש פעמים, בתוספת חצי נקודת דיוק. אז השאלה אינה אם זמן אמת שווה יותר; היא אילו דקות ספציפיות זקוקות לו.
מטלות העבודה שבהן זה ברור לחלוטין: כתוביות חיות שאדם קורא בזמן שהדובר מדבר, שבהן 0.13 שניות לעומת סוף-הקובץ הן כל המוצר; סיוע לנציגים בזמן אמת וניקוד תאימות, שבהם התערבות שמגיעה אחרי שהשיחה הסתיימה חסרת ערך; ויישומי קול אינטראקטיביים, שבהם תור שיחה אינו יכול להושלם עד שהתמלול מושלם. בכל שלושת אלה, מודל האצווה אינו אפשרות זולה יותר — הוא אינו אפשרות כלל: אין מחיר שבו תמלול בדיעבד הופך לזמן אמת.
עומסי העבודה שבהם הוא בבירור אינו מתאים: הקלטות פגישות ושיחות שמעובדות בדיעבד, ארכיוני מדיה, בקרת איכות אצוותית במוקדי שירות, סקירת ציות של שיחות שהושלמו, כתוביות לפודקאסטים ולווידאו. אלו בדיוק צינורות העיבוד שבהם מהירות של פי 411 מזמן אמת והתעריף של $1.67 של מודל האצווה נבנו כדי לנצח, ולשלם פי 5.4 כדי לחסוך כמה מאות מילישניות מתמלול שאיש לא קורא עד מחר הוא בזבוז מובהק. תוסיפו לכך את תכונות הדיאריזציה וחותמות הזמן ברמת המילה — במודל האצווה הן מתועדות, במודל הזרימה לא — והטיעון לבדיעבד מתחזק, ולא נחלש.
האמצע המעניין הוא המקום שבו השניים באמת משלימים זה את זה: להריץ סטרימינג עבור המשטח החי ואצווה עבור התיעוד. שיחת תמיכה שמתומללת בזמן אמת כדי להניע פאנל סיוע לנציג, ואז מתומללת מחדש באצווה במהלך הלילה כדי להפיק את התמלול הארכיוני עם דיאריזציה וחותמות זמן, עולה תוספת קטנה לעומת אצווה בלבד ומקבלת את שתי ההתנהגויות. דפוס זה הפך לאפשרי רק בספטמבר, וגרסת אוקטובר היא זו שמשלימה אותו.
היכן שמבנה שתי החטיבות מופיע
יש שני דברים במשפחה הזו הראויים לתשומת לב, משום שהם מבניים ולא אגביים.
ראשית, היררכיית הדיוק הפוכה מהדפוס הרגיל. מודלי סטרימינג בדרך כלל משלמים מחיר דיוק מהותי עבור פלט בזמן אמת; כאן המחיר הוא 0.5 נקודות, מ-2.0% בלוח האצווה ל-2.5% כנטען בלוח הסטרימינג. Microsoft השיגה מודל בזמן אמת במרחק של חצי נקודה ממודל האצווה המוביל שלה לפי המספרים שלה עצמה, וזה ההישג ההנדסי האמיתי של מהדורת אוקטובר אם הוא מחזיק מעמד — לא המיקום בראש הלוח, שאותו הרצה חוזרת טובה יכולה להזיז, ושאותו העוקב טרם אישר.
שנית, גם התמחור הפוך מהדפוס המקובל. ספקים בדרך כלל מעניקים הנחה על שכבת הנפח הגבוה; מיקרוסופט תמחרה את הסטרימינג ב-5.4× לעומת batch והשאירה את שניהם בתעריפי היכרות שפג תוקפם באותו מועד. זה נקרא פחות כפרמיית סטרימינג מכוונת ויותר כשתי השקות נפרדות שכל אחת מהן נושאת הנחת השקה, בלי תעריף תקן מפורסם לאף אחת מהן. צוותים המתכננים תקציב ל-2027 צריכים להתייחס לשני המספרים כזמניים — גם ה-1.67$ וגם ה-9.00$ מסומנים כמוגבלים בזמן, ולאף אחד מהם אין מחיר מחליף מוכרז.

מה שלא הוכח עדיין
השאלות הפתוחות של מודל ה-batch מספטמבר עדיין פתוחות: אין שיעור שגיאת דיאריזציה מפורסם, אין פירוט לפי שפה מאחורי הטענה בדבר 60 שפות, ומחיר מבצעי בלי יורש שנקוב בשמו. מודל ה-streaming מוסיף עוד אחת שספציפית לעבודה בזמן אמת — WER של streaming נמדד על אודיו נקי, ואיכות תמלול חלקי בזרם רועש מטווח רחוק היא מצב הכשל שהכי חשוב בפריסה והכי פחות מכוסה בחומר ההשקה. הוא גם יורש את הצפיפות של לוח ה-streaming: שלושת הראשונים בלוח 37 המודלים של ה-tracker נמצאים בתוך שבריר נקודה, כך ש"ראשון" הוא מצב שהרצה חוזרת יכולה לשנות — והמקום הראשון של מיקרוסופט הוא טענה ולא שורה.
אולם, השאלה ברמת המשפחה היא זו שכדאי לשים לב אליה. מיקרוסופט מוכרת כעת את אותה יכולת בשני מחירים שנבדלים פי חמישה, כאשר בשכבה היקרה חסרים שני מאפיינים שהשכבה הזולה מתעדת. אם דיאריזציה וחותמות זמן של מילים יגיעו ל-SKU של הסטרימינג, הפער יצטמצם לפשרה בין השהיה למחיר בלבד, וזו החלטה פשוטה בהרבה. אם הן לא יגיעו, מבנה שתי החטיבות קבוע, ויש לבנות ארכיטקטורות סביבו.
לאן זה משאיר סטאק תמלול

התוצאה המעשית היא שתמלול הפסיק להיות סעיף יחיד בספטמבר והפך להחלטת ניתוב באוקטובר. צינור עיבוד שהתרגל להתבסס על API אחד רוצה כעת סטרימינג למשטח החי, עיבוד באצווה לתיעוד, וכלל שקובע איזה אודיו ילך באיזה נתיב — והכלל הזה הוא בעצמו בעיית ניתוב, כמות מוזרה של מורכבות לנחות במחזור שחרור של ספק אחד.
המכה החזקה ביותר נופלת על מה שיושב מעל התמלול. לא משנה איזו שכבה מייצרת את הטקסט, הטקסט הזה עובר לאחר מכן סיכום, סיווג, השחרה וניתוב, והשלבים האלה רצים על מודלי שפה עם פרופילי השהיה ועלות משלהם — תמלול חי רוצה מודל מהיר וזול, ותמלול ארכיוני יכול להרשות לעצמו מודל חזק יותר. OrcaRouter מכסה בדיוק את השכבה הזו: API אחד על פני יותר מ-200 מודלים, מחירי מחירון של הספקים המועברים הלאה ב-0% תוספת, מעבר אוטומטי בין ספקים בעת תקלה, ו-DSL לניתוב שבוחר מודל לפי עומס עבודה ולא לפי צינור עיבוד. לא MAI-Transcribe-2-Streaming ולא MAI-Transcribe-2 נמצאים ברשימה הזו — שניהם מוגשים דרך מחסנית הדיבור של מיקרוסופט עצמה — אבל שכבת תמלול בעלת שתי חטיבות היא הטיעון החזק ביותר עד כה בעד שמירה על ניידות של כל מה שנמצא במורד הזרימה ממנה.
הסיכום הישיר: סטרימינג אינו גרסה טובה יותר של MAI-Transcribe-2; זהו מוצר שני במחיר שני. קנו אותו עבור הדקות שבאמת חייבות להיות בזמן אמת, השאירו את השאר במסלול הזול, וקחו בחשבון בתקציב ששני התעריפים יתומחרו מחדש כשתסתיים תקופת ההיכרות.
