כרטיס הירו של מאמר המציג את 'MAI-Transcribe-2-Streaming לעומת MAI-Transcribe-2' עם התג 'אותה משפחה · שתי רמות תמחור' וכותרת המשנה 'שלם פי 5.4 עבור תזמון ברמת המילה', בנוי כשני כרטיסי שמות דגמים המופרדים בתג VS, עם רצועת צ'יפים המציגה $9.00 לעומת $1.67 ל-1,000 דקות, שיעור שגיאת מילים מוצהר של 2.5% לעומת 2.0% מבוקר, 0.13 שניות לתמלול סופי לעומת בערך פי 411 מזמן אמת, וחתימות זמן בתוספת דיאריזציה בדרגת האצווה בלבד, על גבי גרדיאנט לבן-כחול עם לוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

MAI-Transcribe-2-Streaming לעומת MAI-Transcribe-2: שלמו פי 5.4 עבור תזמון ברמת המילה

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

MAI-Transcribe-2-Streaming ו-MAI-Transcribe-2 הם אותה משפחת מודלים המפוצלת לשתי מדרגות תמחור, והפיצול נקי מספיק כדי לתכנן לפיו. MAI-Transcribe-2 שוחרר ב-3 בספטמבר 2026 כמודל אצווה: שיעור שגיאות מילים של 2.0% בלוח ה-non-streaming של Artificial Analysis, בערך פי 411 מזמן אמת, ו-$0.10 לשעת אודיו — כ-$1.67 ל-1,000 דקות. MAI-Transcribe-2-Streaming שוחרר ב-1 באוקטובר 2026 כגרסת זמן אמת: שיעור שגיאות מילים מוצהר של 2.5% בזרימה, ב-0.13 שניות עד לתמלול סופי, אשר מיקרוסופט מתארת כראשונה בדיוק גם בתמלולים סופיים וגם בתמלולים חלקיים, נמדד לפי המתודולוגיה של Artificial Analysis לזרימה ולא כשורה שמופיעה עדיין בלוח המעקב. $0.54 לשעת אודיו — כ-$9.00 ל-1,000 דקות. אותם 60 שפות, אותה הפצה ב-API בלבד, ללא משקלים מפורסמים. הזרימה עולה פי 5.4 מתעריף האצווה, ולפי המספרים של מיקרוסופט עצמה, 0.5 נקודות דיוק. האם זה מציאה או מס תלוי כולו בשאלה אחת: האם משהו בצינור שלך זקוק לתמלול לפני שהמשפט נגמר?

מכיוון ששני המודלים מגיעים מספק אחד וממשטח תיעוד אחד, ההשוואה נקייה באופן יוצא דופן — בלי ניחושים לגבי שוויון תכונות, בלי אי-התאמה בין גרסאות בנצ׳מרק, בלי "המספרים שלהם מול המספרים שלנו". מדובר בספק יחיד שמתמחר שתי מהירויות של אותה יכולת, והעבודה המעניינת היא להבין אילו עומסי עבודה השכבה הזולה באמת מכסה.

המשפחה, בשתי שורות

• MAI-Transcribe-2 — אצווה, אודיו שהוקלט מראש, שוחרר ב-3 בספטמבר 2026. ‏2.0% AA-WER, במקום השני בלוח התוצאות ללא סטרימינג של Artificial Analysis. בערך פי 411 מזמן אמת, גם במקום השני. $0.10 לשעת אודיו, כ-$1.67 ל-1,000 דקות, כמבצע לזמן מוגבל עד סוף השנה, ללא מחיר סטנדרטי שפורסם. כולל דיאריזציה של דוברים ומחזיר חותמות זמן ברמת המילה. 60 שפות עם זיהוי שפה אוטומטי.

• MAI-Transcribe-2-Streaming — תמלול רציף בזמן אמת בסגנון WebSocket, שיצא ב-1 באוקטובר 2026. מיקרוסופט מדווחת על WER של 2.5% בתמלול הסופי 0.13 שניות לאחר סיום הדיבור, ואותם 2.5% בתמלול החלקי הראשון לאחר 0.12 שניות, שאותם היא מתארת כהישג ראשון מבחינת דיוק בשני המדדים — טענת ספק שנמדדה לפי מתודולוגיית הסטרימינג של Artificial Analysis, אם כי נכון למועד כתיבת הדברים הלוח של העוקב עצמו (37 מודלים) טרם שיבץ את המודל, והמוביל הנוכחי בו הוא Grok Voice Transcribe 2.0 עם 2.73% ו-0.49 שניות. 0.54 דולר לשעת אודיו, כ-9.00 דולר ל-1,000 דקות, מחיר היכרות עד סוף השנה. 60 שפות עם זיהוי שפה רציף אוטומטי. אין טענה מפורסמת בנוגע לדיאריזציה, ואין טענה מפורסמת בנוגע לחותמות זמן של מילים.

האסימטריה היחידה שאינה קשורה למהירות או למחיר היא היכולת: הדיאריזציה וחותמות הזמן של מילים במודל האצווה הן תכונות מתועדות, ואילו אלו של מודל הסטרימינג לא. זה חשוב יותר מפער הדיוק של 0.5 נקודות, וזו הסיבה שצוותים רבים ימצאו את עצמם מריצים את שניהם.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

מה 5.4× actually קונה

במחיר של 1.67 דולר ל-1,000 דקות, תמלול באצווה ברמת הדיוק הזו הוא כמעט בחינם מבחינת עלות שולית. במחיר של 9.00 דולר ל-1,000 דקות, סטרימינג הוא סעיף הוצאה ממשי — בערך העלות של תמלול אותו אודיו חמש פעמים, בתוספת חצי נקודת דיוק. אז השאלה אינה אם זמן אמת שווה יותר; היא אילו דקות ספציפיות זקוקות לו.

מטלות העבודה שבהן זה ברור לחלוטין: כתוביות חיות שאדם קורא בזמן שהדובר מדבר, שבהן 0.13 שניות לעומת סוף-הקובץ הן כל המוצר; סיוע לנציגים בזמן אמת וניקוד תאימות, שבהם התערבות שמגיעה אחרי שהשיחה הסתיימה חסרת ערך; ויישומי קול אינטראקטיביים, שבהם תור שיחה אינו יכול להושלם עד שהתמלול מושלם. בכל שלושת אלה, מודל האצווה אינו אפשרות זולה יותר — הוא אינו אפשרות כלל: אין מחיר שבו תמלול בדיעבד הופך לזמן אמת.

עומסי העבודה שבהם הוא בבירור אינו מתאים: הקלטות פגישות ושיחות שמעובדות בדיעבד, ארכיוני מדיה, בקרת איכות אצוותית במוקדי שירות, סקירת ציות של שיחות שהושלמו, כתוביות לפודקאסטים ולווידאו. אלו בדיוק צינורות העיבוד שבהם מהירות של פי 411 מזמן אמת והתעריף של $1.67 של מודל האצווה נבנו כדי לנצח, ולשלם פי 5.4 כדי לחסוך כמה מאות מילישניות מתמלול שאיש לא קורא עד מחר הוא בזבוז מובהק. תוסיפו לכך את תכונות הדיאריזציה וחותמות הזמן ברמת המילה — במודל האצווה הן מתועדות, במודל הזרימה לא — והטיעון לבדיעבד מתחזק, ולא נחלש.

האמצע המעניין הוא המקום שבו השניים באמת משלימים זה את זה: להריץ סטרימינג עבור המשטח החי ואצווה עבור התיעוד. שיחת תמיכה שמתומללת בזמן אמת כדי להניע פאנל סיוע לנציג, ואז מתומללת מחדש באצווה במהלך הלילה כדי להפיק את התמלול הארכיוני עם דיאריזציה וחותמות זמן, עולה תוספת קטנה לעומת אצווה בלבד ומקבלת את שתי ההתנהגויות. דפוס זה הפך לאפשרי רק בספטמבר, וגרסת אוקטובר היא זו שמשלימה אותו.

היכן שמבנה שתי החטיבות מופיע

יש שני דברים במשפחה הזו הראויים לתשומת לב, משום שהם מבניים ולא אגביים.

ראשית, היררכיית הדיוק הפוכה מהדפוס הרגיל. מודלי סטרימינג בדרך כלל משלמים מחיר דיוק מהותי עבור פלט בזמן אמת; כאן המחיר הוא 0.5 נקודות, מ-2.0% בלוח האצווה ל-2.5% כנטען בלוח הסטרימינג. Microsoft השיגה מודל בזמן אמת במרחק של חצי נקודה ממודל האצווה המוביל שלה לפי המספרים שלה עצמה, וזה ההישג ההנדסי האמיתי של מהדורת אוקטובר אם הוא מחזיק מעמד — לא המיקום בראש הלוח, שאותו הרצה חוזרת טובה יכולה להזיז, ושאותו העוקב טרם אישר.

שנית, גם התמחור הפוך מהדפוס המקובל. ספקים בדרך כלל מעניקים הנחה על שכבת הנפח הגבוה; מיקרוסופט תמחרה את הסטרימינג ב-5.4× לעומת batch והשאירה את שניהם בתעריפי היכרות שפג תוקפם באותו מועד. זה נקרא פחות כפרמיית סטרימינג מכוונת ויותר כשתי השקות נפרדות שכל אחת מהן נושאת הנחת השקה, בלי תעריף תקן מפורסם לאף אחת מהן. צוותים המתכננים תקציב ל-2027 צריכים להתייחס לשני המספרים כזמניים — גם ה-1.67$ וגם ה-9.00$ מסומנים כמוגבלים בזמן, ולאף אחד מהם אין מחיר מחליף מוכרז.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

מה שלא הוכח עדיין

השאלות הפתוחות של מודל ה-batch מספטמבר עדיין פתוחות: אין שיעור שגיאת דיאריזציה מפורסם, אין פירוט לפי שפה מאחורי הטענה בדבר 60 שפות, ומחיר מבצעי בלי יורש שנקוב בשמו. מודל ה-streaming מוסיף עוד אחת שספציפית לעבודה בזמן אמת — WER של streaming נמדד על אודיו נקי, ואיכות תמלול חלקי בזרם רועש מטווח רחוק היא מצב הכשל שהכי חשוב בפריסה והכי פחות מכוסה בחומר ההשקה. הוא גם יורש את הצפיפות של לוח ה-streaming: שלושת הראשונים בלוח 37 המודלים של ה-tracker נמצאים בתוך שבריר נקודה, כך ש"ראשון" הוא מצב שהרצה חוזרת יכולה לשנות — והמקום הראשון של מיקרוסופט הוא טענה ולא שורה.

אולם, השאלה ברמת המשפחה היא זו שכדאי לשים לב אליה. מיקרוסופט מוכרת כעת את אותה יכולת בשני מחירים שנבדלים פי חמישה, כאשר בשכבה היקרה חסרים שני מאפיינים שהשכבה הזולה מתעדת. אם דיאריזציה וחותמות זמן של מילים יגיעו ל-SKU של הסטרימינג, הפער יצטמצם לפשרה בין השהיה למחיר בלבד, וזו החלטה פשוטה בהרבה. אם הן לא יגיעו, מבנה שתי החטיבות קבוע, ויש לבנות ארכיטקטורות סביבו.

לאן זה משאיר סטאק תמלול

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

התוצאה המעשית היא שתמלול הפסיק להיות סעיף יחיד בספטמבר והפך להחלטת ניתוב באוקטובר. צינור עיבוד שהתרגל להתבסס על API אחד רוצה כעת סטרימינג למשטח החי, עיבוד באצווה לתיעוד, וכלל שקובע איזה אודיו ילך באיזה נתיב — והכלל הזה הוא בעצמו בעיית ניתוב, כמות מוזרה של מורכבות לנחות במחזור שחרור של ספק אחד.

המכה החזקה ביותר נופלת על מה שיושב מעל התמלול. לא משנה איזו שכבה מייצרת את הטקסט, הטקסט הזה עובר לאחר מכן סיכום, סיווג, השחרה וניתוב, והשלבים האלה רצים על מודלי שפה עם פרופילי השהיה ועלות משלהם — תמלול חי רוצה מודל מהיר וזול, ותמלול ארכיוני יכול להרשות לעצמו מודל חזק יותר. OrcaRouter מכסה בדיוק את השכבה הזו: API אחד על פני יותר מ-200 מודלים, מחירי מחירון של הספקים המועברים הלאה ב-0% תוספת, מעבר אוטומטי בין ספקים בעת תקלה, ו-DSL לניתוב שבוחר מודל לפי עומס עבודה ולא לפי צינור עיבוד. לא MAI-Transcribe-2-Streaming ולא MAI-Transcribe-2 נמצאים ברשימה הזו — שניהם מוגשים דרך מחסנית הדיבור של מיקרוסופט עצמה — אבל שכבת תמלול בעלת שתי חטיבות היא הטיעון החזק ביותר עד כה בעד שמירה על ניידות של כל מה שנמצא במורד הזרימה ממנה.

הסיכום הישיר: סטרימינג אינו גרסה טובה יותר של MAI-Transcribe-2; זהו מוצר שני במחיר שני. קנו אותו עבור הדקות שבאמת חייבות להיות בזמן אמת, השאירו את השאר במסלול הזול, וקחו בחשבון בתקציב ששני התעריפים יתומחרו מחדש כשתסתיים תקופת ההיכרות.