כרטיס הירו של מאמר עם הכיתוב 'MAI-Transcribe-2-Streaming לעומת Gemini 3.5 Transcribe Live', עם התג 'ראש בראש · דיבור-לטקסט בזרימה' והכתובית 'אותם 9$, טרייד שונה', עם צ'יפים שמציגים 2.5% כנטען לעומת 4.00% באודיט, 0.13s לעומת 0.40s עד לתוצאה הסופית, 60 שפות לעומת 85+, וללא דיאריזציה מפורסמת באף אחד מהשניים, מעל גרדיאנט לבן-לכחול עם הלוגו של OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

MAI-Transcribe-2-Streaming מול Gemini 3.5 Transcribe Live: אותו $9, עסקה שונה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

MAI-Transcribe-2-Streaming ו-Gemini 3.5 Transcribe Live עולים אותו סכום כסף ובנויים על תיאוריות מנוגדות לגבי מה שמתמלל זרימה נועד לעשות. שניהם מגיעים לבערך $9.00 לכל 1,000 דקות של אודיו בזרימה. המודל של מיקרוסופט, שיצא ב-1 באוקטובר 2026, הוא מכשיר דיוק: שיעור שגיאות מילים בזרימה מוצהר של 2.5% בזמן של 0.13 שניות עד לתמלול סופי, הראשון מבחינת דיוק הן בתמלולים סופיים והן בתמלולים חלקיים לפי הצהרת מיקרוסופט עצמה, נמדד לפי מתודולוגיית הזרימה של Artificial Analysis אך טרם הוצג כשורה בלוח שלהם. המודל האחר, בתצוגה מקדימה ציבורית מאז 26 באוגוסט 2026 ומוגש דרך Live API, הוא כלי כיסוי: יותר מ-85 שפות עם החלפה תוך כדי זרימה, מסלול חינמי, ושיעור שגיאות מילים בזרימה של 4.00% ב-0.40 שניות, הנתון ש-Artificial Analysis מודד עבורו. אף אחד מהם אינו הבחירה המובנת מאליה, והסיבה היא שהם בעצם לא מתחרים על אותו עומס עבודה.

הנה ההשוואה ראש בראש כפי שהמספרים באמת נקראים — נתונים שדווחו על ידי הספק מסומנים, נתוני הטראקר מיוחסים, והחלקים שבהם מודל אחד מנצח במימד שהאחר כלל אינו מתחרה בו.

הגרסה בשורה אחת

• דיוק וזמן השהיה — MAI-Transcribe-2-Streaming, לפי המספרים שפורסמו. מיקרוסופט טוענת ל-WER של 2.5% בזרימה וב-0.13 שניות לתמלול סופי, ראשון בדיוק הן בתמלולים סופיים והן בתמלולים חלקיים, ו-2.5% בתמלול החלקי הראשון ב-0.12 שניות. לעומת זאת, ל-Artificial Analysis יש את Gemini 3.5 Transcribe Live ב-4.00% ב-0.40 שניות. היתרון המוצהר של מיקרוסופט הוא 1.5 נקודות ומהירות התייצבות גדולה פי שלושה בערך. ההסתייגות היא שהעוקב עדיין לא הציג את MAI-Transcribe-2-Streaming עצמו — המוביל הנוכחי בלוח הוא Grok Voice Transcribe 2.0 עם 2.73% ו-0.49 שניות, כאשר Muse Voice Transcribe עם 3.06% ו-0.16 שניות — כך ש-2.5% הוא נתון ספק הנקרא מול שדה שהעוקב כן מודד. זו אינה הכרעה צמודה על הציר ששני המודלים מפרסמים, אך רק צד אחד שלו מפורסם באופן עצמאי.

• רוחב לשוני — Gemini 3.5 Transcribe Live. יותר מ-85 שפות עם זיהוי אוטומטי והיכולת להחליף שפה באמצע הזרם בלי להפעיל מחדש את הסשן, וזו ההצהרה המרכזית של Google עבור Live API.‏ MAI-Transcribe-2-Streaming מכסה 60 שפות עם זיהוי שפה רציף ואוטומטי. הרצפה של Microsoft גבוהה יותר; התקרה של Google רחבה יותר, ופער 25 השפות הוא בעיקר בשפות שבהן מודל הזרמה חד-לשוני אינו שמיש כלל.

• אופי הסשן — Gemini 3.5 Transcribe Live, והדבר הזה פועל לשני הכיוונים. ה-Live API הוא סשן WebSocket המוגבל ל-10 דקות, מה שמתאים לתור של סוכן קולי אך לא נוח לפגישה בת שעה; Microsoft אינה מפרסמת תקרת סשן מקבילה למודל הסטרימינג שלה, מה שחשוב אם יחידת העבודה שלך היא שיחה, ולא תור בשיחה.

• עלות כניסה — Gemini 3.5 Transcribe Live. יש חבילה חינמית, והתעריף המשולב של גוגל מסתכם לכ-0.009 דולר לדקה בתמחור מבוסס טוקנים. 0.54 דולר לשעת אודיו של מיקרוסופט הוא תעריף היכרות שמיקרוסופט אומרת שתקף עד סוף השנה, בלי שמחיר תקני פורסם — אותו מבנה כמו השקת האצווה שלה בספטמבר.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

מדוע פער הדיוק גדול יותר ממה שהוא נראה

פער של 1.5 נקודות בשיעור שגיאות מילים נשמע כמו הבדל של עיגול מספרים — עד שמתמחרים אותו. בשיעור WER זורם של 4.00%, Gemini 3.5 Transcribe Live טועה בכ-40 מילים לכל 1,000; ב-2.5% המוצהרים של מיקרוסופט, MAI-Transcribe-2-Streaming טועה ב-25. בהיקפים שצינור עיבוד בזמן אמת מייצר — ארגון תמיכה שמפעיל 5,000 שעות שיחות בחודש הוא 300,000 דקות, יותר מ-45 מיליון מילים בקצבי שיחה — הפער הזה מסתכם במיליוני מילים שגויות בשנה, מרוכזות בישויות שמערכות במורד הזרם תלויות בהן: שמות חשבונות, מספרי פניות, מינונים, כתובות.

ההבדל בהשהיה הוא הקשה יותר למכור. 0.13 שניות לעומת 0.40 שניות לאחר סיום הדיבור מורגש בזרם כתוביות חי — מתחת לכ-0.2 שניות נתפס כבו-זמני, ושליש שנייה נתפס כתמלול שרודף אחרי הדובר — אבל זה לא מורגש בפאנל סיוע לנציג שמתעדכן בסולם זמן אנושי. אם הצרכן שלך הוא אדם שקורא תוך כדי, היתרון של Microsoft בהשהיה הוא המוצר. אם הצרכן שלך הוא מודל שמקבל את התמלול הסופי כשהתור מסתיים, זה מספר.

שני המספרים נושאים את אותה הסתייגות, וראוי לומר זאת פעם אחת: אלה מספרים מהרצה בודדת מתוך לוח מעקב עם 37 מודלים, והפער בין הראשון לשלישי בלוח הזה קטן מנקודה. הרצה חוזרת יכולה לערבב את צמרת לוח המובילים של הסטרימינג באופן שפער של שתי נקודות בלוח האצווה לא יכול. וגם 2.5% של מיקרוסופט עדיין לא נמצאים בלוח בכלל — זוהי טענת ספק שנמדדה לפי המתודולוגיה של העוקב, וזה שונה משורה שהעוקב מפרסם.

הגבולות הם המקום שבו ההחלטה למעשה מתקיימת.

מגבלות תכונות מפרידות בין השניים הללו מהר יותר משעושים הבנצ'מרקים, והם פועלים בכיוונים מנוגדים.

Gemini 3.5 Transcribe Live נושא שלוש מגבלות מתועדות: תקרת פגישה של 10 דקות ב-Live API, אין דיאריזציה של דוברים, ואין חותמות זמן ברמת המילה. הראשונה היא ארכיטקטונית — לסטרימינג דרך פגישת WebSocket יש תקרה מעצם התכנון — והיא אומרת שתמלול חי ארוך־טווח חייב להיות מוטלא בין פגישות, כשהטיפול בתפר נשאר באחריותך. השתיים האחרונות הן מוחלטות: אם המוצר שלך צריך לייחס דיבור לדובר, או למקם מילה בחותמת זמן לצורך חיפוש או סנכרון כתוביות, Gemini 3.5 Transcribe Live לא עושה זאת בשום מחיר.

המגבלות של MAI-Transcribe-2-Streaming מתועדות פחות, וזה כשלעצמו מידע. מיקרוסופט אינה טוענת לדיאריזציה עבור מודל הסטרימינג ואינה טוענת גם לחותמות זמן ברמת המילה; MAI-Transcribe-2 באצווה כולל דיאריזציה ומחזיר חותמות זמן ברמת המילה, אבל זהו מוצר האצווה, וההנחה שה-SKU של הסטרימינג יורש אותן היא בדיוק סוג ההסקה שחומר ההשקה נועד למנוע. מה שמיקרוסופט כן טוענת הוא 60 שפות עם זיהוי שפה רציף ומיקום בחזית פארטו במונחים של דיוק מול השהיה — שתי הצהרות ספק שנתוני הטרקר עולים בקנה אחד איתן.

אז הקריאה הכנה של התכונות היא: אף אחד משני מודלי הסטרימינג לא מפרסם דיאריזציה או חותמות זמן של מילים. ל-Gemini 3.5 Transcribe Live יש מגבלת סשן מפורסמת ושכבה חינמית; ל-MAI-Transcribe-2-Streaming יש מספר שפות מפורסם וללא מגבלה מפורסמת. אם הדרישות שלך כוללות דיאריזציה, אף אחד מאלה אינו הפתרון ואתה מסתכל על תמלול באצווה עם שכבת סטרימינג שהולבשה מלפנים.

מה ששוויון המחירים באמת אומר לך

העובדה המעניינת ביותר בהשוואה הזו היא ששני ספקים מגיעים לאותם 9 דולר ל-1,000 דקות מכיוונים מנוגדים. גוגל הגיעה לשם באמצעות תמחור מבוסס טוקנים בהפעלת Live API: אודיו נכנס ב-3.50 דולר למיליון טוקנים, טקסט יוצא ב-21 דולר למיליון, וצריכה גסה של 175 טוקני טקסט לדקה, שמתמזגת לכ-0.009 דולר לדקה. מיקרוסופט הגיעה לשם על ידי הצגת תעריף קבוע של 0.54 דולר לשעת אודיו עבור מודל במשפחה שהאח ה-batch שלה פועל ב-0.10 דולר. אחד הוא הפעלה בזמן אמת עם מדידה; האחר הוא תעריף קבוע לדקה עם הנחת היכרות.

המבנים האלה מתנהגים אחרת ככל שאתם מתרחבים. תעריף אחיד הוא צפוי וקל לתקצוב; הפעלה שנמדדת לפי טוקנים משתנה בהתאם לכמה המודל מחזיר תשובות ובכמה זמן ההפעלה נשארת פתוחה ללא פעילות. עבור צינור עיבוד בנפח גבוה, התעריף האחיד הוא החשבונית הידידותית יותר; עבור אב-טיפוס או תכונה בנפח נמוך, המסלול החינמי וחיוב לפי טוקן הם נקודת הכניסה הידידותית יותר.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

מה שאף אחד מהמבנים לא משנה הוא השכבה שמעל לתמלול. לא משנה איזה מודל מפיק אותו, תמלול חי הוא קלט לסיכום, סיווג, השחרה וניתוב, ולשלבים האלה יש עקומות עלות ואיכות משלהם — שלרוב מורצים על פני כמה מודלים ולא על פני אחד. זו השכבה ש-OrcaRouter מכסה: API אחד על פני יותר מ-200 מודלים, מחירי מחירון של הספקים מועברים הלאה בתוספת של 0%, מעבר אוטומטי לגיבוי, ו-DSL לניתוב שיכול לשלוח תמלול למודלים שונים בהתאם לעומס העבודה. לא MAI-Transcribe-2-Streaming ולא Gemini 3.5 Transcribe Live נמצאים ברשימה הזו — הם מוגשים דרך מערכות הדיבור של מיקרוסופט ושל גוגל בהתאמה — והנקודה אינה לנתב אותם, אלא לשמור על ניידות של כל מה שנמצא במורד הזרם מהם.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

איזה אחד לבחור?

בחרו ב-MAI-Transcribe-2-Streaming כאשר הדיוק וזמן ההתייצבות הם המוצר: כתוביות חיות שאדם קורא, ניקוד תאימות או איכות בזמן אמת שבהם לישות שנשמעה לא נכון יש מחיר, או מפגשים ארוכים שתקרת 10 הדקות של Gemini תאלץ אתכם לתפור יחד. בחרו ב-Gemini 3.5 Transcribe Live כאשר הכיסוי הוא המוצר: פריסה גלובלית על פני שפות שאינכם יכולים למנות מראש, החלפת שפות באמצע הזרם, או אב טיפוס שבו המסלול החינמי וחיוב לפי טוקנים מסירים את ההתחייבות. צוותים שזקוקים לשניהם אינם תקועים — אלה שני ממשקי API שונים עם מודלים שונים של סשן, והארכיטקטורה הכנה היא לנתב לפי עומס העבודה ולא לתקנן סביב אחד מהם.

הטענה שכדאי לקחת מההשוואה הזו אינה שמיקרוסופט ניצחה. היא שלתמלול בזרימה יש כעת שתי אפשרויות חזיתיות אמינות במחיר זהה, מה שאומר שההחלטה עברה מ"מה זמין" ל"מה עומס העבודה הספציפי הזה צריך". זו בעיה טובה יותר להתמודד איתה.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית