
MAI-Transcribe-2 נגד GPT Transcribe: מיקרוסופט חותרת תחת התמלול של OpenAI בכל מספר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
שלושה מספרים מפרידים בין MAI-Transcribe-2 ל-GPT Transcribe, וכל אחד מהם מצביע לאותו כיוון. בלוח המובילים של Artificial Analysis לקצב שגיאות מילים שאינו סטרימינג, MAI-Transcribe-2, ש-Microsoft השיקה ב-3 בספטמבר 2026, רושם 2.0% AA-WER, לעומת 3.31% עבור GPT Transcribe, ממשק התמלול של OpenAI להקלטות מוקלטות מראש, שהושק חמישה שבועות קודם לכן, ב-28 ביולי 2026. במדד המהירות של אותו לוח, MAI-Transcribe-2 פועל בקצב של בערך פי 411 מזמן אמת, לעומת בערך פי 34 של GPT Transcribe. ובמחיר, MAI-Transcribe-2 עולה $0.10 לשעת אודיו — כ-$1.67 ל-1,000 דקות במסגרת מבצע השקה לזמן מוגבל — לעומת $4.50 ל-1,000 דקות של GPT Transcribe. הפער הזה הוא חיתוך של 63% במחיר, והוא נוחת על מוצר ש-OpenAI הוזילה ב-25% רק לפני שבועות. כך נראה שוק של מוצר קומודיטי, ברגע שמעבדה שנייה בחזית ה-AI מחליטה להתחרות על המחיר.
הפער, מספר אחד בכל פעם
דיוק קודם לכול, כי זה המספר שאף ספק לא יכול להסתתר מאחורי טענה שיווקית. ה-2.0% וה-3.31% מגיעים מאותו מתקן בדיקה עצמאי, Artificial Analysis, שהור� מול שני המודלים — וזה הופך את פער 1.3 הנקודות לעובדה הנקייה ביותר בכל ההשוואה הזו: בערך שלוש-עשרה שגיאות פחות לכל אלף מילים באותה רמת WER. ה-3.31% של GPT Transcribe היו בעצמם שיפור של כ-0.7 נקודות לעומת קודמו, GPT-4o Transcribe, והרצות רב-לשוניות של OpenAI עצמה הראו שהוא מצמצם בכמחצית את שיעורי השגיאות של תקופת Whisper. מיקרוסופט תפסה עכשיו את המקום השני באותו לוח תוצאות באופן חד-משמעי, ובמדד FLEURS הרב-לשוני היא מדווחת על ממוצע WER של 5.2% על פני 60 שפות — נתון שמגיע מהודעת ההשקה של מיקרוסופט, וטרם נגזר באופן עצמאי עבור כל שפה.
מהירות זה הדבר הבא. פי 34 בקירוב מזמן אמת של GPT Transcribe הוא אופייני לנקודת קצה אסינכרונית לתמלול: קובץ של שעה בערך בשתי דקות חישוב. MAI-Transcribe-2, בקצב של פי 411 בקירוב מזמן אמת, מתמלל את אותה שעה בפחות מתשע שניות חישוב. לפי המספרים של Artificial Analysis, הפער האמיתי קרוב יותר לפי 12; מיקרוסופט משווקת את זה כ"מהיר פי 10 מ־GPT-Transcribe של OpenAI," וזו ספקית שמעגלת את היתרון של עצמה כלפי מטה במקום כלפי מעלה — סימן חריג. הסתייגות הכנה היא שהנתון של MAI-Transcribe-2 בן ארבעה ימים ומתייחס לתפוקת קבצים בקבוצות, לא לשהייה בזמן אמת, ואילו לנתון של GPT Transcribe יש חמישה שבועות של תעבורת ייצור מאחוריו. אבל שום דבר בארכיטקטורה של שני המוצרים לא מצביע על כך שפער המהירות ייסגר; הם בנויים לאותה עבודת קבוצה ביעילות שונה מאוד.
מחיר אחרון, כי הוא המספר שמשנה החלטות. GPT Transcribe מתומחר ב-{{1}}$0.0045 לדקה{{/1}} — {{2}}$4.50 לכל 1,000 דקות{{/2}}, כ-{{3}}$0.27 לשעת אודיו{{/3}} — לאחר שקיצוץ יולי של OpenAI הוריד אותו מ-{{4}}$0.006{{/4}} של GPT-4o Transcribe. MAI-Transcribe-2 מתומחר ב-{{5}}$0.10 לשעת אודיו{{/5}} עד סוף השנה, ללא מחיר סטנדרטי שנחשף לתקופה שלאחר המבצע. על 1,000 שעות אודיו בחודש, הפער הוא כ-{{6}}$170{{/6}}: בערך {{7}}$100{{/7}} בתעריף ההרשמה המוקדמת של MAI-Transcribe-2 לעומת בערך {{8}}$270{{/8}} במחיר הרשום של GPT Transcribe. הקיצוץ של {{9}}25%{{/9}} ביולי נראה אגרסיבי; ההנחה של {{10}}63%{{/10}} של מיקרוסופט ביחס למחיר שאחרי הקיצוץ היא קטגוריה אחרת של מהלך, והיא כל הסיבה לכך שההשוואה הזאת קיימת.

למה המספר של OpenAI היה המהימן
יש סיבה לכך שה-AA-WER של GPT Transcribe, שעמד על 3.31%, נשא משקל רב יותר מרוב מספרי ההשקה: הוא נבדק בביקורת עצמאית, והביקורת שרדה מפגש עם אודיו קשה. אותה הרצה של Artificial Analysis שהפיקה את נתון הכותרת חשפה גם את נקודת התורפה של GPT Transcribe — WER של 6.10% על ערכת שיחות הרווחים של Earnings22, מדד הייחוס הציבורי הקשה ביותר בקטגוריה — מה שאמר ללקוחות בדיוק לאן לא לכוון אותה. אחר כך הגיעו חמישה שבועות של תעבורת ייצור, והורדת המחיר של OpenAI הראתה שהחברה מתחרה על עלות, במקום להגן על המרווח. GPT Transcribe גם יורשת את האילוץ המעשי של ה-API שלה: היא מיועדת לעיבוד אצווה בלבד, קבצים עד 25 מגה-בייט לבקשה; אין מסלול סטרימינג במחיר 4.50 דולר, אין הפרדת דוברים, אין הטיית אוצר מילים, ואין תמיכה בשפות ש-OpenAI לא פרסמה. היא מתמללת; כל מה שמעבר למילים הוא הבעיה של הלקוח.
הבהירות הזו היא שהפכה את GPT Transcribe לכזה שקל לסמוך עליו, וזו בדיוק הבהירות שמודל בן ארבעה ימים טרם זכה לה. מיקרוסופט לא פרסמה שיעור שגיאות דיאריזציה עבור MAI-Transcribe-2, לא טבלת דיוק לפי שפה מאחורי ממוצע ה-FLEURS שלו ב-60 שפות, ולא SKU לסטרימינג. אף אחת מההשמטות האלה לא אומרת שהמודל חלש — דיאריזציה מצורפת וטביעת רגל של 60 שפות מהוות שטח פנים מוצרי אמיתי ש-GPT Transcribe אפילו לא מציע — אבל כל אחת מהן היא נקודה שבה הרצה חוזרת עצמאית יכולה לשכתב את הסיפור. ציון הדיוק נמדד על ידי AA והוא אמיתי; המוצר שמסביבו אינו מוכח בדיוק בדרכים שרק תעבורת ייצור חושפת.
קבוצות התכונות אינן באותה צורה
• דיאריזציה — MAI-Transcribe-2 כולל ייחוס דוברים, ללא פרסום שיעור שגיאה; GPT Transcribe אינו מציע זאת כלל, ולכן התמליל מתקבל כזרם אחד בלתי מובחן.
• בקרה — MAI-Transcribe-2 מציע כיוון מילות מפתח לשמות ומונחים מקצועיים, וכן סגנונות תמלול מילוליים ונקיים; GPT Transcribe אינו מציע אף אחד מאלה, ומחזיר טקסט גולמי ונטול פיסוק שעל המתקשר לעבד לאחר מכן.
• חותמות זמן — שתיהן מחזירות פלט מיושר לזמן; אלה של MAI-Transcribe-2 הן ברמת מילה כברירת מחדל.
• שפות — MAI-Transcribe-2 מפרסם 60 עם זיהוי אוטומטי; GPT Transcribe אינו מפרסם את רשימת השפות שלו, וזו כשלעצמה בעיית תכנון עבור עומסי עבודה רב-לשוניים.
• סטרימינג — המסלול של $4.50 של GPT Transcribe הוא אצווה בלבד, ומוצר הסטרימינג המקביל, GPT Live Transcribe, הוא מוצר נפרד במחיר של $17 לכל 1,000 דקות; ל-MAI-Transcribe-2 אין מוצר סטרימינג כלל, לא הוכרז ולא הודגם.
• Shape — שניהם ממשקי API מנוהלים עבור קבצים שהוקלטו מראש, וזו הסיבה שההשוואה הזו הוגנת; ההבדל הוא שמיקרוסופט שילבה יותר מעיבוד הבתר (post-processing) השימושי במוצר הבסיסי, בשליש מהמחיר.

מי צריך לעבור, ומתי
אם אתם מתמללים אודיו בכמויות גדולות בבת אחת, והתעריף המוקדם שורד מפגש עם הקבצים שלכם, MAI-Transcribe-2 הוא ברירת המחדל הרציונלית כרגע: WER מדוד טוב יותר, תפוקה גבוהה בערך פי שתים־עשרה, ומחיר נמוך ב-63% לכל 1,000 דקות על מוצר שמאגד דיאריזציה ובקרת סגנון — ש-OpenAI לא גובה עליהן תוספת, כי היא לא מציעה אותן. המעבר עולה מעט: בדיקה על מדגם מהאודיו הקשה ביותר שלכם פותרת את רוב אי-הוודאות, והתעריף של $1.67 הופך את הניסוי לכמעט חינם עד סוף השנה.
אם עומס העבודה שלך הוא קריטי לייצור, כפוף לרגולציה, או כבר מקושר ל-OpenAI, יתרון חמשת השבועות והחולשה שפורסמה של Earnings22 שווים יותר מפער המחירים. GPT Transcribe הוא המודל שמצבי הכשל שלו אתה יכול לנקוב בשמם; של MAI-Transcribe-2 עדיין מתגלים. הדפוס הנבון הוא זה ששכבת ניתוב קיימת כדי לתמוך בו: להשאיר את המודל המוכח כברירת המחדל ולהעביר נתח מדוד של תעבורה למתמודד, תוך השוואת תמלילים על הנתונים שלך לפני שמקדמים משהו. משמעת הניסוי-ואז-קידום היא כל מטרתם של ה-failover האוטומטי ושל ה-DSL לניתוב של OrcaRouter — מודלים חדשים זוכים בתעבורת ייצור באחוזים, לא בצו, ואותה הגדרה עם מפתח יחיד המגיעה ל-200+ מודלים הופכת את יתרת המחסנית שמעל לספק התמלול לבלתי-תלויה בזהות הספק בזמן שתחרות ה-STT מתנהלת.
פוסט ההשקה שמאחורי המספרים של MAI-Transcribe-2 ממסגר הכול כהשוואה למתחרים בעלי שם ולא כנתונים אבסולוטיים — וזו בדיקת משמעת שימושית לכל מי שקורא אותו: קחו את הטענות היחסיות, מצאו את המספרים האבסולוטיים בלוח העצמאי, ותייגו את כל השאר כמסגור ספק.

התעריף של $1.67 כולל תאריך תפוגה, ול-2.0% יש מוניטין בן ארבעה ימים, ו-OpenAI תענה לשניהם בסופו של דבר. אבל הצורה של השוק הזה הרגע השתנתה: לראשונה, ממשק ה-API המנוהל הזול ביותר עם דיוק גבוה הוא גם המדויק ביותר וגם המהיר ביותר, והוא לא של OpenAI. גם אם המחיר הסטנדרטי של MAI-Transcribe-2 יהיה גבוה בהרבה מההצעה הראשונית, רף הדיוק-לדולר בתמלול מנוהל זז — והוא זז בתנאים של Microsoft.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
