
MAI-Transcribe-2 הושק: הצעד של מיקרוסופט ב-0.10 דולר לשעה לכיבוש תחום דיבור-לטקסט
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 הוא המודל שמיקרוסופט AI מהמרת שיהפוך את המרת הדיבור לטקסט למוצר בסיסי ולא לתכונת פרימיום, והנתונים שאיתם הוא הושק מהונדסים כדי לבסס טענה זו. הוא שוחרר ב-3 בספטמבר 2026 לתצוגה מקדימה ציבורית ב-Microsoft Foundry, ב-MAI Playground ובממשקי ה-API של מיקרוסופט עצמה, והוא מודל הדיבור השלישי של מיקרוסופט בחמישה חודשים — אחרי MAI-Transcribe-1 באפריל במחיר 0.36$ לשעת אודיו ו-MAI-Transcribe-1.5 ביוני — והראשון שמקדים את כל מתחרה מנוהל שהוא מזכיר בשני המדדים שלפיהם צוותים בוחרים בפועל. בלוח הדירוג הלא-סטרימינג של Artificial Analysis לשיעור שגיאות מילים, הוא ניצב במקום השני עם 2.0% AA-WER, ובקצב של בערך פי 411 מזמן אמת, מה שביחד מציב אותו על חזית פארטו של דיוק ומהירות: בלוח הזה, אין מודל שהוא גם מדויק יותר וגם מהיר יותר. מחיר ההשקה נמוך בכ-72% ממחיר קודמו.
"המודל לזיהוי הדיבור המהיר, המדויק והזול ביותר בעולם" היא כותרת הפרסום של מיקרוסופט עצמה לשחרור הזה, והיא ראויה להיקרא עם הכוכביות של החומר המקורי מצורפות אליה. זהו סיפור ההשקה כפי שהתרחש בפועל, עם טענות הספק שמסומנות והחלקים שעדיין זקוקים להוכחה מופרדים החוצה.
מה מיקרוסופט שחררה בפועל
MAI-Transcribe-2 הוא מודל תמלול אצוותי לעיבוד הקלטות מוקלטות מראש, המיועד בעיקר לאודיו ארוך-טווח — פגישות, שיחות, ארכיוני מדיה והקלטות של מוקדי שירות. מיקרוסופט ממקמת אותו בדיוק עבור עומסי העבודה שבהם התפוקה והעלות לדקה הן השיקולים המרכזיים. הוא מתמלל ב־60 שפות עם זיהוי שפה אוטומטי, כולל הפרדת דוברים המייחסת מילים לאדם הנכון, מחזיר חותמות זמן ברמת המילה, ותומך בכיוונון מילות מפתח עבור שמות, ראשי תיבות וטרמינולוגיה תחומית. שני סגנונות תמלול הניתנים להגדרה מכסים את החלוקה המקובלת: "verbatim" (מילולי), השומר על מילות מילוי והתחלות כושלות עבור תמלולים בדרגת ציות, ו-"clean" (נקי), שמסיר חוסר רהיטות עבור כתוביות והערות. מיקרוסופט גם מציינת מעברי קוד בדיבור מעורב-שפות כמו הינגליש וספאנגליש, ועמידות באודיו רועש מהעולם האמיתי.

סיפור הזמינות חשוב לא פחות מרשימת התכונות. מיקרוסופט אינה נועלת זאת מאחורי מחסנית הדיבור הארגונית שלה: המודל ניתן להדגמה כבר היום מה-MAI Playground ומוגש דרך Microsoft Foundry בתצוגה מקדימה ציבורית, כשהתיעוד של Foundry נמצא תחת שירות Azure AI Speech. זו בחירת הפצה מכוונת — להציב את המודל החלוצי במקום שבו מפתח יכול לגשת אליו באמצעות מפתח, ולא במקום שבו מחזור מכירות ארגוני צריך לאשר זאת תחילה. מיקרוסופט לא פרסמה את משקלי המודל, ושום דבר בחומרי ההשקה לא מרמז שהיא תעשה זאת.
קריאת הכותרת כפשוטה
"המהיר, המדויק והזול ביותר בעולם" – אלו שלוש טענות ברמות חוזק שונות, ופוסט ההשקה עצמו מחליש בשקט שתיים מהן. הגרסה הכנה של כל אחת:
• דיוק — בלוח המובילים של Artificial Analysis, MAI-Transcribe-2 מדורג שני עם 2.0% AA-WER, לא ראשון; גם בגוף הטקסט של מיקרוסופט עצמה כתוב שני. הניסוח "המדויק ביותר" שורד רק אם קוראים אותו כ"בקרב ממשקי API אצווה מנוהלים שמופיעים ברמה זו," וגם אז מדובר בטענה על מודל בן ארבעה ימים, לא בכתר מוסכם. מיקרוסופט מדווחת בנפרד שהוא ראשון במדד הרב-לשוני FLEURS, עם ממוצע WER של 5.2% על פני 60 השפות שלו — נתון שמגיע מפוסט ההשקה של מיקרוסופט, וטרם נגזר באופן בלתי תלוי לכל שפה.
• מהירות — לפי Artificial Analysis, MAI-Transcribe-2 פועל בקצב של בערך פי 411 מזמן אמת, שני בלוח זה. למרבה הפלא, ההכרזה של מיקרוסופט עצמה אף פעם לא מציגה את המספר המוחלט; במקום זאת היא פותחת במכפילים יחסיים ידידותיים יותר — "עיבוד מהיר עד פי 10 מהמתחרים המובילים, במיוחד לאודיו ארוך", ובאופן ספציפי פי 10 מהר יותר מ-GPT-Transcribe של OpenAI, פי 7 מהר יותר מ-Scribe v2 של ElevenLabs, ופי 5 מהר יותר מ-Gemini 3.5 Transcribe. היחסים האלה הם המסגור של מיקרוסופט לאותם נתונים של Artificial Analysis, וקצבי הבסיס חשובים: "פי 5 מהר יותר מ-Gemini 3.5 Transcribe" נשמע כמו פער צנוע, עד שמתרגמים אותו לדקות חישוב לכל שעת אודיו.
• הזול ביותר — נכון רק במסגרת שני סייגים שמיקרוסופט מציינת במפורש. התעריף של 0.10 דולר הוא "הצעה לזמן מוגבל עד סוף השנה," ולא נחשף שום מחיר תקני לאחר המבצע בשום מקום בחומרי ההשקה. והוא הזול ביותר מבין ממשקי API מנוהלים בעלי דיוק גבוה; מודל פתוח המארח את עצמו כמו Whisper Large v3 Turbo עדיין מתמלל למעשה בעלות החשמל. הטיעון של סחורה הוא אמיתי — הוא פשוט צר יותר מהכותרת.

מה $1.67 לכל 1,000 דקות קונה
במחיר של 0.10$ לשעת אודיו, MAI-Transcribe-2 מסתכם בכ־1.67$ לכל 1,000 דקות אודיו. ההשוואה שממחישה את גודל המספר היא מול ממשקי התמלול המנוהלים האחרים שמתחרים ברמת הדיוק. GPT-Transcribe מתומחר ב־4.50$ לכל 1,000 דקות; מסלול התמלול של קבצים שהוקלטו מראש של Gemini 3.5 Transcribe מגיע בערך ל־5$ לכל 1,000 דקות לפי התמחור מבוסס הטוקנים של Google; ה־Scribe v2 של ElevenLabs מתומחר גבוה עוד יותר. על 1,000 שעות אודיו בחודש — עומס רציני אך לא אדיר של מוקדי שירות או מדיה — הפער בין MAI-Transcribe-2 בתעריף ההרשמה המוקדמת לבין GPT-Transcribe במחירון הרשמי הוא בסדר גודל של 170$ בחודש, חודש אחרי חודש, וזאת לפני שמתחשבים בהבדלי הדיוק. זהו פער המחירים שגורם לתמלול להפסיק להיות סעיף שצוותים מייעלים ולהפוך לסעיף שהם מתעלמים ממנו.
שתי הסתייגויות צריכות להיאמר באותה נשימה. ראשית, מחיר מבצע הוא ניסוי תמחור, עד שהוא מפסיק להיות כזה: צוותים שבונים מוצר על התעריף של $0.10 צריכים לדעת שהתעריף הרגיל אינו מפורסם, והמספר התכנוני הכנה לתקציב 2027 נמצא איפשהו בין הצעת ההשקה לבין מה שמיקרוסופט תנקוב כשהמבצע יסתיים. שנית, "הזול ביותר ברמת דיוק זו" אינו אומר דבר על עלות הבעלות הכוללת — המודל מוצע אך ורק דרך API, כך שההשוואה שחשובה לצוותים בעלי נפח גדול היא $1.67 לכל 1,000 דקות מול העלות המלאה של הפעלת מחסנית משקלים פתוחים משלהם, ולא רק מול ממשקי API אחרים.
כשדוחסים את זה ללוח תוצאות, עמדת הפתיחה נראית כך — כל נתון שלמטה נושא את תווית המקור שצורפה לו בגוף הכתבה שלמעלה.

מה שלא הוכח עדיין
עם כל הספציפיות של טענות ההשקה, שלושה דברים באמת פתוחים. הראשון הוא סטרימינג: MAI-Transcribe-2 הוא מודל אצווה, סיפור המהירות של מיקרוסופט הוא על תפוקת קבצים, ואף SKU בזמן אמת לא הוכרז או הודגם — ה"411×" אינו מדד שהייה לתמלול חי. השני הוא איכות הדיאריזציה: שיוך דוברים כלול, אבל מיקרוסופט לא מפרסמת שיעור שגיאות דיאריזציה, וזו התכונה שסביר ביותר שתיראה גרוע יותר בבדיקות בלתי תלויות מאשר ה-WER. השלישי הוא הפילוח הרב-לשוני: ממוצע FLEURS יחיד על פני 60 שפות יכול להסתיר שונות רחבה בין שפות, ומיקרוסופט לא פרסמה את הטבלה לפי שפות. כל אחד מאלה הוא סיבה לכך שהסיפור אינו סגור ביום הרביעי.
לאן זה מוביל את מחסנית התמלול שלך
שום דבר מזה אינו מחייב בחירה ב-MAI-Transcribe-2 היום, וזו בדיוק הסיבה שהתמחור ראוי לתשומת לבם של צוותים שאינם מחפשים כרגע ספק חדש. המרת דיבור לטקסט היא רק לעתים נדירות סוף הצינור — תמלילים עוברים סיכום, טיפול, חיפוש וניתוב, והשכבה שבמורד הצינור היא המקום שבו מערך מרובה-מודלים מצדיק את קיומו. פלטפורמה כמו OrcaRouter קיימת עבור אותו חצי של הצינור: API אחד שמתחבר ל-200+ מודלים, מחירי המחירון של הספקים מועברים ב-0% תוספת, מעבר אוטומטי לגיבוי בעת תקלה, ו-DSL לניתוב שמאפשר לנתב תמליל למודל אחר לפי המשימה — פרוטוקול ישיבה למסכם אחד, סקירת ציות למסכם אחר — ללא אינטגרציה נוספת. MAI-Transcribe-2 עצמו אינו ברשימה זו נכון להיום; הוא פועל על ה-API של Microsoft ובפלטפורמות צד שלישי ש-Microsoft מציינת. אבל המחיר הקומודיטי שהוצג זה עתה הוא הטיעון החזק ביותר עד כה לבניית החלק שמעל התמליל כך שלא יהיה תלוי במודל.
מחיר ההשקה הוא זה שמסגיר את הכוונה. מיקרוסופט לא מנסה לנצח בזירת הדיבור-לטקסט על בסיס תכונות בלבד — היא מנסה להפוך דיוק גבוה לכל כך זול שהקטגוריה הזו מפסיקה להיות סעיף תקציבי. MAI-Transcribe-2 ראוי לתשומת הלב שהוא מקבל; רק קראו "המהיר, המדויק והזול ביותר בעולם" עם שלושת הכוכביות שמצורפות: מקום שני ב-AA-WER, מחירי קידום מכירות עד סוף השנה, וסיפור סטרימינג שעדיין לא סופר.
