
MAI-Transcribe-2 לעומת Muse Voice Transcribe: באותו שבוע, שני הימורים הפוכים על אודיו
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
השבוע של 1 בספטמבר 2026 הניב שני מודלי דיבור משתי מעבדות מובילות, ו-MAI-Transcribe-2 ו-Muse Voice Transcribe מובנים בצורה הטובה ביותר כתשובות הפוכות לשאלה היכן צריכה לחיות האינטליגנציה השמעית. Muse Voice Transcribe, ששוחרר על ידי Meta Superintelligence Labs ב-1 בספטמבר, הוא מודל תפיסת שמע בזמן אמת: הוא מתמלל, מפריד בין יותר מעשרים דוברים, ומזהה מתי דובר סיים, הכל במעבר סטרימינג אחד על פני מקטעים של 80 אלפיות שנייה של שמע חי, והוא מוביל את טבלת הדיבור-לטקסט הסטרימינג שבה נמדד. MAI-Transcribe-2, ששוחרר על ידי Microsoft יומיים לאחר מכן, ב-3 בספטמבר, הוא ההימור ההפוך: מנוע אצווה שאינו רודף כלל אחר השהיה בזמן אמת, ובמקום זאת משקיע הכל בתמלול קבצים מוקלטים מראש עם שיעור שגיאות המילים הטוב ביותר בטבלה העצמאית שאינה סטרימינג, בערך פי 411 מזמן אמת, בכ-1.67 דולר לכל 1,000 דקות. השוואה ביניהם זה מול זה כמודלי תמלול מסתירה את ההחלטה האמיתית, שנוגעת לרגע בחיי האודיו שבו אתה צריך את המילים: בזמן שהוא מתרחש, או לאחר שהוא נגמר.
שני מוצרים שכוונו אליהם ברגעים שונים
Muse Voice Transcribe נועד לרגע שבו האודיו עדיין מתרחש. זהו מודל אוטורגרסיבי רב-מודלי במשפחת Muse של Meta, שמאחד שלוש משימות במעבר אחד: זיהוי דיבור אוטומטי, הפרדה בין דוברים ליותר מעשרים דוברים, וזיהוי סוף דיבור (endpointing) — זיהוי שהדובר הפסיק לדבר כדי שהמערכת תוכל להגיב. Meta מדווחת שהתמלול הסופי מגיע כ-0.16 שניות לאחר שהדובר מפסיק, עם שיעור שגיאות מילים של 3.1% בתמלולים הסופיים ו-3.6% בתמלולים החלקיים הראשונים — נתונים ש-Meta פרסמה ביום ההשקה, תוך ציטוט טבלת המובילים לסטרימינג של Artificial Analysis, ושטרם שוחזרו באופן בלתי תלוי נכון לכתיבת שורות אלה. הוא מסוגל לטפל באודיו באורך של יותר משעה בזרם יחיד, מחליף שפות באמצע משפט, ואומן על יותר מ-70 שפות, כאשר 25 מהן אומתו ביסודיות בעת ההשקה. מחירו הוא 3.00 דולרים לכל 1,000 דקות של אודיו, בערך 0.18 דולר לשעה, דרך ה-Meta Model API. Meta אישרה שהמשקלים לא ייפתחו.
MAI-Transcribe-2 מותאם לרגע שבו האודיו כבר נמצא כקובץ. המודל של מיקרוסופט משיג 2.0% AA-WER בלוח התוצאות הלא-סטרימינג של Artificial Analysis — מקום שני, והמספר הטוב ביותר מבין ממשקי ה-API האצוותיים המנוהלים — ופועל במהירות של בערך פי 411 מזמן אמת, שזה מדד תפוקה, לא הבטחת השהיה. הוא מתמלל ב-60 שפות עם זיהוי שפה אוטומטי, כולל הפרדת דוברים, חותמות זמן ברמת מילה, הטיית מילות מפתח, וסגנונות של תמלול מילולי לעומת נקי, ומטפל במעברי שפה כמו הינגליש וספאנגליש. הוא זמין דרך Microsoft Foundry בתצוגה מקדימה ציבורית וב-MAI Playground במחיר של 0.10 דולר לשעת אודיו כהצעה לזמן מוגבל עד סוף השנה, ללא מוצר סטרימינג שהוכרז. פוסט ההשקה של מיקרוסופט ממקם אותו במפורש עבור אודיו ארוך-טווח ואצוותי — עומסי העבודה שבהם השהיה נמוכה של מודל סטרימינג היא חסרת ערך, אבל העלות לדקה שלו אינה חסרת ערך.

מדוע שני מספרי הדיוק אינם מתנגשים
האינסטינקט הטבעי הוא להשוות 2.0% ל-3.1% ולהכריז על מנצח, וזה יהיה שגוי בכפליים. ראשית, המספרים מודדים משימות שונות: 2.0% של MAI-Transcribe-2 הוא דיוק לא-סטרימינג על אודיו מוקלט מראש, שבו המודל יכול להסתכל על כל הקובץ; 3.1% של Muse Voice Transcribe הוא דיוק סטרימינג על תמלילים סופיים, שהופק תחת האילוץ של תמלול בזמן שהאודיו מגיע. סטרימינג היא הבעיה הקשה יותר, ולכן לוח התוצאות לסטרימינג ולוח התוצאות ללא-סטרימינג הם לוחות נפרדים עם ציונים נפרדים. שנית, לתוויות יש משקל שונה: הנתון של MAI-Transcribe-2 הוא מדידה של Artificial Analysis למודל, ואילו הנתון של Muse Voice Transcribe הוא דיווח של Meta מיום ההשקה על מה ש-Artificial Analysis מדד — דיווח של ספק שלא שוחזר. ההצהרה הכנה היא ששני המודלים הם טענות אמינות בראש הלוחות שלהם, ואף מספר לא אומר לך דבר על המסלול השני.
הדיאריזציה היא התחום שבו מתנהלת ההשוואה האמיתית, כי היא התכונה היחידה ששני המוצרים כוללים — וגם התחום שבו אפשר לראות בבירור את השוני בשאיפותיהם. {{1}}Muse Voice Transcribe מפריד בין יותר מעשרים דוברים כיכולת סטרימינג בסיסית; Meta מדווחת על אחוז שגיאת דיאריזציה ממוצע של 17.5% לעומת טווח של 21.1% עד 28.6% שהיא מייחסת למתחרים — שוב, דיווח מטעם Meta שלא אומת.{{/1}} {{2}}MAI-Transcribe-2 מציעה גם היא דיאריזציה, אבל Microsoft לא מפרסמת שום תקרת דוברים ואף לא שום אחוז שגיאת דיאריזציה.{{/2}} {{3}}לשיחה דו-צדדית, שני המוצרים מתאימים וההבדל ביניהם אינו משמעותי.{{/3}} {{4}}ואולם לקבוצת מיקוד של שנים-עשר משתתפים או להקלטת פאנל, Muse Voice Transcribe הוא היחיד מבין השניים שתקרת הדוברים המרובים שלו מוצהרת,{{/4}} {{5}}והדיאריזציה הבלתי-נמדדת של MAI-Transcribe-2 היא הסיבה הגדולה ביותר לבחון אותה לפני שמפקידים בידה אודיו קשה יותר.{{/5}}
השוואת המחירים שהגיונית
במחיר, השניים קרובים יותר ממה שמסגרת ההשוואה בין עיבוד קבוצתי לסטרימינג מרמזת, שכן 1.67$ ל-1,000 דקות (MAI-Transcribe-2, במחיר מוקדם) ו-3.00$ ל-1,000 דקות (Muse Voice Transcribe) שניהם בקצה הזול של שירותי זיהוי דיבור מנוהלים. ההשוואה תקפה רק בתוך מסלול אחד. לצורך תמלול קבוצתי של הקלטות מראש, MAI-Transcribe-2 עולה פחות מחצי ממחיר המודל המותאם לסטרימינג, ובמקביל מציע WER טוב יותר שאינו תלוי בסטרימינג — אבל הייתם מנתבים קבצים מוקלטים ל-Muse Voice Transcribe רק אם הייתם רוצים ספציפית את צינור הסטרימינג שלו, וזו לא הדרך היעילה לעבד ארכיון. עבור אודיו חי של פגישות, Muse Voice Transcribe הוא המוצר היחיד במאמר הזה שעובד בכלל, והתעריף שלו של 3.00$ נמוך יותר ממחירי ממשקי התמלול בזמן אמת האחרים שאיתם הוא הושק — Gemini 3.5 Transcribe Live בכ-9$ ל-1,000 דקות, ו-GPT Live Transcribe ב-17$ — והוא מוסיף הפרדת דוברים ליותר מעשרים דוברים, שאותם מוצרים אינם משיגים. כותרת המחיר הכנה היא שמטה הציבה מחיר נמוך לסטרימינג ומיקרוסופט הציבה מחיר נמוך עוד יותר לעיבוד קבוצתי, ושני המספרים הם תמחור של תקופת השקה שייסחף ברגע שכל ספק יפרסם את התעריף הסטנדרטי שלו.

איזה אחד לאיזה אודיו
אם האודיו שלכם חי — פגישות שמתומללות בזמן אמת, סוכני קול, כתוביות חיות, כל דבר שצריך את המילים בזמן שהן נאמרות — Muse Voice Transcribe הוא הבחירה, וזה לא קרוב. זה מודל הסטרימינג היחיד כאן, הוא מפריד יותר מעשרים דוברים באותו מעבר, והתמחור שלו נועד לנצח בנתיב הזה מהיום הראשון. החולשות שלו הן אלו שכדאי לקחת לניסוי: נתוני הדיוק והדייריזציה הם מדווחים על ידי Meta, ומודל סטרימינג בן שבוע עוד לא הראה כיצד הוא מתנהג על האודיו המבולגן שקיים מחוץ למדדי ההשקה.
אם האודיו שלך כבר בקבצים — ארכיונים, הקלטות שיחות, ספריות מדיה, כל דבר שמעובד בכמויות גדולות — {{1}}MAI-Transcribe-2{{/1}} הוא הבחירה הטובה יותר בכל פרמטר שחשוב: WER מדוד נמוך יותר, תפוקה גבוהה בערך פי עשרה, ומחיר ל-1,000 דקות נמוך יותר משל מודל הסטרימינג. הסיכונים שלו הם תמונת מראה של אלה של {{2}}Muse{{/2}}: הוא בן ארבעה ימים, אין לו SKU לסטרימינג, איכות הדיאריזציה לא נמדדה, ויש לו תעריף מוקדם שמאחוריו עומד מחיר רגיל שלא פורסם.
דף ההשקה של מיקרוסופט שמציג את MAI-Transcribe-2 מפרט את התכונות שמיקרוסופט מצרפת יחד, והמתחרה שמציע סטרימינג אינו מספק באותו מעבר; זהו המסמך שצריך לבדוק כשמחליטים אילו טענות מגובות בשטח מוצר ואילו עדיין רק הבטחות למדדי ביצוע.

ואם התמליל הוא רק המחצית הראשונה של הצינור שלכם, הבחירה בין שני אלה חשובה פחות מהבחירה שאתם עושים מעליהם. שמע פגישה חיה שתומלל באמצעות Muse Voice Transcribe עדיין דורש סיכום, חילוץ פריטי פעולה וניסוח הודעות מעקב לפני שהוא שימושי; שיחות ארכיון שתומללו באמצעות MAI-Transcribe-2 עדיין יש לחפש בהן, להשחירן או לנתב אותן למערכת ההמשך הנכונה. זוהי השכבה שבה פלטפורמה מרובת־מודלים מוכיחה את ערכה — ה-API האחד של OrcaRouter על פני 200+ מודלים, עם מחירי המחירון של הספקים שמועברים הלאה בתוספת 0%, מאפשר לעבודת ההמשך לקרוא למודל אחר לכל עומס עבודה באמצעות אינטגרציה אחת, כך שלא משנה איזה מודל דיבור יזכה בפיילוט שלכם, המחסנית שמעל התמליל לא תצטרך להיבנות מחדש כדי להחליף מודל. לא Muse Voice Transcribe ולא MAI-Transcribe-2 נמצאים ברשימה הזו כיום; שניהם מתקיימים על ממשקי ה-API של הספקים שלהם. ההימור שבאמת הוכרע השבוע הוא צר ושימושי יותר: גם תמלול בזמן אמת וגם תמלול אצווה הפכו זה עתה לזולים דיים, כך שהמבדיל אינו עוד המילים — אלא מה שאתם עושים איתן.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
