
Voxtral Mini 4B Realtime Arabic לעומת MAI-Transcribe-2-Streaming: שני מוצרים שהגיעו באוקטובר, שתי בעיות ראיות
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
שבעה ימים מפרידים בין שני המודלים האלה של דיבור בזמן אמת, והם הגיעו בדרכים מנוגדות. MAI-Transcribe-2-Streaming הוא מודל התמלול בסטרימינג הראשון של Microsoft AI, שהוכרז ב-1 באוקטובר 2026 עם פוסט השקה, רשומת תצוגה מקדימה ב-Azure, מחיר היכרות של 0.54 דולר לשעת אודיו עד סוף השנה, וטענה להיות הראשון בלוח הסטרימינג של Artificial Analysis הן בדיוק התמלול הסופי והן בדיוק התמלול החלקי, בשיעור שגיאת מילים של 2.5%, כאשר הטקסט הסופי מוכן 0.13 שניות לאחר סיום הדיבור. Voxtral Mini 4B Realtime Arabic הוא מודל הסטרימינג לניבים ערביים של Mistral AI, שפורסם ב-Hugging Face ב-8 באוקטובר 2026 ללא כל הכרזה — אין פוסט בבלוג, אין מחיר, אין שירות, רק משקולות Apache 2.0 וכרטיס מודל המדווח על שיעור שגיאת תווים ממוצע של 8.82% על פני שבעה מדדי ערבית בהשהיה של 480 מילישניות. המודל של Microsoft הוא מוצר גמור עם כותרת שאינה ניתנת לאימות. המודל של Mistral הוא ארטיפקט שניתן לאימות וללא מוצר סביבו. שניהם ראויים להבנה בדיוק משום ששניהם משאירים את השאלה המרכזית — עד כמה זה מתמודד עם ערבית — כשהיא מקבלת מענה רק מהספק.
ההשוואה שווה בכל זאת, מפני ששני המודלים ממסגרים את אותה החלטה הנדסית משני קצוות מנוגדים. מיקרוסופט מוכרת רוחב ושירות מנוהל: 60 שפות עם זיהוי שפה רציף אוטומטי, פועל בתוך Azure AI Speech, מתומחר לפי שעה, בתצוגה מקדימה. Mistral מעניקה עומק: שש-עשרה וריאציות ערביות בעלות שם, קטנות מספיק כדי לפעול על מאיץ אחד, עם סקריפט נרמול כך שתוכלו לבדוק את הניקוד בעצמכם. אם אתם מקימים צינור תמלול ערבי החודש, אתם בוחרים בין שתי העמדות האלה, והבחירה תלויה בראיות שאין לכם עדיין בשני המקרים.
מה כל ספק בעצם אמר, ומה אומרים הלוחות
פער הראיות הוא המאפיין החשוב ביותר בהתמודדות הזו, ולכן הוא בא ראשון.
• MAI-Transcribe-2-Streaming — שיעור שגיאות מילים של 2.5% בתמלול הסופי ב-0.13 שניות לאחר תום הדיבור, ואותם 2.5% בתוצאות החלקיות הראשונות ב-0.12 שניות, כששניהם מוצגים במקום הראשון בדיוק לפי מתודולוגיית AA-WER Streaming של Artificial Analysis. זה המסגור של מיקרוסופט עצמה. נכון למועד כתיבת הדברים, לוח ה-Streaming של הטראקר לא שרטט שורה עבור המודל, כך שהטענה נשענת על המתודולוגיה של הטראקר בלי שמאחוריה מספר שפורסם על ידי הטראקר.
• Voxtral Mini 4B Realtime Arabic — שיעור שגיאת תווים ממוצע של 8.82% על פני שבעה benchmarks ערביים בהשהיה מוגדרת של 480 מילישניות. כרטיס הדגם של Mistral עצמה, עם קוד ההערכה שסופק. אף צד שלישי לא שחזר אותו, והמודל בן יומיים בלבד.
אז שני המספרים הבולטים במאמר הזה הם, בהתאמה, טענת ספק לפי הסרגל של מישהו אחר, וטענת ספק עם סרגל משלו מצורף. אף אחד מהם אינו מדידה בלתי תלויה. מה ששונה הוא שהמספר של Mistral מגיע עם סקריפט הנרמול שנדרש כדי לגזור אותו מחדש, ואילו זה של Microsoft מגיע עם לוח שעדיין לא הציב אותו על התרשים. אם אתם מקבלים החלטת רכש, ההבחנה הזו חשובה יותר מהפער של 2.5 מול 8.82, שהוא ממילא חסר משמעות — שיעור שגיאות מילים ושיעור שגיאות תווים אינם ניתנים להמרה, והכתיב הערבי מרחיב את הפער ביניהם באופן ניכר.
ההשוואה היחידה בתוך הכרטיס של Mistral שאכן מחזיקה היא זו מול האח הבלתי-מקוון שלה: Voxtral Transcribe Arabic ב-7.91% CER על אותם שבעה מבחנים עם אותו נרמול, כך שהזרמה עולה למודל הזה 0.91 נקודות אחוז. מיקרוסופט פרסמה נתון שקול עבור המשפחה שלה כשהשיקה את MAI-Transcribe-2 האצוותי ב-3 בספטמבר 2026 בשיעור שגיאת מילים של 2.0% — הגרסה הזורמת מוותרת על חצי נקודה מול מודל האצווה בעוד שהיא מוסיפה אספקה בזמן אמת. קראו את שתי הדלתאות הפנימיות-ספקיות האלה זו לצד זו, ותקבלו את ההצהרה היחידה במאמר הזה שמשווה תפוחים לתפוחים: על המבחנים של עצמן, ה-SKU הזורם של כל מעבדה מפגר אחרי אחיו האצוותי, בנקודה אחת בערך במקרה אחד וחצי נקודה במקרה האחר, ושתיהן מודדות שפות שונות.

כיסוי שפות: 60 מול 16, ואותו פער ללא שם בשני הצדדים
• MAI-Transcribe-2-Streaming — 60 שפות עם זיהוי שפה רציף אוטומטי, כך שסשן שמחליף שפות באמצע הזרם אינו צריך שהשפה תוצהר מראש. חומר ההשקה של Microsoft נותן את המספר ולא את הרשימה; תיעוד התמיכה בשפות של Azure עבור משפחת MAI-Transcribe הוא המקום שבו הכיסוי מפורט, והוא מתעד ערבית בין השפות הנתמכות במשפחה.
• Voxtral Mini 4B Realtime Arabic — שש עשרה וריאציות ערביות, המנויות כל אחת בשמה: ערבית תקנית מודרנית, מרוקאית, לובית, תוניסאית, אלג'יראית וערבית חסאניה, ערבית מפרצית, נג'דית, עומאנית וצנעאנית, ערבית מצרית וסודאנית, מסופוטמית וערבית לבנטינית דרומית וצפונית, וערבית צ'אדית. מחוץ לקבוצה זו המודל מתועד כמחוץ לתחום, עם הפניה אל Voxtral Mini 4B Realtime הכללי.
אף אחד משני המספרים לא אומר לך את מה שאתה צריך. ה־60 של מיקרוסופט הוא ספירת רוחב שכוללת ערבית בלי לתאר את הביצועים בערבית; פוסט ההשקה מציין את סך השפות פעם אחת וממשיך הלאה. ה־16 של מיסטרל הוא מנייה של יעדי אימון עם שיעור שגיאה מצטבר יחיד על פני שבע קבוצות מבחן, כלומר גם הפירוט ברמת הניב — הדבר שבאמת קובע אם אודיו השיחות המרוקאי שלך עובר תמלול — אינו מפורסם. שני מודלים, שני ספקים, ובשני המקרים התשובה הכנה לשאלה "עד כמה הוא טוב בערבית מפרצית ספציפית" היא: לא צוין.
מה שהמנייה כן נותנת לך הוא פריאור. מודל עם ערבית צ'אדית וערבית חסאניה כיעדים בשמם כוונן מול התפלגות צפון-אפריקאית; Mistral פיתחה אותו במשותף עם משרד המעבר הדיגיטלי והרפורמה המנהלית של מרוקו ובנתה שניים משבעת המדדים עם אותו משרד — ISMA ו-Darija in the Wild — במיוחד כדי למדוד את המקרים הקשים. מודל כללי של 60 שפות משתפר קודם כל בערבית ספרותית מודרנית, כי שם נמצא נפח אות האימון. אם האודיו שלך הוא דאריג'ה או ערבית מפרצית, אלו בעיות שונות, ורק אחד משני הספקים האלה נתן מספר לאחת מהן.
השהיה וצורת העיכוב
• MAI-Transcribe-2-Streaming — 0.13 שניות מסוף הדיבור לתמלול הסופי, ותמלולי ביניים ראשונים ב-0.12 שניות, מהירות מספיק כדי שתמלול הביניים והתמלול הסופי יהיו למעשה באותה השהיה. הטענה של Microsoft, כפי שנמדדה לפי המתודולוגיה של הטראקר.
• Voxtral Mini 4B Realtime Arabic — 480 מילישניות של השהיה מוגדרת בנקודת הדיוק שפורסמה, כשההשהיה ניתנת להתאמה. זה בערך פי שלושה וחצי מהנתון של Microsoft, וזה הפרמטר שהמפעיל בוחר בו ולא תכונה קבועה.
שלוש עשיריות השנייה הן הבדל של ממש עבור סוכן קולי שצריך להגיב באמצע אמירה, וכמעט בלתי נראות עבור אדם שקורא כתוביות. זה גם ההבדל בין חוגה למספר. פרמטר ההשהיה של Mistral מאפשר לך לפעול בצורה הדוקה יותר ולספוג יותר שגיאות, או בצורה רופפת יותר ולהחזיר לעצמך את הדיוק — מודל הבסיס שממנו עבר הצ'קפוינט הזה כיוונון עדין מצהיר על טווח מ-240 אלפיות שנייה ועד 2.4 שניות — ואילו נקודת ההפעלה של מיקרוסופט היא זו ש-Azure מספקת. זה הופך את הנתון של מיקרוסופט לקל יותר לניתוח ואת זה של Mistral לקל יותר לכוונון, וזה אומר שכל השוואה בין שני מספרי הדיוק היא למעשה השוואה בין שתי נקודות נבחרות על עקומה אחת לבין נקודה קבועה אחת על עקומה אחרת.
משטח התכונות שונה בדיוק באותה חדות, וכדאי לבדוק אותו מול דרישות הפייפליין שלך לפני שדיון הדיוק נעשה מעניין.
• MAI-Transcribe-2-Streaming — מסופק דרך Azure AI Speech עם מערך התכונות המתועד של המשפחה: דיאריזציה, חותמות זמן ברמת המילה, הטיית מילות מפתח וביטויים, סגנונות פלט מילוליים לעומת נקיים, וזיהוי שפה אוטומטי. התיעוד של ה-SKU הזורם עצמו עבור דיאריזציה וחותמות זמן דל יותר מזה של מודל האצווה, לכן יש לאמת אותם בנפרד לכל נקודת קצה במקום להניח שוויון.

• Voxtral Mini 4B Realtime Arabic — הכרטיס מתעד תמלול עם מקודד אודיו סיבתי, הגשת vLLM דרך WebSocket בכתובת /v1/realtime, תמיכה מקורית ב-Transformers מגרסה 5.2.0, ומודול נרמול. הוא אינו מתעד דיאריזציה או חותמות זמן ברמת המילה עבור נקודת ביקורת זו.
מודל אספקה: שירות תצוגה מקדימה לעומת משקלים להורדה
• MAI-Transcribe-2-Streaming — תצוגה מקדימה של Azure, כלומר ללא SLA והמלצת ספק שלא להסתמך עליה בסביבת ייצור. המחיר הוא $0.54 לשעת אודיו כתעריף היכרות עד סוף 2026, בעוד התעריף הרגיל לא פורסם; גרסת ה-batch של MAI-Transcribe-2 הושקה במחיר $0.10 לשעת אודיו על אותו בסיס של זמן מוגבל. הסטרימינג עולה פי 5.4 מתעריף ה-batch.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, כ-4.4 מיליארד פרמטרים ב-BF16, ניתן להורדה, ניתן לכוונון עדין, וניתן להגשה על מאיץ בודד. אין מחיר, אין SLA, ואין התחייבות לתמיכה, כי אין שירות מאחוריו.
שני המשפטים האלה מכילים את ההחלטה. שירות בתצוגה מקדימה עם תעריף היכרות ומחיר סטנדרטי שלא נחשף הוא התחייבות שתפוג; גם פרמיית הסטרימינג של פי 5.4 וגם החלון עד 2026 נתונים לשינוי בידי מיקרוסופט, והיחס בין אצווה לסטרימינג הוא המספר שכדאי לעקוב אחריו כשהתעריף הסטנדרטי ייכנס לתוקף. משקולות Apache 2.0 ללא הכרזה הן ההיפך: ארטיפקט שאיש לא יכול לקחת בחזרה, הקשור ליחסי ספק שאיש לא תיאר. האם הצ'קפוינט יתוחזק — אין לדעת, אבל הקובץ שיש לך היום ימשיך לעבוד בכל מקרה.
האילוץ הספציפי לענף הוא זה שבדרך כלל מכריע את השאלות האלה בפועל. פריסת מוקד טלפוני בערבית בתוך מוסד בפיקוח אולי לא תוכל בכלל לשלוח אודיו לנקודת קצה בענן במצב תצוגה מקדימה; צוות שכבר אימץ את Azure AI Speech כסטנדרט אולי לא ירצה מערכת מקומית נוספת עבור משפחת שפה אחת. שני האילוצים לגיטימיים, ולאף אחד מהם אין שום קשר לנתונים של 2.5% ו-8.82% שמוצגים בראש שתי ההשקות.
מעל שכבת התמלול, אותה נקודה חלה על שניהם. OrcaRouter לא מנתבת את אף אחד ממודלי הדיבור הללו — זהו השוואה של שתי מערכות שאיננו מספקים — אבל המסכם, המסווג או הסוכן שצורך את התמלול ניתנים לניתוב: יותר מ-200 מודלים על מפתח API אחד במחיר המחירון של הספק עם 0% תוספת, כך ששינוי במחיר של ספק מגיע לצד שלנו באותו יום, ומעבר אוטומטי לגיבוי אם ספק מתדרדר. המקום שבו זה עוזר ספציפית כאן הוא שלב הניסיון: לכוון את שני מועמדי התמלול אל צינור עיבוד בהמשך אחד, מאחורי מפתח אחד, זו הדרך להריץ את ההשוואה ראש בראש בלי להקים שתי אינטגרציות.
המבחן שיכריע את זה
אף אחד מהספקים לא פרסם ביצועים ספציפיים לערבית, ואף אחד מהם לא הוערך באופן בלתי תלוי על אודיו דיאלקטלי. לכן ההשוואה מצטמצמת לשלושה עובדות והמלצה אחת.
העובדות: מודל הסטרימינג של Microsoft מהיר יותר ב-0.13 שניות, וטוען לדיוק מצטבר טוב יותר על לוח דירוג שטרם הציג אותו בגרף; המודל של Mistral מפרסם רשימת ניבים, שיעור שגיאה בערבית, ואת קוד הנרמול כדי לגזור אותו מחדש, תוך 480 אלפיות שנייה; ושני נתוני הדיוק אינם ניתנים להשוואה משום שאחד הוא שיעור שגיאת מילים והשני הוא שיעור שגיאת תווים בקורפוס שונה.
ההמלצה: מי שמקבל את ההחלטה הזו צריך להריץ את שניהם על האודיו שלו, כי זו המדידה היחידה ששני הספקים הותירו פתוחה. בנו את סט ההערכה מהקלטות אמיתיות — תמהיל הדיאלקטים שאתם באמת מקבלים, הקודק שאתם באמת משתמשים בו, אוצר המילים התחומי שאתם באמת צריכים — ותנו ציון לשניהם עם הנרמול של Mistral מול ייחוס שאתם סומכים עליו. בדיקה של שעתיים על ההקלטות שלכם תגיד לכם יותר משני פוסטי ההשקה גם יחד, וזו הדרך היחידה לגלות אם היתרון של 0.13 שניות שווה תלות בתצוגה מקדימה ופרמיית סטרימינג של פי 5.4, או אם מודל 4.4B להורדה ב-480 אלפיות השנייה כבר טוב מספיק למשימה.

OrcaRouter לא משרת אף אחד מהמודלים של הדיבור האלה, והקטע הזה לא מרמז אחרת - מה שהוא כן מכסה הוא שכבת השפה שקוראת את התמלול: יותר מ-200 מודלים מאחורי מפתח אחד במחיר מחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק במודל במורד הזרם מגיע אליך ביום שבו הוא מוכרז.
מעבר אוטומטי בעת כשל מאפשר לשני מועמדי התמלול להזין צינור עיבוד אחד במורד הזרם במקום שתי אינטגרציות, וזו גם הדרך הזולה ביותר להריץ את ההשוואה הישירה.
