כרטיס כותרת ראשי שנוצר עבור השוואה בין Voxtral Mini 4B Realtime Arabic ל-Grok Voice Transcribe 2.0, עם כותרת משנה 'מוביל בטבלת דירוג תוויות נפגש עם מומחה ערבית ל-16 ניבים', עם תג 'מאגר Mistral, 8 באוקטובר 2026', עם שלושה צ'יפים סטטיסטיים המציגים 8.82% שיעור שגיאה בתווים בערבית ב-480ms לעומת 2.7% שיעור שגיאה במילים ב-0.49s, 16 ניבים בעלי שם לעומת 38+ שפות לא מתועדות, ומשקולות Apache 2.0 לעומת $0.20 לשעת אודיו, ולוגו OrcaRouter מורכב ברצועה לבנה בפינה הימנית התחתונה.
Guides & Insights

Voxtral Mini 4B Realtime Arabic מול Grok Voice Transcribe 2.0: מוביל בטבלת הדירוג פוגש מומחה לניבים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

נקודת המוצא הכנה להשוואה הזו היא ש-Voxtral Mini 4B Realtime Arabic ו-Grok Voice Transcribe 2.0 לא מתחרים על אותה עבודה, והדרך המהירה ביותר לראות זאת היא להסתכל על מה שכל ספק היה מוכן לפרסם. Mistral AI העלתה את Voxtral Mini 4B Realtime Arabic ל-Hugging Face ב-8 באוקטובר 2026 ללא הודעה מוקדמת — משקולות Apache 2.0, כרטיס מודל שמפרט שש עשרה וריאציות ערביות, ונתון דיוק בודד של 8.82% שיעור שגיאת תווים ממוצע על פני שבעה מבחני ערבית בהשהיה של 480 אלפיות שנייה. Grok Voice Transcribe 2.0 של xAI שוחרר ב-18 בספטמבר 2026 עם פוסט השקה, מחיר, ותוצאה מלוח דירוג של צד שלישי: 2.7% שיעור שגיאת מילים בתמלולים סופיים כשהטקסט מתייצב 0.49 שניות לאחר שהדובר מפסיק, ראשון בלוח התמלול לדיבור בזרימה של Artificial Analysis כשהגיע. מודל אחד אומר לך בדיוק אילו ניבים הוא מטפל בהם ומסרב לנחש מחוץ להם. האחר אומר לך שהוא מכסה 38 שפות ויותר ולא מפרט אף אחת מהן.

האסימטריה הזו היא כל ההשוואה. אם אתם קונים קיבולת תמלול בכמויות גדולות עבור אודיו מעורב בשפות, מודל xAI הוא המוצר השלם יותר בפער ניכר. אם האודיו שלכם הוא ערבית — ובאופן ספציפי אם מדובר בערבית דיאלקטלית, ולא בערבית תקנית מודרנית לשידור — ה-checkpoint של Mistral מכוון לבעיה שטבלת הדירוג שמודל xAI עומד בראשה לא מודדת, ופירוש העובדה שהוא שני בטבלה הזו ולא ראשון כפסק דין יהיה בגדר טעות.

האריתמטיקה של המחיר, כי היא נקייה באופן יוצא דופן כאן

xAI מפרסמת תעריף. Mistral מפרסמת הורדה. ההבדל הזה מניע את כל מה שבהמשך, אז התחילו עם המספר שקיים.

• Grok Voice Transcribe 2.0 — $0.10 לשעת אודיו דרך REST עבור קבצים מוקלטים, $0.20 לשעת אודיו דרך WebSocket בזרימה. זה בערך $1.67 לאלף דקות באצווה ו־$3.33 לאלף דקות בזרימה, ללא שינוי מ־Grok Voice Transcribe 1.0 באותן נקודות מחיר.

• Voxtral Mini 4B Realtime Arabic — אין מחיר מפורסם, כי אין שירות מפורסם. המשקולות הן Apache 2.0 ובקירוב 4.4 מיליארד פרמטרים ב-BF16, מה שאומר שהעלות היא ה-GPU שאתם מחברים אליו והניצול שאתם מפיקים ממנו. בהיקף מתמשך זה זול; בהיקף אפס זו האפשרות היקרה ביותר במאמר הזה, כי אתם משלמים על חומרה לא פעילה.

נקודת האיזון אינה עדינה. תעריף סטרימינג של $0.20 לשעה הוא בערך שליש סנט לדקה. כל מאיץ שעליו תריץ מודל של 4.4B עולה יותר מזה לשעה, אלא אם כן אתה מזרים דרכו תעבורה מתמשכת, מה שאומר שמסלול המשקולות הפתוחות מנצח בעלות רק אחרי שיש לך מספיק נפח בערבית כדי להעסיק מכונה — ומפסיד בכל ציר אחר בזמן שאתה מגיע לשם, כי ל-API אין הוצאות הון, אין תכנון קיבולת ואין נטל תפעולי.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

המקום היחיד שבו החשבון מתהפך מוקדם הוא תאימות. ה-checkpoint של Mistral מעבד אודיו על חומרה שאתם שולטים בה, כך ששום דבר לא יוצא מהרשת שלכם, והכרטיס מגיע עם מודול נרמול, כך שמסלול הניקוד בערבית פתוח לביקורת שלכם. Grok Voice Transcribe 2.0 פועל באזורים של xAI, ולפי התיעוד שלו מעבד אודיו בזמן אמת בלי לשמור אותו או להשתמש בו לאימון, כשהוא מגובה ב-SOC 2 Type II ובזכאות ל-HIPAA. שני הסיפורים ניתנים להגנה; רק אחד מהם מאפשר לרגולטור לבדוק את נתיב הקוד.

מה 0.20 דולר לשעה באמת קונים, ומודל Mistral לא משוחרר

פער היכולות כאן גדול יותר מפער הדיוק, ומדברים עליו הרבה פחות. Grok Voice Transcribe 2.0 הוא מוצר עם ממשק; Voxtral Mini 4B Realtime Arabic הוא צ'קפוינט שפולט טקסט.

• הפרדת דוברים — כלולה ב-Grok Voice Transcribe 2.0, ובנוסף תמלול רב-ערוצי של עד שמונה ערוצים עצמאיים. בכרטיס של Mistral לא מפורטת יכולת הפרדת דוברים; המודל מפיק תמלול, לא תמלול עם ייחוס דוברים.

• חותמות זמן ברמת המילה — Grok נושא אותן עם ציוני ביטחון מצורפים, כך שאפשר להחיל סף על מקטעים בעלי ביטחון נמוך במקום לסמוך על תמלול שלם באותה מידה. הכרטיס של Mistral אינו טוען לקיומן של חותמות זמן עבור הצ'קפוינט הזה.

• הטיית מונחי מפתח — עד 100 מונחים תחומיים לכל בקשה בנקודת הקצה של Grok, וזו הדרך לגרום למודל לדייק בשמות מוצרים, בקודי חשבון ובשמות מקומות בלי כיוונון עדין. הדרך של Mistral לאותה תוצאה היא כיוונון עדין על הנתונים שלך, דבר ש-Apache 2.0 מתיר בעוד שנקודת הקצה המתארחת אינה מתירה.

• נרמול טקסט הפוך — Grok מעצב מספרים, תאריכים, מטבעות, מספרי טלפון וכתובות דוא״ל לצורה כתובה ב-25 שפות. כרטיס ה-Mistral כולל סקריפט נרמול, אך מטרתו המוצהרת היא ניקוד בנצ׳מרקים בערבית, ולא עיצוב פלט לתצוגה.

• משטח הממשק — REST עבור קבצים עד 500 MB, הזרמת WebSocket בכתובת wss://api.x.ai/v1/stt עם תוצאות ביניים בערך כל 500 ms, 10 בקשות בשנייה מתועדות ו-100 הפעלות זרימה במקביל, ואזור יחיד לעת עתה. בצד Mistral, שירות vLLM עם WebSocket בכתובת /v1/realtime, או Transformers מקוריים מגרסה 5.2.0, ללא הגבלת קצב מלבד החומרה שלך.

אם יש לך צורך בדיאריזציה ובחותמות זמן, ההשוואה נגמרת עוד לפני שהדיוק בכלל נכנס לתמונה. זו לא ביקורת על מודל Mistral — מודל 4B המיועד לערבית, שאומן להפיק טקסט דיאלקטלי מדויק, הוא יעד הנדסי שונה מזה של שירות תמלול כללי — אבל זה כן אומר ששני אלה הופכים לברי-החלפה זה בזה רק אם צינור העיבוד שלך מתייחס לתמלול כאל חומר גלם לעיבוד המשך משלך.

בעיית רשימת השפות

שני הספקים מתארים את התמיכה בשפות באופן שמשאיר את אותה שאלה ללא מענה, מכיוונים מנוגדים.

• Grok Voice Transcribe 2.0 — יותר מ-38 שפות, זיהוי שפה אוטומטי עם החלפת שפה תוך כדי הקלטה במעבר אחד, על פני 12 פורמטי אודיו מ-8 kHz עד 48 kHz. התיעוד נותן את המספר ולא את הרשימה. ערבית אינה מוזכרת בשמה באופן פרטני בשום מקום בחומר, כלומר תמיכה בערבית משתמעת מהמספר ולא מאושרת על ידי הספק.

• Voxtral Mini 4B Realtime Arabic — שש עשרה וריאציות ערביות הנקובות במפורש בשמן: ערבית ספרותית מודרנית; מרוקאית, לובית, תוניסאית, אלג'יראית וחסאנייה מהמגרב; ערבית המפרץ, נג'דית, עומאנית וצנעאנית מהמפרץ; מצרית וסודאנית מעמק הנילוס; מסופוטמית ושתי הלבנטיניות, הדרומית והצפונית; וערבית צ'אדית. כל מה שמחוץ לקבוצה הזו הוא מחוץ לתחום, ובכרטיס נאמר להשתמש במקום זאת במודל ה-realtime הכללי.

אז לשאלה "איזה מאלה מטפל בערבית טוב יותר" יש מבנה מוזר. מודל Mistral הוא מומחה מתועד לערבית עם שיעור שגיאות מפורסם בערבית וללא אימות בלתי תלוי. מודל xAI הוא מוביל מתועד בטבלת הדירוג, שהספק שלו לא אישר שערבית נכללת בתחום שלו בכלל. ספירה של 38 שפות שכוללת ערבית ורשימה של שישה עשר ניבים שכוללת רק ערבית — שתיהן עונות על השאלה "האם הוא מטפל בערבית" — אבל רק אחת מהן עונה על "האם הוא מטפל בדאריג'ה".

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

לוח המובילים לא עוזר כאן. הערכת התמלול מדיבור לטקסט של Artificial Analysis היא תערובת קבועה המוטה לעבר דיבור סוכנים באנגלית, וזה העיצוב הנכון לדירוג תמלול כללי והעיצוב השגוי לחשוף הישג בערבית דיאלקטלית. ייתכן שמודל יהיה טוב יותר באופן ממשי בערבית של המפרץ ובערבית מרוקאית ובכל זאת יופיע כטוב בלבד בלוח הזה. זו אינה ביקורת על הלוח; זו סיבה שלא להשתמש בו כקלט היחיד לפריסה אזורית.

דיוק, ביחידות שאינן מומרות

• Grok Voice Transcribe 2.0 — שיעור שגיאת מילים של 2.7% בתמלול הסופי, עם 0.49 שניות עד לתמלול סופי, ו-3.4% בתמלולים חלקיים ראשונים, שניהם נמדדו במדד AA-WER v2 של Artificial Analysis, שמשלב סט פרטי של שיחות סוכנים עם VoxPopuli ו-Earnings22. נתון התמלול החלקי הראשון הוא הבולט: הוא ירד מ-18.3% ב-Grok Voice Transcribe 1.0, שזה ההבדל בין תמלול חלקי שאפשר לנתב על בסיסו לבין תמלול חלקי שאפשר רק להציג.

• Voxtral Mini 4B Realtime Arabic — שיעור שגיאות תווים ממוצע של 8.82% על פני שבעה מבחני ייחוס בערבית בהשהיה של 480 מילישניות, לפי ההערכה של הספק עצמו, עם סקריפט נרמול שסופק לצידה. Mistral מדווחת שהנתון הזה נמצא במרחק של 0.91 נקודות אחוז מ־Voxtral Transcribe Arabic בשיעור שגיאות תווים של 7.91%, שהוא מודל הערבית הלא־מקוון מאותה מעבדה — השוואה ששווה יותר מהשוואה חוצת־ספקים, מפני שמבחני הייחוס, הנרמול והמדידה זהים בשני הצדדים.

הצבת 2.7% לצד 8.82% אינה השוואה; זו טעות קטגורית. שיעור שגיאות מילים סופר מילים שגויות מול תמלול ייחוס, שיעור שגיאות תווים סופר תווים שגויים, והכתיב הערבי — שבו אותה מילה סובלת כמה איותים לגיטימיים וקליטיקות נצמדות בחופשיות — מרחיב את הפער בין שני המדדים הרבה מעבר למה שמראות שפות בכתב לטיני. הקורפוסים שונים, הנרמול שונה, ורק נתון אחד מגיע מצד שלישי. מה ששני המספרים יכולים לומר לך באופן לגיטימי הוא שמודל xAI הוא מתמלל כללי מדוד ומדורג היטב, ומודל Mistral הוא מתמלל מוצהר כייעודי לערבית. הם אינם יכולים לומר לך איזה מהם מתמלל את האודיו שלך טוב יותר.

ההשוואה שכן משכנעת היא זו שבתוך הכרטיס של Mistral עצמה: 8.82% סטרימינג לעומת 7.91% אופליין, אותם שבעה מבחנים, אותו נרמול, אותה מעבדה. סטרימינג עולה בערך בנקודת דיוק אחת בערבית לעומת מודל אצווה. אם זהו חילוף טוב, זו החלטה שלך, ועכשיו היא מושכלת.

היכן שהמודל הקטן מנצח, וזה לא על לוח התוצאות

שלושה דברים לגבי ה-checkpoint של Mistral שווים יותר ממה שהמספרים מרמזים, ואף אחד מהם לא מופיע בשום לוח דירוג.

הראשון הוא טקסונומיית הניבים עצמה. מתן שמות לשש עשרה וריאציות כיעדי אימון נפרדים, כולל חסאניה וערבית צ'אדית, הוא הצהרה על היכן נמדדו שגיאות המודל. מודל רב-לשוני כללי הכולל את הערבית כאחת מ-38 שפות משתפר בערבית ספרותית תחילה, מכיוון ששם נמצא עיקר אות האימון ומשקל הבנצ'מרק. מודל שנבנה עבור השותפות עם מרוקו לצד משרד צפון אפריקאי מייעל עבור התפלגות שונה, והוא פותח במשותף עם שני בנצ'מרקים — ISMA ו-Darija in the Wild — שנבנו במיוחד כדי למדוד זאת.

השני הוא ההשהיה הניתנת להגדרה. הנתון של 8.82% נמסר ב־480 מילישניות, וההשהיה ניתנת להתאמה ולא קבועה, מה שהופך את נתון הדיוק לנקודה על עקומה שהמפעיל בוחר. בעבור עבודת כתוביות בזמן אמת אפשר לקצר אותה ולקבל יותר שגיאות; בעבור צינור הקלטת שיחות אפשר להאריך אותה ולקבל בחזרה את הדיוק. Grok Voice Transcribe 2.0 מציג נקודת הפעלה קבועה, ומסלול השדרוג של הספק עצמו מראה מדוע יש לכך השלכות — המעבר מ־1.0 ל־2.0 עלה כשליש שנייה הן בהשהיה של התוצאה החלקית הראשונה והן בזו של התוצאה הסופית, והפתרון הזמין לך הוא להצמיד את הדגם הישן, לא לסובב חוגה.

השלישי הוא שהרישיון Apache 2.0 הוא ללא תנאי עבור המשקולות שברשותך. כל מה שיקרה לצ'קפוינט במעלה הזרם — בין אם הוא יוכרז, יתומחר, יוצא משימוש או לא יוזכר שוב לעולם — הארטיפקט נשאר ניתן להורדה, ניתן לכיוונון עדין וניתן לשילוב בתוך המוצר שלך. המחירון של נקודת קצה מתארחת ולוח הוצאת המודל שלה משימוש הם שניהם בשליטת הספק לשנות, ו-xAI כבר אותתה על כוונתה להפוך את Grok Voice Transcribe 2.0 לברירת המחדל ולהוציא משימוש את 1.0, מה שיעביר בבת אחת כל אינטגרציה שלא העבירה פרמטר מודל לפרופיל ההשהיה החדש.

על שכבת הניתוב שמעל לתמלול, הערה מעשית אחת: אף אחד מהמודלים אינו דיבור-לטקסט שאנו מארחים, והמאמר הזה אינו טוען אחרת. מה ש-OrcaRouter מכסה הוא שכבת מודל השפה שצורכת את הזרם — המסכם, המסווג, הסוכן — מאחורי מפתח API אחד על פני יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק נוחת כאן באותו יום. צוותים שמפעילים שני ספקי דיבור לכיסוי שפתי כבר נושאים שני חוזים ושני נתיבי אימות; כיווץ החצי במורד הזרם למפתח אחד הוא הניצחון הזול.

מה לעשות עם זה

התבססו על Grok Voice Transcribe 2.0 אם האודיו שלכם רב-לשוני, אם אתם זקוקים לדיאריזציה, חותמות זמן או הטיית מונחי מפתח באופן מובנה, או אם אתם רוצים שירות עם תעריף מפורסם ומסלול תמיכה כבר היום. זה המוצר השלם יותר, הוא נמדד על ידי צד שלישי, ותעריף הסטרימינג של $0.20 לשעת אודיו נמוך מספיק כך שטיעון העלות של משקולות פתוחות לא תופס עד שאתם מריצים נפח רציני.

בנו על Voxtral Mini 4B Realtime Arabic אם האודיו שלכם הוא ערבית, ובאופן ספציפי ערבית דיאלקטלית, אם אתם זקוקים למודל בתוך הרשת שלכם מסיבות של ציות, או אם אתם מתכוונים לבצע כיוונון עדין — כי רק אחד מאלה מאפשר זאת. קבלו תחילה שלושה דברים: אין דיאריזציה, אין חותמות זמן, ואין הערכה עצמאית שאף אחד פרסם. יומיים לאחר שהמשקלים הופיעו, האחרון הזה אינו דגל אדום; הוא פשוט מצב הראיות.

מה שישנה את ההשוואה הזו במהירות הרבה ביותר הוא הערכה ספציפית לערבית על אודיו דיאלקטלי אמיתי, שתתבצע מחוץ לשני הספקים, עם אותו נרמול שיוחל על שתי המערכות. עד שזה יתקיים, ההחלטה נשענת על רשימת הדיאלקטים של ספק אחד מול רשימה לא מוצהרת של ספק אחר, והמבחן היחיד האמין הוא ההקלטות שלך.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

אף אחת מנקודות הקצה אינה כזו שאנחנו מספקים — זהו השוואה בין שתי מערכות מחוץ לקטלוג שלנו — אבל המודלים שצורכים את התמלול ניתנים לניתוב: יותר מ-200 מודלים על מפתח API יחיד במחיר המחירון של הספק עם 0% תוספת, כך ששינוי בתעריף של המסכם או המסווג נכנס לתוקף באותו היום שבו הוא מוכרז.

מעבר אוטומטי לגיבויהוא מה שמונע ממערכת דיבור דו־ספקית לשאת שתי נקודות כשל בודדות אל תוך שכבת השפה שניזונה ממנה.