כרטיס כותרת גיבור שנוצר להשוואה בין Voxtral Mini 4B Realtime Arabic ל-Voxtral 4B TTS, עם כתובית משנה 'שני קצוות של אותה לולאת קול ערבית, שני רישיונות שונים', עם תג 'כניסת דיבור לעומת יציאת דיבור', עם שלושה צ'יפים סטטיסטיים שמציגים 8.82% שיעור שגיאה בתווים ערביים ב-480ms לעומת 70ms זמן עד לאודיו ראשון, 16 ניבים ערביים לעומת 9 שפות כולל ערבית, ומשקולות Apache 2.0 לעומת משקולות CC BY-NC 4.0, והלוגו של OrcaRouter משולב ברצועה לבנה בפינה הימנית התחתונה.
Engineering & Research

Voxtral Mini 4B Realtime Arabic מול Voxtral 4B TTS: שני קצוות של אותה שיחה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שני המודלים האלה חולקים שם, מספר פרמטרים וקובץ רישיון שמתנהג אחרת, ושם נגמר הדמיון. Voxtral Mini 4B Realtime Arabic, שהועלה ל-Hugging Face ב-8 באוקטובר 2026 בלי הודעה מלווה, קולט אודיו ומייצר טקסט בערבית — כוונון עדין זורם של Voxtral-Mini-4B-Realtime-2602 שנבנה עבור ערבית סטנדרטית מודרנית וחמישה עשר ניבים בעלי שם, Apache 2.0, שיעור שגיאת תווים ממוצע של 8.82% בהשהיה של 480 מילישניות. Voxtral 4B TTS, שהוכרז על ידי Mistral AI במרץ 2026, עושה את ההיפך: טקסט נכנס, דיבור יוצא, עשרים קולות מוגדרים מראש בתוספת התאמה מקטע התייחסות קצר, תשע שפות כולל ערבית, ורישיון — CC BY-NC 4.0 — שאוסר שימוש מסחרי במשקלים עצמם. הם אינם חלופות והם אינם וריאנטים. הם שני החצאים של לולאת קול, והסיבה להסתכל עליהם יחד היא שההחלטות שאתם מקבלים לגבי אחד מהם מגבילות את האחר יותר ממה שרוב הצוותים מצפים.

רוב עמודי ההשוואה יאמרו לך שהמודלים האלה אינם קשורים זה לזה, כי האחד הוא ASR והשני הוא TTS, ואז יעצרו. זה נכון ולא מועיל. מה שבאמת שווה לדעת הוא היכן שהם נפגשים: סוכן קולי צריך את שניהם, שני הרישיונות מצביעים בכיוונים מנוגדים, טביעות החומרה של השניים דומות בעוד שמאפייני התפוקה שונים, וטענות הכיסוי בערבית הן בעלות צורות שונות לחלוטין. כל מה שלהלן עוסק בארבע נקודות המפגש האלה.

מהו כל מודל, במונחים שחשובים לצינור עיבוד.

• Voxtral Mini 4B Realtime Arabic — זיהוי דיבור אוטומטי בזרימה. קלט אודיו ב-16 קילו־הרץ, פלט טקסט, כ־4.4 מיליארד פרמטרים ב־BF16, מוגש דרך vLLM עם WebSocket בכתובת /v1/realtime או באופן מקורי ב־Transformers מגרסה 5.2.0. מקודד אודיו סיבתי ומפענח שפה, השהיית תמלול ניתנת להגדרה הנקובה ב־480 מילישניות עבור נתון הדיוק המפורסם, ומודול נרמול הנלווה אליו כדי שניתן יהיה לגזור מחדש את שיעור שגיאות התווים בערבית. Apache 2.0.

• Voxtral 4B TTS — טקסט לדיבור בזרימה ובאצווה. קלט טקסט, פלט אודיו ב-24 קילו-הרץ בפורמטים WAV, PCM, FLAC, MP3, AAC או Opus, עם כ-4 מיליארד פרמטרים, רשימה של 20 קולות מוגדרים מראש והתאמת קול מקליפ ייחוס קצר כשלוש שניות. מדד הביצועים של Mistral עצמה על H200 בודד המריץ vLLM-Omni 0.18.0 עם קלט של 500 תווים וייחוס של עשר שניות מדווח על השהיה של 70 אלפיות שנייה ומקדם זמן אמת של 0.103 במקביליות 1, עולה ל-331 אלפיות שנייה ול-0.237 במקביליות 16, ול-552 אלפיות שנייה במקביליות 32. נגיש כ-API במחיר של $0.016 לאלף תווים.

ההבחנה הראשונה משתי הפסקאות האלה היא שהזוג קטן. שני המודלים נמצאים בטווח של 4 מיליארד פרמטרים ושניהם נכנסים במאיץ בודד ב-BF16, מה שאומר שסוכן קולי בערבית שמבוסס כולו על משקלים פתוחים הוא פריסה של שני GPU לכל היותר, ובאופן סביר פריסה של GPU אחד עם קוונטיזציה בשני הצדדים. זו הסיבה המעשית להסתכל עליהם כעל סט ולא כשתי החלטות מוצר נפרדות.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

אי־הסימטריה ברישיון היא הממצא, לא הערת שוליים.

הנה הדבר שמפתיע אנשים שמניחים שמודלים מאותה מעבדה עם אותה מוסכמת שמות מגיעים עם אותם תנאים.

• Voxtral Mini 4B Realtime Arabic — 2.0. שימוש מסחרי, שינוי, הפצה מחדש וכוונון עדין — כולם מותרים, בכפוף לכיבוד המקובל של זכויות צד שלישי.

• Voxtral 4B TTS — CC BY-NC 4.0, בירושה ממערכי הנתונים של קולות הייחוס שמאחוריו. לא מסחרי. הכרטיס של Mistral מפורש בכך שהמודל יורש את הרישיון של הפניות הקוליות שלו, הנשאבות ממקורות הכוללים את EARS, CML-TTS, IndicVoices-R ומערך אודיו טבעי בערבית. המשקולות ניתנות להורדה והרישיון אינו מסחרי.

זהו אילוץ קשיח על הארכיטקטורה המדויקת שכולם פונים אליה ראשית. אם תבנה סוכן קולי ערבי שהחלק של המרת דיבור לטקסט בו הוא Voxtral Mini 4B Realtime Arabic ושהחלק של המרת טקסט לדיבור בו הוא Voxtral 4B TTS, יש לך פייפליין שבו מחצית מהרכיבים חופשיים לשימוש מסחרי ומחציתם לא, והמחצית המגבילה קובעת את המוצר. העובדה שמודל ה-ASR הוא Apache 2.0 אינה מצילה את חלק ה-TTS. הרצת הזוג באופן מקומי אינה משנה את הרישיון, וכך גם אי-אספקת המשקלים — האילוץ חל על השימוש, לא על ההפצה.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

המסלול המסחרי ש-Mistral מציעה עבור צד הדיבור הוא ה-API המתארח, במחיר של 0.016 דולר לאלף תווים, שהוא הסכם שירות ולא הענקת רישיון. עבור צוות מוצר, ההשלכה המעשית היא שהחצי שניתן למסחר באופן חופשי בלולאה הוא החצי שמקשיב, ואילו החצי שמדבר הוא או תלות ב-API או שיחה על רישוי. זה הופך על פיו את מה שרוב הצוותים מניחים כשהם יוצאים לבנות מחסנית קולית פתוחה, וכדאי לגלות זאת לפני שכתבתם את האינטגרציה ולא אחרי.

הטענות בערבית אינן מתיישבות, ורק אחת מהן היא הבטחת כיסוי

שני הדגמים מפרטים ערבית. הרשומות משמעותן שונה.

• Voxtral Mini 4B Realtime Arabic — ערבית היא כל התחום. שש-עשרה גרסאות מנויות כיעדי אימון: ערבית ספרותית מודרנית, מרוקאית, לובית, תוניסאית, אלג'יראית וערבית חסאניה, מפרצית, נג'דית, עומאנית וצנעאנית, מצרית וסודאנית, מסופוטמית וגם לבנטינית דרומית וצפונית, וצ'אדית. כל דבר מחוץ לקבוצה הזו מתועד כמחוץ לתחום. נתון דיוק מצטבר אחד, 8.82% CER, בממוצע על פני שבעה בנצ'מרקים לערבית.

• Voxtral 4B TTS — ערבית היא אחת מתשע שפות נתמכות, לצד אנגלית, צרפתית, ספרדית, גרמנית, איטלקית, פורטוגזית, הולנדית והינדי. הכרטיס מתאר "ניבים מגוונים" במסגרת תמיכה זו, מבלי למנות אותם, ולא פורסם נתון איכות לפי שפה עבור ערבית או עבור אף אחת משמונה האחרות.

כשקוראים אותם יחד, הצמד נותן לך הצהרה מפורטת על עד כמה טוב המערכת שלך תשמע ערבית, וכמעט אין כל הצהרה על עד כמה טוב היא תדבר בה. לאסימטריה הזו יש השלכה ממשית עבור סוכן קולי בדאריג'ה או בערבית של המפרץ: לצד הקלט יש בנצ'מרק שפורסם ורשימת ניבים שאפשר להעריך מולם, ולצד הפלט יש תג שפה ורשימת קולות. אף אחד לא פרסם מדידת מובנות לערבית דיאלקטית עבור Voxtral 4B TTS, ותכונת התאמת הקול לא פותרת זאת — התאמת קול משנה למי הדיבור נשמע, לא איזה ניב הוא מפיק.

ישנה נקודה שנייה ועדינה יותר בנוגע לנתון הדיוק של מודל ה-ASR עצמו, שעוברת גם לצד ה-TTS. Mistral מדווחת על 8.82% CER בסטרימינג לעומת 7.91% עבור Voxtral Transcribe Arabic לא-מקוון באותם שבעה מבחני ביצוע עם אותו נרמול, כך שהסטרימינג עולה בערך נקודה. הפשרה המקבילה בצד ה-TTS — כמה עולה הסקה בסטרימינג מבחינת איכות הפלט לעומת אצווה — אינה מכומתת כלל בחומר. נתוני ההשהיה קיימים; פער האיכות לא.

תפוקה: דגם אחד בנוי לעבודה מאומצת, והשני לא

Mistral פרסמה נתוני תפוקה עבור בדיוק אחד מהמודלים האלה, והמספרים מסבירים למה.

• Voxtral 4B TTS — נמדד על H200 אחד עם vLLM-Omni, קלט של 500 תווים והפניה קולית בת עשר שניות, התפוקה נעה מכ-119 תווים לשנייה של זמן GPU במקביליות 1 לכ-879 במקביליות 16 וכ-1,431 במקביליות 32, כאשר ההשהיה עולה מ-70 מילישניות ל-331 ואז ל-552. זו עקומת תפוקה שאפשר לתכנן מולה קיבולת, והיא בצורה שהייתם מצפים לה ממודל שתוכנן כשירות קולי בסביבת ייצור.

• Voxtral Mini 4B Realtime Arabic — הכרטיס אינו מדווח נתון תפוקה, התנהגות מקביליות או בנצ'מרק חומרה. מה שכן נאמר בו הוא הארכיטקטורה: מקודד סיבתי וסכמת קשב עם חלון מחליק גם במקודד וגם במפענח, שמתוארת במודל הבסיס ככזו שתומכת בזרימה בלתי מוגבלת למעשה. נקודת הדיוק מצוטטת בעיכוב של 480 מילישניות, מה שמרמז שהמודל עומד בקצב אודיו בזמן אמת בחומרה מתאימה, וזה כל היקף מעטפת הביצועים שפורסמה.

הפער אינו ביקורת על אף אחד מהמודלים אלא הצהרה על בגרות. למודל ה-TTS יש טבלת SLO שפורסמה משום שהוא שוחרר כמוצר עם פוסט בלוג, דמו, API ומחיר. למודל ה-ASR הערבי אין מעטפת ביצועים שפורסמה משום שהוא הגיע כמאגר עם כרטיס. אם אתם מתכננים את הגודל של צי תמלול ערבי היום, מספר התפוקה שאתם צריכים עדיין לא קיים, והדרך היחידה להשיג אותו היא להריץ את נתיב ההגשה של vLLM על החומרה שלכם עם האודיו שלכם.

זה גם המקום שבו שכבת ניתוב משנה את צורת הפריסה, ולא רק את החיוב. OrcaRouter לא מנתבת אף אחד מהמודלים האלה — איננו מארחים אף נקודת קצה של דיבור של Mistral, והמאמר הזה לא טוען אחרת — אבל שכבת מודל השפה שביניהם היא בדיוק השכבה שמרוויחה מכך שהיא מנותבת: מפתח API אחד על פני יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי מחיר של ספק נוחת אצלנו באותו היום שבו הוא מוכרז, ומעבר אוטומטי לגיבוי כך שאחר צהריים רע של ספק יחיד במעלה הזרם הוא ניתוב מחדש ולא הפסקה בלולאת הקול שלכם. לסוכן קולי שנבנה משני מודלים של Mistral באירוח עצמי ועוד מודל הסקה מתארח יש שלושה תחומי כשל; שכבת הניתוב היא מה שהופך את האמצעי למשעמם.

עלות, זה לצד זה, עם ההסתייגות שלצד אחד אין מחיר

• Voxtral 4B TTS — 0.016 דולר לאלף תווים דרך ה-API של Mistral, או עלות ה-GPU אם תארחו בעצמכם בתנאים שמתירים את מקרה השימוש שלכם. להמחשת סדר הגודל, אלף תווים הם כמאתיים מילים, כך שדקה של פלט מדובר מסתכמת בשברירי סנט נמוכים במחיר המחירון, לפני כל יתרון של ריבוי מקבילי מהרצה בעצמכם.

• Voxtral Mini 4B Realtime Arabic — אין מחיר מפורסם, אין שירות מתארח, אין מחירון. העלות היא חומרה וניצול. מודל 4.4B BF16 על מאיץ מודרני אחד הוא עלות חודשית קבועה שאתה פורש על פני כמה שיותר אודיו שהמכונה יכולה לעבד, וזה זול בנפח שימוש מתמשך ובזבוז טהור בנפח שימוש מזדמן.

ההשוואה שככל הנראה חשובה יותר היא מול החלופות שאליהן היית פונה במקום. בצד ההאזנה, הצ'קפוינט הערבי מתחרה בממשקי API בזרימה לפי שעה, שהתעריפים שלהם מפורסמים ונמוכים — MAI-Transcribe-2-Streaming של Microsoft במחיר היכרות של $0.54 לשעת אודיו, Grok Voice Transcribe 2.0 של xAI ב-$0.20 לשעת אודיו בזרימה — מה שאומר שאפשר לקנות שירות תמלול ערבי בכמה עשיריות הסנט לדקה, והטיעון בעד משקולות פתוחות צריך להיבנות על דיוק דיאלקטים, ריבונות נתונים או כיוונון עדין ולא על עלות ליחידה. בצד הדיבור, מודל TTS באירוח עצמי בעלות שולית אפס הוא יתרון אמיתי על פני ממשקי API לפי תו בנפחים גבוהים, ולכן רישיון CC BY-NC הוא הגורם המגביל ולא המחיר.

הערה מבנית לכל מי שמתקצב מעבר מבוסס מחיר: ראוטר שמעביר את מחיר המחירון של הספק עם תוספת של 0% הוא המקום שבו שינוי בתעריף הספק מופיע באותו יום שבו הוא מוכרז, ולא במחזור התמחור הבא. זה חשוב יותר בצד ההקשבה מאשר בצד הדיבור, כי תמלול מתומחר לפי שעת אודיו וזה מספר שספקים משנים.

איך לחשוב על לבחור ביניהם

אתה לא בוחר ביניהם. השאלה היא איזה חצי מהלולאה אתה יכול לבנות על משקולות פתוחות, והרישיון עונה עליה.

אם הדרישה שלך היא סוכן קולי ערבי עצמאי שבו האודיו לעולם אינו יוצא מהתשתית שלך, רגל ההאזנה עומדת לרשותך ללא תנאי: Apache 2.0, ניתנת להורדה, ניתנת לכוונון עדין, עם רשימת ניבים שתוכל לבדוק מולה ושיעור שגיאות מפורסם בערבית. רגל הדיבור היא המקום שבו האילוץ נוחת, ויש לך שתי אפשרויות כנות — להעביר את סינתזת הדיבור לשירות מתארח במסגרת הסכם מסחרי, או להסיר את Voxtral 4B TTS מהארכיטקטורה ולמצוא מודל סינתזה בעל רישיון מתירני לערבית.

אם הדרישה שלך היא שירות תמלול בסביבת ייצור והשפה היא ערבית, ההחלטה היא בין צ׳קפוינט 4.4B להורדה עם טקסונומיית ניבים מפורסמת ושיעור שגיאה מצטבר אחד, לבין API סטרימינג מתארח עם תעריף מפורסם, השהיה מפורסמת ולוח דירוג של צד שלישי. המודל הפתוח מנצח בשליטה, ריבונות נתונים וכוונון עדין; האפשרויות המתארחות מנצחות בראיות, תמיכה ופשטות תפעולית. יומיים לאחר שהמשקלים הופיעו, איש מחוץ ל-Mistral לא מדד אותם, וזו סיבה להריץ בנצ׳מרק משלך ולא סיבה לפסול את הצ׳קפוינט.

מה שהכי ישנה את התמונה הזו הוא מהדורת סינתזה בערבית בתנאים המתירים שימוש מסחרי — אותו דפוס שצד ההאזנה כבר הולך לפיו. עד שזה קיים, הלולאה נשארת חצי פתוחה, והעבודה המעשית היא להחליט איזה חצי אתה מוכן לשכור.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

איננו מארחים אף אחד משני מודלי הדיבור של Mistral הללו, והמאמר הזה אינו טוען אחרת; מה שללולאת הקול דרוש מעליהם הוא שכבת השפה, וזו ניתנת לניתוב - מפתח API אחד על פני יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך ששינוי בתעריפי הספק נוחת אצלנו באותו היום שבו הוא מוכרז.

מעבר אוטומטי בעת כשל מונע מהחלק האמצעי של סוכן קולי בעל שלושה רכיבים – מודל הסקה אחד במעלה הזרם בין שני מודלים של Mistral באירוח עצמי – להיות החלק שמפיל את המוצר.