
Voxtral Mini 4B Realtime Arabic מול Gemini 3.5 Transcribe Live: ניבים מול היקף
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
שני מודלים של זיהוי דיבור לטקסט בזרימה, שני הימורים שונים לחלוטין לגבי מהו החלק הקשה בתמלול. Voxtral Mini 4B Realtime Arabic הוא כיוונון עדין בן 4.4 מיליארד פרמטרים ש-Mistral AI העלתה למאגר ציבורי ב-8 באוקטובר 2026 בלי פוסט השקה, רשומת בלוג או שורה באינדקס החדשות של החברה, שאומן במיוחד על ערבית ספרותית מודרנית וחמישה עשר ניבים בעלי שם, ושוחרר תחת Apache 2.0 עם משקולות BF16 להורדה. Gemini 3.5 Transcribe Live הוא נקודת הקצה לזרימה של Google עבור Gemini 3.5 Transcribe, שהוכרז באוגוסט 2026 עם כל המערך של השקת פלטפורמה, מכסה יותר מ-85 לוקאלים, וסגור — API בתצוגה מקדימה בלי משקולות ותקרת סשן של עשר דקות. מודל אחד הלך לעומק במשפחת שפות אחת ואמר זאת במפורש במקטע המגבלות שלו; השני הלך לרוחב והשאיר את ההבטחות ברמת המבטא בלתי מפורטות. איזה מהם תרצו תלוי בציר שאף שיווק של ספק לא מציב במקום הראשון: איך האודיו שלכם באמת נשמע.
זו אינה השוואה סימטרית, וראוי לומר זאת כבר בפתח הדברים ולא לקבור זאת. המודל של Mistral בן 48 שעות בזמן כתיבת הדברים, אין לו הכרזת ספק, אין לו הערכה בלתי תלויה, ואין לו מחיר מפורסם. המודל של Google נמצא בתצוגה מקדימה ציבורית מאז סוף אוגוסט והוא נמדד בכלי מעקב של צד שלישי. התייחסו לצד של Mistral כאל אוסף טענות מכרטיס מודל, ולצד של Google כאל אוסף מדידות בתוספת אוסף טענות, וההשוואה תישאר הוגנת.
מהו כל מודל, לפני המספרים
• Voxtral Mini 4B Realtime Arabic — מודל ASR בזרימה שעבר כוונון עדין מ-Voxtral-Mini-4B-Realtime-2602, עם כ-4.4 מיליארד פרמטרים ב-BF16, שמקבל אודיו ב-16 kHz דרך מקודד אודיו סיבתי ומפענח שפה. הוא פולט טקסט תוך כדי הגעת האודיו, עם השהיית תמלול ניתנת להגדרה, והוא תחת Apache 2.0 עם משקולות ב-Hugging Face. Mistral פיתחה אותו במשותף עם משרד המעבר הדיגיטלי והרפורמה המנהלית של מרוקו במסגרת שותפות שנחתמה בינואר 2026, ומתארת את המודל כנכס בינה מלאכותית ריבוני.
• Gemini 3.5 Transcribe Live — החצי הזורם של מהדורה בת שני מודלים. נקודת הקצה של Live API מעבירה אודיו רציף מהמיקרופון דרך WebSocket, מחזירה תעתיקים חלקיים בעוד הדובר עדיין מדבר, ומתגבשת לתעתיק סופי זמן קצר לאחר שכל אמירה מסתיימת. המודל האח במסלול ה-batch, gemini-3.5-transcribe, משרת קבצים מוקלטים מראש באורך של עד שעה. שניהם בתצוגה מקדימה ציבורית, שניהם מבוססי API בלבד, ולאף אחד מהם אין משקולות מפורסמות.
ההבדל המבני הראשון אינו דיוק. הוא שאחד מאלה הוא קובץ שאפשר להוריד הלילה, והאחר הוא שירות שצריך להתקבל אליו כדי להשתמש בו.

כיסוי שפות: 16 מול יותר מ-85, והפער אינו הסיפור
ספירת השפות גורמת למודל Mistral להיראות צר ולמודל Google להיראות עצום. הספירות מודדות דברים שונים, וקריאה שלהן זו לצד זו בלי הסתייגות זו היא הטעות הנפוצה ביותר שההשוואה הזו מזמינה.
• Voxtral Mini 4B Realtime Arabic — 16 סוגי ערבית, הנקראים בשמם בנפרד בכרטיס המודל לפי משפחת ניבים: ערבית ספרותית מודרנית, ובנוסף ערבית מרוקאית, לובית, תוניסאית, אלג'יראית וחסאניה מהמגרב; מפרצית, נג'דית, עומאנית וצנעאנית מהמפרץ; מצרית וסודאנית מעמק הנילוס; מסופוטמית, ולבנטינית דרומית וצפונית כאחת; וערבית צ'אדית. המסגור של הכרטיס עצמו הוא שהמודל מכוון לתמלול ערבית, ושהחלפת קודים — דוברים המחליפים שפות תוך כדי שיחה — היא היכולת שלמענה הוא נבנה, ולא תוצר לוואי.
• Gemini 3.5 Transcribe Live — זיהוי שפה אוטומטי ביותר מ-85 לוקאלים, עם החלפת קוד בתוך משפט ובין משפטים. התיעוד של Google מפרט את הערבית בתוך אותה קבוצה; טבלת הלוקאלים מציינת את ערבית (מצרים) כרשומת הערבית, וכיסוי הלוקאלים הרחב יותר בערבית אינו מפורט בתיעוד של המודל עצמו.
קראו את זה בכנות, וצורת העסקה מתגלה. ה-85 פלוס של גוגל הוא טענת רוחב: אם השמע שלכם בשפה שאינה ערבית, נקודת הקצה של גוגל מכסה אותה והמודל של Mistral יסרב לה — הכרטיס אומר במפורש שלשפות אחרות עליכם להשתמש ב-Voxtral Mini 4B Realtime המקורי, ולא בצ'קפוינט הזה. ה-16 של Mistral הוא טענת עומק. הוא אינו טוען לתמלל ערבית; הוא טוען לתמלל דאריג'ה מרוקאית, ערבית מפרצית, ערבית מצרית וערבית צ'אדית כיעדים נפרדים, וזו בעיה קשה באופן מהותי יותר מאשר לתמלל ערבית ספרותית מודרנית ולקוות שהניב ייפול ממנה מעצמו. בנצ'מרק מוטה-אנגלית שרוחב בא אצלו לפני עומק לעולם לא יראה לכם את ההבדל הזה, כי ערכות הניבים פשוט לא נמצאות בו.
עבור מוקד טלפוני מרוקאי או קו תמיכת לקוחות במפרץ, מודל שמטפל ב־16 דיאלקטים ותו לא יכול לגבור על מודל שמטפל ב־85 לוקאלים ברמת דיוק לא מוצהרת לכל דיאלקט. עבור חברה אירופית שמתמללת פגישות בחמש שפות, המשוואה מתהפכת מיד. אף אחד מהספקים אינו טועה; הם בחרו לקוחות שונים.

המספרים שאפשר להשוות, ואלה שאי אפשר
כאן האסימטריה נושכת. שני המודלים מדווחים על יחידות שונות, על קורפוסים שונים, עם ראיות שונות מאחוריהם, ואף צד שלישי לא הריץ אותם זה מול זה.
• Voxtral Mini 4B Realtime Arabic — שיעור שגיאת תווים ממוצע של 8.82% על פני שבעה מבחני ערבית, בהשהיית תמלול מוגדרת של 480 מילישניות. לפי הכרטיס של Mistral עצמה, ולא שוחזר באופן עצמאי.
• המודל שהוא רודף אחריו — Voxtral Transcribe Arabic עם 7.91% CER על אותם שבעה מבחנים לפי אותה מדידה, כך שהמודל בזמן אמת נמצא 0.91 נקודות אחוז מאחורי מודל ערבי לא מקוון מאותו ספק. הפער הזה הוא השוואה של Mistral עצמה, מה שהופך אותו למלמד במיוחד: הספק אומר לך מה עולה הסטרימינג בדיוק במשפחת שפות זו.
• Gemini 3.5 Transcribe Live — שיעור שגיאות מילים בזרימה של 4.0%, שנמדד על ידי Artificial Analysis וצוטט על ידי Google, כאשר תמלול סופי מגיע 0.40 שניות לאחר סיום הדיבור. כמו כן נמדדו: 2.6% בלוח הלא-זורם של אותו גוף מעקב, ו-5.50% בזרימה ב-FLEURS לפי הדיווח של Google עצמה.
אל תציבו 8.82% CER לצד 4.0% WER ותסיקו מכך מסקנה כלשהי. שיעור שגיאות תווים ושיעור שגיאות מילים הם מכנים שונים — הכתיב הערבי מגדיל את הפער ביניהם לעומת שפות בכתב לטיני — והקורפוסים אינם זהים, הנרמול אינו זהה, ומספר אחד מגיע עם סקריפט שניתן לשחזר ואילו האחר מגיע מתערובת קבועה של מערכת מעקב שמוטה לעבר שיח של נציגים באנגלית.
ההשוואה השימושית יותר היא זו שבתוך הכרטיס של Mistral עצמה: 8.82% בסטרימינג מול 7.91% אופליין, על אותם בנצ'מרקים עם אותו נרמול בדיוק. זו מדידה נקייה של מה שזמן השהיה נמוך קונה ומה שהוא עולה בערבית במיוחד, והיא שווה יותר מכל אחוז חוצה־ספקים. מה שאיש לא פרסם הוא הרצה ערבית בתנאים זהים של המודלים של Google ו-Mistral על אותו אודיו. עד שמישהו יעשה זאת, "איזו מדויקת יותר בערבית" היא שאלה פתוחה, והתשובה היחידה שניתן להגן עליה היא: נסו את שניהם על ההקלטות שלכם.
פרט אחד בכרטיס של Mistral ראוי לאזכור משום שהוא פוגע באינטרס של הספק עצמו. הוא מציין שמסנני הבטיחות של Gemini חוסמים תמלול של כמה דגימות אודיו של FLEURS. זו תצפית אמיתית וניתנת לבדיקה על צינור העיבוד של מתחרה, וזה גם בדיוק מסוג הדברים שלעולם אינם מופיעים בלוח דירוג — מודל שמסרב לתמלל דגימה נמדד ככישלון או כנעדר, ואף אחת משתי הקריאות אינה הוגנת. אם האודיו שלך כולל חומר שמסנן תוכן עלול לתפוס, זהו סיכון פריסה ששום נתון WER לא יחשוף.
השהיה: חוגה מול מספר קבוע
מודלי סטרימינג מושווים בדרך כלל לפי נתון השהיה בודד. לשני אלה אין נתון אחד משותף.
• Voxtral Mini 4B Realtime Arabic — השהיית תמלול ניתנת להגדרה. נתון ה-CER של 8.82% מצוטט ב-480 מילישניות, וההשהיה ניתנת להתאמה, כלומר מספר הדיוק הוא נקודה אחת על עקומה שהמפעיל בוחר, ולא מאפיין של המודל. מודל הבסיס שלה מציג טווח של 240 מילישניות עד 2.4 שניות.
• Gemini 3.5 Transcribe Live — 0.40 שניות מסוף הדיבור לתמלול סופי, כפי שנמדד על ידי Artificial Analysis, כאשר תמלולים חלקיים מגיעים ברציפות במהלך הדיבור. Google טוענת בנפרד לשיפור של 70% בזמן עד לתמלול סופי לעומת Chirp 3, שהוא נתון ספק ולא שוחזר.
שניהם נופלים לאותו אזור — בערך חצי שנייה — אבל המשמעות ההנדסית שונה. מודל Mistral מוסר לך את הפשרה בין השהיה לדיוק כפרמטר, כך שאתה יכול לפעול ב-240 ms כאשר כתוביות של פחות משנייה חשובות יותר מהנקודות האחרונות של הדיוק, ולהאריך את ההשהיה כשלא. נקודת הקצה של Google מציגה נקודת פעולה קבועה שאליה מצורפת התנהגות סינון התוכן של Google עצמה. עבור סוכן קולי, חוגה שווה יותר ממספר קבוע טוב במקצת, מפני שההגדרה הנכונה תלויה באודיו שלך ובמשתמשים שלך, ואף אחד מהספקים לא יכול לבחור אותה עבורך.
הקו המפריד האמיתי: משקלים פתוחים מול נקודת קצה לתצוגה מקדימה
ההבדל ברישיון ובהפצה גדול יותר מכל פער בבנצ'מרק בהשוואה הזו, והוא מכריע את רוב הפריסות בפועל לפני שמדברים על דיוק.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, משקולות BF16 ב-Hugging Face, ניתן להגשה עם vLLM דרך WebSocket בכתובת /v1/realtime, ונתמך באופן מובנה ב-Transformers מגרסה 5.2.0. כרטיס המודל כולל דוגמת Python ומודול נרמול, כך שתוכלו לשחזר בעצמכם את חישוב ה-CER בערבית. שום דבר בצינור העיבוד אינו דורש את השרתים של Mistral, והמודל קטן מספיק כך שהשאלה התפעולית היא איזה GPU, ולא אם אתם יכולים להרשות לעצמכם אחד.
• Gemini 3.5 Transcribe Live — API בלבד, תצוגה מקדימה ציבורית, ללא התחייבות מחיר מפורסמת מעבר לתעריפי המחירון, ותקרת סשן של עשר דקות, כלומר כל דבר ארוך יותר חייב להיות מחולק למקטעים, להתחבר מחדש ולאחות על ידי הקוד שלך. שלוש מגבלות שדווחו לצד ההשקה חשובות במיוחד לפריסות בערבית: נקודת הקצה של הזרמה אינה מחזירה הפרדת דוברים ואינה מחזירה חותמות זמן ברמת המילה, ושתיהן קיימות בנקודת הקצה של האצווה אך לא בזו. אם התמלול בערבית שלך צריך לדעת מי אמר מה, או להיות מיושר בזמן לאודיו, נקודת הקצה Live לא יכולה להפיק זאת, ללא קשר לשפה.
שני האילוצים האלה הם הטיעון החזק ביותר למודל הפתוח הקטן בפריסה ערבית אמיתית, ואין להם דבר וחצי דבר עם דיוק. צינור של מוקד טלפוני רוצה ייחוס דובר, צינור תאימות רוצה חתימות זמן, ומודל ערבי לא־מקוון עם סקריפט נרמול שאתה שולט בו נותן לך את שניהם בלי להתווכח עם חוזה של נקודת קצה. כרטיס המודל של Mistral גם מציין זאת כמגבלה ולא כתכונה — הוא מיועד לתמלול, הוא כיוונון עדין של מודל כללי בזמן אמת, והוא כן מודה שקיים מודל רחב יותר במעלה הזרם אם אתה צריך אחד.
מה העלות של כל אחד מהם, ומה לא ידוע
• Gemini 3.5 Transcribe Live — כ-$0.009 לדקת אודיו בתעריף משוקלל, נגזר ממחירי מחירון של $3.50 למיליון אסימוני קלט ו-$21 למיליון אסימוני פלט, כאשר האודיו מוערך ב-25 אסימונים לשנייה והתמלול בכ-175 אסימונים לדקה. נקודת הקצה של batch עולה כ-$0.005 לדקה. שני הנתונים הם הערכות המבוססות על הנחת הטוקניזציה של Google, ולכן הם משתנים אם החישוב משתנה. יש כיום מסלול חינם.
• Voxtral Mini 4B Realtime Arabic — אין מחיר מפורסם, כי אין שירות מפורסם. העלות היא מה שהחומרה שלך עולה. מודל BF16 עם 4.4 מיליארד פרמטרים נכנס על מאיץ מודרני בודד, כך שהעלות השולית לשעת אודיו היא חשמל וניצולת, והעלות הקבועה היא המכונה. זה זול יותר מכל API לפי דקה בהיקף גבוה ויקר יותר מכל API לפי דקה בהיקף אפס, שזו הצורה הרגילה של הסחר במשקלים פתוחים.
הבלתי־ידוע החשוב ביותר בצד של Mistral אינו המחיר. הוא האם המאגר הזה הוא תחילתו של קו מוצרים או תוצר חד־פעמי במסגרת השותפות עם מרוקו. מודל שמשוחרר בשקט בלי הכרזה, בלי תמחור ובלי שירות הוא מודל שאין מאחוריו התחייבות לתמיכה. Apache 2.0 פירושו שלא ניתן לבטל את הרישיון עבור המשקלים שכבר יש לך, אבל הוא אינו אומר דבר על האם נקודת הבדיקה תתוחזק, וההפניה למודל הבסיס בכרטיס עצמו מרמזת שמודל ה-realtime הכללי הוא עדיין הקו הנתמך.
עבור השכבה שמעל התמלול, שכבת ניתוב מצדיקה את קיומה בדרך שאין לה דבר עם תמלול. אף אחד מהמודלים האלה אינו שירות דיבור-לטקסט שאנחנו מארחים — OrcaRouter אינו מנתב אף אחת מנקודות הקצה — אבל המסכם, מסווג הכוונות או הסוכן שצורך את הזרם הוא מודל שאפשר לנתב: מפתח API אחד דרך יותר מ-200 מודלים במחיר המחירון של הספק עם 0% תוספת, כך שהורדת מחיר של ספק מגיעה לצד שלנו באותו היום, ובנוסף מעבר אוטומטי לגיבוי אם ספק מדרדר. אם אתם כבר מחברים יחד שני ספקי דיבור לכיסוי ניבים, הצבת מודלי השפה במורד הזרם מאחורי מפתח אחד במקום שני חוזים היא החצי הזול של האינטגרציה.
על איזה מהם לבנות
אם האודיו שלך הוא ערבית — ניב אחד, כמה ניבים, או החלפת קוד בין ערבית למשהו אחר — מודל Mistral הוא המועמד הרציני יותר, והסיבה היא מבנית ולא מספרית. הוא נוקב בשמות הניבים שעבורם נבנה, הוא קטן מספיק כדי לרוץ על החומרה שלך, הוא מחזיר טקסט גולמי שאותו אפשר לעבד לאחר מכן עם הנרמול שלך, והוא לא יושב מאחורי מגבלת סשן של עשר דקות או מסנן תוכן שאינך יכול לבחון. המחיר הוא בכך שהוא מטפל במשפחת שפות אחת ומסרב לכל השאר, ובכך שאף אחד עדיין לא פרסם הערכה בלתי תלויה שלו.
אם האודיו שלך משתרע על פני כמה שפות, או אם אתה זקוק לשירות עם מסלול תמיכה ומחירון מפורסם כבר היום, Gemini 3.5 Transcribe Live זמין לקריאה כעת, נמדד בכלי מעקב של צד שלישי, ומכסה את השפות ש-Mistral checkpoint ידחה. העלויות הן תקרת הסשן, היעדר דיאריזציה וחתימות זמן בנקודת הקצה של הזרימה, והעובדה שהדיוק הספציפי לערבית הוא טענה שתצטרך לבדוק בעצמך — רשימת הלוקאלים מציינת את מצרים, וביצועי הדיאלקט אינם מפורטים.
הדבר שכדאי לשים לב אליו אינו מדד ביצועים. השאלה היא אם Mistral מכריזה על המודל הזה בכלל, ואם כן, באיזה מחיר ובאיזו מפת דרכים לשונית. מאגר שקט עם רישיון Apache 2.0 הוא ארטיפקט שימושי ומחויבות חלשה. אם תבוא בעקבותיו מפת דרכים לניבים ערביים — לבנטיני, מפרץ ומצרי כצ׳קפוינטים נפרדים — המסלול של מודלים קטנים הופך לתשובה ממש שלמה לאזור, והרבה יותר קשה להעלות את טיעון הרוחב.

אף אחד מאלה אינו מודל דיבור שאנחנו מארחים, אבל השכבה שמעל לתמלול ניתנת לניתוב - יותר מ-200 מודלים מאחורי מפתח API אחד במחיר המחירון של הספק עם 0% תוספת, כך שהוזלה של ספק במודל החשיבה שנמצא במורד הזרם של התמלול שלך נכנסת לתוקף באותו היום.
מעבר אוטומטי לשרת גיבוימשמעו שלפייפליין דיבור משורשר יש תחום כשל אחד פחות, מכיוון שניתן לנתב מחדש את המסכם או מסווג הכוונות שצורך את התמלול במקום לרדת יחד עם ספק.
