
Voxtral Mini 4B Realtime Arabic مقابل Voxtral 4B TTS: طرفا المحادثة نفسها
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
يتشارك هذان النموذجان الاسم وعدد المعلمات، أما ملف الترخيص فيختلف سلوكه، وهنا ينتهي التشابه. إن Voxtral Mini 4B Realtime Arabic، الذي دُفع إلى Hugging Face في 8 أكتوبر 2026 دون إعلان مصاحب، يأخذ الصوت مدخلاً وينتج نصاً عربياً — نسخة مضبوطة بدقة متدفقة من Voxtral-Mini-4B-Realtime-2602، مصممة للعربية الفصحى الحديثة وخمس عشرة لهجة مسمّاة، برخصة Apache 2.0، ومتوسط معدل خطأ في الأحرف قدره 8.82% عند تأخير 480 مللي ثانية. أما Voxtral 4B TTS، الذي أعلنت عنه Mistral AI في مارس 2026، فيفعل العكس: نص يدخل، وكلام يخرج، وعشرون صوتاً معدّاً مسبقاً إضافة إلى التكيّف من مقطع مرجعي قصير، وتسع لغات تشمل العربية، وترخيص — CC BY-NC 4.0 — يحظر الاستخدام التجاري للأوزان نفسها. إنهما ليسا بديلين وليسا متغيّرين. إنهما نصفا حلقة صوتية، وسبب النظر إليهما معاً هو أن القرارات التي تتخذها بشأن أحدهما تقيّد الآخر أكثر مما تتوقعه معظم الفرق.
تخبرك معظم صفحات المقارنة بأن هذين الطرازين لا علاقة بينهما لأن أحدهما ASR والآخر TTS، ثم تتوقف عند هذا الحد. هذا صحيح لكنه غير مفيد. أما ما يستحق المعرفة فعلاً فهو أين يلتقيان: وكيل صوتي يحتاج إلى كليهما، والترخيصان يشيران في اتجاهين متعاكسين، والبصمتان العتاديتان متشابهتان بينما خصائص الإنتاجية ليست كذلك، وادعاءات التغطية العربية تأتي بأشكال مختلفة تمامًا. كل ما يلي يتعلق بنقاط الالتقاء الأربع تلك.
ما هو كل نموذج، بالمصطلحات التي تهم خط المعالجة.
• Voxtral Mini 4B Realtime Arabic — التعرّف التلقائي المتدفق على الكلام. إدخال صوتي بتردد 16 kHz، وإخراج نصي، بنحو 4.4 مليار معامل بصيغة BF16، يُقدَّم عبر vLLM مع WebSocket على /v1/realtime أو أصليًا في Transformers بدءًا من الإصدار 5.2.0. مُرمِّز صوتي سببي ومُفكِّك لغة، وتأخير نسخ قابل للضبط مقداره 480 مللي ثانية لرقم الدقة المنشور، ووحدة تسوية مرفقة إلى جانبه بحيث يمكن إعادة اشتقاق معدل خطأ المحارف العربية. Apache 2.0.
• Voxtral 4B TTS — تحويل النص إلى كلام بالتدفق والدفعات. إدخال نص، وإخراج صوت بتردد 24 kHz بصيغ WAV، أو PCM، أو FLAC، أو MP3، أو AAC، أو Opus، بنحو 4 مليارات معامل، مع قائمة إعداد مسبق من 20 صوتًا وتكييف صوتي من مقطع مرجعي لا يتجاوز طوله ثلاث ثوانٍ. يفيد الاختبار المعياري الذي أجرته Mistral بنفسها على وحدة H200 واحدة تشغّل vLLM-Omni 0.18.0 مع إدخال من 500 حرف ومرجع مدته عشر ثوانٍ بأن زمن الوصول يبلغ 70 مللي ثانية وعامل الزمن الحقيقي 0.103 عند التزامن 1، ويرتفع إلى 331 مللي ثانية و0.237 عند التزامن 16، و552 مللي ثانية عند التزامن 32. ويمكن الوصول إليه كواجهة برمجة تطبيقات مقابل 0.016 دولار لكل ألف حرف.
الملاحظة الأولى المستخلصة من تلك الفقرتين هي أن الثنائي صغير. فكلا النموذجين يقع في نطاق 4 مليارات معامل، وكلاهما يتسع على مسرّع واحد بصيغة BF16، ما يعني أن وكيلًا صوتيًا عربيًا مبنيًا بالكامل على أوزان مفتوحة لا يتطلب في أقصى الحالات سوى نشر ببطاقتي GPU، ومن المعقول أيضًا أن يكون نشرًا ببطاقة GPU واحدة مع التكميم على الجانبين. وهذا هو السبب العملي للنظر إليهما كمجموعة واحدة بدلًا من النظر إليهما كقرارين منفصلين بشأن المنتج.

عدم التماثل في الترخيص هو النتيجة، وليس حاشية.
إليك الأمر الذي يفاجئ أولئك الذين يفترضون أن النماذج الصادرة عن المختبر نفسه، والتي تتبع اصطلاح التسمية نفسه، تحمل الشروط ذاتها.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. يُسمح بالاستخدام التجاري والتعديل وإعادة التوزيع والضبط الدقيق، مع مراعاة القيد المعتاد ضد انتهاك حقوق الأطراف الثالثة.
• Voxtral 4B TTS — CC BY-NC 4.0، موروثة من مجموعات بيانات الصوت المرجعية التي تقف خلفها. غير تجارية. بطاقة Mistral صريحة في أن النموذج يورث ترخيص مراجعه الصوتية، المستمدة من مصادر تشمل EARS وCML-TTS وIndicVoices-R ومجموعة صوت طبيعي عربية. الأوزان قابلة للتنزيل والترخيص ليس تجارياً.
هذا قيد صارم على البنية الدقيقة التي يلجأ إليها الجميع أولًا. إذا بنيت وكيلًا صوتيًا عربيًا يكون الجزء الخاص بتحويل الكلام إلى نص فيه هو Voxtral Mini 4B Realtime Arabic، ويكون الجزء الخاص بتحويل النص إلى كلام فيه هو Voxtral 4B TTS، فلديك خط معالجة نصف مكوّناته مرخّص تجاريًا بحرية والنصف الآخر ليس كذلك، والنصف المقيِّد هو الذي يحكم المنتج. كون نموذج ASR مرخّصًا بموجب Apache 2.0 لا ينقذ جزء TTS. تشغيل هذا الثنائي محليًا لا يغيّر الترخيص، وكذلك لا يغيّره عدم شحن الأوزان — فالقيد يتعلّق بالاستخدام، لا بالتوزيع.

المسار التجاري الذي تقدمه Mistral للجانب الصوتي هو واجهة API المستضافة بسعر 0.016 دولار لكل ألف حرف، وهو اتفاقية خدمة وليس منح ترخيص. بالنسبة لفريق منتج، النتيجة العملية هي أن النصف القابل للاستغلال التجاري بحرية في الحلقة هو النصف الذي يستمع، أما النصف الذي يتحدث فهو إما اعتماد على API أو نقاش ترخيص. وهذا يقلب ما تفترضه معظم الفرق عندما تشرع في بناء حزمة صوتية مفتوحة، ويستحق أن تكتشفه قبل أن تكتب التكامل وليس بعده.
لا تتوافق الادعاءات العربية، وواحد منها فقط يُعد وعدًا بالتغطية.
كلا الطرازين يدرجان اللغة العربية. لكن القوائم تعني أشياء مختلفة.
Voxtral Mini 4B Realtime Arabic — العربية هي النطاق بأكمله. ستة عشر تنوعًا مُعدَّدة كأهداف تدريب: العربية الفصحى الحديثة، والمغربية، والليبية، والتونسية، والجزائرية، والحسانية، والخليجية، والنجدية، والعُمانية، والصنعانية، والمصرية، والسودانية، والرافدينية، والشامية الجنوبية والشمالية، والتشادية. أي شيء خارج هذه المجموعة موثَّق بأنه خارج النطاق. رقم دقة إجمالي واحد، 8.82% CER، بمتوسط عبر سبعة معايير عربية.
• Voxtral 4B TTS — تُعدّ العربية إحدى اللغات التسع المدعومة، إلى جانب الإنجليزية والفرنسية والإسبانية والألمانية والإيطالية والبرتغالية والهولندية والهندية. تصف البطاقة "لهجات متنوعة" ضمن هذا الدعم، دون تعدادها، ولا يوجد رقم جودة لكل لغة منشور للعربية أو لأي من اللغات الثماني الأخرى.
عند قراءتهما معًا، يمنحك الثنائي بيانًا مفصّلًا عن مدى جودة سماع نظامك للعربية، ولا يكاد يمنحك أي بيان على الإطلاق عن مدى جودة نطقه بها. ولهذا التفاوت نتيجة حقيقية بالنسبة إلى وكيل صوتي بالدارجة أو بالعربية الخليجية: فجانب الإدخال لديه معيار منشور وقائمة لهجات يمكنك التقييم مقابلها، أما جانب الإخراج فلديه شارة لغة وقائمة أصوات. لم ينشر أحد قياسًا لمفهومية العربية اللهجية من أجل Voxtral 4B TTS، وميزة تكييف الصوت لا تحل ذلك — فتغيير الصوت يغيّر مَن يبدو الكلام مثل صوته، لا اللهجة التي ينتجها.
ثمة نقطة ثانية أكثر خفاءً تتعلق برقم دقة نموذج ASR نفسه وتمتد إلى جانب TTS. تُبلغ Mistral عن 8.82% CER في وضع البث مقابل 7.91% لـ Voxtral Transcribe Arabic في الوضع غير المتصل على المعايير السبعة نفسها وبالتطبيع نفسه، لذا يكلف البث نحو نقطة مئوية واحدة. أما المقايضة المكافئة على جانب TTS — أي كلفة الاستدلال بالبث في جودة المخرجات مقابل الدفعات — فليست مُكمَّمة في المادة على الإطلاق. أرقام الكمون موجودة؛ أما فرق الجودة فغير موجود.
الإنتاجية: أحد النموذجين مصمم ليُدفع إلى أقصى حدوده، والآخر ليس كذلك.
نشرت Mistral بيانات معدل الإنتاجية لواحد فقط من هذه النماذج، والأرقام تشرح السبب.
• Voxtral 4B TTS — تم القياس على وحدة H200 واحدة باستخدام vLLM-Omni، مع مدخلات من 500 حرف ومرجع صوتي مدته عشر ثوانٍ، ويتراوح معدل الإنتاجية من حوالي 119 حرفًا في الثانية من وقت GPU عند التزامن 1 إلى نحو 879 عند التزامن 16 وحوالي 1,431 عند التزامن 32، مع ارتفاع زمن الاستجابة من 70 مللي ثانية إلى 331 ثم 552. هذا منحنى إنتاجية يمكنك التخطيط للسعة بناءً عليه، وهو الشكل الذي تتوقعه من نموذج مصمم كخدمة صوتية إنتاجية.
• Voxtral Mini 4B Realtime Arabic — لا تذكر البطاقة أي رقم للإنتاجية، ولا سلوكًا للتزامن، ولا معيارًا للأجهزة. ما تذكره هو البنية: مُرمِّز سببي ومخطط انتباه بنافذة منزلقة على كلٍّ من المُرمِّز وفكّ الترميز، موصوفًا في النموذج الأساسي بأنه يدعم بثًا غير محدود فعليًا. وتُذكر نقطة الدقة عند تأخير قدره 480 مللي ثانية، ما يعني أن النموذج يواكب الصوت في الوقت الفعلي على أجهزة مناسبة، وهذا هو حدّ نطاق الأداء المنشور.
ليست الفجوة نقدًا لأي من النموذجين بقدر ما هي تصريح عن درجة النضج. نموذج TTS لديه جدول SLO منشور لأنه صدر كمنتج مصحوب بمقال مدونة، وعرض تجريبي، وواجهة API، وسعر. أما نموذج ASR العربي فلا يملك نطاق أداء منشورًا لأنه وصل كمستودع مرفق ببطاقة. وإذا كنت تحدد اليوم حجم أسطول للنسخ الصوتي العربي، فإن رقم الإنتاجية الذي تحتاجه غير موجود بعد، والسبيل الوحيد للحصول عليه هو تشغيل مسار الخدمة عبر vLLM على عتادك الخاص وببياناتك الصوتية الخاصة.
وهنا أيضًا تغيّر طبقة التوجيه شكل النشر، لا الفوترة فحسب. لا يوجّه OrcaRouter أيًّا من هذين النموذجين — فنحن لا نستضيف أيًّا من نقطتي نهاية الكلام لدى Mistral، وهذه المقالة لا تدّعي خلاف ذلك — لكن طبقة نموذج اللغة بينهما هي بالضبط الطبقة التي تستفيد من التوجيه: مفتاح API واحد عبر أكثر من 200 نموذج بسعر القائمة لدى المزوّد مع هامش ربح 0%، بحيث يصل تغيير سعر المورّد إلى جانبنا في اليوم نفسه الذي يُعلَن فيه، وتجاوز فشل تلقائي بحيث تصبح أمسية سيئة لمزوّد واحد في المنبع إعادة توجيه بدلًا من انقطاع في حلقة الصوت لديك. الوكيل الصوتي المُركَّب من نموذجَي Mistral مستضافَين ذاتيًا بالإضافة إلى نموذج استدلال مستضاف واحد لديه ثلاثة نطاقات فشل؛ وطبقة التوجيه هي ما يجعل النطاق الأوسط منها مملًا.
التكلفة، جنبًا إلى جنب، مع التحفّظ بأن أحد الجانبين لا سعر له
• Voxtral 4B TTS — 0.016 دولار لكل ألف حرف عبر واجهة برمجة تطبيقات Mistral، أو تكلفة وحدة معالجة الرسومات (GPU) إذا قمت بالاستضافة الذاتية وفق شروط تسمح بحالة الاستخدام الخاصة بك. ولإعطاء فكرة تقريبية عن الحجم، فإن ألف حرف تعادل بضع مئات من الكلمات، لذا فإن دقيقة من الإخراج المنطوق تبلغ أجزاءً صغيرة من السنت بسعر القائمة، قبل أي ميزة تزامن من تشغيله بنفسك.
• Voxtral Mini 4B Realtime Arabic — لا يوجد سعر منشور، ولا خدمة مُستضافة، ولا قائمة أسعار. التكلفة هي العتاد والاستغلال. نموذج 4.4B BF16 على مُسرّع حديث واحد هو تكلفة شهرية ثابتة توزّعها على أكبر قدر من الصوت يمكن للجهاز معالجته، وهو رخيص عند الحجم المستمر ومضيعة محضة عند الحجم المتقطع.
المقارنة التي تُهم على الأرجح أكثر هي تلك مع البدائل التي قد تلجأ إليها بدلاً من ذلك. على جانب الاستماع، تتنافس نقطة التفتيش العربية مع واجهات برمجة تطبيقات البث بالساعة التي تُنشر أسعارها وتكون منخفضة — MAI-Transcribe-2-Streaming من Microsoft بسعر 0.54 دولار لكل ساعة صوتية كسعر تمهيدي، وGrok Voice Transcribe 2.0 من xAI بسعر 0.20 دولار لكل ساعة صوتية للبث — مما يعني أنه يمكن شراء خدمة نسخ عربية مقابل بضعة أعشار سنت لكل دقيقة، ويجب أن تُبنى الحجة لصالح الأوزان المفتوحة على دقة اللهجة، أو إقامة البيانات، أو الضبط الدقيق، بدلاً من تكلفة الوحدة. على جانب التحدث، يُعد نموذج TTS المستضاف ذاتيًا بتكلفة حدية صفرية ميزة حقيقية مقارنة بواجهات برمجة التطبيقات التي تُحاسب لكل حرف عند الحجم الكبير، وهذا هو السبب في أن رخصة CC BY-NC هي العامل المقيّد بدلاً من السعر.
ملاحظة هيكلية واحدة لكل من يضع ميزانية لتبديل قائم على السعر: إن الموجّه الذي يمرّر سعر قائمة المزوّد كما هو دون أي هامش ربح هو السطح الذي يظهر فيه تغيّر أسعار المورّد في اليوم نفسه الذي يُعلن فيه، لا في دورة إعادة التسعير التالية. وهذا يهمّ في جانب الاستماع أكثر من جانب التحدث، لأن النسخ الصوتي يُسعّر لكل ساعة من الصوت، وهذا رقم يحرّكه المورّدون.
كيفية التفكير في الاختيار بينها
أنت لا تختار بينهما. السؤال هو أي نصف من الحلقة يمكنك بناؤه على أوزان مفتوحة، والترخيص يجيب عليه.
إذا كان متطلبك هو وكيل صوتي عربي مكتفٍ ذاتيًا لا يغادر فيه الصوت بنيتك التحتية أبدًا، فإن مسار الاستماع متاح لك دون قيد أو شرط: Apache 2.0، قابل للتنزيل، وقابل للضبط الدقيق، مع قائمة لهجات يمكنك الاختبار عليها ومعدل خطأ عربي منشور. أما مسار التحدث فهو حيث يقع القيد، ولديك خياران صريحان — نقل تركيب الكلام إلى خدمة مستضافة بموجب اتفاق تجاري، أو إزالة Voxtral 4B TTS من البنية المعمارية والعثور على نموذج تركيب كلام مرخّص ترخيصًا متسامحًا للعربية.
إذا كان متطلبك هو خدمة نسخ إنتاجية وكانت اللغة هي العربية، فإن القرار يقع بين نقطة تحقق قابلة للتنزيل بحجم 4.4B مع تصنيف لهجات منشور ومعدل خطأ إجمالي واحد، وبين API بث مستضاف مع معدل منشور وزمن استجابة منشور ولوحة تقييم من طرف ثالث. يتفوق النموذج المفتوح في التحكم وإقامة البيانات والضبط الدقيق؛ بينما تتفوق الخيارات المستضافة في الأدلة والدعم والبساطة التشغيلية. بعد يومين من ظهور الأوزان، لم يقسها أحد خارج Mistral، وهذا سبب لتشغيل المعيار الخاص بك بدلاً من أن يكون سبباً لرفض نقطة التحقق.
ما سيغيّر هذه الصورة أكثر من أي شيء هو إصدار تخليق عربي بشروط تسمح بالاستخدام التجاري — وهو النمط نفسه الذي يتبعه جانب الاستماع بالفعل. وإلى أن يوجد ذلك، تبقى الحلقة نصف مفتوحة، والعمل العملي هو أن تقرر أي نصف تقبل أن تستأجره.

نحن لا نستضيف أيًّا من هذين النموذجين الصوتيين من Mistral، ولا يدّعي هذا المقال خلاف ذلك؛ ما تحتاجه حلقة الصوت فوقهما هو طبقة اللغة، وهي قابلة للتوجيه - مفتاح API واحد عبر أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش ربح 0%، بحيث يصل أي تغيير في أسعار المورّد إلى جانبنا في اليوم نفسه الذي يُعلن فيه.
التبديل التلقائي عند الفشل يمنع الجزء الأوسط من وكيل صوتي ثلاثي المكوّنات — نموذج استدلال واحد في المنبع بين نموذجَي Mistral المستضافين ذاتيًا — من أن يكون الجزء الذي يتسبب في تعطيل المنتج.
