بطاقة عنوان رئيسية مُولّدة لمقارنة بين Voxtral Mini 4B Realtime Arabic وVoxtral 4B TTS، بعنوان فرعي «طرفا حلقة الصوت العربية نفسها، وترخيصان مختلفان»، وشارة نصّها «كلام داخل مقابل كلام خارج»، مع ثلاث شرائح إحصائية تقرأ: معدل خطأ 8.82% في الحروف العربية عند 480 مللي ثانية مقابل 70 مللي ثانية حتى أول مقطع صوتي، و16 لهجة عربية مقابل 9 لغات من بينها العربية، وأوزان Apache 2.0 مقابل أوزان CC BY-NC 4.0، وشعار OrcaRouter مُركَّبًا في شريط أبيض أسفل اليمين.
Engineering & Research

Voxtral Mini 4B Realtime Arabic مقابل Voxtral 4B TTS: طرفا المحادثة نفسها

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يتشارك هذان النموذجان الاسم وعدد المعلمات، أما ملف الترخيص فيختلف سلوكه، وهنا ينتهي التشابه. إن Voxtral Mini 4B Realtime Arabic، الذي دُفع إلى Hugging Face في 8 أكتوبر 2026 دون إعلان مصاحب، يأخذ الصوت مدخلاً وينتج نصاً عربياً — نسخة مضبوطة بدقة متدفقة من Voxtral-Mini-4B-Realtime-2602، مصممة للعربية الفصحى الحديثة وخمس عشرة لهجة مسمّاة، برخصة Apache 2.0، ومتوسط معدل خطأ في الأحرف قدره 8.82% عند تأخير 480 مللي ثانية. أما Voxtral 4B T​TS، الذي أعلنت عنه Mistral AI في مارس 2026، فيفعل العكس: نص يدخل، وكلام يخرج، وعشرون صوتاً معدّاً مسبقاً إضافة إلى التكيّف من مقطع مرجعي قصير، وتسع لغات تشمل العربية، وترخيص — CC BY-NC 4.0 — يحظر الاستخدام التجاري للأوزان نفسها. إنهما ليسا بديلين وليسا متغيّرين. إنهما نصفا حلقة صوتية، وسبب النظر إليهما معاً هو أن القرارات التي تتخذها بشأن أحدهما تقيّد الآخر أكثر مما تتوقعه معظم الفرق.

تخبرك معظم صفحات المقارنة بأن هذين الطرازين لا علاقة بينهما لأن أحدهما ASR والآخر TTS، ثم تتوقف عند هذا الحد. هذا صحيح لكنه غير مفيد. أما ما يستحق المعرفة فعلاً فهو أين يلتقيان: وكيل صوتي يحتاج إلى كليهما، والترخيصان يشيران في اتجاهين متعاكسين، والبصمتان العتاديتان متشابهتان بينما خصائص الإنتاجية ليست كذلك، وادعاءات التغطية العربية تأتي بأشكال مختلفة تمامًا. كل ما يلي يتعلق بنقاط الالتقاء الأربع تلك.

ما هو كل نموذج، بالمصطلحات التي تهم خط المعالجة.

• Voxtral Mini 4B Realtime Arabic — التعرّف التلقائي المتدفق على الكلام. إدخال صوتي بتردد 16 kHz، وإخراج نصي، بنحو 4.4 مليار معامل بصيغة BF16، يُقدَّم عبر vLLM مع WebSocket على /v1/realtime أو أصليًا في Transformers بدءًا من الإصدار 5.2.0. مُرمِّز صوتي سببي ومُفكِّك لغة، وتأخير نسخ قابل للضبط مقداره 480 مللي ثانية لرقم الدقة المنشور، ووحدة تسوية مرفقة إلى جانبه بحيث يمكن إعادة اشتقاق معدل خطأ المحارف العربية. Apache 2.0.

• Voxtral 4B TTS — تحويل النص إلى كلام بالتدفق والدفعات. إدخال نص، وإخراج صوت بتردد 24 kHz بصيغ WAV، أو PCM، أو FLAC، أو MP3، أو AAC، أو Opus، بنحو 4 مليارات معامل، مع قائمة إعداد مسبق من 20 صوتًا وتكييف صوتي من مقطع مرجعي لا يتجاوز طوله ثلاث ثوانٍ. يفيد الاختبار المعياري الذي أجرته Mistral بنفسها على وحدة H200 واحدة تشغّل vLLM-Omni 0.18.0 مع إدخال من 500 حرف ومرجع مدته عشر ثوانٍ بأن زمن الوصول يبلغ 70 مللي ثانية وعامل الزمن الحقيقي 0.103 عند التزامن 1، ويرتفع إلى 331 مللي ثانية و0.237 عند التزامن 16، و552 مللي ثانية عند التزامن 32. ويمكن الوصول إليه كواجهة برمجة تطبيقات مقابل 0.016 دولار لكل ألف حرف.

الملاحظة الأولى المستخلصة من تلك الفقرتين هي أن الثنائي صغير. فكلا النموذجين يقع في نطاق 4 مليارات معامل، وكلاهما يتسع على مسرّع واحد بصيغة BF16، ما يعني أن وكيلًا صوتيًا عربيًا مبنيًا بالكامل على أوزان مفتوحة لا يتطلب في أقصى الحالات سوى نشر ببطاقتي GPU، ومن المعقول أيضًا أن يكون نشرًا ببطاقة GPU واحدة مع التكميم على الجانبين. وهذا هو السبب العملي للنظر إليهما كمجموعة واحدة بدلًا من النظر إليهما كقرارين منفصلين بشأن المنتج.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

عدم التماثل في الترخيص هو النتيجة، وليس حاشية.

إليك الأمر الذي يفاجئ أولئك الذين يفترضون أن النماذج الصادرة عن المختبر نفسه، والتي تتبع اصطلاح التسمية نفسه، تحمل الشروط ذاتها.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. يُسمح بالاستخدام التجاري والتعديل وإعادة التوزيع والضبط الدقيق، مع مراعاة القيد المعتاد ضد انتهاك حقوق الأطراف الثالثة.

• Voxtral 4B TTS — CC BY-NC 4.0، موروثة من مجموعات بيانات الصوت المرجعية التي تقف خلفها. غير تجارية. بطاقة Mistral صريحة في أن النموذج يورث ترخيص مراجعه الصوتية، المستمدة من مصادر تشمل EARS وCML-TTS وIndicVoices-R ومجموعة صوت طبيعي عربية. الأوزان قابلة للتنزيل والترخيص ليس تجارياً.

هذا قيد صارم على البنية الدقيقة التي يلجأ إليها الجميع أولًا. إذا بنيت وكيلًا صوتيًا عربيًا يكون الجزء الخاص بتحويل الكلام إلى نص فيه هو Voxtral Mini 4B Realtime Arabic، ويكون الجزء الخاص بتحويل النص إلى كلام فيه هو Voxtral 4B TTS، فلديك خط معالجة نصف مكوّناته مرخّص تجاريًا بحرية والنصف الآخر ليس كذلك، والنصف المقيِّد هو الذي يحكم المنتج. كون نموذج ASR مرخّصًا بموجب Apache 2.0 لا ينقذ جزء TTS. تشغيل هذا الثنائي محليًا لا يغيّر الترخيص، وكذلك لا يغيّره عدم شحن الأوزان — فالقيد يتعلّق بالاستخدام، لا بالتوزيع.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

المسار التجاري الذي تقدمه Mistral للجانب الصوتي هو واجهة API المستضافة بسعر 0.016 دولار لكل ألف حرف، وهو اتفاقية خدمة وليس منح ترخيص. بالنسبة لفريق منتج، النتيجة العملية هي أن النصف القابل للاستغلال التجاري بحرية في الحلقة هو النصف الذي يستمع، أما النصف الذي يتحدث فهو إما اعتماد على API أو نقاش ترخيص. وهذا يقلب ما تفترضه معظم الفرق عندما تشرع في بناء حزمة صوتية مفتوحة، ويستحق أن تكتشفه قبل أن تكتب التكامل وليس بعده.

لا تتوافق الادعاءات العربية، وواحد منها فقط يُعد وعدًا بالتغطية.

كلا الطرازين يدرجان اللغة العربية. لكن القوائم تعني أشياء مختلفة.

Voxtral Mini 4B Realtime Arabic — العربية هي النطاق بأكمله. ستة عشر تنوعًا مُعدَّدة كأهداف تدريب: العربية الفصحى الحديثة، والمغربية، والليبية، والتونسية، والجزائرية، والحسانية، والخليجية، والنجدية، والعُمانية، والصنعانية، والمصرية، والسودانية، والرافدينية، والشامية الجنوبية والشمالية، والتشادية. أي شيء خارج هذه المجموعة موثَّق بأنه خارج النطاق. رقم دقة إجمالي واحد، 8.82% CER، بمتوسط عبر سبعة معايير عربية.

• Voxtral 4B TTS — تُعدّ العربية إحدى اللغات التسع المدعومة، إلى جانب الإنجليزية والفرنسية والإسبانية والألمانية والإيطالية والبرتغالية والهولندية والهندية. تصف البطاقة "لهجات متنوعة" ضمن هذا الدعم، دون تعدادها، ولا يوجد رقم جودة لكل لغة منشور للعربية أو لأي من اللغات الثماني الأخرى.

عند قراءتهما معًا، يمنحك الثنائي بيانًا مفصّلًا عن مدى جودة سماع نظامك للعربية، ولا يكاد يمنحك أي بيان على الإطلاق عن مدى جودة نطقه بها. ولهذا التفاوت نتيجة حقيقية بالنسبة إلى وكيل صوتي بالدارجة أو بالعربية الخليجية: فجانب الإدخال لديه معيار منشور وقائمة لهجات يمكنك التقييم مقابلها، أما جانب الإخراج فلديه شارة لغة وقائمة أصوات. لم ينشر أحد قياسًا لمفهومية العربية اللهجية من أجل Voxtral 4B TTS، وميزة تكييف الصوت لا تحل ذلك — فتغيير الصوت يغيّر مَن يبدو الكلام مثل صوته، لا اللهجة التي ينتجها.

ثمة نقطة ثانية أكثر خفاءً تتعلق برقم دقة نموذج ASR نفسه وتمتد إلى جانب TTS. تُبلغ Mistral عن 8.82% CER في وضع البث مقابل 7.91% لـ Voxtral Transcribe Arabic في الوضع غير المتصل على المعايير السبعة نفسها وبالتطبيع نفسه، لذا يكلف البث نحو نقطة مئوية واحدة. أما المقايضة المكافئة على جانب TTS — أي كلفة الاستدلال بالبث في جودة المخرجات مقابل الدفعات — فليست مُكمَّمة في المادة على الإطلاق. أرقام الكمون موجودة؛ أما فرق الجودة فغير موجود.

الإنتاجية: أحد النموذجين مصمم ليُدفع إلى أقصى حدوده، والآخر ليس كذلك.

نشرت Mistral بيانات معدل الإنتاجية لواحد فقط من هذه النماذج، والأرقام تشرح السبب.

• Voxtral 4B TTS — تم القياس على وحدة H200 واحدة باستخدام vLLM-Omni، مع مدخلات من 500 حرف ومرجع صوتي مدته عشر ثوانٍ، ويتراوح معدل الإنتاجية من حوالي 119 حرفًا في الثانية من وقت GPU عند التزامن 1 إلى نحو 879 عند التزامن 16 وحوالي 1,431 عند التزامن 32، مع ارتفاع زمن الاستجابة من 70 مللي ثانية إلى 331 ثم 552. هذا منحنى إنتاجية يمكنك التخطيط للسعة بناءً عليه، وهو الشكل الذي تتوقعه من نموذج مصمم كخدمة صوتية إنتاجية.

• Voxtral Mini 4B Realtime Arabic — لا تذكر البطاقة أي رقم للإنتاجية، ولا سلوكًا للتزامن، ولا معيارًا للأجهزة. ما تذكره هو البنية: مُرمِّز سببي ومخطط انتباه بنافذة منزلقة على كلٍّ من المُرمِّز وفكّ الترميز، موصوفًا في النموذج الأساسي بأنه يدعم بثًا غير محدود فعليًا. وتُذكر نقطة الدقة عند تأخير قدره 480 مللي ثانية، ما يعني أن النموذج يواكب الصوت في الوقت الفعلي على أجهزة مناسبة، وهذا هو حدّ نطاق الأداء المنشور.

ليست الفجوة نقدًا لأي من النموذجين بقدر ما هي تصريح عن درجة النضج. نموذج TTS لديه جدول SLO منشور لأنه صدر كمنتج مصحوب بمقال مدونة، وعرض تجريبي، وواجهة API، وسعر. أما نموذج ASR العربي فلا يملك نطاق أداء منشورًا لأنه وصل كمستودع مرفق ببطاقة. وإذا كنت تحدد اليوم حجم أسطول للنسخ الصوتي العربي، فإن رقم الإنتاجية الذي تحتاجه غير موجود بعد، والسبيل الوحيد للحصول عليه هو تشغيل مسار الخدمة عبر vLLM على عتادك الخاص وببياناتك الصوتية الخاصة.

وهنا أيضًا تغيّر طبقة التوجيه شكل النشر، لا الفوترة فحسب. لا يوجّه OrcaRouter أيًّا من هذين النموذجين — فنحن لا نستضيف أيًّا من نقطتي نهاية الكلام لدى Mistral، وهذه المقالة لا تدّعي خلاف ذلك — لكن طبقة نموذج اللغة بينهما هي بالضبط الطبقة التي تستفيد من التوجيه: مفتاح API واحد عبر أكثر من 200 نموذج بسعر القائمة لدى المزوّد مع هامش ربح 0%، بحيث يصل تغيير سعر المورّد إلى جانبنا في اليوم نفسه الذي يُعلَن فيه، وتجاوز فشل تلقائي بحيث تصبح أمسية سيئة لمزوّد واحد في المنبع إعادة توجيه بدلًا من انقطاع في حلقة الصوت لديك. الوكيل الصوتي المُركَّب من نموذجَي Mistral مستضافَين ذاتيًا بالإضافة إلى نموذج استدلال مستضاف واحد لديه ثلاثة نطاقات فشل؛ وطبقة التوجيه هي ما يجعل النطاق الأوسط منها مملًا.

التكلفة، جنبًا إلى جنب، مع التحفّظ بأن أحد الجانبين لا سعر له

• Voxtral 4B TTS — 0.016 دولار لكل ألف حرف عبر واجهة برمجة تطبيقات Mistral، أو تكلفة وحدة معالجة الرسومات (GPU) إذا قمت بالاستضافة الذاتية وفق شروط تسمح بحالة الاستخدام الخاصة بك. ولإعطاء فكرة تقريبية عن الحجم، فإن ألف حرف تعادل بضع مئات من الكلمات، لذا فإن دقيقة من الإخراج المنطوق تبلغ أجزاءً صغيرة من السنت بسعر القائمة، قبل أي ميزة تزامن من تشغيله بنفسك.

• Voxtral Mini 4B Realtime Arabic — لا يوجد سعر منشور، ولا خدمة مُستضافة، ولا قائمة أسعار. التكلفة هي العتاد والاستغلال. نموذج 4.4B BF16 على مُسرّع حديث واحد هو تكلفة شهرية ثابتة توزّعها على أكبر قدر من الصوت يمكن للجهاز معالجته، وهو رخيص عند الحجم المستمر ومضيعة محضة عند الحجم المتقطع.

المقارنة التي تُهم على الأرجح أكثر هي تلك مع البدائل التي قد تلجأ إليها بدلاً من ذلك. على جانب الاستماع، تتنافس نقطة التفتيش العربية مع واجهات برمجة تطبيقات البث بالساعة التي تُنشر أسعارها وتكون منخفضة — MAI-Transcribe-2-Streaming من Microsoft بسعر 0.54 دولار لكل ساعة صوتية كسعر تمهيدي، وGrok Voice Transcribe 2.0 من xAI بسعر 0.20 دولار لكل ساعة صوتية للبث — مما يعني أنه يمكن شراء خدمة نسخ عربية مقابل بضعة أعشار سنت لكل دقيقة، ويجب أن تُبنى الحجة لصالح الأوزان المفتوحة على دقة اللهجة، أو إقامة البيانات، أو الضبط الدقيق، بدلاً من تكلفة الوحدة. على جانب التحدث، يُعد نموذج TTS المستضاف ذاتيًا بتكلفة حدية صفرية ميزة حقيقية مقارنة بواجهات برمجة التطبيقات التي تُحاسب لكل حرف عند الحجم الكبير، وهذا هو السبب في أن رخصة CC BY-NC هي العامل المقيّد بدلاً من السعر.

ملاحظة هيكلية واحدة لكل من يضع ميزانية لتبديل قائم على السعر: إن الموجّه الذي يمرّر سعر قائمة المزوّد كما هو دون أي هامش ربح هو السطح الذي يظهر فيه تغيّر أسعار المورّد في اليوم نفسه الذي يُعلن فيه، لا في دورة إعادة التسعير التالية. وهذا يهمّ في جانب الاستماع أكثر من جانب التحدث، لأن النسخ الصوتي يُسعّر لكل ساعة من الصوت، وهذا رقم يحرّكه المورّدون.

كيفية التفكير في الاختيار بينها

أنت لا تختار بينهما. السؤال هو أي نصف من الحلقة يمكنك بناؤه على أوزان مفتوحة، والترخيص يجيب عليه.

إذا كان متطلبك هو وكيل صوتي عربي مكتفٍ ذاتيًا لا يغادر فيه الصوت بنيتك التحتية أبدًا، فإن مسار الاستماع متاح لك دون قيد أو شرط: Apache 2.0، قابل للتنزيل، وقابل للضبط الدقيق، مع قائمة لهجات يمكنك الاختبار عليها ومعدل خطأ عربي منشور. أما مسار التحدث فهو حيث يقع القيد، ولديك خياران صريحان — نقل تركيب الكلام إلى خدمة مستضافة بموجب اتفاق تجاري، أو إزالة Voxtral 4B TTS من البنية المعمارية والعثور على نموذج تركيب كلام مرخّص ترخيصًا متسامحًا للعربية.

إذا كان متطلبك هو خدمة نسخ إنتاجية وكانت اللغة هي العربية، فإن القرار يقع بين نقطة تحقق قابلة للتنزيل بحجم 4.4B مع تصنيف لهجات منشور ومعدل خطأ إجمالي واحد، وبين API بث مستضاف مع معدل منشور وزمن استجابة منشور ولوحة تقييم من طرف ثالث. يتفوق النموذج المفتوح في التحكم وإقامة البيانات والضبط الدقيق؛ بينما تتفوق الخيارات المستضافة في الأدلة والدعم والبساطة التشغيلية. بعد يومين من ظهور الأوزان، لم يقسها أحد خارج Mistral، وهذا سبب لتشغيل المعيار الخاص بك بدلاً من أن يكون سبباً لرفض نقطة التحقق.

ما سيغيّر هذه الصورة أكثر من أي شيء هو إصدار تخليق عربي بشروط تسمح بالاستخدام التجاري — وهو النمط نفسه الذي يتبعه جانب الاستماع بالفعل. وإلى أن يوجد ذلك، تبقى الحلقة نصف مفتوحة، والعمل العملي هو أن تقرر أي نصف تقبل أن تستأجره.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

نحن لا نستضيف أيًّا من هذين النموذجين الصوتيين من Mistral، ولا يدّعي هذا المقال خلاف ذلك؛ ما تحتاجه حلقة الصوت فوقهما هو طبقة اللغة، وهي قابلة للتوجيه - مفتاح API واحد عبر أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش ربح 0%، بحيث يصل أي تغيير في أسعار المورّد إلى جانبنا في اليوم نفسه الذي يُعلن فيه.

التبديل التلقائي عند الفشل يمنع الجزء الأوسط من وكيل صوتي ثلاثي المكوّنات — نموذج استدلال واحد في المنبع بين نموذجَي Mistral المستضافين ذاتيًا — من أن يكون الجزء الذي يتسبب في تعطيل المنتج.