تم إنشاء بطاقة عنوان رئيسية لمقارنة بين Voxtral Mini 4B Realtime Arabic وMAI-Transcribe-2-Streaming، بعنوان فرعي «وافدان من أكتوبر، ومشكلتا أدلة»، وشارة تحمل «أكتوبر 2026، كلاهما بحسب ما أبلغ عنه المورّد»، مع ثلاث شرائح إحصائية تقرأ 8.82% معدل خطأ الحروف العربية عند 480ms مقابل 2.5% معدل خطأ الكلمات عند 0.13s، و16 لهجة مقابل 60 لغة، وأوزان Apache 2.0 مقابل Azure preview بسعر $0.54 لكل ساعة صوتية، وشعار OrcaRouter مُركَّب في شريط أبيض أسفل اليمين.
Guides & Insights

Voxtral Mini 4B Realtime Arabic مقابل MAI-Transcribe-2-Streaming: وصولان في أكتوبر، ومشكلتان في الأدلة

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يفصل سبعة أيام بين هذين النموذجين للكلام في الزمن الحقيقي، وقد وصلا بطريقتين متعاكستين. MAI-Transcribe-2-Streaming هو أول نموذج نسخ متدفق من Microsoft AI، أُعلن عنه في 1 أكتوبر 2026 بمنشور إطلاق، وإدراج معاينة على Azure، وسعر تعريفي قدره 0.54 دولار لكل ساعة صوتية حتى نهاية العام، وادعاء بأنه الأول على لوحة البث المتدفق الخاصة بـ Artificial Analysis في كل من دقة النص النهائي والجزئي، عند معدل خطأ كلمات نسبته 2.5%، مع جهوزية النص النهائي بعد 0.13 ثانية من انتهاء الكلام. أما Voxtral Mini 4B Realtime Arabic فهو نموذج Mistral AI للبث المتدفق باللهجات العربية، نُشر على Hugging Face في 8 أكتوبر 2026 دون أي إعلان على الإطلاق — لا منشور مدونة، ولا سعر، ولا خدمة، فقط أوزان Apache 2.0 وبطاقة نموذج تُفيد بمتوسط معدل خطأ أحرف نسبته 8.82% عبر سبعة معايير عربية عند تأخير قدره 480 ميلي ثانية. نموذج Microsoft منتج مكتمل بعنوان رئيسي غير قابل للتحقق. ونموذج Mistral أثر قابل للتحقق لا يحيط به أي منتج. وكلاهما يستحق الفهم تحديدًا لأن كليهما يترك السؤال المحوري — إلى أي مدى يتعامل هذا مع العربية بجودة — لا يجيب عنه سوى المورّد.

تستحق المقارنة إجراؤها على أي حال، لأنّ النموذجين يؤطّران القرار الهندسي نفسه من طرفين متقابلين. فشركة Microsoft تبيع الاتساع وخدمة مُدارة: ستّون لغة مع كشف تلقائي مستمر للغة، تعمل داخل Azure AI Speech، بسعر بالساعة، في مرحلة المعاينة. أما Mistral فتمنح العمق مجانًا: ستّ عشرة لهجة عربية مسمّاة، صغيرة بما يكفي لتعمل على مسرّع واحد، مع نصّ برمجي للتطبيع يتيح لك تدقيق التقييم بنفسك. وإذا كنت تُنشئ خط أنابيب للنسخ العربي هذا الشهر، فأنت تختار بين هذين الطرحين، ويتوقّف الاختيار على أدلة لا تملكها بعد في كلتا الحالتين.

ما قاله كل مورّد فعليًا، وما تقوله المجالس.

إن فجوة الأدلة هي أهم سمة في هذه المواجهة، لذا تأتي أولاً.

• MAI-Transcribe-2-Streaming — معدل خطأ الكلمات في النص النهائي بنسبة 2.5% عند 0.13 ثانية بعد انتهاء الكلام، ونفس النسبة 2.5% في أولى النصوص الجزئية عند 0.12 ثانية، وقد قُدّم كلاهما بوصفه المركز الأول في الدقة وفق منهجية AA-WER Streaming لدى Artificial Analysis. وهذه صياغة مايكروسوفت نفسها. واعتبارًا من وقت كتابة هذا المقال، لم يرسم لوح البثّ الخاص بالمتتبّع صفًا لهذا الطراز، لذا يظل الادعاء قائمًا على منهجية المتتبّع دون أن يسنده رقم منشور من المتتبّع.

• Voxtral Mini 4B Realtime Arabic — معدل خطأ أحرف بلغ 8.82% في المتوسط عبر سبعة معايير عربية عند تأخير مُهيَّأ قدره 480 مللي ثانية. بطاقة Mistral الخاصة، مع توفير كود التقييم. لم يُعِد إنتاجه أي طرف ثالث، وعمر النموذج يومان.

إذن، الرقمان الرئيسان في هذا المقال هما، على التوالي، ادّعاء مورّد مأخوذ على مسطرة شخص آخر، وادّعاء مورّد مرفق بمسطرته الخاصة. لا يُعدّ أيٌّ منهما قياسًا مستقلًا. ما يختلف هو أن رقم Mistral يأتي مرفقًا به سكربت التطبيع الذي تحتاجه لإعادة اشتقاقه، بينما يأتي رقم Microsoft مرفقًا بلوحة لم تضع ذلك الرقم بعد على المخطط. إذا كنت بصدد اتخاذ قرار شراء، فإن هذا التمييز يهم أكثر من الفارق بين 2.5 و8.82، وهو فارق لا معنى له على أي حال — فمعدل خطأ الكلمات ومعدل خطأ الأحرف لا يقبلان التحويل بينهما، كما أن الرسم الإملائي العربي يوسّع الفجوة بينهما بشكل كبير.

المقارنة الوحيدة داخل بطاقة Mistral التي تصلح فعلاً هي تلك التي تجري مقابل نظيرها غير المتصل: Voxtral Transcribe Arabic عند 7.91% CER على المعايير السبعة نفسها وبالتطبيع نفسه، لذا يكلّف النمط المتدفق هذا النموذج 0.91 نقطة مئوية. نشرت Microsoft رقماً مكافئاً لعائلتها عندما أطلقت MAI-Transcribe-2 الدفعي في 3 سبتمبر 2026 بمعدل خطأ كلمات بلغ 2.0% — تتنازل النسخة المتدفقة عن نصف نقطة أمام النموذج الدفعي مع إضافة التسليم في الوقت الفعلي. اقرأ هذين الفارقين الداخليين للمورّدين جنباً إلى جنب وستحصل على المقولة الوحيدة القابلة للمقارنة المباشرة في هذا المقال: على معاييرها الخاصة، يتخلف منتج البث لدى كل مختبر عن نظيره الدفعي، بنحو نقطة واحدة في حالة ونصف نقطة في الأخرى، وكلاهما يقيس لغتين مختلفتين.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

تغطية اللغات: 60 مقابل 16، والفجوة نفسها غير المسمّاة على الجانبين

• MAI-Transcribe-2-Streaming — 60 لغة مع كشف تلقائي مستمر للغة، فلا تحتاج الجلسة التي تبدّل اللغات أثناء البث إلى تحديد اللغة مسبقًا. مواد إطلاق Microsoft تعطي العدد لا القائمة؛ وثائق دعم اللغات في Azure الخاصة بعائلة MAI-Transcribe هي التي تُبيّن التغطية بندًا بندًا، وتوثّق اللغة العربية ضمن اللغات المدعومة لهذه العائلة.

• Voxtral Mini 4B Realtime Arabic — ستة عشر تنوعًا عربيًا، مذكورة بالاسم كل على حدة: العربية الفصحى الحديثة، والمغربية، والليبية، والتونسية، والجزائرية، والحسانية، والخليجية، والنجدية، والعمانية، والصنعانية، والمصرية، والسودانية، والرافدينية، والشامية الجنوبية والشمالية معًا، والتشادية. وخارج هذه المجموعة، يُوثَّق النموذج على أنه خارج النطاق، مع إشارة إلى Voxtral Mini 4B Realtime العام.

لا يخبرك أي من الرقمين بما تحتاجه. رقم مايكروسوفت 60 هو عدد اتساع يشمل العربية دون وصف أداء العربية؛ يذكر منشور الإطلاق إجمالي اللغات مرة واحدة ثم يمضي قدماً. رقم ميسترال 16 هو تعداد لأهداف التدريب مع معدل خطأ إجمالي واحد عبر سبع مجموعات معيارية، مما يعني أن التفصيل على مستوى اللهجات — وهو الأمر الذي يحدد فعلاً ما إذا كان تسجيل مكالمتك المغربي سيُفرَّغ نصياً — غير منشور أيضاً. نموذجان، وبائعان، وفي كلتا الحالتين فإن الإجابة الصادقة عن "ما مدى جودته في العربية الخليجية تحديداً" هي: غير مذكورة.

ما يمنحك إياه التعداد هو توزيع مسبق. النموذج الذي يستهدف العربية التشادية والعربية الحسانية كأهداف مسمّاة ضُبط وفق توزيع شمال إفريقي؛ وقد شاركت Mistral في تطويره مع وزارة الانتقال الرقمي وإصلاح الإدارة المغربية، وبنَت اثنين من المعايير السبعة مع تلك الوزارة — ISMA وDarija in the Wild — تحديدًا لقياس الحالات الصعبة. أما النموذج العام ذو الـ60 لغة فيحقق تحسنًا في العربية الفصحى الحديثة أولًا، لأن حجم إشارة التدريب يتركز هناك. وإذا كان صوتك بالدارجة أو بالعربية الخليجية، فهاتان مشكلتان مختلفتان، ولم يضع سوى أحد هذين المورّدين رقمًا على أيٍّ منهما.

الكمون وشكل التأخير

• MAI-Transcribe-2-Streaming — 0.13 ثانية من نهاية الكلام إلى النص النهائي، وأول النصوص الجزئية عند 0.12 ثانية، وهو سريع بما يكفي بحيث يكون النص الجزئي والنص النهائي فعليًا بنفس زمن الاستجابة. ادعاء Microsoft، مقيس وفق منهجية أداة التتبع.

• Voxtral Mini 4B Realtime Arabic — 480 مللي ثانية من التأخير المُهيَّأ عند نقطة الدقة المنشورة، مع إمكانية ضبط التأخير. وهذا يعادل نحو ثلاثة أضعاف ونصف رقم مايكروسوفت، وهو معامل يختاره المشغّل بدلاً من أن يكون خاصية ثابتة.

ثلاثة أعشار الثانية فرق حقيقي بالنسبة لوكيل صوتي يحتاج إلى الاستجابة في منتصف الكلام ويكاد يكون غير مرئي لإنسان يقرأ التسميات التوضيحية. وهو أيضًا الفرق بين قرص ضبط ورقم. تعني معلمة التأخير لدى Mistral أنه يمكنك أن تعمل بإحكام أكبر وتقبل المزيد من الأخطاء، أو أن تعمل بتراخٍ أكبر وتستعيد الدقة — النموذج الأساسي الذي ضُبطت نقطة التحقق هذه بدقة انطلاقًا منه يعلن عن نطاق من 240 مللي ثانية إلى 2.4 ثانية — بينما نقطة التشغيل لدى Microsoft هي ما يوفره Azure. وهذا يجعل قيمة Microsoft أسهل في التحليل، وقيمة Mistral أسهل في الضبط، ويعني أن أي مقارنة بين رقمي الدقة هذين هي في الحقيقة مقارنة بين نقطتين مختارتين على منحنى واحد ونقطة ثابتة على منحنى آخر.

يختلف سطح الميزات اختلافًا حادًا بالقدر نفسه، ومن الجدير التحقق منه مقابل متطلبات خط أنابيبك قبل أن تصبح مناقشة الدقة مثيرة للاهتمام.

• MAI-Transcribe-2-Streaming — يتم تقديمه عبر Azure AI Speech مع مجموعة الميزات الموثّقة الخاصة بالعائلة: تمييز المتحدثين، والطوابع الزمنية على مستوى الكلمات، والتحيز بالكلمات المفتاحية والعبارات، وأنماط الإخراج الحرفي مقابل النظيف، والتعرّف التلقائي على اللغة. إن وثائق وحدة SKU للبث المباشر الخاصة بتمييز المتحدثين والطوابع الزمنية أقل تفصيلاً من وثائق نموذج الدفعات، لذا تحقق من ذلك لكل نقطة نهاية بدلاً من افتراض التكافؤ.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — توثّق البطاقة النسخَ باستخدام مُرمِّز صوتي سببي، وخدمة vLLM عبر WebSocket على /v1/realtime، ودعم Transformers الأصلي ابتداءً من الإصدار 5.2.0، ووحدة تطبيع. ولا توثّق فصل المتحدثين أو الطوابع الزمنية على مستوى الكلمة لنقطة التحقق هذه.

نموذج التسليم: خدمة معاينة مقابل أوزان قابلة للتنزيل

• MAI-Transcribe-2-Streaming — معاينة Azure، مما يعني عدم وجود اتفاقية مستوى خدمة (SLA) وتوصية من المورّد بعدم الاعتماد عليه في الإنتاج. بسعر 0.54 دولار لكل ساعة صوتية كسعر تمهيدي ساري حتى نهاية عام 2026، مع عدم نشر السعر القياسي؛ أُطلق MAI-Transcribe-2 للدفعات بسعر 0.10 دولار لكل ساعة صوتية على نفس الأساس المحدود المدة. تكلفة البث تعادل 5.4 أضعاف سعر الدفعات.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0، بنحو 4.4 مليار معامل بصيغة BF16، قابل للتنزيل، وقابل للضبط الدقيق، وقابل للتشغيل على مسرّع واحد. لا سعر، ولا اتفاقية مستوى خدمة، ولا التزام بالدعم، لأنه لا توجد خدمة خلفه.

تلك الجملتان تحملان القرار. إن خدمة معاينة بسعر تمهيدي وسعر قياسي غير معلن هي التزام ينتهي أجله؛ فعلاوة البث البالغة 5.4× والنافذة الممتدة حتى 2026 كلتاهما بيد مايكروسوفت لتغييرهما، ونسبة الدفعات إلى البث هي الرقم الذي يجب مراقبته عندما يستقر السعر القياسي. أما أوزان Apache 2.0 من دون إعلان فهي العكس: أثر لا يمكن لأحد سحبه، مرتبط بعلاقة مورّد لم يصفها أحد. وما إذا كان سيتم الحفاظ على نقطة التحقق أمر غير معروف، لكن الملف الذي لديك اليوم يظل يعمل بغض النظر.

القيد الخاص بالقطاع هو ما يحسم عادةً هذه الأسئلة عمليًا. قد لا يتمكن نشر مركز اتصال عربي داخل مؤسسة خاضعة للتنظيم من إرسال الصوت إلى نقطة نهاية سحابية للمعاينة على الإطلاق؛ وقد لا يرغب فريق سبق أن اعتمد Azure AI Speech معيارًا في حزمة ثانية محلية لعائلة لغوية واحدة. كلا القيدين مشروعان، ولا علاقة لأي منهما بنسبتي 2.5% و8.82% التي تتصدر الإطلاقين.

فوق طبقة النسخ، تنطبق النقطة نفسها على كليهما. لا يوجّه OrcaRouter أيًّا من هذين النموذجين الصوتيين — فهذه مقارنة بين نظامين لا نقدّمهما — لكن أداة التلخيص أو المصنِّف أو الوكيل الذي يستهلك النص المنسوخ قابل للتوجيه: أكثر من 200 نموذج على مفتاح API واحد بسعر قائمة المزوّد دون هامش ربح 0%، لذا يصل أي تغيير في سعر المورّد إلى طرفنا في اليوم نفسه، مع تحويل تلقائي عند الفشل إذا تدهور أداء أحد المزوّدين. وحيث يفيد ذلك هنا على وجه التحديد هو مرحلة التجربة: توجيه كلا المرشّحين للنسخ إلى مسار معالجة لاحق واحد، خلف مفتاح واحد، هو ما يتيح لك إجراء المقارنة المباشرة دون إعداد تكاملين.

الاختبار الذي من شأنه أن يحسم هذا الأمر

لم ينشر أيٌّ من المورّدين أداءً خاصًّا بالعربية، ولم يخضع أيٌّ منهما لتقييم مستقل على صوت لهجي. لذلك تقتصر المقارنة على ثلاث حقائق وتوصية واحدة.

الحقائق: نموذج Microsoft التدفقي أسرع عند 0.13 ثانية، ويزعم تحقيق دقة إجمالية أفضل على لوحة لم ترسمه بعد؛ ونموذج Mistral ينشر قائمة لهجات، ومعدل خطأ في العربية، وكود التطبيع لإعادة اشتقاقه، عند 480 ميلي ثانية؛ ولا يمكن مقارنة رقمي الدقة هذين لأن أحدهما معدل خطأ الكلمات والآخر معدل خطأ الأحرف على مدونة نصية مختلفة.

التوصية: على من يتخذ هذا القرار أن يشغّل كليهما على تسجيلاته الخاصة، لأن هذا هو القياس الوحيد الذي تركه أي من البائعين مفتوحًا: مجموعة التقييم من تسجيلات حقيقية — مزيج الصوت الذي تتلقاه فعلاً، والترميز الذي تحتاجه فعلاً، والمفردات المستهدفة التي تحتاجها فعلاً — وأن تقيس التطبيع الذي أجراه Mistral مقابل ما تثق به. اختبار لمدة ساعتين على تسجيلاتك الخاصة سيخبرك بأكثر مما تخبرك به منشورات الإطلاق مجتمعة، وهي الطريقة الوحيدة لمعرفة ما إذا كانت ميزة 0.13 ثانية تستحق الاعتماد على نسخة معاينة وعلاوة بث 5.4×، أو ما إذا كان نموذج 4.4B قابل للتنزيل عند 480 مللي ثانية جيدًا بما يكفي للمهمة.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

لا يقدّم OrcaRouter أيّاً من هذين النموذجين الصوتيين، ولا يوحي هذا المقال بغير ذلك — وما يتناوله هو طبقة اللغة التي تقرأ النص المنسوخ: أكثر من 200 نموذج خلف مفتاح واحد بسعر المزوّد المعلن دون أي هامش ربح (0%)، بحيث يصلك أي تغيير في سعر المورّد على النموذج اللاحق في اليوم الذي يُعلن فيه.

تجاوز الفشل التلقائي يتيح لكلا مرشحي النسخ أن يغذيا خط أنابيب واحدًا في المصب بدلًا من تكاملين، وهو أيضًا أرخص طريقة لإجراء المقارنة المباشرة.