
Voxtral Mini 4B Realtime Arabic مقابل Gemini 3.5 Transcribe Live: اللهجات مقابل الاتساع
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
نموذجان لتحويل الكلام إلى نص بالبث، ورهانان مختلفان تمامًا حول ما يمثّل الجزء الصعب في النسخ. Voxtral Mini 4B Realtime Arabic هو نموذج مضبوط بدقة بـ4.4 مليار معامل دفعته Mistral AI إلى مستودع عام في 8 أكتوبر 2026 من دون منشور إطلاق أو تدوينة أو سطر في فهرس أخبار الشركة، ودُرِّب تحديدًا على العربية الفصحى الحديثة وخمس عشرة لهجة محددة بالاسم، وصدر بموجب Apache 2.0 مع أوزان BF16 قابلة للتنزيل. أما Gemini 3.5 Transcribe Live فهو نقطة النهاية المتدفقة من Google لـ Gemini 3.5 Transcribe، وأُعلن عنه في أغسطس 2026 بكامل ما يرافق إطلاق منصات من ترتيبات، ويغطي أكثر من 85 لغة ومنطقة محلية، وهو مغلق — واجهة API للمعاينة بلا أوزان وبحد أقصى للجلسة يبلغ عشر دقائق. غاص أحد النموذجين في العمق داخل عائلة لغوية واحدة وقال ذلك في قسم القيود الخاص به؛ أما الآخر فقد اتّسع نطاقه وترك ضمانات مستوى اللكنة دون ذكر. أيّهما تريد يتوقف على محور لا يضعه تسويق أي من المورّدين في المقام الأول: كيف يبدو تسجيلك الصوتي فعليًا.
هذه ليست مقارنة متماثلة، ويجدر قول ذلك منذ البداية بدلًا من دفنه. عمر نموذج Mistral 48 ساعة وقت كتابة هذه السطور، ولا يوجد إعلان من المزوّد، ولا تقييم مستقل، ولا سعر منشور. أما نموذج Google فهو في معاينة عامة منذ أواخر أغسطس، ويُقاس عبر متعقّب تابع لطرف ثالث. اعتبر جانب Mistral مجموعة من الادعاءات الواردة في بطاقة النموذج، وجانب Google مجموعة من القياسات بالإضافة إلى مجموعة من الادعاءات، وتبقى المقارنة نزيهة.
ما هو كل نموذج، قبل الأرقام
• Voxtral Mini 4B Realtime Arabic — نموذج ASR تدفقي جرى ضبطه الدقيق انطلاقًا من Voxtral-Mini-4B-Realtime-2602، بنحو 4.4 مليار معامل بصيغة BF16، يتلقى صوتًا بتردد 16 kHz عبر مشفّر صوتي سببي ومفكّك ترميز لغوي. يُصدر النص مع وصول الصوت، مع تأخير نسخ قابل للضبط، وهو متاح بموجب Apache 2.0 مع الأوزان على Hugging Face. طوّرته Mistral بالتعاون مع وزارة الانتقال الرقمي وإصلاح الإدارة في المغرب ضمن شراكة وُقّعت في يناير 2026، وتصف النموذج بأنه أصل من أصول الذكاء الاصطناعي السيادية.
• Gemini 3.5 Transcribe Live — النصف المتدفق من إصدار مكوّن من نموذجين. تحمل نقطة نهاية Live API صوت ميكروفون متواصلاً عبر WebSocket، وتعيد نصوصًا جزئية بينما لا يزال المتحدث يتحدث، وتستقر على نص نهائي بعد وقت قصير من انتهاء كل نطق. النظير الدفعي، gemini-3.5-transcribe، يتعامل مع ملفات مسجلة مسبقًا تصل مدتها إلى ساعة. كلاهما في معاينة عامة، وكلاهما يعمل عبر API فقط، ولم ينشر أي منهما أوزانًا.
الفرق البنيوي الأول ليس في الدقة. بل في أن أحدهما ملف يمكنك تنزيله هذه الليلة، والآخر خدمة يجب أن يتم قبولك فيها لاستخدامها.

تغطية اللغات: 16 مقابل أكثر من 85، وليست الفجوة هي القصة
جعلُ عدِّ اللغات يبدو نموذج Mistral ضيّقًا ونموذج Google هائلًا. فالأعداد تقيس أشياء مختلفة، وقراءتها جنبًا إلى جنب دون هذا التحفّظ هو الخطأ الأكثر شيوعًا الذي يُغرِي به هذا المقارنة.
• Voxtral Mini 4B Realtime Arabic — 16 تنويعًا عربيًا، مذكورة فرديًا على بطاقة النموذج حسب عائلة اللهجات: العربية الفصحى الحديثة، إضافة إلى العربية المغربية والليبية والتونسية والجزائرية والحسانية من المغرب الكبير؛ والخليجية والنجدية والعمانية والصنعانية من الخليج؛ والمصرية والسودانية من وادي النيل؛ والرافدينية والشامية الجنوبية والشمالية معًا؛ والعربية التشادية. إن تأطير البطاقة نفسه هو أن النموذج يستهدف النسخ الصوتي للعربية، وأن التبديل اللغوي — تناوب المتحدثين بين اللغات في منتصف المحادثة — هو القدرة التي بُني ليتقنها لا أثرًا جانبيًا.
• Gemini 3.5 Transcribe Live — اكتشاف تلقائي للغة عبر أكثر من 85 لغة محلية، مع التبديل اللغوي داخل الجملة وعبر الجمل. يدرج توثيق Google العربية ضمن تلك المجموعة؛ ويسمّي جدول اللغات المحلية العربية (مصر) كمدخل للعربية، كما أن التغطية الأوسع للغات المحلية العربية غير مُفصّلة في توثيق النموذج نفسه.
اقرأ ذلك بصدق وسيظهر لك شكل المقايضة. إن 85-plus لدى Google ادعاء اتساع: إذا كان صوتك بلغة غير العربية، فإن نقطة نهاية Google تغطيه بينما يرفضه نموذج Mistral — تقول البطاقة صراحةً إنه بالنسبة للغات الأخرى ينبغي استخدام Voxtral Mini 4B Realtime الأصلي، لا نقطة التحقق هذه. إن 16 لدى Mistral ادعاء عمق. إنه لا يدّعي نسخ العربية؛ بل يدّعي نسخ الدارجة المغربية والعربية الخليجية والعربية المصرية والعربية التشادية كأهداف منفصلة، وهي مشكلة أصعب جوهريًا من نسخ العربية الفصحى الحديثة والأمل في أن تظهر اللهجة منها. لن يُظهر لك معيار قياس مرجّح بالإنجليزية وذو أولوية للاتساع ذلك الفرق أبدًا، لأن مجموعات اللهجات ليست ضمنه.
بالنسبة لمركز اتصال مغربي أو خط دعم عملاء خليجي، يمكن لنموذج يتعامل مع 16 لهجة ولا شيء غيرها أن يتفوق على نموذج يتعامل مع 85 بيئة محلية بدقة غير معلنة لكل لهجة. أما بالنسبة لشركة أوروبية تنسخ اجتماعاتها بخمس لغات، فإن المعادلة تنقلب فورًا. لا المورّد هذا مخطئ ولا ذاك؛ لقد اختارا عملاء مختلفين.

الأرقام التي يمكنك مقارنتها، وتلك التي لا يمكنك
هنا يتجلّى وقع عدم التماثل. فالنموذجان يُبلّغان عن وحدات مختلفة، على مدوّنات مختلفة، وأدلتهما مختلفة، ولم يُجرِ أي طرف ثالث مقارنة بينهما وجهاً لوجه.
• Voxtral Mini 4B Realtime Arabic — متوسط معدل خطأ الأحرف 8.82% عبر سبعة معايير عربية، عند تأخير نسخ مضبوط قدره 480 مللي ثانية. وفقًا لبطاقة Mistral الخاصة، ولم يُعَد إنتاجه بشكل مستقل.
• النموذج الذي يسعى إلى اللحاق به — Voxtral Transcribe Arabic عند 7.91% CER على المعايير السبعة نفسها ووفق القياس نفسه، لذا يتخلف النموذج الآني بمقدار 0.91 نقطة مئوية عن نموذج عربي غير متصل من المورّد نفسه. هذه الفجوة هي مقارنة Mistral نفسها، ما يجعلها مفيدة على نحو غير معتاد: فالمورّد يخبرك بما يكلّفه البث التدفقي من دقة في هذه العائلة اللغوية.
• Gemini 3.5 Transcribe Live — معدل خطأ الكلمات في البث المباشر 4.0%، بقياسٍ من Artificial Analysis واستشهادٍ من Google، مع وصول النص النهائي بعد 0.40 ثانية من انتهاء الكلام. كذلك تم القياس: 2.6% على لوحة القياس غير المتدفقة الخاصة بأداة التتبع نفسها، و5.50% في البث على FLEURS وفقًا لما أوردته Google نفسها.
لا تضع 8.82% CER بجانب 4.0% WER وتستنتج أي شيء. فمعدل خطأ المحارف ومعدل خطأ الكلمات يستندان إلى مقامين مختلفين — الإملاء العربي يجعل الفجوة بينهما أكبر مما هي عليه في اللغات ذات الكتابة اللاتينية — كما أن المدونات ليست نفسها، والتطبيع ليس نفسه، وأحد الرقمين يأتي مع نص برمجي قابل لإعادة الإنتاج بينما يأتي الآخر من مزيج ثابت لدى أداة تتبّع مُرجَّح نحو الكلام الإنجليزي للوكلاء.
المقارنة الأكثر فائدة هي تلك الواردة داخل بطاقة Mistral نفسها: 8.82% في وضع البث مقابل 7.91% في الوضع غير المتصل، على معايير اختبار متطابقة مع تطبيع متطابق. هذا قياس نظيف لما يمنحه زمن الاستجابة المنخفض وما يكلفه في العربية تحديدًا، وهو يستحق أكثر من أي نسبة مئوية عابرة للمورّدين. ما لم ينشره أحد بعد هو تشغيل عربي مكافئ لنموذجي Google وMistral على الصوت نفسه. وإلى أن يفعل أحد ذلك، فإن سؤال «أيهما أكثر دقة في العربية» يظل سؤالًا مفتوحًا، والإجابة الوحيدة القابلة للدفاع هي: جرّب كليهما على تسجيلاتك.
تفصيل واحد في بطاقة Mistral يستحق الذكر لأنه يتعارض مع مصلحة المورّد نفسه. فهي تشير إلى أن مرشّحات الأمان في Gemini تحجب نسخ بعض عينات FLEURS الصوتية. هذه ملاحظة حقيقية وقابلة للتحقق بشأن خط معالجة أحد المنافسين، وهي أيضاً بالضبط النوع من الأمور الذي لا يظهر أبداً على لوحة الصدارة — فالنموذج الذي يرفض نسخ عينة يُحتسب كفشل أو كمفقود، ولا أي من القراءتين منصف. إذا تضمّن الصوت لديك مادة قد يلتقطها مرشّح محتوى، فهذا خطر نشر لا يكشف عنه أي رقم WER.
زمن الاستجابة: قرص مقابل رقم ثابت
عادةً ما تُقارَن نماذج البث بناءً على قيمة كمون واحدة. غير أن هذين النموذجين لا يشتركان في أي منها.
• Voxtral Mini 4B Realtime Arabic — تأخير نسخ قابل للضبط. يُذكَر رقم معدل خطأ الأحرف (CER) البالغ 8.82% عند 480 مللي ثانية، والتأخير قابل للتعديل، ما يعني أن رقم الدقة ليس سوى نقطة واحدة على منحنى يختاره المشغّل، لا خاصية من خصائص النموذج. ويُعلن نموذجه الأساسي عن نطاق يمتد من 240 مللي ثانية إلى 2.4 ثانية.
• Gemini 3.5 Transcribe Live — 0.40 ثانية من نهاية الكلام إلى نص نهائي، وفق قياس Artificial Analysis، مع وصول النسخ الجزئية باستمرار أثناء الكلام. وتزعم Google بشكل منفصل تحسّنًا بنسبة 70% في زمن الوصول إلى النسخ النهائي مقارنةً بـ Chirp 3، وهو رقم خاص بالمورّد ولم يُعَد إنتاجه.
يقع كلاهما في نفس النطاق — نصف ثانية تقريبًا — لكن المعنى الهندسي يختلف. يمنحك نموذج Mistral المقايضة بين زمن الاستجابة والدقة كمعامل، فيمكنك التشغيل عند 240 مللي ثانية عندما تكون التسميات التوضيحية دون الثانية أهم من آخر بضع نقاط من الدقة، وتزيد التأخير عندما لا يهم ذلك. تعرض نقطة نهاية Google نقطة تشغيل ثابتة مرتبطة بسلوك تصفية المحتوى الخاص بـ Google. بالنسبة لوكيل صوتي، فإن مقبض الضبط أكثر قيمة من رقم ثابت أفضل قليلًا، لأن الإعداد الصحيح يعتمد على الصوت الخاص بك والمستخدمين لديك، ولا يمكن لأي من المورّدين اختياره لك.
الانقسام الحقيقي: الأوزان المفتوحة مقابل نقطة نهاية للمعاينة
إن الفرق في الترخيص والتوزيع أكبر من أي فجوة في الاختبارات المرجعية في هذه المقارنة، وهو يحسم معظم عمليات النشر الواقعية قبل مناقشة الدقة.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0، أوزان BF16 على Hugging Face، قابلة للتقديم عبر vLLM من خلال WebSocket على /v1/realtime، ومدعومة أصلاً في Transformers بدءاً من الإصدار 5.2.0. تأتي بطاقة الموديل مع مثال بلغة Python ووحدة تطبيع بحيث يمكنك إعادة إنتاج حساب CER العربي بنفسك. لا شيء في خط المعالجة يتطلب خوادم Mistral، والموديل صغير بما يكفي ليكون السؤال التشغيلي هو أي GPU، وليس ما إذا كنت تستطيع تحمّل تكلفة واحد.
• Gemini 3.5 Transcribe Live — API فقط، معاينة عامة، دون أي التزام سعري منشور يتجاوز أسعار القائمة، وحد أقصى للجلسة يبلغ عشر دقائق، ما يعني أن أي مدة أطول يجب تقطيعها وإعادة الاتصال بها ودمجها بواسطة الكود الخاص بك. هناك ثلاثة قيود تم الإبلاغ عنها إلى جانب الإطلاق تهم عمليات النشر العربية تحديدًا: نقطة نهاية البث لا تُرجع فصل المتحدثين ولا طوابع زمنية على مستوى الكلمة، وكلاهما موجود في نقطة نهاية المعالجة الدفعية لكن ليس في هذه. إذا كان نصك العربي يحتاج إلى معرفة من قال ماذا، أو يحتاج إلى محاذاة زمنية مع الصوت، فإن نقطة نهاية Live لا يمكنها إنتاج ذلك بغض النظر عن اللغة.
هذان القيدان هما أقوى حجة لصالح النموذج الصغير المفتوح في نشر عربي فعلي، ولا علاقة لهما بالدقة. فخط معالجة مركز اتصال يريد إسناد المتحدث، وخط معالجة الامتثال يريد طوابع زمنية، ونموذج عربي غير متصل مزوّد بنص برمجي للتطبيع تتحكم به يمنحك كليهما دون الجدال بشأن عقد نقطة النهاية. كما تُدرج بطاقة نموذج Mistral ذلك كقيد لا كميزة — فهو يستهدف النسخ، وهو نسخة مضبوطة ضبطًا دقيقًا من نموذج عام للوقت الحقيقي، وهو صريح في أن نموذجًا أوسع موجود في المنبع إذا احتجت إليه.
ما تكلفة كل واحد، وما هو غير معروف
• Gemini 3.5 Transcribe Live — بنحو 0.009 دولار لكل دقيقة من الصوت بتكلفة مدمجة، مستخلصة من أسعار القائمة البالغة 3.50 دولارات لكل مليون رمز إدخال و21 دولارًا لكل مليون رمز إخراج، مع احتساب الصوت عند 25 رمزًا في الثانية والنص المكتوب عند نحو 175 رمزًا في الدقيقة. تبلغ نقطة نهاية الدفعات نحو 0.005 دولار لكل دقيقة. كلا الرقمين تقديران مبنيان على تقسيم الرموز المفترض من Google، لذا يتغيران إذا تغيّرت طريقة الحساب. تتوفر طبقة مجانية اليوم.
• Voxtral Mini 4B Realtime Arabic — لا يوجد سعر منشور، لأنه لا توجد خدمة منشورة. التكلفة هي ما تكلّفه أجهزتك. نموذج BF16 بـ 4.4 مليار معامل يتسع على مسرّع حديث واحد، لذا فإن التكلفة الحدية لكل ساعة صوتية هي الكهرباء والاستخدام، والتكلفة الثابتة هي الآلة. هذا أرخص من أي API لكل دقيقة عند الحجم الكبير، وأغلى من أي API لكل دقيقة عند الحجم الصفري، وهو الشكل المعتاد لتجارة الأوزان المفتوحة.
المجهول الأكثر أهمية على جانب Mistral ليس السعر. بل ما إذا كان هذا المستودع بداية خط إنتاج أو تسليم لمرة واحدة مقابل شراكة المغرب. النموذج الذي يُطلق بهدوء دون إعلان، ولا تسعير، ولا خدمة هو نموذج لا يوجد التزام دعم خلفه. تعني Apache 2.0 أن الترخيص لا يمكن سحبه للأوزان التي لديك بالفعل، لكنه لا يقول شيئًا عمّا إذا كانت نقطة التفتيش ستُصان، ويشير مؤشر النموذج الأساسي الخاص بالبطاقة إلى أن النموذج العام في الوقت الفعلي لا يزال هو الخط المدعوم.
بالنسبة للطبقة الواقعة فوق النص المنسوخ، تُثبت طبقة التوجيه قيمتها بطريقة لا علاقة لها بالنسخ الصوتي. لا يُعد أي من هذين النموذجين خدمة تحويل الكلام إلى نص نستضيفها — فـ OrcaRouter لا يوجّه أيًا من نقطتي النهاية — لكن الملخِّص أو مصنّف النوايا أو الوكيل الذي يستهلك البث هو نموذج يمكنك توجيهه: مفتاح API واحد عبر أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش ربح 0%، بحيث ينعكس تخفيض سعر أي مورّد لدينا في اليوم نفسه، إضافة إلى تجاوز الفشل التلقائي إذا تراجعت جودة مزوّد. وإذا كنت تجمع بالفعل بين مورّدي خدمات صوت لتغطية اللهجات، فإن وضع نماذج اللغة اللاحقة خلف مفتاح واحد بدلًا من عقدين هو النصف الأرخص من التكامل.
أي واحد نبني عليه؟
إذا كان صوتك بالعربية — لهجة واحدة، أو عدة لهجات، أو تبديل لغوي بين العربية ولغة أخرى — فإن نموذج Mistral هو المرشح الأكثر جدية، والسبب بنيوي وليس رقمي. إنه يسمي اللهجات التي بُني من أجلها، وهو صغير بما يكفي ليعمل على عتادك الخاص، ويعيد نصًا خامًا يمكنك معالجته لاحقًا باستخدام التطبيع الخاص بك، ولا يقف خلف حد جلسة عشر دقائق أو مرشح محتوى لا يمكنك فحصه. الثمن هو أنه يتعامل مع عائلة لغوية واحدة ويرفض الباقي، وأنه لم ينشر أحد تقييمًا مستقلًا له بعد.
إذا كان صوتك يمتد عبر لغات متعددة، أو إذا كنت بحاجة اليوم إلى خدمة لها مسار دعم وبطاقة أسعار منشورة، فإن Gemini 3.5 Transcribe Live قابل للاستدعاء الآن، ومُقاس على متتبع طرف ثالث، ويغطي اللغات التي سترفضها نقطة تفتيش Mistral. التكاليف هي سقف الجلسة، وغياب تمييز المتحدثين والطوابع الزمنية على نقطة نهاية البث، وحقيقة أن الدقة الخاصة بالعربية ادعاء سيكون عليك اختباره بنفسك — فقائمة الإعدادات المحلية تذكر مصر، وأداء اللهجات غير مفصل.
الشيء الذي يجب مراقبته ليس معيارًا مرجعيًا. بل ما إذا كانت Mistral ستعلن عن هذا النموذج إطلاقًا، وإن فعلت، فبأي سعر وخريطة طريق لغوية. مستودع صامت برخصة Apache 2.0 هو أثر مفيد والتزام ضعيف. إذا تبع ذلك خريطة طريق للهجات العربية — الشامية والخليجية والمصرية كنقاط تحقق منفصلة — فإن مسار النماذج الصغيرة يصبح إجابة كاملة بحق للمنطقة، ويصبح تقديم حجة الاتساع أصعب بكثير.

لا يُعد أيٌّ من هذين نموذجًا صوتيًا نستضيفه، لكن الطبقة التي تعلو النص المكتوب قابلة للتوجيه - أكثر من 200 نموذج خلف مفتاح API واحد بسعر قائمة المزوّد مع هامش ربح 0%، لذا فإن تخفيض سعر البائع على نموذج الاستدلال الذي يقع أسفل النص المكتوب الخاص بك يصبح ساريًا في اليوم نفسه.
التحويل التلقائي عند الفشل يعني أن خط أنابيب الكلام المُجمّع يقلّل عدد مجالات الفشل بمقدار واحد، لأن نظام التلخيص أو مصنّف النوايا الذي يستهلك النص المفرّغ يمكن إعادة توجيهه بدلاً من أن يتعطّل مع المزوّد.
