
Voxtral Mini 4B Realtime Arabic مقابل Grok Voice Transcribe 2.0: متصدر لوحة الصدارة يلتقي بمتخصص في اللهجات
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
نقطة البداية الصادقة لهذه المقارنة هي أن Voxtral Mini 4B Realtime Arabic وGrok Voice Transcribe 2.0 لا يتنافسان على المهمة نفسها، وأسرع طريقة لرؤية ذلك هي النظر إلى ما كان كل مورّد مستعدًا لنشره. نشرت Mistral AI نموذج Voxtral Mini 4B Realtime Arabic على Hugging Face في 8 أكتوبر 2026 دون أي إعلان — أوزان Apache 2.0، وبطاقة نموذج تسمّي ست عشرة تنويعة عربية، ورقم دقة وحيد قدره 8.82% لمتوسط معدل خطأ الأحرف عبر سبعة معايير عربية عند تأخير قدره 480 مللي ثانية. طُرح Grok Voice Transcribe 2.0 من xAI في 18 سبتمبر 2026 مع منشور إطلاق، وسعر، ونتيجة لوحة صدارة من طرف ثالث: معدل خطأ كلمات 2.7% في النصوص النهائية مع استقرار النص بعد 0.49 ثانية من توقف المتحدث، وفي المرتبة الأولى على لوحة Artificial Analysis للتحويل المباشر من الكلام إلى نص عند إطلاقه. أحد النموذجين يخبرك بالضبط باللهجات التي يتعامل معها، ويرفض التخمين خارجها. والآخر يخبرك أنه يغطي أكثر من 38 لغة، ولا يفصّل واحدة منها.
هذا اللاتماثل هو جوهر المقارنة بأكملها. إذا كنت تشتري سعة نسخ صوتي بكميات كبيرة لتسجيلات صوتية مختلطة اللغات، فإن نموذج xAI هو المنتج الأكثر اكتمالًا بفارق كبير. أما إذا كان صوتك عربيًا — وتحديدًا إذا كان عربيًا لهجيًا، لا الفصحى الإخبارية المعيارية — فإن نقطة تفتيش Mistral تستهدف مشكلة لا تقيسها لوحة الصدارة التي يتصدرها نموذج xAI، وكونها في المرتبة الثانية على تلك اللوحة بدل الأولى سيكون من الخطأ قراءته كحكم نهائي.
حساب السعر، لأنه نظيف بشكل غير معتاد هنا
تنشر xAI سعرًا. وتنشر Mistral ملفًا للتنزيل. هذا الاختلاف يحرّك كل ما يليه، لذا ابدأ بالرقم الموجود بالفعل.
• Grok Voice Transcribe 2.0 — 0.10 دولار لكل ساعة صوتية عبر REST للملفات المسجلة، و0.20 دولار لكل ساعة صوتية عبر WebSocket المتدفق. أي ما يعادل تقريبًا 1.67 دولار لكل ألف دقيقة للمعالجة المجمعة و3.33 دولار لكل ألف دقيقة للبث، دون تغيير عن Grok Voice Transcribe 1.0 عند نقاط السعر نفسها.
• Voxtral Mini 4B Realtime Arabic — لا يوجد سعر منشور، لأنه لا توجد خدمة منشورة. الأوزان متاحة بموجب Apache 2.0 وبحجم يقارب 4.4 مليار معامل بصيغة BF16، ما يعني أن التكلفة هي وحدة GPU التي تُوصّلها به والاستفادة التي تحققها منها. عند حجم مستدام، يكون ذلك رخيصًا؛ وعند حجم صفر، يكون الخيار الأغلى في هذا المقال، لأنك تدفع مقابل عتاد عاطل.
نقطة التعادل ليست هامشية. فسعر بث قدره $0.20 في الساعة يعادل نحو ثلث سنت للدقيقة. أي مُسرّع تشغّل عليه نموذجًا بحجم 4.4B يكلّف أكثر من ذلك في الساعة، إلا إذا كنت تمرّر عبره حركة مرور مستدامة، ما يعني أن مسار الأوزان المفتوحة لا يتفوق من حيث التكلفة إلا بعد أن يصبح لديك حجم عربي كافٍ لإبقاء جهاز مشغولًا — ويخسر في كل محور آخر أثناء وصولك إلى تلك المرحلة، لأن الـAPI لا يتطلب نفقات رأسمالية، ولا تخطيطًا للسعة، ولا عبئًا تشغيليًا.

المكان الوحيد الذي ينقلب فيه الحساب مبكرًا هو الامتثال. تعالج نقطة تحقق Mistral الصوت على أجهزة تتحكم بها، لذا لا يغادر أي شيء شبكتك، وتأتي البطاقة مزوّدة بوحدة تطبيع، ما يجعل خط التقييم العربي متاحًا لك لتدقيقه. يعمل Grok Voice Transcribe 2.0 داخل مناطق xAI، ووفقًا لوثائقه، يعالج الصوت في الوقت الفعلي دون الاحتفاظ به أو استخدامه للتدريب، ومدعوم بـ SOC 2 Type II وأهلية HIPAA. كلا السردين قابل للدفاع؛ لكن واحدًا فقط منهما يتيح للجهة التنظيمية فحص مسار الشيفرة.
ما الذي يشتريه 0.20 دولار في الساعة فعليًا، ونموذج Mistral لا يتم شحنه
الفجوة في الميزات هنا أكبر من فجوة الدقة، ويجري مناقشتها بدرجة أقل بكثير. Grok Voice Transcribe 2.0 منتج له واجهة؛ أما Voxtral Mini 4B Realtime Arabic فهو نقطة تحقق تُصدر نصًا.
• تجزئة المتحدثين — مضمّنة في Grok Voice Transcribe 2.0، إضافةً إلى النسخ متعدد القنوات لما يصل إلى ثماني قنوات مستقلة. لا تسرد بطاقة Mistral أي قدرة على تجزئة المتحدثين؛ فالنموذج ينتج نصًا مكتوبًا، لا نصًا منسوبًا إلى المتحدثين.
• طوابع زمنية على مستوى الكلمة — يحملها Grok مع درجات ثقة مرفقة، بحيث يمكنك وضع عتبة للنطاقات منخفضة الثقة بدلاً من الوثوق بالنص الكامل على قدم المساواة. بطاقة Mistral لا تدّعي وجود طوابع زمنية لنقطة التحقق هذه.
• ترجيح المصطلحات المفتاحية — حتى 100 مصطلح مجال لكل طلب على نقطة نهاية Grok، وهذه هي الطريقة التي تجعل بها النموذج يضبط أسماء المنتجات ورموز الحسابات وأسماء الأماكن بشكل صحيح دون الضبط الدقيق. أما مسار Mistral إلى النتيجة نفسها فهو الضبط الدقيق على بياناتك الخاصة، وهو ما يسمح به Apache 2.0 ولا تسمح به نقطة النهاية المستضافة.
• التطبيع العكسي للنص — يُنسّق Grok الأعداد والتواريخ والعملات وأرقام الهواتف وعناوين البريد الإلكتروني إلى صيغة مكتوبة عبر 25 لغة. تتضمن بطاقة Mistral نصًا برمجيًا للتطبيع، لكن غرضه المذكور هو تقييم معايير الأداء العربية، وليس تنسيق المخرجات للعرض.
• سطح الواجهة — REST للملفات التي يصل حجمها إلى 500 ميغابايت، وبث WebSocket عبر wss://api.x.ai/v1/stt مع نتائج مؤقتة كل 500 مللي ثانية تقريبًا، ومعدل موثّق قدره 10 طلبات في الثانية و100 جلسة بث متزامنة، ومنطقة واحدة في الوقت الحالي. على جانب Mistral، خدمة vLLM عبر WebSocket على /v1/realtime، أو Transformers الأصلية بدءًا من الإصدار 5.2.0، دون أي حد للمعدل غير العتاد الخاص بك.
إذا كنت بحاجة إلى تمييز المتحدثين والطوابع الزمنية، فقد انتهت المقارنة قبل أن تدخل الدقة في الصورة. هذا ليس انتقاصًا من نموذج Mistral — فمتخصص عربي بحجم 4B مدرَّب لإنتاج نص لهجي دقيق هو هدف هندسي مختلف عن خدمة نسخ عامة — لكنه يعني أن الاثنين لا يصبحان متكافئين إلا إذا تعامل خط أنابيبك مع النص المنسوخ كمادة خام لمعالجة لاحقة خاصة بك.
مشكلة قائمة اللغات
يصف كلا المورّدين دعم اللغات بطريقة تترك السؤال نفسه دون إجابة، ومن اتجاهين متعاكسين.
• Grok Voice Transcribe 2.0 — أكثر من 38 لغة، كشف تلقائي عن اللغة مع تبديل اللغة أثناء التسجيل في تمريرة واحدة، عبر 12 تنسيقًا صوتيًا من 8 كيلوهرتز إلى 48 كيلوهرتز. تذكر الوثائق العدد وليس القائمة. لا تُسمّى اللغة العربية بشكل فردي في أي مكان في المواد، مما يعني أن دعم اللغة العربية مُضمَر من العدد وليس مؤكدًا من المورّد.
• Voxtral Mini 4B Realtime Arabic — ستة عشر تنويعًا عربيًا مذكورة صراحةً: العربية الفصحى الحديثة؛ المغربية والليبية والتونسية والجزائرية والحسانية من المغرب الكبير؛ الخليجية والنجدية والعمانية والصنعانية من الخليج؛ المصرية والسودانية من وادي النيل؛ الرافدينية والشامية الجنوبية والشمالية؛ والعربية التشادية. كل ما هو خارج هذه المجموعة خارج النطاق، وتقول البطاقة إنه يجب استخدام النموذج العام للوقت الفعلي بدلاً من ذلك.
إن سؤال «أيّ هذين يتعامل مع العربية بشكل أفضل» له بنية غريبة. فنموذج Mistral متخصص موثّق في العربية، له معدل خطأ عربي منشور، ولا يوجد تحقق مستقل منه. أما نموذج xAI فهو متصدّر موثّق في لوحة الصدارة، لكن الشركة المزوّدة له لم تؤكد أن العربية ضمن نطاقه على الإطلاق. إن حصرًا لغويًا من 38 لغة يشمل العربية، وقائمة من ست عشرة لهجة لا تشمل إلا العربية، كلاهما يجيبان عن سؤال «هل يتعامل مع العربية» — لكن واحدة فقط منهما تجيب عن سؤال «هل يتعامل مع الدارجة».

لا تفيد لوحة الصدارة هنا. تقييم تحويل الكلام إلى نص لدى Artificial Analysis هو مزيج ثابت مُرجَّح نحو حديث الوكلاء بالإنجليزية، وهو التصميم الصحيح لترتيب النسخ العام والتصميم الخاطئ لإبراز تفوق لهجي عربي. قد يكون نموذج ما أفضل حقًا في اللهجة الخليجية واللهجة المغربية، لكنه يظهر بمستوى جيد فحسب على تلك اللوحة. هذا ليس انتقادًا للوحة؛ بل سبب لعدم استخدامها كمدخل وحيد لعملية نشر إقليمية.
الدقة، بوحدات لا تتحول
• Grok Voice Transcribe 2.0 — معدل خطأ الكلمات في النص النهائي 2.7% مع زمن وصول إلى النهائي قدره 0.49 ثانية، و3.4% في النصوص الجزئية الأولى، وكلاهما مقيس على مؤشر AA-WER v2 من Artificial Analysis، الذي يمزج مجموعة خاصة من محادثات الوكلاء مع VoxPopuli وEarnings22. رقم النص الجزئي الأول هو الجدير بالملاحظة: فقد انخفض من 18.3% في Grok Voice Transcribe 1.0، وهو الفرق بين نص جزئي يمكنك التوجيه بناءً عليه وآخر لا يمكنك سوى عرضه.
• Voxtral Mini 4B Realtime Arabic — متوسط معدل خطأ الأحرف 8.82% عبر سبعة معايير عربية عند تأخير 480 مللي ثانية، وفقًا لتقييم المورد نفسه باستخدام نص تطبيع مرفق معه. تفيد Mistral أن هذا يقع ضمن 0.91 نقطة مئوية من Voxtral Transcribe Arabic عند 7.91% CER، وهو النموذج العربي غير المتصل من المختبر نفسه — وهي مقارنة تفوق مقارنة بين موردين مختلفين لأن المعايير والتطبيع والقياس متطابقة على كلا الجانبين.
وضع 2.7% بجانب 8.82% ليس مقارنة؛ بل هو خطأ في التصنيف. معدل خطأ الكلمات يحصي الكلمات الخاطئة مقابل مرجع، ومعدل خطأ الأحرف يحصي الأحرف الخاطئة، والإملاء العربي — حيث الكلمة نفسها تحتمل تهجئات صحيحة متعددة وتتصل اللواصق بحرية — يوسّع الفجوة بين المقياسين إلى أبعد بكثير مما تُظهره اللغات ذات الكتابة اللاتينية. فالمدونات مختلفة، والتطبيع مختلف، ورقم واحد فقط يأتي من طرف ثالث. ما يمكن للرقمين أن يخبراك به بشكل مشروع هو أن نموذج xAI ناسخ عام مقيس وذو ترتيب جيد، وأن نموذج Mistral ناسخ مزعوم مخصص للعربية. لكنهما لا يستطيعان إخبارك أيّهما ينسخ تسجيلك الصوتي بشكل أفضل.
المقارنة التي تُقنع فعلاً هي الواردة داخل بطاقة Mistral نفسها: 8.82% مع البث مقابل 7.91% دون اتصال، ونفس المعايير السبعة، ونفس التطبيع، ونفس المختبر. يكلّف البث نحو نقطة واحدة من الدقة في العربية مقارنةً بنموذج الدفعات. سواء كان ذلك مقايضة جيدة أم لا، فالقرار قرارك، وقد أصبح الآن قرارًا مستنيرًا.
حيث يفوز النموذج الصغير، وذلك ليس على لوحة النتائج
ثلاثة أمور تتعلق بنقطة حفظ Mistral تستحق أكثر مما توحي به الأرقام، ولا يظهر أي منها على أي لوحة صدارة.
الأول هو تصنيف اللهجات نفسه. تسمية ستة عشر صنفًا كأهداف تدريبية متميزة، بما في ذلك الحسانية والعربية التشادية، هي بيان حول أين قيست أخطاء النموذج. النموذج متعدد اللغات العام الذي يتضمن العربية ضمن 38 لغة يتحسن في العربية الفصحى أولاً، لأن هناك يقع الجزء الأكبر من إشارة التدريب ووزن المعيار. النموذج المبني لشراكة المغرب إلى جانب وزارة شمال أفريقية يُحسّن لتوزيع مختلف، وقد طُوّر بالاشتراك مع معيارين — ISMA وDarija in the Wild — بُنيَا خصيصًا لقياس ذلك.
العامل الثاني هو التأخير القابل للتهيئة. تُذكر نسبة 8.82% عند 480 مللي ثانية، والتأخير قابل للضبط لا ثابت، ما يحوّل رقم الدقة إلى نقطة على منحنى يختارها المشغّل. في مهمة التسميات التوضيحية المباشرة يمكنك تقصيره وقبول مزيد من الأخطاء؛ وفي خط أنابيب تسجيل المكالمات يمكنك إطالته واستعادة الدقة. يقدّم Grok Voice Transcribe 2.0 نقطة تشغيل ثابتة، ويُظهر مسار الترقية الخاص بالمورّد نفسه لماذا لذلك عواقب — فقد كلّف الانتقال من 1.0 إلى 2.0 نحو ثلث ثانية في كل من زمن أول نتيجة جزئية وزمن النتيجة النهائية، والحل المتاح لك هو تثبيت الطراز القديم، لا ضبط قرص.
الثالث هو أن منح Apache 2.0 غير مشروط بالنسبة للأوزان التي لديك. ومهما حدث لنقطة التحقق في المنبع — سواء أُعلن عنها، أو حُدّد سعرها، أو أُهملت، أو لم يُذكَر مرة أخرى — فسيظل الناتج قابلاً للتنزيل، وقابلاً للضبط الدقيق، وقابلاً للشحن داخل منتجك الخاص. فبطاقة أسعار نقطة النهاية المستضافة وجدول إحالة نموذجها للتقاعد كلاهما متروك للمورّد ليغيّرهما، وقد أشارت xAI بالفعل إلى عزمها جعل Grok Voice Transcribe 2.0 هو الافتراضي وإهمال 1.0، وهو ما سينقل كل تكامل لم يمرّر أي معامل نموذج قط إلى نمط زمن الاستجابة الجديد دفعة واحدة.
على طبقة التوجيه فوق النص التفريغي، ملاحظة عملية واحدة: لا يُعد أيّ من النموذجين تحويلاً للكلام إلى نص نستضيفه نحن، وهذا المقال لا يدّعي عكس ذلك. ما يغطيه OrcaRouter هو طبقة نموذج اللغة التي تستهلك البث — أداة التلخيص، وأداة التصنيف، والوكيل — خلف مفتاح API واحد عبر أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش ربح 0%، لذا يصل أي تغيير في سعر المورّد إلى هنا في اليوم نفسه. الفرق التي تشغّل مورّدَي خدمات كلام لتغطية اللغات تحمل بالفعل عقدين ومساري مصادقة اثنين؛ ودمج النصف اللاحق في مفتاح واحد هو المكسب الأقل تكلفة.
ماذا نفعل بهذا؟
اعتمد على Grok Voice Transcribe 2.0 إذا كان صوتك متعدد اللغات، أو إذا كنت بحاجة إلى تمييز المتحدثين أو الطوابع الزمنية أو ترجيح المصطلحات الرئيسية جاهزةً للاستخدام مباشرة، أو إذا أردت خدمة بسعر معلن ومسار دعم اليوم. فهو المنتج الأكثر اكتمالاً، ويخضع للقياس من طرف ثالث، وسعر البث البالغ 0.20 دولار لكل ساعة صوتية منخفض بما يكفي بحيث لا تصبح حجة تكلفة الأوزان المفتوحة مؤثرة حتى تبلغ حجمًا كبيرًا من التشغيل.
اعتمد على Voxtral Mini 4B Realtime Arabic إذا كان صوتك عربيًا وبلهجة محددة، أو إذا كنت بحاجة إلى النموذج داخل شبكتك الخاصة لأسباب تتعلق بالامتثال، أو إذا كنت تنوي الضبط الدقيق — لأن واحدًا فقط من هذه يسمح بذلك. اقبل ثلاثة أمور أولاً: لا فصل للمتحدثين، ولا طوابع زمنية، ولا تقييم مستقل منشور من أي جهة. بعد يومين من ظهور الأوزان، هذا الأخير ليس علامة حمراء؛ إنه ببساطة حيث يقف الدليل.
ما الذي سيغيّر هذه المقارنة بأسرع ما يمكن هو تقييم خاص بالعربية على صوت لهجي حقيقي، يُجرى خارج كلا المورّدين، مع تطبيق التطبيع نفسه على كلا النظامين. وإلى أن يوجد ذلك، يتوقف القرار على قائمة لهجات خاصة بأحد المورّدين مقابل قائمة أخرى غير معلنة خاصة بالمورّد نفسه، والاختبار الوحيد الموثوق هو تسجيلاتك.

لا تُعدّ أيٌّ من نقطتَي النهاية إحدى النقاط التي نقدّمها — فهذه مقارنة بين نظامين خارج كتالوجنا — لكن النماذج التي تستهلك النص المفرّغ قابلة للتوجيه: أكثر من 200 نموذج على مفتاح API واحد بسعر قائمة المزوّد بهامش ربح 0%، لذا يصبح تغيير التعرفة على أداة التلخيص أو المصنّف ساريًا في اليوم نفسه الذي يُعلَن فيه.
التحويل التلقائي عند الفشل هو ما يمنع إعدادًا صوتيًا ثنائي المورّدين من نقل نقطتَي فشل منفردتين إلى طبقة اللغة التي تتغذى منه.
