بطاقة عنوان مُولَّدة لمقال بعنوان «Mistral Large 4 مقابل Claude Opus 5»، تعرض العنوان بخط بولد هندسي بدون زوائد، وتحته العنوان الفرعي «الفجوة أصغر من فجوة السعر»، وفوقه صف من ثلاث أيقونات خطية مسطحة — عمودان بارتفاع غير متساوٍ، وبطاقة سعر، ومقياس تقييم بشري — على خلفية بيضاء مع لمسات متدرجة بالأزرق والسماوي وشعار OrcaRouter في الزاوية السفلى اليمنى.
Guides & Insights

Mistral Large 4 مقابل Claude Opus 5: الفارق أصغر من فارق السعر

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الرقم الوحيد وجهاً لوجه الذي نشره أي طرف لـMistral Large 4 في مواجهة Claude Opus 5 مصدره تقييم بشري أعمى، وهو أقرب مما تُوحي به جداول المعايير. أخفت Surge AI هويات النموذجين وطلبت من معلّقين محترفين تقييم مخرجات البرمجة على مقياس من 1 إلى 5؛ فحلّ Claude Opus 5 في المركز الأول بنتيجة 4.22، وحلّ Mistral Large 4 Preview ثانياً بنتيجة 3.74، متقدماً على Kimi K3 وGLM-5.3 وGLM-5.2. أما على المؤشر الإجمالي المستقل فالنموذجان ليسا متجاورين على الإطلاق — 50.8 مقابل 38.4 على مؤشر الذكاء لدى Artificial Analysis، بحسب قراءة يوم 6 أكتوبر. وما يجعل هذه المقارنة تستحق قضاء بعد ظهر كامل هو أن النموذج الذي يسجل أقل بنحو 12 نقطة تبلغ تكلفة تشغيل مهمة عليه نحو خُمس ما تبلغه على النموذج الآخر.

يحتاج كلٌّ من الرقمين إلى إرفاق مصدره، لأنهما ليسا من النوع ذاته من الأرقام. فتقييم Surge AI دراسة بشرية من طرف ثالث كلّفت Mistral بإعدادها ونشرتها — وهو شكل أقوى من الأدلة من معيار يُشغَّل ذاتيًا، لكنه يبقى دراسة تحكّمت Mistral في نشرها. أما درجات المؤشر فهي عمليات تشغيل Artificial Analysis الخاصة، قابلة للمقارنة بعضها ببعض، ولذلك فهي الزوج الصحيح الذي يُستدلّ منه. لا يخبرك أيٌّ منهما على أيّ نموذج تبني عليه؛ لكنهما معًا يضبطان حدود المسألة.

منتجان، وليس جيلين من منتج واحد.

Claude Opus 5 هو نموذج رائد مغلق الأوزان من المزوّد، صدر في 24 يوليو 2026، ويُقدَّم بنافذة سياق تبلغ مليون رمز وما يصل إلى 128 ألف رمز إخراج، بسعر 5 دولارات لكل مليون رمز إدخال و25 دولارًا لكل مليون رمز إخراج، مع قراءات مخزّنة مؤقتًا بسعر 0.50 دولار. وهو أكثر نماذج المزوّد قدرة في سلسلة Opus، ويستهدف مباشرةً العمل الوكيلي الطويل الأمد — بالحفاظ على التماسك عبر جلسات متعددة الخطوات وكثيفة استخدام الأدوات.

Mistral Large 4 هو إصدار معاينة، أُعلن في 6 أكتوبر 2026، وتصفه Mistral بأنه خليط خبراء متناثر بـ1.05 تريليون معلمة، مع 49 مليار معلمة نشطة ومشفّر رؤية بـ1.6 مليار معلمة. معرّفه في API هو mistral-large-4-0، وهو متعدد الوسائط أصلاً، وتمنحه وثائق Mistral نافذة سياق تبلغ 1M رمز، بينما يرصد Artificial Analysis الرقم 524,288 على التكوين الذي يختبره. وُعِدَ بإتاحة الأوزان في نهاية أكتوبر، ولم يُسمَّ الترخيص بعد.

إذن، هذه ليست مقارنة بين نموذج أحدث وآخر أقدم، بل هي مقارنة بين نموذج رائد احتكاري ومنافس يُزمع أن يصبح مفتوح الأوزان، ويُحدَّد سعر كلٍّ منهما وفقًا لذلك.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

المؤشر نفسه، كلا النموذجين

قُرِئ في 6 أكتوبر من صفحات Artificial Analysis الخاصة بهم، على Intelligence Index v4.3:

• مؤشر الذكاء — Mistral Large 4 Preview 38.4 مقابل Claude Opus 5 50.8

• تكلفة كل مهمة فهرسة — 1.13 دولار لـ Mistral Large 4 Preview مقابل 5.86 دولار لـ Claude Opus 5

• Terminal-Bench 4.0 — 26.8% مقابل 49.0%، أوسع فجوة منفردة بينهما

• امتحان البشرية الأخير — 35.0% مقابل 54.9%

• MMMU-Pro، الاستدلال متعدد الوسائط — 76.4% مقابل 84.7%

• AutomationBench، سير عمل الأعمال — 59.9% مقابل 56.6%، الصف الوحيد الذي يتصدره Mistral Large 4

• نافذة السياق — 1M وفقًا لما ذكرته Mistral و524,288 في التكوين المُختبَر، مقابل 1M المُقدَّمة

• سقف الإخراج — لم يُنشر للنسخة التجريبية مقابل 128 ألف رمز

• السعر لكل مليون، الإدخال / الإخراج — $1.36 / $4.18 سعر معلن، حاليًا $0.68 / $2.09 ضمن عرض ترويجي، مقابل $5.00 / $25.00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

النمط واضح. يتقدّم Opus 5 في الصفّين الأصعب والأشدّ اعتمادًا على الاستدلال — العمل على الطرفية والمعرفة المفتوحة — ويتقدّم أيضًا في الفهم متعدد الوسائط رغم أن Mistral Large 4 هو النموذج الذي يُسوَّق بقدراته البصرية. ويتصدّر Mistral Large 4 صفّ أتمتة سير العمل، وهو الصف الأقرب إلى ما تطلبه وحدة أعمال فعليًا من النموذج، وهو يفعل ذلك بخُمس السعر لكل مهمة.

أين يتفوق Mistral Large 4 حقًا

أكثر ادعاء مثير للاهتمام في منشور إطلاق Mistral ليس نتيجة اختبار معياري. بل إنه في أحد اختبارات Artificial Analysis Cyber Index — إعادة إنتاج ثغرة أمنية حقيقية في برمجيات مفتوحة المصدر، ثم ترقيعها — يسجل Mistral Large 4 نسبة 82%، ويُقال إنها الأعلى بين أي نموذج، وإن عدة نماذج مغلقة رائدة تسجل قرب الصفر في الاختبار نفسه لأنها ترفض المهمة. وتذكر Mistral كلاً من Claude Opus 5.5 وGPT-6 Astra كمثالين على ذلك الرفض.

هذا تفسير من مورّد لرقم يستشهد به المورّد، وينبغي قراءته على هذا النحو. وهو أيضًا فرق تشغيلي حقيقي إذا صحّ: فالنموذج الذي لا يعيد إنتاج ثغرة لا يمكن استخدامه لإثبات أن إحداها حقيقية، وهي الخطوة الأولى في معظم عمليات الاستجابة للحوادث. تقرن Mistral نسبة 82% بنتيجة 93% في تمارين Cybench التنافسية الـ40، وبادعاء مضاد مفاده أن معدل رفضها للمطالبات السيبرانية المستمدة من JailbreakBench وStrongREJECT وAgentHarm أعلى من معدل النماذج الأخرى مفتوحة الأوزان — والحجة هي أنك تريد القدرة والانضباط في النموذج نفسه بدلًا من المقايضة بينهما.

بعيدًا عن الأمن السيبراني، تقوم حجة Mistral Large 4 على ثلاثة أمور لا يقدمها Opus 5. فهو مُدرَّب ويُقدَّم على بنية تحتية أوروبية بموجب القانون الأوروبي، وهو ما يهم المشترين الذين عليهم التزامات بإقامة البيانات. وتَعِدُ Mistral بأنه سيكون قابلًا للتنزيل — وهذا هو المغزى من الأمر برمته، إذ إن النشر الذاتي هو ما يزيل خطر الوصول أثناء الحادث الذي تحرص Mistral على وصفه. وهو رخيص بما يكفي لكل مهمة بحيث يصبح استخدامه كتمريرة أولى وتصعيد المتبقي الصعب إلى نموذج متقدم أمرًا معقولًا اقتصاديًا وليس مجرد خطأ تقريب لا يُذكر.

حيث لا يزال Claude Opus 5 يستحق ثمنه

فجوة مؤشرية مقدارها 12 نقطة ليست صغيرة، والصورة صفًا بصف تقول أين تكمن. Terminal-Bench 4.0 يكاد يكون الضعف — 49.0% مقابل 26.8% — والعمل على الطرفية هو أقرب مقياس بديل عام للبرمجة الوكيلية، وهو الجزء الأكبر مما تشتري الفرق النماذج الحدودية من أجله هذا العام. Humanity's Last Exam يفصل بينهما بـ 20 نقطة. في الاستقلالية بعيدة المدى، يُعد تصميم الاستدلال التكيفي لدى Opus 5، وسقف إخراجه البالغ 128K، وسياقه المقدَّم البالغ 1M، التهيئة التي تريدها إذا كان عبء عملك جلسة وكيل تمتد ساعات متعددة بدلًا من سؤال صعب واحد.

سقف الإخراج هو الفرق الأكثر هدوءًا. لم تنشر Mistral حدًا أقصى لطول الإخراج في النسخة التجريبية، بينما يشكّل حدّ 128K في Opus 5 رافعًا حقيقيًا للقيود المفروضة على توليد الشيفرة والمستندات الطويلة المنظمة. إذا كانت خطوط معالجتك تُخرج ملفات بدلًا من إجابات، فتحقّق من ذلك الرقم قبل أن تنتقل، لأنه من نوع الفجوات التي لا تظهر إلا في بيئة الإنتاج.

التكلفة لكل مهمة هي الرقم الذي يجب التمسك به.

أسعار كل رمز تُجمّل النماذج الرخيصة وتُضلّل بشأن النماذج المكلفة. تكلفة المؤشر نفسه لكل مهمة — إجمالي الإنفاق لإكمال مهمة تقييم واحدة، بما في ذلك الذاكرة المؤقتة وكل شيء — هي الرقم الذي يصمد عند الاحتكاك بالميزانية: 1.13 دولار مقابل 5.86 دولار.

هذا ليس ترخيصًا لنقل كل شيء إلى النموذج الأرخص، لأن المهمة التي يفشل فيها النموذج الرخيص هي مهمة تدفع ثمنها مرتين. بل هو ترخيص للتوقف عن التعامل مع نموذج رائد واحد باعتباره الخيار الوحيد. على OrcaRouter، يحتل Claude Opus 5 مكانه في الكتالوج بسعر المورّد المعلن بهامش ربح 0%، وفي نفس نقطة النهاية المتوافقة مع OpenAI التي تضم أكثر من 200 نموذج آخر، وهذا ما يجعل بناء خط أنابيب من نموذجين عملًا بعد ظهر واحد بدلًا من عقد مع مورّد ثانٍ. Mistral Large 4 ليس في الكتالوج اليوم — يتم الوصول إلى النسخة التجريبية عبر واجهة API الخاصة بـ Mistral وعدة منصات من أطراف ثالثة. عندما تنزل أوزانه ويستضيفه مزوّد، تنطبق قاعدة التمرير نفسها: فما يتقاضاه المورّد هو ما يُتقاضى منك، وأي خفض في سعر المورّد يظهر في فاتورتك في اليوم نفسه.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

بالنسبة لمعاينة لم تثبت جدارتها بعد، فإن ميزة التوجيه الأكثر أهمية هي التحويل عند الفشل. فإرسال شريحة من حركة الإنتاج إلى Mistral Large 4 بينما يحتفظ Opus 5 بالباقي يعني أن أي تراجع في الأداء يتحول إلى إعادة توجيه بدلًا من انقطاع في الخدمة، كما أنك تتعرّف على أنماط فشل النموذج الحقيقية من خلال بياناتك الخاصة لا من لوحة صدارة.

ما الذي يحلّ هذا خلال ثلاثة أسابيع؟

لا تزال ثلاث حقائق مفتوحة، وكل واحدة منها تغيّر الإجابة. إذا وصلت الأوزان بموجب ترخيص متساهل، يصبح Mistral Large 4 النموذج الوحيد في هذا الثنائي الذي يمكنك استضافته ذاتيًا، وتميل حسابات المشترين الخاضعين للتنظيم بقوة. إذا عاد التسعير الترويجي $0.68 / $2.09 إلى $1.36 / $4.18 على بطاقة الأسعار، تضيق الفجوة لكل مهمة لكنها تبقى حاسمة. وإذا نقلت Artificial Analysis أرقام البرمجة المقيَّمة بشكل خاص إلى فهرسها العام دون تغيير، تصبح قصة البرمجة موثّقة من طرف ثالث بدلًا من أن ينشرها المورّد بالنيابة عن طرف ثالث.

حتى ذلك الحين: يُعدّ Opus 5 الخيار الافتراضي الآمن للإنتاج، ويستحق تكلفته المضاعفة للأعمال الوكيلية والمهام التي تعتمد بكثافة على الطرفية. أما Mistral Large 4 فهو الرهان المثير للاهتمام — رخيص بما يكفي لكل مهمة ليعمل إلى جانبه، وقادر بما يكفي في مجالي الأتمتة والأمن السيبراني ليستقطب الاستخدام اليوم، ويحمل وعدًا بالنشر الذاتي لا يستطيع أي نموذج مغلق في هذه المقارنة أن يضاهيه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا