
Grok 4.6 مقابل Claude Opus 5: نفس الـ61، اقتصادان مختلفان
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
تُجري Artificial Analysis كل نموذج متطور عبر التقييمات التسعة نفسها وتنشر الفاتورة. على مؤشر Intelligence Index الخاص بها،Grok 4.6وClaude Opus 5 يحققان الرقم نفسه — 61 — مما يجعل هذه مواجهة نادرة حيث لا يستطيع المؤشر المركب أن يخبرك أيهما تستخدم. الشيء القادر على ذلك هو رقم أقل شهرة من المصدر نفسه: في مجموعة أعمال المعرفة AA-Briefcase، أنجز Grok 4.6 مهمة في حوالي 53 دورة ونحو نصف مليار رمز إدخال، بينما احتاج Claude Opus 5 بأقصى جهد إلى حوالي 103 دورات وملياري رمز لنفس العمل. هذه فجوة أربعة إلى واحد في استهلاك الرموز بين نموذجين تتطابق نتيجتهما الرئيسية، ولا تظهر إلا عندما تتوقف عن مقارنة بطاقات النماذج وتبدأ في مقارنة الفواتير.
كلا الطرازين هما إطلاقان رئيسيان حاليان، مما يجعل هذه مقارنة نظيفة بدلاً من عدم تطابق الأجيال. تم إصدار Grok 4.6 في 12 أغسطس 2026 من SpaceXAI كتحسين لأساس Grok 4.5 — نفس القاعدة القائمة على مزيج من الخبراء بمعاملات تبلغ 1.5 تريليون، أُعيد تدريبها بمدة إشراف أطول وجولات تعلم معزز تهدف إلى الوكلاء طويلي الأمد. تم إصدار Claude Opus 5 في 24 يوليو 2026 من Anthropic كإصدار رئيسي ثابت التاريخ مع تفكير تكيفي، ونافذة سياق تبلغ مليون رمز، وإدخال الصور والملفات. إنهما يقعان في نفس النقطة على لوحة النتائج المستقلة ونقطتين متقابلتين على قائمة الأسعار: 2 دولار / 6 دولارات لكل مليون رمز لـ Grok 4.6 مقابل 5 دولارات / 25 دولارًا لـ Claude Opus 5. العمل المثير للاهتمام هو معرفة أي نصف من تلك الجملة يحدد اختيارك للإنتاج.
الـ61 الذي يخفي فجوة كفاءة بنسبة أربعة إلى واحد
مؤشر الذكاء هو مركّب من تسعة تقييمات، وهي قوّته ونقطة عماه في آنٍ واحد. رقم واحد يدمج متوسط درجات الاستدلال والرياضيات والبرمجة وأعمال المعرفة يُخفي الطريقة التي يصل بها النموذج إلى النتيجة — وهذان النموذجان يصلان إليها بطريقتين متعاكستين. مجموعة أعمال المعرفة الاحترافية بأسلوب الحقيبة من Artificial Analysis هي أوضح نافذة على ذلك: إنها تقيس مهامًا حقيقية طويلة الأمد، وسجّلت Grok 4.6 بحوالي 53 دورة و0.5 مليار رمز إدخال لكل مهمة، مقابل Claude Opus 5 Max بنحو 103 دورات و2 مليار رمز إدخال. من حيث اقتصاديات كل مهمة، هذا هو الفرق بين نموذج يُنهي مهمة بحث وإنتاج بربع الرموز ونموذج يحرقها.
السبب هو خيار تصميمي، وليس خطأ. تم تدريب Grok 4.6 خصيصًا للتحقق من عمله أثناء التنفيذ والتوقف عند اكتمال المهمة الفرعية بشكل حقيقي — تصف xAI مسارات المهام الطويلة مع الاختبار الذاتي كهدف تدريبي. بينما تم تدريب Claude Opus 5 على عمق التفكير واتساع المعرفة، وسلوكه الافتراضي هو التفكير بشكل أعمق والاستشارة أكثر مما هو ضروري تمامًا. كلاهما "نماذج استدلال"؛ لكنهما يوزعان الجهد بشكل مختلف، وهذا التوزيع هو المواصفة المهمة لأعباء عمل الوكلاء.

تكون الفجوة أكثر أهمية بالنسبة للنماذج التي تستدعي نموذجًا في حلقة تكرارية — وكلاء البحث، ووكلاء البرمجة الذين ينفذون عشرات الجولات، وخطوط معالجة المستندات التي تعالج الدفعات طوال الليل. كل جولة تُفوتر، وكل رمز إدخال هو سياق يجب إعادة إرساله في الاستدعاء التالي. النموذج الذي يُنهي المهمة في 53 جولة باستخدام 0.5 مليار رمز ليس فقط أرخص لكل رمز؛ بل هو أرخص لكل مهمة بنحو مرتبة من حيث الحجم مقارنة بنموذج يستغرق 103 جولات باستخدام 2 مليار رمز، قبل أن تضاعف حتى سعر القائمة.
ورقة المواصفات، كلا الوجهين
حيث يختلفان على الورق، في سطر واحد لكل منهما:
• مؤشر الذكاء — يسجّل Grok 4.6 رصيد 61، محتلًا المرتبة #6 من 184؛ بينما يسجّل Claude Opus 5 رصيد 61 أيضًا، متصدرًا الترتيب إلى جانبه. تعادل، وفقًا لـ Artificial Analysis.
• السعر المدرج لكل مليون توكن — Grok 4.6 بسعر 2 دولار للإدخال / 6 دولارات للإخراج (بمضاعفة السعر إلى 4 دولارات / 12 دولارًا للموجهات التي تبلغ مدخلاتها 200 ألف رمز أو أكثر)؛ Claude Opus 5 بسعر 5 دولارات للإدخال / 25 دولارًا للإخراج، مع خصم 50% على المعالجة بالدفعات ليصبح السعر 2.50 دولارًا / 12.50 دولارًا.
• نافذة السياق — 500 ألف توكن لـ Grok 4.6 مقابل 1,000,000 توكن لـ Claude Opus 5، وهي أوضح ميزة على الإطلاق في المواصفات التي يمتلكها أي من النموذجين.
• أقصى إخراج — يتيح Claude Opus 5 ما يصل إلى 128K رمزًا للإخراج (300K عبر واجهة برمجة التطبيقات المجمّعة)؛ بينما سقف إخراج Grok 4.6 أقل، في نطاق إجابة طويلة نموذجية.
• المدخلات — كلاهما يقبل النصوص والصور؛ كما يقبل Claude Opus 5 الملفات، ونسخة أنثروبيك من الإدخال متعدد الوسائط تتعامل مع المستندات بشكل أكثر مباشرة.
• GDPVal-AA v2 (العمل المعرفي) — Grok 4.6 عند 1,753 Elo مقابل Claude Opus 5 عند 1,852 Elo. ينتزع Opus 5 تاج جودة العمل المعرفي على المقياس الذي كانت فيه كفاءة الحقيبة لصالح Grok. [Artificial Analysis]
• CursorBench v3.2 — 69.9% لـ Grok 4.6 مقابل 70.0% لـ Claude Opus 5، وهي نتيجة متعادلة فعليًا على معيار وكيل البرمجة الذي تم قياس كلاهما عليه. [Artificial Analysis]
• التحكم في الاستدلال — يوفّر Claude Opus 5 مؤشر جهد من منخفض إلى أقصى مع تفكير تكيفي مفعّل افتراضيًا؛ بينما يوفّر Grok 4.6 جهد الاستدلال لكنه مضبوط على إعداد افتراضي يفضّل مسارات الوكيل الطويلة.
الهدف من وضع هذين جنبًا إلى جنب هو أن لا يهيمن أيٌّ من النموذجين. كلود أوبوس 5 هو الأفضل عمومًا على الورق: سياق أكبر، سقف إخراج أعلى، إدخال ملفات، وجودة أعلى للعمل المعرفي. جروك 4.6 هو الأفضل قيمةً والوكيل الأكثر كفاءةً. السؤال الوحيد المتبقي هو أيٌّ من هذين يصف العمل الذي لديك فعليًا.

حيث يستحق Claude Opus 5 سعره المميز
أرقام إطلاق Anthropic — المعلنة من قِبل البائع ولم تُستنسَخ بشكل مستقل — تضع Claude Opus 5 عند 96.0% على SWE-bench Verified و79.2% على SWE-bench Pro، مع نتيجة 70.6% على OSWorld لاستخدام الكمبيوتر. وعلى المؤشر المركّب الواسع، تعادل نتيجتها 61 نتيجة Grok 4.6، وعلى GDPVal-AA تتقدم بفارق قابل للقياس. وما يعنيه ذلك عمليًا هو نموذج يثبت جدارته على امتداد يوم العامل المعرفي بالكامل: الصياغة، والتحليل، والاستدلال على المستندات الطويلة، والمهام التي تجمع بين الصور والنصوص، والبرمجة — كل ذلك في مكان واحد مع نافذة سياق تبلغ مليون توكن.
نافذة السياق هي السبب الصادق للجوء إليه. حد 500 ألف توكن كبير، لكنه ليس قاعدة بيانات كاملة بالإضافة إلى مجموعة أبحاث بالإضافة إلى النتائج الوسيطة لجلسة وكيل طويلة. الفرق التي تُجري تحليلًا عميقًا بمرور واحد على مجموعات كبيرة جدًا — مستودع كامل، سنة من الإيداعات المالية، كومة طويلة من ملفات PDF — ستصطدم بسقف Grok 4.6 ولن تصل أبدًا إلى سقف Claude Opus 5. بالنسبة لتلك الأحمال، السياق الإضافي ليس رفاهية؛ إنه الفرق بين إنجاز المهمة والتنسيق حول الحد.
حيث يكون Grok 4.6 الصفقة الأفضل
اقلب نفس الحقائق وسيصبح Grok 4.6 هو الخيار الأفضل لخطوط أنابيب الوكلاء، وبفارق ليس صغيرًا. فهو أرخص بمقدار 2.5× على الإدخال و4.2× على الإخراج مقارنةً بالسعر الرسمي لـ Opus 5، وكفاءة الرموز لكل مهمة تضاعف ذلك: تشير أرقام AA-Briefcase إلى حوالي 4× عددًا أقل من الرموز و2× عددًا أقل من الجولات لنفس نتيجة العمل المعرفي. اضرب 4× في 2.5×، وستجد أن مهمة تكلف 1.00 دولار في اقتصاديات Opus 5، تكلف على الترتيب 0.10 دولار في اقتصاديات Grok 4.6 — قبل أن تُغلق الخصومات المجمّعة على جانب Opus بعض الفجوة.
فيما يتعلق بالبرمجة الوكيلية تحديدًا، تحسنت نتيجة Grok 4.6 في DeepSWE 1.1 من 54% إلى 65.9% بين الإصدارين 4.5 و4.6، كما أن نتيجته في CursorBench تقع ضمن نصف نقطة من نتيجة Opus 5 بينما يتحقق من عمله ذاتيًا على طول الطريق. بالنسبة لفريق يشغّل آلاف الاستدعاءات الوكيلية يوميًا حيث يكون كل استدعاء حلقة متعددة الأدوار، فإن اقتصاديات المهمة الواحدة والمسارات الأقصر تشكّل الفرق بين منتج قابل للاستمرار ومعدل حرق للسيولة. هذه هي الحجة التي يسوقها xAI، والبيانات المستقلة للكفاءة تدعم اتجاهها.
قرار التوجيه
هذه هي المقارنة التي يُثبت فيها الموجّه قيمته، لأن الإجابة الصحيحة هي «كلاهما، مع تحديد التقسيم حسب شكل عبء العمل». يعمل كل من Grok 4.6 وClaude Opus 5 مباشرة على OrcaRouter بسعر القائمة لدى كل مورّد — $2 / $6 لنموذج grok/grok-4.6، و$5 / $25 لنموذج anthropic/claude-opus-5 — بهامش ربح 0%، لذا فإن الرقم في نموذج التكلفة هو نفسه الرقم الذي يُحتسب في الفاتورة. أما البنية التي تجعل هذا التقسيم عمليًا: مفتاح API واحد للنموذجين، وتجاوز فشل تلقائي إذا تدهور أداء نقطة نهاية أحد المورّدين في منتصف تشغيل وكيل طويل، ولغة توجيه (DSL) يمكنها إرسال الجولات القصيرة وعالية الحجم إلى Grok 4.6 ورفع المهام طويلة المدى التي تستهلك قدرًا كبيرًا من السياق إلى Claude Opus 5 ضمن استدعاء واحد. لا تحتاج إلى عقد ثانٍ لتشغيل بنية من مستويين، ويمكنك إعادة ضبط التقسيم مع ورود بيانات حركة المرور الفعلية بدلًا من التخمين بناءً على بطاقات النماذج.

القراءة الصادقة
{{1}}العلاقة التعادلية في المؤشر المركب حقيقية وهي فخ. النماذج ذات الدرجات المتساوية ليست قابلة للتبادل؛ فهي تتميز تحديدًا في المواضع التي يعجز فيها المؤشر عن رؤيتها. كلود أوبوس 5 هو الخيار الافتراضي الأأمن للأعمال الواسعة والمكثفة السياقية التي تعتمد على المستندات والصور، حيث تكون نافذة المليون رمز والاستدلال العميق أهم من التكلفة. جروك 4.6 هو الخيار الافتراضي الأفضل لحلقات الوكلاء عالية الحجم، حيث تتضاعف كفاءة الرموز لكل مهمة وميزة السعر البالغة 2.5× لتُحدث فرقًا في الفاتورة يصل إلى مرتبة كاملة من الحجم. إذا كان عبء عملك من النوع الأول، ادفع مقابل أوبوس 5 وتوقف عن القلق بشأن السعر. وإذا كان من النوع الثاني، فإن التعادل الورقي البالغ 61 هو أفضل سبب ستحصل عليه لاختبار جروك 4.6 أولاً — {{2}}المؤشر يقول إنهما متساويان، والفاتورة تقول إنهما ليسا كذلك.{{/2}}{{1}}
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
