
كلود أوبوس 5.5 مقابل غروك 4.6: نموذج يقرأ والآخر يُنفّذ
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Claude Opus 5.5وGrok 4.6 هما أرخص طريقتين لشراء نموذج من الفئة الرائدة يستوعب نصف مليون توكن من السياق — وهما ليسا المنتج نفسه. في أحد القياسات، يبعد Grok 4.6 ثلاث نقاط عن السقف المطلق: 94.9 في GPQA Diamond، وهي مجموعة أسئلة علمية بمستوى الدراسات العليا حيث يقع نموذج Anthropic الرائد في نفس النطاق. وفي القياس التالي، يتخلف بثمانية وثلاثين نقطة. في Terminal-Bench 4.0، وهو معيار طرفي وكيلي يطلب من النموذج إنجاز عمل حقيقي في صدفة، سجّل Artificial Analysis نتيجة Grok 4.6 عند 21.21% وClaude Opus 5.5 عند 59.60%. هذا ليس خطأً مطبعيًا في أي من الاتجاهين، والسبب الكامل وراء هذا الاقتران يكمن في تفسير لماذا كلا الرقمين صحيحان في آن واحد.
إصداران، في الفئة السعرية نفسها، يفصل بينهما أربعة أشهر
أصدرت SpaceXAI نموذج Grok 4.6 في 12 أغسطس 2026 باعتباره الطراز الرائد الحالي في سلسلة Grok، بسعر 2.00 دولار لكل مليون رمز و6.00 دولار للإخراج، مع نافذة سياق تبلغ 500,000 رمز وواجهة إدخال للنصوص والصور والملفات. وأصدرت Anthropic نموذج Claude Opus 5.5 في 22 سبتمبر 2026، بعد نحو ستة أسابيع، بسعر $4.00/$6.00 مع نافذة سياق تبلغ 1,000,000 رمز و128,000 رمز إخراج. يدعم كلاهما جهد الاستدلال القابل للضبط، واستدعاء الأدوات، والمخرجات المهيكلة؛ كما يقدّم كلاهما واجهة متوافقة مع OpenAI بالإضافة إلى التنسيق الخاص بمورّده.
إذن، القراءة الساذجة هي مقايضة واضحة: سعر Grok 4.6 نصف سعر الإدخال ونحو ثلث سعر الإخراج، بينما يجيب Claude Opus 5.5 بنافذة سياق مضاعفة. هذه المقايضة حقيقية، وقد تكون في العمل على المستندات الطويلة الشيء الوحيد المهم. وهي أيضاً ليست موضع التباين المثير للاهتمام، لأن النموذجين قُيّما على نفس منصة الاختبار المستقلة، ولم يستقرّا في المكان نفسه على المحاور المهمة للعمل الوكيلي.
ما يقوله الكتالوج بشأن المحاور التي قيس كلاهما عليها.
يحمل كتالوج OrcaRouter مصدر الاختبارات المعيارية لكل صف — إذ يذكر كل رقم الجهة المقيِّمة التي جاء منها — لذا فإن الأزواج الواردة أدناه كلها من مصدر واحد عبر كلا الطرازين، وهو Artificial Analysis، بدلاً من رقم من البائع من جهة ورقم من طرف ثالث من الجهة الأخرى:
• GPQA Diamond — Claude Opus 5.5 غير مُدرَج على هذا المحور في الكتالوج لدينا؛ يسجّل Grok 4.6 نسبة 94.9%
• الاختبار الأخير للبشرية — 61.4% لـ Claude Opus 5.5 مقابل 42.9% لـ Grok 4.6
• SciCode — 66.9% مقابل 56.5%
• استدعاء السياق الطويل — 84.7% مقابل 80.3%
• Terminal-Bench 4.0 — 59.60% مقابل 21.21%
• مؤشر AA Intelligence Index — 57.6 مقابل 44.3
صف GPQA تُرك فارغًا عمدًا على جانب Anthropic بدلًا من تعبئته من عرض تقديمي لمورّد. إن 94.9 التي حققها Grok 4.6 هناك هي أقوى رقم في بطاقته وهي حقيقية — قياس مستقل، وليست ادعاءً من SpaceXAI — وهي تقول شيئًا حقيقيًا عن النموذج: عندما تكون المهمة سؤالًا جيد الصياغة بإجابة واحدة قابلة للدفاع، يؤدي Grok 4.6 على حدود الإمكانيات. اقرأها بجانب 21.21% في Terminal-Bench 4.0 فيصبح الشكل واضحًا. إن إنتاج إجابة صحيحة حول العلم وتنفيذ مهمة من خمس خطوات في shell مقابل نظام ملفات حقيقي هما قدرتان مختلفتان، وGrok 4.6 متقدم في الأولى أكثر بكثير من الثانية.
تحفّظ واحد على هذا الاقتران قبل أن يُستخدم كحكم: سُجّلت أرقام Artificial Analysis للطرازين في تاريخي تقييم مختلفين، وأرقام Grok 4.6 هي المجموعة الأقدم. المقارنة هي بين طراز قُيّم في أغسطس وآخر قُيّم في سبتمبر على إطار تقييم خضع هو نفسه للمراجعة خلال تلك الفترة. اتجاه الفجوة متسق عبر خمسة محاور منفصلة، ولهذا نتعامل معه كإشارة، لكن قيم النقاط الدقيقة ينبغي أن تُقرأ كمقارنة بين أغسطس وسبتمبر، لا كمقارنة في اليوم نفسه.
مؤشر بناه شخص لا يبيع أيضًا
ثمة مقياس مستقل ثانٍ، وهو يتفق على الاتجاه بينما يكون أقل استعدادًا بكثير لإجراء تمييزات دقيقة. مؤشر Epoch للقدرات، الذي بنته Epoch AI كمركّب من أكثر من خمسين معيارًا وأُعيد قياسه بحيث يقع Claude 3.5 Sonnet عند 130 وGPT-5 عند 150، يضع Claude Opus 5.5 عند 167.35 في الملف الذي قرأناه في 2 أكتوبر 2026. يقع Grok 4.6 عند 156.61، من تقييم جرى في 12 أغسطس. هذه فجوة قدرها 10.74 نقطة على مقياس لوحظ فيه أن نحو خمس نقاط يقابل مضاعفة مقياس الأفق الزمني لـ METR عند إطلاق المؤشر — واسعة، وتقع بأريحية خارج الفترتين المنشورتين للنموذجين 164.0 إلى 172.0 و154.66 إلى 158.93، وهما لا تتداخلان على الإطلاق.
من الجدير بالملاحظة ما لا يحسمه هذا المؤشر. فهو يضع Claude Sonnet 5.5 عند 165.2 وClaude Fable 5.1 عند 164.82، وكلاهما فوق Grok 4.6، وكلاهما أرخص لكل مليون رمز مُخرَج من سعر الفئة الثانية لدى Grok 4.6. وأي شخص يختار على أساس القدرة مقابل الدولار وحده لديه خيار ثالث ورابع في عائلة المورّد نفسها، أما الاقتران في هذا المقال فيتعلق بشيء آخر: ما يبرع فيه كل من النموذجين.
بطاقات الأسعار، والصف الذي يظهر في إحداها فقط

تحتوي بطاقة أسعار Grok 4.6 على درجة تسعير لا تحتوي عليها بطاقة Claude Opus 5.5: الطلبات التي تتجاوز 200,000 رمز موجه تُحاسَب بضعف السعر الأساسي، فيرتفع الإدخال من 2.00$ إلى 4.00$ والإخراج من 6.00$ إلى 12.00$، مع انتقال قراءة الذاكرة المؤقتة من 0.50$ إلى 1.00$. يتقاضى Claude Opus 5.5 سعر 4.00$/20.00$ مع قراءات ذاكرة مؤقتة بسعر 0.20$ ثابت عبر نافذة الـ 1,000,000 رمز كاملة. هذا الانقلاب هو النتيجة العملية لشراء سياق طويل من أي من النموذجين، وهو يقلب مقارنة السعر المعلن بمجرد أن ينمو عبء العمل فعليًا:
• السعر عند 30,000 رمز إدخال — Claude Opus 5.5 هو الأغلى، بنحو 28 سنتًا مقابل 30,000 إدخال و8,000 إخراج، مقابل نحو 11 سنتًا لـ Grok 4.6
• السعر عند 250,000 رمز إدخال — ينقلب الترتيب، لأن Grok 4.6 انتقل إلى فئته المضاعفة بينما Claude Opus 5.5 لم يفعل
• قراءات الذاكرة المؤقتة — 0.20 دولار لكل مليون لـ Claude Opus 5.5 مقابل 0.50 دولار، وترتفع إلى 1.00 دولار فوق حد الشريحة، لـ Grok 4.6
• الحد الأقصى للإخراج — 128,000 رمز لـ Claude Opus 5.5؛ ولم يُنشر سقف الإخراج لدى Grok 4.6 في سجل الكتالوج
يحمل Grok 4.6 أيضًا فجوة واحدة تستحق ذكرها بوضوح بدل تركها لتُكتشف لاحقًا. فسجلّه لا يدرج أي رقم أقصى للمخرجات على الإطلاق — فالحقل غير مقيس، وليس صفرًا — لذا فإن عبء العمل الذي يعتمد على استجابات فردية طويلة جدًا ليس لديه رقم منشور يمكن التخطيط بناءً عليه في ذلك الجانب من المقارنة.
عمود الأداء الذي لا ينبغي قراءته
يتضمن كتالوجنا أيضًا لوحة لأداء الخدمة لكل نموذج، وهي على Grok 4.6 أكثر العناصر تضليلًا في الصفحة. تُظهر البطاقة زمن استجابة p50 قدره 10,000 مللي ثانية ومعدل خطأ 97.58% خلال نافذة مدتها سبعة أيام، مع خدمة 26,184 رمزًا في تلك الفترة. لا تصف تلك الحقول نموذجًا بطيئًا، بل تصف نموذجًا لم يُستدعَ إلا بالكاد: عند مستوى حركة المرور هذا تكون العينة أضعف من أن يعني توزيع زمن الاستجابة أي شيء، ويعكس معدل الخطأ عددًا ضئيلًا من المحاولات وليس جودة الخدمة. التعامل مع تلك الكتلة كدليل على أن Grok 4.6 بطيء سيكون بمثابة قراءة أثر ناتج عن القياس على أنه قياس.
في المقابل، تقف خلف لوحة Claude Opus 5.5 عيّنة سكانية — قيمة p50 في نطاق 4.4 ثانية على مدى نافذة سبعة أيام مع عيّنات يومية، و156 مليون رمز قُدِّمت في الفترة نفسها. وحتى ذلك ينبغي قراءته على حقيقته: فهو حركة المرور في ساحة التجارب الخاصة بنا، وهي عيّنة من مستخدمينا وليست خاصية من خصائص النموذج.
أيّ واحد يجب توجيهه، وكيف تكتشف ذلك بنفسك في عملك
الانقسام الذي تصفه الأرقام مستقر بما يكفي للبناء عليه. Claude Opus 5.5 هو الخيار للعمل الوكيلي وطويل الأفق — فجوة Terminal-Bench 4.0 البالغة 59.60% مقابل 21.21% هي أكبر تباين على أي محور قيس عليه كلا النموذجين، وهو المحور الذي يتنبأ بما إذا كان يمكن إسناد مهمة إلى نموذج بدلًا من سؤال. وهو أيضًا الخيار عندما يكون الموجّه طويلًا فعلًا، لأن بطاقة الأسعار لا تتدرج والنافذة ضعف الحجم. Grok 4.6 هو الخيار للعمل على شكل أسئلة وبحجم كبير: نتيجة 94.9% في GPQA Diamond بسعر $2.00/$6.00 ضمن أول 200,000 رمز هي صفقة جيدة جدًا لأعباء عمل الاسترجاع والإجابة التي لا تنمو أبدًا إلى الطبقة المضاعفة.
كلاهما متاح على OrcaRouter بسعر المزوّد المعلن مع هامش ربح 0% — Claude Opus 5.5 بسعر $4.00/$20.00 مع قراءات ذاكرة التخزين المؤقت بـ $0.20، Grok 4.6 بسعر $2.00/$6.00 مع تطبيق شريحة ما فوق 200K تمامًا كما تحدّدها SpaceXAI — خلف مفتاح واحد، بحيث يمكن اختبار التقسيم أعلاه على مجموعة المطالبات الخاصة بك بدلًا من الجدال بشأنه. وحيث يتم توجيه كليهما، تجاوز الفشل التلقائي يقع في الأسفل، وهو أمر يستحق الوجود عندما يكون النموذج الأرخص هو من يمسك بالمسار الوكيلي.
الحكم الذي يناله هذا الاقتران: Grok 4.6 هو القارئ الأفضل وClaude Opus 5.5 هو العامل الأفضل. إنّ 94.9 في GPQA Diamond و21.21 في Terminal-Bench هما النموذج ذاته مقيسًا مرتين، ومعرفة أيّ من هذين الرقمين يشبه عبء عملك هي القرار بأكمله.


مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
