
يتصدّر Claude Opus 5.5 مؤشر Coding Agent Index برصيد 66 — وترتفع فاتورة المهام بنسبة 21%
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 180 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
خفض البائع Claude Opus 5.5 أسعار الرموز بنسبة 20% في 22 سبتمبر 2026. بعد يومين، نشرت Artificial Analysis قياس وكيل البرمجة الذي يظهر ما فعله التخفيض بفاتورة الوكيل: ارتفعت تكلفة المهمة بنسبة 21%، إلى $13.04، من $10.79 التي يتقاضاها نفس المؤشر مقابل Claude Opus 5. ارتفعت النتيجة أيضاً — 66 على Coding Agent Index، الذي تصفه Artificial Analysis بأنه الأعلى الذي قاسته، متقدماً بست نقاط على Claude Opus 5 وأربع نقاط على Claude Fable 5.1 في نفس التكوين. كلا الأمرين صحيحان في آن واحد، والسبب في أنهما صحيحان في آن واحد هو القصة الكاملة لهذا التصنيف. الرمز الأرخص الذي يستهلكه النموذج أكثر ليس مهمة أرخص، وعند أقصى جهد استدلالي في تشغيلات الوكيل الطويلة، يستهلك Claude Opus 5.5 الكثير منها.
ما الذي يقيّمه Coding Agent Index فعليًا
هذا ليس جدول صدارة للنماذج. كل صف فيه هو زوج من بيئة التشغيل والنموذج — نقطة تحقق تعمل داخل وكيل برمجي محدد، عند إعداد جهد محدد. الصف الذي يقتبسه الجميع هو Claude Opus 5.5 عند أقصى جهد داخل Claude Code، وهي بيئة التشغيل التي تبنيها Anthropic وتضبطها. وتأتي نتيجة 60 الخاصة بـ Claude Opus 5 ونتيجة 62 الخاصة بـ Claude Fable 5.1 من بيئة التشغيل نفسها وإعداد الجهد نفسه، وهذا ما يجعلهما المقارنتين الأمينتين؛ أما صف أيٍّ من النموذجين في وكيل برمجي مختلف فهو قياس مختلف، ولا يُدرج هنا كما لو كان القياس نفسه.
المؤشر له إصدارات، والإصدار أهم من اسم العلامة التجارية عليه. اللوحة المنشورة حالياً باسم v1.5 تُوسّط ثلاث تقييمات، كل منها مرجّح بالتساوي، وكل منها يُبلّغ عنه بـ pass@1 المُتوسّط على ثلاث محاولات لكل مهمة:
• Terminal-Bench 4.0 — العمل الوكيلي في الصدفة وسطر الأوامر: التنقّل في نظام الملفات، واستخدام الأدوات استخدامًا صحيحًا، والتعافي من فشل وسيط، وإتمام سير عمل متعدد الخطوات.
• DeepSWE v1.1 — مهام هندسة البرمجيات، عمل تحرير المستودعات.
• SWE-Atlas-QnA — أسئلة فهم المستودعات، حيث يتم العثور على الإجابة عبر قراءة قاعدة الشيفرة بدلًا من تعديلها.
ثلاثة تقييمات، ورقم واحد، وعمود للتكلفة لكل مهمة مطبوع بجانبه. هذا العمود الخاص بالتكلفة هو سبب كون هذا المؤشر أكثر فائدة من مجرد درجة، وهو أيضًا سبب كون الرقم الرئيسي أصعب في القراءة مما يبدو.

المكوّنات الثلاثة، ومن أين جاءت النقاط الست.
نشرت Artificial Analysis صفوف المكوّنات إلى جانب المركّب، وهي لا تتحرّك بالتساوي:
• Terminal-Bench 4.0 — 63.1% لصالح Claude Opus 5.5 مقابل 54.5% لـ Claude Opus 5، بزيادة قدرها 8.6 نقاط. هذا أكبر تحسّن فردي في المجموعة.
• DeepSWE v1.1 — 68.4% مقابل 62.5%، بزيادة 5.9 نقاط.
• SWE-Atlas-QnA — 66.4% مقابل 62.1%، بزيادة 4.3 نقاط.
احسب متوسط هؤلاء الثلاثة فتحصل على 66.0، وهو المركب. الجزء المثير للاهتمام هو شكل المكسب: تحسّن النموذج بأقل قدر في قراءة قاعدة تعليمات برمجية وبأكبر قدر في قيادة الصدفة. Terminal-Bench هو التقييم الأقرب إلى ما يعنيه الناس فعلاً بـ"وكيل البرمجة" — حلقة طويلة الأمد حيث يختار النموذج الأوامر، ويقرأ المخرجات، ويقرر ما سيفعله بعد ذلك، دون وجود إنسان في الحلقة بين الخطوات. قفزة بمقدار 8.6 نقطة هناك هي دلالة على الاستخدام المستمر للأدوات، وليس على توليد التعليمات البرمجية.
لاحظ ما يعنيه ذلك بشأن أين تتوقع التحسين. إذا كان عبء عملك هو "اشرح هذا المستودع"، فإن Claude Opus 5.5 ترقية متواضعة مقارنةً بـ Claude Opus 5 — أربع نقاط. وإذا كان عبء عملك هو "شغِّل حتى تنجح مجموعة الاختبارات، مع إصلاح ما يتعطّل"، فهو أكبر قفزة في الجدول.

الرقم المطبوع بجانب الترتيب: $13.04 لكل مهمة
إليك الحساب الذي يجعل تخفيض السعر يبدو مختلفًا عن الطريقة التي أُعلن بها. سعر القائمة لدى Anthropic لـ Claude Opus 5.5 هو 4.00 دولارات لكل مليون رمز إدخال و 20.00 دولارًا لكل مليون رمز إخراج، انخفاضًا من 5.00 و25.00 دولارًا لـ Claude Opus 5، مع انخفاض قراءات الذاكرة المؤقتة بنسبة 60% إلى 0.20 دولارًا لكل مليون. كل سطر من هذه السطور أرخص. تقدير Artificial Analysis لتكلفة مهمة عند أقصى جهد أعلى على أي حال:
• التكلفة لكل مهمة — 13.04 دولارًا لـ Claude Opus 5.5 مقابل 10.79 دولارًا لـ Claude Opus 5، بزيادة 21% على المؤشر نفسه، ونفس منصة الاختبار، ونفس إعداد الجهد.
• إجمالي الرموز المميزة لكل مهمة — نحو 15.6 مليون مقابل 11.4 مليون، بزيادة نحو 37%.
• رموز الإخراج لكل مهمة — نحو 333,000 مقابل 137,000، أي أكثر من الضعف. الإخراج هو الاتجاه المكلف، وهو السطر الذي تحرّك أكثر من غيره.
• الإدخال المخزن مؤقتًا لكل مهمة — تقريبًا 14.6M مقابل 10.9M، بارتفاع نحو 34%. إن خفض القراءة من الذاكرة المؤقتة بنسبة 60% يؤدي دورًا حقيقيًا هنا؛ لكنه ليس كافيًا لتعويض مهمة تقرأ سياقًا أكثر بمقدار الثلث.
أجرِ الحساب بالأسعار المنشورة وستظهر الصورة. خذ رموز الإخراج وحدها: 333,000 رمز بسعر 20.00 دولار لكل مليون تبلغ نحو $6.66 — أي نحو نصف إجمالي تقدير 13.04 دولارًا، من بند واحد تضاعف. بند قراءة الذاكرة المؤقتة ضخم من حيث الحجم وشبه مجاني من حيث السعر: 14.6 مليون رمز بسعر 0.20 دولار لكل مليون أي أقل من 3 دولارات. خفض الـ20% حقيقي وخفض الذاكرة المؤقتة حقيقي؛ عند أقصى جهد في حلقة وكيل، فإن نموذجًا يفكر أطول ويكتب أكثر يفوقهما وزنًا ببساطة.
وهذا له نتيجة مباشرة على طريقة إعداد ميزانيتك. إذا كان فريقك ينفّذ 500 مهمة لوكلاء البرمجة يوميًا بأقصى قدر من الجهد، فإن الفرق بين 10.79 دولارًا و13.04 دولارًا يبلغ نحو 1,125 دولارًا يوميًا — أي نحو 34,000 دولار شهريًا — مقابل العدد نفسه من المهام. هذا هو الرقم الذي يجب أن تضعه أمام من يوافق على تغيير النموذج، وهو ليس الرقم الذي يوحي به خفض السعر.
لماذا يُعدّ كلٌّ من 5.98$ و13.04$ صحيحًا
نشرت Artificial Analysis رقمًا مختلفًالتكلفة المهمة الواحدة للنموذج نفسه قبل أيام، وقراءة الاثنين معًا دون التسميات تجعلهما يبدوان متناقضين. لكنهما ليسا كذلك — إنهما تقييمان مختلفان، والفرق بينهما مفيد.
في مؤشر الذكاء، قدّر التقرير المكتوب في 22 سبتمبر تكلفة المهمة الواحدة لـ Claude Opus 5.5 بنحو 5.98 دولار، أي على نفس المستوى تقريبًا مع 5.86 دولار لـ Claude Opus 5، رغم نحو 119,000 رمز مُخرَج لكل مهمة مقابل 73,000 لـ Opus 5. وهناك، يلغي خفض السعر والرموز الإضافية بعضهما أثر بعض بشكل شبه تام. وعلى مؤشر وكيل البرمجة، عند أقصى جهد، في Claude Code، تبلغ تكلفة النموذج نفسه 13.04 دولار مقابل 10.79 دولار.
كلاهما قياسان صادقان لأحمال عمل مختلفة. تقييم الإجابة عن الأسئلة هو تبادل قصير؛ أما مهمة الوكيل فهي حلقة طويلة من استدعاءات الأدوات بسياق متنامٍ، ويتراكم هذا النمو في اتجاه الإخراج، حيث يكون السعر في أعلى مستوياته. والدرس العملي هو أن سؤال "هل يعوّض خفض السعر الرموز الإضافية؟" ليس له إجابة واحدة — فهو يعتمد على طول المهمة، وكلما كانت المهمة أطول وأكثر اعتمادًا على الوكلاء، ساء التعويض. وإذا كنت تضع ميزانيتك بناءً على معيار قصير الإجابات، فسوف تستهين بفاتورة الوكيل.
ثلاث محاذير تنتمي إلى الصف
الرقم 66 هو رقم Claude Code، وليس رقم نموذج مجرّد. يقرن المؤشر بين النماذج وإطارات التقييم عمداً، بحجة أنّ توجيه الأدوات ومنطق إعادة المحاولة وإدارة السياق لا يمكن فصلها عن الأداء المقيس للوكيل. وهذا يصبّ في مصلحة Anthropic هنا، لأنّ الإطار الذي يُقيَّم فيه هو إطارها الخاص. وتشير Artificial Analysis إلى أنّ عرضاً لمقارنة الإطارات سيصدر قريباً؛ وإلى أن يوجد ذلك، لا يمكن لأحد أن يجزم بمقدار ما يعود من فارق النقاط الست إلى نقطة الحفظ ومقدار ما يعود إلى البنية المحيطة بها.
رقم Terminal-Bench 4.0 الخاص بـ Anthropic أعلى من هذا المكوّن، وقد أجرته Anthropic. تذكر مواد الإطلاق 66.4% عند xhigh من الجهد؛ ومكوّن Coding Agent Index هو 63.1% عند max، وقاس تشغيل مستقل منفصل من Artificial Analysis 59.6% في منصة الاختبار الخاصة به على نفس نسخة المعيار. ثلاثة أرقام، ثلاث تهيئات، ثلاث جهات منتجة. نسبة 63.1% في الصف أعلاه هي مكوّن المؤشر نفسه وينبغي مقارنتها فقط بالأرقام الأخرى في ذلك المؤشر؛ أما نسبة 66.4% الخاصة بالمورّد فهي مُبلَّغ عنها من المورّد، ولم يُعِد إنتاجها طرف ثالث، وتنتمي إلى إعداد جهد مختلف.
تتحرك مراجعة المؤشر. نشرت هذه المدونة صفوفًا مختلفة من Coding Agent Index في أوائل سبتمبر، على نسخة أقدم من اللوحة نفسها، وهذه الأرقام الأقدم غير قابلة للمقارنة مع v1.5 — فقد تغيّرت مجموعة التقييم نفسها عندما حلّ Terminal-Bench 4.0 محل النسخة السابقة. لا تزال المرايا من جهات خارجية تحمل لقطات قديمة بتسميات إصدارات أقدم. إذا لم يكن رقم ما لـ Claude Opus 5.5 على هذا المؤشر من صف v1.5 الحالي، فلا تضع ذلك الرقم بجانب رقم v1.5، ولا تحسب فرقًا بين الاثنين.

ما الذي يجب نشره فعليًا
التصنيف رقم بأقصى جهد، وأقصى جهد هو الإعداد الذي لا ينبغي لأحد تقريبًا أن يطلقه افتراضيًا. لدى Claude Opus 5.5 خمسة إعدادات للجهد — منخفض، ومتوسط، ومرتفع، ومرتفع جدًا، وأقصى — ويأتي النموذج افتراضيًا على متوسط. لم تنشر Artificial Analysis صفوف Coding Agent Index عند الإعدادات الأدنى، لذا فإن التوفير في التكلفة هناك غير محدّد كميًا على هذا المؤشر؛ وفي Intelligence Index، سجّل النموذج نفسه عند الإعداد المتوسط 51 — بما يطابق أقصى Claude Opus 5 — بتكلفة $1.34 لكل مهمة. هذا هو الاتجاه الذي يكمن فيه التوفير، وهو إعداد، وليس نموذجًا مختلفًا.
النمط الواقعي هو الانقسام: احتفظ بأقصى جهد للحلقات المستقلة الطويلة، حيث يكون مكسب 8.6 نقطة في Terminal-Bench هو ما تشتريه، وشغّل العمل الروتيني بجهد أقل حيث يظل النموذج متقدمًا كثيرًا على النقطة التي انتهى عندها Claude Opus 5. ولأن الجهد معامل طلب لا عملية نشر، فإن هذا الانقسام قاعدة توجيه، وكلا النموذجين يقعان في الكتالوج نفسه — الأسعار المعلنة لـ Anthropic تُمرَّر بهامش 0%، لذا يصبح أي تخفيض في سعر المورّد ساريًا على anthropic/claude-opus-5.5 في اليوم نفسه الذي يُعلَن فيه، دون أي عقد ثانٍ أو تغيير في الكود عند إجراء مقارنة A/B بين النموذجين مقابل مهامك. أما مسار أقصى جهد تحديدًا، حيث قد تكون المهمة الواحدة تشغيلًا طويلًا دون إشراف، فإن التحويل التلقائي عند الفشل هو ما يمنع تعطّل أحد المزوّدين من إهدار الحلقة بأكملها.
ما الذي لا يزال غير مُقاس؟
ثلاثة أمور من شأنها أن تغيّر هذه الصورة، ولا وجود لأيٍّ منها حتى الآن. لا توجد مقارنة متطابقة الجهد ومتطابقة البيئة الاختبارية بين Claude Opus 5.5 ونقطة تحقق منافسة — فكل مقارنة عابرة للبائعين متاحة ليست سوى جدولين لجهتين بائعتين موضوعين جنبًا إلى جنب. ولا يوجد تشغيل منشور لمؤشر Coding Agent Index عند مستوى جهد متوسط أو مرتفع، وهو المستوى الذي تقع عنده معظم حركة الإنتاج. أما مسألة إسناد النتائج إلى البيئة الاختبارية — أي مقدار ما يعود إلى النموذج من نتيجة 66 ومقدار ما يعود إلى Claude Code — فقد أقرّ بها المؤشر وأجّلها.
ما يمكنك أن تتصرف بناءً عليه اليوم أضيق نطاقًا وأكثر فائدة من مجرد ترتيب. إن Claude Opus 5.5 أفضل حقًا في عمل الوكيل المستمر المدفوع بالـshell من Claude Opus 5 — وهذا هو المكوّن الوحيد الذي حقق مكسبًا كبيرًا ومتّسقًا ومُنتَجًا بشكل مستقل. كما أنه يكلّف أكثر لكل مهمة عند الإعداد الذي قيس عنده ذلك المكسب، بنحو 2.25 دولار للمهمة، وخفض سعر التوكن لا يبلغ ذلك الرقم. انشره بأقصى جهد حيث تكون الحلقة طويلة وكلفة الفشل مرتفعة؛ وأبقِ الإعداد الأرخص في كل مكان آخر؛ وأعد فحص المؤشر عندما تظهر صفوف الجهد الأقل، لأن ذلك هو التهيئة التي ستدفع ثمنها فعليًا معظم الفرق. إذا كنت تنتقل من أجل خفض السعر وحده، فأنت تشتري الشيء الخطأ — فالنموذج أرخص لكل توكن وأغلى لكل مهمة، وواحد فقط من هذين الرقمين يظهر في فاتورتك.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
