
يتصدّر Claude Opus 5.5 مؤشر Epoch Capabilities Index بفارق 0.84 نقطة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
الرقم هو 0.84. Claude Opus 5.5 يقع عند 167.35 على Epoch Capabilities Index وفقًا للملف الذي قرأناه في 2 أكتوبر 2026، مع GPT-4 Astra عند 166.51 — بفارق أقل من نقطة واحدة على مقياس تتداخل فيه الفترات المنشورة بنسبة 95% للنموذجين بشكل شبه كامل، 164.0 إلى 172.0 بالنسبة إلى Opus 5.5 مقابل 163.14 إلى 171.05 بالنسبة إلى Astra. وتحتهما، Claude Sonnet 5.5 سجّل 165.2 وClaude Fable 5.1 164.82، لذا فإن الإدخالات الأربعة الأولى في مركّب مستقل يضم أكثر من خمسين معيارًا تفصل بينها 2.53 نقطة، وثلاثة منها تحمل اسم المورّد نفسه. الترتيب حقيقي بمعنى أن تقديرات النقاط مرتّبة. وهو ليس حقيقيًا بمعنى أن تقدّمًا بمقدار 0.84 نقطة ينجو من أشرطة الخطأ الخاصة به، وكل ما يستحق قوله عن لوحة الصدارة هذه ينبع من الإمساك بهاتين الحقيقتين في آنٍ واحد.
ما هو المؤشر، وما لا تعنيه 0.84 من نقطة
مؤشر Epoch Capabilities Index ليس لوحة نتائج لمورّد. بناه Epoch AI، وهي منظمة بحثية مستقلة، كمركّب يجمع معًا نتائج أكثر من خمسين اختبارًا معياريًا متميزًا في مقياس واحد للقدرات العامة، ويستنتج الصعوبة النسبية لكل اختبار معياري من النماذج التي تظهر في عدة منها في آن واحد. المنهجية موضحة في ورقة بحثية كُتبت مع باحثين من فريق AGI Safety & Alignment التابع لـ Google DeepMind وممولة من DeepMind، لكن Epoch تذكر بوضوح أن المؤشر منتجها الخاص وأنها تملك الحقوق الكاملة عليه — وهو تمييز يستحق الحفاظ عليه عندما لا يكون مصدر التمويل وناشر النتيجة نفس الطرف. الشيفرة البرمجية عامة.
ثمة خاصيتان في هذا المقياس أهمّ من العنوان الرئيسي. الأولى أن ECI مُثبَّت عن قصد لا مطلق: يُعاد قياس الدرجات الخام بحيث يستقر Claude 3.5 Sonnet عند 130 وGPT-5 عند 150، ما يعني أن أي رقم في هذا المؤشر لا يكون ذا معنى إلا بجوار رقم آخر من الملف نفسه، وليس بمفرده أبدًا. والثانية أن المؤشر بلا سقف. فلا وجود لـ100 يُقترب منها، لذا فإن "قمة المؤشر" عبارة عن تاريخ، لا عن حدّ بلغه أحد.
وهذا هو السبب في أن القراءة الأمينة لـ 167.35 مقابل 166.51 ليست «Claude Opus 5.5 هو النموذج الأقدر في العالم». بل هي أضيق نطاقًا وأقل قابلية للاقتباس: بناءً على نمذجة Epoch للأدلة المتاحة في 2 أكتوبر 2026، لا يمكن التمييز بين النموذجين عند القمة، والترتيب بينهما مجرد كسر للتعادل لا قياس. والفترات المنشورة تقول ذلك مباشرة — 164.0 إلى 172.0 و163.14 إلى 171.05 تتشاركان الغالبية العظمى من نطاقيهما. وأي شخص يقتبس 0.84 كحكم نهائي إنما يقتبس أثرًا من أخطاء التقريب.
كتلة Anthropic، وحجم الإصدار
الميزة الأكثر دلالة في الجدول ليست مَن يحتلّ المركز الأول، بل الصفّان الثالث والرابع. فـ Claude Sonnet 5.5، الذي صدر في 28 سبتمبر وحصد 165.2 نقطة، يتقدّم بـ 0.38 نقطة على Claude Fable 5.1، الذي صدر في 1 سبتمبر برصيد 164.82 — وهو فارق ضيق بما يكفي ليجعل الاثنين في المركز نفسه عملياً، وضيق بما يكفي ليجعل الثنائي يقع على 2.15 نقطة فقط تحت قمة القائمة. وSonnet هو المنتج في الفئة المتوسطة من خط إنتاج Anthropic، بينما Fable هو النموذج الذي ظلّت الشركة تاريخياً توجّهه نحو أعمال الاستدلال العام؛ وأن هذين النموذجين صارا الآن يطوّقان الحدّ الأقصى من أسفله مباشرة هو التغيير الجوهري في هذه التحديثة، أكثر من كونه هوية المتصدّر.
خطوة أنثروبيك الجيلية الخاصة مرئية أيضًا. Claude Opus 5.5 هو خليفة Claude Opus 5، الذي يمنحه Epoch درجة 162.94 بفاصل من 160.2 إلى 166.7. هذا تحسّن بمقدار 4.41 نقطة خلال نحو شهرين، من إصدار 24 يوليو إلى إصدار 22 سبتمبر — وهو تحرّك أكبر من 0.84 نقطة التي تفصل بين المركزين الأول والثاني اليوم. إذا قُرئ الأمر بهذه الطريقة، فإن الكمية المثيرة للاهتمام في هذا الجدول هي الميل داخل خط مورّد واحد، لا الفجوة بين مورّدين في القمة.
أين يقع خط الأوزان المفتوحة
يفصل Epoch بين النماذج حسب إتاحة الوصول، ما يجعل حدود الأوزان المفتوحة واضحة دون الحاجة إلى التخمين. أفضل إدخال مفتوح الأوزان هو Kimi K3 عند 157.61، بتاريخ 16 يوليو ومصنّف كغير تجاري. وخلفه يأتي DeepSeek V4 Pro 0813 عند 155.38 وDeepSeek V4.1 Flash عند 155.0، وكلاهما غير مقيّد، ثم GLM-5.3-Flash عند 151.94 وGLM-5.2 عند 151.78. لذلك فإن أقرب نموذج مفتوح إلى القمة متأخر بـ 9.74 نقطة — وهي فجوة أوسع ثمانية عشر ضعفًا من تلك بين المركزين الأول والثاني، وواسعة بما يكفي بحيث لا تقترب الفترات من التلامس.
هذا التفاوت هو النتيجة الدائمة الوحيدة في الجدول. الحدود المغلقة كتلة متلاصقة ضمن ثلاث نقاط؛ أما المسافة من الحدود المغلقة إلى أفضل الأوزان القابلة للتنزيل فهي أكبر بمرتبة قدر. إن المؤشر المركّب الذي يتيح لك المقارنة عبر أجيال المعايير هو بالتحديد الأداة المناسبة لملاحظة ذلك، لأنه يستطيع قول الشيء نفسه في يوليو وفي سبتمبر بدلًا من الإبلاغ بأن معيارًا آخذًا في التشبع قد خفت.
يستحق بعض الصفوف المجاورة التثبيت من أجل السياق، إذ إنها النماذج التي يقارن بها القراء فعلاً مقابل Opus 5.5:
• Claude Sonnet 5 — 156.34، صدر في 30 يونيو، النطاق من 153.61 إلى 158.81
• Grok 4.6 — 156.61، صدر في 12 أغسطس، النطاق من 154.66 إلى 158.93
• Gemini 3.8 Flash — 156.93، صدر في 2 سبتمبر، الفاصل من 154.64 إلى 160.42
• Muse Spark 1.3 — 156.86، صدر في 2 سبتمبر، الفاصل من 154.73 إلى 159.56
• GPT-5.6 Sol — 161.8، صدر في 9 يوليو، النطاق من 159.26 إلى 165.26
المركز في المؤشر ليس فاتورة

هنا تتوقف لوحة الصدارة عن كونها القصة كاملة، لأن النموذجين في القمة لا يكلفان حتى عن بُعد الشيء نفسه. من كتالوجنا الخاص، الذي يحمل كليهما بسعر قائمة المزوّد دون أي هامش ربح، Claude Opus 5.5 بسعر $4.00/$20.00 مع قراءات ذاكرة مؤقتة بـ $0.20 و GPT-6 Astra بسعر $10.00/$50.00 مع قراءات ذاكرة مؤقتة بـ $1.00، يفصل بينهما فارق 2.5 ضعف في كلا اتجاهي جدول الأسعار. كما يرتفع Astra فوق 272,000 رمز موجّه، حيث يصبح الإدخال $20.00 والإخراج $75.00؛ أما Opus 5.5 فيحافظ على $4.00/$20.00 ثابتين عبر نافذته الكاملة البالغة 1M رمز. ويقدّم كلاهما 128,000 رمز إخراج.
أجرِ الحساب الذي يتحمّله فعليًا عبء عمل ذو سياق طويل — بادئة من 180,000 رمز تُخدَم من الذاكرة المؤقتة، و5,000 رمز مُولَّد. على Opus 5.5، هذا يعني 180,000 رمز بسعر 0.20 دولار لكل مليون، أي نحو 3.6 سنتات، زائد 5,000 رمز بسعر 20 دولارًا لكل مليون، أي 10 سنتات: نحو 13.6 سنتًا. وعلى GPT-6 Astra يكون الحساب 180,000 رمز بسعر 1.00 دولار، أي 18 سنتًا، زائد 5,000 رمز بسعر 50 دولارًا، أي 25 سنتًا: نحو 43 سنتًا. وتقدّم بمقدار 0.84 نقطة وفجوة تكلفة بمقدار 3.2 مرة ليسا من النوع نفسه من الحقائق، وأي قرار شرائي لا يوازن إلا بين الأول قد وزَن الرقم الأصغر.
يوضّح Fable 5.1 النقطة من الجانب الآخر لبطاقة المورّد نفسه: فبسعر $10.00/$50.00، جاء تسعيره مطابقًا تمامًا لتسعير Astra، وهو يسجّل 164.82 — أي أقل بـ2.53 نقطة من Opus 5.5 مقابل السعر نفسه. يضع المؤشر مدخلات Anthropic الثلاثة الرائدة في نطاق 2.53 نقطة من بعضها بعضًا، بينما تضعها بطاقة أسعارها متباعدة بمعامل 2.5، وهو وصف أفضل بكثير للخيار المطروح أمام المشتري مما يقدمه أي تصنيف منفرد.
إذا كنت ستجادل بشأن رقم، فجادل بناءً على حركة المرور الخاصة بك.

السبب الذي يجعل هذا المؤشر جديرًا بالقراءة أصلًا هو أنه يقيسه شخص غير البائعين — لكن بنية المؤشر المركّب نفسه هي التي تحدد شروط الجدال. فمعايرة Epoch، وتقديراتها للصعوبة، وطريقتها في التعامل مع النماذج التي تتجاهل المعايير، كلها تقع في المنبع قبل الرقم الوارد في الجدول، ولا شيء منها مما يستطيع القارئ إعادة استخلاصه من لقطة شاشة. وينطبق الأمر ذاته على المعيار الرئيسي لدى كل بائع، ولهذا فإن الخطوة المفيدة ليست الانحياز إلى طرف بينهم، بل مقارنتهم على حركة المرور التي تتحكمون بها أنتم.
كلا هذين النموذجين يمكن الوصول إليهما من مفتاح API واحد على OrcaRouter، الذي يمرّر سعر قائمة المزوّد دون أي هامش ربح: Claude Opus 5.5 بسعر $4.00/$20.00 مع قراءات ذاكرة مؤقتة بـ $0.20 وGPT-6 Astra بسعر $10.00/$50.00 مع تطبيق طبقة ما فوق 272K تمامًا كما يحددها المزوّد. إرسال مجموعة المطالبات نفسها إلى كليهما هو تغيير في الإعدادات وليس عقدًا ثانيًا، وحيث يتم توجيه كليهما، التجاوز التلقائي عند الفشل يقع في الأسفل، وهذا مهم لقرار قريب إلى هذا الحد من حد الضوضاء. يمكن لجدول الصدارة أن يخبرك أن النموذجين غير قابلين للتمييز. فقط تقييمك الخاص يمكنه أن يخبرك أيهما غير قابل للتمييز في عملك.

ما الذي سيحرّك هذا الرقم الشهر المقبل؟
ملف Epoch حيّ، وثلاثة أمور من شأنها أن تغيّر القراءة بسرعة. الأول هو أي تقييم جديد لنموذج حدودي يقع ضمن أفضل أربعة، لأن ملاحظة معيارية إضافية واحدة تحرّك قيمة مركّبة أكثر عندما يكون التجمّع بهذا التراص مما لو كان هناك متصدّر واضح. والثاني هو انزياح فترات الثقة — أحدث الإدخالات تحمل أوسعها، لأنها قُيّمت على أقل عدد من المعايير المتداخلة، لذا فإن إصدارات سبتمبر هي الصفوف الأرجح للتحرّك، وإصدارات يوليو هي الأقل. والثالث هو بلوغ معيار مرحلة التشبّع، وهو الفشل المحدد الذي بُني المؤشر ليصمد أمامه: فعندما يتوقف مكوّن عن التمييز، تعيد Epoch ترجيح التركيبة بدلًا من أن تدع ميزة نموذج تتبخر مع الاختبار.
في الوقت الحالي، الخلاصة القابلة للدفاع هي الخلاصة الضيقة. يحتل Claude Opus 5.5 المركز الأول في Epoch Capabilities Index عند 167.35 بفضل هامش 0.84 نقطة لا تدعمه فترة ثقته الخاصة، وقد صعد Claude Sonnet 5.5 إلى مسافة 2.15 نقطة من الصدارة من الطبقة الوسطى في السلسلة نفسها، بينما يتخلف مجال الأوزان المفتوحة عنهم جميعًا بأكثر من تسع نقاط. المتصدر محسوم برمية عملة بين مورّدين اثنين. أما فجوة الأربع نقاط في السعر بينهما فليست كذلك.
مقارنات في هذه المقالة4
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
