
Claude Sonnet 5.5 يتعادل مع Claude Fable 5.1 في مؤشر Epoch Capabilities Index
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 221 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
عادةً ما يكون التعادل على قمة لوحة الصدارة أقل ما يثير الاهتمام فيها. هذا التعادل هو الاستثناء، لأن النموذجين المتعادلين في القمة لا يكلفان المال نفسه. في ملف Epoch Capabilities Index المحدَّث في 1 أكتوبر 2026، Claude Sonnet 5.5 و Claude Fable 5.1 يسجلان معًا 165 — الصفان الثالث والرابع من بين 253 نموذجًا متتبعًا — متخلفين بنقطتين عن Claude Opus 5.5 و GPT-6 Astra، وهما متعادلان بدورهما عند 167، ومتقدمين بنقطتين على Claude Opus 5 عند 163. طُرح Claude Sonnet 5.5 في 28 سبتمبر 2026 بسعر 2 دولار لكل مليون رمز إدخال و10 دولارات لكل مليون رمز إخراج. طُرح Claude Fable 5.1 في 1 سبتمبر بسعر 10 دولارات و50 دولارًا. رقم واحد يقول إن النموذجين متبادلان في القدرة العامة. خمسة أضعاف سعر الإخراج تقول إنهما ليسا كذلك. يظل كلا الأمرين صحيحًا، والسبب في كونهما صحيحين معًا هو الجزء من الجدول الذي لا يقتبسه أحد.
ما هو المؤشر في الواقع، ومن يقوم بالقياس
مؤشر ECI ليس لوحة نتائج للمورّدين. إنه من تطوير Epoch AI، وهي منظمة بحثية مستقلة، كمؤشر مركّب يجمع درجات من أكثر من خمسين معيارًا مستقلًا في مقياس واحد للقدرة العامة، ويستنتج الصعوبة النسبية لكل معيار من النماذج التي تظهر مصادفةً في عدة معايير منها في الوقت نفسه. المنهجية موضّحة في ورقة بعنوان “A Rosetta Stone for AI Benchmarks”، مموّلة من Google DeepMind ومكتوبة مع باحثين من فريق AGI Safety & Alignment التابع لها — لكن Epoch تصرّح بوضوح أن المؤشر منتجها الخاص وأنها تملك كامل الحقوق عليه، وكود المواءمة متاح للعموم. يكتسب هذا التمييز أهمية عندما لا يكون ممول البحث وناشر الدرجة الطرف نفسه.
خاصيتان للمقياس تحدّدان كيفية قراءة رقم عليه. الأولى أن ECI مرسّى وليس مطلقًا: يُعاد تحجيم القيم الخام بحيث يستقر Claude 3.5 Sonnet عند 130 وGPT-5 عند 150، ما يعني أن رقمًا لا يعني شيئًا إلا بجوار رقم آخر من الملف نفسه. والثانية أنه لا يوجد سقف. لا يوجد 100 يُقترب منه، لذا فإن «قمة المؤشر» عبارة عن تصريح يتعلق بتاريخ وليس بحدّ بلغه أحد.
الخاصية الثالثة هي التي تحوّل التعادل إلى حكاية. الفترات المنشورة بجانب كل نتيجة — فترات بوتستراب بنسبة 90%، بُنيت عن طريق إعادة أخذ عينات من نتائج المعيار المرصودة الخاصة بكل نموذج خمس مئة مرة — متطابقة بالنسبة للنموذجين عند 165: من 162 إلى 169 لـ Claude Sonnet 5.5 ومن 162 إلى 169 لـ Claude Fable 5.1. لكن الأعداد التي أنتجتها ليست كذلك. قيمة 165 الخاصة بـ Claude Sonnet 5.5 مُشتَقّة من 11 تقييمًا معياريًا. أما قيمة Claude Fable 5.1 فهي مُشتَقّة من 20.
لماذا لا تعني الفترة نفسها الدليل نفسه
يحتاج مؤشر ECI إلى أربع عمليات تقييم معيارية على الأقل قبل أن يُمنح أي نموذج أي تقييم على الإطلاق، لذا فإن كلا الرقمين يتجاوز الحد الأدنى بأريحية. لكن الفاصل تعبير عن مدى تشتت نتائج النموذج نفسه، لا عن حجم الأدلة المتاحة — ولهذا يمكن أن يُظهر نموذجان النطاق نفسه حول التقدير النقطي نفسه، بينما يستند أحدهما إلى نحو نصف الأدلة. وإذا عاملت قيمتي 165 على أنهما متساويتان في الرصانة، فأنت تقرأ الفاصل على أنه تصحيح لحجم العينة، مع أنه ليس كذلك.
اللاتماثل له نتيجة عملية على التوقيت. يعيد Epoch ملاءمة النموذج بأكمله بشكل مشترك عبر جميع البيانات كلما وردت تقييمات جديدة، لذا يمكن أن يتغير رقم النموذج دون أن يتغير أي شيء يخص ذلك النموذج. النموذج الذي يحمل 11 ملاحظة لديه مجال أكبر للتحرك من النموذج الذي يحمل 20، ما يجعل Claude Sonnet 5.5 الأرجح بين الاثنين للتغير في المراجعة التالية — في أي من الاتجاهين.
صياغة Epoch نفسها للقراءة الحالية أضيق من العناوين التي أنتجتها. يبدأ ملخص المنظمة للتحديث بحلول Claude Opus 5.5 في المرتبة الأولى عند 167 متقدمًا بفارق ضيق على GPT-6 Astra، ويكرّس الجملة الثانية لكون Claude Sonnet 5.5 قد «طابق تقريبًا» Claude Fable 5.1 عند 165. وعبارة «طابق تقريبًا» هي العبارة الجوهرية، والفترات المنشورة هي السبب في أنها العبارة الصحيحة.
أين يختلف الملفان الشخصيان فعليًا

التساوي على مستوى المؤشر المركّب لا يعني التساوي على مستوى الأجزاء المكوّنة له. تنشر Epoch لوحةً خاصة بكل اختبار معياري على صفحة كل نموذج، وتظهر ستة اختبارات معيارية على كلٍّ من صفحة Claude Sonnet 5.5 وصفحة Claude Fable 5.1 — وهو ما يجعلها الاختبارات الستة الوحيدة التي يتيح فيها الفهرس نفسه إجراء مقارنة متماثلة.
• ألغاز لعبة الغموض — Claude Sonnet 5.5 بنسبة 65% مقابل Claude Fable 5.1 بنسبة 58%
• FrontierMath المستويات 1–3 (v2) — Claude Sonnet 5.5 89% مقابل Claude Fable 5.1 90%
• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 بنسبة 80% مقابل Claude Fable 5.1 بنسبة 88%
• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 بنسبة 100% مقابل Claude Fable 5.1 بنسبة 100%
• معيار تجميع الأثاث — Claude Sonnet 5.5 بنسبة 75% مقابل Claude Fable 5.1 بنسبة 70%
• SimpleQA Verified — Claude Sonnet 5.5 بنسبة 47% مقابل Claude Fable 5.1 بنسبة 71%
أربع نقاط من الحركة في أي من الاتجاهين على مؤشر مركب بهذا الازدحام، والانقسام الأساسي ليس قريبًا من التماثل. Claude Sonnet 5.5 متقدم حيث يكون العمل شبيهًا بالألعاب ومتعدد الوسائط — حل الألغاز، التجميع الفيزيائي — ومتعادل في رياضيات المسابقات. Claude Fable 5.1 متقدم بـ 8 نقاط في أصعب مستوى من FrontierMath و بـ 24 نقطة في SimpleQA Verified، مجموعة المعرفة العالمية حيث تشكل نتيجة 47% مقابل 71% أكبر فجوة منفردة في اللوحة المشتركة. المشتري الذي يختار بين هذين النموذجين لا يختار بين قراءتين للقدرة نفسها؛ بل يختار بين نموذج أرخص أقوى في بعض الأعمال وآخر أغلى أقوى في أعمال أخرى، مع مؤشر للقدرة العامة يرفض الفصل بينهما.
يؤكد مؤشر Epoch أيضاً صراحةً أن تصدُّر نموذج في اختبار معياري بعينه لا يلزم أن يظهر في المؤشر المركّب. ولا تُوزَن الاختبارات المعيارية حسب الدقة، وقد يسجّل نموذج متخصص نتيجة أدنى من منافس مختلف التكوين حتى وهو يتصدر اختبارات فردية — وتقول وثائقه ذلك مباشرة. هذا ليس عيباً يجري التماس الأعذار له؛ بل هو الغرض من مؤشر مركّب يضم ما يزيد على خمسين اختباراً.
الأداتان المستقلتان تشيران في اتجاهين متعاكسين

هناك قياس مستقل ثانٍ متداول، وهو لا يتفق مع الأول بشأن أي من هذين النموذجين هو المتقدم. على مؤشر Artificial Analysis Intelligence Index، تُقرأ الأرقام التي يحملها كتالوجنا الخاص بالنموذجين 56 لـ Claude Sonnet 5.5 و53.4 لـ Claude Fable 5.1، وهي مستقاة من المراجعة نفسها لذلك المؤشر، وبالتالي تحمل العينة نفسها من النماذج المُقيَّمة. بفارق ثلاث نقاط، لصالح النموذج الأرخص — حيث يقرؤهما Epoch متطابقين.
لا قراءة منهما خاطئة، وطريقة استخدامهما هي ملاحظة ما تختلفان بشأنه. يغطي المؤشران مجموعتين مختلفتين من الاختبارات المعيارية ويعطيانها أوزانًا مختلفة؛ فقد صُمّم مركّب Epoch ليصمد أمام تشبّع الاختبارات المعيارية، بينما Artificial Analysis مجرد تجميع مباشر لسلة مختلفة. وعندما يكون نموذجان بهذا القدر من التقارب، فإن اختيار أداة القياس أهم من الفجوة المقيسة. وعلى القارئ الذي يريد الأقوى من بين رقمين متجاورين أن ينظر إلى لوحة الاختبارات المعيارية الفردية المشتركة أعلاه بدلًا من أي من الرقمين الرئيسيين، لأن ذلك هو الموضع الوحيد الذي يُقارَن فيه النموذجان أحدهما بالآخر على الاختبار نفسه.
ثمة سياق إضافي لا يحمله المؤشر المركّب، بينما تحمله Epoch: تاريخ الإصدار. يحتل Claude Fable 5.1 المرتبة الرابعة من أصل 253 نموذجًا متتبَّعًا اليوم. وفي وقت إصداره نفسه في 1 سبتمبر 2026، كان يحتل المرتبة الأولى من أصل 247 نموذجًا كان يُتتبَّع آنذاك. لم تتغيّر أوزانه. كل ما حدث أن الحدود المتقدمة تجاوزته بستة مراكز خلال شهر واحد — وهذا هو شكل الجدول كله، وهو السبب في أن قراءة المؤشر الشهرية لقطة سريعة لا حكمًا نهائيًا.
ما تكلفة الفرق، وأين يقع الجانب الرخيص

التساوي في القدرة العامة والفارق بمقدار 2.5 مرة في الإدخال و5 مرات في الإخراج هو كامل المحتوى العملي لهذه القراءة. كلا النموذجين مدرجان في كتالوجنا الخاص — anthropic/claude-sonnet-5.5 بسعر 2.00 دولار لكل مليون من الإدخال و10.00 دولارات لكل مليون من الإخراج مع قراءات التخزين المؤقت بـ0.20 دولار، وanthropic/claude-fable-5.1 بسعر 10.00 و50.00 مع قراءات التخزين المؤقت بـ0.25 دولار — ويُمرَّران بسعر القائمة الخاص بالمزوّد دون إضافة أي هامش، لذا يصل تغيير معدل المورّد إلى طرفنا في اليوم نفسه الذي يصل فيه إلى طرفهم.
التكرار يهم أكثر من العنوان الرئيسي. خُذ عبئًا عملًا يرسل بادئة من 120,000 رمز من الذاكرة المؤقتة ويولّد 8,000 رمز من المخرجات، ويُشغَّل مرة واحدة يوميًا لمدة شهر. على Claude Sonnet 5.5، تكلف تلك البادئة 120,000 رمز بمعدل 0.20 دولار لكل مليون، أي نحو 2.4 سنت، بالإضافة إلى 8,000 رمز بمعدل 10 دولارات لكل مليون، أي 8 سنتات — ما يقرب من 10.4 سنتات لكل تشغيل، أو نحو 3.12 دولارات على مدار ثلاثين يومًا. وعلى Claude Fable 5.1، تبلغ البادئة نفسها 120,000 رمز بمعدل 0.25 دولار، أي 3 سنتات، بالإضافة إلى 8,000 رمز بمعدل 50 دولارًا، أي 40 سنتًا — نحو 43 سنتًا لكل تشغيل، أو 12.90 دولارًا خلال الشهر. يقدّم كلا الطرازين النافذة نفسها بسعة مليون رمز مع مخرجات تصل إلى 128K، لذا فالفرق في بطاقة التسعير لا في السقف.
في مقابل ذلك، تحدد المقاييس الستة المشتركة الاتجاه الذي يشتري فيه المال الإضافي شيئًا ما. الفريق الذي يشبه عمله المستوى الرابع من FrontierMath أو استرجاع المعلومات الواقعية مفتوح النهاية يشتري فارقًا حقيقيًا من 8 إلى 24 نقطة في تلك الاختبارات عبر دفع أربعة أضعاف؛ أما الفريق الذي يشبه عمله حل الألغاز أو التجميع متعدد الوسائط فيشتري من 5 إلى 7 نقاط في الاتجاه المعاكس مقابل دفع المبلغ الأصغر. على منصة واحدة، ليس هذان قرارَي شراء منفصلين. كلا النموذجين يقعان خلف مفتاح API واحد يتيح الوصول إلى أكثر من 200 نموذج، لذا فإن مقارنتهما على حركة الاستخدام الخاصة بك تعد تغييرًا في الإعدادات وليست عقدًا ثانيًا، وحيث يتم توجيه كليهما، يوجد تبديل تلقائي عند الفشل في الطبقة الأساسية — وهو أمر مهم عندما تختلف أداتان مستقلتان بشأن أيهما في المقدمة.
ما الذي قد يحرّك هذه القراءة؟
سيكون هناك ثلاثة أمور متضمنة، وواحد فقط منها يتضمن أيًّا من النموذجين.
الأول هو المزيد من تقييمات المعايير. دخل Claude Sonnet 5.5 المؤشر قبل أربعة أيام مع 11 تقييمًا خلفه؛ وكل تقييم إضافي يضيّق فترته ويمكن أن يحرّك تقديره النقطي، كما أن إعادة الملاءمة المشتركة تعني أن التحرك لا يقتصر على الصف الجديد.
والثاني هو وصول نموذج حدودي آخر. تمتد الصفوف الأربعة الأولى على أربع نقاط، مع تعادلين داخل هذا النطاق، لذا فإن وافدًا جديدًا واحدًا جيد التقييم يقع داخل المجموعة لا دونها — والفترات المنشورة، التي تتداخل بين الأربعة جميعًا، تعني أن الترتيب فيما بينها كسر للتعادل لا قياس.
الثالث هو سعر النماذج نفسها، وهو ما لا يتتبعه أي مؤشر. الفجوة التي يدور حولها هذا المقال هي فجوة في بطاقة الأسعار: دولاران و10 دولارات مقابل 10 دولارات و50 دولارًا اليوم. أي تغيير في أي من البطاقتين يحرّك القرار دون تحريك أي درجة قدرة واحدة.
الخلاصة القابلة للدفاع عنها هي الخلاصة الضيقة. على المؤشر المركّب لدى Epoch AI، في ملف حُدّث في 1 أكتوبر 2026، يمثّل Claude Sonnet 5.5 وClaude Fable 5.1 الرقم نفسه — 165، متعادلين في المركز الثالث، مع فترات منشورة متطابقة تستند إلى قدرين مختلفين من الأدلة. على أداة Artificial Analysis المنفصلة، يفصل بين النموذجين نفسهما ثلاث نقاط. وعلى المعايير الستة التي يقارنهما فيها المؤشر مباشرة، يتبادلان الصدارة حسب المجال بدل أن يكونا في مستوى واحد. وعلى قائمة الأسعار، ليسا متقاربين على الإطلاق. والشيء الوحيد الذي لن تدعمه هذه القراءة هو الجملة التي يُرجّح أن تُقتبس على أنها: أن النموذجين متكافئان.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
