
معايير أداء Claude Opus 5.5: كل نتيجة، وإعداد الجهد الذي جاءت منه، ومن قام بقياسها
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 177 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1323 tok/s
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
الرقم الرئيسي لـ Anthropic لـClaude Opus 5.5 على Terminal-Bench 4.0 يبلغ 66.4%، مقابل 52.3% لـClaude Opus 5 على الجدول نفسه — وقد أُنتجت نسبة 66.4% عند xhigh من الجهد، وليس عند الإعداد الافتراضي للنموذج وهو medium. طُرح النموذج في 22 سبتمبر 2026، قبل يومين من كتابة هذه الصفحة، لذا فهو نموذج GA بأسعار نموذج GA وجدول معايير نموذج GA. أما الرقم المستقل على المعيار نفسه، من Artificial Analysis، يبلغ 59.6%، في تهيئة تتضمن توجيه الحماية من جانب الخادم الخاص بـ Anthropic بداخلها. بين هذين الرقمين يقع فرق في أداة الاختبار، وفرق في الجهد، وفرق في التوجيه، ولا أحد — بمن فينا نحن — يستطيع حتى الآن أن يقول مقدار ما يفسره كل واحد من هذه الفروق من الفجوة. ما يمكن لهذه الصفحة فعله هو وضع كل رقم منشور لـ Claude Opus 5.5 في مكان واحد، وتسمية من أنتجه، وتسمية الإعداد الذي أُنتج عنده، وتضمين الصفوف التيGPT-6 Astra وClaude Fable 5.1 يتقدمان.
ابدأ بضبط الجهد، لأنه يحرّك الأرقام أكثر مما تفعله النماذج.
الإعداد الافتراضي لـ Claude Opus 5.5 هو متوسط الجهد على Claude API. وكان الإعداد الافتراضي لـ Claude Opus 5 هو مرتفع. كما أن المستوى الذي يحمل الاسم نفسه ليس أيضًا هو ميزانية التفكير ذاتها بين النموذجين، لذا فإن "شغّلنا كليهما على مرتفع" ليس مقارنة مضبوطة حتى عندما تتطابق التسمية. التفكير التكيفي مفعّل دائمًا ولا يمكن إيقافه على Opus 5.5؛ ومعامل الجهد يغيّر العمق وزمن الاستجابة والتكلفة، ولا شيء آخر.
أُجري رقم Anthropic في Terminal-Bench 4.0 عند xhigh. هذه الحقيقة الوحيدة هي أهم تحذير في هذه الصفحة، لأن المعيار الذي تتصدره هو ذو أوسع هامش مُبلَّغ عنه مقارنةً بالطراز السابق، ولأن الجدول نفسه يُظهر ما يحدث عندما تترك الإعداد كما هو:
• FrontierCode v1.1 Main — 54.4% عند xhigh، و54.6% عند medium الافتراضي.مُبلَّغ من المورّد. تشغيل medium هو أعلى من تشغيل xhigh. على عبء العمل هذا، لم يحقق مقبض الجهد أي مكسب قابل للقياس؛ الرقمان هما الرقم ذاته.
• CursorBench 4.0 — 57.8% عند xhigh، و52.5% عند medium.بحسب ما أبلغ عنه المورّد. النموذج نفسه، وأداة الاختبار نفسها، والأسبوع نفسه: 5.3 نقاط، وهو أكبر فارق في مستوى الجهد المطروح.
هذان الصفان الموجودان داخل جدول مورّد واحد هما الحجة بأكملها. أحد حِملي العمل غير حساس للجهد، والآخر حساس للجهد بشدة، ولا تستطيع بطاقة النموذج أن تخبرك مسبقًا أي نوع من حِمْل العمل ينطبق عليك. الاستنتاج الذي تدعمه البيانات ضيق، ويستحق أن يُصاغ على نحو ضيق: مستوى الجهد الصحيح أصبح الآن قياسًا خاصًا بكل حِمْل عمل، لا قيمة افتراضية ترثها. لا يدعم هذا القول إن "Opus 5.5 أسرع مما توحي به مقاييسه المرجعية" أو إن "Anthropic قلّلت من قدرة الإعداد الافتراضي عمدًا" — فمن أجل ذلك ستحتاج إلى مسوحات لكل حِمْل عمل عبر الإعدادات الخمسة كلها، ولم ينشرها أحد. لكنه يعني أنه إذا انتقلت من Opus 5 وأبقيت إعداد الجهد الذي كان لديك بالفعل، فأنت قد غيّرت التجربة، وليس النموذج فقط.
عدم تماثل آخر، وهو يقطع في الاتجاه المعاكس. عمود المنافس في صف Terminal-Bench الخاص بـ Anthropic هو GPT-6 Astra بنسبة 57.9% — تم تشغيله بـ high effort، وفقًا لملاحظة الرسم البياني الخاصة بـ Anthropic، بينما تم تشغيل Opus 5.5 بنسبة 66.4% بـ xhigh. جدول مورد يشغّل نموذجه الخاص بإعداد معين ومنافسه بإعداد آخر ليس مواجهة مباشرة، مهما بدا الرقمان متجاورين.
جدول المورّد، مع المصدر والإعداد في كل صف
كل ما في هذا القسم بحسب ما أفاد به المورّد: مواد إطلاق Anthropic، وأداة الاختبار الخاصة بـ Anthropic، وضمانات الإنتاج مفعّلة، والتفكير التكيفي بأقصى جهد ما لم يذكر الصف خلاف ذلك. اقرأه على أنه Anthropic تقيس Anthropic.
• Terminal-Bench 4.0 — 66.4%، عند جهد xhigh. مُبلَّغ عنه من المورّد، والخطأ المعياري نحو ±2.6 نقطة. في الصف نفسه: Claude Opus 5 52.3%، وClaude Fable 5.1 55.8%، وGPT-6 Astra 57.9% (عند جهد مرتفع)، وGPT-5.6 Sol 37.3%. إن Terminal-Bench 4.0 هو صراحةً معيار يعترف المورّد بأنه بديل غير مثالي لعمل الطرفية الحقيقي، وهو النتيجة الرئيسية للنموذج.
• FrontierCode v1.1 Main — 54.4% عند xhigh، و54.6% عند المتوسط الافتراضي.وفق ما أبلغ عنه المورّد. Opus 5 48.0%، Fable 5.1 50.3%، GPT-6 Astra 53.3%، GPT-5.6 Sol 47.5%. كما تتضمن بطاقة نظام Anthropic النسخة الموسّعة عند 63.6% وأفضل رقم للنسخة الموسّعة عند الإعداد المتوسط وقدره 65.3%.
• CursorBench 4.0 — 57.8% عند xhigh، و52.5% عند medium.بحسب ما أعلنته الجهة المطوّرة. Opus 5 بنسبة 46.6%، وFable 5.1 بنسبة 51.8%، وGPT-5.6 Sol بنسبة 41.7%. لاحظ أن صفوف CursorBench لكل من Fable 5.1 وOpus 5 هي عند أقصى جهد (max)، لذا فإن Opus 5.5 عند medium تتم مقارنته بأشقائه أنفسهم عند max.
• GDPval-AA v2.1 — 1,846 Elo.هذا هو الصف الوحيد في جدول المورّد الذي لم يُجرِه المورّد. GDPval-AA هو تقييم من Artificial Analysis، ويذكر تقرير Artificial Analysis نفسه عن Opus 5.5 الرقم 1,846 نفسه، مع Fable 5.1 عند 1,735 وOpus 5 عند 1,708. في جدول المورّد: Fable 5.1 1,735، Opus 5 1,708، GPT-5.6 Sol 1,588، GPT-6 Astra 1,542. وهو الصف الوحيد هنا حيث تتفق منظمتان على الرقم نفسه، وذلك لأنه القياس نفسه.
• AutomationBench (Zapier) — 40.0%. مُبلَّغ عنها من المورّد، وأُجريت بدون نماذج احتياطية، لذا صُنِّف كل تدخّل وقائي على أنه فشل. GPT-6 Astra 41.4%، Fable 5.1 31.4%، GPT-5.6 Sol 28.8%، Opus 5 26.9%.
• Humanity's Last Exam، مع الأدوات — 67.7%. مُبلَّغ عنه من المورّد. Fable 5.1 65.6%، وOpus 5 63.6%، وGPT-6 Astra 57.2%. وتُفيد بطاقة نظام Anthropic بشكل منفصل بـ64.4% بدون أدوات، وهو الرقم الذي ينبغي الرجوع إليه إذا كنت تقارن مع مصدر لا يمنح نماذجه الوصول إلى الأدوات.
• Terminal-Bench-Science 0.1 — 58.7%. مُبلَّغ عنه من قبل المورّد، والخطأ المعياري نحو ±3.5 إلى ±5 نقاط، لذا فهذا نطاق وليس نقطة. GPT-6 Astra 64.6%، Fable 5.1 52.6%، Opus 5 29.0%، GPT-5.6 Sol 22.4%.
• OSWorld 2.0 — 81.8% جزئي. مُبلَّغ به من المورّد، وكلمة "جزئي" تؤدي عملًا حقيقيًا في تلك الجملة: فبطاقة نظام Anthropic تعطي معدل إتمام صارمًا قدره 48.7% للنموذج نفسه على التقييم نفسه. كلا الرقمين منشور؛ والرقم الجزئي هو الذي يُقتبس. Fable 5.1 80.7%، Opus 5 74.0%.
• Chartography، مع الأدوات — 89.0%. وفق ما أعلنته الشركة. Fable 5.1 88.4%، Opus 5 83.4%.

الأرقام المستقلة، وما يعنيه "Default Fallback" فعليًا
Artificial Analysis هي الطرف الثالث الوحيد الذي لديه تقييم منشور وحديث لـ Claude Opus 5.5 على مؤشر مركّب، وأرقامها هي التي ينبغي وضعها إلى جانب أرقام Anthropic. وفق ما قُرئ في 24 سبتمبر 2026:
• Intelligence Index — 58 بأقصى جهد، في تهيئة مُعنونة بـ«الاستدلال التكيفي، أقصى جهد، الخيار الاحتياطي الافتراضي». مستقل، ومقيس بواسطة Artificial Analysis. وتصف مقالتها الخاصة 58 بأنها «أعلى نتيجة قمنا بقياسها بفارق عدة نقاط». كما ينشر المؤشر نفسه Opus 5.5 عند كل إعداد جهد آخر، والتفاوت هو الجزء المفيد: 56 عند xhigh، و54 عند high، و51 عند medium، و42 عند low. هذا تأرجح بمقدار 16 نقطة عبر قرص الجهد على نموذج واحد — أكبر من الفجوة بين معظم النماذج على تلك اللوحة.
• Terminal-Bench 4.0 — 59.6%. تقييم مستقل. يُصنّفه Artificial Analysis بأنه "على مستوى المتصدّر GPT-6 Astra (xhigh)" وأعلى بنحو 11 نقطة من Claude Opus 5.
• اختبار البشرية الأخير — 61.4%.مستقل، وكان أفضل نتيجة سابقة على نفس لوحة الصدارة 59.1%، سجّلها Claude Fable 5.1.
• SciCode — 66.9%.تقييم مستقل، مقابل 63.1% لـ Claude Fable 5.1.
والآن العبارة التي تحتاج إلى شرح لا إلى اقتباس. فـ"الرجوع الافتراضي" ليس أثرًا من أثر المعيار ولا إعدادًا من إعدادات Artificial Analysis — بل هو التوجيه الحمائي من جانب خادم Anthropic، متروكًا مُفعَّلًا. يُطرح Claude Opus 5.5 مع طبقة الحماية التي كانت مخصصة سابقًا لـ Fable 5.1: إذ يُعاد توجيه معظم طلبات الأمن السيبراني بشفافية إلى Claude Opus 4.8، ويعود العمل في مجال الأحياء إلى Claude Opus 5 ما لم يكن الحساب موثَّقًا. وعندما يشغّل Artificial Analysis المؤشر مع تمكين الرجوع الافتراضي، فإنه يقيس النظام المُنشَر — أي ما يصل إليه فعليًا مفتاح API غير موثَّق — بدلًا من نسخة نظيفة من أوزان Opus 5.5. وهذا هو القياس الأكثر صدقًا بالنسبة للمشتري، وهو القياس الأقل نظافة بالنسبة لمعيار قياس. وتقول Anthropic الشيء نفسه عن جدولها الخاص: فقد أُنجزت مهام الأمن السيبراني في تشغيل Terminal-Bench 4.0 بواسطة Opus 4.8 ومهام الأحياء بواسطة Opus 5 بفعل تدخلات، وتذكر الشركة أن تلك التدخلات على الأرجح خفّضت النتيجة المُبلَّغ عنها. لذا فإن التوجيه الحمائي حقيقة تشغيلية واقعة في كلا الاتجاهين، ولا يوجد رقم في هذه الصفحة يعزل النموذج الأساسي عنه.
أين يختلف الجدولان، ولماذا
ضع الرقمين الخاصين بـ Terminal-Bench 4.0 جنبًا إلى جنب وستحصل على 66.4% مقابل 59.6% — 6.8 نقاط، على المعيار نفسه، وللنموذج نفسه. الأسباب معروفة، وكل سبب منها كبير بما يكفي ليكون مهمًا بمفرده:
• أُطُر تشغيل مختلفة. شغّلت Anthropic هيكل وكلائها الخاص؛ وشغّلت Artificial Analysis إطار تشغيل وكيل مرجعيًا خاصًا بها. النتيجة في أي اختبار قياسي عبر الطرفية هي خاصية للهيكل مضافًا إليه النموذج، وليست خاصية للنموذج وحده، ولم تنشر أي من المؤسستين تجربةً لتبديل الهياكل.
• إعدادات جهد مختلفة. نسبة Anthropic البالغة 66.4% مسجّلة عند xhigh. أما إعداد الجهد المرتبط بنسبة 59.6% الخاصة بـ Artificial Analysis فلم يُذكر في الجملة التي تحمل الرقم، كما أن أرقام المعايير المعلنة لديها هي عمومًا أرقام الجهد الأقصى.
• الضمانات مُفعَّلة، في كلتا الحالتين، لكنها تُحتسب بطريقة مختلفة. شغّلت Anthropic النموذج مع وجود خيار احتياطي، وتعاملت مع التدخلات باعتبارها مُخفِّضة للنتيجة لكنها تظل محتسبة. أما على AutomationBench فقد شغّلته دون خيار احتياطي وعدّت التدخلات إخفاقات صريحة. أما Artificial Analysis فيشغّل مع تفعيل الخيار الاحتياطي طوال الوقت.
• تتبدّل الأرقام حتى داخل جدول المورّد نفسه. تنشر Anthropic أن Claude Opus 5 يسجّل 52.3% على Terminal-Bench 4.0، وتشير إلى أن نسبة 51.8% للطراز نفسه على اللوحة العامة هي "ضمن هامش الضجيج".
وبعد ذلك يأتي أقوى دليل في هذه الصفحة على قيمة الهارنس. اللوحة العامة لمتصدّري Terminal-Bench 4.0، الملتقطة في 24 سبتمبر 2026،لا تحمل أي صف لـ Claude Opus 5.5 على الإطلاق. ومدخلها الأعلى هو GPT-6 Astra بأقصى جهد، بوكيل Codex،58.2% ±2.8؛ والثاني هو Claude Fable 5.1 بأقصى جهد عبر Claude Code بنسبة57.9% ±3.8؛ والثالث هو Claude Opus 5 عند xhigh عبر Claude Code بنسبة53.9% ±3.2. لذا فإن 66.4% ليست مجرد رقم مختلف عن 59.6% المستقلة — بل إنها غير موجودة على اللوحة العامة، ونسخة اللوحة نفسها من Claude Opus 5 هي 53.9%، لا 52.3% التي يطبعها جدول الإطلاق. وإلى أن تقبل Terminal-Bench وتنشر تقديمًا لـ Opus 5.5، فإن 66.4% نتيجة هارنس صادرة عن المورّد لم يُعِد إنتاجها أحد، و59.6% هي الرقم الذي سيقف خلفه طرف خارجي فعليًا. ولاحظ أيضًا أنه على اللوحة نفسها، يقع متصدّر Terminal-Bench 4.0 من Artificial Analysis وOpus 5.5 من Anthropic عند النسبة ذاتها 59.6% — وهو تعادل في هارنس واحد، ولا يقول لك شيئًا عن الآخر.

الصفوف التي يخسر فيها Opus 5.5
الحوصلة التي تغفل الخسائر ليست حوصلة، وجدول Anthropic الخاص يحتوي على كليهما.
• Terminal-Bench-Science 0.1 — 58.7% مقابل 64.6% لـ GPT-6 Astra. مُبلَّغ عنه من المورّد، وفي جدول Anthropic، وخسارة بمقدار 5.9 نقاط أمام منافس مُسمّى في الصف الأقرب إلى الاستدلال العلمي. ملاحظة الخطأ المعياري الخاصة بالمورّد نفسه (±3.5 إلى ±5) تعني أن الفجوة قريبة من حدّ الضوضاء بدلًا من أن تكون داخله بارتياح — لكنها خسارة على صفحة المورّد نفسه، ولا يجعل هذا النطاق منها فوزًا. يحتل Claude Opus 5 نسبة 29.0% في الصف نفسه، لذا فإن المكسب الجيلي حقيقي حتى حيث يتقدّم المنافس.
• AutomationBench — 40.0% مقابل 41.4% لـ GPT-6 Astra.بحسب ما أبلغ عنه المورّد، بخسارة 1.4 نقطة، ولم تكن في التشغيل نماذج احتياطية، لذا سُجّلت تدخلات الضمانات كإخفاقات. وهذا يعني أن هذه المقارنة تحديدًا تقيس Opus 5.5 مع تضمين عقوبة التوجيه الخاصة به مقابل منافس لم تُوصف عقوبة التوجيه لديه، أيًّا كانت. إنه أقل صف قابل للتفسير في الصفحة في كلا الاتجاهين.
هناك موضعان إضافيان يكون فيهما التقدم أضيق مما يوحي به العنوان الرئيسي، وكلاهما بحسب ما أبلغ عنه المورّد. في Humanity's Last Exam مع الأدوات يبلغ التقدم على Claude Fable 5.1 2.1 نقطة (67.7% مقابل 65.6%)؛ في Chartography مع الأدوات يبلغ 0.6 نقطة (89.0% مقابل 88.4%)؛ في OSWorld 2.0 الجزئي يبلغ 1.1 نقطة (81.8% مقابل 80.7%). هذه هي الصفوف التي تكون فيها عبارة «Opus 5.5 هو أفضل نموذج وكيلي» ادعاءً يتعلق بالترتيب لا بفارق مقيس، ولا ينبغي أن يحدد فرق قدره 0.6 نقطة في قراءة المخططات قرار شراء.
المكانة المستقلة لـ Claude Fable 5.1، وفق مراجعة فهرس مختلفة
يحتاج وضع Opus 5.5 في مقابل نظيره الشقيق إلى قسم خاص به، كما يحتاج إلى تحذير مرفق به، لأن المقارنة أصعب مما تبدو عليه.
عندما نشرت Artificial Analysis مقالتها عن Claude Fable 5.1 في 1 سبتمبر 2026، سجلت 66 بأقصى جهد على مؤشر الذكاء الخاص بها ووصفته بأنه أعلى نتيجة قاستها — متقدمًا على Claude Opus 5 عند 63 و GPT-5.6 Sol عند 61. في المؤشر كما هو مدرج في 24 سبتمبر 2026، يظهر النموذج نفسه عند 53 بأقصى جهد مع التراجع، ويظهر Opus 5.5 عند 58 في التكوين المكافئ. مقالة 22 سبتمبر عن Opus 5.5 تسمي 58 "أعلى نتيجة قسناها بفارق عدة نقاط."
لا يمكن أن يكون هذان القولان صحيحين معًا على مقياس واحد، والحل هو أنهما ليسا على مقياس واحد. فالمؤشر كائن حيّ تُنقّحه Artificial Analysis؛ ومقالان من مقالاتها المنشورة، يفصلهما خمسة أسابيع، يضعان الزوج الشقيق نفسه على طرفين متقابلين من موقع الصدارة. وهذا تصريح عن تنقيحات المؤشر، لا عن تراجع أيٍّ من النموذجين، وهو يعني أن الرقمين 66 و58 يجب ألا يُطبعا جنبًا إلى جنب أبدًا. عند القراءة في اليوم نفسه، وفي القائمة نفسها، وبالإعداد المسمّى نفسه، يضع الترتيب الحالي Opus 5.5 متقدمًا بخمس نقاط على Fable 5.1 — وحتى ذلك مقارنة ضمن المؤشر نفسه ومن الجهة نفسها المُصدِرة للمؤشر، وليست مواجهة مباشرة مدقّقة. وما يمكن قوله بأمان أضيق من ذلك: في التنقيح الحالي للمُركّب المستقل الوحيد الذي يقيس كليهما، يُعدّ Opus 5.5 الأقوى بين نموذجي Anthropic، أما الرقم 66 الأكثر شهرة الخاص بـ Fable 5.1 فينتمي إلى تنقيح أسبق من ذلك المؤشر.
تستحق الإعدادات جملة أخرى لأنها سهلة الالتباس. إنّ الرقم 66 الخاص بـFable 5.1 والرقم 58 الخاص بـOpus 5.5 كلاهما صفّان بأقصى جهد — لكن إعدادات الجهد الخمسة في Fable 5.1 تمتد على نطاق يبلغ 11 ضعفًا في استهلاك رموز الإخراج، من 13.1M عند المستوى المنخفض إلى 143.7M عند الأقصى، مع درجات مؤشر تتراوح من 58 إلى 66. ونقطة مؤشر واحدة لنموذج بهذا القدر من التباين الداخلي ليست بديلًا جيدًا عن الصف الذي ستشغّله فعليًا.
تكلفة الرموز هي محور قياسي بحد ذاته
كل رقم أعلاه هو نتيجة. ولا واحد منها فاتورة، وفي هذا النموذج تكون الفاتورة حيث تكمن الحركة المثيرة للاهتمام.
يقيس Artificial Analysis نموذج Claude Opus 5.5 عند أقصى جهد باستخدام ما يقرب من 119,000 رمز إخراج لكل مهمة في مؤشر الذكاء — وهو الأعلى في مؤشره. وللمقارنة، على اللوحة نفسها وبالإعداد نفسه: Claude Opus 5 نحو 73,000، وClaude Fable 5.1 نحو 78,000، وGPT-6 Astra نحو 27,000. تُحتسب رموز التفكير كرموز إخراج، ولا يمكن إيقاف التفكير التكيفي في Opus 5.5، لذا فإن الرموز التي ينفقها النموذج في التفكير ليست حاشية على سعره — بل هي معظمه.
أجرِ الحساب، لأن السعر المعلن مضلل بحد ذاته. يُدرج Opus 5.5 عند 4.00 دولار للإدخال / 20.00 دولار للإخراج، أي خفض بنسبة 20% عن سعر Opus 5 البالغ 5.00 / 25.00 دولار. لا يزال Artificial Analysis يقيس Opus 5.5 عند أقصى جهد بتكلفة تبلغ نحو 5.98 دولار لكل مهمة في المؤشر مقابل 5.86 دولار لـ Opus 5 عند الإعداد نفسه — قليلاً أكثر، لا أقل، لأن ما يقرب من 1.6 ضعف عدد رموز الإخراج يلتهم كامل خفض السعر بنسبة 20% بل وأكثر. وعلى مستوى المؤشر كله، أنتج Opus 5.5 260 مليون رمز إخراج مقابل وسيط لوحة نتائج قدره 88 مليون، وهو ما يصفه المقيّم بأنه "مطوّل جدًا".
لذلك تعيش قصة التكلفة بالكامل في إعداد الجهد، وهي لا تعمل إلا إذا استخدمته. عند أقصى جهد، يكون Opus 5.5 نموذجًا أكثر تكلفة لكل مهمة مكتملة من النموذج الذي يحل محله. عند المستوى المتوسط — وهو الإعداد الافتراضي الفعلي للمنتج، والنطاق الذي ينطبق عليه ادعاء Anthropic بـ«تكلفة أقل بنحو 40% للتشغيل على أعباء العمل النموذجية» — يكون التوفير حقيقيًا، لكنه تصريح عن متوسط عبر أعباء عمل اختارها المورّد، وليس نتيجة مُدقَّقة لكل مهمة. القراءة العملية: خفض السعر بنسبة 20% هو خصم على قائمة الأسعار وخيار على مقبض الجهد، وليس توفيرًا تلقائيًا. إذا كانت خطة الترحيل لديك هي «تبديل معرّف النموذج والإبقاء على الإعدادات»، فأنت تشتري النسخة المكلفة.
ما الذي لم يُثبت على الإطلاق
هذا هو القسم الذي توجد بقية الصفحة لدعمه.
• لم يُنشر أي اختبار مواجهة مباشرة مستقل ومتكافئ الجهد ومتطابق الأداة لـ Claude Opus 5.5 ضد أي منافس مسمّى.كل مقارنة بين موردين مختلفين في هذه الصفحة — Opus 5.5 مقابل GPT-6 Astra، ومقابل GPT-5.6 Sol، ومقابل Claude Fable 5.1 — هي مقارنة بين جدولين أنتجتهما شركتان مختلفتان، على أداتَي اختبار مختلفتين، وبإعدادَي جهد مختلفين، أحدهما عادةً نموذج المورّد نفسه بإعداد مواتٍ. لا توجد أي تجربة في أي مكان في السجل العام تُبقي الهيكل والجهد ثابتين عبر موردين اثنين وتُبلغ عن كليهما.
• التقسيم الدقيق للرموز لكل مسألة غير منشور. يُقاس إجمالي عدد رموز المخرجات بشكل مستقل، لكن مقدار ما يمثّل تفكيرًا مقابل نص الإجابة غير منشور من أي جهة تمكّنا من العثور عليها. أي صفحة تعطيك رقمًا دقيقًا لرموز التفكير لهذا النموذج إنما تعطيك رقمًا لم يقسه أحد.
• معظم بطاقة النظام غير مُختبَرة من قبل أطراف ثالثة. SWE-bench Pro 89.9%، Multilingual 93.9%، DeepSWE v1.1 74.2%، ProgramBench 91.2%، OfficeQA 78.9%، HealthBench Professional 65.6% معدَّل حسب الطول، GMMLU 94.3%، ArXivMath 96.9% باستخدام الأدوات — جميعها مُبلَّغ عنها من المورّد، ولم يتم إعادة إنتاج أي منها بشكل مستقل وقت كتابة هذا النص.
• الرقم الرئيسي لـ Terminal-Bench 4.0 ليس على لوحة النتائج العامة.سبق تغطيته أعلاه، وهو ينتمي إلى هذه القائمة أيضًا: فالرقم الأكثر اقتباسًا على الإطلاق عن هذا النموذج هو رقم لم يقم أحد من خارج الشركة المورّدة بتشغيله.
• تفيد Anthropic بأن Claude Opus 5.5 "غالبًا ما يشتبه في أنه يخضع للتقييم" — وهذه كلمات الشركة نفسها، قُدِّمت كقيد على تقييمها للسلامة. خُذ ذلك على محمل الجد كمشكلة قياس، لا كغرابة: إذا تصرّف النموذج بشكل مختلف عندما يعتقد أنه يخضع للاختبار، فإن كل رقم من أرقام المعايير في هذه الصفحة، سواء أكان من الجهة المورّدة أم من جهة مستقلة، هو قياس للنموذج تحت المراقبة، ومدى اختلاف ذلك عن سلوكه عند النشر غير معروف وغير مُكمَّم. وينطبق ذلك على الصفوف الجيدة والسيئة على حدّ سواء. وهو التحذير الوحيد الذي لا تُصلحه أي كمية من منهجية الجهد المتطابق.
• Sonnet 5.5 وHaiku 5.5 غير متاحين. أعلنت Anthropic عنهما خلال "الأسابيع المقبلة". لم يتم إطلاقهما بعد، وليس لهما اختبارات أداء منشورة، ولا ينطبق أي شيء في هذه الصفحة عليهما.
السعر، والمظروف، والأجزاء من المواصفات التي تغيّر الكود الخاص بك
اقرأ من بطاقة الأسعار المنشورة من Anthropic بتاريخ 24 سبتمبر 2026: 4.00 دولارات لكل مليون رمز إدخال، و20.00 دولارًا لكل مليون رمز إخراج، و0.20 دولار لكل مليون قراءة من الذاكرة المؤقتة، و5.00 دولارات لكل مليون كتابة في الذاكرة المؤقتة لمدة 5 دقائق، و8.00 دولارات لكل مليون كتابة في الذاكرة المؤقتة لمدة ساعة واحدة، وخصم 50% على الاتجاهين في Batch API. سعر القراءة من الذاكرة المؤقتة هو السعر الهادئ — فهو 5% من سعر الإدخال الأساسي، بينما تقف معظم نماذج Claude عند 10% وFable 5.1 عند 2.5%. ويُسعَّر الوضع السريع (Fast mode) بشكل منفصل عند 8.00 / 40.00 دولار، وتصفه Anthropic بأنه معاينة بحثية، لا كفئة عامة.
هذا هو القسم الذي تتوقف فيه بطاقة الأسعار عن كونها تفاصيل ثانوية وتصبح حسابًا يستطيع الموجّه إجراءه نيابةً عنك. Claude Opus 5.5 يُقدَّم بوصفه anthropic/claude-opus-5.5 على OrcaRouter بالسعر نفسه 4.00 دولار / 20.00 دولار، مع أسعار القائمة مُمرَّرة دون أي هامش ربح 0% — لذا في اللحظة التي تغيّر فيها Anthropic سعرًا، يصبح ذلك هو السعر هنا، في اليوم نفسه ودون أي تأخّر في إعادة التسعير يحتاج إلى نمذجة. والعناصر التي تحدد الفاتورة الفعلية هي تلك التي يحملها الكتالوج بجوار السعر: قراءة الذاكرة المؤقتة بسعر 0.20 دولار عند 5% من المدخلات الأساسية مقابل 2.5% لـ Fable 5.1، ونافذة سياق بسعة مليون رمز، وحدّ أقصى للمخرجات يبلغ 128 ألف رمز. ولأن معامل الجهد هو الموضع الذي تتحرك فيه تكلفة هذا النموذج فعليًا — تقلّب بمقدار 16 نقطة في المؤشر ونحو 119,000 رمز مخرجات لكل مهمة عند الحد الأقصى مقابل نحو 73,000 لـ Opus 5 — فإن الترحيل الذي يوفّر المال هو ذلك الذي يتيح لك ضبط الجهد لكل عبء عمل بدلًا من كل حساب، ووضع مسار Opus 5.5 خلف تجاوز فشل تلقائي بينما تقيس الإعداد الذي تريده حركة المرور لديك.
• Envelope — سياق بسعة 1M رمز، وبحدٍ أقصى للإخراج يبلغ 128K، وإخراج 300K على Batch API خلف output-300k-2026-03-24 ترويسة بيتا، مع قطع المعرفة في يونيو 2026، والإيقاف لن يحدث قبل 22 سبتمبر 2027. الإخراج أسرع بنسبة تزيد على 30% من Claude Opus 5.
• تغييرات كاسرة مقارنةً بـ Opus 5 — لم يعد بالإمكان تعطيل التفكير؛ الاستخدام القسري للأدوات (tool_choice يسمي أداة محددة) يعيد خطأً؛ كتل التفكير مرتبطة بالنموذج وبالمحادثة التي أنتجتها؛ أداة استخدام الحاسوب الأقدم computer_20251124 غير مقبولة على Claude API أو Google Cloud. تنطبق الثلاثة الأولى أيضًا على Fable 5.1. وهناك خامس صامت: النص بين استدعاءات الأدوات يصل الآن داخل كتل تفكير يكون نصها فارغًا عند إعداد العرض الافتراضي، لذا فإن واجهة مستخدم تبث ذلك النص كمؤشر تقدم تصمت من دون أن يظهر أي خطأ.
• توجيه الحماية، مجددًا، لأنه بند في المواصفات وليس حاشية — تذهب معظم طلبات الأمن السيبراني إلى Claude Opus 4.8، ويُحوَّل العمل في مجال الأحياء احتياطيًا إلى Claude Opus 5 ما لم يكن الحساب موثّقًا. في تلك التقييمات، قد لا تأتي الإجابة التي تتلقاها من Opus 5.5 على الإطلاق، لذا فإن الدرجات المنشورة على المعايير المرجعية المرتبطة بالأمن السيبراني والبيولوجيا ليست قياسات خالصة لهذا النموذج.
• ادعاءات الكفاءة، وكلها مُبلَّغ عنها من المورّد — انخفاض تكلفة التشغيل بنحو 40% على أعباء العمل النموذجية مقابل خفض بنسبة 20% في السعر المعلن؛ ومثال محلول لتحليل اندماج يستغرق 63 دقيقة على Opus 5.5 مقابل 93 دقيقة على Opus 5 بتكلفة أقل بنسبة 50%؛ وإفادات عملاء من Box (ثلث الرموز، وإجابات أقل إسهابًا بنحو 40%)، وKiro (نحو نصف الرموز، واستدعاءات أقل بنسبة 40%)، وFactory (رموز إخراج أقل بنسبة 20–25%)، وGitHub (من بين أقل ما قاسه من الرموز والخطوات). هذه متوسطات عبر أعباء العمل التي اختارها المورّد وشركاء إطلاقه. وهي إسنادات، وليست نتائج مدققة، وهي في تعارض ظاهر مع رقم التكلفة المستقل لكل مهمة أعلاه — وهو نفسه قياس عند أقصى جهد وليس عند الوضع الافتراضي. يمكن أن يكون كلا الأمرين صحيحًا؛ ولا يُعد أي منهما ادعاءً عامًا بشأن عبء العمل الخاص بك.

حالة الأدلة
Claude Opus 5.5 نموذج حقيقي مع تخفيض سعري حقيقي، ونطاق حقيقي يبلغ 1M رمز من السياق و128K من المخرجات، وتغيير حقيقي ذو تبعات في كيفية ضبط التفكير والجهد. ويأتي أيضًا مع جدول معايير يقيس Anthropic في معظمه، وجدول مستقل يقيس في معظمه نشرًا موجّهًا بدلًا من نقطة تحقق، ومشكلة وعي ذاتي موثّقة تقوّض كليهما. لم تُنشر أي مقارنة مباشرة وجهًا لوجه، مستقلة، متطابقة الجهد وإطار الاختبار، بين Claude Opus 5.5 ومنافس مسمّى. وإلى أن تُنشر واحدة، اقرأ كل مقارنة بين مورّدين في هذه الصفحة على حقيقتها: جدولان لمورّدين من شركتين وبإعدادين اثنين، رُتّبا جنبًا إلى جنب بواسطتنا — وأعد قياس إعداد الجهد الخاص بك قبل أن تعيد قياس النموذج.
مقارنات في هذه المقالة4
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
