
كلود أوبوس 5.5 مقابل GPT-5.6 سول: جدولا إطلاقٍ لا يكادان يتقاطعان
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
ضع Claude Opus 5.5 وGPT-5.6 Sol جنبًا إلى جنب هذا الأسبوع، وأول ما تلاحظه ليس فائزًا. بل إن المزوّدَين نشرا جدولَي معايير لا يتقاسمان أي صف تقريبًا. مواد الإطلاق لـ Claude Opus 5.5، الصادرة في 22 سبتمبر 2026، تضعه متقدمًا بـ 29 نقطة على GPT-5.6 Sol في Terminal-Bench 4.0. أما مواد الإطلاق لـ Sol، المتاحة عمومًا منذ 9 يوليو 2026، فتصدّرت بدلًا من ذلك بـ Terminal-Bench 2.1، حيث سجّل Sol Ultra نسبة 91.9%، ومؤشر Artificial Analysis Coding Agent Index، حيث احتل المركز الأول بـ 80. كلا الجدولين حقيقيان. وكلاهما أجراه المزوّد الذي يفوز بهما. السؤال المفيد ليس أي نموذج أفضل في المجرّد — بل أي معيار، يُشغَّل تحت إطار مَن، يخبرك بشيء عن عبء عملك. هذا سؤال أصعب مما يريدك أيٌّ من منشوري الإطلاق أن تسأله، وهو السؤال الذي بُنيت حوله هذه المقارنة.
المodelان، جنبًا إلى جنب

• المورّد — Anthropic ضد OpenAI
• صدر — Claude Opus 5.5 في 22 سبتمبر 2026 مقابل GPT-5.6 Sol في 9 يوليو 2026
• السعر لكل مليون رمز — 4.00 دولار للإدخال / 20.00 دولار للإخراج مقابل 5.00 دولار للإدخال / 30.00 دولار للإخراج
• قراءة الذاكرة المؤقتة — 0.20 دولار لكل مليون على Opus 5.5؛ أما سعر الذاكرة المؤقتة لدى Sol فيُحدَّد حسب المنصة ولا يُنشَر كرقم واحد قابل للمقارنة
• نافذة السياق — مليون توكن على كليهما
• الحد الأقصى للإخراج — 128 ألف رمز على كليهما، مع 300 ألف على واجهة Batch API الخاصة بـ Anthropic خلف ترويسة تجريبية
• تاريخ قطع المعرفة — يونيو 2026 لـ Opus 5.5 مقابل 16 فبراير 2026 لـ Sol
• التحكم في الاستدلال — التفكير التكيفي مُفعّل دائمًا، الجهد الافتراضي متوسط، ويتدرج النطاق من منخفض إلى الأقصى مقابل إعداد أقصى جهد للاستدلال بالإضافة إلى وضع Ultra الذي ينسّق بين وكلاء فرعيين متوازيين
• التشكيلة — Opus 5.5 هو الأول من عائلة 5.5، مع الوعد بإصدار Sonnet 5.5 وHaiku 5.5 في الأسابيع القادمة، مقابل Sol كالرائد لعائلة ثلاثية المستويات إلى جانب Terra وLuna
صفان من تلك الصفوف يقومان بعمل أكثر من البقية. فجوة حد المعرفة تبلغ أربعة أشهر، وهذا مهم إذا كانت مطالباتك تتناول أي شيء حدث هذا الربيع. ويأتي Opus 5.5 الآن بسعر أقل من Sol في كل من سعر الإدخال والإخراج — وهو انقلاب عمّا كان عليه الحال قبل ثلاثة أشهر، حين كان Sol هو الطريق الأرخص للوصول إلى مخرجات من فئة الطليعة، وكان Claude Opus 5 عند $5/$25.
الصفوف الوحيدة التي يظهر فيها كلا النموذجين فعليًا
لا يوجد سوى جدول منشور واحد يحتوي على كلا النموذجين، وهو جدول Anthropic. كل رقم فيه مُبلَّغ عنه من المورّد، وقد أنتجته الشركة التي تبيع أحد النموذجين:
• Terminal-Bench 4.0 — Claude Opus 5.5 66.4% مقابل GPT-5.6 Sol 37.3%
• Terminal-Bench-Science 0.1 — 58.7% مقابل 22.4%
• FrontierCode v1.1 (الرئيسي) — 54.4% مقابل 47.5%
• CursorBench 4.0 — 57.8% مقابل 41.7%
• AutomationBench — 40.0% مقابل 28.8%
• GDPval-AA v2.1 — 1846 Elo مقابل 1588
هذا اكتساح نظيف، والهوامش في صفَّي Terminal-Bench كبيران بما يكفي ليستحقّا تدقيقًا لا قبولًا. حاشية أنثروبيك نفسها تقوم ببعض هذا العمل نيابةً عنك: فقد استُخدم في تشغيل Opus 5.5 على Terminal-Bench جهد xhigh بدلًا من الافتراضي، وعند الجهد المتوسط الافتراضي تضيق ميزة FrontierCode إلى 54.6% مقابل 47.5% — فجوة سبع نقاط بدلًا من الأرقام الرئيسية اللافتة. كما تُرفق أنثروبيك تحذيرًا عامًّا على الجدول بأكمله، قائلة إنه عند هذا المستوى من القدرات تصبح هوامش المعايير المرجعية "دليلًا أقل موثوقية على الفروق في العالم الواقعي"، وإن فجوتها الداخلية أمام Claude Fable 5.1 أضيق مما توحي به الدرجات. بائع يقلّل من قيمة جدوله الخاص هو الجملة الأكثر جدًّا بالثقة فيه.
لاحظ أيضًا ما هو غائب عن ذلك الجدول: أي معيار أداء يفوز فيه نموذج OpenAI. إن جدولًا من إعداد بائع لا يحتوي إلا على صفوف مؤيدة ليس دليلًا على اكتساح شامل؛ بل هو دليل على انتقاء الصفوف.
ما تقوله أرقام OpenAI نفسها
تروي مواد إطلاق Sol قصة مختلفة، على معايير قياس مختلفة، وفي أداة اختبار مختلفة. كما ورد عند الإطلاق في يوليو:
• Terminal-Bench 2.1 — 91.9% لـ Sol Ultra و88.8% لـ Sol القياسي، مقابل 88.0% لـ Claude Mythos 5 و84.3% لـ Claude Fable 5
• Artificial Analysis Coding Agent Index — 80، وُصف آنذاك بأنه الأفضل في المجال بفارق 2.8 نقطة عن Claude Fable 5
• Agents' Last Exam، سير العمل المهني طويل الأمد — 53.6، وهو ما أبلغت عنه OpenAI بفارق 13.1 نقطة متقدماً على Claude Fable 5
• BrowseComp — 92.2%؛ OSWorld 2.0 — 62.6%؛ SWE-Bench Pro — 64.6%
لا يتضمّن أيٌّ من تلك الصفوف Claude Opus 5.5، لأنه لم يكن موجودًا في يوليو. صُمِّم جدول Sol ليتفوّق على Fable 5 وMythos 5، وهو ما يفعله بالفعل. أما ما إذا كان يتفوّق على Opus 5.5، فببساطة لا تجيب عليه مواد أيٍّ من المورّدين — إذ جُمِع الجدولان بفارق شهرين وضدّ منافسين مختلفين.
يستحق صف SWE-Bench Pro ملاحظة خاصة، لأنه الموضع الوحيد الذي تُظهر فيه مواد إطلاق OpenAI أن نموذجها يخسر: 64.6% لـ Sol مقابل 80% لـ Claude Fable 5. ردّت OpenAI بالتشكيك في صلاحية المعيار، وتقدّرت أن نحو 30% من مهامه معطوبة. قد يكون ذلك صحيحًا بالفعل. وهو أيضًا تذكير مفيد بأن «هذا المعيار معيب» ادعاء يطلقه كلا المختبرين، ودائمًا بشأن المعيار الذي يخسرون فيه.
مشكلة الحزام التي لا يحلها جدول أحدٍ

سبب عدم توافق الجدولين ليس أن أحد البائعين يكذب. بل إن الاختبارات القياسية للبرمجة الوكيلية تقيس نموذجًا بالإضافة إلى سقالة، والسقالات تختلف. Terminal-Bench 4.0 وTerminal-Bench 2.1 هما مراجعتان مختلفتان للفكرة نفسها، يديرهما أشخاص مختلفون، بميزانيات أدوات مختلفة وقواعد إعادة محاولة مختلفة. أرقام Opus 5.5 من Anthropic أُنتجت في بيئة اختبار Anthropic؛ وأرقام Sol من OpenAI في أدوات على نمط Codex. انقل أيًا من النموذجين إلى بيئة اختبار الآخر وستتغير الدرجات.
البيانات المستقلة، حيثما وُجدت، تصف سباقًا أكثر تقاربًا مما يصفه أيٌّ من الجدولين. أحد معايير تقييم الوكلاء من طرف ثالث صدر في أغسطس 2026، وأُجري عبر نماذج متعددة على أعمال تطبيقية حقيقية، صنّف GPT-5.6 Sol بأنه أفضل مزيج من الدقة والتكلفة والسرعة — نحو 0.52 دولار وخمس دقائق لكل تشغيل — في حين كان Claude Opus 5، وليس 5.5، الأكثر دقة بنسبة 92% من عمليات التشغيل. ولوحة ترتيب منفصلة تغطي مهام البرمجة المؤسسية وضعت Claude Opus 5 في المرتبة الأولى بنسبة 96.4% مع GPT-5.6 Sol في المرتبة الثالثة بنسبة 86.5%، وهي أيضًا تقارن Sol بإصدار Opus السابق لا الجديد. ولا أيٌّ منهما مواجهة مباشرة مع Opus 5.5، ولا أيٌّ منهما يحسم شيئًا. لكنهما يثبتان أنه عندما يُجري المقارنة شخص آخر غير المورّد، تصبح الفروق ضئيلة.
الخلاصة العملية هي التوقف عن قراءة الجداول كتصنيف والبدء في قراءتها كقائمة فرضيات. إذا كان عملك في الأتمتة الطرفية طويلة المدى، فإن فجوة Anthropic في Terminal-Bench هي فرضية تستحق الاختبار على مهامك الخاصة. إذا كان بحثًا مهنيًا متعدد الخطوات، فإن نتيجة Sol في Agents' Last Exam هي نفس نوع الفرضية. لا ينتقل أي من الرقمين إلى عبء عملك دون تشغيل.
التكلفة لكل مهمة منجزة، وهي التكلفة الوحيدة التي تهم
في جدول الأسعار، أصبح Claude Opus 5.5 الآن أرخص في كلا الاتجاهين: 4.00 دولارات مقابل 5.00 دولارات على المدخلات، و20.00 دولارًا مقابل 30.00 دولارًا على المخرجات، وسعر لقراءة الذاكرة المؤقتة قدره 0.20 دولار، وهو أقل بنسبة 60% مما كان Claude Opus 5 يتقاضاه. وبالنسبة لوكيل يعيد إرسال مطالبة نظام طويلة في كل دور، فإن بند الذاكرة المؤقتة هذا هو التكلفة الغالبة، وهو السبب في أن جلسة طويلة الأمد يمكن أن تصبح أرخص بشكل ملموس دون أي تغيير في المطالبة.
لكن سعر التوكن الواحد لم يحدد قط فاتورة وكيل. استندت حجة OpenAI بشأن Sol عند الإطلاق إلى كفاءة التوكنات لا إلى السعر المعلن — إذ أعلنت تحسناً بنسبة 54% في كفاءة توكنات البرمجة، مع توكنات إخراج ووقت منقضٍ أقل من نصف ما لدى Claude Fable 5 وبتكلفة أقل بنحو الثلث. وتقدم Anthropic حجة معكوسة لصالح Opus 5.5: تكلفة تشغيل أقل بنحو 40% على أحمال العمل النموذجية من Claude Opus 5، على بطاقة أسعار انخفضت بنسبة 20% فقط، مع تصريحات عملاء من Box وKiro وFactory وGitHub تشير جميعها إلى انخفاضات كبيرة في التوكنات أو الخطوات. ويشير كلا الادعاءين في الاتجاه نفسه — النموذج الذي ينتهي في دورات أقل يفوز — ولا يخضع أي منهما لتدقيق مستقل.
حيثما توجد حسابات مستقلة للتكلفة لكل مهمة، فإنها تُفضّل حالياً Sol: تحليل نُشر في سبتمبر قدّر GPT-5.6 Sol بـ 1.56 دولار لكل مشكلة محلولة على SWE-bench Verified بنسبة نجاح 96.2%، مقابل Claude Opus 4.8 عند 88.6%. هذا قياس لـ Sol مقابل نموذج Anthropic أقدم، وليس مقابل Opus 5.5، لذا فهو نقطة انطلاق وليس حكماً نهائياً — لكنه تذكير بأن النموذج الذي يحل المشكلة من المحاولة الأولى أرخص من نموذج أرخص يحتاج إلى ثلاث جولات. القياس الوحيد الذي يحسم هذا لك هو مهمتك أنت، مُشغَّلة بالطريقتين، مع أعداد الرموز (tokens) أمامك.
تلك مسألة توجيه أكثر منها مسألة مشتريات، ويستحق الأمر الدقة بشأن أيّ جانب منها قابل للحل بالفعل. يتوفر GPT-5.6 Sol على OrcaRouter اليوم بسعر OpenAI المعلن نفسه دون أي هامش ربح — سعر المزوّد المعلن يُمرَّر مباشرة، لذا يصبح تغيير سعر المورّد نافذًا لدينا في اليوم نفسه بدلًا من بعد مزامنة. Claude Opus 5.5 ليس أحد مساراتنا بعد؛ وهو متاح عبر Anthropic API الخاصة به ومزودات السحابة الكبرى. وحالما يتوفر، يخدم المفتاح نفسه كلا الطرفين، وهذا ما يحوّل التجربة إلى قاعدة توجيه بدلًا من عقد ثانٍ وSDK ثانٍ: أرسل عبء العمل إلى أي نموذج ترجّحه أرقامك الخاصة، أبقِ التجاوز التلقائي للفشل موجّهًا إلى الآخر، ودع سطر routing-DSL يقرر لكل طلب بدلًا من كل ربع سنة. أي خفض سعر على أي من الجانبين هو تغيير في الإعدادات، وليس عملية ترحيل.

حيث يختلف الاثنان حقًا
استبعد المعايير المرجعية، وستبقى أربعة اختلافات، جميعها قابلة للتحقق:
• حد المعرفة. يونيو 2026 بالنسبة إلى Opus 5.5 مقابل 16 فبراير 2026 بالنسبة إلى Sol. أربعة أشهر فجوة حقيقية في أي شيء يتصل بمكتبات حديثة أو أحداث حديثة أو واجهات برمجة تطبيقات تغيّرت مؤخرًا، ولا يلتقطها أي اختبار معياري.
• توجيه الحمايات. يأتي Opus 5.5 مزوّدًا بحمايات من فئة Fable 5.1: يُعاد توجيه معظم طلبات الأمن السيبراني إلى Claude Opus 4.8، وتُحوَّل أعمال علم الأحياء إلى Claude Opus 5 ما لم يكن الحساب موثَّقًا. إذا كان منتجك يقع في أي من هذين المجالين، فإن جزءًا من حركة المرور لديك يجيب عنه نموذج أصغر. لا يحمل Sol أي توجيه موثّق مكافئ، غير أن OpenAI تشير إلى تقييمات السلامة الخاصة بها المتعلقة بالأمن السيبراني.
• التنسيق. توفّر Sol وضع Ultra ينسّق بين عدة وكلاء فرعيين متوازيين، أربعة افتراضيًا، وإعدادًا لأقصى جهد استدلال. لا يمتلك Opus 5.5 أيًّا منهما كميزة من ميزات المنصة؛ فرافِعته هي معامل الجهد، والتكوين متعدد النماذج شيء تبنيه أو توجّهه، لا شيء يسلّمك إياه المورّد.
• اقتصاديات العائلة. Sol هو أحد المستويات الثلاثة، مع Terra و Luna أدناه — وتم تخفيض سعر Luna بنسبة 80% و Terra بنسبة 20% في تحديث 30 يوليو. تم الإعلان عن النموذجين الشقيقين الأرخص من Anthropic، Sonnet 5.5 و Haiku 5.5، لكن لم يتم إطلاقهما بعد. إذا كان عبء العمل لديك مختلطًا، فإن OpenAI تقدم حاليًا المستويات الأرخص اليوم.
الاختيار بينهما
اختر Claude Opus 5.5 إذا كان عملك يتضمن برمجة وكيلية طويلة الأمد أو عملاً معرفيًا، وإذا كان سعر الرمز مهمًا، وإذا كانت مطالباتك تمس أي شيء من الأشهر الأربعة الأخيرة، أو إذا كان سياق بمليون رمز بتكلفة 0.20 دولار لكل مليون رمز مخزّن مؤقتًا هو ما يجعل معماريتك ميسورة التكلفة. ابدأ عند متوسط الجهد، وليس الإعداد المرتفع الموروث، وقِس ما إذا كان منخفض يصمد.
اختر GPT-5.6 Sol إذا كنت تريد وضع تنسيق مُجمَّعًا من المورّد، أو إذا كنت بحاجة إلى فئة أرخص تحت الطراز الرائد اليوم بدلًا من بعد بضعة أسابيع، أو إذا كان عبء العمل لديك من النوع الذي تغطيه أدلة إطلاق Sol نفسها على أفضل وجه — سير العمل المهنية طويلة المدى واستخدام الحاسوب، حيث أبلغت عن أقوى نتائجها.
إذا كنت تستخدم بالفعل Claude Opus 5، فاعلم أن Opus 5.5 ليس بديلاً مباشراً يمكن استبداله دون تعديلات: لم يعد بالإمكان تعطيل وضع التفكير، ويؤدي الاستخدام القسري للأدوات إلى خطأ، وترتبط كتل التفكير بالطراز والمحادثة، كما أن أداة استخدام الحاسوب الأقدم computer_20251124 غير مقبولة في Claude API أو Google Cloud. وينطبق أول هذه الأمور الثلاثة أيضاً على Claude Fable 5.1. أما الانتقال إلى Sol فهو تكامل مختلف تماماً.
ما الذي سيحسم هذه المقارنة فعليًا هو تشغيل مستقل واحد لكلا النموذجين عند جهد مطابق، وفي بيئة اختبار مطابقة، وعلى مجموعة المهام نفسها. وحتى هذا الأسبوع، لم ينشر أحد واحدًا. وإلى أن يفعل أحد ذلك، فإن الموقف الصادق هو ما تدعمه الأدلة: جدول Anthropic يفضّل Opus 5.5 وقد أنتجته Anthropic؛ وجدول OpenAI يفضّل Sol وقد أنتجته OpenAI؛ والنتائج المستقلة الموجودة تقارن Sol بـ Opus السابق وتصف سباقًا أقرب بكثير؛ والصفان اللذان سيحدّدان فاتورتك — الرموز لكل مهمة منجزة وحجم قراءة الذاكرة المؤقتة — هما الصفان اللذان لا ينشرهما أي من المورّدين.
مقارنات في هذه المقالة4
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
