بطاقة رئيسية مُولَّدة لـ GPT-6.1 Sol مقابل Claude Opus 5.5 بعنوان "فجوة حقيقية، موزَّعة بشكل غير متكافئ"، مع بطاقتَي معلومات تقرأان "GPT-6.1 Sol: مؤشر الذكاء 51.8، 0.72 دولار لكل مهمة مؤشر، استدعاء السياق الطويل 83.0%" و"Claude Opus 5.5: مؤشر الذكاء 57.6، 5.98 دولار لكل مهمة مؤشر، استدعاء السياق الطويل 84.7%"، وتذييل يقرأ "الأرقام وفق Artificial Analysis، Intelligence Index v4.3.2، وكلا النموذجين مُدرَجان عند إعداد أقصى جهد لهما."، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

GPT-6.1 Sol مقابل Claude Opus 5.5: فجوة حقيقية، موزّعة بشكل غير متساوٍ

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إن فجوة الـ5.8 نقاط بين Claude Opus 5.5 وGPT-6.1 Sol على مؤشر الذكاء في Artificial Analysis هي الأكبر بين أي ثنائي في هذه المجموعة، وهي خلافًا لمعظمها لن تُغلق بتغيير إعداد. يسجّل Claude Opus 5.5، الذي صدر في 22 سبتمبر 2026 وبتسعير يبلغ 4.00 دولارات لكل مليون رمز إدخال و20.00 دولارًا لكل مليون رمز إخراج، 57.6 نقطة. ويسجّل GPT-6.1 Sol، الذي صدر في 29 سبتمبر 2026 بسعر 2.00 و10.00 دولارات، 51.8 نقطة. Claude Opus 5.5 هو النموذج الأعلى تسجيلًا بفارق أكبر من الفارق الذي يفصل معظم النماذج الرائدة بعضها عن بعض، لكنه يكلّف 8.3 أضعاف لكل مهمة للوصول إلى ذلك — 5.98 دولارات مقابل 0.72 دولار. حتى الآن، النموذج الأغلى هو الذي يفوز ببساطة، وهذه أقل نسخ هذه المقارنة إثارة للاهتمام. وما يجعلها تستحق القراءة هو أن النقاط الـ5.8 ليست موزّعة بالتساوي على المجموعة: فعلى المحور الوحيد الذي يحسم معظم العمل على المستندات الطويلة والجلسات الطويلة، لا يفصل بين النموذجين سوى أقل من نقطتين.

كلاهما من الطرازات الرائدة في الشريحة نفسها من السوق: نوافذ سياق من فئة المليون، وسقوف إخراج 128 ألفًا، وإدخال نصي وصوري وملفات، وتفكير موسّع لدى أحدهما، وسلّم جهد من خمسة مستويات لدى الآخر. يخلف Claude Opus 5.5 الطراز Claude Opus 5، وهو موجّه نحو الاستدلال المتطلّب والبرمجة والأعمال الوكيلية طويلة الأفق؛ أما GPT-6.1 Sol فيقع في مرتبة أدنى من GPT-6 Astra، وهو موجّه نحو البرمجة الوكيلية واستخدام الحاسوب والأعمال المهنية كثيفة المستندات. وكلاهما يستهدفان المهام نفسها. لكن القياسات تقول إنهما ليسا بنفس الجودة في جميعها.

أين تكمن نقاط 5.8 فعليًا

المؤشر المركّب يخفي مكوناته. استخرج التقييمات الفردية، فتتوقف الفجوة عن أن تبدو كفجوة وتبدأ تبدو كملف تعريف.

• اختبار Humanity's Last Exam — Claude Opus 5.5 بنسبة 61.4% مقابل GPT-6.1 Sol بنسبة 52.9%، بفارق 8.5 نقاط في الاستدلال المجرد

• SciCode — Claude Opus 5.5 بنسبة 66.9% مقابل GPT-6.1 Sol بنسبة 54.2%، بفارق 12.7 نقطة في شيفرة بمستوى بحثي

• الاستدعاء من السياق الطويل — Claude Opus 5.5 بنسبة 84.7% مقابل GPT-6.1 Sol بنسبة 83.0%، بفارق 1.7 نقطة في استرجاع الحقائق من مدخلات طويلة

• Terminal-Bench 4.0 — Claude Opus 5.5 بنسبة 59.6% مقابل رقم Sol غير المنشور عند المراجعة نفسها

• نافذة السياق — GPT-6.1 Sol 1,050,000 توكن مقابل Claude Opus 5.5 1,000,000 توكن، مع سقف إخراج يبلغ 128,000 توكن لكليهما

• التكلفة لكل مهمة فهرسة — Claude Opus 5.5 بسعر $5.98 مقابل GPT-6.1 Sol بسعر $0.72

التوزيع هو الذي يروي القصة. حيث تكون المهمة استدلالًا في المجرّد — سؤال امتحان صعب، أو مسألة برمجة بمستوى بحثي لا توجد لها إجابة جاهزة لنسخها — فإن Claude Opus 5.5 متقدم بشكل حاسم، وفجوة 12.7 نقطة في SciCode ليست ضجيجًا. وحيث تكون المهمة العثور على المقطع الصحيح في مدخل طويل جدًا واستخدامه، فإن النموذجين متعادلان فعليًا، ويحافظ GPT-6.1 Sol على ذلك الموقع بسعة تزيد بمقدار 50,000 توكن. وتشكل حصة كبيرة من العمل الإنتاجي لنماذج اللغة الكبيرة النوع الثاني: الإجابة المعززة بالاسترجاع، ومراجعة العقود والملفات، وتحليل السجلات والنصوص، ومراجعة الشيفرة على مستودع كبير. ويُقاس ذلك العمل بالنقطة الثالثة، لا بالنقطتين الأولى والثانية، وفي تلك النقطة تمنح النسخة المميزة 1.7 نقطة.

قراءة صفوف الفهرس بصدق

ينبغي أن يَرِد تحذيران إلى جانب تلك الأرقام لا في أسفل الصفحة.

تختلف الإعدادات. يُدرِج Artificial Analysis نموذج Claude Opus 5.5 في مخططاته ضمن إعداد "Max, Default Fallback"، ونموذج GPT-6.1 Sol عند أقصى جهد. كلاهما أقوى الإعدادات التي يُنشر بها كل نموذج، ما يجعل المقارنة عادلة، لكنها مقارنة بين سقفين وليس بين إعدادين افتراضيين مطروحين. قد تختلف الإعدادات الافتراضية الخاصة بـ Claude Opus 5.5 في واجهة API مستضافة عن التشغيل المدرج في المخطط، كما أن مستوى الجهد الافتراضي لـ GPT-6.1 Sol هو متوسط.

صفّ Terminal-Bench فارغ عمدًا من أحد الجانبين. نسبة 59.6% الخاصة بـ Claude Opus 5.5 مصدرها مراجعة Artificial Analysis التي نُشرت فيها؛ أما الرقم المكافئ لـ GPT-6.1 Sol فغير متاح عند مراجعة مطابقة. إن اقتباس رقم من تشغيل مختلف لنفس المعيار سيُعدّ مقارنة زائفة، والخيار الأمين هو ترك الخانة فارغة بدل ملئها بشيء صحيح تقريبًا.

يأتي الإسهاب هنا في الاتجاه نفسه الذي جاء به في مواجهة الأشقاء الأرخص: يُصدر Claude Opus 5.5 عدد 260M من رموز الإخراج على مجموعة index مقابل 67M لدى GPT-6.1 Sol، أي فارق يبلغ 3.9× بسعر مضاعف بالفعل. ومن هنا تأتي نسبة 8.3× لكل مهمة بينما تُظهر بطاقة الأسعار 2× على الإدخال و2× على الإخراج. العلاوة ليست 8.3× لأن النموذج يكلّف 8.3× — بل هي 8.3× لأنه يكلّف 2× ويستغرق في التفكير وقتًا أطول بمقدار 3.9×.

مبرر دفع ثمنه

إذا كان عملك يشبه النقطتين الأوليين، فإن الحساب بسيط ويرجّح كفة Claude Opus 5.5. فجوة مقدارها 12.7 نقطة في شيفرة علمية بمستوى بحثي، أو 8.5 نقاط في استدلال مجرّد صعب، هي الفرق بين وكيل يُغلق تذكرة دون إشراف ووكيل يحتاج إلى إنسان في كل خطوة ثالثة. البرمجة الوكيلية على قاعدة شيفرة كبيرة هي عبء العمل الذي يسمّيه كلا المورّدَين أولًا، وهو عبء العمل الذي يكون فيه الفارق أوسع. إن دفع $5.98 بدلًا من $0.72 لكل مهمة لتجنّب تشغيل فاشل يكلّف مهندسًا عشرين دقيقة ليس قرارًا متقاربًا.

هناك حجة ثانية لا تتعلق بالدرجات على الإطلاق. عمر Claude Opus 5.5 خمسة عشر يومًا، وقد ولّد كمًّا من التقييمات والمراجعات وخبرات النشر من أطراف ثالثة لا يملكها نموذج عمره ثمانية أيام. وبالنسبة لمسار الإنتاج، فإن نضج المعرفة المحيطة له قيمة لا يسعّرها المؤشر.

الحجة ضد، والرقم الذي يحسم الأمر

الحجة المضادة هي صف السياق الطويل. إذا كان الشكل السائد لحركة استخدامك هو "مدخل كبير، إجابة قصيرة" — وهذا صحيح بالنسبة لعدد كبير جدًا من الفرق — فالمحور الذي تُفرض عليك تكلفته ليس المحور الذي تستهلكه. في استرجاع السياق الطويل، يفصل بين النموذجين 1.7 نقطة عند نسبة سعرية 8.3×، والنموذج الأرخص يحمل النافذة الأكبر. تلك هي الحالة التي تكون فيها العلاوة حقيقية، ومقيسة، وتُنفق على قدرة لا يستخدمها عبء العمل قط.

الرقم الحاسم، إذن، ليس هو المؤشر. بل هو نسبة مهامك التي تشبه SciCode بدلًا من أن تشبه الاسترجاع. الفرق التي يمكنها الإجابة عن هذا السؤال من سجلاتها الخاصة ينبغي أن تجيب عنه من سجلاتها الخاصة؛ فمجموعة الاختبارات المعيارية ليست سوى وكيل عن مزيج من المهام، والمزيج هو المتغير.

كلاهما على مفتاح واحد، وهو ما يجعل السؤال قابلاً للإجابة

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 متاح على OrcaRouter بسعره الخاص $4.00 / $20.00، مع قراءات الذاكرة المؤقتة بسعر $0.20. GPT-6.1 Sol متاح على OrcaRouter بسعر $2.00 / $10.00، ويرتفع إلى $4.00 / $15.00 فوق 272,000 توكن إدخال، مع قراءات الذاكرة المؤقتة بسعر $0.10. كلاهما بسعر قائمة المزوّد، دون أي إضافة فوق ذلك، على مفتاح واحد وفاتورة واحدة.

هذا يهم أكثر من المعتاد في هذا الاقتران، لأن النموذجين ليسا بديلين — بل قرار توجيه. أرسل الأعمال ذات المستندات الطويلة والحجم الكبير إلى GPT-6.1 Sol، وأبقِ أعمال الاستدلال الصعب وتعديل الكود على Claude Opus 5.5، ويوجد كلاهما خلف نفس نقطة النهاية بنفس بيانات الاعتماد. إذا تدهور مسار، ينقل التجاوز التلقائي للفشل الاستدعاء بدلًا من إفشاله، ولأن التوجيه تصريحي يمكن التعبير عنه لكل فئة مهام بدلًا من كل تطبيق. اختبار هذا التقسيم تغيير في الإعدادات، وليس ترحيلًا.

آخر ما يستحق قوله يتعلق بالعمر الافتراضي لهذه المقارنة. كلا النموذجين لا يتجاوز عمره أيامًا أو أسابيع. لدى GPT-6.1 Sol إعداد مستقل واحد منشور؛ ولدى Claude Opus 5.5 واحد. تشغيل واحد لكل نموذج ليس إلا لقطة، ونمط الفشل المثير للاهتمام ليس أن أحد هذه الأرقام خاطئ — بل أن إعدادًا بمستوى جهد متوسط، أو مقيّمًا ثانيًا، يعيد رسم الصورة. حتى ذلك الحين، القراءة القابلة للدفاع عنها هي التي تمنحها المكوّنات: فجوة حاسمة في الاستدلال الصعب والكود البحثي، وفجوة صغيرة في العمل ذي السياق الطويل، وفاتورة تبلغ 8.3× يجب تبريرها بالجزء من عبء عملك الذي يشبه الجزء الأول.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا