
كلود أوبوس 5.5 مقابل GPT-6 أسترا: اختبار تذوق تجاوز المعايير القياسية
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
طلب أحدهم من Claude Opus 5.5 أن يصنع فيديو قصيرًا عن مختبر منافس يحل معادلات نافييه-ستوكس، ثم نشر النتيجة، وكتب بعد ذلك الجملة التي تجعل هذه المقارنة تستحق العناء: النموذج "لطيف جدًا"، ولديه "ذوق رفيع"، وهو أول Claude منذ Opus 4.7 يريدون تشغيله بكثافة فعلًا — لكنهم ما زالوا يحتفظون بـGPT-6 Astra وGPT-5.6 Sol كمحركاتهم الرئيسية، لأن عملهم يتطلب بحثًا مكثفًا. هذه ثلاث دعاوى في منشور واحد، وهي تشدّ في اتجاهات متعارضة. قد يكون النموذج أمتع ما يمكن العمل معه، ومع ذلك لا يكون النموذج الذي توجّه إليه حركة الإنتاج. السؤال المثير ليس أيّ النموذجين أفضل؛ بل أيّ من هذين الحكمين يصمد أمام الأرقام، وأيّهما يتبين أنه تصريح عن الذوق.
هذا المنشور تقرير أحد الممارسين، وليس تشغيلًا معياريًا — تعامل معه كإشارة إلى كيف يشعر النموذج في العمل الإبداعي والمفتوح، وليس كدليل على القدرة. كل ما هو رقمي أدناه موسوم بمن أنتجه.
ما الذي يمكن أن يخبرك به اختبار التذوق وما لا يمكن أن يخبرك به
المُخرَج هو ما يهم هنا. إن إنتاج فيديو عن نتيجة رياضية ليس مهمة برمجية ذات بوابة نجاح/رسوب. لا توجد خطوة تصريف، ولا مجموعة اختبارات، ولا إطار Terminal-Bench يقيس مدى جودة العمل. كان على النموذج أن يختار زاوية، ويقرر ما يعرضه، ويحافظ على التماسك، ثم يتوقف. عندما يقول ممارس إن النموذج يمتلك «ذوقًا رفيعًا»، فهذا ما يصفه: حكمٌ بشأن النطاق ومواضع التركيز يظهر في عمل تكون فيه المواصفات غامضة عمدًا.
تلك قدرة حقيقية، وهي القدرة التي تكون حزم المعايير أسوأ ما تكون في قياسها. وهي أيضاً السبب في أن الشخص نفسه قد يثني على نموذج ولا يتحول إليه. الذوق هو ما تريده عندما تستكشف. لكنه ليس ما تريده عندما يكون لديك 200,000 سطر من التعليمات البرمجية لتدقيقها وفاتورة عليك تبريرها.
يشير إطار الإطلاق الخاص بـ Anthropic نفسه إلى القدرة ذاتها، في نصّ لا في فيديو: يُروَّج لـ Claude Opus 5.5 بأنه يكتب بأسلوب أقل «Claudish» — أقل حشواً تمهيدياً، وأقل تحوّطاً، وأكثر استعداداً لوضع الفكرة أولاً. ويدعم التقييم المستقل لقابلية القراءة اتجاه هذا الادّعاء حتى حين يختلف على مقداره. كما يفيد المورّد بأن اختباراً داخلياً للتحقق من الوقائع نجح في 16 من أصل 18 محاولة، مقابل صفر من 18 لكل من Claude Fable 5.1 وClaude Opus 5؛ وهذا الرقم خاص بـ Anthropic، ولم يُعَد إنتاجه، وينبغي قراءته بوصفه ادّعاءً لا نتيجة.
لوحتا نتائج، وخلاف واحد يهم

على المقاييس المنشورة الخام، يتقدّم Claude Opus 5.5 على GPT-6 Astra في أغلب الأحيان. المشكلة أنّ المصدرين الأكثر اقتباسًا لا يتفقان على مقدار ذلك.
يضع جدول الإطلاق الخاص بـ Anthropic نموذج Claude Opus 5.5 عند 66.4% في Terminal-Bench 4.0، مع GPT-6 Astra عند 57.9% وClaude Fable 5.1 عند 55.8%. وهذا تفوق مُبلَّغ عنه من المورّد بمقدار 8.5 نقاط في البرمجة الوكيلية — وهو هامش من النوع الذي يحسم الجدل في عرض تسويقي. أما Artificial Analysis، فباستخدام أداة اختبار خاصة بها، قاست Claude Opus 5.5 عند 59.6% على المعيار نفسه: على قدم المساواة مع GPT-6 Astra عند جهد xhigh، ونحو 11 نقطة فوق Claude Opus 5. التفوق حقيقي في القراءتين. أما حجمه فلا.
المكان الذي يتبادل فيه النموذجان المواضع أكثر فائدة من المكان الذي لا يتبادلان فيه:
• Terminal-Bench 4.0 (البرمجة الوكيلية) — Claude Opus 5.5 بنسبة 66.4٪ وفقًا لجدول Anthropic نفسه، و59.6٪ وفقًا لـ Artificial Analysis؛ وGPT-6 Astra بنسبة 57.9٪.
• اختبار Humanity's Last Exam، مع الأدوات — Claude Opus 5.5: 67.7% وفقًا لما أعلنته الجهة الموردة، و61.4% بقياس مستقل؛ GPT-6 Astra: 57.2%.
• GDPval-AA v2.1 (عمل معرفي واقعي عبر 44 مهنة) — Claude Opus 5.5 بـ1,846 Elo؛ GPT-6 Astra بـ1,542 Elo. كلا الرقمين مصدرهما لوحة Artificial Analysis المستقلة، وليس المورّد.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64.6% مقابل Claude Opus 5.5 58.7%. هذا فوز واضح لـ Astra، وهو المعيار الوكيلي ذو الطابع العلمي.
• AutomationBench — GPT-6 Astra 41.4% مقابل Claude Opus 5.5 40.0%. الفارق ضيّق، لكن Astra تتفوّق مجددًا.
• FrontierCode v1.1 — Claude Opus 5.5 بنسبة 54.4% مقابل GPT-6 Astra بنسبة 53.3%. بفارق نقطة واحدة.
اقرأ تلك القائمة بالطريقة التي سيقرأها بها الممارس. أعباء العمل البحثية الثقيلة — تلك التي تحتوي على مكوّن علمي أو أدبي، وتلك التي تدير حلقة طويلة لاستخدام الأدوات وتحتاج إلى أن يحافظ النموذج على ثباته — هي بالضبط حيث يصمد GPT-6 Astra. لوحات العمل المعرفي والبرمجة حيث يتفوق Claude Opus 5.5 بفارق كبير هي التي ستشير إليها إذا كانت وظيفتك هي شحن البرمجيات. كلا الشخصين في هذه المحادثة يقرآن مقياسهما الخاص بشكل صحيح. إنهما فقط يقرآن مقياسين مختلفين.
إعداد الجهد يقوم بعمل أكثر مما تقوم به النموذج
هناك سبب ثانٍ أقل إطراءً لكون الهوامش الرئيسية ضعيفة. فمقارنات المورّدين لا تُجرى على الإعداد نفسه.
الأرقام المنشورة لـ Claude Opus 5.5 تأتي من إعداد جهد استدلال فائق الارتفاع (xhigh)، مقابل GPT-6 Astra عند high. وتضع التشغيلات المستقلة التي أجرتها Artificial Analysis كلا النموذجين عند xhigh، فتختفي فجوة البرمجة — ويتحول تقدم المورّد البالغ 8.5 نقاط إلى تعادل. هذا ليس اتهامًا بسوء سلوك؛ بل هو ما يحدث عندما يختار مورّد الإعداد الذي يُظهر نموذجه بأفضل صورة، ويختار مختبر مستقل الإعداد الذي يطابق المنافسة. قبل أن ترحّل حمل عمل بناءً على جدول قياسات أداء، تحقق من إعداد الجهد الذي شُغّل به، لأن الجواب غالبًا ما يكون "الخيار الأكثر إطراءً".
فاتورة الرموز تحكي القصة نفسها من زاوية أخرى. فمواد الإطلاق الخاصة بـ Anthropic تُظهر أن Claude Opus 5.5 يستهلك نحو 119,000 رمز لكل مسألة، يذهب منها نحو 84,000 إلى التفكير، بينما يحل GPT-6 Astra مسائل مماثلة بنحو 27,000 رمز. وتُحتسب رموز التفكير كرموز إخراج. والنموذج الذي يستهلك أربعة أضعاف الرموز بسعر يعادل خُمس سعر الإخراج يكاد يكون متعادلاً — وهذا قبل احتساب أن النموذج الأرخص غالباً ما يكون هو النموذج الذي كنت ستقبل تشغيله على إعداد جهد أعلى على أي حال.
ثمة تحفظ إضافي يخص جانب Claude Opus 5.5 تحديدًا: إذ يمكن لتوجيه الضمانات لدى Anthropic أن يُحيل بعض الطلبات المتاخمة للأمن السيبراني والبيولوجيا إلى مسار أكثر تقييدًا، ما يخفض الدرجات المنشورة في تلك التقييمات مقارنةً بما قد ينتجه النموذج الأساسي. وإذا كان عملك يلامس هذين المجالين، فستكون الفجوة بين المعيار وتجربتك حقيقية، وستكون في اتجاه أن يكون المعيار متفائلًا.
ما تكلفة مهمة حقيقية على كل منها

كلود أوبوس 5.5 هو النموذج الأرخص على قائمة الأسعار، والفرق ليس ضئيلًا:
• Claude Opus 5.5 — 4.00 دولار لكل مليون رمز إدخال، و20.00 دولار لكل مليون رمز إخراج، و0.20 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و5.00 دولار لكل مليون عملية كتابة في الذاكرة المؤقتة. سياق يبلغ مليون رمز، و128 ألف رمز كحد أقصى للإخراج.
• GPT-6 Astra — 10.00 دولارات لكل مليون إدخال، و50.00 دولارًا لكل مليون إخراج، و1.00 دولار لكل مليون إدخال مخزّن مؤقتًا، و12.50 دولارًا لكل مليون عملية كتابة إلى الذاكرة المؤقتة. عند تجاوز 272,000 رمز إدخال في طلب واحد، يُعاد تسعير الطلب بأكمله عند 20.00 دولارًا للإدخال و100.00 دولار للإخراج؛ وتكون فئة الدفعات 5.00/25.00 دولارًا.
إذن Claude Opus 5.5 أرخص بمقدار 2.5 مرة في الإدخال و2.5 مرة في الإخراج، مع إدخال مخزّن مؤقتًا أرخص بمقدار خمس مرات. إذا كانت مهامك متشابهة من حيث التوكنات، فهذا هو القرار كله ومسألة الذوق مجرد زخرفة.
تحذير استخدام الرموز المذكور أعلاه هو ما يمنعه من أن يكون بهذه البساطة، وإعادة تسعير السياق الطويل في GPT-6 Astra هي الفخ الآخر. إذا تجاوزت 272,000 رمز إدخال في طلب واحد، ينتقل الطلب بأكمله — وليس الفائض فقط — إلى سعر السياق الطويل. عبء عمل بحثي يحشر مجموعة كبيرة من النصوص في نداء واحد هو بالضبط الشكل الذي يثير ذلك. المعالجة على دفعات بنصف السعر هي المخرج المشروع، وهي على قائمة الانتظار الأبطأ.
الملخص الصادق هو أن صورة التكلفة تنقلب حسب ما تفعله. في مهمة يستخدم فيها كلا النموذجين توكينات متقاربة، يفوز Claude Opus 5.5 من حيث السعر بفارق واسع. أما في حلقة بحث وكيلية طويلة تتباعد فيها أعداد التوكينات على النحو الذي تُظهره مواد الإطلاق الخاصة بـ Anthropic، فإن الاثنين يتقاربان — وهو عنوان أقل إثارة بكثير من خفض التكلفة بنسبة 40%، وأقرب إلى ما كان الممارس يبلغ عنه.
لماذا لم يُبدِّل المستخدم كثير البحث
اجمع الأجزاء معًا، فتتوقف عبارة "لا يزال يفضّل Astra" عن كونها تناقضًا لعبارة "المذاق الرائع". إنها الملاحظة ذاتها من مقعد مختلف.
أعباء العمل التي ذكرها المستخدم طويلة، ومفتوحة النهاية، وتستخدم الأدوات، ومكلفة في كل تشغيل. وفي هذه المهام، يحتل GPT-6 Astra صدارة لوحات العلوم والأتمتة، ويستهلك جزءاً ضئيلاً من توكنات التفكير، و—وفق قياس مستقل—يكون متعادلاً في البرمجة عندما يعمل النموذجان بالقدر نفسه من الجهد. وتتركّز مزايا Claude Opus 5.5 في العمل الذي يمكنك أن ترى ناتجه وتحكم عليه: النثر، والخيارات التصميمية، وتحديد نطاق موجز غامض، وتقرير ما ينبغي أن يعرضه فعلاً فيديو عن Navier-Stokes. ذلك هو الذوق، والذوق هو بالضبط الجزء الذي لا يظهر على محور أي اختبار معياري.
إذا كنت تأمل في حكم بأن أحد النموذجين يفوز، فالأدلة لا تدعم ذلك. النسخة القابلة للدفاع عنها أضيق: Claude Opus 5.5 هو النموذج الأفضل للعمل حيث يكون الحكم هو عنق الزجاجة، وGPT-6 Astra هو النموذج الأفضل للعمل حيث يكون الجهد المتواصل في السياق الطويل هو عنق الزجاجة، وتتقلص الفجوة السعرية بينهما إلى ما يقارب العدم في النوع الثاني من العمل. هذا قرار توجيه، لا تحويل.
تشغيل كليهما دون ترحيل

هذا هو الجزء الذي يتوقف فيه النموذجان عن كونهما خيارًا إما هذا أو ذاك. GPT-6 Astra متاح على OrcaRouter اليوم بسعر قائمة OpenAI نفسه — 10.00 دولارات للإدخال، و50.00 دولارًا للإخراج، و1.00 دولار للقراءة من الذاكرة المؤقتة، و12.50 دولارًا للكتابة إلى الذاكرة المؤقتة — مع هامش ربح 0%، وسعر قائمة المزوّد يُمرَّر مباشرةً. وهذا يعني أن تغيير أسعار المورّد يصل إلى طرفنا في اليوم نفسه بدلًا من انتظار وقت مزامنة أحد الموزّعين.
يمكن الوصول إلى Claude Opus 5.5 عبر واجهة Anthropic البرمجية الخاصة بها وعدة منصات خارجية؛ نحن لا ندرجه كشيء نقدّمه، وينبغي أن تكون متشككًا في أي شخص يزعم خلاف ذلك قبل أن ينتشر النموذج. ما يمكنك فعله اليوم هو وضع كلا النموذجين خلف مفتاح واحد وشكل نقطة نهاية واحد، والتوجيه حسب عبء العمل بدلًا من التفضيل: أرسل الطلب المفتوح الذي يعتمد كثيرًا على الحكم إلى Claude Opus 5.5 وحلقة البحث الطويلة إلى GPT-6 Astra دون الحفاظ على عقدين أو تكاملين للعميل.
التحويل التلقائي عند الفشل هو ما يجعل اختبار ذلك آمنًا. النموذج الجديد ليس مسار إنتاج بعد، والتوجيه عبر نقطة نهاية واحدة يعني أن حادثًا لدى المزود أو حدًا لمعدل الطلبات يعيد توجيه الطلب بدلًا من إفشاله. إذا أردت معرفة ما إذا كانت فجوة الذوق حقيقية في عملك الخاص، فتلك هي الطريقة الرخيصة لاكتشاف ذلك — شغّله إلى جانب ما لديك بالفعل بدلًا من استبداله، ودع مجموعة الاختبارات الخاصة بك تقرر بدلًا من جداول الإطلاق.
السؤال الذي لا تستطيع المعايير الإجابة عنه
هناك أمران يستحقان المتابعة، ولا أيٌّ منهما يُعد نقطة قياس مرجعية أخرى.
الأول هو ما إذا كان عدم التماثل في إعداد الجهد يُحَلّ. في الوقت الحالي، يُنتج جدول مورّد عند xhigh مقابل منافس عند high تقدمًا بمقدار 8.5 نقاط، وهو ما تحوّله الاختبارات المستقلة عند إعدادات متطابقة إلى تعادل. وبينما تنشر المختبرات المستقلة عمليات تشغيل متطابقة الإعدادات على لوحات العلوم والأتمتة حيث يتصدر GPT-6 Astra حاليًا، يمكن أن تتحرك هذه الصورة في أي من الاتجاهين — وستتحرك بناءً على الأدلة وليس بناءً على تأطير أي شخص.
والثاني هو مسألة كفاءة التوكنات. إذا انخفضت النفقات الإضافية للتفكير في Claude Opus 5.5 في إصدار فرعي، فإن ميزته البالغة 2.5 ضعف في قائمة الأسعار لم يعد هناك ما يعوّضها، وينتصر المنطق السعري انتصاراً كاملاً. أما إذا لم يحدث ذلك، فالممارس الذي أبقى GPT-6 Astra محرّكه الرئيسي ليس متخلفاً عن دورة الأخبار. لقد قرأ عبء عمله الخاص قراءة صحيحة، ولم يكن جدول الإطلاق ببساطة يقيسه.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
