
Claude Sonnet 5.5 مقابل Claude Opus 5.5: تتقارب المقاييس المرجعية، أما الفاتورة فلا.
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 984 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 195 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
Claude Sonnet 5.5 reached general availability on September 28, 2026 at $2.00 per million input tokens and $10.00 per million output tokens. Claude Opus 5.5, Anthropic's flagship, shipped six days earlier on September 22 at $4.00 and $20.00 — exactly double on both lines. The obvious reading is that Opus 5.5 is the ceiling and Sonnet 5.5 is the compromise you make when the budget is real. Anthropic's own launch table does not support that reading. On the numbers the company published, Claude Sonnet 5.5 posts 1844 against Opus 5.5's 1846 on GDPval-AA v2.1, 1811 against 1822 on AA-Briefcase v1.1, and 70.6% against 66.4% on Terminal-Bench 4.0 — it wins the one benchmark that measures work actually done inside a terminal. Two lines below those figures, Anthropic's own caption states that Opus 5.5 "remains clearly stronger at complex, open-ended work." Both statements are true, and figuring out how to hold them at once is most of what this comparison is for.
ما يقوله جدول الإطلاق، وما يمتنع عن رفضه.
النمط في مجموعة معايير Anthropic هو نموذج قلّص معظم الفجوة لا نموذج انتزع الصدارة. GDPval-AA v2.1، وهي مجموعة مهام ذات ترجيح اقتصادي، تعادل بفارق نقطتين. AA-Briefcase v1.1، وهو تقييم للمستندات والمخرجات القابلة للتسليم، تعادل بفارق إحدى عشرة نقطة. CursorBench 4.0 يسير في الاتجاه المعاكس: 55.5% لـ Sonnet 5.5 مقابل 57.8% لـ Opus 5.5. OSWorld 2.1 يبلغ 80.1% مقابل 81.8%، وHumanity's Last Exam عند 64.5% مع الأدوات مقابل 67.7%. فقط Terminal-Bench 4.0 يكسر النمط، ويكسره بقوة — 70.6% مقابل 66.4%، أي ميزة بأربع نقاط لـ Sonnet في العمل الوكيلي على سطر الأوامر.
اقرأ تسميات الصفوف بدلاً من الأرقام، وسيظهر شيء آخر. العديد من تلك الإدخالات الخاصة بـ Opus 5.5 تحمل تعليقًا توضيحيًا للجهد — 66.4% عند Xhigh — وتذكر حاشية أن تكوين Max يسجل أقل من Xhigh على FrontierCode، وليس أعلى. الجهد الأعلى ليس رتيبًا. الفريق المهتم بالميزانية الذي يفترض أن "أقصى جهد" هو ترقية مجانية يشتري رموزًا مقابل إجابة أسوأ في واحد على الأقل من اختبارات Anthropic الخاصة. وعلى FrontierCode 1.1، تضع الحاشية نفسها Sonnet 5.5 عند 46.2% في تكوين Max مقابل 54.4% لـ Opus 5.5، وهو أوضح رقم واحد يوضح أين لا يزال الرائد يتفوق: عمل برمجي طويل الأمد تحت تعريف مهمة يكافئ المثابرة.
هناك ملاحظة تحفظية أخرى تستحق التصريح بها بوضوح بدلًا من دفنها. تشير Anthropic إلى أن تشغيلات GDPval-AA وAA-Briefcase التي تنشرها نُفذت على إصدار ما قبل الإطلاق كان يحمل خطأ في المخرجات المهيكلة. وهذا يؤثر على كلا النموذجين في الجدول نفسه، لذا لا تُبطل المقارنة، لكنه يعني أن الأرقام المطلقة ينبغي التعامل معها كلقطة لحظية بدلًا من نتيجة مستقرة. جداول الاختبارات المعيارية الخاصة بالمورّدين هي مواد تسويقية مصحوبة بملحق منهجي، وهذا الجدول يأتي بملحقه مرفقًا.
حيث يستقر القياس المستقل
تُقيّم Artificial Analysis كلا النموذجين ضمن إطار اختبار واحد، وبالتهيئة نفسها التي تسمّيها "Adaptive Reasoning, Max Effort, Default Fallback"، على Intelligence Index v4.3. يستقر Claude Opus 5.5 عند 58. ويستقر Claude Sonnet 5.5 عند 56. هذا فارق نقطتين على مقياس يضع فيه المُقيّم نفسه Opus 5 عند 51، وSonnet 5 عند 38، وDeepSeek V4 Pro عند 36، وGemini 3.1 Pro Preview عند 30. ووصول Sonnet جديد أدنى بنقطتين من الطراز الرائد وأعلى بخمس نقاط من الجيل السابق من Opus هو الادعاء الجوهري في هذا الإصدار، وهو ادعاء طرف ثالث لا ادعاء مورّد.
ثم تقلب الصفحة نفسها منطق الجدوى الاقتصادية لذلك. يُفيد Artificial Analysis بأنّ تشغيل تقييم Sonnet 5.5 يكلّف 7.60 دولارات لكل مهمة مقابل 5.98 دولارات لـ Opus 5.5، رغم أنّ Sonnet 5.5 بسعر نصف ما يدفعه per token. والسبب ظاهر في الصفحة نفسها: فقد أنتج Sonnet 5.5 نحو 410 ملايين token عبر مجموعة الاختبارات القياسية، مقابل وسيط قدره 88 مليوناً للنماذج التي تتابعها — «مُسهب جداً»، بحسب وصف المُقيِّم. وأنتج Opus 5.5 نحو 260 مليوناً عبر المجموعة نفسها. وعند سعر 10 دولارات لكل مليون token إخراجية مقابل 20 دولاراً، فإنّ عامل الإسهاب البالغ نحو 1.6 لا يزال يُبقي Sonnet 5.5 يدفع نحو 27% أكثر لكل مهمة مكتملة.
هذا هو الجزء من المقارنة الذي لا تستطيع ورقة أسعار لكل رمز أن تُظهره لك، وهو السبب الذي يجعل الرقمين يتعايشان دون تناقض. لكل رمز، Sonnet 5.5 أرخص بمقدار النصف. لكل مهمة مكتملة، في مجموعة تقييم ذات مطالبات مفتوحة النهاية وبلا انضباط في طول المخرجات، قد يكون أكثر تكلفة. وأي من هذين يصف عبء عملك هو القرار الفعلي.
مستويات الجهد وحدود الإنتاج وشكل التكامل
بالنسبة للمشتري، فإن الخصائص المهمة ميكانيكيًا متطابقة تقريبًا بين هذين الطرازين.
• السياق — 1,000,000 رمز لكليهما، من المزوّد نفسه، لذا تنتقل افتراضات هندسة الأوامر دون تغيير
• الحد الأقصى للإخراج — 128,000 رمز على كليهما؛ التوليد بكميات كبيرة ليس عامل تمييز هنا
• الوسائط — إدخال النص والصورة والملفات في كليهما؛ ولا يقبل أي منهما الصوت أو الفيديو
• التحكم في الاستدلال — تفكير تكيّفي في كليهما، مع ضبط العمق عبر معامل الجهد بدلاً من ميزانية رموز التفكير. على Claude Platform تكون القيمة الافتراضية عالية؛ أما داخل تطبيقات Claude فهي متوسطة
• كتابة الذاكرة المؤقتة — 5.00 دولارات لكل مليون لـ Claude Opus 5.5 مقابل 2.50 دولار لـ Claude Sonnet 5.5، السطر الوحيد الذي يكون فيه النموذج الأرخص هو أيضًا الأرخص تغذيةً ببادئة مُعاد بناؤها
• قراءة الذاكرة المؤقتة — 0.20 دولار لكل مليون على كليهما، تعادل تام في البند الذي يهيمن على تشغيلات الوكلاء الطويلة
لأن الأسطح متطابقة، فإن الانتقال بينهما هو تغيير في سلسلة الطراز وإعادة قياس للجهد، وليس مشروع تكامل. هذا أمر غير معتاد عبر البائعين، وهو السبب في أن هذا الاقتران تحديدًا يستحق المقارنة أصلًا: المرشحان يختلفان في السعر والعمق، لا في واجهة API التي عليك كتابتها.
هناك فرق تشغيلي واحد يستحق سطرًا خاصًا به. توضح Anthropic أن Claude Sonnet 5.5 هو أول Sonnet يُطلق بضمانات سيبرانية وآليات احتياطية على قدم المساواة مع طرازاتها الأعلى مستوى، ما يعني أن طلبات الأمن السيبراني الأعلى مخاطرًا تُوجّه بشكل ظاهر إلى Sonnet السابق بدلًا من أن يجيب عنها النموذج الذي حددته بالاسم. وإذا لامس عبء عملك هذا المجال، فإن سلسلة تعريف النموذج ليست ضمانًا للنموذج الذي استجاب — على أي من المستويين. وتشير Anthropic أيضًا إلى أنه إذا شغّلت Sonnet مع تعطيل التفكير، فيجب عليك التبديل إلى سلوك between-tools، وهو تغيير في التعليمات البرمجية وليس مفتاح تهيئة. ولا يُعد أي منهما سببًا لتجنب النموذج؛ بل كلاهما سبب لمعرفة ذلك قبل الإطلاق.
على OrcaRouter، يمكن توجيه Claude Opus 5.5 اليوم باستخدام نفس بيانات الاعتماد المستخدمة مع كل نموذج آخر في الكتالوج، بسعر القائمة لدى المزوّد مع هامش ربح 0%، مع توفّر تجاوز الفشل التلقائي تحته. لا يُعدّ Claude Sonnet 5.5 بعد مسارًا على منصتنا — فالنموذج عمره يوم واحد، وإلى أن يُدرَج، فإن القول الصادق هو أنك ستصل إليه عبر واجهة Anthropic البرمجية الخاصة بها. ويمكن لأي شخص يشغّل حاليًا Opus 5.5 عبرنا أن يقدّر تكلفة التحويل في اليوم الذي يتوفر فيه دون تغيير أي شيء آخر في تكامله.
أيّ واحد يوضع وأين؟
التقسيم الذي ينتج عن الأرقام: Claude Sonnet 5.5 لعمل الوكلاء المرتبط بالطرفية، حيث يكون الأقوى من بين الاثنين في رقم Terminal-Bench 4.0 الخاص بـ Anthropic نفسها وبنصف السعر؛ Claude Sonnet 5.5 لأي شيء ذي طابع إنتاجي، لأن فرق التكلفة لا يضيق إلا عندما تفرض المهمة مخرجات طويلة؛ Claude Opus 5.5 لأعمال من فئة FrontierCode، وإعادة الهيكلة طويلة الأفق عبر قواعد شيفرة كبيرة، وأي عبء عمل يعكس فيه هامش 54.4% إلى 46.2% شكل مشكلتك الفعلية بدلًا من صف في لوحة المتصدرين.
إذا كانت مهامك مفتوحة النهاية ولا يمكنك التنبؤ بطول المخرجات، فاعتبر سعر الرمز الواحد رقمًا خاطئًا تمامًا. قِس الرموز لكل مهمة مكتملة على حركة الاستخدام الخاصة بك لمدة أسبوع قبل أن تحسم أمرك في أي من الاتجاهين؛ رقم Artificial Analysis البالغ 7.60 دولار مقابل 5.98 دولار تحذير من أن النموذج الرخيص قد يخسر في المقياس الذي تدفع مقابله فعليًا.
الحكم الصادق: لم يعد هذا مقايضة بين القدرة والتكلفة. إنه سؤال عمّا إذا كان عملك محدودًا. ففي المهام المحدودة، عالية الحجم، المدفوعة بالأدوات، يكون النموذج الأرخص هو الأفضل أيضًا وفق الأدلة المتاحة، والنموذج الرائد لا يستحق ضعف السعر. أما العمل المفتوح طويل الأمد، فإن جملة Anthropic نفسها — بأن Opus 5.5 لا يزال أقوى بوضوح — هي الجديرة بالتصديق، ولا يغيّر أي قدر من تقارب المعايير ذلك بعد.



