بطاقة عنوان لـ Claude Sonnet 5.5 بعنوان «السعر نفسه، عمل أقل»، مع عنوان فرعي «$2 / $10 لكل مليون توكن، دون تغيير عن Sonnet 5» وثلاث بطاقات إحصائية تقرأ 56 (AA Intelligence Index)، و#3 / 216 (الترتيب في ذلك المؤشر)، و$7.60 (التكلفة لكل مهمة عند أقصى جهد).
Guides & Insights

Claude Sonnet 5.5: ادعاء خفض التكلفة بنسبة 30%، والتغييرات الستة التي تكسر كود Sonnet 5

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Claude Sonnet 5.5 طُرح في 28 سبتمبر 2026 بالأسعار نفسها تماماً التي كانت لـClaude Sonnet 5 — دولاران لكل مليون توكن إدخال، و10 دولارات لكل مليون توكن إخراج، و0.20 دولار لكل مليون قراءة مخزّنة مؤقتاً — بينما يبدأ إعلان Anthropic بعبارة "أسرع بنسبة 30%+ ويكلف أقل بنسبة تصل إلى 30% لمعظم الأعمال". العبارتان صحيحتان، والمسافة بينهما هي القصة بأكملها. الوفورات ليست في بطاقة الأسعار، لأن بطاقة الأسعار لم تتحرك. إنها تأتي من تشغيل النموذج بإعداد جهد أقل مما احتاجه سلفه، ما يعني أن رقم 30% ادعاء حول نقطة تشغيل عليك اختيارها، وليس سعراً ترثه. القياس المستقل يجعل الانقسام حاداً: على Artificial Analysis، Claude Sonnet 5.5 عند أقصى جهد يكلف 7.60 دولار لكل مهمة على مؤشر الذكاء مقابل 5.09 دولار لـClaude Sonnet 5 عند أقصى جهد — نحو 49% أكثر، وليس أقل بنسبة 30%. هذا ليس تناقضاً مع رقم Anthropic. إنه الطرف الآخر من المنحنى نفسه، وهو حيث ستهبط معظم عمليات الترحيل افتراضياً إذا لم يُعِد أحد تشغيل مسح الجهد الخاص به.

ادعاءان تحت رقم واحد

يقدّم منشور Anthropic الادعاء الخاص بكل مهمة في ثلاثة مواضع، وكل واحد منها يعتمد على الجهد. النسخة الأقوى: على Terminal-Bench 4.0، عند جهد متوسط — وهو الإعداد الافتراضي في تطبيقات Claude — فإن Sonnet 5.5 "يتجاوز بكثير أفضل نتيجة لـ Sonnet 5 بأقل من عُشر التكلفة لكل مهمة". وعلى AA-Briefcase v1.1، عند جهد متوسط، يتفوق على أفضل نتيجة لـ Sonnet 5 بنحو تُسع التكلفة. وعلى CursorBench 4.0، عند جهد منخفض، يتجاوز أفضل نتيجة لـ Sonnet 5 بأقل من العُشر.

اقرأ هذه كمجموعة، وستكون الآلية واضحة. إن حدّ Sonnet 5.5 الأدنى يقع فوق حدّ Sonnet 5 الأعلى في عدة تقييمات. أنت لا تحصل على نسبة 30% عبر دفع أقل لكل رمز؛ بل تحصل عليها عبر عدم حاجتك بعد الآن إلى الإعداد المكلف. تقول Anthropic الشيء نفسه في وثائق الترحيل، على بعد صفحة واحدة من المواد التسويقية: "أُعيدت معايرة مستويات الجهد. لم يعد مستوى الجهد ينتج القدر نفسه من التفكير كما كان على Claude Sonnet 5. أعد إجراء مسح الجهد الخاص بك بدلًا من ترحيل إعداد."

تلك الجملة هي السطر الأكثر أهمية من الناحية التشغيلية الذي نشرته Anthropic هذا الأسبوع، وهي الجملة التي لم تُدرَج في معظم التغطيات الإخبارية لإطلاق المنتج.

ما نشرته Anthropic — وفق ما أبلغ عنه المورّد، ولم يُعَد إنتاجه

كل ما في هذا القسم هو قياس Anthropic الخاص، من إعلان Sonnet 5.5 وبطاقة النظام. إنه ادعاء مورّد، وليس نتيجة مستقلة، ومسار الحواشي لا يقل أهمية عن الأرقام الرئيسية.

• Terminal-Bench 4.0 (البرمجة الوكيلية) — Sonnet 5.5 بنسبة 70.6% مقابل Sonnet 5 بنسبة 10.3%. هذه قفزة بمقدار سبعة أضعاف في البند الأكثر اقتباسًا وحده، وهو الرقم الذي تصدّرت به معظم التغطيات.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52.1% عند Xhigh و46.2% عند Max؛ Sonnet 5 42.4%؛ Claude Opus 5.5 54.4%؛ GPT-6 Sol 49.3%. لاحظ الانقلاب: Sonnet 5.5 يحصل على نتيجة أقل عند Max منه عند Xhigh.

• CursorBench 4.0 — 55.5% لـ Sonnet 5.5 مقابل 34.1% لـ Sonnet 5 و57.8% لـ Opus 5.5. لا تُعلن CursorBench 4.0 عن GPT-6 Sol علنًا.

• GDPval-AA v2.1 (العمل المعرفي) — Sonnet 5.5 1844 Elo، Sonnet 5 1449، Opus 5.5 1846، GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 على الطرازات الأربعة نفسها.

• Humanity's Last Exam (مع الأدوات) — 64.5% / 54.9% / 67.7%.

• OSWorld 2.1 (استخدام الحاسوب، درجة جزئية) — 80.1% / 57.0% / 81.8%.

• Chartography (التعرّف البصري على المخططات، بدون أدوات) — 61.6% / 15.6% / 64.4% / 53.6%.

يستحق ثلاثة من الحواشي أن تُنقل مع تلك الصفوف بدلًا من أن توضع تحتها. أولًا، إن رقم Opus 5.5 البالغ 66.4% في Terminal-Bench 4.0 مُسجَّل عند جهد Xhigh، وهو أعلى إعدادات Opus 5.5 تحقيقًا للنتائج. ثانيًا، تفسير انقلاب FrontierCode Max: عند Max، كان Sonnet 5.5 يشغّل غالبًا مهارة مراجعة الكود في Claude Code، التي توزّع المراجعة على العديد من الوكلاء الفرعيين، وفي حالتين أدى ذلك إلى انتهاء المهلة أو إلى تعديلات تتجاوز نطاق المهمة — وFrontierCode تعاقب التغييرات الخارجة عن النطاق حتى لو كانت جيدة. ثالثًا، وهو الأقل ارتياحًا للبائع، أن Artificial Analysis شغّلت GDPval-AA وAA-Briefcase على إصدار ما قبل الإطلاق من Sonnet 5.5 تقول Anthropic إنه كان به خطأ يُضعف الردود على طلبات المخرجات المنظمة. وتتوقع Anthropic أن يكون الأثر صغيرًا وأن يقلّل من قيمة Sonnet 5.5، وتقول إن الخطأ قد أُصلح. وتشير أيضًا إلى أن OpenAI أصلحت مؤخرًا خطأ في فهم الصور في GPT-6 Sol، لذا قد لا تعكس أرقام GPT-6 Sol في تلك الصفوف النموذج الحالي بعد.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

ما يقوله التشغيل المستقل عن النموذج نفسه

لدى Artificial Analysis قياس لـ Sonnet 5.5، وتذكر صفحته الإعداد الدقيق: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". وفي المراجعة نفسها للفهرس، 216 نموذجًا في الفئة:

• Claude Sonnet 5.5 — مؤشر الذكاء 56، في المرتبة #3 من 216. تبلغ التكلفة 7.60 دولار لكل مهمة في المؤشر. ولّد 410 ملايين رمز إخراج أثناء تشغيل المؤشر، مقابل وسيط قدره 88 مليونًا.

• Claude Sonnet 5 — المؤشر 38، في المرتبة 58 من 216، على صفحته الخاصة المعنونة "(الاستدلال التكيفي، أقصى جهد)". بتكلفة 5.09 دولار لكل مهمة. 370 مليون رمز إخراج.

• Claude Opus 5.5 — المؤشر 58، المرتبة الأولى من 216. 5.98 دولار لكل مهمة. 95.3 رمز إخراج في الثانية.

• GPT-6 Sol — المؤشر 48، المرتبة 20 من 216، بسعر 2$/10$ في القائمة. 1.06$ لكل مهمة، و89.8 رمز إخراج في الثانية.

فجوة Intelligence Index — 56 مقابل 38، ثماني عشرة نقطة — هي أقوى تأكيد مستقل في هذا المقال، وهي الرقم الذي ينبغي للقارئ أن يأخذه معه فعلاً. رقم التكلفة هو ما يحتاج إلى تحفظ، ويجدر ذكره بدقة: كلا النقطتين تهيئتان بأقصى جهد، وأقصى جهد على نموذج يفكر لمدة أطول هو موقف مكلف عمدًا. استهلك Sonnet 5.5 410 مليون توكن في تشغيل المؤشر حيث استهلك Sonnet 5 370 مليون، وكلاهما أعلى بكثير من الوسيط البالغ 88 مليون. النموذج الذي يفكر طويلاً عند الإعداد الأعلى يكلف أكثر عند الإعداد الأعلى. ما يدحضه الرقم ليس "أرخص لكل مهمة" بل أي قراءة له كخاصية للنموذج بدلاً من الإعداد.

لم تنشر Artificial Analysis بعد رقمًا لسرعة الإخراج الخاص بـ Sonnet 5.5 — فصفحتها تعرض N/A لعدد رموز الإخراج في الثانية، مقابل 78.7 لـ Sonnet 5 و95.3 لـ Opus 5.5. لذا فإن نصف «أسرع بنسبة 30%+» من ادعاء Anthropic هو مُبلَّغ عنه من البائع فقط في هذه المرحلة. تعامل معه كإرشادي إلى أن يقيسه طرف ثالث.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

من أين يأتي التوفير فعليًا، وكيفية الحصول عليه

إذا قبلت الآلية، فستكتب تعليمات الترحيل نفسها، وقد نشرتها Anthropic:

• ابدأ بالإعداد high افتراضيًا، لا بما ينصّ عليه إعداد Sonnet 5 لديك. توصية Anthropic هي high ما لم يكن عبء عملك وكيليًا أو حساسًا لزمن الاستجابة.

• البرمجة الوكيلية واستخدام الأدوات متعدد الخطوات — ابدأ من المستوى المتوسط للمهام المحددة جيدًا، وارتقِ إلى المستوى المرتفع للمهام الأصعب أو الأطول.

• المحادثة وغيرها من المهام الحساسة لزمن الاستجابة — ابدأ بالمتوسط أو المنخفض. هذا هو النطاق الذي توجد فيه ادعاءات "عُشر التكلفة".

هناك تفسير متماسك لسبب نجاح الإعداد الأقل، وهو ليس تسويقًا. أفاد مختبِرون أوائل لدى Anthropic أن Sonnet 5.5 يجمع استدعاءات الأدوات معًا أكثر مما فعل Sonnet 5، ما ينتج خطوات أقل لكل مهمة. وملاحظة CodeRabbit في الإعلان محددة بشكل غير معتاد بالنسبة لاقتباس إطلاق: إن "ميل Sonnet 5 إلى اللجوء إلى البحث على الويب أكثر من اللازم واستخدامه المرتفع للرموز قد اختفيا في هذا النموذج الجديد." كما احتفظ Sonnet 5.5 بالمُرمِّز نفسه الخاص بـ Sonnet 5، لذا فإن النص المتطابق يكلف الرموز نفسها — الانخفاض هو في عدد الجولات والاستدعاءات الزائدة، وليس في مفردات أرخص. وهذا يعني أيضًا أن أعداد الرموز في سجلاتك تبقى قابلة للمقارنة عبر الترقية، ما يجعل القياس قبل وبعد مباشرًا.

التغييرات الستة التي تكسر أو تغيّر كود Sonnet 5

هذا هو الجزء من الإصدار الذي يستهلك وقت الهندسة، وهنا يصبح دليل الترحيل أكثر قيمة من مخطط المقارنة المرجعية. خمسة من الستة تُرجع أخطاءً صلبة؛ أما السادس فيفشل بصمت.

• thinking: {"type": "disabled"} يعيد الآن خطأ 400. البديل هو thinking: {"type": "between_tools"}، الذي يوقف التفكير المسبق وهو أدنى إعداد للتفكير في هذا النموذج. يعمل عند الجهد المنخفض والمتوسط والمرتفع، ولا يحتاج إلى ترويسة beta، وهو متاح على كل منصة تقدّم Sonnet 5.5. عند الجهد xhigh أو max، فإن between_tools نفسه يعيد خطأ 400 — استخدم التفكير التكيفي (احذف الحقل، أو أرسل {"type": "adaptive"}) إذا كنت بحاجة إلى هذين المستويين. مع between_tools، لا يمكنك أيضًا تغيير الجهد أثناء المحادثة.

• استخدام الأداة القسري غير مدعوم. يؤدي تعيين tool_choice إلى {"type": "any"} أو {"type": "tool", "name": "..."} إلى إرجاع 400 مع الرسالة "tool_choice: type 'tool' and 'any' are not supported for this model." ينطبق الفحص نفسه على نقطة نهاية عدّ الرموز. البديل الموثّق للمدخل الصالح وفق المخطط هو tool_choice: {"type": "auto"} مع strict: true على الأداة، أو نقل المخطط إلى المخرجات المهيكلة.

• كتل التفكير مرتبطة بالنموذج والمحادثة. يقرأ Sonnet 5.5 كتل التفكير من Sonnet 5 وOpus 4.8 وHaiku 4.5 والإصدارات الأقدم — وليس من Opus 5 أو Opus 5.5 أو أي نموذج Fable أو Mythos. ولا يقرأ أي نموذج آخر كتل Sonnet 5.5. انقل محادثة من Sonnet 5 إلى 5.5 فيبقى الاستدلال؛ وإن نقلتها من Sonnet 5.5 إلى أي شيء آخر فستعمل الأدوار اللاحقة من دونه. وبشكل منفصل، تتحقق API الآن مما إذا كان موجّه النظام أو قائمة الأدوات أو رسالة سابقة قد تغيّرت منذ إنتاج كتلة تفكير، وفي الحسابات المُنشأة في 31 أغسطس 2026 أو بعده تُرجع 400 عندما يحدث ذلك. أبقِ المحادثات على وضع الإلحاق فقط، أو أرسل ترويسة بيتا thinking-binding-controls-2026-08-01 مع prefix_mismatch_behavior: "drop_block".

• يُرفض computer_20251124 على Claude API وGoogle Cloud. يتطلب استخدام الكمبيوتر هناك مجموعة أدوات computer_toolset_20260801. لا يزال Amazon Bedrock يقبل الأداة الأقدم — وهو تباين بين المنصات يستحق الإشارة إليه إذا كنت تشغّل الوكيل نفسه على كلتيهما.

• اختفت بعض اقترانات المستشارين. يقبل منفّذ Sonnet 5.5 كلاً من Mythos 5.1 وFable 5.1 وMythos 5 وFable 5 وOpus 5.5 وOpus 5 أو Sonnet 5.5 نفسه بصفته مستشارًا. أما المستشارون Opus 4.8 وOpus 4.7 وSonnet 5، الذين يعملون مع منفّذ Sonnet 5، فيُرجعون 400 مع منفّذ Sonnet 5.5. كل مستشار يقبله Sonnet 5.5 يُرجع المشورة مشفّرة، لذا لا يستطيع عميلك قراءة نص المشورة.

• النص بين استدعاءات الأدوات يصل الآن داخل كتل التفكير — وعند العرض الافتراضي: "omitted" يكون فارغًا. هذه هي الحالة الصامتة. الملاحظات التي تتجاوز جملة أو جملتين بين استدعاءات الأدوات تعود ككتل تفكير لتحديث التقدم بدلًا من أن تصل كنص. التطبيق الذي يبث ذلك السرد إلى مستخدميه يصمت بين استدعاءات الأدوات، من دون خطأ ولا شيء في السجلات. يتمثل الإصلاح إما في ضبط thinking.display بحيث يُعاد النص، أو في التبديل إلى between_tools، وفي هذه الحالة يعود النص كنص عادي.

أمران إضافيان تلمسهما عملية الترحيل، وليس أيٌّ منهما خطأً. مراقبة حالات الرفض: يعيد Sonnet 5.5 قيمة stop_reason: "refusal" مع كائن stop_details يسمّي واحدًا من خمسة مجالات سياسات — cyber وbio وfrontier_llm وreasoning_extraction وgeneral_harms — كما أن الاحتياط من جانب خادم Anthropic سيعيد محاولة الطلبات المرفوضة الخاصة بـ cyber وfrontier_llm على Sonnet 5، لكنه لن يفعل ذلك مع المجالات الثلاثة الأخرى. وقد تغيّر وضع الأمان فعليًا: فـ Sonnet 5.5 هو أول طراز Sonnet يُطلق مزوّدًا بضمانات واحتياطات للأمن السيبراني مثل فئة Opus، ما يعني أن طلبات الأمن السيبراني الأعلى خطورة تتراجع بشكل واضح إلى Sonnet 5، وهو أول Sonnet مزوّد بمصنّفات ضد استخراج الاستدلال. إذا كان عرض القيمة لمنتجك هو أداة أمان، فاختبر هذا الحد قبل أن تُطلق تبديل الطراز.

التسعير، وما الذي يقع حقًا على طريقنا اليوم

بطاقة الأسعار لم تتغير عن Sonnet 5، وشكلها المنشور الكامل قصير بما يكفي لذكره بوضوح:

• الإدخال — 2.00 دولار لكل مليون رمز. الإخراج — 10.00 دولار لكل مليون رمز. كلاهما مطابق لـ Sonnet 5، ومؤكَّد على صفحة نماذج Anthropic الخاصة بـ Sonnet 5.5.

• قراءة الذاكرة المؤقتة — 0.20 دولار لكل مليون، خصم 90% على الإدخال؛ كتابة الذاكرة المؤقتة لمدة 5 دقائق 2.50 دولار لكل مليون؛ كتابة الذاكرة المؤقتة لمدة ساعة واحدة 4.00 دولار لكل مليون. الحد الأدنى للموجّه القابل للتخزين المؤقت هو 512 توكنًا على Sonnet 5، انخفاضًا من 1,024 على Sonnet 5.

• الدفعات — خصم بنسبة 50% في كلا الاتجاهين، أي 1.00 دولار / 5.00 دولار لكل مليون. في واجهة Message Batches API، يمكن أن يصل الإخراج إلى 300 ألف رمز مع ترويسة بيتا ‎output-300k-2026-03-24.

• مقابل Opus 5.5 — إن Sonnet 5.5 يساوي نصفه تمامًا: $2/$10 مقابل $4/$20، مع كتابة الذاكرة المؤقتة بالنصف وقراءات الذاكرة المؤقتة متطابقة عند $0.20. هذا هو الترحيل الذي يعود بالنفع، وتقول Anthropic ذلك صراحةً: يتكامل النموذجان على أفضل وجه عندما يعمل Sonnet بجهد أقل، ويظل Opus "أقوى بوضوح في الأعمال المعقّدة والمفتوحة التي تتطلب حكمًا مستدامًا."

• السياق والمخرجات — سياق بحجم 1M رمز، و128K كأقصى مخرجات، والتفكير التكيفي مفعّل افتراضيًا، والجهد الافتراضي مرتفع، وتاريخ قطع المعرفة الموثوق يونيو 2026، وخيار عدم الاحتفاظ بالبيانات متاح، والإيقاف ليس قبل 28 سبتمبر 2027.

ملاحظة توافر واحدة نفضّل ذكرها بدلًا من الإشارة إليها ضمنًا: Claude Sonnet 5.5 ليس مدرجًا في كتالوج نماذجنا اعتبارًا من 29 سبتمبر 2026. أما سابقه anthropic/claude-sonnet-5وشقيقه الأكبر anthropic/claude-opus-5.5فكلاهما مدرج، وأسعاره من جانبنا هي أسعار المزوّد نفسه — 2.00 دولار للإدخال، و10.00 دولارات للإخراج، و0.20 دولار لقراءة الذاكرة المؤقتة، و2.50 دولار لكتابة الذاكرة المؤقتة في Sonnet 5، دون إضافة أي هامش، لذا فإن تغيّر سعر المورّد يسري هنا في اليوم نفسه الذي يحدث فيه بدلًا من دورة الفوترة التالية. هذه الخصيصة الأخيرة هي ما يجعل قراءة بطاقة الأسعار مفيدة لا تزيينية.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

ما يمكنك فعله بهذا اليوم

التسلسل الصادق لفريق يشغّل Claude Sonnet 5 بالفعل في بيئة الإنتاج هو ثلاث خطوات، وليست أيٌّ منها "تبديل سلسلة الطراز ومراقبة المخطط".

أولاً، أعد تشغيل مسح الجهد. إذا كنت قد أبقيْتَ على إعداد مرتفع أو أقصى قادمًا من Sonnet 5 لأن ذلك هو ما تطلبه معيار جودتك، فأنت الآن تدفع مقابل استدلال لم تعد بحاجة إلى شرائه. تقول أرقام التكلفة المستقلة لكل مهمة إن أعلى السلم أصبح أكثر تكلفة، لا أقل، وجميع ادعاءات التكلفة الخاصة بالمورّد تصف الجزء الأوسط منه. ثانيًا، أصلح مساري الخطأ قبل النشر — التفكير المعطَّل واستخدام الأدوات المفروض — لأن كليهما يفشل بصوت عالٍ وفورًا، وهذا هو الخبر السار. ثالثًا، راقب مسار السرد، لأنه يفشل بصمت.

إذا لم يكن النموذج بعد على المسار الذي تستخدمه، فإن الطريقة منخفضة المخاطر لتقييمه هي تشغيله جنبًا إلى جنب، لا بدلًا منه: أبقِ Sonnet 5 مثبتًا كخيار احتياطي على المفتاح نفسه، بحيث يؤدي أي رفض أو مهلة أو تقييم سيئ إلى إرسال الطلب إلى النموذج الذي تثق به بالفعل، والتحويل التلقائي عند الفشل يُغلق الحلقة دون تكامل ثانٍ. هذه هي الحجة الكاملة لتقييم نموذج غير مُثبت خلف نقطة نهاية واحدة بدلًا من وضعه أمام مستخدميك — وهي تنطبق مرتين هنا، لأن فئات الرفض لدى Sonnet 5.5 جديدة، ومعايرة الجهد لديه ليست صراحةً نفس معايرة سلفه. عندما تصبح مستعدًا لنقل الإعداد الافتراضي، تمتد القائمة على مفتاح واحد إلى أكثر من 200 نموذج، مما يجعل المقارنة تغييرًا في الإعدادات بدلًا من عقد ثانٍ.

ماذا تشاهد

ثلاثة أمور ستحسم التساؤلات المطروحة في هذا المقال، ولم يحدث أيٌّ منها بعد.

قياس مستقل لسرعة الإخراج هو الأول. تدّعي Anthropic أنها أسرع بنسبة 30%+ من Sonnet 5؛ لم تنشر Artificial Analysis رقمًا لـ Sonnet 5.5، والادعاء يؤدي دورًا حقيقيًا في حجة التكلفة، لأن النموذج الأسرع ينهي المهمة نفسها في وقت فعلي أقل وغالبًا برموز أقل. Claude Haiku 5.5 هو الثاني — تقول Anthropic إنه سيصل "في الأسابيع القادمة" وسيقع تحت Sonnet 5.5، مما يغيّر الحسابات لنطاق الدردشة عالي الحجم حيث يجعل الجهد المتوسط والمنخفض Sonnet 5.5 تنافسيًا بالفعل. والثالث هو جولة التصحيح: شغّلت Artificial Analysis اختباري GDPval-AA و AA-Briefcase على إصدار ما قبل الإطلاق به خطأ في الإخراج المهيكل، وتتوقع Anthropic أن تلك الدرجات تبخس النموذج حقه، ولم يُعد تشغيل أي من الرقمين. إذا ارتفعا، تضيق فجوة العمل المعرفي إلى Opus 5.5 أكثر وتصبح حجة "نصف السعر" أقوى.

حتى ذلك الحين، يظل الملخص القابل للدفاع عنه أضيق من الإعلان وأكثر فائدة من مخطط المعايير. إن Claude Sonnet 5.5 يمثل مكسبًا في الذكاء قدره ثمانية عشر نقطة مقارنةً بـ Sonnet 5 على المؤشر المستقل، وبالأسعار المعلنة نفسها، مع توفير حقيقي وقابل للقياس متاح لأي شخص ينزل في سلم الجهد — وعقوبة حقيقية وقابلة للقياس لأي شخص لا يفعل ذلك.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا