بطاقة عنوان رئيسية بعنوان 'Claude Opus 5.5 واختبار البطيخ'، بعنوان فرعي 'أكثر نسخة Claude قابلية للقراءة حتى الآن — ومع ذلك لا يزال يدفن المغزى'، مع ثلاث شارات تقرأ: Flesch-Kincaid 6.95، سهولة القراءة 68.4، و22 سبتمبر 2026، وشعار OrcaRouter في الزاوية اليمنى السفلى.
Guides & Insights

كلاود أوبس 5.5 واختبار البطيخ: أنثروبيك أصلحت الصياغة، لكن المغزى ما زال دفينًا

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

كانت إحدى العينات التي انتشرت أبعد من غيرها بعد أسبوع الإطلاق قصة قصيرة عن بطيخة. بضع مئات من الكلمات، لا معيار أداء مرفق، ولا رسم بياني — مجرد نموذج طُلب منه كتابة شيء صغير فأصاب في معظمه. هذه قطعة أثرية غريبة لتكون قرب مركز إصدار رائد، لكنها تشير إلى الشيء الذي اختار المزوّد أن يتصدّر به عندما أطلق Claude Opus 5.5 في 22 سبتمبر 2026: ليس نقطة أخرى على Terminal-Bench، بل نثر. طريقة طرح الشركة هي أن هذا النموذج يكتب بقدر أقل من «Claudish» — كلمتها للأسلوب القالبي، المفرط في التحوّط، والتنحنح الذي Claude Opus 5 جلب شكاوى بسببه، وأن Claude Fable 5.1، GPT-6 Astra وGPT-5.6 Sol قيس كل منها مقابله منذ ذلك الحين. لذا فالسؤال الجدير بالإجابة ليس ما إذا كان العرض التوضيحي ساحرًا. بل ما إذا كان النثر قد تحسّن بشكل قابل للقياس، وبأي قدر، وأين لا يزال يفشل.

ما الذي تقول Anthropic إنها أصلحته

Screenshot of Anthropic's Claude Platform release-notes page, showing the Claude Opus 5.5 entry dated September 22, 2026, with the model ID claude-opus-5-5, a 1M-token context window and 128K maximum output.

إن ادعاء Anthropic محدد بما يكفي لاختباره. تقول إن Opus 5.5 يضع المعلومات الأكثر أهمية أولاً، ويستخدم مصطلحات أقل تعقيداً، ويتبع قواعد الكتابة التي يحددها المستخدم بشكل أقرب من نماذج Opus السابقة. المواد الداعمة مُبلَّغ عنها من المورّد ولم يُعَد إنتاجها: اختبارات داخلية للتحقق من الوقائع تقول Anthropic إنها نجحت في 16 من 18 محاولة، مقابل صفر من 18 لكلٍّ من Claude Fable 5.1وClaude Opus 5. اقتباسات العملاء في مواد الإطلاق تشير في الاتجاه نفسه — جون رويلاس من Ramp يصف مخرجات «تكتب كزميل جيد»، وBox تُبلغ عن نحو 40٪ أقل من الإسهاب في أعباء عملها.

هناك أمران يستحقان الفصل بينهما هنا. الأول أن "أقل Claudish" هو نمط فشل حقيقي وقابل للتسمية، وليس اختراعًا تسويقيًا. ظل الممارسون يشتكون من نثر Claude المكثّف وسيّئ البنية منذ أجيال Opus ما بعد 4.6، والشكوى محددة: مقدمة أكثر من اللازم، وإفراط في إعادة صياغة الموجّه، وعادة الوصول إلى النقطة بعد فقرتين من اللحظة التي كان القارئ يحتاجها فيها. والثاني أن أرقام Anthropic نفسها بشأن إصلاح ذلك هي بالضبط ذلك — أرقام Anthropic نفسها. رقم 16 من 18 لا يوجد له تكرار مستقل، و"إسهاب أقل بنسبة 40%" هو قياس داخلي لدى عميل، وليس منهجية منشورة.

يتضمن هذا الإصدار أيضًا تغييرًا غير متعلق بالكتابة يستحقّ المعرفة: Opus 5.5 هو أول نموذج من Opus يُطرح مزوَّدًا بضمانات في مجالات الأمن السيبراني والأحياء وتطوير نماذج LLM المتقدمة، مطابقة لتلك المطبَّقة على Claude Fable 5.1. وعندما يصطدم طلب بأحد هذه الضمانات، تقول Anthropic إنها توجّه الطلب بشفافية إلى نموذج آخر بدلًا من رفضه رفضًا تامًّا.

الأرقام التي لا تنتمي إلى Anthropic

A single-column readability scoreboard for Claude Opus 5.5: Flesch-Kincaid grade 6.95 versus Opus 5 at 7.97; Reading Ease 68.4 versus 61.35; Fable 5.1 and GPT-6 Astra at 7.43 and 7.52 grade; GPT-5.6 Sol at 8.74 grade and 56.62 ease; ranked 4th of 5 tested as an editor; and an AA Intelligence Index of 58, first of 212 models, with a sourcing footer.

أكثر قراءة مستقلة مفيدة لادعاء الكتابة تأتي من Every's Vibe Check، التي شغّلت المطالبات نفسها عبر خمسة نماذج رائدة وقيّمت المخرجات باستخدام أداتين معياريتين لقياس سهولة القراءة. على تلك المجموعة من المطالبات، Claude Opus 5.5خرج بوصفه الأسهل قراءةً ضمن المجموعة — والفجوة بينه وبين النموذج الذي حلّ محلّه هي القصة:

• مستوى قراءة Flesch-Kincaid — Claude Opus 5.5 عند 6.95، مقابل Claude Opus 5 عند 7.97

• مقياس Flesch لسهولة القراءة — 68.4 لـ Opus 5.5، مقابل 61.35 لـ Opus 5

• Claude Fable 5.1 — مستوى الصف 7.43، سهولة القراءة 66.09

• GPT-6 Astra — مستوى الصف 7.52، سهولة القراءة 64.55

• GPT-5.6 Sol — مستوى الصف 8.74، سهولة القراءة 56.62

اقرأ المقياسين معًا، لأنهما يتحركان في اتجاهين متعاكسين وهذا هو المغزى: انخفاض مستوى الصف وارتفاع درجة السهولة يعنيان معًا نثرًا أبسط. يقع Opus 5.5 عند مستوى أقل بحوالي صف كامل من Opus 5، وأقل بنحو نصف صف من كل من Claude Fable 5.1 وGPT-6 Astra، وأقل بنحو صفين من GPT-5.6 Sol. بعبارات واضحة، مستوى قراءة الصف السابع بدلاً من الصف الثامن.

ذلك تحسّن حقيقي، وهو أيضًا محدود النطاق. فهذه مجموعة أوامر تخصّ جهة نشر واحدة، وليست معيارًا تقييميًا له قائمة مهام ثابتة ولوحة صدارة خلفه. وهي تخبرك باتجاه المسار وحجم الخطوة تقريبًا، لكنها لا تخبرك بأن Opus 5.5 يكتب جيدًا في عملك، كما توضّح ملاحظات Every النوعية نفسها أن المراجع لم يرَ ذلك أيضًا.

حيث لا يزال يدفن الفكرة

المراجعة نفسها التي أنتجت أرقام قابلية القراءة صريحة بشأن الفشل الذي نجا من الإصلاح. عندما طُلب من Opus 5.5 أن يفتتح مقالًا، استغرق من 37 إلى 39 جملة ليغطي ما غطّاه المراجع في 21 جملة، وقضى فقرة كاملة على نقطة طرحها المراجع في ثماني كلمات. وخلاصة المراجع أن النموذج "لا يزال يدفن الفكرة" — والنسخة الأكثر حدّة من الشكوى هي أنه يستطيع أن يشخّص بشكل صحيح ما تحتاجه الفقرة، ثم ينتج مراجعة تتجاهل تشخيصه الخاص.

بصفته محررًا، كان أداؤه أسوأ مما كان عليه ككاتب. وعند تصنيفه مقابل النماذج الأخرى في مهام التحرير، حلّ Opus 5.5 خلف Claude Opus 5، GPT-5.6 Sol وGPT-6 Astra — فالنموذج أفضل في إنتاج جُمل مقروءة من التعرف على الجملة التي كان ينبغي أن تأتي أولًا. وخلاصة المراجع تأتي في جملة تستحق الاقتباس لأنها أكثر ما يفيد في المراجعة كلها: "أشعر بسعادة أكبر معه كمتعاون مما أشعر مع النثر الذي ينتجه."

القراءة العملية تتبع ذلك مباشرة. اكتب المسودة به، واكتبها عند مستوى جهد مرتفع أو أعلى — فإعدادات الجهد الأدنى هي حيث يبلغ الحشو أسوأ صوره. زوّده بأمثلتك الخاصة بدل أن تطلب منه اختلاقها. ثم انقل الفكرة إلى الأعلى بنفسك، أو سلّم المسودة إلى شيء يفعل ذلك. ما يمنحك إياه Opus 5.5 هو طريق أسرع إلى مسودة أولى نظيفة، وشريك أفضل حقًا في الجولات التي تليها. لكنه لا يمنحك محررًا.

ما تكلفة الكلمات الإضافية

Screenshot of the Artificial Analysis model page for Claude Opus 5.5, showing an Intelligence Index of 58 ranked first of 212 models, a cost rank of 93 of 212 at $4.00 per million input and $20.00 per million output with a 95% cache discount and $5.98 per Index task, and a verbosity rank of 95 of 212 at 260 million output tokens against a median of 88 million.

هناك بُعد تكلفة لمشكلة الإسهاب تتجاهله مراجعات الكتابة في الغالب، وهو يتعارض مع سردية الإطلاق. Claude Opus 5.5الأول من بين 212 نموذجًا في مؤشر الذكاء الخاص به برصيد 58 — لكنه الخامس والتسعون من 212 في الإسهاب، بعد أن ولّد 260 مليون رمز إخراجي خلال تلك الدورة من المؤشر مقابل وسيط قدره 88 مليونًا. وكلّف 5.98 دولار لكل مهمة من مهام مؤشر الذكاء لتقييمها، و8,708.20 دولار إجمالًا.

ضع ذلك إلى جانب ادعاء Anthropic نفسه بالكفاءة، ولن يتفق الاثنان بشكل واضح. الموقف الذي يبلّغ عنه المورّد هو أن Opus 5.5 يستخدم توكنات أقل ويولّد المخرجات أسرع من Opus 5 بنسبة تزيد على 30%. وقد وجد التشغيل المستقل الذي أجرته Artificial Analysis أن النموذج مسهب جدًا مقارنةً بأقرانه. يمكن أن يكون كلا الأمرين صحيحًا في آنٍ واحد — اختلاف مزيج المهام، واختلاف إعدادات الجهد، واختلاف تعريفات «توكنات أقل» — لكن لا ينبغي لأحد أن يقرأ صياغة الإطلاق كحقيقة راسخة بشأن اقتصاد التوكنات. أما من حيث السعر فالصورة أوضح: 4 دولارات لكل مليون توكن إدخال و20 دولارًا لكل مليون توكن إخراج، انخفاضًا من 5/25 دولارًا، مع خصم 95% على التخزين المؤقت في أرقام Artificial Analysis.

إذا كنت تدفع مقابل كل رمز إخراج، فإن الإسهاب في الكتابة ليس تفضيلًا أسلوبيًا، بل هو بند في الفاتورة.

تشغيله مقابل ما لديك بالفعل

ملاحظة صراحة واحدة قبل الجزء العملي: Claude Opus 5.5 ليس أحد مساراتنا. نحن لا نستضيفه، ولا ينبغي قراءة أي شيء أدناه على أنه ادعاء بأننا نفعل ذلك. يمكنك الحصول عليه عبر واجهة API الخاصة بـ Anthropic وعدة منصات تابعة لجهات خارجية.

ما هو موجود على OrcaRouter اليوم هو الطراز الذي حلّ محلّه والفئة الأعلى منه. Claude Opus 5 موجود على OrcaRouter اليوم، وكذلك Claude Fable 5.1، وكلاهما بسعر القائمة لدى المزوّد مع تمرير هامش ربح 0% — ما يعني أن أي تغيير في سعر البائع يصل إلى طرفنا في اليوم نفسه بدلًا من انتظار قيام أحد الموزّعين بذلك. إذا كنت تحاول تحديد ما إذا كانت نصوص Opus 5.5 تستحق الانتقال، فهذا اقتران مفيد: يمكنك إجراء المقارنة بمفتاح واحد دون عقد ثانٍ أو تغيير في الشيفرة، لأن كلا الطرازين واجهة API واحدة لأكثر من 200 طراز على نفس نقطة النهاية.

السبب الآخر للإبقاء على نموذج ثانٍ في الحلقة هو نمط الفشل الذي يتناوله هذا المقال. النموذج الذي يدفن الخلاصة هو نموذج تريد أن تكون قادرًا على تجاوزه في منتصف المهمة، والتحويل التلقائي عند الفشلموجود تحديدًا كي لا يتحول توليد سيئ إلى خط معالجة متعطل. إذا كنت تفضّل ألّا تختار نموذجًا واحدًا على الإطلاق، فإن لغة التوجيه DSL تجمع عدة نماذج في نداء واحد، ودمج النماذج يشغّل مجموعة من النماذج تجيب معًا — وهو شكل معقول لعمل التحرير، حيث يكون الفشل في الحكم لا في القدرة.

من يجب أن يتصرف، ومن يجب أن ينتظر؟

إذا كانت شكواك بشأن Claude Opus 5 هي أنك اضطررت إلى إعادة كتابة افتتاحياته، فإن Opus 5.5 يمثّل إصلاحًا حقيقيًا لنحو مستوى صفّي واحد من تلك المشكلة، وبيانات قابلية القراءة تقول إن التحسّن قابل للقياس وليس مجرد انطباعات. وإذا كانت شكواك هي أنه يستغرق ثلاث فقرات للوصول إلى النقطة، فلا شيء في الأدلة المستقلة يقول إن ذلك تغيّر. هاتان شكويان مختلفتان، وقد تعاملت تغطية الإطلاق معهما كأنهما شكوى واحدة.

بالنسبة للعمل الإبداعي تحديدًا، قصة البطيخة ليست دليلًا على أي شيء سوى أن الناس يلجؤون إلى مطالبات صغيرة ودافئة ومنخفضة المخاطر عندما يريدون استكشاف نموذج جديد. وهذا أمر معقول. وهو أيضًا بالضبط السياق الذي يكون فيه الميل إلى دفن المغزى أقل ظهورًا، لأن لا أحد يقرأ قصة بطيخة بحثًا عن الأطروحة. ضع النموذج أمام مستند يحتاج فيه القارئ إلى الخلاصة في أول جملتين، وستكتشف أيّ المشكلتين كانت لديك فعلاً.

الشيء الذي يجب متابعته بعد ذلك هو ما إذا كان النموذج التالي في العائلة — ومن المتوقع صدور كل من Sonnet 5.5 وHaiku 5.5 في الأسابيع المقبلة — سيرث مكسب سهولة القراءة، وما إذا كان أي شخص سينشر رقمًا لسهولة القراءة خاصًا بالتحرير بدلًا من الصياغة. رقم الصياغة هو السهل. رقم التحرير هو حيث لا يزال Opus 5.5 متأخرًا خلف ثلاثة من منافسيه.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا