
Claude Haiku 5.5 مقابل Claude Sonnet 5.5: بطاقة أسعار بمقدار 20×، وفاتورة مقيسة بمقدار 36×
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Claude Haiku 5.5 وClaude Sonnet 5.5 يفصل بينهما ستة أيام وفئة واحدة ضمن العائلة نفسها، ويتقاسمان نافذة سياق بسعة مليون توكن، ويستجيبان عبر بنية API نفسها. على بطاقة الأسعار المنشورة، يكلّف الأرخص خُمس ما يكلّفه الأغلى في النطاق الذي تقع فيه معظم الطلبات. وعلى لوحة Artificial Analysis المستقلة، الفجوة أوسع من ذلك: 0.21 دولار لإكمال مهمة واحدة من Intelligence Index على Claude Haiku 5.5 مقابل 7.60 دولار على Claude Sonnet 5.5، بدرجة 43 مقابل 56 في Intelligence Index. الإشارة التي أطلقت هذا المنشور وصفته بأن Claude Haiku 5.5 "أفضل بكثير من GPT-6 Luna" و"أقرب إلى Sonnet 5.5". النصف الأول من ذلك هو تقريبًا ما تعرضه مجموعة المقارنة الخاصة بالمورّد. النصف الثاني هو حيث تكفّ القياسات عن الاتفاق مع التسويق، ويجدر بنا أن نكون دقيقين بشأن أيّهما.
طرازان، يفصل بينهما ستة أيام وفئة واحدة
صدر Claude Haiku 5.5 في 7 أكتوبر 2026 تحت معرّف النموذج claude-haiku-5-5. وهو البديل المباشر لـ Claude Haiku 4.5، ويستقبل النصوص والصور ويعيد النصوص، وهو أول نموذج من فئة Haiku تمنحه Anthropic إعداد جهد قابل للتعديل — Low، Medium، High، Xhigh وMax، مع medium كإعداد افتراضي في API. وتصفه Anthropic بأنه "أرخص وأسرع نموذج صغير وأكثره قدرةً أصدرناه على الإطلاق"، وتوضح الحاشية أن كونه الأسرع ينطبق عند السرعة القياسية لكل نموذج، لكنه يبقى خلف نماذج Opus عندما تعمل في الوضع السريع.
صدر Claude Sonnet 5.5 قبل ستة أيام، في 28 سبتمبر 2026، باسم claude-sonnet-5-5 — الفئة التي تضعها Anthropic باعتبارها أفضل مزيج من السرعة والذكاء، وتلك التي توصي بها للبرمجة الوكيلية المعقدة. النافذة نفسها البالغة مليون رمز. وخلافًا لـ Claude Haiku 5.5، لا يحتوي على نطاق سعري حسب طول المطالبة، وهو ما يتضح أنه أكثر أهمية من السبق البالغ ستة أيام.
كلاهما متاح الآن على جميع المنصات، بما في ذلك Amazon Web Services وGoogle Cloud وMicrosoft Azure، ويحمل كلاهما التزامًا بعدم الإيقاف قبل مرور سنة واحدة على الأقل من الإطلاق — 7 أكتوبر 2027 لـ Claude Haiku 5.5، و28 سبتمبر 2027 لـ Claude Sonnet 5.5. وتقول Anthropic إن Claude Sonnet 5.5 متاح مع عدم الاحتفاظ بالبيانات، بما يطابق Claude Opus 5.5 وClaude Sonnet 5.
بطاقة الأسعار، بوجهيها، في مكان واحد
لكل مليون رمز، بالدولار الأمريكي، وفقًا للأسعار المعلنة من Anthropic:
• المدخل — Claude Haiku 5.5 بسعر 0.10 دولار للمطالبات حتى 100,000 رمز، و0.50 دولار فوق هذا الحد؛ Claude Sonnet 5.5 بسعر 2.00 دولار ثابت، دون شرائح.
• الإخراج — Claude Haiku 5.5 بسعر 0.50 $ حتى 100,000 رمز، و2.50 $ فوق ذلك؛ Claude Sonnet 5.5 بسعر 10.00 $ ثابت.
• قراءات الذاكرة المؤقتة — Claude Haiku 5.5 $0.01 في النطاق الأدنى و $0.05 فوقه؛ Claude Sonnet 5.5 $0.10. خفضت Anthropic قراءات الذاكرة المؤقتة لـ Claude Sonnet 5.5 من $0.20 إلى النصف بالتزامن مع إطلاق Haiku، وتقول إنه لأن قراءات الذاكرة المؤقتة تشكل حصة كبيرة من استخدام الرموز الوكيلية، فإن Claude Sonnet 5.5 يكلف الآن حوالي 20% أقل في معظم العمل الوكيلي.
• عمليات الكتابة إلى الذاكرة المؤقتة — Claude Haiku 5.5: 0.125 دولارًا لكتابة مدتها خمس دقائق و0.20 دولارًا لكتابة مدتها ساعة واحدة في النطاق الأدنى، و0.625 دولارًا و1.00 دولار فوقه؛ Claude Sonnet 5.5: 2.50 دولارًا لكتابة مدتها خمس دقائق و4.00 دولارات لساعة واحدة.
• Batch — واجهة Batch API بخصم 50% على كلٍ من الإدخال والإخراج. وهذا يضع Claude Haiku 5.5 عند $0.05 و$0.25 أقل من حد 100,000 رمز، و$0.25 و$1.25 فوقه، مقابل Claude Sonnet 5.5 عند $1.00 و$5.00.
اقرأ عبر تلك السطور وستجد الشكل متسقًا: في النطاق الأدنى، أنت تنظر إلى فجوة إدخال تبلغ 20 ضعفًا وفجوة إخراج تبلغ 20 ضعفًا؛ وفوق الخط، 4 أضعاف و4 أضعاف. العنوان الرئيسي من Anthropic هو "تكلفة تشغيل أقل بنحو 75%" في المتوسط مقارنةً بـ Claude Haiku 4.5، مع توضيح في حاشية بأنه أرخص بنسبة 90% دون 100,000 رمز و50% أرخص فوق ذلك، مع إدراج تغيير أداة الترميز ضمن ذلك المتوسط.
خطوة الـ 100,000 توكن هي حيث ينقلب الحساب
هناك أمران يسحبان في اتجاهين متعاكسين، وواحد فقط منهما مُدرَج في بطاقة الأسعار. تنخفض الأسعار بشدة مقارنةً بـ Claude Haiku 4.5. وفي الوقت نفسه، يأتي Claude Haiku 5.5 بمُرمِّز محدَّث، شبيه بتلك الموجودة في Claude Sonnet 5.5 وClaude Opus 5.5، والذي تقول Anthropic إنه "يستخدم رموزًا أكثر قليلًا لكل مهمة" — لذا يصل الطلب المطابق نفسه بعدد أكبر من الرموز القابلة للفوترة مما كان سيكون عليه في الجيل السابق. ومتوسط 75% هو المحصلة الصافية لكليهما، وهو رقم صادر عن المورّد.
حد الـ100,000 توكن هو الجزء الذي يلفت انتباه الناس. تُسعّر Anthropic نموذج Claude Haiku 5.5 حسب طول المُطالبة: الطلب الذي يتجاوز طول مُطالبته 100,000 توكن يدفع الأسعار الأعلى على الطلب كله، وليس فقط على التوكنات التي تتجاوز العتبة. يشمل طول المُطالبة جميع توكنات الإدخال، بما في ذلك قراءات ذاكرة التخزين المؤقت وكتاباتها، ويُسعّر كل طلب على حدة — فالطلب الطويل يدفع الفئة الأعلى حتى عندما يكون جزء من مُطالبته إصابة في ذاكرة التخزين المؤقت، بينما تحتفظ الطلبات السابقة بالأسعار التي فُوترت بها. خط أنابيب استرجاع يقع بارتياح عند 90,000 توكن يدفع $0.10 و$0.50. زِد النافذة درجة واحدة فقط فيُعاد تسعير الطلب بأكمله عند $0.50 و$2.50. لا يفعل Claude Sonnet 5.5 ذلك، لأن نافذة المليون توكن الكاملة تُفوتَر بالسعر القياسي.
تنتج عن ذلك نتيجتان، تشيران في اتجاهين متعاكسين. أولًا، نقطة التقاطع التي يتوقعها الناس — حيث يجعل السياق الطويل النموذج الباهظ أرخصَ — لا تحدث: فـ Claude Haiku 5.5 فوق الخط لا يزال ربع سعر Claude Sonnet 5.5 على بطاقة الأسعار. ثانيًا، الفجوة التي كنت تعوّل عليها تضيق من 20x إلى 4x بالضبط عندما يصبح حمل العمل ثقيلًا، وهو بالضبط الوقت الذي تبدأ فيه الأرقام المطلقة في الأهمية. هذه الخطوة هي السبب في أن أي خط معالجة حساس للتكلفة يحتاج إلى بند ميزانية خاص به بدلًا من سعر لكل رمز.
ما يصرّح به كل مورّد أنه يسجّله
كل ما في هذا القسم مُبلَّغ عنه من جهة المورّد ولم يُعِد إنتاجه طرف ثالث. وتنشر Anthropic المجموعة نفسها من المقارنات على صفحتَي Claude Haiku 5.5 وClaude Sonnet 5.5، وحيثما تتقاطع الصفحتان فإنهما تتفقان:
• GDPval-AA v2.1، العمل المعرفي — 1,620 لـ Claude Haiku 5.5، مقابل 1,840 لـ Claude Sonnet 5.5، و735 لـ Claude Haiku 4.5 و1,437 لـ GPT-6 Luna.
• AA-Briefcase v1.1 — 1,578 لـ Claude Haiku 5.5، مقابل 1,824 لـ Claude Sonnet 5.5، و614 لـ Claude Haiku 4.5 و1,336 لـ GPT-6 Luna.
• OSWorld 2.1، استخدام الحاسوب، المجموعة الفرعية دون اتصال — 72.4% لـ Claude Haiku 5.5، مقابل 83.9% لـ Claude Sonnet 5.5، و15.7% لـ Claude Haiku 4.5 و48.9% لـ GPT-6 Luna.
• Terminal-Bench 4.0، البرمجة الوكيلية — 39.2% لـ Claude Haiku 5.5، مقابل 70.6% لـ Claude Sonnet 5.5، و0.0% لـ Claude Haiku 4.5 و16.4% لـ GPT-6 Luna.
• FrontierCode 1.1، Main — 46.4% لـ Claude Haiku 5.5، مقابل 52.1% لـ Claude Sonnet 5.5 عند جهد Xhigh، و42.4% لـ GPT-6 Luna. وتشير Anthropic أيضًا إلى أن Claude Sonnet 5.5 يسجل نتيجة أقل عند جهد Max منه عند Xhigh في هذه الحالة، وهو ما تعزوه إلى الاستخدام الأكثر تكرارًا لمهارة مراجعة التعليمات البرمجية مما يؤدي إلى مهل زمنية أو تعديلات خارج النطاق.
• رسم المخططات، الاستدلال البصري بدون أدوات — 46.4% لـ Claude Haiku 5.5، مقابل 61.6% لـ Claude Sonnet 5.5، و6.4% لـ Claude Haiku 4.5 و29.1% لـ GPT-6 Luna.
• اختبار Humanity's Last Exam — 45.9% بدون أدوات و57.4% معها لـ Claude Haiku 5.5؛ و64.5% مع أدوات لـ Claude Sonnet 5.5، و18.7% لـ Claude Haiku 4.5، و56.9% بدون أدوات لـ Claude Sonnet 5.5 في الصفحة نفسها. وتلاحظ Anthropic أن أرقام عائلة GPT-6 قد تكون قديمة لأن OpenAI أصلحت خطأً في فهم الصور ولم يتم تحديث جميع نتائج الأطراف الثالثة.
سطران من تلك السطور يستحقان القراءة مرتين. على FrontierCode، النموذجان متقاربان — 46.4% مقابل 52.1% — وعلى Chartography، حيث لا توجد أدوات يمكن الاحتماء بها، يبلغ الفارق 15 نقطة. أما Terminal-Bench 4.0 فليس متقاربًا على الإطلاق: 39% مقابل 70.6% يمثل فئة قدرات مختلفة، ولهذا لا تزال صفحة Claude Sonnet 5.5 من Anthropic تشير إلى Claude Sonnet 5.5 وClaude Opus 5.5 للبرمجة الوكيلية المعقدة، وتُصوّر Claude Ha 5.5 بوصفه النموذج المخصص للأعمال الضيقة عالية الحجم.
ما الذي يضيفه المجلس المستقل
تقارن أرقام Anthropic نماذجها الخاصة ببعضها البعض وبمنافس واحد. أما لوحة مستقلة فتضع كليهما في مواجهة المجال بأكمله، والرقم الذي تقدمه ولا تقدمه الشركات المورّدة هو التكلفة لكل مهمة مكتملة.
يمنح Artificial Analysis نموذج Claude Haiku 5.5 عند Max effort مؤشر Intelligence Index قدره 43، وهو أعلى بكثير من الوسيط البالغ 13 بين النماذج المماثلة، إذ يولّد 440 مليون رمز إخراج على المؤشر مقابل وسيط قدره 100 مليون — شديد الإسهاب — بتكلفة 0.10 دولار للإدخال و0.50 دولار للإخراج لكل مليون، و242 رمز إخراج في الثانية. وتبلغ تكلفته المقاسة 0.21 دولار لكل مهمة Intelligence Index.
تمنح اللوحة نفسها Claude Sonnet 5.5 درجة 56، مقابل وسيط قدره 26، مع توليد 410 ملايين رمز إخراج مقابل وسيط قدره 88 مليونًا، بتكلفة 2.00 دولار للإدخال و10.00 دولارات للإخراج مع خصم تخزين مؤقت بنسبة 90%. تبلغ تكلفته المقاسة 7.60 دولارات لكل مهمة Intelligence Index.


ضع هذين السطرين جنبًا إلى جنب وستكون النسبة هي القصة. 0.21 دولار مقابل 7.60 دولار تعني أكثر بقليل من 36 ضعفًا، والطرازان متقاربان تقريبًا في درجة الإسهاب — 440 مليون توكن مُخرَج مقابل 410 مليون — لذا فإن هذا المعامل بالكامل تقريبًا هو بطاقة الأسعار تفعل ما تقول إنها ستفعله. على بطاقة أسعار المورّد نفسها تكون المقارنة نفسها 20 ضعفًا. يأتي الفارق الإضافي من الأشياء التي لا يستطيع سعر لكل توكن أن يُظهرها: فالطراز الأرخص يصل إلى إجابته بعدد أقل من التوكنات المفوترة لكل مهمة عند إعداد الجهد هذا، وتُحتسب قراءات الذاكرة المؤقتة بعُشر سعر Claude Sonnet 5.5. نفس منصة الاختبار، نفس المهام، مقيسة بشكل مستقل.

حيث تنفد الطبقة الرخيصة فعليًا
أرقام العملاء التي تنشرها Anthropic تحسم المقارنة في كثير من الأحيان أكثر مما تفعله المعايير، وكلها تشير في الاتجاه نفسه. تُبلغ Asana عن زمن استجابة أقل بأكثر من 30% عند إكمال المهام وبما يصل إلى 2.5 ضعف سرعة الاستدلال لكل دور للوكيل. تُبلغ Box عن نتيجة أعلى بـ11 نقطة من Claude Haiku 4.5 عند نحو نصف زمن الاستجابة. تُبلغ HubSpot عن أفضل نتيجة شهدتها على مجموعتها الخاصة، 92.8% في المتوسط على مدى ثلاث محاولات، مع أعلى معدل إصابة وأدنى معدل إيجابيات كاذبة. تشغّل AlphaSense نحو 8 ملايين استدعاء أسبوعيًا عبر "Ask in Document" وتُبلغ عن تحسّن ذي دلالة إحصائية مقارنة بـ Claude Haiku 4.5، 0.84 مقابل 0.76. تُبلغ Cognition أنه مع Claude Haiku 5.5 كمساعد، يحقق وكيلها Fusion نتيجة FrontierCode قدرها 66.2.
ليس أيٌّ من هؤلاء وكيلًا طويل الأفق. إنها حلول نقطية — خطوة واحدة محددة جيدًا، تصبح أسرع وأرخص. هذا هو النمط الذي صُمم له Claude Haiku 5.5، وهو أيضًا النمط الذي تصبح فيه ميزة التكلفة البالغة 36 ضعفًا مالًا حقيقيًا لا خطأ تقريب. تتراكم هذه الميزة مع حجم الاستدعاءات وتتبخر مع عمق الاستدعاء: مئة ألف استدعاء تصنيف يوميًا بتكلفة 0.10 دولار للإدخال و0.50 دولار للإخراج هو بند تلاحظ اختفاءه، بينما مئة دور وكيل في الجلسة، يعيد كل منها قراءة السياق المتراكم، هو بند ينمو نموًا فائق الخطية لأن كل دور يتجاوز العتبة يدفع الشريحة الأعلى.
الحجة المضادة الخاصة بـ Claude Sonnet 5.5 هي التكلفة لكل محاولة بدلًا من التكلفة لكل توكن. تقول Anthropic إنه يعمل أسرع بنسبة 30%+ من Claude Sonnet 5 ويكلّف أقل بنسبة تصل إلى 30% في معظم الأعمال، مع قدوم التوفير من الحاجة إلى توكنات أقل لا من معدلات أقل. وقد قدّم مختبرون من أطراف ثالثة أرقامًا تدعم ذلك: تفيد Slack بانخفاض توكنات الإخراج بنحو 14%، و Balyasny بنحو 121 ألف توكن لكل إجابة مقابل 497 ألفًا، و Box أسرع بمقدار 2.4 مرة مع توكنات أقل بنسبة 12%، و Lovable أقل بنحو الثلث في استدعاءات الأدوات ونحو النصف في عمليات shell، و Atlassian أسرع بنسبة تصل إلى 30% في Rovo Agents، و Base44 3.6 تكرارات لكل بناء مقابل 7.7 لـ Claude Opus 5. دور واحد ينجح يتفوق على أربعة لا تنجح.
هناك عامل ثالث يعمل في الاتجاه المعاكس. نقلت Anthropic الجهد إلى مقبض على مستوى النموذج في هذا الجيل — إذ يُضبط إعداد الجهد في Claude Haiku 5.5 مرة واحدة لكل طلب بدلًا من قياسه كميزانية تفكير لكل طلب، كما أن وضع budget_tokens القديم مهجور في نماذج 4.6 وغير مقبول في النماذج الأحدث. بالنسبة لأسطول يستدعي معرّف نموذج واحد من خدمات عديدة، يُعد ذلك تبسيطًا. وبالنسبة لأي شيء كان يحدّد حجم استدلاله الخاص لكل استدعاء، فهو إعادة كتابة.
تشغيل كليهما خلف نقطة نهاية واحدة
السبب في أن هذا القرار يستحق أن يُتخذ على نحو صحيح هو أن الجانب الخاطئ منه مكلف التراجع عنه: فإعادة توصيل مسار إنتاجي من معرّف نموذج إلى آخر تعني لمس كل موضع استدعاء افترض سلوك النموذج القديم. والطريقة الأرخص لمعرفة الفئة التي ينتمي إليها عبء عمل ما هي تشغيل كليهما خلف نقطة نهاية واحدة، ونقل الحركة بينهما عبر الإعدادات بدلًا من إعادة الهيكلة.
هذا هو الغرض من OrcaRouter. يتوفر Claude Sonnet 5.5 في الكتالوج باسم anthropic/claude-sonnet-5.5، إلى جانب Claude Sonnet 5 وClaude Opus 5.5 وClaude Haiku 4.5 — تبقى فئة Haiku الأقدم متاحة كنقطة مرجعية أثناء انتقالك بعيدًا عنها. المنصة تمرّر سعر قائمة المزوّد كما هو دون أي هامش ربح، لذا فإن سعري 2.00 $ و10.00 $ المذكورين أعلاه هما السعران اللذان تدفعهما، وينطبق الأمر نفسه في الاتجاه المعاكس: عندما يعيد أحد الموردين تسعير منتجه، يصبح السعر الجديد ساريًا هنا في اليوم نفسه، وهكذا وصلنا خصم قراءة ذاكرة التخزين المؤقت لـ Claude Sonnet 5.5. هناك ميزتان تقومان بالعمل الذي يتطلبه هذا القرار تحديدًا. يحافظ التبديل التلقائي عند الفشل على إبقاء نموذج لا تزال تقيّمه بعيدًا عن مسارك الحرج من تلقاء نفسه، وتتيح لك لغة توجيه DSL إرسال الطلبات التي تقل عن 100,000 رمز إلى الفئة الرخيصة، وإحالة الطلبات ذات السياق الطويل أو الأفق الطويل إلى الفئة الأغلى في تدفق الطلبات نفسه، دون عقد ثانٍ أو SDK ثانٍ.
لنكون دقيقين بشأن ما هو مُستضاف وما ليس مُستضافًا: يمكن توجيه Claude Sonnet 5.5 عبرنا اليوم. Claude Haiku 5.5 لم يُدرَج بعد في الكتالوج. وإلى أن يحدث ذلك، فهو متاح على واجهة API الخاصة بـ Anthropic وعلى المنصات السحابية الثلاث المذكورة أعلاه.
كيف تقرر
اختر Claude Haiku 5.5 عندما تكون المهمة ضيقة النطاق، وكثيفة الحجم، وقابلة للتحقق — التصنيف، والاستخلاص، والتوجيه، والتلخيص، والعمل لكل دور داخل وكيل قمت ببنائه بالفعل. فجوة المعدل البالغة 20x هي بيت القصيد هناك، وخطوة الـ 100,000 رمز يمكن تجنبها بالتصميم، والمقياس المستقل البالغ 0.21 دولار لكل مهمة يقول إن المكسب يصمد خارج مختبر البائع نفسه. اضبط قرص الجهد لكل فئة مهمة بدلاً من تركه على الوضع الافتراضي؛ على نموذج من فئة Haiku، الفرق بين Low و Max هو مضاعف تكلفة، وليس تفضيلاً للجودة.
اختر Claude Sonnet 5.5 عندما تكون المهمة طويلة المدى، أو وكيلية، أو غير قابلة للتحقق — كود يجب أن يُترجم، استخدام حاسوب يجب أن يترك الشاشة في حالة معروفة، أي شيء تكون فيه تكلفة الإجابة الخاطئة أكبر من تكلفة الاستدعاء. Terminal-Bench 4.0 بنسبة 70.6% مقابل 39.2% ليس فارقًا طفيفًا، بل هو فئة قدرات مختلفة، وبطاقة الأسعار الثابتة تعني أن السياق الطويل لا يعيد تسعير الطلب بأكمله بصمت. إذا كان عبء العمل لديك يقع حقًا في المنطقة الوسطى، فالإجابة الصادقة هي أنه لا يوجد أي من النموذجين لديه مجموعة واسعة من عمليات إعادة الإنتاج من طرف ثالث حتى الآن، ودرجات المؤشر تأتي من أداة اختبار واحدة، والأرقام التي ذكرها البائع أعلاه هي أرقام البائع نفسه.
ما الذي سيغيّر هذه الإجابة؟
هناك ثلاثة أمور تستحق المتابعة، ولا يتعلق أي منها بإصدارات المعايير المرجعية. الأول هو ما إذا كانت التقييمات المستقلة لـ Claude Haiku 5.5 عند مستويات الجهد Low وHigh وXhigh — وليس Max فقط — تُظهر النسبة نفسها للتكلفة لكل مهمة، لأن مقبض ضبط الجهد هو أرخص رافعة في المقارنة وأقلها قياسًا. والثاني هو ما إذا كانت خطوة الـ100,000 توكن ستصمد؛ فظهور نطاق ثالث، أو غياب أي نطاق على الإطلاق في الجيل التالي، سيغيّر الحسابات لكل خط أنابيب استرجاع في الإنتاج أكثر من أي درجة معيار مرجعي منفردة. والثالث هو المُجزِّئ. إذا قامت نقطة تحقق لاحقة بتجزئة النص نفسه إلى وحدات رمزية بالمعدل الأقدم، فإن متوسط Anthropic البالغ 75% يصبح حدًا أدنى لا هدفًا، وتتسع الفجوة أمام Claude Sonnet 5.5 دون أن يتحرك أي من السعرين.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
