بطاقة عنوان رئيسية تحمل عنوان «فئة Flash الصينية، مُدقَّقة» مع وسم تحقق من الادعاء «أكتوبر 2026»، وثلاث شرائح أسعار تعرض Claude Haiku 5.5: $0.10 إدخال / $0.50 إخراج لكل مليون رمز، وGLM 5.3 Flash: $0.15 / $0.50، وDeepSeek V4.1 Flash: $0.30 / $1.20، وسطر يعرض «Terminal Bench 4.0 0.32828 - تعادل»، وسطر Index v4.3.2 يعرض 43.40 - 41.81 - 39.46.
Guides & Insights

كان Claude Haiku 5.5 موجَّهًا إلى فئة Flash Tier الصينية. نصف هذا الادعاء فقط يصمد أمام التدقيق.

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

قدّم قارئ يكتب بالصينية حجة حادة هذا الأسبوع: Claude Haiku 5.5 يبدو مصمماً للاستحواذ على السوق الصينية للفئة المتوسطة، لأنه يقلّ عن DeepSeek V4.1 Flash وGLM 5.3 Flash في السعر، ويتفوق على GLM 5.3 Flash في Terminal Bench 4.0 و Artificial Analysis Intelligence Index. إنها قراءة أكثر حدة من معظم تعليقات الإطلاق. وهي أيضاً ادعاءان في ثوب واحد، ولا يحملان القدر نفسه من الصحة.

أطلقت Anthropic نموذج Claude Haiku 5.5 في 7 أكتوبر 2026 — إطلاق عام كامل مع إعلان مؤرخ، وبطاقة نظام، وبطاقة أسعار منشورة. وهذا يمنح الادعاء شيئًا نادرًا ما تحصل عليه تعليقات السوق غير المباشرة: أرقامًا يمكنك التحقق منها.

يكشف التدقيق أدناه أن أحد النصفين أقوى مما قاله القارئ، وأن النصف الآخر مخطئ بشأن المعيار المحدد الذي يستشهد به. كلا الاستنتاجين يستحقان المعرفة، لأنهما يشيران في اتجاهين متعاكسين.

الادعاء، بصياغة دقيقة

إذا جُرّدت الحجة إلى مكوناتها، فإنها تتكوّن من ثلاثة أجزاء.

• السعر — Claude Haiku 5.5 أرخص من DeepSeek V4.1 Flash وأرخص من GLM 5.3 Flash.

• درجة مستقلة — تقع أعلى بنحو نقطة واحدة من GLM 5.3 Flash على Artificial Analysis Intelligence Index.

• معيار الترميز — كما أنه يتقدّم بنقطة واحدة على GLM 5.3 Flash في Terminal Bench 4.0.

اثنان من هذه يمكن التحقق منهما مقابل جداول منشورة ويصمدان، مع تعديلات. أما الثالث فيمكن التحقق منه مقابل الجدول نفسه ويأتي مختلفًا عما وُصف.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

النصف الخاص بالسعر: صحيح، ومُقلَّل في اتجاه، ومُبالَغ فيه في اتجاه آخر

السعر المعلن من Anthropic لـ Claude Haiku 5.5 هو 0.10 دولار لكل مليون رمز إدخال و0.50 دولار لكل مليون رمز إخراج حتى مطالبة من 100,000 رمز، ويرتفع إلى 0.50 دولار و2.50 دولار فوق هذا الحد. تُقرأ الإدخالات المخزّنة مؤقتًا بسعر 0.01 دولار وتُكتب بسعر 0.125 دولار. نافذة السياق مليون رمز؛ والحد الأقصى للإخراج 128,000.

GLM 5.3 Flash، من Z.ai، مُدرَج بسعر 0.15 دولار و0.50 دولار، مع إدخال مخزّن مؤقتًا بسعر 0.026 دولار. DeepSeek V4.1 Flash مُدرَج بسعر 0.30 دولار و1.20 دولار، مع إدخال مخزّن مؤقتًا بسعر 0.006 دولار.

فيما يتعلق بالسعر المعلن، القارئ على حق. فسعر الإدخال البالغ $0.10 يقل بمقدار الثلث عن GLM 5.3 Flash وبمقدار الثلثين عن DeepSeek V4.1 Flash، كما أن سعر الإخراج البالغ $0.50 يطابق GLM 5.3 Flash تمامًا بينما يأتي عند أقل بكثير من نصف سعر DeepSeek. هذا هبوط يبدو متعمدًا: طابِق إخراج المنافس الأرخص، وتفوّق عليه في الإدخال، ودع النسبة تتحدث.

ما يحسّن موقف الادعاء هو التكلفة المقيسة لكل مهمة منجزة. على مؤشر Intelligence Index v4.3.2 من Artificial Analysis، تبلغ تكلفة المهمة كاملة $0.21 لـ Claude Haiku 5.5، و$0.25 لـ GLM 5.3 Flash، و$0.27 لـ DeepSeek V4.1 Flash. تقول قائمة الأسعار إن Claude Haiku 5.5 أرخص بـ1.5 مرة من GLM 5.3 Flash في الإدخال؛ بينما يقول القياس إن المهمة المنجزة أرخص بنحو السدس. ورغم ذلك يظل الأرخص بين الثلاثة — لكن ليس بالفارق الذي يوحيه السعر المعلن.

السبب هو ما تُغفله معظم مقارنات الأسعار. إن Claude Haiku 5.5 مسهب. سجّلت Artificial Analysis 162,164 رمز إخراج له أثناء تشغيل Index، مقابل 68,673 لـ GLM 5.3 Flash و88,574 لـ DeepSeek V4.1 Flash. تضيف وثائق Anthropic نفسها تأثيرًا ثانيًا: يستخدم النموذج أداة الترميز الأحدث المشتركة مع Claude 4.7 والإصدارات اللاحقة، لذا يُحتسب النص نفسه بما يقارب 30% رموزًا أكثر مما هو عليه في النموذج الذي يستبدله. سعر أقل يُطبَّق على رموز أكثر هو سعر أقل يُطبَّق على رموز أكثر.

تفصيل لا يظهر إلا في فاتورة موجّهة: يسرد كتالوجنا الخاص DeepSeek V4.1 Flash بسعر 0.15 دولار للمدخلات و0.60 دولار للمخرجات، مع تطبيق مضاعف 2× خلال نافذتين يوميتين، 01:00–04:00 و06:00–10:00 بتوقيت UTC. ثماني عشرة ساعة يوميًا يكون ذلك هو السعر الأساسي؛ وست ساعات يوميًا يكون سعر المخرجات 1.20 دولار. حركة الدفعات التي يمكن جدولتها بعيدًا عن هاتين النافذتين تحصل على سعر DeepSeek أفضل بدرجة جوهرية مما يوحي به سعر القائمة الرئيسي لدى المورّد، أما الحركة التفاعلية فلا. إذا كنت تُنمذج هذه المقارنة على أرض الواقع، فإن التقويم لا يقل أهمية عن بطاقة الأسعار.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

نصف النتيجة: "حوالي نقطة" تساوي 1.6

على مؤشر Artificial Analysis Intelligence Index v4.3.2، يُقاس Claude Haiku 5.5 عند 43.40 في إعداد Max الخاص به. ويُقاس GLM 5.3 Flash عند 41.81. ويأتي DeepSeek V4.1 Flash عند 39.46.

إذن، الشق المتعلق بالمؤشر في الادعاء صحيح من حيث الاتجاه ويُقرَّب نحو الأسفل: الفارق 1.59 نقطة، وليس نقطة واحدة. وهذا تقدم حقيقي في مؤشر يبلغ الستينيات، وهو الرقم الذي يُقتبس في كل ملخص لهذه المواجهة.

ما ليس عليه هذا هو ادعاء بشأن المعايير الكامنة تحته. ينشر كلا المزوّدين مجموعات التقييم الخاصة بهما، وهي ليست المجموعات نفسها — إذ تُبلِغ Anthropic عن GDPval-AA v2.1، وOSWorld 2.1، وTerminal-Bench 4.0، وFrontierCode من أجل Claude Haiku 5.5؛ بينما تُبلِغ Z.ai عن مجموعتها الخاصة من أجل GLM 5.3 Flash. اللوحة المستقلة هي الصف الوحيد المتاح القابل للمقارنة العادلة، وهذا بالضبط سبب الاعتماد على فجوة المؤشر بهذه القوة، وسبب أهمية القسم التالي.

نصف البرمجة: هذه تعادل تام، وليست فوزًا

Terminal Bench 4.0، وفق القياس المستقل المشترك، يسجل 0.32828 لـ Claude Haiku 5.5 و0.32828 لـ GLM 5.3 Flash. متطابقان حتى خمس منازل عشرية.

هذا هو الرقم الأكثر قابلية للاقتباس على الإطلاق في هذه المواجهة، والادعاء المتعلق به خاطئ. المصدر المرجّح للالتباس هو الصف المجاور: النسخة الكاملة GLM-5.3، النظير غير Flash، تحرز 0.4192 في الاختبار المعياري نفسه. إذا رأيت "GLM" و"Terminal Bench" في جملة واحدة بجانب رقم أعلى بنقطة واحدة من Claude Haiku 5.5، فهذا هو النظير، وليس Flash.

الصفوف الثلاثة الأخرى التي تنشرها Artificial Analysis لكلا النموذجين أكثر إثارة للاهتمام من التعادل، وهي لا تشير في اتجاه واحد:

• SciCode — 0.5498 لـ Claude Haiku 5.5 مقابل 0.5162 لـ GLM 5.3 Flash. تقدّم بـ 3.4 نقطة لصالح Anthropic.

• Humanity's Last Exam — 0.4439 مقابل 0.3985. فارق 4.5 نقاط لصالح Anthropic.

• AutomationBench، نتيجة جزئية — 0.3541 مقابل 0.6037. تفوّق بمقدار 25 نقطة لصالح GLM 5.3 Flash، وهي أكبر فجوة في المجموعة بفارق كبير.

ذلك الصف الأخير هو أكثر ما ستهتم به فرق المشتريات، لأن الأتمتة الوكيلية هي المجال الذي تُنشر فيه النماذج متوسطة المستوى فعليًا. وفي مقياس لما إذا كان النموذج قادرًا على إنجاز مهمة متعددة الخطوات حتى اكتمالها، يفوز النموذج مفتوح الأوزان الأقل تكلفة في التشغيل بهامش يجعل فرق المؤشر البالغ 1.6 نقطة في الاتجاه الآخر يبدو ضئيلًا.

تتفاوت السرعة بالطريقة نفسها التي يتفاوت بها السعر، بل وبدرجة أكبر. قاست Artificial Analysis 424.6 ثانية لكل مهمة Index لـ Claude Haiku 5.5 مقابل 1035.4 ثانية لـ GLM 5.3 Flash. ويصل نموذج Anthropic إلى ذلك في أقل من نصف الوقت الفعلي، وهو رقم تشغيلي أكبر في حلقة الوكيل من معدل الرموز.

ما يغفله الادعاء تمامًا

تُصاغ المقارنة كقصة سعر ونتيجة، وهو ما يتخطى بهدوء البُعد الذي يقل فيه تشابه النموذجين. GLM 5.3 Flash مفتوح الأوزان، منشور تحت رخصة MIT، بإجمالي 320 مليار معامل و18 مليار معامل نشط. DeepSeek V4.1 Flash هو أيضًا مفتوح الأوزان بإجمالي 552 مليار معامل و16 مليار معامل نشط. Claude Haiku 5.5 احتكاري، عبر API فقط، بدون عدد معاملات منشور وبدون مستودع.

هذا ليس حاشية بالنسبة إلى كثير من المشترين؛ بل هو السطر الأول من وثيقة المتطلبات. الفريق الذي يحتاج إلى تشغيل الاستدلال داخل المستأجر الخاص به، أو الضبط الدقيق، أو تثبيت إصدار نموذج بعينه لسنوات، لا يختار بين هذه الثلاثة بناءً على نقاط المؤشرات إطلاقًا — اثنان من الثلاثة يُستبعدان قبل قراءة عمود السعر حتى. إن صياغة القارئ ملاحظة حول التموضع في السوق، وهي ملاحظة منصفة؛ غير أن الفرق البنيوي يصادف أنه يعمل ضد النموذج الذي تدافع عنه هذه الصياغة.

إجراء المقارنة بنفسك

GLM 5.3 Flash و DeepSeek V4.1 Flash كلاهما على كتالوج OrcaRouter بسعر قائمة المزود بهامش ربح 0%، مما يجعل الجانب الصيني من هذه المقارنة شيئًا يمكنك استدعاؤه اليوم بدلاً من نمذجته في جدول بيانات. لأن السعر يتم تمريره بدلاً من دمجه، فإن تغيير سعر المورد يصل إلى جانبنا في نفس اليوم الذي يصل فيه إلى جانبهم — ونافذة DeepSeek القائمة على التقويم الموصوفة أعلاه مرئية في نفس كتلة التسعير التي ستقوم بالتوجيه مقابلها. مفتاح واحد، SDK واحد، التجاوز التلقائي للفشل تحتها، و DSL التوجيه إذا كنت تفضل التعبير عن سقف تكلفة في المسار بدلاً من كود التطبيق.

كلود هايكو 5.5 ليس في كتالوجنا. يمكن الوصول إليه عبر واجهة API الخاصة بـ Anthropic، والأفضل أن نقول ذلك صراحةً بدلًا من تركه ضمنيًا.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

ما الذي أصاب فيه القارئ، وما الذي ينبغي فعله به

الحدس سليم. إذا أردت أن تبدو موجة النماذج الصينية المتوسطة الرخيصة والقادرة باهظة الثمن، فهذه تقريبًا هي الورقة التي ستلعبها: ضاهاة معدل الإخراج لدى المنافس الأرخص، وخفض معدل الإدخال إلى النصف، والتقدّم بفارق 1.6 نقطة في المؤشر، وترك رقم السعر لكل مهمة مكتملة يحمل الحجة. وClaude Haiku 5.5 يفعل ذلك، ويفعله وهو أسرع بأكثر من الضعف لكل مهمة من النموذج الذي يستهدفه.

الخطأ الذي وقع فيه القارئ أضيق نطاقًا وأكثر إثارة للاهتمام. إن Terminal Bench 4.0 ليس انتصارًا؛ بل تعادل تام. وميزة السعر، عندما تُحتسب مقابل المهمة كاملة لا مقابل الرمز، تبلغ نحو السُدس بدلًا من 1.5× التي توحي بها قائمة الأسعار. والمعيار الوحيد الذي يتباعد فيه النموذجان أكثر من أي معيار آخر هو المعيار الوكيلي، حيث يتقدم GLM 5.3 Flash بـ25 نقطة.

النسخة الصادقة من الادعاء هي هذه: إن Claude Haiku 5.5 موجّه إلى فئة flash الصينية، وهو يفوز في تلك المقارنة على المؤشر المركّب، وعلى التكلفة لكل مهمة مكتملة، وعلى زمن الاستجابة، لكنه لا يفوز فيها على الأتمتة الوكيلية أو على الانفتاح، والميزة المحددة في معيار ترميز البرمجيات التي جعلت الحجة تبدو حاسمة غير موجودة.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا