
Claude Haiku 5.5 مقابل GLM 5.3 Flash: تعادل تام في الاختبار المعياري الذي يستشهد به كلا الموردين
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
إنه أيضًا الرقم الخاطئ لاتخاذ القرار بناءً عليه. ينفصل النموذجان بشكل حاد في كل مكان آخر، ونمط هذا الانفصال غير معتاد بما يكفي بحيث ينبغي أن يغيّر طريقة قراءتك لأي من الادعاءات الرئيسية لأي من المورّدين. أحدهما يفوز بالمؤشر المركّب ورقم التكلفة لكل مهمة. والآخر يفوز بكل ما يشبه عملية نشر فعلية تقريبًا.
إنها لا تُفصَل بالقدرة، بل تُفصَل بالشكل.
ابدأ بالرقم الوحيد الذي يقول "هذه من نفس فئة الطراز."
• SciCode — 0.5498 لـ Claude Haiku 5.5 مقابل 0.5162 لـ GLM 5.3 Flash. نقطتان لصالح Anthropic، على معيار يكون فيه فارق نقطتين مجرد ضجيج.
• Terminal Bench 4.0 — 0.32828 مقابل 0.32828. تعادل، بالضبط.
• نافذة السياق — مليون رمز لكلٍّ منهما.
• سعر الإخراج، الشريحة الأولى — 0.50 دولار لكل مليون رمز لكليهما.
أربعة صفوف، وأربعة تطابقات شبه تامة. إذا توقفت هنا، فستستنتج أن هذه الطُرز قابلة للتبادل وتختار بناءً على السعر. سيكون هذا الاستنتاج خاطئًا، والمجموعة التالية من الصفوف هي السبب.
حيثما تتباعد، يكون الاتجاه ثابتًا
الصفوف التي تفصل بينها فعلاً ليست متناثرة. بل تتجمّع في مجموعتين، وكل نموذج يملك مجموعة واحدة بالكامل.
تنتمي المجموعة الوكيلية إلى GLM 5.3 Flash.تقرأ النتيجة الجزئية لـ AutomationBench 0.6037 لـ GLM 5.3 Flash مقابل 0.3541 لـ Claude Haiku 5.5 — فجوة قدرها 25 نقطة، وهي أكبر فرق منفرد بين هذين النموذجين في أي قياس مشترك. تقرأ Tau-Bench Banking 0.4722 لـ GLM 5.3 Flash؛ ولا يملك Claude Haiku 5.5 أي رقم منشور في ذلك الصف. وتقرأ GPQA 0.9121 لـ GLM 5.3 Flash؛ ومرة أخرى لا يوجد رقم من Anthropic للمقارنة به. وفي المقاييس التي تخص قدرة النموذج على الحفاظ على تماسك مهمة متعددة الخطوات واستخدام الأدوات بموثوقية داخل نطاق منظم، يتقدم نموذج Z.ai بفارق يضائل فرق المؤشر المركب السائر في الاتجاه المعاكس.
مجموعة التركيب والتكلفة تنتمي إلى Claude Haiku 5.5. يقرأ مؤشر الذكاء Artificial Analysis Intelligence Index v4.3.2 قيمة 43.40 مقابل 41.81 — أي 1.59 نقطة، وهو الرقم الذي تقتبسه كل ملخصات هذه المواجهة. تبلغ التكلفة لكل مهمة مكتملة من مهام المؤشر 0.21 دولار مقابل 0.25 دولار. يبلغ الزمن الفعلي لكل مهمة مؤشر 424.6 ثانية مقابل 1,035.4 ثانية: يُنجز نموذج Anthropic المهمة في أقل من نصف الوقت.
هذا هو شكل الاختيار. Claude Haiku 5.5 أسرع، وأقل تكلفة لكل مهمة منجزة، وأعلى في الإجمالي. GLM 5.3 Flash أكثر موثوقية في فئة العمل المحددة التي تُشترى النماذج الرخيصة من أجلها.

أيّ واحد هو الذي يجب أن نصدّقه؟
لا أحدهما بمفرده — والاختلاف نفسه هو المعلومة.
مؤشر Intelligence Index هو مزيج مرجّح عبر فئات الاستدلال والعلوم والبرمجة والفئات الوكيلية. صُمّم للإجابة عن سؤال «ما مدى قدرة هذا النموذج تقريبًا» برقم واحد، وهو يؤدي هذه المهمة. لكن ما لا يستطيع فعله هو إخبارك ما إذا كان تفوق قدره 1.59 نقطة يأتي من الفئات التي يقع فيها عبء عملك أم من الفئات التي لا يلمسها أبدًا. هنا، يأتي التفوق بدرجة كبيرة من صفوف مثل SciCode وHumanity's Last Exam — 0.5498 مقابل 0.5162، و0.4439 مقابل 0.3985 — بينما يقبع عجز قدره 25 نقطة على AutomationBench بإشارة معاكسة.
فريق يبني مساعدًا للبرمجة على حلقة طرفية سيلاحظ تفوّق SciCode. وفريق يبني وكيلًا يتعيّن عليه إتمام سير عمل مصرفي من البداية إلى النهاية سيلاحظ فجوة AutomationBench، وسيلاحظها كل يوم. الفريقان ينظران إلى المؤشر نفسه، وينبغي أن يتوصّلا إلى استنتاجين متعارضين.
الخطوة العملية هي قراءة المُركّب كمرشّح لا كترتيب. إذا كان نموذجان ضمن نحو نقطتي مؤشر تقريبًا، فقد أخبرك المُركّب أنهما في النطاق نفسه، ولم يخبرك بشيء عن أيهما تختار. عند هذه النقطة، تكون الصفوف الوحيدة الجديرة بالقراءة هي تلك التي تطابق عبء عملك — وإذا لم ينشر أحد المورّدين صفًا تحتاجه، فإن غيابه هو نفسه نقطة بيانات، وليس فجوة يُملأ فيها بالافتراض.
سطر المُرمِّز الذي لا يضعه أحد في جدول المقارنة
تحتوي وثائق Anthropic نفسها على جملة واحدة تغيّر كل مقارنة أسعار تتعلق بـ Claude Haiku 5.5، ويسهل تجاوزها أثناء القراءة. يستخدم النموذج نظام الترميز الأحدث المشترك مع Claude 4.7 والإصدارات اللاحقة، وهو يعدّ النص نفسه بنحو 30% رموزًا إضافية مقارنةً بالنموذج الذي يحل محلّه.
ضع ذلك مقابل بطاقة الأسعار، وستصبح الحسابات أقل إطراءً مما يوحي به السعر المعلن. سعر الإدخال لدى Claude Haiku 5.5 هو $0.10 لكل مليون رمز مقابل $0.15 لدى GLM 5.3 Flash — ميزة تبلغ 1.5×. وإذا استهلكت 30% رموزًا أكثر لنفس المطالبة، تضيق الميزة الفعلية على النص نفسه بشكل كبير، وإن كانت لا تختفي. أسعار الإخراج متطابقة عند $0.50 في الشريحة الأولى، لذا ينطبق تأثير المُرمِّز هناك دون أي شيء يعوّضه.
النتيجة المقيسة هي النسخة الصادقة من الادعاء: وفقًا لحسابات Artificial Analysis نفسها، ولّد Claude Haiku 5.5 ما مقداره 162,164 من رموز الإخراج لكل مهمة Index مقابل 68,673 لدى GLM 5.3 Flash — أي 2.4 ضعفًا — ومع ذلك جاء بسعر 0.21 دولار لكل مهمة مكتملة مقابل 0.25 دولار. وتظل الميزة السعرية صامدة أمام الإسهاب، وما تبقى منها أقل مما تقوله بطاقة الأسعار.
واحد فقط من هذين الاثنين مُعلَنة معدلاته كسعر ثابت. يرتفع سعر Claude Haiku 5.5 بعد 100,000 رمز من المطالبة إلى 0.50 دولار للمدخلات و2.50 دولار للمخرجات؛ أما GLM 5.3 Flash فليس لديه عتبة مكافئة منشورة. بالنسبة لمعظم حركة الدردشة ومساعدة البرمجة، لا تُطبَّق هذه الزيادة مطلقًا. أما في العمل على المستندات الطويلة أو مهام الوكلاء ذات السياق الكبير، فإنها تُطبَّق باستمرار، وعند هذه النقطة تنقلب المقارنة إلى ما يتجاوز بكثير ما توحي به أرقام الفئة الأولى.

الخط الذي يحسم الأمر قبل أن تفعل أي من الأرقام ذلك
كل ما ورد أعلاه يفترض أن بإمكانك الاختيار بين هذين النموذجين بحرية. لكن شريحة كبيرة من الفرق لا تستطيع ذلك، والسبب سطر واحد في ورقة المواصفات يميل نقاش المقارنات المعيارية إلى دفنه.
GLM 5.3 Flash مفتوح الأوزان، وصادر بموجب رخصة MIT، بإجمالي 320 مليار معامل، مع 18 مليارًا نشطة منها. ويمكن تنزيله، واستضافته ذاتيًا، وضبطه الدقيق، وتكميمه، وتثبيته على إصدار معيّن، وتشغيله داخل مستأجر تتحكم به. أما Claude Haiku 5.5 فهو احتكاري ومقتصر على API، مع عدم وجود عدد معاملات منشور، ولا رخصة، ولا مستودع.
إذا كانت وثيقة متطلباتك تنص على أن النموذج يجب أن يعمل على العتاد الخاص بك، أو أن نقطة تحقق محددة يجب أن تظل قابلة للاستدعاء للسنوات الثلاث القادمة، فإن هذه المقارنة تنتهي قبل قراءة عمود السعر. هذا ليس تفصيلاً تقنياً. إنه السبب الأكثر شيوعاً الذي يجعل الفرق تنتهي عند نموذج مفتوح الأوزان من الفئة المتوسطة أصلاً، وهو السبب في أن ميزة 25 نقطة في AutomationBench ليست الشيء الوحيد الذي يشدّ في اتجاه Z.ai.
وينطبق الأمر في الاتجاه المعاكس أيضًا، ويسري الصدق نفسه. تنشر Anthropic التزامًا بتقاعد Claude Haiku 5.5 لا يسبق أكتوبر 2027، وتشغّل النموذج على واجهة برمجة تطبيقات من الطرف الأول مع بطاقة نظام ومجموعة تقييم موثّقة. إن الإصدار مفتوح الأوزان ليس أكثر استدامة تلقائيًا — فأنت ترث العبء التشغيلي إلى جانب الأوزان، وملف الترخيص ليس عقد دعم. أيّ الأمرين تريد هو سؤال عن فريقك، لا عن النماذج.
كلا الجانبين على مفتاح واحد، إن أردت حسم الأمر تجريبيًا
GLM 5.3 Flash موجود في كتالوج OrcaRouter بسعر Z.ai المعلن مع هامش ربح 0%، ويُمرَّر كما هو بدلًا من دمجه، لذا فالسعر أعلاه هو السعر الظاهر في الفاتورة، وأي تغيير يُجريه Z.ai ينعكس علينا في اليوم نفسه.Claude Haiku 5.5 ليس في كتالوجنا — يمكن الوصول إليه عبر واجهة API الخاصة بـ Anthropic — ومن الأفضل ذكر ذلك بدلًا من تركه ضمنيًا.
ما يسهّله الكتالوج بالفعل هو شكل الاختبار الذي تتطلبه هذه المواجهة فعليا. إن الخلاف بين المؤشر المركّب والصفوف الوكيلية هو فرضية بشأن عبء العمل الخاص بك، والسبيل الوحيد لحله هو تشغيل كلا النموذجين على التتبع نفسه. مع وجود GLM 5.3 Flash على المسار ووصلة Anthropic على الجانب الآخر من البوابة نفسها، يصبح ذلك تغييرًا في الإعدادات بدلًا من تكاملين — واجهة API واحدة لأكثر من 200 نموذج، ومفتاح واحد، التجاوز التلقائي للفشل تحته، ولغة التوجيه DSL عندما تريد تقسيم حركة المرور حسب فئة المهمة وقراءة التكلفة من فاتورة واحدة.

الحكم، مصاغًا بالطريقة التي تدعمه بها الأرقام
إذا كان عملك عبارة عن نص يُدخل ونص يُخرج، وتبقى المطالبات ضمن فئة التسعير الأولى، وكنت تدفع لكل رمز مقابل حجم فعلي، فإن Claude Haiku 5.5 هو النموذج الأفضل هنا: نتيجة مركّبة أعلى، وتكلفة أقل لكل مهمة مكتملة، وأسرع بأكثر من الضعف لكل مهمة. العنوان الرئيسي لـ terminal-benchmark لا يُحدث فرقًا، ولا ينبغي استخدامه لحسم أي شيء.
إذا كان عملك وكيلًا يتعيّن عليه إتمام سير عمل متعدد الخطوات دون إشراف، فإن GLM 5.3 Flash متقدّم بفارق 25 نقطة على المعيار المشترك الوحيد الذي يقيس ذلك تحديدًا، وهو الأرخص بين الاثنين من حيث التعديل لأنك تستطيع الاحتفاظ بالأوزان لديك.
التعادل عند 0.32828 هو الصورة الصحيحة لهذا الزوج، لكن ليس لأن النموذجين متساويان. إنه الصف الوحيد الذي يصدف فيه أن يقع نموذجان لا يجمع بينهما أي شيء آخر تقريبًا على الرقم نفسه — والتعامل مع ذلك الرقم كملخص للمقارنة هو الطريقة التي يُتخذ بها قرار شراء بناءً على أقل رقم إفادةً في الجدول.
