بطاقة رئيسية بعنوان "Claude Haiku 5.5 مقابل Ling 3.1 Flash" يعلوها سطر "560B من المعلمات، بلا أوزان"، مع مقارنة Index مقابل AutomationBench تقرأ 0.3541 مقابل 0.6174، وسطر تكلفة يقرأ $0.21 لكل مهمة مقابل $0.99 لكل مهمة، وسطر زمن يقرأ 424.6s لكل مهمة مقابل 360.4s لكل مهمة.
Engineering & Research

كلود هايكو 5.5 مقابل لينغ 3.1 فلاش: نموذج بـ560 مليار معامل يكلف أربعة أضعاف لكل إجابة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يفصل بينهما ستة أيام. أطلقت InclusionAI Ling 3.1 Flash في 1 أكتوبر 2026؛ وأطلقت الشركة المورّدة Claude Haiku 5.5 في 7 أكتوبر. يُباعان بوصفهما نموذجين من فئة فلاش، وكلاهما يحمل نافذة سياق تبلغ مليون رمز، وفي صفوف الاستدلال في اللوحة المستقلة الوحيدة التي شغّلت كليهما هما قريبان جدًا لدرجة أن الفرق داخل الضجيج. ثم تصل إلى الصف الذي يقيس ما إذا كان الوكيل يُنجز المهمة فعليًا، ويفصل بينهما 26 نقطة — وإلى الصف الذي يقيس تكلفة إنجاز المهمة، حيث يبلغ سعر النموذج ذي الـ560 مليار معامل أربعة أمثال ونصف سعر النموذج الذي لم ينشر أحد عدد معاملاته.

لا تتوقّع أيٌّ من بطاقتَي الأسعار ذلك. يُدرَج Ling 3.1 Flash بسعر 0.30 دولار لكل مليون رمز إدخال و0.90 دولار لكل مليون رمز إخراج. ويُدرَج Claude Haiku 5.5 بسعر 0.10 و0.50 للمطالبات حتى 100,000 رمز، ثم يرتفع إلى 0.50 و2.50 فوق ذلك. وإذا قُرئ ذلك كسعر لكل رمز، فإن Ling يكلّف ثلاثة أضعاف على الإدخال وأقل قليلاً من الضعف على الإخراج، وهي الفجوة التي تُنهي المقارنة في سطر واحد.

لا يُنهي هذا الأمر، لأن بطاقة الأسعار تُسعَّر لكل رمز، والقرار يُسعَّر لكل مهمة. يخرج هذان الرقمان من هذه المقارنة بإشارتين متعاكستين، والسبب ليس الإسهاب.

ما تكلّفه مهمة منجزة، لا ما يكلّفه الرمز.

على مؤشر Artificial Analysis Intelligence Index v4.3.2، تبلغ التكلفة المقاسة لإكمال مهمة مؤشر كاملة واحدة 0.21 دولار لـ Claude Haiku 5.5 و0.99 دولار لـ Ling 3.1 Flash. وهذا فارق يبلغ 4.6× — أوسع من نسبة المدخلات البالغة 3×، وفي الاتجاه نفسه.

التفسير البديهي — أن النموذج الأغلى يتحدث أكثر — هو التفسير الخاطئ. فقد ولّد Ling 3.1 Flash عدد 100,671 رمزًا مخرَجًا لكل مهمة فهرسة؛ بينما ولّد Claude Haiku 5.5 عدد 162,164. النموذج الأرخص هو الأكثر ثرثرة، بأكثر من 60%. لذا فالمال لا يذهب أيضًا إلى حيث توحي بطاقة الأسعار.

قسّم التكلفة لكل مهمة، وستجد أنها تقع حيث تنفق منهجية المؤشر فعليًا. من أصل $0.21 لـ Claude Haiku 5.5، نحو 62% منها على جانب الإدخال؛ ومن أصل $0.99 لـ Ling 3.1 Flash، نحو 91% منها كذلك. هذه عمليات تشغيل استدلالية كثيفة الاعتماد على التخزين المؤقت، ويسعّر المورّدان توكن إدخال مخزّنًا مؤقتًا بشكل مختلف جدًا: $0.01 لكل مليون لـ Claude Haiku 5.5 مقابل $0.06 لكل مليون لـ Ling 3.1 Flash — فارق بمقدار 6× في البند الوحيد الذي يسيطر على الفاتورة. تقارن بطاقة الأسعار المنشورة $0.10 بـ $0.30. أما البند الذي يحدد الفاتورة فيقارن $0.01 بـ $0.06.

يُمرِّر كتالوجنا الخاص أسعار القوائم لدى المزوّدين بهامش 0%، وهكذا يمكنك التمييز بين الحالتين على فاتورة فعلية لا على نموذج محاكاة. ولا يتضمّن الكتالوج Ling 3.1 Flash بأي صيغة من مسار مورّده تمكّنا من تحديدها — لا تحت InclusionAI، ولا تحت Ling، ولا تحت أي من الصيغ الثماني التي جرّبناها — لذا فإن 0.30 دولار و0.90 دولار المذكورين أعلاه هما السعران المعلنان من المورّد، ولا يمكننا توجيه أيٍّ منهما لك اليوم. كما أن Claude Haiku 5.5 ليس على الكتالوج؛ فهو يعمل عبر واجهة Anthropic الخاصة. وما يحمله الكتالوج فعلًا من هذه المقارنة هو GLM 5.3 Flash وDeepSeek V4.1 Flash وQwen3.8 Flash وGemini 3.8 Flash، كلٌّ بسعر قائمة المزوّد بهامش 0%، بحيث يصل أي تغيير في أسعار المورّد إلى جانبنا في اليوم نفسه الذي يصل فيه إليهم. وإذا خلصت النتيجة أدناه إلى أن ملف Ling 3.1 Flash الوكيلي هو ما تحتاجه أحمال عملك، فإن الخطوة العملية التالية هي مواجهة مباشرة مع النماذج القادرة على العمل الوكيلي التي نوفّرها فعلًا، على مفتاح واحد مع تحويل تلقائي عند الفشل في الخلفية، واستخدام لغة توجيه (routing DSL) عندما يكون سقف التكلفة جزءًا من المسار لا من شيفرة التطبيق.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

سبعة صفوف حيث تم قياس كليهما

تُعد Artificial Analysis اللوحة الوحيدة التي شغّلت كلا النموذجين، والتداخل ضيّق لكنه مفيد. لا تتفق الصفوف مع بعضها، وليس اتجاه الاختلاف عشوائياً.

• Intelligence Index v4.3.2 — 43.40 لـ Claude Haiku 5.5 (Max) مقابل 41.09 لـ Ling 3.1 Flash. تقدم بـ 2.31 نقطة لصالح Anthropic.

• تكلفة كل مهمة Index منجزة — 0.21 دولار مقابل 0.99 دولار على نفس اللوحة.

• الوقت لكل مهمة في Index — 424.6 ثانية لـ Claude Haiku 5.5 مقابل 360.4 ثانية لـ Ling 3.1 Flash. هذا هو الصف الذي ينكسر عنده التوقع: النموذج ذو الـ560 مليار معامل هو الأسرع بين الاثنين على مستوى المؤشر ككل، بنحو 15%.

• Terminal Bench 4.0 — 0.3283 مقابل 0.3333. Ling 3.1 Flash متقدم بنصف نقطة، وهو يُعد تعادلًا على معيار يستشهد به كلا الموردين.

• SciCode — 0.5498 مقابل 0.5405. Claude Haiku 5.5 بفارق 0.9 نقطة. أيضًا تعادل.

• Humanity's Last Exam، بدون أدوات — 0.4439 مقابل 0.3943. Claude Haiku 5.5 بفارق 5 نقاط، أول تمايز حقيقي.

• AutomationBench، نتيجة جزئية — 0.3541 مقابل 0.6174. Ling 3.1 Flash بفارق 26 نقطة، وبهامش أوسع من كل الفجوات الأخرى في هذه القائمة مجتمعة.

يوجد صفّان إضافيان خارج تلك المجموعة المشتركة ويستحقان الإدراج، لأنهما الأكثر ملاحظة من قِبل المشترين. في GDPval-AA، الذي تشغّله Artificial Analysis عبر 44 مهنة، يبلغ الرقمان 1620.05 و1621.75 — تعادل إحصائي تام. وفي AA-Briefcase v1.1، وهو تقييم للعمل المهني طويل النصوص مصنّف وفق Elo، يسجّل Claude Haiku 5.5 نتيجة 1577.72 مقابل 1400.35 لـ Ling 3.1 Flash، أي فجوة قدرها 177 نقطة لصالح Anthropic. وهذه أوسع فارق غير وكيلي بينهما في أي مكان على اللوحة.

الصف الوحيد الذي ينبغي أن يحسم معظم هذه المحادثات

المتوسطات على مستوى المؤشر تُخفي أين ذهب الوقت والمال فعلاً، وهذا الثنائي هو أوضح مثال على ذلك في الدفعة. الأرقام لكل تقييم على Terminal Bench 4.0 ليست متقاربة في أي بُعد باستثناء النتيجة.

• Terminal Bench 4.0، Ling 3.1 Flash — 0.3333 بتكلفة 5.49 دولار لكل مهمة و1,283 ثانية لكل مهمة.

• Terminal Bench 4.0، Claude Haiku 5.5 — 0.3283 بتكلفة 0.65 دولار لكل مهمة و908 ثانية لكل مهمة.

تفصل بينهما خمسة أجزاء من الألف من نقطة في النتيجة. التكلفة 8.4× والزمن الفعلي 1.4×. الفريق الذي يقرأ جدول المعايير ويختار النموذج الذي يسجل 0.3333 قد اختار، وفق حسابات Artificial Analysis نفسها، أن يدفع ثمانية أضعاف المبلغ ليصل بعد ثلث دقيقة بالإجابة نفسها.

هذه ليست حجة على أن الدرجة بلا معنى؛ بل هي حجة على أن الدرجة نسبة العمل المنجز إلى العمل المحاول، وهي لا تقول شيئًا عن الموارد المستهلكة للوصول إلى هناك. ومعايير إتمام المهام الوكيلة هي بالضبط السياق الذي يكون فيه هذا التمييز أشدّ وقعًا، لأن الوكيل الذي يعيد المحاولة هو وكيل يدفع الثمن كاملًا عند كل إعادة محاولة، والنموذج الذي تكلّف المحاولة الواحدة معه ثمانية أضعاف يحوّل حلقة إعادة المحاولة إلى بند في الميزانية.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

الـ 560 مليار معامل دون أي شيء لتنزيله

هذا هو الجزء الغريب حقًا في ورقة مواصفات Ling 3.1 Flash، وهو ليس الحجم.

Ling 3.1 Flash هو نموذج خليط خبراء متناثر — إجمالي 560 مليار معلمة، و25 مليارًا نشطة لكل رمز — ويصنّفه Artificial Analysis على أنه مملوك. لا توجد أوزان، ولا ملف ترخيص، ولا مستودع. عادةً ما يصدر نموذج متناثر كبير بهذا الشكل كإصدار مفتوح، لأن هذا ما تفعله بقية هذه الفئة: يوفّر GLM 5.3 Flash أوزان MIT بإجمالي 320 مليارًا و18 مليارًا نشطة، ويوفّر DeepSeek V4.1 Flash أوزان MIT بإجمالي 552 مليارًا و16 مليارًا نشطة. Ling 3.1 Flash هو من الفئة نفسها من المعمارية وبالرتبة نفسها من حيث الحجم، لكنه منشور كواجهة برمجية (API) فقط.

لهذا الاختيار نتيجة لا تُظهرها صفوف المعيار. يجب تقديم نموذج بـ25 مليار معامل نشط في مكان ما، وإذا لم تستطع الاحتفاظ بنقطة التحقق، فلا يمكنك اختيار أين أو بأي هامش ربح — فأنت تستأجر خدمة تقديمه من البائع. سعر مهمة Terminal Bench البالغ 5.49 دولارًا أعلاه ليس في الأساس ناتجًا عن معدل الرموز؛ بل هو تكلفة استئجار نموذج متناثر كبير من الطرف الوحيد القادر على تشغيله. تمنحك النماذج الشقيقة ذات الأوزان المفتوحة في هذه الفئة خيار تحريك هذا الرقم بنفسك.

إنها تقطع الاتجاه الآخر أيضًا، وينطبق الصدق نفسه. الإصدار المفتوح ليس تلقائيًا المنتج الأفضل: فأنت ترث عبء التقديم، وخيارات التكميم، ودوامة الترقية مع الأوزان، وملف الترخيص ليس عقد دعم. تنشر Anthropic التزامًا بتقاعد Claude Haiku 5.5 في موعد لا يسبق 7 أكتوبر 2027، على API من طرف أول مع بطاقة نظام. أي هذين الترتيبين تريد هو سؤال يتعلق بفريقك، لا بأي من النموذجين.

فيمَ يُستخدم Ling 3.1 Flash

اقرأ الملف التعريفي كاملًا، فهو يصف منتجًا متماسكًا لا منتجًا منقوصًا: نموذجًا كبيرًا ومتخلخلًا وطويل السياق يُنجز مسارات العمل المستقلة متعددة الخطوات أفضل من أي شيء آخر قيس في نطاق السعر هذا، وهو غير لافت في الاستدلال الصعب أحادي المحاولة، ويفعل ذلك بسعر ثابت دون انحدار مفاجئ عند طول المُوجّه. في AutomationBench، يتقدم بفارق 26 نقطة على Claude Haiku 5.5، ودرجته في AA-Briefcase هي النقطة الوحيدة في هذه المقارنة التي يقف فيها خلف منتصف الميدان بدلًا من مقدمته.

هذا وصف يمكن الدفاع عنه لعامل وكيلي دفعي: وجّهه إلى قائمة انتظار من المهام المنظمة التي يجب إكمال كل منها، واقبل أن المهمة تُقاس بالدقائق، وأبقِ الموجّه طويلاً بما يكفي بحيث تصبح خطوة العتبة عقابية، وقدّر الموثوقية عند خط النهاية فوق تكلفة أي رمز واحد. ما لا يجيده هو الشيء الذي عادةً ما تُشترى من أجله نماذج فئة الفلاش. إنه يقبل النص فقط — لا مدخلات صور على الإطلاق، بينما يستقبل Claude Haiku 5.5 النص والصور. زمن مهمة الفهرس لديه أقصر، لكن زمن مهمة Terminal Bench لديه أطول، وبسعر 0.99 دولار لكل مهمة فهرس منتهية مقابل 0.21 دولار، فإنه ينفق أربع مرات ونصف للوصول إلى نفس النتيجة المركبة تقريباً.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

أيّهما، بناءً على الأدلة الموجودة

إذا كان عملك نصًا يدخل ونصًا يخرج، ويُسعَّر لكل رمز عند الحجم الكبير، فإن Claude Haiku 5.5 يتفوق في هذه المقارنة في كل بند يصل إلى الفاتورة: تكلفة مهمة أقل على المؤشر، وتكلفة مهمة حقيقية أقل على المعيار الأكثر أهمية للوكلاء، ودرجة مركّبة أعلى، ونتائج أفضل في الأعمال الاحترافية الطويلة، ودقة أعلى، وإدخال للصور لا يوفره النموذج الآخر على الإطلاق.

إذا كان عملك وكيلًا يعمل دون إشراف ويتعين عليه إكمال سير عمل متعدد الخطوات، فإن Ling 3.1 Flash يسجل أعلى بـ26 نقطة من Claude Haiku 5.5 في المقياس المعياري المشترك الوحيد الذي يقيس ذلك تحديدًا، وهذا يستحق الاختبار بدلًا من رفضه بسبب السعر. اختبره على سجل تتبعك الخاص، لا على هذا الجدول — وسعّر الاختبار لكل مهمة مكتملة، لأن هذا هو الرقم الذي يتغير عندما يعيد الوكيل المحاولة.

إذا كنت بحاجة إلى الاحتفاظ بالأوزان، فلا أيٌّ من هذين هو نموذجك. Ling 3.1 Flash احتكاري بـ560 مليار معامل؛ Claude Haiku 5.5 احتكاري دون عدد منشور. الإصدارات المفتوحة في هذه الفئة موجودة في مكان آخر على اللوحة، وتبدأ تلك المقارنة من مجموعة صفوف مختلفة تمامًا.

يقول المؤشر المركّب إن النتيجة 2.31 نقطة. ويقول المعيار الوكيلي إنها 26 في الاتجاه المعاكس. وتقول بطاقة الأسعار إنها 3× على المدخلات؛ بينما تقول تكلفة المهام المنجزة إنها 4.6× في الاتجاه نفسه الذي تشير إليه البطاقة. أربعة أرقام، واتجاهان — ولهذا فإن الطريقة الموثوقة الوحيدة لحسم هذا هي تشغيل كليهما على أثر من عملك أنت، وقراءة التكلفة من المهام المكتملة لا من التوكنات.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا