بطاقة عنوان مُولّدة تحمل النص 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next' مع عنوان فرعي 'النموذج مفتوح الأوزان ليس هو الرخيص'، وشريط مُعنون 'التكلفة لكل مهمة مكتملة في مؤشر الذكاء' ومُعلَّم بـ $0.21 لـ Claude Haiku 5.5 و$0.37 لـ Qwen3.8-Flash-Next، وسطر تذييل يحمل النص 'أرقام مستقلة وفقًا لـ Artificial Analysis؛ التسعير وفقًا لـ Anthropic وAlibaba.' ويُدمج شعار OrcaRouter الحقيقي في أسفل اليمين.
Guides & Insights

Claude Haiku 5.5 مقابل Qwen3.8-Flash-Next: نموذج الأوزان المفتوحة ليس الرخيص

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الحدس هو أن نموذجًا مفتوح الأوزان من فئة الفلاش لدى Alibaba سيقلل سعر نموذج صغير مغلق من Anthropic، وهو ما يفعله وفقًا لرقمي السعر المعلنين: Qwen3.8-Flash-Nextيُقدَّم بسعر $0.15 لكل مليون رمز إدخال و$0.47 لكل مليون رمز إخراج على واجهة برمجة التطبيقات الخاصة بـ Alibaba، مقابل $0.10 و$0.50 لـClaude Haiku 5.5. لكن إذا شغّلت كليهما مقابل نفس مجموعة الاختبارات، ينقلب الترتيب. تقيس Artificial Analysis نموذج Claude Haiku 5.5 عند Max effort بتكلفة $0.21 لكل مهمة مكتملة من Intelligence Index؛ بينما يكلف Qwen3.8-Flash-Next $0.37 في نفس القياس، مقابل نتيجة أقل بثلاث نقاط. السعر المعلن الأرخص يخص النموذج ذا الفاتورة الأكبر، والسبب هو نفسه الذي يحسم معظم هذه المقارنات: بطاقة الأسعار ليست هي السعر، والنموذج مفتوح الأوزان يكسب قوته في مكان آخر غير فاتورة واجهة برمجة التطبيقات المُدارة. وهذا "المكان الآخر" هو الموضوع الفعلي لهذه المقارنة.

ما هو كل واحد

وصل الاثنان بفارق ستة أسابيع، وهما ليسا من النوع نفسه من القطع الأثرية.

• Claude Haiku 5.5 — نموذج مغلق الأوزان صدر في 7 أكتوبر 2026، عبر Claude API وAmazon Bedrock وGoogle Cloud وMicrosoft Foundry وClaude Platform on AWS. سياق بسعة مليون رمز، وحتى 128,000 رمز إخراج على واجهة Messages API المتزامنة، وتفكير تكيّفي مع محدد جهد من منخفض إلى أقصى والافتراضي متوسط، وحدّ معرفي بتاريخ يونيو 2026، وبطاقة أسعار تتدرّج عند 100,000 رمز.

• Qwen3.8-Flash-Next — نموذج مفتوح الأوزان قائم على خليط الخبراء، صدر في 26 أغسطس 2026 بموجب رخصة qwen-community-1.0، وتصفه علي بابا بأنه معاينة تجريبية للبنية التي ستشكّل أساس Qwen4. يخزّن 125B من معاملات النموذج الرئيسي إضافة إلى جدول تضمين n-gram منفصل بحجم 51B — أي نحو 176B قبل وحدة تنبؤ متعدد الرموز بحجم 4B — ويُنشّط 6B لكل رمز، مع 512 خبيرًا، وتوجيه top-10 و48 طبقة. سياقه أصليًا 262,144 رمزًا، ويمكن توسيعه إلى 1M باستخدام YaRN، ويستقبل مدخلات نصية وصورية وفيديو.

• Qwen3.8-Flash — النظير التجاري المُقدَّم كخدمة، وهو متاح أيضًا منذ 26 أغسطس 2026 على QwenCloud من علي بابا بسعر 0.16 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مع سياق افتراضي يبلغ مليون رمز. يجدر إبقاؤه منفصلًا عن Flash-Next: فاحدهما نقطة تحقق يمكنك تنزيلها وفحصها، والآخر نقطة نهاية مُدارة مسعّرة.

التمييز بين الأخيرين هو السبب الكامل وراء كون هذه المقارنة مثيرة للاهتمام. لا يتنافس Claude Haiku 5.5 وQwen3.8-Flash-Next إلا على القليل جدًا، لأن واحدًا منهما فقط يمكن تشغيله على العتاد الخاص بك.

الفاتورة المقيسة، التي تشير في الاتجاه المعاكس

جميع الأرقام المستقلة التالية مأخوذة من Artificial Analysis على Intelligence Index v4.3.2. وبطاقات الأسعار الخاصة بـ Anthropic وAlibaba هي الأسعار المنشورة الخاصة بالمورّدين أنفسهم.

• مؤشر الذكاء — Claude Haiku 5.5 بأقصى جهد: 43، وهو الثاني بين 182 نموذجًا. وQwen3.8-Flash-Next: 40، وهو السادس بين 117 في فئته. يفصلهما ثلاث نقاط، لصالح Anthropic.

• التكلفة لكل مهمة — 0.21 دولار مقابل 0.37 دولار. النموذج الأغلى لكل رمز أرخص بنسبة 43% لكل مهمة منجزة.

• رموز الإخراج في تشغيل المؤشر — 440 مليونًا لـ Claude Haiku 5.5 و240 مليونًا لـ Qwen3.8-Flash-Next، كلاهما مقابل وسيط قدره 100 مليون. نموذج Qwen أكثر كفاءة في الكتابة ومع ذلك تظل المهمة الأغلى، مما يخبرك أن الفجوة ليست في حجم الرموز وحده بل في مزيج المدخلات والتقييم الذي يطبقه المُقيِّم.

• سرعة الإخراج — 241.9 رمزًا في الثانية مقابل 56.0. Claude Haiku 5.5 أسرع بأكثر من أربعة أضعاف وفق القياس نفسه، ووقت وصوله إلى أول رمز البالغ 295 ثانية في تلك التجربة ناتج عن التفكير عند أقصى جهد وليس رقمًا شبكيًا؛ ووقت وصول Qwen3.8-Flash-Next إلى أول رمز هو 2.53 ثانية.

• شكل بطاقة التسعير — يتدرّج Claude Haiku 5.5 من 0.10$ و0.50$ إلى 0.50$ و2.50$ عند 100,000 رمز. أما Qwen3.8-Flash فسعره ثابت عند 0.16$ و0.47$ بغض النظر عن الطول، وهو ميزة حقيقية في المطالبات الطويلة، والموضع الوحيد الذي تصمد فيه حجّة السعر المعلن عند التلامس مع مستند طويل.

• أداة التقسيم إلى رموز — يستخدم Claude Haiku 5.5 أداة التقسيم إلى رموز الأحدث المشتركة مع Claude 4.7 والإصدارات اللاحقة، لذا يُحتسب النص نفسه بما يزيد بنحو 30% من الرموز مقارنةً بـ Haiku السابق. وهذا يضخّم عدد الرموز في المطالبات نحو عتبة الـ100,000 رمز؛ وهو توثيق Anthropic الخاص، ويعمل ضد مصلحة النموذج تحديدًا في حالة المطالبات الطويلة التي يبدو فيها سعر Qwen الثابت هو الأفضل.

إذن، شكل المقايضة هو: ادفع أكثر لكل رمز، واحصل على إجابة أسرع وأذكى قليلاً تكلّف أقل لكل مهمة مكتملة، مع منحدر سعري يجب الانتباه إليه عند المدخلات الطويلة. أو ادفع أقل لكل رمز واحصل على نموذج أبطأ يكلّف أكثر لكل مهمة مكتملة، مع سعر ثابت ونافذة أصلية سعتها 262,144 رمزًا.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

حيث تُغيّر الأوزان المفتوحة الحساب فعليًا

كل ما سبق يقارن بين واجهتي برمجة تطبيقات مُدارتين، وتلك مقارنة لم يُصمَّم Qwen3.8-Flash-Next للفوز بها. حجته أنه ليس مضطرًا إلى أن يُستأجَر.

• دعم تقديم الخدمة من اليوم الأول. أطلقت SGLang صفحة دليل وصفات وصورة مخصصة؛ ولدى vLLM بناء له بينما لا يزال طلب السحب الخاص بدعم البنية مفتوحًا. وقد تحققت NVIDIA من كليهما بالإضافة إلى TensorRT LLM على رف GB300 NVL72، ويغطي NeMo الضبط الدقيق.

• الحد الأدنى من متطلبات العتاد منخفض لنقطة استعادة بحجم 176B. يمكن لجدول التضمين n-gram بحجم 51B أن يقيم في ذاكرة المضيف بدلاً من VRAM، لأن عناوين البحث الخاصة به معروفة مسبقًا ويمكن جلبها مسبقًا. وهذا ما يتيح تشغيل النموذج على عناقيد DGX Spark ومحطات عمل 4×RTX PRO 6000، كما أن التكميمات المجتمعية الصادرة في اليوم نفسه — إصدارات 1-bit تتسع في 75GB من RAM بنحو 80% من الدقة الكاملة — تضع النموذج على عتاد يملكه فريق صغير.

• الضبط الدقيق متاح. ليس بمعنى واجهة برمجة تطبيقات مستضافة للضبط: فالأوزان ملكك، بموجب ترخيص مجتمعي بالشروط المعتادة، والبنية موثّقة في تقرير فني ينشر عمليات الاستئصال والنتائج السلبية.

• النافذة أصغر مما تبدو عليه. 262,144 رمزًا أصليًا، قابلة للتوسيع إلى مليون باستخدام YaRN — مقابل مليون أصلي على Claude Haiku 5.5، دون أي تحفّظ يتعلق بـ rope-scaling. في أحمال العمل ذات المستندات الطويلة حيث يبدو سعر Qwen الثابت الأكثر جذبًا، فإن النموذج القادر فعليًا على استيعاب المستند هو الآخر.

• النتائج المعيارية مُعلَنة من الجهة المصنّعة. يضع جدول علي بابا الخاص Flash-Next في المقدمة على DeepSeek-V4-Flash-0731 في DeepSWE 1.1 (58.7 مقابل 54.4)، وSWE-bench Pro (62.5 مقابل 56.0)، وGPQA Diamond (91.7 مقابل 90.8)، ويتأخر عنه في NL2Repo-Bench (48.1 مقابل 54.2) — توليد الشيفرة على مستوى المستودع، وهو البُعد الوكيلي الوحيد الذي لا يجاريه فيه النموذج الأصغر. ولم يُعِد أي طرف ثالث إنتاج أيٍّ من ذلك، وعمر النموذج ستة أسابيع.

هذا هو الحدّ الفاصل الصادق بين الاثنين. Claude Haiku 5.5 خدمة تُحاسَب حسب الاستهلاك، بسقف جودة ثابت ولا سطح تشغيلي لها. أما Qwen3.8-Flash-Next فهو ناتج ينحدر منحنى تكلفته نحو سعر الكهرباء، وسقف جودته هو ما يمكنك تقديمه، إضافة إلى خطر جدول معايير أداء لم يُعَد إنتاجه ومعمارية لا تزال بيئات التشغيل تستوعبها.

الطريقة الواقعية لاتخاذ القرار

ثلاثة أسئلة تحسم الأمر، والأول فقط منها يتعلق بمعايير القياس.

هل لديك وحدات GPU، أو ترغب في الحصول عليها؟ إذا لم يكن الأمر كذلك، فإن حالة الاستضافة الذاتية نظرية وتظل المقارنة المُدارة أعلاه هي القصة كاملة — وتذهب الغلبة إلى Claude Haiku 5.5 من حيث التكلفة لكل مهمة والسرعة والنتيجة، مع التحفظ بأن خطوته البالغة 100,000 توكن تُعاقب المطالبات الطويلة. أما إذا كانت لديك مسرّعات لا تصل إلى هدف الاستخدام المطلوب، فإن Qwen3.8-Flash-Next يُعد أحد النماذج المفتوحة القليلة التي يكون فيها فك ترميز 6B بمعاملات نشطة رخيصًا حقًا عند التشغيل بكميات كبيرة، ويتوقف رقم 0.37 دولار لكل مهمة عن كونه الرقم ذا الصلة.

ما متوسط طول المُوجّه؟ هذا هو المكان الوحيد الذي تصحّ فيه حجة السعر المعلن. في أقل من 100,000 رمز — بعد مُرمِّز يضخّم العدد بنحو 30% — يكون Claude Haiku 5.5 أرخص على كل مقياس. وفوق ذلك، فإن السعرين الثابتين $0.16 و$0.47 هما الخيار الأفضل، وتتسع ميزته مع الطول وصولًا إلى النافذة الأصلية البالغة 262,144 رمزًا، وبعدها يصبح تمديد YaRN مشكلة هندسية مختلفة.

ما مدى تحمّل عبء العمل لتفاوت زمن الاستجابة؟ يمثّل 241.9 رمز إخراج في الثانية مقابل 56.0 فجوة كبيرة، ويضيف النشر بالاستضافة الذاتية اصطفافًا إليها. وكيل دعم مباشر أو وكيل يقود المتصفح — وهما من أعباء العمل التي تسمّيها Anthropic لهذه الفئة — سيشعر بالفرق.

لكل من يريد الإجابة عن السؤالين الثاني والثالث بدلًا من التفكير فيهما نظريًا، فإن أرخص أداة هي نقطة نهاية مشتركة. لا يزال Qwen3.8-Flash-Next غير موجود في كتالوج OrcaRouter، وكذلك Claude Haiku 5.5؛ أما النموذج الشقيق من Qwen الذي نوجّهه فعلًا فهو Qwen3.8-Flash، بسعر القائمة لدى المزوّد مع تمرير هامش ربح بنسبة 0%، وهو أقرب مكافئ مُقدَّم عبر الخدمة للنموذج في هذه المقارنة والأساس الصحيح لاختبار تكلفة المطالبات الطويلة. وعلى جانب Anthropic، يمكن اليوم استدعاء Claude Haiku 4.5 وClaude Sonnet 5.5 وClaude Opus 5.5 جميعها من المفتاح نفسه، لذا فإن تجربة تسعير تمتد على جيلين هي إعداد لا عقد ثانٍ — ولأن التسعير قائم على التمرير لا على الدمج، فإن أي تخفيض من المورّد على أيٍّ من الطرفين يظهر عندنا في اليوم نفسه الذي يُعلَن فيه. والتجاوز التلقائي عند الفشل هو ما يجعل تشغيل التجربة آمنًا على حركة مرور حقيقية: فنموذج معاينة أو جدول معايير غير مُعاد إنتاجه هما بالضبط الحالة التي تستدعي توجيه مسار نحو شيء جديد بينما يبقى نموذج موثوق خلفه.

ما الذي سيغيّر الإجابة؟

أمران، كلاهما قابل للتحقق. الأول هو تقييم مستقل لـ Qwen3.8-Flash-Next على منصة اختبار تشغّل أيضًا Claude Haiku 5.5 — جدول المورّد مقابل DeepSeek، ونتيجة 40 على اللوحة المستقلة هي موضع واحد. درجة البرمجة على مستوى المستودع هي الصف الذي يجب مراقبته، لأن NL2Repo هو حيث ثبت بالفعل أن النموذج متأخر. الثاني هو ما إذا كان العمل على زمن التشغيل ينجح: دعم vLLM لا يزال يُدمج عبر طلبات سحب مفتوحة، وإلى أن يحدث ذلك، فإن استضافة هذه البنية ذاتيًا هي تمرين للفرق التي تستمتع بهذا النوع من الأمور وليس مسارًا مدعومًا.

حتى ذلك الحين، الملخص قصير. Qwen3.8-Flash-Next هو النموذج الأكثر إثارة للاهتمام لامتلاكه والأغلى لاستئجاره. Claude Haiku 5.5 هو نقطة النهاية المُدارة الأرخص والأسرع والأعلى تقييمًا، مع بطاقة أسعار تعاقب أي شيء طويل. اختر بناءً على ما إذا كنت تشتري الرموز أم تشتري نقطة حفظ — وإذا كنت تشتري الرموز، لاحظ أن النموذج مفتوح الأوزان ليس الخصم الذي افترضته.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.