
Qwen3.8-Flash-Next متاح الآن: علي بابا تطرح بنية Qwen4 قبل وجود Qwen4
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 84 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
أخيرًا بات لدى Qwen3.8-Flash-Next أرقام لم تُنتجها Alibaba — وهي لا تقول ما تقوله النسخة الأعلى صوتًا من القصة. في Artificial Analysis Intelligence Index، بعد إعادة إصداره وفق الإصدار v4.3 في 7 سبتمبر، تحصل المعاينة مفتوحة الأوزان من Alibaba على 40 نقطة وتحتل المرتبة الخامسة بين 113 نموذجًا في فئة المقارنة الخاصة بها. أما DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — النموذج الذي يظل يُقاس به — فيحصل على 35 نقطة ويحتل المرتبة التاسعة. هذا ليس تعادلًا؛ بل تقدم بخمس نقاط للنموذج الأصغر. وهو أيضًا أول لوحة نتائج شاملة ومستقلة تصل إلى نموذج كانت أرقامه المنشورة الوحيدة، حتى هذا الشهر، صادرة عن البائع نفسه. النموذج نفسه ليس جديدًا: فقد نُشرت الأوزان على Hugging Face في 24 أغسطس، وصدر الإصدار الرسمي على ModelScope في 26 أغسطس. ما تغيّر هذا الشهر هو أن القارئ يمكنه الآن التحقق من الادعاءات بدلًا من مجرد الأخذ بها.
جاء الدافع لإعادة النظر في هذا المنشور من @teortaxesTex على X، الذي تساءل عمّا إذا كانت المعاينة مُبخَّسةً بهدوء: يُفترض أنها على نفس فئة Artificial Analysis الخاصة بـ DeepSeek V4 Flash 0731، و«أصغر بنحو 4 أضعاف تقريبًا»، مع «معاملات نشطة أقل بنحو 3 أضعاف تقريبًا». اثنتان من هذه الادعاءات الثلاث لا تصمدان أمام البيانات المنشورة — والتصحيح يصب في مصلحة النموذج، لأنه وفق الأرقام المهمة تكون المعاينة متقدمة على ما تُقارَن به، لا على مستواه.
ابدأ بالحجم، حيث تكون الأرقام لا لبس فيها. يخزّن Qwen3.8-Flash-Next نحو 180B من المعلمات — هيكل مزيج خبراء بحجم 125B، وجدول تضمين n-gram منفصل بحجم 51B، ونحو 4B من طبقات التنبؤ متعدد الرموز — ويُفعّل 6B منها لكل رمز. يخزّن DeepSeek V4 Flash 0731 عدد 284B ويُفعّل 13B. هذه هي الأرقام الواردة في بطاقة نموذج Qwen ووثائق DeepSeek، وهي الأرقام التي يعرضها Artificial Analysis على صفحتي كلا النموذجين. النسب التي تنتجها هي 1.6x في المعلمات المخزّنة و2.2x في المعلمات النشطة. هذه قصة كفاءة حقيقية، وهي السبب في أهمية هذه البنية — لكنها ليست 4x ولا 3x. لم نتمكن من العثور على أي رقم منشور يدعم المضاعفات الأكبر. إذا كان المقصود هو بصمة الذاكرة أثناء الخدمة بدلاً من عدد المعلمات، فإن ذلك الرقم غير منشور أيضًا.
ما الذي تم الإعلان عنه؟
نشرت Alibaba معمارية Qwen4 قبل أن تنشر نموذج Qwen4. Qwen3.8-Flash-Next — وهو نموذج مزيج خبراء متعدد الوسائط مفتوح الأوزان، مبني على المعمارية من الجيل التالي التي ستشغّل عائلة Qwen4 — صدر على خطوتين: المستودع الرسمي Qwen/Qwen3.8-Flash-Next أصبح متاحًا على Hugging Face في 24 أغسطس، قبل يومين من إصدار ModelScope الذي كان مؤقّت التشويق يشير إليه. حلّ الإطلاق الرسمي على ModelScope في 26 أغسطس الساعة 23:00 بتوقيت UTC+08:00، مع تسعير نسخة Qwen3.8-Flash المقدمة في الوقت نفسه. الادعاء الرئيسي في البطاقة، الذي لا يزال متداولًا منذ ذلك الحين، هو أن نموذجًا ينشّط 6 مليارات معلمة لكل رمز يتفوق على Claude Opus 4.6 Max في 8 من 9 معايير قابلة للمقارنة في جدول Alibaba الخاص. عائلة Qwen4 الكاملة، كما يكرر Alibaba قوله، ستأتي لاحقًا.
إذا لم تكن تتابع وتيرة Alibaba هذا الشهر، فالمحور هو Qwen3.8-Max — الطراز الرائد البالغ 2.4 تريليون معلمة، الذي صدر في 3 أغسطس وأُتيح مفتوح المصدر باسم Qwen3.8-2.4T-A95B بعد أقل من أسبوعين. ثم صدرت أوزان Qwen3.8-Flash-Next بعد ذلك بأقل من شهر. المختبر نفسه الذي أطلق نموذجاً مفتوح الأوزان بمعلمات تبلغ 2.4 تريليون يوزّع الآن معمارية الجيل الذي يليه، قبل أن يُسمّى الطراز الرائد لذلك الجيل حتى.

الجزء الجدير بإعادة القراءة هو صياغة Alibaba نفسها. يوصَف النموذج بأنه مبني على معمارية الجيل التالي «التي ستشغّل عائلة Qwen4 القادمة» — وبشكل صريح لا بأنه Qwen4 نفسه. والسبب الذي أعلنته Alibaba هو أن التغييرات المعمارية ينبغي أن تكون بين يدي المجتمع قبل وصول العائلة، حتى تكون بيئات التشغيل وعمليات التكميم والتطبيقات جاهزة عند إطلاق الإصدار الحقيقي. هذا موقف تسويقي، لكنه أيضًا التزام تقني: قدّم الجزء الصعب أولًا، واصطحب المجتمع معك.
ما الذي تحسمه بطاقة النموذج، وما الذي لا تحسمه:
• مؤكد، وفقًا لبطاقة النموذج الرسمية: Qwen3.8-Flash-Next هو نموذج مفتوح الأوزان، متعدد الوسائط، ومزيج من الخبراء على بنية Qwen4 — وتصفه البطاقة بأنه "معاينة تجريبية للبنية التي سترتكز عليها Qwen4."
• تم التأكيد، وفقًا لبطاقة النموذج والإعدادات: تغييران معماريان رئيسيان — شبكة دلتا ذات البوابة (GDN) وانتباه Qwen المتناثر (QSA) — داخل هجين من 48 طبقة يشغّل 36 طبقة انتباه خطي مقابل 12 طبقة انتباه كامل.
• مؤكد من المستودع: 125 مليار معامل إجمالي مع تنشيط 6 مليارات لكل توكن (512 خبيرًا، 10 موجهين بالإضافة إلى خبير مشترك واحد) — تُدرج Artificial Analysis 180 مليارًا عند احتساب جدول تضمين n-gram المنفصل بسعة 51 مليارًا وطبقات MTP — مع سياق أصلي بطول 262,144 توكنًا قابل للتمديد إلى 1,000,000 بموجب ترخيص Qwen Community License 1.0.
• لم يعد غير مؤكَّد: فقد جرى الآن تقييم النموذج بشكل مستقل، مرتين. لا يزال جدول Alibaba خاصًّا بالمورّد نفسه ولا يزال غير مُعاد إنتاجه، لكنه لم يعد الدليل الوحيد الموجود.
ظهرت أولى النتائج المستقلة — وهي تقول «متقدّم»، لا «متعادل».
أصدرت Artificial Analysis مؤشر Intelligence Index v4.3 في 7 سبتمبر، وإعادة التقييم هي السبب في أن أيًا من هذا قابل للمقارنة على الإطلاق. استبدل تحديث v4.3 الإصدار Terminal-Bench v2.1 بـ Terminal-Bench v4.0 الأكثر صعوبة بكثير، واستبدل τ³-Banking بـ AutomationBench-AA، وهو معيار لسير العمل الوكيلي بُني مع Zapier على مجموعة اختبار خاصة محجوزة من 657 مهمة. ارتفع ترجيح الاختبار الخاص المحجوز إلى 45%. كان الغرض المعلن هو منع الطرز الحدودية من التلاعب بالمؤشر، وكان التأثير على الدرجات كبيرًا: هبط كل من GPT-6 Astra وClaude Fable 5.1، المتصدرين، عند 53 بعد أن كانا يُقيَّمان في الستينيات على المقياس القديم.
هذا مهم عند قراءة أرقام المجتمع. أرقام «56 مقابل 52» التي تداولت بشأن Qwen3.8-Flash-Next وDeepSeek V4 Flash 0731 في أوائل سبتمبر حُسبت على مؤشر pre-v4.3؛ وفي ظل v4.3 يستقر هذان الرقمان عند 40 و35. اقتباس أي من المجموعتين مقابل الأخرى هو مقارنة بين اختبارين مختلفين.
في المؤشر الحالي، إليك كيف يتقارن النموذجان فعليًا في تقييمات Artificial Analysis الخاصة:
• مؤشر الذكاء — Qwen3.8-Flash-Next 40 (الخامس من 113 في الفئة) مقابل DeepSeek V4 Flash 0731 (الاستدلال، أقصى جهد) 35 (التاسع من 113).
• العمل المعرفي الوكيلي — AA-Briefcase 1587 مقابل 1259؛ GDPval-AA v2 1647 مقابل 1468؛ AutomationBench-AA 56% مقابل 54%.
• الطرفية والبرمجة — Terminal-Bench v4.0 25% مقابل 12%؛ SciCode 51% مقابل 50%.
• الاستدلال العام والعلمي — Humanity's Last Exam 38% مقابل 39%؛ CritPt 11% مقابل 17%؛ GDP.pdf 16% مقابل 11%؛ AA-LCR v1.1 80% مقابل 80%.
• استرجاع الحقائق مقابل الاختلاق — AA-Omniscience −10 مقابل −14، بفارق أربع نقاط لصالح معاينة Qwen.
• السعر — 0.15 دولار لكل مليون توكن إدخال / 0.47 دولار لكل مليون توكن إخراج مقابل 0.44 / 1.32 دولار؛ وبمعدل مدمج 0.0882 دولار لكل مليون توكن مقابل 0.2298 دولار. التكلفة لكل مهمة في مؤشر الذكاء: 0.37 دولار مقابل 0.22 دولار.
• السرعة وزمن الاستجابة — 53 رمز إخراج في الثانية مقابل 210؛ الزمن حتى أول رمز 2.80 ثانية مقابل 0.98 ثانية؛ الاستجابة من البداية إلى النهاية 49.76 ثانية مقابل 12.88 ثانية؛ الوقت لكل مهمة 1,572.60 ثانية مقابل 221.65 ثانية.
• استخدام الرموز — 108 آلاف رمز إخراج لكل مهمة مقابل 62 ألفًا، منها 72 ألفًا رموز استدلال مقابل 45 ألفًا. وتصف Artificial Analysis المعاينة بأنها «مطوّلة جدًا» و«أبطأ من المتوسط».
• السياق والحجم — 256 ألف توكن مقابل 1,000 ألف؛ إجمالي 180 مليار / 6 مليار نشط مقابل 284 مليار / 13 مليار.
عند قراءتهما معًا، تكون تلك إجابة أكثر حِدّة من «الفئة نفسها». يحسم Qwen3.8-Flash-Next جدل الدقة والكفاءة على كل محور تقريبًا يقيسه Artificial Analysis — فهو النموذج الأعلى تسجيلًا، وهو أصغر، وتكلفته لكل توكن نحو الثلث. ويحسم DeepSeek V4 Flash 0731 جدل الإنتاج بامتياز: إنتاجية أربعة أضعاف، وربع زمن الاستجابة من طرف إلى طرف، وزمن فعلي أقل بسبع مرات لكل مهمة مكتملة، ونافذة سياق أربعة أضعاف. وعلى التكلفة لكل مهمة مكتملة — الرقم الذي يصمد أمام إسهاب التوكنات — فإن DeepSeek هو النموذج الأرخص عند $0.22 مقابل $0.37، رغم سعره المعلن الأعلى. إذا كان «أقل ترويجًا مما يستحق» يعني «أفضل من سمعته في الجودة لكل معامل»، فالوصف منصف. وإذا كان يعني «ينبغي أن تشغّل هذا بدلًا منه»، فإن عمودي السرعة وزمن الاستجابة يقولان عكس ذلك.

وهناك أيضاً أدلة مستقلة خارج Artificial Analysis. فقد نشرت منصة اختبار تابعة لطرف ثالث، smf-bench، تشغيلاً بعنوان «Official A» في 5 سبتمبر: سجّل Qwen3.8-Flash-Next، بتكميم NVFP4 من NVIDIA على جهاز DGX Spark واحد، مع تعطيل التفكير، 137 من 157 (87.3%) مع نتيجة نظيفة 30 من 30 في قسم البرمجة لديه، مقابل 117 من 157 لتشغيل two-Spark DeepSeek V4 Flash Vision-Exp على نفس منصة الاختبار المكوّنة من 157 اختباراً. هذه منصة اختبار واحدة على فئة أجهزة واحدة، وهي ليست بديلاً عن تقييم واسع — لكنها نقطة بيانات ثانية تشير في الاتجاه نفسه، وتأتي من شخص لا مصلحة له لدى أي من المورّدين.
ما هي بنية Qwen4 في الواقع؟
تحمل آليتان القصة. الأولى، GDN — شبكة دلتا المبوّبة — هي طبقة الانتباه الخطي الخاصة بـ Alibaba. بينما يحتفظ المحوّل القياسي بذاكرة مؤقتة للمفاتيح والقيم تنمو مع طول التسلسل، تحافظ طبقة GDN على حالة متكررة ثابتة الحجم وتحدّثها بقاعدة بوّابات متعلّمة؛ ويمتد النسب عبر DeltaNet و Mamba-2. العائد هو ما كان يغذّي خط Qwen بهدوء منذ Qwen3-Next: تبقى السياقات الطويلة منخفضة التكلفة لأن الحالة لا تنمو، بينما تبقى أقلية من طبقات الانتباه الكامل في المزيج للقيام بالاسترجاع الدقيق الذي يكون الانتباه الخطي ضعيفاً فيه. في الجيل الحالي، يعمل هذا المزيج بنحو ثلاث طبقات GDN مقابل كل طبقة انتباه كامل — ويحصي تحليل مجتمعي لنقطة تفتيش Qwen3.8-2.4T-A95B 69 طبقة GDN مقابل 23 طبقة انتباه. يُظهر Qwen3.8-Flash-Next نفس التقسيم ثلاثة إلى واحد: 36 طبقة انتباه خطي مقابل 12 طبقة انتباه كامل.
الثاني، QSA — Qwen Sparse Attention — هو الجزء الجديد حقًا، ولا يزال وصفه العلني مقتضبًا: تضيف بطاقة النموذج أنه يعمل على مستوى الكتل الدقيقة بميزانية 512 كتلة / 2048 رمزًا، لكن لا يوجد حتى الآن أي شرح تقني كامل. وهذا الشحّ في التفاصيل هو نفسه جزء من النمط. فقد قدّم العرض الأول لـ Qwen3-Next في أواخر 2025 شبكة Gated DeltaNet مع التوثيق المقتضب نفسه، ولم تُحدَّد البنية بالكامل إلا بعد أن تبنّتها سلسلة Qwen3.5. وبالنسبة للقارئ، الخلاصة العملية هي نفسها في المرتين: يظهر مؤشر البنية أولًا، ثم يأتي التوثيق ونماذج الإنتاج بعد ذلك.
خطة اللعب التي نجحت بالفعل مرة واحدة
نفّذت Alibaba هذه الخطة نفسها من قبل، وقد نجحت. في أواخر 2025، قدّمت Qwen3-Next لمحة عن Gated DeltaNet ومزيجًا هجينًا من الانتباه الخطي والانتباه الكامل. وعندما صدرت سلسلة Qwen3.5، تبنّت ذلك المخطط على نطاق واسع — ومنذ ذلك الحين استمرّ هذا الهجين عبر جيل Qwen3.8، بما في ذلك الطراز الرائد 2.4T. سبب أهمية هذه السابقة هنا هو التوقيت الذي تشير إليه. ينبغي توقّع عائلة Qwen4 الكاملة بعد هذه المعاينة، لا ضمنها؛ وإذا كانت الفجوة الزمنية لـ Qwen3-Next مؤشرًا، فإن المسافة بين «هذه هي البنية» و«هذه هي العائلة» تُقاس بالأشهر. لا شيء في بطاقة النموذج يؤكد ذلك — إنه استنتاج من نمط نفّذته Alibaba الآن مرتين.
ما زلنا لا نعرفه
تقلّصت المجهولات، لكنها لم تختفِ:
• لا يزال جدول المعايير الخاص بالمورّد من إعداد المورّد نفسه. وقد قيّمت Artificial Analysis النموذج الآن بشكل مستقل، وهو ما يعالج أكبر ثغرة في تغطية الإطلاق — لكن ادعاء Alibaba الرئيسي، بأن النموذج يتفوق على Claude Opus 4.6 Max في 8 من أصل 9 معايير قابلة للمقارنة، يستند إلى تقييمات Alibaba الداخلية (CoWorkBench وJobBench وAndroidWorld) إلى جانب تقييمات عامة، ولم يقم أي طرف ثالث بإعادة إنتاج أي منها.
• ما إذا كانت المعاينة هي نفس النموذج المُقدَّم. تُصنِّف البطاقة Qwen3.8-Flash-Next كمعاينة تجريبية مفتوحة الأوزان، بينما يضيف المتغير المُقدَّم في الإنتاج — Qwen3.8-Flash من Qwen Cloud — سياقًا افتراضيًا بسعة 1,000,000 رمز وأدوات مدمجة. لا يزال غير معلن ما إذا كان ذلك النموذج المُقدَّم هو نفس البنية ضمن نافذة سياق أكبر، والنتائج المستقلة أعلاه تخص المعاينة مفتوحة الأوزان، وليس نموذج API المُقدَّم.
• الرخصة معروفة وهي رخصة حقيقية: تسمح Qwen Community License 1.0 بالاستخدام التجاري، بما في ذلك بيع الأعمال المشتقة، لكنها تشترط اتفاقًا تجاريًا منفصلًا مع Alibaba إذا كنت تدير أعمال Model-as-a-Service أو مساعد عمل بالذكاء الاصطناعي بعد تجاوز حدّ محدد للإيرادات وحدّ للمستخدمين النشطين شهريًا. وهي ليست مماثلة لرخصة Qwen3.8-Max المقيّدة بعتبة إيرادات، لكنها تستحق القراءة قبل البناء على الأوزان.
• تقرير ميداني واحد يستحق الإشارة إليه: تدوينة بتاريخ 6 سبتمبر عن نسخة NVFP4 مجتمعية توثّق فشلًا في استدعاء الأدوات المقيَّد بالقواعد النحوية عند تفعيل كلٍّ من التفكير والتنبؤ متعدد الرموز معًا، وقد جرى تتبُّع مصدره إلى مسار فك الترميز المقيَّد الخاص بـ xgrammar. هذا خطأ في وقت التشغيل ضمن نسخة مجتمعية مُكمَّمة، وليس خاصية من خصائص النموذج — لكن إذا كانت أداة التقييم لديك تعتمد على استدعاءات الأدوات المقيَّدة بالقواعد النحوية، فهو أول ما ينبغي اختباره.
عائلة تعمل بدورة زمنية مدتها أسبوعان
الوتيرة المحيطة حكاية بحد ذاتها. صدر Qwen3.8-Max، الطراز الرائد ذو 2.4 تريليون معامل، في 3 أغسطس؛ ثم تبعه Qwen3.8-2.4T-A95B المفتوح الأوزان في 12–13 أغسطس؛ ثم ظهر Qwen3.8-27B المجاني بترخيص Apache-2.0 بعد أيام؛ والآن، قبل انقضاء الشهر، تُعرض معمارية الجيل التالي تمهيدياً — ويُجرى قياس أدائها بشكل مستقل بعد أسبوع. لا يوجد مختبر آخر يطوّر بهذه الوتيرة حالياً. بالنسبة لقارئ يختار النماذج، النتيجة العملية هي أن «أفضل Qwen» هدف متحرك — والفارق بين الأجيال يصل أسرع مما تتكيف المنظومة المحيطة عادةً. وبات شراء قرار بدل نموذج هو الخطوة الأكثر قابلية للدفاع عنها بشكل متزايد.
ماذا يجب على المطوّر فعله الآن
تغيّر أرقام الكفاءة حسابات الخدمة المحلية أكثر مما فعل الإطلاق نفسه. نموذج نشط بحجم 6B يسجّل 40 على المؤشر الحالي قابل للضغط: تكميم NVFP4 الرسمي من NVIDIA هو ما استخدمه تشغيل smf-bench في 5 سبتمبر، وبناءات NVFP4 وFP8 المجتمعية الأبعد منه باتت متداولة بالفعل، وهذا ما يجعل نشر نموذج مخزّن بحجم 180B من فئة وحدة GPU واحدة ممكنًا أصلًا. التحفظ لم يتغير — هذه نسخة معاينة غير مُثبتة، وجدول المورّد لم يُعَد إنتاجه، وشكل الدرجات المستقلة (قوي في أعمال المعرفة ومهام الطرفية، وأضعف في توليد المستودعات طويلة الأفق ومعدلات نجاح الوكلاء من محاولة واحدة) يعني أن نقاط ضعف النموذج تظهر بالضبط حيث توجد تغييرات كود الإنتاج. شغّل عليه نسخة منخفضة المخاطر من حمل عمل حقيقي قبل أن يلمس أي شيء مهم، ودع التجاوز التلقائي عند الفشل يستوعب اللحظات التي تسيء فيها نسخة المعاينة التصرف.
من حيث السعر، أصبحت الصورة التي كانت غامضة عند الإطلاق الآن واضحة. يدرج Artificial Analysis سعر الخدمة للمعاينة عند 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مقابل 0.44 و1.32 دولار لـ DeepSeek V4 Flash 0731 — وهو نفس الترتيب من حيث الحجم مقارنةً بنسخة Qwen3.8-Flash المخدومة، والتي تدرجها Qwen Cloud بسعر ¥1 و¥3 (حوالي 0.16 و0.47 دولار). النسخة الإنتاجية هي التي يمكنك استدعاؤها فعليًا اليوم: يتم توجيهها هنا باسم qwen/qwen3.8-flash، ويمرر OrcaRouter سعر القائمة الخاص بالمورّد دون أي هامش ربح (0%)، لذا عندما تغيّر Alibaba هذا الرقم، تتغير نقطة النهاية معه في نفس اليوم. وينطبق الشيء نفسه على النموذج المقارن في هذا المقال — يتم توجيه DeepSeek V4 Flash 0731 باسم deepseek/deepseek-v4-flash-0731 بسعر القائمة الخاص بالمزوّد، مما يجعل نصف التكلفة لكل رمز من المواجهة أعلاه قابلاً للاختبار مقابل حركة المرور الخاصة بك بدلاً من مقابل أعداد الرموز في معيار قياسي. ما لا يتم توجيهه هنا هو معاينة Flash-Next مفتوحة الأوزان نفسها: لاستخدامها اليوم، عليك سحب الأوزان وتشغيلها بنفسك، وهذا هو السبب تحديدًا الذي يجعل قصة التكميم أعلاه أكثر أهمية من سعر القائمة. السقف الذي يجب أن يتجاوزه هذا الجيل لا يزال مرئيًا على نفس نقطة النهاية: Qwen3.8-Max (qwen/qwen3.8-max) يبلغ 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج، ويُمرر أيضًا بسعر القائمة الخاص بالمورّد.

لم يتغيّر التسلسل العملي كثيرًا، لكن الثقة وراءه تغيّرت. إذا كنت تريد النسخة الإنتاجية المخدومة دون سحب 100GB من الأوزان، فإن Qwen3.8-Flash قابل للاستدعاء بالفعل بالسعر المعلن. وإذا كنت تريد البنية — GDN، وQSA، وجدول n-gram، وحيل التفريغ — فإن الأوزان قابلة للتنزيل وبيئات التشغيل جاهزة: يقدّمه vLLM من اليوم الأول عبر مسار تفريغ يُبقي جدول تضمين n-gram ذا الـ 51B معلمة في ذاكرة المضيف بدلًا من VRAM الدائمة، كما أن SGLang وTensorRT-LLM ضمن قائمة Day 0 لدى NVIDIA، وتحتوي مكتبة Ollama على إصدار MLX يمكنك سحبه على Apple Silicon. الشيء الوحيد الذي ينبغي التوقف عن فعله هو التعامل مع النموذج باعتباره مجهولًا من حيث الجودة. لقد قيس الآن، وقد جاء قياسه جيدًا.
ماذا تشاهد بعد ذلك
• ما إذا كانت الأرقام المستقلة ستصمد مع نضوج المؤشر. تأتي نتيجة 40 التي حققها Qwen3.8-Flash-Next مصحوبة بفاتورة رموز مرتفعة على نحو غير معتاد — إذ أحرق 245 مليون رمز في تشغيل المؤشر مقابل وسيط قدره 140 مليون — وتصف مذكرة Artificial Analysis نفسها أنه "مُسهب للغاية". النتيجة الناتجة عن استدلال أطول تظل نتيجة، لكنها من النوع الذي يتحرك حين يتغير التقييم. وسيكون التحديث التالي للمؤشر هو الاختبار الحقيقي لما إذا كان 40 مستوى ثابتًا أم ذروة محلية.
• ما إذا كان Qwen3.8-Flash المخدوم يُقيَّم بشكل منفصل. كل رقم مستقل في هذا المقال يخص المعاينة مفتوحة الأوزان. النسخة الإنتاجية ذات السياق البالغ 1M والأدوات المدمجة ليس لها تقييم مستقل خاص بها، وإذا كانت هي البنية نفسها في سياق أطول، فإن ذلك تقييم منخفض التكلفة ينبغي أن ينشره أحد.
• كيف يصمد دعم التقديم في اليوم صفر عمليًا — فلا تزال أرقام الإنتاجية GB300 المعلنة من المورّد مجرد أرقام معلنة من المورّد، كما أن تهيئات TP4 للتوازي بين الخبراء وتفريغ KV لا تزال جديدة بما يكفي لتكون هشّة.
• كم من الوقت تنتظر Alibaba حتى تتبع عائلة Qwen4 الكاملة النسخة التجريبية؟
إن الجزء المتعلق بما نعرفه حتى الآن من هذه القصة قد أُغلق إلى حد كبير الآن. ورقة المواصفات صارت علنية، والأوزان قابلة للتنزيل، والبنية مؤكدة، والنسخة Qwen3.8-Flash المخدومة متاحة الآن على واجهات API المستضافة بسعر القائمة، وقد قُيّم النموذج بشكل مستقل من طرفين منفصلين — إذ فاز النموذج الأصغر بحجة الجودة وفاز الأكبر بحجة الإنتاجية. ما يبقى مفتوحًا هو ما إذا كانت معاينة بـ6B من المعاملات النشطة تتعمم إلى ما هو أبعد من المعايير التي ضُبطت عليها، وكم من الوقت تنتظر Alibaba قبل أن تتبعها عائلة Qwen4 الكاملة. لا يزال ذلك السؤال الأخير بلا إجابة في هذه الإصدارة، ولا يزال هو الأكثر أهمية.
مقارنات في هذه المقالة4
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
