Qwen3.8-Flash-Next Release — داخل معاينة بنية Qwen4 من Alibaba. رسم توضيحي مُعاد توليده.
Guides & Insights

إصدار Qwen3.8-Flash-Next: من داخل معاينة بنية Qwen4 من Alibaba

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

كانت الوثيقة الأكثر فائدة التي نشرتها علي‌بابا في 26 أغسطس 2026 ليست الحقيبة الصحفية — بل تقريرًا فنيًا. نموذج Qwen3.8-Flash-Next، وهو نموذج متعدد الوسائط مفتوح الأوزان يعتمد على خليط الخبراء صدر في ذلك اليوم، وصل مصحوبًا بورقة بحثية بعنوان "حول تصميم بنية Qwen3.8-Next: التقييم والكفاءة واستقرار التدريب"، وهذا التقرير هو القصة الحقيقية. إنه يفعل ما لا تفعله إطلاقات البائعين تقريبًا أبدًا: ينشر عمليات الاجتثاث، والنتائج السلبية، وتجارب وصفات التدريب، ثم يرسم خطًا من كل نتيجة إلى بنية عائلة Qwen4 التي صُمم هذا النموذج ليكون معاينةً لها.

ما الذي تم إطلاقه بالفعل في 26 أغسطس

النموذج نفسه متواضع بمعايير Qwen لعام 2026، وهذا متعمد. يخزّن Qwen3.8-Flash-Next 125B من معلمات النموذج الرئيسي بالإضافة إلى جدول تضمين n-gram منفصل بحجم 51B — أي حوالي 176B قبل وحدة التنبؤ متعددة الرموز بحجم 4B — لكنه ينشّط 6B فقط لكل رمز. إنه نموذج خليط من الخبراء بـ512 خبيرًا مع توجيه من أعلى 10 و48 طبقة، وسياق أصلي يبلغ 262,144 رمزًا وقابل للتوسيع إلى 1M عبر YaRN. يستقبل نصًا وصورًا وفيديو ويُخرج نصًا. الأوزان متاحة على Hugging Face وModelScope بموجب ترخيص qwen-community-1.0، وتصفه مدونة Alibaba الرسمية بأنه "معاينة تجريبية للبنية التي ستدعم Qwen4" — وهو نفس الدور الذي لعبه Qwen3-Next لسلسلة Qwen3.5، أي كناري يطير قبل الطراز الرائد.

في اليوم نفسه، فعّلت علي​بابا النظير التجاري: إصدارًا مُدارًا يُسمى Qwen3.8-Flash على واجهة QwenCloud API بسعر 0.16 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج. من السهل الخلط بين الاثنين، ومن الجدير التمييز بينهما. Qwen3.8-Flash-Next هو الإصدار التجريبي مفتوح الأوزان الذي يحلله التقرير التقني؛ أما Qwen3.8-Flash فهو إصدار واجهة البرمجة الإنتاجي، بسعر محدد، مع سياق افتراضي يبلغ مليون رمز، وتنسيقات طلبات متوافقة مع Open​AI وAnthropic. السعر، والمعايير، والحجج المعمارية كلها تنبع من الهندسة نفسها.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

الرهانات المعمارية الأربعة في التقرير التقني

العمود الفقري للورقة هو أربع رهانات حول ما ينبغي أن يكون عليه نموذج حدودي طويل السياق ومنخفض التكلفة، كل منها مدعوم بتجارب.

انتباه — هجين GDN + QSA. ثلاثة من كل أربع طبقات تستخدم Gated DeltaNet، وهي طبقة انتباه خطي تضغط التاريخ في حالة متكررة بحجم ثابت بدلاً من ذاكرة تخزين KV التي تنمو مع طول التسلسل. الطبقة المتبقية هي Qwen Sparse Attention، التي تجمع التسلسل في كتل صغيرة، وتقيّمها بتكلفة منخفضة، وتشغّل الانتباه الكامل فقط على المناطق المهمة. تبلغ Ali​baba عن تسريع يصل إلى 7.6× في التعبئة المسبقة و4.9× في فك التشفير عند سياق يبلغ 1M؛ بينما قياس SGLang الخاص في اليوم الأول سجل أرقامًا أعلى، عند 10.2× و6.6×. عند معدل إصابة ذاكرة التخزين المؤقت للبادئة بنسبة 90%، تصل إنتاجية التعبئة المسبقة إلى 8.6× مقارنة بـ Qwen3.7-Plus. هذه أرقام مقدمة من البائع والشركاء، وليست مدققة بشكل مستقل.

• التدفق المتبقي — المتبقي المُبوَّب. يُوسَّع المسار المتبقي الوحيد إلى أربعة فروع متوازية مع بوابات ديناميكية على مستوى العناصر، بتصميم متعدد الفروع على غرار Hyper-Connection وتحكم على غرار GatedNorm. تنظّم البوابة عمليات القراءة والكتابة في كل فرع، وهو ما يذكر البحث أنه يثبّط القيم المتطرفة للتفعيلات، وعمليًا، يسمح بتخزين الحالات المتبقية في FP8.

• التضمين — جدول n-gram بحجم 51B. بدلاً من تضمين واحد لكل رمز، يعتمد النموذج على جدول بحث يُفهرس بالرمز الحالي والرموز السابقة له، فيخزّن العبارات الكاملة والأنماط المحلية. وهو شبه مجاني لكل رمز، ولأن عناوين البحث معروفة مسبقًا، يمكن أن يُخزَّن في ذاكرة المضيف ويُسبق جلبه بشكل غير متزامن، بعيدًا تمامًا عن ذاكرة GPU. هذه هي الحيلة التي تسمح لنقطة حفظ مخزّنة بحجم 176B بالعمل على أجهزة من فئة 75GB، ويعود أصلها إلى تضمينات Gemma 3n لكل طبقة وEngram الخاص بـ Deep​Seek.

• التحسين — Muon، مضبوط. يستخدم التدريب محسّن Muon، وهو أسلوب زخم قائم على التعامد، يُطبَّق على الخرائط الخطية ثنائية الأبعاد (الانتباه وGDN وأوزان خبراء MoE) بينما يُبقى AdamW للتضمينات والموجّه والمعاملات منخفضة الرتبة. كما يعرض البحث نتيجة سلبية جديرة بالقراءة: أُسقط تسخين حجم الدفعة بعد أن تبيّن أنه يكلّف 18.8% خطوات محسّن إضافية دون تحسين أي شيء.

جدول المعايير، اقرأه بعناية

كل رقم في العناوين هنا هو رقم Qw​en الخاص، منشور على بطاقة النموذج وفي التقرير، ولم يتم إعادة إنتاج أي منه بشكل مستقل — النموذج عمره يوم واحد ولم يقم أي طرف ثالث بمراجعته بعد. إذا قرأته بهذه الطريقة، فإنه لا يزال مذهلاً، لأن Qwen3.8-Flash-Next يبادل الضربات مع DeepSeek-V4-Flash-0731، وهو نموذج أكبر وأكثر رسوخاً، على 6B معلمات نشطة.

• DeepSWE 1.1 — 58.7 مقابل 54.4 (كما أبلغ البائع).

• SWE-bench Pro — 62.5 مقابل 56.0 (وفقًا لتقرير البائع).

Toolathlon مُتحقَّق منه — 73.5 مقابل 70.3 (وفقًا للبائع).

• LiveCodeBench v6 — 91.9 مقابل 90.6 (وفقًا لما أبلغه البائع).

• GPQA Diamond — 91.7 مقابل 90.8 (وفقًا لما أبلغه البائع).

• IFBench — 81.3 مقابل 79.2 (وفقًا لما أبلغت به الشركة المصنّعة).

ثم هناك الفجوة التي يكشفها التقرير على الملأ: في NL2Repo-Bench، 48.1 مقابل 54.2 لنموذج DeepSeek-V4-Flash-0731 — عجز حقيقي في توليد الأكواد على مستوى المستودعات، وهو البُعد الوحيد في الترميز الوكيلي الذي يتخلّف فيه النموذج الأصغر. أما في Agents' Last Exam فالنتيجة متعادلة تقريبًا عند 24.3 مقابل 25.2. وفي أتمتة المكاتب، تُبلغ Qw​en عن 73.9 في CoWorkBench — لكنه معيار داخلي، وتُبقيه Ali​baba خارج المخطط الرئيسي.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

في الرؤية الحاسوبية، يُظهر الجدول المُبلَّغ ذاتيًا نتيجة AndroidWorld 84.5 مقابل 62.0 لـ Claude Opus 4.6 Max، وRealWorldQA 88.5 مقابل 73.9. أما اختبار Humanity's Last Exam فهو العنوان الرئيسي الوحيد الذي يخسر فيه Qw​en أمام Claude Opus 4.6 Max بشكل صريح — وقد أُجري الحكم على تلك النتيجة بواسطة GPT-4o نفسها، فحتى تلك المقارنة ليست نزيهة.

السعر: جزء من اثني عشر من سعر المنتج الرئيسي

ثم الرقم الذي يهم في الميزانيات. إصدار Qwen3.8-Flash المُقدَّم على QwenCloud بسعر 0.16 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج. وهذا يمثل تقريبًا واحدًا على اثني عشر من سعر النموذج الرئيسي لشركة Alibaba نفسها، Qwen3.8-Max البالغ 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج — على نموذج يقول التقرير إنه دُرّب بحوالي واحد على تسعة من القدرة الحاسوبية لنموذج Qwen3.7-Plus. لقد أمضى بائعو النماذج الصينيون الصيف في خفض أسعار فئة الفلاش، وهذا الإصدار هو جانب Qwen من تلك الحملة، إذ يصل بمبرر معماري مرفق وليس مجرد خصم.

بالنسبة لأي شخص يقارن بين الفئات، تصبح الحسابات أسهل عندما يعرض كل مزود نفس الرقم. يقوم OrcaRouter بتوجيه بقية عائلة Qw​en — Qwen3.8-Max و Qwen3.8-27B و Qwen3.8 — بسعر القائمة الخاص بالمزود مع هامش ربح 0%، لذا فإن تخفيض سعر البائع يصبح ساريًا لدينا في نفس اليوم الذي يُعلن عنه. Qwen3.8-Flash-Next ليس في كتالوجنا بعد؛ وعندما يصل إلى وقت تشغيل نوجّهه، فإنه يُدرج في نفس الإعداد أحادي المفتاح وسعر القائمة دون عقد ثانٍ.

ما يمكنك فعله به اليوم

دعم توفير الخدمة منذ اليوم الأول واسع بشكل غير معتاد. تصدر SGLang صفحة دليل استخدام وصورة حاوية مخصصة (lmsysorg/sglang:qwen38flashnext)؛ وتوفر vLLM صورة vllm/vllm-openai:qwen38-flash-next؛ وتتحقق NVIDIA من كليهما بالإضافة إلى TensorRT LLM على حامل GB300 NVL72 بمعدل يتجاوز 16,000 رمزًا في الثانية لكل GPU بدقة FP8، وتغطي NeMo الضبط الدقيق. وتحت نطاق مراكز البيانات، يعمل النموذج على مجموعات DGX Spark ومحطات عمل 4×RTX PRO 6000، كما أن قطار التكميم المجتمعي في اليوم نفسه — تنسيقات GGUFs من Unsloth وإصدار 1-بت يتسع في 75GB من الذاكرة بدقة تبلغ نحو 80% من الدقة الكاملة — يعني أن نقطة التحقق المخزنة بحجم 176B قابلة للتشغيل فعليًا على أجهزة تمتلكها فرق صغيرة. أما الفرق التي تفضل استدعاءه عبر واجهة برمجة التطبيقات بدلاً من تشغيله محليًا، فيمكنها الوصول إلى واجهة Qwen3.8-Flash عبر QwenCloud التابع لشركة Alibaba نفسها والعديد من المنصات الخارجية، غير أن الأوزان مفتوحة المصدر هي ما سيعتمد عليه معظم المتبنين الأوائل أولاً.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

حساب الـ VRAM خلف تلك القائمة هو جدول n-gram، وهو النقطة التي تتقارب عندها حزم الخدمة (serving stacks) بعد ذلك. تضمين كل طبقة الذي يُبقيه التقرير الفني خارج ذاكرة GPU هو بنية بحث خالصة — فلكل رمز (token) مولّد، يسحب النموذج حوالي 16 صفًا فقط من صفوفه البالغة 320 مليون صف — وهذا ما يجعل تفريغه (offloading) رخيصًا. يخدم vLLM نموذج Qwen3.8-Flash-Next من صورة تطوير مخصصة بينما لا يزال طلب سحب دعم البنية المعمارية مفتوحًا، وأحدث قطعة في ذلك العمل — مسودة طلب سحب من نفس مؤلف vLLM (vllm-project/vllm#54371، غير مدمج) — تضيف مسار خدمة PLE-Offload يُبقي الجدول في ذاكرة المضيف ويقرؤه عبر العنونة الافتراضية الموحدة لـ CUDA بدلاً من حجز VRAM. بدقة FP8، يبلغ حجم الجدول حوالي 48GB من أصل ~173GB لنقطة التحقق (checkpoint)، لذا فإن تفريغه هو الفرق بين GPU لمركز بيانات وبطاقة واحدة بسعة 96GB — مثل RTX PRO 6000، أو تجمع الذاكرة الموحدة لأحد أجهزة DGX Spark. لا يزال الأمر مبكرًا، فتعامل معه كاتجاه وليس كخيار مدعوم اليوم؛ لكنه وقت التشغيل (runtime) يلحق بما ادعاه التقرير الفني بالفعل، وهو الأمر الذي يجب مراقبته إذا كان رقم الـ VRAM هو ما كان يعيقك.

النسخة التجريبية التي لم يتجاوز عمرها يومًا واحدًا ولم تُستنسخ أرقامها بعد هي الحالة النموذجية التي تُظهر لماذا لا نراهن على مسار إنتاجي بها، وهذا هو بالضبط الغرض من التبديل الاحتياطي. إذا كان وقت التشغيل يحمل Qwen3.8-Flash-Next ووجّهت إليه نقطة نهاية واحدة مع تبديل احتياطي تلقائي إلى نموذج تثق به بالفعل، فستحصل على فائدة البنية الجديدة في حركة المرور غير الحرجة وعلى مسار احتياطي نظيف عندما تتعثر — دون إعادة توصيل، لأن ذلك قاعدة توجيه وليس تغييرًا في الكود.

ماذا تقول هذه المعاينة عن Qwen4

علي بابا لعبت هذه اللعبة من قبل. كشفت Qwen3-Next عن Gated DeltaNet في أواخر 2025 مع توثيق ضئيل، ولم تُحدَّد البنية بالكامل إلا بعد أن تبنّتها سلسلة Qwen3.5 على نطاق واسع. النمط يتكرر: Qwen3.8-Flash-Next هي الكناري، والتقرير هو المواصفات عبر التجربة. الأمور الملموسة التي يجب مراقبتها هي ما إذا كانت الرائدة Qwen4 ستعتمد تقسيم GDN-to-QSA بنسبة ثلاثة إلى واحد، وما إذا كانت تضمينات n-gram ستصمد أمام الاتصال بالإنتاج على نطاق الرائدة، والأهم من كل ذلك ما إذا كانت التقييمات المستقلة ستؤكد تفوّق ميزة 6B-active على النماذج الأكبر. إذا صمدت فرضية الكفاءة، فقد تصل الرائدة Qwen4 بتكاليف خدمة أقل بشكل كبير من الجيل الذي سبقها.

الأسئلة الشائعة

Qwen3.8-Flash-Next و Qwen3.8-Flash — هل هما نفس النموذج؟

لا، والتمييز مهم. Qwen3.8-Flash-Next هو معاينة معمارية الأوزان المفتوحة التي يحللها التقرير التقني؛ أما Qwen3.8-Flash فهو إصدار واجهة برمجة التطبيقات الإنتاجي الذي تقدمه Ali​baba على QwenCloud بسعر 0.16$/0.47$ لكل مليون رمز مع سياق افتراضي يبلغ 1M. نفس السلالة الهندسية، لكن منتجات مختلفة — أحدهما للاستضافة الذاتية والفحص، والآخر خدمة مُدارة مدفوعة الثمن.

هل يجب نقل أعباء العمل في بيئة الإنتاج إليها اليوم؟

ليس بدون رأي ثانٍ. كل معيار قياسي هو مُبلَّغ عنه من البائع وغير مُعاد إنتاجه، والبنية جديدة بما يكفي لدرجة أن حزم الخدمة لا تزال تتقارب — دعم vLLM نفسه ما يزال قادمًا عبر طلبات سحب مفتوحة — والفجوة الوحيدة في الترميز الوكيل (NL2Repo) هي بالضبط نوع المهمة التي يصادفها المبرمجون في الإنتاج. الأوزان المفتوحة تجعل تقييمها بنفسك رخيصًا، ودعم اليوم الأول من SGLang وvLLM يجعل التجربة ممكنة هذا الأسبوع — لكن التجربة خلف تجاوز الفشل هي الطريقة الصادقة للبدء، وليس قطع التحويل.

متى يُشحن Qwen4 الفعلي؟

لم يقل Ali​baba شيئًا. الإشارة الزمنية الوحيدة في هذا الإصدار تاريخية: آخر كناري، Qwen3-Next، طار قبل موسم تقريبًا من تبنّي سلسلة Qw​en3.5 لهندسته. على هذا الإيقاع، فإن الطرازات الرئيسية من Qwen4 أقرب مما تبدو — لكن التقرير يتعلق صراحةً بالهندسة المعمارية، وليس بخريطة طريق.

الخلاصة

Qwen3.8-Flash-Next هو الإصدار النادر الذي تكون فيه الورقة البحثية هي المنتج نفسه. أما بخصوص النموذج ذاته، فبطاقة الأداء الصادقة تقول: 6B معاملات نشطة تضاهي نماذج أكبر بكثير في معظم المعايير المشتركة، وفجوة واحدة محددة في الكود على مستوى المستودعات، وسعر خدمة يبلغ واحدًا على اثني عشر من سعر النموذج الرئيسي، وهندسة معمارية هي إجابة Qw​en على كيفية جعل نموذج حدودي رخيصًا. يوضح التقرير التقني ما صُنع من أجله Qwen3.8-Flash-Next — وهو ليس النموذج. إنه الدليل على الهندسة المعمارية التي ستكون Qwen4، ومن الجدير قراءته قبل إطلاق Qwen4، لأن القرار الذي يغيّره هو القرار الذي ستتخذه عند وصول Qwen4.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube