
تعرف على Qwen3.8-Flash: نموذج مفتوح الوزن متعدد الوسائط من نوع MoE يستعرض بنية Qwen4 — بسعر 0.15$/0.47$ لكل مليون رمز على QwenCloud
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
في 26 أغسطس 2026، أتاح فريق Qwen الأوزان (weights) الخاصة بنموذج Qwen3.8-Flash كمصدر مفتوح، وأصدرها على Hugging Face وModelScope باسم Qwen3.8-Flash-Next، كما أطلق نموذج الإنتاج الذي يحمل اسم Qwen3.8-Flash على واجهة برمجة تطبيقات QwenCloud، مؤكدًا التسعير الرسمي في اليوم التالي. الرقم الأبرز — الذي أكدته Alibaba رسميًا في إعلانها الصادر في 28 أغسطس — هو نموذج خليط خبراء متعدد الوسائط يضم 125 مليار معامل، لا يُفعّل سوى نحو 6 مليارات معامل فقط لكل رمز (token)، بنسبة ندرة تبلغ نحو 95%، مبني على بنية تصفها Alibaba صراحةً بأنها معاينة مبكرة لجيل Qwen4. واجهة برمجة التطبيقات للإنتاج متاحة الآن على QwenCloud بسعر 0.15 دولار لكل مليون رمز إدخال، و0.47 دولار لكل مليون رمز إخراج، و0.016 دولار لكل مليون عند ضربات الذاكرة المؤقتة (cache hits) — وهي الطريقة الأرخص لتشغيل شيء ينحدر بنيويًا من النموذج الرئيسي القادم لشركة Alibaba، والأولى التي تشحن فيها المختبر معاينة بنية كأوزان مفتوحة عامة قبل وجود عائلة النموذج الكاملة.
رقم واحد يحمل وزنًا أكبر من بقية ورقة المواصفات: 6B. لا تستمد Qwen3.8-Flash قدراتها من الحجم الضخم — بل من حيث توجّه الحوسبة. جسم MoE بحجم 125B، وجدول تضمين N-gram بحجم 51B، ووحدة صغيرة للتنبؤ متعدد الرموز، تخزّن معًا ما يقرب من 180B معاملًا على القرص، ومع ذلك يمر كل رمز عبر 6B منها فقط. هذا هو الرهان الذي يقوم عليه هذا الإصدار بأكمله، وهو السبب في انخفاض تكلفة التدريب إلى هذا الحد.
ما الذي تم شحنه فعليًا
{{1}}Qwen3.8-Flash، بدون اللاحقة، هو نموذج الإنتاج المتاح الآن على واجهة QwenCloud API وداخل منتج Qwen Office من Alibaba{{/1}}؛ يأتي بسياق افتراضي يبلغ 1M رمزًا وأدوات مدمجة، بسعر $0.15 / $0.47 لكل مليون رمز، وتكلفة ضربات ذاكرة التخزين المؤقت $0.016. {{2}}في 28 أغسطس اتسعت قائمة التوفر{{/2}}: وفقًا {{3}}لإعلان Alibaba{{/3}}، أصبح Qwen3.8-Flash متاحًا الآن أيضًا عبر OpenCode Go، الاشتراك بسعر ثابت لوكيل البرمجة مفتوح المصدر في الطرفية — {{4}}قائمة نماذج OpenCode الخاصة تعرضه باسم qwen3.8-flash بنفس أسعار $0.15 / $0.47 لكل مليون رمز{{/4}}.

{{1}}يؤطر الإعلان الرسمي من Qwen Studio إصدار الأوزان المفتوحة كدعوة للنظام البيئي: طرح التغييرات الهيكلية مبكرًا حتى يتمكن المجتمع ومكدسات الاستدلال من التكيف قبل بناء تشكيلة Qwen4 الكاملة.{{/1}} {{2}}أول علامة على نجاح ذلك هي SGLang — محرك الاستدلال المدعوم من LMSYS — حيث نشر دعمًا ليوم الإطلاق لنموذج Qwen3.8-Flash-Next في اليوم نفسه، مع تهيئة النموذج أيضًا ليعمل مع Transformers وvLLM وTokenSpeed.{{/2}}
العمارة هي القصة
هذا ليس نموذجًا مصغّرًا من جيل Qwen 3.8. يقدّم Qwen3.8-Flash أربعة تغييرات يقول الفريق إن عائلة Qwen4 سترثها، ويستهدف كلٌّ منها عنق زجاجة مختلفًا.
• الانتباه — Gated DeltaNet بالإضافة إلى Qwen Sparse Attention. يقوم Gated DeltaNet (GDN) بضغط التاريخ في حالات ذات حجم ثابت في ثلاثة من كل أربع طبقات، بحيث لا يعيد النموذج قراءة كل شيء في كل خطوة؛ ثم تعالج QSA السياق الطويل كمسألة بحث — إذ يجمع مفهرس خفيف التسلسل في كتل صغيرة، ويقيّم أهمية الكتل، ويوجّه الانتباه إلى المناطق الأكثر صلة. وفقًا لقياسات Alibaba، تحقق نواة انتباه QSA تسريعًا يصل إلى 7.6× في مرحلة ما قبل التعبئة (prefill) و4.9× في مرحلة فك التشفير (decode) عند سياق بطول 1M رمز (كما ورد من البائع).
• المتبقي — المتبقي المُبوَّب. يصبح تيار المتبقي الواحد أربعة فروع متوازية مع بوابات على مستوى العنصر، مما يسمح للشبكة بتحديد مقدار القراءة والكتابة لكل رمز في كل فرع؛ ويستقر فرع واحد في قناة بعيدة المدى تربط طبقات الانتباه المبكرة بالطبقات العميقة. تُخزَّن حالات المتبقي في FP8 لتقليل عرض النطاق الترددي للذاكرة.
• التضمين — تضمينات N-gram. جدول بحث بمعاملات 51B يعتمد على الرمز الحالي بالإضافة إلى عدة رموز سابقة. يضيف سعة دون إضافة تكلفة حسابية لكل رمز، ولأن الجدول يمكن أن يكون موجودًا في ذاكرة المضيف ويتم جلبه مسبقًا بشكل غير متزامن، فإنه لا يشغل ذاكرة GPU بشكل دائم.
• المحسّن — Muon. المعلمات الخطية ثنائية الأبعاد الكبيرة (الانتباه، GDN، خبراء MoE) تُدرَّب باستخدام Muon، بينما تُبقي التضمينات والموجّه والأجزاء منخفضة الرتبة في Gated Residual على AdamW؛ وأعاد الفريق ملاءمة قانون التوسّع للبنية الجديدة حول المزيج.

بالنسبة للمطوّر، هناك أمران مهمّان فورًا: مكدّس الانتباه هو السبب في أن سياق 1M-token يمكن أن يكون افتراضيًا وليس هدفًا طموحًا، وجدول N-gram هو السبب في أن نموذج 125B لا يزال ممكن تقديمه بشكل خفيف. والباقي مادة معاينة لـ Qwen4 — وهذا هو بالضبط كيف تموضعه Alibaba.
ورقة المعايير، موسومة بصدق.
كل رقم في هذا القسم هو تقييم خاص من Alibaba، عمره يوم واحد ولم يتم إعادة إنتاجه من قبل أي مختبر مستقل وقت كتابة هذا التقرير. تعامل معها كمؤشرات استرشادية، وليس كأرقام نهائية محسومة. في مجموعة اختبارات Alibaba، يسجّل Qwen3.8-Flash-Next (6B نشط) نتائج SWE-bench Pro 62.5، وDeepSWE 1.1 58.7، وCoWorkBench 73.9، وAndroidWorld 84.5، وMathVision 95.7، مع درجة JobBench 55.7 — ويُشار إلى النسخة الأساسية، Qwen3.8-Flash-Next-Base، باعتبارها أفضل نموذج مفتوح المصدر في 8 من 14 معيارًا في مقارنة مباشرة، بما في ذلك MMLU-Pro وSuperGPQA وBBH وMMMU.
يجب أن تُوسم ادعاءات أليبابا حول التنسيب العائلي بما هي عليه — ادعاءات. تقول الشركة إن Qwen3.8-Flash يتفوق على Claude Opus 4.6 بـ9.1 نقاط في SWE-bench Pro وبقرابة 20 نقطة في JobBench، ويقترب من الوصول إلى مستوى Claude Opus 4.8. كلها من تقارير البائع، وكلها غير مُعاد إنتاجها. ما يمكن التحقق منه بشكل مستقل اليوم هو أضيق: الأوزان منشورة، ومكدس الاستدلال يشغّلها بالفعل، وأصدر SGLang الدعم في اليوم نفسه. إعادة الإنتاج المستقلة لجدول المعايير على بُعد أيام، لا أسابيع.
كم تبلغ تكلفتها؟
التسعير هو الجزء الأسهل للتحقق منه، لأنه سعر معلن وليس معيارًا مرجعيًا — وفي 27 أغسطس أكدت Alibaba رسميًا سعر QwenCloud للإنتاج: 0.15 دولار لكل مليون رمز إدخال، و0.47 دولار لكل مليون رمز إخراج، و0.016 دولار لكل مليون عند إصابات التخزين المؤقت، مع المعدل المحلي في الصين عند 0.8 يوان/2.7 يوان/0.1 يوان. رقم إصابات التخزين المؤقت هو ما يهم في أعباء عمل الوكلاء: وكيل طويل السياق يعيد قراءة تاريخ كبير في كل دورة يدفع بنسات مقابل القراءات المتكررة، وهو بالضبط عبء العمل الذي يستهدفه مكدس الانتباه في Qwen4-preview. قارنت التغطية الصحفية الصينية فورًا السعر الرئيسي مع الأقران — حوالي ثلث ما تفرضه DeepSeek-V4-Flash، ومبلغ لا يُذكر بجانب النماذج المغلقة المتطورة. ووفقًا لحسابات Alibaba الخاصة، بلغت تكلفة عملية التدريب حوالي تسع تكلفة Qwen3.7-Plus، وهذه الرافعة الهيكلية هي ما يسمح لسعر واجهة برمجة التطبيقات بأن يستقر عند مستواه الحالي.
بجانب بقية عائلة Qwen 3.8، الفجوة صارخة: النموذج الرائد Qwen3.8-Max يُفوتر بمعدل 2.00$ و6.00$ لكل مليون توكن، وهو متاح بالفعل على {{KEEP}}OrcaRouter{{/KEEP}} بسعر قائمة المزوّد دون أي هامش ربح. والآن بعد أن أصبحت واجهة Qwen3.8-Flash الإنتاجية مفتوحة، ينطبق نفس مبدأ التمرير المباشر على السعر الرسمي البالغ 0.15$/0.47$ وعلى معدل إصابة الكاش البالغ 0.016$ — طبقة التوجيه هي الفرق بين أن تقرأ عن خفض الأسعار وأن يكون الخفض في إعداداتك. كلا النموذجين خلف مفتاح واحد، مع تحويل تلقائي بينهما عند الفشل، دون عقد ثانٍ.
ما معنى "معاينة Qwen4"؟
اقرأ الإعلان حرفيًا وستتضح الرهانات: هذه ليست فئة جديدة من {{1}}Qwen3.8{{/1}} — بل هي بنية {{2}}Qwen4{{/2}} أُطلقت مبكرًا، تحت العلامة الواقية لنموذج أصغر وأرخص. والأسباب التي تدعو إلى ذلك سليمة: الأُطر البرمجية، والتكميم، وأنماط النشر تحتاج وقتًا لتنضج، ونموذج {{3}}6B-active{{/3}} وسيلة رخيصة للمجتمع لاختبار {{4}}GDN + QSA{{/4}} على نطاق واسع قبل أن تبني Alibaba النسخة المكلفة فوقه. أما الجانب الآخر فهو أن {{5}}Qwen3.8-Flash{{/5}} الإنتاجي هو واجهة برمجة تطبيقات مبنية على بنية ما زال النظام البيئي الأوسع يدقق فيها. المتبنون الأوائل هم، بحكم التصميم، مجموعة الاختبار.
الطريق السريع لتجربته
اليوم أمامك أربعة خيارات واقعية. يمكنك استضافة الأوزان مفتوحة المصدر ذاتيًا عبر vLLM أو SGLang أو Transformers أو TokenSpeed — فإصدار FP8 هو المحطة الأولى المنطقية على أي شيء أقل من عقدة كاملة. يمكنك استدعاء واجهة QwenCloud API، المتاحة الآن بالسعر الرسمي $0.15/$0.47 مع ضربات الكاش بسعر $0.016. يمكنك استخدامه داخل OpenCode Go، الاشتراك ذي السعر الثابت لوكيل البرمجة الطرفي مفتوح المصدر، الذي أضاف Qwen3.8-Flash هذا الأسبوع (أعلنت عنه Alibaba في 28 أغسطس، وأُكد ذلك في قائمة النماذج على موقع OpenCode نفسه). أو يمكنك استدعاء Flash الإنتاجي عبر موجه بالطريقة التي تستدعي بها Qwen3.8-Max بالفعل، مع تمرير السعر الرسمي دون أي زيادة — دون أي تكامل مخصص للصيانة.

السؤال المطروح هو السؤال الصادق: {{1}}هل يمكن لنموذج يُفعّل 6 مليارات من معاملاته أن يصمد في الإنتاج عبر مجموعة واسعة من أعباء العمل، أم أن جدول المعايير الذي يبدو وكأن عمره يوم واحد اليوم سيظل يبدو كذلك بعد شهر؟{{/1}} هذا ليس سببًا للانتظار — بل سبب {{2}}لوضعه خلف نظام التبديل الاحتياطي بدلاً من أمام نظامك بالكامل{{/2}}. الأوزان صدرت، والسعر محدد، والبنية هي الاتجاه المُعلن من Alibaba. {{3}}الأسابيع القليلة القادمة ستقرر ما إذا كان 6B كافيًا.{{/3}}
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
