
Qwen4-Exp QSA يصل إلى Ascend من هواوي: داخل طلب السحب الاختياري CANN prefill في SGLang
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 348 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 105 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 987 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
في 30 سبتمبر 2026، فتح أحد المساهمين طلب سحب SGLang رقم 41855 بعنوان "[NPU] إضافة انتباه متناثر CANN اختياري لـ Qwen4-Exp QSA prefill"، والجزء المثير ليس الحساب. بل العتاد. بات لمعمارية Qwen4Exp الآن مسار انتباه متناثر مكتوب يدويًا لمسرّع Ascend 910C من هواوي، خلف راية معطّلة افتراضيًا، في طلب سحب مسودة لم يُدمج بعد — بينما النموذج الذي ينتمي إليه اسم هذه المعمارية، Qwen4-Exp، لم يُنشر بأي شكل من الأشكال. نقطة التحقق الوحيدة التي تحمل هذه المعمارية بأوزان مفتوحة لا تزال Qwen3.8-Flash-Next، معاينة مزيج الخبراء البالغة 125 مليار معلمة التي أصدرتها الشركة على Hugging Face في 24 أغسطس 2026، والتي تُصرّح بطاقتها فعليًا بأن معماريتها هي qwen4_exp. أما Qwen 4 نفسه — فئات Max و Flash و Plus و 27B التي أعلنتها الشركة في مؤتمر Apsara في 22 سبتمبر 2026 — فلا يزال بلا أوزان ولا معرّف ولا سعر ولا تاريخ. لذا فهذه مقالة من نوع "ما نعرفه حتى الآن" عن قطعة هندسية، وليست إطلاقًا: حزمة خدمة لمورّد آخر تقرر بهدوء أن معمارية غير مُصدَرة تستحق الدعم مبكرًا.
ما الذي يضيفه طلب السحب فعليًا
التغيير صغير عمدًا وضيق عمدًا. خمسة ملفات، التزام واحد، +355 سطرًا إلى فرع main عند commit b87a241، حاملًا SGLang npu وسم. المؤلف، w1ida، يوضح النية مسبقًا: مسار انتباه رئيسي CANN اختياري لـ Qwen4-Exp QSA eager prefill، مبني على torch_npu.npu_sparse_flash_attention، مع الإبقاء على المفهرس، واختيار Top-K، وميزانية الرموز، ومحتويات KV-cache كما كانت.
الخدعة التي يستخدمها للوصول إلى هناك تستحق فقرة واحدة، لأنها تشرح لماذا يُعد هذا مهايئ تخطيط بدلًا من نواة انتباه جديدة. بالنسبة إلى Q وK المُدوَّرين مسبقًا، يحزم المسار الذاكرة المؤقتة على هيئة C = [K, V] والاستعلام على هيئة Q' = [Q, 0]. عندئذٍ يكون الناتج Q' @ C.T مساويًا Q @ K.T، ولأن الاستعلام المُحشو لا يساهم بشيء، فإن softmax(scale * Q' @ C.T) @ C يعيد [P @ K, P @ V] مكدّسة — لذا يمكن اقتطاع نصف V. وبكلمات المؤلف نفسه، هذا "تضمين تخطيط انتباه، وليس تغييرًا في انتباه النموذج أو ضغط KV منخفض الرتبة." يصبح كل رأس KV دفعة مستقلة في تخطيط MLA الأصلي، ويُحافَظ على مقياس D256 الأصلي، ويُصفَّر RoPE المساعد.
التفاصيل التشغيلية لا تقل أهمية عن الرياضيات:
• التمكين — SGLANG_NPU_QSA_NATIVE_PREFILL=1، الافتراضي معطل. فقط العادي ForwardMode.EXTEND يشارك؛ فك التشفير، والأوضاع التخمينية، والتمرير الأمامي المختلط، والتقاط الرسم البياني كلها تبقى على المسارات الحالية، والتقاط الرسم البياني يتجاوز المحول بالكامل.
• العتاد ونوع البيانات — BF16 ببُعد رأس 256، Ascend 910C (Ascend910_93*)، تم اختباره مقابل CANN 9.0 وtorch-npu 2.10. أي نوع بيانات أو شكل غير مدعوم يتراجع بصمت إلى المسار المرجعي.
• أشكال الرؤوس — المدعوم محليًا (رؤوس Q، رؤوس KV) الأزواج هي (16,2)، (24,2)، (12,1)، (6,1) و(3,1). يرفض CANN نسبة استعلام/KV تساوي 12 رفضًا قاطعًا — فوحدة التقسيم (tiler) لديه تقبل قوى الاثنين فقط — لذا تُحشى الرؤوس 12→16 و6→8 و3→4 وتُهمَل المخرجات المضافة. وهذه أوضح إشارة في طلب السحب (PR) بأكمله على أن العتاد لم يُصمَّم مع أخذ نسب رؤوس الانتباه المتناثر في الحسبان، وأن المحوِّل يستوعب هذا التباين بدلًا من أن يغيّر النموذج شكله من أجله.
• حدود التحجيم — يُحزم فقط المدى الفعلي لذاكرة التخزين المؤقت المشار إليه، بحد أقصى 262,144 رمزًا، والذي يحسبه المؤلف بحد أقصى 512 MiB للموتر K/V المحزوم BF16 عند رأسي KV. الداخلي -1 الحشو يتم اكتشافه ويتم توجيهه إلى البديل، لأن CANN يتطلب فتحات صالحة متجاورة؛ الصفوف المقنعة بالكامل تحتفظ باتفاقية الإخراج الصفري الحالية.
• لماذا التعبئة المسبقة فقط — ينسخ فحص الامتداد والتخطيط قيمتين قياسيتين إلى المضيف، وتستهلك النسخ المؤقتة بالإضافة إلى مساحة العمل الأصلية ذاكرةً. هذا التزامن هو السبب في أن المسار مقتصر على التعبئة المسبقة الحريصة ويُبقى مُعطَّلًا أثناء الالتقاط.
![A capture of the SGLang GitHub pull request #41855, titled '[NPU] Add opt-in CANN sparse attention for Qwen4-Exp QSA prefill', showing an Open state with no merged marker, the line 'w1ida wants to merge 1 commit into main from npu/qsa-cann-prefill', the npu label, and the start of the Motivation section describing the Q' = [Q, 0] and C = [K, V] packing and stating that the approach avoids modifying the indexer, Top-K selection, or KV-cache layout.](https://cms.orcarouter.ai/api/media/file/2-1459.png)
تسعة اختبارات نجحت، ورقم سرعة لم يأتِ من هذا الفرع
الأدلة على الصحة محددة وقابلة لإعادة الإنتاج، وهو أكثر مما تقدمه معظم طلبات السحب الخاصة بالنواة. ويذكر المؤلف أن 9 اختبارات نجحت في 40.772 ثانية على Ascend 910C (Ascend910_9362) مع CANN 9.0 وtorch-npu 2.10.0، دون الحاجة إلى نقطة تفتيش: قيم Q/K/V عشوائية BF16 غير صفرية مقابل مرجع FP32 على CPU محسوب من مدخلات BF16 نفسها، وخانات فيزيائية غير مرتبة بعروض 1/63/64/65/2051، ومقاييس افتراضية وصريحة، وصفوف مقنّعة بالكامل، وصفوف صفرية، وعرض اختيار صفري، وموترات غير متجاورة، وبواقي ذيل سببي بنسبة ضغط 4 من 0 إلى 3، وتعيين فيزيائي لطلبين مع بادئة مشتركة، وإعادة استخدام محتوى الذاكرة المؤقتة، وأشكال الرؤوس المحلية Flash-Next عند 1 و257 من صفوف الاستعلام.
الحالة الرئيسية هي تعبئة مسبقة طويلة: 7,810 رمز استعلام مقابل ذاكرة مؤقتة بسعة 65,536 رمزًا مع 2,051 فتحة مختارة لكل استعلام، وجميع المخرجات منتهية، مع ثمانية صفوف مُعيّنة مقارنةً بمرجع FP32. بلغ خطأ L2 النسبي الملاحظ 0.209% في حالات شكل الرأس الصغيرة و0.231% في صفوف التعبئة المسبقة الطويلة المُعيّنة، مقابل بوابات اختبار atol=0.025، rtol=0.025 وL2 النسبي أقل من 0.008، مع اشتراط أن تكون الصفوف الفارغة صفرًا تمامًا. يُذكر أن ذروة الذاكرة المخصّصة لـ NPU في تلك التشغيلة تبلغ 1,042.7 MiB — ويصنّفها المؤلف كمقياس مخصّص PyTorch، وليس HBM الخاصة باللوحة ولا ذاكرة النموذج الكامل، وهو بالضبط التحفّظ الصحيح الذي ينبغي إرفاقه.
ثم هناك الرقم الذي سيتم اقتباسه ولا ينبغي أن يكون كذلك. يحتوي نص طلب السحب على جدول سرعة يظهر مسار الانتباه المحلي الحالي عند 2,270.79 رمزًا جديدًا في الثانية والانتباه الرئيسي المعبأ الأصلي عند 3,890.06 — مكسب 1.713x / +71.3%، مع انخفاض متوسط الوقت لأول رمز من 3.109 ثانية إلى 1.812 ثانية. يوضح المؤلف صراحةً أن هذه قياسات نموذجية تاريخية تم أخذها في 2026-09-29 على معدّلWhittle-Next-26B-A3B نقطة تفتيش، تشغيل عند TP1 بأوزان W8A8 وانتباه BF16 على 910C تحت CANN 9.0، باستخدام sglang.bench_serving أداة الاختبار عند التزامن 1 مع ستة طلبات، رمز إخراج واحد لكل منها، و36,096 بادئة مخزنة مؤقتًا مستبعدة من معدل نقل الرموز الجديدة. هي ليست معيارًا للفرع الأصلي في طلب السحب، فالمخرجات الأصلية لخدمة JSON غير موجودة في نسخة الشيفرة، والنتائج المحلية اللاحقة حوالي 5,000 رمز في الثانية استخدمت عملاً إضافيًا أصليًا للمفهرس وblock4 لم يُنسب صراحةً إلى هذا التغيير. يلاحظ المؤلف أيضًا أن أوزان المفهرس لنقطة التفتيش المعدلة خاملة وميزانيتها تختلف عن الأصلية، لذا لا شيء من ذلك يعد دليلاً على صحة المفهرس أو جودة التوليد خارج الميزانية.
توضيح واحد بشأن التسمية، لأنه سيربك أي شخص يبحث عن نقطة التفتيش: نموذج القياس هو المُخرَج المُكيَّف الخاص بالمساهم نفسه. وبشكل منفصل، فإن «Whittle-Next» هو أيضًا اسم سلسلة عامة من نماذج الضبط الدقيق MoE المشتقة من Qwen3.8، نشرها حساب طرف ثالث على Hugging Face، بما في ذلك نسخة 26B-A3B رُفعت في سبتمبر. تلك ليست النموذج Qwen4Exp الذي يستهدفه هذا الـ PR، ولا ينبغي أن تُقرأ على أنها تكوين القياس الكامن وراء رقم 1.713×.
هناك تحذيران إضافيان مصدرهما المؤلف لا أنا. لم يُتحقق من تكامل الخدمة الكامل، والتوازي الموزّع للموترات، ونموذج Qwen3.8-Flash-Next الكامل على هذا الفرع؛ ويقول المساهم إن إبقاءه مسودة أثناء مناقشة مسألة التكامل والاعتماديات متعمد، بل ويسأل في متن الـ PR عمّا إذا كان المحوّل ينتمي إلى SGLang أم إلى مستودع sgl-kernel-npuالمنفصل. كما أن CI ليس نظيفًا أيضًا — تُظهر كتلة الحالة في متن الـ PR إخفاقات في PR Test (Base) وPR Test (Extra) وتشغيل AMD ROCm 10. الصحة الموصوفة أعلاه على مستوى المشغّل؛ ولا شيء في الـ PR يدّعي نتيجة دقة أو إنتاجية من الطرف إلى الطرف على المكدس المتكامل.
لماذا تُعد QSA الجزء الصعب، بالأرقام
Qwen Sparse Attention ليست طبقة انتباه تقليدية، ويُظهر الإعداد المنشور لماذا يتعيّن على مورّد مسرّعات أن يكتب مسارًا مخصّصًا لها. من إعداد Qwen3.8-Flash-Next: 48 طبقة مرتّبة على شكل اثنتي عشرة تكرارًا من ثلاث كتل Gated DeltaNet متبوعة بكتلة انتباه كامل واحدة، full_attention_interval 4، وحجم مخفي 2,560، وبُعد رأس الانتباه 256، و24 رأس استعلام مقابل رأسي KV، وبُعد RoPE 64. أمّا المفهرِس الذي يجعل الانتباه متناثرًا فهو بنية متعددة الاستعلامات بأربعة رؤوس استعلام تشترك في رأس مفتاح واحد، وبُعد رأس 128، ونسبة ضغط 4، وميزانية 2,048 كتلة دقيقة مختارة لكل استعلام.
تلك الميزانية هي ما يحافظ عليه الـ PR ثابتًا. يبقى حجم الكتلة المتفرقة عند 1، ويبقى الوضع المتفرق عند 0، ويبقى وضع الانتباه عند 2، وواجهة الرموز المحددة لا تُمس؛ وتحسينات native indexer وblock4 خارج النطاق صراحةً. لذا فهذا محوّل مُثبَّت تحت آلية اختيار موجودة، وليس إعادة تنفيذ لـ QSA — وهو أيضًا سبب قدرة المؤلف على الادعاء بشكل موثوق بأن محتويات KV-cache لم تتغير.

تؤطّر بطاقة النموذج النية التصميمية بوضوح: فبدلًا من اختيار رموز فردية، تعمل QSA على مستوى الكتلة الدقيقة لخفض زمن الاستجابة في السياق الطويل، وهذه الدقة على مستوى الكتلة الدقيقة، إلى جانب حالة المحدِّد المكرَّرة المصاحبة لها، هي بالتحديد ما لا يتوافق بشكل نظيف مع نواة انتباه مُصفَّحة عامة على شرائح أيٍّ من المورّدين.
أين يقع هذا في إطار توسيع خدمة Qwen4Exp
إذا نُظر إليه وحده، فإن طلب سحب مسودة واحد على مسرّع واحد يثير الفضول. وعند مقارنته ببقية سبتمبر، فهو اللوح الرابع أو الخامس لمنصة يتم تجميعها علنًا قبل أن توجد العائلة التي تخدمها:
• البنية في أوزان مفتوحة — Qwen3.8-Flash-Next، 2026-08-24، نموذج MoE بـ 125 مليار معامل مع تفعيل 6 مليارات، وجدول تضمين n-gram بـ 51 مليار معامل، ورأس MTP بـ 4 مليارات، وتحمل model_type: qwen_exp والمعماريات Qwen4ExpForConditionalGeneration.
• جانب vLLM — #53909، طلب السحب «qwen4 fuse op» الذي يضيف نوى HyperConnection وQSA وPLE، لا يزال مفتوحًا وغير مدموج منذ 2026-08-26؛ و#59279، الذي يضيف توازي سياق فك الترميز إلى المسار QSA نفسه، مسودة فُتحت في 2026-09-29؛ وعمل تفريغ PLE الذي أُنجز خلال سبتمبر.
• الجانب الخاص بـ SGLang — #38642 لالتقاط الحالة المخفية في DFlash، و#39548 لتفريغ PLE إلى CPU على Ascend، و#40235 لإضافة تجهيز على المضيف لجدول PLE المدعوم بملف، والآن #41855 لمسار الانتباه على Ascend.
• خط تمكين NPU — sglang #37570، الذي يضيف Qwen3.8-Flash-Next إلى SGLang على NPU مع إعادة تشغيل الرسم البياني وMTP ونوى Triton (فُتح في 2026-09-02، وما زال مفتوحًا، +2,590 سطرًا عبر 20 ملفًا)، وsgl-kernel-npu #807 لنوى Triton المرافقة (فُتح في 2026-09-17، +4,643 سطرًا). كلاهما من المساهم نفسه. #41855 هو طبقة الانتباه التي تقع داخل جهد التمكين الأكبر ذلك.
ملاحظتان يمكن للقارئ أن يستفيد منهما عمليًا. أولًا، تقوم قصة Ascend Qwen4Exp بأكملها على عدد صغير جدًا من المساهمين — فطلبات السحب (PRs) الخاصة بالتمكين ومستودع النواة (kernel) يشتركان في مؤلف واحد، بينما يعود محوّل الانتباه (attention adapter) إلى مؤلف مختلف. ويُعد هذا التركّز تقديرًا منصفًا لمدى بُعد خدمة Ascend Qwen4Exp عن أن تكون مسار منتج مدعومًا بدلًا من مجرد تجربة. ثانيًا، عنق الزجاجة في النواة ليس خاصًا بمورّد بعينه: إذ توثّق مشكلتان في SGLang رُفعتا في 2026-08-28 عملية فك ترميز Qwen4Exp على NVIDIA DGX Spark، حيث يهيمن زمن نواة QSA وPLE وGated DeltaNet، وحيث ثبت بالقياس أن ذاكرة KV المؤقتة NVFP4 تسبب تراجعًا في فك الترميز بنحو 29% مقارنةً بـ fp8_e4m3. وطبقات الانتباه والتضمين في هذه البنية هي الجزء الصعب في كل مكان.
ما لا يعنيه هذا
لا يعني أن Qwen 4 قد صدر، أو أنه قريب من ذلك. عائلة Qwen 4 التي أعلنت عنها Alibaba في 2026-09-22 — Max و Flash و Plus وفئة 27B — لا تزال خارطة طريق بدون بطاقة نموذج، ولا أوزان، ولا معرف API، ولا نافذة سياق، ولا ترخيص، ولا سعر. محول إطار العمل الذي يستهدف اسم البنية الداخلية هو خطوة نحو تقديم خدمة جيدة لتلك العائلة يومًا ما؛ وهو ليس خطوة نحو وجود العائلة.
لا يعني ذلك أنه يمكنك تشغيل هذا اليوم. طلب السحب (PR) مسودة مع فشل في CI ولا يوجد تاريخ للدمج. وحتى لو دُمج، فإن المسار يتطلب Ascend 910C، وBF16، وCANN 9.0 مع torch-npu 2.10، وواحدًا من خمسة أشكال محددة لرأس محلي، وهو خيار اشتراك (opt-in) — ما يعني أن على عملية النشر أن تختاره. كما امتنع المؤلف عن ادعاء التحقق على مستوى الخادم، وهو الجزء الذي سيخبرك فعلاً بما إذا كان يصمد في ظل التجميع/الدفعات الحقيقية.
وهذا لا يعني أن Qwen3.8-Flash-Next منتج مدعوم على Ascend، أو في أي مكان آخر ضمن نسخة محرك مُشحونة. ومسارات Qwen4Exp في كلا بيئتي التشغيل المفتوحتين الرئيسيتين هي طلبات سحب غير مدموجة. ولا يوجد أي إصدار صادر من SGLang أو vLLM يمكنك تثبيته ويدعم هذه البنية دعماً أصلياً — فسهولة الاستخدام على طريقة FastAPI التي توفرها نقطة نهاية مستضافة شيء مختلف عن نواة يمكنك تشغيلها بنفسك، والفجوة بينهما هي بالضبط ما وُجدت طلبات السحب مثل هذا من أجله.
ما الذي يمكنك الاتصال به فعليًا أثناء انتظارك
إذا كان سبب اهتمامك بـ Qwen4Exp هو أنك تريد اختبار سلوك السياق الطويل للبنية بدلاً من تفاصيل النواة الداخلية، فإن النموذج الذي يجب أن تتجه إليه هو الطبقة التي تقدمها Alibaba فعليًا. Qwen3.8-Flash — خط الإنتاج المبني على Qwen3.8-Flash-Next، مع أدوات مدمجة رسميًا وسياق يبلغ 1,000,000 رمز — متاح على OrcaRouter باسم qwen/qwen3.8-flash: إدخال نص وصورة وفيديو، وحد أقصى للإخراج 131,072 رمزًا، و0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مع قراءات ذاكرة التخزين المؤقت بسعر 0.0184 دولار. هذه أسعار قائمة المزود التي تُمرَّر بها مع هامش ربح 0% من جانبنا، لذا فإن أي تغيير في السعر أو الحد الأقصى من المورّد يصلك في نفس اليوم الذي يُعلن فيه. خلال نافذة الأيام السبعة الماضية، تعرض البطاقة المباشرة زمن استجابة p50 لأول رمز يبلغ 4,416 مللي ثانية، وحوالي 106 رمز إخراج في الثانية، ومعدل خطأ 2.68% — وهو ملف طبقة نصية عالية الحجم وليس معاينة مختبرية.
تحفّظان صادقان، وهما نفسهما التحفظان اللذان تحملهما الكتابات الشقيقة عن هذه البنية. Qwen3.8-Flash-Next نفسه — نقطة تفتيش المعاينة FP8، الشيء الذي ستحتاج إليه لإعادة إنتاج أي من قياسات النوى هذه محليًا — غير مدرج في كتالوجنا؛ أما طبقة Flash المخدومة فهي النشر الإنتاجي المبني عليه، وليست نسخة المعاينة الخام. ولا يوجد أي من عمل Ascend أو DCP الموصوف أعلاه في أي شيء يمكنك استدعاؤه، لأن أيًا منه لم يُدمج. لكن ما تمنحك إياه الطبقة المخدومة فعلًا هو طريقة رخيصة لمعرفة ما إذا كان عبء عملك مُشكّلًا بما يلائم المشكلة التي تحلها هذه النوى — مطالبات طويلة كثيفة البادئات ووكيلية في مواجهة سياق طويل جدًا. وإذا كان الأمر كذلك، فإن الإنتاجية وسلوك الذاكرة المؤقتة الذي تلاحظه هناك هو السلوك نفسه الذي ستُضبط حزمة خدمة Qwen 4 لحمايته.
هناك أيضًا حجة تتعلق بالبنية التحتية لعدم الانتظار من أجل عائلة ليس لديها تاريخ إصدار. أيًّا كانت الفئة التي ستفوز في نهاية المطاف في تشكيلة Qwen 4، فإن تكلفة التبديل مسألة توجيه لا مشروع تكامل، وواجهة API واحدة لأكثر من 200 نموذجهي الطريقة التي تُبقي بها هذا الخيار مفتوحًا دون عقد ثانٍ أو تغيير في الشيفرة عندما تنزل الأوزان. تكتسب القدرة على تجاوز الفشل أهمية للسبب نفسه هنا بطريقة محددة: إذا أردت البناء بالاعتماد على فئة غير مجرّبة، فأنت تريد أن يُحوَّل الطلب إلى شيء مستقر بدلًا من أن يفشل عندما يمر المسار الذي راهنت عليه بلحظة سيئة.

ثلاثة أسئلة تستحق الإجابة عليها مباشرة
هل يعني SGLang #41855 أن Qwen 4 قد صدر، أم أنه متاح للمعاينة؟
لا، في كلا الأمرين. يستهدف طلب السحب معمارية Qwen4Exp كما هي مُنفَّذة في Qwen3.8-Flash-Next، التي أطلقتها Alibaba في 2026-08-24. وهو لا يمس أوزان Qwen 4، ولا توجد طبقة Qwen 4 لديها أوزان ليمسها. الإشارة التي ينبغي قراءتها هنا تتعلق بسعة التقديم لمعمارية معاينة، لا بتوفر العائلة.
إذا كانت بطاقة نموذج تقول qwen4_exp، فهل هذا يعني Qwen 4؟
لا — وهذا هو فخ التسمية في القصة كلها. qwen4_exp هو معرّف البنية الداخلية، وهو ما ستجده في config.json الخاص بـ Qwen3.8-Flash-Next وشقيقه FP8. عبارة "البنية التجريبية" هي الكلمة المفتاحية هنا: فالأوزان منشورة، والبنية حقيقية، والنموذج معاينة لما يُتوقع أن تُبنى عليه عائلة Qwen 4. البحث عن المعرّف والعثور على طلب سحب (PR) في SGLang أو vLLM يحمل في عنوانه Qwen4Exp يخبرك عن عمل المحرّك، لا عن إصدار.
هل هذه قصة Ascend في مواجهة NVIDIA؟
ليس تمامًا. احتاج مسار الانتباه نفسه إلى مهايئ مخصّص على جانب NVIDIA أيضًا — توازي سياق فك الترميز لـ QSA في vLLM، ونواة تعبئة أولية متناثرة أصلية لـ Hopper — كما تُظهر مشكلات DGX Spark أن زمن نواة QSA وPLE وGated DeltaNet يهيمن على فك الترميز هناك أيضًا. إن مفهرس الكتل الدقيقة في QSA وحالة المُحدِّد المنسوخة فيه ليسا ببساطة ما تفترضه نوى الانتباه المُصفّح العامة. ومساهمة Ascend في النمط هي القيد الأحدّ: مُبلِّط نسبة الرؤوس الذي لا يقبل إلا قوى الاثنين، مما يفرض الحشو الذي على المهايئ إخفاؤه.
الأمر الجدير بالمتابعة
ليس مسألة ما إذا كان هذا سيُدمج. فالمُهايئ صريح بشأن كونه مُهايئًا، واختبارات الصحة قابلة لإعادة الإنتاج دون نقطة تفتيش، وقد أشار المؤلف إلى مسألة التكامل بدلًا من التظاهر بأنها محسومة. الشيء الجدير بالمراقبة هو ما يحدث بعد دمج سطر تمكين NPU ومسار الانتباه هذا — وما إذا كان الفرع المدمج سيحصل على التشغيل من البداية إلى النهاية الذي لم يحصل عليه أيٌّ منهما، على دفعات حقيقية مع النموذج الكامل بدلًا من موترات محلية بأشكال الرؤوس. رقم 1.713× هو الرقم الذي سيتداول، وهو الرقم المحسوب على بناء مختلف، على نقطة تفتيش مُكيَّفة، مع مفهرس خامل. إن رقمًا مُقاسًا على الحزمة المكتملة سيكون ذا قيمة أكبر بكثير من رقم تاريخي.
حتى ذلك الحين، الملخص الصادق هو الذي يلتزم به الـ PR نفسه: الحساب سليم، والعلَم معطّل افتراضيًا، و CI أحمر، والنموذج المذكور في العنوان لا يزال غير موجود.
