بطاقة عنوان رئيسية تحمل النص 'Qwen4Exp QSA DCP' مع شارة 'غير مُتحقَّق منه — طلب سحب مسودة، غير مدموج'، والعنوان الرئيسي 'Qwen 4 QSA يحصل على توازي سياق فك الترميز'، والعنوان الفرعي 'داخل vLLM PR #59279 لمسار Qwen3.8-Flash-Next Qwen4Exp'، وثلاث شرائح تحمل 'المصدر: vllm-project/vllm PR #59279'، و'فُتح في 2026-09-29'، و'الحالة: مفتوح، مسودة'، وسطر تذييل يحمل 'أرقام أبلغ عنها المساهمون؛ لم تُدقَّق بشكل مستقل.' شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

تحصل Qwen 4 QSA على التوازي السياقي لفك الترميز: نظرة داخل مسودة طلب السحب (PR) الخاص بـ vLLM من أجل Qwen3.8-Flash-Next

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 29 سبتمبر 2026، ظهر طلب سحب مسودة في مستودع vLLM بعنوان «[Model][DCP] دعم Qwen4Exp QSA»، وهو يحمل، بالنسبة للنموذج الذي يصفه، أكثر أرقام الخدمة ملموسية التي نشرها أي شخص طوال الشهر: عمليات تشغيل مقترنة لـ Qwen3.8-Flash-Next على أربع وحدات معالجة رسومات تُظهر سعة رموز KV تنتقل من 9,759,529 إلى 17,603,636، وأقصى تزامن من 37.23× إلى 67.15×، وزمن الوصول إلى أول رمز ينخفض من 1,869 مللي ثانية إلى 767 مللي ثانية. Qwen3.8-Flash-Next هو النموذج التجريبي مفتوح الأوزان، ذو 125 مليار معلمة، من نوع مزيج الخبراء، الذي تصفه بطاقة Hugging Face الخاصة به بأنه «معاينة لمعمارية Qwen4»؛ ويضيف طلب السحب توازي سياق فك التشفير إلى مسار الانتباه المتناثر الذي بُنيت هذه المعمارية حوله. أما Qwen4 نفسه — فئات Qwen4: Max وFlash وPlus و27B التي سمّتها الشركة في مؤتمر Apsara الخاص بها في 22 سبتمبر 2026 — فلا يزال غير مُصدَر، بلا أوزان ولا مُعرّف ولا سعر ولا تاريخ. لذا اقرأ هذا على حقيقته: ليس إطلاقًا، ولا اختبارًا معياريًا، بل مُخرَج هندسي يخبرك كيف يتم توسيع غلاف خدمة Qwen4 قبل أن توجد العائلة.

هذه مادة عمّا نعرفه حتى الآن، والمصادر تهم أكثر من المعتاد. طلب السحب هو مسودة، مفتوح، وغير مدموج — vllm-project/vllm#59279، فُتح في 2026-09-29 بواسطة سونغسو ها، مهندس برمجيات في NVIDIA، ولا يزال في حالة مسودة. كل رقم أدناه هو القياس المقترن الخاص بالمؤلف، والمُبلَّغ عنه في متن الـ PR، والمأخوذ على مراجعة أقدم من العمل نفسه. لا شيء هنا مُدقَّق بشكل مستقل، ولا شيء هنا وصل إلى إصدار، والتحذير الذي يرفقه المؤلف جوهري بما يكفي ليحصل على قسم خاص به أدناه.

ما الذي يغيّره طلب السحب فعليًا

التوازي السياقي لفك الترميز — DCP — هو تقنية تقديم خدمات، وليس تغييرًا في النموذج. فبدلًا من أن تحتفظ مجموعة GPU واحدة بذاكرة KV cache كاملة، يقسّم DCP تلك الذاكرة عبر الرتب، بحيث لا تقرأ كل رتبة سوى شريحتها من السياق، بينما تُدمج نتائج الانتباه عبر الرتب في النهاية. الهدف هو السعة: فعند تقسيم الذاكرة، يمكن لنشرٍ ما أن يستوعب قدرًا أكبر بكثير من حركة السياق الطويل المتزامنة على العتاد نفسه، وهو بالضبط القيد الذي يؤثر بقوة عندما يحمل كل طلب ربع مليون رمز.

التعقيد هو أن انتباه Qwen المتناثر — QSA — ليس طبقة انتباه عادية. فكما تحدده بطاقة نموذج Qwen3.8-Flash-Next، يقوم مفهرس خفيف بضغط المفاتيح إلى كتل دقيقة بنسبة ضغط مقدارها 4، ثم يمنحها تقييمات، ويحتفظ بأفضل 512 كتلة، أي نحو 2,048 موضع رمز، بينما لا يزال softmax النهائي وتجميع القيم يعملان على K و V غير المضغوطتين. وهذا يعني أن QSA يحمل حالة أكبر من ذاكرة KV المؤقتة: فهناك الذاكرة الرئيسية، وهناك ذاكرتا المُحدِّد والجانبية اللتان يحتفظ بهما المفهرس. أما تطبيق DCP العام في vLLM فلا يعرف شيئًا من ذلك.

ما يفعله #59279، وفقًا لوصفه، هو تعريف DCP بالأجزاء الخاصة بـ QSA:

• تقرأ كل رتبة الجزء الخاص بها من ذاكرة KV الرئيسية، بينما يظل محدد QSA وذاكراته الجانبية منسوخة عبر الرتب بدلاً من تجزئتها.

• تُدمج نتائج الانتباه عبر الرُتب بعد القراءة المُقسَّمة.

• يُحتفَظ بالمُحدِّد وذاكرة KV المؤقتة الرئيسية في مجموعة ذاكرة مؤقتة واحدة، لذا لا يمكن أن يتباعدا.

• تُمنع دفعات V2 الاصطناعية من الكتابة في ذاكرات التخزين المؤقت الجانبية QSA.

A capture of the vLLM GitHub pull request #59279, titled '[Model][DCP] Support Qwen4Exp QSA', showing an Open state with a Draft badge, the head branch sungsooha:n4/qsa-dcp-clean-20260929, the description of how decode context parallelism is enabled for Qwen4Exp QSA, and the labels kv-cache-manager, mrv2, speculative-decoding, dflash, nvidia, qwen and ci/build.

هذا الزوج الأخير من التفاصيل هو الجزء المثير للاهتمام إذا كنت تهتم بالصحة بدلاً من الإنتاجية. ذاكرة التخزين المؤقت للانتباه المجزأة التي تختلف بصمت مع محدد منسوخ هي نوع الخلل الذي يظهر كتدهور بطيء في الدقة عند السياق الطويل بدلاً من انهيار، والتغيير صريح بشأن الحفاظ على تزامن الاثنين. يذكر المؤلف أيضاً أنه تم استخدام مساعدة الذكاء الاصطناعي وأن Codex يُنسب كمؤلف مشارك — وهذا يستحق أن يُقال بصراحة، لأنه في PR مسودة بهذا الشكل يكون من المشروع السؤال عن من كتب ماذا.

الأرقام المقترنة، وكيف تم أخذها

خطة الاختبار محددة بما يكفي لتكون قابلة للتحقق، ولهذا تستحق النتائج أن تُقتبس. يخدّم كلا الذراعين Qwen/Qwen3.8-Flash-Next-FP8 على أربع وحدات GPU مع التوازي التنسوري 4 وتوازي الخبراء مُفعَّل، عند --gpu-memory-utilization 0.90 مع تفعيل التخزين المؤقت للبادئة. الفرق الوحيد بين الذراعين هو --decode-context-parallel-size: يُغفَل من أجل DCP=1، ويُضبط على 2 من أجل DCP=2، مع إعادة تشغيل بين الذراعين بحيث يبدأ الاختبار المعياري من ذاكرة تخزين مؤقت باردة. الحمل هو أثر AgentX 256k عند 128 مستخدمًا لمدة 900 ثانية؛ الدقة هي EvalScope لـ GSM8K بالإضافة إلى مُقيّم MRCR المُودَع في المستودع، ويُشغَّل ست مرات لكل ذراع مع تجاهل أول تشغيل بعد إعادة التشغيل.

فروق الإنتاجية المُبلَّغ عنها، DCP=2 مقابل DCP=1:

• رموز KV — 9,759,529 مقابل 17,603,636، بزيادة 1.80× في سعة ذاكرة التخزين المؤقت.

• أقصى تزامن — 37.23× مقابل 67.15×، وأيضًا 1.80×.

• الطلبات في الثانية — 1.69 مقابل 2.30، 1.36×.

• رموز الإدخال في الثانية — 128,730 مقابل 179,702، 1.40×.

• زمن الوصول إلى أول رمز — 1,869 ms مقابل 767 ms، أقل بمقدار 2.44×.

• زمن الاستجابة بين الرموز — 43.48 ms مقابل 26.27 ms، أقل بـ 1.66×.

• معدل إصابة الذاكرة المؤقتة للبادئة في الحالة المستقرة — 67.85% مقابل 88.98%، بزيادة قدرها 21.1 نقطة مئوية.

A two-column comparison scoreboard titled 'Qwen4Exp QSA — DCP = 1 vs DCP = 2'. The DCP = 1 (baseline) column reads KV cache tokens 9,759,529, max concurrency 37.23x, requests/sec 1.69, time to first token 1,869 ms, inter-token latency 43.48 ms, prefix cache hit 67.85%. The DCP = 2 (context parallel) column reads KV cache tokens 17,603,636, max concurrency 67.15x, requests/sec 2.30, time to first token 767 ms, inter-token latency 26.27 ms, prefix cache hit 88.98%. A footer line reads that all figures are contributor-reported in vLLM PR #59279 and unaudited, measured on an earlier revision of the patch. The OrcaRouter logo is composited in the bottom-right corner.

كانت الدقة، المُبلَّغ عنها كمتوسط ± الانحراف المعياري للعينة عبر جولات ما بعد الإحماء، ثابتة إلى حد كبير: إجمالي MRCR 0.8630 ± 0.0005 عند DCP=1 مقابل 0.8697 ± 0.0153 عند DCP=2، وGSM8K 0.9788 ± 0.0020 مقابل 0.9790 ± 0.0016. كانت عينات MRCR ثنائية الإبر ورباعية الإبر ثابتة عند 0.9960 و0.9906؛ وجاء كل التفاوت في الجولة من عينات ثمانية الإبر — وسجّلت جولة إجمالية واحدة عند DCP=2 قيمة 0.8633 بينما تراوحت الأربع الأخرى بين 0.8620 و0.8632. هذا تفاوت، وليس ضجيجًا يمكن التلويح به جانبًا، وهو مذكور في PR بدلًا من التغاضي عنه.

ما لا تُثبته هذه الأرقام

التحذير موجود في نص طلب السحب وهو ليس صغيرًا. تم قياس نتائج AgentX والدقة المقترنة على أقدم نسخة QSA DCP، باستخدام إصدار vLLM الليلي المبني على الالتزام 3df4ae153eb. الالتزام النهائي النظيف في طلب السحب يتضمن إصلاحًا لاحقًا لنواة التوطين QSA وقد اجتاز التحقق المركّز على B200 — لكن التقييمات الكاملة لـ AgentX والدقة لم تُعَد على ذلك المصدر نفسه. بعبارة أخرى: قصة الإنتاجية والفرق المُشحون ليسا المُخرَج نفسه، والمؤلف يقول ذلك.

بعد ذلك، ينطبق الانضباط المعتاد، وهو ينطبق بقوة هنا. هذه أرقام إعداد واحد من مساهم واحد على إعداد واحد بأربع وحدات GPU. إنها قريبة من البائع بدلًا من أن تكون محايدة: فمساهم في إطار العمل يقيس تغييرًا في إطار العمل أمر طبيعي ومفيد، لكنه ليس تدقيقًا مستقلًا، ولم يُعِد أي طرف ثالث إنتاج التشغيل. لا يوجد إصدار vLLM مُصدَر يمكنك تثبيته اليوم يحتوي على هذا التغيير، لأن التغيير لم يُدمج بعد. و DCP=2 هو تقسيم ثنائي الاتجاه لشكل واحد محدد — الفروق ليست وعدًا بما قد يفعله DCP=4 أو DCP=8، ولا شيء في PR يزعم أنها كذلك.

لماذا لا يزال طلب سحب خاص بالخدمة عن بنية غير مُصدَرة يستحق وقتك

الاعتراض الواضح: النموذج في العنوان غير موجود، فلماذا الاهتمام؟ لأن ما يتم ضبطه ليس Qwen 4. إنه Qwen3.8-Flash-Next، وهذا النموذج موجود بالفعل — نشرته علي بابا في 2026-08-24 كـ MoE بـ 125 مليار معامل مع 6 مليارات مفعّلة، وجدول تضمين n-gram بـ 51 مليار معامل، ورأس MTP بـ 4 مليارات للفك التخميني، و48 طبقة مرتبة كاثنتي عشرة تكرارًا لثلاث كتل Gated DeltaNet متبوعة بكتلة QSA واحدة، و512 خبيرًا مع 10 موجهين و1 مشترك نشط، وسياق أصلي من 262,144 رمزًا تقول البطاقة إنه قابل للتمديد إلى 1,000,000. إنه التنفيذ المرجعي لمعمارية Qwen4 بأوزان مفتوحة، وQSA — الانتباه المتناثر للكتل الدقيقة الذي يعلّم طلب السحب هذا DCP كيفية تجزئته — هو الجزء الأكثر تميزًا فيه.

ما تصفه هذه الأرقام هو ما يحدث عندما تتوقف عن التعامل مع سياق الـ 262K ذلك باعتباره شيئًا يجب أن تحتفظ به مجموعة GPU واحدة كاملًا. إن القفزة بمقدار 1.80× في سعة رموز KV والتزامن هي حساب تقسيم ذاكرة تخزين مؤقت إلى قسمين، وهو أقل النتائج إثارة للدهشة في القائمة. أما الأرقام الأكثر إثارة للاهتمام فهي أرقام زمن الاستجابة: انخفاض زمن الوصول إلى أول رمز بمقدار 2.44×، وانخفاض زمن الاستجابة بين الرموز بمقدار 1.66× عند الحمل المعروض نفسه، إضافة إلى تحسن بمقدار 21 نقطة في معدل إصابة ذاكرة التخزين المؤقت للبادئة في الحالة المستقرة. وتشير هذه الأرقام إلى أن مسار DCP لا يشتري السعة فقط مقابل تكلفة في زمن الاستجابة — بل في هذه التجربة المزدوجة اشترى الاثنين معًا. وهذا هو شكل التغيير الذي يهم أي شخص يخدم حركة وكلاء عبر مطالبات نظام طويلة جدًا، لأن سلوك ذاكرة التخزين المؤقت للبادئة عند السياق الطويل هو عادةً حيث تموت إنتاجية السياق الطويل بهدوء.

وهذه ليست رقعة معزولة. فقد أنتج الأسبوع نفسه مجموعة من أعمال محرك Qwen4Exp: يضيف #59214 خطط GEMM لفك الترميز منخفض الكمون على SM100 لأشكال B200، ويضيف #59010 نواة prefill متناثرة أصلية على SM90 لمسار QSA على Hopper، ويغطي #58977 تضمينات BF16 INC PLE، أما #58961 — وهو الذي دُمج فعلاً، في 2026-09-28 — فقد أصلح ذاكرة KV cache للتوصيف كانت عروض مفاتيح QSA تُبقيها حية. وعند قراءتها معًا، فإنها تشكّل غلاف الخدمة لبنية Qwen4 التي تُبنى علنًا، في بيئات التشغيل، قبل أشهر من إطلاق العائلة. إذا كنت تخطط لـ Qwen 4، فإن الإشارة المفيدة ليست تاريخ إطلاق — فلا يوجد تاريخ — بل ما تفترضه النوى وتخطيطات الذاكرة المؤقتة مسبقًا حول الطريقة التي سيتعين عليك تقديمها بها.

ما الذي يمكنك تسميته اليوم

إذا كنت تريد اختبار السلوك طويل السياق على البنية التي يتناولها هذا الـ PR، فإن النموذج الذي ينبغي اللجوء إليه هو فئة Flash التي توفّرها علي بابا فعليًا. Qwen3.8-Flash — النشر الإنتاجي المبني على Qwen3.8-Flash-Next، بسياق يبلغ 1,000,000 رمز وأقصى إخراج 131,072 رمز، ويستقبل مدخلات نصية وصورية وفيديو — متاح الآن، وهو نقطة نهاية واحدة للنموذج الذي يشغّل بنية Qwen4Exp فعليًا اليوم، مُدرَج باسم qwen/qwen3.8-flash بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مع قراءات الذاكرة المؤقتة بسعر 0.0184 دولار. ولأن هذه أسعار قوائم مزوّدين تُمرَّر دون أي هامش ربح من جانبنا، فإن أي تغيير في سعر المورّد أو حدوده يصلك في اليوم نفسه الذي يُعلَن فيه.

A capture of the OrcaRouter model page for Qwen3.8 Flash (qwen/qwen3.8-flash), showing the model name and vendor, the Vision, Tools, JSON and Reasoning capability chips, text plus image plus video input, a 1,000,000-token context window, 131,072-token maximum output, a $0.15 per 1M token input rate and a $0.47 per 1M token output rate passed through at provider list price, and an OpenAI-compatible base URL of https://api.orcarouter.ai/v1.

تحفّظان صادقان. أولًا، Qwen3.8-Flash-Next نفسه — أوزان FP8 في خطة اختبار طلب السحب، تلك التي ستحتاجها لإعادة إنتاج أي من هذه القياسات محليًا — ليس في كتالوجنا؛ فطبقة Flash المقدَّمة هي خط إنتاج QwenCloud، وليست نقطة تحقق المعاينة الخام. إذا أردت تشغيل التكوين الدقيق الموجود في PR، فأنت تستضيفه ذاتيًا على أربع وحدات GPU. ثانيًا، تغيير DCP غير مدموج، لذا لا يوجد شيء يمكنك استدعاؤه في أي مكان اليوم يقوم بتشغيله. ما تمنحك إياه الطبقة المقدَّمة هو وسيلة لمعرفة ما إذا كان عبء عملك مهيأً أصلًا للمشكلة التي يحلّها DCP: إذا كانت مطالباتك طويلة ووكيلية وثقيلة البادئات، فإن سعة 1.80× ودلتا ذاكرة التخزين المؤقت للبادئة هما الرقمان اللذان ينبغي مراقبتهما في تتبعاتك الخاصة.

وإذا لم يكن الجزء المثير للاهتمام لديك نموذجًا واحدًا بل مسألة التبديل — أي مستوى تبني عليه بينما لا تزال تشكيلة Qwen 4 بلا اسم — فهذه مشكلة توجيه لا مشكلة تقديم، وواجهة API واحدة لأكثر من 200 نموذج هي طريقة إبقاء الخيار مفتوحًا دون عقد ثانٍ أو تغيير في الكود عندما تُطرح العائلة أخيرًا.

أسئلة تستحق إجابة مباشرة

هل يعني #59279 أن Qwen 4 قد صدر، أم أنه على وشك الصدور؟

لا. طلب السحب يتعلق بمعمارية Qwen4Exp كما هي منفَّذة في Qwen3.8-Flash-Next، التي أطلقتها Alibaba في 2026-08-24. عائلة Qwen 4 — Max وFlash وPlus و27B — سُمّيت على مسرح في Apsara في 2026-09-22 ووُضعت على خريطة طريق للشركة مع خط خلف متوقَّع بـ5 إلى 10 تريليونات معامل، وما زال ليس لديها بطاقة نموذج، ولا أوزان، ولا معرّف API، ولا نافذة سياق، ولا سعر، ولا تاريخ. طلب سحب لإطار عمل يضيف نمط توازٍ إلى المعمارية المعاينة هو خطوة نحو خدمة Qwen 4 جيدًا. إنه ليس خطوة نحو وجود Qwen 4.

كيف يختلف توازي سياق فك الترميز عن التوازي التنسوري؟

إنهما يقسّمان أشياء مختلفة ويفشلان بطرق مختلفة. يوزّع التوازي الموترّي الأوزان وحسابات كل طبقة على وحدات GPU، بحيث تشارك كل رتبة في كل توكن لكنها ترى التسلسل كاملًا. ويقسّم توازي سياق فك الترميز ذاكرة KV المؤقتة نفسها، بحيث تحتفظ كل رتبة وتقرأ فقط شريحة من السياق، ثم تُدمج نتائج الانتباه الجزئية لاحقًا. يتعلق TP باستيعاب النموذج؛ أما DCP فيتعلق باستيعاب السياق وحركة المرور المتزامنة التي تسير عليه. هذا التمييز هو بالضبط سبب كون هذا الـ PR غير بسيط: لا يمكن ببساطة تجزئة مُحدِّد QSA وذاكراته الجانبية بالطريقة التي يمكن بها تجزئة ذاكرة KV المؤقتة الرئيسية، لذا يجب على التغيير أن يجزّئ أحدها ويكرّر الأخرى، ثم يثبت أن الاثنين يبقيان متسقين.

إذا اتصلت بـ Qwen3.8-Flash-Next اليوم عبر واجهة برمجة تطبيقات مستضافة، فهل أحصل بالفعل على هذه الأرقام؟

لا، والفجوة تتكوّن من ثلاثة أجزاء. التغيير غير مدموج، لذا لا يحتوي أي إصدار منشور من vLLM عليه. وحتى بعد دمجه، على المزوّد أن يتبنّى ذلك البناء وأن يختار التشغيل بحجم DCP أكبر من واحد — فهو إعداد خدمة، وليس إعدادًا افتراضيًا. والفروقات المقاسة مأخوذة من نسخة سابقة من الرقعة وليس من الالتزام النهائي، الذي يذكر المؤلف أنه لم يخضع حتى الآن سوى لتحقق مركّز على B200. تعامل مع الفروقات المُبلَّغ عنها كحدّ أعلى موثّق جيدًا لما يوفّره هذا النهج في إعداد واحد، وليس كمواصفة لأي نقطة نهاية يمكنك استئجارها هذا الأسبوع.

السؤال المفتوح

ما يستحق المتابعة ليس ما إذا كانت هذه المسودة تحديدًا ستُدمج — والأرجح أنها ستُدمج بشكل أو بآخر، لأن معالجة الذاكرة المؤقتة الخاصة بـQSA التي تضيفها تمثّل فجوة حقيقية وليست مجرد تفضيل. ما يستحق المتابعة هو ما إذا كان الالتزام (commit) النهائي سيحظى بالتقييم المزدوج نفسه الذي حظيت به المراجعة الوسيطة. إن تغييرًا في طبقة الخدمة تأتي مزاعم معدل الإنتاجية فيه من بناء (build) واحد وتأتي مزاعم صحته من بناء آخر هو، في الوقت الحالي، اقتراح مُحكَم الحجة لا نتيجة مقيسة، وتباين الدقة في عينات MRCR ذات الإبر الثماني واسع بما يكفي لأن تكون إعادة تشغيل التجربة على المصدر المُصدَّر الشيء الأكثر فائدة الذي يمكن لأي أحد أن ينشره بهذا الشأن. وحتى ذلك الحين: الاتجاه واضح، ودفتر الحسابات لم يُقفل بعد، والنموذج الوحيد بمعمارية Qwen4 المتاح بأوزان مفتوحة لا يزال هو ذاك الصادر في أغسطس.