بطاقة عنوان إنفوجرافيك مُولَّدة تقرأ «Qwen 4 — تقرير تسريب» تحت شارة «غير مُتحقَّق منه — لا إصدار»، بعنوان فرعي «تهيئة المضيف في SGLang لجدول PLE المدعوم بملف»، مع ثلاث شرائح تقرأ «المصدر: sgl-project/sglang #40235»، و«18 سبتمبر 2026» و«النسخة المشحونة: Qwen3.8-Flash-Next»، وبطاقة يسرى تقرأ «الجدار — جدول PLE من نوع n-gram بحجم 47.7 GiB» وبطاقة يمنى تقرأ «الادعاء — تهيئة المضيف المدعومة بملف، 71 GB من ذاكرة التخزين المؤقت للصفحات تنخفض إلى 6 GB»، وسطر تذييل يقرأ «إشارة، وليست قدرة مشحونة. لا توجد أوزان Qwen 4.» يقع شعار OrcaRouter في الشريط المُبطَّن أسفل اليمين.
Guides & Insights

تسريب Qwen 4: طلب السحب Host-Staging الخاص بـ SGLang يُظهر كيف يتّسع جدول PLE بحجم 47.7 GiB على وحدة GPU واحدة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الرقم الذي سيحدد ما إذا كان Qwen 4 نموذجًا يمكنك استضافته بنفسك ليس عدد معاملاته. إنه 47.7 GiB — حجم جدول تضمين n-gram الذي يسير جنبًا إلى جنب مع بنية Qwen4، منفصلًا عن الأوزان، ولا بد أن يعيش في مكان ما بينما يفك النموذج التشفير. طلب سحب فُتح في مستودع SGLang في 18 سبتمبر 2026، بعنوان [Qwen4-Exp] إضافة استضافة مضيف لـ PLE مدعوم بملف، هو محاولة لمنع ذلك الجدول من أن يفرض مقدار الذاكرة RAM التي تحتاجها الآلة قبل أن تعمل أصلًا. لا يزال Qwen 4 غير مُصدَر: لا بطاقة نموذج، ولا أوزان، ولا إدخال في الكتالوج، ولا تاريخ. النموذج الوحيد المُصدَر الذي يجسّد هذه البنية هو Qwen3.8-Flash-Next، المعاينة مفتوحة الأوزان المنشورة في 26 أغسطس 2026، التي يعلن تكوينها model_type=qwen4_exp — السلسلة نفسها التي تمنح طلب السحب اسمه. نظيره الإنتاجي Qwen3.8-Flash هو الإصدار الذي يستطيع مستدعي واجهة API الوصول إليه فعليًا اليوم. كل ما في هذه المقالة عن Qwen 4 هو استنتاج من تلك المعاينة ومن كود المحرك؛ طلب السحب مفتوح وغير مدموج، لذا اقرأ كل ذلك كإشارة، لا كقدرة مُصدَرة.

ما هي الإشارة فعليًا

A screenshot of the GitHub pull request page for sgl-project/sglang#40235, titled '[Qwen4-Exp] Add host staging for file-backed PLE', shown open with Dev-Jahn wanting to merge 1 commit into sgl-project:main from Dev-Jahn:task/ple-host-staged, counters reading Conversation 0, Commits 1, Checks 119 and Files changed 21, and a diff stat of +1,476 lines and -168. The Motivation section quotes the existing file backend (#37068) keeping the 47.7 GiB n-gram PLE table in a sparse file and requiring cudaDevAttrPageableMemoryAccessUsesHostPageTables, glossed as the GB10 class, and notes the HMM alternative running at 2.8x the pinned TPOT at concurrency 16 on an RTX PRO 6000 with an FP8 TP4 64 GB memory cap. The Modifications section lists PageCacheRowSource in qwen4_exp_ple_rows.py advising pages with POSIX_FADV_WILLNEED, PleHostStaging in qwen4_exp_ple_staging.py giving each PLE layer two pinned 8192-row buffers of 1.25 MiB each at FP8 plus one worker, host-side n-gram hashing in hash_contexts_numpy, and a CUDA-graph replay preparation step costing 0.5 to 1 ms per decode step over pinned. The right rail lists nine requested reviewers all awaiting review, with a note that at least 1 approving review is required to merge.

طلب السحب sgl-project/sglang#40235 ليس إطلاقًا وليس مدموجًا. إنه قائم على كوميت واحد، فتحه المساهم Dev-Jahn، بدمج فرع يسمى task/ple-host-staged في الخط الرئيسي لـ SGLang. طُلب من تسعة من مالكي الشيفرة مراجعته، ويظهر جميعهم كمنتظرين، لذا تفصل مراجعة موافقة واحدة على الأقل بين هذا وبين الرئيسي. ثلاث مهام في التكامل المستمر (CI) — اختبار طلب السحب الأساسي، واختبار طلب السحب الإضافي، وتشغيل AMD ROCm — تفشل على الكوميت المفتوح. هذه هي الحالة الطبيعية لتغيير كبير في المحرك قيد التنفيذ، وهي أيضًا سبب أن الجزء المثير للاهتمام في طلب السحب هذا ليس ما إذا كان سيصل إلى الرئيسي، بل ما كان على مؤلفه قياسه ليحتج به لصالحه. يحمل الوصف نحو 1,400 سطر مضاف، بما في ذلك الاختبارات، وجدول قياس أداء هو أكثر البيانات العامة ملموسية التي نشرها أي شخص عن تشغيل هذه البنية على وحدة معالجة رسومات واحدة.

لماذا الجدول هو القصة بأكملها

تُعد التضمينات لكل طبقة (Per-Layer Embeddings) الشذوذ البنيوي في هذا الجيل. فبينما يضع النموذج العادي تضمينًا واحدًا للرموز في المقدمة، يحمل تصميم Qwen4 جدول n-gram كبيرًا — من الثنائيات والثلاثيات، مُجزَّأ إلى مفردات أكبر بكثير من مفردات المُرمِّز — ويغذّي منه عمليات البحث عن التضمينات لكل طبقة على امتداد المكدس. تصف مواد المعاينة الخاصة بشركة علي بابا مكوّن n-gram بأنه عشرات مليارات المعاملات فوق جسم MoE ذي 125 مليار معامل؛ بينما تضع تحليلات المجتمع لنقطة التحقق المُصدَرة ملف الجدول عند 47.7 جيجابايت. هذه الأرقام مصدرها جهات موردة والمجتمع لا إعادة إنتاج مستقلة، والعلاقة الدقيقة بين جدول المعاينة وأيٍّ مما ستُطلقه Qwen 4 غير معروفة.

ما لا شك فيه هو التبعات الهندسية. فجدول جانبي بحجم 47.7 GiB يجب الرجوع إليه في كل خطوة فك ترميز ليس شيئًا يمكنك دفعه بهدوء إلى زاوية من VRAM. على بطاقة بسعة 96 GB ينافس مباشرة ذاكرة KV cache؛ وعلى البطاقات الأصغر لا يتسع ببساطة. لهذا أمضت SGLang، التي أقامت دعمًا من اليوم الأول للمعاينة في أواخر أغسطس، الأسابيع الثلاثة التالية وهي تنتج طلب سحب تلو الآخر حول بنية البيانات الواحدة هذه بدلًا من النموذج المحيط بها.

ما الذي كان معطلاً قبل طلب السحب هذا؟

كان لدى SGLang بالفعل طريقتان للاحتفاظ بالجدول، وكان لكلتيهما حدّ صارم.

Pinned يحتفظ بالجدول بأكمله في ذاكرة الوصول العشوائي للمضيف ويقرأه من هناك. إنه يعمل، وهو سريع، ويجعل متطلب ذاكرة المضيف مطلقًا — لا يوجد إصدار أصغر منه.

المدعوم بالملف، الذي أُضيف سابقًا في طلب سحب منفصل، يُبقي الجدول في ملف متناثر ويسمح لنواة التجميع بقراءة التعيين مباشرةً، بحيث يقرر مخزن صفحات نظام التشغيل مقدار ما يبقى مقيمًا منه. العائق عتادي: يتطلب مسار القراءة المباشرة هذا أن تُبلّغ وحدة معالجة الرسومات عن cudaDevAttrPageableMemoryAccessUsesHostPageTables — وهي القدرة التي يصفها نص طلب السحب نفسه بأنها "فئة GB10". على وحدة معالجة رسومات لا تمتلكها، تُرفض الخلفية المدعومة بالملف رفضًا قاطعًا ويبقى المثبّت هو الخيار الوحيد المتبقي.

الفجوة التي يخلقها ذلك ليست نظرية. تقرير منفصل مرفوع ضد مسار الشيفرة نفسه يوثّق مستخدمًا على اثنتين من RTX 3090s بلغ نصيب كل رتبة من الجدول 23.84 GiB مقابل 23.56 GiB من الذاكرة القابلة للاستخدام — أي نقص قدره 0.28 GiB، مع وجود 188 GiB من ذاكرة RAM الخاصة بالمضيف حرة. في ذلك التكوين رُفضت الواجهة الخلفية للملف بواسطة فحص العتاد، وعلم CPU-offload العادي يرفع خطأً عند دمجه مع علم تفريغ PLE. أن تكون أقل بثلاث مئة ميغابايت مع وجود مئة وثمانين غيغابايت احتياطية هو بالضبط شكل المشكلة التي وُجد طلب السحب هذا لإزالتها.

ما هي تغييرات تجهيز المضيف؟

الآلية التي يضيفها PR هي طبقة تجهيز وسيطة بين الملف والجهاز. فبدلًا من مطالبة GPU بفكّ مرجعية صفحات المضيف، يقرأ مكوّن على جانب CPU الصفوف التي يحتاجها عبر التعيين الموجود لدى المُحمِّل، وينصح النواة بسحب تلك الصفحات مسبقًا؛SGLANG_QWEN4_PLE_FILE_PREFETCHمتغيّر بيئة، يوقف هذه التوصية إذا أردت القياس من دونه. ثم تحصل كل طبقة PLE على مخزنَين مؤقتين مثبّتين بسعة 8,192 صفًا — نحو 1.25 MiB لكل منهما عند FP8 — وعامل واحد. تُجمَع الصفوف في أحد المخزنين بينما يُنسَخ الآخر إلى الجهاز، فيتداخل التجميع والنقل بدلًا من التسلسل. تُجزَّأ معرّفات N-gram على المضيف بدلًا من الجهاز. تحصل إعادة تشغيل الرسم البياني على استدعاء تحضيري قبل كل إعادة تشغيل، وينتظر خيط الإطلاق الخطوة السابقة.

هذا التفصيل الأخير هو التكلفة، ويذكر الـ PR ذلك بوضوح: نحو 0.5 إلى 1 مللي ثانية مضافة لكل خطوة فك ترميز على المسار المثبّت. كل ما عدا ذلك هو المكسب. تم القياس على بطاقة RTX PRO 6000 Blackwell واحدة بسعة 96 جيجابايت، ومضيف AMD EPYC بذاكرة RAM سعة 377 GiB، وCUDA 13.2، باستخدام نقاط التحقق العامة FP8 وNVFP4 الخاصة بـ Qwen3.8-Flash-Next:

ذاكرة التخزين المؤقت لصفحات المضيف، FP8 TP4/EP4 — 71 جيجابايت مثبّتة وبلا سقف، مقابل 49 جيجابايت عند سقف 64 جيجابايت، و15 جيجابايت عند 32 جيجابايت، و6 جيجابايت عند سقف 24 جيجابايت

زمن استجابة فك الترميز، نفس التشغيلات — 8.62 مللي ثانية لكل رمز عند التزامن 1 المثبّت، مقابل 9.16 / 9.20 / 9.12 مللي ثانية عبر التشغيلات الثلاثة للملف المحدود

التزامن 16 — 16.54 مللي ثانية مثبّتة مقابل 17.62 / 17.85 / 17.37 مللي ثانية مقيّدة، أي انخفاض من 893 توكنًا في الثانية إلى 827–840

إنتاجية التعبئة المسبقة — 620 رمزًا في الثانية عند 8k المثبَّت مقابل 624 / 630 / 631 المقيَّد؛ عند 32k، 1,347 مقابل 1,358 / 1,359 / 1,361

NVFP4 TP2 — 69 غيغابايت مثبَّتة مقابل 24 غيغابايت مع الواجهة الخلفية للملفات عند حدّ 32 غيغابايت، عند 8.87 مللي ثانية مقابل 9.18 مللي ثانية

NVFP4 على وحدة GPU واحدة — 69 غيغابايت مثبّتة مقابل 51 غيغابايت عند سقف 64 غيغابايت، عند 6.44 مللي ثانية مقابل 6.73 مللي ثانية

البديل الذي يتفوق عليه — قراءة الملف نفسه عبر إدارة ذاكرة المضيف على وحدة معالجة الرسومات تلك أعطت 10.8 مللي ثانية عند التزامن 1 و46.5 مللي ثانية عند التزامن 16، والذي يصفه PR بأنه 2.8× الكمون المثبت عند هذا التزامن

A generated two-column scoreboard titled 'Qwen4-Exp — what host staging buys'. The left column, 'Pinned (host RAM)', reads 'Host page cache: 71 GB uncapped', 'Decode latency c1: 8.62 ms', 'Concurrency 16: 16.54 ms', 'Prefill 8k: 620 tokens/s', 'Accuracy: token-identical greedy output' and 'Status: the baseline'. The right column, 'File-backed + host staging', reads 'Host page cache: 6 GB at a 24 GB cap', 'Decode latency c1: 9.12 ms', 'Concurrency 16: 17.37 ms', 'Prefill 8k: 631 tokens/s', 'Accuracy: GSM8K 97.6% vs 98.0%' and 'Status: open PR, unmerged, three failing CI runs'. A footer reads 'Figures from sgl-project/sglang PR #40235, unmerged and unreproduced; measured on one RTX PRO 6000 Blackwell 96 GB host.' The OrcaRouter logo sits in the bottom-right padded strip.

يُذكر أن جانب الدقة نظيف. كان الناتج الجشع الحتمي عبر ثمانية مطالبات من 256 رمزًا متطابقًا رمزًا برمز بين المسارين المثبّت ومسار الملف على FP8 TP4، وجاء GSM8K بنسبة 97.6% في المسار المثبّت مقابل 98.0% في مسار الملف عند حد 64 GB — فجوة من ستة أسئلة يعزوها المؤلف إلى التباين بين التشغيلات وليس إلى مسار التفريغ. كل هذه الأرقام هي أرقام مؤلف طلب السحب نفسه، قيست مرة واحدة على جهاز واحد، ولم يعِد أحد إنتاجها.

التكاليف التي تعترف بها العلاقات العامة

تتضمن القراءة المنصفة لطلب السحب هذا ما يرفض القيام به. تُرفض عدة أنماط تنفيذ في وقت الإنشاء بدلًا من تخفيضها بصمت، ويسمّي كل رفض الواجهة الخلفية المثبّتة كبديل احتياطي: رسوم CUDA للـprefill، والانتباه المتوازي على البيانات، ومسار تعدد الإرسال prefill-decode، وتداخل دفعتين، ورسوم فك ترميز DLLM، ورسوم التحقق المضغوطة غير المنتظمة، كلها مستبعدة. وبالقدر نفسه من الأهمية، لا يضيف أي علم جديد ولا أي مفتاح جديد يواجه المستخدم — فمسار التحضير المرحلي هو ما تفعله الواجهة الخلفية للملفات على عتاد لم يكن قادرًا على استخدامه إطلاقًا من قبل. كما يحمل تشغيل الدقة تحذيرًا يتطوع به المؤلف: لم تحتفظ التشغيلات المحدودة بالجدول بأكمله قط، لأن الجدول بحجم 47.7 GiB والحدود تنزل إلى 24 GB، لذا فإن عبء عمل بنمط وصول مسطح وغير متوقع حقًا على الجدول كله ليس ما جرى قياسه.

لماذا يعد هذا مهمًا لـ Qwen 4 على وجه التحديد

إذا جرّدنا الأمر من تفاصيل المحرّك، يصبح النمط مقروءًا بوضوح. أطلقت علي بابا معاينة معمارية في 26 أغسطس، مع تعليمات لمجتمع المصادر المفتوحة كي يُجهّز بيئات التشغيل والتكميم ومحرّكات الاستدلال قبل صدور العائلة الكاملة. فعلت SGLang ذلك، ثم أمضت ثلاثة أسابيع في تقديم طلبات سحب حول المكوّن الوحيد الذي يجعل نشر هذه المعمارية عسيرًا. وإذا قُرئ ذلك كتوقّع، فهو بيان عمّا سيحتاجه Qwen 4 من عتادك، لا عمّا يمكنه فعله في اختبار أداء.

كما أنه يزيد من حدة السؤال حول الجدول الزمني. لم يتم إصدار Qwen 4 بعد، والتكهنات المتعلقة به في سبتمبر تشير إلى مؤتمر Apsara الخاص بـ Alibaba في الفترة من 22 إلى 24 سبتمبر في Hangzhou — المكان الذي أُعلنت فيه أجيال Qwen السابقة. لا شيء من ذلك مؤكد، والنمط من دورة المعاينة الأخيرة هو أن معاينة معمارية تسبق المجموعة الكاملة بأشهر وليس بأسابيع. فتح طلب سحب قبل ثلاثة أيام من ذلك المؤتمر مثير للاستنتاج وليس أكثر.

الخلاصة الصادقة للموضع الذي يترك فيه هذا القارئ: Qwen 4 غير موجود، بينما Qwen3.8-Flash-Next موجود، والثاني يخبرك بما سيكلفك تشغيل الأول. إذا استمر جدول 47.7 GiB في الانكماش من حيث البصمة الفعّالة — وثلاثة أسابيع من طلبات السحب تقول إن العمل عليه جارٍ بجد — فإن عتبة النشر لعائلة Qwen 4 أقل مما أوحى به أسبوع إطلاق النسخة التجريبية.

ما الذي يمكنك فعله فعليًا بهذا اليوم

لا شيء في طلب السحب هذا متاح على main، والنموذج الذي يستهدفه ليس شيئًا يمكنك استدعاؤه عبر واجهة برمجة تطبيقات. إن نقطة التحقق Qwen3.8-Flash-Next ذات الأوزان المفتوحة حكاية استضافة ذاتية: تسحب الأوزان، وتقدّمها بنفسك، ومسار PLE المدعوم بالملفات هو ما تقرأ عنه. إنه غير موجّه هنا. ما يتم توجيهه هو النسخة الإنتاجية — Qwen3.8-Flash، يمكن الوصول إليها عبر qwen/qwen3.8-flash بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مع سياق يبلغ مليون رمز وإدخال نص وصورة وفيديو — والنموذج الأكبر Qwen3.8-Max بسعر 2.00 و6.00 دولار.

A screenshot of the OrcaRouter model page for Qwen3.8 Flash, model id qwen/qwen3.8-flash, dated 2026-08-26 and flagged NEW and FEATURED, with capability chips for Vision, Tools, JSON and Reasoning, a spec panel reading 1M tokens context, 131K max output, input text + image + video and output text, endpoints /v1/chat/completions and /v1/responses, and a stat row reading $0.15 per 1M input tokens, $0.47 per 1M output tokens, p50 time-to-first-token 5.93 s, p95 time-to-first-token 10.00 s and traffic of 2,552.9M tokens over 7 days, above an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

هذا التمييز هو المفيد للقارئ الذي يقرّر ما الذي يفعله هذا الأسبوع. فالنسخة التجريبية بحثٌ تُجريه بنفسك؛ أما النسخة المخدومة فهي مسار الإنتاج للبنية نفسها، ولا يفصلك عنها سوى نقطة نهاية واحدة. ويمرّر OrcaRouter سعر قائمة المزوّد كما هو بهامش ربح 0%، لذا فإن تغيّر سعر المورّد على نقطة النهاية تلك يظهر في اليوم نفسه بدلًا من دورة الفوترة التالية، وكل نموذج على المفتاح يمكن الوصول إليه عبر عنوان أساسي واحد متوافق مع OpenAI بدلًا من عقد وSDK وبيانات اعتماد منفصلة لكل مورّد. وبالنسبة لبنية بهذا الحداثة من العمر — حيث لا يزال عمل المحرّك يصدر أسبوعيًا ولم تُنشر خارطة الطريق — فإن التبديل التلقائي عند الفشل بين المزوّدين هو السبيل العملي للاعتماد على النسخة المخدومة دون المراهنة بمسار إنتاجي على جهوزية مزوّد واحد. كل ذلك يتعلق بالنماذج التي يمكنك استدعاؤها اليوم. ولا يقول شيئًا عن Qwen 4، فهو ليس واحدًا منها.

ما زلنا لا نعرفه

ما إذا كانت Qwen 4 ستطرح الجدول نفسه بالحجم نفسه. وما إذا كان طلب السحب سيُدمج أصلاً — فلديه ثلاث عمليات CI فاشلة ولا مراجعات بعد. وما إذا كانت عقوبة 0.5 إلى 1 مللي ثانية لكل خطوة تصمد خارج إعدادات التزامن المنخفض لدى المؤلف. وما إذا كانت Alibaba ستقول أي شيء في Apsara في 22 سبتمبر. بناءً على الأدلة الحالية، أسلم ما يمكن استنتاجه بشأن Qwen 4 ليس ما تحرزه من نتائج، بل مقدار الآلات التي تبنيها الصناعة فقط لجعله يتلاءم — وهو أمر مفيد بحد ذاته معرفته قبل أن يكون للنموذج اسم في أي كتالوج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا