بطاقة بطل مُولَّدة للمقال، بعنوان SGLang-Diffusion يقدّم Qwen-Image-2.1، مع عنوان فرعي: خدمة من اليوم الأول، مقاسة، تعرض ثلاث بطاقات مستديرة مُعنونة: من نص إلى صورة، تحرير متعدد الصور، ومخرجات RGBA فوق شريط زمن استجابة يعرض 2.75 ثانية للتوليد و3.36 ثانية للتحرير، مع التعليق: 1024 × 1024، 40 خطوة، B200 واحدة.
Engineering & Research

SGLang-Diffusion يخدم Qwen-Image-2.1 منذ يوم الإطلاق: توليدات خلال 2.75 ثانية على شريحة B200 واحدة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصبح Qwen-Image-2.1 متاحًا للعموم في 20 سبتمبر 2026، وكان لدى فريق SGLang-Diffusion مسار خدمة ينتظره. يغطي دعم اليوم صفر المهام الثلاث التي يؤديها النموذج — توليد الصور من النص، وتحرير الصور المتعددة، وإخراج RGBA شفاف — ويأتي مع شيء أندر من طلب سحب مدمج: زمن استجابة مقاس على عتاد مذكور بالاسم، منشور مع الإعدادات التي أنتجته. على وحدة NVIDIA B200 واحدة، بدقة 1024×1024 عند 40 خطوة، تستقر أرقام SGLang عند 2.748 ثانية لعملية توليد و3.358 ثانية لعملية تحرير. طلب السحب الداعم، sgl-project/sglang#39983، فُتح في 17 سبتمبر — قبل ثلاثة أيام من إتاحة الأوزان للتنزيل — ولهذا السبب توجد الأرقام أصلًا بدلًا من أن تُوعَد بها لاحقًا.

ما الذي يعنيه «يوم الصفر» هنا، ولماذا يُعد التوقيت هو الجزء المثير للاهتمام

عادةً ما يُعلن عن دعم إطار العمل في نفس وقت إصدار النموذج، ويُسلَّم بعد ذلك بأسابيع. أما حالة SGLang فتسير في الاتجاه المعاكس. فقد كُتب التنفيذ مقابل نقطة تفتيش لم تكن عامة بعد، مما يجبر المؤلفين على التعامل مع البنية الحقيقية بدلاً من ورقة مواصفات: محول الانتشار، وVAE RGBA ذو 64 قناة، وتهيئة Qwen3-VL، وإدخال صور مرجعية متعددة، وإدخال وإخراج RGBA.

هذا هو سبب الوثوق بجدول زمن الوصول أكثر من قائمة القدرات. النموذج الذي لم تُقدَّم خدمته قط ليس لديه أرقام مقيسة، والرقم الذي يأتي مصحوبًا بالعتاد ودقة العرض وعدد الخطوات ودقة الحساب الخاصة به يمكن لأي شخص يملك البطاقة نفسها أن يتحقق منه. أرقام SGLang موسومة كتهيئة محددة، لا كادعاء عام بشأن النموذج.

وصلت بقية الأدوات في النافذة نفسها. أصدرت ComfyUI دعمًا أصليًا، ودمجت Diffusers QwenImage21Pipeline، وأضاف vLLM-Omni تنفيذًا تدريجيًا وتكميم FP8، وأضاف LightX2V تسريعًا مع دعم AMD Radeon عبر ROCm. تُعدّ الأُطُر الجزءَ من الإصدار الذي يحدد ما إذا كان بإمكان أي شخص خارج المختبر استخدامه.

A screenshot of the SGLang Diffusion cookbook page for Qwen-Image 2.1, captured September 21 2026, showing the Diffusion Models sidebar with Qwen-Image 2.1 marked new, the page heading Qwen-Image 2.1 with a Copy page control, the summary line Run Qwen-Image 2.1 text-to-image and image-conditioned generation with SGLang Diffusion, and the capability tags RGBA image, text-to-image, image editing, multi-image references and block-causal attention.

الأرقام، وما لا تقوله

ينشر عمل SGLang زمن الوصول لكل طلب، وليس الإنتاجية. يهم هذا التمييز إذا كنت تحدد حجم خدمة بدلًا من تشغيل عرض توضيحي: فالعملية التوليدية الواحدة التي تستغرق 2.7 ثانية تخبرك بزمن الرحلة ذهابًا وإيابًا، وليس بعدد المستخدمين المتزامنين الذين تستوعبهم بطاقة واحدة. الإعدادات المنشورة، وكلها عند 1024×1024 و40 خطوة:

B200، أوزان مقيمة، FlashAttention — توليد 2.748 ث، تحرير 3.358 ث، بعد إصلاح Q/K-norm وتغيير LayerNorm قلّل كلٌّ منهما النتيجة بنسبة قليلة.
RTX PRO 6000 Blackwell، 96 غيغابايت، مقيم — 8.23 ث توليد، 9.85 ث تحرير عند ذروة استهلاك 40.1 GiB؛ 10.28 ث و10.66 ث مع تفريغ محوّل الانتشار، ما يخفض الذروة إلى 26.1 GiB.
DGX Spark، 1× GB10، تنفيذ حثيث، فك ترميز VAE كامل — 35.36 ث توليد، 42.23 ث تحرير، و35.49 ث و42.21 ث للنسخ الشفافة. تتضمن هذه أرقامًا لتسلسل PNG. أنتجت رسوم CUDA القابلة للكسر بكسلات متطابقة دون أي فائدة سرعة قابلة للقياس (35.96 ث مقابل 35.64 ث)، ولم تُقَس الدفعات وإعدادات Spark المتعددة على الإطلاق.
RTX 4090، 24 غيغابايت، تفريغ طبقي، إزالة الضوضاء فقط — 26.69 ث عند BF16 الأساسي مع SDPA، و10.31 ث مع Cache-DiT (2.59×)، و5.59 ث مع Cache-DiT بالإضافة إلى مجموعة نوى INT8 (4.77×)، و4.74 ث بإضافة Sage attention (5.63×).

ثمة تحفّظان صادقان يلازمان تلك الصفوف. أولًا، إنها أزمنة استجابة لطلب واحد، وصف 4090 يقيس إزالة الضوضاء فقط — إذ يقع مشفّر النص وVAE خارج المؤقّت. ثانيًا، يصف مؤلفو SGLang التحقق الأوسع بأنه وظيفي، لا تقييمي: فمخرجات BF16 ليست مطابقة على مستوى البت عبر مختلف عمليات التوزيع، كما أن التكميم أو التوازي التنسوري يغيّر الأرقام. كون الشيء أسرع ومختلفًا ليس ككونه أسرع وأفضل.

A generated single-column spec scoreboard titled Qwen-Image-2.1 - the scoreboard, listing Generation component 7B single-stream DiT, Text encoder Qwen3-VL 8B, VAE 64-channel RGBA, Native output 2048 x 2048 at 40 steps, Reference images up to 10, and Hosted price none - self-host only, with a footer reading Qwen architecture per the vendor model card, unaudited; latency figures per SGLang-Diffusion, single request, 1024 x 1024 at 40 steps.

لماذا يُعد مسار الإخراج الشفاف هو الجدير بالمتابعة

RGBA هو حيث يختلف هذا النموذج عن نقاط نهاية الصور التي تستدعيها معظم الفرق بالفعل، وهو أيضًا حيث يصبح التقديم عسيرًا. يقوم Qwen-Image-2.1 بإزالة الضوضاء في فضاء كامن يحتوي على قناة ألفا كمكوّن من الدرجة الأولى، عبر VAE بصيغة RGBA ذي 64 قناة مع ضغط مكاني بمعامل 16×. الشفافية ليست معالجة لاحقة تُلحق باستخدام نموذج تجزئة؛ بل هي ما يخرجه المُعيّن.

خدمة ذلك جيدًا أصعب من خدمة RGB. فالمخرجات أكبر، ولدى VAE قنوات أكثر لفكّ ترميزها، ويحمل الطلب بتًا إضافيًا للوضع يتعيّن على المجدول توجيهه. وتغطي عملية التحقق في SGLang هذا السطح تحديدًا — إخراج PNG شفاف، وقناة ألفا محتفظ بها عبر النطاق الكامل 0–255، وقيمة RGBA PSNR تبلغ 60.69 ديسيبل في عيّنة واحدة، مع نجاح تهيئات FP8 أيضًا في التوليد الشفاف. وهذا فحص للصحة لا معيار للجودة، ويقول المؤلفون ذلك صراحةً. فهو يثبت أن قناة ألفا حقيقية وتصمد أمام التكميم؛ لكنه لا يقول شيئًا عن مدى نظافة الحواف في الشعر أو الفراء أو الزجاج.

القيمة العملية لمكدس تقديم بمسار شفافية مُختبَر هي أنه يحوّل خط أنابيب من ثلاث أدوات إلى استدعاء واحد. التوليد باستخدام ألفا، والتحرير داخل صورة تحتوي على ألفا بالفعل، واستخراج عنصر من صورة فوتوغرافية RGB عادية إلى طبقة شفافة، كلها تمر عبر نقطة النهاية نفسها.

أين يندرج هذا إذا لم تكن تشغّل وحدة معالجة الرسومات بنفسك

الجزء المزعج في إصدار Qwen-Image-2.1 هو أنه لا توجد نقطة نهاية مستضافة يمكن استدعاؤها. الأوزان عبارة عن تنزيل بحجم 33 غيغابايت تقريبًا، ومكوّن التوليد هو محوّل انتشار 7B مقترن بمشفّر نصي Qwen3-VL 8B، ويُطرح كل ذلك بموجب اتفاقية Qwen Research License Agreement المؤرخة في 20 سبتمبر 2026 — للاستخدام غير التجاري فقط، مع اشتراط حصول النشر التجاري على ترخيص منفصل من المورّد. لذا فإن وصفة SGLang ليست بديلاً عن واجهة برمجة التطبيقات. إنها واجهة برمجة التطبيقات، وأنت المشغّل.

هذا يغيّر الغرض من طبقة التوجيه. يضع OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI بسعر قائمة المزوّد دون أي هامش ربح، مع تحويل تلقائي عند الفشل عبر المزوّدين، ولغة توجيه DSL لتكوين بدائل احتياطية، ودمج للنماذج للاستدعاءات بنمط اللوحات — لكنه لا يوجّه أي نموذج Qwen-Image من أي إصدار، ولن يكون Qwen-Image-2.1 أبدًا مسارًا يمكنك استدعاؤه هناك. البنية الواقعية منقسمة: شغّل Qwen-Image-2.1 على عتادك الخاص عبر SGLang للأعمال الشفافة ومتعددة المراجع، وأرسل كل ما تبقّى إلى نماذج الصور المستضافة بمفتاح واحد. يضم كتالوجنا خط OpenAI GPT-Image، وفئات Imagen 4 من Google ومعاينات صور Gemini، ونقطة نهاية الصور Grok Imagine من xAI، وكلها بسعر القائمة الممرَّر كما هو، لذا فإن أي تغيير في سعر المزوّد لأي منها يسري لدينا في اليوم نفسه.

كيف يبدو النشر في الواقع

تأتي وثائق SGLang مع كتاب وصفات لهذا النموذج يتضمن أوامر لكل وحدة معالجة رسومات، والتشغيل الموصى به للخادم هو سطر واحد — sglang serve --model-path Qwen/Qwen-Image-2.1 --performance-mode speed. تدعم طلبات تحويل النص إلى صورة التجميع الديناميكي الاختياري؛ يتم التعامل مع طلبات تحرير الصورة كمسار منفصل، ويمكن لطلب واحد إرجاع مخرجات متعددة.

التكوينات التي جرى التحقق منها فعليًا أضيق مما توحي به مصفوفة التوافق. تُغطّى H200 وB200 وRTX PRO 6000 96 GB وRTX 5090 وRTX 4090 لتوليد وتحرير 1024×1024 عند 40 خطوة، بما في ذلك متغيّراتها الشفافة، إضافة إلى التوازي التنسوري متعدد وحدات GPU، وانتباه Ulysses وRing، وتفريغ الطبقات الطبقي layerwise offload، وفك ترميز VAE المبلّط المتوازي parallel tiled VAE decode، وCache-DiT، ومخططات CUDA graphs، وتكميم FP8 المتصل والمتسلسل online and serialized FP8 quantization. تبقى وصفات multi-GPU وNVFP4 على RTX PRO 6000 غير متحقَّق منها، كما أن RDMA متعدد المضيفين multi-host RDMA والأدوار المفكّكة متعددة الرتب multi-rank disaggregated roles غير مغطاة. وإذا كانت خطتك تتضمن أربع بطاقات وشبكة fabric، فأنت متقدّم على الأدلة المنشورة.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

أمران يستحقان المتابعة لاحقًا. الأول هو ما إذا كان أي أحد ينشر معدل الإنتاجية بدلًا من زمن الاستجابة — فأرقام التزامن هي ما يحوّل رقم 2.7 ثانية إلى خطة سعة. الثاني هو الترخيص: لا يوجد سعر منشور أو ورقة شروط للاستخدام التجاري لـ Qwen-Image-2.1، وإلى أن يوجد ذلك، فإن القيد غير التجاري هو القصة كاملة لأي شيء يُشحن إلى عميل.