بطاقة رئيسية مُولَّدة لمقال «Qwen-Image 2.1 صدر بهدوء» تُظهر بطاقة مستديرة الحواف موسومة بـ«Qwen-Image 2.1» مع مؤشر معامل 7B، وإلى جانبها بطاقتان أصغر موسومتان بـ«PE-T2I» و«PE-I2I» ومعلَّمتان بـ9B، وشريط يحمل نص «صدر بهدوء، وليس دون إعلان».
Engineering & Research

تم إطلاق Qwen-Image 2.1 بهدوء: نظرة داخلية على Qwen/Qwen-Image-2.1-PE-I2I

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 20 سبتمبر 2026، وضع فريق Qwen-Image Qwen-Image 2.1 على Hugging Face وModelScope — الأوزان، وملف الترخيص، وبطاقة النموذج، ومقال مدونة، كل ذلك في اليوم نفسه، مع فترة تمهيد شبه معدومة قبله. الرقم الأبرز هو 7 مليارات معامل في مكوّن التوليد البصري. الجزء الذي لم يفتحه أحد تقريبًا بعد هو Qwen/Qwen-Image-2.1-PE-I2I، أحد نقطتي تحقق لإعادة صياغة المطالبات طُرحتا إلى جانب نموذج الصور. إنه ليس نموذج الصور. إنه الشيء الذي يحدّد ما تعنيه تعليماتك قبل أن يراها نموذج الصور أصلًا — وفي هذا الإصدار، هو المكوّن الذي يضبط بصمت اللغة التي تعود بها مخرجاتك.

ما الذي يعنيه «شُحن بهدوء» فعليًا هنا

الصياغة مهمة، لأن من السهل المبالغة في أي من الاتجاهين. لم يُسرَّب Qwen-Image 2.1، ولم يكن دون إعلان. هناك منشور مدونة من الجهة المورّدة بتاريخ 20 سبتمبر 2026، ومستودع GitHub يتضمن قسم أخبار مؤرخًا باليوم نفسه، وتنزيل مباشر للأوزان. لكن ما لم يحصل عليه هو فترة تمهيدية: الإشارة المسبقة الوحيدة كانت إشعارًا بتاريخ 17 سبتمبر يعرض 50 مقعدًا للوصول المبكر عبر ModelScope، مع مطالبة مختبِرين مختارين بنشر عيّنة أو مراجعة بحلول 29 سبتمبر. وبعد ثلاثة أيام، أصبحت الأوزان متاحة للعموم. لا كلمة رئيسية، ولا حظر على نشر نتائج المعايير، ولا دورة صحفية.

هذا نوع معيّن من الإصدار، ويجدر تسميته بدقة. أعلنت عنه الجهة المورّدة. ولم تروّج له الجهة المورّدة. وبالنسبة لأي شخص يقرر ما إذا كان سيبني عليه، فالنتيجة العملية هي أن لا يوجد تقييم مستقل يمكن الاعتماد عليه بعد — فقط مواد الجهة المورّدة نفسها وأي شيء ينشره المختبِرون ذوو الوصول المبكر خلال الأسبوع المقبل. تعامل مع كل ادعاء حول الجودة في هذا المقال على أنه صادر عن بطاقة النموذج ومنشور المدونة حتى يشغّله شخص من خارج Alibaba علنًا.

لماذا تُعد نقطة تفتيش PE-I2I هي المثيرة للاهتمام

يتضمن إصدار Qwen-Image 2.1 ثلاث قطع قابلة للتنزيل، وليس قطعة واحدة:

Qwen/Qwen-Image-2.1 — نموذج الصور نفسه. DiT أحادي المسار مكوَّن من 32 طبقة بمعاملات 7B في مكوّن التوليد البصري، ومشفّر نصي Qwen3-VL 8B، وVAE من نوع RGBA بـ64 قناة مع ضغط مكاني 16×. نحو 33 GB موزّعة على المكوّنات الثلاثة.

Qwen/Qwen-Image-2.1-PE-T2I — أداة لإعادة صياغة الأوامر لتوليد الصور من النص. نموذج Qwen3.5-VL 9B مُضبَّط بدقة، بحجم يقارب 18.8 جيجابايت.

Qwen/Qwen-Image-2.1-PE-I2I — مُعيد كتابة أوامر التوجيه لتحرير الصورة إلى الصورة. وهو أيضًا Qwen3.5-VL 9B مُضبوطٌ ضبطًا دقيقًا، وبحجم يقارب 18.8 GB أيضًا، وقد رُفِع إلى Hugging Face في 08:46 UTC يوم 20 سبتمبر.

"PE" هو تحسين المطالبة. يأخذ متغير I2I تعليمة تحرير غامضة بالإضافة إلى صورة إدخال واحدة أو أكثر ويعيد كتابتها إلى توجيه تحرير دقيق لا لبس فيه لنموذج الانتشار اللاحق. وصف المستودع نفسه صريح بشأن شكل الإدخال: صورة الإدخال موجودة دائمًا، لذا فهذه دائمًا مهمة تحرير صور وليست أبدًا تحويل نص إلى صورة من لا شيء. يوجد كود إعادة الكتابة في مجلد prompt_rewrite/ الذي يخدم كلا نقطتي التفتيش — --task t2i أو --task edit — مع مسار transformers، ومسار vLLM، و serve.sh بالإضافة إلى client.py لخدمة قائمة، و pe_core.py للمنطق المشترك.

وإليك لماذا يهم ذلك أكثر مما يبدو. فليس لدى نموذج الصور أي فكرة عما قصدته. لديه فكرة عما يقوله نصك التوجيهي حرفيًا، موزونةً بما يفعله بها مُرمِّز النص. إن أداة إعادة الصياغة الجالسة أمامه هي الموضع الذي يُحسم فيه الغموض — أو يُحسم بشكل خاطئ، وبشكل متسق، في كل صورة تولّدها. وفي نموذج موحّد للتوليد والتحرير مع ما يصل إلى 10 صور مرجعية، يكون لدى خطوة الحسم هذه مجال أكبر للخطأ من المعتاد.

موجه النظام هو المكان الذي يقيم فيه قرار اللغة

يضم مستودع PE-I2I system_prompt.txt إلى جانب الأوزان، وهو صريح على نحو غير معتاد بشأن أمر واحد: اللغة. عند قراءته مباشرةً، يُوجَّه مُعيد الصياغة إلى اتخاذ قرارين منفصلين لغويين، وإبقائهما منفصلين.

لغة الوصف. إنّ النصّ النثري الذي يكتبه المُعيد صياغةً لوصف التعديل يتبع لغة تعليمات المستخدم — تعليمة بالصينية، وصف بالصينية؛ وتعليمة بالإنجليزية، وصف بالإنجليزية؛ أما التعليمة باليابانية أو الكورية أو الفرنسية أو التايلاندية أو أي لغة أخرى، فتحصل على وصف بالإنجليزية.

لغة النص المُصيَّر. إن النص الذي سيُرسم فعليًا في الصورة الناتجة، والمُحمَّل بين علامتي اقتباس مزدوجتين، يُحدَّد وفق ترتيب أولويات صارم: أولًا، إذا حدَّد المستخدم النص الدقيق أو اللغة الهدف، فأطِع ذلك حرفيًا؛ ثانيًا، إذا كانت الصورة المُدخَلة تحتوي بالفعل على نص، فطابِق اللغة السائدة لذلك النص الموجود — حتى لو كانت التعليمات مكتوبة بلغة مختلفة؛ ثالثًا، إذا لم يوجد نص في الصورة ولم تُحدَّد أي لغة، فاستخدم لغة التعليمات نفسها، وبشكل خاص لا تفرضها أن تكون الإنجليزية.

يعزّز الموجِّه القاعدة الثانية بمثالٍ عملي — صورة معظمها باللغة التايلاندية، عُدِّلت بتعليمةٍ إنجليزية لا تُسمّي أي لغة، فيجب أن تُنتج نصًّا تايلانديًّا — ويضيف قيدين اثنين: أن يكون النص المُنتَج أحادي اللغة بدلًا من زوجٍ ثنائيٍّ صيني/إنجليزي، وأن يُحقَّق النوع البصري «ورقة المواصفات» أو «اللوحة القصصية» عبر التخطيط والطباعة، لا أبدًا بتحويل التسميات المُنتَجة إلى الإنجليزية.

هذا عمل هندسي صغير ذو تأثير واسع. إذا كنت تُنشئ صور المنتج لسوقٍ حيث تهم نصوص التغليف، فإن الفرق بين «أن تحافظ أداة إعادة الصياغة على لغة الملصق الحالية» و«أن تترجم أداة إعادة الصياغة كل شيء إلى الإنجليزية بكل لطف» هو الفرق بين أصل صالح للاستخدام وأصل مرفوض. ولأن هذا السلوك مُحدد في توجيه النظام الذي يُشحن مع المستودع، يمكنك قراءته، وعمل diff له، وتجاوزه — وهو ما لا يمكنك قوله عن الخطوة نفسها داخل نموذج مُستضاف مغلق.

ما هو المؤكد، وما هو غير المؤكد؟

إن الدقة في تحديد الحد هنا هي جوهر مقال من نوع «ما نعرفه».

تم التأكيد من المستودع وبطاقة النموذج — الرقم 7B / 32 طبقة لـ DiT أحادي المسار؛ مشفر النصوص Qwen3-VL 8B؛ VAE RGBA بـ 64 قناة عند ضغط مكاني 16×؛ انتباه سببي كتلي مع قناع سببي على مستوى الرمز للنص وقناع ثنائي الاتجاه على مستوى الكتلة لتوليد الصور؛ إعادة استخدام ذاكرة KV المؤقتة للبادئة، والتي تذكر البطاقة أنها تُنشط عندما يحمل نقطة التفتيش causal_condition: true (نعم، إنها كذلك)؛ مطابقة التدفق مع جدولة أويلر المنفصلة؛ إخراج أصلي بدقة 2K مع 2048×2048 كإعداد افتراضي عند 40 خطوة استدلال؛ سبعة إعدادات مسبقة موثقة لنسب الأبعاد؛ دعم ما يصل إلى 10 صور مرجعية؛ التحرير المحلي بواسطة دائرة، أو تعليق مرسوم، أو قناع منفصل؛ وتوليد RGBA، وتحرير الطبقات الشفافة، واستخلاص الهدف من صور RGB.

مؤكَّد بخصوص الترخيص، وهذا هو الجانب الحرج — الإصدار يخضع لاتفاقية ترخيص Qwen Research، المؤرخة في 20 سبتمبر 2026، والتي تمنح حقوقًا "لأغراض غير تجارية فقط" وتنص على أن الاستخدام التجاري يتطلب ترخيصًا منفصلًا يُطلب من المورّد. وهذا تغيير جوهري عن سلسلة Qwen-Image السابقة، التي صدرت بموجب Apache 2.0. اقرأ ملف الترخيص قبل أن تبني منتجًا على هذا، وليس بعده.

غير مؤكد — لا توجد بعد نتائج معيارية مستقلة. تشير منشور المدونة إلى مخطط مقارنة Qwen-Image-Bench، لكن الأرقام الواردة فيه هي أرقام المورّد نفسه ولم يعيدها أي طرف ثالث في وقت كتابة هذا النص. لا يوجد سعر منشور لنقطة نهاية مستضافة لـ Qwen-Image 2.1، ولا شروط معلنة للترخيص التجاري. ولا توجد أي كلمة بعد عمّا إذا كان سيتبع ذلك متغيّر بترخيص متساهل.

نقطة البيانات المستقلة الوحيدة الموجودة فعلاً هي مراجعة تطبيقية للوصول المبكر من مختبِر حصل على وصول عبر برنامج Qwen Ambassador وشغّل أوزان الإصدار النهائي عبر واجهة ModelScope Studio. أبلغت تلك المراجعة عن أزمنة توليد تبلغ نحو 10–15 ثانية للتحويل من النص إلى صورة و18–23 ثانية للتحرير، وأداء قوي في الإعدادات المسبقة لموضع الكاميرا وإسناد أدوار متعددة الشخصيات، ونمط فشل محدد يجدر معرفته: تدهور اتساق المراجع المتعددة بدءًا من نحو ثلاث صور مُدخلة فصاعدًا، مع انهيار موضع ذيل الفرس الجانبي إلى ذيل فرس مركزي عند زوايا العرض الجانبي. هذا مُراجِع واحد، على واجهة مستخدم للوصول المبكر، دون إظهار أي مؤقت. إنها إشارة مفيدة. وهي ليست مقياسًا معياريًا.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

دعم إطار العمل منذ اليوم الأول، وهو الخبر السار الهادئ

حيث يظهر النموذج يوم إطلاقه يخبرك أكثر عمّا إذا كان بإمكانك استخدامه فعلاً ممّا تفعله بطاقة النموذج، وقد ظهر Qwen-Image 2.1 على نطاق واسع:

Diffusers — تم دمج QwenImage21Pipeline في يوم الإطلاق، ويحمل مستودع النموذج وسم diffusers:QwenImage21Pipeline.

ComfyUI — دعم أصلي من اليوم الأول مع قوالب سير عمل للتحويل من النص إلى الصورة وتحرير الصور، بالإضافة إلى مستودع أوزان منفصل متوافق مع Comfy.

vLLM-Omni — تنفيذ خطوة بخطوة، والتخزين المؤقت البادئي لـ KV، وفك ترميز CUDA Graph، وتكميم FP8، والتوازي tensor/Ulysses.

SGLang — وصل طلب سحب للدعم الأصلي في 17 سبتمبر، أي قبل ثلاثة أيام من إطلاق الأوزان، ويغطي DiT وRGBA VAE وتكييف Qwen3-VL والصور المرجعية المتعددة وإدخال/إخراج RGBA، وقد جرى التحقق منه على H200 وB200 وRTX PRO 6000 وRTX 5090 وRTX 4090.

LightX2V — تسريع من اليوم الأول، بالإضافة إلى AMD Radeon عبر ROCm ودعم متعدد الشرائح من خلال FlagOS.

طلب السحب (pull request) الخاص بـ SGLang قبل الإصدار هو الدليل الفاضح. دعم الإطار الذي يصل قبل الأوزان يعني أن مسار الخدمة كان يُختبر مقابل نقطة التحقق (checkpoint)، لا أنه كُتب لاحقًا من بطاقة النموذج. وبالنسبة لمكوّن بحجم 7B يقف بجانبه مُرمِّز نصي بحجم 17.5 GB، فإن الفرق بين عطلة نهاية أسبوع من الاشتغال في تفاصيل جانبية مرهقة وبعد ظهر واحد.

بالنسبة لوحدات معالجة الرسومات المحدودة الإمكانيات، توصي بطاقة النموذج بتفريغ الحمل إلى وحدة المعالجة المركزية — pipe.enable_model_cpu_offload() — وهو مخرج الطوارئ القياسي بدلًا من كونه إصلاحًا. يهيمن مُرمِّز النص على تنزيل الـ 33 غيغابايت، وليس DiT؛ فمحوِّل الانتشار نفسه هو النصف الأصغر من الحزمة بنحو 14 غيغابايت.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

القراءة العملية

إذا كنت تريد تجربة Qwen-Image 2.1 اليوم، فالموقف الصادق هو أنك تستطيع ذلك، محليًا، بموجب ترخيص بحثي، دون اختبارات معيارية مستقلة ودون حقوق تجارية. هذه مقايضة معقولة للتقييم وسيئة لخط إنتاج، والفجوة بين هذين الأمرين هي بالضبط ما يقرره ملف الترخيص.

بالنسبة للفرق التي تختبر أداء نماذج الصور دون الرغبة في تخصيص مسار إنتاجي لنقطة تحقق عمرها بضعة أيام، فإن طبقة التوجيه هي المكان الذي يُحتوى فيه هذا الخطر. تضع OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI بسعر قائمة المزوّد وبدون أي هامش إضافي، مع تجاوز فشل تلقائي بين المزوّدين، لذا يمكن لنموذج لم تثبت جدارته أن يبقى خلف مسار إلى جانب نموذج تثق به بالفعل بدلاً من أن يحل محله — ولأن سعر القائمة يُمرَّر كما هو، فإن أي تخفيض سعر من المورّد على أي نموذج موجّه يصبح ساريًا في اليوم نفسه بدلاً من انتظار تغيير في العقد. Qwen-Image 2.1 ليس من بين النماذج التي نوجّهها وقت كتابة هذا المقال، ولن يوحي هذا المقال بغير ذلك. ما نوجّهه فعلاً هو خط الصور المحيط — عائلة GPT-Image من OpenAI، وفئات Imagen 4 من Google ومعاينات صور Gemini، ونقطة نهاية صور Grok Imagine من xAI — وهو المكان الذي سيأتي منه مسار تجاوز الفشل أثناء تقييمك للوافد الجديد على أجهزتك الخاصة.

السؤال المفتوح هو السؤال الذي لا يستطيع المستودع الإجابة عنه. أطلقت Alibaba نموذج صور مفتوح الأوزان بحجم 7B بموجب ترخيص للأبحاث فقط، في العام نفسه الذي أطلقت فيه Qwen-Image 3.0 كنموذج مستضاف مغلق بلا أوزان على الإطلاق. إصداران، ورهانان متعاكسان، يفصل بينهما أربعة أشهر. أيّ من هذين الشكلين سيتخذه نموذج Qwen للصور التالي — وما إذا كان ترخيص الأبحاث سيتحول يوماً إلى شيء يمكن لشركة استخدامه — هو ما يجب مراقبته. الأوزان متاحة على Hugging Face الآن، ويمكن لأي شخص قراءة ملف الترخيص بنفسه.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.