بطاقة رئيسية للمقارنة بين Qwen-Image 2.1 وLLaDA-Image-Turbo، تُقابِل بين ترخيص Qwen المخصّص للبحث فقط وترخيص LLaDA-Image-Turbo غير المُصرَّح به، وبين محوّل انتشار بحجم 7B بـ40 خطوة ونموذج مُقطَّر بحجم 6B بـ4 خطوات
Guides & Insights

Qwen-Image 2.1 مقابل LLaDA-Image-Turbo: نموذجان مفتوحان للصور، وترخيصان مختلفان جدًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

صدر نموذجان للصور مفتوحا الأوزان في غضون الأسابيع الثلاثة ذاتها. نشر فريق Qwen-Image Qwen-Image 2.1 في 20 سبتمبر 2026 — الأوزان، وملف الترخيص، وبطاقة النموذج، ومنشور مدونة، كل ذلك في اليوم نفسه، دون أي فترة تحضير تقريبًا. قبل ستة عشر يومًا، في 4 سبتمبر 2026، نشرت inclusionAI (مختبر أبحاث مجموعة Ant) LLaDA-Image-Turbo دون منشور إطلاق، ولا بيان صحفي، ولا أي إعلان من أي نوع. كلاهما قابل للتنزيل اليوم. ولا يمتلك أي منهما نتيجة تقييم مستقلة واحدة. والفرق الذي سيحدد فعلياً أي النموذجين يمكنك استخدامه ليس في بطاقة أي منهما — بل في الأوراق. يُطرح Qwen-Image 2.1 بموجب ترخيص بحثي يمنع الاستخدام التجاري منعاً باتاً. أما LLaDA-Image-Turbo فيُطرح دون ترخيص مُعلن على أيٍّ من مستودعاته على الإطلاق.

مسألة الترخيص تأتي أولاً، لأنها الوحيدة التي لها إجابة واضحة

ابدأ من هنا، لأن كل شيء آخر في هذه المقارنة مؤقت، وهذا ليس كذلك.

Qwen-Image 2.1صدر بموجب اتفاقية ترخيص Qwen Research المؤرخة 20 سبتمبر 2026، والتي تمنح حقوقًا "لأغراض غير تجارية فقط" وتنص على أن الاستخدام التجاري يتطلب ترخيصًا منفصلًا يُطلب من المورد. وهذا تغيير جوهري عن سلسلة Qwen-Image السابقة، التي طُرحت بموجب Apache 2.0. الأمر لا لبس فيه: يمكنك قراءته وتقييمه وإجراء اختبارات قياس عليه والكتابة عنه. لا يمكنك تضمينه في منتج.

LLaDA-Image-Turbo لا يعلن عن أي ترخيص على الإطلاق. ليس ترخيصًا متساهلًا، ولا مقيّدًا، ولا شكليًا. إن المستودع الذي لا يحمل ترخيصًا ليس «حرًا في الاستخدام» بأي معنى قانوني — بل إن جميع الحقوق محفوظة افتراضيًا، وهو موقف أكثر صرامة من ترخيص Qwen البحثي، وليس أكثر تساهلًا. إذا كنت تخطط للبناء عليه، فهذا سؤال يوجَّه إلى المختبر، وليس إلى ملف README.

المفارقة تستحق أن تُقال بوضوح: النموذج الذي وصل بترخيص رسمي تقييدي هو الذي يمكنك التخطيط على أساسه اليوم، لأنك تعرف تمامًا أين تقف. أما النموذج الذي لا ترخيص له فهو الذي لا يمكنك التخطيط على أساسه.

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

ما هما النموذجان في الواقع

إذا استبعدنا مسألة الترخيص، فسنرى تصميمين مختلفين حقًا، صُنع كل منهما لسبب مختلف.

البنية — Qwen-Image 2.1 هو محوّل انتشار أحادي المسار مكوّن من 32 طبقة وبمعاملات تبلغ 7B في مكوّن التوليد البصري، مع مشفّر نصي Qwen3-VL 8B وVAE بـ64 قناة RGBA بضغط مكاني مقداره 16×، أي نحو 33 GB في كامل الحزمة. أما LLaDA-Image-Turbo فهو نموذج موحّد للتوليد والتحرير بحجم 6B — مجموعة واحدة من الأوزان تؤدي المهمتين معًا بدلًا من نموذج أساسي مضاف إليه مسار تحرير منفصل.

خطوات الاستدلال — يستخدم Qwen-Image 2.1 افتراضيًا 2048×2048 عند 40 خطوة مع مطابقة التدفق وجدولة أويلر المنفصلة. تم تقطير LLaDA-Image-Turbo عبر Twin-DMD إلى 2–4 خطوات، مع التوصية بـ4، ويعمل عند مقياس إرشاد 1.0 مقابل 5.0 لنموذج Base.

خيارات الدقة — يوفّر Qwen-Image 2.1 دعم التكميم FP8 عبر مسار vLLM-Omni الخاص به. يأتي LLaDA-Image-Turbo بنقاط حفظ BF16 وFP8 كتنزيلات منفصلة.

التهيئة المرجعية — يقبل Qwen-Image 2.1 ما يصل إلى 10 صور مرجعية، ويدعم التعديلات الموضعية عبر التحديد بدائرة، أو التعليق المرسوم، أو قناع منفصل، ويولّد صورًا بصيغة RGBA أصلية مع تحرير الطبقات الشفافة. ولا تنشر بطاقة LLaDA-Image-Turbo أي حدّ أقصى للصور المرجعية.

انتباه — يستخدم Qwen-Image 2.1 انتباهاً سببيّاً كتليّاً: قناع سببي على مستوى الوحدة النصية للنص وقناع ثنائي الاتجاه على مستوى الكتلة لتوليد الصور، مع إعادة استخدام ذاكرة KV المؤقتة للبادئة عندما تحمل نقطة التحقق causal_condition: true. لا تصف بطاقة LLaDA-Image-Turbo مخطط التقنيع الخاص بها بهذا القدر من التفصيل.

الترخيص — لأغراض البحث فقط وصريح، مقابل غير معلَن.

لاحظ ما تعنيه أعداد الخطوات مع أعداد المعلمات. Qwen-Image 2.1 هو نموذج أكبر يعمل لعشرة أضعاف عدد الخطوات؛ LLaDA-Image-Turbo هو نموذج أصغر مقطّر وصولاً إلى حفنة من الخطوات. هذان رهانان متعاكسان على أين تكمن تكلفة توليد الصور، وتعتمد الإجابة الصحيحة كليًا على ما إذا كان عنق الزجاجة لديك هو ثواني وحدة معالجة الرسوميات لكل صورة أو الحد الأقصى لما يمكن أن تبدو عليه الصورة.

اقتصاديات السرعة: 40 خطوة مقابل 4

اسم Turbo يؤدي عملًا حقيقيًا هنا. يؤدي تقطير Twin-DMD إلى طيّ مسار الانتشار في بضع قفزات كبيرة، ولهذا يمكن تشغيل LLaDA-Image-Turbo عند 4 خطوات حيث يريد طرازه Base جدولًا تقليديًا. عند التوجيه 1.0، يتخطى أيضًا التوجيه الخالي من المصنّف، الذي يضاعف عادةً عدد مرات التمرير الأمامي في كل خطوة — لذا فإن الفجوة الفعلية أوسع مما يوحي به 40 مقابل 4 بمفرده.

ما يوفره لك ذلك هو الإنتاجية وقابلية التنبؤ. نموذج بحجم 6B عند أربع خطوات هو النوع الذي يتسع على بطاقة استهلاكية واحدة وينتج صورة أولية بسرعة كافية لتندرج داخل حلقة تفاعلية. Qwen-Image 2.1 عند 40 خطوة و2048×2048 هو تكوين يضع الجودة أولاً؛ وتوصية بطاقة النموذج نفسها للأجهزة المحدودة هي تفريغ الحمل إلى المعالج عبر pipe.enable_model_cpu_offload()، وهو مخرج طارئ لا حل جذري.

المقابل لذلك هو أن التقطير ضغطٌ للقدرات، ولم يقس أي شيء هنا أحدٌ من خارج المختبرين. نقطة البيانات المستقلة الوحيدة الموجودة لأي من النموذجين هي مراجعة تطبيقية مبكرة الوصول لـ Qwen-Image 2.1 من مختبِر في برنامج Qwen Ambassador، شغّل الأوزان النهائية عبر واجهة ModelScope Studio وأفاد بنحو 10–15 ثانية للنص إلى صورة و18–23 ثانية للتحرير. هذا مراجِع واحد، على واجهة استخدام مبكرة الوصول، دون إظهار أي مؤقت — إشارة مفيدة، وليست معيارًا. ولا يوجد لـ LLaDA-Image-Turbo أي تقرير تطبيقي مماثل متاح علنًا على الإطلاق.

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

التحرير هو المجال الذي يتباين فيه التصميمان أكثر من أي شيء آخر

كلا النموذجين يقومان بالتحويل من النص إلى صورة والتحرير، لكنهما يصلان إلى ذلك بطرق مختلفة، ويظهر الاختلاف في البنية الداخلية بدلاً من المخرجات.

يتعامل Qwen-Image 2.1 مع اتباع التعليمات باعتباره مكوّنًا منفصلًا قابلًا للفحص. وإلى جانب نموذج الصور، يتضمّن الإصدار نقطتَي تحقّق لإعادة كتابة المطالبات — Qwen/Qwen-Image-2.1-PE-T2I وQwen/Qwen-Image-2.1-PE-I2I، وكلٌّ منهما Qwen3.5-VL 9B مُضبَّط بدقة عند حوالي 18.8 GB — يأخذان تعليمة غامضة ويعيدان كتابتها إلى توجيه لا لبس فيه قبل أن يراها نموذج الانتشار. system_prompt.txt يمكنك قراءته وتجاوزه، وهي صريحة على نحو غير معتاد بشأن اللغة: تتبع لغة الوصف تعليماتك، بينما لغة النص المرسوم داخل الصورة تُحدَّد بترتيب أولويات صارم يحافظ على لغة التسميات الموجودة في صورة الإدخال حتى عندما تُدخل مطالبتك بلغة مختلفة.

هذا عمل هندسي صغير ذو تأثير واسع. إذا كنت تنتج صورًا للمنتجات لسوقٍ يُعدّ نص التغليف فيه مهمًا، فإن «المُعيد للصياغة يحافظ على لغة الملصق الحالية» و«المُعيد للصياغة يترجم كل شيء إلى الإنجليزية بشكل مفيد» هما الفرق بين أصل قابل للاستخدام وأصل مرفوض — ولأنه يوجد في موجه نظام بدلًا من أن يكون داخل صندوق أسود مُستضاف، يمكنك إجراء diff عليه وتغييره.

يقدّم LLaDA-Image-Turbo مقايضة معاكسة: نموذج واحد بحجم 6B، ومجموعة أوزان واحدة، والتوليد والتحرير يتشاركان كل شيء. أجزاء متحركة أقل، وقدر أقل مما يحتاج إلى تكوين، ولا شيء يمكن فحصه أو تجاوزه. وتستشهد بطاقته بأرقام Qwen-Image-Bench تبلغ 53.53 في الإنجليزية و53.38 في الصينية مع ادعاء تحقيق حالة SOTA مفتوحة المصدر — وهو رقم مبلَّغ عنه من البائع، وغير مُعاد إنتاجه، ولاحظ أن المعيار الذي يفوز به سُمّي على اسم النموذج الذي ينافسه ضمنيًا.

ما الذي ستشغّلها عليه فعليًا

دعم المنظومة في يوم الإطلاق هو الجزء الأقل بريقًا في أي إصدار، وهو الجزء الذي يحدد ما إذا كنت ستقضي بعد الظهر أم عطلة نهاية الأسبوع.

Qwen-Image 2.1 أُتيحت على نطاق واسع: QwenImage21Pipeline اندمج في Diffusers في اليوم الأول؛ دعم أصلي لـ ComfyUI مع قوالب سير عمل النص إلى صورة وتحرير الصور؛ vLLM-Omni بتنفيذ خطوة بخطوة، وتخزين KV مؤقت للبادئة، وفك ترميز CUDA Graph، وتكميم FP8، وتوازٍ tensor/Ulysses؛ وطلب سحب للدعم الأصلي لـ SGLang وصل في 17 سبتمبر — ثلاثة أيام قبل الأوزان — يغطي DiT، وRGBA VAE، وتكييف Qwen3-VL، وإدخال متعدد المراجع، وتم التحقق منه على H200، وB200، وRTX PRO 6000، وRTX 5090، وRTX 4090؛ وتسريع في اليوم الأول عبر LightX2V مع AMD Radeon عبر ROCm، ودعم متعدد الرقائق عبر FlagOS.

LLaDA-Image-Turboحصل LLaDA-Image-Turbo على دعم ComfyUI في 7 سبتمبر 2026، بعد ثلاثة أيام من الأوزان، إضافةً إلى توزيع Diffusers وSafetensors. هذا مسار حقيقي لتشغيله، لكنه أرقّ، ولا يوجد عمل مكافئ لخدمة ما قبل الإصدار يمكن الإشارة إليه.

طلب السحب SGLang قبل الإصدار هو المؤشر على Qwen-Image 2.1. دعم إطار العمل الذي يُطرح قبل الأوزان يعني أن أحدهم كان يختبر مسار الخدمة مقابل نقطة التحقق، لا أن يكتبه انطلاقاً من بطاقة النموذج لاحقاً.

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

المسار المستضاف الذي تحتفظ به إلى جانب التجربة

لا يمكن توجيه أي من هذين النموذجين عبر OrcaRouter وقت كتابة هذا النص، ولن يوحي هذا المقال بغير ذلك — فكلاهما خيار قائم على الاستضافة الذاتية، أحدهما بموجب ترخيص يستبعد الاستخدام الإنتاجي، والآخر بلا ترخيص على الإطلاق. وما يهم الفريق الذي يقيّمهما هو أن التقييم ليس مضطرًا لأن يقع على المسار الحرج.

يضع OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI بسعر قائمة المزوّد ودون أي هامش ربح، مع تحويل تلقائي عند الفشل بين المزوّدين ولغة توجيه خاصة (DSL) تتيح لك تركيب عدة نماذج في استدعاء واحد. الشكل العملي لذلك بالنسبة لهذا القرار هو مسار يحمل فيه النموذج الذي تثق به بالفعل حركة الإنتاج بينما تُختبر نقطة تحقق مستضافة ذاتيًا إلى جانبه — ولأن سعر القائمة يُمرَّر كما هو بدلًا من إضافة هامش ربح، فإن أي تغيير في سعر المورّد لأي نموذج موجّه يصبح ساريًا لدينا في اليوم نفسه بدلًا من انتظار تعديل عقد. نماذج الصور التي نوجّهها اليوم هي عائلة GPT-Image من OpenAI، ومستويات Imagen 4 من Google ومعاينات صور Gemini، ونقطة نهاية صور Grok Imagine من xAI. إذا كنت ستقضي أسبوعًا في إعداد محوّل انتشار بحجم 33 غيغابايت لمعرفة ما إذا كان يتفوق على نموذج مستضاف، النموذج المستضاف هو المجموعة الضابطة، ومن المفيد أن تكون المجموعة الضابطة جاهزة لديك بالفعل على مفتاح.

ما الذي قد يغيّر هذه المقارنة؟

ثلاثة أمور، مرتبة حسب مدى أهميتها.

أولاً، نتيجة معيارية مستقلة لأيٍّ من النموذجين. لا يملك أيٌّ منهما واحدة، وإلى أن يتغير ذلك، فإن كل ادعاء عن الجودة من كلا الجانبين ليس سوى مختبر يصحّح واجباته بنفسه. ثانياً، ترخيص: نسخة متساهلة من Qwen-Image 2.1 ستجعله الخيار الافتراضي البديهي لأعمال الصور المفتوحة عند 7B، وأي ترخيص معلن على الإطلاق لـ LLaDA-Image-Turbo سيجعله على الأقل قابلاً للتخطيط. ثالثاً، طُلب من مختبرِي الوصول المبكر في برنامج ModelScope الخاص بـ Qwen بتاريخ 17 سبتمبر نشر عينات أو مراجعات بحلول 29 سبتمبر — أي بعد ثمانية أيام من الآن. عندها يتوقف هذا عن كونه مقارنة بين بطاقتي نموذجين ويصبح مقارنة حقيقية. حتى ذلك الحين، الملخص الصادق هو أن Qwen-Image 2.1 هو النموذج الذي يبدو أكثر قدرةً لكن لا يمكنك الاستفادة منه تجارياً، وLLaDA-Image-Turbo هو الأسرع لكن لا يمكنك استخدامه إطلاقاً دون محادثة، وملف الترخيص هو الجزء الوحيد في أيٍّ من الإصدارين الذي استقر بالكامل.