
Ming-Image-0.1-Design مقابل Qwen-Image 3.0: من يُظهر لك كيف يُرسم النص
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
أكثر ما يثير الاهتمام في Ming-Image-0.1-Design ليس على بطاقة النموذج الخاصة به. بل في التزام (commit) إلى إطار استدلال. في وقت ما قرب الرفع الهادئ للنموذج إلى Hugging Face في 17 سبتمبر 2026، دمج vLLM-Omni تغييرًا بعنوان feat: إضافة دعم byte5 لـ Ming يربط مُرمِّز محارف ByT5 بـming_flash_omniخط الأنابيب الجديد — مكوّن مخصص تتمثل مهمته كلها في النظر إلى المحارف التي طلبت عرضها، لا إلى الصورة التي طلبتها. هذا نوع التفصيل الذي لا تجده إلا بقراءة الشفرة، وهو بالضبط التفصيل الذي Qwen-Image 3.0 — نموذج الصور المستضاف المغلق الخاص بالبائع، الذي طُرح في 21 يوليو 2026 وأصبح متاحًا عمومًا في 5 أغسطس — لا يسمح لأي أحد بقراءته على الإطلاق. كلا النموذجين موجّهان إلى أعمال التصميم حيث تكون الطباعة المقروءة هي الجزء الصعب. واحد فقط منهما سيخبرك كيف يفعل ذلك.
ما يقوله كل واحد منهم عن النص
قصة عرض النصوص في Qwen-Image 3.0 هي بالكامل ادعاء إطلاق، وهو ادعاء جيد على الورق. تصف مواد علي بابا مطالبات تصل إلى نحو 4,500 رمز، ونصوصًا قابلة للقراءة حتى حوالي 10 بكسلات، وتغطية 12 لغة عبر أكثر من 20 خطًا، ومخرجات تصل إلى 2048×2048 وما يصل إلى ست صور لكل استدعاء، تُقدَّم في إصدارين Pro وStandard عبر واجهة برمجة تطبيقات مستضافة واحدة. لا يوجد إصدار أوزان، ولا ترخيص معلن، ولا بطاقة نموذج، ولا تقرير فني، ولا جدول معايير منشور للتحقق من أي من ذلك. رقم معاملات MMDiT البالغ نحو 20 مليارًا الذي يُكرَّر على نطاق واسع مُبلَّغ عنه لا مؤكَّد.
قصة Ming-Image-0.1-Design هي مستودع. 6,154,901,056 معلمة، رخصة MIT، مع diffusers، وهو وسم خط أنابيب. جميع الأوزان في BF16 safetensors، حوالي 71.5 GB عبر connector/، mllm/، mlp/، scheduler/، transformer/ و vae/. الاستدلال الموصى به هو 2048×2048 عند 12 خطوة أخذ عينات مع التوجيه عند 1.0 على وحدة معالجة رسومات CUDA واحدة بسعة 80 GiB، أو 1024 للسرعة، مع تسمية vLLM-Omni للنشر ونموذج منفصل للرؤية واللغة مسمى لتحسين المطالبة. تصف البطاقة النموذج كنموذج نص إلى صورة لواجهة المستخدم، والرسوم البيانية، والملصقات، وغيرها من التصميم البصري الغني بالنصوص، مع إخراج RGBA لخلفيات شفافة.
تلك الفقرتان ليستا من النوع نفسه من العبارات، ومن الجدير أن نكون صريحين بشأن السبب. إحداهما وصف لمنتج كتبه الأشخاص الذين يبيعونه. والأخرى وصف لمُخرَج يمكن لأي شخص تنزيله والتحقق منه.
مُرمِّز المحارف هو الجزء الذي يوضح الفئة
عادةً ما يفشل تصيير النص في نماذج الصور بطريقة محددة: يولّد النموذج شيئًا يشبه الكتابة دون أن يكون كتابة. تكون أشكال الحروف معقولة بينما تكون الكلمة خاطئة. والسبب معماري قبل أي شيء آخر — فمعظم نماذج الصور لا تملك مكوّنًا يرى المحارف كمحارف، لذا يُعاد بناء الخط من الإحصاءات البصرية بالطريقة نفسها التي يُعاد بها بناء العشب.
إن التزام vLLM-Omni مثير للاهتمام تحديدًا لأنه يشير إلى ذلك. الملفات المضافة — byte5_encoder.py، pipeline_ming.py، t5_block_mapper.py ومعالج إدخال المرحلة — يصفان مسارًا يقرأ فيه مُرمِّز ByT5 على مستوى البايت النص الذي يجب أن يظهر في الصورة، وتُوسَّع مفردات المُرمِّز بعلامات الخط واللون، وتُضاف السمات الناتجة على طول بُعد التسلسل مع تلقي الجانب السالب للأصفار. هذه التفصيلة الأخيرة هي الدليل على أن هذا قرار تصميمي حقيقي وليس مجرد توصيلات: إذا حمل الفرع السالب نفس سمات الحروف، فسيتم دفع التوجيه الخالي من المصنف نحو عرض النص وبعيدًا عن المطالبة، لذا توجد الأصفار لمنع الهدفين من التصارع. لا يُحمَّل المُرمِّز إلا عندما يحتوي نقطة التحقق فعليًا على byte5/ مجلد فرعي.
ملاحظتان بشأن الأمانة. هذا التزام (commit) في إطار استدلال من طرف ثالث، وليس بيانًا من Ant Group، وقراءتنا لمعنى تلك الملفات هي قراءتنا نحن لا قراءة المورّد. وهو يعزّز نية تصميمية، لا نتيجة: فوجود مُرمِّز محارف يتوافق مع عرض نص جيد، لكنه ليس دليلًا على أن عرض النص جيد. والدليل المستقل الوحيد على الجودة هو موقع واحد في لوحة الصدارة، وهو ما نناقشه أدناه.

التباين مع Qwen-Image 3.0 لا يكمن في أن نموذج Alibaba يرسم النص بشكل سيئ — فلا أحد خارج Alibaba يستطيع أن يقول مدى جودة رسمه للنص، وهذا هو بيت القصيد. بل يكمن في أن سؤال "كيف يرسم هذا النموذج الحروف" له إجابة عند أحد هذين النموذجين وادعاء تسويقي عند الآخر، والفجوة بين الإجابة والادعاء هي حيث تُتخذ القرارات الهندسية.
الرقم الوحيد، واللوحة التي ليس عليها
Ming-Image-0.1-Design يحتل المرتبة الأولى في لوحة المتصدرين للنص إلى الصورة من Artificial Analysis لتصميم واجهة/تجربة المستخدم، عرض الأوزان المفتوحة، بتصنيف Elo قدره 1,082 — متقدماً على Ideogram 4.0 (Quality) عند 1,052، وIdeogram 4.0 عند 1,015، وHunyuanImage 3.0 Instruct عند 1,005، وFLUX.2 [dev] عند 1,000، وFLUX.2 [dev] Flash عند 999 وFLUX.2 [dev] Turbo عند 994. نسخة تلك اللوحة هي التي أعيد إنتاجها على بطاقة النموذج نفسه، وهي تحمل علامة Artificial Analysis التجارية؛ لم يقم أحد بإعادة إنتاج النتيجة بشكل مستقل.
![The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.](https://cms.orcarouter.ai/api/media/file/3-1124.png)
إنها لوحة ترتيب مفتوحة الأوزان، لذا لا يوجد لـ Qwen-Image 3.0 مدخل فيها، وغيابه لا يقول شيئًا عن جودته. لكن ما يقوله هو أمر بنيوي: لا تستطيع لوحة تفضيل أعمى أن ترتّب سوى النماذج التي تكون أوزانها عامة. وهذا يمنح إصدارًا مفتوحًا موضعًا قابلًا للقياس قبل أشهر من امتلاكه منتجًا، ويمنح إصدارًا مغلقًا رقمًا تسويقيًا ولا شيء آخر. أما مزاعم Qwen-Image 3.0 — وضوح القراءة بحجم 10 بكسل، ومطالبات بطول 4,500 رمز، وأكثر من 20 خطًا — فلا يقف خلفها أي قياس مستقل على الإطلاق.

كيف يمكنك اختبار هذا فعليًا، وكم تكلفة المحاولة
إذا كان الخط الواضح هو سبب قراءتك لهذا، فإن الاختبار ليس لوحة صدارة. إنه خطك الخاص، ولغتك الخاصة، وسلاسل النصوص الخاصة بك، تُمرَّر عبر كلا المرشحين ويقرأها إنسان. يحتاج ذلك الاختبار إلى أن يكون أحد هذين النموذجين سهل الوصول ورخيصًا، والآخر قابلًا للتنزيل، وهما مسعّران وفق مبدأين متعاكسين.
{{1}}Qwen-Image 3.0{{/1}} — حوالي 0.04 دولار لكل صورة على {{2}}النسخة الاحترافية{{/2}} وحوالي 0.03 دولار على {{3}}القياسية{{/3}}، مع بدء أسعار المستهلك المحلي من حوالي ¥0.18 لكل صورة. هذه أرقام إطلاق ولم تخضع للتدقيق. يمكنك تشغيل مصفوفة مطالبات بعد ظهر اليوم والدفع مقابل كل استدعاء.
• Ming-Image-0.1-Design — لا يوجد سعر منشور، لأنه لا توجد نقطة نهاية مستضافة. التكلفة هي تنزيل بحجم 71.5 GB، وبطاقة بسعة 80 GiB، ووقتك الخاص، والفائدة هي أنه يمكنك توجيه الاختبار نفسه إلى مسار مُرمِّز الرموز الرسومية وترى ما إذا كان هو المكوّن الذي يقوم بالعمل.
هذه هي الحالة التي صُمّمت طبقة توجيه من أجلها، ويجدر بنا أن نكون دقيقين بشأن أي جزء منها ينطبق. لا يتوفر Qwen-Image 3.0 ولا Ming-Image-0.1-Design على منصتنا، لذا لا يمكن لطبقة توجيه أن تضع أياً منهما خلف مفتاح اليوم. ما يمكنها فعله هو إبقاء المقارنة نزيهة أثناء إجرائك المقارنة: يضع OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI بسعر قائمة المزوّد ومن دون أي هامش ربح، مع تجاوز فشل تلقائي بين المزوّدين، لذا يمكن للنموذج الذي تثق به بالفعل أن يحتفظ بمسار الإنتاج — وتبقى تكلفته مرتبطة بسعر قائمة المزوّد، بحيث يصل أي تغيير في أسعار المورّد إلى جانبنا في اليوم نفسه — بينما يُقيَّم نموذج تصميم غير مقيس إلى جانبه بدلاً من أن يكون أمامه.
إصداران مفتوحان، وواحد مغلق، ونمط
تجدر الإشارة إلى ما يُثبته إصدار Ming، بما يتجاوز ذاته. نشرت Ant Group نموذج تصميم بـ6.15 مليار معامل بموجب رخصة MIT دون أي إعلان، إلى جانب نموذج ثانٍ لتفكيك الطبقات بالرخصة نفسها. ونشرت Alibaba نموذجًا مُستضافًا مغلقًا بلا رخصة، ولا بطاقة، ولا تقرير، موجّهًا إلى الفئة ذاتها من العمل، وسعّرته لكل صورة.
هذان رهانان مختلفان حول أين تكمن القيمة في نماذج التصميم. يقول أحدهما إن النموذج هو المنتج وإن الأوزان هي قناة التوزيع. ويقول الآخر إن النموذج خدمة وإن الأوزان هي الشيء الذي تحتفظ به. يمكن أن يصح كلا الرهانين في السوق نفسه، وهما ينتجان إجابات مختلفة جدًا عن السؤال الوحيد المهم في وقت التقييم: هل يمكنني أن أكتشف كيف يعمل هذا قبل أن أعتمد عليه؟
• إذا كنت بحاجة إلى معرفة كيف يُعرَض النص، ولماذا لا يُعرَض في بعض الأحيان — فإن Ming-Image-0.1-Design هو الوحيد بين الاثنين الذي يسمح لك بالنظر، ورخصة MIT تعني أنه يمكنك التصرف بناءً على ما تكتشفه.
• إذا كنت بحاجة اليوم إلى نقطة نهاية جاهزة للإنتاج بسعر لكل صورة ودون أي بنية تحتية — فإن Qwen-Image 3.0 هو الوحيد من بين الاثنين الذي يوفّر ذلك، كما أن بنيته الداخلية جزء من السعر.
• إذا كنت بحاجة إلى أدلة مستقلة قبل أن تلتزم — فلا يملك أيٌّ منهما ما يكفي منها. أحدهما لديه موضع واحد في لوحة الصدارة لم يُعَد إنتاجه؛ والآخر لديه ورقة ادعاءات من البائع دون أي أرقام مرفقة بها.
ما يجب مراقبته هو ما إذا كان النمط سيستمر. إن إصدارًا غير معلن من MIT يتضمن مُرمِّز glyph هو بمثابة تصريح بكيفية توقع مؤلفيه استخدام النموذج — أن يُفحص، ويُشغَّل محليًا، ويُعدَّل. إذا أُعلن عن الإصدار التالي من الفريق نفسه، وتم تقييمه واختباره واستضافته، فقد كان ذلك حدثًا لمرة واحدة. أما إذا كان مستودعًا هادئًا آخر، فإن فئة نماذج التصميم بات لديها منافس مفتوح ثانٍ، والنصف المغلق من السوق يواجه مشكلة سعرية لم يكن يواجهها في يوليو.
