
Ming-Image-0.1-Design مقابل Gemini Omni 1.1 Flash: المخرَج التصميمي يحتاج إلى كلا النصفين
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 177 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1323 tok/s
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
اطلب Ming-Image-0.1-Design للحصول على فيديو وستحصل على صورة ثابتة. اطلب Gemini Omni 1.1 Flash للحصول على صورة ثابتة وستحصل على خطأ — توثيقه الخاص يدرج توليد الصور وتحرير الصور والإخراج المتشابك للصور والنصوص ضمن القدرات غير المدعومة لدى النموذج. لذا فإن صفحة تضع هذين الاثنين في عمودين تقارن بين مُصيّر وجهاز عرض. ما يستحق المقارنة فعلاً هو الأمر الذي تخطئ فيه فرق التصميم باستمرار: المنتج النهائي المُسلَّم يحتاج عادةً إلى شاشة وعنصر متحرك، وكلٌّ من هذين النموذجين يملك نصف ذلك، مع تسليم في المنتصف يدمّر العمل بهدوء.
Ming-Image-0.1-Design هو نموذج تحويل النص إلى صورة بحجم 6B من inclusionAI، صدر تحت رخصة MIT مع أوزان نُشرت في 17 سبتمبر 2026، ومصمم للتصميم الجرافيكي كثيف النصوص. Gemini Omni 1.1 Flash هو نموذج الفيديو الإنتاجي من Google، متاح عمومًا منذ 27 أغسطس 2026، ومصمم للحركة القصيرة مع صوت متزامن. لا يُعد أي منهما بديلاً عن الآخر، والسؤال المثير للاهتمام هو ما يحدث بينهما.
النصفان، بصياغة واضحة
ابدأ بما يعيده كل واحد منها فعليًا، لأن كل ما عدا ذلك يتبع ذلك.
• المخرجات — يُعيد Ming-Image-0.1-Design صورة ثابتة، حتى 2048 × 2048 عند 12 خطوة أخذ عينات وCFG 1.0، أو 1024 × 1024 من أجل السرعة؛ ويُعيد Gemini Omni 1.1 Flash فيديو يصل إلى 40 ثانية، يُجمَّع من استدعاءات توليد وتمديد مدتها 10 ثوانٍ
• الشفافية — يُصدر Ming-Image-0.1-Design قيم RGBA أصلية عندما يبدأ الموجّه بعبارة شفافية موثّقة، فتأتي قناة alpha من أداة أخذ العينات؛ ولا يوفّر Gemini Omni 1.1 Flash أي مخرجات شفافة، كما لا يوجد تنسيق فيديو شفاف في خط المعالجة أيضًا
• البنية — يُفكّك نموذج Layer المرافق لـ Ming-Image-0.1-Design تصميمًا مسطّحًا إلى 2–9 ملفات PNG RGBA منفصلة تُعاد تركيبها لتكوّن الأصل؛ بينما يُعيد Gemini Omni 1.1 Flash مقطعًا مسطّحًا واحدًا
• المدخل المرجعي — يُنشئ Ming-Image-0.1-Design من مطالبة نصية وحدها دون الحاجة إلى صورة مرجعية؛ ويقبل Gemini Omni 1.1 Flash حتى 10 صور لكل مطالبة وما يصل إلى ثلاثة مقاطع فيديو مرجعية مدتها 3 ثوانٍ، ويقرأ حتى 10 ثوانٍ من اللقطات السابقة عند تمديد مشهد
• سقف الدقة — Ming-Image-0.1-Design بدقة أصلية 2048؛ Gemini Omni 1.1 Flash يُصيّر أصليًا بدقة 720p ويرفع الدقة إلى 1080p و4K، مع مستوى مسودة بدقة 360p
• التكلفة — لا يتوفر لـ Ming-Image-0.1-Design سعر مستضاف لأنه لا توجد نقطة نهاية مستضافة، لذا فإن التكلفة هي وقت وحدة معالجة الرسومات (GPU) الخاصة بك على بطاقة واحدة بسعة 80 GiB؛ بينما يفرض Gemini Omni 1.1 Flash رسومًا قدرها 0.10 دولار لكل ثانية بدقة 720p، مع فئة المسودة 360p بحوالي 0.03 دولار لكل ثانية
• الترخيص — MIT لـ Ming-Image-0.1-Design، ويُسمح بالاستخدام التجاري؛ واجهة برمجة تطبيقات تجارية لـ Gemini Omni 1.1 Flash يحمل ناتجها علامة SynthID المائية

حيث يتعطل نقل المهام
إذا كنت تبني مسارًا لتصميم ينتج كليهما، فإن الاتجاه في اتجاه واحد فقط: Ming-Image-0.1-Design يصنع الإطار، وGemini Omni 1.1 Flash يمنحه الحركة. أما الاتجاه المعاكس فغير موجود. والدرز بينهما هو حيث يضيع عمل التصميم.
أولى الضحايا هي قناة ألفا. أصل واجهة المستخدم المولَّد بخلفية شفافة هو السبب في استخدام مُعايِّن يُصدر RGBA من الأساس — فهو يستقر على تخطيط موجود دون تمريرة اقتطاع. أدخِل ذلك الإطار في مسار فيديو، فتختفي الشفافية، لأنه لا يوجد إخراج فيديو شفاف للحفاظ عليها فيه. تظل الشفافية في برنامج التركيب لديك، وتُطبَّق بعد عودة المقطع، لا في سلسلة النموذج. الفرق التي تخطط لعملية التركيب قبل وجود المقطع ينتهي بها الأمر إلى إعادتها.
الخسارة الثانية هي الدقة. يُصيّر Ming-Image-0.1-Design أصلاً بدقة 2048. يُصيّر Gemini Omni 1.1 Flash أصلاً بدقة 720p ثم يرفع الدقة تصاعديًا. إطار تصميم بدقة 2048 بكسل يُغذّى إلى مسار تصيير بدقة 720p يكون معظمه من التفاصيل المُهمَلة، والرفع الذي يتبعه خطوة من جانب المورّد لا تتحكم فيها.
الثالث هو النص. الفرضية الكاملة لـ Ming-Image-0.1-Design هي أن النص المُصيَّر يبقى مقروءًا بالحجم الذي سيُقرأ به — وهذا هو المحور الذي يقيسه تصنيفه البالغ 1,084 في شريحة تصميم واجهات/تجربة المستخدم من Artificial Analysis. نموذج الفيديو الذي يُحرّك ذلك الإطار لا يعيد إنتاج النص؛ بل يحرّك وحدات البكسل التي أُعطيت له. أي حركة تغيّر المنظور أو المقياس أو الإضاءة في الإطار ستنقل الطباعة معها، والنص الصغير الذي كان مقروءًا في صورة ثابتة لن ينجو من التحويل.
لا شيء من ذلك عيبٌ في أيٍّ من النموذجين. إنه ما يحدث عندما يُقسَّم مُخرَجٌ ما بين نظامين لم يُصمَّما قط لتبادل التسليم بينهما، والحل قرارٌ إنتاجي، لا اختيارٌ لنموذج: قرِّر أيَّ طبقةٍ من المُخرَج يُسمح بتسطيحها، وطسِّحها عن قصد.
ما الذي يجيده كل نصف في الواقع
دليل Ming-Image-0.1-Design هو ساحة من طرف ثالث. وهو في المرتبة 45 من 104 على لوحة صدارة Artificial Analysis للنص إلى صورة، بتصنيف Elo قدره 995 عبر 21,342 صوتًا، والأول بين النماذج مفتوحة الأوزان في شريحة تصميم UI/UX في تلك اللوحة عند 1,084 Elo على 2,100 صوت في الشريحة. الفجوة بين هذين الرقمين هي الوصف الصادق للنموذج: متخصص مُثبت بالقياس، لا معمّم. أرقام رفيقه Layer — خطأ RGB L1 البالغ 0.0574 وalpha soft IoU البالغ 0.8923 عند 1024 على مجموعة اختبار Crello — مُبلّغة من المورّد وغير مُعاد إنتاجها، وينبغي وسمها بذلك.
دليل Gemini Omni 1.1 Flash مستقل أيضًا، لكن على لوحة مختلفة. في Artificial Analysis، شغل المركز الأول في كل من ساحتي النص إلى الفيديو والصورة إلى الفيديو في فئة بدون صوت اعتبارًا من 2 سبتمبر 2026، بـ Elo 1,324 و1,364. مع تمكين الصوت، ينخفض إلى 1,237 و1,180 — الثاني والرابع. تلك الفجوة الصوتية تفصيل تخفيه ورقة المواصفات وتكشفه لوحة الصدارة، ويستحق المعرفة قبل أن تضع ميزانية حملة بناءً على ادعاء التصدر.
اللوحتان لا تتداخلان، وهذا هو بيت القصيد. لا توجد حلبة تُحاكَم فيها صورة تصميم ثابتة ومقطع مدته عشر ثوانٍ إحداهما مقابل الأخرى، وأي مقال يشير إلى عكس ذلك إنما يختلق لوحة نتائج.

ما تكلفة الانقسام لكل محاولة
اقتصاديات النصفين غير قابلة للمقارنة ولا ينبغي دمجهما في بند ميزانية واحد.
على الجانب الثابت، لا يكلف Ming-Image-0.1-Design شيئًا لكل صورة بمجرد توفر العتاد. وهذا يجعل التكرار مجانيًا بالطريقة المهمة: يمكنك إنشاء عشرين نسخة من لوحات التحكم في فترة ما بعد الظهر والتخلص من تسعة عشر منها. على جانب الحركة، يكلف مقطع 10 ثوانٍ بدقة 720p على Gemini Omni 1.1 Flash حوالي 1.00 دولار؛ نفس الـ10 ثوانٍ بطبقة المسودة 360p تكلف حوالي 0.30 دولار؛ مشهد كامل مدته 40 ثانية بدقة 720p — توليد واحد بالإضافة إلى ثلاث مكالمات تمديد — يصل إلى حوالي 4.00 دولارات. لم تنشر Google أسعارًا لكل ثانية لطبقات 1080p و4K، وقوائم الموزعين التي تذكر 0.15 و0.30 دولار لكل ثانية هي تقديرات السوق وليست أرقام البائعين، لذا تبقى أي ميزانية إنتاج عالية الدقة مؤقتة.
النتيجة العملية هي أن النصفين يريدان أسلوبي عمل متعارضين. كرّر على الصورة الثابتة، حيث تكون إعادة المحاولة مجانية. واحسم على الفيديو، حيث تُحتسب كل إعادة. الفريق الذي يكرّر على نصف الفيديو هو الفريق الذي تفاجئه الفاتورة، لأن الإطار الأول لا يكلّف شيئًا بينما تكلّف إعادات التصوير كل شيء.
النطاق الذي تلائم فيه طبقة التوجيه هنا أضيق مما قد يوحي به أي عرض ترويجي، ويستحق أن يُذكر بدقة. إن Ming-Image-0.1-Design تنزيل بترخيص MIT — وOrcaRouter لا يوجّه أي نموذج من inclusionAI، لذا فهو يعمل على عتادك أو لا يعمل إطلاقًا. أما Gemini Omni 1.1 Flash فهو واجهة برمجية من مورّد بمفتاح خاص به وعدّاد خاص به لكل ثانية، ونحن لا نوجّهه نحن أيضًا؛ فشركة Google لم تفتح واجهة Omni للفيديو أمام التوجيه من أطراف ثالثة. ما نوفّره في جانب الحركة هو خط الفيديو من Kling، بما يشمل kling-v3 وkling-v3-omni وkling-video-o1، إضافة إلى MiniMax H3 — فإن احتاج الجزء المتحرك من أي مُخرَج إلى مسار مستضاف بدلًا من عقد مع مورّد ثانٍ، فهذا متاح لدينا. وفي جانب الصور نوفّر عائلة GPT-Image من OpenAI، وطبقات Imagen 4 من Google ومعاينات صور Gemini، ونقطة نهاية Grok Imagine للصور من xAI. ولأن سعر قائمة المورّد يُمرَّر بهامش ربح 0% بدلًا من إضافة هامش ربح عليه، فإن أي تخفيض في سعر المورّد على أيٍّ منها يصبح ساريًا لدينا في اليوم نفسه.

القرار، في مرور واحد
• تحتاج إلى أصول تصميم قابلة للتحرير — Ming-Image-0.1-Design، وتفكيك الطبقات هو السبب. الاقتطاعات الشفافة، والأيقونات، والسبرايتات، والمركّبات الطبقية هي حيث يزيل مُعاين يُصدر RGBA مرحلة كاملة من خط المعالجة.
• تحتاج إلى حركة محسوبة — Gemini Omni 1.1 Flash. فهو الوحيد بين الاثنين الذي لديه نتائج ساحة مستقلة في صدارة لوحة، والوحيد الذي لديه سعر منشور لكل ثانية يمكنك وضعه في توقّع.
• أنت بحاجة إلى كليهما — خصّص نصف الفيديو لكل محاولة لا لكل أصل، ولا تفترض أن قناة ألفا ستبقى سليمة، وخطّط لعملية التركيب بعد عودة المقطع.
• عليك بيع المخرجات — Gemini Omni 1.1 Flash هو بلا لبس الخيار الأكثر أمانًا، بما أن MIT تغطي أوزان Ming-Image-0.1-Design وشروط Google API تغطي الفيديو. العلامات المائية هي المقابل: كل مقطع من Omni يحمل SynthID، ولا يحمل أي ناتج من Ming-Image-0.1-Design ذلك.
ما يستحق المتابعة لاحقًا ليس مواجهةً مباشرة أخرى. بل ما إذا كانت inclusionAI تُرفق نقطة نهاية مُستضافة بـ Ming-Image-0.1-Design — وهو ما قد يُلغي كلفة الدخول البالغة 80 GiB ويغيّر هذه المقارنة بالكامل — وما إذا كانت Google تسدّ الفجوة الصوتية في لوحات Omni للفيديو. هاتان الحقيقتان، لا لوحة نتائج أخرى، هما ما يحدّدان أيّ نصفٍ من مُخرَج التصميم يحصل على الميزانية.
