بطاقة العنوان الرئيسية تحمل نص 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'، والعنوان الفرعي 'أحدهما يُخرج تصميمًا متعدد الطبقات، بينما الآخر لا يستطيع إخراج صورة ثابتة على الإطلاق'، مع بطاقتين بأيقونات بسيطة. شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

Ming-Image-0.1-Design مقابل Gemini Omni 1.1 Flash: المخرَج التصميمي يحتاج إلى كلا النصفين

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

اطلب Ming-Image-0.1-Design للحصول على فيديو وستحصل على صورة ثابتة. اطلب Gemini Omni 1.1 Flash للحصول على صورة ثابتة وستحصل على خطأ — توثيقه الخاص يدرج توليد الصور وتحرير الصور والإخراج المتشابك للصور والنصوص ضمن القدرات غير المدعومة لدى النموذج. لذا فإن صفحة تضع هذين الاثنين في عمودين تقارن بين مُصيّر وجهاز عرض. ما يستحق المقارنة فعلاً هو الأمر الذي تخطئ فيه فرق التصميم باستمرار: المنتج النهائي المُسلَّم يحتاج عادةً إلى شاشة وعنصر متحرك، وكلٌّ من هذين النموذجين يملك نصف ذلك، مع تسليم في المنتصف يدمّر العمل بهدوء.

Ming-Image-0.1-Design هو نموذج تحويل النص إلى صورة بحجم 6B من inclusionAI، صدر تحت رخصة MIT مع أوزان نُشرت في 17 سبتمبر 2026، ومصمم للتصميم الجرافيكي كثيف النصوص. Gemini Omni 1.1 Flash هو نموذج الفيديو الإنتاجي من Google، متاح عمومًا منذ 27 أغسطس 2026، ومصمم للحركة القصيرة مع صوت متزامن. لا يُعد أي منهما بديلاً عن الآخر، والسؤال المثير للاهتمام هو ما يحدث بينهما.

النصفان، بصياغة واضحة

ابدأ بما يعيده كل واحد منها فعليًا، لأن كل ما عدا ذلك يتبع ذلك.

• المخرجات — يُعيد Ming-Image-0.1-Design صورة ثابتة، حتى 2048 × 2048 عند 12 خطوة أخذ عينات وCFG 1.0، أو 1024 × 1024 من أجل السرعة؛ ويُعيد Gemini Omni 1.1 Flash فيديو يصل إلى 40 ثانية، يُجمَّع من استدعاءات توليد وتمديد مدتها 10 ثوانٍ

• الشفافية — يُصدر Ming-Image-0.1-Design قيم RGBA أصلية عندما يبدأ الموجّه بعبارة شفافية موثّقة، فتأتي قناة alpha من أداة أخذ العينات؛ ولا يوفّر Gemini Omni 1.1 Flash أي مخرجات شفافة، كما لا يوجد تنسيق فيديو شفاف في خط المعالجة أيضًا

• البنية — يُفكّك نموذج Layer المرافق لـ Ming-Image-0.1-Design تصميمًا مسطّحًا إلى 2–9 ملفات PNG RGBA منفصلة تُعاد تركيبها لتكوّن الأصل؛ بينما يُعيد Gemini Omni 1.1 Flash مقطعًا مسطّحًا واحدًا

• المدخل المرجعي — يُنشئ Ming-Image-0.1-Design من مطالبة نصية وحدها دون الحاجة إلى صورة مرجعية؛ ويقبل Gemini Omni 1.1 Flash حتى 10 صور لكل مطالبة وما يصل إلى ثلاثة مقاطع فيديو مرجعية مدتها 3 ثوانٍ، ويقرأ حتى 10 ثوانٍ من اللقطات السابقة عند تمديد مشهد

• سقف الدقة — Ming-Image-0.1-Design بدقة أصلية 2048؛ Gemini Omni 1.1 Flash يُصيّر أصليًا بدقة 720p ويرفع الدقة إلى 1080p و4K، مع مستوى مسودة بدقة 360p

• التكلفة — لا يتوفر لـ Ming-Image-0.1-Design سعر مستضاف لأنه لا توجد نقطة نهاية مستضافة، لذا فإن التكلفة هي وقت وحدة معالجة الرسومات (GPU) الخاصة بك على بطاقة واحدة بسعة 80 GiB؛ بينما يفرض Gemini Omni 1.1 Flash رسومًا قدرها 0.10 دولار لكل ثانية بدقة 720p، مع فئة المسودة 360p بحوالي 0.03 دولار لكل ثانية

• الترخيص — MIT لـ Ming-Image-0.1-Design، ويُسمح بالاستخدام التجاري؛ واجهة برمجة تطبيقات تجارية لـ Gemini Omni 1.1 Flash يحمل ناتجها علامة SynthID المائية

A rendered two-column scoreboard headed 'Two halves', titled 'Ming-Image-0.1-Design vs Gemini Omni 1.1 Flash'. The Ming-Image-0.1-Design column reads: returns a still to 2048 x 2048; 12 steps, CFG 1.0; transparency native RGBA; structure 2-9 editable RGBA layers; cost your own 80 GiB GPU; independent placement #1 open weights in the UI/UX slice. The Gemini Omni 1.1 Flash column reads: returns video to 40 seconds; 10-second calls with 10s lookback; transparency none and no alpha video; structure one flattened clip; cost $0.10 per second at 720p; independent placement top of the video arenas with no audio.

حيث يتعطل نقل المهام

إذا كنت تبني مسارًا لتصميم ينتج كليهما، فإن الاتجاه في اتجاه واحد فقط: ‏Ming-Image-0.1-Design‏ يصنع الإطار، و‏Gemini Omni 1.1 Flash‏ يمنحه الحركة. أما الاتجاه المعاكس فغير موجود. والدرز بينهما هو حيث يضيع عمل التصميم.

أولى الضحايا هي قناة ألفا. أصل واجهة المستخدم المولَّد بخلفية شفافة هو السبب في استخدام مُعايِّن يُصدر RGBA من الأساس — فهو يستقر على تخطيط موجود دون تمريرة اقتطاع. أدخِل ذلك الإطار في مسار فيديو، فتختفي الشفافية، لأنه لا يوجد إخراج فيديو شفاف للحفاظ عليها فيه. تظل الشفافية في برنامج التركيب لديك، وتُطبَّق بعد عودة المقطع، لا في سلسلة النموذج. الفرق التي تخطط لعملية التركيب قبل وجود المقطع ينتهي بها الأمر إلى إعادتها.

الخسارة الثانية هي الدقة. يُصيّر Ming-Image-0.1-Design أصلاً بدقة 2048. يُصيّر Gemini Omni 1.1 Flash أصلاً بدقة 720p ثم يرفع الدقة تصاعديًا. إطار تصميم بدقة 2048 بكسل يُغذّى إلى مسار تصيير بدقة 720p يكون معظمه من التفاصيل المُهمَلة، والرفع الذي يتبعه خطوة من جانب المورّد لا تتحكم فيها.

الثالث هو النص. الفرضية الكاملة لـ Ming-Image-0.1-Design هي أن النص المُصيَّر يبقى مقروءًا بالحجم الذي سيُقرأ به — وهذا هو المحور الذي يقيسه تصنيفه البالغ 1,084 في شريحة تصميم واجهات/تجربة المستخدم من Artificial Analysis. نموذج الفيديو الذي يُحرّك ذلك الإطار لا يعيد إنتاج النص؛ بل يحرّك وحدات البكسل التي أُعطيت له. أي حركة تغيّر المنظور أو المقياس أو الإضاءة في الإطار ستنقل الطباعة معها، والنص الصغير الذي كان مقروءًا في صورة ثابتة لن ينجو من التحويل.

لا شيء من ذلك عيبٌ في أيٍّ من النموذجين. إنه ما يحدث عندما يُقسَّم مُخرَجٌ ما بين نظامين لم يُصمَّما قط لتبادل التسليم بينهما، والحل قرارٌ إنتاجي، لا اختيارٌ لنموذج: قرِّر أيَّ طبقةٍ من المُخرَج يُسمح بتسطيحها، وطسِّحها عن قصد.

ما الذي يجيده كل نصف في الواقع

دليل Ming-Image-0.1-Design هو ساحة من طرف ثالث. وهو في المرتبة 45 من 104 على لوحة صدارة Artificial Analysis للنص إلى صورة، بتصنيف Elo قدره 995 عبر 21,342 صوتًا، والأول بين النماذج مفتوحة الأوزان في شريحة تصميم UI/UX في تلك اللوحة عند 1,084 Elo على 2,100 صوت في الشريحة. الفجوة بين هذين الرقمين هي الوصف الصادق للنموذج: متخصص مُثبت بالقياس، لا معمّم. أرقام رفيقه Layer — خطأ RGB L1 البالغ 0.0574 وalpha soft IoU البالغ 0.8923 عند 1024 على مجموعة اختبار Crello — مُبلّغة من المورّد وغير مُعاد إنتاجها، وينبغي وسمها بذلك.

دليل Gemini Omni 1.1 Flash مستقل أيضًا، لكن على لوحة مختلفة. في Artificial Analysis، شغل المركز الأول في كل من ساحتي النص إلى الفيديو والصورة إلى الفيديو في فئة بدون صوت اعتبارًا من 2 سبتمبر 2026، بـ Elo 1,324 و1,364. مع تمكين الصوت، ينخفض إلى 1,237 و1,180 — الثاني والرابع. تلك الفجوة الصوتية تفصيل تخفيه ورقة المواصفات وتكشفه لوحة الصدارة، ويستحق المعرفة قبل أن تضع ميزانية حملة بناءً على ادعاء التصدر.

اللوحتان لا تتداخلان، وهذا هو بيت القصيد. لا توجد حلبة تُحاكَم فيها صورة تصميم ثابتة ومقطع مدته عشر ثوانٍ إحداهما مقابل الأخرى، وأي مقال يشير إلى عكس ذلك إنما يختلق لوحة نتائج.

Screenshot of Google's Gemini API models documentation at ai.google.dev/gemini-api/docs/models, captured 24 September 2026 in English. The left navigation lists Gemini 3, Nano Banana, Veo, Gemini Omni Flash, Lyria 3.5 & Lyria Clip, Text-to-speech, Transcribe and other model families. The body shows the Models guide heading, a Gemini 3 section with Gemini 3.8 Flash, Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking cards marked New and Stable, and a Generative media models entry in the on-this-page rail.

ما تكلفة الانقسام لكل محاولة

اقتصاديات النصفين غير قابلة للمقارنة ولا ينبغي دمجهما في بند ميزانية واحد.

على الجانب الثابت، لا يكلف Ming-Image-0.1-Design شيئًا لكل صورة بمجرد توفر العتاد. وهذا يجعل التكرار مجانيًا بالطريقة المهمة: يمكنك إنشاء عشرين نسخة من لوحات التحكم في فترة ما بعد الظهر والتخلص من تسعة عشر منها. على جانب الحركة، يكلف مقطع 10 ثوانٍ بدقة 720p على Gemini Omni 1.1 Flash حوالي 1.00 دولار؛ نفس الـ10 ثوانٍ بطبقة المسودة 360p تكلف حوالي 0.30 دولار؛ مشهد كامل مدته 40 ثانية بدقة 720p — توليد واحد بالإضافة إلى ثلاث مكالمات تمديد — يصل إلى حوالي 4.00 دولارات. لم تنشر Google أسعارًا لكل ثانية لطبقات 1080p و4K، وقوائم الموزعين التي تذكر 0.15 و0.30 دولار لكل ثانية هي تقديرات السوق وليست أرقام البائعين، لذا تبقى أي ميزانية إنتاج عالية الدقة مؤقتة.

النتيجة العملية هي أن النصفين يريدان أسلوبي عمل متعارضين. كرّر على الصورة الثابتة، حيث تكون إعادة المحاولة مجانية. واحسم على الفيديو، حيث تُحتسب كل إعادة. الفريق الذي يكرّر على نصف الفيديو هو الفريق الذي تفاجئه الفاتورة، لأن الإطار الأول لا يكلّف شيئًا بينما تكلّف إعادات التصوير كل شيء.

النطاق الذي تلائم فيه طبقة التوجيه هنا أضيق مما قد يوحي به أي عرض ترويجي، ويستحق أن يُذكر بدقة. إن Ming-Image-0.1-Design تنزيل بترخيص MIT — وOrcaRouter لا يوجّه أي نموذج من inclusionAI، لذا فهو يعمل على عتادك أو لا يعمل إطلاقًا. أما Gemini Omni 1.1 Flash فهو واجهة برمجية من مورّد بمفتاح خاص به وعدّاد خاص به لكل ثانية، ونحن لا نوجّهه نحن أيضًا؛ فشركة Google لم تفتح واجهة Omni للفيديو أمام التوجيه من أطراف ثالثة. ما نوفّره في جانب الحركة هو خط الفيديو من Kling، بما يشمل kling-v3 وkling-v3-omni وkling-video-o1، إضافة إلى MiniMax H3 — فإن احتاج الجزء المتحرك من أي مُخرَج إلى مسار مستضاف بدلًا من عقد مع مورّد ثانٍ، فهذا متاح لدينا. وفي جانب الصور نوفّر عائلة GPT-Image من OpenAI، وطبقات Imagen 4 من Google ومعاينات صور Gemini، ونقطة نهاية Grok Imagine للصور من xAI. ولأن سعر قائمة المورّد يُمرَّر بهامش ربح 0% بدلًا من إضافة هامش ربح عليه، فإن أي تخفيض في سعر المورّد على أيٍّ منها يصبح ساريًا لدينا في اليوم نفسه.

A rendered summary card headed 'The handoff', titled 'What a still loses on the way to motion', listing four losses: the alpha channel (Ming-Image-0.1-Design emits it from the sampler, Gemini Omni 1.1 Flash has no transparent video output); resolution (2048 x 2048 in against a path that renders natively at 720p and upscales); typography (the video model moves the pixels it is given and does not re-render the copy); and working style (stills iterate for free, video bills about $1.00 per 10 seconds at 720p and about $0.30 at the 360p draft tier).

القرار، في مرور واحد

• تحتاج إلى أصول تصميم قابلة للتحرير — Ming-Image-0.1-Design، وتفكيك الطبقات هو السبب. الاقتطاعات الشفافة، والأيقونات، والسبرايتات، والمركّبات الطبقية هي حيث يزيل مُعاين يُصدر RGBA مرحلة كاملة من خط المعالجة.

• تحتاج إلى حركة محسوبة — Gemini Omni 1.1 Flash. فهو الوحيد بين الاثنين الذي لديه نتائج ساحة مستقلة في صدارة لوحة، والوحيد الذي لديه سعر منشور لكل ثانية يمكنك وضعه في توقّع.

• أنت بحاجة إلى كليهما — خصّص نصف الفيديو لكل محاولة لا لكل أصل، ولا تفترض أن قناة ألفا ستبقى سليمة، وخطّط لعملية التركيب بعد عودة المقطع.

• عليك بيع المخرجات — Gemini Omni 1.1 Flash هو بلا لبس الخيار الأكثر أمانًا، بما أن MIT تغطي أوزان Ming-Image-0.1-Design وشروط Google API تغطي الفيديو. العلامات المائية هي المقابل: كل مقطع من Omni يحمل SynthID، ولا يحمل أي ناتج من Ming-Image-0.1-Design ذلك.

ما يستحق المتابعة لاحقًا ليس مواجهةً مباشرة أخرى. بل ما إذا كانت inclusionAI تُرفق نقطة نهاية مُستضافة بـ Ming-Image-0.1-Design — وهو ما قد يُلغي كلفة الدخول البالغة 80 GiB ويغيّر هذه المقارنة بالكامل — وما إذا كانت Google تسدّ الفجوة الصوتية في لوحات Omni للفيديو. هاتان الحقيقتان، لا لوحة نتائج أخرى، هما ما يحدّدان أيّ نصفٍ من مُخرَج التصميم يحصل على الميزانية.