
MAI-Image-2.5-Pro مقابل Bernini-Diffusers-v2: رقم 1 مُقاس ضد رهان مفتوح الأوزان غير مُقاس
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
مقارنة MAI-Image-2.5-Pro بـBernini-Diffusers-v2 ليست حقًا مقارنة بين نموذجي صور. إنها مقارنة بين إجابتين مختلفتين على السؤال نفسه — "كيف أحصل على تعديل جيد لصورة موجودة؟" — حيث يحظى أحد الجانبين بـ6,100 صوت بشري أعمى خلف ترتيبه الأول في التحرير، بينما يملك الجانب الآخر ملف README. نموذج MAI-Image-2.5-Pro، نموذج الصور عالي الجودة من مايكروسوفت، دخل المعاينة العامة على Microsoft Foundry في 23 يوليو 2026، وهو الآن يتصدر منصة Artificial Analysis Image Editing Arena. أما Bernini-Diffusers-v2، إطار التوليد الموحد من الجيل الثاني من ByteDance، فقد وصل إلى Hugging Face في 13 أغسطس 2026 بأوزان Apache-2.0 دون أي إعلان ودون أي معيار لجودة الصور شغّله أي شخص خارج ByteDance. كل اختلاف عملي في هذه المواجهة ينبع من هاتين الحقيقتين.
أحدهما تتصل به، والآخر تشغّله
• MAI-Image-2.5-Pro — نموذج API مستضاف في المعاينة العامة على Azure AI Foundry وMAI Playground. خاص ومُقنن بالرموز، بدون ضبط دقيق، ولا استضافة ذاتية. تحصل على نقطة وصول وتدفع مقابل كل رمز؛ بينما تدير Microsoft البنية التحتية.
• Bernini-Diffusers-v2 — أوزان Apache-2.0 التي تقوم بتحميلها من Hugging Face وتشغيلها بنفسك. يتكون المكدس من مخطط دلالي Qwen2.5-VL-7B يقود مُصيِّر DiT القائم على Wan2.2، وتوصية العتاد في README هي وحدات معالجة رسومية من فئة Hopper (H100/H800/H200) مع Python 3.11.2 / PyTorch 2.5.1+cu124. أنت من يوفر العنقود.
هذه هي قاعدة القرار في سطر واحد: إذا كانت مؤسستك تريد امتلاك الحزمة التقنية، فإن Bernini خيارٌ مطروح؛ وإذا كانت مؤسستك تريد فاتورة واتفاقية مستوى خدمة (SLA)، فإن MAI-Image-2.5-Pro هو الوحيد الذي يظل في المنافسة. إنهما ليسا بديلين لبعضهما البعض.
فجوة الأدلة هي العنوان الرئيسي الحقيقي.
يقف النموذجان على طرفي نقيض من أكبر مشكلة جودة في الذكاء الاصطناعي للصور: قياس المخرجات. تم تقييم مهارة التحرير في MAI-Image-2.5-Pro بشكل مستقل — المركز الأول على Artificial Analysis Image Editing Arena بتقييم Elo 1,272 من ~6,100 مقارنة عمياء، متقدمًا على Reve 2.1 وGPT Image 2 ونظيره MAI-Image-2.5. وترتيبه في تحويل النص إلى صورة هو السابع عند 1,292 Elo، وهو الثقل الموازن الصادق: إنه محرر متخصص، وليس رائدًا في الإنشاء من لوحة فارغة. ويمكن لأي شخص لديه متصفح التحقق من هذه الأرقام.
بيرنيني-ديوفيوزرز-الإصدار الثاني ليس له نتيجة عامة مكافئة. بطاقة النموذج تذكر EditVerse 8.02 وOpenVE 3.96 وOpenS2V 63.83 وVBench 84.46 — جميعها من تقارير البائع، وجميعها مقاييس خاصة بالفيديو. لا يوجد على البطاقة ما يمكن لمشتري الصور أن يتعرف عليه كنتيجة في لوحة صدارة لتوليد الصور من النص أو لتحرير الصور. وتدّعي البطاقة أن بيرنيني يصل إلى "الطبقة الأولى" من النماذج التجارية المغلقة في حلبة المقارنة الثنائية العمياء الداخلية لشركة ByteDance — وهذا بالضبط نوع التقييم الذاتي من البائع الذي يحتاج إلى تحقق مستقل قبل أن يعني أي شيء.
• MAI-Image-2.5-Pro:تحرير Elo 1,272 (مستقل، ~6,100 صوت)؛ نص-إلى-صورة Elo 1,292 (مستقل، ~11,500 صوت)
• Bernini-Diffusers-v2: لا يوجد معيار قياس عام للصور؛ مقاييس الفيديو فقط، وفق ما أبلغ البائع

نظريتان مختلفتان في التحرير
كلا النموذجين مبنيان على فكرة أن التحرير لا ينبغي أن يعني إعادة توليد المشهد. لكن كل منهما يصل إلى ذلك بطريقة مختلفة.
MAI-Image-2.5-Pro هو عرض مايكروسوفت "تعديلات دقيقة وجراحية مع ثبات": غيّر كائنًا واحدًا، حدّث النص داخل الصورة، نظّف ضبابية الحركة، وأبقِ كل شيء آخر — هوية الهدف، الإضاءة، الملمس — مستقرًا. هذا الثبات هو الآلية الكامنة وراء ادعاء ثبات الشخصية بنسبة 94% عبر الصور المتعددة (مُبلَغ عنه من قِبل البائع، غير مُتحقَّق منه). الهدف من المنتج هو نموذج يُجري التعديل المحدود ثم يتوقف.
برنيني-ديفيوزرز-في2 هو خط أنابيب يخطط ثم يُصيِّر: المخطط Qwen2.5-VL يجزّئ التعليمات إلى خطوات دلالية — تغيير الطقس، تبديل الأسلوب، إدراج كائن، الإبقاء على الموضوع — ويقوم المُصيِّر برسم النتيجة. صُمم التصميم لتعليمات معقدة متعددة الخطوات، وتغطي الأوزان نفسها مهام تحويل النص إلى صورة، وصورة إلى صورة، والفيديو (t2i، i2i، t2v، v2v، rv2v، r2v). هذا الاتساع هو الجانب الإيجابي؛ أما التكلفة غير المقيسة فهي أن مخطط 7B يشكل عنق زجاجة حقيقي للتحريرات الدقيقة للغاية، ولا أحد خارج ByteDance قد حدد كيف يتعامل معها.

عرض النصوص، ساحة المعركة العملية
النص داخل الصورة هو ما يُبرر سعر محرر الصور الحديث، وهنا التفاوت صارخ. قدرة MAI-Image-2.5-Pro الرئيسية هي عرض النص بدقة — تدّعي Microsoft دقة 96.8% عبر الإنجليزية والصينية واليابانية والكورية والإسبانية (وفقًا لتقرير البائع؛ وتحدد الوثائق نفسها الإخراج عند حوالي ميغابكسل واحد، فتعامل مع الرقم كمؤشر اتجاهي). لم تنشر Bernini-Diffusers-v2 أي دقة لعرض النص إطلاقًا. بالنسبة لسير عمل ينتج إعلانات مترجمة أو تغليفًا أو أي شيء يحتوي كلمة مقروءة، أحد الخيارين يقدم ادعاءً قابلاً للقياس والآخر لا يقدم شيئًا.
التكلفة، وشكل الفاتورة
• MAI-Image-2.5-Pro — 5 دولارات لكل مليون رمز إدخال نصي، و8 دولارات لكل مليون رمز إدخال صورة، و106 دولارات لكل مليون رمز إخراج صورة. تكلفة الصورة الواحدة غير منشورة؛ يضع تحويل Artificial Analysis صورة بدقة 1024×1024 في حدود 108.50 دولار لكل 1000. أسعار تجريبية قابلة للتغيير عند الإطلاق العام.
• Bernini-Diffusers-v2 — الأوزان مجانية، لكن الاستضافة الذاتية تعني أجهزة من فئة H100 (أو استئجارًا سحابيًا)، وعمليات التشغيل لإبقائها تعمل، وتوسيع النطاق بنفسك. تعكس الاقتصاديات نموذج واجهة برمجة التطبيقات: مكلفة لعشر صور يوميًا، ورخيصة عند الأحجام الكبيرة.
بالنسبة لمعظم الفرق، الإطار الصادق هو: التكلفة الإجمالية للملكية في بيرنيني لا تكون مجدية إلا إذا كنت تدير بالفعل أسطولًا من وحدات معالجة الرسومات وكان حجم العمل كبيرًا ومستقرًا. وإلا، فإن واجهة برمجة تطبيقات تُحتسب رسومها بسعر مرتفع هي الفشل الأرخص تكلفة.

ما يمكن أن يفعله جهاز التوجيه وما لا يمكنه فعله هنا
لا يمكن توجيه أيٍّ من النموذجين عبر OrcaRouter اليوم، وذلك لأسباب متعاكسة: فـ MAI-Image-2.5-Pro يقع خلف المعاينة المباشرة لـ Microsoft Foundry، بينما Bernini-Diffusers-v2 ليس نقطة وصول (endpoint) إطلاقًا — إنه أوزان فحسب. وهذا أمر جوهري من حيث المبدأ في هذه المواجهة: نمط التوجيه (router) لا ينطبق إلا على النصف القابل للاستدعاء كواجهة برمجية (API) ضمن هذه المقارنة. فعندما يتوفر MAI-Image-2.5-Pro عبر واجهة برمجية تابعة لجهة خارجية قابلة للاستدعاء، فإن الطريقة الأمثل لاعتماده دون المراهنة على مسار إنتاجي مبني على كود معاينة هي توجيه شريحة من حركة المرور إليه مع نموذج مُجرَّب بوصفه آلية تجاوز تلقائي عند الفشل (failover) — وهذا على OrcaRouter يعني نقطة وصول واحدة، وأسعار المزوّد تُمرَّر بدون أي هامش ربح (0%)، وخيارًا احتياطيًّا يلتقط ما عجزت لوحة التصنيف منخفضة الأصوات عن رؤيته. أما الجانب مفتوح الأوزان فلا يوجد له ما يعادله: فإما أن تشغّل حزمة Bernini البرمجية بنفسك أو لا تستخدمها إطلاقًا.
الحكم
MAI-Image-2.5-Pro هو محرر مستضاف متميز وقابل للقياس: إنه رقم 1 في لوحة تحرير مستقلة، وادعاء حقيقي في عرض النصوص، وسعر يضاهي ذلك. Bernini-Diffusers-v2 هو خط أنابيب مفتوح الأوزان مجاني وواسع وغير مُثبت في مجال الصور، ويعمل أيضًا مع الفيديو — إنه مثير للاهتمام حقًا إذا كنت تستضيف بنفسك، وغير قابل للتقييم حقًا حتى يُجري أحدهم تقييمًا عامًا للصور. إذا كانت سير عملك تحتاج إلى API قابلة للاستدعاء ورقم يمكنك الدفاع عنه، فالخيار هو MAI-Image-2.5-Pro أو أحد المحررات المستضافة الأخرى التي يتفوق عليها. إذا كانت سير عملك تحتاج إلى الملكية ويمكنك تشغيل الأجهزة، فإن Bernini-Diffusers-v2 يستحق الاختبار — لكن اشترِه كرهان على إمكانات غير مقاسة، وليس كمنافس لرقم 1 مُقاس.
