
GPT-Image-2.5 ضد LLaDA-Image: واجهة برمجة تطبيقات بتكلفة 30 دولارًا لكل مليون رمز مقابل نموذج انتشار مجاني بحجم 6 مليارات معامل
- openaiجديدOpenAI: GPT-6 Astra2026-09-0455الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0247الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0247الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0157الذكاء82البرمجة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2646الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1849الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1541الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1251الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0547الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0347الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2140الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128الذكاء49البرمجة
اسأل عن التكلفة التي ينبغي أن يتطلّبها توليد الصور، وستجد مختبرَين قدما إجابتين متعاكستين تمامًا في غضون أسبوع واحد من بعضهما. في 8 سبتمبر 2026، أطلقت OpenAI نموذج GPT-Image-2.5 — النموذج الذي يقف خلف ChatGPT Images 2.5، ويُباع عبر الواجهة البرمجية API باسمي GPT-Image-2.5 Flare وGPT-Image-2.5 Sunburst — بسعر محدد على بطاقة الرموز: 8 دولارات لكل مليون رمز إدخال للصور، و30 دولارًا لكل مليون رمز إخراج للصور. وقبل ذلك بخمسة أيام، في 4 سبتمبر، أصدرت inclusionAI (المختبر المدعوم من مجموعة Ant، والمسؤول عن عائلة لغات LLaDA) نموذج LLaDA-Image بهدوء: مولّد ومحرر صور من نوع diffusion-transformer بستة مليارات معامل، أوزانه قابلة للتنزيل مجانًا. أحدهما أقوى نموذج صور تجاريًا وضعته OpenAI خلف عدّاد رموز على الإطلاق؛ والآخر محاولة لإثبات أنه يمكن بناء نموذج صور قوي بوصفة تدريب مفتوحة وتقديمه مجانًا. والمقارنة بينهما ليست مواجهة مباشرة بقدر ما هي قرار حول أي تعريف للتكلفة أنت تدفعه فعليًا.
تقريبًا كل رقم في جانب GPT-Image-2.5 مُعلَن من قِبل البائع ولم يخضع أيٌّ منها لتحقق مستقل بعد: تقول OpenAI إن Flare يقلل زمن الاستجابة بنسبة تصل إلى 50% مقارنةً بـ GPT-Image-2، وإن اختبارات طرف ثالث أجرتها شركة الوكلاء الأذكياء Manus قاست توليدًا أسرع بمقدار 2–4 مرات، لكن اعتبارًا من 9 سبتمبر 2026 لا يمتلك أيٌّ من نموذجي GPT-Image-2.5 إدراجًا في لوحات متصدرات الصور الخاصة بـ Artificial Analysis. أما الرقم الرئيسي لـ LLaDA-Image فغير مُعاد إنتاجه بالمثل — إذ تُبلغ inclusionAI عن 53.53 للإنجليزية / 53.38 للصينية على Qwen-Image-Bench، وهو الأول بين نماذج الأوزان المفتوحة عند الإصدار — وبسبب عدم وجود واجهة برمجة تطبيقات مستضافة للنموذج، لا يمكنه الظهور في لوحات المتصدرات المخصصة لواجهات البرمجة فقط إطلاقًا. كلا جانبي هذه المقارنة يعتمدان على ادعاءات صانعيهما الخاصة، وهي نقطة جديرة بالتمسك بها طوال بقية هذا المقال.
نموذجان بالكاد يتشاركان في فئة
GPT-Image-2.5 هو نموذج صور مُستضاف ومُغلق يتبع نفس سلالة ChatGPT Images 2.0 الصادر في أبريل 2026. وهو متعدد الوسائط على مستوى الإدخال، وينتج صورًا تدّعي OpenAI أنها أكثر حدة في التفاصيل الدقيقة، وأكثر طبيعية في الإضاءة والملمس، وأكثر ثباتًا عبر التعديلات متعددة الجولات — نقطة نهاية Sunburst مخصّصة تحديدًا لأعمال الإنتاج كثيفة التعديل حيث يكون التوليد الأبطأ مقبولًا مقابل تحكم أدق في تنفيذ التعليمات، بينما يُعد Flare الخيار الافتراضي السريع للتوليد عالي الحجم. تصل أبعاد المخرجات إلى 2048×2048 و3840×2160، مع دعم الخلفيات الشفافة، وتحمل كل مخرجات بيانات وصفية للإسناد C2PA بالإضافة إلى علامة مائية غير مرئية.
LLaDA-Image هو إصدار مفتوح بأسلوب بحثي مبني على رهان مختلف تمامًا. فبينما يتم تقديم GPT-Image-2.5 عبر البنية التحتية لـ OpenAI، فإن LLaDA-Image عبارة عن مجموعة أوزان تشغّلها بنفسك: محول انتشار (DiT) بستة مليارات معلمة على جانب التوليد — وتسجّل بطاقة النموذج حوالي 7 مليارات معلمة عند احتساب الجانب اللغوي — مقترنًا بـ LLaDA 2.0-mini، وهو نموذج لغوي انتشاري مختلط الخبراء بإجمالي 16 مليار معلمة و1 مليار معلمة نشطة، بوصفه جانب "الفهم" الذي يحوّل المطالبات النصية أو تعليمات التحرير إلى الإشارة التي يتبعها DiT. الادعاء غير المعتاد في تقرير arXiv (2609.03796) هو وصفة التدريب: أكثر من 90% من حوالي 220 مليون عينة تراكمية للتدريب المسبق والتدريب الوسيط هي صور فقط، مع نموذج رؤية-لغة مجمّد يستخرج الدلالات من الصور غير الموسومة كإشارة تهيئة ذاتية، بحيث "يتعلم النموذج الرسم أولاً، ثم يطيع". وتنقل الدقة التصاعدية التدريب من 256×256 عبر 512×512 وصولاً إلى ضبط دقيق بدقة 1024×1024، يليه تدريب مختلط على تحويل النص إلى صورة والتحرير، وتقطير TwinFlow ذو الخطوات القليلة الذي ينتج نسخة LLaDA-Image-Turbo.
ما الذي يجيده كل واحد منها فعليًا
يتمثل جوهر GPT-Image-2.5 في {{1}}الدقة والتحكم بجودة تجارية{{/1}}. يؤكد إعلان OpenAI على الدقة المرجعية — {{2}}الحفاظ على إمكانية التعرف على الشخص أو الحيوان الأليف أو المنتج عند تغيير الإعداد أو الأسلوب{{/2}} — و{{3}}التحرير الذي لا يغيّر سوى ما طلبت تغييره، ويستمر عبر جولات متعددة من التعديلات في محادثة واحدة{{/3}}. {{4}}يتم تسليط الضوء بشكل خاص على عرض النصوص داخل الصور، بما في ذلك إزالة الأحرف الصينية المشوّهة التي عانت منها نماذج الصور السابقة.{{/4}} هذه هي بالضبط القدرات التي تعتمد عليها فرق المنتجات أو العلامات التجارية أو الإعلانات بشكل متكرر.
جوهر LLaDA-Image هو مجموعة واحدة من الأوزان تقوم بالتوليد ثنائي اللغة والتحرير الموجه بالتعليمات مع وصفة مفتوحة. تُعلن inclusionAI عن عرض نصي أصلي بالصينية والإنجليزية، ومسار تحرير يحقن الصور المرجعية عبر تصميم ثنائي المسار يهدف إلى الحفاظ على المحتوى غير المعدل، وعلى Qwen-Image-Bench حققت أعلى درجات الأوزان المفتوحة عند الإصدار. التحفظات الصريحة في الإصدار هي أن جودة التحرير الإدراكية لا تزال متخلفة عن المحررين المتخصصين، وأن عدّ الأشياء يظل ضعيفًا. إنه نموذج مفتوح عام، وليس منتجًا تجاريًا مكتملًا.

لوحة النتائج عمدًا ليست منافسة على جودة الصورة — فالنموذجان لم يُعرض عليهما نفس التقييم أبدًا. ما تُظهره هو أين تتدفق الأموال والسيطرة.
ثمن الصورة الواحدة هو الرقم الذي لن يعطيك إياه أيٌّ من الجانبين
تنشر OpenAI بطاقة أسعار للرموز (توكنات) الخاصة بـ GPT-Image-2.5 مطابقة لتلك الخاصة بـ GPT-Image-2: 8 دولارات لكل مليون رمز إدخال للصور، و30 دولارًا لكل مليون رمز إخراج للصور، و2 دولار لإدخال الصور المخزّن مؤقتًا، مع فوترة رموز النصوص بشكل منفصل بمعدل 5 دولارات لكل مليون. وما لا تنشره هو عدد الرموز التي تستهلكها صورة معيّنة، مما يعني عدم وجود سعر رسمي لكل صورة وعدم وجود حاسبة للتكلفة. وبسعر AA المدرج للطراز السابق على لوحة الصدارة الخاصة بها — حوالي 211 دولارًا لكل 1000 صورة لـ GPT Image 2 بجودة "عالية" — فإن هذا الطراز الرائد المعتمد على عدّ الرموز يعد أداة مكلفة عند الاستخدام بكميات كبيرة، لكن هذا الرقم خاص بـ GPT-Image-2 وليس 2.5، والتكلفة لكل صورة للطراز الجديد غير معروفة فعليًا خارج OpenAI.
تواجه LLaDA-Image مشكلة الصدق المعاكسة. الأوزان مجانية وبطاقة التعريف تحمل شارة Apache-2.0، لكن الثمن الحقيقي هو البنية التحتية: محول الانتشار diffusion transformer بحجم 6 مليارات معلمة يتطلب وحدة معالجة رسومية قوية للإصدار الأساسي الذي يعمل بـ 50 خطوة، ونقاط التحقق بصيغة FP8 (حوالي 49 جيجابايت في تخطيط diffusers) هي الخيار العملي لمعظم المستخدمين. والتقطير بـ 2-4 خطوات في LLaDA-Image-Turbo هو التنازل لهذا الواقع. تحركت أدوات المجتمع بسرعة — إذ يضيف طلب سحب SGLang دعمًا لتوليد الصور من النص والتحرير والتوازي التسلسلي وFP8، وتدعم حزمة عقد RebelAI ComfyUI الاستدلال المحلي بكمية INT8 وGGUF — لكن "النموذج المجاني" ما زال يعني "أنت مزود الاستضافة". بالنسبة لفريق يملك بالفعل قدرة GPU، تقترب التكلفة الحدية لـ LLaDA-Image من الصفر؛ أما بالنسبة للآخرين، فإن التكلفة الإجمالية لتشغيله قد تتجاوز فواتير واجهات البرمجة المدفوعة حسب الاستخدام عند احتساب الوقت الهندسي.
الطريق الصادق إذا أردت كلاهما
هذه ليست مسألة إما/أو بالنسبة لمعظم الفرق. يمكن لخط إنتاجي أن يستخدم واجهة برمجة تطبيقات مستضافة مثل GPT-Image-2.5 للعمل الموجَّه للعملاء الذي يتطلب تحريرًا مكثفًا ويجب ألا يفشل، مع الاحتفاظ بنموذج مفتوح مثل LLaDA-Image للتجارب والمهام المجمعة دون اتصال وأي شيء لا يمكن إرسال طلباته إلى طرف ثالث. وهذا التقسيم هو بالضبط شكل المشكلة التي صُممت من أجلها طبقة التوجيه — واجهة برمجة تطبيقات واحدة تصل إلى النماذج المستضافة التي تستخدمها فعليًا، مع تمرير سعر القائمة من المزود كما هو دون أي زيادة، بحيث تكون تجربة نموذج مفتوح الأوزان عبر مسار مستضاف لاحقًا بنفس تكلفة الذهاب إلى المزود مباشرة. لا يوجد أي من النموذجين في كتالوج OrcaRouter اعتبارًا من 9 سبتمبر 2026: GPT-Image-2.5 متاح حاليًا عبر OpenAI API فقط (الجيل السابق، GPT-Image-2، موجه)، وLLaDA-Image متاح كأوزان فقط دون استدلال مستضاف. يظل قصد التصميم قائمًا بغض النظر عن كتالوج اليوم.

أيُّ واحدٍ ينبغي أن تبني عليه؟
إذا كان عملك هو توليد الصور التجاري حيث التعديل الفاشل يكلّفك علاقة عميل — لقطات المنتجات، إبداعات الحملات، صور متسقة مع المرجع، جلسات تعديل طويلة متعددة الجولات — فإن GPT-Image-2.5 هو النموذج الذي صُمم بالكامل لهذه المهمة، ونقطة نهاية Sunburst هي سبب الانتباه حتى قبل وجود تقييمات مستقلة. أما المخاطر فهي غموض السعر لكل صورة، وحقيقة أن كل ادعاء بالجودة يأتي من OpenAI نفسها. وإذا كان عملك بحثًا أو تجارب عالية الحجم أو توليدًا ثنائي اللغة (صينية-إنجليزية) أو أي شيء يجب تشغيله في بيئتك الخاصة أو على بياناتك الخاصة، فإن LLaDA-Image هو الإصدار الأكثر إثارة — أوزان مفتوحة حقًا مع وصفة منشورة، على حساب أن تكون بنيتك التحتية الخاصة وتتعايش مع نتائج لم تُستنسخ. النموذجان يفصل بين إصداريهما أسبوع، وبين نموذجَي تشغيلهما عالم كامل؛ والخيار الصحيح هو ما يطابق التكلفة التي يمكنك فعليًا تحملها.

