OpenAI's gpt-image-2 هو الجيل التالي من سلسلة gpt-image — نموذج صور يُحتسب على أساس الرموز (token-billed) ويُستخدم عبر واجهة OpenAI Images API القياسية. إنه ترقية متوافقة بالكامل مع gpt-image-1: نفس حزمة SDK، نفس هيكل الاستدعاء، نفس المعاملات. وجّه عميل OpenAI الحالي الخاص بك إلى عنوان OrcaRouter الأساسي واضبط النموذج على `openai/gpt-image-2`. التسعير: $5.00 للإدخال / $30.00 للإخراج لكل مليون رمز، ويُحتسب بالتكلفة الفعلية — لا رسوم إضافية، ولا حاجة للترحيل.
OpenAI GPT-Image-2 هو نموذج متعدد الوسائط من OpenAI متخصص في إنشاء وتحرير الصور. يقبل مطالبات نصية وإدخالات صور اختيارية لإنتاج مخرجات بصرية معدلة أو جديدة تمامًا. يُقاس أداء النموذج بواسطة درجة LM…
تم تصميم GPT-Image-2 لإنشاء صور من الأوصاف النصية وتحرير الصور الموجودة استنادًا إلى التعليمات النصية. يمكنه تعديل سمات مثل اللون والملمس والشكل والتركيب، بالإضافة إلى إضافة أو إزالة العناصر. يدعم النموذج الرسم الداخلي (استبدال أجزاء من الصورة) والرسم الخارجي (تمديد اللوحة) بشكل ضمني من خلال تصميم المطالبات. كما يتيح نقل النمط، مما يمكّن المستخدمين من تطبيق جمالية معينة على صورة مصدرية. هذه القدرات تجعله مناسبًا لمهام تتراوح من التصحيحات البسيطة إلى التجارب البصرية الإبداعية.
نعم، يمكن لـ GPT-Image-2 توليد صور جديدة كليًا من أوصاف نصية دون الحاجة إلى أي صورة إدخال. يستخدم النموذج الوصف المقدَّم لإنشاء تمثيل بصري، بما في ذلك تفاصيل حول تكوين المشهد، والإضاءة، والألوان، والأشياء. تعتمد جودة الصورة المولَّدة ودقتها على وضوح الوصف والقيود التي تفرضها البنية الأساسية. للحصول على أفضل النتائج، يجب أن تكون الأوصاف واضحة وتتجنب الإشارات الغامضة. هذه الإمكانية مفيدة لتوليد الأفكار، والنماذج الأولية، وإنشاء رسوم توضيحية فريدة من أوصاف المفاهيم.
يقبل GPT-Image-2 النصوص التوجيهية كمدخل أساسي. عند تحرير الصور، يتطلب توفير صورة موجودة إما كرابط URL أو كبيانات مشفرة بصيغة base64 الخام داخل طلب API. يجب أن تكون الصورة بتنسيق قياسي مثل PNG أو JPEG، مع حدود الدقة والحجم المحددة بواسطة مواصفات API الخاصة بـ OpenAI. لا يدعم النموذج الفيديو أو المدخلات المتعددة الصور بشكل أصلي؛ كل طلب يعمل على زوج واحد من النص التوجيهي والصورة. يتم إنشاء صور المخرجات بتنسيقات شائعة، عادةً PNG، ويمكن تسليمها كروابط URL أو كبيانات base64 وفقًا لتفضيل العميل.
لا يحتفظ GPT-Image-2 بحالة عبر الطلبات؛ كل استدعاء API مستقل. يجب أن تدير التطبيق المستدعي عملية التحرير متعدد الخطوات—حيث يتم تحسين الصورة تدريجيًا عبر سلسلة من المطالبات—. يمكن للمطورين تنفيذ سير عمل حيث تمرر كل خطوة المخرجات السابقة كمدخل للطلب التالي. يتيح هذا النهج التحرير التكراري، مثل تعديل الألوان أولاً، ثم إضافة خلفية، ثم تغيير الحجم. على الرغم من أنه فعال، فإن عدم وجود حالة مدمجة يعني أن التطبيق يجب أن يتولى السياق، مثل تخزين الصور الوسيطة وبناء المطالبات المناسبة لكل خطوة.
نقاط Elo لتحرير الصور في LM Arena والتي تبلغ 1467.0 هي معيار يقيس جودة مخرجات تحرير الصور. يتم حساب نقاط Elo في هذا السياق بناءً على مقارنات زوجية لمخرجات النماذج من قبل المقيمين البشر. تشير نقاط 1467 إلى أن GPT-Image-2 يتفوق بشكل كبير على النماذج الأساسية ويتنافس مع النماذج الرائدة الأخرى في تحرير الصور. تعكس أداءً قوياً في مهام مثل إدراج الكائنات، استبدال الخلفية، تغيير الألوان، والتعديلات التركيبية. هذه النتيجة هي واحدة من أعلى النتائج في لوحة متصدرى LM Arena لفئة تحرير الصور، مما يشير إلى أن النموذج ينتج تحريرات متماسكة ومخلصة للتعليمات وجذابة بصرياً.
تختلف زمن الاستجابة لـ GPT-Image-2 حسب تعقيد المطالبة، وحجم الإدخال (إن وجد)، ودقة الإخراج المطلوبة. لا تنشر OpenAI ضمانات زمن استجابة ثابتة لهذا النموذج؛ تتراوح أوقات الاستجابة النموذجية من بضع ثوانٍ إلى عشرات الثواني للصور الكبيرة أو التعديلات المعقدة. نظرًا لأن OrcaRouter هو مرحّل لا يضيف أي عبء إضافي على وقت معالجة المزود، فإن وقت الانتظار الفعلي هو نفسه عند الاتصال بـ OpenAI مباشرة. بالنسبة للتطبيقات الإنتاجية، يجب على المستخدمين تنفيذ مهلات (timeouts) ومنطق إعادة المحاولة، والنظر في المعالجة المجمعة لإدارة الإنتاجية.
تتفوق GPT-Image-2 في مهام تحرير الصور التي تتطلب تعديلات دقيقة بناءً على تعليمات اللغة الطبيعية. تعكس درجة LM Arena Elo العالية قدرتها على إنتاج تعديلات دقيقة وجميلة من الناحية الجمالية. يتعامل النموذج بشكل جيد مع التغييرات التركيبية المعقدة، مثل استبدال الكائنات مع الحفاظ على الإضاءة والظلال المناسبة. كما يقوم بتوليد صور عالية الجودة من الصفر مع محاكاة تصويرية جيدة والالتزام بالتعليمات. يبلغ المستخدمون عادةً أنه يتعامل مع التعليمات الإبداعية (مثل، "اجعل هذا المشهد يبدو كلوحة زيتية") بنقل أسلوب معقول.
على الرغم من أدائه القوي في الاختبارات المعيارية، إلا أن GPT-Image-2 لديه قيود. قد يواجه صعوبة في التعليمات الطويلة جدًا أو متعددة الأجزاء، خاصة عندما تتطلب كائنات متعددة تعديلًا متزامنًا. يمكن للنموذج إنتاج تشوهات عرضية، مثل وجوه مشوهة أو أنسجة غير واقعية، خاصة في المشاهد المعقدة. كما أن لديه قيودًا أمنية تمنع إنشاء أنواع معينة من المحتوى، مما قد يحد من بعض الاستخدامات الإبداعية. بالإضافة إلى ذلك، نظرًا لأنه يتم الوصول إلى النموذج من خلال بنية OpenAI التحتية، فإن المستخدمين يخضعون لسياسة المحتوى وحدود المعدل الخاصة بـ OpenAI، مما قد يؤثر على سير عمل التحرير الجماعي.
يتم تسعير GPT-Image-2 لكل رمز: 8.00 دولار لكل مليون رمز إدخال و30.00 دولار لكل مليون رمز إخراج. تشمل رموز الإدخال النص الموجه وأي بيانات صورة مشفرة بتنسيق base64 (نظرًا لأن الصور يتم تحويلها إلى رموز). رموز الإخراج هي تمثيل الصورة المُولَّدة. تعتمد التكلفة الإجمالية للطلب على طول النص الموجه ودقة كل من صور الإدخال والإخراج. يمرر OrcaRouter هذه التسعيرة دون أي هامش ربح، مما يعني أن التكلفة هي بالضبط ما تفرضه OpenAI. لا تُضاف أي رسوم إضافية من منصة OrcaRouter.
لا. توضح OrcaRouter صراحةً أنها تقوم بفوترة GPT-Image-2 بسعر المزود دون أي زيادة.这意味着 سعر كل توكن هو بالضبط 8.00 دولار للإدخال و 30.00 دولار للإخراج. لا توجد رسوم اشتراك شهرية، أو تكاليف أساسية، أو نسب زيادة مضافة من قبل OrcaRouter. الرسوم الوحيدة هي تكاليف التوكن التي تستهلكها OpenAI. يجب على المستخدمين التأكد من إعداد طريقة دفع صالحة مع OrcaRouter لتجنب انقطاع الخدمة، لكن معادلة التسعير شفافة وقابلة للتوقع.
لا تقدم OpenAI علنًا التخزين المؤقت لمطالبات توليد الصور أو تحريرها؛ تتم معالجة كل طلب بشكل مستقل. لذلك، فإن تكرار نفس المطالبات مع نفس صورة الإدخال سيؤدي عادةً إلى تحمل تكاليف الرموز الكاملة في كل استدعاء. ومع ذلك، إذا كان تطبيقك يستخدم نفس صورة الإدخال بشكل متكرر، فقد تقلل استخدام رموز الإدخال عن طريق تخزين الصورة خارجيًا والإشارة إليها عبر عنوان URL (إذا كان ذلك مدعومًا) بدلاً من إعادة ترميزها كـ base64. لا يوفر OrcaRouter أي طبقة تخزين مؤقت إضافية من شأنها تقليل استهلاك الرموز لهذا النموذج.
يتم تحديد تسعير GPT-Image-2 من قبل OpenAI، وهو من بين الخيارات الأعلى تكلفة لنماذج الصور نظراً لقدراته التحريرية المتخصصة. قد توفر البدائل الأرخص، مثل نماذج Stability AI المتاحة على OrcaRouter، أسعاراً أقل لكل رمز (token)، ولكنها قد لا ترقى إلى دقة التحرير التي يقيسها معيار LM Arena. المفاضلة قائمة بين التكلفة وجودة المخرجات. بالنسبة للتحريرات البسيطة أو التطبيقات منخفضة الأهمية، قد يكون النموذج الأقل تكلفة كافياً، بينما يُفضل استخدام GPT-Image-2 عندما تكون الدقة العالية والالتزام بالتعليمات أمراً بالغ الأهمية.
لاستخدام GPT-Image-2 عبر OrcaRouter، أرسل طلب HTTP POST إلى نقطة النهاية المتوافقة مع OpenAI على https://api.orcarouter.ai/v1/images/generations (أو نقطة نهاية مماثلة حسب العملية). اضبط معامل النموذج على "openai/gpt-image-2". قم بتضمين سلسلة نصية (prompt) واختياريًا صورة (بصيغة base64 أو رابط URL) لمهام التحرير. يُصادق OrcaRouter على الطلبات باستخدام مفتاح API الخاص بك (يُمرر عادةً في رأس Authorization كـ "Bearer <key>"). سيحتوي الرد على بيانات الصورة المُنشأة بالتنسيق المحدد في الطلب، عادةً كرابط URL أو سلسلة base64.
تتبع معاملات API إلى حد كبير مخطط إنشاء الصور الخاص بـ OpenAI. تشمل المعاملات الرئيسية "model" (مضبوطة على "openai/gpt-image-2")، و"prompt" (التعليمات النصية)، و"n" (عدد الصور المراد إنشاؤها، الافتراضي 1)، و"size" (أبعاد الإخراج مثل "1024x1024")، و"response_format" ("url" أو "b64_json")، و"user" (لتتبع حدود المعدل). بالنسبة لمهام التعديل، يمكنك أيضًا تضمين "image" (صورة الإدخال بتنسيق base64) و"mask" (للتلوين الداخلي، لتحديد المناطق المراد تعديلها). يُرجى الرجوع إلى وثائق OpenAI الرسمية للحصول على القائمة الكاملة للمعاملات المدعومة وقيودها.
الترحيل سهل لأن OrcaRouter يوفر واجهة برمجة تطبيقات متوافقة تمامًا مع OpenAI. التغييرات الوحيدة المطلوبة هي تحديث عنوان URL الأساسي من https://api.openai.com إلى https://api.orcarouter.ai/v1 وتعديل سلسلة النموذج من شيء مثل "gpt-image-2" إلى "openai/gpt-image-2". يجب أن تعمل شفرتك الحالية للمصادقة، وتنسيق الطلبات، ومعالجة الاستجابات دون تعديل. لا حاجة لتغيير أسماء المعاملات أو هياكل البيانات. بعد تحديث نقطة النهاية ومعرف النموذج، اختبر باستخدام طلب واحد لتأكيد الاتصال وسلوك الفوترة.
يستخدم OrcaRouter مصادقة مفتاح API. يجب تضمين مفتاح API الخاص بـ OrcaRouter في رأس الطلب. يتم تحديد حدود المعدل بواسطة كل من OrcaRouter و OpenAI. قد يفرض OrcaRouter حدوداً لمنع إساءة الاستخدام، لكنها عادةً ما تكون سخية. يطبق OpenAI حدوده الخاصة بناءً على المستوى والفواتير، والتي تنطبق بغض النظر عما إذا كنت تصل إلى النموذج عبر OrcaRouter أو مباشرة. يجب على المستخدمين مراقبة الاستخدام عبر لوحة تحكم OrcaRouter وضبط وتيرة الطلبات وفقاً لذلك. لا توجد مصادقة إضافية مطلوبة تتجاوز مفتاح API.
GPT-Image-2 وDALL-E 3 هما نموذجان لتوليد الصور من OpenAI، لكن كل منهما يستهدف حالات استخدام مختلفة. DALL-E 3 هو نموذج عام لتحويل النص إلى صورة يركز على توليد صور إبداعية وواقعية من الصفر. أما GPT-Image-2 فهو مُحسَّن لتحرير الصور الحالية، كما يتضح من درجة Elo العالية في تحرير الصور في LM Arena. وعلى الرغم من أن DALL-E 3 يمكنه أيضًا إجراء بعض التعديلات، إلا أن قوته تكمن في التوليد الأصلي. يميل GPT-Image-2 إلى إنتاج تعديلات أكثر دقة على الصور المدخلة، خاصةً عندما يتضمن الطلب الحفاظ على عناصر من التكوين الأصلي.
نماذج Stability AI مثل SD3.5 هي مولدات صور مفتوحة المصدر تقدم تكلفة أقل لكل رمز (token)، لكنها قد تتطلب المزيد من هندسة المطالبات (prompt engineering) لتحقيق جودة مماثلة. أما GPT-Image-2، كنموذج احتكاري، فيستفيد من بيانات تدريب موسعة وضبط دقيق لمهام التحرير، وهو ما ينعكس في درجته على منصة LM Arena. يعتمد الاختيار بينهما على الميزانية ومتطلبات الجودة. بالنسبة لمهام التحرير عالية المخاطر حيث تكون الدقة ضرورية، فإن GPT-Image-2 هو الخيار الأفضل. أما للتوليد بكميات كبيرة أو عندما تكون التكلفة هي الشاغل الرئيسي، فقد تكون نماذج Stability AI المتاحة عبر OrcaRouter بديلاً قابلاً للتطبيق، لكن يجب عليك تقييم الفروقات في الجودة لتطبيقك المحدد.
اختر نموذجًا أقل تكلفة عندما تكون مهمتك توليد صور بسيطة دون متطلبات تحرير، أو عندما يكون التسامح مع التحرير غير المثالي مرتفعًا. على سبيل المثال، قد لا يتطلب توليد صور نائبة أو أيقونات بسيطة أو رسومات منخفضة الدقة تعقيد GPT-Image-2. وبالمثل، إذا كان طلبك يتضمن تعديلات طفيفة فقط (مثل تغيير السطوع أو الاقتصاص)، فقد يكون النموذج الأقل تخصصًا كافيًا. يقدم OrcaRouter مجموعة من نماذج الصور بنقاط سعر متفاوتة. قيّم حالة الاستخدام الخاصة بك—إذا كانت مهمة التحرير معقدة وتتطلب دقة عالية، فإن GPT-Image-2 مبرر؛ وإلا، ففكر في توفير التكاليف من النماذج البديلة.
متوافق مع OpenAI — أبقِ على SDK الحالي
https://api.orcarouter.ai/v1| الإدخال / 1M توكن | $8.00 |
|---|---|
| الإخراج / 1M توكن | $30.00 |
| قراءة الذاكرة المؤقتة / 1M | $1.25 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
ما يتحدث عنه المطورون هذا الأسبوع
GET /api/public/models/openai/gpt-image-2فتح @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2