إصدار Gemini 2.5 Flash Image، المعروف أيضًا باسم "Nano Banana"، أصبح متاحًا بشكل عام الآن. وهو نموذج متطور لتوليد الصور مع فهم سياقي. وهو قادر على توليد الصور،...
Google: Nano Banana (صورة Gemini 2.5 Flash) هو نموذج لغوي متعدد الوسائط طورته Google، وهو جزء من سلسلة Gemini 2.5 Flash. يقبل النموذج كلاً من الصورة والنص كمدخلات، وينتج نصًا كمخرج. يتم الوصول إلى…
تتركز القدرات الأساسية على فهم واستدلال المحتوى البصري المقدم كصور. عند إعطاء النموذج صورة واستفسار نصي، يمكنه وصف المشهد، تحديد الكائنات، الإجابة عن أسئلة حول المحتوى، استخراج النص (OCR)، وإجراء استدلال بصري أساسي (مثل العلاقات المكانية، الألوان، الأفعال). كما يمكنه معالجة النص المصاحب للصورة، مثل التعليمات أو السياق. نظرًا لاستخدامه بنية معمارية من فئة flash-tier، فهو محسّن لزمن استجابة منخفض وإنتاجية عالية، مما يجعله مناسبًا للتطبيقات في الوقت الفعلي أو ذات الحجم الكبير. ومع ذلك، قد لا يضاهي عمق الاستدلال أو دقة النماذج الأكبر والأكثر تكلفة مثل Gemini 2.5 Pro في المهام البصرية المعقدة التي تتطلب تحليلًا دقيقًا أو سلاسل استدلال طويلة. النموذج غير مصمم لمهام مثل توليد الصور، تحليل الفيديو، أو المحادثات متعددة الأدوار التي تتطلب سياقًا طويلًا يتجاوز 32K توكن.
إذا كان تطبيقك لا يتطلب إدخال صور على الإطلاق، فإن استخدام نموذج نصي فقط (مثل متغير أصغر من Gemini أو نموذج مفتوح المصدر) سيكون أكثر فعالية من حيث التكلفة. وبالمثل، إذا كانت مهمتك تتضمن فقط تفكيرًا قائمًا على النص بدون مكون بصري، فإن المعالجة الزائدة للصور غير ضرورية. بالنسبة للسيناريوهات التي يكون فيها طول الإخراج طويلًا—مثل إنشاء تقارير أو قصص مفصلة من صورة—فإن 30 دولارًا لكل مليون رمز إخراج يمكن أن تصبح مكلفة. في مثل هذه الحالات، فكر في نماذج ذات تسعير إخراج أقل، أو استخدم هذا النموذج لإنشاء ملخص موجز ثم توسيعه باستخدام نموذج نصي أرخص. بالإضافة إلى ذلك، إذا كنت بحاجة إلى معالجة صور متعددة لكل طلب أو التعامل مع صور كبيرة جدًا، فقد تكون النماذج ذات نوافذ سياق أكبر أو دعم دقة صورة محددة أكثر ملاءمة.
تستفيد عمليات النشر عالية الحجم من انخفاض تكلفة الإدخال لهذا النموذج (0.30 دولار لكل مليون رمز) وسرعة الاستدلال. تشمل حالات الاستخدام المثالية وضع العلامات تلقائيًا على الصور لمكتبات الصور الكبيرة، وإنشاء نص بديل لآلاف صور المنتجات، وإجراء التعرف الضوئي على الحروف لمجموعات من المستندات الممسوحة ضوئيًا، والمراقبة الفورية لمحتوى الصور التي يرفعها المستخدمون. نظرًا لارتفاع تكلفة الإخراج، يجب أن تكون الاستجابة قصيرة—غالبًا كلمة واحدة أو تسمية أو جملة. على سبيل المثال، تصنيف صورة ضمن فئات محددة مسبقًا، أو استخراج بعض الحقول الرئيسية من نموذج، أو الإجابة على سؤال بنعم/لا حول صورة. يمكن إجراء المعالجة المجمعة عبر واجهة برمجة تطبيقات OrcaRouter مع طلبات متزامنة. زمن الاستجابة للنموذج منخفض عمومًا، لكن الإنتاجية الفعلية تعتمد على حجم الصورة وتعقيدها. لا يوجد حد معدل منفصل في OrcaRouter بخلاف استخدام واجهة برمجة التطبيقات الإجمالي.
القيود الرئيسية هي التكلفة العالية لإخراج الرموز المميزة (tokens) مقارنةً بتكلفة الإدخال، مما يجعل توليد النصوص الطويلة مكلفًا. نافذة السياق البالغة 32,768 رمزًا تحد من كمية النص وحجم الصورة (من حيث الرموز) التي يمكن معالجتها في طلب واحد. النموذج غير مصمم للمهام التي تتطلب استدلالًا متعدد الوسائط عميقًا، أو تفاصيل بصرية معقدة، أو معالجة صور متعددة في وقت واحد (حيث تستهلك كل صورة إضافية من السياق). علاوة على ذلك، باعتباره نموذجًا من فئة "flash"، قد يُظهر دقة أقل في المهام البصرية المتخصصة مثل تحليل الصور الطبية، أو اكتشاف الأجسام الدقيقة، أو التعرف على الأجسام النادرة مقارنةً بالنماذج الأكثر قدرة ولكنها أبطأ أو أكثر تكلفة. لا يتم الكشف عن بيانات تدريب النموذج أو أدائه المحدد على المعايير المرجعية في المعلومات المقدمة؛ لذا يجب على المستخدمين التقييم على مجموعات بياناتهم الخاصة. أخيرًا، يدعم النموذج إدخال الصور والنصوص فقط، وليس الفيديو أو الصوت.
المعلومات المقدمة لا تتضمن أي نتائج مرجعية محددة لـ Google: Nano Banana (Gemini 2.5 Flash Image). وهو جزء من سلسلة Gemini 2.5 Flash من Google، والتي تستهدف بشكل عام الكفاءة بدلاً من الدقة العالية. في غياب الأرقام، يجب على المستخدمين توقع أداء مماثل للنماذج متعددة الوسائط من فئة Flash في المهام القياسية للرؤية واللغة مثل VQAv2 وCOCO Captions وOCR. لكن النتائج الدقيقة غير معطاة. نوصي بتقييم النموذج على مجموعة بيانات تمثيلية خاصة بك لتحديد ما إذا كانت قدراته تلبي متطلباتك. لا توفر OrcaRouter معايير داخلية تتجاوز ما هو متاح علنًا من Google. إذا كنت بحاجة إلى مقاييس دقة محددة، فاستشر الوثائق الرسمية من Google لسلسلة Gemini 2.5 Flash، لكن لاحظ أن معرف النموذج هذا قد يكون له ضبط دقيق خاص به.
المعلومات المقدمة لا تتضمن قياسات زمن الاستجابة (latency) لهذا النموذج. كجزء من عائلة Gemini 2.5 Flash، تم تصميمه لزمن استجابة منخفض وإنتاجية عالية. عادةً، نماذج الفلاش من Google تتبادل بعض جودة التفكير مقابل السرعة، مما يجعلها مناسبة للتطبيقات شبه الفورية. يعتمد زمن الاستجابة الفعلي على عوامل مثل حجم ودقة الصورة المدخلة، وطول النص الاستفهامي (prompt)، وعدد الرموز (tokens) المخرجة المطلوبة، والحمل الحالي على واجهة API. بشكل عام، قد تستغرق مهام وصف الصور البسيطة من بضع مئات من المللي ثانية إلى بضع ثوانٍ، بينما تستغرق الاستفسارات الأكثر تعقيدًا التي تتطلب مخرجات أطول وقتًا أطول. للحصول على أفضل النتائج، يُنصح بالحفاظ على دقة الصورة معقولة والحد من طول المخرجات. لا تضيف واجهة API الخاصة بـ OrcaRouter أي تكلفة إضافية تتجاوز وقت استجابة المزوّد.
النقاط القوية: النموذج يتفوق في المهام التي تتطلب إجابة سريعة وفعالة من حيث التكلفة من صورة واحدة. يمكنه التعرف بسرعة على الأشياء الشائعة، وقراءة النصوص من الصور، والإجابة على الأسئلة المباشرة حول المحتوى البصري. التكلفة المنخفضة للإدخال تجعل من الممكن معالجة كميات كبيرة من الصور. القيود: قد يواجه صعوبة في المهام التي تتطلب دقة عالية، مثل عد الأشياء الصغيرة، أو التمييز بين الأنسجة المتشابهة جدًا، أو فهم المخططات المعقدة. فهم النموذج محدود بما يمكن استنتاجه من بيانات البكسل والنص المقدم؛ ليس لديه إمكانية الوصول إلى المعرفة الخارجية خارج بيانات التدريب الخاصة به (تاريخ القطع غير معروف). بالإضافة إلى ذلك، نظرًا لأن تكلفة الإخراج مرتفعة، فإن توليد إجابات مطولة لكل صورة يمكن أن يصبح مكلفًا بسرعة. بالنسبة للمهام التي تتطلب تحليلاً طويلاً ومفصلاً، سيكون النموذج الأكثر قدرة (وعادة ما يكون أكثر تكلفة) أكثر ملاءمة. قد يكون الأداء في الحالات الحدودية مثل الصور المظلمة المشوشة أو الزوايا غير المعتادة أقل.
التسعير بسيط: 0.30 دولار لكل مليون رمز إدخال، و30.00 دولار لكل مليون رمز إخراج. تشمل رموز الإدخال الرموز من النص النصي ومن الصورة (يتم تحويل الصورة إلى رموز بواسطة النموذج). رموز الإخراج هي الرموز التي يتم إنشاؤها كاستجابة. لا توجد رسوم إعداد، ولا حد أدنى شهري، ولا يضيف OrcaRouter أي هامش ربح—أنت تدفع تمامًا سعر المزود. يتم عدّ الرموز بواسطة نظام OrcaRouter. الفوترة عادةً تكون على أساس الاستخدام، ويتم فرض الرسوم عند إرسال الطلبات. يمكنك مراقبة الاستخدام من خلال لوحة تحكم OrcaRouter. نظرًا لأن رموز الإدخال أرخص بكثير من رموز الإخراج، فإن التكلفة الإجمالية لطلب نموذجي (خرج قصير) يهيمن عليها جانب الإدخال، خاصة إذا قمت بتضمين صورة كبيرة. على سبيل المثال، قد تستهلك صورة بحجم 1024x1024 عدة آلاف من رموز الإدخال.
مقارنة بالنماذج النصية فقط (على سبيل المثال، Gemini 1.5 Flash النصية فقط بسعر $0.075/M للإدخال و$0.30/M للإخراج)، فإن تكلفة الإدخال لهذا النموذج أعلى بـ 4 أضعاف وتكلفة الإخراج أعلى بـ 100 ضعف، مما يعكس التعقيد الإضافي للرؤية. بالنسبة للمهام التي لا تتطلب تحليل الصور، فإن تلك النماذج النصية فقط أرخص بكثير. مقارنة بالنماذج متعددة الوسائط الأكبر مثل Gemini 2.5 Pro (التي لها تكاليف أعلى لكل رمز ولكن تفكير أفضل)، فإن هذا النموذج أرخص من حيث الإدخال لكنه مماثل أو أعلى من حيث الإخراج اعتمادًا على الطبقة المحددة من Pro. المفاضلة في طبقة Flash هي دقة أقل مقابل تكلفة إدخال أقل. إذا كان تطبيقك يحتاج إلى دقة عالية ويمكنه تحمل تكلفة إدخال أعلى، فقد يكون نموذج Pro أفضل. إذا كان طول الإخراج كبيرًا، تصبح تكلفة الإخراج لهذا النموذج باهظة، لذا فكر في نماذج بتسعير إخراج أقل، مثل Gemini 1.5 Flash (نص+رؤية) والتي قد يكون لها أسعار مختلفة.
المعلومات المتوفرة لا تذكر أي آليات تخزين مؤقت أو خصومات على الحجم لهذا النموذج على OrcaRouter. يقوم OrcaRouter بتمرير تسعير المزوّد دون أي هامش ربح، لذا فإن أي خصومات يجب أن تأتي من ترتيبات الفوترة المباشرة من Google. وحتى الآن، لا يوجد تخزين مؤقت تلقائي لتضمينات الصور أو المطالبات في المعلومات المنشورة لـ OrcaRouter. يجب على المستخدمين افتراض أن كل طلب يتم فوترة بناءً على الرموز (tokens) المدخلة والمخرجة المستخدمة. بالنسبة للمستخدمين ذوي الحجم العالي، قد يكون من المفيد التواصل مع OrcaRouter للاستفسار عن اتفاقيات المؤسسات المحتملة، لكن التسعير القياسي للدفع حسب الاستخدام هو $0.30/M للمدخلات و $30.00/M للمخرجات. لتقليل التكاليف، أعد استخدام المخرجات المُنتَجة سابقًا حيثما أمكن، وقلل عدد الرموز في كل طلب (على سبيل المثال، عن طريق تغيير حجم الصور أو استخدام مطالبات مختصرة).
لاستخدام Google: Nano Banana (Gemini 2.5 Flash Image) عبر OrcaRouter، أرسل طلب POST إلى https://api.orcarouter.ai/v1/chat/completions مع تعيين المعلمة model إلى "google/gemini-2.5-flash-image". تتبع واجهة API تنسيق محادثات OpenAI. قم بتضمين مفتاح API الخاص بـ OrcaRouter في رأس التفويض (Authorization header) كـ "Bearer YOUR_API_KEY". في نص الطلب، قدم مصفوفة رسائل (messages array) تحتوي على رسالة مستخدم تشمل صورة ونصًا. للصور، قم بتضمين جزء محتوى من نوع "image_url" مع عنوان URL أو بيانات base64. مثال: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"ما محتوى هذه الصورة؟"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. سيكون الرد عبارة عن محادثة مكتملة قياسية تحتوي على إجابة النموذج.
تدعم واجهة برمجة تطبيقات OrcaRouter العديد من المعاملات نفسها التي تدعمها واجهة OpenAI API. المعاملات الأساسية: model (مطلوب، اضبطه على "google/gemini-2.5-flash-image")، messages (مطلوب، مصفوفة من كائنات الرسائل)، max_tokens (عدد صحيح، أقصى عدد من الرموز المولدة)، temperature (رقم عشري، القيمة الافتراضية 1.0، يتحكم في العشوائية)، top_p (رقم عشري، القيمة الافتراضية 1.0)، presence_penalty و frequency_penalty (أرقام عشرية)، stop (سلسلة نصية أو مصفوفة من السلاسل النصية، حتى 4 متواليات)، وstream (قيمة منطقية، للاستجابات المتدفقة). للإدخال الصوري، يجب أن تتضمن الرسائل رسالة مستخدم واحدة على الأقل بمحتوى عبارة عن مصفوفة من الأجزاء، كل جزء يحتوي على حقل type ("text" أو "image_url"). يجب أن يحتوي جزء image_url على كائن "image_url" به سلسلة "url" (إما عنوان URL عام الوصول أو عنوان URL لبيانات مع base64). لا توجد معاملات ضبط دقيق أو معاملات خاصة بالنموذج مكشوفة. نافذة السياق هي 32,768 رمزًا، لذا تأكد من أن prompt_token_count + image_token_count + max_tokens <= 32768.
يتطلب الانتقال إلى OrcaRouter تغييرات ضئيلة في الكود إذا كنت تستخدم بالفعل واجهة برمجة تطبيقات متوافقة مع OpenAI. ما عليك سوى تغيير عنوان URL الأساسي من نقطة النهاية السابقة إلى https://api.orcarouter.ai/v1. قم بتحديث مفتاح API الخاص بك إلى مفتاح OrcaRouter الخاص بك. عند استدعاء النموذج، عيّن معامل النموذج إلى `"google/gemini-2.5-flash-image"` (أو النموذج الذي تريده). اضبط أي معرفات نموذج موجودة وفقًا لذلك. بالنسبة لإدخال الصور، تأكد من أن تنسيق طلبك يتطابق مع اصطلاح OpenAI (على سبيل المثال، باستخدام مصفوفة محتوى مع image_url). لا حاجة لأي تغييرات أخرى في الكود عادةً. إذا كنت تستخدم تنسيق API مختلف (مثل نقاط نهاية سحابية)، فقد تحتاج إلى إعادة كتابة هيكل الطلب. توفر OrcaRouter وثائق لمكتبات SDK الشائعة. اختبر مع عدد صغير من الطلبات للتحقق من عدد الرموز والتسعير. لاحظ أن OrcaRouter تفرض أسعار المزوّدين بدون هامش ربح، لذلك قد يختلف التسعير عن مزوّدك السابق.
بالمقارنة مع نموذج Gemini 2.5 Flash النصي فقط (إذا كان متاحًا على OrcaRouter)، يضيف هذا النموذج إمكانيات إدخال الصور، ولكن بتكلفة إدخال أعلى. عادةً ما يكون الإصدار النصي فقط أقل تكلفة لكل رمز إدخال وله تكلفة إخراج أقل بشكل ملحوظ، مما يجعله مفضلًا للمهام النصية البحتة. مقارنة بنماذج Gemini 2.5 Pro، فإن هذا النموذج من الطبقة السريعة أرخص في الإدخال ولكن قد يكون أقل دقة وعمقًا في التفكير. تمتلك نماذج Pro نافذة سياق أكبر (غالبًا مليون رمز) وأداءً أفضل في المهام المعقدة متعددة الخطوات. قد تكون تكلفة الإخراج لنماذج Pro مماثلة أو أعلى. بالنسبة للمهام التي تتطلب فهم الصور إلى جانب النص، يقدم هذا النموذج نقطة دخول فعالة من حيث التكلفة. ومع ذلك، إذا كنت بحاجة إلى معالجة الفيديو أو الصوت أو صور متعددة في وقت واحد، فعليك التفكير في نموذج يدعم تلك الوسائط (على سبيل المثال، Gemini 2.5 Pro الذي يدعم الفيديو والصوت في بعض التكوينات).
هذا النموذج هو أحد الخيارات المتعددة الوسائط المتاحة عبر OrcaRouter. عادةً ما يحتوي GPT-4o (OpenAI) على نافذة سياق أكبر (128k) وقد يوفر فهمًا واستدلالًا أفضل للصور بشكل عام، ولكن بتكاليف إدخال وإخراج أعلى. نماذج الرؤية الخاصة بـ Claude (مثل Claude 3.5 Sonnet) تنافسية أيضًا ولكنها تختلف في التسعير وطول السياق. الميزة الرئيسية لـ Gemini 2.5 Flash Image هي انخفاض تكلفة الإدخال، مما يجعله جذابًا للمهام ذات الحجم الكبير والمخرجات القصيرة. ومع ذلك، بالنسبة للاستدلال البصري المعقد أو التصوير الطبي أو تحليل المستندات المفصل، قد تُنتج النماذج الأكثر تقدمًا نتائج أفضل. يعتمد الاختيار على المقايضة المحددة بين التكلفة والدقة وزمن الوصول. يتيح لك OrcaRouter التبديل بسهولة بين النماذج عن طريق تغيير معرف النموذج، لذلك من الممكن اختبار هذا النموذج جنبًا إلى جنب مع البدائل لتحديد الأنسب.
نموذج أكثر تكلفة—مثل Gemini 2.5 Pro أو GPT-4o أو Claude 3.5 Sonnet—يصبح مبررًا عندما تتطلب المهمة دقة أعلى، أو سياقًا أطول، أو استدلالًا يحتاج إلى خطوات أكثر. إذا كان تطبيقك ينتج نتائج غير صحيحة أو غير مكتملة باستخدام هذا النموذج، فإن توفير التكاليف يضيع هباءً إذا احتجت إلى معالجة لاحقة أو تصحيح يدوي. بالنسبة لمهام مثل تحليل الصور الطبية، أو تفسير المستندات القانونية، أو التعامل مع المحتوى الحساس المتعلق بالامتثال، فإن موثوقية النموذج المتميز قد تبرر التكلفة الأعلى. أيضًا، إذا كنت بحاجة إلى توليد مخرجات طويلة (مثل وصف صفحات كاملة) أو معالجة صور كبيرة جدًا، فإن النماذج ذات نوافذ السياق الأكبر وتكاليف الرموز المخرجة الأقل قد تكون أكثر فعالية من حيث التكلفة بشكل عام. طبيعة الطبقة السريعة (flash-tier) لهذا النموذج تعني أنه مصمم للسرعة والإنتاجية، وليس للعمق. استخدمه عندما يكون الفهم التقريبي كافيًا؛ وقم بالترقية عندما تكون الدقة مهمة.
تعتمد خصوصية البيانات ومعالجتها على سياسات Google لنماذج Gemini. كما هو الحال مع أي واجهة برمجة تطبيقات سحابية، يتم إرسال بيانات الإدخال (الصور والنص) إلى خوادم Google للمعالجة. قد تستخدم Google البيانات لتحسين النموذج ما لم تقم بإلغاء الاشتراك أو استخدام حسابات على مستوى المؤسسات التي تحظر هذا الاستخدام. لا تحدد الحقائق المقدمة تفاصيل معالجة البيانات لهذا النموذج المحدد. عند استخدام OrcaRouter كبوابة، تمر البيانات عبر البنية التحتية لـ OrcaRouter ولكن يتم معالجتها في النهاية بواسطة Google. لا تقوم OrcaRouter بتخزين بياناتك أو استخدامها للتدريب. يجب على المستخدمين مراجعة شروط معالجة البيانات الخاصة بـ Google لواجهات برمجة تطبيقات Gemini والنظر في التشفير من النهاية إلى النهاية إذا لزم الأمر. بالنسبة للبيانات الحساسة، تفضل بعض المؤسسات النماذج المستضافة على بنيتها التحتية الخاصة (على سبيل المثال، عبر Vertex AI مع إقامة البيانات) بدلاً من بوابة طرف ثالث. ومع ذلك، توفر OrcaRouter مفتاح واجهة برمجة تطبيقات موحد وفواتير، مما قد يبسط الوصول إذا كانت مخاوف معالجة البيانات مقبولة.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| الإدخال / 1M توكن | $0.300 |
| الإخراج / 1M توكن | $30.00 |
| العملة | USD |
تقدير بناءً على السعر المُعلن
تقدير فقط — يعتمد العدد الفعلي للرموز على مُجزّئ الرموز الخاص بالمزوّد.
GET /api/public/models/google/gemini-2.5-flash-imageفتح @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image