Gemini 2.5 Flash Image, également connu sous le nom de "Nano Banana," est désormais généralement disponible. C'est un modèle de génération d'images de pointe avec compréhension contextuelle. Il est capable de génération d'images,...
Google : Nano Banana (Gemini 2.5 Flash Image) est un modèle de langage multimodal développé par Google, faisant partie de la série Gemini 2.5 Flash. Il accepte à la fois des images et du texte en…
Les capacités principales reposent sur la compréhension et le raisonnement à partir de contenus visuels présentés sous forme d’images. Étant donné une image et une instruction textuelle, le modèle peut décrire la scène, identifier des objets, répondre à des questions sur le contenu, extraire du texte (OCR) et effectuer un raisonnement visuel de base (par exemple, relations spatiales, couleurs, actions). Il peut également traiter du texte accompagnant l’image, comme des instructions ou du contexte. Grâce à une architecture de type flash-tier, il est optimisé pour une faible latence et un débit élevé, ce qui le rend adapté aux applications en temps réel ou à grand volume. Cependant, il peut ne pas égaler la profondeur de raisonnement ou la précision de modèles plus coûteux et plus grands comme Gemini 2.5 Pro sur des tâches visuelles complexes nécessitant une analyse fine ou de longues chaînes de raisonnement. Le modèle n’est pas conçu pour des tâches telles que la génération d’images, l’analyse vidéo ou les conversations multi-tours nécessitant un contexte long au-delà de 32K tokens.
Si votre application ne nécessite aucune entrée d'image, l'utilisation d'un modèle textuel uniquement (par exemple, une variante plus petite de Gemini ou un modèle open-source) serait plus rentable. De même, si votre tâche implique uniquement un raisonnement basé sur du texte sans composante visuelle, le traitement d'image en sus est inutile. Pour les scénarios où la longueur de sortie est importante, comme la génération de rapports détaillés ou d'histoires à partir d'une image, le coût de 30 $ par million de tokens de sortie peut devenir élevé. Dans ce cas, envisagez des modèles avec un tarif de sortie inférieur, ou utilisez ce modèle pour générer un bref résumé, puis développez-le avec un modèle textuel moins cher. De plus, si vous devez traiter plusieurs images par requête ou gérer de très grandes images, des modèles avec des fenêtres de contexte plus grandes ou un support spécifique de résolution d'image peuvent être plus appropriés.
Les déploiements à grand volume bénéficient du faible coût d'entrée de ce modèle (0,30 $ par million de tokens) et de son inférence rapide. Les cas d'usage idéaux incluent l'étiquetage automatique d'images pour de grandes bibliothèques de photos, la génération de alt-text pour des milliers d'images de produits, l'exécution d'OCR sur des lots de documents scannés, et la modération en temps réel du contenu des images téléchargées par les utilisateurs. Étant donné que le coût de sortie est élevé, la réponse doit être courte — souvent un seul mot, une étiquette ou une phrase. Par exemple, classer une image dans des catégories prédéfinies, extraire quelques champs clés d'un formulaire, ou répondre à une question oui/non sur une image. Le traitement par lots peut être effectué via l'API d'OrcaRouter avec des requêtes simultanées. La latence du modèle est généralement faible, mais le débit réel dépend de la taille et de la complexité de l'image. Il n'y a pas de limite de débit distincte dans OrcaRouter autre que l'utilisation globale de l'API.
La principale limitation est le coût élevé des jetons de sortie par rapport au coût d'entrée, ce qui rend la génération de longs textes coûteuse. La fenêtre de contexte de 32 768 jetons limite la quantité de texte et la taille d'une image (en termes de jetons) pouvant être traitées en une seule requête. Le modèle n'est pas conçu pour des tâches nécessitant un raisonnement multimodal approfondi, des détails visuels complexes ou le traitement de plusieurs images à la fois (chaque image supplémentaire consomme du contexte). De plus, en tant que modèle de niveau flash, il peut présenter une précision moindre sur des tâches visuelles spécialisées telles que l'analyse d'images médicales, la détection fine d'objets ou la reconnaissance d'objets rares par rapport à des modèles plus performants mais plus lents ou plus coûteux. Les données d'entraînement du modèle et ses performances spécifiques sur des benchmarks ne sont pas divulguées dans les faits fournis ; les utilisateurs doivent évaluer sur leurs propres ensembles de données. Enfin, il ne prend en charge que les entrées image et texte, pas la vidéo ni l'audio.
Les faits fournis n'incluent aucun score de référence spécifique pour Google: Nano Banana (Gemini 2.5 Flash Image). Ce modèle fait partie de la série Gemini 2.5 Flash de Google, qui cible généralement l'efficacité plutôt qu'une précision de premier ordre. En l'absence de chiffres, les utilisateurs doivent s'attendre à des performances comparables à celles d'autres modèles multimodaux de niveau flash sur des tâches standard de vision-langage telles que VQAv2, COCO Captions et OCR. Cependant, les scores exacts ne sont pas fournis. Nous recommandons d'évaluer le modèle sur votre propre ensemble de données représentatif pour déterminer si ses capacités répondent à vos besoins. OrcaRouter ne fournit pas de références internes au-delà de ce qui est publiquement disponible chez Google. Si vous avez besoin de mesures de précision précises, consultez la documentation officielle de Google pour la série Gemini 2.5 Flash, mais notez que cet identifiant de modèle spécifique peut avoir son propre réglage fin.
Les faits fournis n'incluent pas de mesures de latence pour ce modèle. Faisant partie de la famille Gemini 2.5 Flash, il est conçu pour une faible latence et un débit élevé. En règle générale, les modèles de niveau flash de Google échangent une certaine qualité de raisonnement contre la vitesse, ce qui les rend adaptés aux applications quasi en temps réel. La latence réelle dépend de facteurs tels que la taille et la résolution de l'image d'entrée, la longueur du texte d'invite, le nombre de jetons de sortie demandés et la charge actuelle de l'API. En général, les tâches simples de légende d'image peuvent être effectuées en quelques centaines de millisecondes à quelques secondes, tandis que les invites plus complexes nécessitant une sortie plus longue prendront plus de temps. Pour de meilleurs résultats, gardez une résolution d'image raisonnable et limitez la longueur de la sortie. L'API d'OrcaRouter n'ajoute aucun surcoût au-delà du temps de réponse du fournisseur.
Points forts : le modèle excelle dans les tâches où une réponse rapide et économique est nécessaire à partir d’une seule image. Il peut identifier rapidement des objets courants, lire du texte dans des images et répondre à des questions directes sur le contenu visuel. Le faible coût d’entrée le rend adapté au traitement de grands volumes d’images. Limites : il peut rencontrer des difficultés pour les tâches nécessitant une grande précision, comme le comptage de petits objets, la distinction de textures très similaires ou la compréhension de diagrammes complexes. La compréhension du modèle se limite à ce qui peut être déduit des données pixelliques et de l’invite textuelle ; il n’a pas accès à des connaissances externes au-delà de ses données d’entraînement (date de coupure inconnue). De plus, comme le coût de sortie est élevé, générer des réponses détaillées pour chaque image peut rapidement devenir coûteux. Pour les tâches nécessitant une analyse longue et détaillée, un modèle plus performant (et généralement plus coûteux) serait plus approprié. Les performances sur des cas limites comme les images sombres et floues ou les angles inhabituels peuvent être moindres.
La tarification est simple : 0,30 $ par million de jetons d'entrée et 30,00 $ par million de jetons de sortie. Les jetons d'entrée incluent les jetons provenant à la fois du texte de l'invite et de l'image (l'image est tokenisée par le modèle). Les jetons de sortie sont les jetons générés en tant que réponse. Il n'y a pas de frais d'installation, pas de minimum mensuel, et OrcaRouter n'ajoute aucune marge — vous payez exactement le tarif du fournisseur. Les jetons sont comptés par le système d'OrcaRouter. La facturation est généralement basée sur l'utilisation, les frais étant encourus au fur et à mesure que vous envoyez des requêtes. Vous pouvez surveiller l'utilisation via le tableau de bord d'OrcaRouter. Étant donné que les jetons d'entrée sont beaucoup moins chers que les jetons de sortie, le coût total d'une requête typique (sortie courte) est dominé par le côté entrée, surtout si vous incluez une grande image. Par exemple, une image de 1024x1024 peut consommer plusieurs milliers de jetons d'entrée.
Comparé aux modèles textuels uniquement (par ex., Gemini 1.5 Flash text-only à 0,075 $/M en entrée, 0,30 $/M en sortie), le coût d’entrée de ce modèle est 4 fois supérieur et le coût de sortie 100 fois supérieur, ce qui reflète la complexité ajoutée de la vision. Pour les tâches ne nécessitant pas d’analyse d’image, ces modèles purement textuels sont bien moins chers. Comparé à des modèles multimodaux plus grands comme Gemini 2.5 Pro (qui ont des coûts par jeton plus élevés mais un meilleur raisonnement), ce modèle est moins cher en entrée, mais similaire ou plus cher en sortie selon le niveau Pro spécifique. Le compromis du niveau flash est une précision moindre pour un coût d’entrée inférieur. Si votre application nécessite une haute précision et peut tolérer un coût d’entrée plus élevé, un modèle Pro peut être préférable. Si la longueur de sortie est importante, le coût de sortie de ce modèle devient prohibitif ; envisagez donc des modèles avec une tarification de sortie plus basse, comme Gemini 1.5 Flash (texte+vision) qui peut avoir des tarifs différents.
Les faits fournis ne mentionnent aucun mécanisme de mise en cache ni de remise sur volume pour ce modèle sur OrcaRouter. OrcaRouter transmet la tarification du fournisseur sans marge, donc toute remise devrait provenir des accords de facturation directs avec Google. À ce jour, aucune mise en cache automatique des embeddings d'images ou des prompts n'est mentionnée dans les informations publiées par OrcaRouter. Les utilisateurs doivent supposer que chaque requête est facturée en fonction des tokens d'entrée et de sortie utilisés. Pour les utilisateurs à volume élevé, il peut être intéressant de contacter OrcaRouter pour se renseigner sur d'éventuels accords d'entreprise, mais la tarification standard à l'utilisation est de 0,30 $/M en entrée et 30,00 $/M en sortie. Pour minimiser les coûts, réutilisez les sorties générées précédemment lorsque c'est possible, et limitez le nombre de tokens par requête (par exemple, en redimensionnant les images ou en utilisant des prompts concis).
Pour utiliser Google : Nano Banana (Gemini 2.5 Flash Image) via OrcaRouter, envoyez une requête POST à https://api.orcarouter.ai/v1/chat/completions avec le paramètre model défini sur "google/gemini-2.5-flash-image". L'API suit le format de complétion de chat d'OpenAI. Incluez votre clé API OrcaRouter dans l'en-tête Authorization sous la forme "Bearer YOUR_API_KEY". Dans le corps de la requête, fournissez un tableau messages avec un message utilisateur contenant à la fois une image et du texte. Pour les images, incluez une partie content de type "image_url" avec l'URL ou les données base64. Exemple : {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. La réponse sera une complétion de chat standard avec la réponse du modèle.
L'API OrcaRouter prend en charge de nombreux paramètres identiques à ceux de l'API OpenAI. Paramètres essentiels : model (obligatoire, défini sur "google/gemini-2.5-flash-image"), messages (obligatoire, tableau d'objets message), max_tokens (entier, nombre maximum de jetons à générer), temperature (flottant, par défaut 1.0, contrôle le caractère aléatoire), top_p (flottant, par défaut 1.0), presence_penalty et frequency_penalty (flottants), stop (chaîne ou tableau de chaînes, jusqu'à 4 séquences), et stream (booléen, pour les réponses en streaming). Pour l'entrée d'image, les messages doivent inclure au moins un message utilisateur avec un contenu qui est un tableau de parties, chaque partie ayant un champ type ("text" ou "image_url"). La partie image_url doit avoir un objet "image_url" avec une chaîne "url" (soit une URL accessible publiquement, soit une URL de données avec base64). Il n'y a pas de paramètres de réglage fin ou supplémentaires spécifiques au modèle exposés. La fenêtre de contexte est de 32,768 jetons, donc assurez-vous que prompt_token_count + image_token_count + max_tokens <= 32768.
Migrer vers OrcaRouter nécessite des modifications minimales du code si vous utilisez déjà une API compatible OpenAI. Modifiez simplement l'URL de base de votre précédent point de terminaison vers https://api.orcarouter.ai/v1. Mettez à jour votre clé API avec votre clé OrcaRouter. Lors de l'appel au modèle, définissez le paramètre model sur "google/gemini-2.5-flash-image" (ou le modèle de votre choix). Ajustez les identifiants de modèles existants en conséquence. Pour une entrée d'image, assurez-vous que le format de votre requête correspond à la convention OpenAI (par exemple, en utilisant un tableau content avec image_url). Aucune autre modification de code n'est généralement nécessaire. Si vous utilisiez un format d'API différent (par exemple, des points de terminaison cloud), vous devrez peut-être réécrire la structure de la requête. OrcaRouter fournit une documentation pour les SDK courants. Testez avec un petit nombre de requêtes pour vérifier les compteurs de tokens et la tarification. Notez qu'OrcaRouter facture les tarifs des fournisseurs sans majoration, donc la tarification peut différer de celle de votre fournisseur précédent.
Comparé au modèle Gemini 2.5 Flash uniquement texte (si disponible sur OrcaRouter), ce modèle ajoute la capacité de saisie d’images, mais à un coût d’entrée plus élevé. La version uniquement texte coûte généralement moins cher par jeton d’entrée et a un coût de sortie nettement inférieur, ce qui la rend préférable pour les tâches purement textuelles. Comparé aux modèles Gemini 2.5 Pro, ce modèle de niveau Flash est moins cher à l’entrée mais peut avoir une précision et une profondeur de raisonnement moindres. Les modèles Pro disposent d’une fenêtre de contexte plus grande (souvent 1 million de jetons) et de meilleures performances sur les tâches complexes en plusieurs étapes. Le coût de sortie des modèles Pro peut être similaire ou plus élevé. Pour les tâches nécessitant la compréhension d’images en plus du texte, ce modèle offre un point d’entrée économique. Cependant, si vous devez traiter des vidéos, de l’audio ou plusieurs images simultanément, vous devriez envisager un modèle prenant en charge ces modalités (par exemple, Gemini 2.5 Pro qui prend en charge la vidéo et l’audio dans certaines configurations).
Ce modèle est l’une des nombreuses options multimodales disponibles via OrcaRouter. GPT-4o (OpenAI) dispose généralement d’une fenêtre de contexte plus large (128k) et peut offrir une meilleure compréhension et un meilleur raisonnement global des images, mais à des coûts d’entrée et de sortie plus élevés. Les modèles de vision de Claude (par exemple, Claude 3.5 Sonnet) sont également compétitifs, mais diffèrent en matière de tarification et de longueur de contexte. Le principal avantage de Gemini 2.5 Flash Image réside dans son faible coût d’entrée, ce qui le rend attrayant pour les tâches à volume élevé et à sortie courte. Cependant, pour un raisonnement visuel complexe, l’imagerie médicale ou l’analyse détaillée de documents, des modèles plus avancés peuvent produire de meilleurs résultats. Le choix dépend du compromis spécifique entre le coût, la précision et la latence. OrcaRouter vous permet de basculer facilement entre les modèles en modifiant l’ID du modèle, il est donc possible de tester ce modèle aux côtés d’alternatives pour déterminer la meilleure solution.
Un modèle plus onéreux—comme Gemini 2.5 Pro, GPT-4o ou Claude 3.5 Sonnet—devient justifié lorsque la tâche exige une précision accrue, un contexte plus long ou un raisonnement nécessitant davantage d’étapes. Si votre application produit des résultats incorrects ou incomplets avec ce modèle, les économies réalisées sont perdues si vous devez effectuer un post-traitement ou une correction humaine. Pour des tâches comme l’analyse d’images médicales, l’interprétation de documents juridiques ou le traitement de contenu sensible lié à la conformité, la fiabilité d’un modèle premium peut justifier un coût plus élevé. De plus, si vous devez générer de longs résultats (par exemple, des descriptions de pages entières) ou traiter de très grandes images, les modèles dotés de fenêtres de contexte plus étendues et de coûts de jetons de sortie plus faibles pourraient s’avérer plus rentables dans l’ensemble. La nature flash-tier de ce modèle signifie qu’il est conçu pour la vitesse et le débit, non pour la profondeur. Utilisez-le là où une compréhension approximative suffit ; passez à un modèle supérieur lorsque la précision compte.
La confidentialité et le traitement des données dépendent des politiques de Google pour les modèles Gemini. Comme pour toute API cloud, les données d'entrée (images et texte) sont envoyées aux serveurs de Google pour traitement. Google peut utiliser les données pour l'amélioration du modèle, sauf si vous vous désengagez ou utilisez des comptes de niveau entreprise qui interdisent une telle utilisation. Les faits fournis ne précisent pas les détails du traitement des données pour ce modèle particulier. Lors de l'utilisation d'OrcaRouter comme passerelle, les données transitent par l'infrastructure d'OrcaRouter mais sont finalement traitées par Google. OrcaRouter ne stocke pas vos données et ne les utilise pas pour l'entraînement. Les utilisateurs devraient consulter les conditions de traitement des données de Google pour les API Gemini et envisager un chiffrement de bout en bout si nécessaire. Pour les données sensibles, certaines organisations préfèrent des modèles hébergés sur leur propre infrastructure (par exemple via Vertex AI avec résidence des données) plutôt qu'une passerelle tierce. Cependant, OrcaRouter fournit une clé API unifiée et une facturation unifiée, ce qui peut simplifier l'accès si les préoccupations concernant le traitement des données sont acceptables.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Entrée / 1M tokens | $0.300 |
| Sortie / 1M tokens | $30.00 |
| Devise | USD |
Estimation basée sur le tarif public
Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.
GET /api/public/models/google/gemini-2.5-flash-imageOuvrir @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image