Gemini 2.5 Flash Image, ook wel bekend als "Nano Banana", is nu algemeen beschikbaar. Het is een state-of-the-art beeldgeneratiemodel met contextueel begrip. Het is in staat tot beeldgeneratie,...
Google: Nano Banana (Gemini 2.5 Flash Image) is een multimodaal taalmodel ontwikkeld door Google, onderdeel van de Gemini 2.5 Flash-serie. Het accepteert zowel afbeeldingen als tekst als invoer en…
De kernmogelijkheden richten zich op het begrijpen en redeneren over visuele inhoud die als afbeeldingen wordt gepresenteerd. Gegeven een afbeelding en een tekstprompt kan het model de scène beschrijven, objecten identificeren, vragen over de inhoud beantwoorden, tekst extraheren (OCR) en basisvisueel redeneren uitvoeren (bijv. ruimtelijke relaties, kleuren, acties). Het kan ook tekst verwerken die bij de afbeelding hoort, zoals instructies of context. Door het gebruik van een flash-tier architectuur is het geoptimaliseerd voor lage latentie en hoge doorvoer, waardoor het geschikt is voor realtime- of grootschalige toepassingen. Het evenaart echter mogelijk niet de diepgang van redeneren of nauwkeurigheid van duurdere, grotere modellen zoals Gemini 2.5 Pro bij complexe visuele taken die fijnmazige analyse of lange redeneerketens vereisen. Het model is niet ontworpen voor taken zoals beeldgeneratie, videoanalyse of meerderde-gesprekken die een lange context van meer dan 32K tokens vereisen.
Als uw applicatie helemaal geen beeldinvoer nodig heeft, is het gebruik van een tekst-only model (bijv. een kleinere Gemini-variant of een open-source model) kosteneffectiever. Evenzo, als uw taak alleen op tekst gebaseerde redenering omvat zonder visuele component, is de overhead van beeldverwerking onnodig. Voor scenario's waarin de uitvoerlengte lang is—zoals het genereren van gedetailleerde rapporten of verhalen op basis van een afbeelding—kan de $30 per miljoen uitvoertokens duur worden. Overweeg in dergelijke gevallen modellen met lagere uitvoerprijzen, of gebruik dit model om een korte samenvatting te genereren en deze vervolgens uit te breiden met een goedkoper tekst-only model. Bovendien, als u meerdere afbeeldingen per verzoek moet verwerken of zeer grote afbeeldingen moet hanteren, kunnen modellen met grotere contextvensters of specifieke ondersteuning voor beeldresolutie geschikter zijn.
Implementaties met hoge volumes profiteren van de lage invoerkosten van dit model ($0.30 per miljoen tokens) en snelle inferentie. Ideale gebruikssituaties zijn onder meer het automatisch taggen van afbeeldingen voor grote fotobibliotheken, het genereren van alt-tekst voor duizenden productafbeeldingen, het uitvoeren van OCR op batches van gescande documenten en realtime contentmoderatie van door gebruikers geüploade afbeeldingen. Omdat de uitvoerkosten hoog zijn, moet de respons kort worden gehouden—vaak een enkel woord, label of zin. Bijvoorbeeld het classificeren van een afbeelding in vooraf gedefinieerde categorieën, het extraheren van een paar sleutelvelden uit een formulier, of het beantwoorden van een ja/nee-vraag over een afbeelding. Batchverwerking kan worden gedaan via de API van OrcaRouter met gelijktijdige verzoeken. De latentie van het model is over het algemeen laag, maar de daadwerkelijke doorvoer hangt af van de grootte en complexiteit van de afbeelding. Er is geen aparte snelheidslimiet in OrcaRouter anders dan het totale API-gebruik.
De belangrijkste beperking is de hoge uitvoertokenkosten in verhouding tot de invoerkosten, waardoor het genereren van lange tekst duur wordt. Het contextvenster van 32.768 tokens beperkt hoeveel tekst en hoe groot een afbeelding (in tokentermen) in één enkele aanvraag kan worden verwerkt. Het model is niet ontworpen voor taken die diepgaand multimodaal redeneren, ingewikkelde visuele details of het tegelijkertijd verwerken van meerdere afbeeldingen vereisen (elke extra afbeelding verbruikt context). Bovendien kan het model, als flash-tier model, lagere nauwkeurigheid vertonen bij gespecialiseerde visuele taken zoals medische beeldanalyse, fijnmazige objectdetectie of herkenning van zeldzame objecten in vergelijking met krachtigere maar langzamere of duurdere modellen. De trainingsgegevens van het model en specifieke prestaties op benchmarks worden niet bekendgemaakt in de verstrekte feiten; gebruikers moeten evalueren op hun eigen datasets. Ten slotte ondersteunt het alleen invoer van afbeeldingen en tekst, niet van video of audio.
De verstrekte feiten bevatten geen specifieke benchmarkresultaten voor Google: Nano Banana (Gemini 2.5 Flash Image). Het maakt deel uit van Google's Gemini 2.5 Flash-serie, die over het algemeen gericht is op efficiëntie in plaats van topnauwkeurigheid. Bij gebrek aan cijfers kunnen gebruikers verwachten dat de prestaties vergelijkbaar zijn met andere flash-tier multimodale modellen op standaard visie-taal taken zoals VQAv2, COCO Captions en OCR. Exacte scores worden echter niet gegeven. We raden aan om het model te evalueren op uw eigen representatieve dataset om te bepalen of de mogelijkheden aan uw vereisten voldoen. OrcaRouter biedt geen interne benchmarks buiten wat openbaar beschikbaar is van Google. Als u exacte nauwkeurigheidsstatistieken nodig heeft, raadpleeg dan de officiële documentatie van Google voor de Gemini 2.5 Flash-serie, maar houd er rekening mee dat deze specifieke modelidentificatie mogelijk een eigen fine-tuning heeft.
De verstrekte feiten bevatten geen latentiemetingen voor dit model. Als onderdeel van de Gemini 2.5 Flash-familie is het ontworpen voor lage latentie en hoge doorvoer. Normaal gesproken ruilen flash-tier-modellen van Google enige redeneerkwaliteit in voor snelheid, waardoor ze geschikt zijn voor bijna real-time toepassingen. De werkelijke latentie hangt af van factoren zoals de grootte en resolutie van de invoerafbeelding, de lengte van de tekstprompt, het aantal opgevraagde uitvoertokens en de huidige belasting van de API. Over het algemeen kunnen eenvoudige beeldbeschrijvingstaken in enkele honderden milliseconden tot een paar seconden worden voltooid, terwijl complexere prompts die langere uitvoer vereisen langer duren. Voor de beste resultaten houdt u de afbeeldingsresolutie redelijk en beperkt u de uitvoerlengte. De API van OrcaRouter heeft geen extra overhead bovenop de responstijd van de provider.
Sterke punten: Het model blinkt uit in taken waarbij een snel, kosteneffectief antwoord nodig is op basis van een enkele afbeelding. Het kan snel algemene objecten identificeren, tekst uit afbeeldingen lezen en directe vragen over visuele inhoud beantwoorden. De lage invoerkosten maken het haalbaar om grote hoeveelheden afbeeldingen te verwerken. Beperkingen: Het kan moeite hebben met taken die hoge precisie vereisen, zoals het tellen van kleine objecten, het onderscheiden van zeer vergelijkbare texturen of het begrijpen van complexe diagrammen. Het begrip van het model is beperkt tot wat kan worden afgeleid uit de pixelgegevens en de tekstuele prompt; het heeft geen toegang tot externe kennis buiten zijn trainingsdata (afkapdatum onbekend). Bovendien kan het genereren van uitgebreide antwoorden voor elke afbeelding snel duur worden doordat de uitvoerkosten hoog zijn. Voor taken die een lange, gedetailleerde analyse vereisen, is een capabeler (en doorgaans duurder) model geschikter. Prestaties op randgevallen zoals donkere, wazige afbeeldingen of ongebruikelijke hoeken kunnen lager zijn.
Prijzen zijn eenvoudig: $0,30 per 1 miljoen inputtokens en $30,00 per 1 miljoen outputtokens. Inputtokens omvatten de tokens van zowel de tekstprompt als de afbeelding (de afbeelding wordt getokeniseerd door het model). Outputtokens zijn de tokens die als antwoord worden gegenereerd. Er zijn geen opstartkosten, geen maandelijks minimum en OrcaRouter voegt geen opslag toe—u betaalt exact het tarief van de provider. Tokens worden geteld door het systeem van OrcaRouter. Facturatie is doorgaans op basis van gebruik, waarbij kosten worden gemaakt wanneer u verzoeken verstuurt. U kunt het gebruik monitoren via het OrcaRouter-dashboard. Omdat inputtokens veel goedkoper zijn dan outputtokens, wordt de totale kostprijs van een typisch verzoek (korte output) gedomineerd door de inputzijde, vooral als u een grote afbeelding toevoegt. Een afbeelding van 1024x1024 kan bijvoorbeeld enkele duizenden inputtokens verbruiken.
Vergeleken met tekst-only modellen (bijv. Gemini 1.5 Flash tekst-only tegen $0.075/M input, $0.30/M output), zijn de invoerkosten van dit model 4x hoger en de uitvoerkosten 100x hoger, wat de toegevoegde complexiteit van vision weerspiegelt. Voor taken die geen beeldanalyse vereisen, zijn die tekst-only modellen veel goedkoper. Vergeleken met grotere multimodale modellen zoals Gemini 2.5 Pro (die hogere kosten per token maar betere redenering heeft), is dit model goedkoper qua input maar vergelijkbaar of duurder qua output, afhankelijk van de specifieke Pro-tier. De afweging van de flash-tier is lagere nauwkeurigheid voor lagere invoerkosten. Als uw toepassing hoge nauwkeurigheid vereist en hogere invoerkosten kan tolereren, is een Pro-model mogelijk beter. Als de outputlengte groot is, worden de uitvoerkosten van dit model prohibitief, overweeg dan modellen met lagere uitvoerprijzen, zoals Gemini 1.5 Flash (text+vision) die mogelijk andere tarieven hebben.
De verstrekte feiten vermelden geen caching-mechanismen of volumekortingen voor dit model op OrcaRouter. OrcaRouter geeft de prijzen van de provider door zonder opslag, dus eventuele kortingen zouden moeten komen van de directe facturatieovereenkomsten van Google. Voor zover nu bekend is er geen automatische caching van afbeeldingsembeddings of prompts in de gepubliceerde informatie van OrcaRouter. Gebruikers moeten ervan uitgaan dat elk verzoek wordt gefactureerd op basis van de gebruikte invoer- en uitvoertokens. Voor gebruikers met een hoog volume kan het de moeite waard zijn om contact op te nemen met OrcaRouter om te informeren naar mogelijke enterprise-overeenkomsten, maar de standaard betalen-per-gebruik-prijs is $0.30/M invoer en $30.00/M uitvoer. Om de kosten te minimaliseren, kunt u eerder gegenereerde uitvoer waar mogelijk hergebruiken en het aantal tokens in elk verzoek beperken (bijv. door afbeeldingen te verkleinen of korte prompts te gebruiken).
Om Google: Nano Banana (Gemini 2.5 Flash Image) via OrcaRouter te gebruiken, stuur een POST-verzoek naar https://api.orcarouter.ai/v1/chat/completions met de modelparameter ingesteld op "google/gemini-2.5-flash-image". De API volgt het OpenAI chat completions-formaat. Voeg uw OrcaRouter API-sleutel toe in de Authorization-header als "Bearer YOUR_API_KEY". In de verzoekbody geeft u een messages-array met een gebruikersbericht dat zowel afbeelding als tekst bevat. Voor afbeeldingen voegt u een content-onderdeel van het type "image_url" toe met de URL of base64-gegevens. Voorbeeld: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"What is in this image?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Het antwoord is een standaard chat completion met het antwoord van het model.
De OrcaRouter-API ondersteunt veel van dezelfde parameters als de OpenAI-API. Essentiële parameters: model (vereist, ingesteld op "google/gemini-2.5-flash-image"), messages (vereist, array van berichtobjecten), max_tokens (geheel getal, maximum aantal tokens om te genereren), temperature (float, standaard 1.0, regelt willekeur), top_p (float, standaard 1.0), presence_penalty en frequency_penalty (floats), stop (string of array van strings, maximaal 4 reeksen), en stream (boolean, voor streaming reacties). Voor afbeeldingsinvoer moeten de berichten ten minste één gebruikersbericht bevatten met inhoud die een array van delen is, elk deel met een type-veld ("text" of "image_url"). Het image_url-onderdeel moet een "image_url"-object hebben met een "url"-string (ofwel een openbaar toegankelijke URL of een data-URL met base64). Er zijn geen fine-tuning of extra model-specifieke parameters beschikbaar. Het contextvenster is 32.768 tokens, dus zorg ervoor dat prompt_token_count + image_token_count + max_tokens <= 32768.
Migreren naar OrcaRouter vereist minimale codewijzigingen als u al een OpenAI-compatibele API gebruikt. Wijzig eenvoudigweg de basis-URL van uw vorige endpoint naar https://api.orcarouter.ai/v1. Werk uw API-sleutel bij naar uw OrcaRouter-sleutel. Stel bij het aanroepen van het model de modelparameter in op "google/gemini-2.5-flash-image" (of uw gewenste model). Pas eventueel bestaande model-ID's dienovereenkomstig aan. Voor afbeeldingsinvoer moet uw verzoekindeling overeenkomen met de OpenAI-conventie (bijv. gebruik van een inhoudsarray met image_url). Normaal gesproken zijn geen andere codewijzigingen nodig. Als u een andere API-indeling gebruikte (bijv. cloud-eindpunten), moet u mogelijk de verzoekstructuur herschrijven. OrcaRouter biedt documentatie voor veelgebruikte SDK's. Test met een klein aantal verzoeken om tokencounts en prijzen te verifiëren. Houd er rekening mee dat OrcaRouter provider-tarieven zonder opslag factureert, dus de prijs kan afwijken van uw vorige provider.
Vergeleken met de tekst-only Gemini 2.5 Flash (indien beschikbaar op OrcaRouter), voegt dit model beeldinvoermogelijkheden toe maar tegen hogere invoerkosten. De tekst-only versie kost doorgaans minder per invoertoken en heeft aanzienlijk lagere uitvoerkosten, waardoor het de voorkeur geniet voor puur tekstuele taken. Vergeleken met Gemini 2.5 Pro modellen, is dit flash-tier model goedkoper qua invoer, maar kan het een lagere nauwkeurigheid en redeneerdiepte hebben. Pro modellen hebben een groter contextvenster (vaak 1 miljoen tokens) en betere prestaties bij complexe meerstapstaken. Uitvoerkosten voor Pro modellen kunnen vergelijkbaar of hoger zijn. Voor taken die begrip van afbeeldingen naast tekst vereisen, biedt dit model een kosteneffectief instappunt. Echter, als u video, audio of meerdere afbeeldingen tegelijkertijd moet verwerken, overweeg dan een model dat deze modaliteiten ondersteunt (bijv. Gemini 2.5 Pro dat in sommige configuraties video en audio ondersteunt).
Dit model is een van de vele multimodale opties die beschikbaar zijn via OrcaRouter. GPT-4o (OpenAI) heeft doorgaans een groter contextvenster (128k) en biedt mogelijk een betere algehele beeldinterpretatie en redenering, maar tegen hogere input- en outputkosten. De vision-modellen van Claude (bijv. Claude 3.5 Sonnet) zijn ook concurrerend, maar verschillen in prijs en contextlengte. Het belangrijkste voordeel van de Gemini 2.5 Flash Image is de lage inputkosten, waardoor het aantrekkelijk is voor taken met een hoog volume en korte uitvoer. Voor complexe visuele redenering, medische beeldvorming of gedetailleerde documentanalyse kunnen echter geavanceerdere modellen betere resultaten opleveren. De keuze hangt af van de specifieke afweging tussen kosten, nauwkeurigheid en latentie. OrcaRouter stelt u in staat eenvoudig te schakelen tussen modellen door de model-ID te wijzigen, dus het is haalbaar om dit model naast alternatieven te testen om de beste keuze te bepalen.
Een duurder model—zoals Gemini 2.5 Pro, GPT-4o of Claude 3.5 Sonnet—wordt gerechtvaardigd wanneer de taak een hogere nauwkeurigheid, langere context of redenering vereist die meer stappen nodig heeft. Als uw toepassing met dit model onjuiste of onvolledige resultaten oplevert, zijn de kostenbesparingen verspild als u nabewerking of correctie door mensen nodig hebt. Voor taken zoals het analyseren van medische beelden, het interpreteren van juridische documenten of het verwerken van gevoelige compliance-inhoud, kan de betrouwbaarheid van een premium model de hogere kosten rechtvaardigen. Ook, als u lange uitvoer moet genereren (bijv. paginalange beschrijvingen) of zeer grote afbeeldingen moet verwerken, kunnen modellen met grotere contextvensters en lagere tokenkosten voor uitvoer over het algemeen kosteneffectiever zijn. De flash-tier aard van dit model betekent dat het is ontworpen voor snelheid en doorvoer, niet voor diepgang. Gebruik het waar benaderend begrip voldoende is; upgrade wanneer precisie van belang is.
Gegevensprivacy en -verwerking zijn afhankelijk van het beleid van Google voor Gemini-modellen. Net als bij elke cloud-API worden invoergegevens (afbeeldingen en tekst) naar de servers van Google verzonden voor verwerking. Google kan de gegevens gebruiken voor modelverbetering, tenzij u ervoor kiest dit uit te schakelen of gebruikmaakt van zakelijke accounts die dergelijk gebruik verbieden. De verstrekte feiten specificeren geen details over gegevensverwerking voor dit specifieke model. Wanneer OrcaRouter als gateway wordt gebruikt, passeren de gegevens de infrastructuur van OrcaRouter, maar worden uiteindelijk door Google verwerkt. OrcaRouter slaat uw gegevens niet op en gebruikt ze niet voor training. Gebruikers dienen de voorwaarden van Google voor gegevensverwerking voor Gemini-API's te bekijken en indien nodig end-to-end-encryptie te overwegen. Voor gevoelige gegevens geven sommige organisaties de voorkeur aan modellen die op hun eigen infrastructuur worden gehost (bijv. via Vertex AI met data residency) in plaats van een externe gateway. OrcaRouter biedt echter een uniforme API-sleutel en facturering, wat de toegang kan vereenvoudigen als de zorgen over gegevensverwerking acceptabel zijn.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Invoer / 1M tokens | $0.300 |
| Uitvoer / 1M tokens | $30.00 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
GET /api/public/models/google/gemini-2.5-flash-imageOpenen @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image