Gemini 2.5 Flash Image, även känd som "Nano Banana", är nu allmänt tillgänglig. Det är en toppmodern bildgenereringsmodell med kontextuell förståelse. Den är kapabel till bildgenerering,...
Google: Nano Banana (Gemini 2.5 Flash Image) är en multimodal språkmodell utvecklad av Google, en del av Gemini 2.5 Flash-serien. Den accepterar både bild och text som indata och genererar text som…
Huvudfunktionerna kretsar kring att förstå och resonera kring visuellt innehåll som presenteras som bilder. Givet en bild och en textprompt kan modellen beskriva scenen, identifiera objekt, svara på frågor om innehållet, extrahera text (OCR) och utföra grundläggande visuella resonemang (t.ex. rumsliga relationer, färger, handlingar). Den kan också bearbeta text som åtföljer bilden, såsom instruktioner eller kontext. Eftersom den använder en flash-tier-arkitektur är den optimerad för låg latens och hög genomströmning, vilket gör den lämplig för realtids- eller högvolymapplikationer. Den kan dock inte matcha djupet i resonemang eller noggrannhet hos dyrare, större modeller som Gemini 2.5 Pro för komplexa visuella uppgifter som kräver detaljerad analys eller långa resonemangskedjor. Modellen är inte designad för uppgifter som bildgenerering, videoanalys eller flervarvssamtal som kräver lång kontext utöver 32K tokens.
Om din applikation inte kräver någon bildinmatning alls, skulle en textbaserad modell (t.ex. en mindre Gemini-variant eller en öppen källkodsmodell) vara mer kostnadseffektiv. På samma sätt, om din uppgift endast innefattar textbaserat resonemang utan visuell komponent, är bildbehandlingsomkostnaden onödig. För scenarier där utdatalängden är lång—som att generera detaljerade rapporter eller berättelser från en bild—kan de $30 per miljon utdatatokens bli dyra. I sådana fall, överväg modeller med lägre priser för utdata, eller använd denna modell för att generera en kort sammanfattning och utöka den med en billigare textbaserad modell. Dessutom, om du behöver bearbeta flera bilder per begäran eller hantera mycket stora bilder, kan modeller med större kontextfönster eller specifikt stöd för bildupplösning vara mer lämpliga.
Storskaliga distributioner drar nytta av denna modells låga inmatningskostnad ($0,30 per miljon tokens) och snabba inferens. Ideala användningsfall inkluderar automatisk bildtaggning för stora fotobibliotek, generering av alt-text för tusentals produktbilder, utförande av OCR på batcher av skannade dokument, och realtidsinnehållsmoderering av användaruppladdade bilder. Eftersom utmatningskostnaden är hög, bör svaret hållas kort – ofta ett enda ord, en etikett eller en mening. Till exempel att klassificera en bild i fördefinierade kategorier, extrahera några få nyckelfält från ett formulär, eller besvara en ja/nej-fråga om en bild. Batchbearbetning kan göras via OrcaRouters API med samtidiga förfrågningar. Modellens latens är generellt låg, men den faktiska genomströmningen beror på bildens storlek och komplexitet. Det finns ingen separat hastighetsbegränsning i OrcaRouter annat än den övergripande API-användningen.
Den främsta begränsningen är den höga tokenkostnaden för utdata jämfört med indata, vilket gör generering av lång text dyr. Kontextfönstret på 32 768 tokens begränsar hur mycket text och hur stor bild (i token-termer) som kan bearbetas i en enskild begäran. Modellen är inte designad för uppgifter som kräver djup multimodalt resonemang, invecklade visuella detaljer eller hantering av flera bilder samtidigt (varje ytterligare bild förbrukar kontext). Dessutom, som en flash-tier-modell, kan den uppvisa lägre noggrannhet på specialiserade visuella uppgifter såsom medicinsk bildanalys, finkornig objektdetektion eller igenkänning av sällsynta objekt jämfört med mer kapabla men långsammare eller dyrare modeller. Modellens träningsdata och specifika prestanda på riktmärken avslöjas inte i de angivna fakta; användare bör utvärdera på sina egna dataset. Slutligen stöder den endast bild- och textinmatning, inte video eller ljud.
De angivna fakta innehåller inga specifika riktmärkesresultat för Google: Nano Banana (Gemini 2.5 Flash Image). Den är en del av Googles Gemini 2.5 Flash-serie, som generellt är inriktad på effektivitet snarare än topprestanda i noggrannhet. I avsaknad av siffror bör användare förvänta sig prestanda jämförbar med andra flash-nivå multimodala modeller på vanliga vision-språk-uppgifter som VQAv2, COCO Captions och OCR. Exakta poäng anges dock inte. Vi rekommenderar att du utvärderar modellen på ditt eget representativa dataset för att avgöra om dess förmågor uppfyller dina krav. OrcaRouter tillhandahåller inte interna riktmärken utöver vad som är allmänt tillgängligt från Google. Om du behöver exakta noggrannhetsmått, konsultera Googles officiella dokumentation för Gemini 2.5 Flash-serien, men notera att denna specifika modellidentifierare kan ha egen finjustering.
De angivna fakta inkluderar inte latensmätningar för denna modell. Som en del av Gemini 2.5 Flash-familjen är den utformad för låg latens och hög genomströmning. Typiskt sett byter flash-tier-modeller från Google ut en del resoneringskvalitet mot hastighet, vilket gör dem lämpliga för nästan realtidsapplikationer. Den faktiska latensen beror på faktorer som storlek och upplösning på inmatningsbilden, längden på textprompten, antalet begärda utdatatecken och den aktuella belastningen på API:et. Generellt sett kan enkla bildtextningsuppgifter slutföras på några hundra millisekunder till ett par sekunder, medan mer komplexa prompter som kräver längre utdata tar längre tid. För bästa resultat, håll bildupplösningen rimlig och begränsa utdatalängden. OrcaRouters API har ingen extra overhead utöver leverantörens svarstid.
Styrkor: Modellen utmärker sig vid uppgifter där ett snabbt, kostnadseffektivt svar behövs från en enda bild. Den kan snabbt identifiera vanliga objekt, läsa text från bilder och besvara direkta frågor om visuellt innehåll. Den låga ingångskostnaden gör den lämplig för att bearbeta stora volymer bilder. Begränsningar: Den kan ha svårigheter med uppgifter som kräver hög precision, såsom att räkna små objekt, särskilja mycket liknande texturer eller förstå komplexa diagram. Modellens förståelse är begränsad till vad som kan utläsas från pixeldata och textprompten; den har inte tillgång till extern kunskap utöver dess träningsdata (gräns okänd). Dessutom, eftersom utskriftskostnaden är hög, kan generering av utförliga svar för varje bild snabbt bli dyrt. För uppgifter som kräver långa, detaljerade analyser skulle en mer kapabel (och vanligtvis dyrare) modell vara mer lämplig. Prestanda på gränsfall som mörka suddiga bilder eller ovanliga vinklar kan vara lägre.
Prissättningen är enkel: $0,30 per 1 miljon inmatningstokens och $30,00 per 1 miljon utmatningstokens. Inmatningstokens inkluderar tokens från både textprompten och bilden (bilden tokeniseras av modellen). Utmatningstokens är de tokens som genereras som svar. Det finns ingen installationsavgift, inget månatligt minimum, och OrcaRouter lägger på noll påslag – du betalar exakt leverantörens pris. Tokens räknas av OrcaRouters system. Fakturering är vanligtvis användningsbaserad, med avgifter som uppstår när du skickar förfrågningar. Du kan övervaka användningen via OrcaRouters instrumentpanel. Eftersom inmatningstokens är mycket billigare än utmatningstokens, domineras den totala kostnaden för en typisk förfrågan (kort utdata) av inmatningssidan, särskilt om du inkluderar en stor bild. Till exempel kan en 1024x1024-bild förbruka flera tusen inmatningstokens.
Jämfört med textbaserade modeller (t.ex. Gemini 1.5 Flash text-only till $0.075/M input, $0.30/M output) är den här modellens ingångskostnad 4x högre och utgångskostnaden 100x högre, vilket återspeglar den extra komplexiteten för bildanalys. För uppgifter som inte kräver bildanalys är de textbaserade modellerna mycket billigare. Jämfört med större multimodala modeller som Gemini 2.5 Pro (som har högre kostnad per token men bättre resonemangsförmåga) är den här modellen billigare i ingång men liknande eller högre i utgång beroende på den specifika Pro-nivån. Flash-nivåns avvägning är lägre noggrannhet för lägre ingångskostnad. Om din applikation kräver hög noggrannhet och kan tolerera högre ingångskostnad kan en Pro-modell vara bättre. Om utdatalängden är stor blir den här modellens utgångskostnad oöverkomlig, så överväg modeller med lägre utdatapris, som Gemini 1.5 Flash (text+vision) som kan ha olika priser.
De angivna fakta nämner inga cachningsmekanismer eller volymrabatter för denna modell på OrcaRouter. OrcaRouter vidarebefordrar leverantörens prissättning utan påslag, så eventuella rabatter måste komma från Googles direkta faktureringsarrangemang. För närvarande finns det ingen automatisk cachning av bildinbäddningar eller uppmaningar i OrcaRouters publicerade information. Användare bör anta att varje begäran faktureras baserat på de in- och utdatatokens som används. För användare med hög volym kan det vara värt att kontakta OrcaRouter för att fråga om potentiella företagsavtal, men standardprissättningen för betala per användning är $0.30/M för indata och $30.00/M för utdata. För att minimera kostnaderna, återanvänd tidigare genererade utdata där det är möjligt, och begränsa antalet tokens i varje begäran (t.ex. genom att ändra storlek på bilder eller använda korta uppmaningar).
För att använda Google: Nano Banana (Gemini 2.5 Flash Image) via OrcaRouter, skicka en POST-förfrågan till https://api.orcarouter.ai/v1/chat/completions med model-parametern satt till "google/gemini-2.5-flash-image". API:et följer OpenAI chat completions-formatet. Inkludera din OrcaRouter-API-nyckel i Authorization-headern som "Bearer YOUR_API_KEY". I förfrågans brödtext anger du en messages-array med ett användarmeddelande som innehåller både bild och text. För bilder inkluderar du en content-del av typen "image_url" med URL:en eller base64-data. Exempel: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"Vad finns i den här bilden?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. Svaret blir en standard chat completion med modellens svar.
OrcaRouter API stöder många av samma parametrar som OpenAI API. Nödvändiga parametrar: model (krävs, inställd på "google/gemini-2.5-flash-image"), messages (krävs, array av meddelandeobjekt), max_tokens (heltal, maximalt antal tokens att generera), temperature (flyttal, standard 1.0, styr slumpmässighet), top_p (flyttal, standard 1.0), presence_penalty och frequency_penalty (flyttal), stop (sträng eller array av strängar, upp till 4 sekvenser) och stream (boolesk, för strömmande svar). För bildinmatning måste meddelandena innehålla minst ett användarmeddelande med innehåll som är en array av delar, varje del med ett typfält ("text" eller "image_url"). Image_url-delen måste ha ett "image_url"-objekt med en "url"-sträng (antingen en offentligt tillgänglig URL eller en data-URL med base64). Det finns ingen finjustering eller ytterligare modellspecifika parametrar exponerade. Kontextfönstret är 32 768 tokens, så se till att prompt_token_count + image_token_count + max_tokens <= 32768.
Migrering till OrcaRouter kräver minimala kodändringar om du redan använder ett OpenAI-kompatibelt API. Ändra helt enkelt bas-URL:en från din tidigare slutpunkt till https://api.orcarouter.ai/v1. Uppdatera din API-nyckel till din OrcaRouter-nyckel. När du anropar modellen, ställ in model-parametern till "google/gemini-2.5-flash-image" (eller din önskade modell). Justera eventuella befintliga modell-ID:n därefter. För bildinmatning, se till att ditt begärandeformat överensstämmer med OpenAI-konventionen (t.ex. att använda en content-array med image_url). Inga andra kodändringar krävs vanligtvis. Om du använde ett annat API-format (t.ex. molnslutpunkter) kan du behöva skriva om begärandestrukturen. OrcaRouter tillhandahåller dokumentation för vanliga SDK:er. Testa med ett litet antal förfrågningar för att verifiera tokenräkningar och prissättning. Observera att OrcaRouter fakturerar leverantörspriser utan påslag, så prissättningen kan skilja sig från din tidigare leverantör.
Jämfört med den textbaserade Gemini 2.5 Flash (om tillgänglig på OrcaRouter) lägger denna modell till möjligheten att hantera bildinmatning, men till en högre inmatningskostnad. Den textbaserade versionen kostar vanligtvis mindre per inmatningstoken och har betydligt lägre utmatningskostnad, vilket gör den att föredra för rent textbaserade uppgifter. Jämfört med Gemini 2.5 Pro-modeller är denna flash-nivåmodell billigare för inmatning men kan ha lägre noggrannhet och resonemangsdjup. Pro-modeller har ett större kontextfönster (ofta 1 miljon token) och bättre prestanda på komplexa flerstegsuppgifter. Utmatningskostnaden för Pro-modeller kan vara liknande eller högre. För uppgifter som kräver förståelse av bilder tillsammans med text erbjuder denna modell en kostnadseffektiv ingångspunkt. Men om du behöver bearbeta video, ljud eller flera bilder samtidigt bör du överväga en modell som stöder dessa modaliteter (t.ex. Gemini 2.5 Pro som stöder video och ljud i vissa konfigurationer).
Den här modellen är ett av många multimodala alternativ som finns tillgängliga via OrcaRouter. GPT-4o (OpenAI) har vanligtvis ett större kontextfönster (128k) och kan erbjuda bättre övergripande bildförståelse och resonemang, men till högre kostnader för in- och utdata. Claude's visionsmodeller (t.ex. Claude 3.5 Sonnet) är också konkurrenskraftiga men skiljer sig åt i prissättning och kontextlängd. Gemini 2.5 Flash Image:s främsta fördel är dess låga ingångskostnad, vilket gör den attraktiv för högvolymsuppgifter med kort utdata. För komplexa visuella resonemang, sjukvårdsbilder eller detaljerad dokumentanalys kan dock mer avancerade modeller ge bättre resultat. Valet beror på den specifika avvägningen mellan kostnad, noggrannhet och latens. OrcaRouter låter dig enkelt växla mellan modeller genom att ändra modell-ID, så det är möjligt att testa denna modell tillsammans med alternativ för att avgöra vilken som passar bäst.
En dyrare modell – såsom Gemini 2.5 Pro, GPT-4o eller Claude 3.5 Sonnet – blir motiverad när uppgiften kräver högre noggrannhet, längre kontext eller resonemang som kräver fler steg. Om din applikation producerar felaktiga eller ofullständiga resultat med denna modell, är kostnadsbesparingarna bortkastade om du behöver efterbearbetning eller mänsklig korrigering. För uppgifter som att analysera medicinska bilder, tolka juridiska dokument eller hantera känsligt efterlevnadsmaterial kan tillförlitligheten hos en premiummodell motivera den högre kostnaden. Dessutom, om du behöver generera långa utdata (t.ex. helsidesbeskrivningar) eller bearbeta mycket stora bilder, kan modeller med större kontextfönster och lägre utdatakostnader per token vara mer kostnadseffektiva totalt sett. Flash-nivåns karaktär hos denna modell innebär att den är designad för hastighet och genomströmning, inte för djup. Använd den där ungefärlig förståelse är tillräcklig; uppgradera när precision spelar roll.
Datasekretess och hantering beror på Googles policyer för Gemini-modeller. Som med alla moln-API:er skickas indata (bilder och text) till Googles servrar för bearbetning. Google kan använda data för modellförbättring om du inte väljer bort det eller använder företagskonton som förbjuder sådan användning. De angivna fakta specificerar inte detaljer om datahantering för just denna modell. När OrcaRouter används som gateway passerar data genom OrcaRouters infrastruktur men bearbetas slutligen av Google. OrcaRouter lagrar inte din data eller använder den för träning. Användare bör granska Googles villkor för databehandling för Gemini-API:er och överväga end-to-end-kryptering om det behövs. För känslig data föredrar vissa organisationer modeller som är värd på egen infrastruktur (t.ex. via Vertex AI med datalokalitet) snarare än en tredjepartsgateway. OrcaRouter tillhandahåller dock en enhetlig API-nyckel och fakturering, vilket kan förenkla åtkomst om datahanteringsfrågor är acceptabla.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Inmatning / 1M token | $0.300 |
| Utdata / 1M tokens | $30.00 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/google/gemini-2.5-flash-imageÖppna @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image