Gemini 3.1 Flash Image Preview, även känd som "Nano Banana 2", är Googles senaste toppmoderna bildgenererings- och redigeringsmodell som levererar Pro-nivå visuell kvalitet i Flash-hastighet. Den kombinerar...
Google: Nano Banana 2 är en multimodal modell som bearbetar både bild- och textinmatning. Den är baserad på Gemini 3.1 Flash-arkitekturen, som betonar snabb inferens. Modellen accepterar…
Gemini 3.1 Flash Image Preview-modellen kan utföra en rad multimodala uppgifter inklusive bildtextning, visuell frågebesvarande, dokumentförståelse (t.ex. extrahera information från fakturor eller formulär) och innehållsmoderering som kombinerar bild- och textanalys. Den kan även resonera över diagram och grafer, såsom att tolka diagram eller flödesscheman. Eftersom det är en flashmodell är den optimerad för hastighet, vilket gör den lämplig för applikationer som kräver snabb bearbetning. Den kanske dock inte matchar djupet hos större, långsammare modeller när det gäller komplexa resonemangsuppgifter. Användare bör utvärdera modellen på sina specifika användningsfall för att bekräfta dess prestanda.
Kontextfönstret är 65,536 token. Det innebär att modellen kan bearbeta upp till så många token i en enda prompt, inklusive både texten och de kodade bilddata. För enbart text-promptar möjliggör detta hantering av dokument på omkring 50,000 ord. För multimodala indata förbrukar bildtoken en del av fönstret, så den användbara textkapaciteten minskas. Den exakta tokenkostnaden per bild anges inte, men användare bör räkna med att bilder tar upp ett betydande antal token. Denna kontextstorlek möjliggör bearbetning av måttligt långa dokument med bilder, men extremt stora dokument eller många bilder kan överskrida gränsen. I sådana fall kan uppdelning eller sammanfattning vara nödvändig.
Om din uppgift inte kräver bildförståelse kan en textbaserad modell (t.ex. Gemini 1.5 Flash eller liknande) vara billigare och snabbare. Dessutom, om din applikation är extremt känslig för latens och bildbehandlingskostnaden är onödig, kan en lättviktig textmodell vara att föredra. För uppgifter som involverar komplex, flerbildsresonemang eller mycket hög detaljrikedom kan en större, icke-flash vision-modell erbjuda bättre noggrannhet på bekostnad av hastighet. Flash-varianten är utformad för att vara en mellanväg. Användare bör utvärdera sina egna arbetsbelastningar för att avgöra om avvägningen mellan hastighet och kvalitet motiverar kostnaden. OrcaRouter erbjuder en rad modeller; att konsultera katalogen kan hjälpa till att identifiera alternativ.
Arkitekturen i Gemini 3.1 Flash är optimerad för inferens med låg latens. Detta gör modellen väl lämpad för realtidsapplikationer som livechattassistenter, interaktiva frågor-och-svar-system eller automatiserade modereringsverktyg som måste svara inom sekunder. Hastighetsfördelen kommer från arkitektoniska val som minskar beräkningskostnaden, såsom färre parametrar eller optimerade uppmärksamhetsmekanismer. Även om inga specifika latenssiffror anges, producerar flashmodeller generellt tokens snabbare än sina standardmotsvarigheter. Detta kan minska den upplevda väntetiden för slutanvändare. Den exakta hastigheten beror dock på faktorer som indatastorlek, bildkomplexitet och serverbelastning på OrcaRouter. Utvecklare bör testa med representativa indata.
Inga officiella riktmärkespoäng tillhandahålls offentligt för denna specifika modell för närvarande. Eftersom det är en förhandsversion (anges av "Image Preview" i dess namn) har Google kanske inte publicerat standardiserade utvärderingsresultat. Användare bör inte anta prestandanivåer från andra Gemini Flash-modeller, eftersom bildförhandsvisningsvarianten kan skilja sig i kapacitet. För att bedöma modellens kvalitet rekommenderar OrcaRouter att du kör anpassade utvärderingar på din egen datamängd. Vanliga mått för multimodala uppgifter inkluderar noggrannhet på VQA-riktmärken, BLEU för bildtexter eller F1 för dokumentförståelse. Utan riktmärken är det nödvändigt att förlita sig på empirisk testning.
Eftersom modellen är byggd på Gemini 3.1 Flash, bör den uppvisa starka textgenereringsförmågor som är typiska för den arkitekturen, såsom sammanhängande språk, sammanfattning och resonemang. Men eftersom det är en multimodal variant kan dess textprestanda skilja sig från den dedikerade text-only Flash-modellen på grund av overhead från bildbehandlingsgrenarna. Inga jämförande riktmärken finns tillgängliga. För rena textuppgifter kan användare upptäcka att en enklare, text-only flash-modell ger motsvarande eller bättre kvalitet med lägre kostnad och latens. Om du huvudsakligen arbetar med text, överväg att använda gemini-3.1-flash eller liknande modeller på OrcaRouter istället.
Som en förhandsvisningsmodell kan den ha begränsningar eller restriktioner som inte är fullständigt dokumenterade. Kända potentiella begränsningar inkluderar: modellen kanske inte hanterar bilder med mycket hög upplösning lika bra som dedikerade visionsmodeller; den kan vara mindre pålitlig när det gäller att hantera flera bilder i en enda prompt på grund av kontextdelning; och den kan vara mer känslig för promptformulering än specialiserade modeller. Dessutom, eftersom det är en flashmodell, kan den avväga lite resonemangsdjup för snabbhet, så komplexa flerstegs visuella resonemangsuppgifter kan vara felbenägna. Användare bör noggrant testa gränsfall. OrcaRouter rekommenderar att granska Googles dokumentation för Gemini för eventuella säkerhetsfilter eller innehållspolicyer som kan gälla.
Gemini 3.1 Flash Image Preview är utformad för låg latens, men exakta hastighetsmått publiceras inte. Jämfört med andra flash-modeller på OrcaRouter (t.ex. Gemini 1.5 Flash eller andra flash-varianter) kan tillägget av bildbehandling öka latensen per begäran eftersom bilder måste kodas och behandlas. Men inom flash-klassen bör den vara snabbare än större, icke-flash-modeller som hanterar bilder. För användare som behöver både hastighet och bildseende är denna modell ett rimligt val. Om latens är avgörande och bilder inte krävs, kommer en textbaserad flash-modell att vara snabbare. OrcaRouters API tillhandahåller svarstider; kunder kan övervaka sin egen användning.
Priser för denna modell på OrcaRouter bestäms av plattformen och kan komma att ändras. Vanligtvis tar OrcaRouter betalt per bearbetad token (inmatning + utmatning), med extra avgifter för bildtokens. För multimodala modeller är kostnaden per begäran högre än för textbaserade modeller eftersom bilder förbrukar många tokens. Användare bör konsultera OrcaRouters officiella prissida för aktuella priser för google/gemini-3.1-flash-image-preview. Inga specifika kostnader per token anges här. Det rekommenderas att uppskatta kostnader genom att testa exempelbegäranden och granska tokenanvändningen som rapporteras i API-svarets huvud.
Ja, bildinmatningar ökar avsevärt antalet tokens per förfrågan, eftersom varje bild tokeniseras till många tokens (vanligtvis hundratals till tusentals beroende på upplösning). Detta höjer direkt kostnaden jämfört med textbaserade prompts av liknande längd. Om din applikation kan använda textbaserade beskrivningar av bilder kan en textbaserad modell vara billigare. Omvänt, om bildförståelse är nödvändig, erbjuder denna modell en enskild modellösning istället för att kombinera två separata tjänster. Användare bör väga kvaliteten på modellens bildtolkning mot den extra kostnaden. OrcaRouter kan erbjuda användningsrabatter för högvolymskunder; kontakta dem för detaljer.
OrcaRouter kan erbjuda funktioner som prompt-cachning eller återanvändning av sessioner för att minska redundans vid bearbetning av bildtokens. Specifika implementeringsdetaljer är dock inte offentligt dokumenterade för denna modell. Cachning kan avsevärt sänka kostnaderna i applikationer där samma bild skickas upprepade gånger (t.ex. i en Q&A-bot med ett fast dokument). Användare bör fråga OrcaRouters supportteam om cachningsmöjligheter. Dessutom kan OrcaRouter erbjuda prisnivåer eller månadsplaner som sänker kostnaden per token för garanterad användning. Det är lämpligt att granska användarvillkoren eller kontakta säljavdelningen för precisa kostnadsoptimeringsstrategier.
För att använda modellen, skicka HTTP POST-förfrågningar till OrcaRouter's OpenAI-kompatibla API-slutpunkt: https://api.orcarouter.ai/v1/chat/completions. Ställ in modellparametern till "google/gemini-3.1-flash-image-preview". Inkludera din API-nyckel i Authorization-headern (Bearer-token). Begärandekroppen ska innehålla en messages-array, där varje meddelande kan ha en roll (system, user, assistant) och innehåll. För bilder, inkludera ett objekt med typen "image_url" och bildens URL eller base64-data. Exempel: "content": [{"type": "text", "text": "Beskriv detta foto"}, {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}]. API:t returnerar ett standardsvar för chattkomplettering.
API:n stöder standardparametrar för OpenAI-chattkomplettering: model, messages, max_tokens, temperature, top_p, stop, stream, etc. För bildinmatning måste innehållsmatrisen innehålla objekt med typen "image_url". image_url-objektet kan ha antingen en offentlig URL eller en base64-kodad data-URI. OrcaRouter kan också stödja valfria parametrar som max_image_tokens eller detail-inställningar (som OpenAIs low/high), men dessa är inte bekräftade. Se OrcaRouters API-dokumentation för eventuella ytterligare parametrar som är specifika för multimodala modeller. Svaret innehåller användningsinformation som prompt_tokens (inklusive bildtokens), completion_tokens och total_tokens, vilket är användbart för kostnadsövervakning.
Migrering från Googles Vertex AI eller AI Studio API till OrcaRouter kräver att bas-URL och modellidentifierare ändras. Byt ut din Google-slutpunkt mot https://api.orcarouter.ai/v1/chat/completions. Ändra modellnamnet till "google/gemini-3.1-flash-image-preview". Autentisering: använd OrcaRouter API-nycklar istället för autentiseringsuppgifter för Googles tjänstekonto. Förfrågeformatet blir OpenAI-kompatibelt: meddelandearray med roller och innehåll. Om du använde Googles multimodala inmatningsformat måste du konvertera bilder till det image_url-format som beskrivs ovan. De flesta SDK (t.ex. OpenAI Python) fungerar med en enkel konfigurationsuppdatering. Testa med en liten nyttolast för att verifiera beteendet innan produktionsmigrering.
OrcaRouter använder API-nyckelautentisering. Du måste hämta en API-nyckel från OrcaRouter-dashboarden. Inkludera den i begärandehuvudet som: Authorization: Bearer YOUR_API_KEY. API-nycklar bör hållas hemliga och inte exponeras i klientkod. För kommunikation mellan servrar, använd miljövariabler. OrcaRouter kan erbjuda hastighetsbegränsning och användningskvoter; kontrollera dina kontoinställningar. Det krävs inget ytterligare OAuth-flöde eller Google-specifik autentisering. API-nyckeln är kopplad till ditt OrcaRouter-konto och din faktureringsplan. Om du överskrider hastighetsbegränsningarna kan du få HTTP 429-status; implementera logik för återförsök i enlighet med detta.
Den vanliga Gemini 3.1 Flash är en textbaserad modell (eller möjligen text med begränsad bildigenkänning i nyare versioner). Varianten Image Preview lägger explicit till visuella förmågor, vilket gör den lämplig för multimodala uppgifter. I utbyte kan bildförhandsgranskningsmodellen ha en något annorlunda intern arkitektur och potentiellt högre latens eller kostnad på grund av bildbehandling. För textbaserade uppgifter kommer den vanliga Flash sannolikt att vara snabbare och billigare, och möjligen erbjuda identisk eller bättre kvalitet. Användare bör endast välja varianten Image Preview när bildinmatning är nödvändig. OrcaRouter erbjuder båda modellerna; jämför deras modell-ID:n.
På OrcaRouter inkluderar andra multimodala modeller GPT-4V, Claude 3 Vision och Gemini Pro Vision, samt varianter med öppen källkod. Gemini 3.1 Flash Image Preview positioneras som ett snabbt och billigare alternativ till större visionsmodeller som GPT-4V. Det offrar troligen viss resoneringsdjup för hastighet och pris. Jämfört med dedikerade bildtextningsmodeller erbjuder denna modell en mer allmän multimodal chattupplevelse. För specifika uppgifter som OCR eller detaljerad visuell igenkänning kan specialiserade modeller (t.ex. Googles egen Document AI) prestera bättre. Användare bör utvärdera baserat på sitt användningsfall: denna flashmodell är bäst för hastighetskritiska applikationer där måttlig synförmåga räcker.
OrcaRouter tillhandahåller ett enhetligt OpenAI-kompatibelt API för denna Google-modell, vilket förenklar integration om du redan använder det gränssnittet. Du slipper hantera Google Cloud-resurser, IAM-behörigheter eller separata SDK:er direkt. OrcaRouter kan erbjuda ytterligare funktioner som lastbalansering, cachning, reservmodeller och konsoliderad fakturering. Det sammanför också flera leverantörer, vilket möjliggör enkelt modellbyte utan kodändringar. För just denna modell hanterar OrcaRouter backend-anslutningen till Googles infrastruktur och optimerar potentiellt routingen. Men att använda en tredjepartsgateway introducerar ett beroende och kan lägga till en liten latens. Bedöm om bekvämligheten överväger direkt åtkomst.
Välj denna modell när din applikation kräver förståelse av visuellt innehåll kombinerat med text, såsom att analysera foton, diagram eller skannade dokument. Om din uppgift innebär att tolka bilder som en del av resonemangsprocessen — till exempel i en kundsupportbot som läser skärmbilder — eliminerar denna modell behovet av att använda ett separat visions-API. Men om dina bilder endast är dekorativa eller kan beskrivas textuellt, kommer en textbaserad modell att vara mer ekonomisk och snabbare. Dessutom, om du behöver extremt hög noggrannhet i specialiserade visuella uppgifter (som detaljerad objektsigenkänning), skulle en dedikerad datorseendemodell vara överlägsen. Denna modell erbjuder en bekväm mellanväg.
https://api.orcarouter.aiinclude_reasoningmax_tokensreasoningresponse_formatseedstopstructured_outputstemperaturetop_p| Per förfrågan | $0.1510 |
| Valuta | USD |
| Fast avgift per API-anrop (bildgenereringsmodeller) | |
GET /api/public/models/google/gemini-3.1-flash-image-previewÖppna @misc{orcarouter_gemini_3_1_flash_image_preview,
title = {Nano Banana 2 (Gemini 3.1 Flash Image Preview) API},
author = {Google},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3.1-flash-image-preview}
}Google. (2026). Nano Banana 2 (Gemini 3.1 Flash Image Preview) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3.1-flash-image-preview