Nano Banana Pro är Googles mest avancerade bildgenererings- och redigeringsmodell, byggd på Gemini 3 Pro. Den utökar den ursprungliga Nano Banana med avsevärt förbättrad multimodal resonemang, verklighetsförankring och...
Den här modellen är en förhandsversion från Google av en kommande variant av Gemini 3 Pro med fokus på bildförståelse. Den tar emot bild- och textinmatningar och genererar textutdata. Namnet "Nano…
Modellen kan beskriva bildinnehåll i detalj, svara på frågor om objekt, scener, färger och text som syns i bilden (t.ex. läsa skyltar eller etiketter). Den stöder visuella resonemangsuppgifter som att jämföra två bilder, identifiera skillnader eller extrapolera från visuella ledtrådar. Den kan också analysera diagram och tabeller, även om dess noggrannhet på komplexa vetenskapliga figurer kan variera.
Starka användningsområden inkluderar: 1) Realtidsbildtextning för tillgänglighetsverktyg; 2) Visuell sökning och produktklassificering inom e‑handel; 3) Dokumenthantering (formulär, kvitton, fakturor) med handskriven eller utskriven text; 4) Utbildningsverktyg som förklarar diagram eller fotografier. Modellen presterar bäst med tydliga, välbelysta bilder och specifika, detaljerade uppmaningar.
Om din uppgift inte involverar bilder (t.ex. ren textgenerering, sammanfattning, översättning) kommer en textbaserad modell (som standard Gemini eller Llama-varianter) att vara mer kostnadseffektiv. För enkel bildklassificering som inte kräver naturligt språkresonemang kan en dedikerad visionsmodell med lägre latens vara bättre. Om du dessutom behöver lägre latens för högvolymsförfrågningar kan en mindre multimodellmodell vara att föredra.
Som en förhandsvisning är stödet för funktionsanrop inte bekräftat för denna modell. OrcaRouters API stöder samma verktygsdefinitioner som OpenAI, men den underliggande modellen kanske inte på ett tillförlitligt sätt kan utföra funktionsanrop. Testa noggrant innan du förlitar dig på verktygsanvändning. Strukturerad utdata (JSON-läge) stöds via det OpenAI-kompatibla formatet, men utdatakvaliteten varierar.
Benchmark-poäng för Nano Banana Pro (Gemini 3 Pro Image Preview) har inte offentliggjorts. Som en förhandsmodell kanske den inte utvärderas på standardbenchmarks som MMLU, VQAv2 eller COCO Captions. Utvecklare bör köra sin egen utvärdering på representativ data för att bedöma prestanda. Förvänta förbättringar i den slutliga Gemini 3 Pro-versionen.
Latensen beror på bildstorlek, indatalängd och OrcaRouters aktuella belastning. Bildbearbetning ger extra overhead jämfört med enbart textbaserade modeller. I genomsnitt kan en förfrågan med en medelupplöst bild och 100 texttokens ta flera sekunder för den första token och därefter strömma resten. Det finns ingen publicerad siffra för tokens per sekund för denna förhandsversion. Använd mindre bilder och batcha förfrågningar för att minimera latensen.
Modellen är utmärkt på att identifiera objekt, människor och text i bilder. Den kan resonera om rumsliga relationer och svara på frågor som kräver att kombinera visuell och textuell information. Tidig feedback indikerar god prestanda på fotobaserade frågor och dokumentförståelse. Dess stora kontextfönster möjliggör konversationer med flera bilder.
Som en förhandsvisning kan modellen producera oväntade utdata eller hallucinera detaljer om bilder (t.ex. påståenden om objekt som inte finns). Den kan ha svårt med lågupplösta, suddiga eller mycket abstrakta bilder. Komplex flerstegsvisuell resonemang (t.ex. matematiska ekvationer från handskrift) kan vara opålitligt. Modellen stöder inte ljud- eller videoingång. Det finns ingen finjusteringsmöjlighet för denna förhandsvisning.
Priserna sätts av OrcaRouter baserat på per‑token kostnader för google-leverantören. Indatatokener är vanligtvis billigare än utdatatokener. Bildtokener förbrukar betydligt fler indatatokener än text—varje bild delas upp i paneler och bearbetas. Se OrcaRouter:s officiella prissida för aktuella priser. Det finns ingen gratissnivå för denna modell; du betalar per begäran.
Eftersom bildbehandling är tokenintensiv kan kostnaderna snabbt ackumuleras om du skickar många högupplösta bilder. För att hantera kostnaderna: minska bildupplösningen, begränsa antalet bilder per begäran och använd kort prompttext. För uppgifter där bilder inte är nödvändiga, överväg en textbaserad modell. OrcaRouter kan erbjuda caching för återkommande bildebäddningar (kontrollera dokumentationen för detaljer).
OrcaRouter kan implementera cachning för ofta använda bildinbäddningar, men denna förhandsmodells cachningsbeteende är inte dokumenterat. Vanligtvis kan identiska bildinmatningar på samma URL cachas hos leverantören, vilket minskar tokenkostnaderna vid upprepade förfrågningar. Kontakta OrcaRouter support för specifika detaljer. Cachning är modellberoende och garanteras inte för förhandsmodeller.
Tokenförbrukning för bilder är proportionell mot antalet 256×256-brickor som krävs för att täcka bilden (efter storleksändring). En 512×512-bild använder 4 brickor (4 inmatningstoken per bricka? Ej angivet—exakt formel beror på modell). OrcaRouter kan tillhandahålla ett tokenantal i API-svarets användningsfält. Experimentera med dina egna bilder för att uppskatta kostnad per begäran.
Använd den OpenAI-kompatibla slutpunkten på https://api.orcarouter.ai/v1 med din API-nyckel. Ställ in modellen till "google/gemini-3-pro-image-preview". Formatera förfrågan med en messages-array som innehåller både text- och bilddelar. Bilder skickas som base64-data-URL:er eller URL:er med image_url-objekt. Exempel: {"model":"google/gemini-3-pro-image-preview","messages":[{"role":"user","content":[{"type":"text","text":"Describe this image"},{"type":"image_url","image_url":{"url":"data:image/png;base64,..."}}]}]}. Streaming stöds.
Standard OpenAI-parametrar: temperatur (0–2), top_p, max_tokens (upp till kontextfönstret minus prompttokens), stoppsekvenser, frekvensstraff, närvarostraff. Modellen accepterar också parametern "seed" för deterministiska utdata (inte garanterat). Parameterstöd är modellberoende; vissa parametrar kan ignoreras eller ha andra standardvärden. Testa med din önskade konfiguration.
Ändra din bas-URL från https://api.openai.com/v1 till https://api.orcarouter.ai/v1, uppdatera din API-nyckel till en OrcaRouter-nyckel och ändra modellnamnet till "google/gemini-3-pro-image-preview". Meddelandestrukturen (innehållsarray med text och image_url) är identisk. Om du använder bibliotek som openai Python, ändra bara base_url och api_key. OBS: hastighetsbegränsningar skiljer sig.
Autentisering sker via API-nyckel i Authorization-headern (Bearer din_nyckel). Hastighetsbegränsningar är per nyckel och beror på din plan. API:t returnerar 429 när det överskrids. Det finns ingen separat autentisering för modellleverantören – OrcaRouter hanterar routning. För produktion, använd en dedikerad nyckel och övervaka användningen i OrcaRouter-instrumentpanelen.
Båda är multimodala (bild+text in, text ut). GPT‑4V är en mogen produktionsmodell med bredare referensdata. Nano Banana Pro är en förhandsversion; dess verkliga kapacitet är mindre känd. Kontextfönster: GPT‑4V upp till 128k jämfört med 65k för denna modell. GPT‑4V stöder bilder med högre upplösning. Denna modell kan dock erbjuda lägre kostnader och andra styrkor i resonemang. Direkta jämförelser kräver uppgiftsspecifik utvärdering.
OrcaRouter erbjuder flera multimodala modeller (t.ex. Claude 3 Vision, Llama 3.2 Vision). Denna Google-förhandsvisning ger en unik Gemini-baserad arkitektur som kan utmärka sig i vissa Google-centrerade uppgifter (t.ex. förståelse av skärmdumpar från Google Docs). Den har hälften så stort kontextfönster som vissa konkurrenter. Prissättning och latens varierar; kontrollera OrcaRouters jämförelsetabeller för priser per modell.
Den främsta fördelen är inbyggd bildinmatning utan att behöva en separat visionskodare. Du kan kombinera visuell kontext med text i en enda uppmaning. Detta minskar systemkomplexiteten jämfört med att kedja ihop två olika modeller. Dock är text‑endast modeller billigare och snabbare för uppgifter som inte kräver bilder. Välj baserat på om uppgiften kräver visuell förståelse.
Gemini 2 Pro är en produktionsmodell med lång meritlista. Denna förhandsvisning ger en inblick i Gemini 3 Pros arkitektur och kan ha andra styrkor (t.ex. bättre hantering av vissa bildtyper). Det är dock en förhandsvisning – stabilitet och support är begränsade. För produktionsdistributioner är Gemini 2 Pro (via OrcaRouter) säkrare. Använd denna förhandsvisning för tidig testning och feedback.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Per förfrågan | $0.2400 |
|---|---|
| Valuta | USD |
| Fast avgift per API-anrop (bildgenereringsmodeller) | |
Vad utvecklare säger den här veckan
GET /api/public/models/google/gemini-3-pro-image-previewÖppna @misc{orcarouter_gemini_3_pro_image_preview,
title = {Nano Banana Pro (Gemini 3 Pro Image Preview) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-3-pro-image-preview}
}Google. (2025). Nano Banana Pro (Gemini 3 Pro Image Preview) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-3-pro-image-preview