Gemini 2.5 Flash Image, noto anche come "Nano Banana", è ora generalmente disponibile. È un modello di generazione di immagini all'avanguardia con comprensione contestuale. È in grado di generare immagini,...
Google: Nano Banana (Gemini 2.5 Flash Image) è un modello linguistico multimodale sviluppato da Google, parte della serie Gemini 2.5 Flash. Accetta sia immagini che testo come input e genera testo…
Le capacità principali si concentrano sulla comprensione e il ragionamento di contenuti visivi presentati come immagini. Data un'immagine e un prompt testuale, il modello può descrivere la scena, identificare oggetti, rispondere a domande sul contenuto, estrarre testo (OCR) ed eseguire ragionamenti visivi di base (ad esempio relazioni spaziali, colori, azioni). Può anche elaborare testo che accompagna l'immagine, come istruzioni o contesto. Grazie all'architettura flash-tier, è ottimizzato per bassa latenza e alta produttività, rendendolo adatto per applicazioni in tempo reale o ad alto volume. Tuttavia, potrebbe non eguagliare la profondità di ragionamento o l'accuratezza di modelli più grandi e costosi come Gemini 2.5 Pro in compiti visivi complessi che richiedono analisi dettagliate o lunghe catene di ragionamento. Il modello non è progettato per attività come generazione di immagini, analisi video o conversazioni multi-turno che richiedono contesto lungo oltre 32K token.
Se la tua applicazione non richiede affatto input di immagini, utilizzare un modello solo testo (ad esempio, una variante più piccola di Gemini o un modello open-source) sarebbe più conveniente. Allo stesso modo, se il tuo compito coinvolge solo ragionamenti basati sul testo senza alcuna componente visiva, il sovraccarico dell'elaborazione delle immagini non è necessario. Per scenari in cui la lunghezza dell'output è lunga—come la generazione di report dettagliati o storie da un'immagine—il costo di $30 per milione di token di output può diventare costoso. In tali casi, considera modelli con prezzi di output inferiori, oppure usa questo modello per generare un breve riepilogo e poi espanderlo con un modello solo testo più economico. Inoltre, se hai bisogno di elaborare più immagini per richiesta o gestire immagini molto grandi, modelli con finestre di contesto più ampie o supporto specifico per risoluzione di immagini potrebbero essere più appropriati.
Le implementazioni ad alto volume beneficiano del basso costo di input di questo modello ($0.30 per milione di token) e dell'inferenza veloce. I casi d'uso ideali includono l'etichettatura automatica delle immagini per grandi librerie fotografiche, la generazione di testo alternativo per migliaia di immagini di prodotti, l'esecuzione di OCR su lotti di documenti scansionati e la moderazione dei contenuti in tempo reale delle immagini caricate dagli utenti. Poiché il costo di output è elevato, la risposta dovrebbe essere breve—spesso una singola parola, etichetta o frase. Ad esempio, classificare un'immagine in categorie predefinite, estrarre alcuni campi chiave da un modulo o rispondere a una domanda sì/no su un'immagine. L'elaborazione in batch può essere effettuata tramite l'API di OrcaRouter con richieste concorrenti. La latenza del modello è generalmente bassa, ma la velocità effettiva effettiva dipende dalle dimensioni e dalla complessità dell'immagine. Non esiste un limite di frequenza separato in OrcaRouter oltre all'utilizzo complessivo dell'API.
Il limite principale è l'elevato costo dei token in output rispetto al costo dei token in input, rendendo costosa la generazione di testi lunghi. La finestra di contesto di 32.768 token limita la quantità di testo e le dimensioni di un'immagine (in termini di token) che possono essere elaborati in una singola richiesta. Il modello non è progettato per compiti che richiedono ragionamento multimodale approfondito, dettagli visivi complessi o la gestione di più immagini contemporaneamente (ogni immagine aggiuntiva consuma contesto). Inoltre, essendo un modello flash-tier, potrebbe mostrare una precisione inferiore in compiti visivi specialistici come l'analisi di immagini mediche, il rilevamento di oggetti a grana fine o il riconoscimento di oggetti rari rispetto a modelli più capaci ma più lenti o costosi. I dati di addestramento del modello e le prestazioni specifiche sui benchmark non sono divulgati nei fatti forniti; gli utenti dovrebbero valutare sui propri set di dati. Infine, supporta solo input di immagini e testo, non video o audio.
I fatti forniti non includono punteggi di benchmark specifici per Google: Nano Banana (Gemini 2.5 Flash Image). Fa parte della serie Gemini 2.5 Flash di Google, che generalmente mira all'efficienza piuttosto che alla precisione di alto livello. In assenza di numeri, gli utenti dovrebbero aspettarsi prestazioni comparabili ad altri modelli multimodali di livello flash su compiti standard di visione-linguaggio come VQAv2, COCO Captions e OCR. Tuttavia, punteggi esatti non vengono forniti. Raccomandiamo di valutare il modello sul proprio dataset rappresentativo per determinare se le sue capacità soddisfano i propri requisiti. OrcaRouter non fornisce benchmark interni oltre a quelli pubblicamente disponibili da Google. Se si necessitano metriche di accuratezza precise, consultare la documentazione ufficiale di Google per la serie Gemini 2.5 Flash, ma notare che questo identificatore di modello specifico potrebbe avere il proprio fine-tuning.
I fatti forniti non includono misurazioni di latenza per questo modello. Come parte della famiglia Gemini 2.5 Flash, è progettato per bassa latenza e alto throughput. Tipicamente, i modelli flash-tier di Google sacrificano un po' di qualità di ragionamento per la velocità, rendendoli adatti ad applicazioni quasi in tempo reale. La latenza effettiva dipende da fattori come la dimensione e la risoluzione dell'immagine in input, la lunghezza del prompt testuale, il numero di token di output richiesti e il carico corrente sull'API. In generale, i semplici compiti di didascalia delle immagini possono completarsi in poche centinaia di millisecondi fino a un paio di secondi, mentre prompt più complessi che richiedono output più lunghi impiegheranno più tempo. Per ottenere i migliori risultati, mantieni la risoluzione dell'immagine ragionevole e limita la lunghezza dell'output. L'API di OrcaRouter non ha alcun overhead aggiuntivo oltre al tempo di risposta del provider.
Punti di forza: Il modello eccelle in attività in cui è necessaria una risposta rapida ed economica da una singola immagine. Può identificare rapidamente oggetti comuni, leggere testo dalle immagini e rispondere a domande dirette sul contenuto visivo. Il basso costo di input lo rende fattibile per elaborare grandi volumi di immagini. Limitazioni: Potrebbe avere difficoltà con attività che richiedono alta precisione, come contare piccoli oggetti, distinguere texture molto simili o comprendere diagrammi complessi. La comprensione del modello è limitata a ciò che può essere dedotto dai dati dei pixel e dal prompt testuale; non ha accesso a conoscenze esterne oltre i suoi dati di addestramento (data di cutoff sconosciuta). Inoltre, poiché il costo di output è elevato, generare risposte verbose per ogni immagine può diventare rapidamente costoso. Per attività che richiedono analisi lunghe e dettagliate, un modello più capace (e tipicamente più costoso) sarebbe più appropriato. Le prestazioni in casi limite come immagini scure e sfocate o angolazioni insolite potrebbero essere inferiori.
I prezzi sono semplici: $0,30 per 1 milione di token di input e $30,00 per 1 milione di token di output. I token di input includono quelli sia del prompt testuale che dell’immagine (l’immagine viene tokenizzata dal modello). I token di output sono quelli generati come risposta. Non ci sono costi di configurazione, nessun minimo mensile e OrcaRouter non applica alcun margine: paghi esattamente la tariffa del fornitore. I token vengono conteggiati dal sistema di OrcaRouter. La fatturazione è tipicamente basata sull’utilizzo, con addebiti sostenuti quando invii richieste. Puoi monitorare l’utilizzo tramite il dashboard di OrcaRouter. Poiché i token di input sono molto più economici di quelli di output, il costo totale per una richiesta tipica (output breve) è dominato dal lato input, specialmente se includi un’immagine grande. Ad esempio, un’immagine 1024x1024 può consumare diverse migliaia di token di input.
Rispetto ai modelli solo testo (ad esempio, Gemini 1.5 Flash solo testo a $0.075/M input, $0.30/M output), il costo di input di questo modello è 4x superiore e il costo di output 100x superiore, riflettendo la complessità aggiuntiva della visione. Per compiti che non richiedono analisi delle immagini, quei modelli solo testo sono molto più economici. Rispetto a modelli multimodali più grandi come Gemini 2.5 Pro (che ha costi per token più alti ma un ragionamento migliore), questo modello è più economico in input ma simile o più alto in output a seconda del livello Pro specifico. Il compromesso del livello flash è una minore accuratezza per un costo di input inferiore. Se la tua applicazione necessita di alta accuratezza e può tollerare un costo di input più alto, un modello Pro potrebbe essere migliore. Se la lunghezza dell'output è grande, il costo di output di questo modello diventa proibitivo, quindi considera modelli con prezzi di output inferiori, come Gemini 1.5 Flash (testo+visione) che potrebbe avere tariffe diverse.
I fatti forniti non menzionano alcun meccanismo di caching o sconti sul volume per questo modello su OrcaRouter. OrcaRouter trasmette il prezzo del fornitore senza ricarico, quindi eventuali sconti dovrebbero provenire direttamente dagli accordi di fatturazione di Google. Ad oggi, non esiste caching automatico di embedding di immagini o prompt nelle informazioni pubblicate di OrcaRouter. Gli utenti devono presumere che ogni richiesta venga fatturata in base ai token di input e output utilizzati. Per utenti con volumi elevati, potrebbe valere la pena contattare OrcaRouter per informarsi su potenziali accordi aziendali, ma il prezzo standard a pagamento a consumo è $0.30/M per input e $30.00/M per output. Per ridurre al minimo i costi, riutilizzare gli output generati in precedenza quando possibile e limitare il numero di token in ogni richiesta (ad esempio, ridimensionando le immagini o utilizzando prompt brevi).
Per utilizzare Google: Nano Banana (Gemini 2.5 Flash Image) tramite OrcaRouter, invia una richiesta POST a https://api.orcarouter.ai/v1/chat/completions con il parametro model impostato su "google/gemini-2.5-flash-image". L'API segue il formato delle chat completions di OpenAI. Includi la tua chiave API OrcaRouter nell'header Authorization come "Bearer YOUR_API_KEY". Nel corpo della richiesta, fornisci un array messages con un messaggio utente che contenga sia immagine che testo. Per le immagini, includi una parte content di tipo "image_url" con l'URL o i dati in base64. Esempio: {"model":"google/gemini-2.5-flash-image","messages":[{"role":"user","content":[{"type":"text","text":"Cosa c'è in questa immagine?"},{"type":"image_url","image_url":{"url":"https://example.com/photo.jpg"}}]}],"max_tokens":50}. La risposta sarà una chat completion standard con la risposta del modello.
L'API OrcaRouter supporta molti degli stessi parametri dell'API OpenAI. Parametri essenziali: model (obbligatorio, impostato a "google/gemini-2.5-flash-image"), messages (obbligatorio, array di oggetti messaggio), max_tokens (intero, numero massimo di token da generare), temperature (float, predefinito a 1.0, controlla la casualità), top_p (float, predefinito a 1.0), presence_penalty e frequency_penalty (float), stop (stringa o array di stringhe, fino a 4 sequenze), e stream (booleano, per risposte in streaming). Per input di immagini, i messaggi devono includere almeno un messaggio utente con content che è un array di parti, ciascuna parte con un campo type ("text" o "image_url"). La parte image_url deve avere un oggetto "image_url" con una stringa "url" (un URL accessibile pubblicamente o un URL di dati con base64). Non sono esposti fine-tuning o parametri aggiuntivi specifici del modello. La finestra di contesto è di 32.768 token, quindi assicurati che prompt_token_count + image_token_count + max_tokens <= 32768.
Migrare a OrcaRouter richiede modifiche minime al codice se già utilizzi un'API compatibile con OpenAI. Basta cambiare l'URL di base dal tuo endpoint precedente a https://api.orcarouter.ai/v1. Aggiorna la tua chiave API con la tua chiave OrcaRouter. Quando chiami il modello, imposta il parametro model su "google/gemini-2.5-flash-image" (o il modello desiderato). Regola di conseguenza gli eventuali ID di modello esistenti. Per l'input di immagini, assicurati che il formato della richiesta corrisponda alla convenzione OpenAI (ad esempio, utilizzando un array content con image_url). Di solito non sono necessarie altre modifiche al codice. Se stavi utilizzando un formato API diverso (ad esempio, endpoint cloud), potrebbe essere necessario riscrivere la struttura della richiesta. OrcaRouter fornisce documentazione per gli SDK comuni. Esegui test con un numero ridotto di richieste per verificare il conteggio dei token e i prezzi. Nota che OrcaRouter fattura le tariffe del provider senza maggiorazioni, quindi il prezzo potrebbe differire dal tuo provider precedente.
Rispetto al Gemini 2.5 Flash solo testo (se disponibile su OrcaRouter), questo modello aggiunge capacità di input di immagini ma a un costo di input più elevato. La versione solo testo costa generalmente meno per token di input e ha un costo di output significativamente inferiore, rendendola preferibile per attività puramente testuali. Rispetto ai modelli Gemini 2.5 Pro, questo modello flash-tier è più economico in input ma può avere precisione e profondità di ragionamento inferiori. I modelli Pro hanno una finestra di contesto più ampia (spesso 1 milione di token) e prestazioni migliori su attività complesse a più passaggi. Il costo di output per i modelli Pro può essere simile o superiore. Per attività che richiedono la comprensione di immagini insieme al testo, questo modello offre un punto di ingresso conveniente. Tuttavia, se è necessario elaborare video, audio o più immagini contemporaneamente, si dovrebbe considerare un modello che supporti tali modalità (ad esempio, Gemini 2.5 Pro che supporta video e audio in alcune configurazioni).
Questo modello è una delle tante opzioni multimodali disponibili tramite OrcaRouter. GPT-4o (OpenAI) ha tipicamente una finestra di contesto più ampia (128k) e può offrire una migliore comprensione e ragionamento complessivo delle immagini, ma a costi di input e output più elevati. I modelli di visione di Claude (es. Claude 3.5 Sonnet) sono anch'essi competitivi, ma differiscono per prezzo e lunghezza del contesto. Il principale vantaggio di Gemini 2.5 Flash Image è il basso costo di input, che lo rende interessante per attività ad alto volume e con output brevi. Tuttavia, per ragionamenti visivi complessi, imaging sanitario o analisi dettagliata di documenti, modelli più avanzati possono produrre risultati migliori. La scelta dipende dal compromesso specifico tra costo, precisione e latenza. OrcaRouter ti consente di passare facilmente da un modello all'altro modificando l'ID del modello, quindi è fattibile testare questo modello insieme ad alternative per determinare la soluzione migliore.
Un modello più costoso—come Gemini 2.5 Pro, GPT-4o, o Claude 3.5 Sonnet—diventa giustificato quando l'attività richiede maggiore accuratezza, un contesto più lungo o un ragionamento che necessita di più passaggi. Se la tua applicazione produce risultati errati o incompleti con questo modello, i risparmi sui costi vengono sprecati se è necessario un post-processing o una correzione umana. Per attività come l'analisi di immagini mediche, l'interpretazione di documenti legali o la gestione di contenuti sensibili legati alla conformità, l'affidabilità di un modello premium può giustificare il costo più elevato. Inoltre, se è necessario generare output lunghi (ad esempio, descrizioni di pagine intere) o elaborare immagini molto grandi, i modelli con finestre di contesto più ampie e costi di token di output inferiori potrebbero essere complessivamente più convenienti. La natura di livello flash di questo modello significa che è progettato per velocità e throughput, non per profondità. Usalo dove è sufficiente una comprensione approssimativa; passa a un modello superiore quando la precisione è importante.
La privacy e la gestione dei dati dipendono dalle politiche di Google per i modelli Gemini. Come per qualsiasi API cloud, i dati in input (immagini e testo) vengono inviati ai server di Google per l'elaborazione. Google potrebbe utilizzare i dati per il miglioramento del modello, a meno che non si scelga di non partecipare o si utilizzino account a livello aziendale che ne vietino tale uso. I dati forniti non specificano i dettagli sulla gestione dei dati per questo particolare modello. Quando si utilizza OrcaRouter come gateway, i dati passano attraverso l'infrastruttura di OrcaRouter ma vengono infine elaborati da Google. OrcaRouter non memorizza i tuoi dati né li utilizza per l'addestramento. Gli utenti dovrebbero esaminare i termini di elaborazione dei dati di Google per le API Gemini e prendere in considerazione la crittografia end-to-end, se necessario. Per i dati sensibili, alcune organizzazioni preferiscono modelli ospitati sulla propria infrastruttura (ad esempio tramite Vertex AI con residenza dei dati) piuttosto che un gateway di terze parti. Tuttavia, OrcaRouter fornisce una chiave API e una fatturazione unificate, che possono semplificare l'accesso se le preoccupazioni relative alla gestione dei dati sono accettabili.
https://api.orcarouter.aimax_tokensresponse_formatseedstopstructured_outputstemperaturetop_p| Input / 1M token | $0.300 |
| Output / 1M token | $30.00 |
| Valuta | USD |
Stima basata sul prezzo di listino
Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.
GET /api/public/models/google/gemini-2.5-flash-imageApri @misc{orcarouter_gemini_2_5_flash_image,
title = {Nano Banana (Gemini 2.5 Flash Image) API},
author = {Google},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/google/gemini-2.5-flash-image}
}Google. (2025). Nano Banana (Gemini 2.5 Flash Image) API. OrcaRouter. https://www.orcarouter.ai/models/google/gemini-2.5-flash-image