Una hero card generata con il titolo Qwen-Image-2.1 vs Nano Banana 2 Lite, che mostra un'icona di ricevuta con il testo 0,034 dollari per immagine accanto a un'icona di cronometro con il testo 4,74 s per generazione, con la didascalia: quella economica è a consumo, quella veloce non è gratuita.
Guides & Insights

Qwen-Image-2.1 vs Nano Banana 2 Lite: 340 $ per diecimila immagini, oppure 13 ore di GPU

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Diecimila immagini a 1024 pixel su Nano Banana 2 Lite costano circa 340 $. Diecimila immagini da Qwen-Image-2.1 costano all'incirca tredici ore di una GPU da 24 GB e una licenza che ti vieta di venderne anche solo una. Questo, in una riga, è il compromesso, ed è l'unico confronto in questa famiglia in cui i due modelli fanno effettivamente lo stesso lavoro nello stesso momento. Qwen-Image-2.1 è passato a pesi aperti il 20 settembre 2026. Nano Banana 2 Lite — l'ID del modello del fornitore google/gemini-3.1-flash-lite-image, ufficialmente Gemini 3.1 Flash-Lite Image — è stato lanciato il 30 giugno 2026 ed è il generatore di immagini statiche più economico della linea Nano Banana.

I due candidati, prezzati onestamente

Nano Banana 2 Lite genera un'immagine 1K in circa quattro secondi, all'incirca 2,7 volte più velocemente di Gemini 3.1 Flash Image, e applica una tariffa fissa di 0,034 $ per immagine 1K. Le tariffe per token di Google alla base di questa cifra sono 0,25 $ per 1M di token di input e 30 $ per 1M di token di output immagine, il che equivale a circa 0,0336 $ a 1K; la modalità batch la dimezza portandola a circa 0,0168 $. Non esiste un piano gratuito e ogni output contiene un watermark SynthID invisibile.

Qwen-Image-2.1 non ha un prezzo, perché non c'è nulla da acquistare. È un download di circa 33 GB — un diffusion transformer single-stream da 7B con 32 layer, abbinato a un text encoder Qwen3-VL 8B — che servi in autonomia. La cosa più vicina a un listino prezzi è la latenza misurata di SGLang-Diffusion: 4,74 secondi per il passaggio di denoising su una RTX 4090 da 24 GB usando kernel Cache-DiT e INT8, 8,23 secondi per una generazione completa da 1024×1024 in 40 step su una RTX PRO 6000 Blackwell con un picco di occupazione di 40,1 GiB, e 2,748 secondi su una singola B200. Quelle sono latenze per singola richiesta che includono i componenti indicati, non valori di throughput, quindi considera le 13 ore per diecimila immagini come un ordine di grandezza anziché come un benchmark.

Mettili uno accanto all'altro e l'aritmetica non è "340 $ contro gratis". È 340 $ contro tredici ore di una scheda che già possiedi o noleggi, più il tempo di ingegneria per mettere in piedi uno stack di servizio. Il volume di crossover è molto più basso di quanto la maggior parte dei team presupponga — ma solo se la scheda non resta inattiva per il resto del mese, e solo se l'output è qualcosa che ti è consentito produrre.

Tre carichi di lavoro, e quale modello si occupa di ciascuno

Il volume da solo è l'asse sbagliato. È il tipo di lavoro a deciderlo più in fretta.

Asset a schermo ad alto volume — ritagli per i social, thumbnail, varianti A/B. Nano Banana 2 Lite vince su quasi ogni componente. Quattro secondi per immagine, quattordici proporzioni incluso 1:4 e 8:1, un prezzo fisso per immagine che puoi prevedere al centesimo, modalità batch a metà prezzo. Nulla di questo carico di lavoro richiede l'alpha o il 2K, e la licenza commerciale con filigrana è esattamente ciò che vuoi quando l'output viene distribuito.
Stampa, compositing in grande formato o qualsiasi cosa che dovrai ritagliare in modo aggressivo. Qwen-Image-2.1, e non c'è partita. Nativo 2048×2048 a 40 step contro un modello con un tetto massimo di circa 1 megapixel, senza modalità 2K, senza upscaling e senza alcun parametro API per aumentarlo — Google indirizza i lavori in 2K e 4K verso Nano Banana 2 o Nano Banana Pro. Se devi ritagliare via un terzo dell'inquadratura e avere comunque un asset utilizzabile, Lite non può arrivarci.
Ritagli trasparenti, icone, sprite, compositi a livelli. Qwen-Image-2.1. Il canale alpha è una componente dello spazio latente RGBA a 64 canali in cui il sampler esegue il denoising, quindi non c'è alcuna passata di segmentazione né di matting; il modello può anche estrarre un soggetto da una fotografia ordinaria portandolo in un livello trasparente. Nano Banana 2 Lite non ha alcun output con sfondo trasparente documentato.
Qualsiasi cosa che debba avere una licenza commerciale. Nano Banana 2 Lite, senza riserve. Qwen-Image-2.1 è distribuito con il Qwen Research License Agreement datato 20 settembre 2026 e consente esclusivamente ricerca e valutazione non commerciali; la distribuzione commerciale richiede una licenza separata da Hangzhou Tongyi Laboratory Technology, e non esiste un prezzo pubblicato né un term sheet per ottenerla.

Un'altra riga va in quell'elenco, e gioca contro il modello aperto. Nano Banana 2 Lite sa delle cose — viene fornito con un knowledge cutoff di gennaio 2025 e un profilo di aderenza ai prompt costruito sul backbone Gemini 3.1 Flash Lite, con una solida resa del testo nelle immagini, inclusi cinese, giapponese e coreano. Le prove indipendenti di Qwen-Image-2.1 sul rispetto delle istruzioni sono scarse e contrastanti. Un confronto in arena con giudice AI che ha messo Nano Banana 2 Lite contro un modello di immagini Qwen — la voce non fissa una versione, quindi leggila come un segnale sulla famiglia più che sulla 2.1 nello specifico — ha dato a Lite la vittoria sui bizzarri prompt spaziali ("astronauta a cavallo", "tassista capibara") e sulla resa del testo, dove l'output di Qwen ha reso il titolo di un invito di Halloween come "Hallofarty Invitation". I punti deboli documentati di Lite sono volti piccoli, dettagli fini del testo, infografiche dense e complesse modifiche con maschera. Nessuno dei due modelli è affidabilmente migliore nel seguire un'istruzione strana; falliscono in punti diversi.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Nano Banana 2 Lite - the scoreboard. Left column Qwen-Image-2.1 rows: Speed 4.74 s denoise on an RTX 4090; Price self-hosted GPU time; Resolution 2048 x 2048 native; Transparency native RGBA; Reference images up to 10; Licence non-commercial research only. Right column Nano Banana 2 Lite rows: Speed about 4 s per 1K image; Price 0.034 dollars per 1K image; Resolution hard cap at 1K; Transparency not supported; Reference images one image for editing; Licence commercial, SynthID watermark. Footer: Qwen figures per the vendor model card and SGLang measurements, unaudited; Google figures per the vendor launch material.

La questione dell'immagine di riferimento, irrisolta

L'editing multi-immagine è il punto in cui una pipeline volumetrica non riesce più a sostituire un modello con l'altro, ed è anche la riga in cui le informazioni pubbliche sono in conflitto.

Qwen-Image-2.1 accetta fino a 10 immagini di riferimento e supporta, oltre a questo, il virtual try-on, i ritratti di gruppo e la composizione del guardaroba. Per Nano Banana 2 Lite, le fonti sono in netto disaccordo: la pagina del modello di un provider dichiara il supporto per un massimo di 14 immagini di riferimento per il trasferimento di stile e la modifica multi-riferimento, mentre un articolo comparativo afferma l'opposto — che Lite accetta una singola immagine per la modifica e che la capacità di 14 riferimenti appartiene al Nano Banana 2 completo, con un massimo di cinque persone più sei oggetti. Visto il conflitto, la posizione difendibile è che Lite supporti l'input di immagini e la composizione multi-immagine, ma che la sua capacità di riferimento sia il fattore distintivo che Google usa per separarlo da Nano Banana 2. Se il tuo flusso di lavoro dipende da sei personaggi coerenti lungo una serie, verifica il limite sulla scheda modello ufficiale di Google prima di progettare l'architettura attorno a esso.

È anche qui che i modelli smettono di essere intercambiabili in senso più ampio. Google posiziona Nano Banana 2 Lite e Gemini Omni Flash come una coppia — il modello per le immagini fisse e il modello per il video, pensati per essere concatenati. Qwen-Image-2.1 non ha una controparte video, e il suo trucco di animazione è una sequenza concatenata di modifiche locali alle regioni che costruisce un semplice loop fotogramma per fotogramma, non un modello video.

Dove uno strato di routing si guadagna il suo posto

Nessuno di questi modelli è su OrcaRouter. Non instradiamo alcun modello Qwen-Image di nessuna versione, quindi Qwen-Image-2.1 è self-hosted o niente. Nano Banana 2 Lite — l'gemini-3.1-flash-lite-imageidentificatore — non è presente neanche nel nostro catalogo; le route per le immagini Google che offriamo sono google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview e i tre livelli di Imagen 4, più GPT-Image-2, GPT-Image-1.5 e GPT-Image-1-mini di OpenAI, e l'endpoint per le immagini Grok Imagine di xAI.

Quello che questo garantisce a una pipeline mista è il punto su cui questo confronto continua a imbattersi: una decisione che cambia da asset a asset. Gli asset ad alto volume vanno su una rotta hosted economica, gli scontorni trasparenti vanno sulla tua scheda, e una variazione di prezzo del fornitore sul lato hosted arriva lo stesso giorno perché passiamo il prezzo di listino del provider a markup zero invece di applicare un prezzo nostro. Aggiungi failover automatico tra provider, un DSL di routing per comporre fallback e model fusion per chiamate in stile panel, e la metà hosted smette di essere un rapporto con il fornitore che devi gestire per modello — 200+ modelli, un endpoint compatibile con OpenAI, una chiave. La metà self-hosted resta un tuo problema, che è il costo onesto di eseguire un checkpoint con licenza per la ricerca su hardware di tua proprietà.

Quale scegliere, e la condizione che lo ribalta

Se produci asset su schermo in volume per uso commerciale, Nano Banana 2 Lite è la risposta e la questione della licenza non si pone mai: 0,034 $ per immagine, quattro secondi, prevedibile, vendibile. Se ti servono 2K, trasparenza nativa o dieci immagini di riferimento, Qwen-Image-2.1 è l'unico dei due che ne offra anche solo uno, e lo paghi in hardware, tempo di ingegneria e una licenza non commerciale che lo rende uno strumento di ricerca più che una dipendenza produttiva.

Un solo fatto annullerebbe il divario. Un term sheet commerciale pubblicato per Qwen-Image-2.1 — con un prezzo e condizioni che qualcuno possa davvero firmare — trasforma un lavoro GPU di 13 ore in una voce che compete con 340 $, e a quel punto i vantaggi di risoluzione e canale alpha iniziano a conquistare workload che attualmente vanno a Lite per impostazione predefinita. Finché non esisterà, la divisione è netta: Lite per tutto ciò che viene rilasciato, Qwen-Image-2.1 per tutto ciò che resta all'interno dell'azienda, e uno stack di serving per il secondo che gestisci tu stesso.

A screenshot of OrcaRouter's own model page for google/gemini-3.1-flash-image-preview, captured September 21 2026, showing the model title Nano Banana 2 (Gemini 3.1 Flash Image Preview), the Vision, JSON and Reasoning capability tags, the 2026-02-26 date, the generateContent endpoint and a $0.15 price.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno