Hero card per il confronto tra Qwen-Image 2.1, un modello open-weights con licenza per la ricerca che ospiti tu stesso, e Nano Banana 2, un modello con licenza commerciale con un prezzo per immagine pubblicato
Guides & Insights

Qwen-Image 2.1 vs Nano Banana 2: quanto si paga per immagine e quanto si paga per possederlo

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Solo uno di questi due modelli ha un prezzo che puoi inserire in un foglio di calcolo. Nano Banana 2 — il modello Gemini 3.1 Flash Image, disponibile in generale dal 28 maggio 2026 — costa circa $0,067 per immagine 1024×1024, $0,101 a 2048×2048 e all'incirca $0,151 nel range 4K, con modalità batch a circa la metà e input di testo fatturato separatamente a $0,25 per milione di token. Qwen-Image 2.1, reso open source dal team Qwen-Image il 20 settembre 2026, non ha alcun prezzo per immagine, perché non esiste un endpoint ospitato da cui acquistare: è un download di pesi da 33 GB con licenza di ricerca che vieta l'uso commerciale. Quindi la prima domanda in questo confronto non è quale modello sia migliore. È se stai comprando immagini o comprando una macchina che le produce, e questi due acquisti non sono paragonabili nel modo in cui lo suggerisce una scheda tecnica.

La prevedibilità è ciò che un prezzo per immagine acquista davvero.

Il prezzo di Google è insolito nella categoria delle immagini per quanto la conversione sia lineare. Il modello fattura 60 $ per milione di token di output e, poiché l'output delle immagini viene tokenizzato in modo prevedibile, ciò si traduce in cifre per immagine su cui puoi ragionare prima ancora di generare qualsiasi cosa.

Nano Banana 2 — circa 0,067 $ per 1024×1024, 0,101 $ per 2048×2048, all'incirca 0,151 $ in 4K, approssimativamente la metà di queste cifre in modalità batch, più 0,25 $ per milione di token per l'input di testo. Mille immagini in 2K costano circa 101 $, prevedibili al dollaro.

Qwen-Image 2.1 — nessun prezzo pubblicato. Il costo è il tempo della tua GPU su un pacchetto da 33 GB, e il consiglio della model card per hardware con risorse limitate è l'offload sulla CPU tramite pipe.enable_model_cpu_offload(), che è più una via di fuga che una vera soluzione.

Ciò che si ottiene con il prezzo a consumo non sono solo le immagini. È la capacità di rispondere a "quanto ci costa questa funzionalità con diecimila immagini al mese" senza dover prima fare benchmark del proprio hardware. È un vero vantaggio ed è facile sottovalutarlo, perché l'alternativa — l'auto-hosting — ha un costo davvero difficile da calcolare: dipende dal tuo utilizzo, dalla tua scheda, dalla tua energia elettrica e dal fatto che la macchina sarebbe altrimenti inattiva. Il confronto onesto non è 101 $ per mille contro gratis. È 101 $ per mille contro una cifra ammortizzata che devi calcolare da solo, e la maggior parte dei team che fa i conti scopre che il prezzo a consumo è competitivo finché l'utilizzo non diventa molto alto.

La licenza è dove i «pesi liberi» smettono di essere gratis.

Questa è la differenza più netta tra i due modelli, e non c'è partita.

Nano Banana 2 è un prodotto commerciale con termini commerciali. Paghi per immagine e distribuisci ciò che realizzi. Qwen-Image 2.1 è distribuito con il Qwen Research License Agreement datato 20 settembre 2026, che concede diritti "FOR NON-COMMERCIAL PURPOSES ONLY" e stabilisce che l'uso commerciale richiede una licenza separata da richiedere al fornitore. Si tratta di un cambiamento rispetto alla precedente linea Qwen-Image, distribuita con licenza Apache 2.0 — quindi l'opzione aperta in questo confronto è aperta nel senso che puoi leggerla ed eseguirla, non nel senso che puoi costruirci sopra un'attività commerciale.

Per un team di ricerca, un appassionato o chiunque faccia benchmarking, quella è una buona licenza e il download è davvero gratuito. Per un team di prodotto, significa che il modello in questo confronto, non avendo un prezzo per immagine, non ha nemmeno un percorso commerciale, il che fa crollare del tutto il confronto dei costi: non stai scegliendo tra $101 e qualcosa di più economico, stai scegliendo tra un modello di cui puoi vendere l'output e uno di cui non puoi.

Risoluzione e rapporti d'aspetto, dove il modello aperto ha un vero vantaggio

Messa da parte la licenza, Qwen-Image 2.1 fa qualcosa che Nano Banana 2 non fa, in un modo che conta per flussi di lavoro specifici.

Qwen-Image 2.1 — 2K nativo con 2048×2048 come impostazione predefinita documentata a 40 passaggi di inferenza, sette preset di proporzioni, fino a 10 immagini di riferimento e output RGBA: un vero canale alpha, modifica su livelli trasparenti ed estrazione del soggetto da foto RGB.

Nano Banana 2 — output 4K con supporto a rapporti insoliti, inclusi gli estremi 1:4 e 1:8, una portata più ampia di quella che la maggior parte dei modelli offre in entrambe le direzioni, e dichiara cifre di coerenza pari a cinque personaggi e quattordici oggetti in un'unica generazione.

Il canale alpha è quello da notare. Il modello di Google non è documentato come in grado di produrre trasparenza, mentre Qwen-Image 2.1 lo fa nativamente, il che significa che la fase di compositing che altrimenti sarebbe un lavoro manuale — ritagliare il soggetto, mantenere i bordi morbidi, collocarlo su qualcos'altro — avviene all'interno del modello anziché dopo di esso. Se costruisci asset a livelli per professione, questa è una differenza nel flusso di lavoro e non un'affermazione sulla qualità. Vale anche la pena dire chiaramente che entrambi i modelli renderizzano a dimensioni superiori a quelle necessarie alla maggior parte dei lavori: 4K e 2048×2048 sono entrambi oltre il punto in cui il vincolo è il modello anziché la destinazione.

Two-column scoreboard for Qwen-Image 2.1 and Nano Banana 2: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Output 2048x2048 native with RGBA transparency / Aspect ratios seven presets / Reference images up to 10 / Price self-host, no hosted endpoint; Nano Banana 2 rows read GA 28 May 2026 / Licence commercial / Output up to 4K plus 1:4 and 1:8 ratios / Consistency five characters, fourteen objects, Google-reported / Independent score AA top five, both boards / Price about $0.067 per 1K image, $0.101 per 2K; footer reads 'Nano Banana 2 figures per Google and Artificial Analysis; Qwen-Image 2.1 figures vendor-reported, no independent score yet.'

Un numero pubblicato a fronte di una promessa

Il modello di Google è presente su entrambe le classifiche di immagini di Artificial Analysis dalla primavera e si trova tra i primi cinque per la generazione da testo a immagine e la modifica di immagini nello snapshot di settembre, a circa Elo 1.320 nel text-to-image. I suoi dati di coerenza — cinque personaggi, quattordici oggetti — sono di Google, ma si trovano accanto a una classifica indipendente, il che significa che possono essere verificati rispetto a come il modello si comporta effettivamente nei confronti alla cieca.

Qwen-Image 2.1 non ha un punteggio indipendente. Ha un post sul blog di un fornitore con un grafico Qwen-Image-Bench che nessuna terza parte ha riprodotto, e un resoconto pratico di accesso anticipato da parte di un tester del programma Qwen Ambassador che ha eseguito i pesi finali tramite un'interfaccia ModelScope Studio: circa 10–15 secondi per la generazione da testo a immagine, 18–23 secondi per la modifica, una solida gestione della posizione della fotocamera e dei ruoli multi-personaggio, e una coerenza multi-riferimento che si degrada a partire da circa tre immagini di input. Un solo revisore, nessun timer mostrato, nessun set di prompt pubblicato. È l'unica osservazione esterna del modello che esiste pubblicamente, e dovrebbe essere letta come un indizio piuttosto che come una misurazione.

C'è anche un numero che circola nelle coperture di terze parti che descrive Qwen-Image 2.1 come un transformer a 20 strati. Ciò contraddice la scheda del modello, che documenta un diffusion transformer a flusso singolo a 32 strati con 7B parametri nella componente di generazione visiva, un text encoder Qwen3-VL 8B e un VAE RGBA a 64 canali con compressione spaziale 16×. Usa la scheda del modello.

L'unica cosa che puoi fare con entrambi

Questo è l'unico articolo di questa serie in cui l'avversario è un modello che instradiamo davvero. Nano Banana 2 è su OrcaRouter come google/gemini-3.1-flash-image-preview, insieme al resto della linea di immagini — la famiglia GPT-Image di OpenAI, i livelli di Imagen 4 di Google, le altre anteprime immagini di Gemini e l'endpoint per immagini Grok Imagine di xAI — tutti dietro un unico endpoint compatibile con OpenAI, al prezzo di listino del provider, senza alcun ricarico. Qwen-Image 2.1 non è tra i modelli che instradiamo, e questo articolo non intende insinuare che lo sia.

Ciò che questo significa in pratica per questa decisione è più limitato di un pitch e più utile di uno. Se vuoi confrontare i due modelli sui tuoi prompt, il lato Google ti costa una chiave API e circa un decimo di centesimo per immagine a 2K, ed è sullo stesso endpoint di tutto il resto che chiami. Il lato Alibaba ti costa un download da 33 GB, una GPU e una revisione della licenza di ricerca prima che tu possa fare qualsiasi cosa commerciale con l'output. Il failover automatico tra provider è l'altro elemento che conta qui: una route può trasportare traffico di produzione su un modello misurato mentre uno non misurato viene valutato accanto, così la valutazione non si trova mai sul percorso critico.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing Nano Banana 2 inside the top group of hosted image models at around Elo 1,320 behind GPT Image 2 (high), MAI-Image-2.6 and Reve 2.1, with no Qwen-Image 2.1 entry on the boardScreenshot of the OrcaRouter model page for google/gemini-3.1-flash-image-preview, the route that serves Nano Banana 2, captured in English and showing the model listed on the platform's OpenAI-compatible endpoint

Quale, per chi

Scegli Nano Banana 2 se devi andare in produzione. Dispone di una licenza commerciale, un prezzo prevedibile al dollaro, un punteggio indipendente tra i primi cinque su entrambe le classifiche, output in 4K e la gamma di rapporti più ampia di questo confronto. Il costo di mille immagini 2K è di circa 101 $ e puoi iniziare a generarle già questo pomeriggio.

Scegli Qwen-Image 2.1 se stai facendo ricerca. È scaricabile gratuitamente, l'architettura e il prompt di sistema per la riscrittura dei prompt sono completamente ispezionabili, esegue il rendering nativamente a 2048×2048 con vera trasparenza e accetta fino a 10 immagini di riferimento con modifiche locali tramite cerchio, annotazione dipinta o maschera. Non puoi vendere ciò che produce, e nessuno ha misurato se sia valido.

Il divario tra quei due paragrafi è il divario tra i modelli, e non è un divario di qualità — è un divario di maturità, e si sta colmando secondo un calendario. Ai tester in accesso anticipato di Qwen è stato chiesto di pubblicare campioni o recensioni entro il 29 settembre 2026. Quando arriveranno, il modello aperto smetterà di essere un'incognita e inizierà a essere comparabile, e l'unica domanda rimasta sarà la licenza. Questo è il numero da tenere d'occhio, ed è un file di licenza più che un benchmark.