Scheda hero che riporta 'Qwen-Image-2.1 vs GPT Image 2' con il sottotitolo 'Scaricalo gratis, o noleggia quello classificato' e tre righe: Qwen-Image-2.1 download di 33 GB non commerciale, GPT Image 2 solo API con addebito per token, Trasparenza RGBA VAE vs un parametro della richiesta, accanto a un'icona con freccia di download e a un'icona misuratore.
Guides & Insights

Qwen-Image-2.1 vs GPT Image 2: scaricalo gratis o noleggia il migliore

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen-Image-2.1 è un download da 33 GB che puoi eseguire gratuitamente e non puoi vendere. GPT Image 2 è un'API che non puoi scaricare affatto, fatturata a token, in produzione da quattro mesi e in cima alle classifiche indipendenti per le immagini. Questi due fatti rappresentano l'intero scambio, e la parte interessante è che la funzionalità di trasparenza — ciò che rende Qwen-Image-2.1 meritevole di uno sguardo fin dall'inizio — è arrivata su entrambi i sistemi nel giro di un mese l'una dall'altra, attraverso percorsi completamente diversi. Qwen-Image-2.1 è stato rilasciato il 20 settembre 2026 con l'alpha integrata nel suo spazio latente. GPT Image 2 ha acquisito un background: "transparent" parametro il 20 agosto 2026 come flag API.

Due percorsi verso la stessa funzionalità

L'output trasparente è il motivo per cui la maggior parte delle persone finisce per confrontare questi due, quindi parti da lì, perché le implementazioni non sono equivalenti e la differenza conta più dell'output.

La trasparenza di Qwen-Image-2.1 è architetturale. Un VAE RGBA a 64 canali con compressione spaziale 16× significa che l'alpha fa parte dello spazio latente in cui il modello esegue il denoising. Lo stesso meccanismo ti consente la generazione con trasparenza, la modifica all'interno di un'immagine che ha già la trasparenza senza appiattirla, e l'estrazione del soggetto da una normale fotografia RGB che restituisce l'alpha anziché una maschera binaria. È un'unica capacità con tre utilizzi, e la presentazione dello stesso fornitore è che non serve alcun nodo separato per la rimozione dello sfondo, modello di matting o passaggio di pulizia dei bordi.

La trasparenza di GPT Image 2 è un parametro della richiesta. Aggiungendo background: "transparent" insieme a output_format: "png" si ottiene un'immagine con un vero canale alpha, e funziona sia nel text-to-image, sia nell'editing delle immagini, sia nello strumento di generazione di immagini della Responses API. L'inpainting basato su maschera e gli sfondi trasparenti possono essere combinati. È stato rilasciato in Preview, quindi la stessa indicazione di OpenAI è che i risultati possono essere instabili — e l'editing con trasparenza viene descritto come un ridisegnare o rimuovere uno sfondo, piuttosto che un matting preciso dei contorni. Almeno due fonti secondarie affermano che il parametro non è disponibile e che GPT Image 2 non produce affatto trasparenza; queste contraddicono la copertura dell'annuncio, i mirror della documentazione API e i test di terze parti, quindi vanno considerate obsolete o errate, non come un controsegnale. La trasparenza non modifica il costo in token — a parità di qualità e dimensione, un'immagine trasparente e una opaca consumano gli stessi token immagine.

Quindi entrambi producono alpha. Uno lo fa perché il modello è stato costruito così; l'altro perché un parametro lo richiede al servizio. Quale sia migliore dipende interamente dal fatto che l'alpha debba sopravvivere a un ciclo di modifiche, e questo è verificabile in un pomeriggio.

Cosa ti fa guadagnare il vantaggio di GPT Image 2

Quattro mesi in produzione non rappresentano un argomento di marketing, bensì un divario di maturità, che si manifesta in ambiti noiosi e decisivi.

Posizione indipendente — GPT Image 2 è in cima alle classifiche indipendenti dedicate alle immagini e vi si trova da abbastanza tempo perché si possa parlare di una posizione stabile e non di un picco della settimana di lancio. Qwen-Image-2.1 era del tutto assente da quelle classifiche quando questo testo è stato scritto.
Modalità di errore documentate — un modello con quattro mesi di utilizzo pubblico ha un corpus di casi di errore noti che puoi consultare prima di incapparvi. Un modello reso pubblico ieri ha una scheda di valutazione del fornitore e un solo test di integrazione.
Superficie operativa — limiti di frequenza a livelli, espressi sia in token al minuto sia in immagini al minuto (da 100.000 TPM e 5 IPM al livello base fino a 8.000.000 TPM e 250 IPM al livello più alto), oltre al supporto per gli endpoint batch. È la differenza tra una demo e una coda che puoi dimensionare.
Dati sulla qualità forniti da terzi — la posizione in classifica è misurata in modo indipendente. L'unico dato numerico di Qwen-Image-2.1 è il grafico Qwen-Image-Bench dello stesso fornitore, dove segna 60,28 contro Nano Banana 2.0 a 59,82 e GPT Image 1.5 a 59,65. Materiale del fornitore, non riprodotto.

L'unico dato realmente indipendente su Qwen-Image-2.1 è la verifica funzionale pubblicata con l'integrazione SGLang: l'output PNG trasparente ha superato la verifica, il canale alfa è stato mantenuto su tutto l'intervallo 0–255, il PSNR RGBA è stato misurato a 60,69 dB su un singolo campione, e le configurazioni FP8 hanno superato la generazione di PNG trasparenti. Gli autori di SGLang affermano esplicitamente che si tratta di un controllo di correttezza e non di una garanzia generale di qualità. È la prova più forte disponibile che il canale alfa sia reale. Non dice nulla sul fatto che le immagini siano buone.

Il disegno di legge, esaminato a fondo

GPT Image 2 viene fatturato a token, il che significa che il costo di un asset dipende dal livello di qualità e dalla risoluzione in un modo che un prezzo per immagine nasconde. Le tariffe di listino pubblicate sono $5,00 per milione di token di input di testo, $8,00 per milione di token di input immagine e $30,00 per milione di token di output immagine, con tariffe in cache pari rispettivamente a $1,25 e $2,00. OpenAI non pubblica una tabella statica dei token di output per questo modello — la vecchia tabella che copre i conteggi di token Basso, Medio e Alto è esplicitamente contrassegnata come non applicabile a GPT Image 2 — quindi i numeri seguenti sono misurazioni di terze parti del prezzo di listino con rapporto d'aspetto 1:1, da testo a immagine:

Output 1K — qualità bassa $0.0059, media $0.053, alta $0.211 per immagine.
Output 2K — $0.012 bassa, $0.107 media, $0.428 alta.
Output 4K — $0.020 bassa, $0.178 media, $0.712 alta.

La differenza tra qualità bassa e alta alla stessa risoluzione è di circa un fattore trentacinque. Questa è la vera decisione all'interno di una pipeline GPT Image 2: non quale modello, ma quale livello di qualità supera la revisione al costo più basso. E interagisce con l'editing in un modo che coglie molti di sorpresa: input_fidelity non può essere regolato su questo modello perché elabora automaticamente ogni immagine di input ad alta fedeltà, quindi una richiesta di modifica che include immagini di riferimento consuma più token di input immagine di quanto si stimerebbe dalla dimensione dell'output. I cicli genera-esamina-modifica sono perciò più costosi qui di quanto suggeriscano le cifre per singola immagine.

Di contro, il costo marginale per immagine di Qwen-Image-2.1 è l'elettricità. Il rovescio della medaglia sono il costo fisso e la licenza. Trentatré gigabyte da scaricare, un DiT di circa 14 GB con il resto destinato all'encoder di testo Qwen3-VL 8B, offload sulla CPU consigliato sulle schede con risorse limitate, e il tutto sotto il Qwen Research License Agreement datato 20 settembre 2026 — solo uso non commerciale, con i diritti commerciali ottenibili tramite accordo separato e nessun prezzo o termine pubblicato per essi.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Dove si colloca l'opzione hosted

Esiste una via di mezzo che evita sia la questione della GPU sia quella della licenza, ed è quella che la maggior parte dei team sceglie effettivamente. OrcaRouter instrada la famiglia GPT-Image di OpenAI insieme ai livelli di Imagen 4 di Google, alle anteprime immagini di Gemini e all'endpoint immagini Grok Imagine di xAI — oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, prezzo di listino del provider passato così com'è, a ricarico zero, failover automatico tra provider, un DSL di routing e la fusione di modelli. Poiché il prezzo di listino viene passato così com'è anziché maggiorato, un taglio di prezzo del fornitore su qualsiasi modello instradato è attivo lo stesso giorno, e poiché il failover è automatico, un provider che ha una brutta giornata non diventa un tuo disservizio. Qwen-Image-2.1 non è tra i modelli che instradiamo e non lo è nemmeno qualsiasi altra versione di Qwen-Image — è una proposta solo locale — quindi questo non è un elogio per il nuovo arrivato. È la risposta onesta a "cosa uso mentre valuto il nuovo arrivato".

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

La decisione, esposta chiaramente

Scegli GPT Image 2 se l'output è per uso commerciale, se ti serve una soglia di qualità misurata in modo indipendente, se vuoi costi per singolo asset che puoi prevedere e limitare, oppure se ti serve che funzioni questa settimana senza acquistare hardware. Accetta il fatto che stai noleggiando, che non puoi fine-tunarlo, che non puoi eseguirlo offline e che il costo per immagine cresce linearmente con il volume, per sempre.

Scegli Qwen-Image-2.1 se l'output è ricerca, valutazione o lavoro personale, se vuoi specificamente un alpha che sopravvive a un ciclo di modifiche anziché un alpha che un parametro ha prodotto una volta sola, se vuoi leggere la logica di riscrittura — i checkpoint PE-T2I e PE-I2I distribuiti sono modelli Qwen3.5-VL 9B fine-tuned con un leggibile system_prompt.txt, che è più di quanto ottieni da qualsiasi API di immagini ospitata — o se semplicemente vuoi sapere cosa può fare un modello di immagini open-weights da 7B a settembre 2026 senza pagare per ogni immagine per scoprirlo.

Non scegliere né l'uno né l'altro e instrada la questione se il risultato da consegnare è commerciale e la scadenza è reale. Non è una scappatoia; è l'opzione che non richiede di risolvere una questione di licenza alla quale non puoi ancora ottenere una risposta.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.