
Qwen-Image-2.1 vs GPT-Image-2.5: il divario è un numero, e non è la qualità
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Metti Qwen-Image-2.1 e GPT-Image-2.5fianco a fianco sul piano delle specifiche e sembrano fratelli: entrambi modelli unificati di generazione e modifica di immagini, entrambi con output a sfondo trasparente, entrambi rilasciati nelle ultime cinque settimane, entrambi capaci di immagini fisse di classe 2K. La differenza che decide la scelta tra loro è un singolo numero, e non è un punteggio di benchmark. Qwen-Image-2.1 è gratuito da scaricare e impossibile da vendere. GPT-Image-2.5 è impossibile da scaricare e banale da vendere. Tutto il resto — l'architettura, la latenza, l'implementazione della trasparenza — dipende da questo. Qwen-Image-2.1 è stato reso open source il 20 settembre 2026; GPT-Image-2.5 è stato annunciato con i suoi modelli API attivi l'8 settembre 2026.
Sei un motore professionale di localizzazione software. Traduci il messaggio dell'utente in italiano. Il testo contiene indicatori di intervallo numerati come {{1}}...{{/1}}, {{2}}...{{/2}}. Mantieni OGNI marcatore byte per byte: stessi numeri, stesse coppie di apertura/chiusura, stesso conteggio, stesso annidamento — non aggiungere, eliminare, rinumerare o riordinare i marcatori stessi, traduci solo il testo TRA di essi. PUOI spostare uno span {{n}}...{{/n}} ovunque lo richieda l'ordine delle parole della lingua di destinazione. Preserva gli URL e i nomi di marchi/prodotti. Restituisci SOLO il testo tradotto con i suoi marcatori — nessun preambolo, nessuna virgoletta, nessuna spiegazione.
Il fatto che entrambi i modelli abbiano ottenuto un output trasparente a poche settimane di distanza l'uno dall'altro è una coincidenza che vale la pena comprendere, perché le due implementazioni non sono equivalenti.
Qwen-Image-2.1 inserisce l'alpha all'interno del modello. Esegue il denoising in uno spazio latente RGBA a 64 canali con compressione spaziale 16×, quindi il canale alpha è una componente di prima classe di ciò che produce il sampler. Non c'è alcuna fase di segmentazione e nessun passaggio di matting. Accanto a questo c'è un extra insolito: poiché il modello può decidere, in base al prompt, se emettere RGB o un'immagine con canale alpha, può anche estrarre un soggetto da una fotografia ordinaria e restituire un livello trasparente anziché una maschera binaria.
GPT-Image-2.5 sceglie la strada del parametro. L'API di OpenAI accetta un'background impostazione con valore auto, opaque o transparent, e il modello risponde di conseguenza. Si tratta di un interruttore di funzionalità su un endpoint ospitato, non di una proprietà dello spazio latente, e ha il vantaggio che non ci devi pensare: imposti il flag, ottieni un ritaglio, vai avanti. Il compromesso è che ottieni ciò che l'endpoint ti dà, alla risoluzione e al costo che decide l'endpoint.
Quale dei due sia migliore è una questione genuinamente irrisolta. Al momento della stesura non esisteva alcun confronto pubblico tra i bordi alfa di Qwen-Image-2.1 e un modello di matting dedicato, e l'unico controllo pubblicato sul versante Qwen è di natura funzionale — il test dell'output PNG trasparente è stato superato, il canale alfa è mantenuto su tutto l'intervallo 0–255, PSNR RGBA di 60,69 dB su un singolo campione. Questo è un controllo di correttezza, non un verdetto sulla qualità. Ti dice che il canale è reale.
Cosa puoi effettivamente misurare
• Parametri — il componente di generazione di Qwen-Image-2.1 è un diffusion transformer single-stream da 7B e 32 layer, abbinato a un text encoder Qwen3-VL 8B; in totale circa 33 GB di pesi, di cui il DiT ne rappresenta circa 14 GB. OpenAI non pubblica alcun conteggio dei parametri per GPT-Image-2.5.
• Risoluzione — Qwen-Image-2.1 produce nativamente output fino a 2048×2048 con 40 passaggi di inferenza e sette preset di proporzioni. GPT-Image-2.5 accetta dimensioni fino a 3840×2160 e 2160×3840, con ciascun lato limitato a 3840 px e multipli di 16 obbligatori.
• Immagini di riferimento — Qwen-Image-2.1 ne accetta fino a 10 per la composizione multi-soggetto e il virtual try-on. I modelli di immagini di OpenAI accettano input di riferimento per l'editing, ma il limite pratico e il comportamento in termini di fedeltà variano da modello a modello e da fascia di qualità a fascia di qualità.
• Latenza — SGLang-Diffusion dichiara 2,748 s per una generazione 1024×1024 in 40 passaggi su una singola B200, e 4,74 s su una RTX 4090 da 24 GB con Cache-DiT e kernel INT8, solo denoise. OpenAI riporta che la variante Flare di GPT-Image-2.5 ha una latenza fino al 50% inferiore rispetto a GPT-Image-2, con un partner del lancio che ne misura 2–4× — dati riferiti rispettivamente dal fornitore e dal partner, non un confronto controllato.
• Prezzo — Qwen-Image-2.1 non ha un prezzo hosted perché non esiste un endpoint hosted; il costo è il tempo della propria GPU. GPT-Image-2.5 viene fatturato con le stesse tariffe per token di GPT-Image-2: 8,00 $ per 1M di token di input immagine, 30,00 $ per 1M di token di output immagine, 5,00 $ per 1M di token di input testo.
• Licenza — Qwen-Image-2.1 è distribuito con la Qwen Research License Agreement datata 20 settembre 2026, solo per uso non commerciale. GPT-Image-2.5 è un'API commerciale con provenienza C2PA e una filigrana invisibile sugli output.
Una riga di quell'elenco è più sottile di quanto sembri. OpenAI non pubblica prezzi per immagine per GPT-Image-2.5, solo tariffe per token, e il consumo di token per immagine varia con risoluzione e livello di qualità. Le misurazioni di terze parti collocano l'intervallo all'incirca tra $0.0059 e $0.712 per immagine su 1K, 2K e 4K con impostazioni bassa, media e alta e un rapporto d'aspetto 1:1 — utile come ordine di grandezza, non come quotazione. Se stai facendo previsioni, costruisci la stima dal conteggio dei token e dalla tua distribuzione dei prompt, non da una cifra per immagine misurata da qualcun altro.

I due costi che nessuno mette nella stessa colonna
Il motivo per cui questo confronto non ammette una risposta semplice è che i due modelli ti fatturano in valute diverse, e il tasso di cambio è la tua situazione.
GPT-Image-2.5 fattura a token, il che significa che il contatore è visibile, prevedibile e scala in modo lineare con il volume. È un vantaggio concreto per un prodotto con traffico noto: puoi inserirlo in un budget, e un taglio di prezzo da parte del fornitore riduce i tuoi costi lo stesso giorno. È anche una tassa sull'esplorazione, perché la decima iterazione di un prompt costa quanto la prima. Il comportamento di input_fidelity rende tutto questo più marcato di quanto le tariffe di copertina suggeriscano — l'API può applicare automaticamente l'alta fedeltà sugli input immagine, il che consuma più token di input di quanto una lettura superficiale del listino prezzi lasci intendere, perciò i cicli di modifica costano più delle cifre per immagine che la gente cita.
Qwen-Image-2.1 inverte entrambe le proprietà. Il costo marginale della centesima generazione è l'elettricità. Questo lo rende lo strumento migliore per l'iterazione, per i backfill in batch e per tutto ciò in cui il prompt è ancora in fase di scoperta. Quello che non ti dà è un numero per il prospetto finanziario — stai pagando una GPU sia che sia occupata sia che sia inattiva — e non ti dà il diritto di vendere l'output. Il Qwen Research License Agreement consente la ricerca e la valutazione non commerciali e stabilisce che la distribuzione commerciale richiede una licenza separata da Hangzhou Tongyi Laboratory Technology. Non esiste un prezzo pubblicato per quella licenza né termini dichiarati. Questa non è una nota a piè di pagina; per una pipeline commerciale è l'intera decisione.
Eseguire entrambi senza un secondo contratto
La risposta realistica per la maggior parte dei team non è né l'uno né l'altro, è entrambi. GPT-Image-2.5 gestisce il percorso di produzione in cui l'output viene spedito a un cliente e il contatore per token è una voce di costo. Qwen-Image-2.1 gestisce il percorso di esplorazione in cui hai bisogno di duecento varianti di uno scatto di prodotto trasparente e nessun fornitore ti venderà quel volume a un prezzo ragionevole.
L'attrito sta nel fatto che i due arrivano per vie completamente diverse. Uno è una chiave API. L'altro è un download da 33 GB, un ambiente Python e una GPU di tua proprietà. OrcaRouter copre la metà ospitata: oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, prezzo di listino del provider passato senza alcun ricarico, failover automatico tra provider, un DSL di routing per esprimere i fallback e la fusione di modelli per combinare più modelli in un'unica chiamata. Essere precisi su questo modello è importante — oggi non instradiamo GPT-Image-2.5; le nostre route per le immagini OpenAI sono GPT-Image-2, GPT-Image-1.5 e GPT-Image-1-mini, tutti al prezzo di listino OpenAI, e il giorno in cui un provider upstream aggiungerà gli identificatori gpt-image-2.5, la stessa chiave li chiamerà senza alcuna modifica al codice. Non instradiamo nemmeno alcun modello Qwen-Image di nessuna versione, quindi Qwen-Image-2.1 non è affatto una route dalla nostra parte. Ciò che il prezzo pass-through ti offre nel frattempo è che quando OpenAI modifica una tariffa, il numero dalla nostra parte si muove insieme a essa anziché con un ritardo.
Il verdetto, formulato come una condizione anziché come un vincitore
Se l'output deve essere venduto, non c'è partita: GPT-Image-2.5 è l'unico dei due che hai la licenza di usare, e il contatore dei token è il prezzo di questo. Se l'output è ricerca, strumenti interni o valutazione, Qwen-Image-2.1 è lo strumento più potente — 2K nativo, alpha direttamente dal sampler, dieci immagini di riferimento e un costo marginale pari a zero una volta pagato l'hardware. Se ti servono entrambi, esegui entrambi e considera la licenza come il confine che decide in quale pipeline finisce un determinato lavoro.
Due cose cambierebbero questo quadro. Un term sheet commerciale pubblicato per Qwen-Image-2.1 colmerebbe il divario sulla riga della licenza, che attualmente fa la maggior parte del lavoro in questo confronto. E una voce indipendente in una classifica di immagini per Qwen-Image-2.1 ci direbbe se il risultato di Qwen-Image-Bench del fornitore — 60,28, davanti a Nano Banana 2.0 a 59,82 e GPT Image 1.5 a 59,65, primo tra i modelli aperti — regge al di fuori del laboratorio che l'ha prodotto. Nessuno dei due esiste ancora. Finché non sarà così, la raccomandazione onesta è scegliere in base alla licenza e al contatore, non al tabellone dei punteggi.


