Una hero card generata per l'articolo 'Qwen-Image 2.1 vs Qwen-Image 3.0' che mostra due card modello arrotondate etichettate 'Qwen-Image 2.1' e 'Qwen-Image 3.0' con indicatori di data 20 set 2026 e 21 lug 2026, un'icona di download su una e un'icona cloud sull'altra, e un nastro con la scritta 'Il numero più basso è il modello più recente'.
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0: il numero più basso è il modello più recente

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cominciamo dalla cosa che manda tutti in confusione. Qwen-Image 2.1 è più recente di Qwen-Image 3.0. Il fornitore ha rilasciato Qwen-Image 3.0 il 21 luglio 2026 e l'ha portata alla disponibilità generale il 5 agosto. Ha rilasciato Qwen-Image 2.1 il 20 settembre 2026 — sette settimane dopo, e una versione minore inferiore. La numerazione non è una sequenza; sono due linee di prodotto diverse che condividono un nome, e il fatto più utile su entrambe è che prendono posizioni opposte sulla questione che decide se puoi costruirci sopra. Qwen-Image 3.0 è chiuso e ospitato, senza pesi, senza licenza e senza report tecnico. Qwen-Image 2.1 è a pesi aperti, scaricabile oggi, con una licenza di ricerca che consente esclusivamente l'uso non commerciale.

Due prodotti che condividono per caso un nome

La famiglia Qwen-Image ha ormai assunto tre distinte posizioni di licenza in quattordici mesi, e delinearle elimina gran parte della confusione:

Qwen-Image 1.0 e 2.0 — pesi aperti con licenza Apache 2.0 su Hugging Face e ModelScope, report tecnici il giorno del lancio, ospitabili in autonomia, ottimizzabili con fine-tuning, quantizzabili.

Qwen-Image 3.0 — chiuso. Nessun peso, nessuna licenza dichiarata, nessuna scheda del modello, nessun rapporto tecnico, nessuna tabella di benchmark pubblicata. Raggiungibile solo tramite un'API ospitata, nelle edizioni Pro e Standard.

Qwen-Image 2.1 — di nuovo pesi aperti, ma sotto l'Accordo di Licenza per la Ricerca Qwen datato 20 settembre 2026, che concede diritti "SOLO PER SCOPI NON COMMERCIALI" e indirizza l'uso commerciale a una licenza negoziata separatamente.

Leggilo come uno schema anziché come una cronologia e la forma è chiara: Alibaba non tratta più "open" come una scelta binaria. Qwen-Image 2.1 non è né la release permissiva che erano la 1.0 e la 2.0, né la release chiusa che era la 3.0. È una terza posizione — pesi che puoi ispezionare, eseguire e modificare, con una barriera commerciale imbullonata davanti.

Cosa è realmente ciascun modello

Qwen-Image 2.1 — un modello unificato di generazione testo-immagine e modifica di immagini con 7B parametri nella sua componente di generazione visiva, costruito come DiT single-stream a 32 strati. Un text encoder Qwen3-VL 8B e un VAE RGBA a 64 canali con compressione spaziale 16× gli si affiancano; il download completo è di circa 33 GB, con il text encoder che ne rappresenta più della metà. Attenzione block-causal con maschera causale a livello di token per il testo e maschera bidirezionale a livello di chunk per la generazione di immagini, oltre al riutilizzo della KV cache del prefisso per la modifica multi-immagine. 2K nativo, con valore predefinito 2048×2048 a 40 passi, con sette preset di proporzioni.

Qwen-Image 3.0 — un modello chiuso hosted nelle edizioni Pro e Standard, che offre generazione e modifica di immagini tramite un'unica API. Il materiale di lancio di Alibaba dichiara prompt fino a circa 4.500 token, testo leggibile fino a circa 10 pixel e copertura di 12 lingue su oltre 20 font, con output fino a 2048×2048 e fino a sei immagini per chiamata. Non è stato pubblicato alcun numero di parametri; la cifra di ~20B MMDiT ampiamente ripetuta è riportata, non confermata.

La differenza architetturale che conta di più in pratica non è la dimensione — è dove viene eseguito il modello e cosa puoi fargli. Qwen-Image 2.1 arriva sotto forma di file che puoi ispezionare, quantizzare, usare per fare fine-tuning su dati privati ed eseguire sul tuo hardware, con una pull request di supporto a SGLang mergiata tre giorni prima ancora che i pesi arrivassero. Qwen-Image 3.0 arriva come endpoint. Non puoi quantizzarlo, non puoi farci fine-tuning e non puoi eseguirlo in nessun altro posto se non dove lo esegue Alibaba.

Il montaggio è il punto in cui i due divergono di più

Entrambi i modelli svolgono generazione ed editing in un unico sistema, quindi il confronto interessante sta nei dettagli dell'editing — e qui il modello più nuovo e più piccolo è quello più capace sulla carta.

Immagini di riferimento — Qwen-Image 2.1 accetta fino a 10 riferimenti in input. La documentazione Pro di Qwen-Image 3.0 descrive il supporto per 1–3 immagini in input.

Controllo di modifica locale — Qwen-Image 2.1 supporta cerchi, annotazioni dipinte e una maschera separata fornita come input a sé stante, così che l'immagine originale resti priva di contrassegni. Il percorso di modifica documentato di Qwen-Image 3.0 copre la riscrittura locale, l'espansione dei contenuti, il trasferimento di stile e la generazione da più angolazioni di camera, senza un flusso di lavoro pubblicato basato su maschera.

Trasparenza — Qwen-Image 2.1 genera e modifica nativamente immagini RGBA, modifica il testo all'interno di un livello trasparente ed estrae un soggetto da una fotografia RGB in un livello trasparente. L'annuncio di Qwen-Image 3.0 non contiene alcuna dichiarazione sulla trasparenza.

Riscrittura dei prompt — Qwen-Image 2.1 include due checkpoint dedicati alla riscrittura, entrambi modelli Qwen3.5-VL 9B ottimizzati tramite fine-tuning, uno per il text-to-image e uno per l'editing, con il codice di riscrittura e il prompt di sistema pubblicati. La gestione dei prompt di Qwen-Image 3.0 è una scatola nera dietro l'API.

Ecosistema — Qwen-Image 2.1 ha supporto dal giorno zero in Diffusers, ComfyUI, vLLM-Omni, SGLang e LightX2V, oltre a percorsi AMD ROCm e FlagOS. Qwen-Image 3.0 ha un'API.

Quell'ultima frase non è un abbellimento retorico. Per un team la cui pipeline risiede in ComfyUI o il cui stack di inferenza è vLLM, la differenza tra un modello con una classe pipeline unificata e un modello con un endpoint HTTP è la differenza tra un compito di integrazione e una riscrittura.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Il prezzo, e ciò che il prezzo non riesce a catturare

Qwen-Image 3.0 ha l'unico prezzo pubblicato dei due: sul cloud del fornitore, Pro è indicato a circa $0,04 per immagine e Standard a circa $0,03, con prezzi al consumo nazionali che partono da circa ¥0,18. Si tratta di cifre di lancio e non sono state verificate in modo indipendente. Qwen-Image 2.1 non ha alcuna tariffa di hosting pubblicata — è un download, e il costo è quello che costa il tempo della tua GPU.

Queste due voci non sono comparabili, e fingere il contrario è l'errore più comune in questo confronto. Un prezzo per immagine copre il modello, l'infrastruttura di serving, lo scaling e l'uptime di qualcun altro. Il download dei pesi non copre nulla di tutto ciò. La domanda giusta non è quale numero sia più piccolo; è se hai la capacità operativa di gestire uno stack di modelli da 33 GB, e se la licenza del lato economico consente ciò che intendi farne.

Il che riporta la licenza al centro del confronto, dove le compete. I termini di Qwen-Image 3.0 non sono pubblicati, il che è di per sé un problema per i lavori in ambito regolamentato o per le agenzie — non c'è alcun documento da citare. I termini di Qwen-Image 2.1 sono pubblicati, e dicono non commerciale. Tra una licenza poco chiara e una chiaramente restrittiva, quella chiaramente restrittiva è più facile da gestire in fase di pianificazione, perché almeno sai quale conversazione intavolare.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Quale dovresti scegliere

Hai bisogno di immagini di produzione ricche di testo e vuoi che sia qualcun altro a occuparsene — Qwen-Image 3.0 è la scelta adatta, con l'avvertenza che i suoi dati principali sul rendering del testo sono dichiarazioni del fornitore e i test indipendenti disponibili descrivono testo in caratteri piccoli che in alcuni casi risulta ancora confuso.

Devi eseguire il modello autonomamente, metterlo a punto o mantenere i dati sul tuo hardware — Qwen-Image 2.1 è l'unica opzione tra le due, e la licenza di ricerca è il prezzo d'ingresso.

Hai bisogno di asset trasparenti, ritagli di prodotto o più di tre immagini di riferimento — Qwen-Image 2.1, secondo le specifiche pubblicate, è lo strumento più potente, e non c'è paragone sul numero di riferimenti.

Hai bisogno di diritti commerciali e di una licenza permissiva — nessuno dei due è il tuo modello. Qwen-Image 3.0 non ha termini pubblicati di alcun tipo, e Qwen-Image 2.1 richiede una licenza commerciale negoziata. Le release Apache-2.0 di questa famiglia sono le precedenti Qwen-Image 1.0 e 2.0.

Quell'ultima riga è quella su cui vale la pena soffermarsi, perché descrive un insieme in diminuzione. Una licenza già concessa non cambia retroattivamente, quindi le release di Qwen-Image con licenza Apache-2.0 restano utilizzabili alle loro condizioni originali. Ma se stai pianificando una pipeline di immagini commerciale basandoti sul presupposto che il più recente Qwen-Image sarà con licenza permissiva, le ultime tre release sono una prova contraria a tale presupposto.

Eseguire l'uno o l'altro senza puntare la pipeline su di esso

Entrambi questi modelli sono, per ragioni diverse, scomodi da mettere dietro un percorso di produzione oggi — uno a causa di una licenza, l'altro a causa di una scatola nera e di un numero di parametri non pubblicato. È esattamente la situazione per cui è costruito un livello di routing. OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider, senza alcun ricarico, con failover automatico tra provider e un DSL di routing che consente di comporre più modelli in un'unica chiamata, così un modello nuovo o scomodo può stare accanto a uno collaudato anziché davanti ad esso. La fusione dei modelli porta la stessa idea ancora più avanti, eseguendo insieme un panel di modelli e permettendoti di confrontarli sui tuoi prompt anziché su un grafico di lancio.

Né Qwen-Image 2.1 né Qwen-Image 3.0 figura tra i modelli che instradiamo oggi, e questo articolo non suggerirà il contrario. I modelli di immagini che instradiamo — la linea GPT-Image di OpenAI, i livelli di Imagen 4 e le anteprime immagini di Gemini di Google, e l'endpoint immagini Grok Imagine di xAI — sono ciò su cui verrebbe effettivamente costruito un percorso di failover mentre valuti la coppia Qwen secondo i tuoi criteri.

Ciò che c'è da osservare è più limitato di quanto sembri. Alibaba ha ormai dimostrato che distribuirà pesi aperti, modelli ospitati chiusi e download con licenza per la ricerca all'interno della stessa famiglia nello stesso trimestre. La prossima release non ti dirà quale schema ha vinto. Lo farà il file di licenza.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.