Card hero per il confronto tra Qwen-Image 2.1 e LLaDA-Image-Turbo, che contrappone la licenza di Qwen limitata alla sola ricerca a quella non dichiarata di LLaDA-Image-Turbo, e un diffusion transformer da 7B a 40 step contro un modello distillato da 6B a 4 step
Guides & Insights

Qwen-Image 2.1 vs LLaDA-Image-Turbo: due modelli open per immagini, due licenze molto diverse

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli di immagini open-weights sono arrivati nello giro di tre settimane. Il team di Qwen-Image ha pubblicato Qwen-Image 2.1 il 20 settembre 2026 — pesi, file di licenza, model card e un post sul blog, tutto lo stesso giorno, con quasi nessun preavviso. Sedici giorni prima, il 4 settembre 2026, inclusionAI (il laboratorio di ricerca di Ant Group) ha pubblicato LLaDA-Image-Turbo senza post di lancio, senza comunicato stampa e senza alcun annuncio. Entrambi sono scaricabili oggi. Nessuno dei due ha un singolo punteggio di benchmark indipendente. E la differenza che deciderà davvero quale dei due puoi usare non è in nessuna delle due model card — è nella documentazione. Qwen-Image 2.1 è distribuito con una licenza di ricerca che vieta del tutto l'uso commerciale. LLaDA-Image-Turbo è distribuito senza alcuna licenza dichiarata su nessuno dei suoi repository.

La questione della licenza viene prima, perché è l'unica con una risposta chiara

Inizia da qui, perché tutto il resto in questo confronto è provvisorio e questo no.

Qwen-Image 2.1 è rilasciato con il Contratto di licenza Qwen Research, datato 20 settembre 2026, che concede diritti "SOLO PER SCOPI NON COMMERCIALI" e stabilisce che l'uso commerciale richiede una licenza separata da richiedere al fornitore. Si tratta di un cambiamento sostanziale rispetto alla precedente linea Qwen-Image, distribuita con licenza Apache 2.0. È inequivocabile: puoi leggerlo, valutarlo, sottoporlo a benchmark e scriverne. Non puoi inserirlo in un prodotto.

LLaDA-Image-Turbonon dichiara alcuna licenza. Non una permissiva, non una restrittiva, non un segnaposto. Un repository senza licenza non è "libero da usare" in alcun senso legale — per impostazione predefinita tutti i diritti sono riservati, il che è una posizione più restrittiva della licenza di ricerca di Qwen, non più permissiva. Se hai intenzione di costruirci sopra, la domanda va posta al laboratorio, non a un README.

L'ironia va detta chiaramente: il modello arrivato con una licenza formale e restrittiva è quello su cui oggi puoi contare, perché sai esattamente a che punto sei. Il modello senza licenza è quello su cui non puoi.

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Cosa sono davvero i due modelli

Mettendo da parte le licenze, questi sono due progetti davvero diversi, costruiti per motivi diversi.

Architettura — Qwen-Image 2.1 è un transformer di diffusione a flusso singolo a 32 strati con 7B parametri nella componente di generazione visiva, un text encoder Qwen3-VL 8B e un VAE RGBA a 64 canali con compressione spaziale 16×, per circa 33 GB sull'intero pacchetto. LLaDA-Image-Turbo è un modello unificato di generazione e modifica da 6B — un unico set di pesi che svolge entrambi i compiti anziché un modello base più un percorso di modifica separato.

Passaggi di inferenza — Qwen-Image 2.1 usa per impostazione predefinita 2048×2048 a 40 passaggi con flow matching e pianificazione discreta di Euler. LLaDA-Image-Turbo è distillato tramite Twin-DMD a 2–4 passaggi, con 4 consigliati, e funziona con scala di guidance 1.0 rispetto al 5.0 del modello Base.

Opzioni di precisione — Qwen-Image 2.1 introduce il supporto alla quantizzazione FP8 attraverso il suo percorso vLLM-Omni. LLaDA-Image-Turbo fornisce checkpoint sia BF16 che FP8 come download separati.

Condizionamento di riferimento — Qwen-Image 2.1 accetta fino a 10 immagini di riferimento, supporta modifiche locali tramite cerchio, annotazione disegnata o una maschera separata, e genera RGBA nativo con modifica del livello trasparente. La scheda di LLaDA-Image-Turbo non indica un limite massimo di immagini di riferimento.

Attenzione — Qwen-Image 2.1 utilizza l'attenzione causale a blocchi: una maschera causale a livello di token per il testo e una maschera bidirezionale a livello di chunk per la generazione di immagini, con riutilizzo della cache KV del prefisso quando il checkpoint contiene causal_condition: true. La scheda di LLaDA-Image-Turbo non descrive il suo schema di mascheramento con lo stesso dettaglio.

Licenza — solo per ricerca ed esplicita, rispetto a non dichiarata.

Nota cosa significano il numero di passi insieme al numero di parametri. Qwen-Image 2.1 è un modello più grande eseguito con un numero di passi dieci volte maggiore; LLaDA-Image-Turbo è un modello più piccolo distillato fino a una manciata di passi. Sono scommesse opposte su dove risiede il costo della generazione di immagini, e la risposta giusta dipende interamente dal fatto che il tuo collo di bottiglia siano i secondi GPU per immagine o il tetto su come può apparire un'immagine.

Economia della velocità: 40 passi contro 4

Il nome Turbo qui fa un lavoro concreto. La distillazione Twin-DMD collassa una traiettoria di diffusione in pochi grandi salti, ed è per questo che LLaDA-Image-Turbo può essere eseguito a 4 step, mentre il suo modello Base richiede uno schedule convenzionale. Con guidance 1.0 salta anche il classifier-free guidance, che normalmente raddoppia il numero di forward pass per step — quindi il divario effettivo è più ampio di quanto suggerisca da solo il confronto 40 contro 4.

Quello che ti offre è throughput e prevedibilità. Un modello da 6B a quattro passi è il tipo di cosa che sta su una singola scheda consumer e produce un'immagine di bozza abbastanza veloce da inserirsi in un ciclo interattivo. Qwen-Image 2.1 a 40 passi e 2048×2048 è una configurazione orientata alla qualità; la raccomandazione della model card stessa per hardware con risorse limitate è l'offload sulla CPU tramite pipe.enable_model_cpu_offload(), che è una via di fuga più che una vera soluzione.

Il contrappeso sta nel fatto che la distillazione è una compressione della capacità, e nulla di quanto presentato qui è stato misurato da nessuno al di fuori dei due laboratori. L'unico dato indipendente che esiste per l'uno o l'altro modello è una recensione pratica in accesso anticipato di Qwen-Image 2.1 da parte di un tester nel programma Qwen Ambassador, che ha fatto girare i pesi finali attraverso un'interfaccia ModelScope Studio e ha riportato all'incirca 10–15 secondi per la generazione da testo a immagine e 18–23 secondi per la modifica. Si tratta di un solo recensore, su una UI di accesso anticipato, senza alcun timer mostrato — un segnale utile, non un benchmark. LLaDA-Image-Turbo non ha alcun rapporto pratico comparabile reso pubblico.

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

La modifica è il punto in cui i due design divergono maggiormente

Entrambi i modelli fanno text-to-image ed editing, ma ci arrivano in modi diversi, e la differenza si vede nel funzionamento interno più che nell'output.

Qwen-Image 2.1 tratta l'aderenza alle istruzioni come un componente separato e ispezionabile. Insieme al modello di immagini, la release include due checkpoint di riscrittura dei prompt — Qwen/Qwen-Image-2.1-PE-T2I e Qwen/Qwen-Image-2.1-PE-I2I, ciascuno un Qwen3.5-VL 9B fine-tuned da circa 18,8 GB — che prendono un'istruzione vaga e la riscrivono in una direttiva inequivocabile prima che il modello di diffusione la veda. La variante I2I ha sempre un'immagine di input, quindi è sempre un'attività di editing e mai una generazione dal nulla. Fondamentalmente, il riscrittore viene fornito con un system_prompt.txt che puoi leggere e sovrascrivere, ed è insolitamente esplicito riguardo alla lingua: la lingua della descrizione segue la tua istruzione, mentre la lingua del testo dipinto nell'immagine è decisa da un ordine di priorità rigoroso che preserva la lingua esistente delle etichette dell'immagine di input anche quando scrivi il prompt in una lingua diversa.

È un piccolo intervento di ingegneria con un grande raggio d'azione. Se produci immagini di prodotto per un mercato in cui il testo sulla confezione conta, "il riscrittore preserva la lingua dell'etichetta esistente" e "il riscrittore gentilmente traduce tutto in inglese" sono la differenza tra un asset utilizzabile e uno scartato — e, poiché vive in un prompt di sistema anziché dentro una black box ospitata, puoi farne il diff e modificarlo.

LLaDA-Image-Turbo fa la scelta opposta: un unico modello 6B, un unico set di pesi, generazione ed editing che condividono tutto. Meno componenti in movimento, meno da configurare e nulla da ispezionare o sovrascrivere. La sua scheda cita cifre di Qwen-Image-Bench pari a 53,53 in inglese e 53,38 in cinese con una dichiarazione di open-source-SOTA — riportate dal fornitore, non riprodotte, e nota che il benchmark che sta vincendo porta il nome del modello con cui è implicitamente in competizione.

Su cosa li eseguiresti effettivamente

Il supporto all'ecosistema il giorno del lancio è la parte meno affascinante di un rilascio e quella che decide se ci passerai un pomeriggio o un fine settimana.

Qwen-Image 2.1 ha fatto il suo debutto su vasta scala: una QwenImage21Pipeline integrata in Diffusers dal giorno zero; supporto nativo per ComfyUI con template di workflow text-to-image e image-edit; vLLM-Omni con esecuzione step-wise, caching KV del prefisso, decodifica CUDA Graph, quantizzazione FP8 e parallelismo tensor/Ulysses; una pull request per il supporto nativo a SGLang che è stata unita il 17 settembre — tre giorni prima dei pesi — coprendo il DiT, il VAE RGBA, il condizionamento Qwen3-VL e l'input multi-reference, convalidata su H200, B200, RTX PRO 6000, RTX 5090 e RTX 4090; e accelerazione day-zero tramite LightX2V con AMD Radeon via ROCm e supporto multi-chip tramite FlagOS.

LLaDA-Image-Turboha ottenuto il supporto per ComfyUI il 7 settembre 2026, tre giorni dopo i pesi, più una distribuzione Diffusers e Safetensors. È un percorso reale per eseguirlo, ma è più esile, e non c'è alcun lavoro equivalente di serving in pre-rilascio da poter indicare.

La pull request SGLang di pre-rilascio è l'indizio per Qwen-Image 2.1. Il supporto del framework che arriva prima dei pesi significa che qualcuno stava testando il percorso di serving sul checkpoint, non scrivendolo a posteriori dalla model card.

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

Il percorso ospitato che tieni accanto all'esperimento

Nessuno di questi modelli è instradabile tramite OrcaRouter al momento in cui scriviamo, e questo articolo non intende suggerire il contrario: entrambi sono proposte self-host, uno con una licenza che esclude l'uso in produzione e l'altro senza alcuna licenza. Ciò che conta per un team che li valuta è che la valutazione non debba trovarsi sul percorso critico.

OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI al prezzo di listino del provider, senza alcun ricarico, con failover automatico tra i provider e un DSL di routing che ti consente di comporre più modelli in un'unica chiamata. La forma concreta che questo assume per la decisione in questione è una route in cui il modello di cui ti fidi già si occupa del traffico di produzione mentre un checkpoint self-hosted viene testato al suo fianco — e poiché il prezzo di listino viene passato direttamente invece di essere maggiorato, una variazione di prezzo del fornitore su qualsiasi modello instradato è attiva dalla nostra parte lo stesso giorno, anziché dover attendere una modifica contrattuale. I modelli di immagini che instradiamo oggi sono la famiglia GPT-Image di OpenAI, i livelli di Imagen 4 di Google e le anteprime di immagini di Gemini, e l'endpoint per immagini Grok Imagine di xAI. Se hai intenzione di passare una settimana a mettere in piedi un diffusion transformer da 33 GB per scoprire se batte un modello ospitato, il modello ospitato è il gruppo di controllo, e vale la pena avere il gruppo di controllo già su una chiave.

Cosa cambierebbe questo confronto

Tre cose, in ordine di quanto conterebbero.

Primo, un punteggio di benchmark indipendente per ciascuno dei due modelli. Nessuno dei due ne ha uno, e finché le cose non cambiano ogni affermazione sulla qualità da entrambe le parti è un laboratorio che si mette i voti da solo. Secondo, una licenza: una variante permissiva di Qwen-Image 2.1 lo renderebbe la scelta predefinita ovvia per il lavoro aperto sulle immagini a 7B, e qualunque licenza dichiarata su LLaDA-Image-Turbo lo renderebbe almeno pianificabile. Terzo, ai tester in accesso anticipato del programma ModelScope di Qwen del 17 settembre è stato chiesto di pubblicare campioni o recensioni entro il 29 settembre — otto giorni da oggi. È allora che questo smette di essere un confronto tra due model card e inizia a essere un confronto reale. Fino ad allora, il riepilogo onesto è che Qwen-Image 2.1 è il modello che sembra più capace e che non puoi commercializzare, LLaDA-Image-Turbo è quello più veloce che non puoi usare affatto senza una conversazione, e il file di licenza è l'unica parte di entrambe le release a essere del tutto definita.