Una card hero generata per l'articolo 'Qwen-Image 2.1 vs FLUX 3' che mostra una grafica di confronto a due colonne con un'icona a forma di lucchetto tra due card modello arrotondate etichettate 'Qwen-Image 2.1' e 'FLUX 3', e un nastro con la scritta 'Uno che puoi eseguire e non puoi vendere; uno che potresti vendere e non puoi eseguire'.
Guides & Insights

Qwen-Image 2.1 vs FLUX 3: Due modelli di immagini che non riesci proprio a usare

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen-Image 2.1 e FLUX 3 sono le due uscite per immagini più interessanti della seconda metà del 2026, e nessuna delle due è utilizzabile in modo semplice. Qwen-Image 2.1, che il team di Qwen-Image ha reso open source il 20 settembre 2026, è un modello unificato di generazione e modifica da 7 miliardi di parametri che puoi scaricare questo pomeriggio e che non puoi inserire legalmente in un prodotto commerciale. FLUX 3, che Black Forest Labs ha annunciato il 23 luglio 2026, è un modello fondazionale multimodale unificato il cui livello per le immagini — la parte che confronteresti davvero — due mesi dopo l'annuncio non ha ancora endpoint pubblici, né ID del modello, né prezzo, né benchmark. Il confronto, quindi, non è "quale dei due sia migliore". È quale dei due ostacoli riesci ad aggirare.

Due diversi tipi di non disponibilità

È allettante archiviare entrambi sotto "non ancora pronti" e passare oltre. Ciò nasconderebbe l'unica decisione che conta, perché i due ostacoli hanno forme opposte.

Il blocco di Qwen-Image 2.1 è di natura legale, ed è una riga in un file che puoi leggere prima ancora di scaricare qualsiasi cosa. I pesi sono su Hugging Face e ModelScope, la model card è scritta, il codice di inferenza è pubblicato, e quattro framework di serving distinti hanno avuto il supporto integrato prima o il giorno stesso del rilascio. Niente di tecnico si frappone tra te e un modello funzionante. Ciò che si frappone tra te e la sua messa in produzione è il Qwen Research License Agreement, datato 20 settembre 2026, la cui clausola di concessione dei diritti consente l'uso "SOLO PER SCOPI NON COMMERCIALI" e indirizza chiunque voglia ottenere diritti commerciali a richiedere una licenza separata al fornitore.

L'ostacolo di FLUX 3 è fisico. Non c'è alcun endpoint immagine da chiamare, nessun identificatore di modello da passare e nessuna scheda prezzi su cui basare il budget. La pagina dei prezzi di BFL stessa copre i livelli Video di FLUX 3 e la precedente linea di immagini FLUX.2; non copre un livello immagine di FLUX 3, perché non c'è nulla da prezzare. L'accesso al modello immagine è solo su richiesta anziché un pulsante per iniziare: la pagina FLUX 3 di BFL elenca il livello immagine come "prossimamente", ed è il livello action a portare l'etichetta di accesso anticipato.

Quindi uno di questi è un modello che puoi far girare stasera ma non puoi vendere, e l'altro è un modello che potresti vendere ma non puoi far girare. Quale dei due ti è più utile dipende interamente da quale lato di quella frase ti trovi — un team di ricerca interno e un team di prodotto commerciale dovrebbero arrivare a conclusioni opposte dagli stessi due fatti.

La lettura dimensione per dimensione

Stato — Pesi, licenza e model card di Qwen-Image 2.1 pubblicati il 20 settembre 2026, con un post sul blog del fornitore lo stesso giorno. FLUX 3 annunciato il 23 luglio 2026; è stato reso disponibile solo il livello video, che ha raggiunto la disponibilità generale il 4 agosto 2026.

Cosa puoi effettivamente chiamare oggi — Qwen-Image 2.1 viene eseguito localmente tramite Diffusers, ComfyUI, vLLM-Omni, SGLang e LightX2V, oppure tramite l'API del fornitore stesso e diverse piattaforme di terze parti. FLUX 3 indica il suo livello per le immagini come "in arrivo", senza alcun endpoint da chiamare, e offre un endpoint video a pagamento e generalmente disponibile.

Architettura — Qwen-Image 2.1 è un DiT a flusso singolo a 32 livelli con 7B di parametri nel componente di generazione visiva, un text encoder Qwen3-VL 8B e un VAE RGBA a 64 canali con compressione spaziale 16×. FLUX 3 è un modello flow unificato singolo addestrato congiuntamente su immagini, video e audio, basato su un metodo di flow-matching auto-supervisionato che BFL chiama Self-Flow, con un livello di action prediction sviluppato parallelamente a Mimic Robotics.

Trasparenza nativa — Qwen-Image 2.1 genera e modifica immagini RGBA, modifica il testo all'interno di livelli trasparenti ed estrae soggetti da fotografie RGB in livelli trasparenti, integrando la funzionalità che Alibaba ha distribuito separatamente come Qwen-Image-Layered a dicembre 2025. BFL non ha pubblicato alcuna dichiarazione sulla trasparenza per FLUX 3 Image.

Immagini di riferimento — Qwen-Image 2.1 accetta fino a 10 riferimenti in input, con modifica locale tramite cerchio, annotazione dipinta o una maschera separata. Non esiste alcun dato pubblicato per FLUX 3 Image.

Risoluzione — Qwen-Image 2.1 è nativo in 2K, con impostazione predefinita a 2048×2048 e 40 passaggi di inferenza, oltre a sette preset di proporzioni documentati. Le risoluzioni di FLUX 3 Image sono descritte nell'annuncio solo come "ampie", senza alcun dato pubblicato.

Prezzo — nessun prezzo pubblicato per nessuno dei due. Al momento della stesura, Qwen-Image 2.1 non ha una tariffa hosted elencata; FLUX 3 Image non ha una scheda prezzo perché non ha un endpoint. L'unico prezzo FLUX 3 esistente è quello video: $0,06 al secondo per la bozza, $0,17 al secondo per HD e $0,29 al secondo per FHD.

Licenza — Accordo di licenza Qwen Research, solo uso non commerciale, uso commerciale su richiesta separata. I termini di licenza di FLUX 3 per il livello immagini non sono stati pubblicati affatto.

Un'asimmetria merita una riga a sé, perché è la trappola in questo confronto. FLUX 3 ha effettivamente numeri di benchmark pubblicati — un Elo interno di 1.135 per il text-to-video e tassi di vittoria basati sulle preferenze umane riportati rispetto a Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 e Luma Ray 3.2. Ognuna di queste cifre descrive il livello video. Nessuna di esse si applica alla generazione di immagini, e BFL stessa non ha pubblicato alcun benchmark o tasso di vittoria per le immagini. Citare un Elo video di FLUX 3 come prova della qualità delle immagini di FLUX 3 è l'errore più facile da commettere in questo confronto.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs FLUX 3 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Status: released 20 Sep 2026; Callable today: local, five frameworks; Architecture: 7B, 32-layer DiT; Transparency: native RGBA; Reference images: up to 10; Price: none published; Licence: research, non-commercial. Right column 'FLUX 3': rows reading Status: announced 23 Jul 2026; Callable today: video only; Architecture: unified flow model; Transparency: none claimed; Reference images: not published; Price: video $0.06-$0.29 per second; Licence: not published for image. Footer reads 'Qwen-Image 2.1 figures per the vendor model card, unaudited; FLUX 3 image tier has published no figures at all.'

Che cosa può effettivamente mostrare ciascuna parte

Metti a confronto le prove e l'asimmetria si inverte rispetto alla sezione precedente.

FLUX 3 ha un prodotto spedito, con un prezzo, disponibile generalmente — semplicemente non quello nel titolo di questo articolo. FLUX 3 Video genera clip fino a 20 secondi con audio sincronizzato in un'unica passata, supporta text-to-video, image-to-video, video-to-video, keyframe-to-video e continuation generativa, ed è già in fase di test da parte di Canva, Burda, Magnific, Krea e Picsart. Si tratta di un sistema reale, distribuito, con una lista di clienti reale. Il livello per le immagini è la parte che non è ancora arrivata, e l'indicazione originale di BFL secondo cui sarebbe seguito "nelle prossime settimane" ha ormai superato due mesi interi senza un endpoint pubblico.

Qwen-Image 2.1 ha il profilo opposto. Le sue dichiarazioni di qualità provengono dal grafico di confronto Qwen-Image-Bench dello stesso fornitore, e nessuna terza parte le ha riprodotte. Ma la cosa in sé è nelle tue mani: 33 GB di pesi, una struttura di repository in stile Apache con un file di licenza che è onesto sul fatto che sia solo per ricerca, e un percorso di serving day-zero su cinque framework. C'è anche una recensione pratica in accesso anticipato, da un tester che ha eseguito i pesi finali tramite un'interfaccia ModelScope Studio e ha riportato all'incirca 10–15 secondi per text-to-image e 18–23 secondi per l'editing, un forte comportamento con preset di fotocamera e assegnazione di ruoli multi-personaggio, e una coerenza multi-riferimento che inizia a degradare a partire da circa tre immagini di input. Un solo recensore, nessun timer, nessun set di prompt pubblicato. Utile come indicazione, formalmente non verificato.

Il riepilogo onesto delle evidenze: Qwen-Image 2.1 ha un modello eseguibile e nessun dato indipendente sulla qualità; FLUX 3 Image ha affermazioni del fornitore e né un modello eseguibile né alcun dato sulle immagini. Se la tua domanda è "su quale di questi dovrei pianificare una pipeline", la risposta oggi è nessuno dei due, e il motivo è diverso.

A screenshot of the Black Forest Labs FLUX 3 model page, captured September 20 2026, showing the FLUX 3 family overview with the Video tier marked as generally available and the Image tier listed as coming soon, alongside the FLUX 3 Video per-second pricing tiers.

Dove si trova effettivamente la soluzione alternativa

Per un team commerciale, il blocco rappresentato da Qwen-Image 2.1 ha una forma che si può pianificare. La licenza è esplicita, il referente per la licenza commerciale è indicato nel repository, e il modello è abbastanza piccolo — 7B nel componente di generazione — che il costo di valutarlo sul proprio hardware si misura in un pomeriggio, non in un trimestre. Prima valutate, poi negoziate, e nel frattempo tenete la build di ricerca lontana da qualsiasi percorso rivolto ai clienti. Questo è un normale problema di approvvigionamento.

Il blocco di FLUX 3 Image non è un problema di procurement, perché non c'è nulla da acquistare. Puoi entrare in una coda di accesso anticipato e puoi tenere d'occhio l'arrivo dell'endpoint, e questo è tutto ciò che puoi fare. Se oggi hai bisogno della generazione di immagini della famiglia FLUX in produzione, le opzioni invocabili sono le linee precedenti FLUX.2 e FLUX Pro/Dev, che hanno un prezzo e sono disponibili — e che appartengono a una generazione di modello diversa da quella di cui tratta questo articolo.

Per un team che vuole testare entrambi i candidati senza impegnare nessuno dei due su un percorso di produzione, questo è esattamente il caso per cui esiste il livello di routing. OrcaRouter mette oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, al prezzo di listino del provider e senza alcun ricarico, con failover automatico tra i provider, così un modello non ancora collaudato o non rilasciato si trova dietro una route accanto a qualcosa di cui ti fidi già, invece di sostituirlo — e poiché il prezzo di listino viene passato tal quale, qualsiasi variazione di prezzo del fornitore su un modello instradato è attiva lo stesso giorno. Né Qwen-Image 2.1 né FLUX 3 Image sono instradabili al momento in cui scriviamo, e non abbiamo intenzione di fingere il contrario; ciò che instradiamo è la linea di immagini che sta loro attorno, inclusa la famiglia GPT-Image di OpenAI, i livelli di Imagen 4 e le anteprime immagini di Gemini di Google, e l'endpoint immagini Grok Imagine di xAI. Questi sono i modelli in grado di reggere un carico di lavoro mentre questi due si sistemano.

Un'altra cosa che vale la pena tenere d'occhio, in particolare sul fronte Qwen. Alibaba ha rilasciato Qwen-Image 1.0 e 2.0 come pesi aperti con licenza Apache-2.0, poi ha rilasciato Qwen-Image 3.0 a luglio 2026 come modello ospitato completamente chiuso, senza pesi, senza licenza e senza report tecnico, quindi ha rilasciato Qwen-Image 2.1 a settembre come pesi aperti con una licenza solo per ricerca. La direzione di marcia non è una linea retta, e i termini della licenza del prossimo rilascio sono una vera domanda aperta, più che un'assunzione sicura in una direzione o nell'altra.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

Il verdetto, per quello che è

Se sei un ricercatore o un team di valutazione interno, Qwen-Image 2.1 è il più utile dei due in questo momento, con un ampio margine: è scaricabile, documentato, supportato dai framework e onesto riguardo ai suoi termini. Se sei un team commerciale, entrambi sono bloccati e i blocchi non sono equivalenti: uno è un contratto su cui puoi avviare una conversazione, l'altro è un prodotto che non esiste ancora.

Se devi rilasciare la generazione di immagini questo mese, nessuno dei due è la risposta, e la domanda utile è quale dei modelli puoi chiamare ti avvicina di più. Questo è un esercizio di benchmarking, e vale la pena farlo con i tuoi prompt anziché con il grafico di lancio di chiunque — incluso quello del fornitore, e incluso questo.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno