Una hero card generata con il titolo Qwen-Image-2.1 vs Gemini Omni 1.1 Flash, che mostra una card etichettata Qwen-Image-2.1 con un'icona a cornice e una scacchiera di trasparenza accanto a una card etichettata Gemini Omni 1.1 Flash con un'icona a pellicola, con la didascalia: uno restituisce un file, l'altro restituisce una clip.
Guides & Insights

Qwen-Image-2.1 vs Gemini Omni 1.1 Flash: Uno restituisce un PNG, l'altro no

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La cosa più utile da sapere su Qwen-Image-2.1 e Gemini Omni 1.1 Flash è che non competono. Chiedi a Gemini Omni 1.1 Flash un'immagine statica e ottieni un errore: la documentazione dello stesso fornitore elenca la generazione di immagini, la modifica di immagini e l'output intercalato di immagini e testo come capacità non supportate per il modello. Chiedi a Qwen-Image-2.1 un video e ottieni un'immagine statica 2048×2048 con canale alfa. Qualsiasi tabella comparativa che li colloca in due colonne sta confrontando una fotocamera con un proiettore. La vera domanda — quella che costa davvero denaro — è cosa succede quando li si concatena, e se la catena sopravvive al contatto con il listino prezzi. Qwen-Image-2.1 è stato reso pubblico il 20 settembre 2026; Gemini Omni 1.1 Flash è disponibile a livello generale dal 27 agosto 2026.

Cosa restituisce fisicamente ciascun modello

Questo è l'intero confronto, e tutto il resto ne consegue.

Formato di output — Qwen-Image-2.1 restituisce un'immagine fissa, fino a 2048×2048 nativamente a 40 passaggi di inferenza, opzionalmente con un vero canale alfa; Gemini Omni 1.1 Flash restituisce video, fino a 40 secondi assemblati da chiamate di generazione ed estensione da 10 secondi, senza alcuna modalità immagine fissa.
Trasparenza — Qwen-Image-2.1 esegue il denoising in uno spazio latente RGBA a 64 canali, quindi l'alfa esce dal sampler; Gemini Omni 1.1 Flash non ha output con sfondo trasparente, e richiederlo fallisce.
Input di riferimento — Qwen-Image-2.1 accetta fino a 10 immagini di riferimento per la composizione multi-soggetto; Gemini Omni 1.1 Flash accetta fino a 10 immagini per prompt come *input* e fino a tre clip video di riferimento da 3 secondi.
Limite di risoluzione — Qwen-Image-2.1 è nativo 2K; Gemini Omni 1.1 Flash offre 360p, 720p, 1080p e 4K, ma 1080p e 4K sono upscale di un rendering nativo a 720p anziché generazioni native.
Quanto costa — Qwen-Image-2.1 non ha un prezzo di hosting perché non esiste un endpoint ospitato, quindi il costo è il tempo della tua GPU; Gemini Omni 1.1 Flash fattura $0,10 al secondo a 720p, con un livello draft a 360p intorno a $0,03 al secondo.
Licenza — Qwen-Image-2.1 è distribuito con il Qwen Research License Agreement datato 20 settembre 2026, solo per uso non commerciale; Gemini Omni 1.1 Flash è un'API commerciale il cui output porta SynthID e provenienza C2PA per impostazione predefinita.

L'ultima riga è quella che tutti scorrono senza badarci. Da un lato hai un modello che puoi scaricare e non puoi vendere. Dall'altro, un modello che non puoi scaricare e che puoi vendere liberamente — con una filigrana invisibile in ogni fotogramma.

Perché l'impostazione "versus" continua comunque a saltare fuori

Cerca i due nomi insieme e troverai pagine che li mettono a confronto testa a testa. Il motivo è che la domanda di fondo è reale anche quando l'inquadramento è sbagliato: entrambi i modelli si trovano nella stessa pipeline creativa, ed entrambi ne sono la novità più recente. Ciò che le persone stanno in realtà cercando di decidere è dove finisce l'immagine statica e dove inizia il movimento.

Gemini Omni 1.1 Flash si è guadagnato il suo posto su quella questione con numeri indipendenti anziché quelli dei fornitori. Su Artificial Analysis occupava la prima posizione sia nell'arena text-to-video sia in quella image-to-video nella categoria senza audio al 2 settembre 2026, con Elo 1324 e 1364. Con l'audio attivato scende a Elo 1237 e 1180 — secondo e quarto. Quel divario audio è il tipo di dettaglio che una scheda tecnica nasconde e una classifica porta alla luce.

Le prove a sostegno di Qwen-Image-2.1 sono più esili e di natura diversa. Il Qwen-Image-Bench dello stesso fornitore lo colloca a 60,28, davanti a Nano Banana 2.0 a 59,82 e a GPT Image 1.5 a 59,65, e al primo posto tra i modelli open — ma si tratta di un benchmark eseguito dal fornitore, con margini inferiori a un punto, e non è una riproduzione di terze parti. I test indipendenti finora consistono in una sessione GenAI Showdown con valutazione umana da 7/15, in rialzo rispetto a 4/15 del Qwen-Image originale e dietro l'8/15 di Ideogram 4. Al momento della stesura, il modello non aveva alcuna voce nelle classifiche di immagini di Artificial Analysis. Non un punteggio basso — nessun punteggio.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

Il passaggio di consegne, e quanto costa davvero

Se stai costruendo qualcosa che richiede sia un'immagine fissa sia una clip, la pipeline è a senso unico: Qwen-Image-2.1 crea il fotogramma, Gemini Omni 1.1 Flash lo anima. Il contrario non esiste.

L'aritmetica non perdona una volta che la fai. Una clip di 10 secondi a 720p su Gemini Omni 1.1 Flash costa circa 1,00 $. Al livello bozza a 360p gli stessi 10 secondi costano all'incirca 0,30 $, e una scena completa di 40 secondi a 720p — una generazione più tre chiamate di estensione — si aggira sui 4,00 $. Nel frattempo, lo still che dà origine a tutto il resto non costa nulla se non l'elettricità sulla tua scheda. Il che significa che la decisione di costo interessante non è "quale modello", ma "quante riprese". Uno still su cui puoi iterare gratuitamente; un video no. I team che mettono a budget la generazione video per asset anziché per tentativo sono quelli che vengono colti di sorpresa, perché il primo fotogramma è gratis e i tentativi successivi no.

C'è una trappola di qualità anche nel passaggio di consegne. Gemini Omni 1.1 Flash esegue il rendering nativamente a 720p e fa upscaling a 1080p e 4K. Se la tua immagine fissa è un frame Qwen-Image-2.1 da 2048×2048 con un canale alfa pulito, inserirla in un percorso video che esegue il rendering a 720p e fa upscaling butta via gran parte di ciò che il modello di immagini ti ha dato — e il canale alfa viene eliminato del tutto, perché non esiste un output video trasparente. La trasparenza sopravvive nel compositor, non nella catena del modello. Pianifica la composizione dopo che la clip è tornata, non prima.

Dove si colloca il livello di routing

La parte scomoda di questo abbinamento è che nessuno dei due modelli è raggiungibile nel modo in cui probabilmente lo è il resto del tuo stack. Gemini Omni 1.1 Flash è un'API di fornitore con una propria chiave e un proprio contatore al secondo. Qwen-Image-2.1 è un download di circa 33 GB — un transformer di diffusione da 7B più un text encoder Qwen3-VL 8B — che servi tu stesso, con una licenza che ne consente esclusivamente l'uso non commerciale. Due modelli di fatturazione, due percorsi di accesso, un solo progetto.

OrcaRouter esiste esattamente per la superficie circostante: un unico endpoint compatibile con OpenAI su oltre 200 modelli, prezzo di listino del provider passato tal quale a markup zero, failover automatico tra provider, un DSL di routing per comporre fallback e fusione di modelli per chiamate in stile panel. Essere precisi su ciò che questo copre, qui, è importante. Non instradiamo alcun modello Qwen-Image di qualsiasi versione, quindi Qwen-Image-2.1 non è una route che puoi chiamare dalla nostra parte — viene eseguito sul tuo hardware o non viene eseguito affatto. Inoltre non instradiamo Gemini Omni 1.1 Flash. Ciò che invece gestiamo sul lato motion è la linea video di Kling, inclusi kling-v3, kling-v3-omni e kling-video-o1, più MiniMax H3 — quindi la metà animazione di questa pipeline ha una route ospitata che non richiede un secondo contratto con un fornitore, e sul lato immagini gestiamo la famiglia OpenAI GPT-Image, i livelli di Imagen 4 di Google e le anteprime immagini di Gemini, e l'endpoint immagini Grok Imagine di xAI. Poiché il prezzo di listino viene passato tal quale invece che maggiorato, una riduzione di prezzo del fornitore su uno qualsiasi di essi è attiva qui lo stesso giorno.

Quale ti serve davvero

Ti servono asset, non filmati — Qwen-Image-2.1, e il canale alpha è il motivo. Ritagli di prodotto trasparenti, icone, sprite e composizioni a livelli: è qui che un sampler che emette RGBA fa risparmiare un'intera pipeline di matting.
Ti serve movimento, e ti serve misurarlo — Gemini Omni 1.1 Flash. È l'unico dei due con risultati d'arena indipendenti in cima a una classifica, e l'unico con un prezzo al secondo pubblicato che puoi inserire in una previsione.
Ti servono entrambi — metti a budget la metà video per tentativo, non per asset, e non dare per scontato che il canale alpha arrivi fino in fondo.
Devi vendere l'output — Gemini Omni 1.1 Flash, e solo Gemini Omni 1.1 Flash, finché Qwen non pubblica termini commerciali per Qwen-Image-2.1. Oggi non esiste un prezzo pubblicato né un term sheet per quella licenza.

La sintesi onesta è che il confronto che li classifica è l'artefatto sbagliato. Ciò che vale la pena tenere d'occhio, poi, è se Qwen assocerà termini commerciali a Qwen-Image-2.1 e se Google colmerà il divario audio nelle classifiche Omni: sono quei due fatti, non un altro tabellone, a decidere quale metà di questa pipeline riceve il budget.

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno