
Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: Uno guarda il video, l'altro lo crea
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Risposta breve: questi due non sono sostituti, e il confronto ha senso solo quando si smette di trattare "omni" come una categoria. Qwen3.8-Omni-Flash, che il fornitore ha reso disponibile ai clienti API il 18 settembre 2026, accetta in input testo, immagini, audio e video e restituisce testo — è un modello per leggere un'ora di riunione o di girato e dirti cosa è successo. Gemini Omni 1.1 Flash, che il fornitore ha rilasciato il 27 agosto 2026, accetta un prompt testuale o un'immagine e restituisce video con audio sincronizzato — è un modello per creare il girato. Uno consuma contenuti multimediali, l'altro li produce. Se la tua pipeline ha bisogno di entrambi, ti servono entrambi, e la domanda onesta non è quale dei due vince, ma quale dei due ti manca davvero.
Nessuno dei due modelli è open-weight, nessuno dei due è instradabile tramite OrcaRouter, ed entrambi hanno un prezzo su assi che non possono essere convertiti l'uno nell'altro — token da un lato, secondi di video generato dall'altro. Dove si sovrappongono veramente è più ristretto di quanto suggerisca l'inquadramento "omni vs omni", e vale la pena definire con precisione tale sovrapposizione prima dell'aritmetica dei prezzi, perché è proprio nell'aritmetica dei prezzi che i due vengono confrontati erroneamente più spesso.
L'errore di categoria che vale la pena chiarire per primo
I materiali di lancio di Alibaba mettono a confronto Qwen3.8-Omni-Flash con Gemini 3.8 Flash, e gran parte della copertura che ne è seguita lo ha ridotto a "batte Gemini". Quello è un modello Google diverso da Gemini Omni 1.1 Flash, e i due non sono punti di riferimento intercambiabili: Gemini 3.8 Flash è il modello multimodale generico, mentre Gemini Omni 1.1 Flash è il modello di generazione video con un listino prezzi separato e una superficie API separata. Ogni numero Qwen-contro-Gemini che circola dal lancio — WildClawBench-MM 71,0 contro 58,9, SpotSoundBench 67,2 contro 39,7, AgenticVBench 36,8 contro 45,0 — è riferito a Gemini 3.8 Flash, non al modello video Omni, e in ogni caso nessuno di questi dati è indipendente. Se sei arrivato qui con una tabella di punteggi che colloca i due modelli di questo articolo sullo stesso asse, è quasi certamente il modello Google sbagliato nella colonna di destra.
Cosa fa effettivamente ciascuno
• Cosa accetta in ingresso — Qwen3.8-Omni-Flash accetta testo, immagini, audio e video, inclusi audio stereo e spaziale a quattro canali; Gemini Omni 1.1 Flash accetta prompt testuali e immagini, oltre a un massimo di tre secondi di video di riferimento.
• Cosa restituisce — Qwen3.8-Omni-Flash restituisce solo testo; Gemini Omni 1.1 Flash restituisce video con audio sincronizzato nativamente, in scene estendibili fino a 40 secondi con incrementi di dieci secondi.
Superficie di controllo — Qwen3.8-Omni-Flash espone il contesto, il campionamento e una modalità agentica che decide da sé cosa guardare; Gemini Omni 1.1 Flash espone il controllo del primo frame e dell'ultimo frame, una ripercorrenza di dieci secondi per la continuità e un livello di bozza a 360p che Google descrive come all'incirca un terzo del costo e circa il 60% più veloce.
• Risoluzione e finitura — Qwen3.8-Omni-Flash non ha una risoluzione di output perché non produce media; Gemini Omni 1.1 Flash genera output a 720p, 1080p e 4K.
• Contesto e durata — Qwen3.8-Omni-Flash gestisce un milione di token e fino a un'ora di audio-video continuo in una singola chiamata; Gemini Omni 1.1 Flash è limitato dalla clip che sta generando, non da una finestra di input.
• Come paghi — Qwen3.8-Omni-Flash viene fatturato per token: 0,15 $ per milione di input, 0,016 $ per quelli in cache, 0,47 $ di output sul listino internazionale; Gemini Omni 1.1 Flash viene fatturato al secondo di video generato, con la tariffa pubblicata da Google di 0,10 $ al secondo per il 720p.
• Apertura — chiusa su entrambi i lati. Nessun peso per nessuno dei due modelli, e nessuno dei due è disponibile per l'instradamento tramite la nostra API oggi.

La sovrapposizione è la comprensione video, ed è asimmetrica
L'unico contesto in cui un acquirente potrebbe ragionevolmente metterli a confronto diretto è una pipeline che deve sia comprendere il girato sia produrlo — ad esempio, un assistente di montaggio che legge una lunga registrazione, individua i momenti che vale la pena conservare e genera un montaggio. Per quanto riguarda la comprensione, Qwen3.8-Omni-Flash è progettato esattamente per questo: un'ora di audio e video continui per chiamata, separazione degli interlocutori e una modalità agentica che aumenta l'accuratezza su OmniVideoBench del fornitore da 63,4 a 67,8, riducendo al contempo i token per query da 145.736 a 79.117. Per quanto riguarda la produzione, Gemini Omni 1.1 Flash è quello che può generare il clip risultante con audio sincronizzato, mentre il modello di Qwen non può produrre nemmeno un fotogramma di video.
L'asimmetria vale anche nel senso opposto, ed è più facile lasciarsela sfuggire. Per un modello di generazione video, la comprensione è strumentale: gli serve abbastanza scena per mantenere coerente un'inquadratura lungo un'estensione di dieci secondi, un requisito diverso dal rispondere a una domanda su quanto detto nella terza ora di una riunione. Il modello di Google ha una storia più lunga quanto a qualità di generazione e una più breve quanto ad analisi di contenuti lunghi; quello di Alibaba ha il contrario. Se il tuo compito è «trovare i tre minuti che contano in questa registrazione», il modello di generazione non è lo strumento giusto. Se il tuo compito è «produrre una clip di trenta secondi corrispondente a questo brief», nemmeno il modello di comprensione è lo strumento giusto.
Perché il confronto dei prezzi continua a sbagliare
Una tariffa al secondo e una tariffa per token non sono convertibili, e il tentativo di convertirle produce i due errori che dominano questo confronto. Il primo è confrontare un'intera clip generata con una tariffa per token di input e concludere che il modello video è centinaia di volte più costoso — il che è vero e privo di significato, perché non vendono la stessa cosa. Il secondo è confrontare solo i prezzi di input e non considerare che il taglio del 98% sull'audio di Alibaba si applica alle ore di audio in input, mentre la tariffa di Google si applica ai secondi di video in output, quindi i due "tagli" non sono nemmeno dalla stessa parte del contatore.
Ciò che si può dire onestamente è questo. Secondo la metodologia di Alibaba stessa — un campione di due minuti moltiplicato per trenta, video a 720p e un fotogramma al secondo — un'ora di input combinato di audio e video per Qwen3.8-Omni-Flash è quotata a circa $0,20, in calo da $3,27 rispetto alla generazione precedente. Generare quaranta secondi di video a 720p con Gemini Omni 1.1 Flash al prezzo pubblicato da Google di $0,10 al secondo costa $4,00, e realizzare una bozza degli stessi quaranta secondi a 360p si aggira intorno a $1,20 secondo la logica di Google del costo pari a un terzo. Entrambi i gruppi di cifre sono dichiarati dai fornitori e nessuno dei due è stato riprodotto in modo indipendente. La conclusione utile non è quale numero sia più piccolo, ma che analizzare un'ora di filmato e generarne quaranta secondi si collocano nello stesso ordine di grandezza — che è la vera ragione per cui una pipeline di produzione che fa entrambe le cose ha bisogno di un modello di costo, non di un vincitore.
Questo è anche l'argomento a favore di tenere i due su un'unica chiave anziché su due contratti. Nessuno dei due modelli omni è instradabile tramite OrcaRouter oggi: Qwen3.8-Omni-Flash gira solo sulle piattaforme di Alibaba stessa, e Google non ha aperto l'API video Omni all'instradamento di terze parti, quindi non ospitiamo nessuno dei due e non fingeremo il contrario. Ciò che è disponibile nel nostro catalogo è il fratello di ciascuna famiglia — Qwen3.8-Flash e Gemini 3.8 Flash — entrambi richiamabili oggi tramite un unico endpoint al prezzo di listino del fornitore con 0% di ricarico, ed è questo che rende un A/B contro i numeri di uno dei due vendor una questione di modifica di configurazione anziché una seconda integrazione.

Dove ciascuno vince, detto chiaramente
Qwen3.8-Omni-Flash vince su tutto ciò che si misura in ore di input: trascrizione e diarizzazione delle riunioni, riepilogo di registrazioni lunghe, uso agentico di strumenti ad alta intensità audio e costo per ora di contenuti multimediali elaborati. I suoi risultati audio riportati dal fornitore sono solidi e il suo punto debole è là dove il modello non è mai stato indirizzato — le classifiche a forte componente di ragionamento, dove le prime esecuzioni di terze parti lo collocano al 28º percentile sul ragionamento, con un dato di velocità al 21º, su un campione abbastanza piccolo che i numeri dovrebbero essere considerati uno spunto per testare più che un verdetto.
Gemini Omni 1.1 Flash vince sull'output: generazione di inquadrature con audio sincronizzato, continuità attraverso scene estese, controllo a livello di fotogramma e la finitura 4K che una pipeline di delivery potrebbe semplicemente richiedere. Il suo vantaggio non è un punteggio di benchmark — è che l'altro modello non è affatto in grado di svolgere il compito. Dove è più debole è in tutto ciò che richiede di mantenere un'ora di contesto, perché non è progettato per farlo.
La decisione, e la cosa da tenere d’occhio
Se devi scegliere tra loro, la domanda è quale metà della pipeline rimane non servita. Un team che genera già video e deve comprendere registrazioni lunghe dovrebbe testare Qwen3.8-Omni-Flash sul proprio audio questa settimana; un team che analizza contenuti multimediali e deve produrli dovrebbe testare Gemini Omni 1.1 Flash. Un team che ha bisogno di entrambi si trova davanti a due fornitori, due modelli di fatturazione e due integrazioni, ed è la situazione in cui un singolo livello di routing smette di essere una comodità e inizia a essere ciò che mantiene leggibile il modello di costo.
Due cose cambierebbero questa lettura. Una valutazione indipendente di Qwen3.8-Omni-Flash sostituirebbe ogni numero del fornitore sopra riportato con uno comparabile — non ne esiste ancora nessuno, e la sua assenza è la singola lacuna più grande in questo confronto. E una tariffa pubblicata per l'output 1080p e 4K da parte di Google renderebbe verificabile l'aritmetica di fascia alta; oggi quelle cifre circolano solo come stime di mercato anziché come listino proprio di Google.

Una nota conclusiva sull'inquadramento. "Omni" ha smesso di significare qualcosa di preciso — ora copre un modello che legge un'ora di audio di una riunione e uno che genera una clip di quaranta secondi con l'audio, e trattare la parola come una categoria è il modo in cui gli acquirenti finiscono per confrontare una tariffa per token con una tariffa al secondo e trarne una conclusione. I modelli sono complementari con una sovrapposizione limitata, e la postura corretta verso entrambi, cinque giorni e quattro settimane dopo i rispettivi rilasci, è la stessa: misurarli sul proprio materiale e tenere aperta una seconda strada.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
