
Qwen3.8-Omni-Flash è qui: contesto da 1M token, audio più economico del 98%, solo output testuale
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il lancio ha aperto Qwen3.8-Omni-Flash ai clienti API oggi, 18 settembre 2026, e il numero con cui si è presentato è una bolletta più che un punteggio. Per ogni ora di audio in ingresso, Qwen afferma che il nuovo modello costa il 98% in meno rispetto al suo predecessore Qwen3.5-Omni-Plus; per ogni ora di audio e video combinati, il 93% in meno. Tutto il resto dell'annuncio discende da questa impostazione. Qwen3.8-Omni-Flash è un modello nativamente omni-modale — testo, immagini, audio e video in ingresso, un milione di token di contesto, fino a un'ora intera di audio-video continuo all'interno di una singola chiamata — e Alibaba non lo vende come un descrittore di contenuti multimediali migliore, ma come il primo modello Qwen progettato per agire su di essi. Lo slogan è "Omni Senses. Agentic Delivery." Il punto debole, dichiarato apertamente negli stessi materiali, è che il modello risponde solo in testo: ascolta e guarda, ma non parla.
Nulla di quanto segue è stato riprodotto in modo indipendente. Il modello ha poche ore di vita, non esiste ancora alcuna valutazione di terze parti e ogni dato di benchmark e ogni cifra di prezzo nei materiali di lancio è di Alibaba stessa. Laddove un numero è riportato dal fornitore, questo articolo lo dice nella frase che lo contiene; laddove una lettura proviene da un critico anziché dal fornitore, viene attribuita. L'unica cosa che èoggi verificabile in modo indipendente — che il modello è attivo sulle piattaforme di Alibaba e non nel catalogo di nessun altro — è proprio la cosa di cui il lancio ha meno voglia di parlare.
Cosa è stato effettivamente spedito
La scheda tecnica è insolitamente pulita per un lancio omnimodale, il che è di per sé la notizia: la generazione precedente di modelli omni di questa famiglia era assemblata a partire da encoder di percezione separati avvitati su un LLM testuale, mentre questo è costruito direttamente sulla Qwen3.8-Flash linea architetturale, con le modalità gestite in modo nativo anziché innestate a posteriori.
• Input — testo, immagine, audio e video, con audio spaziale stereo e a quattro canali accettato; l'output è solo testo.
• Contesto — un milione di token, con input massimo di circa 991K (circa 983K in modalità di pensiero), output massimo di 131K e un budget di ragionamento che arriva a 262K.
• Durata — fino a un'ora di audio o audio-video continui per chiamata, che è il numero che rende possibili i casi d'uso di riunioni e video lunghi senza suddivisione in blocchi.
• Copertura vocale — riconoscimento in 74 lingue e generazione vocale in 29 negli strumenti circostanti; un resoconto in lingua cinese del rilascio afferma 113 lingue e dialetti per l'input audio.
• Disponibilità — la piattaforma AI Qianwen e Alibaba Cloud Model Studio (Bailian), con l'id API qwen3-8-omni-flash. I pesi non vengono rilasciati. Una variante Realtime è descritta come il primo modello omni-modale con localizzazione della sorgente sonora.

Il 98% è un'affermazione sui costi, e l'aritmetica che ci sta dietro vale la pena di essere vista
Una riduzione del 98% del costo di un'ora di audio è un numero molto più grande di una riduzione del 98% del prezzo di un token, ed è proprio nel divario tra queste due cose che l'annuncio fa il suo lavoro. La cifra oraria si ricava prezzando un campione di due minuti e moltiplicando per trenta, con il video campionato a 720p e un fotogramma al secondo. È un modo legittimo di quantificare un carico di lavoro di produzione, ed è anche una descrizione di ciò che si chiede al modello di osservare: un fotogramma al secondo basta per sapere cosa è stato detto e all'incirca cosa è successo sullo schermo, ma non è neanche lontanamente sufficiente per ispezionare operazioni a livello di singolo fotogramma, valutare la qualità del montaggio o individuare un artefatto su un solo fotogramma. Qui si moltiplicano tra loro due cambiamenti — un vero e proprio taglio del prezzo unitario e una politica di campionamento molto più aggressiva — e solo il primo rappresenta un miglioramento del modello.
I prezzi unitari in sé sono concreti. Il prezzo internazionale è indicato a 0,15 $ per milione di token di input, 0,016 $ per milione di token di input in cache e 0,47 $ per milione di token di output. Il prezzo nazionale di Bailian è indicato a 0,8 ¥ per milione per l'input multimodale, in calo rispetto a circa 18 ¥. Si noti che i sistemi di fatturazione internazionale e della Cina continentale sono separati e le cifre non sono intercambiabili; chiunque le confronti direttamente otterrà una risposta errata.
Questa è la parte del rilascio in cui il routing conta più del solito. OrcaRouter trasferisce il prezzo di listino del provider a 0% di ricarico, così un taglio di prezzo di questo tipo da parte di un fornitore raggiunge i nostri clienti il giorno stesso in cui viene applicato, anziché al rinnovo contrattuale successivo. Un confronto realmente verificabile è già presente nel nostro catalogo: Qwen3.8-Flash, il modello multimodale accanto al quale questo è costruito, è instradabile oggi a 0,15 $ per milione di token in input e 0,47 $ per milione in output — lo stesso prezzo di listino che Alibaba indica per il nuovo modello omni — e ha veicolato 2,47 miliardi di token di traffico attraverso la nostra API nei sette giorni precedenti alla stesura di questo testo, il che è una misura attendibile di quanto appetito abbia già questo livello. Il modello omni in sé non è ancora nel nostro catalogo, e finché non lo sarà, gira sulle piattaforme di Alibaba e da nessun'altra parte. Non abbiamo intenzione di fingere il contrario.
Ogni benchmark nel lancio confronta una sola cosa
Il dato principale è un miglioramento medio di oltre il 26% su circa 30 valutazioni — e ognuna di quelle valutazioni è contro Qwen3.5-Omni-Plus. È il baseline giusto per un lancio, e anche ristretto: ti dice che la famiglia si è mossa, non dove si è collocata rispetto a qualsiasi cosa per cui potresti già stare pagando.
I singoli valori, tutti dichiarati dai fornitori: WildClawBench-MM 71,0, in rialzo di 36,5 punti e il maggiore movimento singolo del set; UniClawBench 69,6; AgenticVBench in aumento di 22,3 punti a 36,8; LongAudioSpan 82,7, in aumento di 8,3; OmniVideoBench 63,4, in aumento di 9,6; OmniCap-IF 28,2. La coppia più eclatante è la diarizzazione dei parlanti su AliMeeting, dove il tasso di errore scende da 88,11 a 3,35 e cpWER da 89,61 a 17,18 — un balzo abbastanza grande da meritare un esame approfondito anziché applausi. Un'analisi tecnica cinese del lancio sostiene esattamente questo, attribuendo il miglioramento in larga misura all'ingegneria del front-end e della diarizzazione costruita attorno al modello anziché al ragionamento proprio del modello, e avvertendo che il sistema appare specializzato nell'ascolto, con un ragionamento video profondo comparativamente più debole. Questa è l'interpretazione di un critico, non una replica misurata, ma la dimensione del delta è il motivo per cui vale la pena tenerlo a mente.

L'altro numero su cui vale la pena soffermarsi non è affatto un punteggio. In quella che Alibaba chiama modalità Agentic Understanding, il modello decide da solo cosa guardare e ascoltare invece di elaborare ogni fotogramma, raccogliendo prove in round dal grossolano al fine. Su OmniVideoBench quella modalità aumenta la precisione da 63,4 a 67,8 riducendo al contempo token per query da 145.736 a 79.117 — una riduzione del 45,7%. Precisione in aumento e costo in calo simultaneamente è l'affermazione più forte del rilascio, ed è quella che supporta più direttamente la proposta agentica.
Il confronto con Gemini è più limitato di quanto la copertura suggerisca
La posizione di Alibaba è che la capacità audio-video «si avvicina» a Gemini 3.8 Flash, mentre la performance audio complessiva la supera. Tolta la cornice, i confronti riportati dal fornitore appaiono così. WildClawBench-MM: 71,0 contro 58,9. SpotSoundBench: 67,2 contro 39,7. MMAU: 81,8 contro 76,9. DailyOmni: 85,1 contro 84,0. Sono divari reali sull'audio e sull'uso di strumenti incentrati sull'audio. Sono anche selettivi. Su AgenticVBench, la classifica di puro ragionamento video, l'ordine si inverte — Gemini a 45,0 contro il 36,8 di Qwen — e la stessa Alibaba ammette che Gemini è ancora in testa in diversi test di comprensione video. Un riassunto ragionevole è che Qwen ha conquistato la metà audio dell'omni ed è ancora indietro sulla metà video, il che è un'affermazione diversa da quella con cui sono usciti i titoli.
"Il primo modello omnimodale di Qwen" ha bisogno di un qualificatore
La narrazione secondo cui Qwen3.8-Omni-Flash sia il primo modello omni-modale di Qwen è circolata ampiamente oggi e vale la pena essere precisi al riguardo, perché la famiglia ha un esponente precedente che può a buon diritto rivendicare quel titolo. Qwen2.5-Omni, un modello open-weight da 7B rilasciato a marzo 2025 con un'architettura Thinker-Talker, accettava in input anche testo, immagini, audio e video — e generava sia parlato sia testo. Ciò che qui è davvero un primato è la nativa omni-modalità: un unico modello costruito sulla Qwen3.8-Flash come base, anziché un LLM testuale con encoder di percezione aggiunti, più un design brief improntato all'agente fin dall'inizio. Entrambe le affermazioni sono vere; solo una delle due è quella che è stata ripetuta. Se state valutando il modello partendo dal presupposto che nessun modello omni di Qwen esistesse prima di questa settimana, attribuirete un prezzo sbagliato al percorso di aggiornamento da Qwen2.5-Omni, un confronto che abbiamo trattato in un articolo a parte.
Il tooling è dove risiede davvero la promessa agentica
Due cose sono state rilasciate insieme al modello, e contano più di quanto suggerisca la scheda del modello, perché sono ciò che trasforma la percezione in risultati concreti. Qwen-MM-Plugins è una suite di plugin multimodale per harness di agenti che offre a un agente esterno la comprensione di immagini, audio, video e documenti, oltre alla memoria per video lunghi e al montaggio video; dichiara il supporto per Codex, Claude Code, Qwen Code, Gemini CLI e vari altri, e include strumenti con nomi specifici tra cui Video2Note, che trasforma ore di video in note PDF illustrate. Qwen-Live Harness è un runtime open source per l'interazione omni-modale continua in tempo reale, che agisce come livello di scheduling in cui un utente conversa in diretta e delega il lavoro più pesante ad agenti in background. Un avvertimento dalla copertura del giorno del lancio: la pagina GitHub di Qwen-Live Harness restituiva un 404 quando Gigazine l'ha controllata, quindi considera gli strumenti come annunciati anziché verificati finché i repository non saranno disponibili.
La frase che il lancio seppellisce: non parla
Per un modello il cui predecessore generava parlato, il fatto che Qwen3.8-Omni-Flash sia multimodale in ingresso e testuale in uscita è la riga più significativa della specifica, e nei materiali compare in gran parte come una nota a piè di pagina. Significa che il modello non può essere inserito da solo in un prodotto speech-to-speech. Qualsiasi doppiaggio, agente vocale o conversazione in tempo reale basati su di esso richiedono una fase esterna di sintesi vocale e, per il video, un renderer esterno — ed è esattamente per questo che esistono la suite di plugin e il live harness. La conseguenza pratica è una pipeline con più parti in movimento di "un unico modello omni", e una latenza che deve essere preventivata su tutte quante.
C'è una dimostrazione efficace del divario, e di ciò per cui il modello è utile, nascosta nel rilascio. In un esperimento di "modello che ottimizza modello", Qwen3.8-Omni-Flash ha migliorato autonomamente il riconoscimento del dialetto del Sichuan di Qwen2.5-Omni-3B, riducendo il tasso di errore sui caratteri da 25,79% a 15,30% nell'arco di dodici ore e costruendo 3.413 campioni di addestramento in quattro round. Un modello in grado di diagnosticare e riparare la gestione dei dialetti di un fratello minore sta facendo qualcosa che un'API di trascrizione non può fare. Questo, più della tabella di benchmark, è l'argomento più chiaro su cosa dovrebbe significare "agentico" in questo contesto.

Cosa cambierebbe la nostra lettura
La situazione reale, a essere onesti, è che questo è un lancio ben definito, con una narrativa convincente sul prezzo, nessuna valutazione indipendente e almeno una limitazione strutturale che l'annuncio minimizza. Tre cose sarebbero decisive. Una scheda su Artificial Analysis o LMArena trasformerebbe i numeri del fornitore in dati comparabili, e non ne esiste ancora nessuna. Un test di terze parti della riduzione dei token del 45,7% — l'affermazione che l'accuratezza aumenta mentre il costo diminuisce — confermerebbe il risultato più utile e meno appariscente del rilascio. E una misurazione indipendente della diarizzazione di AliMeeting mostrerebbe se il calo di 88 punti appartiene al modello o alla pipeline che lo circonda.
Fino ad allora, la disposizione sensata è quella che si applica a qualsiasi modello al suo primo giorno: vale la pena testarlo, non vale la pena puntarci un percorso di produzione. Se stai già instradando tramite OrcaRouter, la mossa pratica è mantenere il carico di lavoro sui modelli che hai misurato e trattare Qwen3.8-Omni-Flash come un candidato da mettere alla prova contro di essi sul tuo audio e video, anziché sulla tabella di benchmark di uno dei due fornitori. Se il tuo caso d'uso è l'analisi di riunioni o contenuti media di lunga durata in cinese e inglese, l'economia dei token in questo caso è abbastanza solida da giustificare subito il test.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
