Una scheda del titolo principale per il confronto "Qwen3.8-Omni-Flash vs Qwen2.5-Omni", con l'occhiello "A diciotto mesi di distanza - da marzo 2025 a settembre 2026", il sottotitolo "Un contesto trenta volte più ampio, un'ora di contenuti multimediali invece di secondi - e l'unica cosa che il modello più vecchio poteva fare e che quello più nuovo non può", e tre pillole statistiche con scritto "Contesto: da 32K a 1M", "Media per chiamata: da secondi a 1 ora" e "Output vocale: solo modello 2025".
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni: dopo 18 mesi, l'aggiornamento ha perso la voce

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ecco il fatto che rende questo confronto più interessante di un semplice aggiornamento generazionale. Il modello più vecchio sa parlare e quello più nuovo no. Qwen2.5-Omni, rilasciato a marzo 2025, accettava in input testo, immagini, audio e video e rispondeva in testo o con parlato naturale in streaming, in un unico modello end-to-end che potevi scaricare. Qwen3.8-Omni-Flash, rilasciato il 18 settembre 2026, gestisce le stesse quattro modalità su una finestra di contesto trenta volte più ampia, elabora un'ora di audio-video continuo laddove il suo antenato ne gestiva pochi secondi, e restituisce solo testo. Diciotto mesi di lavoro hanno portato un'assunzione di dati enormemente più ampia e hanno sacrificato il canale di output. Che si tratti di un progresso o di un compromesso dipende interamente da ciò per cui usavi il vecchio modello — e la risposta si divide nettamente in due.

I dati relativi a Qwen2.5-Omni sono del fornitore, tratti dai suoi materiali di lancio del marzo 2025, e diciotto mesi di ampia diffusione li hanno in parte convalidati. Anche i dati relativi a Qwen3.8-Omni-Flash sono di Alibaba, tratti dai materiali di lancio pubblicati poche ore prima della stesura di questo testo, e nulla in essi è stato riprodotto in modo indipendente. Quando un'affermazione proviene da un critico anziché dal fornitore, viene attribuita come tale. L'unico fatto strutturale che non richiede verifica è anche il più significativo: Qwen2.5-Omni è a pesi aperti e scaricabile, mentre Qwen3.8-Omni-Flash non lo è.

Cos'era Qwen2.5-Omni e perché era importante

Quando è stato rilasciato il 26 marzo 2025, Qwen2.5-Omni è stato il primo modello omni-modale end-to-end della famiglia — il lancio lo presentava come la risposta al problema dello "zoo di specialisti", in cui trascrizione, visione e voce richiedevano ciascuna un modello separato e un livello di raccordo separato. Il modello 7B gestiva tutte e quattro le modalità di input e sia l'output testuale sia quello vocale, rivendicava risultati allo stato dell'arte sul benchmark di fusione OmniBench davanti a Gemini-1.5-Pro, e riportava un punteggio di qualità della generazione vocale di 4,51 che Alibaba descriveva come di livello umano. Una variante 3B seguiva la stessa architettura.

L'ingegneria che lo ha reso possibile merita di essere nominata, perché il nuovo modello non la utilizza. Thinker-Talker divideva il lavoro in due: un transformer Thinker fondeva gli encoder audio e immagine e produceva semantica e testo, mentre un Talker trasmetteva token vocali dagli stati nascosti del Thinker, condividendo l'intera cronologia conversazionale. RoPE multimodale allineato temporalmente (TMRoPE) interlacciava le posizioni video e audio affinché i due flussi rimanessero sincronizzati. Lo streaming a blocchi permetteva agli encoder di occuparsi della percezione mentre il modello linguistico gestiva sequenze lunghe, ed è ciò che ha reso possibili risposte vocali a bassa latenza. Due voci fisse erano incluse, Chelsie ed Ethan.

I vincoli erano altrettanto reali. Il contesto era 32.768 token. La memoria era il limite vincolante molto più della potenza di calcolo: le tabelle di Alibaba stessa indicano l'inferenza BF16 con FlashAttention-2 a circa 31 GB di memoria GPU per un video di 15 secondi, 42 GB per 30 secondi e 60 GB per un minuto intero. Un minuto di video, su un modello 7B, su una delle più grandi GPU singole che si potessero noleggiare. Quel numero è quello da tenere presente, perché è il numero che il modello del 2026 è stato costruito per distruggere.

Che cos'è Qwen3.8-Omni-Flash

Il nuovo modello è nativamente omni-modale anziché assemblato — costruito direttamente sulla Qwen3.8-Flash linea architetturale, e non come un LLM testuale con encoder di percezione aggiunti a posteriori, il che rappresenta una differenza strutturale e non solo un'etichetta generazionale. Accetta testo, immagini, audio e video, inclusi audio spaziale stereo e a quattro canali, e restituisce testo su un contesto da un milione di token con un input massimo di circa 991K, un output massimo di 131K e un budget di ragionamento di 262K. Gestisce fino a un'ora di audio-video continuo per chiamata. Il riconoscimento vocale copre 74 lingue, mentre la generazione vocale per 29 lingue è gestita dagli strumenti circostanti anziché dal modello. È disponibile sulla piattaforma Qianwen AI e su Alibaba Cloud Model Studio con l'id qwen3-8-omni-flash, a 0,15 $ per milione di token di input e 0,47 $ per milione di output, con l'input in cache a 0,016 $.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Diciotto mesi, dimensione per dimensione

• Contesto — Qwen2.5-Omni 32.768 token rispetto a Qwen3.8-Omni-Flash a un milione, un aumento di circa trenta volte.

• Durata dei media — secondi di video, limitati dalla memoria della GPU, rispetto a un'ora di audio-video continuo in un'unica chiamata ospitata.

• Output — testo più voce naturale in streaming sul vecchio modello; solo testo sul nuovo.

• Deployment — Qwen2.5-Omni è open-weight con licenza Apache-2.0, scaricabile da Hugging Face e ModelScope; Qwen3.8-Omni-Flash è disponibile solo tramite API e non è stato annunciato alcun rilascio dei pesi.

• Hardware — 7 miliardi di parametri che richiedono fino a ~60GB di memoria GPU per un minuto di video, contro un endpoint ospitato che non devi affatto predisporre.

• Prezzo — il vecchio modello ti costa una GPU; il nuovo costa $0,15 per milione di token di input, e Alibaba sostiene che l'input audio per ora sia il 98% più economico rispetto alla generazione Qwen3.5-Omni-Plus che sostituisce.

• Generazione vocale — due voci fisse nel 2025, contro 29 lingue di generazione vocale nel tooling del 2026, nessuna delle quali prodotta dal modello stesso.

Il mestiere che nessuno ha pubblicizzato

Leggendo insieme le due schede tecniche, la forma degli ultimi diciotto mesi diventa chiara. Alibaba ha speso questo intervallo per risolvere l'assorbimento — quanti contenuti multimediali un modello può assorbire, con quanta convenienza, e quanta parte delle decisioni può prendere da solo. Qwen3.8-Omni-Flash è un trionfo su questo asse. La modalità Agentic Understanding, in cui il modello sceglie cosa campionare invece di elaborare ogni fotogramma, riduce i token per query da 145.736 a 79.117, aumentando al contempo l'accuratezza su OmniVideoBench da 63,4 a 67,8, e il fornitore riferisce che l'errore di diarizzazione dei parlanti su AliMeeting crolla da 88,11 a 3,35.

Ciò che l'intervallo non ha reso prioritario è l'output. Il trucco distintivo del modello 2025 — un unico modello che ti ascolta e risponde a voce, end to end, senza un sintetizzatore vocale separato — non ha un successore qui. Se hai creato un agente vocale, una pipeline di doppiaggio o uno strumento di accessibilità sul Talker di Qwen2.5-Omni, il modello 2026 non è un suo aggiornamento; è un componente su cui dovresti innestare una nuova fase di sintesi vocale, aggiungendo latenza e un fornitore a una pipeline che prima non aveva né l'una né l'altro. I materiali di lancio sono onesti al riguardo se leggi attentamente la riga sulle modalità, ma non è la notizia principale, e chiunque esegua la migrazione partendo dal presupposto che "omni" significhi la stessa cosa in entrambi i rilasci scoprirà la differenza in produzione.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Perché il modello 2025 ha ancora un lavoro

Tre ragioni, e nessuna è la nostalgia. La prima è la voce, come sopra. La seconda sono i pesi aperti: 32K di contesto e un footprint da 7B gireranno su hardware che controlli tu, offline, senza che alcun dato lasci l'edificio e senza contatore per token — l'unica opzione se il tuo audio è soggetto a una regola di residenza o se il tuo budget di latenza vieta un round trip. La terza è il costo a volumi molto bassi. Una GPU che già possiedi è gratuita al margine; i $0,15 per milione di token del modello ospitato sono economici ma non zero, e il costo fisso di provisioning rispetto a esso è reale per un carico di lavoro che gira due volte a settimana.

L'obiezione è che i vincoli del vecchio modello si fanno sentire sempre più pesantemente ogni anno. Un minuto di video, 32K di contesto e nessuna chiamata a strumenti né output strutturato in un mondo in cui gli agenti sono la forma di distribuzione predefinita rappresentano un margine ristretto. Per una pipeline che deve acquisire riunioni registrate, Qwen3.8-Omni-Flashnon è semplicemente migliore — è la differenza tra il possibile e il non possibile, perché il modello del 2025 non può fisicamente contenere l'input.

Vale la pena essere concreti su quanta vita sia rimasta nei vecchi pesi, perché "legacy" non rende loro giustizia. Il Qwen2.5-Omni-7B repository ha registrato 343.676 download nell'ultimo mese quando lo abbiamo controllato il 18 settembre 2026, con circa un centinaio di Spaces della community e dozzine di fine-tuning, adapter e quantizzazioni costruiti sopra. Qualunque cosa faccia il flagship, una vasta popolazione di persone sta ancora rilasciando sul modello del 2025 — e, cosa notevole, Hugging Face non ha elencato alcun provider di inferenza che lo distribuisse, il che significa che quasi tutto quell'utilizzo è self-hosted.

Il nuovo modello migliora quello vecchio.

Il dettaglio più strano e più convincente del lancio è sepolto verso la fine dei materiali. In un esperimento che Alibaba descrive come un modello che ne ottimizza un altro, Qwen3.8-Omni-Flash ha migliorato autonomamente il riconoscimento vocale del dialetto del Sichuan di Qwen2.5-Omni-3B — il fratello minore del modello che nominalmente sostituisce — riducendo il tasso di errore sui caratteri da 25,79% a 15,30% nell'arco di dodici ore e creando 3.413 campioni di addestramento in quattro round.

Questo è un argomento più forte a favore del modello più recente di qualsiasi benchmark incluso nella release, e ridefinisce il rapporto tra i due. Il modello 2026 non è solo un sostituto di quello 2025; è uno strumento che rende migliori i pesi del 2025. Se usi Qwen2.5-Omni in produzione per una lingua o un dialetto che gestisce male, la strada pratica può essere mantenere il deployment e usare il nuovo modello per costruire i dati di addestramento, invece di migrare il carico di lavoro. Nota, però, che questa è una dimostrazione dichiarata dal fornitore, senza una metodologia pubblicata, e va considerata un aneddoto incoraggiante più che una ricetta riproducibile.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Se stai migrando

La decisione raramente si riduce a un solo modello. Un team che abbandona un modello omni self-hosted sceglie tra tre forme: restare sui pesi aperti e continuare a fare provisioning, passare a un'API di un fornitore e rinunciare al controllo, oppure suddividere il carico di lavoro in modo che solo la parte che richiede un input da un milione di token vada al modello ospitato. Quella terza opzione di solito è quella giusta ed è anche quella che la gente salta, perché sembra più lavoro di quanto non sia — il fine-tune sul dialetto su cui hai speso un mese non deve essere buttato via solo perché la fase di sintesi delle riunioni si è spostata.

Dove il routing aiuta è nelle giunture. OrcaRouter ti offre una sola chiave per oltre 200 modelli con markup dello 0% sul prezzo di listino del provider e failover automatico se un endpoint si degrada, il che significa che la metà ospitata di una pipeline suddivisa non ha bisogno di un proprio contratto, del proprio codice client e del proprio monitoraggio prima di sapere se il carico di lavoro giustifica tutto ciò. Per essere chiari su cosa non facciamo: nessuno dei modelli omni è nel nostro catalogo — entrambi girano sulle piattaforme di Alibaba o sul tuo hardware — quindi questa è una decisione di routing che stai prendendo attorno ai modelli, non attraverso di noi.

Chi dovrebbe muoversi, e chi no

Passa se il tuo carico di lavoro è audio o video di lunga durata, se 32K di contesto è ciò che impedisce a una pipeline di esistere, se ti serve un comportamento agentico sui media, oppure se la diarizzazione dei parlanti su larga scala è il problema che hai. Rimani se ti serve che il modello parli, se il tuo audio non può lasciare la tua infrastruttura, se dipendi dai pesi specifici di Qwen2.5-Omni che hai già messo a punto, o se il tuo volume di chiamate è abbastanza basso che una GPU di tua proprietà batte un contatore.

Il riassunto scomodo è che questa è meno una sostituzione che una biforcazione nella linea di prodotto. Alibaba ha impiegato diciotto mesi per costruire il miglior modello di input possibile e non ha costruito un successore per la metà dedicata all'output. Se il tuo lavoro si svolge sul lato input, l'aggiornamento è quasi obbligatorio. Se si svolge sul lato output, il modello 2025 è ancora la cosa più recente che fa ciò di cui hai bisogno — e vale la pena saperlo prima di pianificare una migrazione che eliminerebbe silenziosamente una funzionalità da cui dipendi.