
Qwen3.8-Omni-Flash vs Qwen 3.8: uno specialista Bill contro un flagship
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 984 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 196 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Se volete la versione breve: Qwen3.8-Omni-Flashè all'incirca tredici volte più economico per tokendi Qwen 3.8ed è l'unico dei due progettato per reggere un'ora di audio-video senza soffocare — mentre Qwen 3.8, il nucleo aperto da 2,4 trilioni di parametri in cima alla linea Qwen3.8, è quello che si usa quando la risposta deve essere giustaanziché economica, e l'unico dei due di cui si possono scaricare i pesi. Condividono una lunghezza di contesto, un nome di famiglia e una finestra di lancio da agosto a settembre. Non sono sostituti, e tutto il valore di questo confronto sta nel sapere quale domanda ci si sta effettivamente ponendo.
Per essere precisi sui nomi, perché la famiglia è affollata. Qwen 3.8qui indica il nucleo aperto mixture-of-experts 2.4T-A95B — il modello alla base dell'endpoint Qwen3.8-Max, che Alibaba ha svelato il 3 agosto 2026 e per cui ha pubblicato i pesi il 12 agosto, e che Artificial Analysis indicizza a 40 sul suo Intelligence Index. Qwen3.8-Omni-Flash è il modello omni-modale nativo che Alibaba ha messo in servizio API il 18 settembre 2026, costruito sulla linea architetturale Qwen3.8-Flash, che riceve in ingresso testo, immagini, audio e video e restituisce testo. Tutto ciò che riguarda il modello di punta è dichiarato dal fornitore o indicizzato in modo indipendente, come annotato; tutto ciò che riguarda il modello omni è dichiarato solo dal fornitore, perché ha poche ore di vita e nessuno al di fuori di Alibaba l'ha misurato.
Due modelli, una famiglia, brief di design opposti
La tentazione è leggerlo come un modello grande e un modello piccolo della stessa generazione, come leggeresti Qwen3.8-Max contro Qwen3.8-Flash. Quella lettura è sbagliata in un modo che costa denaro. Il Qwen 3.8 ha un nucleo che è un motore di ragionamento che accetta immagini e video; il suo throughput è misurato in token al secondo su problemi difficili, il suo prezzo è impostato per riflettere il costo di calcolo di un forward pass da 95 miliardi di parametri attivi, e la sua scheda di valutazione è una lista di classifiche di ragionamento e coding. Qwen3.8-Omni-Flash è un motore di percezione e azione che ragiona; il suo prezzo è impostato in base al costo di ingestione di ore di media, e la sua scheda di valutazione è una lista di classifiche di audio, video e tool-calling. Uno è ottimizzato per la profondità per token. L'altro è ottimizzato per i token per ora di contenuto.
Questa differenza emerge nel modo più netto in un punto che il marketing non menziona. Entrambi i modelli accettano circa un milione di token ed entrambi accettano video. Ma Qwen3.8-Omni-Flash è progettato esplicitamente attorno al problema della durata — fino a un'ora di audio-video continuo in una singola chiamata, con una modalità Agentic Understanding in cui il modello sceglie cosa campionare invece di elaborare ogni fotogramma, riducendo i token per query da 145.736 a 79.117 e aumentando al contempo l'accuratezza su OmniVideoBench da 63,4 a 67,8. Qwen 3.8 non ha alcun meccanismo equivalente pubblicato. Dargli in pasto due ore di video è possibile sulla carta; farlo a un prezzo che sopravviva al confronto con un team finanziario è una questione diversa, ed è la questione a cui il modello omni è stato costruito per rispondere.
Le dimensioni che in realtà lo decidono
• Prezzo — Qwen3.8-Omni-Flash $0,15 per milione di token in input e $0,47 per milione in output, contro Qwen 3.8 a $2,00 e $6,00. Lettura della cache: $0,016 contro $0,25.
• Pesi aperti — Qwen 3.8 ha pubblicato i pesi il 12 agosto 2026 con una licenza personalizzata; Qwen3.8-Omni-Flash è disponibile solo tramite API e Alibaba non ha dichiarato che verrà rilasciato.
• Contesto — un milione di token su entrambi i lati; 991K di input massimo sul modello omni, con 131K di output massimo e un budget di ragionamento di 262K.
• Durata dei media — fino a un'ora di audio-video continuo in una singola chiamata omni; il flagship è documentato per l'input video senza alcun dettaglio associato sui costi orari.
• Modalità di output — testo su entrambi i lati. Nessuno dei due genera parlato, nonostante la discendenza del modello omni.
• Punteggio indipendente — Qwen 3.8 si attesta a 40 sull'Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash non ha ancora alcun tipo di punteggio indipendente.

Perché le tabelle di benchmark non possono risolvere questa questione
Non esiste una classifica testa a testa, e non ce ne sarà una a breve. I materiali di lancio di Alibaba per Qwen3.8-Omni-Flashlo confrontano esclusivamente con Qwen3.5-Omni-Plus, il suo predecessore diretto, e con Gemini 3.8 Flash; i numeri del modello di punta provengono invece da un insieme del tutto diverso di valutazioni di ragionamento e di coding. I due fogli non condividono una sola riga. Chiunque pubblichi una tabella che li mette fianco a fianco su un unico asse si è costruito quell'asse da solo.
Ciò che si può dire onestamente è indicativo. Sui dati forniti dallo stesso venditore, il modello omni rappresenta un grande passo avanti rispetto alla linea omni che sostituisce — un guadagno medio superiore al 26% su circa trenta valutazioni, con WildClawBench-MM a 71,0, UniClawBench a 69,6, LongAudioSpan a 82,7 — e uno reale ma parziale rispetto a Gemini 3.8 Flash, dove è in vantaggio nelle board audio-centriche come SpotSoundBench (67,2 contro 39,7) e MMAU (81,8 contro 76,9) e in svantaggio sul puro video-reasoning AgenticVBench (36,8 contro 45,0). Sul fronte dei flagship, il punteggio Index di Qwen 3.8, pari a 40, è una misurazione indipendente e vale più di tutte quelle sopra. Questi sono tipi diversi di prove e non dovrebbero essere mediati insieme.

Un confronto dei costi svolto, con l'ipotesi dichiarata
Prendi un lavoro di analisi di documenti lunghi e video: 300.000 token in input e 20.000 token in output, una forma plausibile per una riunione registrata di novanta minuti con diapositive. Su Qwen3.8-Omni-Flash questo è 300.000 × $0,15 per milione = $0,045 di input e 20.000 × $0,47 per milione = $0,0094 di output, quindi circa 5,4 centesimi. Su Qwen 3.8 la stessa chiamata è 300.000 × $2,00 per milione = $0,60 e 20.000 × $6,00 per milione = $0,12, ovvero circa 72 centesimi. Poco più di tredici volte il costo per lo stesso numero di token.
Il numero che cambia la decisione non è il rapporto ma il volume. Con cento lavori di questo tipo al giorno, sono circa 5 $ al giorno contro circa 72 $ al giorno — la differenza tra una funzionalità che rilasci e una di cui riduci la portata. Ma se il compito è una singola estrazione difficile da un contratto da 300K token, dove una risposta sbagliata costa un’ora di revisione umana, il sovrapprezzo di 13 volte è irrilevante e il modello di ragionamento più forte vince grazie al primo errore che non commette. Stabilisci l’ipotesi prima di guardare la voce di prezzo, non dopo.
Dove ciascuno vince davvero
Qwen3.8-Omni-Flash vince su qualsiasi cosa si misuri in ore. Trascrizione di riunioni con diarizzazione ed estrazione delle attività di follow-up, riepilogo di video lunghi, report di ricerca audiovisiva, pipeline di captioning e qualsiasi agente che debba decidere da sé quale minuto di una registrazione conti. Il miglioramento della diarizzazione dichiarato dal fornitore — il tasso di errore sugli speaker di AliMeeting che scende da 88,11 a 3,35 — è il tipo di delta che trasforma una pipeline con revisione manuale in una automatizzata, sebbene un'analisi tecnica cinese del lancio sostenga che gran parte di quel guadagno derivi da ingegneria del front-end e della diarizzazione costruita attorno al modello più che dal modello stesso, quindi sottoponilo a benchmark sul tuo audio prima di dismettere la fase di revisione umana. Il modello omni vince inoltre nettamente sul prezzo per qualsiasi carico di lavoro testuale ad alto volume in cui la sua qualità testuale sia adeguata, che Alibaba sostiene essere comparabile a quella dei modelli solo testuali della stessa dimensione — un'affermazione non replicata, e che vale la pena verificare anziché dare per scontata.
Qwen 3.8 vince ovunque il risultato venga giudicato anziché contato: ragionamento complesso, lavoro agentico a lungo orizzonte, lavoro di codice su larga scala, analisi di documenti da un milione di token dove la sintesi è il prodotto finale. Vince anche su una dimensione che non ha nulla a che vedere con i benchmark — è open-weight. Se il tuo vincolo è la residenza dei dati, il deployment on-premise, il fine-tuning, o semplicemente non volere un fornitore nel percorso di inferenza, il modello omni non è affatto un candidato, e nessun vantaggio di prezzo colma quel divario. Quel singolo vincolo determina più deployment reali di tutti i numeri sopra.
Eseguirli senza due contratti
L'attrito pratico in un confronto come questo raramente è la scelta del modello; è che finisci per integrare due fornitori, due relazioni di fatturazione e due set di codice client per scoprire quale volevi.Qwen3.8-Max — l'endpoint che ospita il core aperto da 2,4 trilioni di parametri — è attivo su OrcaRouter con l'id del modello qwen/qwen3.8-max, a $2,00 per milione di token in input e $6,00 per milione in output, con una finestra di contesto di un milione di token e input di testo, immagini e video, insieme a più di 200 altri modelli con una sola chiave al prezzo di listino del provider con 0% di markup e failover automatico tra provider se un endpoint si degrada. Qwen3.8-Omni-Flash non è in quel catalogo — gira sulle piattaforme proprietarie di Alibaba — quindi la configurazione onesta oggi è il flagship sulla nostra rotta e il modello omni chiamato direttamente, con il livello di routing che ti dà un posto dove mettere il perdente del test una volta che l'hai eseguito.

Il verdetto
Scegli Qwen3.8-Omni-Flash quando l'input è lungo, l'output è breve e il volume rende il prezzo unitario il vincolo determinante. Scegli Qwen 3.8 quando l'input è denso, l'output è il prodotto e la correttezza o il controllo del deployment non ammettono compromessi. La zona di sovrapposizione — la comprensione video — è l'unico ambito in cui esiste un vero confronto testa a testa, e in quella zona il modello omni porta l'argomento costo e durata mentre il flagship porta l'argomento ragionamento e pesi aperti. Esegui entrambi sui tuoi dati prima di impegnarti; il modello omni non ha ancora una valutazione indipendente, e un vantaggio di prezzo del giorno di lancio è esattamente il tipo di cosa che vale la pena verificare su una fattura invece che su un annuncio.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
