Una card di titolo hero generata per Qwen3.8-Omni-Flash con la scritta "Una sola porta, nessun peso", con il sottotitolo "Il modello ha un unico host, nessun peso aperto, e i suoi primi punteggi non provenienti dal fornitore sono scarni" e quattro chip: "Esecuzione su: solo Alibaba", "Pesi: non rilasciati", "Punteggi indipendenti: nessuno", "Contesto: 1M token". Il logo di OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-Omni-Flash, cinque giorni dopo: una porta, nessun peso e i primi punteggi che non sono di Alibaba

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Cinque giorni dopo che il fornitore ha aperto Qwen3.8-Omni-Flash ai clienti API, il modello ha ancora esattamente una sola casa. Gira sulla piattaforma Qianwen dello stesso fornitore e sul suo servizio cloud Bailian; gli elenchi di terze parti comparsi dal lancio sono proxy davanti a quegli stessi endpoint, non un secondo luogo in cui il modello risiede. Non è stato rilasciato alcun peso. I dati del giorno del lancio — una riduzione del 98% sul costo di un'ora di audio, un guadagno medio del 26% rispetto a Qwen3.5-Omni-Plus, un milione di token di contesto, output solo testuale — restano del fornitore e non riprodotti. Ciò che è davvero cambiato in cinque giorni non è il modello, ma il terreno intorno a esso: è comparso un sottile strato di punteggi di terze parti, il supporto ai framework è arrivato dal giorno zero, e il confronto che tutti cercano è con Gemini 3.8 Flash anziché con il Qwen3.8-Flash accanto al quale questo modello è stato costruito. Ognuno di questi merita uno sguardo più attento di quello che la copertura del lancio gli ha dedicato.

La porta è una buona porta, ed è l'unica.

La disponibilità si è ampliata senza diventare plurale. Il modello risponde a una richiesta in formato OpenAI senza modifiche, il che significa che il codice client esistente funziona in gran parte; ciò che si rompe è l'endpoint, perché gli host internazionali e quelli della Cina continentale sono servizi separati con fatturazione separata. Il codice puntato al valore predefinito fallirà oppure verrà fatturato nella valuta sbagliata, e il discorso del prezzo orario vale solo sul lato internazionale. Le librerie client open source hanno fornito supporto day-zero per il modello, cosa genuinamente utile e che non costituisce un secondo provider: una libreria che parla con Bailian è un wrapper di comodo attorno alla stessa unica fonte di approvvigionamento.

Questo è il rischio strutturale che vale la pena nominare. Un modello a fonte unica non ha alcun percorso di failover. Se l'endpoint applica limiti di frequenza, si degrada, o una regione diventa irraggiungibile, non c'è nessun altro posto dove andare, e nessun livello di supporto delle librerie client cambia la situazione. È anche il motivo per cui dichiariamo apertamente la nostra posizione invece di lasciar intendere il contrario: Qwen3.8-Omni-Flash non è nel nostro catalogo. Non lo ospitiamo, e un lettore che si iscrive aspettandosi di instradarlo sarebbe tratto in inganno. Ciò che è instradabile è il resto della famiglia — Qwen3.8-Flash e Qwen3.8-Max sono entrambi attivi su la nostra API — e OrcaRouter trasferisce il prezzo di listino del provider con uno 0% di ricarico, quindi quando il prezzo del modello omni di Alibaba cambia, o il giorno in cui il modello omni diventa disponibile per l'instradamento, la modifica raggiunge i clienti lo stesso giorno invece che al rinnovo contrattuale successivo.

A generated single-model spec card for Qwen3.8-Omni-Flash with six rows reading 'Released: 18 Sep 2026', 'Context: 1M tokens', 'Media per call: up to 1 hour', 'Output: text only', 'Price: $0.15 in / $0.47 out per M', 'Independent score: none yet', and the footer 'Vendor-reported; no independent evaluation exists.' The OrcaRouter logo is composited in the bottom-right corner.

I primi punteggi che non sono di Alibaba sono scarni, e non sono lusinghieri.

Non esiste ancora nulla su Artificial Analysis per questo modello, e questa assenza è il titolo onesto dopo cinque giorni: le classifiche che tutti citano per i modelli adiacenti non hanno ancora una riga per quello omni. Il vuoto è stato colmato da qualcos'altro. Una piattaforma di valutazione di terze parti ha iniziato a pubblicare esecuzioni sul modello, e il suo riepilogo vale la pena di essere letto proprio per quanto non dice. Riporta la classificazione delle email con un'accuratezza del 99,0% (86° percentile), l'etica al 95,0% (23° percentile) e il ragionamento al 56,0%, che colloca nel 28° percentile e definisce una debolezza notevole; la velocità si colloca nel 21° percentile, il costo nel 58°, con un tasso di successo complessivo dell'89%.

Trattali con molta cautela, e non solo perché il campione è piccolo. La stessa pagina colloca il rilascio del modello al 20 settembre, due giorni dopo che Alibaba lo ha distribuito, non fornisce date di esecuzione per nessuno dei risultati e mostra una tabella di benchmark vuota sotto un riepilogo che descrive numeri che la tabella non contiene. Questo è il profilo di un sistema di test precoce e poco supervisionato, più che di una valutazione rigorosa, e la lettura onesta è che questi sono i primi punti dati non provenienti dal fornitore, non i primi affidabili. Sono un motivo per testare il modello personalmente, non un motivo per trarre conclusioni. La direzione, però, è coerente con ciò che i materiali del fornitore stesso lasciano intendere per omissione: questo è un modello di percezione e long-media, e le classifiche fortemente orientate al ragionamento non sono ciò a cui era destinato.

C'è anche una trappola nei risultati di ricerca che trarrà in inganno le persone per le prossime settimane. Qwen 3.8, il modello testuale, ha un Artificial Analysis Intelligence Index nella fascia dei quaranta, e quel numero è stato citato in più di un riassunto come se descrivesse il modello omni. Non è così. Sono modelli diversi con compiti diversi, e il modello omni non ha ancora alcun indice.

A headless screenshot of Alibaba's own Qwen site (qwen.ai) showing the Qwen3.8-Omni-Flash 'Conducting Deep Research with Audio and Video' demo page, with the model workflow panel, the timeline of a 40-minute video, and the English UI navigation.

La tabella di benchmark è ancora un singolo fornitore che si confronta con se stesso

Il dato di lancio — un miglioramento medio superiore al 26% su circa trenta valutazioni — è misurato interamente rispetto a Qwen3.5-Omni-Plus. Questo dice che la famiglia si è mossa. Non dice dove si colloca il modello rispetto a qualunque cosa tu stia già pagando, e nemmeno i confronti selettivi che hanno circolato insieme a esso colmano il divario. Il quadro riportato dal fornitore rispetto a Gemini 3.8 Flash è una vittoria autentica sulle board audio e una sconfitta su quelle che misurano il lavoro video agentico: WildClawBench-MM 71,0 contro 58,9 e SpotSoundBench 67,2 contro 39,7 da un lato, AgenticVBench 36,8 contro 45,0 e OmniGAIA 74,0 contro 78,6 dall'altro. Il linguaggio stesso del riepilogo di Alibaba — prestazioni audio-video che "si avvicinano" a Gemini, prestazioni audio complessive che lo superano — è più prudente dei titoli che ha prodotto, e la versione prudente è quella accurata.

• Contesto — 1M token, con un massimo di circa 991K input (circa 983K in modalità thinking) e 131K di output massimo.

• Modalità — testo, immagine, audio e video in input; solo testo in output. Nessuna generazione vocale nel modello di base.

• Durata — fino a un'ora di audio o audio-video continui per chiamata, il che rende possibile lavorare con riunioni e media di lunga durata senza suddivisione in blocchi.

• Copertura linguistica — riconoscimento in 74 lingue più 39 dialetti cinesi nei materiali di lancio, con cifre più ampie (113 lingue e dialetti) citate altrove per l'input audio.

Dettaglio sull'input — audio spaziale stereo e a quattro canali accettato, con la variante Realtime descritta come il primo modello omnimodale in grado di localizzare un target tramite il suo suono.

• Prezzo — 0,15 $ per milione di token di input, 0,016 $ in cache, 0,47 $ di output sul fronte internazionale, e un listino prezzi separato per la Cina continentale che non è comparabile.

Il 98% è reale, e non è il tuo conto

Secondo la metodologia di Alibaba stessa — un campione di due minuti moltiplicato per trenta, video campionato a 720p e a un fotogramma al secondo — un'ora di input audio scende da $0,28 a meno di $0,01, e un'ora di audio e video combinati da $3,27 a $0,20. Si tratta di riduzioni grandi, specifiche, dichiarate dal fornitore, e sono riduzioni su una singola voce. L'aritmetica che conta è quale quota del tuo carico di lavoro rappresenti quella voce. Una pipeline che spende la maggior parte dei suoi token in output, in contesto memorizzato nella cache o in fotogrammi video campionati più densamente di uno al secondo vedrà una variazione percentuale sulla fattura molto più piccola di quella promessa dal titolo, e il titolo riguarda l'input audio, non il totale. Aggiungi l'output solo testo e il divario si allarga di nuovo: qualsiasi cosa debba rispondere a voce ha bisogno di un secondo modello, e quel modello viene fatturato separatamente.

Questa è la parte del quadro in cui il routing dimostra il proprio valore. Il valore di un router pass-through non è uno sconto — è che il listino prezzi del fornitore stesso è ciò che paghi, e che un carico di lavoro può essere distribuito su diversi modelli, così che un modello a fonte unica sia un componente anziché una dipendenza. Un modello omni che è l'unica cosa che puoi chiamare è un singolo punto di guasto sia a livello di disponibilità sia a livello di prezzo.

A headless screenshot of the OrcaRouter models catalogue at www.orcarouter.ai/models, showing the model grid and the 'one API key, one bill' framing over the English-language site navigation.

Cosa ti direbbero davvero cinque giorni di produzione

Tre cose risolverebbero le questioni aperte. Una misurazione indipendente del risultato di diarizzazione su AliMeeting — un tasso di errore che scende da 88,11 a 3,35 e cpWER da 89,61 a 17,18 — mostrerebbe se ciò appartiene al modello o all'ingegneria di diarizzazione e front-end che lo circonda, ed è a quest'ultima che almeno un'analisi tecnica cinese attribuisce la maggior parte del guadagno. Un test riprodotto della riduzione dei token della modalità agentica, in cui l'accuratezza è salita da 63,4 a 67,8 su OmniVideoBench mentre i token per query sono scesi da 145.736 a 79.117, confermerebbe l'affermazione più utile in assoluto contenuta nel rilascio: che il modello può migliorare e diventare più economico allo stesso tempo. E una riga su Artificial Analysis o in un'arena trasformerebbe ogni numero di fornitore sopra riportato in qualcosa di comparabile, che è la precondizione perché il modello venga scelto anziché semplicemente provato.

Fino ad allora, l'atteggiamento che ha senso è quello che vale per qualsiasi modello di appena cinque giorni con un solo host e nessuna valutazione indipendente: vale la pena misurarlo sul proprio audio e video, non vale la pena renderlo l'unico percorso attraverso la propria pipeline. Se il tuo carico di lavoro è l'analisi di riunioni o media long-form in cinese o inglese e i tuoi costi sono dominati dalle ore di input anziché dai token di output, la convenienza economica in gioco è abbastanza forte da giustificare un test questa settimana. Se il tuo carico di lavoro richiede output vocale, o richiede un fallback quando un provider si degrada, il modello così com'è oggi non può essere la risposta completa — e nessuna quantità di supporto del framework dal giorno zero lo cambia.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno