Card hero del titolo per l'articolo 'Qwen3.8-Flash-Next — LEAK REPORT' con un badge 'NON VERIFICATO — ANTEPRIMA DELL'ARCHITETTURA QWEN4', il sottotitolo 'Alibaba distribuisce l'architettura Qwen4 prima del modello', tre chip con le scritte 'Fonte: @kimmonismus', '25 agosto 2026' e 'Rilascio: 26 agosto 2026 23:00 UTC+08', una card a sinistra con la scritta 'L'affermazione: un MoE multimodale open-weight che anticipa l'architettura Qwen4' e una card a destra con la scritta 'Stato: pesi non ancora rilasciati, ~24h al rilascio'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-Flash-Next È Uscito: Alibaba Distribuisce l'Architettura Qwen4 Prima Che Qwen4 Esista

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen3.8-Flash-Next ha finalmente numeri che Alibaba non ha prodotto — e non dicono ciò che sostiene la versione più clamorosa della storia. Sull'Artificial Analysis Intelligence Index, ricalcolato alla v4.3 il 7 settembre, l'anteprima open-weight di Alibaba ottiene 40 punti e si classifica al quinto posto tra i 113 modelli della sua classe di confronto. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — il modello con cui viene continuamente messo a confronto — ottiene 35 punti e si classifica al nono posto. Non è parità; è un vantaggio di cinque punti per il modello più piccolo. È anche il primo tabellone di valutazione ampio e indipendente a prendere in esame un modello i cui unici numeri pubblicati, fino a questo mese, erano quelli del fornitore stesso. Il modello in sé non è nuovo: i pesi sono stati resi disponibili su Hugging Face il 24 agosto e il rilascio ufficiale su ModelScope è arrivato il 26 agosto. Ciò che è cambiato questo mese è che ora un lettore può verificare le affermazioni invece di prenderle per buone.

L'invito a tornare su questo post è arrivato da @teortaxesTex su X, che ha chiesto se l'anteprima sia silenziosamente sottovalutata: secondo quanto si dice, allo stesso livello Artificial Analysis di DeepSeek V4 Flash 0731, «quasi 4 volte più piccola», con «quasi 3 volte meno parametri attivi». Due di queste tre affermazioni non sopravvivono al confronto con i dati pubblicati — e la correzione va a favore del modello, perché sui numeri che contano l'anteprima è avanti rispetto al suo termine di paragone, non alla pari con esso.

Cominciamo dalle dimensioni, dove i numeri sono inequivocabili. Qwen3.8-Flash-Next memorizza circa 180B parametri — un corpo mixture-of-experts da 125B, una tabella di embedding n-gram separata da 51B e circa 4B di livelli di multi-token-prediction — e ne attiva 6B per token. DeepSeek V4 Flash 0731 ne memorizza 284B e ne attiva 13B. Questi sono i valori riportati sulla model card di Qwen e nella documentazione di DeepSeek, e sono i valori che Artificial Analysis riporta su entrambe le pagine dei modelli. I rapporti che ne derivano sono 1.6x sui parametri memorizzati e 2.2x sui parametri attivi. Questa è una storia di efficienza autentica, ed è il motivo per cui questa architettura conta — ma non è 4x e non è 3x. Non siamo riusciti a trovare da nessuna parte un dato pubblicato che supporti i moltiplicatori più elevati. Se l'intento era l'occupazione di memoria in fase di servizio anziché il conteggio dei parametri, nemmeno quel numero è pubblicato.

Cosa è stato annunciato?

Aliba​ba ha pubblicato l'architettura Qwen4 prima di pubblicare un modello Qwen4. Qwen3.8-Flash-Next — un modello mixture-of-experts multimodale a pesi aperti, costruito sull'architettura di nuova generazione che alimenterà la famiglia Qwen4 — è arrivato in due fasi: il repository ufficiale Qw​en/Qwen3.8-Flash-Next è andato live su Hugging Face il 24 agosto, due giorni prima del rilascio ModelScope a cui puntava il timer del teaser. Il rilascio formale su ModelScope è arrivato il 26 agosto alle 23:00 UTC+08:00, con la variante Qwen3.8-Flash servita, prezzata nello stesso momento. L'affermazione di punta della scheda, che da allora continua a circolare, è che un modello che attiva 6B parametri per token batte Claude Opus 4.6 Max su 8 dei 9 benchmark comparabili nella tabella di Aliba​ba stessa. La famiglia Qwen4 completa, continua a dire Aliba​ba, arriverà più tardi.

Se non avete seguito il ritmo di Alibaba questo mese, il punto di riferimento è Qwen3.8-Max — il modello di punta da 2,4 trilioni di parametri rilasciato il 3 agosto e reso open source come Qwen3.8-2.4T-A95B meno di due settimane dopo. I pesi di Qwen3.8-Flash-Next sono disponibili meno di un mese dopo. Lo stesso laboratorio che ha pubblicato un modello open-weight da 2,4 trilioni di parametri ora distribuisce l'architettura per la generazione successiva, prima ancora che il modello di punta di quella generazione abbia un nome.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

La parte che vale la pena rileggere è la stessa impostazione di Aliba​ba. Il modello è descritto come basato sull'architettura di nuova generazione "che alimenterà la prossima famiglia Qwen4" — e esplicitamente non come Qwen4 stesso. La ragione dichiarata da Aliba​ba è che i cambiamenti architetturali dovrebbero essere nelle mani della comunità prima che arrivi la famiglia, così che runtime, quantizzazioni e applicazioni siano pronti quando il prodotto vero sarà rilasciato. Questa è una posizione di marketing, ma è anche un impegno tecnico: mostrare in anteprima prima la parte difficile, coinvolgere la comunità.

Cosa chiarisce la scheda del modello e cosa no:

• Confermato, secondo la scheda ufficiale del modello: Qwen3.8-Flash-Next è open-weight, multimodale e un modello mixture-of-experts basato sull'architettura Qwen4 — la scheda lo definisce "un'anteprima sperimentale dell'architettura che sarà alla base di Qwen4."

• Confermato, secondo la model card e la configurazione: due principali modifiche architetturali — Gated Delta Network (GDN) e Qw​en Sparse Attention (QSA) — all'interno di un ibrido a 48 strati che esegue 36 strati di attenzione lineare contro 12 strati di attenzione completa.

• Confermato dal repository: 125B parametri totali con 6B attivati per token (512 esperti, 10 instradati più uno condiviso) — Artificial Analysis ne indica 180B una volta conteggiati la tabella di embedding n-gram separata da 51B e i layer MTP — con un contesto nativo di 262.144 token estensibile a 1.000.000 secondo la Licenza Community di Qw​en 1.0.

• Non più non confermato: il modello è ormai stato valutato in modo indipendente, per ben due volte. La tabella di Aliba​ba è ancora quella del fornitore e non è ancora stata riprodotta, ma non è più l'unica prova sul tavolo.

I primi punteggi indipendenti sono arrivati — e dicono "avanti", non "alla pari"

Artificial Analysis ha rilasciato Intelligence Index v4.3 il 7 settembre, e la nuova valutazione dei punteggi è il motivo per cui tutto questo è quantomeno comparabile. L'aggiornamento v4.3 ha sostituito Terminal-Bench v2.1 con il ben più difficile Terminal-Bench v4.0 e ha rimpiazzato τ³-Banking con AutomationBench-AA, un benchmark di workflow agentico costruito con Zapier su un set di test privato held-out di 657 attività. Il peso dei dati privati held-out è salito al 45%. Lo scopo dichiarato era impedire alla frontiera di manipolare l'indice, e l'effetto sui punteggi è stato notevole: GPT-6 Astra e Claude Fable 5.1, i due leader, sono entrambi arrivati a 53, dopo essere stati valutati nella fascia dei sessanta sulla vecchia scala.

Questo è importante quando si leggono i numeri della community. Le cifre "56 contro 52" che hanno circolato per Qwen3.8-Flash-Next e DeepSeek V4 Flash 0731 all'inizio di settembre erano state calcolate sull'indice pre-v4.3; con la v4.3, la coppia si attesta a 40 e 35. Citare l'uno o l'altro insieme mettendoli a confronto significa confrontare due esami diversi.

Sull'indice attuale, ecco come i due modelli si confrontano realmente nelle valutazioni di Artificial Analysis:

• Indice di intelligenza — Qwen3.8-Flash-Next 40 (5º su 113 nella categoria) vs DeepSeek V4 Flash 0731 (Ragionamento, Sforzo massimo) 35 (9º su 113).

• Lavoro di conoscenza agentico — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.

• Terminale e programmazione — Terminal-Bench v4.0 25% vs 12%; SciCode 51% vs 50%.

• Ragionamento generale e scientifico — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.

• Richiamo fattuale rispetto alla confabulazione — AA-Omniscience −10 vs −14, un vantaggio di quattro punti per l'anteprima di Qwen.

• Prezzo — $0,15 per milione di input / $0,47 per milione di output vs $0,44 / $1,32; combinato $0,0882 per milione di token vs $0,2298. Costo per attività dell'Intelligence Index: $0,37 vs $0,22.

• Velocità e latenza — 53 token di output al secondo rispetto a 210; tempo al primo token 2,80 s rispetto a 0,98 s; risposta end-to-end 49,76 s rispetto a 12,88 s; tempo per attività 1.572,60 s rispetto a 221,65 s.

• Uso di token — 108k token di output per attività rispetto a 62k, di cui 72k sono token di ragionamento rispetto a 45k. Artificial Analysis definisce l'anteprima "molto prolissa" e "più lenta della media".

• Contesto e dimensione — 256k token vs 1.000k; 180B totali / 6B attivi vs 284B / 13B.

Letti insieme, offrono una risposta più incisiva di «stesso livello». Qwen3.8-Flash-Next vince l'argomentazione su accuratezza ed efficienza su quasi tutti gli assi misurati da Artificial Analysis: è il modello con il punteggio più alto, è più piccolo e costa circa un terzo per token. DeepSeek V4 Flash 0731 vince nettamente l'argomentazione sulla produzione: quattro volte il throughput, un quarto della latenza end-to-end, sette volte meno tempo effettivo per attività completata e quattro volte la finestra di contesto. E sul costo per attività completata — il numero che sopravvive alla verbosità dei token — DeepSeek è il modello più economico, a $0,22 contro $0,37, nonostante il prezzo di listino più alto. Se «underhyped» significa «migliore della sua reputazione in quanto a qualità per parametro», l'etichetta è giusta. Se significa «dovresti usare questo invece di quello», le colonne di velocità e latenza dicono il contrario.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Esistono prove indipendenti anche al di fuori di Artificial Analysis. Un harness di terze parti, smf-bench, ha pubblicato il 5 settembre un'esecuzione "Official A": Qwen3.8-Flash-Next nella quantizzazione NVFP4 di NVIDIA su un singolo DGX Spark, con il thinking disattivato, ha ottenuto 137 su 157 (87,3%), con un netto 30 su 30 nella sua sezione di coding, contro 117 su 157 per un'esecuzione DeepSeek V4 Flash Vision-Exp su due Spark sullo stesso harness da 157 test. Si tratta di un solo harness su una sola classe di macchine, e non sostituisce una valutazione ampia — ma è un secondo punto dati che punta nella stessa direzione, e arriva da qualcuno che non ha interessi in nessuno dei due fornitori.

Che cos'è in realtà l'architettura di Qwen4

Due meccanismi reggono la storia. Il primo, GDN — Gated Delta Network — è il livello di attenzione lineare di Alibaba. Mentre un transformer standard mantiene una cache chiave-valore che cresce con la lunghezza della sequenza, un livello GDN mantiene uno stato ricorrente a dimensione fissa e lo aggiorna con una regola di gating appresa; la discendenza passa attraverso DeltaNet e Mamba-2. Il vantaggio è quello che alimenta silenziosamente la linea Qwen da Qwen3-Next: i contesti lunghi restano economici perché lo stato non cresce, mentre una minoranza di livelli di attenzione completa resta nel mix per fare il recupero preciso in cui l'attenzione lineare è scarsa. Nella generazione attuale quel mix si attesta a circa tre livelli GDN per ogni livello di attenzione completa — l'analisi della comunità del checkpoint Qwen3.8-2.4T-A95B conta 69 livelli GDN contro 23 livelli di attenzione. Qwen3.8-Flash-Next mostra la stessa ripartizione tre a uno: 36 livelli di attenzione lineare contro 12 livelli di attenzione completa.

Il secondo, QSA — Qw​en Sparse Attention — è il pezzo davvero nuovo, e la sua descrizione pubblica è ancora scarna: la model card aggiunge che opera a livello di micro-blocco con un budget di 512 blocchi / 2048 token, ma non esiste ancora una trattazione tecnica completa. Questa scarsità di dettagli è essa stessa parte dello schema. L'anteprima di Qwen3-Next alla fine del 2025 ha introdotto Gated DeltaNet con la stessa documentazione scarna, e l'architettura è stata specificata del tutto solo quando la serie Qwe​n3.5 l'ha adottata. Per chi legge, il messaggio pratico è lo stesso in entrambi i casi: il canarino dell'architettura compare per primo, la documentazione e i modelli di produzione compaiono dopo.

Il playbook che ha già funzionato una volta

Aliba​ba ha già eseguito esattamente questa mossa, e ha funzionato. Alla fine del 2025, Qwen3-Next ha presentato in anteprima Gated DeltaNet e un ibrido di attenzione lineare e completa. Quando è stata distribuita la serie Qwe​n3.5, ha adottato quel progetto su scala — e l'ibrido è stato mantenuto nella generazione Qwen3.8 da allora, inclusa l'ammiraglia da 2,4T. Il motivo per cui il precedente conta qui è la tempistica che implica. Ci si dovrebbe aspettare l'intera famiglia Qwen4 dopo questa anteprima, non al suo interno; se il divario di Qwen3-Next è indicativo, la distanza tra «ecco l'architettura» e «ecco la famiglia» si misura in mesi. Nulla nella scheda del modello lo conferma — è un'inferenza tratta da uno schema che Aliba​ba ha ormai ripetuto due volte.

Quello che ancora non sappiamo

Le incognite si sono ridotte, ma non sono scomparse:

• La tabella di benchmark del fornitore resta ancora quella del fornitore. Artificial Analysis ha ora valutato il modello in modo indipendente, il che colma la lacuna più grande nella copertura del lancio — ma l'affermazione di punta di Aliba​ba, secondo cui il modello batte Claude Opus 4.6 Max su 8 dei 9 benchmark comparabili, si basa sulle valutazioni interne di Aliba​ba (CoWorkBench, JobBench, AndroidWorld) insieme a quelle pubbliche, e nessuna di queste è stata riprodotta da terzi.

• Se l'anteprima sia lo stesso modello di quello servito. La scheda presenta Qwen3.8-Flash-Next come l'anteprima sperimentale a pesi aperti, mentre la variante servita in produzione — Qwen3.8-Flash di Qwen Cloud — aggiunge un contesto predefinito di 1.000.000 di token e strumenti integrati. Non è ancora dichiarato se quel modello servito sia la stessa architettura sotto una finestra di contesto più grande, e i punteggi indipendenti sopra riportati riguardano l'anteprima a pesi aperti, non il modello API servito.

• La licenza è nota ed è una licenza vera e propria: Qwen Community License 1.0 consente l'uso commerciale, inclusa la vendita di opere derivate, ma richiede un accordo commerciale separato con Alibaba se gestisci un'attività di Model-as-a-Service o di assistente AI per il lavoro oltre una soglia definita di ricavi e utenti attivi mensili. Non è la stessa cosa della licenza Qwen3.8-Max vincolata ai ricavi, ma vale la pena leggerla prima di costruire sui pesi.

• Un rapporto sul campo che vale la pena segnalare: un resoconto del 6 settembre di una build NVFP4 della community registra un errore di chiamata agli strumenti con grammatica vincolata quando sono abilitati sia il thinking sia la previsione multi-token, ricondotto al percorso di decodifica vincolata di xgrammar. Si tratta di un bug di runtime in una build quantizzata della community, non di una proprietà del modello — ma se il tuo harness di valutazione fa affidamento su chiamate agli strumenti con grammatica vincolata, è la prima cosa da testare.

Una famiglia che itera su un ritmo di due settimane

La cadenza circostante è una storia a sé. Qwen3.8-Max, il modello di punta da 2,4 trilioni di parametri, è stato rilasciato il 3 agosto; il Qwen3.8-2.4T-A95B a pesi aperti ha fatto seguito il 12–13 agosto; il Qwen3.8-27B gratuito con licenza Apache-2.0 è arrivato pochi giorni dopo; e ora, prima che il mese finisca, l'architettura della prossima generazione viene presentata in anteprima — e sottoposta a benchmark indipendenti una settimana dopo. Nessun altro laboratorio sta attualmente iterando a questo ritmo. Per un lettore che sceglie modelli, la conseguenza pratica è che «il miglior Qwen» è un bersaglio mobile — e il delta tra le generazioni arriva più in fretta di quanto l'ecosistema circostante riesca di solito ad adattarsi. Comprare una decisione anziché un modello è sempre più la mossa difendibile.

Cosa dovrebbe fare ora uno sviluppatore

I numeri di efficienza cambiano il calcolo dell'esecuzione locale più di quanto abbia fatto il lancio stesso. Un modello da 6B di parametri attivi che ottiene 40 sull'indice attuale è comprimibile: la quantizzazione NVFP4 ufficiale di NVIDIA è quella usata dalla run di smf-bench del 5 settembre, e le build NVFP4 e FP8 della community che vanno oltre sono già in circolazione, ed è proprio questo a rendere plausibile, in generale, un deployment di classe GPU singola per un modello che occupa 180B. L'avvertenza è invariata: questa è un'anteprima non provata, la tabella del fornitore non è stata riprodotta, e la forma dei punteggi indipendenti (solidi sul lavoro di conoscenza e sui task da terminale, più deboli sulla generazione di repository a lungo orizzonte e sui tassi di successo degli agent in un solo colpo) significa che le debolezze del modello emergono esattamente là dove vivono le modifiche al codice di produzione. Fate girare su di esso una copia a basso rischio di un carico di lavoro reale prima che tocchi qualsiasi cosa che conti, e lasciate che il failover automatico assorba i momenti in cui un'anteprima si comporta male.

Sul prezzo, il quadro che era confuso al lancio ora è concreto. Artificial Analysis riporta la tariffa applicata per l'anteprima a $0,15 per milione di token in input e $0,47 per milione in output, rispetto a $0,44 e $1,32 per DeepSeek V4 Flash 0731 — lo stesso ordine di grandezza della variante Qwen3.8-Flash servita, che Qw​en Cloud indica a ¥1 e ¥3 (circa $0,16 e $0,47). La variante di produzione è quella che puoi effettivamente chiamare oggi: qui è instradata come qwen/qwen3.8-flash, e OrcaRouter trasmette il prezzo di listino del fornitore con un ricarico dello 0%, quindi quando Aliba​ba modifica quel numero, l'endpoint si aggiorna con esso lo stesso giorno. Lo stesso vale per il modello di confronto in questo articolo — DeepSeek V4 Flash 0731 è instradato come deepseek/deepseek-v4-flash-0731 al prezzo di listino del provider, il che rende la parte del confronto sopra relativa al costo per token verificabile rispetto al tuo traffico reale anziché rispetto ai conteggi di token di un benchmark. Ciò che non è instradato qui è l'anteprima open-weight Flash-Next stessa: per usarla oggi devi scaricare i pesi e servirli tu stesso, ed è proprio per questo che il discorso sulla quantizzazione sopra conta più del prezzo di listino. Il tetto che questa generazione deve superare è ancora visibile sullo stesso endpoint: Qwen3.8-Max (qwen/qwen3.8-max) si attesta a $2,00 per milione di token in input e $6,00 per milione di token in output, anch'esso trasferito al prezzo di listino del fornitore.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

La sequenza pratica non è cambiata molto, ma la fiducia che vi sta dietro sì. Se vuoi la variante di produzione servita senza scaricare 100GB di pesi, Qwen3.8-Flash è già richiamabile al prezzo di listino. Se vuoi l'architettura — GDN, QSA, la tabella n-gram, i trucchi di offload — i pesi sono scaricabili e i runtime sono pronti: vLLM lo serve dal primo giorno con un percorso di offload che mantiene la tabella di embedding n-gram da 51B parametri nella memoria dell'host anziché nella VRAM permanente, SGLang e TensorRT-LLM sono nella lista Day 0 di NVIDIA, e la libreria di Ollama include una build MLX che puoi scaricare su Apple Silicon. L'unica cosa da smettere di fare è trattare il modello come un'incognita sul fronte qualità. Ora è stato misurato, e ha dato buoni risultati.

Cosa guardare dopo

• Se i numeri indipendenti reggeranno man mano che l'indice matura. Il 40 di Qwen3.8-Flash-Next comporta un costo in token insolitamente elevato — ha bruciato 245M di token durante l'esecuzione dell'indice rispetto a una mediana di 140M — e la nota di Artificial Analysis stessa lo definisce "molto prolisso". Un punteggio prodotto da un ragionamento più lungo è comunque un punteggio, ma è il genere di cosa che cambia quando cambia la valutazione. La prossima revisione dell'indice è il vero test per stabilire se 40 era un livello o un massimo locale.

• Se il Qwen3.8-Flash servito venga valutato separatamente. Ogni numero indipendente in questo articolo riguarda l'anteprima open-weight. La variante di produzione con il contesto da 1M e gli strumenti integrati non ha un punteggio indipendente proprio, e se è la stessa architettura con un contesto più lungo, è una valutazione a basso costo che qualcuno dovrebbe pubblicare.

• Come regge in pratica il supporto al serving day-0 — le cifre di throughput GB300 dichiarate dal fornitore sono ancora solo dichiarazioni del fornitore, e le configurazioni TP4 expert-parallel e KV-offload sono ancora così nuove da essere fragili.

• Quanto tempo aspetta Alibaba prima che l'intera famiglia Qwen4 segua l'anteprima.

La parte di questa storia dedicata a "quello che sappiamo finora" è ormai in gran parte conclusa. La scheda tecnica è pubblica, i pesi sono scaricabili, l'architettura è confermata, la variante Qwen3.8-Flash servita è attiva sulle API ospitate al prezzo di listino, e il modello è stato valutato in modo indipendente da due parti distinte — con il modello più piccolo che vince la discussione sulla qualità e quello più grande che vince quella sul throughput. Ciò che resta aperto è se un'anteprima con 6B attivi generalizzi al di là dei benchmark su cui è stata messa a punto, e quanto a lungo Alibaba aspetti prima che segua l'intera famiglia Qwen4. Quest'ultima domanda è ancora quella a cui il rilascio non dà risposta, ed è ancora quella che conterà di più.

Confrontati in questo articolo4

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno