
Rilasciato Qwen3.8-Flash-Next: Anteprima dell'architettura Qwen4 di Alibaba
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Il documento più utile pubblicato da Alibaba il 26 agosto 2026 non era il press kit — era un rapporto tecnico. Qwen3.8-Flash-Next, il modello multimodale mixture-of-experts a pesi aperti rilasciato quel giorno, è arrivato insieme a un articolo intitolato "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability", e il rapporto è la storia. Fa ciò che i lanci dei vendor non fanno quasi mai: pubblica le ablazioni, i risultati negativi e gli esperimenti sulla ricetta di addestramento, poi traccia una linea da ogni risultato all'architettura della famiglia Qwen4 che questo modello è destinato ad anticipare.
Cosa è stato effettivamente rilasciato il 26 agosto
Il modello in sé è modesto secondo gli standard del 2026 di Qwen, ed è una scelta deliberata. Qwen3.8-Flash-Next memorizza 125B di parametri del modello principale più una tabella separata di embedding n-gram da 51B — circa 176B prima di un modulo di multi-token-prediction da 4B — ma attiva solo 6B per token. È un modello mixture-of-experts a 512 esperti, con routing top-10 e 48 layer, un contesto nativo di 262.144 token estendibile a 1M tramite YaRN. Accetta testo, immagini e video in input e produce testo. I pesi sono disponibili su Hugging Face e ModelScope sotto la licenza qwen-community-1.0, e lo stesso blog di Alibaba lo definisce «un'anteprima sperimentale dell'architettura che sarà alla base di Qwen4» — lo stesso ruolo che Qwen3-Next ha svolto per la linea Qwen3.5, un canarino che vola prima dell'ammiraglia.
Lo stesso giorno, Alibaba ha attivato la controparte commerciale: una build servita chiamata Qwen3.8-Flash sull'API QwenCloud a 0,16 $ per milione di token di input e 0,47 $ per milione di output. I due sono facili da confondere e vale la pena tenerli distinti. Qwen3.8-Flash-Next è l'anteprima a pesi aperti che il report tecnico analizza; Qwen3.8-Flash è la build di produzione API, a pagamento, con un contesto predefinito di 1M token e formati di richiesta compatibili con OpenAI e Anthropic. Il prezzo, i benchmark e gli argomenti sull'architettura derivano tutti dalla stessa ingegneria.

Le quattro scommesse architetturali nel report tecnico
La colonna portante del paper sono quattro scommesse su come dovrebbe presentarsi un modello all'avanguardia a basso costo e con contesto lungo, ciascuna supportata da evidenze sperimentali.
• Attenzione — ibrido GDN + QSA. Tre strati su quattro usano Gated DeltaNet, un livello di attenzione lineare che comprime la cronologia in uno stato ricorrente di dimensioni fisse invece di una cache KV che cresce con la lunghezza della sequenza. Lo strato rimanente è Qwen Sparse Attention, che aggrega la sequenza in micro-blocchi, li valuta a basso costo ed esegue l'attenzione completa solo sulle regioni che contano. Alibaba riporta speedup fino a 7.6× in prefill e 4.9× in decode con contesto da 1M; il benchmark day-0 di SGLang ha misurato valori ancora più alti, pari a 10.2× e 6.6×. Con un tasso di hit della cache dei prefissi del 90%, il throughput in prefill raggiunge 8.6× quello di Qwen3.7-Plus. Questi sono dati riportati da fornitori e partner, non verificati in modo indipendente.
• Residual stream — Gated Residual. Il singolo percorso residuo viene ampliato in quattro rami paralleli con gating dinamico elemento per elemento, un design multi-ramo in stile Hyper-Connection con controllo in stile GatedNorm. Il gate regola letture e scritture per ciascun ramo; secondo il paper, questo sopprime i valori anomali di attivazione e, in pratica, consente di memorizzare gli stati residui in FP8.
• Embedding — la tabella n-gram da 51B. Invece di un embedding per token, il modello indicizza una tabella di lookup sul token corrente più quelli precedenti, memorizzando intere frasi e pattern locali. Ha un costo quasi nullo per token e, poiché gli indirizzi di lookup sono noti in anticipo, può risiedere nella memoria dell'host ed essere prefetchato in modo asincrono, rimanendo completamente fuori dalla memoria GPU. Questo è il trucco che consente a un checkpoint da 176B di funzionare su macchine di classe 75GB, e deriva dagli embedding per-layer di Gemma 3n e dall'Engram di DeepSeek.
• Ottimizzazione — Muon, ottimizzato. L'addestramento utilizza l'ottimizzatore Muon, un metodo di momentum basato su ortogonalizzazione, applicato a mappe lineari bidimensionali (attenzione, GDN e pesi degli esperti MoE), mentre AdamW viene mantenuto per embedding, router e parametri a basso rango. L'articolo riporta anche un risultato negativo che vale la pena leggere: il warmup della dimensione del batch è stato eliminato dopo che si è scoperto che costava il 18,8% in più di passi di ottimizzazione senza migliorare nulla.
La tabella dei benchmark, leggila attentamente.
Ogni numero evidenziato qui proviene da Qwen stesso, pubblicato sulla model card e nel report, e nulla è stato riprodotto in modo indipendente — il modello ha un giorno di vita e nessuna terza parte lo ha ancora verificato. Leggendolo in quest'ottica, resta comunque impressionante, perché Qwen3.8-Flash-Next se la sta giocando alla pari con DeepSeek-V4-Flash-0731, un modello molto più grande e affermato, con 6B parametri attivi.
• DeepSWE 1.1 — 58,7 vs 54,4 (dichiarato dal fornitore).
• SWE-bench Pro — 62.5 vs 56.0 (riportato dal fornitore).
• Toolathlon Verificato — 73,5 vs 70,3 (dichiarato dal fornitore).
• LiveCodeBench v6 — 91.9 vs 90.6 (riportato dal fornitore).
• GPQA Diamond — 91.7 vs 90.8 (riportato dal fornitore).
• IFBench — 81.3 vs 79.2 (riportato dal fornitore).
Poi, la mancanza che il report evidenzia apertamente: NL2Repo-Bench, 48.1 contro i 54.2 di DeepSeek-V4-Flash-0731 — un vero deficit nella generazione di codice a livello di repository, l'unica dimensione di coding agente in cui il modello più piccolo non tiene il passo. Agents' Last Exam è un pareggio, con 24.3 contro 25.2. Per quanto riguarda l'automazione d'ufficio, Qwen riporta CoWorkBench 73.9 — ma è un benchmark interno e Alibaba lo tiene fuori dal grafico principale.

Per quanto riguarda la visione, la tabella auto-riportata mostra AndroidWorld 84,5 contro 62,0 per Claude Opus 4.6 Max e RealWorldQA 88,5 contro 73,9. Humanity's Last Exam è l'unico titolo in cui Qwen perde apertamente contro Claude Opus 4.6 Max — e il giudizio su quel punteggio è stato a sua volta eseguito da GPT-4o, quindi anche quel confronto non è pulito.
Il prezzo: un dodicesimo dell'ammiraglia
Poi c'è il numero che conta per i budget. La build servita di Qwen3.8-Flash costa $0.16 per milione di token in input e $0.47 per milione di token in output su QwenCloud. Si tratta di circa un dodicesimo del prezzo dell'ammiraglia di Alibaba, Qwen3.8-Max, a $2.00 per milione di token in input e $6.00 per milione di token in output — su un modello che, secondo il report, è stato addestrato con circa un nono della potenza di calcolo di Qwen3.7-Plus. I vendor cinesi di modelli hanno passato l'estate a tagliare i prezzi della fascia flash, e questa release è il lato Qwen di quella campagna che arriva con una giustificazione architetturale annessa, piuttosto che con un semplice sconto.
Per chi confronta all'interno della categoria, i calcoli sono più semplici quando ogni fornitore mostra lo stesso numero. {{1}}OrcaRouter instrada il resto della famiglia Qwen — Qwen3.8-Max, Qwen3.8-27B e Qwen3.8 — al prezzo di listino del fornitore con un margine dello 0%, quindi un taglio di prezzo del venditore è attivo dalla nostra parte il giorno stesso in cui viene annunciato.{{/1}} Qwen3.8-Flash-Next non è ancora nel nostro catalogo; quando raggiungerà un runtime che instradiamo, si inserirà nella stessa configurazione con un solo clic e prezzo di listino, senza un secondo contratto.
Cosa puoi farci oggi
Il supporto di serving day-zero è insolitamente ampio. SGLang offre una pagina cookbook e un'immagine dedicata (lmsysorg/sglang:qwen38flashnext); vLLM ha vllm/vllm-openai:qwen38-flash-next; NVIDIA convalida entrambi, oltre a TensorRT LLM, su un rack GB300 NVL72 a oltre 16.000 token al secondo per GPU in FP8, e NeMo copre il fine-tuning. Al di sotto della scala data-center, il modello gira su cluster DGX Spark e workstation con 4×RTX PRO 6000, e la serie di quantizzazioni della community uscite lo stesso giorno — i GGUF di Unsloth e una build a 1-bit che sta in 75GB di RAM con circa l'80% dell'accuratezza completa — significa che il checkpoint da 176B è davvero eseguibile su hardware di proprietà di un piccolo team. I team che preferiscono chiamarla piuttosto che eseguirla possono accedere all'API Qwen3.8-Flash tramite QwenCloud di Alibaba e diverse piattaforme di terze parti, anche se la maggior parte dei primi utilizzatori sceglierà in primo luogo i pesi aperti.

La matematica della VRAM dietro quell'elenco è la tabella n-gram, ed è il prossimo punto di convergenza degli stack di serving. L'embedding per-layer che il rapporto tecnico tiene fuori dalla memoria GPU è una pura struttura di lookup — per ogni token generato il modello estrae solo circa 16 delle sue 320 milioni di righe — ed è questo che rende economico l'offloading. vLLM serve Qwen3.8-Flash-Next da un'immagine di sviluppo dedicata mentre la pull request per il supporto dell'architettura è ancora aperta, e l'ultimo pezzo di quel lavoro, una PR in bozza dello stesso autore di vLLM (vllm-project/vllm#54371, non ancora mergiata), aggiunge un percorso di serving PLE-Offload che mantiene la tabella in memoria host e la legge tramite CUDA unified virtual addressing invece di riservare VRAM. Con FP8 la tabella occupa circa 48GB del checkpoint di ~173GB, quindi l'offloading fa la differenza tra una GPU da data center e una singola scheda da 96GB — una RTX PRO 6000 o il pool di memoria unificata di un DGX Spark. È presto, quindi consideralo come una direzione piuttosto che come un'opzione supportata oggi; ma è il runtime che si sta allineando a ciò che il rapporto tecnico aveva già affermato, ed è la cosa da tenere d'occhio se il numero di VRAM è ciò che ti ha frenato.
Una preview di un giorno con numeri non riprodotti è il caso da manuale per non scommettere su di essa un percorso di produzione, ed è esattamente a questo che serve il failover. Se un runtime include Qwen3.8-Flash-Next e punti un endpoint su di esso con failover automatico verso un modello di cui ti fidi già, ottieni il vantaggio della nuova architettura sul traffico non critico e un fallback pulito quando fa fatica — nessun ricablaggio, perché questa è una regola di routing, non una modifica al codice.
Cosa dice questa anteprima su Qwen4
Alibaba ha già fatto questa mossa. Qwen3-Next ha presentato in anteprima Gated DeltaNet a fine 2025 con documentazione scarna, e l'architettura è stata completamente specificata solo quando la serie Qwen3.5 l'ha adottata su larga scala. Il pattern si ripete: Qwen3.8-Flash-Next è il canarino, e il report è la specifica attraverso l'esperimento. Gli aspetti concreti da osservare sono se il modello di punta Qwen4 adotterà la suddivisione tre-a-uno tra GDN e QSA, se l'embedding n-gram sopravviverà al contatto con il serving in produzione alla scala del modello di punta, e soprattutto se le valutazioni indipendenti confermeranno il vantaggio dei 6B attivi rispetto a modelli più grandi. Se la tesi dell'efficienza regge, il modello di punta Qwen4 potrebbe essere rilasciato con costi di serving drasticamente inferiori rispetto alla generazione precedente.
Domande frequenti
Qwen3.8-Flash-Next e Qwen3.8-Flash — stesso modello?
No, e la distinzione è importante. Qwen3.8-Flash-Next è l'anteprima dell'architettura a pesi aperti che il report tecnico analizza; Qwen3.8-Flash è la build API di produzione che Alibaba serve su QwenCloud a $0,16/$0,47 per milione di token con un contesto predefinito di 1M. Stessa discendenza ingegneristica, artefatti diversi — uno è per self-hosting e ispezione, l'altro è un servizio gestito a pagamento.
Dovrebbero i carichi di lavoro di produzione migrarvi oggi?
Non senza una seconda opinione. Ogni benchmark è dichiarato dal fornitore e mai replicato in modo indipendente; l'architettura è abbastanza nuova che gli stack di serving stanno ancora convergendo — il supporto di vLLM stesso sta ancora venendo integrato tramite pull request aperte — e l'unico gap nel coding agentico (NL2Repo) riguarda esattamente il tipo di attività che i programmatori in produzione si trovano ad affrontare. I pesi aperti rendono economico valutarlo da soli, e il supporto day-0 di SGLang e vLLM rende possibile un pilot già questa settimana — ma un pilot dietro failover è il modo onesto di iniziare, non un cutover.
Quando esce il vero Qwen4?
Alibaba non ha detto nulla. L'unico segnale di tempistica in questa release è storico: l'ultimo canarino, Qwen3-Next, è volato circa una stagione prima che la serie Qwen3.5 adottasse la sua architettura. Con quella cadenza, i flagship di Qwen4 sono più vicini di quanto sembri — ma il report parla esplicitamente di architettura, non di una roadmap.
La conclusione
Qwen3.8-Flash-Next è una di quelle rare release in cui il paper è il prodotto. Sul modello in sé, la pagella onesta recita: 6B di parametri attivi che eguagliano modelli molto più grandi sulla maggior parte dei benchmark condivisi, un gap esplicitamente dichiarato sul codice a livello di repository, un prezzo di erogazione pari a un dodicesimo di quello del modello di punta, e un'architettura che è la risposta di Qwen a come un modello di frontiera diventa economico. Il tech report dice a cosa serve Qwen3.8-Flash-Next — e non è il modello. È la prova dell'architettura che sarà Qwen4, e vale la pena leggerlo prima che Qwen4 arrivi, perché la decisione che cambia è quella che prenderai quando Qwen4 sarà qui.
