
Qwen3.8-Flash-Next vs Qwen3.8-27B: il MoE Qwen4-preview contro il cavallo di battaglia a pesi aperti
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 578 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 182 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 226 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
La cosa sorprendente di Qwen3.8-Flash-Next non è che Alibaba affermi che un modello che attiva solo 6 miliardi di parametri per token batta gran parte dei modelli open — è che servirlo richiede più memoria del modello denso da 27 miliardi di parametri con cui viene confrontato. Qwen3.8-Flash-Next, reso open source il 26 agosto 2026 come anteprima dell'architettura Qwen4, mantiene una tabella di lookup N-gram da 51 miliardi di parametri nella RAM di sistema invece che nella VRAM; Qwen3.8-27B, il modello denso multimodale Apache-2.0 uscito a metà agosto e cavallo di battaglia open-weights dell'attuale generazione Qwen 3.8, sta in una singola scheda grafica da 24 GB a 4 bit. Sul foglio benchmark della stessa Alibaba, il nuovo MoE batte il 27B su 21 dei 22 benchmark confrontati. Sul fronte delle prove indipendenti — posizionamenti in arena, uno studio su agenti legali, misurazioni di throughput di terze parti — il 27B è l'unico dei due ad averne. Tutta la decisione si riduce a questa combinazione.
Il confronto in una riga: due modelli open-weight, text-plus-vision della stessa generazione, stesso contesto nativo di 262K, entrambi progettati per girare fuori da un datacenter — e divisi da architettura, licenza, prezzo e da quanto della loro storia è verificato. Qwen3.8-Flash-Next è il MoE sparso che anticipa tutto ciò che Qwen4 è destinato a ereditare. Qwen3.8-27B è il modello denso che comprime ciò che Alibaba ha imparato costruendo il flagship da 2.4T in qualcosa che una singola GPU può eseguire. Scegliere tra i due dipende meno dalle capacità — Alibaba afferma che l'anteprima è più avanti — e più dal fatto di fidarsi di una scheda del fornitore vecchia di un giorno rispetto a un modello che è già stato smontato dalla community.
Il tabellone
Prima di tutto, le fonti: ogni dato di Qwen3.8-Flash-Next riportato di seguito è di Alibaba, vecchio di un giorno e non riprodotto. Anche le affermazioni di benchmark principali di Qwen3.8-27B sono riportate da Alibaba, ma il 27B presenta risultati indipendenti — posizionamenti nell'arena delle preferenze umane, uno studio nel settore legale e misurazioni di throughput AMD — che l'anteprima non può eguagliare.
• Parametri totali — Qwen3.8-Flash-Next: 125B MoE + 51B N-gram + MTP (~180B memorizzati), 6B attivi. Qwen3.8-27B: ~27B densi (28B con encoder visivo), tutti attivi.
Architettura — Qwen3.8-Flash-Next: anteprima di Qwen4 — Qwen Sparse Attention alternata a Gated DeltaNet, residuo gated, embedding N-gram, addestrato con Muon. Qwen3.8-27B: 48 layer di attenzione lineare GDN più 16 layer di attenzione completa (3:1), denso.
• Contesto — entrambi con 262.144 token nativi, estendibile a 1M tramite YaRN.
• Modalità — entrambi accettano input di testo, immagini e video e restituiscono testo.
• Licenza — Qwen3.8-Flash-Next: qwen-community-1.0. Qwen3.8-27B: Apache 2.0.
Prezzo — Qwen3.8-Flash-Next: $0.16 / $0.47 per 1M (annunciato; API di produzione non ancora aperta). Qwen3.8-27B: $0.33 / $2.40 per 1M, attivo da oggi.
• Ingombro di esecuzione — Qwen3.8-Flash-Next: tabella da 51B nella RAM host, ~96GB di memoria di sistema più eventuale GPU; FP8 ~186GB, Q4 GGUF ~82GB. Qwen3.8-27B: BF16 ~55.6GB, la versione a 4 bit sta in una scheda da 24GB.
• Prove indipendenti — Qwen3.8-Flash-Next: ancora nessuna. Qwen3.8-27B: #1 modello open su Arena.ai Image-to-WebDev, #9 complessivo su Code Arena WebDev, #1 open-weight sul benchmark Legal Agent di Harvey, throughput misurato da AMD.

Secondo i numeri di Alibaba, l'anteprima vince quasi su tutto.
Il confronto pubblicato da Alibaba attribuisce a Qwen3.8-Flash-Next punteggi uguali o migliori su 21 dei 22 benchmark linguistici e visivi rispetto a Qwen3.8-27B, e le vittorie non sono solo di facciata. SWE-bench Pro 62.5 contro 61.7 è un vantaggio marginale, ma DeepSWE 58.7 contro 42.2, JobBench 55.7 contro 33.4 e CoWorkBench 73.9 contro 70.7 sono divari reali proprio sui carichi di lavoro agentici e d'ufficio a cui è destinato il livello flash. I numeri principali dell'anteprima — LiveCodeBench v6 91.9, GPQA Diamond 91.7, MathVision 95.7 — superano anche le corrispondenti righe del 27B nella tabella di Alibaba. Questa è la tesi del rilascio espressa come dati: gran parte della capacità di ragionamento e codifica della più grande linea Qwen 3.8, a una frazione del calcolo attivo.
Tieni l'etichetta attaccata a quella frase. Queste sono valutazioni di Alibaba, dal proprio harness di Alibaba, vecchie di un giorno nel caso dell'anteprima e non replicate per entrambi. Lo smontaggio dell'architettura KGP Talkie che si posiziona per questo confronto giunge alla stessa forma di conclusione, ma sta lavorando dalla stessa scheda del fornitore. Una tabella del fornitore è una promessa; nulla in questo paragrafo è stato confermato in modo indipendente.
Quello che la 27B ha e Flash-Next non ha: prove
È qui che il confronto smette di essere a senso unico. Qwen3.8-27B è in circolazione da due settimane e la community ha prodotto tre punti dati indipendenti. Nella classifica Image-to-WebDev di Arena.ai — voti umani alla cieca su quale dei due output anonimizzati uno spettatore preferirebbe mettere in produzione — il 27B si classifica al #1 tra i modelli open e al #7 assoluto con un punteggio dichiarato di 1.574. Nella gemella classifica Code Arena WebDev si piazza al #9 assoluto con 1.595, l'unico modello della sua fascia dimensionale nella top ten. Harvey, l'azienda di AI legale, ed Engram hanno condotto una simulazione di studio legale che ha portato un 27B adattato in cima al loro benchmark per agenti legali — con l'avvertenza che il modello aveva studiato in anticipo il corpus di test, il che lo rende una dimostrazione del margine di fine-tuning piuttosto che un punteggio per i pesi standard. AMD ha pubblicato le misurazioni di throughput del Day-0: 24,5 token/s su una Ryzen AI Max+ 395 e 51,8 token/s su una Radeon AI PRO R9700. Nessuno di questi è un punteggio di qualità generica — non esiste ancora un indice Artificial Analysis per il 27B — ma ognuno è una terza parte che ha effettivamente eseguito il modello.
Qwen3.8-Flash-Next non ha nulla di tutto ciò. Il suo intero foglio di benchmark è di Alibaba, vecchio di poche ore al momento della stesura, e nessun laboratorio indipendente ha riprodotto una sola riga. Non è un'accusa; è la definizione di un rilascio di un giorno. Ma è esattamente l'asimmetria che dovrebbe guidare la scelta: l'anteprima è in vantaggio sugli unici numeri che esistono, e ognuno di quei numeri è stato scritto dal fornitore che vuole farti credere.
Il fork di distribuzione
La differenza pratica tra questi due modelli è dove risiedono i parametri, e questo determina l'hardware di cui hai bisogno. Qwen3.8-Flash-Next scarica deliberatamente la sua tabella di embedding N-gram da 51B nella memoria host, dove può essere precaricata in modo asincrono — è per questo che aggiunge 51B parametri di capacità senza aggiungere calcolo per token. La conseguenza è che il modello non entrerà in una scheda consumer da 24GB come faceva prima una Qwen locale. Le stime della community collocano un Q4 GGUF a circa 82GB in totale (circa 58GB di pesi principali più la tabella di lookup da 24GB), la build FP8 intorno ai 186GB, BF16 intorno ai 360GB; la ricetta funzionante è una macchina con circa 96GB di RAM di sistema più qualsiasi GPU che esegua i 6B attivi. Il vantaggio è che il calcolo per token è economico — l'intera scommessa dell'architettura — e il contesto lungo da 1M di token rimane accessibile perché i layer GDN comprimono la cronologia invece di far crescere la cache KV.
Qwen3.8-27B è il modello al contrario: denso, quindi ogni token esegue tutti i 27B parametri, ma abbastanza piccolo da stare interamente su hardware che già possiedi. I pesi BF16 sono circa 55,6 GB; a 4 bit gira su una scheda da 24 GB come una RTX 3090 o 4090, e le misurazioni AMD mostrano che fa da 24,5 a 51,8 token/s su hardware AI Max-class e Radeon PRO. Se il vincolo è una singola workstation, il 27B è quello che ci sta davvero; se il vincolo è il costo per token su larga scala, Flash-Next è quello che vince sulla carta.
La forchetta dei prezzi
I prezzi delle API raccontano la stessa storia dall'altro lato. Qwen3.8-27B è disponibile oggi su OrcaRouter a $0.33 per milione di token di input e $2.40 per milione di token di output, prezzo di listino del provider trasferito senza markup — l'opzione self-host resa disponibile, nessuna GPU da acquistare. Qwen3.8-Flash-Next non è ancora instradato da nessuna parte: i pesi open sono l'unica via fino a quando il Qwen3.8-Flash di produzione non sarà disponibile sull'API QwenCloud ai prezzi annunciati di $0.16/$0.47. Quando quell'API verrà aperta, lo stesso pass-through applicherà il prezzo di $0.16/$0.47 anche dalla nostra parte lo stesso giorno, sulla stessa chiave del 27B, con failover automatico tra i due — quindi il modo per adottare un'architettura di un giorno non è scommetterci sopra la produzione, ma indirizzare una parte del traffico verso di essa con il modello collaudato come fallback. Un layer di routing può anche fare da frontend a un modello che servi tu stesso, che è la via pratica per valutare oggi i pesi open di Flash-Next senza una seconda integrazione.

Quale eseguire?
Scegli Qwen3.8-Flash-Next se vuoi seguire la direzione Qwen4 ora, se il tuo carico di lavoro è abbastanza ad alto volume da rendere $0.16/$0.47 contro $0.33/$2.40 un numero reale, o se hai la RAM per auto-ospitarlo e sei a tuo agio con una scheda del fornitore. Scegli Qwen3.8-27B se hai bisogno di termini Apache-2.0, una singola scheda da 24GB, un modello che puoi richiamare oggi, o qualsiasi grado di evidenza indipendente — è l'unico dei due che sia stato eseguito da qualcuno al di fuori di Alibaba.

Le due schermate sopra sono le superfici pubbliche di ciascuna metà: l'elenco di OrcaRouter dove Qwen3.8-27B è chiamabile oggi a $0.33/$2.40, e la scheda del modello Qwen/Qwen3.8-Flash-Next su Hugging Face.
{{1}}E la chiusura onesta è una domanda, perché la base di evidenze ha un solo giorno: può un modello che attiva 6 miliardi dei suoi parametri mantenere un 21 su 22 in replicazione indipendente, o è la tabella N-gram che lo rende snello anche ciò che fallisce sui carichi di lavoro reali? Il 27B ha già superato due settimane di scrutinio della comunità. Flash-Next è dove si trovava il 27B due settimane fa — che è il miglior argomento per eseguirli fianco a fianco piuttosto che scegliere.{{/1}}
