
Qwen3.8-Flash-Next: Alibaba presenta in anteprima l'architettura Qwen4 prima che Qwen4 esista
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
{{1}}Alibaba sta per pubblicare l'architettura Qwen4 prima di pubblicare un modello Qwen4.{{/1}} {{2}}Qwen3.8-Flash-Next — un modello open-weight, multimodale mixture-of-experts basato sull'architettura di prossima generazione che alimenterà la famiglia Qwen4 — è previsto in pubblicazione su ModelScope alle 23:00 ora di Pechino del 26 agosto 2026.{{/2}} {{3}}Alibaba presenta il rilascio come un'anteprima tecnologica: gli sviluppatori ricevono l'architettura in anticipo, la famiglia completa Qwen4 arriverà più avanti.{{/3}} {{4}}Al momento della stesura, il numero di parametri, la licenza e il prezzo non sono confermati, quindi questo è un articolo su ciò che sappiamo finora — ogni dettaglio specifico qui sotto è classificato in base alla sua attendibilità.{{/4}}
Se non hai seguito il ritmo di Alibaba questo mese, il punto di riferimento è Qwen3.8-Max — il modello di punta da 2,4 trilioni di parametri rilasciato il 3 agosto e reso open-source come Qwen3.8-2.4T-A95B meno di due settimane dopo. Qwen3.8-Flash-Next arriva meno di un mese dopo. Lo stesso laboratorio che ha pubblicato un modello open-weight da 2,4 trilioni di parametri sta ora condividendo l'architettura per la generazione successiva, prima ancora che il modello di punta di quella generazione venga nominato.
Cosa è stato annunciato?
Il segnale è giunto all'arena attraverso i soliti canali. Una pagina teaser di ModelScope per Qwen3.8-Flash-Next è andata online il 25 agosto con un badge "Prossimo rilascio open", lo slogan "Avanti verso la prossima generazione: velocità fulminante" e un timer per il rilascio puntato al 2026-08-26 23:00 (UTC+08:00). Il team Qwen di Alibaba ha pubblicato su X lo stesso giorno: "La prossima ondata Qwen sta arrivando." Il post che ci ha inoltrato questa notizia, da @kimmonismus su X, descriveva la stessa cosa con parole leggermente diverse: un MoE multimodale a pesi aperti sull'architettura di prossima generazione, in accesso anticipato per consentire alla community di prepararsi alla famiglia Qwen4.

La parte che vale la pena rileggere è la lettura che ne dà Alibaba. Il modello è descritto come costruito sull'architettura di nuova generazione «che alimenterà la prossima famiglia Qwen4» — e non, esplicitamente, come Qwen4 stesso. La motivazione dichiarata da Alibaba è che i cambiamenti architetturali debbano essere nelle mani della comunità prima che la famiglia arrivi, così che runtime, quantizzazioni e applicazioni siano pronti quando il prodotto vero e proprio verrà rilasciato. È una posizione di marketing, ma è anche un impegno tecnico: anticipare la parte difficile e portare la comunità con sé.
Cosa è confermato oggi, e cosa non lo è:
• Confermato, secondo il teaser e la dichiarazione di Qwen: Qwen3.8-Flash-Next è un modello open-weight, multimodale e MoE basato sull'architettura Qwen4.
• Confermato, secondo la dichiarazione di Qwen: introduce due principali cambiamenti architettonici — l'architettura ibrida GDN e Qwen Sparse Attention (QSA).
• Confermato, secondo il teaser: l'orario di rilascio, 2026-08-26 23:00 (UTC+08:00), su ModelScope.
• Non confermato: parametri totali o attivi, termini di licenza, lunghezza del contesto, disponibilità o prezzi dell'API e ogni punteggio di benchmark. Non esiste ancora alcuna valutazione indipendente perché i pesi non sono stati rilasciati.

Che cos'è in realtà l'architettura di Qwen4
Due meccanismi portano avanti la storia. Il primo, GDN — Gated Delta Network — è lo strato di attenzione lineare di Alibaba. Mentre un trasformatore standard mantiene una cache chiave-valore che cresce con la lunghezza della sequenza, uno strato GDN mantiene uno stato ricorrente di dimensione fissa e lo aggiorna con una regola di gating appresa; la discendenza passa attraverso DeltaNet e Mamba-2. Il vantaggio è quello che ha silenziosamente alimentato la linea Qwen da Qwen3-Next: i contesti lunghi restano economici perché lo stato non cresce, mentre una minoranza di strati di attenzione completa rimane nella miscela per svolgere il recupero preciso in cui l'attenzione lineare è carente. Nella generazione attuale, quella miscela è composta da circa tre strati GDN per ogni strato di attenzione completa — l'analisi della comunità del checkpoint Qwen3.8-2.4T-A95B conta 69 strati GDN contro 23 strati di attenzione. Qwen3.8-Flash-Next è descritto come "architettura ibrida GDN" esattamente su quella discendenza.
Il secondo, QSA — Qwen Sparse Attention — è il componente genuinamente nuovo, e non esiste ancora alcuna descrizione tecnica pubblica: solo il nome, e la sua presentazione come uno dei due cambiamenti principali dell'anteprima. Questa assenza di dettagli è essa stessa parte del pattern. L'anteprima di Qwen3-Next a fine 2025 ha introdotto Gated DeltaNet con la stessa scarsità di documentazione, e l'architettura è stata completamente specificata solo quando la serie Qwen3.5 l'ha adottata. Per il lettore, il messaggio pratico è lo stesso in entrambi i casi: il canary dell'architettura appare per primo, la documentazione e i modelli di produzione arrivano dopo.
Il playbook che ha già funzionato una volta
Alibaba ha già provato questa esatta strategia, e ha funzionato. Alla fine del 2025, Qwen3-Next ha presentato in anteprima Gated DeltaNet e un ibrido di attenzione lineare e completa. Quando la serie Qwen3.5 è stata lanciata, ha adottato quel progetto su larga scala — e da allora l'ibrido ha caratterizzato la generazione Qwen3.8, inclusa la punta di diamante da 2,4T. Il motivo per cui il precedente è importante qui è il tempismo che implica. Ci si deve aspettare l'intera famiglia Qwen4 al di là di questa anteprima, non al suo interno; se il divario di Qwen3-Next è un indicatore, la distanza tra "ecco l'architettura" e "ecco la famiglia" si misura in mesi. Niente nel teaser lo conferma — è un'inferenza tratta da uno schema che Alibaba ha ormai seguito due volte.
Quello che ancora non sappiamo
Le incognite sono il punto di un'anteprima, e sono reali:
• Parametri. Il teaser non ne rivela alcuno. La speculazione della community su X e Reddit — senza alcun supporto ufficiale — indica una configurazione di circa 125B totali / 6B attivi con una grande tabella di lookup per embedding di n-grammi. Trattatela come una voce.
• Il livello "Flash". Nella generazione Qwen3.5, la Qwen3.5-Flash esclusiva del cloud era una variante potenziata della Qwen3.5-35B-A3B a pesi aperti. Se Qwen3.8-Flash-Next sia la controparte a pesi aperti di un modello Qwen3.8 di dimensioni simili è sconosciuto; potrebbe invece essere il modello della classe 125B-A6B. Entrambe le interpretazioni sono ipotesi.
• Licenza. Le recenti release di Qwen di Alibaba spaziano da Apache-2.0 (Qwen3.8-27B) alla licenza Qwen3.8-Max, condizionata al fatturato. La collocazione di Flash-Next determina se può essere utilizzato commercialmente e a quali condizioni.
• Benchmark. La dichiarazione di Qwen evidenzia la codifica agentica, i compiti a lungo orizzonte e l’intelligenza multimodale, ma non sono allegati numeri e non esiste una valutazione indipendente finché non vengono rilasciati i pesi.
Una famiglia che itera su un ritmo di due settimane
La cadenza circostante è una storia a sé. Qwen3.8-Max, il modello di punta da 2,4 trilioni di parametri, è stato rilasciato il 3 agosto; il Qwen3.8-2.4T-A95B open-weight è seguito il 12–13 agosto; il Qwen3.8-27B, gratuito e con licenza Apache-2.0, è arrivato pochi giorni dopo; e ora, prima della fine del mese, viene presentata in anteprima l'architettura della prossima generazione. Nessun altro laboratorio sta attualmente iterando a questo ritmo. Per chi sta scegliendo un modello, la conseguenza pratica è che «il miglior Qwen» è un bersaglio mobile — e il delta tra le generazioni arriva più velocemente di quanto l'ecosistema circostante di solito si adatti. Acquistare una decisione, piuttosto che un modello, è una mossa sempre più difendibile.
Cosa dovrebbe fare ora uno sviluppatore
{{1}}Pianifica l'architettura, non solo il modello.{{/1}} {{2}}Qwen3.8-Flash-Next sarà una preview non comprovata fin dal primo giorno: nessun benchmark indipendente, un ecosistema runtime ancora in fase di maturazione e solo dichiarazioni del fornitore riguardo ai punti di forza agentici e di lungo orizzonte che contano per i carichi di lavoro che la utilizzerebbero.{{/2}} {{3}}Il modo sicuro per valutarla non è collegarla a un percorso di produzione — è instradare verso di essa una copia a basso rischio di un carico di lavoro, confrontare l'output con il modello attualmente in uso e lasciare che il failover automatico assorba i momenti in cui il provider che serve un modello open-weight nuovissimo si comporta in modo anomalo.{{/3}} {{4}}Su OrcaRouter si tratta dello stesso endpoint e della stessa chiave che già utilizzi: Qwen3.8-Flash-Next e il tuo modello attuale sono dietro un'unica API, e il DSL di routing può testare la preview rispetto al modello in uso con lo stesso prompt prima che qualsiasi cosa venga confermata.{{/4}}
Il prezzo, quando esiste, va letto allo stesso modo. Alibaba non ha annunciato un prezzo API per Flash-Next, e i pesi non rilasciati non sono instradabili da nessuna parte. Quando un provider lo espone, OrcaRouter trasmette il prezzo di listino del provider direttamente con un margine dello 0% — quindi qualunque numero Alibaba decida apparirà invariato, lo stesso giorno. Il benchmark più vicino che puoi effettivamente chiamare oggi è Qwen3.8-Max (qwen/qwen3.8-max), il modello di punta sotto cui questa architettura andrà infine a collocarsi: una finestra di contesto da 1.000.000 di token a $2,00 per milione di token in input e $6,00 per milione di token in output, trasmessi al prezzo di listino. Tieni a mente quel numero quando il prezzo di Flash-Next scenderà; è il costo che la prossima generazione deve battere.

Cosa guardare al drop
Quattro cose contano nel momento in cui il timer di rilascio scade:
• Il numero di parametri e il livello dei parametri attivi — se questo è il modello di classe 125B-A6B descritto dalle voci o un'opzione più piccola.
La licenza — {{1}}permissiva come Qwen3.8-27B, o restrittiva come la licenza Max{{/1}}.
• Se le prime valutazioni indipendenti riproducono le affermazioni del fornitore relative alla codifica agentica e agli orizzonti lunghi — i numeri di cui fidarsi, non la linea di marketing.
• Quanto tempo aspetta Alibaba prima che l'intera famiglia Qwen4 segua l'anteprima.
Niente di tutto questo è conoscibile da qui. Ciò che è conoscibile oggi è la forma della decisione che Alibaba ha preso: sta scommettendo che valga la pena regalare la prossima generazione della sua architettura prima dell'ammiraglia. Questa scommessa è la storia — e i pesi verranno rilasciati domani.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
