Card hero del titolo per l'articolo 'Qwen3.8-Flash-Next — LEAK REPORT' con un badge 'NON VERIFICATO — ANTEPRIMA DELL'ARCHITETTURA QWEN4', il sottotitolo 'Alibaba distribuisce l'architettura Qwen4 prima del modello', tre chip con le scritte 'Fonte: @kimmonismus', '25 agosto 2026' e 'Rilascio: 26 agosto 2026 23:00 UTC+08', una card a sinistra con la scritta 'L'affermazione: un MoE multimodale open-weight che anticipa l'architettura Qwen4' e una card a destra con la scritta 'Stato: pesi non ancora rilasciati, ~24h al rilascio'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba presenta in anteprima l'architettura Qwen4 prima che Qwen4 esista

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

{{1}}Alibaba sta per pubblicare l'architettura Qwen4 prima di pubblicare un modello Qwen4.{{/1}} {{2}}Qwen3.8-Flash-Next — un modello open-weight, multimodale mixture-of-experts basato sull'architettura di prossima generazione che alimenterà la famiglia Qwen4 — è previsto in pubblicazione su ModelScope alle 23:00 ora di Pechino del 26 agosto 2026.{{/2}} {{3}}Alibaba presenta il rilascio come un'anteprima tecnologica: gli sviluppatori ricevono l'architettura in anticipo, la famiglia completa Qwen4 arriverà più avanti.{{/3}} {{4}}Al momento della stesura, il numero di parametri, la licenza e il prezzo non sono confermati, quindi questo è un articolo su ciò che sappiamo finora — ogni dettaglio specifico qui sotto è classificato in base alla sua attendibilità.{{/4}}

Se non hai seguito il ritmo di Alibaba questo mese, il punto di riferimento è Qwen3.8-Max — il modello di punta da 2,4 trilioni di parametri rilasciato il 3 agosto e reso open-source come Qwen3.8-2.4T-A95B meno di due settimane dopo. Qwen3.8-Flash-Next arriva meno di un mese dopo. Lo stesso laboratorio che ha pubblicato un modello open-weight da 2,4 trilioni di parametri sta ora condividendo l'architettura per la generazione successiva, prima ancora che il modello di punta di quella generazione venga nominato.

Cosa è stato annunciato?

Il segnale è giunto all'arena attraverso i soliti canali. Una pagina teaser di ModelScope per Qwen3.8-Flash-Next è andata online il 25 agosto con un badge "Prossimo rilascio open", lo slogan "Avanti verso la prossima generazione: velocità fulminante" e un timer per il rilascio puntato al 2026-08-26 23:00 (UTC+08:00). Il team Qw​en di Alibaba ha pubblicato su X lo stesso giorno: "La prossima ondata Qw​en sta arrivando." Il post che ci ha inoltrato questa notizia, da @kimmonismus su X, descriveva la stessa cosa con parole leggermente diverse: un MoE multimodale a pesi aperti sull'architettura di prossima generazione, in accesso anticipato per consentire alla community di prepararsi alla famiglia Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

La parte che vale la pena rileggere è la lettura che ne dà Alibaba. Il modello è descritto come costruito sull'architettura di nuova generazione «che alimenterà la prossima famiglia Qwen4» — e non, esplicitamente, come Qwen4 stesso. La motivazione dichiarata da Alibaba è che i cambiamenti architetturali debbano essere nelle mani della comunità prima che la famiglia arrivi, così che runtime, quantizzazioni e applicazioni siano pronti quando il prodotto vero e proprio verrà rilasciato. È una posizione di marketing, ma è anche un impegno tecnico: anticipare la parte difficile e portare la comunità con sé.

Cosa è confermato oggi, e cosa non lo è:

• Confermato, secondo il teaser e la dichiarazione di Qw​en: Qwen3.8-Flash-Next è un modello open-weight, multimodale e MoE basato sull'architettura Qwen4.

• Confermato, secondo la dichiarazione di Qw​en: introduce due principali cambiamenti architettonici — l'architettura ibrida GDN e Qw​en Sparse Attention (QSA).

• Confermato, secondo il teaser: l'orario di rilascio, 2026-08-26 23:00 (UTC+08:00), su ModelScope.

• Non confermato: parametri totali o attivi, termini di licenza, lunghezza del contesto, disponibilità o prezzi dell'API e ogni punteggio di benchmark. Non esiste ancora alcuna valutazione indipendente perché i pesi non sono stati rilasciati.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Che cos'è in realtà l'architettura di Qwen4

Due meccanismi portano avanti la storia. Il primo, GDN — Gated Delta Network — è lo strato di attenzione lineare di Alibaba. Mentre un trasformatore standard mantiene una cache chiave-valore che cresce con la lunghezza della sequenza, uno strato GDN mantiene uno stato ricorrente di dimensione fissa e lo aggiorna con una regola di gating appresa; la discendenza passa attraverso DeltaNet e Mamba-2. Il vantaggio è quello che ha silenziosamente alimentato la linea Qw​en da Qwen3-Next: i contesti lunghi restano economici perché lo stato non cresce, mentre una minoranza di strati di attenzione completa rimane nella miscela per svolgere il recupero preciso in cui l'attenzione lineare è carente. Nella generazione attuale, quella miscela è composta da circa tre strati GDN per ogni strato di attenzione completa — l'analisi della comunità del checkpoint Qwen3.8-2.4T-A95B conta 69 strati GDN contro 23 strati di attenzione. Qwen3.8-Flash-Next è descritto come "architettura ibrida GDN" esattamente su quella discendenza.

Il secondo, QSA — Qw​en Sparse Attention — è il componente genuinamente nuovo, e non esiste ancora alcuna descrizione tecnica pubblica: solo il nome, e la sua presentazione come uno dei due cambiamenti principali dell'anteprima. Questa assenza di dettagli è essa stessa parte del pattern. L'anteprima di Qw​en3-Next a fine 2025 ha introdotto Gated DeltaNet con la stessa scarsità di documentazione, e l'architettura è stata completamente specificata solo quando la serie Qw​en3.5 l'ha adottata. Per il lettore, il messaggio pratico è lo stesso in entrambi i casi: il canary dell'architettura appare per primo, la documentazione e i modelli di produzione arrivano dopo.

Il playbook che ha già funzionato una volta

Alibaba ha già provato questa esatta strategia, e ha funzionato. Alla fine del 2025, Qwen3-Next ha presentato in anteprima Gated DeltaNet e un ibrido di attenzione lineare e completa. Quando la serie Qw​en3.5 è stata lanciata, ha adottato quel progetto su larga scala — e da allora l'ibrido ha caratterizzato la generazione Qw​en3.8, inclusa la punta di diamante da 2,4T. Il motivo per cui il precedente è importante qui è il tempismo che implica. Ci si deve aspettare l'intera famiglia Qwen4 al di là di questa anteprima, non al suo interno; se il divario di Qwen3-Next è un indicatore, la distanza tra "ecco l'architettura" e "ecco la famiglia" si misura in mesi. Niente nel teaser lo conferma — è un'inferenza tratta da uno schema che Alibaba ha ormai seguito due volte.

Quello che ancora non sappiamo

Le incognite sono il punto di un'anteprima, e sono reali:

• Parametri. Il teaser non ne rivela alcuno. La speculazione della community su X e Reddit — senza alcun supporto ufficiale — indica una configurazione di circa 125B totali / 6B attivi con una grande tabella di lookup per embedding di n-grammi. Trattatela come una voce.

• Il livello "Flash". Nella generazione Qw​en3.5, la Qwen3.5-Flash esclusiva del cloud era una variante potenziata della Qwen3.5-35B-A3B a pesi aperti. Se Qwen3.8-Flash-Next sia la controparte a pesi aperti di un modello Qw​en3.8 di dimensioni simili è sconosciuto; potrebbe invece essere il modello della classe 125B-A6B. Entrambe le interpretazioni sono ipotesi.

• Licenza. Le recenti release di Qw​en di Alibaba spaziano da Apache-2.0 (Qw​en3.8-27B) alla licenza Qw​en3.8-Max, condizionata al fatturato. La collocazione di Flash-Next determina se può essere utilizzato commercialmente e a quali condizioni.

• Benchmark. La dichiarazione di Qw​en evidenzia la codifica agentica, i compiti a lungo orizzonte e l’intelligenza multimodale, ma non sono allegati numeri e non esiste una valutazione indipendente finché non vengono rilasciati i pesi.

Una famiglia che itera su un ritmo di due settimane

La cadenza circostante è una storia a sé. Qwen3.8-Max, il modello di punta da 2,4 trilioni di parametri, è stato rilasciato il 3 agosto; il Qwen3.8-2.4T-A95B open-weight è seguito il 12–13 agosto; il Qw​en3.8-27B, gratuito e con licenza Apache-2.0, è arrivato pochi giorni dopo; e ora, prima della fine del mese, viene presentata in anteprima l'architettura della prossima generazione. Nessun altro laboratorio sta attualmente iterando a questo ritmo. Per chi sta scegliendo un modello, la conseguenza pratica è che «il miglior Qw​en» è un bersaglio mobile — e il delta tra le generazioni arriva più velocemente di quanto l'ecosistema circostante di solito si adatti. Acquistare una decisione, piuttosto che un modello, è una mossa sempre più difendibile.

Cosa dovrebbe fare ora uno sviluppatore

{{1}}Pianifica l'architettura, non solo il modello.{{/1}} {{2}}Qwen3.8-Flash-Next sarà una preview non comprovata fin dal primo giorno: nessun benchmark indipendente, un ecosistema runtime ancora in fase di maturazione e solo dichiarazioni del fornitore riguardo ai punti di forza agentici e di lungo orizzonte che contano per i carichi di lavoro che la utilizzerebbero.{{/2}} {{3}}Il modo sicuro per valutarla non è collegarla a un percorso di produzione — è instradare verso di essa una copia a basso rischio di un carico di lavoro, confrontare l'output con il modello attualmente in uso e lasciare che il failover automatico assorba i momenti in cui il provider che serve un modello open-weight nuovissimo si comporta in modo anomalo.{{/3}} {{4}}Su OrcaRouter si tratta dello stesso endpoint e della stessa chiave che già utilizzi: Qwen3.8-Flash-Next e il tuo modello attuale sono dietro un'unica API, e il DSL di routing può testare la preview rispetto al modello in uso con lo stesso prompt prima che qualsiasi cosa venga confermata.{{/4}}

Il prezzo, quando esiste, va letto allo stesso modo. Alibaba non ha annunciato un prezzo API per Flash-Next, e i pesi non rilasciati non sono instradabili da nessuna parte. Quando un provider lo espone, OrcaRouter trasmette il prezzo di listino del provider direttamente con un margine dello 0% — quindi qualunque numero Alibaba decida apparirà invariato, lo stesso giorno. Il benchmark più vicino che puoi effettivamente chiamare oggi è Qwen3.8-Max (qwen/qwen3.8-max), il modello di punta sotto cui questa architettura andrà infine a collocarsi: una finestra di contesto da 1.000.000 di token a $2,00 per milione di token in input e $6,00 per milione di token in output, trasmessi al prezzo di listino. Tieni a mente quel numero quando il prezzo di Flash-Next scenderà; è il costo che la prossima generazione deve battere.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

Cosa guardare al drop

Quattro cose contano nel momento in cui il timer di rilascio scade:

• Il numero di parametri e il livello dei parametri attivi — se questo è il modello di classe 125B-A6B descritto dalle voci o un'opzione più piccola.

La licenza — {{1}}permissiva come Qwen3.8-27B, o restrittiva come la licenza Max{{/1}}.

• Se le prime valutazioni indipendenti riproducono le affermazioni del fornitore relative alla codifica agentica e agli orizzonti lunghi — i numeri di cui fidarsi, non la linea di marketing.

• Quanto tempo aspetta Alibaba prima che l'intera famiglia Qwen4 segua l'anteprima.

Niente di tutto questo è conoscibile da qui. Ciò che è conoscibile oggi è la forma della decisione che Alibaba ha preso: sta scommettendo che valga la pena regalare la prossima generazione della sua architettura prima dell'ammiraglia. Questa scommessa è la storia — e i pesi verranno rilasciati domani.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube