
Qwen 4.5 e Qwen 5 puntano a 5-10 trilioni di parametri: ciò che Alibaba ha detto e ciò che non ha detto
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Alla sua Apsara Conference di Hangzhou del 22 settembre 2026, l'azienda ha quantificato la generazione dopo la prossima. Le Qwen 4.5 e Qwen 5 serie sono "proiettate a scalare fino a 5-10 trilioni di parametri", secondo la formulazione del comunicato stampa in inglese della stessa azienda — una linea di roadmap, non una specifica. Nessuno dei due modelli ha una data di rilascio, una model card, un identificatore API, un prezzo o un punteggio di benchmark pubblicato, il che significa che nulla di nessuno dei due è invocabile oggi. Il flagship che puoi effettivamente acquistare è Qwen3.8-Max, disponibile a livello generale dal 3 agosto 2026, con 2,4 trilioni di parametri. Nei giorni successivi alla conferenza, quella frase di roadmap è stata ridotta in gran parte della copertura mediatica a un'affermazione secondo cui sta arrivando un modello da 10 trilioni di parametri — un'affermazione più forte e più semplice di quella fatta dall'azienda. La distanza tra queste due frasi è più o meno un anno di pianificazione.
L'affermazione, e la versione di essa che si è diffusa
Due cose sono state dette sul palco, e vale la pena separarle perché portano quantità di informazioni molto diverse. La prima è un aggiornamento di stato: Qwen 4 è in addestramento, su una nuova architettura. La seconda è una roadmap: si prevede che le serie Qwen 4.5 e Qwen 5 raggiungano una fascia di parametri da 5 a 10 trilioni.
Il comunicato stampa in inglese di Alibaba attribuisce entrambi all'azienda anziché a un dirigente identificato per nome. Il resoconto della conferenza che va oltre attribuisce la roadmap a Liu Da Yiheng, che dirige il progetto Qwen di modelli linguistici di grandi dimensioni presso Alibaba Token Hub, e riporta la sua impostazione secondo cui lo scaling è un percorso chiave verso la superintelligenza artificiale. Tale impostazione è il contesto in cui è stato presentato il numero di parametri, e spiega perché il numero è una fascia anziché un obiettivo.
Ciò che poi è circolato è stato l'estremo superiore dell'intervallo. I titoli inglesi che ne sono seguiti includono almeno uno che descrive un modello da 10 trilioni di parametri preannunciato, e diversi che descrivono un piano per un modello da 5 a 10 trilioni di parametri. Entrambe sono letture difendibili di una slide. Nessuna delle due è una specifica, e la differenza conta per chiunque debba pianificare tenendone conto.
5 trilioni sono l'obiettivo di una generazione e 10 trilioni quello di un'altra
La cosa più utile da capire correttamente di questo annuncio è che da 5 a 10 trilioni è una fascia che abbraccia due generazioni, non un singolo modello con una tolleranza ampia. La frase stessa di Alibaba collega la fascia a "le imminenti serie di modelli Qwen 4.5 e Qwen 5" — le serie, al plurale, prese nel loro insieme.
I resoconti in lingua cinese della stessa conferenza sono di nuovo precisi in un'altra direzione, con titoli che descrivono modelli successivi a Qwen 4.5 in espansione nella fascia da 5 a 10 trilioni. Questa lettura colloca anche l'estremo dei 10 trilioni oltre Qwen 4.5. L'unica affermazione sulla quale ogni fonte concorda è che la fascia copre l'intervallo da Qwen 4.5 a Qwen 5. L'assegnazione dei 10 trilioni specificamente a Qwen 5 è un'inferenza diventata un titolo, non una citazione.
Per dare un'idea delle proporzioni, e questi sono gli unici numeri in questa storia che sono pubblicati anziché proiettati:
• Da 5 a 10 trilioni — la fascia di parametri che il comunicato stampa di Alibaba associa alle serie Qwen 4.5 e Qwen 5
• 2,4 trilioni — parametri totali di Qwen3.8-Max, il flagship in distribuzione, secondo la sua model card ufficiale
• 95 miliardi — i parametri attivi per token di Qwen3.8-Max, il dato che determina quanto costa servire un token
• 10 trilioni — la parte superiore della fascia, e l'unica parte di essa che è arrivata sulla maggior parte dei titoli in inglese
• 0 — il numero di specifiche pubblicate, date di rilascio, prezzi, finestre di contesto o punteggi di benchmark per Qwen 4.5 o Qwen 5

Il numero di parametro che conta è quello che nessuno ha pubblicato.
I parametri totali sono il numero che un laboratorio sceglie di dichiarare. I parametri attivi sono il numero di cui ha bisogno un acquirente, e la roadmap non ne include nemmeno uno.
Qwen3.8-Max è un modello mixture-of-experts con 2.400 miliardi di parametri in totale e 95 miliardi attivi per token. Si tratta di un rapporto di attivazione di circa il 4%: il modello conserva una grande quantità di conoscenza in pesi che non legge su un dato token, e paga in termini di calcolo per una piccola porzione di essi. I parametri totali ti dicono quanta memoria occupa il tutto e quanto grande deve essere il box che ti serve. I parametri attivi ti dicono quanto paghi ogni volta che risponde.
Estendendo quel rapporto in avanti, la forma del problema diventa visibile. Un modello da 10 trilioni di parametri costruito con lo stesso 4 per cento di attivazione attiverebbe dell'ordine di 400 miliardi di parametri per token — più di quattro volte quello che Qwen3.8-Max attiva ora. Questa è aritmetica basata su un'ipotesi dichiarata, non un'affermazione su Qwen 5: aumenta la sparsità e il conteggio degli attivi scende, riducila e sale. Ma è questa aritmetica a decidere se un modello da 10 trilioni di parametri sia un prodotto erogato o un artefatto di ricerca, ed è il calcolo che il titolo «da 5 a 10 trilioni» invita a fare per poi lasciarlo incompiuto.
È anche qui che l'economia del routing smette di essere astratta. Su OrcaRouter il prezzo di listino del provider viene passato con 0% di markup, quindi un taglio di prezzo del vendor su un tier Qwen è attivo sulla tua chiave lo stesso giorno anziché al rinnovo. Una generazione il cui costo di serving è davvero incerto è esattamente il caso in cui quel pass-through vale più di uno sconto negoziato in anticipo su una cifra che nessuno ha pubblicato.
L'annuncio del chip è la vera tempistica
Alibaba ha annunciato la roadmap dei modelli e un nuovo acceleratore nello stesso comunicato stampa, e i due sono più collegati di quanto il comunicato non dica.
Il Zhenwu V900 di T-Head è un processore per training e inferenza con 216 GB di memoria e 1.200 GB/s di larghezza di banda inter-chip, supporto nativo per FP8 e FP4, e una prestazione dichiarata pari a tre volte quella del suo predecessore, lo Zhenwu M890, rilasciato a maggio. La produzione di massa e il rilascio commerciale sono previsti per il primo trimestre del 2027. Un server supernode companion supporta cluster fino a 500.000 schede, e T-Head afferma che la linea Zhenwu ha servito più di 650 clienti.
Leggi i due annunci insieme e la sequenza è leggibile. Addestrare e servire un modello mixture-of-experts su scala da 10 trilioni è un problema di interconnessione prima che di calcolo, perché il parallelismo degli esperti comporta lo spostamento continuo di attivazioni tra i chip, e 1.200 GB/s di larghezza di banda tra chip è il numero che decide se ciò è fattibile. Il silicio su quella tabella di marcia colloca la prima finestra plausibile per un'esecuzione su scala di frontiera di questo tipo ben dentro il 2027 — e anche allora, il fatto che un chip venga spedito non dice nulla sul completamento di una sessione di addestramento. Alibaba ha collegato i due argomenti mettendoli in un'unica release; il collegamento in sé è una nostra lettura, ed è etichettato come tale.
L'orizzonte temporale della stessa azienda è coerente con questo. L'amministratore delegato Eddie Wu ha fissato un obiettivo di oltre 20 gigawatt di capacità globale dei data center di Alibaba Cloud entro il 2032 — un obiettivo di capacità, non di capacità effettivamente realizzata, e un orizzonte di oltre cinque anni anziché quello del trimestre successivo.
Le affermazioni di auto-miglioramento che tengono in piedi la roadmap
Il motivo per cui un piano da 5-10 trilioni è quantomeno discutibile anziché semplicemente costoso è l'auto-miglioramento ricorsivo: se la pipeline di addestramento migliora se stessa, il calcolo richiesto per generazione diminuisce, e la frontiera si avvicina alla sostenibilità economica. Questa è l'affermazione portante alla base della roadmap, ed è anche la cosa meno verificabile che Alibaba abbia detto.
Cosa ha riportato l'azienda: Qwen3.8-Max ha completato 33 cicli iterativi nell'arco di circa un mese di lavoro completamente automatizzato che ha spaziato dalla progettazione della pipeline, alla convalida dei dati e alla diagnosi degli errori, e ha aumentato il suo punteggio Artificial Analysis da 40 a 45. In un esperimento di progettazione di chip, il modello ha dedicato più di 60 ore all'auto-miglioramento lungo un ciclo di progettazione, ha effettuato più di 10.000 chiamate a strumenti di automazione della progettazione elettronica e ha ridotto l'area del chip del 42 percento senza perdita di prestazioni. Un rapporto della conferenza riporta anche un miglioramento del throughput di inferenza del 96 percento grazie alla messa a punto autonoma di una nuova GPU T-Head.
Queste sono dichiarazioni dei fornitori e non sono state replicate in modo indipendente. Non è un tecnicismo: un ciclo autonomo che valuta i propri esperimenti si sta misurando rispetto al proprio sistema di valutazione, e il mondo esterno non ha alcun modo di verificare i criteri. La copertura della conferenza lo ha generalmente affermato, e i lettori dovrebbero darlo per assunto.
C'è una seconda trappola nella stessa dichiarazione, e riguarda le etichette più che l'onestà. Alibaba non ha detto a quale revisione dell'Artificial Analysis Intelligence Index sia misurato il suo spostamento da 40 a 45, e quell'indice è stato ricostruito da quando questo modello è stato lanciato. L'attuale pagina di Artificial Analysis per Qwen3.8 Max (0902) riporta 45 — una cifra indipendente, sulla revisione in vigore oggi. La lettura registrata per lo stesso modello a metà agosto, secondo la revisione allora in vigore, era 56. Un 45 e un 56 non sono la stessa misura nelle stesse unità, e sottrarre l'uno dall'altro produce un numero che non significa nulla. Ciò che la pagina non riporta è il 40 da cui Alibaba dice di essere migliorata: il punto di partenza di quel delta è quello dell'azienda stessa, e solo il punto finale capita dove ora si colloca la lettura indipendente. Leggi lo spostamento come una direzione, non come una misura.

Cosa ha effettivamente lanciato Alibaba alla stessa conferenza
Tolta la roadmap, la conferenza conteneva comunque release reali, tutte multimodali:
• Qwen3.8-LiveTranslate — interpretazione simultanea, con latenza (LAAL) ridotta di quasi il 20 percento, da 2,8 secondi a 2,3 secondi
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS e Qwen-Audio-3.1-Realtime — una suite vocale rinnovata
• Qwen-Audio-3.1-TTS-Next — paesaggi sonori cinematografici che fondono dialogo e atmosfera da un copione testuale, pensati per audiolibri, cinema e televisione, podcast e videogiochi
• Qwen-Image 3.1 — generazione di immagini ottimizzata per il design creativo e il marketing e-commerce, prevista per la fine di quest'anno, con generazione nativa di sfondi trasparenti
• Qwen Intelligence — una piattaforma agentica full-stack rivolta ai produttori di smartphone
Ogni voce di quell'elenco è un prodotto con una finestra di consegna. L'affermazione su scala di frontiera è l'unica voce all'ordine del giorno senza una data associata, e il contrasto non è un caso: rilasciare il livello multimodale è ciò che finanzia un anno di roadmap, e la roadmap è ciò che rende il prossimo round di finanziamento o il prossimo contratto cloud una storia anziché un foglio di calcolo. Entrambe le cose sono reali. Solo una delle due è qualcosa che puoi chiamare.
Cosa è invocabile oggi e cosa deve cambiare perché questo cambi
La generazione Qwen 3.8 resta l'intera linea acquistabile. Qwen3.8-Max è disponibile a livello generale dal 3 agosto 2026 a $2,00 per milione di token di input e $6,00 per milione di output, con tariffa invariata su tutta la finestra di contesto di 1.000.000 di token e senza sovrapprezzo per i prompt lunghi. I suoi pesi sono stati pubblicati il 12 agosto 2026 come Qwen3.8-2.4T-A95B in BF16 e FP8 con una licenza Qwen personalizzata. La sua tabella di benchmark del fornitore è solida e non verificata — Terminal-Bench 2.1 a 86,6, GPQA Diamond a 92,6, OSWorld-Verified a 86,1, tutte cifre di Alibaba stessa — Il quadro indipendente è meno lusinghiero di quello del fornitore: Artificial Analysis colloca Qwen3.8 Max (0902) a un Intelligence Index di 45, 24º su 212 modelli, a $5,41 di costo misurato per attività dell'Intelligence Index e 39,2 token di output al secondo — 159º su 212, vicino all'estremità lenta del campo. La stessa pagina elenca la finestra di contesto come 984k, contro 1.000.000 sulla nostra pagina del modello, un divario di cui vale la pena essere consapevoli prima di dimensionare un lavoro a contesto lungo. Punteggio di livello frontier, velocità di fascia media: questo è il riassunto onesto del flagship in distribuzione, ed è la base che qualsiasi Qwen 4.5 deve battere su entrambi gli assi contemporaneamente.

OrcaRouter porta la famiglia Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash e qwen3.8-27b — su un unico endpoint compatibile con OpenAI insieme a più di 200 altri modelli, il che significa che un tier Qwen 4.5 sarebbe un cambio di model-id su una chiave esistente anziché un nuovo contratto con un fornitore, una nuova fattura e un nuovo SDK. Quando uno di essi sarà disponibile, è in quel catalogo che comparirebbe. Oggi, né Qwen 4.5 né Qwen 5 vi è presente, perché nessuno dei due è stato rilasciato — e nessuna quantità di comunicati stampa sulla roadmap cambia le cose.
L'utilità pratica di una roadmap come questa è l'opposto di un piano di migrazione. Se un tier di Qwen 4.5 alla fine sembra plausibile per il tuo carico di lavoro, il modo economico per scoprirlo è instradare una fetta di traffico reale verso di esso dietro un fallback automatico, così un modello che si rivela lento, costoso o peggiore di quello attualmente in uso ti costa una percentuale di un carico di lavoro anziché un quarto. È a questo che serve il failover, e un modello di frontiera non provato, vecchio di pochi giorni, è il caso più chiaro per usarlo.
Cosa tenere d'occhio, e a cosa non credere ancora
Una voce di roadmap diventa un rilascio quando compare un piccolo insieme di elementi concreti. Una model card che riporta un conteggio totale dei parametri, un conteggio dei parametri attivi e una finestra di contesto. Un identificatore API che puoi passare in una richiesta. I pesi su un model hub. Una voce su una classifica indipendente con una data allegata. Un prezzo. Uno qualsiasi di questi è un segnale; la maggior parte di essi insieme è un lancio.
Cose che non sono un rilascio, per quanto tecniche possano sembrare: una menzione in una conferenza; una pull request di un framework di serving che aggiunge un ramo architetturale per una build sperimentale di Qwen, cioè lavoro sul motore dello stack di inferenza di qualcuno, non un modello che puoi chiamare; un id di snapshot datato per una generazione già rilasciata; e un post sui social che parafrasa un commento fatto sul palco. Il segnale che ha prodotto questo articolo è stato l'ultimo di questi, e il motivo per cui valeva la pena scriverne è che l'affermazione di fondo è verificabile contro il comunicato stampa di Alibaba stesso — che è la fonte da cui provengono l'intervallo da 5 a 10 trilioni, lo stato di Qwen 4 e i dati RSI. Il segnale puntava alla storia; non è la storia.
La questione a breve termine è più ristretta di quanto suggeriscano i titoli. Alibaba ha dichiarato che Qwen 4 è in addestramento, il che colloca Qwen 4 prima sia di 4.5 sia di 5 nella sequenza — quindi la prossima cosa da tenere d'occhio non è un modello da 10 trilioni di parametri, ma se Qwen 4 arriverà con una model card, un prezzo e un endpoint, e quando. Finché qualcosa in quella catena non si concretizza, la posizione onesta sulla fascia da 5 a 10 trilioni è che si tratta di una direzione di marcia, divulgata ufficialmente, senza alcuna specifica allegata e senza una data. Pianifica in base a Qwen3.8-Max, osserva la fascia 4.5 e 5 come una tesi di scaling più che come un prodotto, e considera ogni conteggio di parametri che vedi per un modello privo di model card come una previsione.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
