
Qwen 4 Max annunciato ad Apsara 2026: cosa ha confermato Alibaba e cosa no
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
La conferenza Yunqi di Hangzhou — l'Apsara Conference — è stata l'occasione, il 22 settembre 2026, per mostrare quattro modelli non ancora rilasciati. Il responsabile LLM del laboratorio, Liu Da Yiheng, ha presentato in anteprima sul palco Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus e Qwen 4 27B, ha descritto la famiglia come in addestramento su un'architettura di nuova generazione e si è limitato a dire che sarebbe arrivata presto. Al momento in cui scriviamo non esiste una scheda modello per nessuno dei quattro, né pesi aperti, né identificatore API, né finestra di contesto, né prezzo, né punteggio di benchmark. Il flagship più recente che si può effettivamente chiamare oggi è Qwen3.8-Max, disponibile a livello generale dal 3 agosto 2026, e quella distanza tra un annuncio sul palco e un endpoint richiamabile è la parte di questa storia che vale la pena leggere con attenzione.
I quattro livelli, e cosa ciascuno dovrebbe essere
La linea Qwen di Alibaba è stata organizzata in livelli di capacità fin dalla generazione Qwen 3, e l'annuncio di Qwen 4 ha mantenuto quella struttura anziché sostituirla. Ciò che è stato mostrato sul palco era un elenco, non una scheda tecnica:
• Qwen 4 Max — il livello di punta, e quello che Alibaba contrappone al modello migliore di ogni altro laboratorio di frontiera
• Qwen 4 Flash — il livello ad alto throughput, progettato per carichi sensibili alla latenza e ad alto volume anziché per il ragionamento di picco
• Qwen 4 Plus — il livello intermedio equilibrato, storicamente quello con la più ampia gamma di supporto multimodale
• Qwen 4 27B — il livello locale a pesi aperti, quello che viene scaricato, messo a punto e quantizzato da persone che non toccano mai un'API ospitata
• Architettura — descritta come una nuova generazione e descritta come in addestramento, il che non equivale a essere finita
• Carico di lavoro primario — attività agentiche e con utilizzo di strumenti, secondo l'inquadramento della conferenza, anziché chat
• Disponibilità — nessuna. Nessun livello ha una data di rilascio, un prezzo, una finestra di contesto, un elenco di modalità o un punteggio pubblicato
La fascia 27B è quella da tenere d'occhio per una ragione che non ha nulla a che fare con i benchmark. È l'unica fascia della famiglia che storicamente è stata distribuita con pesi aperti, e la generazione Qwen 3.8 ha mostrato quanto lavoro indipendente questo sblocchi: nel giro di pochi giorni dall'arrivo dei pesi 27B, la comunità aveva prodotto conversioni MLX, quantizzazioni NVFP4 e fine-tune non censurati. Un 27B annunciato è la promessa di un intero ecosistema a valle, ed è la parte di questa roadmap con la consegna più prevedibile.
Il numero da 5 a 10 trilioni di parametri non appartiene a Qwen 4
La copertura della conferenza è stata imprecisa su una cifra. L'obiettivo "da 5 a 10 bilioni di parametri" che circolava insieme alle notizie su Qwen 4 non è una specifica di Qwen 4 — è un'affermazione prospettica sulle generazioni successive, l'orizzonte temporale di Qwen 4.5 e Qwen 5. Alibaba non ha associato alcun numero di parametri a Qwen 4 Max, e in base alle evidenze disponibili sarebbe un errore pubblicarne uno.
Questo è importante perché il numero di parametri è quello su cui i lettori si ancorano e quello che si propaga. Un'affermazione di 5T parametri associata a un modello senza architettura pubblicata è non falsificabile in entrambe le direzioni: nessuno può confermarla, e nessuno può correggerla una volta che è stata ripetuta. Se questa settimana vedi Qwen 4 Max descritto come un modello con molti trilioni di parametri, quel numero è stato preso in prestito da una diapositiva diversa.
Quello che si può dire onestamente è che il predecessore flagship è un mixture-of-experts da 2,4 trilioni di parametri con 95 miliardi di parametri attivi per token, confermato sulla scheda ufficiale del modello per Qwen3.8-Max e sul rilascio open-weight che è seguito. Qualunque cosa si rivelerà essere Qwen 4 Max, quella è la baseline che deve superare, ed è un numero pubblicato e verificabile, non un'aspirazione da roadmap.

L'architettura non è un'indiscrezione: una sua anteprima è già stata distribuita
La cosa più utile dell'annuncio di Qwen 4 è che parte dell'architettura era già stata rilasciata con un nome diverso. Qwen3.8-Flash-Next è stato reso open source alla fine di agosto 2026, e la sua scheda del modello lo etichetta chiaramente come un'anteprima dell'architettura di Qwen 4. Questo lo rende l'unica prova concreta che chiunque al di fuori di Alibaba abbia su come è costruita la famiglia Qwen 4.
È un modello sparso con 125 miliardi di parametri principali più 51 miliardi di parametri di embedding di N-gram, che ne attiva circa 6 miliardi per ogni passo di inferenza. Porta con sé un contesto nativo di 262.000 token che, secondo la scheda, si estende fino a 1 milione, e Alibaba riferisce che è stato addestrato a un costo inferiore di circa il 90 percento rispetto a Qwen3.7-Plus. Sulla scheda sono menzionate tre tecniche:
• QSA, uno schema di attenzione sparsa specifico di Qwen, ovvero il meccanismo alla base della promessa di addestramento a basso costo su contesti lunghi
• Connessioni residue con gating, una misura di stabilità per reti sparse profonde
• Embedding di N-gram, un archivio di parametri separato da 51 miliardi di parametri a cui si accede tramite consultazione anziché con un calcolo denso
Se i quattro livelli di Qwen 4 ereditano quel design, la conseguenza interessante è di natura economica più che architetturale. Una famiglia progettata per raggiungere una qualità vicina alla frontiera a circa un decimo del costo di addestramento è una famiglia che può essere prezzata in modo aggressivo, e il prezzo aggressivo di Alibaba è stata la forza più affidabile in assoluto nell'economia dei modelli a pesi aperti per due anni. Questa è una previsione, non un fatto, e dovrebbe essere etichettata come tale — ma è il motivo per seguire questa roadmap invece di scartarla.
Cosa eseguire mentre aspetti
Niente nell'annuncio di Qwen 4 cambia ciò che è disponibile questa settimana, e la risposta onesta per chiunque stia sviluppando oggi è la generazione Qwen 3.8. Qwen3.8-Max è disponibile a livello generale dal 3 agosto 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output, con tariffa unica su tutto il contesto da 1 milione di token e senza supplemento per i prompt lunghi, e i suoi pesi sono stati pubblicati il 12 agosto 2026 come Qwen3.8-2.4T-A95B sia in BF16 sia in FP8 con una licenza Qwen personalizzata. È il modello rispetto al quale verranno misurati i livelli di Qwen 4, e oggi serve traffico di produzione.
Se vuoi confrontare la generazione Qwen attualmente disponibile con il resto della frontiera senza gestire un account, una chiave e una fattura separati per ogni laboratorio, OrcaRouter porta la famiglia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — accanto a Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview e GLM 5.3 su un unico endpoint compatibile con OpenAI. Ovvero una sola API per quasi 200 modelli a markup 0%, il che significa che il prezzo di listino del fornitore viene trasferito invariato, così un taglio di prezzo del vendor arriva sulla tua chiave lo stesso giorno anziché al ciclo di fatturazione successivo. Quando arriverà un tier Qwen 4, sarà nello stesso catalogo che comparirebbe; oggi, nessuno di essi è presente.

La conclusione
Qwen 4 Max è un annuncio reale e non un prodotto reale, ed entrambe le metà di quella frase contano. La gamma è confermata: quattro livelli, un'architettura di nuova generazione, un focus agentico e un livello 27B a pesi aperti che conterà per più persone più di quanto conterà il modello di punta. Tutto ciò che serve per una decisione d'acquisto — prezzo, contesto, modalità, pesi, punteggi, una data — manca.
Consideralo un segnale di roadmap con una traccia documentale insolitamente buona, perché il rilascio di Qwen3.8-Flash-Next ti offre gratuitamente l'anteprima dell'architettura e Qwen3.8-Max ti fornisce la baseline incumbent con pesi pubblicati e un prezzo pubblicato. Monitora il tier 27B per l'ecosistema che creerà e il tier Flash per l'economia del throughput. Non ripubblicare la cifra dei 5-10 trilioni di parametri come un fatto su Qwen 4, e non pianificare una migrazione attorno a un modello che non ha una data di rilascio — pianificala attorno a Qwen3.8-Max, e migra quando c'è un endpoint verso cui migrare.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
