Una card del titolo principale per «Qwen 4 Max annunciato ad Apsara 2026», con il sottotitolo «Cosa ha confermato Alibaba e cosa no», tre badge a pillola con la scritta «4 fasce in anteprima», «0 specifiche pubblicate» e «22 settembre 2026», e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Qwen 4 Max annunciato ad Apsara 2026: cosa ha confermato Alibaba e cosa no

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La conferenza Yunqi di Hangzhou — l'Apsara Conference — è stata l'occasione, il 22 settembre 2026, per mostrare quattro modelli non ancora rilasciati. Il responsabile LLM del laboratorio, Liu Da Yiheng, ha presentato in anteprima sul palco Qwen 4 Max, Qwen 4 Flash, Qwen 4 Plus e Qwen 4 27B, ha descritto la famiglia come in addestramento su un'architettura di nuova generazione e si è limitato a dire che sarebbe arrivata presto. Al momento in cui scriviamo non esiste una scheda modello per nessuno dei quattro, né pesi aperti, né identificatore API, né finestra di contesto, né prezzo, né punteggio di benchmark. Il flagship più recente che si può effettivamente chiamare oggi è Qwen3.8-Max, disponibile a livello generale dal 3 agosto 2026, e quella distanza tra un annuncio sul palco e un endpoint richiamabile è la parte di questa storia che vale la pena leggere con attenzione.

I quattro livelli, e cosa ciascuno dovrebbe essere

La linea Qwen di Alibaba è stata organizzata in livelli di capacità fin dalla generazione Qwen 3, e l'annuncio di Qwen 4 ha mantenuto quella struttura anziché sostituirla. Ciò che è stato mostrato sul palco era un elenco, non una scheda tecnica:

• Qwen 4 Max — il livello di punta, e quello che Alibaba contrappone al modello migliore di ogni altro laboratorio di frontiera

• Qwen 4 Flash — il livello ad alto throughput, progettato per carichi sensibili alla latenza e ad alto volume anziché per il ragionamento di picco

• Qwen 4 Plus — il livello intermedio equilibrato, storicamente quello con la più ampia gamma di supporto multimodale

• Qwen 4 27B — il livello locale a pesi aperti, quello che viene scaricato, messo a punto e quantizzato da persone che non toccano mai un'API ospitata

• Architettura — descritta come una nuova generazione e descritta come in addestramento, il che non equivale a essere finita

• Carico di lavoro primario — attività agentiche e con utilizzo di strumenti, secondo l'inquadramento della conferenza, anziché chat

• Disponibilità — nessuna. Nessun livello ha una data di rilascio, un prezzo, una finestra di contesto, un elenco di modalità o un punteggio pubblicato

La fascia 27B è quella da tenere d'occhio per una ragione che non ha nulla a che fare con i benchmark. È l'unica fascia della famiglia che storicamente è stata distribuita con pesi aperti, e la generazione Qwen 3.8 ha mostrato quanto lavoro indipendente questo sblocchi: nel giro di pochi giorni dall'arrivo dei pesi 27B, la comunità aveva prodotto conversioni MLX, quantizzazioni NVFP4 e fine-tune non censurati. Un 27B annunciato è la promessa di un intero ecosistema a valle, ed è la parte di questa roadmap con la consegna più prevedibile.

Il numero da 5 a 10 trilioni di parametri non appartiene a Qwen 4

La copertura della conferenza è stata imprecisa su una cifra. L'obiettivo "da 5 a 10 bilioni di parametri" che circolava insieme alle notizie su Qwen 4 non è una specifica di Qwen 4 — è un'affermazione prospettica sulle generazioni successive, l'orizzonte temporale di Qwen 4.5 e Qwen 5. Alibaba non ha associato alcun numero di parametri a Qwen 4 Max, e in base alle evidenze disponibili sarebbe un errore pubblicarne uno.

Questo è importante perché il numero di parametri è quello su cui i lettori si ancorano e quello che si propaga. Un'affermazione di 5T parametri associata a un modello senza architettura pubblicata è non falsificabile in entrambe le direzioni: nessuno può confermarla, e nessuno può correggerla una volta che è stata ripetuta. Se questa settimana vedi Qwen 4 Max descritto come un modello con molti trilioni di parametri, quel numero è stato preso in prestito da una diapositiva diversa.

Quello che si può dire onestamente è che il predecessore flagship è un mixture-of-experts da 2,4 trilioni di parametri con 95 miliardi di parametri attivi per token, confermato sulla scheda ufficiale del modello per Qwen3.8-Max e sul rilascio open-weight che è seguito. Qualunque cosa si rivelerà essere Qwen 4 Max, quella è la baseline che deve superare, ed è un numero pubblicato e verificabile, non un'aspirazione da roadmap.

A two-column scoreboard titled "Qwen 4 Max vs the model you can call today". Left column Qwen 4 Max: Release date not given, Input price not given, Output price not given, Context window not given, Open weights not given, Benchmarks not given. Right column Qwen3.8-Max: Release date August 3 2026, Input price $2.00 per 1M tokens, Output price $6.00 per 1M tokens, Context window 1M tokens, Open weights published August 12 2026, Benchmarks vendor and independent. Footer reads "Qwen 4 Max status per Alibaba's September 22 2026 conference; Qwen3.8-Max from its published model card.", with the OrcaRouter logo bottom-right.

L'architettura non è un'indiscrezione: una sua anteprima è già stata distribuita

La cosa più utile dell'annuncio di Qwen 4 è che parte dell'architettura era già stata rilasciata con un nome diverso. Qwen3.8-Flash-Next è stato reso open source alla fine di agosto 2026, e la sua scheda del modello lo etichetta chiaramente come un'anteprima dell'architettura di Qwen 4. Questo lo rende l'unica prova concreta che chiunque al di fuori di Alibaba abbia su come è costruita la famiglia Qwen 4.

È un modello sparso con 125 miliardi di parametri principali più 51 miliardi di parametri di embedding di N-gram, che ne attiva circa 6 miliardi per ogni passo di inferenza. Porta con sé un contesto nativo di 262.000 token che, secondo la scheda, si estende fino a 1 milione, e Alibaba riferisce che è stato addestrato a un costo inferiore di circa il 90 percento rispetto a Qwen3.7-Plus. Sulla scheda sono menzionate tre tecniche:

• QSA, uno schema di attenzione sparsa specifico di Qwen, ovvero il meccanismo alla base della promessa di addestramento a basso costo su contesti lunghi

• Connessioni residue con gating, una misura di stabilità per reti sparse profonde

• Embedding di N-gram, un archivio di parametri separato da 51 miliardi di parametri a cui si accede tramite consultazione anziché con un calcolo denso

Se i quattro livelli di Qwen 4 ereditano quel design, la conseguenza interessante è di natura economica più che architetturale. Una famiglia progettata per raggiungere una qualità vicina alla frontiera a circa un decimo del costo di addestramento è una famiglia che può essere prezzata in modo aggressivo, e il prezzo aggressivo di Alibaba è stata la forza più affidabile in assoluto nell'economia dei modelli a pesi aperti per due anni. Questa è una previsione, non un fatto, e dovrebbe essere etichettata come tale — ma è il motivo per seguire questa roadmap invece di scartarla.

Cosa eseguire mentre aspetti

Niente nell'annuncio di Qwen 4 cambia ciò che è disponibile questa settimana, e la risposta onesta per chiunque stia sviluppando oggi è la generazione Qwen 3.8. Qwen3.8-Max è disponibile a livello generale dal 3 agosto 2026 a 2,00 $ per milione di token in input e 6,00 $ per milione di token in output, con tariffa unica su tutto il contesto da 1 milione di token e senza supplemento per i prompt lunghi, e i suoi pesi sono stati pubblicati il 12 agosto 2026 come Qwen3.8-2.4T-A95B sia in BF16 sia in FP8 con una licenza Qwen personalizzata. È il modello rispetto al quale verranno misurati i livelli di Qwen 4, e oggi serve traffico di produzione.

Se vuoi confrontare la generazione Qwen attualmente disponibile con il resto della frontiera senza gestire un account, una chiave e una fattura separati per ogni laboratorio, OrcaRouter porta la famiglia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — accanto a Claude Opus 5, DeepSeek V4 Pro, Gemini 3.1 Pro Preview e GLM 5.3 su un unico endpoint compatibile con OpenAI. Ovvero una sola API per quasi 200 modelli a markup 0%, il che significa che il prezzo di listino del fornitore viene trasferito invariato, così un taglio di prezzo del vendor arriva sulla tua chiave lo stesso giorno anziché al ciclo di fatturazione successivo. Quando arriverà un tier Qwen 4, sarà nello stesso catalogo che comparirebbe; oggi, nessuno di essi è presente.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the on-page nav, the 1M token context badge, the model ID qwen/qwen3.8-max, multi-modality shown as text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the code-samples panel with the OpenAI-compatible Python import, the Public benchmarks and Community buzz blocks, and the opening line of the model description calling Qwen3.8-Max Alibaba's newest flagship and highest-capability tier to date.

La conclusione

Qwen 4 Max è un annuncio reale e non un prodotto reale, ed entrambe le metà di quella frase contano. La gamma è confermata: quattro livelli, un'architettura di nuova generazione, un focus agentico e un livello 27B a pesi aperti che conterà per più persone più di quanto conterà il modello di punta. Tutto ciò che serve per una decisione d'acquisto — prezzo, contesto, modalità, pesi, punteggi, una data — manca.

Consideralo un segnale di roadmap con una traccia documentale insolitamente buona, perché il rilascio di Qwen3.8-Flash-Next ti offre gratuitamente l'anteprima dell'architettura e Qwen3.8-Max ti fornisce la baseline incumbent con pesi pubblicati e un prezzo pubblicato. Monitora il tier 27B per l'ecosistema che creerà e il tier Flash per l'economia del throughput. Non ripubblicare la cifra dei 5-10 trilioni di parametri come un fatto su Qwen 4, e non pianificare una migrazione attorno a un modello che non ha una data di rilascio — pianificala attorno a Qwen3.8-Max, e migra quando c'è un endpoint verso cui migrare.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno