
Qwen3.8-Max vs Qwen 3.8: Un unico core 2,4T, a noleggio o self-hosted — Dopo il refresh 0902
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il 2 settembre 2026, Alibaba ha distribuito un aggiornamento datato di Qwen3.8-Max — la build che identifica come Qwen3.8-Max-0902 — e una classifica indipendente per la generazione di codice ha piazzato il nuovo snapshot al #1 nella stessa settimana. La versione scaricabile di quello stesso nucleo da 2,4 trilioni di parametri, il modello a cui la maggior parte delle persone pensa quando scrive "Qwen 3.8" senza suffisso, è ancora ferma al checkpoint del 12 agosto: solo testo, ragionamento sempre attivo e a centinaia di gigabyte dall'essere eseguibile su qualsiasi cosa più piccola di un rack di GPU. Quel divario tra il modello di punta ospitato e i pesi open non esisteva ad agosto. Ora è l'intero confronto, ed è il motivo per cui lo stesso modello continua a esserti venduto con due nomi.
Qwen3.8-Max è il modello di punta ospitato da Alibaba: un modello sparso a miscela di esperti da 2,4 trilioni di parametri, con circa 95 miliardi di parametri attivi per token, disponibile su un’API a pagamento dal 3 agosto e dotato di una finestra di contesto multimodale da 1 milione di token. Qwen 3.8, inteso come nome a sé stante, è la versione open della stessa generazione — soprattutto Qwen3.8-2.4T-A95B, i pesi pubblicati da Alibaba il 12 agosto sotto una licenza su misura. Non sono un fratello più economico e uno premium: sono lo stesso cervello venduto in due modi, e una passata di post-addestramento di settembre ha iniziato a separare le due versioni. Questo articolo chiarisce quale “Qwen 3.8” stai effettivamente guardando, cosa ha cambiato l’aggiornamento 0902 e quale percorso — affittare l’API o eseguire i pesi — dovresti seguire oggi.
L'abbinamento che non è una rivalità
Prima delle date e dei listini tariffari, l'architettura: Qwen3.8-Max e Qwen3.8-2.4T-A95B condividono un design MoE a grana fine con 512 esperti per layer (10 instradati più uno condiviso, per layer), 92 layer e uno stack ibrido in cui 69 dei 92 layer utilizzano attenzione lineare — Gated DeltaNet combinata con attenzione gated — con attenzione completa intervallata per il lavoro a contesto lungo. È per questo che la model card può dichiarare il contesto da un milione di token sull'API e per cui la build open raggiunge un contesto nativo di 262K che si estende verso il milione con la giusta configurazione di serving. Le differenze tra i due nomi non riguardano l'architettura dei pesi; sono ai margini, e i margini si sono spostati dal 2 settembre.
• Parametri — Qwen3.8-Max: 2,4T totali / ~95B attivi, MoE. Qwen3.8-2.4T-A95B: stesso core, stesso numero di parametri attivi.
• Delivery — Qwen3.8-Max: API ospitata, attiva dal 3 agosto, aggiornata come Qwen3.8-Max-0902 il 2 settembre. Qwen3.8-2.4T-A95B: pesi scaricabili, pubblicati per la prima volta il 12 agosto, nessun checkpoint più recente da allora.
• Modalità — Qwen3.8-Max: input di testo, immagini e video. Qwen3.8-2.4T-A95B: solo testo.
• Controllo del ragionamento — Qwen3.8-Max: attivazione/disattivazione del pensiero, inclusa una modalità senza pensiero. Qwen3.8-2.4T-A95B: pensiero sempre attivo, con solo un selettore dello sforzo di ragionamento (basso / alto / extra-alto).
• Tooling — {{1}}Qwen3.8-Max{{/1}}: {{2}}chiamata nativa di funzioni, cinque strumenti integrati e output strutturato{{/2}}. {{3}}Qwen3.8-2.4T-A95B{{/3}}: {{4}}nessun layer nativo per gli strumenti; ciò che ottieni dipende dal framework di inferenza con cui lo servi{{/4}}.
Cosa ha cambiato l'aggiornamento del 2 settembre
La build 0902 è una passata di post-training, non una nuova architettura. Alibaba l'ha indirizzata verso i due ambiti per cui Qwen3.8-Max era già celebre — il coding e il "cowork", come l'azienda chiama il lavoro agentico e d'ufficio a lungo orizzonte temporale — e i numeri che hanno accompagnato il debutto sono il motivo per cui questo aggiornamento conta. Nella classifica indipendente Code Arena: WebDev, Qwen3.8-Max-0902 ha debuttato con 1.691 punti Elo, un balzo di 22 punti rispetto alla build precedente, sufficiente a farle conquistare il primo posto appena arrivata. Alibaba presenta inoltre la build come il modello con il punteggio più alto sulla frontiera di Pareto costo-prestazioni di quella classifica, a una tariffa mista di circa 5 dollari per milione di token — il prezzo di listino di 2 e 6 dollari ponderato in base al traffico agentico ad alta intensità di output, circa un quarto di quanto costa altrove una chiamata a un modello di frontiera comparabile. Il lettore deve però tenere distinti questi numeri: i 1.691 punti Elo sono un risultato di arena indipendente; l'inquadramento sulla frontiera di Pareto è la caratterizzazione che Alibaba dà di quella stessa classifica indipendente.
Le valutazioni interne di Alibaba per il pass 0902, riportate dal vendor e non riprodotte, mostrano la stessa direzione: Terminal-Bench 3.0 passa da 11,3 a 29,0, ProgramBench da 10,5 a 28,0, JobBench da 53,4 a 64,0 e WorkArena Elo da 1.348 a 1.468. Leggeteli come «il refresh ha spostato gli assi agentico e di coding», non come punteggi verificati. Sul fronte dell'intelligenza generale, l'Intelligence Index di Artificial Analysis colloca Qwen3.8-Max a 56 — competitivo, ma non è il motivo per cui sceglierlo; lo sono i risultati di coding e quelli agentici.
La parte che la maggior parte dei resoconti ha trascurato è che il post-training del 0902 è, al momento in cui scriviamo, disponibile solo via API. Alibaba non ha pubblicato un checkpoint aperto del modello aggiornato: i pesi Qwen3.8-2.4T-A95B su Hugging Face risalgono ancora alla release del 12 agosto. Ciò significa che il Qwen3.8-Max ospitato e il core scaricabile non sono più lo stesso modello come lo erano a metà agosto. L'API ha il post-training di settembre; i pesi no. Se la tua unica ragione per usare la release aperta era riprodurre esattamente ciò che fa il modello di punta, quell'assunto ha smesso silenziosamente di essere valido il 2 settembre.

I cinque punti in cui divergono davvero
Messa da parte l'architettura condivisa, le differenze pratiche risultano chiare. La modalità è il primo filtro: se il tuo carico di lavoro include immagini o video — screenshot, grafici, documenti con figure, fotogrammi video — solo Qwen3.8-Max li accetta, e la sua finestra da 1 milione di token è nativa, non un'estensione. I pesi aperti sono solo testo. Il controllo del ragionamento è il secondo: l'API ospitata può funzionare con il pensiero disattivato, il che conta per l'estrazione sensibile alla latenza e ad alto volume, dove una catena di pensiero è puro overhead; la build aperta non può disattivarlo. Il tooling è il terzo: la chiamata di funzione, i cinque strumenti integrati e la modalità JSON fanno parte del prodotto ospitato, mentre la build aperta dipende da ciò che fornisce il tuo strato di servizio.
{{1}}La questione del contesto è più sottile di quanto suggerisca la scheda tecnica.{{/1}} {{2}}Entrambi i modelli possono raggiungere circa un milione di token, ma il modello ospitato lo fa nativamente con input multimodale, mentre il contesto nativo di 262K della versione open deve essere esteso tramite configurazione,{{/2}} {{3}}e ogni token di quella finestra estesa è di testo.{{/3}} {{4}}Anche i limiti di output differiscono{{/4}} — {{5}}l'API consente fino a circa 131K token di output,{{/5}} {{6}}e la versione open è in genere configurata con un tetto simile,{{/6}} {{7}}ma sul lato open il tetto pratico è determinato dal tuo stack di serving, non dal modello.{{/7}}
Quanto costa realmente ogni percorso
È qui che le due versioni smettono del tutto di essere confrontabili. Qwen3.8-Max ha un prezzo di listino: $2,00 per milione di token di input, $6,00 per milione di token di output e $0,25 per milione per l'input in cache. Poiché OrcaRouter applica i prezzi di listino dei provider con un markup dello 0%, questa è la tariffa che paghi qui e, quando Alibaba modifica il prezzo, la nuova tariffa è attiva lo stesso giorno. Lo snapshot 0902 è fissato separatamente come qwen/qwen3.8-max-0902 per i team che vogliono un comportamento riproducibile — stesso prezzo, stesse capacità, ma un checkpoint fisso invece del modello in continuo aggiornamento. Sul traffico di OrcaRouter, il time-to-first-token mediano su 7 giorni per Qwen3.8-Max è di circa 2–4 secondi e Artificial Analysis misura circa 45–48 token di output al secondo: non è lento, ma è verboso, motivo per cui i compiti agentici su questo modello possono consumare quantità sorprendenti di token nonostante la tariffa economica.

Qwen3.8-2.4T-A95B non ha un prezzo di listino, perché il prezzo è la tua infrastruttura. I pesi in BF16 occupano circa 4,9 TB e persino la build FP8 ufficiale è di circa 2,4 TB, quindi stiamo parlando di hardware su scala rack: le configurazioni di serving documentate più piccole partono da circa otto GPU B300 o GB300, e un rack GB300 NVL72 completo è il deployment di riferimento. La quantizzazione aggressiva abbassa il limite minimo — una build NVFP4 occupa circa 1,3 TB, e la quantizzazione layerizzata a 1 bit di Unsloth comprime il modello a circa 397 GB, che è ciò che finalmente rende fattibile un singolo nodo ben provisionato — ma ognuno di questi percorsi presuppone che tu gestisca GPU su scala data-center. Gli host terzi che servono il checkpoint aperto ti venderanno token a un prezzo inferiore a quello per token del Max, ma in cambio rinunci all'input multimodale, alla modalità non-thinking, agli strumenti nativi e al post-training 0902, e nessun benchmark indipendente di quel checkpoint scaricabile è stato ancora pubblicato. La model card di Alibaba è onesta riguardo alla relazione: descrive Qwen3.8-Max come la versione ufficiale basata su Qwen3.8-2.4T-A95B, che aggiunge input visivo, supporto non-thinking, un contesto predefinito di 1M e strumenti integrati sopra il core aperto.

Numeri indipendenti a confronto con le dichiarazioni del fornitore
L'onestà delle fonti conta più qui che nella maggior parte dei confronti, perché le evidenze a disposizione dei due modelli hanno età molto diverse. Qwen3.8-Max è stato valutato in modo indipendente: il risultato di 1.691 in Code Arena: WebDev per la build 0902 e l'Intelligence Index di Artificial Analysis, pari a 56, sono misurazioni di terze parti, e i prezzi che rendono interessante l'affermazione sulla frontiera di Pareto provengono da un listino pubblicato. Qwen3.8-2.4T-A95B non ha ancora nulla di tutto ciò — la tabella dei benchmark che Alibaba ha pubblicato descrive il core di classe Max, non un'esecuzione indipendente del checkpoint scaricabile, quindi il lato open di questo confronto è ancora in gran parte "il fornitore afferma che il core ha punteggi di questo tipo". Se devi decidere tra i due in base alle capacità, considera le cifre di punta dei pesi open come affermazioni finché una terza parte non le verifica in modo indipendente.
Chi dovrebbe scegliere cosa
La decisione scaturisce direttamente dall'elenco sopra. Scegli la versione hosted di Qwen3.8-Max — oggi, in particolare la build 0902 — quando ti servono il post-training di settembre, l'input di immagini o video, una modalità non-thinking, strumenti nativi e output strutturato, oppure una finestra da un milione di token senza mettere in piedi infrastrutture. Questa è la posizione di frontiera per coding e agenti, e a $2/$6 con input in cache a $0.25 è prezzato in modo aggressivo per quello che offre.
Scegli Qwen3.8-2.4T-A95B quando il controllo supera la convenienza: hai bisogno dei pesi sul tuo hardware o su un provider che già gestisci, vuoi un checkpoint fisso che puoi verificare e riprodurre, oppure il tuo volume sostenuto rende il costo per token il termine dominante e sei pronto a eseguire un MoE da 2.4T. Accetta l'elenco dei compromessi — solo testo, ragionamento sempre attivo, nessun tooling nativo, nessun post-training 0902 per ora — e verifica i termini di licenza per la tua fascia di ricavi, perché la licenza personalizzata Qwen3.8-Max non è Apache 2.0 e aggiunge condizioni per i grandi operatori commerciali.
Se il tuo carico di lavoro è ad alto volume, su singola GPU o sensibile alla latenza, nessuno di questi potrebbe essere la corsia giusta: il fratello della generazione con 27 miliardi di parametri, Qwen3.8-27B, è quello dimensionato per questo scenario, ed è trattato separatamente nel nostro confronto Qwen3.8-27B vs Qwen3.8-Max.
Come provare entrambi senza rischiare il tuo stack
Il modo pulito per prendere questa decisione è testare entrambe le parti sui propri prompt, ed è qui che un livello di routing dimostra il suo valore, piuttosto che un componente aggiunto in seguito. Qwen3.8-Max e lo snapshot fissato Qwen3.8-Max-0902 risiedono entrambi dietro un unico endpoint compatibile con OpenAI su OrcaRouter, quindi passare dall'ammiraglia in evoluzione al checkpoint riproducibile è un cambio di ID del modello, non una ridistribuzione. Quando un team decide di portare i pesi aperti in-house, la DSL di routing può porsi davanti a un endpoint vLLM o SGLang self-hosted che serve Qwen3.8-2.4T-A95B e collocarlo nello stesso grafo di chiamate — con il traffico di volume instradato verso il proprio deployment, i prompt complessi e le richieste multimodali convogliati verso il Qwen3.8-Max ospitato, e failover automatico tra i due. Provare un nuovo checkpoint in questo modo richiede una modifica di configurazione, non una migrazione, ed è esattamente ciò che serve quando le due parti di questo confronto si muovono ancora a velocità diverse.
La conclusione
Qwen3.8-Max e Qwen 3.8 non sono due modelli in competizione per lo stesso ruolo. Sono un unico nucleo da 2,4 trilioni di parametri offerto come API a noleggio e come pesi scaricabili, e l'aggiornamento del 2 settembre ha fatto sì che le due modalità di distribuzione significassero cose diverse. Se noleggi l'API, ottieni il post-addestramento 0902 che ha conquistato il primato nella Code Arena: WebDev, oltre a visione, una modalità non-thinking, strumenti nativi e una finestra nativa da un milione di token, a $2/$6 con $0,25 per input in cache. Se esegui i pesi aperti, ottieni la stessa architettura congelata al suo stato del 12 agosto — solo testo, ragionamento sempre attivo — senza ancora punteggi indipendenti e con una bolletta hardware da data center. Se i guadagni di settembre in ambito coding e agentico contano per te, solo uno dei due nomi li ha oggi. Se invece per te conta di più il controllo riproducibile, solo uno dei due nomi è tuo da tenere.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
