
Recensione di Qwen3.8-Max: l'ammiraglia da 2,4T di Alibaba a $2/$6 — la build 0902 domina Code Arena WebDev
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Alibaba Qwen ha presentato in anteprima Qwen3.8-Max alla World AI Conference di Shanghai il 19 luglio 2026, e per due settimane è stato il modello più discusso che nessuno riusciva davvero a prezzare. Non c'era un listino prezzi, né una tabella di benchmark, né una scheda del modello, né una licenza, né un conteggio dei parametri attivi — solo un titolo da 2,4 trilioni di parametri e l'affermazione che il modello si collocava "secondo solo a Claude Fable 5."
Il 3 agosto 2026 è cambiato tutto. Qwen3.8-Max è ufficialmente disponibile: una tariffa pubblicata a 2 dollari per milione di token di input e 6 dollari per milione di output, un endpoint compatibile con OpenAI e DashScope, una tabella completa di benchmark e pesi open source rilasciati il 12 agosto. Una settimana dopo, il 14 agosto, è andato live su DigitalOcean Serverless Inference come "Day 0 launch partner" di Alibaba — il primo grande cloud occidentale a servirlo. Il 2 settembre Alibaba ha pubblicato un aggiornamento denominato Qwen3.8-Max-0902, ulteriormente post-addestrato su Coding e Cowork, che secondo Qwen rafforza le prestazioni su lavori enterprise e scientifici complessi. Questa recensione è scritta sulla base dei dati della disponibilità generale, integrando il lancio al day zero e la build 0902, e risponde alla domanda che i team realmente si pongono ora che il modello è acquistabile: Qwen3.8-Max è pronto a sostenere il traffico di produzione, o è ancora un modello da tenere sotto osservazione?
La risposta breve è che è progredito più di quanto la maggior parte delle persone si aspettasse — i prezzi in particolare sono aggressivi in un modo che ridetermina il limite della frontiera, e l'aggiornamento del 2 settembre punta ancora più forte sulle due cose in cui il modello era già bravo — programmazione e lavoro collaborativo. Il punteggio indipendente pubblicato successivamente è davvero buono, ma contiene un'avvertenza che vale la pena leggere prima di inviare traffico.
TL;DR. Qwen3.8-Max è ora GA a $2 / $6 per 1M di token, con tariffa piatta sull'intero contesto di 1M di token e nessun sovrapprezzo per i prompt lunghi — sotto Kimi K3 ($3/$15) e Claude Opus 5 ($5/$25) sull'output, il principale fattore di costo per il lavoro di reasoning. Alibaba ha pubblicato una solida tabella di benchmark (Terminal-Bench 2.1 86,6, GPQA Diamond 92,6, OSWorld-Verified 86,1) e il balzo nel coding rispetto al predecessore è notevole: FrontierSWE 73,5 contro 40,7. Ma la tabella sulla qualità è di Alibaba stessa, e il primo arbitro indipendente — l'Artificial Analysis Intelligence Index — si è ora espresso: Qwen3.8-Max totalizza 56 punti a $1,14 per task, alla pari con Claude Opus 4.8 (56) e un punto dietro al leader open-weights Kimi K3 (57), con un costo per task superiore del 25%. Il numero di parametri attivi non è più un'incognita: 95B attivati su un totale di 2,4T, come confermato sulla scheda ufficiale del modello, che finalmente consente a chi è esterno di ragionare sull'economia del serving. Da quando è uscita questa recensione si è aperta anche una seconda via gestita: Qwen3.8-Max è andato in produzione su DigitalOcean Serverless Inference il 14 agosto, in veste di partner Day 0 di Alibaba, con numeri di serving pubblicati da DigitalOcean — prefill che scala a ~16.000 token/sec e ~1.937 token di output/sec a 256 richieste concorrenti, con zero errori — che costituiscono i primi dati concreti sulla latenza da un provider diverso da Alibaba. Il 2 settembre Alibaba ha rinnovato il modello di punta rilasciando Qwen3.8-Max-0902, ulteriormente post-addestrato su Coding e Cowork; Qwen afferma che la nuova snapshot sia più forte su carichi di lavoro enterprise e scientifici complessi — un'affermazione del fornitore, senza ancora numeri indipendenti su attività enterprise o scientifiche. Il lato coding della build 0902 ha ora un risultato indipendente in arena tutto suo: Qwen3.8-Max-0902 ha debuttato al #1 nella classifica Code Arena: WebDev con 1.691 punti — 22 in più rispetto alla build precedente e davanti a Claude Opus 5 e Kimi K3 — secondo Alibaba, che cita la classifica live di terze parti. La storia del commercio agentico ha guadagnato un tabellone la stessa settimana: su CommerceAgentBench, un nuovo benchmark del team Accio di Alibaba costruito su repliche stateful di software commerciale reale, Qwen3.8-Max registra il risultato open-weight più forte — 156 passaggi aggregati su tre harness, due in più di DeepSeek V4 Pro — una tabella gestita dal fornitore, non un arbitro indipendente. Verdetto: ora è davvero acquistabile, ed è abbastanza economico da giustificare una valutazione vera e propria — ma va instradato con criterio, non in blocco.
Punti chiave
• GA dal 3 agosto 2026. L'era della campagna di anteprima e crediti è finita; ora ci sono un vero tariffario e un vero endpoint.
• $2 / $6 per 1M token, un unico livello flat per 1M di contesto. La maggior parte dei rivali applica un sovrapprezzo per i prompt lunghi. Alibaba non lo fa, il che conta enormemente per il lavoro su documenti lunghi e repository di grandi dimensioni.
• La tabella dei benchmark di Alibaba è solida ma non verificata: Terminal-Bench 2.1 86.6, GPQA Diamond 92.6, PaperBench 93.0, IFBench 82.8, OSWorld-Verified 86.1, OmniDocBench 1.5 92.1.
• Il salto generazionale nel coding è la vera storia: FrontierSWE 73.5 (da 40.7) e DeepSWE 1.1 56.6 (da 21.6) — quasi un raddoppio per entrambi.
• Il primo punteggio indipendente è arrivato: Qwen3.8-Max ottiene 56 sull'AA Intelligence Index a $1.14 per task — un balzo di 10 punti rispetto a Qwen3.7-Max (46), alla pari con Claude Opus 4.8 (56), un punto dietro a Kimi K3 (57). La classifica generale di LMArena non ha ancora un punteggio pubblico.
• Parametri attivi confermati a 95B — la scheda ufficiale del modello indica 2,4T totali e 95B attivati, chiudendo la più grande questione aperta nel calcolo dei costi di serving.
I pesi open sono disponibili — Qwen3.8-2.4T-A95B (BF16) e Qwen3.8-2.4T-A95B-FP8 sono arrivati su Hugging Face il 12 agosto con una licenza Qwen3.8-Max personalizzata, non Apache 2.0. Il percorso on-premise di Qwen3.8-27B è stato rilasciato il 14 agosto con licenza Apache 2.0.
• Un secondo percorso gestito è stato aperto il 14 agosto. Qwen3.8-Max è live su DigitalOcean Serverless Inference come "Day 0 launch partner" di Alibaba — NVFP4 su NVIDIA HGX B300, $2/$6 con $0.20 di input in cache, servito al contesto nativo di 262K del checkpoint aperto. I dati misurati da DigitalOcean (prefill ~16K token/sec, zero errori a 256 di concorrenza) sono i primi dati sulle prestazioni di servizio su una piattaforma gestita al di fuori di Alibaba.
• Aggiornamento del 2 settembre: Qwen3.8-Max-0902.Alibaba ha ulteriormente addestrato il modello di punta su Coding e Cowork e lo sta servendo su QwenCloud agli stessi prezzi di $2/$6 e con contesto da 1M. Qwen afferma che le prestazioni enterprise e scientifiche sono più solide — sono ancora dichiarazioni del fornitore — mentre sul fronte del coding è arrivato lo stesso giorno un risultato indipendente dall'arena: la build ha debuttato al #1 su Code Arena: WebDev con 1.691 (vedi punto Code Arena sotto).
• CommerceAgentBench: leader open-weight, gestito dal fornitore. Il team Accio di Alibaba ha rilasciato CommerceAgentBench questa settimana: 107 attività a lungo orizzonte all'interno di repliche stateful di software commerciali e aziendali reali, valutate in base allo stato su tutti gli harness Accio, OpenClaw e Pi. Qwen3.8-Max guida i modelli open-weight con 156 successi complessivi, due in più di DeepSeek V4 Pro; il modello chiuso Claude Opus 5 guida in assoluto con 191, e la tabella è di proprietà di Alibaba, non un giudice indipendente.
• Code Arena: WebDev #1 — il risultato della build 0902 nell'arena indipendente. Qwen3.8-Max-0902 ha debuttato in cima alla classifica Code Arena: WebDev con 1.691 punti — in aumento di 22 punti rispetto alla build precedente e davanti a Claude Opus 5 e Kimi K3 — e guida la frontiera di Pareto costo-prestazioni di quella classifica a un prezzo medio combinato di circa $5/MToken, circa un quarto del prezzo medio combinato di Claude Opus 5. L'account ufficiale QwenCloud di Qwen ha confermato il piazzamento. A differenza di CommerceAgentBench, questa classifica è di terze parti: un'arena con votazione umana alla cieca, non una tabella di Alibaba, anche se "debuttare al #1" è l'annuncio di Alibaba di una rilevazione riferita a un momento specifico.
Nota sull'accuratezza: la tabella benchmark di Qwen3.8-Max in questa recensione è fornita da Alibaba e non è stata replicata in modo indipendente. Il punteggio Artificial Analysis Intelligence Index (56 a 1,14 $/task) è misurato in modo indipendente da AA sull'API ufficiale di Alibaba — il primo arbitro indipendente del modello. I prezzi provengono dalla scheda tariffaria GA di Alibaba Model Studio. I repository open-weights (Qwen3.8-2.4T-A95B e Qwen3.8-2.4T-A95B-FP8), il dato dei 95B attivi e il testo della licenza sono di prima parte: provengono dall'organizzazione Hugging Face di Qwen, verificati il 13 agosto 2026. La disponibilità su DigitalOcean, la sua scheda tariffaria, le misurazioni delle prestazioni di serving e il controllo a campione GPQA di 88 sulla build quantizzata provengono dalla documentazione DigitalOcean e dal tutorial della community, pubblicati insieme all'annuncio del 14 agosto; la caratterizzazione di "partner di lancio Day 0" è il linguaggio dell'annuncio di Alibaba. Laddove citiamo numeri di concorrenti, questi provengono da Artificial Analysis o dal fornitore indicato nel testo. Il refresh Qwen3.8-Max-0902 annunciato il 2 settembre si basa interamente su dichiarazioni del fornitore: specifiche, descrizione del post-training "Coding-and-Cowork" e presunti miglioramenti enterprise e scientifici provengono tutti dall'annuncio di Qwen e dalla pagina del modello su QwenCloud, e nessuno dei suoi dati è stato riprodotto in modo indipendente. La posizione in Code Arena: WebDev trattata nella sezione benchmark è l'unica eccezione: quella classifica è un'arena di voto cieco di terze parti, non una tabella Alibaba — sebbene "debutto al #1 con 1.691" sia l'annuncio di Alibaba di una classifica puntuale, e i punteggi dell'arena continuino a variare man mano che i voti si accumulano. Il risultato di CommerceAgentBench descritto più avanti rientra nella stessa categoria: il benchmark è stato creato e pubblicato da Accio, il team di Alibaba International, quindi le sue tabelle sono fornite da Alibaba — un benchmark open-source, ma non un arbitro indipendente come Artificial Analysis. Le tabelle benchmark dei fornitori sono in genere ottimistiche come regola generale: trattatele come un'ipotesi da verificare sul vostro carico di lavoro, non come una classifica definitiva.

Cos'è Qwen3.8-Max?
Qwen3.8-Max è l'ammiraglia della famiglia Qwen di Alibaba: un modello sparso Mixture-of-Experts con 2,4 trilioni di parametri totali, una finestra di contesto da 1 milione di token e input multimodale nativo. Accetta testo, immagini e video, e restituisce testo. Supporta la modalità di pensiero, il function calling, strumenti integrati e output strutturati, ed è servito tramite un endpoint /v1/chat/completions compatibile con OpenAI, il che significa che la maggior parte delle integrazioni esistenti richiede un cambio di base URL piuttosto che una riscrittura. L'attuale snapshot di produzione, rilasciato il 2 settembre, è Qwen3.8-Max-0902, ulteriormente post-addestrato su Coding e Cowork.
I numeri di contesto pratici sono leggermente più specifici del marketing "1M." I metadati cloud di Alibaba elencano una finestra di 983.616 tokencon il pensiero abilitato, un input massimo di circa 991K token e un output massimo di 131.072 token. Quel tetto di output è insolitamente generoso e conta per attività come la generazione di codice su file completo o la stesura di report lunghi, dove tetti inferiori ti costringono a spezzare e ricucire. Il checkpoint aperto che DigitalOcean ora serve è una configurazione diversa: la sua scheda modello elenca 262.144 token in modo nativo, estensibile fino a circa 1.010.000, quindi il serving di terze parti che esegue la base aperta in genere si attesta sul numero nativo più piccolo.
Il conteggio dei parametri attivi è ora pubblico e il nome del repository lo riporta: A95B significa 95 miliardi attivati. La scheda ufficiale del modello Qwen3.8-2.4T-A95B dichiara “2.4T in totale e 95B attivati”, un Mixture-of-Experts a grana fine con 512 esperti, di cui 10 instradati più uno condiviso sono attivi per token. Quel numero conta più del dato di punta di 2.4T. Per un modello denso, i parametri totali ti dicono approssimativamente quanto costa l’inferenza; per un modello MoE, non dicono quasi nulla — solo il conteggio attivo te lo dice, perché è ciò che viene effettivamente eseguito per token. Un modello da 2.4T che attiva 30B si comporta in modo completamente diverso, in termini di latenza e di economia del serving, da uno che ne attiva 200B. Con 95B attivi, la computazione per token si colloca nello stesso ordine di grandezza di un modello denso intorno ai 90B — una frazione di ciò che richiederebbe un modello denso da 2.4T — ed è questo il numero che rende finalmente possibile rispondere alla questione del self-hosting di seguito.
Il refresh del 2 settembre: Qwen3.8-Max-0902
Il 2 settembre 2026, Qwen ha rilasciato il suo primo production refresh denominato. Qwen3.8-Max-0902 mantiene la stessa architettura sparse-MoE da 2.4T parametri, gli stessi 95B parametri attivi e la stessa finestra di contesto da 1M token, ma è stato ulteriormente post-addestrato su due capacità — Coding e Cowork — ed è disponibile sull'API di QwenCloud come qwen3.8-max-0902 (anche elencato come qwen3.8-max-2026-09-02). È la build attualmente consigliata, non un ramo secondario: l'endpoint qwen3.8-max non datato di Alibaba ora serve lo snapshot 0902, quindi una chiamata al nome standard del modello viene indirizzata al refresh, mentre l'id datato esiste per i team che vogliono fissare la build esatta. Dal 3 settembre, lo snapshot è stato inoltre elencato come ID modello instradabile autonomo sulle API gestite di terze parti. Il listino prezzi non si è mosso: $2 per 1M di input, $6 per 1M di output, con le stesse tariffe per la cache.
Le affermazioni sulle prestazioni sono di Qwen. L'annuncio e la pagina del modello QwenCloud descrivono una capacità di Coding che "apre nuove frontiere" nei progetti su scala ingegneristica e nello sviluppo autonomo a lungo orizzonte, un'esperienza di agente collaborativo "significativamente migliorata" nell'orchestrazione multi-strumento e nella consegna end-to-end delle attività e — come dice l'azienda — prestazioni più solide su complesse attività aziendali, ricerca scientifica e flussi di lavoro a ciclo lungo. Il primo controllo indipendente è arrivato lo stesso giorno. Qwen3.8-Max-0902 ha debuttato al #1 nella classifica Code Arena: WebDev — un'arena di terze parti a voto cieco per lo sviluppo web agentico, il progetto precedentemente noto come WebDev Arena — con 1.691 punti, in aumento di 22 rispetto alla build precedente e davanti a Claude Opus 5 e Kimi K3, secondo Alibaba, che cita la classifica live — un piazzamento che l'account ufficiale di Qwen ha confermato lo stesso giorno, indicando l'API QwenCloud. Ciò che questo dimostra e ciò che non dimostra vengono analizzati nella sezione benchmark qui sotto. Le restanti affermazioni dell'aggiornamento — ragionamento aziendale, lavoro scientifico e autonomia generale a lungo orizzonte — sono ancora solo dichiarazioni del fornitore, quindi mantieni la disciplina applicata alla tabella di agosto: trattale come un'ipotesi finché un'analisi di Artificial Analysis o un carico di lavoro reale non le conferma.
Ciò che "Cowork" significa in pratica è il punto in cui l'aggiornamento diventa interessante. La Qwen3.8-Max dell'era GA si basava già sull'autonomia a lungo orizzonte — la creazione di oh-my-cli in 16 giorni, l'attività virtuale con oltre 2.000 round — e la build 0902 è Alibaba che raddoppia su questo asse: agenti che orchestrano più strumenti e portano a termine un compito end-to-end, invece di risposte single-shot. Nella stessa settimana, il team Accio di Alibaba ha pubblicato CommerceAgentBench, un benchmark costruito per misurare direttamente questo asse: 107 compiti a lungo orizzonte all'interno di repliche stateful di software commerciali e aziendali reali, dove Qwen3.8-Max guida il campo dei modelli open-weight — come dettagliato nella sezione benchmark qui sotto. Per i team che valutano il modello per l'uso enterprise, questa è l'affermazione da testare per prima, perché è anche la più difficile da verificare da una tabella di benchmark.
Pricing: la cosa più aggressiva di questo lancio
Alibaba Model Studio elenca Qwen3.8-Max a $2.00 per 1M token di input e $6.00 per 1M token di output. L'output include i token di ragionamento, un aspetto rilevante perché le configurazioni con uso intensivo di ragionamento addebitano la loro deliberazione interna alla tariffa di output. Economia della cache: gli hit di input in cache costano $0.25 per 1M, la creazione esplicita della cache $2.50, e le letture esplicite della cache $0.17.
La parte strutturalmente interessante non è il numero principale, ma il livello fisso. Alibaba applica gli stessi $2/$6 sia che il prompt sia di 5.000 token sia che sia di 900.000. La maggior parte dei concorrenti applica un sovrapprezzo per il contesto lungo proprio perché servire un prompt di quasi un milione di token è costoso. Il fatto che Alibaba assorba questo costo è una deliberata conquista di mercato rivolta esattamente ai carichi di lavoro in cui il contesto lungo è il punto centrale: revisione dell'intero repository di codice, analisi di contratti e documenti, sintesi di ricerche su più documenti.
Esempio svolto. Supponi di eseguire un agente di analisi del repository: 200,000 token di input di contesto del codice e 8,000 token di output per chiamata.
• Per chiamata: 0.2M × $2 = $0.40 input, più 0.008M × $6 = $0.048 output. ≈ $0.45 per chiamata.
• A 1.000 chiamate/giorno: ≈ $448/giorno, ovvero circa $13.400/mese.
• La stessa chiamata su Claude Opus 5 a $5/$25: $1.00 + $0.20 = $1.20 — circa 2,7 volte in più.
• Con il caching dei prompt su un contesto di codice stabile, l'input in cache a $0,25 riduce il lato input da $0,40 a $0,05, portando la chiamata a ≈ $0,10 — una riduzione di quasi 4,5× sul traffico ripetuto.
È nella differenza di cache che vive il vero budget. Se il tuo agente rilegge un contesto quasi invariato a ogni turno — cosa che descrive la maggior parte degli agenti di coding e supporto — il prezzo effettivo è molto più vicino a $0.25/$6 che a $2/$6. I team che saltano la configurazione della cache pagano regolarmente 3–4× in più su questo modello.
Per confronto ai prezzi di listino: Qwen3.8-Max $2/$6; il suo predecessore Qwen3.7-Max $2.50/$7.50; Kimi K3 $3/$15; GPT-5.6 Terra $2/$12; Claude Opus 5 $5/$25. In input Qwen è solo competitivo. In output — il lato che domina la spesa nel lavoro di ragionamento e agentico — è il modello più economico tra quelli dichiarati frontier in quella lista.
La misurazione indipendente di Artificial Analysis rivela il rovescio della medaglia di quei token economici. Sul suo Intelligence Index, Qwen3.8-Max costa $1.14 per attività — più del doppio rispetto ai $0.53 del predecessore, e 25% in più rispetto ai $0.86 di Kimi K3 anche se Kimi K3 è listato a $3/$15 per token. Il divario è comportamentale, non un aumento di prezzo: il modello ha impiegato in media 64 passaggi per attività GDPval-AA contro 14 per Qwen3.7-Max e poiché il sistema di valutazione rinvia l'intera conversazione a ogni passaggio, i token di input sono cresciuti di circa 15× e l'output di ~45%. Token economici non equivalgono ad agenti economici — la verbosità segnalata dai tester in anteprima ora ha un prezzo misurato. Poiché OrcaRouter trasmette i prezzi di listino con un margine dello 0% tramite un endpoint compatibile con OpenAI, quella questione da $1.14 contro $0.86 è qualcosa che puoi misurare su prompt identici senza un secondo contratto.

La tabella dei benchmark e ciò che ogni numero misura effettivamente
Al GA, Alibaba ha pubblicato la tabella che aveva trattenuto durante l'anteprima. Punteggi riportati:
• Terminal-Bench 2.1 — 86.6.Misura se un modello può utilizzare una shell reale fino al completamento: eseguire comandi, leggere l'output, recuperare dagli errori. Questo è l'indicatore più vicino a "può funzionare come un agente di codifica piuttosto che come un suggeritore di codice."
• GPQA Diamond — 92.6. Domande di fisica, chimica e biologia a livello post-laurea, formulate per resistere al recupero di informazioni. Un punteggio elevato indica un ragionamento scientifico autentico, non il semplice richiamo di nozioni. Il 92.6 si colloca ai vertici del settore attuale.
• PaperBench — 93.0. Riprodurre i risultati di articoli di ricerca — leggere una metodologia e reimplementarla. Premia la comprensione sostenuta su più fasi.
• IFBench — 82,8. Seguire le istruzioni in condizioni di vincolo: formato, lunghezza e istruzioni negative. È notevole che sia il punteggio più basso nella tabella di Alibaba, il che è coerente con la critica emersa nell'era dell'anteprima secondo cui il modello è tanto esaustivo da ignorare i limiti di ambito.
• OSWorld-Verified — 86.1. Uso del computer: guidare una vera GUI desktop per completare le attività. La forte performance qui supporta il posizionamento agentico.
• OmniDocBench 1.5 — 92.1. Parsing di documenti — tabelle, layout, testo e figure misti. Si abbina al contesto flat-rate da 1M per rappresentare un caso concreto per le pipeline di documenti.
• FrontierSWE — 73.5, in aumento rispetto al 40.7 del suo predecessore. DeepSWE 1.1 — 56.6, in aumento rispetto a 21.6.
Gli ultimi due meritano di essere sottolineati. Quasi raddoppi nei benchmark di ingegneria del software più difficili in una sola generazione non sono normali miglioramenti incrementali, e sono coerenti con la decisione di Alibaba di commercializzare questo modello rivolgendosi agli sviluppatori piuttosto che agli utenti di chat. Se il dato FrontierSWE regge alla replica indipendente, Qwen3.8-Max è un serio modello di programmazione e non solo uno di grandi dimensioni.
La nota di cautela dell'anteprima si è ridotta ma non è scomparsa. La tabella qui sopra è stata prodotta da Alibaba, sul proprio banco di prova, in condizioni che nessun altro può verificare. Le tabelle dei vendor sono scelte, non campionate — i laboratori pubblicano i benchmark in cui ottengono buoni risultati. Ma dal 6 agosto c'è ora un autentico arbitro indipendente: Artificial Analysis ha assegnato a Qwen3.8-Max un punteggio di 56 sull'Intelligence Index al costo di 1,14 $ per task, misurato sull'API ufficiale di Alibaba — un balzo di 10 punti rispetto ai 46 del predecessore, in pari con Claude Opus 4.8 (56) e a un punto da Kimi K3 (57). Nella leaderboard agentica GDPval-AA di AA il modello raggiunge 1.739 Elo, superando Kimi K3 (1.685) e GPT-5.6 Sol (1.730), con solo Claude Opus 5 (1.852) davanti. Anche le note di cautela di AA meritano lo stesso peso: una precedente esecuzione aveva ottenuto 53 prima che i problemi degli endpoint fossero risolti, e il nuovo test sull'API ufficiale ha prodotto 56; AA-Omniscience ha perso 10 punti con un tasso di allucinazioni salito dal 23% al 40%; e il costo per task è elevato proprio perché il modello elabora un numero di passaggi molto maggiore. La classifica generale di LMArena non ha ancora un punteggio pubblico.
Il lancio di DigitalOcean ha aggiunto un terzo dato, questa volta sulla build quantizzata anziché sul modello di punta. Il controllo interno di DigitalOcean sui pesi NVFP4 che serve ha ottenuto 88 su GPQA Diamond, contro i 92,6 pubblicati da Alibaba per il modello di punta non quantizzato. DigitalOcean stesso definisce il confronto "un dato indicativo piuttosto che un confronto controllato" — le differenze riguardano tre assi (base a pesi aperti anziché il modello di punta hosted, NVFP4 anziché BF16 e una diversa pipeline di valutazione) — ma è il primo controllo indipendente su una distribuzione reale di questi pesi, e un promemoria del fatto che il checkpoint aperto non è bit per bit il numero sulla tabella di Alibaba.
CommerceAgentBench: la classifica del commercio agentico
Oltre al refresh, il team Accio di Alibaba International ha rilasciato CommerceAgentBench, un benchmark progettato per valutare proprio il lavoro a lungo orizzonte che Qwen continua a promuovere. Un agente avvia ogni attività all'interno di un container nuovo in una delle 14 repliche offline di software reali di commercio e business — pubblicazione di prodotti, prenotazione di spedizioni, amministrazione dello storefront, operazioni di pagamento, analisi dei fornitori — e la valutazione si basa sullo stato: un'attività viene superata solo quando i servizi mock sottostanti e i file prodotti cambiano realmente, quindi un agente che descrive un flusso di lavoro plausibile senza modificare lo stato ottiene zero punti. La suite esegue 107 attività su superfici CLI, browser, file/documento e API/MCP, tramite tre harness — Accio, OpenClaw e Pi — e il codice degli harness (Apache 2.0) e i dati delle attività (CC BY 4.0) sono aperti per ispezione o nuove esecuzioni.
Nelle tabelle pubblicate, Qwen3.8-Max registra il risultato open-weight più forte: 56 dei 107 task sull'harness Accio, 47 su OpenClaw e 53 su Pi — 156 task superati in totale, due in più dei 154 di DeepSeek V4 Pro. L'intero margine open-weight deriva dall'harness Accio; i due modelli sono pari su OpenClaw e Pi. Il leader open-weight non è il leader assoluto: il modello chiuso Claude Opus 5 surclassa il campo con 191 task superati in totale, 35 in più. E la tabella è di Alibaba stessa — Accio è il team di Alibaba, e il repository stesso segnala i limiti di audit: l'harness Accio è solo di riferimento e non riproducibile da un checkout (OpenClaw è il percorso rieseguibile), i risultati a livello di task mancano di checksum pubblici immutabili, e le righe di Qwen dipendevano da un protocollo di replay del contenuto di ragionamento per restare confrontabili. Trattalo come un dato dichiarato dal fornitore sullo stesso asse agentico che OSWorld-Verified e l'approccio GDPval-AA di AA affrontano da angolazioni diverse — vale la pena metterlo alla prova sui propri workflow, non è una classifica definitiva.
Code Arena WebDev: l'arbitro indipendente della build 0902
Code Arena è la prova indipendente che mancava all'aggiornamento. {{1}}È una classifica di terze parti per lo sviluppo web agentico — il progetto precedentemente noto come WebDev Arena — in cui voti umani alla cieca, raccolti a coppie su quale output di un modello un utente preferirebbe pubblicare, vengono convertiti in un rating in stile Elo.{{/1}} Nella sua classifica WebDev, Qwen3.8-Max-0902 ha debuttato in vetta con 1.691 punti, 22 in più rispetto alla build precedente e davanti a Claude Opus 5 e Kimi K3. {{2}}Il posizionamento ha anche un vantaggio in termini di efficienza dei costi: a un prezzo misto di circa $5 per milione di token — la tariffa di listino $2/$6, ponderata verso il mix ad alta intensità di output che la generazione di app web produce effettivamente — la build 0902 è il modello con il punteggio più alto sulla frontiera di Pareto della classifica, costando circa un quarto del prezzo misto (~$20/M) di Claude Opus 5 e ben al di sotto dei ~$12/M di Kimi K3, motivo per cui questi due restano fuori dalla frontiera nonostante il 2° e il 3° posto per punteggio.{{/2}} Alibaba ha annunciato il posizionamento il 2 settembre e l'account ufficiale di Qwen lo ha confermato, indirizzando gli utenti a QwenCloud; {{3}}la misurazione non è di Alibaba:{{/3}} a differenza della tabella dei benchmark qui sopra o dell'esecuzione di CommerceAgentBench appena descritta, questo punteggio è prodotto da un'arena di terze parti sulla base di voti di preferenza umani.
Due avvertenze rendono onesto il quadro. Primo: i punteggi dell'arena valgono per un momento specifico: 1.691 è il valore su cui si attestava la classifica quando Alibaba ha annunciato il debutto, e si sposterà con l'accumularsi dei voti; va quindi letto come un forte segnale sul coding per lo sviluppo web, non come una corona permanente. Secondo: copre solo quell'asse. Le affermazioni dell'aggiornamento sulle prestazioni enterprise, scientifiche e generali a lungo orizzonte non hanno ancora un arbitro indipendente; per questo la tabella dei vendor e l'AA Index 56 sul modello base restano i punti di riferimento per tutto ciò che esula dal lavoro front-end agentico. Terzo: il prezzo di frontiera è una scelta di modellazione, non un nuovo listino: la cifra di ~$5/MToken combina il listino invariato di $2/$6 assumendo un utilizzo fortemente orientato all'output; va quindi trattata come una classifica di costo-efficienza secondo i criteri dell'arena, non come una rimodulazione dei prezzi da parte di Alibaba.

Pesi aperti, Qwen3.8-27B e la questione dell'on-premise
La promessa open-weight di Alibaba è ora mantenuta. Il 12 agosto 2026, Qwen ha pubblicato due repository su Hugging Face — Qwen3.8-2.4T-A95B in BF16 e Qwen3.8-2.4T-A95B-FP8 — ciascuna con 213 file di pesi. La licenza è una licenza Qwen3.8-Max personalizzata, non Apache 2.0; il campo licenza di Hugging Face riporta "other". I termini consentono uso, modifica, distribuzione e fine-tuning, incluso l'uso commerciale, con attribuzione, più due soglie basate sulle dimensioni: i prodotti con oltre 100 milioni di utenti attivi mensili o 20 milioni di dollari di ricavi mensili devono mostrare il nome del modello in modo ben visibile, e le attività Model-as-a-Service o AI-Work-Assistant con oltre 50 milioni di dollari di ricavi complessivi negli ultimi dodici mesi necessitano di una licenza separata da Qwen. La maggior parte dei team è al di sotto di queste soglie; se la tua attività le supera, leggi il testo della licenza prima di sviluppare su questa base. I contatori dei download confermano la recente pubblicazione — 978 sulla repository BF16 e 3.851 su quella FP8 al momento in cui scrivo, numeri bassi per un rilascio di frontiera e coerenti con una repository creata l'8 agosto e resa pubblica solo il 12 agosto, non una rimasta visibile per una settimana. Un'ultima nota di onestà: il checkpoint aperto è il modello base, solo testo con il thinking sempre attivo, mentre l'API ospitata Qwen3.8-Max aggiunge input visivi, una modalità non-thinking opzionale e il contesto completo da 1M — scaricare i pesi ti dà il modello, non tutte le funzionalità dell'API.
Il self-hosting del modello di punta è ancora fuori dalla portata della maggior parte dei team, ma ora lo è con la matematica alla mano. L'intero set di pesi da 2,4 trilioni di parametri ammonta a circa 4,9 TB in BF16 e a circa 2,4 TB in FP8, perché ogni esperto deve risiedere in memoria anche se solo 95 miliardi vengono attivati per token. Con la quantizzazione a 4 bit siamo nell'ordine di 1,2 TB, contro i circa 141 GB per H200; quindi servono otto o più acceleratori di fascia alta prima di servire un singolo token. Ciò che il conteggio dei parametri attivi, ora reso pubblico, aggiunge è il lato throughput: con 95 miliardi attivati per token, il costo di calcolo per token è paragonabile a quello di un modello denso della classe ~90 miliardi — una frazione del costo che un modello denso da 2,4 trilioni imporrebbe — quindi, una volta che i pesi sono residenti in memoria, il costo per token non è l'incubo che il numero dei parametri totali suggerisce. È esattamente questa combinazione di un ampio ingombro di memoria e di un costo di calcolo per token contenuto a consentire ad Alibaba di prezzare l'output a $6/1M, e a indirizzare i team che fanno self-hosting verso nodi multi-GPU che eseguono i checkpoint FP8, piuttosto che verso qualsiasi soluzione a GPU singola.
La scelta di serving di DigitalOcean è un esempio tangibile di quella matematica in produzione. Esegue il modello quantizzato NVFP4 su GPU NVIDIA HGX B300 proprio affinché i pesi da 2,4T entrino in un singolo nodo, evitando il routing degli esperti tra nodi — un'implementazione reale dell'economia a 4 bit che questa sezione ha finora trattato sulla carta. Il compromesso è esattamente quello che il controllo a campione GPQA sopra quantifica: un ingombro minore, a un costo misurabile in qualità rispetto al modello di punta non quantizzato.
È questo che rende Qwen3.8-27B il rilascio più rilevante per la maggior parte dei lettori — e, a differenza del modello ammiraglia, i suoi pesi sono arrivati nei tempi previsti. Il 14 agosto 2026, Qwen ha pubblicato Qwen/Qwen3.8-27B su Hugging Face e ModelScope con licenza Apache 2.0: un modello denso da 27B, nativamente multimodale, con un contesto nativo di 262K token estendibile a 1M e una modalità reasoning_effort configurabile. Daniel Han di Unsloth aveva stimato che sarebbe stato eseguibile in circa 17 GB di VRAM — una singola scheda prosumer — e ora è possibile testarlo: il repository ufficiale include safetensors BF16 (circa 55,6 GB su 18 shard), mentre le quantizzazioni GGUF stanno seguendo nei repository della community. Il pattern di rilascio di questa generazione è quindi ora completo: i pesi dell'ammiraglia da 2,4T sono arrivati per primi il 12 agosto, e il piccolo modello per il percorso on-premise è arrivato due giorni dopo. Abbiamo seguito il suo rilascio nel nostro post sulla data di uscita di Qwen3.8-27B.
Dove si colloca Qwen3.8-Max: quattro scenari
1. Analisi di documenti lunghi e contratti. Questo è il caso d'uso più adatto. La tariffa fissa su 1 milione di token e il punteggio di 92.1 su OmniDocBench significano che puoi elaborare un documento di 400 pagine in un'unica chiamata, senza sovrapprezzi e senza doverlo suddividere in blocchi. I concorrenti che applicano sovrapprezzi per i contesti lunghi rendono lo stesso lavoro notevolmente più costoso. Sul percorso DigitalOcean, ricorda che quel percorso serve il modello open di base con un contesto di 262K: si tratta comunque di un documento di grandi dimensioni, ma non del milione completo.
2. Agenti di codifica su scala repo. Terminal-Bench 86,6 e FrontierSWE 73,5 lo supportano, e il prezzo della cache rende economico il lavoro iterativo su un codebase stabile. La prima cosa da testare è la latenza con il proprio livello di concorrenza, perché i revisori dell'era preview hanno trovato il modello accurato ma lento su lunghe esecuzioni agentiche, e il serving GA è un animale diverso dal serving preview. Il risultato GDPval-AA di AA — un Elo leader di 1.739 al costo di 64 passi per attività — è la conferma indipendente di entrambe le metà di questo compromesso. Le misurazioni di DigitalOcean del 12 agosto — throughput aggregato che scala quasi linearmente a ~1.937 token di output al secondo con 256 richieste concorrenti, zero errori e nessuna saturazione rilevata — sono il primo dato di piattaforma gestita su questo tema, anche se sono numeri di DigitalOcean sul proprio serving, non un confronto diretto con quello di Alibaba.
3. Pipeline per documenti e screenshot.L'input video e immagini, insieme a OSWorld-Verified 86.1, lo rendono credibile per flussi di lavoro che leggono schermate — automazione QA, triage del supporto dagli screenshot, attività affini all'RPA. Anche in questo caso, l'input multimodale è una funzionalità delle API hosted; il percorso open-base di DigitalOcean è solo testo.
4. Dove non lo metteremmo ancora. UX interattiva critica per la latenza e qualsiasi carico di lavoro regolamentato che richieda una valutazione riproducibile. Per il primo, vuoi una produttività misurata che controlli. Per il secondo, la riproducibilità ora ha una scheda modello e una licenza da citare, ma la tabella di benchmark di Alibaba non è ancora replicata — e la regressione Omniscience di AA (tasso di allucinazioni fino al 40%) è un promemoria che il punteggio indipendente ha un doppio taglio.

Come accedere a Qwen3.8-Max
Ci sono diversi percorsi pratici. La via diretta tramite Alibaba Model Studio / DashScope — o l'API QwenCloud di Qwen — dà accesso al listino sopra riportato e alle nuove snapshot datate in anteprima assoluta: la build Qwen3.8-Max-0902 del 2 settembre è comparsa lì per prima, prima di essere distribuita sugli altri endpoint — al costo di dover integrare un nuovo fornitore e gestire un'altra chiave. Qwen Chat e l'app Qwen sono il modo più rapido per osservare il comportamento prima di scrivere codice. Scaricare i pesi aperti da Hugging Face è una quarta via per i team che vogliono gestire la propria infrastruttura, con le avvertenze su dimensioni e licenza sopra menzionate. Passare attraverso un router è l'opzione che la maggior parte dei team di produzione dovrebbe prendere in considerazione, perché separa la decisione sulla migrazione da quella sulla valutazione.
Dal 14 agosto 2026, esiste un'opzione genuinamente nuova: Qwen3.8-Max è disponibile su DigitalOcean Serverless Inference, che Alibaba ha annunciato come suo "partner di lancio Day 0" — una lettura di Alibaba, anche se l'offerta è di DigitalOcean e si regge da sola. DigitalOcean offre il checkpoint open-weights (id del modello di piattaforma qwen3.8-max), quantizzato NVFP4 su GPU NVIDIA HGX B300 in collaborazione tecnica con Inferact, come API serverless completamente gestita: un unico endpoint, prezzi basati sull'utilizzo, nessuna infrastruttura da gestire. Il suo tariffario è in linea con il listino di Alibaba — $2.00 input / $6.00 output per 1M, con input in cache a $0.20 — e serve della base open il nativo contesto di 262K, con il ragionamento sempre attivo, anziché la modalità multimodale da ~1 milione di token del flagship ospitato. Questo tetto di contesto è importante se il tuo carico di lavoro si concentra sui contesti lunghi: la modalità completa da un milione di token rimane disponibile esclusivamente tramite l'API di Alibaba.
Ciò che il percorso DigitalOcean aggiunge oltre alla geografia sono i primi dati concreti sull'erogazione del servizio da un provider diverso da Alibaba. Le misurazioni di DigitalOcean sul proprio endpoint di produzione, effettuate il 12 agosto, mostrano un prefill che scala linearmente a circa 16.000 token/sec — regola pratica: TTFT ≈ (input ÷ 16.000) + 0,7 s, quindi ~1,1 s a ~1.080 token e ~15,8 s a ~254K — e una velocità effettiva aggregata che raggiunge ~1.937 token di output/sec con 256 richieste concorrenti con zero errori e nessun punto di saturazione trovato. Questi sono i numeri di DigitalOcean sulla propria implementazione, non un test comparativo controllato, ma sono i primi dati su latenza e concorrenza per questo modello al di fuori del cloud di Alibaba, e affrontano direttamente la preoccupazione "approfondito ma lento" dell'era dell'anteprima.
Qwen3.8-Max è live su OrcaRouter come qwen/qwen3.8-max, e l'aggiornamento del 2 settembre è instradabile con il suo id datato — qwen/qwen3.8-max-0902 — entrambi alla stessa tariffa di listino di $2.00 / $6.00. OrcaRouter applica uno 0% di markup e trasmette direttamente il prezzo del provider, quindi entrambi i percorsi costano quanto l'accesso diretto. La nostra telemetria di servizio mostra attualmente un p50 time-to-first-token di 1,64 secondi su una finestra di 7 giorni. Si tratta di una misurazione di latenza in prima parte piuttosto che di un'affermazione del fornitore, ed è opportuno valutarla alla luce dei report dell'epoca di anteprima che parlavano di "modello più lento mai usato": provenivano da un singolo recensore che eseguiva build agentiche di un'ora su infrastruttura in anteprima, e dovrebbero essere ritestati contro il serving GA invece di essere ripetuti come dato attuale.
Il valore pratico del percorso del router è che Qwen3.8-Max si trova dietro lo stesso endpoint compatibile con OpenAI dei modelli che già esegui, quindi una valutazione equivale a cambiare la stringa del modello. Puoi inviargli il 5% del traffico di produzione, confrontarlo con il tuo modello attuale su prompt identici e mantenere un fallback, che è esattamente l'approccio che merita un modello con una tabella del fornitore non replicata. Lo stesso approccio è il modo giusto per testare il deployment su DigitalOcean: esegui una fetta del traffico con un fallback attivo, piuttosto che scommettere un percorso di produzione su uno stack di serving vecchio di due settimane.

Limitazioni e rischi onesti
• La tabella dei vendor non è ancora stata revisionata. Il punteggio indipendente è arrivato (AA Index 56), ma la tabella di benchmark di Alibaba rimane non replicata, e la misurazione di AA segnala una regressione di Omniscience con un tasso di allucinazioni fino al 40%. Il punteggio indipendente aiuta; non rende però la tabella dei vendor verificabile.
• Il percorso DigitalOcean è la base aperta, non l'ammiraglia. Serve il checkpoint a 262K di contesto, solo testo, pensiero sempre attivo, quantizzato NVFP4 — e i punteggi dei controlli a campione di DigitalOcean raggiungono 88 su GPQA Diamond rispetto ai 92,6 pubblicati da Alibaba, un divario che DigitalOcean definisce indicativo piuttosto che controllato. Se hai bisogno dell'API multimodale completa da un milione di token, quella è ancora ospitata da Alibaba.
• Qwen3.8-27B è stato rilasciato, ma la numerazione è del fornitore. I pesi della 27B sono stati pubblicati il 14 agosto con licenza Apache 2.0, colmando il divario on-premise — ma i suoi risultati nei benchmark sono dichiarati da Alibaba e non replicati, e le quantizzazioni della community erano ancora in fase di rilascio al momento di questo aggiornamento.
• Licenza personalizzata, non Apache 2.0. La licenza Qwen3.8-Max consente l'uso commerciale con attribuzione ma prevede due soglie di scala — esposizione prominente del nome del modello oltre 100M MAU o $20M di ricavi mensili, e una licenza separata per le aziende MaaS/AI-Work-Assistant con ricavi superiori a $50M negli ultimi dodici mesi. Leggila prima di superare le soglie di scala.
• Verbosità e deriva delle istruzioni.IFBench 82.8 è il punteggio più basso nella tabella di Alibaba, e i tester in anteprima hanno ripetutamente visto il modello superare l'ambito — aggiungendo funzionalità non richieste. I numeri di AA stessa ora lo quantificano: 64 passi per attività GDPval-AA è ciò che porta il costo a $1.14, il 25% in più rispetto a Kimi K3. Affascinante in una demo, costoso quando l'output viene addebitato a $6/1M e destabilizzante quando servono formati esatti.
• Vincoli sui contenuti. Come altri modelli di frontiera ospitati in Cina, le risposte su argomenti politicamente sensibili sono soggette a limitazioni. Rilevante se il tuo prodotto gestisce query aperte.
• I token di pensiero vengono fatturati come output. Con il ragionamento attivato, i costi reali superano le stime semplicistiche. Misura con il ragionamento configurato esattamente come lo distribuirai in produzione.

Domande frequenti
Qwen3.8-Max è disponibile ora?
Sì. È stata rilasciata in disponibilità generale il 3 agosto 2026, con una tariffa pubblicata e un'API compatibile con OpenAI e DashScope. L'attuale snapshot di produzione — Qwen3.8-Max-0902, pubblicato il 2 settembre — è attivo sull'API di QwenCloud ed è ciò che l'endpoint standard qwen3.8-max serve ora. Questo rappresenta un cambiamento rispetto allo stato di anteprima del 19 luglio, quando l'accesso era limitato a Qwen Chat, all'app Qwen e alla campagna crediti di Qoder.
Cos'è Qwen3.8-Max-0902?
Qwen3.8-Max-0902 è il refresh di produzione del 2 settembre 2026 di Qwen3.8-Max: lo stesso modello di punta sparse-MoE da 2,4T parametri e contesto da 1 milione di token, ulteriormente sottoposto a post-addestramento su Coding e Cowork, e disponibile in diretta sulle API di QwenCloud allo stesso prezzo di $2/$6. Qwen afferma che la nuova snapshot è più performante su attività enterprise e scientifiche complesse — una dichiarazione del fornitore, non ancora verificata in modo indipendente — mentre sull'asse della programmazione vanta già un risultato indipendente: 1° posto nella classifica Code Arena: WebDev con 1.691 punti e al vertice della sua frontiera di Pareto costo-prestazioni a un prezzo medio di circa $5/MToken, secondo l'annuncio di Alibaba relativo all'inserimento nella classifica live dell'arena, confermato dall'account QwenCloud di Qwen stessa.
Quanto costa Qwen3.8-Max?
$2,00 per 1 milione di token di input e $6,00 per 1 milione di token di output, tariffa fissa per l'intero contesto di 1 milione di token senza sovrapprezzo per prompt lunghi. Gli accessi alla cache per l'input costano $0,25 per 1 milione, la creazione esplicita della cache $2,50 e le letture della cache $0,17. I token di ragionamento vengono fatturati alla tariffa di output. Nell'Intelligence Index di Artificial Analysis, il costo misurato del modello è di $1,14 per attività — vedi la sezione sui prezzi per capire perché supera il calcolo basato sui token. Il percorso serverless di DigitalOcean riporta gli stessi $2/$6 con input in cache a $0,20.
Quanti parametri ha Qwen3.8-Max?
2,4 bilioni in totale, in una configurazione sparse Mixture-of-Experts. Il conteggio dei parametri attivi — la cifra che determina effettivamente il costo di serving e la latenza — è ora confermato a 95 miliardi attivati, secondo la scheda ufficiale del modello Qwen3.8-2.4T-A95B (512 esperti; 10 instradati più uno condiviso attivo per token).
I pesi di Qwen3.8-Max sono aperti?
Sì — dal 12 agosto 2026. Qwen ha pubblicato Qwen3.8-2.4T-A95B (BF16) e Qwen3.8-2.4T-A95B-FP8 su Hugging Face, ciascuno con 213 file di pesi. La licenza è una licenza personalizzata Qwen3.8-Max (Hugging Face la elenca come "other"), non Apache 2.0: consente l'uso commerciale con attribuzione e prevede due limiti basati sulla scala. Il checkpoint aperto è solo testo con il ragionamento sempre attivo; l'API ospitata aggiunge la visione, una modalità opzionale senza ragionamento e il contesto completo di 1M.
Qwen3.8-Max è stato sottoposto a benchmark indipendenti?
Sì — al 6 agosto 2026. Artificial Analysis gli assegna 56 punti sul suo Intelligence Index, con test a 1,14 $ per task eseguiti sull'API ufficiale di Alibaba: un balzo di 10 punti rispetto a Qwen3.7-Max (46), alla pari con Claude Opus 4.8 (56) e un punto dietro a Kimi K3 (57). La tabella benchmark qui sopra, però, resta dichiarata da Alibaba e non replicata, e la classifica generale di LMArena non riporta ancora alcun punteggio pubblico. Il quadro dell'arena indipendente è cambiato il 2 settembre: il refresh 0902 ha debuttato al #1 nella classifica Code Arena: WebDev della stessa piattaforma, con 1.691 punti — un risultato di terze parti basato su voto alla cieca, non una tabella di Alibaba — e la frontiera costo-prestazioni di Code Arena lo indica come l'opzione col punteggio più alto della classifica a un costo medio di ~5 $/MToken. La verifica a campione di DigitalOcean sulla sua versione quantizzata (88 su GPQA Diamond) è il primo controllo di terze parti su un deployment di servizio, ed è esplicitamente un'indicazione, non un test controllato. Una nota di cautela per la colonna "indipendente": CommerceAgentBench, dove Qwen3.8-Max guida i modelli open-weight, non è un secondo giudice indipendente — Accio, che l'ha creato e pubblicato, è il team stesso di Alibaba.
Qwen3.8-Max è meglio di Qwen3.7-Max?
Sui numeri di Alibaba, sostanzialmente — FrontierSWE 73.5 contro 40.7 e DeepSWE 1.1 56.6 contro 21.6 sono quasi raddoppi su compiti complessi di ingegneria del software. È anche più economico dei 2,50$/7,50$ del suo predecessore. In modo indipendente, AA colloca il salto generazionale a 10 punti sul suo Intelligence Index (56 contro 46). Entrambe le affermazioni del fornitore andrebbero comunque verificate sul vostro carico di lavoro.
Posso auto-ospitare Qwen3.8-Max?
Non praticamente. Il set completo di pesi da 2.4T è di circa 4.9TB in BF16 e circa 2.4TB in FP8, circa 1.2TB a 4 bit — rispetto a circa 141GB per H200, ciò significa otto o più GPU di fascia alta. Con 95B attivi per token, il calcolo per token è relativamente modesto, ma l'ingombro di memoria è il vincolo principale. Il servizio NVFP4 di DigitalOcean sui B300 è la prova concreta che il 4-bit può far stare il modello su un singolo nodo. La Qwen3.8-27B — che si dice richieda circa 17GB di VRAM — è l'opzione on-premise realistica, e i suoi pesi sono stati resi disponibili il 14 agosto 2026 sotto licenza Apache 2.0 — ora scaricabili, non più una promessa.
Cos'è Qwen3.8-27B?
Un modello molto più piccolo annunciato insieme al modello di punta, posizionato come il percorso pratico per la distribuzione on-premise. È un modello denso da 27B, nativamente multimodale, con un contesto nativo di 262K token estendibile a 1M, ed è rilasciato sotto licenza Apache 2.0. I suoi pesi sono stati resi disponibili su Hugging Face e ModelScope il 14 agosto 2026; Daniel Han di Unsloth riferisce che gira in circa 17GB di VRAM — una singola scheda consumer di fascia alta. Le sue prestazioni dichiarate nei benchmark sono riportate da Alibaba e non sono state riprodotte in modo indipendente.
Qwen3.8-Max è multimodale?
Sì — accetta input di testo, immagini e video e restituisce testo. Supporta inoltre la modalità di pensiero, la chiamata di funzioni, gli strumenti integrati e gli output strutturati. Il checkpoint a pesi aperti è solo testo; l'input multimodale è una funzionalità dell'API ospitata, che è ciò che il percorso DigitalOcean non include.
Qwen3.8-Max è disponibile su DigitalOcean?
Sì — dal 14 agosto 2026. DigitalOcean Serverless Inference serve il checkpoint a pesi aperti (NVFP4 su NVIDIA HGX B300) a 2,00/6,00 dollari per ogni milione di token, con 0,20 dollari per input in cache, un contesto di 262K token, solo testo e pensiero sempre attivo. Alibaba definisce DigitalOcean il suo "partner di lancio Day 0"; la scheda stessa è di DigitalOcean ed è indipendente da questa terminologia. Le cifre misurate da DigitalOcean: prefill di circa 16K token/sec e circa 1.937 token di output/sec a 256 richieste concorrenti con zero errori.
Posso usare Qwen3.8-Max tramite OrcaRouter?
Sì. È attivo come qwen/qwen3.8-max, e lo snapshot del 2 settembre con il proprio ID datato — qwen/qwen3.8-max-0902 — agli stessi prezzi di listino di $2.00/$6.00, con ricarico dello 0%. Il routing costa quanto l'accesso diretto, tramite l'endpoint compatibile con OpenAI che già utilizzi. La nostra telemetria su 7 giorni mostra un p50 del tempo al primo token di 1.64 secondi.
Dovrei spostare oggi il traffico di produzione su di esso?
Non in blocco. Il prezzo e il primo punteggio indipendente rendono una valutazione seria economica e utile da fare ora, ma con un costo per attività superiore del 25% rispetto a quello di Kimi K3, la mossa disciplinata è una suddivisione del traffico rispetto al tuo sistema attuale su prompt identici, con un fallback predisposto — non una migrazione. Il percorso DigitalOcean aggiunge una seconda distribuzione gestita da testare, il che rende la valutazione ancora più economica.
Il risultato finale
Qwen3.8-Max è rimasto per due settimane il modello più interessante che nessuno poteva comprare. Al GA è una proposta davvero diversa: 2$/6$ piatti su un milione di token è un prezzo aggressivo, le tariffe di cache rendono economico il lavoro iterativo degli agenti, e il salto generazionale su FrontierSWE e DeepSWE — se si replica — lo rende un vero modello di codifica, non un esercizio di scala. I pesi aperti arrivati sotto una licenza vera il 12 agosto hanno trasformato "i pesi aperti in arrivo" da promessa a fatto, e il percorso DigitalOcean al giorno zero annunciato il 14 agosto — con numeri di serving misurati e una lettura cache a 0,20$ — rafforza il caso del "provalo a poco prezzo" e offre ai team un deployment gestito di terze parti da confrontare con l'API di Alibaba. Il refresh del 2 settembre, Qwen3.8-Max-0902, mantiene intatta quella tesi: gli stessi 2$/6$ e 1M di contesto, con più post-training sul lavoro di codifica e collaborativo per cui il modello era già posizionato. Il refresh ha anche aggiunto una classifica indipendente basata su preferenze umane per quella proposta di codifica: Qwen3.8-Max-0902 ha debuttato al #1 nella classifica WebDev di Code Arena con 1.691 punti, davanti a Claude Opus 5 e Kimi K3, e con un costo misto di ~5$/MToken è il modello con il punteggio più alto sulla frontiera di Pareto costi-prestazioni di quella classifica. Il risultato CommerceAgentBench pubblicato la stessa settimana dal team Accio di Alibaba — Qwen3.8-Max in testa al campo degli open weight su un benchmark costruito da flussi di lavoro commerciali reali — dà a quella tesi sul lavoro collaborativo una classifica concreta, sebbene gestita dal vendor.
Ciò che è cambiato è che sia l'arbitro sia i pesi sono infine arrivati — e il verdetto è per lo più buono, con asterischi veri. AA colloca Qwen3.8-Max a 56 sull'Intelligence Index: un salto generazionale autentico, che la porta allo stesso livello di Claude Opus 4.8, anche se la stessa scheda mostra Kimi K3 avanti di un punto, con un costo per task inferiore del 25%, e segnala un calo di 10 punti su Omniscience a fronte di un tasso di allucinazioni in aumento. La questione dei parametri attivi è chiusa — 95B attivi, confermati sulla model card — e la licenza è stata pubblicata: personalizzata, non Apache 2.0. Ciò che non è cambiato: la tabella dei benchmark di Alibaba non è ancora stata replicata, il costo per task resta alto perché il modello macina un numero enorme di passaggi, la base aperta servita su DigitalOcean è un modello leggermente diverso da quello dei numeri di punta dell'ammiraglia (contesto 262K, NVFP4, GPQA spot-check 88 contro 92,6), e i benchmark dichiarati per Qwen3.8-27B sono forniti dal produttore nonostante i suoi pesi siano già stati rilasciati. Questa combinazione non rende Qwen3.8-Max una cattiva scommessa — a questo prezzo è quasi un esperimento obbligato — ma significa che l'atteggiamento giusto è: valutare in modo aggressivo, instradare con criterio, tenere un fallback. Quello che ora bisogna osservare è se il numero di passaggi agentici dietro quel costo di $1,14 per task sia qualcosa che il tuo carico di lavoro può assorbire; se il vantaggio in Code Arena: WebDev della build 0902 regga con l'accumularsi dei voti; se i guadagni in Coding e Cowork si replichino su carichi di lavoro reali; se il vantaggio open-weight in CommerceAgentBench — due passaggi aggregati sull'harness di Alibaba — sopravviva a una verifica indipendente; se le affermazioni sui benchmark del 27B reggano; e se il throughput misurato nella distribuzione su DigitalOcean regga sotto traffico reale. Sarà questo a decidere se "secondo solo a Fable 5" era posizionamento o profezia.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
