
Qwen 3.8 vs GLM-5.2: Il Primo Benchmark in Cui Si Sovrappongono Davvero
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Questi due modelli sono l'espressione più chiara di scommesse opposte nell'AI cinese open-weight. Il GLM-5.2 di Zhipu è snello e collaudato: 753B di parametri totali con soli 40B attivi, un Artificial Analysis Intelligence Index certificato di 51, pesi scaricabili a partire da giugno 2026 e un prezzo pubblicato di $0,95 / $3,00. Il Qwen3.8-Max di Alibaba è la scommessa massimalista: ~2,4T di parametri, un numero di parametri attivi non divulgato e — fino a poco tempo fa — nessun numero.
La disponibilità generale del 3 agosto 2026 ha dato a questo confronto qualcosa che nessun altro articolo di questa serie ha: un benchmark su cui entrambi i modelli hanno un punteggio. Alibaba riporta Terminal-Bench 2.1 a 86.6; Artificial Analysis ha verificato GLM-5.2 a 82.7 sullo stesso test. Per la prima volta, l'affermazione di Qwen può essere accostata a un numero del concorrente misurato in modo indipendente su un terreno identico — con l'importante avvertenza che solo uno dei due è stato prodotto da un arbitro.
Una nota per gli sviluppatori: il modo più rapido per risolvere la questione è eseguire entrambi sui propri prompt. OrcaRouter espone oltre 200 modelli dietro un unico endpoint compatibile con OpenAI, così puoi mettere a confronto Qwen 3.8 Max con GLM-5.2 sullo stesso compito senza dover configurare due SDK.
Verdetto in breve. Sull'unico benchmark condiviso, Qwen rivendica un vantaggio di 3,9 punti su Terminal-Bench 2.1 (86,6 vs 82,7) — un risultato reale se si replica, anche se il dato di Qwen è auto-dichiarato e quello di GLM è verificato. Per il resto, GLM-5.2 mantiene i vantaggi pratici: è ~2× più economico a $0.95 / $3.00 contro i $2 / $6 di Qwen, i suoi pesi sono scaricabili oggi, i suoi 40B parametri attivi lo rendono realmente distribuibile, e possiede un punteggio di indice indipendente di 51 dove Qwen non ne ha. Qwen risponde con un contesto a tariffa fissa di 1M di token, multimodalità nativa che a GLM manca, e un tetto potenziale più alto. Lo snello e collaudato batte ancora il grande e non verificato per la produzione — ma il divario si è ridotto il 3 agosto.
Punti chiave
• Primo confronto diretto di benchmark nella serie: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (riportato da Alibaba) contro GLM-5.2 82.7 (Artificial Analysis, revisionato). Qwen conduce di 3.9 punti, ma le due cifre non sono ugualmente affidabili.
• GLM-5.2 costa circa la metà: $0.95 / $3.00 per 1M (AA blended ~$0.90), mentre Qwen3.8-Max costa $2 / $6.
• I parametri attivi sono la vera questione architettonica: GLM-5.2 utilizza 40B di parametri attivi su 753B totali. Alibaba ha ancora il numero di parametri attivi di Qwen non rivelato, il che rende il suo costo di servizio non modellabile.
• I pesi di GLM sono scaricabili oggi; quelli di Qwen sono promessi entro la settimana, senza ancora licenza né repository.
• GLM-5.2 ha un indice verificato di 51. Qwen3.8-Max resta senza punteggio — sebbene il suo predecessore Qwen3.7-Max abbia ottenuto 46, sotto GLM.
• Le offerte uniche di Qwen: una finestra da 1 milione di token con tariffa fissa e nessun sovrapprezzo per prompt lunghi, più input nativi per testo/immagini/video e OmniDocBench 1.5 92.1. GLM-5.2 è focalizzato sul testo.
Nota sulla precisione: tutti i dati qualitativi di Qwen3.8-Max sono riportati da Alibaba {{1}}e non verificati da terze parti{{/1}}. I dati di GLM-5.2 provengono da Artificial Analysis. {{2}}Confrontare un punteggio auto-dichiarato con uno sottoposto a verifica sullo stesso benchmark è utile ma non conclusivo{{/2}} — gli harness dei fornitori e quelli di valutazione differiscono. Il prezzo di Qwen è quello della tariffa GA e sostituisce lo sconto di anteprima di luglio.
Specifiche e prezzo, fianco a fianco
Ecco i dati concreti, con ogni cifra attribuita alla sua fonte.
• Produttore / stato — Qwen3.8-Max: Alibaba; GA (3 agosto 2026); GLM-5.2: Zhipu; rilasciato a giugno 2026
• Architettura — Qwen3.8-Max: ~2.4T in totale, sparse MoE; GLM-5.2: 753B in totale, sparse MoE (Artificial Analysis)
• Parametri attivi — Qwen3.8-Max: Ancora non divulgati da Alibaba; GLM-5.2: 40B attivi (Artificial Analysis)
• Finestra di contesto — Qwen3.8-Max: 1M token, tariffa fissa (983.616 con ragionamento; output massimo 131.072); GLM-5.2: 1M token (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (riportato da Alibaba); GLM-5.2: 82.7 (Artificial Analysis, verificato)
• AA Intelligence Index — Qwen3.8-Max: Ancora non valutato; GLM-5.2: 51 (Artificial Analysis)
• Punteggi riportati da altri fornitori — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (riportati da Alibaba); GLM-5.2: la posizione è misurata da terze parti
• Modalità — Qwen3.8-Max: Testo, immagine, video in ingresso → testo in uscita; GLM-5.2: focalizzato sul testo
• Prezzi (input / output) — Qwen3.8-Max: $2.00 / $6.00 per 1M, fisso; input in cache $0.25; GLM-5.2: $0.95 / $3.00 per 1M (AA miscelato ~$0.90)
• Pesi aperti — Qwen3.8-Max: Promesso entro la settimana (ancora nessuna licenza); GLM-5.2: Sì — scaricabile oggi
Due cose inquadrano questo confronto, e la prima è il dato più utile dell'intera serie.
Innanzitutto, la sovrapposizione con Terminal-Bench è davvero informativa. Terminal-Bench 2.1 misura se un modello può operare su una shell reale fino al completamento — eseguire comandi, leggere l'output, riprendersi dagli errori. È la migliore approssimazione disponibile per capire "se questo può funzionare come agente di codifica piuttosto che come suggeritore di codice", ed è il benchmark che entrambi i fornitori hanno scelto di riportare. L'86.6 di Qwen contro l'82.7 certificato di GLM è un vantaggio di 3.9 punti a favore di Qwen.
La precisazione è importante, ma non va sopravvalutata. Gli harness dei fornitori e gli harness di valutazione differiscono per scaffolding, policy di retry e costruzione dei prompt, e queste scelte possono spostare un punteggio Terminal-Bench di oltre quattro punti. Quindi questa non è una prova che Qwen sia il modello agentico migliore. Ciò che invece dimostra è che l'affermazione auto-riportata di Qwen si colloca nella stessa fascia competitiva di un modello open-weight di frontiera sottoposto a audit, piuttosto che in un territorio implausibile. Questa è una posizione significativamente più solida rispetto a "non valutato".
Secondo, il confronto architetturale è dove GLM vince in silenzio. GLM-5.2 attiva 40B parametri su 753B. Quel singolo numero ti dice il costo di servizio, il profilo di latenza e che un team ben attrezzato può effettivamente eseguirlo. Alibaba non ha ancora pubblicato il numero dei parametri attivi di Qwen — il che significa che, nonostante tutto ciò che il titolo dei 2.4T comunica, nessuno al di fuori di Alibaba può stimare quanto costi servire Qwen3.8-Max o come si comporterebbe in modalità self-hosted. In un confronto Mixture-of-Experts, non è una nota a piè di pagina; è il numero mancante più importante.

Snello e collaudato vs grande e non verificato
La proposta di GLM-5.2 si basa su una posizione ingegneristica coerente: fare di più con meno, pubblicare i numeri, rilasciare i pesi. Un modello con 40B attivi è economico da servire, veloce per costruzione e distribuibile da un team con un budget GPU serio ma non assurdo. Il suo indice certificato di 51 e il Terminal-Bench certificato di 82,7 significano che un acquirente non compra sulla fiducia. E a $0,95 / $3,00, costa circa la metà del prezzo di Qwen.
Il caso di Qwen3.8-Max è la scommessa opposta: costruire il modello più grande possibile e lasciare che le capacità ne giustifichino il costo. GA ha reso quella tesi molto più solida di quanto non fosse, perché finalmente ci sono dei numeri associati — GPQA Diamond 92.6 su scienza a livello post-laurea, OSWorld-Verified 86.1 sull'operazione GUI, FrontierSWE 73.5 contro il 40.7 del predecessore, e il Terminal-Bench 86.6 discusso sopra. Questi sono dati di livello frontier, e il quasi raddoppio su FrontierSWE è il tipo di salto generazionale che è difficile da fingere del tutto.
Ma restano due lacune, e sono le stesse due che contavano a luglio. Non c'è alcun punteggio indipendente — Artificial Analysis e LMArena non hanno ancora valutato Qwen3.8-Max, quindi ogni affermazione sulla qualità è solo di Alibaba. E non c'è alcuna licenza, quindi la promessa dei pesi aperti non può ancora essere valutata a livello commerciale.
Il riferimento storico depone contro Qwen qui più che nella maggior parte dei confronti: il predecessore Qwen3.7-Max ha ottenuto 46 nell'indice AA, sotto il 51 di GLM-5.2. Quindi l'affermazione implicita di Alibaba non è solo che Qwen3.8-Max sia buono, ma che sia passato da sotto GLM a ben sopra in una generazione. Il miglioramento FrontierSWE dà a ciò una certa credibilità. Un punteggio indipendente lo chiarirebbe.

Costo in pratica: dove atterra il 2×
Prendi una pipeline di codifica agentica: 180.000 token di contesto del repository, 10.000 token di output per esecuzione.
• GLM-5.2: 0.18M × $0.95 = $0.171, più 0.01M × $3.00 = $0.03. ≈ $0.20 per esecuzione.
• Qwen3.8-Max: 0.18M × $2 = $0.36, più 0.01M × $6 = $0.06. ≈ $0.42 per esecuzione.
• A 3.000 esecuzioni/giorno: GLM ≈ $603/giorno; Qwen ≈ $1.260/giorno — circa $20.000/mese di differenza.
• Con l'input in cache di Qwen a $0,25/1M su un repository stabile, il suo costo di esecuzione scende a ≈ $0,11, che di fatto è inferiore al costo senza cache di GLM.
Quell'ultima riga è la cosa più utile in pratica di questo confronto. Il prezzo di listino di Qwen è il doppio di quello di GLM, ma il suo tasso di cache hit di $0,25 per 1M è abbastanza aggressivo da ribaltare le posizioni in una pipeline che fa buon uso della cache. Se il tuo agente rilegge un contesto in gran parte invariato a ogni turno — il che descrive la maggior parte degli agenti di coding — Qwen potrebbe rivelarsi l'opzione più economica in pratica, nonostante il tariffario peggiore. I team che non configurano la cache pagheranno il doppio per nulla.
Entrambi i modelli fatturano i token di ragionamento come output, quindi le configurazioni con forte carico di ragionamento costano più di queste stime in entrambi i casi.
Distribuibilità: l'asse che GLM possiede
Entrambi sono modelli MoE open-weight cinesi con affermazioni di contesto da 1M token, il che rende la distribuibilità il divario pratico più netto.
I pesi di GLM-5.2 sono scaricabili da giugno e, con 40B attivi, è un obiettivo realistico per il self-hosting — quantizzabile, servibile su un numero ragionevole di GPU e già testato dalla community.
I pesi di Qwen3.8-Max sono promessi entro la settimana, ma il modello di punta non è un obiettivo realistico per nessuno: circa 1,2 TB a 4 bit contro circa 141 GB per H200 significa otto o più acceleratori di fascia alta, e il numero non divulgato di parametri attivi rende impossibile prevedere il throughput risultante. Aggiungete la licenza mancante e il self-hosting del modello di punta, per ora, non è un piano.
Annunciato in concomitanza, Qwen3.8-27B è la risposta autentica di Alibaba su questo asse. Anch'esso con pesi aperti e, secondo quanto riportato, funzionante in circa 17 GB di VRAM — una singola scheda di fascia alta, ben al di sotto dell'ingombro di GLM-5.2 — compete direttamente sulla distribuibilità. Se il tuo interesse per entrambi i modelli è eseguirli da solo, il confronto tra Qwen 27B e GLM-5.2 è quello che conterà davvero, ed è una sfida molto più equilibrata di 2.4T contro 753B.
Domande frequenti
Qwen 3.8 è migliore di GLM-5.2?
Nell'unico benchmark che condividono, Qwen rivendica un vantaggio — Terminal-Bench 2.1 86.6 contro l'82.7 certificato di GLM. Ma il dato di Qwen è auto-dichiarato e quello di GLM è stato misurato da Artificial Analysis, e le differenze di harness possono superare un divario di quattro punti. GLM-5.2 detiene anche un indice certificato di 51, mentre Qwen non ha alcun punteggio indipendente. GLM è la scelta più sicura; Qwen ha il tetto più alto non verificato.
Come si confrontano su Terminal-Bench 2.1?
Qwen3.8-Max riporta 86,6; Artificial Analysis ha misurato GLM-5.2 a 82,7. Si tratta di un vantaggio nominale di 3,9 punti per Qwen e della prima sovrapposizione sullo stesso benchmark tra i due. Va interpretato come prova che Qwen è competitivo in quella fascia, non come dimostrazione che sia in vantaggio, visto che solo il numero di GLM è stato prodotto in modo indipendente.
Qual è più economico?
GLM-5.2 sul tariffario — $0,95 / $3,00 per 1M (AA blended ~$0,90) rispetto ai $2 / $6 di Qwen, circa la metà. Ma l'input in cache di Qwen a $0,25 per 1M è abbastanza aggressivo da far sì che una pipeline fortemente basata su cache possa risultare più conveniente su Qwen che su GLM senza cache.
Quanti parametri attivi usa Qwen 3.8 Max?
Alibaba non ha mai pubblicato la cifra, nemmeno in occasione della disponibilità generale. È quel numero che determina il costo di servizio e la latenza in un modello Mixture-of-Experts, quindi la sua assenza è una vera lacuna. GLM-5.2, al contrario, è documentato con 40B attivi su 753B totali.
Quali posso effettivamente auto-ospitare?
GLM-5.2 oggi — i pesi sono disponibili e i 40B attivi lo rendono gestibile. I pesi di Qwen3.8-Max sono promessi entro la settimana, ma il modello di punta richiede otto o più GPU di classe H200 con ~1.2TB in 4-bit, senza licenza ancora pubblicata. Il Qwen3.8-27B, annunciato contestualmente e con ~17GB di VRAM, è l'opzione Qwen distribuibile e la scelta più vicina alla nicchia di GLM.
Qwen 3.8 Max è uscito dall'anteprima?
Sì, il 3 agosto 2026, con un listino prezzi pubblicato e un endpoint compatibile con OpenAI e DashScope. La campagna di crediti Qoder di luglio con il 90% di sconto non descrive più come viene venduta.
Cosa offre Qwen che GLM-5.2 non offre?
Multimodalità nativa — input di immagini e video, con un punteggio OmniDocBench di 92.1 auto-dichiarato per il parsing dei documenti — e un contesto da 1 milione di token addebitato a tariffa fissa senza sovrapprezzo per i prompt lunghi. GLM-5.2 è incentrato sul testo, quindi per pipeline di documenti, screenshot o video, Qwen non è tanto in competizione con esso quanto sta facendo qualcos'altro.
Il risultato finale
Qwen 3.8 vs GLM-5.2 è il confronto in cui la disponibilità generale ha fornito le informazioni più realmente nuove. Per la prima volta Qwen ottiene un punteggio in un benchmark che anche un valutatore indipendente ha eseguito, e si colloca sopra GLM: Terminal-Bench 2.1 86.6 contro 82.7. Questo fa passare Qwen da "senza punteggio" a "plausibilmente competitivo su terreno misurato", il che è un vero progresso anche tenendo conto dell'avvertenza auto-dichiarata.
Ma GLM-5.2 mantiene la corona della praticità, e lo fa grazie a punti di forza poco appariscenti: la metà del prezzo, un indice certificato di 51, 40B parametri attivi che rendono i suoi costi prevedibili e la sua implementazione realizzabile, e pesi che puoi scaricare subito. Le risposte di Qwen — un contesto flat-rate da un milione di token, multimodalità nativa e un tetto più alto — sono significative ma condizionali, e le sue due lacune di luglio restano invariate: nessun punteggio indipendente e nessuna licenza. Tieni d'occhio tre cose: il primo punteggio indipendente dell'Intelligence Index per Qwen3.8-Max, se un valutatore riprodurrà quel punteggio di 86.6 su Terminal-Bench, e il rilascio di Qwen3.8-27B, che è il punto in cui queste due filosofie si scontreranno davvero. Fino ad allora, GLM-5.2 è ciò che metti in produzione e Qwen3.8-Max è ciò che valuti — con la cache attivata.

Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
