
GLM-5.3 vs GLM-5.2: Stesso cervello, benchmark raddoppiati
- obsidianNUOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
La lettura che Zhipu AI stessa dà dell'aggiornamento da GLM-5.2 a GLM-5.3 è quella onesta: il libro di testo non è cambiato, è cambiato solo l'addestramento dello studente. GLM-5.3, rilasciato il 14 agosto 2026, è costruito sulla stessa identica base MoE da 743 miliardi di parametri di GLM-5.2, che a giugno ha conquistato il primo posto tra i modelli open-weight nell'Artificial Analysis Intelligence Index. L'architettura è invariata, l'ingombro è invariato, il prezzo di $1,40 / $4,40 per milione di token è invariato — eppure Z.ai riferisce che il modello riaddestrato raddoppia o supera il suo predecessore su diversi benchmark di coding e sicurezza che entrambe le versioni pubblicano. Che questo renda GLM-5.3 un aggiornamento da fare assolutamente o un attendi-e-vedi dipende da quanto ci si fida di un modello che è migliorato così tanto senza cambiare la propria architettura, e da se la sua capacità cyber appena emersa sia una funzionalità che si vuole tenere dietro una finestra di sicurezza di due settimane.
Lo stesso cervello, riaddestrato.
Tutto ciò che ha reso GLM-5.2 un server pratico è stato mantenuto: il MoE da 743B con circa 40B di parametri attivi, l'attenzione sparsa IndexShare che ha ridotto i FLOPs con un contesto a 1M, la licenza MIT, la finestra di contesto da 1M e l'efficiente throughput di token che ha registrato ~145–168 token/sec in osservazioni indipendenti. GLM-5.3 differisce in una sola dimensione — il post-training. Z.ai ha ampliato la fase di reinforcement learning con i framework IndexShare, SAO e Slime, ha aggiunto decine di volte più ambienti di task a lungo orizzonte e li ha estesi dal debug del codice alla scoperta di vulnerabilità di sicurezza e all'ingegneria dei sistemi. Il risultato è un modello che si comporta diversamente sullo stesso hardware, che è esattamente il motivo per cui la domanda sull'aggiornamento non è "mi servono nuove GPU" ma "mi serve un nuovo comportamento".
Il delta del benchmark, in entrambe le direzioni
Letto come un prima e dopo sui dati pubblicati da Z.ai, il salto è il più grande nella storia degli open-weights. Terminal-Bench 3.0 — la versione più difficile, in cui entrambi sono stati valutati — passa da 4.6 a 28.3, un balzo di sei volte. DeepSWE v1.1 passa da 46.2 a 66.9, che è la differenza tra "buon modello open" e "competitivo con i leader chiusi". Il sottoinsieme CLI di Agents' Last Exam passa da 23.8 a 28.5. La scoperta di vulnerabilità di CyberGym sale da 77.2 a 84.5. ExploitBench più che raddoppia, da 24.4 a 54.4, e il throughput di ExploitGym passa da 29 e 39 task completati (in due e sei ore) a 105 e 130. Z.ai lo riassume come un miglioramento di circa il 50% nel coding, e la forma dei guadagni — concentrati nella codifica a lungo orizzonte, nell'automazione del terminale e nella sicurezza — è coerente con un modello basato esclusivamente sul post-training: la conoscenza grezza è la stessa, ma la capacità di svolgere realmente lavoro multi-step è ciò che si è rafforzata.
• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5
• Scoperta di vulnerabilità CyberGym — GLM-5.2 77.2 vs GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4


La capacità che nessuno aveva programmato
I guadagni in termini di sicurezza meritano un paragrafo a parte perché Z.ai afferma che non facevano parte del piano. Il team di post-training ha aggiunto ambienti di scoperta delle vulnerabilità aspettandosi un miglioramento modesto; il modello invece ha iniziato a concatenare exploit completi, un comportamento emergente che ha costretto Z.ai a trattenere i pesi per circa due settimane per il rafforzamento della sicurezza. Nei test nel mondo reale con i team di sicurezza, GLM-5.3 ha contribuito a trovare 2.436 vulnerabilità in 269 progetti, 1.097 delle quali a rischio medio o alto, inclusi difetti rimasti non rilevati per decenni in software ampiamente diffusi. GLM-5.2 aveva capacità di sicurezza nel senso ordinario — poteva leggere il codice per individuare bug. GLM-5.3 ce l'ha in un senso diverso: è ciò di cui parla la finestra di sicurezza. È un cambiamento di natura, non di grado, ed è la ragione più forte in assoluto per trattare i due modelli come prodotti diversi nonostante la base condivisa.

L'avvertenza sulla coerenza
Il contrappeso a ogni numero precedente è che i primi test di terze parti descrivono GLM-5.3 come incoerente in un modo che GLM-5.2 non era. Revisori indipendenti riportano che lo stesso modello si comporta come un ingegnere esternalizzato appena sufficiente su alcuni compiti e offre risultati di livello professionale su altri, con una differenza legata a quanto chiaramente i requisiti erano specificati. È esattamente il profilo di fallimento che ci si aspetterebbe da un modello i cui miglioramenti derivano interamente da un post-addestramento fortemente basato sull'ambiente: generalizza dalle forme dei compiti su cui è stato addestrato, e le richieste mal specificate rimangono al di fuori di esse. Nessuno dei risultati indipendenti è pulito come le tabelle pubblicate da Z.ai, e nessuno dei numeri di Z.ai è ancora stato riprodotto in modo indipendente. Per la produzione, ciò richiede una valutazione esplicita sul proprio carico di lavoro prima della migrazione — la stessa avvertenza che valeva per GLM-5.2, ora con un divario più ampio tra caso migliore e peggiore.
Prezzo, accesso e la questione dell'attesa.
I prezzi sono identici, il che elimina il consueto attrito dell'upgrade: entrambi i modelli costano $1.40 / $4.40 per milione di token, con GLM-5.3 che richiede il thinking abilitato. L'accesso è la vera differenza. {{1}}GLM-5.2{{/1}} è scaricabile oggi con licenza MIT, auto-ospitabile su un footprint FP8 sub-terabyte e richiamabile tramite OrcaRouter al prezzo di listino senza markup — il modello a cui puoi instradare il traffico adesso, stabile e valutato in modo indipendente. {{2}}GLM-5.3{{/2}} è utilizzabile ora tramite ZCode / AutoClaw di Z.ai e il GLM Coding Plan, ma sia l'API pubblica che i pesi sono soggetti a gating per la finestra di sicurezza, e i suoi risultati benchmark sono tutti dichiarati dal vendor, in attesa di riesecuzioni da parte di terzi. Quindi la risposta onesta a «dovrei aspettare?» ha due parti: per il traffico di produzione che non deve subire regressioni, {{3}}GLM-5.2{{/3}} rimane oggi la scommessa sicura con pesi aperti, e nel momento in cui l'API di {{4}}GLM-5.3{{/4}} si aprirà e le esecuzioni indipendenti daranno esito positivo, il passaggio è un cambio di rotta, non una riscrittura — mantieni la stessa configurazione con una sola chiave e cambi corsia. Per il lavoro esplorativo e di valutazione della sicurezza, {{5}}GLM-5.3{{/5}} vale la pena provarlo ora tramite gli strumenti di Z.ai, con la consapevolezza che il suo vantaggio dichiarato non è verificato e il suo comportamento è più variabile rispetto al modello che sostituisce.
Il verdetto onesto
GLM-5.3 è il modello migliore secondo i numeri di Z.ai — drammaticamente migliore nella programmazione a lungo orizzonte e categoricamente diverso per quanto riguarda la sicurezza — ed è gratuito per il tuo flusso di lavoro perché base, ingombro e prezzo sono invariati. Ma "migliore nelle valutazioni del fornitore" e "migliore nella tua pipeline" sono separati dalle due cose che GLM-5.2 già possiede e GLM-5.3 non ancora: riproduzione indipendente e pesi pubblicati. Se già esegui GLM-5.2, il percorso di aggiornamento è il più economico nella storia dei pesi aperti — stesso hardware, stesso prezzo, stessa superficie API e due settimane di attesa per i pesi. La decisione riguarda meno il fatto che GLM-5.3 sia migliore di GLM-5.2 e più il fatto di essere disposti a scommettere la produzione su un modello i cui miglioramenti, e la cui nuova capacità di sicurezza emersa, non sono ancora stati confermati da nessuno al di fuori di Z.ai.
