Card hero del titolo per il confronto tra GLM-5.3 e GLM-5.2, con sottotitolo 'Stesso cervello, benchmark raddoppiati', con due card modello che condividono un unico blocco base MoE da 743B collegato e una freccia curva di aggiornamento etichettata 'solo post-addestramento' che punta da GLM-5.2 a GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Stesso cervello, benchmark raddoppiati

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La lettura che Zhipu AI stessa dà dell'aggiornamento da GLM-5.2 a G​LM-5.3 è quella onesta: il libro di testo non è cambiato, è cambiato solo l'addestramento dello studente. G​LM-5.3, rilasciato il 14 agosto 2026, è costruito sulla stessa identica base MoE da 743 miliardi di parametri di GLM-5.2, che a giugno ha conquistato il primo posto tra i modelli open-weight nell'Artificial Analysis Intelligence Index. L'architettura è invariata, l'ingombro è invariato, il prezzo di $1,40 / $4,40 per milione di token è invariato — eppure Z.ai riferisce che il modello riaddestrato raddoppia o supera il suo predecessore su diversi benchmark di coding e sicurezza che entrambe le versioni pubblicano. Che questo renda G​LM-5.3 un aggiornamento da fare assolutamente o un attendi-e-vedi dipende da quanto ci si fida di un modello che è migliorato così tanto senza cambiare la propria architettura, e da se la sua capacità cyber appena emersa sia una funzionalità che si vuole tenere dietro una finestra di sicurezza di due settimane.

Lo stesso cervello, riaddestrato.

Tutto ciò che ha reso GLM-5.2 un server pratico è stato mantenuto: il MoE da 743B con circa 40B di parametri attivi, l'attenzione sparsa IndexShare che ha ridotto i FLOPs con un contesto a 1M, la licenza MIT, la finestra di contesto da 1M e l'efficiente throughput di token che ha registrato ~145–168 token/sec in osservazioni indipendenti. G​LM-5.3 differisce in una sola dimensione — il post-training. Z.ai ha ampliato la fase di reinforcement learning con i framework IndexShare, SAO e Slime, ha aggiunto decine di volte più ambienti di task a lungo orizzonte e li ha estesi dal debug del codice alla scoperta di vulnerabilità di sicurezza e all'ingegneria dei sistemi. Il risultato è un modello che si comporta diversamente sullo stesso hardware, che è esattamente il motivo per cui la domanda sull'aggiornamento non è "mi servono nuove GPU" ma "mi serve un nuovo comportamento".

Il delta del benchmark, in entrambe le direzioni

Letto come un prima e dopo sui dati pubblicati da Z.ai, il salto è il più grande nella storia degli open-weights. Terminal-Bench 3.0 — la versione più difficile, in cui entrambi sono stati valutati — passa da 4.6 a 28.3, un balzo di sei volte. DeepSWE v1.1 passa da 46.2 a 66.9, che è la differenza tra "buon modello open" e "competitivo con i leader chiusi". Il sottoinsieme CLI di Agents' Last Exam passa da 23.8 a 28.5. La scoperta di vulnerabilità di CyberGym sale da 77.2 a 84.5. ExploitBench più che raddoppia, da 24.4 a 54.4, e il throughput di ExploitGym passa da 29 e 39 task completati (in due e sei ore) a 105 e 130. Z.ai lo riassume come un miglioramento di circa il 50% nel coding, e la forma dei guadagni — concentrati nella codifica a lungo orizzonte, nell'automazione del terminale e nella sicurezza — è coerente con un modello basato esclusivamente sul post-training: la conoscenza grezza è la stessa, ma la capacità di svolgere realmente lavoro multi-step è ciò che si è rafforzata.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs G​LM-5.3 28.5

• Scoperta di vulnerabilità CyberGym — GLM-5.2 77.2 vs GLM-5.3 84.5

• ExploitBench — G​LM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

La capacità che nessuno aveva programmato

I guadagni in termini di sicurezza meritano un paragrafo a parte perché Z.ai afferma che non facevano parte del piano. Il team di post-training ha aggiunto ambienti di scoperta delle vulnerabilità aspettandosi un miglioramento modesto; il modello invece ha iniziato a concatenare exploit completi, un comportamento emergente che ha costretto Z.ai a trattenere i pesi per circa due settimane per il rafforzamento della sicurezza. Nei test nel mondo reale con i team di sicurezza, G​LM-5.3 ha contribuito a trovare 2.436 vulnerabilità in 269 progetti, 1.097 delle quali a rischio medio o alto, inclusi difetti rimasti non rilevati per decenni in software ampiamente diffusi. GLM-5.2 aveva capacità di sicurezza nel senso ordinario — poteva leggere il codice per individuare bug. G​LM-5.3 ce l'ha in un senso diverso: è ciò di cui parla la finestra di sicurezza. È un cambiamento di natura, non di grado, ed è la ragione più forte in assoluto per trattare i due modelli come prodotti diversi nonostante la base condivisa.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

L'avvertenza sulla coerenza

Il contrappeso a ogni numero precedente è che i primi test di terze parti descrivono G​LM-5.3 come incoerente in un modo che GLM-5.2 non era. Revisori indipendenti riportano che lo stesso modello si comporta come un ingegnere esternalizzato appena sufficiente su alcuni compiti e offre risultati di livello professionale su altri, con una differenza legata a quanto chiaramente i requisiti erano specificati. È esattamente il profilo di fallimento che ci si aspetterebbe da un modello i cui miglioramenti derivano interamente da un post-addestramento fortemente basato sull'ambiente: generalizza dalle forme dei compiti su cui è stato addestrato, e le richieste mal specificate rimangono al di fuori di esse. Nessuno dei risultati indipendenti è pulito come le tabelle pubblicate da Z.ai, e nessuno dei numeri di Z.ai è ancora stato riprodotto in modo indipendente. Per la produzione, ciò richiede una valutazione esplicita sul proprio carico di lavoro prima della migrazione — la stessa avvertenza che valeva per GLM-5.2, ora con un divario più ampio tra caso migliore e peggiore.

Prezzo, accesso e la questione dell'attesa.

I prezzi sono identici, il che elimina il consueto attrito dell'upgrade: entrambi i modelli costano $1.40 / $4.40 per milione di token, con G​LM-5.3 che richiede il thinking abilitato. L'accesso è la vera differenza. {{1}}GLM-5.2{{/1}} è scaricabile oggi con licenza MIT, auto-ospitabile su un footprint FP8 sub-terabyte e richiamabile tramite OrcaRouter al prezzo di listino senza markup — il modello a cui puoi instradare il traffico adesso, stabile e valutato in modo indipendente. {{2}}G​LM-5.3{{/2}} è utilizzabile ora tramite ZCode / AutoClaw di Z.ai e il G​LM Coding Plan, ma sia l'API pubblica che i pesi sono soggetti a gating per la finestra di sicurezza, e i suoi risultati benchmark sono tutti dichiarati dal vendor, in attesa di riesecuzioni da parte di terzi. Quindi la risposta onesta a «dovrei aspettare?» ha due parti: per il traffico di produzione che non deve subire regressioni, {{3}}GLM-5.2{{/3}} rimane oggi la scommessa sicura con pesi aperti, e nel momento in cui l'API di {{4}}G​LM-5.3{{/4}} si aprirà e le esecuzioni indipendenti daranno esito positivo, il passaggio è un cambio di rotta, non una riscrittura — mantieni la stessa configurazione con una sola chiave e cambi corsia. Per il lavoro esplorativo e di valutazione della sicurezza, {{5}}G​LM-5.3{{/5}} vale la pena provarlo ora tramite gli strumenti di Z.ai, con la consapevolezza che il suo vantaggio dichiarato non è verificato e il suo comportamento è più variabile rispetto al modello che sostituisce.

Il verdetto onesto

G​LM-5.3 è il modello migliore secondo i numeri di Z.ai — drammaticamente migliore nella programmazione a lungo orizzonte e categoricamente diverso per quanto riguarda la sicurezza — ed è gratuito per il tuo flusso di lavoro perché base, ingombro e prezzo sono invariati. Ma "migliore nelle valutazioni del fornitore" e "migliore nella tua pipeline" sono separati dalle due cose che GLM-5.2 già possiede e G​LM-5.3 non ancora: riproduzione indipendente e pesi pubblicati. Se già esegui GLM-5.2, il percorso di aggiornamento è il più economico nella storia dei pesi aperti — stesso hardware, stesso prezzo, stessa superficie API e due settimane di attesa per i pesi. La decisione riguarda meno il fatto che G​LM-5.3 sia migliore di GLM-5.2 e più il fatto di essere disposti a scommettere la produzione su un modello i cui miglioramenti, e la cui nuova capacità di sicurezza emersa, non sono ancora stati confermati da nessuno al di fuori di Z.ai.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube