
Che cos'è GLM-5.2? L'ammiraglia open-weight di Z.ai con contesto da 1M, due versioni dopo
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 è un modello linguistico di grandi dimensioni open-weight, solo testo, di Z.ai, il laboratorio di Pechino precedentemente noto come Zhipu AI, rilasciato il 16 giugno 2026 con licenza MIT. È un modello mixture-of-experts da 753 miliardi di parametri con una finestra di contesto di un milione di token e, per circa due mesi, è stato il modello di coding open-weight più forte che chiunque potesse scaricare. Non occupa più quella posizione, perché Z.ai ha nel frattempo distribuito su di esso due successori — ed è la parte che la maggior parte delle pagine su GLM-5.2 omette, nonché la parte che decide se dovresti ancora interessartene.
Quarantatré articoli nell'archivio di questo blog menzionano GLM-5.2. Fino ad ora, nessuno di essi era dedicato ad esso: il modello compare come l'avversario in confronto dopo confronto, il punto di riferimento fisso rispetto al quale vengono misurati i modelli più recenti. È un ruolo strano per un modello che il suo stesso creatore ha già lasciato alle spalle, ed è il motivo per cui esiste questa pagina — una descrizione diretta di cosa sia effettivamente GLM-5.2, quanto costi, in cosa sia bravo e chi dovrebbe ancora sceglierlo.
Dove si colloca GLM-5.2 nella gamma di Z.ai
Z.ai pubblica un log delle release datato, ed è la fonte più chiara per questo. Leggilo in ordine e la forma della famiglia è evidente:

• GLM-5 — 12 febbraio 2026. Il primo GLM-5, pensato per l'ingegneria di sistemi complessi e per compiti di agenti a lungo raggio.
• GLM-5.1 — 7 aprile 2026. Lavoro a lungo orizzonte, in grado di operare da solo fino a otto ore in una singola esecuzione.
• GLM-5.2 — 16 giugno 2026. Il flagship con contesto da 1M per compiti a lungo orizzonte; il log di Z.ai lo descrive come "contesto lossless da 1M, che migliora significativamente le capacità nei compiti a lungo orizzonte".
• GLM-5.3 — 18 agosto 2026. Stesso modello di base di GLM-5.2, con i miglioramenti derivanti dal post-training. Z.ai riporta un guadagno del 50% rispetto a GLM-5.2 sul suo Code Bench interno e uno stato dell'arte open source su Terminal Bench 3.0.
• GLM-5.3-Flash — 26 agosto 2026. Un modello diverso e più piccolo, costruito su una base addestrata di recente (320B totali, 18B attivi), il primo GLM-5 nativamente multimodale.
La voce importante è quella di GLM-5.3. GLM-5.3 non è un GLM-5.2 più grande: sono gli stessi pesi di base spinti oltre con il post-training. Ciò rende GLM-5.2 l'ultimo modello della linea la cui capacità derivava dall'architettura, e rende GLM-5.3 l'attuale modello di punta per il testo. Se oggi scegli un modello Z.ai basandoti solo sulla qualità, la risposta è GLM-5.3 e non GLM-5.2.
GLM-5.3-Flash è un ramo separato anziché un GLM-5.3 più economico: un modello più piccolo, nativamente multimodale (testo, immagini e video) con un prezzo di un ordine di grandezza inferiore ai flagship testuali. Se ti serve la visione, in entrambi i casi GLM-5.2 non è il modello che vuoi.
La scheda tecnica
• Parametri — 753B in totale, secondo la model card su zai-org/GLM-5.2-FP8. Z.ai non indica il numero di parametri attivi in quella card; gli elenchi di terze parti lo collocano intorno ai 40B per token, e non abbiamo potuto confermare tale cifra da una fonte primaria.
• Finestra di contesto — 1M token, descritta nella card come «un solido contesto da 1M token che sostiene stabilmente lavori a lungo orizzonte».
• Output massimo — 128K token.
• Modalità — testo in input, testo in output. Nessun input di immagini, nessun audio. La nostra stessa voce di catalogo per il modello afferma che «supporta solo input testuale».
• Licenza — MIT, senza limiti regionali. I pesi sono pubblicati tramite l'organizzazione zai-org su Hugging Face nelle varianti BF16 e FP8.
• Controllo del ragionamento — una modalità di pensiero ibrida guidata da un reasoning_effort parametro con le impostazioni high e max, con valore predefinito max. Sono supportati il tool calling nativo e l'output strutturato.
• Architettura — IndexShare, che riutilizza un unico indexer leggero ogni quattro livelli di sparse attention e, secondo la model card, riduce i FLOP per token di 2,9× a contesto pieno; in più un livello migliorato di multi-token prediction che aumenta fino al 20% la lunghezza di accettazione dello speculative decoding.
• Hardware di addestramento — la copertura stampa del lancio afferma che il modello è stato addestrato su acceleratori Huawei Ascend, senza hardware Nvidia. È un'affermazione che proviene da resoconti giornalistici, non dalla model card, e la riportiamo come tale.

In cosa GLM-5.2 è misurabilmente valido
Quasi tutto ciò in cui GLM-5.2 è bravo è una misurazione di coding o agentica, e i numeri di seguito sono dichiarati dal fornitore — provengono dalla tabella di benchmark sulla scheda del modello di Z.ai stessa, non da una riproduzione indipendente.
• Terminal Bench 2.1 (Terminus-2) — 81,0, contro 63,5 di GLM-5.1. È il singolo salto generazionale più grande della tabella.
• SWE-bench Pro — 62,1, contro 58,4 di GLM-5.1.
• FrontierSWE (Dominance) — 74,4, contro 30,5 di GLM-5.1 e 72,6 di GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Entrambi ampiamente competitivi con la frontiera chiusa nella tabella di Z.ai.
• MCP-Atlas (set pubblico) — 76,8, sostanzialmente alla pari con il 77,8 di Claude Opus 4.8 sulla stessa tabella.
• Richiamo su contesto lungo — 78,3, che è il numero che conta di più per la finestra da 1M token. La finestra è utile solo se il richiamo tiene in profondità, e la cifra di Z.ai dice che per lo più è così.
Il quadro indipendente è più scarno ma reale. Artificial Analysis riporta GLM-5.2 con un punteggio di 34 sull’Intelligence Index nella sua Intelligence Index v4.3.2, collocandolo all’11º posto su 114 modelli della sua classe. A quel numero sono legati due avvertimenti, ed è Artificial Analysis stessa a dichiararli entrambi: il modello è contrassegnato come deprecato sulla loro pagina, e «continuano a eseguire il benchmarking delle prestazioni solo per il carico di lavoro predefinito con 10k token di input» — i risultati per gli altri carichi di lavoro sono storici e non vengono più aggiornati. La nostra voce di catalogo per il modello contiene un’istantanea di valutazione più vecchia del 25 giugno 2026 con un punteggio di Intelligence di 33.7, che non appartiene alla stessa revisione dell’indice del dato attuale e non deve essere interpretata come un cambiamento nel modello.
In cosa è misurabilmente scarso
Tre cose, e vale la pena essere schietti al riguardo.
• È solo testo. Nessun input di immagini, nessun input audio. GLM-5.3-Flash è il modello multimodale di questa famiglia, e se il tuo carico di lavoro comprende screenshot, PDF o video, GLM-5.2 è totalmente il ramo sbagliato.
• Perde nettamente sulle misurazioni di ingegneria del software più difficili e a più lungo orizzonte. Su SWE-Marathon segna 13,0 contro il 26,0 di Claude Opus 4.8. Su DeepSWE segna 46,2 contro 58 di Claude Opus 4.8 e 70 di GPT-5.5. Su NL2Repo segna 48,9 contro il 69,7 di Opus 4.8. Sono tutte cifre riportate dal fornitore, provenienti dalla stessa tabella che mostra GLM-5.2 vincere altrove, ed è questo che le rende credibili: Z.ai le ha pubblicate accanto alle proprie vittorie.
• È stato soppiantato sulle misurazioni che lo hanno reso famoso. GLM-5.3 usa la stessa base e lo batte sul Code Bench di Z.ai del 50%, su Terminal Bench 3.0 e su Agents' Last Exam. GLM-5.2 è anche contrassegnato come deprecato su Artificial Analysis.
Un dato che non siamo riusciti a ottenere: non abbiamo potuto confermare una misurazione indipendente e aggiornata di throughput o latenza per GLM-5.2 da una fonte che siamo riusciti ad aprire, quindi questa pagina non ne indica alcuno anziché ripetere un numero che non abbiamo potuto verificare.
Prezzo e dove eseguirlo
Il listino tariffe di Z.ai, consultato oggi, riporta GLM-5.2 a:
• Input — $1,40 per milione di token
• Input in cache — $0,26 per milione di token
• Output — $4,40 per milione di token
L'archiviazione dell'input in cache è indicata come gratuita per un periodo limitato. Tieni presente che GLM-5.3 applica esattamente le stesse tre tariffe, quindi il modello più recente non è più costoso nella lista di Z.ai — il che elimina la solita ragione per rimanere su quello più vecchio.
Sulla disponibilità: il modello è servito tramite l'endpoint compatibile con OpenAI di Z.ai stesso all'indirizzo api.z.ai/api/paas/v4/chat/completions, con SDK ufficiali per Python e Java, e i pesi sono scaricabili da Hugging Face per il self-hosting con licenza MIT. Oltre a ciò, è disponibile attraverso diverse piattaforme di inferenza di terze parti. Noi lo instradiamo: OrcaRouter presenta GLM-5.2 sulla propria pagina del modello alla tariffa del provider Z.ai senza alcun ricarico, quindi gli $1.40 / $4.40 sopra indicati sono ciò che paghi tramite noi anziché una copia maggiorata. La stessa chiave dà anche accesso al resto del catalogo, il che qui conta per un motivo specifico — vedi sotto.

Chi dovrebbe scegliere GLM-5.2, e chi dovrebbe scegliere qualcos'altro
Scegli GLM-5.2 se ospiti il modello in autonomia e la finestra da 1M token è il requisito, più dei punteggi dei benchmark. La licenza MIT senza restrizioni regionali, i pesi FP8 pubblicati e il design dell'attenzione IndexShare lo rendono una cosa davvero pratica da eseguire in contesto lungo, e il valore di recall in profondità è il numero che giustifica la finestra. È anche una scelta ragionevole se hai già una pipeline ottimizzata per il suo reasoning_effort comportamento e il costo di rivalidare i prompt su GLM-5.3 supera il guadagno.
Scegli invece GLM-5.3 se acquisti token anziché pesi e la qualità è l'unico criterio. È lo stesso modello di base, con un post-addestramento migliore, a prezzi di listino identici. Non c'è alcun argomento sul prezzo a favore del modello precedente sul tariffario di Z.ai stesso.
Scegli invece GLM-5.3-Flash se ti servono capacità visive, o se cerchi l'opzione più economica ma comunque valida: gestisce testo, immagini e video e costa molto meno di entrambi i modelli di punta per il testo.
Scegli qualcosa di completamente diverso se il tuo lavoro si colloca all'estremità più difficile dell'ingegneria del software a lungo orizzonte. Nella tabella pubblicata da Z.ai stessa, Claude Opus 4.8 batte GLM-5.2 su SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench e Tool-Decathlon; GPT-5.5 batte GLM-5.2 su DeepSWE e ProgramBench. Le vittorie di GLM-5.2 sono reali, ma sono concentrate nella programmazione agentica e nel ragionamento in stile terminale, non nei compiti da maratona. Se la tua valutazione assomiglia a un'esecuzione di un agente di due ore su un grande repository sconosciuto, il vantaggio di prezzo dei pesi aperti non colma quel divario su questi numeri.
Il riepilogo pratico
GLM-5.2 è un modello MoE solo testo con 753 miliardi di parametri, con licenza MIT, contesto da 1M, rilasciato il 16 giugno 2026 a 1,40 $ / 4,40 $ per milione di token, con un Terminal Bench 2.1 riportato dal fornitore pari a 81,0, uno SWE-bench Pro pari a 62,1 e un Artificial Analysis Intelligence Index indipendente pari a 34. È l'ultimo modello di punta GLM la cui capacità derivava dall'architettura anziché dal post-training, è stato superato due volte dal suo stesso produttore ed è contrassegnato come deprecato sull'indice indipendente che lo ha valutato.
Niente di tutto ciò ne fa un cattivo modello. Ne fa un modello consolidato: la domanda interessante su GLM-5.2 a settembre 2026 non è se sia buono, ma se la cosa specifica di cui hai bisogno — un modello di coding a contesto lungo, auto-ospitabile e con licenza MIT — valga più per te dei tre punti che GLM-5.3 aggiunge sugli stessi pesi. Per la maggior parte degli acquirenti di token la risposta è no. Per chiunque scarichi i pesi, lo è ancora.
Se vuoi verificarlo da solo senza impegnare per questo un percorso di produzione, il livello di routing è il modo più economico per farlo: indirizza la stessa richiesta a GLM-5.2 e GLM-5.3 tramite un unico endpoint, confronta sui tuoi prompt e lascia che il failover automatico gestisca il caso in cui sia l'endpoint del modello più vecchio a cadere.
Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
