
Recensione di GLM-5.2: Coding quasi all'avanguardia a prezzi Open-Weight?
- anthropicNUOVOAnthropic: Claude Opus 52026-07-2461Intelligenza78Codice
- googleNUOVOGoogle: Gemini 3.6 Flash2026-07-2150Intelligenza69Codice
- googleNUOVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaNUOVOMeta: Muse Spark 1.12026-07-1651Intelligenza71Codice
- kimiNUOVOMoonshotAI: Kimi K32026-07-1557Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0854Intelligenza72Codice
- tencentTencent: Hy32026-07-0641Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenza69Codice60Matematica
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenza61Codice61Matematica
- anthropicAnthropic: Claude Fable 52026-06-0960Intelligenza77Codice
- qwenQwen: Qwen3.7 Plus2026-06-0139Intelligenza56Codice59Matematica
- minimaxMiniMax: MiniMax M32026-05-3144Intelligenza59Codice59Matematica
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Intelligenza74Codice68Matematica
Z.ai ha rilasciato GLM-5.2 il 16 giugno 2026, definendolo un modello di punta costruito per compiti a lungo termine. Per una volta, l'etichetta regge. GLM-5.2 abbina una finestra di contesto da 1 milione di token, effettivamente addestrata per sessioni lunghe di agente di codifica, con i punteggi di codifica più alti mai ottenuti finora da un modello open-weight — e viene distribuito ovunque in contemporanea: l'API di Z.ai, il GLM Coding Plan, e i pesi completi con licenza MIT su Hugging Face, senza restrizioni regionali.
Questa recensione risponde alla domanda che la maggior parte dei team si pone davvero: un modello open-weight è finalmente abbastanza buono per essere il tuo modello di coding predefinito, e dove i capofila closed frontier giustificano ancora il loro premio? Tratteremo cosa c'è di veramente nuovo, cosa costa realmente GLM-5.2 (incluso uno sconto per input memorizzati nella cache che molti articoli ignorano), come si confronta con GLM-5.1 e con i modelli closed frontier, e chi dovrebbe passare oggi.
Verdetto rapido
Considera GLM-5.2 se…
- Esegui carichi di lavoro di codifica o agenti ad alto volume e vuoi una qualità quasi di frontiera a $1.40 / $4.40 per milione di token — una frazione del prezzo di punta
- Crea agenti di codifica a lunga esecuzione — sui risultati pubblicati di FrontierSWE da Z.ai, GLM-5.2 si colloca a un solo punto da Claude Opus 4.8 e davanti a GPT-5.5
- Necessità di una finestra di contesto da 1 milione di token con fino a 128K token di output, addestrata specificamente per traiettorie di agenti lunghe e disordinate piuttosto che solo dichiarata in una scheda tecnica.
- Vuoi pesi aperti: licenza MIT, auto-hosting, fine-tuning e zero vincoli al fornitore.
Astenersi (o restare su una flagship chiusa) se si…
- Serve il massimo assoluto per il lavoro agentico più difficile — Claude Opus 4.8 è ancora chiaramente in testa per l'orchestrazione degli strumenti e i compiti autonomi di lunga durata
- Serve input di immagini o file: GLM-5.2 è solo testo; la visione è nella linea separata GLM-V di Z.ai.
- Sono fortemente vincolati dalla latenza — GLM-5.2 è un modello che pensa prima, e le statistiche del gateway pubblico mostrano un tempo mediano al primo token nell'ordine di diversi secondi
Cos'è GLM-5.2?
GLM-5.2 è il più recente modello di punta della famiglia GLM di Z.ai (ex Zhipu AI), uno dei pochi laboratori a distribuire modelli open-weight a scala di frontiera. La documentazione pubblica del modello indica circa 750 miliardi di parametri totali in un design Mixture-of-Experts, con circa 40 miliardi attivi per token. L'ID del modello è `glm-5.2`, ed è generalmente disponibile oggi: puoi chattare con esso su Z.ai, chiamarlo tramite l'API di Z.ai, usarlo all'interno dell'abbonamento GLM Coding Plan (dove è apparso alcuni giorni prima del lancio pubblico), oppure scaricare i pesi da Hugging Face ed eseguirlo da solo.
Ciò che è notevole in questa generazione è il posizionamento. Z.ai non vende GLM-5.2 come un'alternativa più economica; lo propone come il modello di codifica open-source più potente, con numeri pubblicati che lo collocano a pochi punti dalla frontiera chiusa proprio sui carichi di lavoro — codifica a lungo termine e agenti — dove ora va la maggior parte della spesa degli sviluppatori.
Cosa c'è di nuovo in GLM-5.2?

Un salto di codifica a lungo termine, non un rilascio puntuale.La modifica principale. Nella tabella dei benchmark pubblicata da Z.ai, GLM-5.2 ottiene 81.0 su Terminal-Bench 2.1 rispetto a 63.5 per GLM-5.1, e 62.1 contro 58.4 su SWE-bench Pro. Il dato più impressionante è FrontierSWE, che misura progetti di ingegneria aperti della durata di ore o decine di ore: 74.4 contro 30.5 di GLM-5.1.
Un solido contesto da 1M token. GLM-5.2 è il primo modello GLM ad abbinare una finestra da un milione di token (cinque volte i 200K di GLM-5.1) con un addestramento mirato: Z.ai afferma di aver ampliato sostanzialmente l'addestramento su contesti da 1M in scenari di coding-agent — implementazione su larga scala, ricerca automatizzata, ottimizzazione delle prestazioni, debug complesso. L'output raggiunge un massimo di 128K token per risposta.
Controllo del livello di sforzo. Novità di questa generazione: puoi bilanciare esplicitamente la capacità con la velocità di esecuzione e il costo computazionale impostando un livello di sforzo di ragionamento, invece di ottenere una profondità di ragionamento fissa per ogni richiesta.
Un'architettura più economica sotto il cofano.La nuova tecnica IndexShare di Z.ai riutilizza lo stesso indicizzatore in ogni quattro layer di attenzione sparsa, riducendo il calcolo per token di 2,9x alla piena lunghezza di contesto di 1M, e un layer MTP migliorato accelera la decodifica speculativa aumentando la lunghezza di accettazione fino al 20%.
Puramente aperto. I pesi vengono distribuiti con una licenza MIT, secondo le parole di Z.ai, senza limiti regionali — uso commerciale, fine-tuning e hosting privato sono tutti consentiti.

Prezzi: quanto costa realmente

Di prima parte GLM 5.2 APIil prezzo è di $1,40 per milione di token in input e $4,40 per milione di token in output — lo stesso prezzo di GLM-5.1, quindi il salto di capacità è gratuito se sei già sulla GLM API. L'input in cache scende a $0,26 per milione, e Z.ai sta attualmente rinunciando alle tariffe di archiviazione cache per un periodo limitato, il che è importante per i cicli di agenti che rileggono lo stesso contesto del progetto centinaia di volte.
Per dare un'idea: Claude Opus 4.8 costa $5 / $25 per milione di token. Se la tabella dei benchmark di Z.ai è anche solo approssimativamente corretta, GLM-5.2 offre gran parte della capacità di codifica a lungo orizzonte della frontiera a meno di un quinto del prezzo di output dell'ammiraglia. Due avvertenze: il livello di sforzo determina la spesa effettiva (uno sforzo maggiore significa più token di pensiero), e gli host di terze parti elencano le proprie tariffe — alcune più economiche di quelle della prima parte — quindi controlla i numeri attuali prima di fare un budget.
Punteggio recensione
I punteggi qui sotto sono la nostra valutazione editoriale basata sui benchmark pubblicati da Z.ai e sulla documentazione del modello — la tabella dei benchmark è di proprietà del fornitore. Rivedremo la questione quando arriveranno risultati indipendenti.

- Programmazione: 9/10
Uso agentico / di strumenti: 8/10 — quasi all'avanguardia su MCP-Atlas, ma Opus 4.8 rimane chiaramente in vantaggio nell'orchestrazione degli strumenti.
- Ragionamento: 8/10 — matematica d'élite (AIME 2026: 99.2, il punteggio più alto nella tabella di Z.ai), eppure i test di ragionamento più ampi favoriscono ancora la frontiera chiusa
- Efficienza dei costi: 10/10
Contesto e documenti lunghi: 9/10
- Velocità e latenza: 7/10 — un modello che pensa per primo; usa livelli di sforzo più bassi per attività rapide
Complessivamente: ~8.5/10 — il primo modello open-weight abbastanza vicino alla frontiera da essere un default, non un compromesso.
Vantaggi
- Codifica a lungo orizzonte quasi all'avanguardia a $1,40 / $4,40 per milione di token — stesso prezzo di GLM-5.1, ben al di sotto dei modelli di punta chiusi
- Contesto solido da 1M token con output di 128K, addestrato su traiettorie reali di agenti di codifica
- Controllo del livello di sforzo per ottimizzare il compromesso costo/latenza/qualità per richiesta
- Pesi aperti MIT: auto-ospitare, mettere a punto o mantenere un fallback privato — nessun vincolo, nessun limite regionale
- Input in cache a $0,26 per milione con archiviazione cache attualmente gratuita — importante per i loop degli agenti
Contro
- Claude Opus 4.8 guida ancora i benchmark agentici più difficili — l'orchestrazione di strumenti e i compiti di lunga durata non sono ancora la corona di GLM-5.2.
Solo testo: nessun input di immagine, quindi i flussi di lavoro basati su screenshot o visione documentale necessitano di un modello diverso.
Design incentrato sul pensiero comporta un notevole tempo per il primo token; UX critica per la latenza richiede impostazioni a minore sforzo o un fallback più veloce
Self-hosting è un progetto da data center, non da fine settimana — il checkpoint completo a quanto pare richiede memoria GPU su scala cluster.
La storia del benchmark si basa sulla propria tabella di Z.ai per ora; la replicazione indipendente è ancora in arrivo.
Come si confronta GLM-5.2

contro GLM-5.1.Stesso sticker a $1.40 / $4.40, una finestra di contesto cinque volte più grande e un salto di lungo orizzonte che sembra un salto generazionale: FrontierSWE 74.4 contro 30.5, Terminal-Bench 2.1 81.0 contro 63.5, SWE-Marathon 13.0 contro 1.0. Se sei su GLM-5.1, questa è la scelta di aggiornamento più facile dell'anno — Z.ai pubblica persino una guida alla migrazione dedicata.
vs la frontiera chiusa (Claude Opus 4.8, GPT-5.5).Sulla tabella di Z.ai, GLM-5.2 si posiziona entro quattro punti da Opus 4.8 su Terminal-Bench 2.1 (81.0 vs 85.0), entro un singolo punto su FrontierSWE (74.4 vs 75.1), e supera effettivamente GPT-5.5 su SWE-bench Pro (62.1 vs 58.6) e FrontierSWE (74.4 vs 72.6). La frontiera mantiene il suo vantaggio dove i compiti diventano più lunghi e più ricchi di strumenti: Opus 4.8 raddoppia GLM-5.2 su SWE-Marathon (26.0 vs 13.0) e guida Tool-Decathlon con un ampio margine. La regola pratica: GLM-5.2 per il volume, un modello di punta per la vetta.
contro altri modelli open-weight. Rispetto a Qwen3.7-Max, MiniMax M3 e DeepSeek-V4-Pro, GLM-5.2 supera ogni riga di codifica nella tabella pubblicata. Ad oggi, la corona della codifica open-weight spetta a Z.ai.
Chi dovrebbe usare GLM-5.2?
- Team che eseguono agenti di codifica su larga scala — bot CI, refactoring autonomo, revisione del codice — dove il costo per attività decide ciò che è economicamente possibile.
- Costruttori di strumenti per sviluppatori che vogliono una qualità quasi all'avanguardia senza le fatture all'avanguardia.
- Carichi di lavoro con contesto lungo: analisi di monorepo, specifiche ingegneristiche multi-documento, sessioni di agenti che durano ore e che effettivamente riempiono 1 milione di token.
- Organizzazioni che necessitano di pesi aperti — per conformità, distribuzione in ambienti isolati, fine-tuning, o semplicemente potere contrattuale nei confronti dei fornitori di API.
Chi dovrebbe rimanere con un flagship chiuso?
I team i cui compiti più difficili sono esecuzioni autonome di durata maratona o orchestratura pesante di strumenti — i benchmark dicono che il premio della frontiera è ancora reale lì.
- Workflow dipendenti dalla visione: GLM-5.2 non accetta immagini.
- Prodotti in cui ogni secondo di latenza del primo token costa agli utenti
Vale la pena GLM-5.2?
Per la maggior parte dei carichi di lavoro di programmazione e agenti, sì — decisamente. Il quadro onesto: GLM-5.2 ti offre circa il 90-95% della capacità di coding a lungo orizzonte della frontiera a meno di un quinto del prezzo, con pesi aperti come assicurazione. I modelli flagship chiusi vincono ancora il 5% più difficile dei compiti. Non è un motivo per saltare GLM-5.2; è un motivo per instradare: invia il volume a GLM-5.2 e scala i problemi di livello summit a un modello flagship.
Verdetto finale
GLM-5.2 è il modello di coding open-weight più potente che puoi usare oggi, e il primo che si presenta come una scelta predefinita anziché un compromesso economico — il nostro punteggio: ~8,5/10. Non detronizza Claude Opus 4.8 al vertice della gamma di difficoltà, ma trasforma il modello di punta in uno strumento specialistico invece della risposta ovvia per l'uso quotidiano. Se sei su GLM-5.1, aggiorna ora. Se stai pagando prezzi da modello di punta per lavori di agente di routine, questo è il tuo segnale per rivalutare.
Utilizzando GLM-5.2 tramite OrcaRouter
Poiché la mossa intelligente è "GLM-5.2 per il volume, un modello di punta per i compiti più difficili", probabilmente vorrai più di un modello in produzione — da più di un fornitore. Questa è la frizione che OrcaRouter rimuove.

OrcaRouter già serve GLM-5.2 (ID modello `z-ai/glm-5.2`) attraverso un endpoint compatibile con OpenAI, alle tariffe di Z.ai di $1.40 / $4.40 con margine zero sui token. Instrada il traffico di codifica e agenti ad alto volume verso GLM-5.2, inoltra i ragionamenti più complessi a Claude Opus 4.8 o un altro modello di punta, e tieni pronto il failover automatico per i picchi di capacità durante le finestre di lancio — tutto senza dover riscrivere la tua integrazione ogni volta che cambi modello.

Domande frequenti
GLM-5.2 è disponibile ora?
Sì. È stato lanciato il 16 giugno 2026 ed è generalmente disponibile: sulla chat e API di Z.ai (ID modello glm-5.2), all'interno del GLM Coding Plan, tramite gateway come OrcaRouter, e come pesi aperti con licenza MIT su Hugging Face.
Quanto costa GLM-5.2?
Il prezzo dell'API first-party è di $1.40 per milione di token in input e $4.40 per milione di token in output — invariato rispetto a GLM-5.1. L'input in cache è di $0.26 per milione, e lo storage della cache è gratuito per un periodo limitato.
GLM-5.2 è migliore di GLM-5.1?
Con un ampio margine nel lavoro a lungo termine: 81.0 contro 63.5 su Terminal-Bench 2.1, 74.4 contro 30.5 su FrontierSWE, e un contesto di 1M contro 200K — allo stesso prezzo.
GLM-5.2 vs Claude Opus 4.8 — quale dovrei usare?
Imposta come predefinito GLM-5.2 per la codifica ad alto volume e il lavoro degli agenti; scala i compiti autonomi di lunga durata e l'orchestrazione pesante degli strumenti su Opus 4.8, che è ancora leader in questo ambito. Il routing tra di essi è meglio che sceglierne uno.
Cos'è la finestra di contesto?
1M token, con fino a 128K token di output per risposta — e Z.ai afferma che la finestra lunga è stata specificamente addestrata su scenari di agenti di codifica, non solo estesa.
GLM-5.2 è davvero open source?
Sì — i pesi sono pubblicati sotto licenza MIT senza limiti regionali, gratuiti per uso commerciale e fine-tuning. Tuttavia, bisogna preventivare realisticamente per l'auto-hosting: un checkpoint MoE con ~750 miliardi di parametri richiede memoria GPU su scala cluster.
GLM-5.2 supporta l'input di immagini?
No. GLM-5.2 è testo in entrata, testo in uscita. Per compiti di visione, Z.ai mantiene una linea di modelli GLM-V separata, oppure puoi instradare le richieste di immagini a un modello multimodale.
Posso usare GLM-5.2 tramite OrcaRouter?
Sì — GLM-5.2 è disponibile su OrcaRouter come z-ai/glm-5.2 a tariffe first-party con zero ricarico, insieme a Claude, GPT, Gemini e altri modelli dietro un unico endpoint compatibile con OpenAI.
Pronto per mettere in produzione GLM-5.2? Avvialo in pochi minuti — crea il tuo account OrcaRouter e chiama GLM-5.2, Claude Opus 4.8 e ogni altro modello leader tramite un singolo endpoint compatibile con OpenAI. La programmazione di classe frontier è appena diventata molto più economica; un livello di routing è come raccogli i risparmi.
