Hero-kaart voor de GLM-5.2-uitleg, met een kaart met de tekst 753B totale parameters, een brede contextstrook met de tekst 1M-token context, en een badge met de tekst MIT open weights, met een voettekst met de tekst GLM-5.2 - uitgebracht op 16 juni 2026 - Z.ai.
Guides & Insights

Wat is GLM-5.2? Z.ai's 1M-context open-weight vlaggenschip, twee versies later

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GLM-5.2 is een groot open-weight taalmodel dat alleen tekst verwerkt, afkomstig van Z.ai, het lab in Beijing dat voorheen bekendstond als Zhipu AI, uitgebracht op 16 juni 2026 onder de MIT-licentie. Het is een mixture-of-experts-model met 753 miljard parameters en een contextvenster van een miljoen tokens, en ongeveer twee maanden lang was het het sterkste open-weight codeermodel dat iemand kon downloaden. Die positie heeft het niet meer, want Z.ai heeft sindsdien twee opvolgers bovenop GLM-5.2 uitgebracht — dat is het deel dat de meeste pagina's over GLM-5.2 weglaten, en het deel dat bepaalt of je er nog steeds om zou moeten geven.

Drieënveertig artikelen in het archief van deze blog vermelden GLM-5.2. Tot nu toe ging nog geen van alle erover: het model verschijnt als de tegenstander in de ene na de andere vergelijking, het vaste referentiepunt waaraan nieuwere modellen worden afgemeten. Dat is een vreemde rol voor een model waar zijn eigen maker al aan voorbij is, en dat is de reden dat deze pagina bestaat — een rechtstreekse beschrijving van wat GLM-5.2 werkelijk is, wat het kost, waar het goed in is, en wie het nog steeds zou moeten kiezen.

Waar GLM-5.2 staat binnen de eigen line-up van Z.ai

Z.ai publiceert een gedateerd release-log, en dit is de meest heldere bron hiervoor. Lees het op volgorde en de vorm van de familie wordt vanzelf duidelijk:

Z.ai's public release-notes page, listing dated model entries in reverse chronological order: 2026-08-26 GLM-5.3-Flash, 2026-08-18 GLM-5.3, 2026-06-16 GLM-5.2 and 2026-04-07 GLM-5.1, each with its own summary bullet points.

GLM-5 — 12 februari 2026. De eerste GLM-5, gericht op complexe systeemengineering en langdurige agenttaken.
GLM-5.1 — 7 april 2026. Langdurig werk, in staat om tot acht uur zelfstandig te draaien in één enkele run.
• GLM-5.2 — 16 juni 2026. Het 1M-context-vlaggenschip voor langdurige taken; Z.ai's log beschrijft het als "1M verliesloze context, wat de mogelijkheden voor langdurige taken aanzienlijk verbetert".
GLM-5.3 — 18 augustus 2026. Hetzelfde basismodel als GLM-5.2, waarbij de winst uit post-training komt. Z.ai rapporteert een winst van 50% ten opzichte van GLM-5.2 op zijn interne Code Bench en open-source state-of-the-art op Terminal Bench 3.0.
GLM-5.3-Flash — 26 augustus 2026. Een ander, kleiner model gebouwd op een nieuw getraind basismodel (320B totaal, 18B actief), de eerste native multimodale GLM-5.

De belangrijke regel is de GLM-5.3-vermelding. GLM-5.3 is geen grotere GLM-5.2 — het zijn dezelfde basisgewichten die met post-training verder zijn gebracht. Dat maakt GLM-5.2 het laatste model in de lijn waarvan de capaciteit uit de architectuur kwam, en het maakt GLM-5.3 het huidige tekstvlaggenschip. Als je vandaag louter op kwaliteit een Z.ai-model kiest, is GLM-5.3 het antwoord en GLM-5.2 niet.

GLM-5.3-Flash is een aparte tak in plaats van een goedkopere GLM-5.3: een kleiner, native multimodaal model (tekst, afbeelding en video) dat een orde van grootte goedkoper is dan de tekst-topmodellen. Als je computervisie nodig hebt, is GLM-5.2 in geen van beide gevallen het model dat je wilt.

Het specificatieblad

• Parameters — 753B totaal, volgens de modelkaart op zai-org/GLM-5.2-FP8. Z.ai vermeldt het aantal actieve parameters niet op die kaart; vermeldingen van derden schatten het op ongeveer 40B per token, en we konden dat cijfer niet bevestigen via een primaire bron.
• Contextvenster — 1M tokens, op de kaart beschreven als "een solide 1M-tokencontext die langdurig werk stabiel volhoudt".
• Maximale output — 128K tokens.
• Modaliteit — tekst in, tekst uit. Geen beeldinvoer, geen audio. Onze eigen catalogusvermelding voor het model stelt dat het "alleen tekstinvoer ondersteunt".
• Licentie — MIT, zonder regionale beperkingen. Gewichten worden gepubliceerd via de zai-org-organisatie op Hugging Face in BF16- en FP8-varianten.
• Redeneerbesturing — een hybride denkmodus aangestuurd door een reasoning_effort parameter met instellingen high en max, standaard ingesteld op max. Native tool calling en gestructureerde output worden ondersteund.
• Architectuur — IndexShare, dat één lichtgewicht indexeerder hergebruikt voor elke vier sparse-attentielagen en, volgens de modelkaart, de FLOPs per token met 2,9× verlaagt bij volledige context; plus een verbeterde multi-token-predictionlaag die de acceptatielengte bij speculative decoding met maximaal 20% verhoogt.
• Trainingshardware — persverslaggeving over de lancering stelt dat het model is getraind op Huawei Ascend-accelerators zonder Nvidia-hardware. Dat is een bewering uit nieuwsberichtgeving, niet uit de modelkaart, en we geven die als zodanig door.

A scoreboard card for GLM-5.2 with six rows: released 16 June 2026, 753B total parameters MoE, 1M-token context with 128K output, MIT licence text only, price $1.40 and $4.40 per million tokens, and an Artificial Analysis Intelligence Index of 34, 11th of 114. The footer reads that vendor benchmarks are from Z.ai and the index is per Artificial Analysis v4.3.2.

Waar GLM-5.2 meetbaar goed in is

Bijna alles waar GLM-5.2 goed in is, is een coderings- of agentische maatstaf, en de onderstaande cijfers zijn door de leverancier gerapporteerd — ze komen uit de benchmarktabel op Z.ai's eigen modelkaart, niet uit een onafhankelijke reproductie.

• Terminal Bench 2.1 (Terminus-2) — 81,0, tegenover 63,5 voor GLM-5.1. Dat is de grootste sprong tussen generaties in de tabel.
• SWE-bench Pro — 62,1, tegenover 58,4 voor GLM-5.1.
• FrontierSWE (Dominance) — 74,4, tegenover 30,5 voor GLM-5.1 en 72,6 voor GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Beide ruimschoots competitief met de gesloten frontier op Z.ai's eigen tabel.
• MCP-Atlas (publieke set) — 76,8, vrijwel gelijk aan de 77,8 van Claude Opus 4.8 in dezelfde tabel.
• Recall bij lange context — 78,3, het getal dat er het meest toe doet voor het venster van 1M tokens. Het venster is alleen nuttig als de recall op diepte standhoudt, en Z.ai's eigen cijfer zegt dat dat grotendeels het geval is.

Het onafhankelijke beeld is dunner maar reëel. Artificial Analysis vermeldt GLM-5.2 met een Intelligence Index-score van 34 op zijn Intelligence Index v4.3.2, waarmee het op de 11e plaats van 114 modellen in zijn klasse staat. Aan dat cijfer kleven twee kanttekeningen, en Artificial Analysis noemt ze beide zelf: het model is op hun pagina gemarkeerd als afgeschreven, en zij "continueren alleen prestatiebenchmarking voor de standaard workload van 10k inputtokens" — resultaten voor andere workloads zijn historisch en worden niet meer bijgewerkt. Onze eigen catalogusvermelding voor het model bevat een oudere evaluatiesnapshot van 25 juni 2026 met een Intelligence-score van 33.7, wat niet dezelfde indexrevisie is als het actuele cijfer en niet moet worden gelezen als een verandering in het model.

Waar het meetbaar slecht in is

Drie dingen, en het loont om er bot over te zijn.

• Het is alleen tekst. Geen beeldinvoer, geen audio-invoer. GLM-5.3-Flash is het multimodale model in deze familie, en als je workload screenshots, PDF's of video raakt, zit je met GLM-5.2 volledig op de verkeerde tak.
• Het verliest kansloos op de metingen met de langste horizon en de moeilijkste software-engineering. Op SWE-Marathon scoort het 13,0 tegen 26,0 van Claude Opus 4.8. Op DeepSWE scoort het 46,2 tegen 58 voor Claude Opus 4.8 en 70 voor GPT-5.5. Op NL2Repo scoort het 48,9 tegen 69,7 van Opus 4.8. Dit zijn allemaal door de leverancier gerapporteerde cijfers uit dezelfde tabel die laat zien dat GLM-5.2 elders wint, en dat is juist wat ze geloofwaardig maakt: Z.ai publiceerde ze naast zijn eigen overwinningen.
• Het is voorbijgestreefd op de metingen die het beroemd maakten. GLM-5.3 gebruikt dezelfde basis en verslaat het met 50% op Z.ai's eigen Code Bench, en ook op Terminal Bench 3.0 en op Agents' Last Exam. GLM-5.2 is bij Artificial Analysis ook gemarkeerd als verouderd.

Eén cijfer konden we niet achterhalen: we konden geen actuele, onafhankelijke meting van doorvoer of latentie voor GLM-5.2 bevestigen via een bron die we konden openen. Daarom vermeldt deze pagina er geen, in plaats van een getal te herhalen dat we niet konden controleren.

Prijs en waar je het kunt uitvoeren

Z.ai's eigen tarievenlijst, vandaag gelezen, vermeldt GLM-5.2 tegen:

• Invoer — $1,40 per miljoen tokens
• Gecachte invoer — $0,26 per miljoen tokens
• Uitvoer — $4,40 per miljoen tokens

Opslag van gecachte input staat vermeld als tijdelijk gratis. Merk op dat GLM-5.3 exact dezelfde drie tarieven hanteert, dus het nieuwere model is niet duurder op de lijst van Z.ai — waardoor de gebruikelijke reden om bij het oudere model te blijven vervalt.

Over beschikbaarheid: het model wordt aangeboden via Z.ai's eigen OpenAI-compatibele endpoint op api.z.ai/api/paas/v4/chat/completions, met officiële SDK's voor Python en Java, en de gewichten zijn te downloaden van Hugging Face voor self-hosting onder MIT. Daarnaast is het beschikbaar via een aantal platforms voor inferentie van derden. Wij routeren het: OrcaRouter voert GLM-5.2 op zijn modelpagina tegen het tarief van de provider Z.ai, zonder opslag, dus de $1,40 / $4,40 hierboven is wat u via ons betaalt in plaats van een duurdere versie ervan. Dezelfde sleutel geeft ook toegang tot de rest van de catalogus, wat hier om een specifieke reden van belang is — zie hieronder.

The OrcaRouter model page for z-ai/glm-5.2, showing a Featured badge, a 1M-token context, 128K maximum output, text-only input and output, and rate cards reading $1.40 per million input tokens and $4.40 per million output tokens, alongside measured latency and a seven-day traffic figure.

Wie zou GLM-5.2 moeten kiezen, en wie zou iets anders moeten kiezen

Kies GLM-5.2 als je zelf host en het 1M-tokenvenster de vereiste is in plaats van de benchmarkscores. De MIT-licentie zonder regionale beperkingen, de gepubliceerde FP8-gewichten en het IndexShare-attentieontwerp maken het een echt praktisch iets om op lange context te draaien, en het recall-cijfer op diepte is het getal dat het venster rechtvaardigt. Het is ook een redelijke keuze als je al een pipeline hebt die is afgestemd op het reasoning_effort gedrag ervan en de kosten van het opnieuw valideren van prompts tegen GLM-5.3 groter zijn dan de winst.

Kies in plaats daarvan GLM-5.3 als je tokens koopt in plaats van gewichten en kwaliteit de enige as is. Het is hetzelfde basismodel, beter nagetraind, tegen identieke lijstprijzen. Er is geen prijsargument voor het oudere model op Z.ai's eigen tariefkaart.

Kies in plaats daarvan GLM-5.3-Flash als je visuele mogelijkheden nodig hebt, of als je de goedkoopste capabele optie nodig hebt: hij verwerkt tekst, afbeeldingen en video en is veel goedkoper dan beide tekstvlaggenschepen.

Kies iets totaal anders als je werk aan de moeilijke kant van langetermijnsoftware-engineering zit. In Z.ai's eigen gepubliceerde tabel verslaat Claude Opus 4.8 GLM-5.2 op SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench en Tool-Decathlon; GPT-5.5 verslaat het op DeepSWE en ProgramBench. De overwinningen van GLM-5.2 zijn echt, maar ze zijn geconcentreerd in terminal-achtige agentische codering en redeneren, niet in de marathontaken. Als je evaluatie lijkt op een agent-run van twee uur tegen een grote onbekende repository, dan dicht het prijsvoordeel van open gewichten die kloof niet met deze cijfers.

De praktische samenvatting

GLM-5.2 is een MoE-model met 753B parameters, MIT-licentie, 1M-context en alleen tekst, uitgebracht op 16 juni 2026 voor $1,40 / $4,40 per miljoen tokens, met door de leverancier gerapporteerde scores van 81,0 op Terminal Bench 2.1, 62,1 op SWE-bench Pro en een onafhankelijke Artificial Analysis Intelligence Index van 34. Het is het laatste GLM-vlaggenschip waarvan het vermogen uit de architectuur kwam in plaats van uit post-training, het is tweemaal opgevolgd door zijn eigen maker, en het is gemarkeerd als verouderd op de onafhankelijke index die het heeft beoordeeld.

Niets daarvan maakt het een slecht model. Het maakt het een vaststaand model: de interessante vraag over GLM-5.2 in september 2026 is niet of het goed is, maar of het specifieke ding dat je nodig hebt — een lang-context, zelf te hosten codeermodel onder MIT-licentie — voor jou meer waard is dan de drie punten die GLM-5.3 toevoegt bovenop dezelfde gewichten. Voor de meeste kopers van tokens is het antwoord nee. Voor iedereen die gewichten downloadt, is het nog steeds ja.

Als je dat zelf wilt testen zonder er een productiepad aan te verbinden, is de routeringslaag de goedkope manier om dat te doen: richt hetzelfde verzoek via één endpoint op GLM-5.2 en GLM-5.3, vergelijk op basis van je eigen prompts, en laat automatische failover het geval afhandelen waarin het endpoint van het oudere model het endpoint is dat uitvalt.

Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt