
GLM-5.3 vs GLM-5.2: Zelfde brein, verdubbelde benchmarks
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
- tencentTencent: Hy32026-07-0642Intelligentie59Coderen
Zhipu AI's eigen framing voor de upgrade van GLM-5.2 naar GLM-5.3 is de eerlijke: het leerboek is niet veranderd, alleen de training van de leerling. GLM-5.3, uitgebracht op 14 augustus 2026, is gebouwd op exact dezelfde MoE-basis met 743 miljard parameters als GLM-5.2, die in juni het open-weights-veld aanvoerde op de Artificial Analysis Intelligence Index. De architectuur is ongewijzigd, de voetafdruk is ongewijzigd, de prijs van $1,40 / $4,40 per miljoen is ongewijzigd — en toch meldt Z.ai dat het opnieuw getrainde model zijn voorganger verdubbelt of overtreft op verschillende codeer- en beveiligingsbenchmarks die beide versies publiceren. Of dat GLM-5.3 een must-upgrade of een kwestie van afwachten maakt, hangt af van hoeveel vertrouwen je hebt in een model dat zoveel verbeterde zonder zijn eigen architectuur te veranderen, en van de vraag of de nieuw ontstane cybercapaciteit een functie is die je achter een veiligheidsvenster van twee weken wilt plaatsen.
Hetzelfde brein, opnieuw getraind.
Alles wat GLM-5.2 tot een praktische server maakte, blijft behouden: de 743B-MoE met ongeveer 40B actieve parameters, de IndexShare sparse attention die FLOPs verminderde bij 1M context, de MIT-licentie, het contextvenster van 1M en de slanke token-doorvoer die in onafhankelijke observatie ~145–168 tokens/sec mat. GLM-5.3 verschilt slechts in één dimensie — post-training. Z.ai schaalde de reinforcement-learningfase met de IndexShare-, SAO- en Slime-frameworks, voegde tientallen keren meer langetermijn-taakomgevingen toe en breidde ze uit van code-debugging naar het ontdekken van beveiligingskwetsbaarheden en systems engineering. Het resultaat is een model dat zich op dezelfde hardware anders gedraagt, en dat is precies waarom de upgrade-vraag niet is "heb ik nieuwe GPU's nodig" maar "heb ik nieuw gedrag nodig."
De benchmark-delta, in beide richtingen
Als voor-na-vergelijking van de door Z.ai gepubliceerde cijfers is de sprong de grootste in de geschiedenis van open-weights-modellen. Terminal-Bench 3.0 — de moeilijkere revisie waarin beide werden gescoord — gaat van 4.6 naar 28.3, een zesvoudige sprong. DeepSWE v1.1 gaat van 46.2 naar 66.9, het verschil tussen "goed open model" en "concurrerend met de gesloten koplopers." De Agents' Last Exam CLI-subset gaat van 23.8 naar 28.5. CyberGym kwetsbaarheidsdetectie stijgt van 77.2 naar 84.5. ExploitBench meer dan verdubbelt, van 24.4 naar 54.4, en ExploitGym-doorvoer gaat van 29 en 39 voltooide taken (twee en zes uur) naar 105 en 130. Z.ai vat het samen als een verbetering van circa 50% op coderingsgebied, en de vorm van de winst — geconcentreerd in codering over lange horizon, terminalautomatisering en beveiliging — is consistent met een model dat uitsluitend post-training heeft gehad: de ruwe kennis is hetzelfde, maar het vermogen om daadwerkelijk meerstaps werk te doen is sterker geworden.
• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5
• Kwetsbaarheidsdetectie van CyberGym — GLM-5.2 77.2 vs GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4


De mogelijkheid die niemand had gepland
De veiligheidswinst verdient een eigen paragraaf, omdat Z.ai zegt dat dit niet het plan was. Het post-trainingsteam voegde omgevingen voor kwetsbaarheidsdetectie toe in de verwachting van een bescheiden verbetering; het model begon in plaats daarvan complete exploits aaneen te rijgen, een emergent gedrag dat Z.ai dwong om de gewichten ongeveer twee weken terug te houden voor veiligheidshardening. In praktijktests met securityteams droeg GLM-5.3 bij aan het vinden van 2.436 kwetsbaarheden in 269 projecten, waarvan er 1.097 een gemiddeld of hoog risico hadden, waaronder fouten die tientallen jaren onopgemerkt waren gebleven in wijdverbreide software. GLM-5.2 had beveiligingscapaciteiten in de gewone zin van het woord: het kon code doorzoeken op bugs. GLM-5.3 heeft die in een andere zin: het is datgene waar het veiligheidsvenster om draait. Dat is een verandering in aard, niet in mate, en het is veruit de sterkste reden om de twee modellen als verschillende producten te behandelen, ondanks de gedeelde basis.

De kanttekening over consistentie
Het tegenwicht voor elk bovenstaand getal is dat vroege tests van derden GLM-5.3 omschrijven als inconsistent op een manier die GLM-5.2 niet was. Onafhankelijke reviewers melden dat hetzelfde model bij sommige taken presteert als een net aan geslaagde uitbestede ingenieur en bij andere resultaten van professioneel niveau levert, waarbij het verschil samenhangt met hoe duidelijk de vereisten waren gespecificeerd. Dat is precies het faalprofiel dat je zou voorspellen bij een model waarvan de winst volledig voortkwam uit omgevingsintensieve post-training: het generaliseert vanuit de taakvormen waarop het is getraind, en slecht gespecificeerde prompts vallen daarbuiten. Geen van de onafhankelijke resultaten is zo strak als de gepubliceerde tabellen van Z.ai, en geen van de cijfers van Z.ai is tot nu toe onafhankelijk gereproduceerd. Voor productie pleit dat voor expliciete evaluatie op je eigen workload vóór de migratie — hetzelfde voorbehoud dat voor GLM-5.2 gold, nu met een grotere spreiding tussen beste en slechtste geval.
Prijs, toegang en de wachtkwestie.
De prijzen zijn identiek, waardoor de gebruikelijke upgradefrictie wegvalt: beide modellen kosten $1,40 / $4,40 per miljoen tokens, waarbij voor GLM-5.3 de denkmodus moet worden ingeschakeld. Toegang is het echte verschil. GLM-5.2 is vandaag downloadbaar onder MIT, zelf te hosten met een FP8-voetafdruk van minder dan een terabyte, en aanroepbaar via OrcaRouter tegen de lijstprijs zonder winstopslag — het model waar je nu naar kunt routeren, stabiel en onafhankelijk gescoord. GLM-5.3 is nu bruikbaar via Z.ai's ZCode / AutoClaw en het GLM Coding Plan, maar zowel de openbare API als de gewichten zijn tijdens het veiligheidsvenster afgeschermd, en de benchmarkcijfers zijn allemaal door de leverancier gerapporteerd, in afwachting van hertests door derden. Dus het eerlijke antwoord op "moet ik wachten" heeft twee delen: voor productieverkeer dat niet mag terugvallen, blijft GLM-5.2 vandaag de veilige gok met open gewichten, en op het moment dat de API van GLM-5.3 opengaat en onafhankelijke runs kloppen, is de overstap een routewijziging, geen herschrijving — je houdt dezelfde configuratie met één sleutel en wisselt van rijstrook. Voor verkennend werk en beveiligingsevaluaties is GLM-5.3 het nu proberen waard via de tools van Z.ai, met dien verstande dat de gepubliceerde voorsprong onbevestigd is en het gedrag variabeler is dan dat van het model dat het vervangt.
Het eerlijke oordeel
GLM-5.3 is het betere model volgens Z.ai's eigen cijfers — dramatisch beter bij langetermijncodering en categorisch anders op het gebied van beveiliging — en het is gratis voor je workflow omdat de basis, de voetafdruk en de prijs ongewijzigd zijn. Maar "beter op de evals van de leverancier" en "beter in je pipeline" worden gescheiden door de twee dingen die GLM-5.2 al heeft en GLM-5.3 nog niet: onafhankelijke reproductie en uitgebrachte gewichten. Als je al GLM-5.2 draait, is het upgradepad het goedkoopste in de geschiedenis van open-gewichten — dezelfde hardware, dezelfde prijs, hetzelfde API-oppervlak, en twee weken wachten op de gewichten. De beslissing gaat minder over de vraag of GLM-5.3 beter is dan GLM-5.2 en meer over de vraag of je bereid bent om productie te verwedden op een model waarvan de verbeteringen, en de nieuw ontstane beveiligingsmogelijkheid, nog niet door iemand buiten Z.ai zijn bevestigd.
