Hero-titelkaart voor de vergelijking van GLM-5.3 en GLM-5.2, met als ondertitel 'Hetzelfde brein, dubbele benchmarks', met twee modelkaarten die een enkel verbonden 743B MoE-basisblok delen en een gebogen upgrade-pijl met het label 'alleen post-training' die van GLM-5.2 naar GLM-5.3 wijst.
Guides & Insights

GLM-5.3 vs GLM-5.2: Zelfde brein, verdubbelde benchmarks

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zhipu AI's eigen framing voor de upgrade van GLM-5.2 naar G​LM-5.3 is de eerlijke: het leerboek is niet veranderd, alleen de training van de leerling. G​LM-5.3, uitgebracht op 14 augustus 2026, is gebouwd op exact dezelfde MoE-basis met 743 miljard parameters als GLM-5.2, die in juni het open-weights-veld aanvoerde op de Artificial Analysis Intelligence Index. De architectuur is ongewijzigd, de voetafdruk is ongewijzigd, de prijs van $1,40 / $4,40 per miljoen is ongewijzigd — en toch meldt Z.ai dat het opnieuw getrainde model zijn voorganger verdubbelt of overtreft op verschillende codeer- en beveiligingsbenchmarks die beide versies publiceren. Of dat G​LM-5.3 een must-upgrade of een kwestie van afwachten maakt, hangt af van hoeveel vertrouwen je hebt in een model dat zoveel verbeterde zonder zijn eigen architectuur te veranderen, en van de vraag of de nieuw ontstane cybercapaciteit een functie is die je achter een veiligheidsvenster van twee weken wilt plaatsen.

Hetzelfde brein, opnieuw getraind.

Alles wat GLM-5.2 tot een praktische server maakte, blijft behouden: de 743B-MoE met ongeveer 40B actieve parameters, de IndexShare sparse attention die FLOPs verminderde bij 1M context, de MIT-licentie, het contextvenster van 1M en de slanke token-doorvoer die in onafhankelijke observatie ~145–168 tokens/sec mat. G​LM-5.3 verschilt slechts in één dimensie — post-training. Z.ai schaalde de reinforcement-learningfase met de IndexShare-, SAO- en Slime-frameworks, voegde tientallen keren meer langetermijn-taakomgevingen toe en breidde ze uit van code-debugging naar het ontdekken van beveiligingskwetsbaarheden en systems engineering. Het resultaat is een model dat zich op dezelfde hardware anders gedraagt, en dat is precies waarom de upgrade-vraag niet is "heb ik nieuwe GPU's nodig" maar "heb ik nieuw gedrag nodig."

De benchmark-delta, in beide richtingen

Als voor-na-vergelijking van de door Z.ai gepubliceerde cijfers is de sprong de grootste in de geschiedenis van open-weights-modellen. Terminal-Bench 3.0 — de moeilijkere revisie waarin beide werden gescoord — gaat van 4.6 naar 28.3, een zesvoudige sprong. DeepSWE v1.1 gaat van 46.2 naar 66.9, het verschil tussen "goed open model" en "concurrerend met de gesloten koplopers." De Agents' Last Exam CLI-subset gaat van 23.8 naar 28.5. CyberGym kwetsbaarheidsdetectie stijgt van 77.2 naar 84.5. ExploitBench meer dan verdubbelt, van 24.4 naar 54.4, en ExploitGym-doorvoer gaat van 29 en 39 voltooide taken (twee en zes uur) naar 105 en 130. Z.ai vat het samen als een verbetering van circa 50% op coderingsgebied, en de vorm van de winst — geconcentreerd in codering over lange horizon, terminalautomatisering en beveiliging — is consistent met een model dat uitsluitend post-training heeft gehad: de ruwe kennis is hetzelfde, maar het vermogen om daadwerkelijk meerstaps werk te doen is sterker geworden.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs G​LM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5

• Kwetsbaarheidsdetectie van CyberGym — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

De mogelijkheid die niemand had gepland

De veiligheidswinst verdient een eigen paragraaf, omdat Z.ai zegt dat dit niet het plan was. Het post-trainingsteam voegde omgevingen voor kwetsbaarheidsdetectie toe in de verwachting van een bescheiden verbetering; het model begon in plaats daarvan complete exploits aaneen te rijgen, een emergent gedrag dat Z.ai dwong om de gewichten ongeveer twee weken terug te houden voor veiligheidshardening. In praktijktests met securityteams droeg G​LM-5.3 bij aan het vinden van 2.436 kwetsbaarheden in 269 projecten, waarvan er 1.097 een gemiddeld of hoog risico hadden, waaronder fouten die tientallen jaren onopgemerkt waren gebleven in wijdverbreide software. GLM-5.2 had beveiligingscapaciteiten in de gewone zin van het woord: het kon code doorzoeken op bugs. G​LM-5.3 heeft die in een andere zin: het is datgene waar het veiligheidsvenster om draait. Dat is een verandering in aard, niet in mate, en het is veruit de sterkste reden om de twee modellen als verschillende producten te behandelen, ondanks de gedeelde basis.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

De kanttekening over consistentie

Het tegenwicht voor elk bovenstaand getal is dat vroege tests van derden G​LM-5.3 omschrijven als inconsistent op een manier die GLM-5.2 niet was. Onafhankelijke reviewers melden dat hetzelfde model bij sommige taken presteert als een net aan geslaagde uitbestede ingenieur en bij andere resultaten van professioneel niveau levert, waarbij het verschil samenhangt met hoe duidelijk de vereisten waren gespecificeerd. Dat is precies het faalprofiel dat je zou voorspellen bij een model waarvan de winst volledig voortkwam uit omgevingsintensieve post-training: het generaliseert vanuit de taakvormen waarop het is getraind, en slecht gespecificeerde prompts vallen daarbuiten. Geen van de onafhankelijke resultaten is zo strak als de gepubliceerde tabellen van Z.ai, en geen van de cijfers van Z.ai is tot nu toe onafhankelijk gereproduceerd. Voor productie pleit dat voor expliciete evaluatie op je eigen workload vóór de migratie — hetzelfde voorbehoud dat voor GLM-5.2 gold, nu met een grotere spreiding tussen beste en slechtste geval.

Prijs, toegang en de wachtkwestie.

De prijzen zijn identiek, waardoor de gebruikelijke upgradefrictie wegvalt: beide modellen kosten $1,40 / $4,40 per miljoen tokens, waarbij voor G​LM-5.3 de denkmodus moet worden ingeschakeld. Toegang is het echte verschil. GLM-5.2 is vandaag downloadbaar onder MIT, zelf te hosten met een FP8-voetafdruk van minder dan een terabyte, en aanroepbaar via OrcaRouter tegen de lijstprijs zonder winstopslag — het model waar je nu naar kunt routeren, stabiel en onafhankelijk gescoord. G​LM-5.3 is nu bruikbaar via Z.ai's ZCode / AutoClaw en het G​LM Coding Plan, maar zowel de openbare API als de gewichten zijn tijdens het veiligheidsvenster afgeschermd, en de benchmarkcijfers zijn allemaal door de leverancier gerapporteerd, in afwachting van hertests door derden. Dus het eerlijke antwoord op "moet ik wachten" heeft twee delen: voor productieverkeer dat niet mag terugvallen, blijft GLM-5.2 vandaag de veilige gok met open gewichten, en op het moment dat de API van G​LM-5.3 opengaat en onafhankelijke runs kloppen, is de overstap een routewijziging, geen herschrijving — je houdt dezelfde configuratie met één sleutel en wisselt van rijstrook. Voor verkennend werk en beveiligingsevaluaties is G​LM-5.3 het nu proberen waard via de tools van Z.ai, met dien verstande dat de gepubliceerde voorsprong onbevestigd is en het gedrag variabeler is dan dat van het model dat het vervangt.

Het eerlijke oordeel

G​LM-5.3 is het betere model volgens Z.ai's eigen cijfers — dramatisch beter bij langetermijncodering en categorisch anders op het gebied van beveiliging — en het is gratis voor je workflow omdat de basis, de voetafdruk en de prijs ongewijzigd zijn. Maar "beter op de evals van de leverancier" en "beter in je pipeline" worden gescheiden door de twee dingen die GLM-5.2 al heeft en G​LM-5.3 nog niet: onafhankelijke reproductie en uitgebrachte gewichten. Als je al GLM-5.2 draait, is het upgradepad het goedkoopste in de geschiedenis van open-gewichten — dezelfde hardware, dezelfde prijs, hetzelfde API-oppervlak, en twee weken wachten op de gewichten. De beslissing gaat minder over de vraag of G​LM-5.3 beter is dan GLM-5.2 en meer over de vraag of je bereid bent om productie te verwedden op een model waarvan de verbeteringen, en de nieuw ontstane beveiligingsmogelijkheid, nog niet door iemand buiten Z.ai zijn bevestigd.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube