
GLM-5.3 gelanceerd: het lek was echt — Z.ai's post-getrainde vlaggenschip voor coderen en cyberverdediging
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 222 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
Het lek was echt, de lancering is hier, en GLM-5.3 heeft nu een onafhankelijke score om over te twisten. De Intelligence Index van Artificial Analysis — gemeten door het lab, niet door Z.ai — plaatst GLM-5.3 op 60, gelijk met Kimi K3 voor de hoogste open-gewichten score op het bord en 7 punten boven de 53 van GLM-5.2. De API ging deze week live tegen dezelfde prijs als zijn voorganger, de open gewichten zijn bevestigd voor vrijdag 28 augustus, en de beweringen over codering en cyberdefensie die Z.ai sinds de aankondiging van 14 augustus doet, beginnen testbaar te worden. Deze pagina volgde GLM-5.3 voor het eerst via de leksporen van 3 augustus; dit is het lanceringsrapport, hier bijgewerkt met wat de lancering, de API en de eerste onafhankelijke benchmark daadwerkelijk bevestigden.
Van lek tot lancering
De vier sporen die op 3 augustus opdoken — een "ZCode for GLM-5.3"-harnesspagina, een officiële documentatiepagina die ongeveer een uur bereikbaar was, een Bing-indexvermelding met "GLM-5.3 Official Harness," en een commit die een "glm-5.3"-vermelding met JSON Schema-ondersteuning toevoegde aan de officiële Java SDK van Zhipu — wezen allemaal op een echte, met naam genoemde release. Z.ai-medeoprichter Tang Jie's "sooooooon"-antwoord en de "epic-level plus"-framing worden nu bevestigd door een daadwerkelijk product in plaats van een gerucht. Het "ongeveer een week"-tijdsignaal dat deze pagina testte — geplaatst op X door @teortaxesTex nadat DeepSeek V4 Pro op 13 augustus was uitgebracht — klopte tot op de dag: Z.ai kondigde GLM-5.3 op 14 augustus formeel aan onder de slogan "Built to Code. Ready for Cyber Defense." De follow-up kwam deze week: op 19 augustus zei Z.ai dat de GLM-5.3-API live en open voor oproepen was, geprijsd hetzelfde als GLM-5.2, met het model al ingebouwd in ZCode, AutoClaw en het GLM Coding Plan.
Wat post-training daadwerkelijk opleverde
De architectuurclaim is het deel dat de moeite waard is om vast te spijkeren, omdat het meest in het oog springende specifieke detail van de leak — parameters die boven de biljoen uitstijgen — onjuist is. GLM-5.3 is geen groter model. Z.ai zegt dat het exact dezelfde 743B Mixture-of-Experts-basis hergebruikt als GLM-5.2 (ruwweg 40 miljard actieve parameters per token), hetzelfde contextvenster van 1M tokens en ongeveer 128K maximale output behoudt, en al zijn winst haalt uit opgeschaalde post-training: meer long-horizon-taakomgevingen, meer omgevingstypen en langere trainingsruns, gebouwd op het IndexShare long-context-, SAO asynchrone-RL- en open-source slime-framework dat al GLM-5.2 voortbracht. Dat 'geen hertraining, alleen post-training'-frame is van Z.ai zelf, en het is niet onafhankelijk gecontroleerd. De omvang is de andere kop: met 743B totale parameters en slechts ongeveer 40B actieve per token is GLM-5.3 licht genoeg om op een bescheiden cluster zelf te hosten en goedkoop genoeg om op schaal te draaien — de 'kleiner, goedkoper, open'-positionering die het commentaar op de lanceringsdag eraan toeschreef, en een scherp contrast met de gesloten frontier-vlaggenschepen waaraan het wordt afgemeten.
Coding en agents: de cijfers die Z.ai claimt
Op het gebied van coderen rapporteert Z.ai — allemaal door leveranciers gerapporteerd en niet gereproduceerd — een stijging van Terminal-Bench 3.0 van 4,6 naar 28,3, wat Z.ai de hoogste open-weights-score op die harness noemt; een stijging van DeepSWE v1.1 van 46,2 naar 66,9; ruwweg een verdubbeling van SWE-Marathon van 19,4 naar 42,5; en een stijging van Agents' Last Exam (CLI) van 23,8 naar 28,5. Op de interne codebench van Z.ai scoorde GLM-5.3 31,4% bij ongeveer 50K outputtokens per taak bij hoge inspanning, tegenover de 29,5% van Claude Opus 4.8 bij ongeveer 120K tokens — het punt van Z.ai is dat GLM-5.3 een vergelijkbaar resultaat bereikt terwijl het veel minder outputtokens gebruikt. Claude Fable 5 staat nog steeds aan de leiding in die interne evaluatie met 39,5% bij maximale inspanning, en Z.ai geeft toe dat GLM-5.3 nog steeds achterblijft bij GPT-5.6 Sol en Claude Fable 5 op verscheidene moeilijkere code-evaluaties. Beschouw al deze cijfers als leverancierscijfers totdat een onafhankelijke harness ze reproduceert.
Cyberdefensie: de capaciteit die niemand zag aankomen
De cybersecurity-cijfers zijn het echte nieuws, en ze zijn ook volledig afkomstig van de leverancier. Op CyberGym, een white-box-benchmark voor het ontdekken en valideren van kwetsbaarheden, rapporteert Z.ai GLM-5.3 op 84,5%, tegenover 77,2% voor GLM-5.2 en vóór Anthropic's Mythos 5 (83,8%) en GPT-5.6 Sol (83,6%). Op ExploitBench, dat zowel rootcause-analyse als een werkende exploit vereist, is GLM-5.3 meer dan verdubbeld van 24,4% naar 54,4%, al blijft Mythos 5 (78,0%) voorop. Op ExploitGym rapporteert Z.ai 105 voltooide taken binnen een budget van 2 uur en 130 binnen 6 uur, tegenover 29 en 39 voor GLM-5.2 — opnieuw achter Mythos 5 (181 en 247). Z.ai framet de cybercapaciteit als een emergente eigenschap van opgeschaalde post-training — 'de capaciteit bleef zich opstapelen naarmate de training opschaalde', in de woorden van het bedrijf — in plaats van een bewust doel.
Z.ai voegt een praktijkclaim toe naast de benchmarks: in tests met beveiligingsteams identificeerde GLM-5.3 2.436 kwetsbaarheden in 269 open-sourceprojecten, waarvan 1.097 als kritiek of ernstig werden beoordeeld, met de oudste bevinding uit 1981 en een gemiddelde 'levensduur' van 26,6 jaar. Dat is het opvallendste cijfer in de aankondiging en ook het minst onafhankelijk controleerbaar. Het bedrijf heeft de functionaliteit gekoppeld aan een Security Disclosure Ledger voor gecoördineerde openbaarmaking, een 'trusted access'-programma dat gevoelige cyberfuncties beperkt tot geverifieerde gebruikers, en een 'Open Source Shield'-initiatief om belangrijke open-sourceprojecten continu te controleren.
De baseline die GLM-5.3 moest verslaan.
GLM-5.2 is het referentiepunt waar het hele verhaal aan ophangt. Het werd in juni 2026 uitgebracht als een 743B Mixture-of-Experts-model met ongeveer 40B actieve parameters per token, een contextvenster van 1M tokens, een maximale output van 128K, een MIT-licentie en open gewichten op Hugging Face. Onafhankelijk plaatst de Intelligence Index van Artificial Analysis GLM-5.2 op 53 — de hoogste open-weights-score op de index tot deze week. GLM-5.3 overtreft die score nu met 7 punten: Artificial Analysis meet GLM-5.3 op 60 op dezelfde index (v4.1.1), waarmee het gelijk staat aan Kimi K3 voor de hoogste open-weights-positie en het in de frontier-band terechtkomt naast closed-source vlaggenschepen als Claude Fable 5 en GPT-5.6 Sol. Dat is het eerste onafhankelijke getal dat aan GLM-5.3 wordt gekoppeld, en het is consistent met de richting — zo niet elk detail — van Z.ai's eigen beweringen. Op het gebied van long-horizon coding meet de OrcaRouter-harness 77,9 op Terminal-Bench 2.1, terwijl Z.ai's best gerapporteerde cijfer voor GLM-5.2 82,7 is, wat de eerste open-weights-score boven 80 zou zijn, maar door de leverancier is gerapporteerd en niet is gereproduceerd. De lijstprijs is $1,40 per miljoen inputtokens en $4,40 per miljoen outputtokens.

Het scorebord hierboven is de projectie uit het lek-tijdperk die deze pagina vóór de lancering publiceerde — de rij ">1T parameters (gerucht)", de onbevestigde context en licentie, de geprojecteerde AA-index. De lancering corrigeerde de grootste cel: GLM-5.3 gebruikt dezelfde 743B-basis als GLM-5.2, dus er is geen parametersprong. Het contextvenster is bevestigd op 1M, en de licentie blijft onbevestigd omdat de open gewichten nog niet zijn uitgebracht. De geprojecteerde indexcel — de eigen schatting van deze pagina van ~57–60 — was de zeldzame projectie die precies klopte: het werkelijke getal is 60, en de open vraag is nu wat er gebeurt wanneer die score wordt gereproduceerd met de werkelijke gewichten.

De bovenstaande capture is de onafhankelijke basislijn waartegen de claims van GLM-5.3 worden gemeten. GLM-5.2 voert de open-weights leaderboard aan met een Artificial Analysis Intelligence Index van 53. De eerste test of de post-training deltas van GLM-5.3 dat getal veranderen is nu aangebroken: Artificial Analysis meet GLM-5.3 op 60 op dezelfde index — gelijk aan Kimi K3 voor de leiding in open-weights, 7 punten voor op GLM-5.2, en door het laboratorium gerapporteerd als onafhankelijk gemeten.
Prijzen en beschikbaarheid
GLM-5.3 is qua prijs identiek aan GLM-5.2: $1,40 per miljoen invoertokens en $4,40 per miljoen uitvoertokens (¥8 / ¥28 in de binnenlandse notering), met reads op gecachte invoer voor $0,26 / ¥2 per miljoen. Z.ai maakte op 19 augustus bekend dat de API open is, en deze is bereikbaar via Z.ai's eigen API, ZCode, AutoClaw, het GLM Coding Plan en verschillende partner-gateways. Eén gedragsverandering is belangrijk voor API-gebruikers: verzoeken vereisen nu dat "thinking" is ingeschakeld op drie inspanningsniveaus — laag, hoog en maximaal — zonder uitschakeloptie, een breaking change voor bestaande integraties.
Dezelfde prijs betekent niet dezelfde rekening. GLM-5.3 verbruikt ongeveer 20% meer tokens per taak dan GLM-5.2 bij dezelfde workloads, wat bij een kosten-per-taak-berekening neerkomt op ongeveer $0,68 tegenover $0,44 voor GLM-5.2 — nog steeds onder Kimi K3 (ongeveer $0,84) en GPT-5.6 Sol (ongeveer $1,23). Die berekening per taak is een afgeleide schatting op basis van waargenomen tokenverbruik, geen cijfer van de leverancier, maar het is wel het getal dat bepaalt of de vaste tariefkaart van $1,40 / $4,40 je daadwerkelijk geld bespaart.
Wat de lancering voor jou verandert
Voor API-gebruikers die al op GLM-5.2 zitten, is de praktische stap een wijziging van de modelnaam, geen project: GLM-5.2 is OpenAI-compatibel en de integratie blijft behouden, met de bovengenoemde kanttekening over thinking-effort. Voor self-hosters is de tijdlijn nu een datum in plaats van een gok: Zhipu beloofde de gewichten "twee weken na release" op 14 augustus, wat neerkomt op vrijdag 28 augustus, en de open vraag is of de licentie permissief blijft. Voor iedereen die modellen vergelijkt in de categorie DeepSeek V4 Pro, Qwen3.8-Max, Kimi K3, GPT-5.6 Sol en Claude Fable 5, is GLM-5.3 nu een levende, onafhankelijk gescoorde variabele in die rangschikking in plaats van een gerucht.
Het argument op de lanceringdag rond GLM-5.3 is dat de codeergrens is geconvergeerd: voor de meeste alledaagse taken, zo gaat het verhaal, kunnen weinig gebruikers GPT-5.6 Sol, Claude Fable 5, Kimi K3, GLM-5.2 en Qwen3.8-Max betrouwbaar van elkaar onderscheiden. Als die convergentie echt is, zijn de doorslaggevende factoren niet langer ruwe capaciteit, maar prijs, openheid en overstapkosten — precies de hoek die GLM-5.3 claimt met $1,40 / $4,40 per miljoen op een zelf-hostbare 743B-basis, met gewichten die voor 28 augustus zijn bevestigd. Of codeermodellen werkelijk onderling uitwisselbaar zijn, is een mening, geen benchmark; de prijzen, het aantal parameters en de datum van de gewichten zijn dat niet.
Aan de routingkant werd GLM-5.3 op 18 augustus live op OrcaRouter, dezelfde dag dat de API van Z.ai openging — tegen de lijstprijs van de eerste partij, $1,40 / $4,40 per miljoen, zonder enige opslag doorberekend. De onderstaande screenshot toont de pagina van GLM-5.2, die precies de vorm heeft die GLM-5.3 nu heeft: dezelfde prijs, dezelfde context van 1M tokens, dezelfde maximale output van 128K. Het routeren van een deel van het echte verkeer naar GLM-5.3 met automatische failover naar GLM-5.2 of een ander bewezen model is een configuratiewijziging, geen herschrijving — dezelfde sleutel, geen tweede contract. Als het nieuwe model achteruitgaat op jouw workload, valt de router terug voordat een pagina omslaat, en krijg je een kwaliteitssignaal op je eigen verkeer in plaats van een slide van de leverancier. Voor een model waarvan de vlaggenschipclaims nog grotendeels door de leverancier worden gemeld, is dat de laag-risicomanier om het zelf te ontdekken.

Wat nu te kijken
• De gewichten, op vrijdag 28 augustus, en de licentieregel op de modelkaart — permissief MIT zoals GLM-5.2, of iets beperkter. Zhipu's cyberveiligheidshardening is de opgegeven reden voor de vertraging van twee weken, en het "trusted access"-programma suggereert dat sommige functies hoe dan ook worden afgeschermd.
• Of de cyberclaims standhouden buiten Z.ai's eigen testomgeving. De claim van 2.436 kwetsbaarheden in de echte wereld en de CyberGym-voorsprong zijn de cijfers die onafhankelijke laboratoria als eerste zullen onderzoeken; de AA Intelligence Index meet algemene capaciteiten, niet beveiliging.
• Waar de index terechtkomt zodra de gewichten zijn uitgebracht. De 60 wordt gescoord ten opzichte van de aangeboden API; de zelfgehoste versie, met een bijbehorende licentie, is de versie die teams daadwerkelijk opnieuw zullen implementeren.
• De aangekondigde prijsverhoging van DeepSeek V4 Flash, die het prijskader bepaalt waartegen GLM-5.3 wordt afgemeten, en de voorsprong van één punt van GPT-5.6 Sol op 61.
Veelgestelde vragen
Is GLM-5.3 een groter model dan GLM-5.2?
Nee. Z.ai zegt dat GLM-5.3 dezelfde 743-miljard-parameter Mixture-of-Experts-basis gebruikt als GLM-5.2, met hetzelfde contextvenster van 1M tokens en ongeveer 40 miljard actieve parameters per token. Alle gerapporteerde verbeteringen komen voort uit geschaalde post-training, niet uit een toename van parameters — wat direct het gerucht uit het lek-tijdperk corrigeert over een basis van meer dan een biljoen. Die architectuurclaim is van Z.ai zelf en is niet onafhankelijk gecontroleerd.
Wanneer zullen de open gewichten van GLM-5.3 beschikbaar zijn?
Vrijdag 28 augustus. Zhipu beloofde de gewichten "twee weken na release" toen het GLM-5.3 op 14 augustus aankondigde, en zei "volgende vrijdag" toen de API op 19 augustus live ging — beide lezingen komen op dezelfde datum uit. De licentie is nog niet bevestigd, en Z.ai heeft gezegd dat gevoelige cyberfuncties worden beperkt tot een programma voor "vertrouwde toegang" voor geverifieerde gebruikers.
Hoe moet ik de benchmarkcijfers behandelen?
Splits de lijst. De coding-sprongen — Terminal-Bench 3.0 op 28.3, DeepSWE v1.1 op 66.9, SWE-Marathon op 42.5 — en de cyberresultaten — CyberGym 84.5%, ExploitBench 54.4% — komen allemaal uit Z.ai's eigen aankondiging en blijven door de leverancier gerapporteerd totdat een onafhankelijke harness ze reproduceert. De Artificial Analysis Intelligence Index van 60 is de eerste onafhankelijke meting, en dat is het getal om af te wegen tegen alles wat Z.ai beweert.
De lek was echt, en de lancering bevestigde de naam, de framing en de timing — terwijl het juist dat ene specifieke detail corrigeerde waar de geruchtenmolen het luidst over was. GLM-5.3 is hetzelfde basismodel, stevig doorgetraind, en beschikt nu over een onafhankelijke score om de claims van de leverancier tegen af te wegen: 60 op de Artificial Analysis Intelligence Index, op gelijke hoogte met Kimi K3, zeven punten boven GLM-5.2. De codeer- en cybercijfers zijn nog steeds van Z.ai zelf, de gewichten verschijnen op 28 augustus, en de licentievoorwaarden en een werkelijk onafhankelijke toets van de beveiligingsclaims zijn wat er nog moet worden afgerond. Tot die tijd is de manier met het laagste risico om je eigen oordeel te vormen een deel van het echte verkeer en een failover naar iets beproefds.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
