
GLM-5.3 vs Kimi K3: Een 743B-basis uitknijpen of een 2.8T bouwen — Welke gok loont?
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0455Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0247Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0247Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0157Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2646Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1541Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1251Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0547Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligentie49Coderen
De Chinese open-weights-race is zojuist gesplitst in twee antwoorden op dezelfde vraag. Moonshot AI bouwde Kimi K3 vanaf nul — een mixture-of-experts-basismodel met 2,8 biljoen parameters, het grootste open-weights-model ooit uitgebracht, aangekondigd op 16 juli 2026, waarna de gewichten op 27 juli volgden. GLM-5.3 is de tegenovergestelde gok: Z.ai behield exact het basismodel van 743 miljard parameters dat GLM-5.2 aandreef en besteedde de hele releasecyclus aan post-training, met het argument dat het intelligentieplafond van het basismodel nooit het probleem was. Beide zijn vlaggenschepen met 1M-context, gericht op coding en agents, en beide beweren het beste open coding-model op de markt te zijn. Ze kunnen niet allebei de beste manier zijn om hetzelfde budget te besteden, en de benchmarks zijn werkelijk precies in tweeën verdeeld — wat dit minder tot een vergelijking maakt dan tot een referendum over hoe je het volgende frontier-model bouwt.
Twee weddenschappen over hoe je een grensverleggend model bouwt
Z.ai noemt GLM-5.3 een "deep dig" in plaats van een generatie-upgrade. De basis is byte-voor-byte hetzelfde 743B-model als GLM-5.2; de delta zit volledig in de post-training, uitgevoerd via het open-source slime-framework op taken die hele engineeringsessies bestrijken — diagnosticeren, repareren, verifiëren en opleveren in echte clusters, opslagsystemen en codebases, waarvan sommige het werk van een senior engineer gedurende meerdere dagen vergen. De gerapporteerde winsten van de leverancier zijn groot: een sprong van 50% op zijn eigen Code Bench, Terminal-Bench 3.0 van 4.6 naar 28.3, DeepSWE v1.1 van 46.2 naar 66.9, en een cybercapaciteit die een veiligheidsbeoordeling heeft afgedwongen voordat de gewichten worden uitgebracht. Moonshot ging de andere kant op. Kimi K3 is een gloednieuwe basis — 2.8T totale parameters met ongeveer 104B actief per token (16 van de 896 experts), een Kimi Delta Attention-architectuur, native beeld- en video-invoer, een altijd actieve redenering die niet kan worden uitgeschakeld, en een contextvenster van 1M voor zowel invoer als uitvoer. Waar Z.ai erop gokt dat meer van hetzelfde model voldoende is, gokt Moonshot erop dat de basis zelf het plafond was.

De onderlinge vergelijking, met herkomstinformatie erbij.
De enige plek waar beide modellen op dezelfde pagina verschijnen, is de eigen lanceertabel van Z.ai, dus daar komen de naast elkaar geplaatste cijfers vandaan — vermeld als door de leverancier gerapporteerd, niet onafhankelijk gecontroleerd. Kimi K3's op zichzelf staande cijfers komen overeen met wat Moonshot in juli publiceerde en wat Artificial Analysis meet, maar geen neutraal laboratorium heeft beide al getest.
• Terminal-Bench 3.0 — GLM-5.3 op 28,3 tegenover Kimi K3 op 17,4 (tabel van Z.ai). Het grootste codeerverschil in de onderlinge vergelijking, op de nieuwste en zwaarste versie.
• Terminal-Bench 2.1 — GLM-5.3 op 88.2 versus Kimi K3 op 88.3. Een nek-aan-nekrace.
• DeepSWE v1.1 — GLM-5.3 op 66,9 tegenover Kimi K3 op 67,5. Kimi wint nipt.
• SWE-Marathon v1.1 — GLM-5.3 op 42,5 versus Kimi K3 op 48,1. Kimi's beste codeeroverwinning.
• ExploitGym — GLM-5.3 op 105/130 tegen Kimi K3 op 36/70. Een vrijwel totale zege voor GLM.
• GDPval-AA v2 (kenniswerk) — GLM-5.3 op 1,769 versus Kimi K3 op 1,682.
• Toegang — GLM-5.3: Coding Plan-abonnement, gewichten vergrendeld tot ongeveer 28 augustus. Kimi K3: API live voor $3 / $15, gewichten downloadbaar sinds 27 juli.

De beveiligingsgracht is de echte scheiding
Haal de codeerbenchmarks eraf en het doorslaggevende verschil is cybersecurity. GLM-5.3 behaalt 84,5 op CyberGym tegenover 80,0 voor Kimi K3, en de ExploitBench-score van 54,4 is bijna het dubbele van de 32,2 van Kimi K3. Op ExploitGym is het gat geen verschil, maar een andere categorie — 105 en 130 tegenover 36 en 70 over de runs van 2 uur en 6 uur. Daarom voelen de twee lanceringen in de praktijk zo verschillend aan: de gewichten van Kimi K3 zijn openbaar beschikbaar onder een aangepaste MIT-licentie, terwijl die van GLM-5.3 worden achtergehouden voor beveiligingsversteviging, juist omdat Z.ai zegt dat het model zo goed is in het vinden en misbruiken van kwetsbaarheden dat het direct uitbrengen van de gewichten onverantwoordelijk voelde. Als je werk bestaat uit het controleren van andermans code, of het verdedigen van je eigen code tegen geautomatiseerde kwetsbaarhedenjacht, is dit de meest relevante regel uit de hele vergelijking — en ook de minst onafhankelijk geverifieerde.
Waar Kimi K3 terugvecht
Kimi K3's overwinningen clusteren waar GLM-5.3 het zwakst is: langetermijnwerk aan repositories. Het heeft de voorsprong op DeepSWE en SWE-Marathon, leidt op Toolathlon Verified, en het uitvoervenster van 1M tokens betekent dat het een volledige codebase of een lange agent-trace in één keer kan schrijven. De altijd actieve redenering streamt de volledige trace naar de API, wat ontwikkelaars veel nuttiger hebben genoemd voor het debuggen van agents dan ondoorzichtige samenvattende uitleg — met de operationele kanttekening dat je de redeneervelden woordelijk moet teruggeven bij toolcalls, en dat er geen assistant-prefill is. Op de Intelligence Index van Artificial Analysis staat Kimi K3 op 57, vierde overall, met ruwweg $0,94 kosten per taak, gemeten op de standaardset. Het is ook het duurste model dat een Chinees lab heeft uitgebracht: $3 per miljoen inputtokens en $15 per miljoen output, prijzen op Sonnet-niveau, terwijl GLM-5.3 nog helemaal niet per token geprijsd kan worden, omdat het alleen binnen een abonnementsplan bestaat.
De realiteit van toegang en kosten
Kimi K3 staat nu op OrcaRouter tegen Moonshot's eigen adviesprijs — $3 / $15 per miljoen tokens, $0.30 voor gecachte reads, 0% opslag — dus het agentwerk met 1M-context is aanroepbaar met dezelfde sleutel als de rest van je stack, en de open weights zijn de exit-optie als je zelf wilt hosten. GLM-5.3 is degene die moeilijk te krijgen is: een maandabonnement van $18 tot $168 met een puntensysteem dat credits verbruikt tegen 6.9x op invoer en 24x op uitvoer, off-piekprijzen die het verbruik halveren buiten 14:00–18:00 China-tijd, en geen per-token API totdat de veiligheidsreview is afgerond. De routinglaag vlakt deze asymmetrie feitelijk af voor het venster van twee weken: wanneer de API van GLM-5.3 op dezelfde sleutel terechtkomt, kan een panelaanroep beide open-coding-vlaggenschepen op je eigen taken loslaten en de rechter ze laten verzoenen — en als je niet kunt wachten, maken de al geleverde gewichten van Kimi K3 het de enige van de twee die je vandaag volledig on-premises kunt nemen.

Welke weddenschap betaalt uit?
Het eerlijke oordeel na één week is dat beide weddenschappen zich uitbetalen, maar bij verschillende workloads. Als je werk terminal-intensief, beveiligingsgerelateerd en agent-georkestreerd is, is GLM-5.3 de sterkere richting op basis van het bewijs dat Z.ai heeft gepubliceerd — en de cybersecurity-kloof is groot genoeg dat het de moeite waard is om twee weken te wachten op de gewichten om het zelf te controleren. Als je werk lange repository-sessies, multimodale invoer of iets anders omvat waarbij je de gewichten vandaag nog in handen moet hebben, is Kimi K3 de enige van de twee die daadwerkelijk beschikbaar is — en de deep-repo-winsten kun je nu direct verifiëren via de live API. Het enige om scherp te houden: elk getal in de head-to-head van deze vergelijking komt uit Z.ai's eigen tabel, dus behandel de codeer-verschillen als richtinggevend totdat een onafhankelijk lab beide heeft gedraaid. Dat is precies het soort verificatie dat de wachttijd van twee weken zal brengen.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
