Een titelkaart voor de vergelijking tussen GLM-5.3 en Kimi K3: een kleinere kubus aan de linkerkant met het label GLM-5.3 en daarbij '743B basis, post-getraind', en een grotere kubus aan de rechterkant met het label Kimi K3 en daarbij '2.8T basis, vanaf nul gebouwd'.
Guides & Insights

GLM-5.3 vs Kimi K3: Een 743B-basis uitknijpen of een 2.8T bouwen — Welke gok loont?

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De Chinese open-weights-race is zojuist gesplitst in twee antwoorden op dezelfde vraag. Moonshot AI bouwde Kimi K3 vanaf nul — een mixture-of-experts-basismodel met 2,8 biljoen parameters, het grootste open-weights-model ooit uitgebracht, aangekondigd op 16 juli 2026, waarna de gewichten op 27 juli volgden. G​LM-5.3 is de tegenovergestelde gok: Z.ai behield exact het basismodel van 743 miljard parameters dat GLM-5.2 aandreef en besteedde de hele releasecyclus aan post-training, met het argument dat het intelligentieplafond van het basismodel nooit het probleem was. Beide zijn vlaggenschepen met 1M-context, gericht op coding en agents, en beide beweren het beste open coding-model op de markt te zijn. Ze kunnen niet allebei de beste manier zijn om hetzelfde budget te besteden, en de benchmarks zijn werkelijk precies in tweeën verdeeld — wat dit minder tot een vergelijking maakt dan tot een referendum over hoe je het volgende frontier-model bouwt.

Twee weddenschappen over hoe je een grensverleggend model bouwt

Z.ai noemt G​LM-5.3 een "deep dig" in plaats van een generatie-upgrade. De basis is byte-voor-byte hetzelfde 743B-model als GLM-5.2; de delta zit volledig in de post-training, uitgevoerd via het open-source slime-framework op taken die hele engineeringsessies bestrijken — diagnosticeren, repareren, verifiëren en opleveren in echte clusters, opslagsystemen en codebases, waarvan sommige het werk van een senior engineer gedurende meerdere dagen vergen. De gerapporteerde winsten van de leverancier zijn groot: een sprong van 50% op zijn eigen Code Bench, Terminal-Bench 3.0 van 4.6 naar 28.3, DeepSWE v1.1 van 46.2 naar 66.9, en een cybercapaciteit die een veiligheidsbeoordeling heeft afgedwongen voordat de gewichten worden uitgebracht. Moonshot ging de andere kant op. Kimi K3 is een gloednieuwe basis — 2.8T totale parameters met ongeveer 104B actief per token (16 van de 896 experts), een Kimi Delta Attention-architectuur, native beeld- en video-invoer, een altijd actieve redenering die niet kan worden uitgeschakeld, en een contextvenster van 1M voor zowel invoer als uitvoer. Waar Z.ai erop gokt dat meer van hetzelfde model voldoende is, gokt Moonshot erop dat de basis zelf het plafond was.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

De onderlinge vergelijking, met herkomstinformatie erbij.

De enige plek waar beide modellen op dezelfde pagina verschijnen, is de eigen lanceertabel van Z.ai, dus daar komen de naast elkaar geplaatste cijfers vandaan — vermeld als door de leverancier gerapporteerd, niet onafhankelijk gecontroleerd. Kimi K3's op zichzelf staande cijfers komen overeen met wat Moonshot in juli publiceerde en wat Artificial Analysis meet, maar geen neutraal laboratorium heeft beide al getest.

Terminal-Bench 3.0 — G​LM-5.3 op 28,3 tegenover Kimi K3 op 17,4 (tabel van Z.ai). Het grootste codeerverschil in de onderlinge vergelijking, op de nieuwste en zwaarste versie.

Terminal-Bench 2.1 — G​LM-5.3 op 88.2 versus Kimi K3 op 88.3. Een nek-aan-nekrace.

DeepSWE v1.1GLM-5.3 op 66,9 tegenover Kimi K3 op 67,5. Kimi wint nipt.

SWE-Marathon v1.1 — G​LM-5.3 op 42,5 versus Kimi K3 op 48,1. Kimi's beste codeeroverwinning.

ExploitGym — G​LM-5.3 op 105/130 tegen Kimi K3 op 36/70. Een vrijwel totale zege voor G​LM.

GDPval-AA v2 (kenniswerk) — G​LM-5.3 op 1,769 versus Kimi K3 op 1,682.

Toegang — G​LM-5.3: Coding Plan-abonnement, gewichten vergrendeld tot ongeveer 28 augustus. Kimi K3: API live voor $3 / $15, gewichten downloadbaar sinds 27 juli.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

De beveiligingsgracht is de echte scheiding

Haal de codeerbenchmarks eraf en het doorslaggevende verschil is cybersecurity. G​LM-5.3 behaalt 84,5 op CyberGym tegenover 80,0 voor Kimi K3, en de ExploitBench-score van 54,4 is bijna het dubbele van de 32,2 van Kimi K3. Op ExploitGym is het gat geen verschil, maar een andere categorie — 105 en 130 tegenover 36 en 70 over de runs van 2 uur en 6 uur. Daarom voelen de twee lanceringen in de praktijk zo verschillend aan: de gewichten van Kimi K3 zijn openbaar beschikbaar onder een aangepaste MIT-licentie, terwijl die van G​LM-5.3 worden achtergehouden voor beveiligingsversteviging, juist omdat Z.ai zegt dat het model zo goed is in het vinden en misbruiken van kwetsbaarheden dat het direct uitbrengen van de gewichten onverantwoordelijk voelde. Als je werk bestaat uit het controleren van andermans code, of het verdedigen van je eigen code tegen geautomatiseerde kwetsbaarhedenjacht, is dit de meest relevante regel uit de hele vergelijking — en ook de minst onafhankelijk geverifieerde.

Waar Kimi K3 terugvecht

Kimi K3's overwinningen clusteren waar G​LM-5.3 het zwakst is: langetermijnwerk aan repositories. Het heeft de voorsprong op DeepSWE en SWE-Marathon, leidt op Toolathlon Verified, en het uitvoervenster van 1M tokens betekent dat het een volledige codebase of een lange agent-trace in één keer kan schrijven. De altijd actieve redenering streamt de volledige trace naar de API, wat ontwikkelaars veel nuttiger hebben genoemd voor het debuggen van agents dan ondoorzichtige samenvattende uitleg — met de operationele kanttekening dat je de redeneervelden woordelijk moet teruggeven bij toolcalls, en dat er geen assistant-prefill is. Op de Intelligence Index van Artificial Analysis staat Kimi K3 op 57, vierde overall, met ruwweg $0,94 kosten per taak, gemeten op de standaardset. Het is ook het duurste model dat een Chinees lab heeft uitgebracht: $3 per miljoen inputtokens en $15 per miljoen output, prijzen op Sonnet-niveau, terwijl G​LM-5.3 nog helemaal niet per token geprijsd kan worden, omdat het alleen binnen een abonnementsplan bestaat.

De realiteit van toegang en kosten

Kimi K3 staat nu op OrcaRouter tegen Moonshot's eigen adviesprijs — $3 / $15 per miljoen tokens, $0.30 voor gecachte reads, 0% opslag — dus het agentwerk met 1M-context is aanroepbaar met dezelfde sleutel als de rest van je stack, en de open weights zijn de exit-optie als je zelf wilt hosten. G​LM-5.3 is degene die moeilijk te krijgen is: een maandabonnement van $18 tot $168 met een puntensysteem dat credits verbruikt tegen 6.9x op invoer en 24x op uitvoer, off-piekprijzen die het verbruik halveren buiten 14:00–18:00 China-tijd, en geen per-token API totdat de veiligheidsreview is afgerond. De routinglaag vlakt deze asymmetrie feitelijk af voor het venster van twee weken: wanneer de API van G​LM-5.3 op dezelfde sleutel terechtkomt, kan een panelaanroep beide open-coding-vlaggenschepen op je eigen taken loslaten en de rechter ze laten verzoenen — en als je niet kunt wachten, maken de al geleverde gewichten van Kimi K3 het de enige van de twee die je vandaag volledig on-premises kunt nemen.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

Welke weddenschap betaalt uit?

Het eerlijke oordeel na één week is dat beide weddenschappen zich uitbetalen, maar bij verschillende workloads. Als je werk terminal-intensief, beveiligingsgerelateerd en agent-georkestreerd is, is G​LM-5.3 de sterkere richting op basis van het bewijs dat Z.ai heeft gepubliceerd — en de cybersecurity-kloof is groot genoeg dat het de moeite waard is om twee weken te wachten op de gewichten om het zelf te controleren. Als je werk lange repository-sessies, multimodale invoer of iets anders omvat waarbij je de gewichten vandaag nog in handen moet hebben, is Kimi K3 de enige van de twee die daadwerkelijk beschikbaar is — en de deep-repo-winsten kun je nu direct verifiëren via de live API. Het enige om scherp te houden: elk getal in de head-to-head van deze vergelijking komt uit Z.ai's eigen tabel, dus behandel de codeer-verschillen als richtinggevend totdat een onafhankelijk lab beide heeft gedraaid. Dat is precies het soort verificatie dat de wachttijd van twee weken zal brengen.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube