Een hero-titelkaart voor GLM-5.2 vs Kimi K3 met de ondertitel 'Goedkoper en sneller, of groter en beter', drie afgeronde pilvormige badges met de tekst 'elk 1M token context', 'AA Index 34 vs 44' en '$1.40 / $4.40 vs $3.00 / $15.00', een voettekstregel met 'Leverancierstarieven en Artificial Analysis, 2026-09-23', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

GLM-5.2 vs Kimi K3: Goedkoper en sneller, of groter en beter

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

GLM-5.2 en Kimi K3 verschenen in het midden van 2026 met een maand tussenruimte en zijn bijna perfect elkaars tegenpool. Kimi K3, uitgebracht op 2026-07-16, met de open weights die op 2026-07-27 volgden, is het grootste en op papier het betere model: 2,8 biljoen parameters, waarvan 104 miljard actief, en de hoogste score op vrijwel elke benchmark waarmee de twee zijn vergeleken. GLM-5.2 is al sinds 2026-06-16 beschikbaar, is met 753 miljard parameters waarvan 40 miljard actief de kleinere van de twee, kost per outputtoken ongeveer een derde, antwoordt bij de mediaan sneller en wordt uitgebracht onder MIT in plaats van een licentie op maat met omzetdrempels.

Dat is de beslissing in één alinea. Wat volgt is het bewijs erachter — de prijsberekening voor een klus die je misschien daadwerkelijk zou uitvoeren, de metingen waarbij de twee zo dicht bij elkaar liggen dat het verschil ruis is, en één populair getal dat niet vergelijkbaar is met het getal dat ernaast staat afgedrukt.

Waar de twee staan

Beide zijn over het algemeen beschikbaar via de eigen API's van hun leveranciers, beide zijn routeerbaar op OrcaRouter, en beide hebben downloadbare gewichten. De verschillen die van belang zijn voordat je ook maar in de buurt van een benchmark komt:

• Uitgebracht — GLM-5.2 op 2026-06-16 vs Kimi K3 op 2026-07-16 (modelpagina's van Artificial Analysis; OrcaRouter's eigen modelpagina voor Kimi K3 dateert het een dag eerder, 2026-07-15)

• Gewichten — GLM-5.2 open onder MIT vs. Kimi K3 open onder de Kimi K3 License, die een aparte overeenkomst vereist boven $20M jaarlijkse omzet uit model-as-a-service en prominente naamsvermelding boven 100M maandelijkse gebruikers (intern onderzoek en ontwikkeling is vrijgesteld)

• Grootte — GLM-5.2 753B totaal / 40B actief vs Kimi K3 2,8T totaal / 104B actief

• Context — GLM-5.2 1.000.000 tokens vs Kimi K3 1.048.576 tokens

• Invoer — GLM-5.2 tekst in, tekst uit vs Kimi K3 tekst en afbeeldingen in, tekst uit

• Gepubliceerde maximale output — GLM-5.2 128.000 tokens vs. niet gepubliceerd op de OrcaRouter-pagina van Kimi K3

Op OrcaRouter zitten beide achter één sleutel op één OpenAI-compatibel endpoint op https://api.orcarouter.ai/v1, en we geven de lijstprijs van de provider rechtstreeks door zonder dat er markup wordt toegevoegd — dus elk bedrag hieronder is het bedrag van de leverancier, niet het onze.

Wat een miljoen tokens kost, voor een klus die wat kost

Eerst de tariefkaarten van de leveranciers, afgelezen van de eigen prijspagina's van de leveranciers op 2026-09-23. Z.ai vermeldt GLM-5.2 tegen $1,40 per miljoen inputtokens, $0,26 per miljoen gecachte inputtokens, en $4,40 per miljoen outputtokens. Moonshot vermeldt Kimi K3 tegen $3,00 input, $0,30 cache-lezen, $15,00 output — plus een cacheschrijftoeslag van $3,00 per miljoen voor een cache van vijf minuten en $6,00 per miljoen voor een cache van een uur. Dat zijn gepubliceerde prijzen, geen onafhankelijk gecontroleerde, en beide leveranciers kunnen ze wijzigen.

Zet ze op een taak die grotendeels uit lezen bestaat: een review van een codebase van 600.000 tokens met een geschreven antwoord van 8.000 tokens. Bij GLM-5.2 is dat 0,6 x $1,40 = $0,84 aan invoer plus 0,008 x $4,40 = $0,035 aan uitvoer, of ongeveer $0,88. Bij Kimi K3 is dat 0,6 x $3,00 = $1,80 plus 0,008 x $15,00 = $0,12, of ongeveer $1,92. Ongeveer 2,2 keer de kosten voor dezelfde taak.

Voer het nu opnieuw uit terwijl de codebase al in de cache van de provider staat. De inputregel valt terug naar het cache-leestarief, en de twee prijzen die 2,1x uit elkaar lagen, worden $0,26 tegen $0,30 per miljoen — een verschil van 15%. Dit is het minst besproken cijfer in de vergelijking en het cijfer dat het meest uitmaakt voor een agent die elke beurt dezelfde context opnieuw leest. Er zit ook een asterisk bij: Kimi K3 factureert apart voor het schrijven van de cache en de pagina van GLM-5.2 vermeldt helemaal geen schrijftarief, dus een koude start kost op Kimi K3 aanzienlijk meer dan de $3,00-headline suggereert.

• Een read van 600k tokens met een 8k-antwoord — GLM-5.2 ongeveer $0,88 vs Kimi K3 ongeveer $1,92

• Dezelfde regel voor gecachte invoer — GLM-5.2 $0,16 vs. Kimi K3 $0,18 per 600k tokens

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Het onafhankelijke model is het eens over de richting, maar niet over de omvang. Artificial Analysis mengt cache-hit-, input- en outputtokens in een verhouding van 7:2:1 en telt de reasoning-tokens mee die een model daadwerkelijk verbruikt, en zijn cijfers voor deze twee — afgelezen op 2026-09-23 onder zijn v4.3.2-index — plaatsen GLM-5.2 op $0,902 per miljoen gemengde tokens tegenover $2,31 voor Kimi K3, en de kosten voor het voltooien van een van zijn evaluatietaken op $0,96 tegenover $2,00. Het één keer draaien van de volledige Intelligence Index kost $1.559 op GLM-5.2 en $3.658 op Kimi K3.

In dat kostenmodel schuilt een contra-intuïtief detail. Kimi K3 gebruikt minder outputtokens per taak dan GLM-5.2 — 48.000 tegenover 64.000 — en minder redeneertokens, 32.000 tegenover 51.000. Het is het zuinigere model per eenheid werk en kost toch ruwweg twee keer zoveel per taak, omdat de prijs per token 2,1x hoger is voor invoer en 3,4x voor uitvoer. Goedkoop per taak en goedkoop per token zijn verschillende eigenschappen, en dit is een combinatie waarbij ze in tegengestelde richtingen wijzen.

Het contextvenster, en wat er daadwerkelijk in past

Op papier liggen de twee binnen 5% van elkaar: 1.000.000 tokens tegenover 1.048.576. Het zou onnozel zijn om dat als een overwinning voor Kimi K3 te rapporteren. Het zijn beide modellen met een miljoen tokens en het venster is geen onderscheidende factor; de eerlijke vraag is wat elk ervan nog kan met tekst die in het midden begraven zit.

Dat is wat de lang-context-redeneerevaluatie van Artificial Analysis meet, en het is een van de grotere verschillen in de dataset: Kimi K3 scoort 89% tegenover de 78% van GLM-5.2. Als het je taak is een groot corpus te laden en vragen te stellen waarbij je feiten van tegenoverliggende uiteinden ervan moet samenbrengen, zijn de extra 48.576 tokens niet de reden om Kimi K3 te kiezen — de elfpuntsmarge op lange context is dat wel.

De ondergrens onder het venster verschilt ook. GLM-5.2 publiceert een maximale output van 128.000 tokens; op de pagina van Kimi K3 staat geen equivalent cijfer, dus wij leveren er geen. Als je lange documenten genereert in plaats van ze te lezen, is het de moeite waard om die asymmetrie af te zetten tegen je eigen werklast voordat je een van beide koopt.

Snelheid: de enige dimensie die GLM-5.2 onbetwist beheerst

Twee onafhankelijke metingen wijzen hier dezelfde kant op, wat juist het vermelden waard is omdat ze het niet op alles eens zijn.

Onze eigen routeringsgegevens, over de zeven dagen tot 2026-09-23, tonen dat GLM-5.2 antwoordt met een mediaan van 3,28 seconden tot het eerste token tegenover 8,09 seconden voor Kimi K3, en streamt met 68,1 tokens per seconde tegenover 43,4. De p95-tijd tot het eerste token van beide modellen ligt op precies 10,00 seconden. Artificial Analysis, dat afzonderlijk meet, heeft GLM-5.2 op 68,2 outputtokens per seconde tegenover 36,7 voor Kimi K3, op 41,29 seconden end-to-end tegenover 72,13, en op 33,95 seconden tot het eerste antwoord tegenover 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

De twee bronnen verschillen op één punt, en dat is het vermelden waard in plaats van het weg te poetsen. Artificial Analysis plaatst Kimi K3 iets voorop wat de ruwe tijd tot het eerste token betreft, 4,08 seconden tegenover 4,62, terwijl onze eigen routering GLM-5.2 bij p50 bijna tweeënhalf keer sneller laat zijn. Verschillende endpoints, verschillende upstreamproviders, verschillende periodes. Beschouw de doorvoerrichting — GLM-5.2 ruim sneller — als solide, en beschouw elk afzonderlijk cijfer voor de tijd tot het eerste token, het onze of het hunne, als een eigenschap van een bepaalde week.

Er staat ook een cijfer op onze GLM-5.2-pagina dat we niet stilletjes zullen weglaten: over dezelfde zeven dagen laat het een foutpercentage van 9,2% zien, tegenover 0,26% voor Kimi K3. Een verschil van die omvang is ongeveer even waarschijnlijk toe te schrijven aan een slechte week voor de upstreamproviders die GLM-5.2 bedienen als aan een eigenschap van het model, en zeven dagen is geen lang genoeg venster om het verschil te kunnen vaststellen. Het is het soort probleem dat routing bestaat om op te lossen — wanneer een provider één op de elf verzoeken laat mislukken, verplaatst automatische failover het verkeer zonder dat iemand de on-call hoeft te alarmeren.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarks: een echte sweep, smaller dan de kop.

Kimi K3 wint bijna alles waarop beide modellen zijn getest. Dit zijn cijfers van Artificial Analysis onder indexrevisie v4.3.2, beide modellen in hun maximale redeneerconfiguratie, afgelezen op 2026-09-23:

• Intelligentie-index — Kimi K3 44 vs GLM-5.2 34

• AA-Briefcase v1.1 — 1510 vs 1233

• GDPval-AA v2.1 — 1524 vs 1358

• AutomationBench-AA — 58% vs 28%

• Terminal-Bench 4.0 — 13% vs 1%

• SciCode — 59% vs 51%

• Humanity's Last Exam — 47% vs 41%

• GDP.pdf — 22% vs 10%

• AA-LCR v1.1 — 89% vs 78%

• CritPt — 23% vs 21%

Twee kanttekeningen voordat iemand een screenshot van die lijst maakt.

Eerst de indexherziening. De berichtgeving over de juli-lancering van Kimi K3 citeerde 57 op de Intelligence Index, met GLM-5.2 op 51. De live pagina's van vandaag zeggen 44 en 34. Dat is niet dezelfde meting — Artificial Analysis herziet de index en herberekent de scores van modellen daartegen, en een juli-cijfer naast een september-cijfer zetten is de gemakkelijkste fout die je bij deze combinatie kunt maken. De richting is stabiel in elke snapshot; de absolute cijfers zijn niet vergelijkbaar tussen revisies.

Ten tweede, de niveaus. Terminal-Bench 4.0 met 13% en 1% is een zware evaluatie, en op dat niveau zegt de verhouding meer dan elk van beide cijfers. AA-Omniscience, dat onderzoekt of een model de grenzen van zijn eigen kennis kent, zet GLM-5.2 op 4 tegenover de 20 van Kimi K3 — een ondergrens waarvan je op de hoogte wilt zijn als je van plan bent een van beide zonder toezicht te draaien.

Nog één ding dat Artificial Analysis over de GLM-5.2-vermelding noteert: het markeert de configuratie voor maximaal redeneren als verouderd ten gunste van de nieuwere GLM-5.3. Dat verandert niets aan de cijfers hierboven, die een momentopname zijn van GLM-5.2 zoals het werd gemeten, maar het betekent wel dat de roadmap van Z.ai dit model inmiddels voorbij is. Op een routed endpoint kost dat een modelstring in plaats van een migratie, wat het belangrijkste argument is om geen van beide namen hard te coderen in je applicatie.

Agents en toolgebruik: waar de kloof het grootst is

Als één blok van die tabel de aankoop zou moeten bepalen, is het dit. Langetermijn-agentisch werk is waar de voorsprong van Kimi K3 het grootst en meest consistent is:

• AutomationBench-AA — 58% vs. 28%, een verschil van 30 punten

• GDPval-AA v2.1 — 1524 vs 1358

• AA-Briefcase v1.1 — 1510 vs 1233

• Terminal-Bench 4.0 — 13% vs 1%

Moonshots eigen releasemateriaal leunt op hetzelfde verhaal — de release van de K3-gewichten ging vergezeld van een technisch rapport over de expert-parallelle trainingsstack van de leverancier en een harness voor agent-omgevingen — maar leveranciersmateriaal is leveranciersmateriaal, en de cijfers hierboven zijn de onafhankelijke.

De externe aggregator LLM Stats, die zijn eigen samengestelde score over een gedeelde benchmarkset berekent, komt vanuit een andere richting tot dezelfde conclusie: van de elf benchmarks die hij voor beide modellen scoort, wint Kimi K3 ze alle elf, en zijn categoriescores zetten Kimi K3 voorop bij toolgebruik (30,8 vs 19,6), agents (38,3 vs 29,6) en coderen (42,3 vs 34,8). Dat zijn de eigen samengestelde scores van LLM Stats volgens zijn eigen weging, op een gedeelde set die niet groot is, dus beschouw ze als bevestiging en niet als een labresultaat. Elf van de elf is nog steeds geen nek-aan-nekrace.

Coderen

Dezelfde richting, kleinere marge. Op de code-evaluaties die Artificial Analysis voor beide beoordeelt, leidt Kimi K3 op SciCode met 59% tegen 51%; op de gedeelde set van LLM Stats wint het DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench en Terminal-Bench 2.1. De flatteuze cijfers van GLM-5.2 — 99,2% op AIME 2026, 94,4% op HMMT 2025, 91,2% op GPQA zoals overgenomen door aggregators van derden — zijn door de leverancier gerapporteerd en niet gereproduceerd, en de meeste ervan meten wedstrijdwiskunde in plaats van software-engineering.

De praktische interpretatie: voor een codeeragent die lang draait, veel bestanden bewerkt en zich van zijn eigen fouten moet herstellen, is de agentische marge van Kimi K3 een relevanter signaal dan de wiskundescores van beide modellen. Voor een snelle, goedkope codeassistent die grotendeels in één keer werkt, is het doorvoervoordeel van GLM-5.2 meer waard dan de kosten van de benchmarkkloof.

Waar ze dicht genoeg bij elkaar liggen dat het er niet toe doet

• Prijs van gecachte input — $0,26 vs $0,30 per miljoen, een verschil van 15% tegenover een verschil van 3,4x bij output

• Contextvenster — 1.000.000 vs 1.048.576 tokens

• p95 tijd tot eerste token — 10,00 s vs 10,00 s op onze eigen routing

• CritPt — 23% vs 21%

• Wiskunde — LLM Stats zet GLM-5.2 marginaal voorop op zijn samengestelde wiskundescore (41,4 vs 40,9), terwijl Kimi K3 leidt bij wiskunde met afbeeldingen; op basis van het beschikbare bewijs beheerst geen van beide modellen het rekenen.

Iedereen die je vertelt dat een van deze modellen op alle fronten twee keer zo goed is als het andere, leest slechts één rij van de tabel.

Kies GLM-5.2 als…

Je betaalt de rekening, en de rekening is de beperkende factor. GLM-5.2 kost ongeveer een derde van de outputprijs, is ook goedkoper op de cachelijn, is MIT-gelicentieerd zonder omzettrigger om aan te toetsen, is sneller in de mediaan en veel sneller bij streaming, en zijn miljoen-tokenvenster ligt dicht genoeg bij dat van Kimi K3 dat het verschil nooit ergens de doorslag zal geven. Als je workload tekst in en tekst uit is, en het vooral om lezen gaat in plaats van lange ketens van toolaanroepen, dan zijn de extra benchmarkpunten op Kimi K3 punten die je applicatie nooit zal scoren.

Kies Kimi K3 als…

Het werk is agentisch en langdurig. De kloof van 30 punten op AutomationBench, de voorsprongen op GDPval en AA-Briefcase, de marge van elf punten bij redeneren met een lange context en de volledige overwinning op de gedeelde set van LLM Stats wijzen allemaal in dezelfde richting: Kimi K3 is het betere model om een taak met meerdere stappen aan toe te vertrouwen en er niet meer naar om te kijken. Het is ook de enige van de twee die afbeeldingen accepteert. Daarvoor betaal je per taak ongeveer twee keer zoveel, en als je werkset zwaar gecachet is, betaal je minder dan twee keer zoveel — maar het argument ervoor is niet de prijs, en ook niet de snelheid.

Beide zijn routeerbaar op OrcaRouter met één sleutel tegen één OpenAI-compatibel endpoint, tegen de lijstprijzen van de providers, zonder dat er iets bovenop komt, en beide zitten achter dezelfde automatische failover. Dat is de goedkoopste manier om erachter te komen welke je workload eigenlijk wil, want wisselen tussen de twee is een modelstring en geen contract.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt