
GLM-5.2 vs Kimi K3: Goedkoper en sneller, of groter en beter
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 en Kimi K3 verschenen in het midden van 2026 met een maand tussenruimte en zijn bijna perfect elkaars tegenpool. Kimi K3, uitgebracht op 2026-07-16, met de open weights die op 2026-07-27 volgden, is het grootste en op papier het betere model: 2,8 biljoen parameters, waarvan 104 miljard actief, en de hoogste score op vrijwel elke benchmark waarmee de twee zijn vergeleken. GLM-5.2 is al sinds 2026-06-16 beschikbaar, is met 753 miljard parameters waarvan 40 miljard actief de kleinere van de twee, kost per outputtoken ongeveer een derde, antwoordt bij de mediaan sneller en wordt uitgebracht onder MIT in plaats van een licentie op maat met omzetdrempels.
Dat is de beslissing in één alinea. Wat volgt is het bewijs erachter — de prijsberekening voor een klus die je misschien daadwerkelijk zou uitvoeren, de metingen waarbij de twee zo dicht bij elkaar liggen dat het verschil ruis is, en één populair getal dat niet vergelijkbaar is met het getal dat ernaast staat afgedrukt.
Waar de twee staan
Beide zijn over het algemeen beschikbaar via de eigen API's van hun leveranciers, beide zijn routeerbaar op OrcaRouter, en beide hebben downloadbare gewichten. De verschillen die van belang zijn voordat je ook maar in de buurt van een benchmark komt:
• Uitgebracht — GLM-5.2 op 2026-06-16 vs Kimi K3 op 2026-07-16 (modelpagina's van Artificial Analysis; OrcaRouter's eigen modelpagina voor Kimi K3 dateert het een dag eerder, 2026-07-15)
• Gewichten — GLM-5.2 open onder MIT vs. Kimi K3 open onder de Kimi K3 License, die een aparte overeenkomst vereist boven $20M jaarlijkse omzet uit model-as-a-service en prominente naamsvermelding boven 100M maandelijkse gebruikers (intern onderzoek en ontwikkeling is vrijgesteld)
• Grootte — GLM-5.2 753B totaal / 40B actief vs Kimi K3 2,8T totaal / 104B actief
• Context — GLM-5.2 1.000.000 tokens vs Kimi K3 1.048.576 tokens
• Invoer — GLM-5.2 tekst in, tekst uit vs Kimi K3 tekst en afbeeldingen in, tekst uit
• Gepubliceerde maximale output — GLM-5.2 128.000 tokens vs. niet gepubliceerd op de OrcaRouter-pagina van Kimi K3
Op OrcaRouter zitten beide achter één sleutel op één OpenAI-compatibel endpoint op https://api.orcarouter.ai/v1, en we geven de lijstprijs van de provider rechtstreeks door zonder dat er markup wordt toegevoegd — dus elk bedrag hieronder is het bedrag van de leverancier, niet het onze.
Wat een miljoen tokens kost, voor een klus die wat kost
Eerst de tariefkaarten van de leveranciers, afgelezen van de eigen prijspagina's van de leveranciers op 2026-09-23. Z.ai vermeldt GLM-5.2 tegen $1,40 per miljoen inputtokens, $0,26 per miljoen gecachte inputtokens, en $4,40 per miljoen outputtokens. Moonshot vermeldt Kimi K3 tegen $3,00 input, $0,30 cache-lezen, $15,00 output — plus een cacheschrijftoeslag van $3,00 per miljoen voor een cache van vijf minuten en $6,00 per miljoen voor een cache van een uur. Dat zijn gepubliceerde prijzen, geen onafhankelijk gecontroleerde, en beide leveranciers kunnen ze wijzigen.
Zet ze op een taak die grotendeels uit lezen bestaat: een review van een codebase van 600.000 tokens met een geschreven antwoord van 8.000 tokens. Bij GLM-5.2 is dat 0,6 x $1,40 = $0,84 aan invoer plus 0,008 x $4,40 = $0,035 aan uitvoer, of ongeveer $0,88. Bij Kimi K3 is dat 0,6 x $3,00 = $1,80 plus 0,008 x $15,00 = $0,12, of ongeveer $1,92. Ongeveer 2,2 keer de kosten voor dezelfde taak.
Voer het nu opnieuw uit terwijl de codebase al in de cache van de provider staat. De inputregel valt terug naar het cache-leestarief, en de twee prijzen die 2,1x uit elkaar lagen, worden $0,26 tegen $0,30 per miljoen — een verschil van 15%. Dit is het minst besproken cijfer in de vergelijking en het cijfer dat het meest uitmaakt voor een agent die elke beurt dezelfde context opnieuw leest. Er zit ook een asterisk bij: Kimi K3 factureert apart voor het schrijven van de cache en de pagina van GLM-5.2 vermeldt helemaal geen schrijftarief, dus een koude start kost op Kimi K3 aanzienlijk meer dan de $3,00-headline suggereert.
• Een read van 600k tokens met een 8k-antwoord — GLM-5.2 ongeveer $0,88 vs Kimi K3 ongeveer $1,92
• Dezelfde regel voor gecachte invoer — GLM-5.2 $0,16 vs. Kimi K3 $0,18 per 600k tokens

Het onafhankelijke model is het eens over de richting, maar niet over de omvang. Artificial Analysis mengt cache-hit-, input- en outputtokens in een verhouding van 7:2:1 en telt de reasoning-tokens mee die een model daadwerkelijk verbruikt, en zijn cijfers voor deze twee — afgelezen op 2026-09-23 onder zijn v4.3.2-index — plaatsen GLM-5.2 op $0,902 per miljoen gemengde tokens tegenover $2,31 voor Kimi K3, en de kosten voor het voltooien van een van zijn evaluatietaken op $0,96 tegenover $2,00. Het één keer draaien van de volledige Intelligence Index kost $1.559 op GLM-5.2 en $3.658 op Kimi K3.
In dat kostenmodel schuilt een contra-intuïtief detail. Kimi K3 gebruikt minder outputtokens per taak dan GLM-5.2 — 48.000 tegenover 64.000 — en minder redeneertokens, 32.000 tegenover 51.000. Het is het zuinigere model per eenheid werk en kost toch ruwweg twee keer zoveel per taak, omdat de prijs per token 2,1x hoger is voor invoer en 3,4x voor uitvoer. Goedkoop per taak en goedkoop per token zijn verschillende eigenschappen, en dit is een combinatie waarbij ze in tegengestelde richtingen wijzen.
Het contextvenster, en wat er daadwerkelijk in past
Op papier liggen de twee binnen 5% van elkaar: 1.000.000 tokens tegenover 1.048.576. Het zou onnozel zijn om dat als een overwinning voor Kimi K3 te rapporteren. Het zijn beide modellen met een miljoen tokens en het venster is geen onderscheidende factor; de eerlijke vraag is wat elk ervan nog kan met tekst die in het midden begraven zit.
Dat is wat de lang-context-redeneerevaluatie van Artificial Analysis meet, en het is een van de grotere verschillen in de dataset: Kimi K3 scoort 89% tegenover de 78% van GLM-5.2. Als het je taak is een groot corpus te laden en vragen te stellen waarbij je feiten van tegenoverliggende uiteinden ervan moet samenbrengen, zijn de extra 48.576 tokens niet de reden om Kimi K3 te kiezen — de elfpuntsmarge op lange context is dat wel.
De ondergrens onder het venster verschilt ook. GLM-5.2 publiceert een maximale output van 128.000 tokens; op de pagina van Kimi K3 staat geen equivalent cijfer, dus wij leveren er geen. Als je lange documenten genereert in plaats van ze te lezen, is het de moeite waard om die asymmetrie af te zetten tegen je eigen werklast voordat je een van beide koopt.
Snelheid: de enige dimensie die GLM-5.2 onbetwist beheerst
Twee onafhankelijke metingen wijzen hier dezelfde kant op, wat juist het vermelden waard is omdat ze het niet op alles eens zijn.
Onze eigen routeringsgegevens, over de zeven dagen tot 2026-09-23, tonen dat GLM-5.2 antwoordt met een mediaan van 3,28 seconden tot het eerste token tegenover 8,09 seconden voor Kimi K3, en streamt met 68,1 tokens per seconde tegenover 43,4. De p95-tijd tot het eerste token van beide modellen ligt op precies 10,00 seconden. Artificial Analysis, dat afzonderlijk meet, heeft GLM-5.2 op 68,2 outputtokens per seconde tegenover 36,7 voor Kimi K3, op 41,29 seconden end-to-end tegenover 72,13, en op 33,95 seconden tot het eerste antwoord tegenover 58,52.

De twee bronnen verschillen op één punt, en dat is het vermelden waard in plaats van het weg te poetsen. Artificial Analysis plaatst Kimi K3 iets voorop wat de ruwe tijd tot het eerste token betreft, 4,08 seconden tegenover 4,62, terwijl onze eigen routering GLM-5.2 bij p50 bijna tweeënhalf keer sneller laat zijn. Verschillende endpoints, verschillende upstreamproviders, verschillende periodes. Beschouw de doorvoerrichting — GLM-5.2 ruim sneller — als solide, en beschouw elk afzonderlijk cijfer voor de tijd tot het eerste token, het onze of het hunne, als een eigenschap van een bepaalde week.
Er staat ook een cijfer op onze GLM-5.2-pagina dat we niet stilletjes zullen weglaten: over dezelfde zeven dagen laat het een foutpercentage van 9,2% zien, tegenover 0,26% voor Kimi K3. Een verschil van die omvang is ongeveer even waarschijnlijk toe te schrijven aan een slechte week voor de upstreamproviders die GLM-5.2 bedienen als aan een eigenschap van het model, en zeven dagen is geen lang genoeg venster om het verschil te kunnen vaststellen. Het is het soort probleem dat routing bestaat om op te lossen — wanneer een provider één op de elf verzoeken laat mislukken, verplaatst automatische failover het verkeer zonder dat iemand de on-call hoeft te alarmeren.

Benchmarks: een echte sweep, smaller dan de kop.
Kimi K3 wint bijna alles waarop beide modellen zijn getest. Dit zijn cijfers van Artificial Analysis onder indexrevisie v4.3.2, beide modellen in hun maximale redeneerconfiguratie, afgelezen op 2026-09-23:
• Intelligentie-index — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% vs 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% vs 51%
• Humanity's Last Exam — 47% vs 41%
• GDP.pdf — 22% vs 10%
• AA-LCR v1.1 — 89% vs 78%
• CritPt — 23% vs 21%
Twee kanttekeningen voordat iemand een screenshot van die lijst maakt.
Eerst de indexherziening. De berichtgeving over de juli-lancering van Kimi K3 citeerde 57 op de Intelligence Index, met GLM-5.2 op 51. De live pagina's van vandaag zeggen 44 en 34. Dat is niet dezelfde meting — Artificial Analysis herziet de index en herberekent de scores van modellen daartegen, en een juli-cijfer naast een september-cijfer zetten is de gemakkelijkste fout die je bij deze combinatie kunt maken. De richting is stabiel in elke snapshot; de absolute cijfers zijn niet vergelijkbaar tussen revisies.
Ten tweede, de niveaus. Terminal-Bench 4.0 met 13% en 1% is een zware evaluatie, en op dat niveau zegt de verhouding meer dan elk van beide cijfers. AA-Omniscience, dat onderzoekt of een model de grenzen van zijn eigen kennis kent, zet GLM-5.2 op 4 tegenover de 20 van Kimi K3 — een ondergrens waarvan je op de hoogte wilt zijn als je van plan bent een van beide zonder toezicht te draaien.
Nog één ding dat Artificial Analysis over de GLM-5.2-vermelding noteert: het markeert de configuratie voor maximaal redeneren als verouderd ten gunste van de nieuwere GLM-5.3. Dat verandert niets aan de cijfers hierboven, die een momentopname zijn van GLM-5.2 zoals het werd gemeten, maar het betekent wel dat de roadmap van Z.ai dit model inmiddels voorbij is. Op een routed endpoint kost dat een modelstring in plaats van een migratie, wat het belangrijkste argument is om geen van beide namen hard te coderen in je applicatie.
Agents en toolgebruik: waar de kloof het grootst is
Als één blok van die tabel de aankoop zou moeten bepalen, is het dit. Langetermijn-agentisch werk is waar de voorsprong van Kimi K3 het grootst en meest consistent is:
• AutomationBench-AA — 58% vs. 28%, een verschil van 30 punten
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
Moonshots eigen releasemateriaal leunt op hetzelfde verhaal — de release van de K3-gewichten ging vergezeld van een technisch rapport over de expert-parallelle trainingsstack van de leverancier en een harness voor agent-omgevingen — maar leveranciersmateriaal is leveranciersmateriaal, en de cijfers hierboven zijn de onafhankelijke.
De externe aggregator LLM Stats, die zijn eigen samengestelde score over een gedeelde benchmarkset berekent, komt vanuit een andere richting tot dezelfde conclusie: van de elf benchmarks die hij voor beide modellen scoort, wint Kimi K3 ze alle elf, en zijn categoriescores zetten Kimi K3 voorop bij toolgebruik (30,8 vs 19,6), agents (38,3 vs 29,6) en coderen (42,3 vs 34,8). Dat zijn de eigen samengestelde scores van LLM Stats volgens zijn eigen weging, op een gedeelde set die niet groot is, dus beschouw ze als bevestiging en niet als een labresultaat. Elf van de elf is nog steeds geen nek-aan-nekrace.
Coderen
Dezelfde richting, kleinere marge. Op de code-evaluaties die Artificial Analysis voor beide beoordeelt, leidt Kimi K3 op SciCode met 59% tegen 51%; op de gedeelde set van LLM Stats wint het DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench en Terminal-Bench 2.1. De flatteuze cijfers van GLM-5.2 — 99,2% op AIME 2026, 94,4% op HMMT 2025, 91,2% op GPQA zoals overgenomen door aggregators van derden — zijn door de leverancier gerapporteerd en niet gereproduceerd, en de meeste ervan meten wedstrijdwiskunde in plaats van software-engineering.
De praktische interpretatie: voor een codeeragent die lang draait, veel bestanden bewerkt en zich van zijn eigen fouten moet herstellen, is de agentische marge van Kimi K3 een relevanter signaal dan de wiskundescores van beide modellen. Voor een snelle, goedkope codeassistent die grotendeels in één keer werkt, is het doorvoervoordeel van GLM-5.2 meer waard dan de kosten van de benchmarkkloof.
Waar ze dicht genoeg bij elkaar liggen dat het er niet toe doet
• Prijs van gecachte input — $0,26 vs $0,30 per miljoen, een verschil van 15% tegenover een verschil van 3,4x bij output
• Contextvenster — 1.000.000 vs 1.048.576 tokens
• p95 tijd tot eerste token — 10,00 s vs 10,00 s op onze eigen routing
• CritPt — 23% vs 21%
• Wiskunde — LLM Stats zet GLM-5.2 marginaal voorop op zijn samengestelde wiskundescore (41,4 vs 40,9), terwijl Kimi K3 leidt bij wiskunde met afbeeldingen; op basis van het beschikbare bewijs beheerst geen van beide modellen het rekenen.
Iedereen die je vertelt dat een van deze modellen op alle fronten twee keer zo goed is als het andere, leest slechts één rij van de tabel.
Kies GLM-5.2 als…
Je betaalt de rekening, en de rekening is de beperkende factor. GLM-5.2 kost ongeveer een derde van de outputprijs, is ook goedkoper op de cachelijn, is MIT-gelicentieerd zonder omzettrigger om aan te toetsen, is sneller in de mediaan en veel sneller bij streaming, en zijn miljoen-tokenvenster ligt dicht genoeg bij dat van Kimi K3 dat het verschil nooit ergens de doorslag zal geven. Als je workload tekst in en tekst uit is, en het vooral om lezen gaat in plaats van lange ketens van toolaanroepen, dan zijn de extra benchmarkpunten op Kimi K3 punten die je applicatie nooit zal scoren.
Kies Kimi K3 als…
Het werk is agentisch en langdurig. De kloof van 30 punten op AutomationBench, de voorsprongen op GDPval en AA-Briefcase, de marge van elf punten bij redeneren met een lange context en de volledige overwinning op de gedeelde set van LLM Stats wijzen allemaal in dezelfde richting: Kimi K3 is het betere model om een taak met meerdere stappen aan toe te vertrouwen en er niet meer naar om te kijken. Het is ook de enige van de twee die afbeeldingen accepteert. Daarvoor betaal je per taak ongeveer twee keer zoveel, en als je werkset zwaar gecachet is, betaal je minder dan twee keer zoveel — maar het argument ervoor is niet de prijs, en ook niet de snelheid.
Beide zijn routeerbaar op OrcaRouter met één sleutel tegen één OpenAI-compatibel endpoint, tegen de lijstprijzen van de providers, zonder dat er iets bovenop komt, en beide zitten achter dezelfde automatische failover. Dat is de goedkoopste manier om erachter te komen welke je workload eigenlijk wil, want wisselen tussen de twee is een modelstring en geen contract.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
