Ett hero-titelkort för GLM-5.2 vs Kimi K3 med undertiteln 'Billigare och snabbare, eller större och bättre', tre rundade pill-badges med texten '1M token-kontext vardera', 'AA Index 34 vs 44' och '$1.40 / $4.40 vs $3.00 / $15.00', en sidfotsrad med texten 'Leverantörsprislistor och Artificial Analysis, 2026-09-23', samt OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

GLM-5.2 vs Kimi K3: Billigare och snabbare, eller större och bättre

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GLM-5.2 och Kimi K3 kom med en månads mellanrum i mitten av 2026 och är nästan perfekt varandras motsatser. Kimi K3, som släpptes 2026-07-16 med öppna vikter som följde den 2026-07-27, är den större och på papperet den bättre modellen: 2,8 biljoner parametrar, varav 104 miljarder aktiva, och högre poäng på i stort sett varje benchmark som de två har testats mot. GLM-5.2 har funnits sedan 2026-06-16, är den mindre av de två med 753 miljarder parametrar och 40 miljarder aktiva, och kostar ungefär en tredjedel så mycket per utdatatoken, svarar snabbare vid medianen och levereras under MIT i stället för en skräddarsydd licens med intäktsutlösare.

Det är beslutet i ett stycke. Det som följer är underlaget bakom det — prisaritmetiken för ett jobb som du faktiskt kan tänkas köra, mätningarna där de två ligger tillräckligt nära varandra för att skillnaden ska vara brus, och en populär siffra som inte är jämförbar med siffran som står tryckt bredvid den.

Var de två står

Båda är allmänt tillgängliga via sina leverantörers egna API:er, båda är routbara på OrcaRouter, och båda har nedladdningsbara vikter. Skillnaderna som spelar roll innan du ens kommer i närheten av ett benchmark:

• Släppt — GLM-5.2 den 16 juni 2026 mot Kimi K3 den 16 juli 2026 (Artificial Analysis modellsidor; OrcaRouters egen modellsida för Kimi K3 daterar den en dag tidigare, 15 juli 2026)

• Vikter — GLM-5.2 öppen under MIT vs Kimi K3 öppen under Kimi K3-licensen, som kräver ett separat avtal vid över 20 miljoner USD i årliga intäkter från model-as-a-service och framträdande attribution vid över 100 miljoner månatliga användare (intern forskning och utveckling är undantagen)

• Storlek — GLM-5.2 753B totalt / 40B aktiva mot Kimi K3 2,8T totalt / 104B aktiva

• Kontext — GLM-5.2 1 000 000 tokens mot Kimi K3 1 048 576 tokens

• Indata — GLM-5.2 text in, text ut vs Kimi K3 text och bilder in, text ut

• Publicerad maxutdata — GLM-5.2 128 000 tokens jämfört med ej publicerad på Kimi K3:s OrcaRouter-sida

På OrcaRouter ligger båda bakom en enda nyckel på en och samma OpenAI-kompatibla endpoint på https://api.orcarouter.ai/v1, och vi förmedlar leverantörens listpris direkt utan att lägga på något påslag – så varje siffra nedan är leverantörens siffra, inte vår.

Vad en miljon tokens kostar, på ett jobb som kostar något

Leverantörernas prislistor först, hämtade från leverantörernas egna prissidor den 23 september 2026. Z.ai listar GLM-5.2 till 1,40 USD per miljon indatatokens, 0,26 USD per miljon cachade indatatokens och 4,40 USD per miljon utdatatokens. Moonshot listar Kimi K3 till 3,00 USD för indata, 0,30 USD för cacheläsning, 15,00 USD för utdata – plus en cacheskrivningsavgift på 3,00 USD per miljon för en femminuterscache och 6,00 USD per miljon för en timmescache. Det är publicerade priser, inte oberoende granskade, och båda leverantörerna kan ändra dem.

Sätt dem på ett jobb som mestadels består av läsning: en granskning av en kodbas på 600 000 tokens med ett skriftligt svar på 8 000 tokens. Med GLM-5.2 är det 0,6 x $1,40 = $0,84 för indata plus 0,008 x $4,40 = $0,035 för utdata, eller ungefär $0,88. Med Kimi K3 är det 0,6 x $3,00 = $1,80 plus 0,008 x $15,00 = $0,12, eller ungefär $1,92. Ungefär 2,2 gånger kostnaden för samma jobb.

Kör det igen nu när kodbasen redan finns i leverantörens cache. Inmatningsraden sjunker till cache-läsningspriset, och de två priser som skilde sig med faktor 2,1 blir $0,26 mot $0,30 per miljon — en skillnad på 15 %. Detta är den minst diskuterade siffran i jämförelsen och den som betyder mest för en agent som läser om samma kontext varje tur. Den har också en asterisk: Kimi K3 debiterar separat för att skriva cachen och GLM-5.2:s sida annonserar inte någon skrivavgift alls, så en kallstart kostar betydligt mer på Kimi K3 än vad rubrikpriset $3,00 antyder.

• En läsning på 600k tokens med ett svar på 8k — GLM-5.2 cirka 0,88 $ mot Kimi K3 cirka 1,92 $

• Samma cachade inmatningsrad — GLM-5.2 $0.16 mot Kimi K3 $0.18 per 600k tokens

A self-built two-column scoreboard for GLM-5.2 vs Kimi K3. Left column 'GLM-5.2' (753B total / 40B active, MIT, $1.40 / $4.40): Intelligence Index 34, blended price per million $0.902, cost per task $0.96, output speed 68.2 tok/s, long context AA-LCR 78%, agentic AutomationBench 28%. Right column 'Kimi K3' (2.8T total / 104B active, Kimi K3 License, $3.00 / $15.00): Intelligence Index 44, blended price per million $2.31, cost per task $2.00, output speed 36.7 tok/s, long context AA-LCR 89%, agentic AutomationBench 58%. Footer reads 'Benchmark, speed and cost figures per Artificial Analysis (Intelligence Index v4.3.2, read 2026-09-23), both models in their maximum-reasoning configuration. Vendor list prices per Z.ai and Moonshot. OrcaRouter passes provider list price through at 0% markup.'

Den oberoende modellen är ense om riktningen men inte om storleken. Artificial Analysis blandar cacheträff-, indata- och utdatatoken i förhållandet 7:2:1 och lägger till de resonemangstoken som en modell faktiskt förbrukar, och dess siffror för dessa två — avlästa 2026-09-23 under dess v4.3.2-index — sätter GLM-5.2 till $0.902 per miljon blandade token mot Kimi K3:s $2.31, och kostnaden för att slutföra en av dess utvärderingsuppgifter till $0.96 mot $2.00. Att köra hela Intelligence Index en gång kostar $1,559 på GLM-5.2 och $3,658 på Kimi K3.

Det finns en kontraintuitiv detalj begravd i den kostnadsmodellen. Kimi K3 använder färre utdatatokens per uppgift än GLM-5.2 — 48 000 mot 64 000 — och färre resonemangstokens, 32 000 mot 51 000. Den är den mer ekonomiska modellen per arbetsenhet och kostar ändå ungefär dubbelt så mycket per uppgift, eftersom dess pris per token är 2,1x för indata och 3,4x för utdata. Billig per uppgift och billig per token är olika egenskaper, och detta är ett par där de pekar i motsatta riktningar.

Kontextfönstret, och vad som faktiskt får plats i det

De två ligger inom 5 % av varandra på papperet: 1 000 000 tokens mot 1 048 576. Att rapportera det som en seger för Kimi K3 vore löjligt. Båda är modeller med miljontals tokens, och fönstret är ingen särskiljande faktor; den ärliga frågan är vad var och en fortfarande kan göra med text som ligger begravd i mitten av det.

Det är vad utvärderingen av långkontextresonemang från Artificial Analysis mäter, och det är en av de större skillnaderna i datasetet: Kimi K3 får 89 % mot GLM-5.2:s 78 %. Om ditt jobb är att läsa in en stor korpus och ställa frågor som kräver att man kopplar samman fakta från motsatta ändar av den, är de extra 48 576 tokens inte skälet att välja Kimi K3 — långkontextmarginalen på elva punkter är det.

Golvet under fönstret skiljer sig också. GLM-5.2 publicerar en maximal utdata på 128 000 token; Kimi K3:s sida publicerar ingen motsvarande siffra, så vi kommer inte att ange någon. Om du genererar långa dokument snarare än läser dem är den asymmetrin värd att kontrollera mot din egen arbetsbelastning innan du köper någon av dem.

Hastighet: den enda axeln som GLM-5.2 helt och hållet dominerar

Två oberoende mätningar pekar i samma riktning här, vilket är värt att säga just för att de inte är överens om allt.

Vår egen routingdata, under de sju dagarna fram till 2026-09-23, visar att GLM-5.2 svarar med en median på 3,28 sekunder till första token mot Kimi K3:s 8,09 sekunder, och strömmar 68,1 tokens per sekund mot 43,4. Båda modellernas p95-tid till första token ligger på exakt 10,00 sekunder. Artificial Analysis, som mäter separat, har GLM-5.2 på 68,2 utdatatokens per sekund mot Kimi K3:s 36,7, på 41,29 sekunder end-to-end mot 72,13, och på 33,95 sekunder till första svar mot 58,52.

A screenshot of the OrcaRouter model page for GLM 5.2 (z-ai/glm-5.2) captured 2026-09-23, showing the FEATURED badge, the byline 'by Z.ai · 2026-06-16', a 1M-token context with 128K maximum output and text in / text out, rate cards of $1.40 input and $4.40 output per 1M tokens with a $0.260 cache read, a p50 time to first token of 3.28 s against a p95 of 10.00 s, 29.4M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 68.1 tokens per second and a 9.2% error rate.

De två källorna går isär i en punkt, och det är värt att flagga snarare än att släta över. Artificial Analysis placerar Kimi K3 något före när det gäller rå tid till första token, 4,08 sekunder mot 4,62, medan vår egen routning visar att GLM-5.2 är nästan två och en halv gång snabbare vid p50. Olika slutpunkter, olika uppströmsleverantörer, olika fönster. Betrakta genomströmningsriktningen — GLM-5.2 klart snabbare — som säker, och betrakta varje enskilt värde för tid till första token, vårt eller deras, som en egenskap hos en viss vecka.

Det finns också en siffra på vår GLM-5.2-sida som vi inte tänker utelämna i tysthet: under samma sju dagar visar den en felfrekvens på 9,2 %, mot 0,26 % för Kimi K3. Ett gap av den storleken är ungefär lika sannolikt en dålig vecka för de uppströmsleverantörer som betjänar GLM-5.2 som en egenskap hos modellen, och sju dagar är inte ett tillräckligt långt fönster för att avgöra skillnaden. Det är den typ av problem som routing finns till för att lösa – när en leverantör misslyckas med en av elva förfrågningar flyttar automatisk failover trafiken utan att någon behöver larma jourhavande.

A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) captured 2026-09-23, showing the FEATURED badge, the byline 'by MoonshotAI · 2026-07-15', text-and-image input with text output, a 1,048,576-token context, rate cards of $3.00 input and $15.00 output per 1M tokens with a $0.300 cache read, a p50 time to first token of 8.09 s against a p95 of 10.00 s, 1116.2M tokens of traffic in the last 7 days, and a PERFORMANCE panel showing an output speed of 43.4 tokens per second and a 0.26% error rate.

Benchmarks: ett riktigt svep, snävare än rubriken

Kimi K3 vinner nästan allt som båda modellerna har testats på. Detta är siffror från Artificial Analysis under indexrevision v4.3.2, båda modellerna i sin maximala resonemangskonfiguration, avlästa 2026-09-23:

• Intelligensindex — Kimi K3 44 mot GLM-5.2 34

• AA-Briefcase v1.1 — 1510 mot 1233

• GDPval-AA v2.1 — 1524 mot 1358

• AutomationBench-AA — 58 % mot 28 %

• Terminal-Bench 4.0 — 13 % mot 1 %

• SciCode — 59 % vs 51 %

• Humanity's Last Exam — 47 % mot 41 %

• GDP.pdf — 22 % mot 10 %

• AA-LCR v1.1 — 89 % mot 78 %

• CritPt – 23 % mot 21 %

Två förbehåll innan någon skärmdumpar den listan.

Först, revideringen av indexet. Rapporteringen kring Kimi K3:s lansering i juli angav 57 på Intelligence Index, med GLM-5.2 på 51. De aktuella sidorna i dag visar 44 och 34. Det är inte samma mätning – Artificial Analysis reviderar indexet och poängsätter om modeller mot det, och att ställa en julisiffra bredvid en septembersiffra är det lättaste misstaget att göra i den här jämförelsen. Riktningen är stabil i varje ögonblicksbild; de absoluta talen är inte jämförbara mellan revideringar.

För det andra, nivåerna. Terminal-Bench 4.0 på 13 % och 1 % är en tuff utvärdering, och på den nivån säger förhållandet dig mer än någon av siffrorna. AA-Omniscience, som undersöker om en modell känner till gränserna för sin egen kunskap, har GLM-5.2 på 4 mot Kimi K3:s 20 – en lägstanivå som är värd att känna till om du planerar att köra någon av dem utan övervakning.

En sak till som Artificial Analysis registrerar om GLM-5.2-listningen: den markerar konfigurationen för maximalt resonemang som föråldrad till förmån för den nyare GLM-5.3. Det ändrar inte någon av siffrorna ovan, som är en ögonblicksbild av GLM-5.2 så som den mättes, men det innebär att Z.ai:s färdplan har gått förbi den här modellen. På en routad endpoint kostar det en modellsträng i stället för en migrering, vilket är huvudargumentet för att inte hårdkoda något av dessa namn i din applikation.

Agenter och verktygsanvändning: där gapet är som störst

Om ett block i den tabellen ska avgöra köpet, är det detta. Långsiktigt agentiskt arbete är där Kimi K3:s marginal är störst och mest konsekvent:

• AutomationBench-AA — 58 % mot 28 %, en skillnad på 30 punkter

• GDPval-AA v2.1 — 1524 mot 1358

• AA-Briefcase v1.1 — 1510 mot 1233

• Terminal-Bench 4.0 — 13 % mot 1 %

Moonshots eget releasematerial lutar sig mot samma berättelse – släppet av K3-vikterna kom med en teknisk rapport som täcker leverantörens expert-parallella träningsstack och ett harness för agentmiljöer – men leverantörsmaterial är leverantörsmaterial, och siffrorna ovan är de oberoende.

Tredjepartsaggregatorn LLM Stats, som kör sin egen sammansatta poäng över en delad uppsättning benchmarkar, kommer fram till samma slutsats från ett annat håll: av de elva benchmarkar den poängsätter för båda modellerna tar Kimi K3 alla elva, och dess kategoripoäng placerar Kimi K3 före inom verktygsanvändning (30,8 mot 19,6), agenter (38,3 mot 29,6) och kodning (42,3 mot 34,8). Det är LLM Stats egna sammansatta poäng enligt dess egen viktning, på en delad uppsättning som inte är stor, så se dem som bekräftelse snarare än som ett labbresultat. Elva av elva är fortfarande inte någon jämn match.

Kodning

Samma riktning, mindre marginal. I kodningsutvärderingarna från Artificial Analysis, där båda får poäng, leder Kimi K3 över SciCode med 59 % mot 51 %; i LLM Stats gemensamma uppsättning tar den DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench och Terminal-Bench 2.1. GLM-5.2:s smickrande siffror – 99,2 % på AIME 2026, 94,4 % på HMMT 2025, 91,2 % på GPQA såsom återgivna av tredjepartsaggregatorer – är leverantörsrapporterade och ej reproducerade, och de flesta av dem mäter tävlingsmatematik snarare än mjukvaruutveckling.

Den praktiska tolkningen: för en kodagent som kör under lång tid, redigerar många filer och måste återhämta sig från sina egna misstag är Kimi K3:s agentiska marginal en mer relevant signal än någon av modellernas matematikpoäng. För en snabb, billig och till stor del enkeltskottsbaserad kodassistent är GLM-5.2:s genomströmningsfördel värd mer än vad benchmark-gapet kostar.

Där de är tillräckligt nära för att det inte spelar någon roll

• Pris för cachelagrad indata — 0,26 USD vs 0,30 USD per miljon, en skillnad på 15 % mot en skillnad på 3,4x för utdata

• Kontextfönster — 1 000 000 vs 1 048 576 tokens

• p95 tid till första token — 10,00 s mot 10,00 s med vår egen routning

• CritPt – 23 % mot 21 %

• Matematik — LLM Stats placerar GLM-5.2 marginellt före på sitt sammansatta matematikmått (41,4 mot 40,9) medan Kimi K3 leder på matematik med bilder; utifrån tillgängliga bevis behärskar ingen av modellerna aritmetik

Den som säger att en av dessa modeller är dubbelt så bra som den andra på alla områden läser bara en enda rad i tabellen.

Välj GLM-5.2 om…

Du betalar räkningen, och räkningen är begränsningen. GLM-5.2 ligger på ungefär en tredjedel av priset för utdata, är billigare även på den cachade raden, är MIT-licensierad utan någon intäktsutlösare att kontrollera mot, är snabbare vid medianen och mycket snabbare vid strömning, och dess fönster på en miljon token ligger tillräckligt nära Kimi K3:s för att skillnaden aldrig kommer att avgöra något. Om din arbetsbelastning är text in och text ut, och den mestadels handlar om läsning snarare än långa kedjor av verktygsanrop, är de extra benchmarkpoängen på Kimi K3 poäng som din applikation aldrig kommer att samla in.

Välj Kimi K3 om…

Arbetet är agentiskt och långvarigt. AutomationBench-gapet på 30 poäng, försprången på GDPval och AA-Briefcase, marginalen på elva poäng för långkontextresonemang och svepet av LLM Stats delade uppsättning pekar alla åt samma håll: Kimi K3 är den bättre modellen att lämna en flerstegsuppgift till och gå därifrån. Den är också den enda av de två som accepterar bilder. Du kommer att betala ungefär dubbelt så mycket per uppgift för det, och om din arbetsuppsättning är kraftigt cachad kommer du att betala mindre än dubbelt — men argumentet för den är inte pris, och det är inte hastighet.

Båda kan routas på OrcaRouter från en nyckel mot en OpenAI-kompatibel slutpunkt, till leverantörernas listpriser utan något påslag, och båda ligger bakom samma automatiska redundansväxling. Det är det billigaste sättet att ta reda på vilken din arbetsbelastning faktiskt vill ha, eftersom att byta mellan dem är en modellsträng snarare än ett kontrakt.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen