
GLM-5.3 vs Kimi K3: Att pressa en 743B-bas eller bygga en 2.8T — vilken satsning lönar sig?
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
Det kinesiska open-weight-racet har just delat sig i två svar på samma fråga. Moonshot AI byggde Kimi K3 från grunden — en mixture-of-experts-bas med 2,8 biljoner parametrar, den största open-weight-modellen som någonsin släppts, tillkännagiven den 16 juli 2026 med vikterna som följde den 27 juli. GLM-5.3 är den motsatta satsningen: Z.ai behöll exakt samma bas med 743 miljarder parametrar som drev GLM-5.2 och ägnade hela releasecykeln åt post-träning, med argumentet att basmodellens intelligenstak aldrig var problemet. Båda är flaggskeppsmodeller med 1M-kontext, inriktade på kodning och agenter, och båda hävdar att de är den bästa öppna kodningsmodellen på marknaden. De kan inte båda vara det bästa sättet att spendera samma budget, och benchmarkresultaten delar verkligen mitt itu — vilket gör detta mindre till en jämförelse än en folkomröstning om hur man bygger nästa frontier-modell.
Två satsningar på hur man bygger en frontier-modell
Z.ai kallar GLM-5.3 en "deep dig" snarare än en generationsuppgradering. Basen är byte för byte samma 743B-modell som GLM-5.2; skillnaden ligger helt i efterträningen, som körs genom ramverket slime med öppen källkod på uppgifter som sträcker sig över hela ingenjörssessioner — diagnostisering, åtgärdande, verifiering och leverans över verkliga kluster, lagringssystem och kodbaser, där vissa tar flera dagars arbete för en senior ingenjör. Leverantörens rapporterade förbättringar är stora: ett 50-procentigt hopp på dess egen Code Bench, Terminal-Bench 3.0 från 4,6 till 28,3, DeepSWE v1.1 från 46,2 till 66,9, samt en cyberförmåga som har föranlett en säkerhetsgranskning innan vikterna släpps. Moonshot gick åt andra hållet. Kimi K3 är en helt ny bas — 2,8T totala parametrar med cirka 104B aktiva per token (16 av 896 experter), en Kimi Delta Attention-arkitektur, inbyggd bild- och videoinmatning, alltid påkopplat resonemang som inte kan stängas av, och ett kontextfönster på 1M för både inmatning och utmatning. Där Z.ai satsar på att mer av samma modell räcker, satsar Moonshot på att själva basen var taket.

Direktjämförelsen, med bifogad proveniens.
Den enda plats där båda modellerna förekommer på samma sida är Z.ai:s egen lanseringslista, så det är därifrån siffrorna sida vid sida kommer – märkta som leverantörsrapporterade, inte oberoende granskade. Kimi K3:s fristående siffror stämmer överens med vad Moonshot publicerade i juli och vad Artificial Analysis mäter, men inget neutralt labb har ännu kört båda.
• Terminal-Bench 3.0 — GLM-5.3 vid 28.3 mot Kimi K3 vid 17.4 (Z.ai:s tabell). Den enskilt största kodningsskillnaden i matchen, på den nyaste och svåraste versionen.
• Terminal-Bench 2.1 — GLM-5.3 på 88.2 mot Kimi K3 på 88.3. Helt jämnt.
• DeepSWE v1.1 — GLM-5.3 på 66,9 jämfört med Kimi K3 på 67,5. Kimi med en hårsmån.
• SWE-Marathon v1.1 — GLM-5.3 på 42.5 mot Kimi K3 på 48.1. Kimi:s bästa kodseger.
• ExploitGym — GLM-5.3 med 105/130 mot Kimi K3 med 36/70. En nästan total utklassning för GLM.
• GDPval-AA v2 (kunskapsarbete) — GLM-5.3 med 1,769 mot Kimi K3 med 1,682.
• Access — GLM-5.3: Coding Plan-prenumeration, vikter låsta tills ungefär 28 augusti. Kimi K3: API live till $3 / $15, vikter nedladdningsbara sedan 27 juli.

Säkerhetsvallgraven är den verkliga separationen.
Om man tar bort kodningsbenchmarkerna så är den avgörande skillnaden cybersäkerhet. GLM-5.3 rapporterar 84.5 på CyberGym mot Kimi K3:s 80.0, och dess ExploitBench-poäng på 54.4 är nästan dubbelt så hög som Kimi K3:s 32.2. På ExploitGym är gapet inte en skillnad, det är en annan kategori — 105 och 130 jämfört med 36 och 70 över 2-timmars- och 6-timmarskörningarna. Det är därför de två lanseringarna känns så olika i praktiken: Kimi K3:s vikter är öppna under en modifierad MIT-licens, medan GLM-5.3:s hålls tillbaka för säkerhetshärdning just för att Z.ai säger att modellen är tillräckligt bra på att hitta och utnyttja svagheter att det kändes oansvarigt att släppa vikterna omedelbart. Om ditt arbete innebär att granska någon annans kod, eller försvara din egen mot automatiserad sårbarhetsjakt, är detta den enskilt mest relevanta raden i hela jämförelsen — och den är också den minst oberoende verifierade.
Där Kimi K3 kämpar tillbaka
Kimi K3:s vinster samlas där GLM-5.3 är svagast: långsiktigt repository-arbete. Den har övertaget på DeepSWE och SWE-Marathon, leder på Toolathlon Verified, och dess 1M-token-utdatafönster innebär att den kan skriva en hel kodbas eller en lång agent-spårning i ett enda steg. Dess alltid påkopplade resonemang strömmar hela spårningen till API:et, vilket utvecklare har kallat mycket mer användbart för att felsöka agenter än ogenomskinliga sammanfattningsförklaringar — med den operativa haken att du måste skicka tillbaka resonemangsfälten ordagrant över verktygsanrop, och det finns ingen assistant-förfyllning. På Artificial Analysis:s Intelligence Index ligger Kimi K3 på 57, totalt fyra, med ungefär 0,94 dollar i kostnad per uppgift mätt på dess standarduppsättning. Det är också den dyraste modell som ett kinesiskt labb har släppt: 3 dollar per miljon input-tokens och 15 dollar per miljon output, Sonnet-nivå prissättning, där GLM-5.3 ännu inte kan prissättas per token alls eftersom den bara finns i en prenumerationsplan.
Verkligheten kring tillgång och kostnad
Kimi K3 finns på OrcaRouter just nu till Moonshots eget listpris — 3 $ / 15 $ per miljon tokens, 0,30 $ för cachade läsningar, 0 % påslag — så kan agentarbetet med 1M-kontext anropas med samma nyckel som resten av din stack, och de öppna vikterna är utvägen om du vill self-hosta. GLM-5.3 är den som är svår att få tag på: ett månadsabonnemang på 18–168 $ med ett poängsystem som förbrukar krediter vid 6,9x på input och 24x på output, lågtrafikspriser som halverar förbrukningen utanför 14:00–18:00 kinesisk tid, och inget per-token-API förrän säkerhetsgranskningen är klar. Routningslagret plattar faktiskt ut denna asymmetri för tvåveckorsfönstret: när GLM-5.3:s API landar på samma nyckel kan ett panelanrop köra båda open-coding-flaggskeppen mot dina egna uppgifter och låta domaren stämma av dem — och om du inte kan vänta, är Kimi K3, med sina redan släppta vikter, den enda av de två du kan ta helt on-premises idag.

Vilken satsning betalar ut?
Den ärliga domen efter en vecka är att båda satsningarna lönar sig, men under olika arbetsbelastningar. Om ditt arbete är terminaltungt, säkerhetsnära och agentorkestrerat, är GLM-5.3 den starkare riktningen baserat på de bevis Z.ai har publicerat — och cybersäkerhetsgapet är tillräckligt stort för att det är värt att vänta två veckor på vikterna för att själv kontrollera. Om ditt arbete är långa repositoriesessioner, multimodal indata, eller något där du behöver vikterna i handen idag, är Kimi K3 den enda av de två som faktiskt är tillgänglig — och dess deep-repo-vinster är de du kan verifiera just nu från dess live-API. En sak att hålla reda på: varje siffra i denna jämförelses head-to-head kommer från Z.ai:s egen tabell, så behandla kodningsskillnaderna som riktningsgivande tills ett oberoende labb kör båda. Det är precis den typen av verifiering som tvåveckorsväntan kommer att ge.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
