
Claude Fable 5.1 vs Kimi K3: Resonemangstaket vs taket du kan äga
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Claude Fable 5.1 och Kimi K3 riktar sig till samma köpare – team som kör långvariga, verktygsanvändande agenter över stora kodbaser och dokumentuppsättningar – och de kommer från motsatta ändar av marknaden. Claude Fable 5.1 är Anthropics stängda flaggskeppsmodell, släppt den 1 september 2026, prissatt till 10,00 dollar per miljon inmatningstokens och 50,00 dollar per miljon utmatningstokens, och mätt av Artificial Analysis till 53 på dess nuvarande Intelligence Index: först av de 201 modellerna som indexet spårar. Kimi K3, Moonshot AIs modell med 2,8 biljoner parametrar och mixture-of-experts-arkitektur, släppte sina vikter den 27 juli och ligger på 44 på samma index – tvåa av de 112 modellerna med öppna vikter i sin klass. Den uppenbara tolkningen är ett nio poängs intelligensgap mot en ungefär tredubbel prisskillnad. Den mer användbara tolkningen är att de två modellerna har olika maxvärden, och bara ett av dessa maxvärden kan höjas av den som använder modellen.
Källhänvisning: Artificial Analysis reviderade sitt Intelligence Index i september, så poängen, rangordningarna, hastigheterna och kostnaderna per uppgift här kommer från den aktuella versionen, inhämtad den 10 september 2026, och är inte jämförbara med de siffror som publicerades vid någon av modellernas lansering. Moonshots egna benchmarkresultat och Anthropics är märkta där de förekommer, och ingetdera har reproducerats av det andra labbet. Claude Fable 5.1 är nio dagar gammal, så dess leverantörspåståenden har knappt genomgått några externa tester; Kimi K3 har haft sex veckor av det.
Samma fönster, olika maxvärden
Båda modellerna har ett kontextfönster på 1 048 576 tokens, och ingen av dem tar extra betalt för att fylla det — Moonshot tar ett fast pris på Kimi K3: 3,00 USD / 0,30 USD cachad / 15,00 USD per miljon, och Claude Fable 5.1 tar ett fast pris på sitt fönster: 10,00 USD / 0,25 USD cachad / 50,00 USD. Det är detta gemensamma fönster som gör att dessa två överhuvudtaget jämförs: de är byggda för samma typ av arbete, där en enda uppgift samlar ihop ett repository, ett datarum eller en veckas verktygsutdata.
Skillnaden ligger i andra änden av röret. Kimi K3 kan generera upp till 1 048 576 token i ett enda svar – leverantörer brukar som standard sätta den till 131 072, men taket är en hel miljon, marknadsfört av Moonshot som ”ett enda anrop kan generera en kodbas.” Claude Fable 5.1 begränsar ett svar till 128K utdata-token. För en chattvända är den gränsen irrelevant. För generering av hela kodbaser, massmigrering eller en stor dokumentuppsättning är det skillnaden mellan ett enda anrop och en agentloop du måste bygga, övervaka och betala för tur för tur.
Siffrorna, dimension för dimension
• Pris per 1M tokens — Claude Fable 5.1 $10.00 in / $50.00 ut vs Kimi K3 $3.00 in / $15.00 ut.
• Cachad indata — Claude Fable 5.1 $0.25 per 1M jämfört med Kimi K3 $0.30, vilket Artificial Analysis omvandlar till en effektiv cache-rabatt på 98% mot 90%.
• Oberoende poäng, hastighet och kostnad — Claude Fable 5.1 ligger på 53 i det aktuella Intelligence Index (#1 av 201) med 67,2 output-tokens per sekund och 7,63 USD per indexuppgift; Kimi K3 ligger på 44 (#2 av 112 open-weights-modeller) med 35,5 tokens per sekund och 2,00 USD per uppgift, och indexet noterar att den är märkbart långsam och något mångordig — 160M output-tokens per indexkörning jämfört med Claude-modellens 190M.
• Kontext- och utdatatak — 1M token in och upp till 128K ut vs 1M token in och upp till 1M ut.
• Vikter — stängda, endast API, kontra öppna och självhostningsbara, publicerade av Moonshot under Kimi K3-licensen, en modifierad MIT-variant med kommersiella villkor för mycket stora återförsäljare, med vikter på Hugging Face.
• Vision — Claude Fable 5.1 accepterar text-, bild- och filinmatning via API:et; Kimi K3 accepterar text och bild via API:et, men nativ vision är en funktion i serveringslagret och ingår inte i de släppta vikterna.
• Resonemangssynlighet — Kimi K3 strömmar sina resonemangsspår i API:t; Claude Fable 5.1 returnerar tankeblock vars visning du väljer, sammanfattad eller utelämnad, medan den råa tankekedjan aldrig exponeras.
• Arkitektur — Claude Fable 5.1:s parameterantal är inte offentliggjort; Kimi K3 är en gles blandning av experter med totalt 2,8 biljoner parametrar och cirka 104 miljarder aktiva.
• Släppt — Claude Fable 5.1 den 1 september 2026; Kimi K3:s API den 16 juli 2026, med öppna vikter den 27 juli.

Vad niopoängsgapet är, och inte är.
På det aktuella indexet leder Claude Fable 5.1 med 53 och Kimi K3 är tvåa på 44, före resten av fältet med öppna vikter. Nio poäng är en verklig skillnad och det är inte brus, men indexet är en sammansättning – agentiskt arbete, kodning, vetenskapligt resonerande och allmän förmåga, viktat – och ett enda tal döljer de områden där den öppna modellen verkligen är stark. I oberoende mätningar från början av september låg Kimi K3 på eller nära toppen av det öppna fältet inom långsiktigt agentarbete: först på AutomationBench, tvåa på den agentiska Briefcase-sviten från Artificial Analysis och trea på GDPval-AA v2 bland de testade modellerna. Oberoende arenadata placerar dess webbutvecklingsförmåga på ungefär 1 679 Elo på Code Arenas Web Dev-tavla, nära toppen av det fältet fram till början av september. Det är de arbetsbelastningar där den öppna modellen inte ligger nio poäng efter.
Där Claude Fable 5.1 drar ifrån är taket för krävande resonemang. Anthropic rapporterar 52,6 % på Terminal-Bench-Science 0.1, mer än dubbelt så mycket som den tidigare Claude-generationens 24,7 %, samt 55,8 % på Terminal-Bench 4.0 — båda leverantörsrapporterade och ej oberoende verifierade. Det är siffrorna bakom påståendet att septemberversionen flyttade ribban för vetenskapligt och långsiktigt arbete. Den ärliga sammanfattningen är att Kimi K3 är konkurrenskraftig inom agentisk bredd och webbutveckling, och att den stängda modellen ligger före där resonemanget blir djupast; en indexspridning på nio poäng komprimerar båda fakta till en rad.
En datapunkt förtjänar ett eget omnämnande eftersom den är ovanlig: Moonshots egen Terminal-Bench 2.1-siffra för Kimi K3 är 88,3 %, mot en oberoende mätning på 85,0 %. Det är sällsynt att leverantörssiffror överlever neutral mätning nästan intakta, och ett så litet gap, till leverantörens fördel, säger mer om modellen än något enskilt indexresultat.

Ägarförgreningen, ärligt prissatt.
Öppna vikter är anledningen att föredra Kimi K3, och de är också anledningen att läsa det finstilta. Kimi K3 är en gles mixture of experts med 2,8 biljoner parametrar; att köra den själv är ett uttalande om multi-nod GPU-kluster, inte en eftermiddag vid en arbetsstation, och Kimi K3-licensen har en kommersiell spärr riktad mot mycket stora återförsäljare. Det du köper med den infrastrukturen är på riktigt: inga anropsbegränsningar, ingen mätning per token, finjustering på egna data, full granskningsbarhet och prompts som aldrig lämnar ditt nätverk — kraven som gör ett slutet API till en omöjlighet i reglerade och försvarsnära sammanhang.
Två förbehåll hör till detta. Egen hosting innebär att man går miste om API:ets inbyggda vision, eftersom bildinmatning är en funktion i serving-lagret snarare än i de utgivna vikterna; och modellen är långsam, mätt till 35,5 utdatatoken per sekund på nuvarande index — en naturlig följd av en mixture of experts med 2,8 biljoner parametrar och alltid aktivt resonemang. Vid 20 000 genererade token handlar det om minuter av generering, och på ditt eget kluster handlar det om minuter av dina egna GPU:er.
De hyrda versionerna ligger närmare varandra än vad ägarfrågan antyder. Kimi K3 på Moonshots API kostar $3,00 / $15,00 med $0,30 för cachad input, ungefär en tredjedel av Claude Fable 5.1:s tokenpriser, medan Claude-sidan sänkte sitt cacheläsningspris med 75 % i september — till $0,25 per miljon, under Kimis — vilket är avgörande för just de långa agentiska sessioner som båda modellerna riktar in sig på, där samma verktygsutdata läses om dussintals gånger. På det oberoende måttet kostnad per uppgift hamnar skillnaden på $2,00 för Kimi K3 mot $7,63 för Claude Fable 5.1: en faktor på nästan fyra, inte den faktor på tre som tokenpriserna antyder, eftersom Anthropic-modellen skriver ungefär 190 miljoner tokens jämfört med Kimis 160 miljoner för samma indexarbete.
Resonemang du kan titta på
Det finns en skillnad i utvecklarupplevelse som inte syns i någon benchmark-tabell. Kimi K3 strömmar sina resonemangsspår genom API:et, vilket förvandlar ett misslyckat agentsteg till något du kan läsa snarare än något du får sluta dig till. Claude Fable 5.1 gör motsatsen: tänkandet är alltid på, den råa tankekedjan returneras aldrig, och visningsinställningen avgör bara om du får en läsbar sammanfattning eller ingenting alls. Sammanfattningar räcker för de flesta produktionsloggar; spår är bättre för att felsöka en agent som hela tiden tar fel gren. Om du bygger agentinfrastruktur snarare än att konsumera den, märks den skillnaden inom timmar.
Upphandlingsfotnoten
För amerikanska företag är en icke-teknisk variabel kopplad till denna jämförelse. Moonshot AI är ett laboratorium med huvudkontor i Peking som har varit föremål för granskning av den amerikanska regeringen: finansministern har offentligt hotat att lägga till företaget på en handelsblacklist, amerikanska tjänstemän har hävdat att det destillerat kapacitet från amerikanska modeller – en anklagelse som Moonshot förnekar – och pressrapportering beskriver tidiga samtal med Microsoft, Amazon och Google om att vara värd för Kimi K3 på intäktsdelningsvillkor, tillsammans med en konfidentiell börsansökan i Hongkong i början av september. Inget av detta ändrar den tekniska jämförelsen, och en USA-värd distribution med öppna vikter inom din egen infrastruktur är väsentligt annorlunda än att dirigera frågor till ett utländskt API. Det innebär att ett upphandlingsbeslut om Kimi K3 är ett beslut med en politisk dimension, och att det bör fattas av personer som är medvetna om det.
Att köra jämförelsen istället för att argumentera om den.
Båda modellerna är tillgängliga på OrcaRouter till sina leverantörers listpriser utan påslag, vilket gör detta till en jämförelse du kan avgöra med dina egna data istället för en benchmarktabell: Kimi K3 till Moonshots $3.00 / $15.00, Claude Fable 5.1 till Anthropics $10.00 / $50.00, med en enda nyckel och en enda faktura, utan ytterligare avtal att skriva under och utan kodändring för att byta. Rikta samma testmiljö mot båda, mät kostnaden per slutförd uppgift på dina verkliga arbetsbelastningar, och låt automatisk failover hålla produktionssökvägen uppe medan en kandidatmodell fortfarande utvärderas. Om arbetsbelastningen är djup resonering eller lever i Claude Code, vinner vanligtvis den stängda flaggskeppsmodellen; om det är högvolymsgenerering där en utdata på en miljon token eller en självhostad driftsättning förändrar ekonomin, är Kimi K3 den enda av de två som kan ägas, och routinglagret är där du håller båda alternativen öppna.

Vad man ska hålla koll på härnäst är symmetriskt. Anthropic har levererat i ungefär månatlig takt och har nu visat att de kommer att sänka cache-prissättningen utan att röra listpriserna, så kostnadssidan i den här jämförelsen kan förändras utan en ny modell. Moonshots egen framtid är nu knuten till dess börsnotering och till de där molnförhandlingarna i USA, vilka båda kan förändra hur — och var — Kimi K3 levereras. Inget av detta är en anledning att vänta: båda modellerna gör idag det som siffrorna ovan säger att de gör, och det beslut som åldras bäst är det som behåller modell-ID:t som ett konfigurationsvärde snarare än en omskrivning.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
