
Grok 4.7 vs Kimi K3: Halva priset, halva kontexten, inga vikter
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Ta en månad med 300 miljoner tokens agentiskt kodningsarbete och kör den genom båda modellerna till deras listpriser, och valet slutar se ut som en benchmarkdiskussion. Grok 4.7, som SpaceXAI släppte den 21 september 2026, tar 2 dollar per miljon indatatokens och 6 dollar per miljon utdatatokens. Kimi K3, som Moonshot AI släppte den 16 juli 2026, tar 3 dollar och 15 dollar. Under en sådan hypotetisk månad – låt oss säga 200 M indata och 100 M utdata – landar Grok 4.7 på ungefär 1 000 dollar och Kimi K3 på ungefär 2 100 dollar. Klyftan är inte en avrundningsdetalj; den motsvarar budgeten för en andra modell. Mot det ger Kimi K3 dig ett kontextfönster på 1 000 000 tokens i stället för 500 000, inbyggd videoindata såväl som bilder, och nedladdningsbara vikter. Grok 4.7 ger dig en snabbare, billigare, sluten modell som uttryckligen tränades för det långsiktiga terminalarbete som Kimi K3 också riktar in sig på. Båda är av frontlinjeklass. De är inte samma köp.
De två modellerna, kortfattat
Grok 4.7 är SpaceXAI:s frontiermodell för kodning och kunskapsarbete, byggd på en större basmodell än Grok 4.6 och tränad med en längre körning av förstärkningsinlärning inriktad på uppgifter som kan ta timmar. Den är proprietär – inga vikter, ingen nedladdning – erbjuder ett kontextfönster på 500 000 tokens, tar in text och bilder och returnerar text, och stöder nivåer för reasoning effort från low till xhigh. Dess främsta säljargument är hastighet och pris: SpaceXAI positionerar den som ungefär dubbelt så snabb som jämförbara modeller till ungefär halva priset.
Kimi K3 är Moonshot AI:s flaggskeppsmodell med öppen blandning av experter, den första öppna modellen i klassen med tre biljoner parametrar: 2,8 biljoner parametrar totalt med 104 miljarder aktiva per token, byggd på Kimi Delta Attention och kvantiseringsmedvetna MXFP4-vikter. Den tar in text, bilder och video, erbjuder en kontext på 1 000 000 token, kör resonemang ständigt aktiverat med konfigurerbar ansträngning, och dess vikter kan laddas ner under Kimi K3-licensen – kommersiell användning tillåten, med begränsningar. Den är, till sin konstruktion, modellen du kan ta med dig hem.
Det är hela den strukturella skillnaden mellan dem. Den ena är en billig, snabb, stängd slutpunkt. Den andra är en dyrare, långsammare, öppen artefakt med dubbelt så stor kontext. Allt nedan är en konsekvens av detta.
Vad benchmarkarna faktiskt jämför
Det är här som de flesta texter om Grok 4.7 kontra Kimi K3 går fel, så det är värt att vara rakt på sak: de två modellernas publicerade siffror mäter till stor del inte samma saker, och minst ett par som ser jämförbart ut är det inte.
Börja med paret som är genuint vilseledande. Kimi K3:s lanseringsmaterial anger en Terminal-Bench 2.1-poäng på 88,3. Grok 4.7:s lanseringsmaterial anger Terminal-Bench 4.0 till 38,0 %. Det är olika benchmarkversioner med olika uppgiftsuppsättningar och olika poängsättning, och att ställa dem sida vid sida skulle antyda att Kimi K3 är mer än dubbelt så bra som agentisk modell. Det är inte en försvarbar tolkning, och ingen bör upprepa den. Båda siffrorna är dessutom rapporterade av leverantören – ingen av dem har oberoende reproducerats.
Det som kan jämföras är det oberoende sammansatta måttet, och där ligger de två nära varandra. I det aktuella Artificial Analysis Intelligence Index, version v4.3.2, får Kimi K3 44 poäng – tvåa av 113 modeller, den högsta placeringen av någon modell med öppna vikter på listan. Grok 4.7 får 46 poäng, på sextonde plats av 655. Två poäng skiljer dem åt, och Kimi K3:s placering är uppnådd vid maximal resonemangsansträngning. I det sammanvägda sammansatta måttet är dessa modeller jämbördiga.
• Oberoende sammansatt – Grok 4.7 46 på AA Intelligence Index v4.3.2 mot Kimi K3 44 på samma version. I praktiken oavgjort.
• Kontextfönster — Grok 4.7 500 000 tokens mot Kimi K3 1 000 000 tokens. En verklig, oinskränkt fördel för Kimi K3, och den enda specifikationsskillnaden utan något förbehåll.
• Indatamodaliteter — Grok 4.7 text och bild vs Kimi K3 text, bild och video. Kimi K3 är bredare, om din arbetsbelastning innehåller video.
• Vikter — Grok 4.7 proprietär, ingen nedladdning vs Kimi K3:s öppna vikter under Kimi K3-licensen. För ett krav på lokal installation eller luftgapad miljö är detta den enda raden som spelar roll.
• Pris per miljon tokens — Grok 4.7 $2 in / $6 ut mot Kimi K3 $3 in / $15 ut, med Kimis pris för cachad indata på $0,30 per miljon. Grok 4.7 är billigare i alla avseenden och dramatiskt mycket billigare på utdata.
• Kontroll av resonemangsinsats — Grok 4.7 från låg till xhigh vs Kimi K3 alltid på med konfigurerbar insats. Funktionellt sett likartade; skillnaden är att Grok 4.7 låter dig skruva ner resonemanget.
• Leverantörsrapporterade agentiska belägg – Grok 4.7 Terminal-Bench 4.0 38,0 %, CursorBench 4.0 46,3 %, DeepSWE v1.1 71,0 % (alla leverantörsrapporterade) mot Kimi K3 Terminal-Bench 2.1 88,3 %, Frontend Code Arena första plats med 1 679 Elo (leverantörsrapporterad vid lanseringen). Inte jämförbara – se ovan.


Vart pengarna faktiskt går
Prislistan underskattar gapet, eftersom de två modellerna förbrukar tokens olika. Grok 4.7 är en ordrik resonerare – Artificial Analysis uppmätte 240 miljoner genererade utdata-tokens när de körde sitt Intelligence Index, mot ett medianvärde på 92 miljoner bland modellerna. Kimi K3 är den motsatta typen av dyr: det är en stor, ständigt påslagen resonemangsmodell, och vid 15 dollar per miljon utdata-tokens är det ordrikedom du köper.
Så den ärliga kostnadsmodellen är inte "$2/$6 mot $3/$15." Det är utdatatokens per slutförd uppgift, multiplicerat med utdatapriset, plus indatatokens inklusive varje omförsök, multiplicerat med indatapriset. En modell som löser en uppgift i en enda lång omgång för $6 per miljon kan slå en modell som behöver tre försök för $15 per miljon, och den kan också förlora mot den om den billiga modellens omgångar är tillräckligt långa. Det är en mätning du gör i ditt eget kodförråd, inte en som någon publicerar åt dig.
En asymmetri är värd att känna till innan du kör den: Grok 4.6, föregångaren till Grok 4.7, tillämpar en prisklippa vid 200 000 indatatokens, där en förfrågan som passerar gränsen innebär att hela förfrågan prissätts om till dubbel taxa. Långkontextarbete på Grok-sidan kräver att man kontrollerar detta mot aktuell prislista för modellen du driftsätter, eftersom ett fönster på 500 000 tokens och en prisklippa vid 200 000 tokens interagerar dåligt. Kimi K3:s prissättning är platt, vilket är den mer lågmälda fördelen av de två.
Där var och en brister
Båda modellerna har ett felläge som lanseringsmaterialet inte börjar med, och de är olika fel.
Det som brister hos Kimi K3 är tillförlitligheten under ihållande belastning. Community- och oberoende tester vid lanseringen rapporterade att dess agentiska prestanda försämras när körningarna blir längre — starka resultat vid enstaka körningar, svagare andel godkända vid längre körningar — och att dess utdatahastighet ligger på runt 37 till 38 tokens per sekund, vilket är långsamt för interaktiv kodning. Moonshot tvingades också pausa nya konsumentabonnemang strax efter lanseringen eftersom efterfrågan översteg kapaciteten, vilket säger en del om kapacitetsmarginalen för servering på den hostade sidan.
Grok 4.7 har den motsatta formen: den är snabb, billig och stängd, vilket innebär att du inte kan inspektera den, inte kan köra den själv och inte kan gardera dig mot en utfasning. SpaceXAI har redan offentligt aviserat Grok 4.8, Grok 4.9 och Grok 5 i tur och ordning efter den här utgåvan, och Grok 4.6 höll i ungefär fem veckor innan den ersattes. Allt du bygger på Grok 4.7 bör byggas så att modell-ID:t är ett konfigurationsvärde, inte ett antagande.
Det finns en tredje aspekt som inte är ett misslyckande för någon av modellerna: ingen av dem är rätt svar för en tvåveckors autonom körning, och båda leverantörerna har demonstrerat exakt det. De publicerade 16-dagars- och 48-timmarsdemoerna för autonom kodning är genomförda av leverantörerna, på uppgifter som leverantörerna valt, utan oberoende reproduktion. De är värda att känna till, men inte värda att planera efter.

Att köra båda, och varför det är det egentliga svaret
Kostnadsklyftan och kontextklyftan pekar i motsatta riktningar, vilket är argumentet för att inte välja en. Kimi K3 förtjänar sitt pris vid arbete i repositoriskala, där ett fönster på 1M innebär att du inte delar upp indata, och för allt som måste vara självhostat. Grok 4.7 förtjänar sitt pris vid volym – agentloopar med många turer, pipelines med tunga verktygsanrop och långa terminalsessioner där hastighet och utdatakostnad dominerar.
Kimi K3 finns på OrcaRouter, vilket gör den uppdelningen till ett routingbeslut snarare än ett upphandlingsbeslut. Den finns i katalogen till Moonshots listpris, och eftersom OrcaRouter för vidare leverantörernas listpriser utan påslag (0 %) slår en leverantörs prissänkning igenom här samma dag som den tillkännages, i stället för vid nästa avtalsförnyelse. För arbetsbelastningar där en långkontextkörning och en exekveringskörning bör samarbeta i stället för att konkurrera – en modell som håller hela kodförrådet i sikte, en annan som agerar på det – komponerar routing-DSL:en flera modeller till ett enda anrop, och modellfusion låter en panel av modeller svara tillsammans när uppgiften är värd den extra kostnaden. En enda API-nyckel täcker Kimi K3 plus över 200 andra modeller, så den exekverande halvan av uppdelningen kan komma från vilken modell som helst som är billigast och snabbast för jobbet, i stället för från den som råkar hålla kontexten.
En sak bör klargöras: Kimi K3:s öppna vikter går att ladda ner, men det är den hostade endpointen som OrcaRouter routar till. Om ditt krav verkligen är on-premise-inferens är det ett självhostningsprojekt på din egen hårdvara, inte ett routingbeslut – och det är det enda scenariot där den här jämförelsen har ett enda korrekt svar.
Domen, och den enda siffran att hålla fast vid
Om du väljer utifrån kostnad och hastighet vinner Grok 4.7, och det är inte ens nära: halva priset för indata, under halva priset för utdata, snabbare serving och ett resonemangsreglage du kan skruva ned. Om du väljer utifrån kontext, modalitetsbredd eller möjligheten att äga modellen, vinner Kimi K3 på samma villkor. Om du enbart väljer utifrån förmåga säger den oberoende sammanvägningen att de ligger två poäng ifrån varandra, och du bör besluta utifrån din egen utvärdering snarare än utifrån någon av leverantörernas lanseringsdiagram.
Det tal du ska hålla fast vid är det från toppen: $2/$6 mot $3/$15. Allt annat i den här jämförelsen är förhandlingsbart, men det förhållandet är det inte.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
