
GPT-6.1 Sol vs Kimi K3: Nedladdningen finns, och det är fortfarande inte det billiga alternativet
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Kimi K3 är motexemplet som vanligtvis avgör den här typen av argument. Moonshot AI släppte modellen med 2,8 biljoner parametrar i juli 2026 och publicerade vikterna – moonshotai/Kimi-K3 finns på Hugging Face, utan begränsningar, med över en miljon nedladdningar och en senaste revision i september. Så det finns ingen asterisk om "öppen i princip, undanhållen för säkerhetshärdning" här, ingen tvåveckorsfördröjning att vänta ut. GPT-6.1 Sol, som OpenAI släppte den 29 september 2026, är stängd och endast via API och kommer alltid att vara det. Och på den oberoende resultattavlan får den nedladdningsbara modellen 43,6 mot den stängda modellens 51,8, samtidigt som den kostar 2,00 USD per slutförd indexuppgift mot 0,72 USD. Öppna vikter förväntas vara den billiga nödutgången; i detta par är de den dyra sidan av affären, och orsaken är inte licensen.
Vad varje modell är
Kimi K3 är en sparse mixture-of-experts-modell med 2 800 miljarder totala parametrar och ungefär 104 miljarder – cirka 3,7 % – aktiva per token. Den har ett kontextfönster på 1 048 576 token, tar text och bilder som indata och returnerar text. Den publicerade checkpointen är en FP8-artefakt och är en genuint stor nedladdning; en produktionsdriftsättning på din egen hårdvara är ett klusterbeslut snarare än ett arbetsstationsbeslut. Moonshots arkitektoniska anspråk är ett hybridiskt linjärt attention-schema som man säger är avsevärt snabbare vid avkodning av långa kontexter, plus det residual- och routingarbete som gjorde att en modell med 2,8 biljoner parametrar över huvud taget gick att köra.
GPT-6.1 Sol är OpenAIs mellanklassuppdatering – under GPT-6 Astra, över GPT-6 Luna – med ett fönster på 1 050 000 tokens, ett tak för utdata på 128 000 tokens, inmatning av text, bild och fil samt en kunskapsgräns den 30 april 2026. Resonemang går från låg till max med medium som standard; nivån ingen som den tidigare GPT-6 Sol accepterade avvisas helt, och OpenAIs egen migreringsanteckning hänvisar utvecklare till låg i stället. Den kostar $2,00 och $10,00 per miljon tokens, med cachad indata för $0,10.
En rad per dimension, båda sidorna på varje:
• Indata — GPT-6.1 Sol 2,00 $ per 1 miljon mot Kimi K3 3,00 $ per 1 miljon
• Utdata — GPT-6.1 Sol 10,00 $ per 1 miljon mot Kimi K3 15,00 $ per 1 miljon
• Cachad indata — GPT-6.1 Sol 0,10 $ per 1 miljon mot Kimi K3 0,30 $ per 1 miljon
• Kontextfönster — 1 050 000 tokens mot 1 048 576 tokens; en skillnad på 0,1 %, försumbar
• Maximal utdata — 128 000 tokens i båda fallen
• Totala och aktiva parametrar — ej offentliggjorda mot 2 800 miljarder totalt, 104 miljarder aktiva per token
• Modalitet — text, bild och fil som indata, text som utdata mot text och bild som indata, text som utdata
• Vikter — stängda, endast API mot öppna, utan begränsningar, över 1 miljon nedladdningar
• Klausul för lång kontext — ändrar priset för hela begäran över 272 000 indatatokens till 2× för indata och cache och 1,5× för utdata, mot ingen motsvarande klausul på det publicerade kortet
• Intelligence Index, oberoende, maximal ansträngning — 51,8 mot 43,6
• Kostnad per indexuppgift, oberoende — 0,72 $ mot 2,00 $
• Utdatatokens i indexkörningen — 67 miljoner mot 160 miljoner, mot en median på resultattavlan på 140 miljoner för dess jämförelseklass
Den enda utvärderingen som K3 vinner, och varför det spelar roll
Före aritmetiken, undantaget, för det är verkligt. Poängsatt utvärdering för utvärdering vid maximal ansträngning på Artificial Analysis v4.3.2 leder GPT-6.1 Sol i sju av tio och inga oavgjorda, men modellen som vinner utvärderingen av långkontextresonemang är K3:
• AA-LCR v1.1 — Kimi K3 0,887 vs GPT-6.1 Sol 0,830. Ett försprång på sex punkter i utvärderingen som byggts specifikt för resonemang över långa indata.
• SciCode — Kimi K3 0,595 vs GPT-6.1 Sol 0,542. K3 leder även inom vetenskaplig kodning.
• Terminal-Bench 4.0 — Kimi K3 0,126 vs GPT-6.1 Sol 0,561. En skillnad på 43 punkter i motsatt riktning, och den i särklass största klyftan i den här parningen.
• Humanity's Last Exam — Kimi K3 0,469 vs GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 vs GPT-6.1 Sol 41,5; när det gäller faktabaserad tillförlitlighet är de två inte samma klass av modell.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 vs GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 vs GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 och 0,234; Sol 0,649, 0,310 och 0,317.
AA-LCR-resultatet är det som är värt att ta på allvar, eftersom det är det enda talet som motsäger kostnaden per uppgift, och det pekar på en arbetsbelastning där det till synes billiga svaret är fel i båda riktningarna. Om din trafik består av mycket långa indata, ett måttligt genererat svar och tung återanvändning av ett stabilt prefix — den form där mångordighet aldrig får chansen att bita — passar K3:s kombination av en långkontextpoäng i toppklass, en bildinmatning och en nedladdningsbar checkpoint bättre än Sol:s, och siffran för kostnaden per uppgift för indexkörningen gäller inte för dig. Det är den ärliga versionen av ”öppna vikter är värda ett premium”: ibland är den öppna modellen helt enkelt den bättre modellen för uppgiften, och här är den det på en axel.
Det är också värt att sätta ord på vad de två vinsterna har gemensamt. K3 är stark när en uppgift kan besvaras i en enda lång akt av läsning eller resonemang, och svag när den måste utföras i många små steg och kontrolleras. Gapet på 43 punkter i Terminal-Bench och allvetenhetsgapet på 22 punkter är samma fynd sett ur två vinklar: uthållig agentisk exekvering är inte vad denna checkpoint optimerades för.
Aritmetiken, som är det som faktiskt avgör det.
K3:s prislista är 1,5× Sols på varje rad och dess uppmätta kostnad per slutförd indexuppgift är 2,8×, och skillnaden mellan 1,5 och 2,8 förklaras helt av tokenvolymen. Styrelsens egen mätning är 160 miljoner output-tokens för K3 mot 67 miljoner för Sol i samma svit med tio utvärderingar. K3 producerar 2,4 gånger så mycket output till 1,5 gånger priset, och 2,4 × 1,5 är 3,6 — styrelsens siffra på 2,00 $ mot 0,72 $ är lite vänligare än den rena kvoten eftersom input- och cachebidrag väger upp det något, men riktningen är inte omtvistad.
Moonshoots egen marknadsföring går emot detta på ett sätt som är värt att läsa noggrant. Företaget hävdar att K3 avger färre utdatatokens än sin föregångare, och arkitekturarbetet – uppmärksamhetsschemat, residualdesignen – är direkt inriktat på kostnaden för långkontextavkodning. Båda dessa kan vara sanna samtidigt som modellen fortfarande är dubbelt så mångordig som benchmarkmedianen i en allmän testsvit. De två påståendena handlar om olika saker: effektivitet i förhållande till en tidigare Kimi, och effektivitet i förhållande till fältet. Det är bara det andra som du faktureras utifrån, och det är det som den oberoende styrelsen mäter.
Cachelagring mildrar det. Båda priserna för cachad indata är en tiondel av respektive modells pris för icke-cachad indata – 0,30 USD för K3, 0,10 USD för Sol – så cacheraden ändrar inte rangordningen, men den innebär att en förfrågningstung, svarslätt arbetsbelastning minskar gapet till ungefär prislisteförhållandet i stället för det uppmätta uppgiftsförhållandet. Och Sols långkontextklausul drar åt andra hållet: över 272 000 indatatoken prissätter den om hela begäran till 4,00 USD och 15,00 USD, med cache till 0,20 USD, vilket är det enda intervallet där K3:s platta prislista vinner ohotat. Det är värt att känna till av två skäl, eftersom det också är intervallet där K3:s långkontextpoäng är det bästa värdet i den här jämförelsen.

Vad öppna vikter egentligen är värda här
Tre saker, och det är värt att skilja på dem, eftersom "öppna vikter" vanligtvis används som ett argument när det är tre.
Det första är att du kan lämna. Om Moonshoot blir uppköpt, ändrar licensen för framtida versioner, utfasar K3 eller höjer sitt API-pris, fortsätter en checkpoint som du redan har laddat ned att köras. Det är inte hypotetiskt för det här labbet: Moonshoot pausade nya prenumerationer inom ungefär 48 timmar efter en tidigare release för att skydda tjänstekvaliteten för befintliga betalande kunder, vilket är en levande demonstration av att API-åtkomst är ett policybeslut snarare än en egenskap. Inget av detta syns i en tabell över kostnad per uppgift, och allt är verkligt.
Det andra är att du kan pinna. En fast revision, finjusterad, som körs inom en gräns du kontrollerar, är något som kan visas för en revisor och som ett API inte kan tillhandahålla. För reglerad trafik är det värt mer än en prislista.
Den tredje — den man vanligtvis antar — är att det blir billigare. Det blir det inte. Checkpointen är en FP8-artefakt på 2,8 biljoner parametrar, och den publicerade vägledningen för driftsättning är utformad kring konfigurationer med flera acceleratorer snarare än en enda nod. Ett team som redan driver den typen av kluster har ett verkligt alternativ här, och kalkylen förändras helt, eftersom marginalkostnaden för en token blir el. Ett team som inte gör det jämför en API-räkning mot ett kapitalinköp, och API-räkningen vinner med bred marginal. Den ärliga sammanfattningen är att öppna vikter här ger dig möjligheten att lämna, inte möjligheten att köra billigt.
Båda på samma tangent, vilket är det som gör bytet användbart.
Kimi K3 finns på OrcaRouter till Moonshoots eget listpris – $3.00 och $15.00 per miljon tokens med $0.30 för cacheläsning, oförändrat från leverantörens prislista – och GPT-6.1 Sol landade på våra rutter till OpenAIs pris på releasedagen, $2.00 och $10.00 med cachad indata på $0.10 och 272 000-tokensteget fördes vidare exakt som listat. Inget läggs till på något av dem. Plattformen för vidare leverantörens listpris i stället för att lägga på marginal, så både en prisändring från Moonshoot och en prisändring från OpenAI visas hos oss samma dag som de visas hos leverantören, utan ett andra avtal eller en återförsäljare däremellan.

Anledningen till att detta spelar större roll för det här paret än för de flesta är att de två modellerna tillhör olika felmoder. GPT-6.1 Sol är modellen du kör för uthållig exekvering, verktygsloopar och faktatillförlitlighet; Kimi K3 är modellen du kör för mycket långa indata, där du vill ha bästa poäng för lång kontext och vill ha en checkpoint som en säkring mot någon annans affärsbeslut. Det är inte konkurrerande val; de är två vägar i samma trafik. Att hålla båda bakom en enda slutpunkt, med automatisk failover mellan dem och en regel som flyttar arbete med långa indata till K3 och exekveringsarbete till Sol, är det som omvandlar ”vi har en open-weight-fallback” från en rad i ett designdokument till något som fungerar klockan tre på morgonen i ett anrop som håller på att misslyckas.

Där var och en hör hemma
• Terminalagenter, kodning i reposkala, flerstegsutförande — GPT-6.1 Sol, med ett gap på 43 poäng i Terminal-Bench 4.0. Det är inte ens nära.
• Svar där en hallucination är dyr — GPT-6.1 Sol, med ett gap på 22 poäng i AA-Omniscience.
• Mycket långa indata med ett kort genererat svar — Kimi K3. Bästa resultatet för långkontextresonemang i den här jämförelsen, bildinmatning, och en ordrikedom som aldrig får en chans att komma till användning.
• Självhostning eller en inferensstack som du måste kunna frysa — Kimi K3, och endast om du redan driver hårdvaran. Checkpointen är slutleveransen; ekonomin för att köra den är separat.
• En gardering mot att en leverantör ändrar sina villkor — Kimi K3, och detta är det enda argumentet som GPT-6.1 Sol inte kan bemöta, oavsett pris.
• Att välja utifrån prislista — varken K3 eller Sol är det billiga alternativet i den här jämförelsen, och ingen av dem är det billiga alternativet i GPT-6-serien. Om fakturan är den avgörande faktorn finns modellen du vill ha längre ner i prislistan, inte någon annanstans i den här tabellen.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
