
GPT-6 Luna vs Kimi K3: Fyra gånger så hög genomströmning, en trettiondel av priset, ett verkligt undantag
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Två modeller, båda släppta inom de senaste tre månaderna, båda positionerade som den billiga nivån i en frontlinjefamilj, och båda har fel om vad "billig nivå" innebär på samma sätt – vilket inte alls är fallet. Kimi K3 är Moonshot AI:s flaggskepp med öppna vikter, offentligt under en modifierad MIT-licens sedan den 27 juli 2026, prissatt till $3.00 per miljon indatatoken och $15.00 per miljon utdatatoken med cacheläsningar på $0.30. GPT-6 Luna är leverantörens volymnivå, allmänt tillgänglig sedan den 22 september 2026 till $0.10 och $0.50 med cacheläsningar på en cent. Trettio gånger på indata, trettio gånger på utdata, och en licens på ena sidan som den andra inte kan erbjuda till något pris.
Det är dock inte prislistan som avgör den här parkopplingen, eftersom den inte är tillräckligt jämn för att behöva avgöras. Det som avgör den är en siffra som ingen av leverantörerna sätter i en rubrik: uppmätt utdatahastighet. Kimi K3 genererar 38,7 tokens per sekund. GPT-6 Luna genererar 153,9. Det är en fyrdubbel skillnad, och för varje arbetsbelastning där modellen är en komponent i en loop snarare än en slutpunkt som en person pratar med, förändrar en fyrdubbel genomströmningsskillnad arkitekturen snarare än räkningen.
Vad dessa två egentligen är
Kimi K3 är en mixture-of-experts-modell med 2,8 biljoner parametrar, varav 104 miljarder parametrar aktiva per token, ett kontextfönster på 1 048 576 token, ett utdatatak på 1 048 576 token och vikter publicerade på Hugging Face under en modifierad MIT-licens. Det är den högst rankade modellen med öppna vikter på den oberoende resultattavlan – först bland 112 modeller med öppna vikter – och den innehar toppositionen på Code Arenas WebDev-topplista med 1 679 Elo. Moonshot rapporterar 88,3 % på Terminal-Bench 2.0, vilket är en leverantörssiffra och inte oberoende reproducerad.
GPT-6 Luna är den lilla nivån i OpenAI:s GPT-6-generation och ligger under GPT-6 Sol på $2.00/$10.00 och långt under flaggskeppet GPT-6 Astra på $10.00/$50.00. Text och bild in, text ut, ett fönster på 1 050 000 tokens med maximalt 922 000 i indata och ett utdatatak på 128 000 tokens, samt resonemangsansträngning som kan väljas från none via low, medium, high, xhigh och max, med medium som standard. Den är stängd, har en enda identifierare och är tillgänglig för alla med en API-nyckel.
Den ena är en nedladdning. Den andra är en slutpunkt. Båda är prissatta för volym. Det är formen på jämförelsen.
Korten, rad för rad
En rad per dimension, båda sidorna på varje:
• Indata per 1M — GPT-6 Luna $0.10 vs Kimi K3 $3.00
• Utdata per 1M — GPT-6 Luna $0,50 vs Kimi K3 $15,00
• Cachad indata per 1M — GPT-6 Luna $0.01 mot Kimi K3 $0.30, en tiondel av dess eget indatapris på båda korten
• Klausul för lång kontext — GPT-6 Luna fördubblar indata och cache och höjer utdata 1,5× över 272 000 indatatoken, tillämpas på hela begäran, medan Kimi K3 inte har någon motsvarande klausul publicerad på sitt kort
• Kontextfönster — GPT-6 Luna 1 050 000 tokens med 922 000 maximal indata kontra Kimi K3 1 048 576 tokens
• Maximal utdata — GPT-6 Luna 128 000 tokens vs Kimi K3 1 048 576 tokens, åtta gånger taket
• Intelligence Index, oberoende — GPT-6 Luna 37 vid maximal ansträngning vs Kimi K3 44 vid maximal ansträngning, samma indexrevision
• Poäng för standardansträngning — GPT-6 Luna 29 vid sin standardinställning medium jämfört med Kimi K3 mätt vid sin maxinställning
• Kostnad per Index-uppgift, oberoende – GPT-6 Luna cirka 0,07 $ jämfört med Kimi K3 2,00 $
• Utdatatokens i indexkörningen — GPT-6 Luna 150M vs Kimi K3 160M, mot en median på 88M för topplistan; båda är betydligt mer utförliga än topplistans medianmodell
• Utdatningshastighet, oberoende — GPT-6 Luna 153,9 tokens/sek vs Kimi K3 38,7 tokens/sek
• Vikter — GPT-6 Luna stängd, endast API mot Kimi K3 öppen på Hugging Face sedan 27 juli 2026
• Licens — GPT-6 Luna ej tillämplig vs Kimi K3 Modified MIT, vilket inte är samma instrument som MIT
• Totalt antal parametrar — GPT-6 Luna ej offentliggjorda vs Kimi K3 2 800 miljarder, varav 104 miljarder är aktiva per token
• Framträdande bevis — tool calling och agentiska loopar i GPT-6 Luna till en tiondels cent per tusen cachade indatatoken jämfört med Kimi K3 Code Arena WebDev #1 vid 1 679 Elo, Terminal-Bench 2.0 88,3 % enligt leverantören, högsta poäng för öppna vikter på den oberoende resultattavlan
• På OrcaRouter — GPT-6 Luna finns inte i vår katalog jämfört med Kimi K3 som kan routas till Moonshots listpris

Throughput är specifikationen som ingen gör rubriker om.
En modell med 38,7 token per sekund och en modell med 153,9 token per sekund är inte samma produkt med olika prislappar. De är olika produkter.
Ta en uppgift där modellen måste producera ett svar på 1 500 tokens – en sammanfattning, en strukturerad extrahering, en kodpatch med tillhörande förklaring. Vid 153,9 tokens per sekund tar det svaret ungefär tio sekunder. Vid 38,7 tar det ungefär trettionio. Ingen av siffrorna inkluderar resonemangstid eller nätverkslatens, så gapet i verkligheten är större än fyra gånger i proportion, inte mindre.
Sätt nu in det i en loop. En agent som gör trettio modellanrop för att slutföra en uppgift – planera, välj ett verktyg, läs resultatet, bestäm nästa steg, upprepa – producerar kanske 15 000 utdatatokens över dessa anrop. GPT-6 Luna lägger ungefär 97 sekunder på att generera. Kimi K3 lägger ungefär 388. Det är skillnaden mellan en uppgift som en användare väntar på och en uppgift som en användare schemalägger, och ingen grad av licenspermissivitet ändrar på det.
Ordrikheten förvärrar hastighetsproblemet i stället för att uppväga det. Kimi K3 genererade 160 miljoner utdatatoken när den slutförde det oberoende indexet, jämfört med GPT-6 Lunas 150 miljoner – så i den utvärderingen producerade den långsammare modellen också något fler token, inte färre. De två modellerna är lika ordrika; de är helt enkelt inte lika snabba, och på ett kort som prissätts efter utdata blir ordrikedom dyrt två gånger om.
Det är värt att säga rent ut att detta inte är en defekt i Kimi K3. En modell med 2,8 biljoner parametrar varav 104 miljarder aktiva utför mer arbete per token än en mindre modell i lägre klass, och genomströmningstalet är ett mått på det arbetet. Den relevanta frågan är om din arbetsbelastning behöver arbetet. Om den gör det är 38,7 tokens per sekund priset för kapaciteten. Om den inte gör det betalar du för eftertanke du inte bad om, trettio gånger om.
Var K3:s sju punkter bor
Kimi K3 får 44 på det oberoende Intelligence Index vid maximal ansträngning. GPT-6 Luna får 37 vid samma inställning. Sju poäng, på ett sammansatt mått där en poäng ligger inom bruset för en omkörning — och de två skiljs åt av ungefär tjugoåtta gånger i kostnad per slutförd uppgift, 2,00 dollar mot cirka 0,07 dollar.
De där sju poängen är inte jämnt fördelade. Kimi K3:s rykte är koncentrerat till kodning och agentiskt programvaruarbete, och det är anledningen till att modellen finns: Code Arenas WebDev-topplista har den på första plats med 1 679 Elo, och leverantörens siffra på 88,3 % för Terminal-Bench 2.0 är en mätning av kodningsagenter. GPT-6 Lunas egen kodningsposition är ett steg bakåt snarare än framåt – dess Coding Agent Index ligger på 41, två poäng under den GPT-5.6 Luna som den ersatte, med nedgångarna koncentrerade till SWE-Atlas-QnA och DeepSWE v1.1. Om ditt arbete är en agent som skriver programvara mot ett verkligt kodförråd, är det ett indexgap på sju poäng och en generationsregression på två poäng som pekar i samma riktning, och argumentet för den billiga nivån blir betydligt svagare.
Där de sju poängen inte gäller är den typ av arbete som GPT-6 Luna är prissatt för. Klassificering, extraktion, routing, massammanfattning, den inre loopen hos en agent som behöver ett snabbt ja-eller-nej — i dessa uppgifter kommer de två modellerna att producera samma användbara utdata i den överväldigande majoriteten av fallen, och skillnaden kommer inte att stå sig mot din egen utvärderingsuppsättning. Indexet mäter ett sammansatt mått som lägger stor vikt vid långsiktigt resonemang och kodning, och ingen av dem är vad ett routingbeslut kräver.
Ett förbehåll värt att fästa vid indexsiffrorna på båda sidor: den här resultattavlan är en rullande utvärdering och dess revidering spelar roll. Tidigare ögonblicksbilder av samma topplista placerade Kimi K3 väsentligt högre än de 44 som vår registrering visar i dag, eftersom kompositen, testramen och modelluppsättningen alla rör sig. Varje jämförelse som förlitar sig på den exakta skillnaden mellan två modeller i ett rullande index vilar på något som inte kommer att stå stilla. Den ärliga tolkningen är att dessa två ligger i intilliggande kapacitetsband vid sina tak, och att indexet inte kan säga dig vilken som är bättre för din uppgift.
Undantaget: vad Modified MIT faktiskt ger dig
Kimi K3:s licens är den enda dimension där GPT-6 Luna inte har något svar oavsett pris, och den förtjänar mer precision än vad frasen "open weights" vanligtvis får.
Vikterna är offentliga på Hugging Face och licensen är Modified MIT, inte MIT. Den distinktionen spelar roll: en Modified MIT-licens innebär vanligtvis villkor – ofta ett krav på att visa en attribution när modellen används i en produkt över en viss skala – och den som planerar att bygga en kommersiell produkt på vikterna bör läsa själva instrumentet snarare än det familjenamn den liknar. Detta är inte ett skäl att undvika den. Det är ett skäl att inte beskriva den som MIT i ett upphandlingsdokument.
Det som nedladdningen ger är verkligt och begränsat. Den ger ett golv för kostnaden, i den meningen att ett fast GPU-fotavtryck kan slå en mätarbaserad faktura vid tillräcklig volym. Den ger oberoende av en leverantörs färdplan – en modell du hostar kan inte fasas ut under fötterna på dig. Den ger möjligheten att finjustera på din egen distribution. Och den ger valet att hålla prompter inom dina egna gränser, vilket för vissa team avslutar jämförelsen innan priset nämns.
Det som kostar är hårdvaran. En mixture-of-experts-modell med 2,8 biljoner parametrar och 104 miljarder aktiva parametrar är inte en modell som körs på en arbetsstation. Att betjäna den vid produktionsgenomströmning är ett åtagande på klusterskala med en kapitalkostnad, en driftskostnad och en latensprofil som du äger i stället för hyr. Det är inte ett argument mot att självhosta Kimi K3 – det är ett argument för att den korrekta jämförelsen inte är 15,00 dollar per miljon utdatatoken mot 0,00 dollar, utan 15,00 dollar per miljon utdatatoken mot en fullkostnad per token som inkluderar kisel och personal. För ett litet antal organisationer är den siffran lägre. För de flesta är den inte det, och brytpunkten ligger längre bort än vad licensen får det att verka.
Kör en av dem, eller båda
Kimi K3 finns på OrcaRouter till Moonshots listpris, och med pass-through-prissättningen innebär det att en ändring av leverantörens pris slår igenom hos oss samma dag. Automatisk failover är den del som särskilt förtjänar sin plats för just den här modellen: en självhostad eller tredjeparts Kimi K3-endpoint som försämras är exakt det scenario där man vill att routen flyttas utan en driftsättning, och en modell med 38,7 token per sekund har mindre marginal att absorbera en långsam uppström än en snabb har.
GPT-6 Luna finns inte i vår katalog när detta skrivs och nås via OpenAIs eget API, så ett team som vill ha båda kör en nyckel för Kimi K3 vid sidan av vad det redan använder för OpenAI. Det här är också den kombination där routing-DSL:en gör något som en hårdkodad uppdelning inte kan: en regel som skickar kodning och långsiktigt arbete till Kimi K3 och allt programkonsumerat och kort till GPT-6 Luna uttrycker en gräns som flyttar sig varje gång någon av leverantörerna släpper något, och den flyttar sig som konfiguration snarare än som en kodväg. Modellfusion är den andra konfigurationen värd att nämna här — en panel med en långsam noggrann modell och en snabb billig modell som svarar tillsammans, där den billiga medlemmen gör volymen och den dyra avgör de fall som betyder något, är en form som detta modellpar passar ovanligt väl, eftersom kostnadsasymmetrin mellan dem är tillräckligt stor för att ett Kimi K3-anrop på en liten andel av trafiken ska vara överkomligt.

Vilken, och när?
Välj GPT-6 Luna om din arbetsbelastning är högvolym, programkonsumerad och latenskänslig. Klassificering, extrahering, routning, massammanfattning, den inre loopen i en agent. Vid $0.10/$0.50 med en cachad läsning för en cent och fyra gånger Kimi K3:s genomströmning är matematiken inte i närheten och latensskillnaden inte marginell. Ange effort-parametern uttryckligen, eftersom standardvärdet är medium och den marknadsförda 37:an är ett max-effort-tal, och håll långa anrop på rätt sida om 272 000-token-gränsen.
Ta Kimi K3 om du behöver vikterna, om ditt arbete är agentisk kodning mot ett verkligt repository där dess WebDev-position och leverantörsrapporterade 88,3 % på Terminal-Bench 2.0 är det bevis som spelar roll, om du behöver ett utdatatak över 128 000 tokens, eller om din organisation inte kan skicka prompter till en sluten endpoint. Acceptera 38,7 tokens per sekund som en del av uppgörelsen, och läs villkoren för Modified MIT i stället för att anta dem.
Misstaget som den här jämförelsen inbjuder till är att behandla den trettiofaldiga takten som svaret på en fråga om förmåga. Den är svaret på en fråga om tokens. Frågan om förmåga avgörs av huruvida man behöver vikterna eller hastigheten, och de två svaren pekar i motsatta riktningar.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
