Gegenereerde hero-titelkaart met als kop 'GPT-6 Luna vs Kimi K3', de ondertitel 'Vier keer de doorvoer, een dertigste van de prijs', een voettekst met de tekst 'Prijzen volgens OpenAI en Moonshot AI; indexcijfers volgens Artificial Analysis.', en het OrcaRouter-logo rechtsonder gecomponeerd.
Guides & Insights

GPT-6 Luna vs Kimi K3: vier keer de doorvoer, een dertigste van de prijs, één echte uitzondering

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee modellen, beide in de afgelopen drie maanden uitgebracht, beide gepositioneerd als de goedkope tier van een frontier-familie, en beide op dezelfde manier fout zitten over wat 'goedkope tier' betekent — wat helemaal niet zo is. Kimi K3 is het open-weight vlaggenschip van Moonshot AI, openbaar onder een gewijzigde MIT-licentie sinds 27 juli 2026, geprijsd op $3,00 per miljoen inputtokens en $15,00 per miljoen output, met cache-reads tegen $0,30. GPT-6 Luna is de volumetier van de leverancier, algemeen beschikbaar sinds 22 september 2026 tegen $0,10 en $0,50, met cache-reads tegen een cent. Dertig keer zoveel op input, dertig keer zoveel op output, en een licentie aan de ene kant die de andere tegen geen enkele prijs kan bieden.

De tariefkaart is echter niet wat deze combinatie bepaalt, want de tarieven liggen niet dicht genoeg bij elkaar om te moeten beslissen. Wat de doorslag geeft, is een getal dat geen van beide leveranciers in een kop zet: de gemeten outputsnelheid. Kimi K3 genereert 38,7 tokens per seconde. GPT-6 Luna genereert 153,9. Dat is een gat van een factor vier, en voor elke workload waarin het model een onderdeel in een lus is in plaats van een eindpunt waarmee een persoon praat, verandert een verschil in doorvoer van een factor vier de architectuur in plaats van de rekening.

Wat deze twee eigenlijk zijn

Kimi K3 is een mixture-of-experts-model met 2,8 biljoen parameters, waarvan 104 miljard parameters actief zijn per token, een contextvenster van 1.048.576 tokens, een uitvoerplafond van 1.048.576 tokens, en gewichten die op Hugging Face zijn gepubliceerd onder een aangepaste MIT-licentie. Het is het best scorende open-weight model op de onafhankelijke ranglijst — eerste van 112 open-weight modellen — en het staat bovenaan de WebDev-ranglijst van Code Arena met 1.679 Elo. Moonshot rapporteert 88,3% op Terminal-Bench 2.0, wat een cijfer van de leverancier is en niet onafhankelijk is gereproduceerd.

GPT-6 Luna is de kleine variant van OpenAI's GPT-6-generatie, onder GPT-6 Sol op $2,00/$10,00 en ver onder het vlaggenschip GPT-6 Astra op $10,00/$50,00. Tekst en afbeelding in, tekst uit, een contextvenster van 1.050.000 tokens met een maximale invoer van 922.000 en een uitvoerplafond van 128.000 tokens, en redeneerinspanning selecteerbaar van none tot en met low, medium, high, xhigh en max, met medium als standaard. Het is gesloten, met één identifier, en beschikbaar voor iedereen met een API-sleutel.

De ene is een download. De andere is een endpoint. Beide zijn geprijsd op volume. Dat is de vorm van de vergelijking.

De kaarten, regel voor regel

Eén regel per dimensie, beide zijden op elk:

Invoer per 1M — GPT-6 Luna $0,10 vs Kimi K3 $3,00

• Uitvoer per 1 miljoen — GPT-6 Luna $0,50 vs Kimi K3 $15,00

• Gecachte invoer per 1 mln. — GPT-6 Luna $0,01 vs. Kimi K3 $0,30, een tiende van het eigen invoertarief op beide kaarten

• Lange-contextclausule — GPT-6 Luna verdubbelt de input en cache en verhoogt de output met 1,5× boven 272.000 inputtokens, toegepast op het volledige verzoek, tegenover Kimi K3 waarvoor geen gelijkwaardige clausule op zijn kaart is gepubliceerd

• Contextvenster — GPT-6 Luna 1.050.000 tokens met 922.000 maximale invoer vs. Kimi K3 1.048.576 tokens

• Maximale uitvoer — GPT-6 Luna 128.000 tokens vs Kimi K3 1.048.576 tokens, acht keer het maximum

• Intelligence Index, onafhankelijk — GPT-6 Luna 37 bij maximale inspanning vs Kimi K3 44 bij maximale inspanning, dezelfde indexrevisie

• Score voor standaardinspanning — GPT-6 Luna 29 op zijn standaard medium versus Kimi K3 gemeten op zijn maximale instelling

• Kosten per Index-taak, onafhankelijk — GPT-6 Luna ongeveer $0,07 vs Kimi K3 $2,00

• Uitvoertokens tijdens de index-run — GPT-6 Luna 150M vs Kimi K3 160M, tegenover een mediaan van 88M op het scorebord; beide zijn veel uitgebreider dan het mediane model op het scorebord

• Uitvoersnelheid, onafhankelijk — GPT-6 Luna 153,9 tokens/sec vs Kimi K3 38,7 tokens/sec

• Gewichten — GPT-6 Luna gesloten, alleen via API versus Kimi K3 openbaar op Hugging Face sinds 27 juli 2026

• Licentie — GPT-6 Luna niet van toepassing vs Kimi K3 Modified MIT, wat niet hetzelfde instrument is als MIT

• Totaal aantal parameters — GPT-6 Luna niet bekendgemaakt vs Kimi K3 2.800 miljard, waarvan 104 miljard actief per token

• Opvallend bewijs — GPT-6 Luna tool calling en agentische loops tegen een tiende van een cent per duizend gecachte invoertokens versus Kimi K3 Code Arena WebDev #1 met 1.679 Elo, Terminal-Bench 2.0 88,3% door leverancier gerapporteerd, beste open-weightscore op het onafhankelijke scorebord

• Op OrcaRouter — GPT-6 Luna niet in onze catalogus, tegenover Kimi K3 die routeerbaar is tegen de lijstprijs van Moonshot

Generated two-column scoreboard titled 'GPT-6 Luna vs Kimi K3 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Output speed 153.9 tok/s, Context 1,050,000, Weights closed. Right column Kimi K3 rows: Price in/out $3.00 / $15.00, Cached input $0.30, AA Index at max effort 44, Output speed 38.7 tok/s, Context 1,048,576, Weights Modified MIT. Footer: 'Prices per OpenAI and Moonshot AI; index and speed per Artificial Analysis.'

Doorvoer is de specificatie die nooit de krantenkoppen haalt.

Een model van 38,7 tokens per seconde en een model van 153,9 tokens per seconde zijn niet hetzelfde product met een ander prijskaartje. Het zijn verschillende producten.

Neem een taak waarbij het model een antwoord van 1.500 tokens moet produceren — een samenvatting, een gestructureerde extractie, een codepatch met bijbehorende uitleg. Bij 153,9 tokens per seconde duurt dat antwoord ongeveer tien seconden. Bij 38,7 duurt het ongeveer negenendertig. Geen van beide cijfers omvat redeneertijd of netwerklatentie, dus het verschil in de praktijk is breder dan een factor vier, niet smaller.

Zet dat nu in een lus. Een agent die dertig modelaanroepen doet om één taak te voltooien — plannen, een tool kiezen, het resultaat lezen, de volgende stap bepalen, herhalen — produceert verspreid over die aanroepen misschien 15.000 outputtokens. GPT-6 Luna besteedt ongeveer 97 seconden aan genereren. Kimi K3 ongeveer 388. Dat is het verschil tussen een taak waarop een gebruiker wacht en een taak die een gebruiker inplant, en geen enkele mate van licentiepermissiviteit verandert dat.

De breedsprakigheid verergert het snelheidsprobleem in plaats van het te compenseren. Kimi K3 genereerde 160 miljoen outputtokens voor het voltooien van de onafhankelijke index, tegenover 150 miljoen van GPT-6 Luna — dus in die evaluatie produceerde het langzamere model ook iets meer tokens, niet minder. De twee modellen zijn even breedsprakig; ze zijn simpelweg niet even snel, en op een kaart waarop output wordt geprijsd, betaal je breedsprakigheid dubbel.

Het is goed om ronduit te zeggen dat dit geen defect in Kimi K3 is. Een model met 2,8 biljoen parameters en 104 miljard actieve parameters doet meer werk per token dan een model uit de kleinere klasse, en het doorvoercijfer is een meting van dat werk. De relevante vraag is of je werkbelasting dat werk nodig heeft. Als dat zo is, is 38,7 tokens per seconde de prijs van de capaciteit. Als dat niet zo is, betaal je dertigvoudig voor beraad waar je niet om hebt gevraagd.

Waar de zeven punten van K3 leven

Kimi K3 scoort 44 op de onafhankelijke Intelligence Index bij maximale inspanning. GPT-6 Luna scoort 37 bij dezelfde instelling. Zeven punten, op een samengestelde score waarbij één punt binnen de ruis van een herhaling valt — en qua kosten per voltooide taak schelen de twee ruwweg een factor achtentwintig: $2,00 tegenover ongeveer $0,07.

Die zeven punten zijn niet gelijkmatig verdeeld. De reputatie van Kimi K3 is geconcentreerd in coderen en in agentisch softwarewerk, en dat is de reden dat het model bestaat: de WebDev-ranglijst van Code Arena heeft het op de eerste plaats met 1.679 Elo, en het Terminal-Bench 2.0-cijfer van de leverancier van 88,3% is een meting van een coding-agent. De eigen codeerpositie van GPT-6 Luna is een stap achteruit in plaats van vooruit — de Coding Agent Index staat op 41, twee punten onder de GPT-5.6 Luna die het vervangt, met de dalingen geconcentreerd in SWE-Atlas-QnA en DeepSWE v1.1. Als jouw werk een agent is die software schrijft tegen een echte repository, dan is dat een indexkloof van zeven punten en een generatieregressie van twee punten die dezelfde kant op wijzen, en het pleidooi voor de goedkope tier wordt aanzienlijk zwakker.

Waar die zeven punten niet zitten, is precies de categorie werk waarvoor GPT-6 Luna is geprijsd. Classificatie, extractie, routing, bulk-samenvatting, de binnenste lus van een agent die een snelle ja-of-nee nodig heeft — bij dat soort taken produceren de twee modellen het overgrote deel van de tijd dezelfde bruikbare output, en het verschil zal het contact met je eigen evaluatieset niet overleven. De index meet een samengestelde score waarin langetermijnredeneren en coderen zwaar wegen, en geen van beide is wat een routeringsbeslissing vereist.

Eén voorbehoud dat bij de indexcijfers aan beide zijden hoort: dit bord is een doorlopende evaluatie en de herziening ervan doet ertoe. Eerdere momentopnames van hetzelfde leaderboard plaatsten Kimi K3 aanzienlijk hoger dan de 44 die onze opname vandaag laat zien, omdat de composiet, de harness en de modelset allemaal bewegen. Elke vergelijking die leunt op het precieze verschil tussen twee modellen op een doorlopende index, leunt op iets dat niet stil zal blijven staan. De eerlijke lezing is dat deze twee zich op hun plafonds in aangrenzende capaciteitsbanden bevinden, en dat de index je niet kan vertellen welke beter is voor jouw taak.

De uitzondering: wat Modified MIT je daadwerkelijk oplevert

De licentie van Kimi K3 is de enige dimensie waarop GPT-6 Luna tegen welke prijs dan ook geen antwoord heeft, en die verdient meer precisie dan de uitdrukking "open weights" gewoonlijk krijgt.

De gewichten zijn openbaar op Hugging Face en de licentie is Modified MIT, niet MIT. Dat onderscheid is belangrijk: een Modified MIT-licentie gaat doorgaans gepaard met voorwaarden — vaak de eis om een attributie weer te geven wanneer het model in een product boven een bepaalde schaal wordt gebruikt — en wie van plan is een commercieel product op de gewichten te bouwen, moet de daadwerkelijke juridische tekst lezen in plaats van de familienaam waarop deze lijkt. Dit is geen reden om het te vermijden. Het is een reden om het niet als MIT te beschrijven in een inkoopdocument.

Wat de download oplevert, is reëel en begrensd. Het levert een ondergrens op het gebied van kosten op, in die zin dat een vaste GPU-voetafdruk bij voldoende volume voordeliger kan uitvallen dan een verbruiksrekening. Het levert onafhankelijkheid van de roadmap van een leverancier op — een model dat je zelf host, kan niet onder je vandaan worden uitgefaseerd. Het levert de mogelijkheid op om te fine-tunen op je eigen distributie. En het biedt de optie om prompts binnen je eigen grens te houden, wat voor sommige teams de vergelijking al beëindigt voordat de prijs ter sprake komt.

Wat het kost, is de hardware. Een mixture-of-experts-model met 2,8 biljoen parameters en 104 miljard actieve parameters is geen model dat op een werkstation draait. Het serveren ervan met productiedoorvoer is een verbintenis op clusterschaal, met kapitaalkosten, operationele kosten en een latentieprofiel dat je bezit in plaats van huurt. Dat is geen argument tegen het zelf hosten van Kimi K3 — het is een argument dat de juiste vergelijking niet $15,00 per miljoen outputtokens tegen $0,00 is, maar $15,00 per miljoen outputtokens tegen een volledig toegerekende kostprijs per token waarin de chips en de mensen zijn meegerekend. Voor een klein aantal organisaties ligt dat getal lager. Voor de meeste niet, en het omslagpunt ligt verder weg dan de licentie doet aanvoelen.

Een van beide uitvoeren, of allebei

Kimi K3 staat op OrcaRouter tegen Moonshots lijstprijs, wat bij de pass-through-prijzen betekent dat een tariefwijziging van een leverancier dezelfde dag nog aan onze kant live staat. Automatische failover is het onderdeel dat juist voor dit model zijn plek verdient: een zelfgehoste of door derden geleverde Kimi K3-endpoint dat degradeert, is precies het scenario waarin je wilt dat de route verspringt zonder deployment, en een model van 38,7 tokens per seconde heeft minder ruimte om een trage upstream op te vangen dan een snel model.

GPT-6 Luna staat op het moment van schrijven niet in onze catalogus en wordt bereikt via OpenAI's eigen API, dus een team dat beide wil, draait één key voor Kimi K3 naast wat het al voor OpenAI gebruikt. Dit is ook de combinatie waarin de routing-DSL iets doet wat een hardgecodeerde splitsing niet kan: een regel die codeerwerk en werk met een lange horizon naar Kimi K3 stuurt en alles wat door programma's wordt verbruikt en kort is naar GPT-6 Luna, drukt een grens uit die elke keer verschuift wanneer een van beide leveranciers iets uitbrengt, en die verschuift als configuratie in plaats van als een codepad. Modelfusie is de andere configuratie die hier het vermelden waard is — een panel van één langzaam, zorgvuldig model en één snel, goedkoop model die samen antwoorden, waarbij het goedkope lid het volume doet en het dure de gevallen beoordeelt die ertoe doen, is een vorm waarin dit paar modellen ongewoon goed past, omdat de kostenasymmetrie tussen hen groot genoeg is dat het uitgeven van een Kimi K3-call aan een kleine fractie van het verkeer betaalbaar is.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Welke, en wanneer?

Kies GPT-6 Luna als je workload een hoog volume heeft, door programma's wordt verbruikt en latentiegevoelig is. Classificatie, extractie, routing, bulk-samenvatting, de inner loop van een agent. Met $0,10/$0,50, een gecachte read van één cent en vier keer de doorvoer van Kimi K3 is de rekensom allesbehalve nipt en is het latentieverschil niet marginaal. Stel de effort-parameter expliciet in, want de standaardwaarde is medium en het kopcijfer 37 is een maximum-effort-getal, en houd lange calls aan de goede kant van de grens van 272.000 tokens.

Neem Kimi K3 als je de gewichten nodig hebt, als je werk bestaat uit agentic coding tegen een echte repository waarbij zijn WebDev-positie en de door de leverancier gerapporteerde 88,3% op Terminal-Bench 2.0 het bewijs zijn dat ertoe doet, als je een uitvoerplafond boven 128.000 tokens nodig hebt, of als je organisatie geen prompts naar een gesloten endpoint kan sturen. Accepteer 38,7 tokens per seconde als onderdeel van de deal, en lees de Modified MIT-voorwaarden in plaats van ze te veronderstellen.

De fout die deze vergelijking uitlokt, is dat de dertigvoudige snelheid wordt behandeld als het antwoord op een vraag over capaciteit. Het is het antwoord op een vraag over tokens. De capaciteitsvraag wordt beslecht door of je de gewichten of de snelheid nodig hebt, en die twee antwoorden wijzen in tegengestelde richtingen.

Screenshot of the OrcaRouter model page for Kimi K3 showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, a FEATURED badge, the model id kimi/kimi-k3, Vision, Tools, JSON and Reasoning chips, a MoonshotAI attribution dated 2026-07-15, the description of a 2.8-trillion-parameter mixture-of-experts model with a 1M-token context window, input pricing of $3.00 and output of $15.00 per 1M tokens, a p50 time to first token of 8.11s, a p95 of 10.00s, and traffic of 1163.7M tokens over seven days.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt