Een gegenereerde hero-titelkaart voor een artikel met de titel 'Grok 4.7 vs Kimi K3 — prijs tegenover context', met de ondertitel 'Twee frontiermodellen, twee verschillende weddenschappen' en stat-chips met de tekst: prijs $2/$6 vs $3/$15, context 500K vs 1M, en open weights nee vs ja.
Guides & Insights

Grok 4.7 vs Kimi K3: de helft van de prijs, de helft van de context, geen van de gewichten

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Neem een maand van 300 miljoen tokens aan agentisch codeerwerk en haal die door beide modellen tegen hun lijsttarieven, en de keuze ziet er ineens niet meer uit als een benchmarkdiscussie. Grok 4.7, die SpaceXAI op 21 september 2026 uitbracht, rekent $2 per miljoen inputtokens en $6 per miljoen output. Kimi K3, die Moonshot AI op 16 juli 2026 uitbracht, rekent $3 en $15. In die hypothetische maand — zeg 200 miljoen input en 100 miljoen output — komt Grok 4.7 uit op ongeveer $1.000 en Kimi K3 op ongeveer $2.100. Dat verschil is geen afrondingskwestie; het is een budget voor een tweede model. Daar staat tegenover dat Kimi K3 je een contextvenster van 1.000.000 tokens geeft in plaats van 500.000, native video-invoer naast afbeeldingen, en downloadbare gewichten. Grok 4.7 geeft je een sneller, goedkoper, gesloten model dat expliciet is getraind voor het langdurige terminalwerk waarop Kimi K3 zich ook richt. Beide zijn van frontierklasse. Het zijn niet dezelfde aankoop.

De twee modellen, in het kort.

Grok 4.7 is het grensverleggende codeer- en kenniswerkmodel van SpaceXAI, gebouwd op een groter basismodel dan Grok 4.6 en met een langere reinforcement learning-run gericht op taken die uren kunnen duren. Het is propriëtair — geen gewichten, geen download — biedt een contextvenster van 500.000 tokens, accepteert tekst en afbeeldingen en retourneert tekst, en ondersteunt reasoning-effort-niveaus van low tot xhigh. De voornaamste claim is snelheid en prijs: SpaceXAI positioneert het als ongeveer twee keer zo snel als vergelijkbare modellen voor ongeveer de helft van de prijs.

Kimi K3 is Moonshot AI's vlaggenschip open mixture-of-experts-model, het eerste open model in de klasse van drie biljoen parameters: 2,8 biljoen parameters in totaal met 104 miljard actief per token, gebouwd op Kimi Delta Attention en quantisatiebewuste MXFP4-gewichten. Het accepteert tekst, afbeeldingen en video, ondersteunt een context van 1.000.000 tokens, draait redenering altijd aan met configureerbare inspanning, en de gewichten zijn downloadbaar onder de Kimi K3-licentie — commercieel gebruik toegestaan, met beperkingen. Het is, door zijn ontwerp, het model dat je mee naar huis kunt nemen.

Dat is het hele structurele verschil tussen hen. De ene is een goedkoop, snel, gesloten eindpunt. De andere is een duurder, langzamer, open artefact met twee keer zoveel context. Alles hieronder is een gevolg daarvan.

Wat de benchmarks eigenlijk vergelijken

Dit is waar de meeste stukken over Grok 4.7 versus Kimi K3 de fout ingaan, dus het is de moeite waard om ronduit te zijn: de gepubliceerde cijfers van de twee modellen meten grotendeels niet hetzelfde, en ten minste één paar dat er vergelijkbaar uitziet, is dat niet.

Begin met het paar dat echt misleidend is. Het lanceringsmateriaal van Kimi K3 noemt een Terminal-Bench 2.1-score van 88,3. Het lanceringsmateriaal van Grok 4.7 noemt Terminal-Bench 4.0 op 38,0%. Dat zijn verschillende benchmarkversies met verschillende taaksets en verschillende scoring, en ze naast elkaar zetten zou suggereren dat Kimi K3 meer dan twee keer het agentische model is. Dat is geen verdedigbare lezing, en niemand zou die moeten herhalen. Beide cijfers zijn bovendien door de leverancier gerapporteerd — geen van beide is onafhankelijk gereproduceerd.

Wat kan worden vergeleken, is de onafhankelijke samengestelde score, en daarin liggen de twee dicht bij elkaar. Op de huidige Artificial Analysis Intelligence Index, versie v4.3.2, scoort Kimi K3 44 — tweede van 113 modellen, de hoogste positie van alle open-weightmodellen op de ranglijst. Grok 4.7 scoort 46, zestiende van 655. Twee punten uit elkaar, waarbij de positie van Kimi K3 is behaald met maximale reasoning-inspanning. Op de gecombineerde samengestelde score zijn deze modellen gelijkwaardig.

Onafhankelijke composiet — Grok 4.7 46 op AA Intelligence Index v4.3.2 tegenover Kimi K3 44 op dezelfde versie. In de praktijk een gelijkspel.

• Contextvenster — Grok 4.7 500.000 tokens vs. Kimi K3 1.000.000 tokens. Een echt, onvoorwaardelijk voordeel voor Kimi K3, en het enige specificatieverschil waaraan geen voorbehoud kleeft.

• Inputmodaliteiten — Grok 4.7 tekst en afbeelding versus Kimi K3 tekst, afbeelding en video. Kimi K3 is breder, als je werklast video bevat.

• Gewichten — Grok 4.7 propriëtair, geen download vs. Kimi K3 open gewichten onder de Kimi K3 License. Voor een on-premise- of air-gapped-vereiste is dit de enige regel die ertoe doet.

• Prijs per miljoen tokens — Grok 4.7 $2 invoer / $6 uitvoer vs Kimi K3 $3 invoer / $15 uitvoer, met Kimi's tarief voor gecachte invoer op $0,30 per miljoen. Grok 4.7 is goedkoper op elk vlak, en dramatisch goedkoper op uitvoer.

• Beheer van redeneerinspanning — Grok 4.7 van laag tot xhigh vs. Kimi K3 altijd aan met configureerbare inspanning. Functioneel vergelijkbaar; het verschil is dat je bij Grok 4.7 het redeneren kunt verlagen.

• Door de leverancier gerapporteerd agentisch bewijs — Grok 4.7 Terminal-Bench 4.0 38,0%, CursorBench 4.0 46,3%, DeepSWE v1.1 71,0% (allemaal door de leverancier gerapporteerd) vs. Kimi K3 Terminal-Bench 2.1 88,3%, Frontend Code Arena eerste plaats met 1.679 Elo (door de leverancier gerapporteerd bij de lancering). Niet vergelijkbaar — zie hierboven.

A generated two-column comparison scoreboard for Grok 4.7 and Kimi K3 with six rows: price $2/$6 vs $3/$15 per million tokens, context 500K vs 1M tokens, AA Intelligence Index 46 vs 44, weights proprietary vs open, modalities text and image vs text, image and video, and speed twice as fast vs slower output, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Waar het geld daadwerkelijk naartoe gaat

De tariefkaart doet de kloof tekort, omdat de twee modellen tokens anders verbruiken. Grok 4.7 is een breedsprakige redeneerder — Artificial Analysis mat 240 miljoen gegenereerde outputtokens tijdens het draaien van zijn Intelligence Index, tegen een mediaan van 92 miljoen over de modellen heen. Kimi K3 is op de tegenovergestelde manier duur: het is een groot always-on redeneermodel, en bij $15 per miljoen outputtokens is breedsprakigheid wat je koopt.

Het eerlijke kostenmodel is dus niet "$2/$6 versus $3/$15". Het is outputtokens per voltooide taak, vermenigvuldigd met het outputtarief, plus inputtokens inclusief elke nieuwe poging, vermenigvuldigd met het inputtarief. Een model dat een taak in één lange pass oplost tegen $6 per miljoen kan een model verslaan dat drie pogingen nodig heeft tegen $15 per miljoen, en het kan er ook van verliezen als de passes van het goedkope model lang genoeg zijn. Dat is een meting die je op je eigen repository uitvoert, niet een die iemand voor je publiceert.

Eén asymmetrie is het weten waard voordat je het uitvoert: Grok 4.6, de voorganger van Grok 4.7, hanteert een prijskloof bij 200.000 invoertokens, waarbij een aanvraag die de grens overschrijdt, de volledige aanvraag tegen het dubbele tarief herprijst. Lang-contextwerk aan de Grok-kant moet dat worden gecontroleerd tegen de actuele tariefkaart voor het model dat je inzet, omdat een venster van 500.000 tokens en een prijskloof bij 200.000 tokens slecht samengaan. De prijsstelling van Kimi K3 is vlak, wat het subtielere voordeel van de twee is.

Waar elk van breekt

Beide modellen hebben een faalwijze die het lanceringsmateriaal niet vooropstelt, en het zijn verschillende vormen van falen.

Kimi K3's is betrouwbaarheid onder aanhoudende belasting. Community- en onafhankelijke tests bij de lancering meldden dat de agentische prestaties afnemen naarmate runs langer duren — sterke resultaten bij één enkele poging, zwakkere aanhoudende slagingspercentages — en dat de outputsnelheid rond de 37 tot 38 tokens per seconde ligt, wat traag is voor interactief programmeren. Moonshot moest kort na de lancering ook nieuwe consumentenabonnementen tijdelijk stopzetten omdat de vraag het aanbod overtrof, wat iets zegt over de beschikbare servercapaciteit aan de gehoste kant.

Grok 4.7 heeft de tegenovergestelde vorm: het is snel, goedkoop en gesloten, wat betekent dat je het niet kunt inspecteren, het niet zelf kunt draaien en je niet kunt indekken tegen een deprecatie. SpaceXAI heeft Grok 4.8, Grok 4.9 en Grok 5 al publiekelijk na deze release in de planning gezet, en Grok 4.6 hield het ongeveer vijf weken vol voordat het werd opgevolgd. Alles wat je op Grok 4.7 bouwt, moet zo gebouwd worden dat de model-ID een configuratiewaarde is, geen aanname.

Er is een derde overweging die geen tekortkoming van een van beide modellen is: geen van beide is het juiste antwoord voor een autonome run van twee weken, en beide leveranciers hebben precies dat gedemonstreerd. De gepubliceerde demo's van 16 dagen en 48 uur autonoom coderen zijn door leveranciers uitgevoerd, op door leveranciers gekozen taken, zonder onafhankelijke reproductie. Ze zijn het weten waard en niet iets om je planning op te baseren.

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing Moonshot AI's list pricing of $3.00 per million input tokens and $15.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Beide uitvoeren, en waarom dat het echte antwoord is

Het kostengat en het contextgat wijzen in tegengestelde richtingen, wat het argument is om er niet één te kiezen. Kimi K3 verdient zijn prijs bij werk op repositoryschaal, waar een venster van 1M betekent dat je de input niet in stukken hoeft te hakken, en bij alles wat zelf gehost moet worden. Grok 4.7 verdient zijn prijs bij volume — agentloops met veel beurten, pijplijnen met veel tool-aanroepen, en lange terminalsessies waarin snelheid en outputkosten domineren.

Kimi K3 staat op OrcaRouter, wat die splitsing tot een routeringsbeslissing maakt in plaats van een inkoopbeslissing. Het staat in de catalogus tegen de lijstprijs van Moonshot, en omdat OrcaRouter de lijstprijzen van providers doorgeeft met 0% opslag, is een prijsverlaging van een leverancier hier live op dezelfde dag dat die wordt aangekondigd, in plaats van bij de volgende contractverlenging. Voor workloads waarbij een long-context-pass en een uitvoeringspass moeten samenwerken in plaats van concurreren — het ene model houdt de hele repository in het vizier, het andere handelt erop — stelt de routing-DSL meerdere modellen samen in één aanroep, en met model fusion kan een panel van modellen samen antwoorden wanneer de taak de extra uitgave waard is. Eén API-sleutel dekt Kimi K3 plus meer dan 200 andere modellen, zodat de uitvoeringshelft van die splitsing kan komen van welk model dan ook dat het goedkoopst en snelst is voor de taak, in plaats van van het model dat toevallig de context vasthoudt.

Eén ding moet duidelijk zijn: de open weights van Kimi K3 zijn downloadbaar, maar het gehoste endpoint is waar OrcaRouter naartoe routeert. Als jouw vereiste echt on-premise-inferentie is, dan is dat een selfhostingproject op je eigen hardware, geen routingbeslissing — en het is het enige scenario waarin deze vergelijking één juist antwoord heeft.

Het verdict, en het ene cijfer om aan vast te houden.

Als je op kosten en snelheid kiest, wint Grok 4.7, en het is niet eens spannend: de helft van de invoerprijs, minder dan de helft van de uitvoerprijs, sneller serveren, en een redeneerinstelling die je lager kunt zetten. Als je op context, breedte aan modaliteiten of de mogelijkheid om het model zelf te bezitten kiest, wint Kimi K3 even overtuigend. Als je alleen op capaciteit kiest, zegt de onafhankelijke samengestelde score dat ze twee punten uit elkaar liggen, en je moet op je eigen evaluatie afgaan in plaats van op de lanceringsgrafiek van een van beide leveranciers.

Het getal om aan vast te houden is dat van bovenaan: $2/$6 tegenover $3/$15. Al het andere in deze vergelijking is onderhandelbaar, en die verhouding niet.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt