Een gegenereerde hero-titelkaart voor een artikel met de titel 'Grok 4.7 vs Grok 4.6 — dezelfde prijs, een ander model', met de ondertitel 'Wat de release van 21 september daadwerkelijk veranderde' en stat-chips met Terminal-Bench 4.0 38,0% vs 20,3%, AA Index 46 vs 44, en $2/$6 bij beide.
Guides & Insights

Grok 4.7 vs Grok 4.6: dezelfde prijs van $2/$6, een ander model eronder

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

SpaceXAI heeft Grok 4.7 op 21 september 2026 uitgebracht, en het eerste dat opvalt is wat niet is veranderd: de prijs. Grok 4.7 kost $2 per miljoen input-tokens en $6 per miljoen output-tokens, precies wat Grok 4.6 kost sinds de lancering op 12 augustus 2026. Dezelfde tariefkaart, hetzelfde contextvenster van 500.000 tokens, dezelfde tekst- en beeldinvoer — en toch liggen de twee modellen niet dicht bij elkaar op de evaluaties die belangrijk zijn voor agentisch werk. Volgens de eigen gepubliceerde cijfers van SpaceXAI verdubbelt Grok 4.7 bijna Grok 4.6 op Terminal-Bench 4.0, 38,0% tegen 20,3%. Dat is de hele vorm van deze vergelijking: een generatiewissel voor dezelfde prijs waarbij bijna alle winst op één plek landt, en de delen van Grok 4.6 die productieteams irriteerden zijn er nog steeds.

Wat is er eigenlijk veranderd tussen de twee modellen?

De eigen beschrijving die SpaceXAI van de release geeft, is beperkt, en het is de moeite waard de vorm ervan te citeren in plaats van de adjectieven. Grok 4.7 is gebouwd op een groter basismodel dan Grok 4.6, en kreeg een langere reinforcement-learning-run gericht op taken die "uren in beslag kunnen nemen." Het bedrijf zegt dat die run drie dingen heeft aangescherpt: zelfverificatie, het omgaan met lange contexten, en gedrag binnen de Grok Bot-omgeving. Er wordt niets beweerd over een nieuwe architectuur, een nieuwe modaliteit of een andere serving-stack.

Die framing is belangrijk omdat ze voorspelt waar de benchmarkwinsten opduiken, en ze duiken precies daar op. Een langere RL-pass over moeilijke taken van meerdere uren beïnvloedt terminal- en repositorywerk veel sterker dan een kennisquiz. Als je hoopte dat Grok 4.7 een breder model zou zijn dan Grok 4.6, zeggen de release notes iets anders — het is dezelfde modelvorm, verder getraind aan de moeilijke kant van agentisch werk.

Het parameterverhaal is het enige onderdeel hiervan dat geen openbaarmaking door een leverancier is. Musk zei begin september dat Grok 4.7 ongeveer 2,1 biljoen parameters heeft tegenover de 1,5 biljoen van Grok 4.6, een toename van 40%, en dat cijfer is sindsdien overal herhaald. Het is nooit op een specificatieblad van SpaceXAI verschenen. Beschouw het als een veelvuldig doorvertelde bewering over het basismodel, niet als een bevestigde specificatie — en merk op dat parameteraantallen heel weinig zeggen over serveerkosten of capaciteit wanneer de architectuur sparse is, wat bij de Grok-lijn het geval is.

De benchmarkkloof, met het sourcinglabel eraan gehecht

Elk cijfer in deze sectie is afkomstig uit het lanceermateriaal van SpaceXAI. Niets ervan is op het moment van schrijven onafhankelijk gereproduceerd, en de eerlijke manier om het te lezen is als een reeks beweringen die toevallig ongewoon specifiek is — waardoor het later controleerbaar is, maar het nu niet geverifieerd maakt.

• Terminal-Bench 4.0 — Grok 4.7 38,0% (volgens opgave van de leverancier) vs. Grok 4.6 20,3%. De grootste afzonderlijke delta in de release, en degene die overeenkomt met de bewering "langere RL op moeilijkere taken".

• CursorBench 4.0 — Grok 4.7 46,3% (door leverancier gerapporteerd) vs Grok 4.6 40,4%. Een echte vooruitgang, maar een bescheiden een — minder dan zes punten, op een benchmark die dichter bij alledaags werk in de editor ligt dan bij autonome terminalsessies.

• DeepSWE v1.1 — Grok 4.7 71,0% bij hoge reasoning effort (volgens opgave van de leverancier) tegenover Grok 4.6 65,2%. Wederom een solide, weinig spectaculaire verbetering.

• EEBench — Grok 4.7 64,0% (door de leverancier gerapporteerd). Er is geen cijfer voor Grok 4.6 samen met dit gepubliceerd, dus dit zegt niets over de upgrade.

• AA-Briefcase v1.1 — Grok 4.7 met 1.657 Elo (volgens opgave van de leverancier), bij de evaluatie voor professioneel kenniswerk.

Lees de lijst als een geheel en het patroon is consistent: Grok 4.7 is wezenlijk beter waar de taak lang en agentisch is, en marginaal beter waar de taak kort is. De sprong op Terminal-Bench is ruwweg een verdubbeling; de verbeteringen bij editor-werk zijn eencijferige percentages. Als je workload autocomplete-achtig is, betaal je dezelfde $2/$6 voor een kleine verbetering. Als je workload "twee uur laten draaien en dan terugkomen" is, is deze release direct op jou gericht.

Wat onafhankelijke meting tot nu toe zegt

Er bestaat één onafhankelijk getal, en het is de moeite waard om het zorgvuldig te vermelden, want het is gemakkelijk verkeerd te lezen. Artificial Analysis geeft Grok 4.7 een score van 46 op zijn Intelligence Index, versie v4.3.2, waarmee het 16e van de 655 modellen op de ranglijst staat. Grok 4.6 staat op 44 op dezelfde schaal. Een gat van twee punten op een samengestelde index is niet de verdubbeling die Terminal-Bench laat zien, en die discrepantie is informatief in plaats van tegenstrijdig: de index mengt redeneren, kennis, wiskunde en coderen, dus een grote winst in één agentisch segment wordt verwaterd door alles wat het model niet heeft veranderd.

Twee verdere details van dezelfde pagina zijn nuttiger dan de kopscore. Ten eerste genereerde Grok 4.7 240 miljoen outputtokens tijdens het draaien van de index, tegenover een mediaan van 92 miljoen — het is een breedsprakig redeneermodel, en bij een outputtarief van $6 per miljoen is die breedsprakigheid een kostenpost. Ten tweede plaatst de samengestelde score van de index het onder de sterkste modellen in zijn prijsklasse, wat de vergelijking is die er echt toe doet voor een koper. Artificial Analysis heeft geen ingevulde prijs voor Grok 4.7 gepubliceerd op de modelpagina, dus neem het kosten-per-taakcijfer daar niet vandaan; gebruik de $2/$6 van de leverancier.

A generated two-column comparison scoreboard for Grok 4.7 and Grok 4.6 with six rows: Terminal-Bench 4.0 38.0% vs 20.3%, CursorBench 4.0 46.3% vs 40.4%, DeepSWE v1.1 71.0% vs 65.2%, AA Intelligence Index 46 vs 44, context 500K on both, and price $2/$6 on both, with a footer noting all benchmark figures are vendor-reported and the index scores are per Artificial Analysis v4.3.2.

De prijskloof die geen van beide modellen oploste

Dit is het deel van de Grok 4.6-tariefkaart dat productieteams hebben leren haten, en Grok 4.7 heeft het niet veranderd. Onder 200.000 invoertokens is het tarief $2 voor invoer en $6 voor uitvoer. Daarboven krijgt het hele verzoek een nieuw tarief van $4 voor invoer en $12 voor uitvoer. Niet de overtollige tokens — het hele verzoek. Een aanroep van 210.000 tokens kost het dubbele van een aanroep van 199.000 tokens, voor 11.000 extra tokens.

Met een contextvenster van 500.000 tokens op beide modellen is het makkelijk om van die klif te lopen. Long-context agent runs en prompts voor hele repositories zijn precies de workloads waarvoor Grok 4.7 is afgestemd, wat betekent dat de beste use case van het model ook degene is die het vaakst de verdubbeling zal triggeren. Als je werk naar Grok 4.7 verhuist omdat het beter omgaat met lange agentische sessies, calculeer de prijsherziening dan in voordat je overstapt, niet erna.

Er is ook een snelheidsniveau om rekening mee te houden. SpaceXAI levert een snelle variant van Grok 4.7 die de uitvoersnelheid verdubbelt en de vermelde prijs verdubbelt. Dat is een legitieme ruil voor interactief programmeren, en een slechte voor batchwerk — dezelfde taak met dezelfde kwaliteit kost twee keer zoveel voor een besparing in kloktijd waar niemand naar kijkt.

Migreren van Grok 4.6 zonder een herschrijving

Het praktische goede nieuws is dat dit een modelwissel is, geen platformmigratie. Beide modellen nemen tekst en afbeeldingen als invoer en geven tekst terug, beide gebruiken dezelfde reasoning-effortniveaus van low tot en met xhigh, en de requestvorm is dezelfde die SpaceXAI sinds Grok 4.5 hanteert. Code die Grok 4.6 met een effort-parameter aanroept, heeft geen herstructurering nodig om Grok 4.7 aan te roepen.

Waar de overstap niet gratis is, is bij de evaluatie. De winst van Grok 4.7 is geconcentreerd in lange agentische runs, dus een testsuite die is opgebouwd uit korte prompts voor één beurt zal je bijna niets laten zien — je zult de verbetering ter grootte van CursorBench zien en concluderen dat de upgrade het niet waard was, terwijl het argument ervoor juist zit in taken die je suite nooit uitvoert. De meting die het echt zou beslechten, is taakvoltooiing bij meerstaps werk: geaccepteerde patches, geïntroduceerde regressies, tool-aanroepen per voltooide taak, en hoe vaak een run menselijke redding nodig heeft. Dat zijn de dimensies waar de eigen cijfers van de leverancier op wijzen, en het zijn de dimensies die geen enkele gepubliceerde benchmark voor jouw codebase dekt.

Uitvoerigheid is het tweede dat je moet meten. Een model dat 240 miljoen tokens op een standaardindex genereert, zal op jouw workload meer tokens genereren dan zijn voorganger deed, en bij $6 per miljoen output kan dat stilletjes de waarde van een upgrade tegen dezelfde prijs tenietdoen. Houd een week lang de outputtokens per voltooide taak bij voordat je je vastlegt.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), showing an Intelligence Index of 46 on index version v4.3.2, a 500k token context window, text and image input with text output, and a verbosity figure of 240M output tokens generated on the index.

Wie te bellen

De beslissing is echt eenvoudig, wat ongebruikelijk is voor een modelvergelijking. Grok 4.6 blijft de juiste keuze voor kortdurend, kostengevoelig verkeer: chat, classificatie, samenvatting en codehulp op editorschaal, waar de winst van Grok 4.7 klein is en de uitvoerigheid een belasting vormt. Grok 4.7 is de juiste keuze voor de workload waarvoor hij is gebouwd — langdurig agentisch coderen en terminalwerk waarbij een taak uren draait en zelfverificatie het verschil is tussen een afgeronde klus en een vastgelopen taak.

Beide draaien is hier geen compromis, het is het juiste antwoord, en het is goedkoop om te doen. Grok 4.6 staat in de catalogus van OrcaRouter tegen de lijstprijs van SpaceXAI met 0% marge die rechtstreeks wordt doorgegeven, dus het $2/$6-tarief hierboven is wat je betaalt — en omdat wij de lijstprijs van de provider doorgeven in plaats van er een marge op te zetten, staat elke prijswijziging van de leverancier dezelfde dag dat ze ingaat live aan onze kant. Eén API-sleutel dekt Grok 4.6 en meer dan 200 andere modellen, dus verkeer per taak tussen hen verplaatsen is een configuratiewijziging in plaats van een tweede contract. Als je Grok 4.7 op een productiepad wilt uitproberen voordat je het vertrouwt, is het veiligere patroon om de fallback op Grok 4.6 te houden — een model dat je vandaag kunt routeren — en automatische failover tussen providers de aanvraag terug te laten verplaatsen wanneer het nieuwe model zich misdraagt.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing SpaceXAI's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 500K token context window, and the reasoning and vision capability tags.

Wat nu te kijken

Twee dingen zullen deze vergelijking beslechten, en geen van beide is al gebeurd. Het eerste is een onafhankelijke reproductie van het Terminal-Bench 4.0-cijfer — 38% is een zodanig grote sprong dat iemand het opnieuw zal uitvoeren, en als het standhoudt, is het pleidooi voor Grok 4.7 in agentische pipelines sterk op basis van verdiensten in plaats van marketing. Het tweede is de rest van de Grok-roadmap: SpaceXAI heeft Grok 4.8, Grok 4.9 en Grok 5 publiekelijk na deze release ingepland, en Grok 4.6 zelf leefde maar ongeveer vijf weken. Grok 4.7 omarmen als langetermijnplatformaanname zou de fout herhalen die teams met Grok 4.5 maakten.

Voorlopig is de upgrade tegen dezelfde prijs reëel en is de koers duidelijk. Het getal om aan vast te houden is dat je voor $2/$6 een model kreeg dat op terminalwerk met een lange horizon ruwweg verdubbelt en elders nauwelijks beweegt — en dat is een specifieke, nuttige, controleerbare bewering in plaats van een generatiesprong.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt