Een hero-titelkaart voor een artikel dat GPT-6 Sol Pro vergelijkt met Grok 4.7, met de tekst 'GPT-6 Sol Pro vs Grok 4.7' en de ondertitel 'Twee keer zo uitvoerig, een derde van de prijs'.
Guides & Insights

GPT-6 Sol Pro vs Grok 4.7: Tweemaal zoveel breedsprakigheid, een derde van de prijs

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De twee goedkoopste frontier-aanpalende modellen van september 2026 verschenen een dag na elkaar, en het interessante eraan is niet welke van de twee slimmer is. GPT-6 Sol — het model waar mensen naar grijpen wanneer ze GPT-6 Sol Pro zoeken, wat dat model is met zijn reasoning.mode ingesteld op pro in plaats van een apart product — kwam uit op 22 september 2026 voor $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens. Grok 4.7 van de leverancier kwam uit op 21 september voor dezelfde $2,00 input en $6,00 output. Op de neutrale testomgeving van Artificial Analysis liggen de twee twee indexpunten uit elkaar en ongeveer twee dollar per voltooide taak uit elkaar, en de reden voor dat verschil is niet het vermogen. Het is hoeveel tokens elk verbrandt om daar te komen.

Sol genereerde 77 miljoen outputtokens bij het draaien van de Intelligence Index. Grok 4.7 genereerde 240 miljoen. Die verhouding — iets meer dan drie tegen één — is de hele vergelijking, en die keert de conclusie die een prijstabel per token je geeft om.

De twee tariefkaarten, en waar de goedkope niet goedkoop is

Beide leveranciers publiceren deze cijfers zelf; geen van beide is onafhankelijk opnieuw geprijsd.

• Invoer — GPT-6 Sol $2,00 per miljoen tokens vs Grok 4.7 $2,00 per miljoen tokens

• Uitvoer — GPT-6 Sol $10,00 per miljoen tokens vs. Grok 4.7 $6,00 per miljoen tokens

Gecachte invoer — GPT-6 Sol $0,20 per miljoen tokens versus Grok 4.7 $0,50 per miljoen tokens; Sols cache-read is tweeënhalf keer goedkoper, wat het tegenovergestelde is van wat het opvallende outputtarief doet vermoeden

• Contextvenster — GPT-6 Sol 1.050.000 tokens vs Grok 4.7 500.000 tokens

• Toeslag voor lange context — GPT-6 Sol herprijst een verzoek boven 272.000 inputtokens tegen 2× input- en cachetarieven en 1,5× output voor het hele verzoek, tegenover Grok 4.7 die elk tarief verdubbelt bij 200.000 inputtokens, ook voor het hele verzoek

• Kennisafsluitdatum — GPT-6 Sol 20 april 2026 vs Grok 4.7, een pretrainingsafsluitdatum die naar verluidt juni 2026 is, met aanvullende training tot en met augustus

• Redeneerinspanning — GPT-6 Sol geen, laag, gemiddeld (standaard), hoog, extra hoog, maximaal vs. Grok 4.7 laag, gemiddeld (standaard), hoog, extra hoog

• Modaliteit — beide accepteren tekst en afbeeldingen als invoer en retourneren tekst

De cache-leesregel is degene waar een koper eens goed bij stil moet staan. Het outputtarief van Grok 4.7 is 40% lager, maar de gecachte invoer is 150% hoger, en gecachte invoer is waar lange agenthistories en herhaalde systeemprompts leven. Een workload die grotendeels een grote, stabiele context opnieuw leest, zal de twee modellen veel dichter bij elkaar vinden dan $6 tegenover $10 doet vermoeden.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Het onafhankelijke record, en het ene getal dat daarover beslist

Artificial Analysis is de enige testomgeving die beide modellen heeft gemeten, en de cijfers ervan zijn het waard om naast elkaar te leggen, omdat de divergentie leerzaam is.

• Intelligentie-index — GPT-6 Sol 48 bij maximale inspanning versus Grok 4.7 46 bij xhigh; beide ruim boven de mediaan van 25 voor vergelijkbare modellen

• Kosten per indextaak — GPT-6 Sol $1,06 vs Grok 4.7 $3,74

• Uitvoertokens voor de index-run — GPT-6 Sol 77M vs Grok 4.7 240M, tegen een mediaan van 88M

Uitvoersnelheid — Grok 4.7 gemeten op 39 tokens per seconde, wat de harness zelf als opvallend langzaam bestempelt; Sols waarde op dezelfde ranglijst wordt niet in dezelfde samenvattingsregel vermeld

• Coding Agent Index — GPT-6 Sol 57 tegen $2,99 per taak vs. Grok 4.7 56 met zijn eigen Grok Build-harness, een stijging van negen punten ten opzichte van Grok 4.6

Twee punten indexverschil, drieënhalf keer de kosten per taak. Dat is geen prijsanomalie — het is de rekensom van breedsprakigheid. Grok 4.7 is een model dat uitgebreid hardop nadenkt; de harness markeert het als "zeer breedsprakig" tegen een mediaan van 88 miljoen tokens, en de kosten volgen de tokens, niet de tariefkaart.

De vergelijking van coding-agents bevat een voorbehoud dat het scorebord verbergt. De 56 van Grok 4.7 wordt gemeten binnen xAI's eigen Grok Build-harness, de configuratie die xAI meelevert en waartegen wordt gebenchmarkt. De 57 van Sol wordt gemeten in een neutrale harness. Een voorsprong van een punt of twee door een first-party-harness valt ruim binnen het bereik dat de keuze van de harness verklaart, wat betekent dat de eerlijke lezing is dat deze twee gelijk staan op agentic coding — niet dat Sol één punt voorstaat.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Wat elke leverancier beweert, en wat geen van beide heeft aangetoond

Het lanceringsmateriaal van xAI is specifiek en het is een langetermijnverhaal: Grok 4.7 is gebouwd op een groter basismodel dan Grok 4.6 en kreeg een langere reinforcement-learning-run gericht op taken die "uren kunnen duren om te voltooien", waardoor zelfverificatie, het omgaan met lange contexten en gedrag binnen de Grok Bot-omgeving werden aangescherpt. Door de leverancier gerapporteerde cijfers zijn onder meer Terminal-Bench 4.0 op 38,0% tegenover 20,3% voor Grok 4.6, CursorBench 4.0 op 46,3% en DeepSWE v1.1 op 71,0%. Elk van die cijfers is xAI's eigen meting en geen ervan is onafhankelijk gereproduceerd; het onafhankelijke Terminal-Bench 4.0-cijfer dat circuleert ligt wezenlijk lager dan dat van de leverancier, wat het gebruikelijke patroon van dat verschil is.

OpenAI's claims voor GPT-6 Sol zijn dezelfde die hierboven al aan bod zijn gekomen, en ze hebben hetzelfde label. De door de leverancier gerapporteerde cijfers zijn 33,2% op AutomationBench bij xhigh-inspanning tegenover de 26,9% van Claude Opus 5 bij max, tegen ongeveer 9% van de kosten per taak, en 68,8% op DeepSWE v1.1 bij maximale inspanning — binnen 1,1 punt van Claude Fable 5 bij xhigh, tegen ongeveer 80% lagere kosten per taak. Let op waarmee wordt vergeleken: in OpenAI's eigen grafieken wordt Sol tegenover de modellen van Anthropic gezet, niet tegenover Grok 4.7. Geen van beide leveranciers heeft een rechtstreekse vergelijking met de andere gepubliceerd.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Waar de routeringslaag zijn plaats verdient

OrcaRouter voert geen van beide modellen in deze vergelijking — Grok 4.7 en GPT-6 Sol ontbreken beide in onze catalogus, dus niets hier is een bewering over hun prijs via ons. Wat een routeringslaag in deze specifieke combinatie waard is, is de faalmodus, niet de tariefkaart. De reden om naar Grok 4.7 te grijpen is zijn agentische gedrag over een lange horizon; de reden om er niet naar te grijpen is dat een uitvoersnelheid van 39 tokens per seconde een lange agentrun traag genoeg maakt om relevant te zijn, en een trage run is een run die een time-out kan krijgen. Automatische failover tussen providers betekent dat een langdurige taak kan worden gerouteerd naar welk model dan ook dat daadwerkelijk beschikbaar is, zonder dat die snelheid een single point of failure wordt, en de routerings-DSL drukt de modelkeuze uit als een regel binnen de aanroep in plaats van als een migratie — wat hier van belang is, omdat het juiste antwoord voor dit tweetal ervan afhangt of de taak tokenhongerig of latentiegevoelig is, en dat is een eigenschap van het verzoek, niet van het kwartaal.

De beslissingsregel

• Agentisch coderen met een vast budget — GPT-6 Sol. Capaciteitsniveau op de neutrale coding-index, tegen ongeveer een derde van de kosten per taak, omdat het dat bereikt met een derde van de tokens.

• Langetermijntaken waarbij de looptijd het punt is — Grok 4.7. De release is specifiek getraind voor werk van meerdere uren, en de leverancierscijfers op SWE-Marathon en CursorBench bewegen precies in die richting.

• Latentiegevoelig volume — geen van beide, op basis van de huidige gegevens. De kosten per taak van Sol zijn het betere cijfer, maar de gemeten 39 tokens per seconde van Grok 4.7 is een echte beperking voor alles wat interactief is.

• Grotendeels gecachte long-context-werkbelastingen — GPT-6 Sol, op de cache-leeslijn in plaats van de outputlijn. Bij $0,20 tegenover $0,50 per miljoen gecachte tokens, en met een venster dat twee keer zo groot is, wordt het argument sterker naarmate een groter deel van je prompt stabiel is.

• Als je vergelijking is gebaseerd op de tariefkaart per token — bouw die dan opnieuw op basis van kosten per taak. $6,00 tegenover $10,00 output is het minst informatieve paar getallen in dit artikel, en het is het paar waar elke bestaande pagina mee begint.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt