
GPT-6 Sol vs Grok 4.7: Het goedkoopste uitvoertarief in de zaal, en het duurste gesprek
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Grok 4.7, de opvolger van Grok 4.6 van xAI, verscheen op 21 september 2026 voor $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens. GPT-6.1 Sol, de vernieuwing in het middensegment van OpenAI, verscheen acht dagen later, op 29 september, voor $2,00 input en $10,00 output. De inputtarieven zijn identiek, het outputtarief is 40% goedkoper bij Grok 4.7, en daar houden de meeste vergelijkingen op. Het is de verkeerde plek om te stoppen, want dezelfde onafhankelijke instantie heeft nu beide modellen van begin tot eind gemeten: Grok 4.7 verbruikte ongeveer 240 miljoen outputtokens bij het voltooien van de Artificial Analysis Intelligence Index; GPT-6.1 Sol verbruikte 67 miljoen. Vermenigvuldig je het goedkopere tarief met drieënhalf keer het volume, dan kost het model met de lagere prijs per token $3,74 per voltooide taak tegenover $0,72.
Twee modellen, acht dagen uit elkaar, en een tariefkaart die omkeert
Grok 4.7 is xAI's sterkste model voor coderen en kenniswerk: een contextvenster van 500.000 tokens, tot 450.000 uitvoertokens in één antwoord volgens de eigen specificaties van de leverancier, tekst-, afbeeldings- en bestandsinvoer, en redeneerinspanning instelbaar op laag, gemiddeld (standaard), hoog en extra hoog. xAI heeft het aantal parameters niet bekendgemaakt, en de pretraining-cutoff wordt gemeld als juni 2026 met aanvullende training tot en met augustus.
GPT-6.1 Sol is OpenAI's kleine versie-update van de GPT-6 Sol-tier, gepositioneerd onder GPT-6 Astra en boven GPT-6 Luna: 1.050.000 tokens context — ongeveer het dubbele van Grok — met een uitvoerplafond van 128.000 tokens, dat ongeveer een derde is van dat van Grok, een kennisafsluitdatum van 30 april 2026, en dezelfde tekst-, beeld- en bestandsinvoer. De redeneerladder loopt van laag tot max met een standaardwaarde van gemiddeld, en het accepteert de waarde "geen" helemaal niet meer.
Eén regel per dimensie, beide zijden op elk:
• Invoer — GPT-6.1 Sol $2,00 per 1 mln vs Grok 4.7 $2,00 per 1 mln; identiek
• Uitvoer — GPT-6.1 Sol $10,00 per 1 mln vs Grok 4.7 $6,00 per 1 mln; Grok is 40% goedkoper
• Gecachte invoer — GPT-6.1 Sol $0,10 per 1 mln vs Grok 4.7 $0,50 per 1 mln; Sol is vijf keer goedkoper, het tegenovergestelde van wat de uitvoerregel impliceert
• Contextvenster — 1.050.000 tokens vs 500.000
• Maximale uitvoer in één antwoord — 128.000 tokens vs 450.000 geclaimd
• Stap voor lange context — de hele aanvraag opnieuw geprijsd boven 272.000 invoertokens tegen 2× invoer en cache en 1,5× uitvoer vs elk tarief verdubbeld boven 200.000 invoertokens, ook voor de hele aanvraag
• Redeneerinspanning — low, medium (standaard), high, xhigh, max vs low, medium (standaard), high, xhigh
• Gewichten en parameters — gesloten, niet bekendgemaakt vs gesloten, niet bekendgemaakt; geen van beide geeft je een checkpoint
• Intelligence Index bij maximaal gepubliceerde inspanning — GPT-6.1 Sol 51,8 bij max vs Grok 4.7 46,4 bij xhigh
• Kosten per indextaak, onafhankelijk — $0,72 vs $3,74
• Uitvoertokens in de indexrun — 67 miljoen vs 240 miljoen, tegen een leaderboardmediaan van bijna 81 miljoen
Twee regels in die lijst vormen de hele vergelijking. Het outputtarief van Grok 4.7 is daadwerkelijk lager en zijn cacheregel is daadwerkelijk vijf keer hoger; en het genereerde drieënhalf keer zoveel tokens om te worden gemeten. De tariefkaart, op zichzelf gelezen, wijst de ene kant op. De meting wijst de andere kant op, met een factor vijf.

Waar Grok 4.7 daadwerkelijk vooroploopt
Het zou oneerlijk zijn om dit artikel als een verpletterende overwinning te presenteren, omdat Grok 4.7 wint op echte evaluaties. Naast elkaar gescoord op Artificial Analysis v4.3.2 met het maximale gepubliceerde inspanningsniveau — Grok op xhigh, Sol op max, een configuratieverschil dat je bij alles wat volgt in gedachten moet houden:
• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 vs. GPT-6.1 Sol Elo 1575,1. Een voorsprong van 140 Elo-punten op economisch waardevol kenniswerk, en de grootste afzonderlijke onafhankelijke overwinning voor het model met de goedkopere tariefkaart.
• AutomationBench-AA — Grok 4.7 0,6556 vs. GPT-6.1 Sol 0,6487. Feitelijk een gelijkspel, nominaal voor Grok.
• SciCode — Grok 4.7 0,5741 vs. GPT-6.1 Sol 0,5417. Een voorsprong van 3,2 punten op wetenschappelijk programmeren.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 vs. GPT-6.1 Sol 0,5606. Een achterstand van 30 punten, en de grootste kloof in het tweetal.
• Humanity's Last Exam — Grok 4.7 0,4314 vs. GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, redeneren met lange context — Grok 4.7 0,7667 vs. GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 vs. GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 vs. GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 vs. GPT-6.1 Sol 0,3171.
Drie van de negen evaluaties gaan naar Grok 4.7 of eindigen onbeslist, waaronder degene waar het moeilijkst iets tegen in te brengen is: GDPval-AA is ontworpen om economisch waardevol professioneel werk te beprijzen, en een Elo-voorsprong van 140 punten is geen ruis. Als jouw werklast van het soort is dat GDPval moest representeren — documentintensieve analyse, professionele deliverables, beoordelingskwesties met een juist antwoord — dan is het model met de goedkopere tariefkaart ook het betere model op de neutrale ranglijst, en de kosten-per-taak-penalty is wat je ervoor betaalt.
De eigen lanceringscijfers van xAI zijn groot en, zoals alle lanceringscijfers van leveranciers, niet gereproduceerd. CursorBench 4.0 op 46,3% bij xhigh tegen de 40,4% van Grok 4.6; Terminal-Bench 4.0 op 38,0% tegen 20,3%, de grootste enkele geclaimde toename in de release; DeepSWE v1.1 op 71,0% bij high tegen 65,2%; EEBench op 64,0% tegen 53,0%. Dat zijn de harness van xAI, de instellingen van xAI, de rapportage van xAI — en let op: de claim van 38,0% voor Terminal-Bench 4.0 staat tegenover de 0,2576 van het onafhankelijke leaderboard voor hetzelfde model op dezelfde benchmark, wat het soort discrepantie is dat je mag verwachten tussen de getunede configuratie van een leverancier en een neutrale max-effort-run.
OpenAI's cijfers voor GPT-6.1 Sol verdienen dezelfde korting en hebben dezelfde zwakte. Het enige getal in deze vergelijking dat geen van beide leveranciers heeft geproduceerd, is de kosten per voltooide taak, omdat het wordt berekend op basis van gemeten tokenverbruik in plaats van op basis van een scoretabel. Dat is het getal dat standhoudt.
Waarom 240 miljoen tokens de doorslag geven
Artificial Analysis beschrijft de breedsprakigheid van Grok 4.7 in zijn eigen samenvatting, en het tokenaantal achter de index-run is het bewijs: 240 miljoen outputtokens tegen een mediaan van het board van bijna 81 miljoen, ongeveer drie keer zoveel als een typisch model in dezelfde suite produceert. De 67 miljoen van GPT-6.1 Sol ligt ruim onder de mediaan. Zet de twee verhoudingen naast elkaar — 3,6× het volume tegen 0,6× de prijs — en het goedkopere outputtarief koopt meer tokens in plaats van een kleinere rekening, wat precies is hoe een verschil in kosten per taak van $3,74 tegenover $0,72 eruitziet.
Caching verandert de grootte van het effect, maar niet de richting, en dat is het detail waar mensen over struikelen. De gecachete invoer van Grok 4.7 is $0,50 per miljoen tegenover $0,10 voor Sol — vijf keer duurder op de lijn waar lange agenthistories en herhaalde systeemprompts zich bevinden. Voor een workload die wordt gedomineerd door het herlezen van een grote, stabiele prefix, liggen de twee modellen daarom dichter bij elkaar dan $6 tegenover $10 doet vermoeden, en zodra de breedsprakigheid van Grok daarbovenop komt, verder uit elkaar dan de invoertarieven doen vermoeden. De cachelijn en de tokenlijn wijzen hier dezelfde kant op, wat ongewoon is en deze combinatie schoner maakt dan de tariefkaarten suggereren.
De clausules voor lange context zijn het waard om apart te prijzen, omdat ze op verschillende punten in werking treden. GPT-6.1 Sol herprijst een volledige aanvraag boven 272.000 invoertokens; Grok 4.7 doet hetzelfde boven 200.000. Bij een aanroep van 250.000 tokens is Grok al verdubbeld — $4,00 en $12,00 met een cacheread van $1,00 — terwijl Sol nog op zijn standaardtarief van $2,00 en $10,00 zit. Tussen 200.000 en 272.000 tokens is het model met de goedkopere tariefkaart met ruime marge het duurdere, en die band komt veel voor bij documentwerk.
Waar Grok echt wint op structuur in plaats van op score, is bij het uitvoerplafond. Een maximale respons van 450.000 tokens tegenover de 128.000 van Sol is een ander soort artefact: een volledige gegenereerde codebase, een lang transcript, een boeklange synthese in één aanroep. Als je vandaag tegen outputplafonds aanloopt, beslist die regel de vergelijking en geldt niets van de kostenberekening hierboven — je kunt een capaciteit die het andere model niet heeft, tegen geen enkele prijs kopen.
Beide zitten op één toets, en dat is het handige.
Grok 4.7 staat op OrcaRouter tegen xAI's eigen lijstprijs — $2,00 en $6,00 per miljoen tokens met een cache-read van $0,50 en de stap van 200.000 tokens naar $4,00 en $12,00 die exact wordt doorgegeven zoals xAI het vermeldt — en GPT-6.1 Sol is geland op onze routes op de releasedag tegen OpenAI's prijs, $2,00 en $10,00 met gecachte input tegen $0,10 en de stap van 272.000 tokens ongewijzigd. Aan geen van beide wordt iets toegevoegd: het platform geeft de lijstprijs van de provider door in plaats van er een opslag op te zetten, wat betekent dat een prijsverlaging van een leverancier aan beide kanten hier dezelfde dag ingaat als daar, zonder tweede factuur en zonder wederverkoper ertussen.

Voor dit specifieke paar weegt dat zwaarder dan gemak. De twee modellen zijn het erover oneens waar ze goed in zijn — Grok 4.7 leidt op Elo voor professioneel werk en op wetenschappelijk programmeren, GPT-6.1 Sol leidt op terminaluitvoering, feitelijke betrouwbaarheid en het ophalen uit lange contexten — en de grens tussen die workloads is zichtbaar in je eigen verkeer voordat die zichtbaar is in een benchmark. GDPval-vormige verzoeken de ene kant op sturen en langdurige agent-runs de andere, achter één endpoint, met automatische failover over beide en een routeringsregel die je in de configuratie wijzigt in plaats van in een deployment, is een goedkopere manier om die grens te vinden dan een evaluatieproject. Modelfusie, waarbij een panel van modellen samen antwoordt, is de andere optie die het platform biedt als je liever helemaal niet per verzoek kiest.

De oproep
• Agentisch en terminalwerk met lange output, loops met gecachte prefix — GPT-6.1 Sol. Dertig punten op Terminal-Bench 4.0, een cachelijn die vijf keer goedkoper is en een vijfde van de kosten per afgeronde taak.
• Professioneel kenniswerk, documentanalyse, beoordelingstaken — Grok 4.7 dankzij een voorsprong van 140 punten in GDPval-AA Elo, waarbij de tokenrekening wordt begroot in plaats van aangenomen.
• Wetenschappelijk programmeren — Grok 4.7, nipt, op de SciCode-split van het scorebord. Toets het aan je eigen suite; 3,2 punten valt binnen het bereik dat een andere promptset kan verschuiven.
• Afzonderlijke antwoorden boven 128.000 outputtokens — Grok 4.7, en er is geen rekenkundige truc die daarvoor in de plaats komt.
• Verzoeken tussen 200.000 en 272.000 inputtokens — GPT-6.1 Sol, omdat Grok 4.7 zijn volledige verzoek al heeft verdubbeld en Sol niet.
• Goedkoopst mogelijke gesprek — geen van deze twee. Beide zijn modellen met frontierprijzen en frontier-tokenhonger; de vergelijking gaat erom welk model je taak afmaakt, niet welk model in abstracto goedkoop is.
• Als een vergelijking eindigt met "Grok is goedkoper per token" — dan eindigde die een stap te vroeg. De volgende stap is het tokenaantal, en dat is 240 miljoen tegen 67.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
