
Grok 4.7 vs Claude Opus 5: Het prijsverschil is reëel, de pariteit niet
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Je kunt Grok 4.7 aanroepen voor $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens. Je kunt Claude Opus 5 aanroepen voor $5,00 en $25,00. Dat is een verschil van 4,2x op de uitvoer — het soort kloof dat een vergelijking doorgaans al beslecht voordat de benchmarks überhaupt zijn geopend. Deze vergelijking beslecht het niet. Op de versie van de Artificial Analysis Intelligence Index waartegen beide modellen momenteel worden afgezet — v4.3.2, de herziening die op 19 september 2026 is gepubliceerd — staat Claude Opus 5 op 51 en Grok 4.7, op 21 september 2026 door de leverancier uitgebracht, op 46. Vijf punten is geen afstraffing, maar de vorm van die vijf punten wel: Opus 5 wint acht van de tien evaluaties in die index. Het pleidooi voor het goedkopere model is de prijs, de context maakt geen verschil, en de enige plek waar het prijsvoordeel van Grok 4.7 het meest zou moeten tellen, is precies waar het verdwijnt.
Twee vlaggenschepen, twee heel verschillende prijslijsten
Claude Opus 5 is sinds 24 juli 2026 op de markt en is Anthropics vlaggenschip in de Opus-klasse, dat in het eigen aanbod van het bedrijf onder Claude Fable 5.1 staat. Het heeft een contextvenster van 1 miljoen tokens tegen een uniforme prijs — Anthropic stelt ronduit dat een verzoek van 900k tokens tegen hetzelfde tarief per token wordt gefactureerd als een verzoek van 9k tokens, zonder enige toeslag voor lange context — en een maximale output van 128K, uitbreidbaar tot 300K via de Message Batches API. Thinking is adaptief en standaard ingeschakeld, met een inspanningsladder van low, medium, high, xhigh en max, standaard ingesteld op high. De gewichten zijn gesloten.
Grok 4.7 is een dag oud. Het heeft een context van 500k tokens, accepteert tekst en afbeeldingen en retourneert tekst, en beschikt over een eigen instelknop voor redeneerinspanning. De catalogusprijs is $2,00 voor input en $6,00 voor output per miljoen tokens onder de 200k prompttokens, oplopend naar $4,00 en $12,00 op of boven die drempel; voor cache-leesacties geldt $0,50 en $1,00 in dezelfde twee tariefbanden. xAI vermeldt ook een snellere variant die ongeveer twee keer zo snel output levert voor ongeveer het dubbele tarief, hoewel die configuratie werd uitgebracht zonder dat er een gepubliceerde snelheidsmeting aan was gekoppeld. De gewichten zijn hier ook gesloten, wat het ontsnappingsluik "zelf draaien" wegneemt aan beide zijden van deze vergelijking.
Het onafhankelijke bestuur is niet dichtbij, en het is niet vleiend.
Beide modellen worden gescoord op de v4.3.2-index van Artificial Analysis, die tien evaluaties omvat op het gebied van agents, programmeren, algemene kennis en wetenschappelijk redeneren. Het naast elkaar zetten van de twee kolommen laat het kopcijfer van vijf punten er voordelig uitzien voor het goedkopere model — een enkel verschil van vijf punten in een samengestelde score kan veel verbergen, en hier verbergt het een bijna volledige overwinning.
• Samengestelde intelligentie — Grok 4.7 (xhigh): 46 op de Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (adaptief redeneren, maximale inspanning): 51 op dezelfde revisie.
• Moeilijk redeneren — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Een verschil van respectievelijk twaalf en elf punten, beide in het voordeel van Opus 5.
• Agentische terminals — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. Dit is het grootste enkele verschil op het bord, en het ligt op de benchmark die het dichtst bij echt autonoom werk komt.
• Automatisering op de werkplek — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Grok 4.7's enige duidelijke overwinning, en een echte — negen punten op de evaluatie die meet of een agent een workflow afmaakt zonder een guardrail te overtreden.
• Kennis en eerlijkheid — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Beide modellen hallucineren; Opus 5 doet dat minder op deze maatstaf.
• Lange context — Grok 4.7: AA-LCR v1.1 77%, venster 500k tokens. Claude Opus 5: 79%, venster 1M tokens.
• Kosten om de index te draaien — Grok 4.7: 240M outputtokens gedurende de evaluatie, door Artificial Analysis bestempeld als ongewoon verbose. Claude Opus 5: 140M. Grok 4.7 verbruikt 1,7x zoveel tokens om een lagere score te behalen.

Waar het prijsvoordeel van Grok 4.7 sneuvelt
Hier is de rekensom die de tarievenlijst verbergt. Neem een realistische agentische aanvraag: 30k inputtokens, 8k output. Grok 4.7 rekent $0,06 voor input en $0,048 voor output — ongeveer elf cent. Claude Opus 5 rekent $0,15 voor input en $0,20 voor output — ongeveer vijfendertig cent. Dat is een echte factor 3, en bij deze omvang is Grok 4.7 op basis van kosten alleen al de voor de hand liggende keuze.
Neem nu het verzoek waarop de marketing van Grok 4.7 zelf is gebouwd: een agentische sessie met een lange context. Duw de prompt voorbij 200k tokens en de tarieven van Grok 4.7 verdubbelen naar $4,00 in en $12,00 uit. Claude Opus 5 beweegt niet — het venster van 1M rekent een vlak tarief van $5,00 en $25,00. Bij 250k input en 8k output kost Grok 4.7 $1,00 in en $0,096 uit, ongeveer $1,10. Opus 5 kost $1,25 in en $0,20 uit, ongeveer $1,45. Het verschil is gekrompen van 3x naar ongeveer 1,3x. Duw verder — 400k, 500k, de top van het venster van Grok 4.7 — en het vlakke tarief van Opus 5 blijft het gat dichten terwijl het venster blijft doorgaan tot een miljoen tokens. Grok 4.7 is het goedkope model bij korte prompts en een bijna-gelijke op prijs bij de lange, wat de intuïtie omkeert die de prijzenpagina beoogt te creëren.
Twee kanttekeningen houden dit eerlijk. Ten eerste is de long-context-tier een gedocumenteerde structuur van lijstprijzen uit xAI's eigen modeldocumentatie, geen meting — echte rekeningen hangen af van caching, en het tarief van $0,50 voor gecachte reads van Grok 4.7 is echt goedkoop. Ten tweede heeft Artificial Analysis nog geen snelheidsmeting voor Grok 4.7 gepubliceerd, dus de "het is sneller"-helft van het goedkoop-en-snel-argument is momenteel niet geverifieerd. Wat wel is gemeten, is Opus 5 met 59 tokens per seconde en een tijd tot het eerste token van 49 seconden — traag, duur en op bijna elke kwaliteitsas vooruit.
Wat je daadwerkelijk zou routeren
Dit is een vergelijking waarbij het eerlijke antwoord verschilt per workload, en een router is de goedkoopste manier om daarnaar te handelen. Claude Opus 5 is beschikbaar op OrcaRouter, vermeld op zijn eigen modelpagina, waarbij de prijs van de provider wordt doorgegeven met 0% markup — dus de $5,00 en $25,00 van Opus 5 in onze catalogus zijn de lijstprijs van Anthropic, geen met markup verhoogde kopie, en als Anthropic die aanpast, verandert dat getal dezelfde dag nog op dezelfde sleutel. Grok 4.7 staat op het moment van schrijven niet in de OrcaRouter-catalogus; om het vandaag aan te roepen, ga je via de eigen API van xAI en de platforms van derden die het aanbieden. Die asymmetrie is het waard om te weten voordat je eromheen gaat architecteren.

Het routeringspatroon dat uit de cijfers volgt, is eenvoudig. Stuur werk met een lange context, veel redeneerwerk en terminal-agent-taken naar Opus 5 — het wint Terminal-Bench 4.0 met 23 punten voorsprong en biedt een tweemaal zo groot venster tegen een vast tarief, wat precies het profiel is van een zware, langdurige klus. Stuur volumineuze automatiserings- en workflowtaken naar Grok 4.7: het wint AutomationBench-AA met negen punten voorsprong en kost een derde daarvan bij korte prompts. Omdat beide via één endpoint bereikbaar zijn wanneer ze in de catalogus staan, is die splitsing een routeringsregel in plaats van een tweede leverancierscontract, en automatische failover betekent dat een snelheidslimiet op het ene pad een routeringsgebeurtenis wordt in plaats van een storing. Waar een workload echt beide nodig heeft — een goedkope eerste pass en een dure verificatiepass — voegt de routerings-DSL ze samen tot één aanroep in plaats van twee integraties.
Het vonnis
Als je op bewijs afgaat, wint Claude Opus 5 deze confrontatie en het is niet eens spannend: acht van de tien evaluaties, de twee grootste verschillen, tweemaal zoveel context bij een gelijkblijvende prijs, en een tokenbudget dat ruim onder twee derde van de omvang blijft voor een hogere score. De samengestelde score van vijf punten doet tekort aan hoe overtuigend de voorsprong is. De argumenten voor Grok 4.7 zijn beperkter dan zijn prijslijst suggereert, maar niet leeg — hij is oprecht goedkoper bij de promptgroottes die de meeste applicaties daadwerkelijk gebruiken, het is het betere automatiseringsmodel, en hij is pas een dag oud, met een leveranciersbenchmarksuite die nog onafhankelijk wordt gereproduceerd. Koop hem voor kostengevoelige automatisering, houd zijn snelheidscijfers in de gaten wanneer Artificial Analysis ze publiceert, en beschouw het prijsniveau voor lange contexten als hetgeen bepaalt of het goedkope model goedkoop blijft.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
