
Claude Opus 5.5 vs Grok 4.6: Het ene model leest, het andere handelt
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Claude Opus 5.5 en Grok 4.6 zijn de twee goedkoopste manieren om een model van frontierklasse te kopen dat een half miljoen tokens context kan vasthouden — en het zijn niet hetzelfde product. Bij de ene meting zit Grok 4.6 drie punten onder het absolute plafond: 94,9 op GPQA Diamond, een wetenschappelijke vragenset op masterniveau waarop het vlaggenschip van Anthropic in dezelfde band zit. Bij de volgende staat het achtendertig punten achter. Op Terminal-Bench 4.0, de agentische terminalbenchmark die een model vraagt om echt werk in een shell af te maken, scoorde Artificial Analysis Grok 4.6 op 21,21% en Claude Opus 5.5 op 59,60%. Dat is in geen van beide richtingen een drukfout, en de hele vorm van deze combinatie zit hem in het verklaren waarom beide cijfers tegelijk waar zijn.
Twee releases, één prijsklasse, vier maanden uit elkaar
SpaceXAI bracht Grok 4.6 uit op 12 augustus 2026 als het huidige topmodel van de Grok-lijn, voor $2,00 per miljoen inputtokens en $6,00 output, met een contextvenster van 500.000 tokens en een invoeroppervlak voor tekst, afbeeldingen en bestanden. Anthropic bracht Claude Opus 5.5 uit op 22 september 2026, ongeveer zes weken later, voor $4,00/$20,00 met een contextvenster van 1.000.000 tokens en 128.000 outputtokens. Beide ondersteunen configureerbare reasoning-inspanning, tool calling en gestructureerde uitvoer; beide spreken zowel een OpenAI-compatibele chatinterface als het eigen formaat van hun leverancier.
Dus de naïeve lezing is een zuivere ruil: Grok 4.6 kost de helft voor input en ongeveer een derde voor output, en Claude Opus 5.5 antwoordt met een twee keer zo groot contextvenster. Die ruil is reëel, en bij werk met lange documenten is het misschien wel het enige dat ertoe doet. Het is ook niet waar de interessante divergentie zit, want de twee modellen zijn op dezelfde onafhankelijke harness gemeten en kwamen niet op dezelfde plek uit op de assen die van belang zijn voor agentisch werk.
Wat de catalogus zegt op de assen waarop beide zijn gemeten
De catalogus van OrcaRouter bevat per rij de herkomst van de benchmark — elk cijfer vermeldt de evaluator waar het vandaan komt — dus de onderstaande paren komen voor beide modellen allemaal van één bron, Artificial Analysis, in plaats van een leverancierscijfer aan de ene kant en een derde partij aan de andere:
• GPQA Diamond — Claude Opus 5.5 staat niet vermeld op deze as in onze catalogus; Grok 4.6 scoort 94,9%
• Humanity's Last Exam — 61,4% voor Claude Opus 5.5 tegen 42,9% voor Grok 4.6
• SciCode — 66,9% tegen 56,5%
• Recall bij lange context — 84,7% tegen 80,3%
• Terminal-Bench 4.0 — 59,60% tegen 21,21%
• AA Intelligence Index — 57,6 tegen 44,3
De GPQA-rij wordt aan de kant van Anthropic met opzet leeggelaten in plaats van gevuld vanuit een leveranciersdeck. De 94,9 van Grok 4.6 daar is het sterkste getal op zijn kaart en het is echt — een onafhankelijke meting, geen claim van SpaceXAI — en het zegt iets wezenlijks over het model: wanneer de taak een goed geformuleerde vraag met één verdedigbaar antwoord is, presteert Grok 4.6 op frontier-niveau. Lees het naast de 21,21% van Terminal-Bench 4.0, en de contouren worden zichtbaar. Het geven van een correct antwoord over wetenschap en het uitvoeren van een taak van vijf stappen in een shell op een echt bestandssysteem zijn verschillende competenties, en Grok 4.6 is veel verder gevorderd in de eerste dan in de tweede.
Eén voorbehoud bij die combinatie voordat ze als oordeel wordt gebruikt: de Artificial Analysis-cijfers van de twee modellen zijn op verschillende evaluatiedata vastgelegd, en die van Grok 4.6 vormen de oudere set. De vergelijking is tussen een model dat in augustus is geëvalueerd en een dat in september is geëvalueerd op een harness die in dat venster zelf is herzien. De richting van de kloof is consistent over vijf afzonderlijke assen, daarom behandelen we die als signaal, maar de exacte puntwaarden moeten worden gelezen als een augustus-versus-septembervergelijking, niet als een vergelijking van dezelfde dag.
Een index gebouwd door iemand die evenmin verkoopt
Er is een tweede, onafhankelijke maatstaf, en die is het eens over de richting, maar veel minder bereid om fijne onderscheidingen te maken. De Epoch Capabilities Index, opgesteld door Epoch AI als een composiet van meer dan vijftig benchmarks en herschaald zodat Claude 3.5 Sonnet op 130 staat en GPT-5 op 150, plaatst Claude Opus 5.5 op 167,35 in het bestand dat we op 2 oktober 2026 lazen. Grok 4.6 staat op 156,61, op basis van een evaluatie van 12 augustus. Dat is een gat van 10,74 punten op een schaal waar bij de lancering van de index ruwweg vijf punten overeen bleek te komen met een verdubbeling van METR's tijdshorizonmaatstaf — groot, en ruim buiten de gepubliceerde intervallen van de twee modellen van 164,0 tot 172,0 en 154,66 tot 158,93, die elkaar helemaal niet overlappen.
Het is de moeite waard op te merken wat deze index niet beslecht. Hij plaatst Claude Sonnet 5.5 op 165,2 en Claude Fable 5.1 op 164,82, beide boven Grok 4.6, en beide zijn per miljoen outputtokens goedkoper dan het tarief in de tweede schijf van Grok 4.6. Iedereen die alleen op capaciteit-per-dollar kiest, heeft een derde en vierde optie in dezelfde leveranciersfamilie, en de koppeling in dit artikel gaat over iets anders: waar de twee modellen ieder goed in zijn.
De tariefkaarten, en de rij die alleen op één ervan voorkomt.

De tariefkaart van Grok 4.6 bevat een staffel die die van Claude Opus 5.5 niet heeft: aanvragen boven 200.000 prompttokens worden tegen het dubbele basistarief gefactureerd, dus input gaat van $2,00 naar $4,00 en output van $6,00 naar $12,00, terwijl de cachelezing van $0,50 naar $1,00 gaat. Claude Opus 5.5 rekent $4,00/$20,00 met $0,20 voor cachelezingen, gelijk over het hele venster van 1.000.000 tokens. Die inversie is het praktische gevolg van het kopen van lange context bij een van beide modellen, en ze keert de stickervergelijking om zodra een workload daadwerkelijk groeit:
• Prijs bij 30.000 inputtokens — Claude Opus 5.5 is de dure optie, met ongeveer 28 cent voor 30.000 input en 8.000 output, tegenover ongeveer 11 cent voor Grok 4.6
• Prijs bij 250.000 inputtokens — de volgorde keert om, omdat Grok 4.6 naar zijn verdubbelde tarief is overgestapt, terwijl Claude Opus 5.5 dat niet heeft gedaan
• Cache-leesbewerkingen — $0,20 per miljoen voor Claude Opus 5.5, tegenover $0,50 voor Grok 4.6, oplopend tot $1,00 boven de staffel
• Maximale uitvoer — 128.000 tokens voor Claude Opus 5.5; het uitvoerplafond van Grok 4.6 wordt niet vermeld in het catalogusrecord
Grok 4.6 heeft ook één hiaat dat het waard is om ronduit te benoemen in plaats van het later te laten ontdekken. In het overzicht staat helemaal geen maximale uitvoerwaarde — het veld is ongemeten, niet nul — dus een workload die afhankelijk is van zeer lange individuele antwoorden heeft geen gepubliceerd getal om mee te plannen aan die kant van de vergelijking.
De prestatiekolom die niet gelezen mag worden
Onze catalogus bevat ook een paneel voor serveerprestaties per model, en bij Grok 4.6 is dat het meest misleidende onderdeel op de pagina. De kaart vermeldt een p50-latentie van 10.000 milliseconden en een foutpercentage van 97,58% over een periode van zeven dagen, met 26.184 tokens die in die periode zijn geserveerd. Die velden beschrijven geen langzaam model. Ze beschrijven een model dat nauwelijks werd aangeroepen: op dat verkeersniveau is de steekproef te gering om een latentieverdeling iets te laten betekenen, en het foutpercentage weerspiegelt een handjevol pogingen in plaats van een servicekwaliteit. Dat blok behandelen als bewijs dat Grok 4.6 langzaam is, zou neerkomen op het lezen van een meetartefact als een meting.
Het panel van Claude Opus 5.5 heeft daarentegen een populatie achter zich — een p50 in het bereik van 4,4 seconden over een venster van zeven dagen met dagelijkse samples, en 156 miljoen tokens die in dezelfde periode zijn verwerkt. Zelfs dat moet worden gelezen als wat het is: ons eigen playgroundverkeer, dat eerder een steekproef van onze gebruikers is dan een eigenschap van het model.
Welke je moet routeren, en hoe je dat zelf in je eigen werk kunt achterhalen
De tweedeling die de cijfers beschrijven, is stabiel genoeg om op te handelen. Claude Opus 5.5 is de keuze voor agentisch en langetermijnwerk — het verschil op Terminal-Bench 4.0 van 59,60% tegenover 21,21% is de grootste kloof op welke as dan ook waarop beide modellen zijn gemeten, en het is de as die voorspelt of een model een taak dan wel een vraag kan worden voorgelegd. Het is ook de keuze wanneer de prompt echt lang is, omdat het tarief niet in stappen omhooggaat en het venster twee keer zo groot is. Grok 4.6 is de keuze voor werk in de vorm van vragen op grote schaal: een GPQA Diamond-score van 94,9% voor $2,00/$6,00 binnen de eerste 200.000 tokens is een zeer goede deal voor workloads voor ophalen en beantwoorden die nooit doorgroeien naar de verdubbelde tarieftier.
Beide staan op OrcaRouter tegen de lijstprijs van de provider met 0% opslag — Claude Opus 5.5 voor $4,00/$20,00 met $0,20 voor cache-reads, Grok 4.6 voor $2,00/$6,00 waarbij de tier boven 200K exact wordt toegepast zoals SpaceXAI die instelt — achter één sleutel, zodat de bovenstaande verdeling op je eigen promptset kan worden getest in plaats van erover te discussiëren. Waar beide worden gerouteerd, automatische failover zit eronder, wat de moeite waard is wanneer het goedkopere model degene is die het agentische pad draaiende houdt.
Het oordeel dat deze combinatie verdient: Grok 4.6 is de betere lezer en Claude Opus 5.5 is de betere werker. De 94,9 op GPQA Diamond en de 21,21 op Terminal-Bench zijn hetzelfde model, tweemaal gemeten, en weten op welk van die twee getallen je werklast lijkt, is de hele beslissing.


Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
