
Claude Opus 5.5 vs GPT-6 Astra: Een smaaktest die de benchmarks voorbijstreefde
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Iemand vroeg Claude Opus 5.5 om een korte video te maken over een rivaliserend lab dat Navier-Stokes oplost, plaatste het resultaat en schreef vervolgens de zin die deze vergelijking de moeite waard maakt: het model is "heel fijn", het heeft "een geweldige smaak", en het is de eerste Claude sinds Opus 4.7 die ze echt intensief willen draaien — maar ze houden nog steeds GPT-6 Astra en GPT-5.6 Sol als hun voornaamste werkpaarden, omdat hun werk onderzoeksintensief is. Dat zijn drie beweringen in één bericht, en ze trekken in verschillende richtingen. Een model kan het prettigste zijn om mee te werken en toch niet het model zijn waarnaar je productieverkeer routeert. De interessante vraag is niet welk model beter is. Het is welke van die twee oordelen de confrontatie met de cijfers doorstaat, en welke een uitspraak over smaak blijkt te zijn.
De post is het verslag van één praktijkbeoefenaar, geen benchmarkrun — zie het als een signaal over hoe het model aanvoelt in creatief en open werk, niet als bewijs over capaciteit. Alles wat hieronder numeriek is, is gelabeld met wie het heeft geproduceerd.
Wat een smaaktest je wel en niet kan vertellen
Het artefact doet er hier toe. Een video maken over een wiskundig resultaat is geen codeertaak met een geslaagd/gezakt-grens. Er is geen compilatiestap, geen testsuite, geen Terminal-Bench-harnas dat beoordeelt of het ding deugt. Het model moest een invalshoek kiezen, beslissen wat het zou tonen, het samenhangend houden en stoppen. Wanneer iemand uit de praktijk zegt dat een model "great taste" heeft, is dat wat diegene beschrijft: oordeel over reikwijdte en nadruk dat tot uiting komt in werk waar de specificatie bewust vaag is.
Dat is een echte capaciteit, en het is precies datgene wat benchmarksuites het slechtst meten. Het is ook de reden waarom dezelfde persoon een model kan prijzen en er toch niet op overstapt. Smaak is wat je wilt wanneer je aan het verkennen bent. Het is niet wat je wilt wanneer je 200.000 regels code moet auditen en een rekening moet verantwoorden.
Anthropics eigen framing bij de lancering wijst op hetzelfde vermogen, in proza in plaats van video: Claude Opus 5.5 wordt aangeprezen als minder "Claudish" schrijvend — minder inleidend gedraai, minder afzwakken, meer bereidheid om de kern vooraan te zetten. Onafhankelijke leesbaarheidsscores ondersteunen de richting van die claim, zelfs waar ze het oneens zijn over de omvang. De leverancier meldt ook dat een interne factchecktest 16 van de 18 pogingen doorstaat, tegenover nul van 18 voor zowel Claude Fable 5.1 als Claude Opus 5; dat cijfer is van Anthropic zelf, niet gereproduceerd, en moet als een claim worden gelezen, niet als een resultaat.
Twee scoreborden, één meningsverschil dat ertoe doet

Op ruwe gepubliceerde benchmarks staat Claude Opus 5.5 vaker wel dan niet aan de leiding ten opzichte van GPT-6 Astra. Het probleem is dat de twee meest geciteerde bronnen het niet eens zijn over de mate waarin.
De lanceringstabel van Anthropic zet Claude Opus 5.5 op 66,4% op Terminal-Bench 4.0, met GPT-6 Astra op 57,9% en Claude Fable 5.1 op 55,8%. Dat is een door de leverancier gerapporteerde voorsprong van 8,5 punten op agentic coding — het soort marge dat een discussie in een marketingdeck beslecht. Artificial Analysis, dat zijn eigen testharnas draaide, mat Claude Opus 5.5 op 59,6% op dezelfde benchmark: gelijk aan GPT-6 Astra bij xhigh effort, en ongeveer 11 punten boven Claude Opus 5. De voorsprong is in beide lezingen reëel. De omvang niet.
Waar de twee modellen van plaats wisselen, is nuttiger dan waar ze dat niet doen:
• Terminal-Bench 4.0 (agentic coding) — Claude Opus 5.5 66,4% volgens Anthropics eigen tabel, 59,6% volgens Artificial Analysis; GPT-6 Astra 57,9%.
• Humanity's Last Exam, met tools — Claude Opus 5.5 67,7% volgens opgave van de leverancier, onafhankelijk gemeten op 61,4%; GPT-6 Astra 57,2%.
• GDPval-AA v2.1 (praktijkgericht kenniswerk in 44 beroepen) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Beide cijfers zijn afkomstig van het onafhankelijke panel van Artificial Analysis, niet van de leverancier.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% vs. Claude Opus 5.5 58,7%. Dit is een duidelijke overwinning voor Astra, en het is de wetenschappelijk getinte agentische benchmark.
• AutomationBench — GPT-6 Astra 41,4% vs Claude Opus 5.5 40,0%. Krappe marge, maar opnieuw Astra.
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%. Binnen één punt.
Lees die lijst zoals iemand uit de praktijk dat zou doen. De onderzoeksintensieve workloads — die met een wetenschaps- of literatuurcomponent, die een lange lus met toolgebruik doorlopen en waarbij het model zich staande moet houden — zijn precies waar GPT-6 Astra standhoudt. De kenniswerk- en codingboards waar Claude Opus 5.5 met afstand wint, zijn de boards waarnaar je zou wijzen als het je werk was om software te shippen. Beide personen in dit gesprek lezen hun eigen benchmark correct. Ze lezen alleen verschillende benchmarks.
De inspanningsinstelling doet meer werk dan het model.
Er is een tweede, minder flatteuze reden waarom de kopmarges zacht zijn. De leveranciersvergelijkingen worden niet met dezelfde instelling uitgevoerd.
De gepubliceerde cijfers van Claude Opus 5.5 komen uit een extra-hoog (xhigh) reasoning-effort-configuratie, tegenover GPT-6 Astra op high. De onafhankelijke runs van Artificial Analysis zetten beide modellen op xhigh en het verschil in codeerprestaties verdwijnt — de voorsprong van 8,5 punt van de leverancier wordt een gelijkspel. Dat is geen beschuldiging van wangedrag; het is wat er gebeurt wanneer een leverancier de configuratie kiest die zijn model het beste laat uitkomen en een onafhankelijk lab de configuratie kiest die bij de concurrentie past. Voordat je een workload verplaatst op basis van een benchmarktabel, controleer op welke effort-instelling die is gedraaid, want het antwoord is vaak 'de flatteuze'.
De tokenrekening vertelt hetzelfde verhaal vanuit een andere invalshoek. In Anthropics eigen lanceringsmateriaal verbruikt Claude Opus 5.5 per probleem in de orde van 119.000 tokens, waarvan ongeveer 84.000 naar denken gaan, terwijl GPT-6 Astra vergelijkbare problemen in ongeveer 27.000 tokens oplost. Denktokens worden gefactureerd als outputtokens. Een model dat vier keer zoveel tokens gebruikt tegen een vijfde van de outputprijs, komt bijna op hetzelfde neer — en dat is nog voordat je meerekent dat het goedkopere model vaak juist het model is dat je toch al bereid zou zijn geweest om met een hogere inspanningsinstelling te draaien.
Er rust nog één extra voorbehoud, specifiek aan de kant van Claude Opus 5.5: de veiligheidsroutering van Anthropic kan sommige cyber- en bio-gerelateerde verzoeken naar een restrictievere route leiden, wat de gepubliceerde scores op die evaluaties naar beneden haalt ten opzichte van wat het onderliggende model zou produceren. Als je werk die domeinen raakt, zal de kloof tussen de benchmark en jouw ervaring reëel zijn, en die zal in de richting zijn dat de benchmark optimistisch is.
Wat een echte taak op elk kost

Claude Opus 5.5 is het goedkopere model op de tariefkaart, en het is niet eens in de buurt:
• Claude Opus 5.5 — $4,00 per miljoen input, $20,00 per miljoen output, $0,20 per miljoen gecachte input, $5,00 per miljoen cache-schrijfacties. 1M-token context, 128k maximale output.
• GPT-6 Astra — $10,00 per miljoen invoer, $50,00 per miljoen uitvoer, $1,00 per miljoen gecachte invoer, $12,50 per miljoen cache-schrijfacties. Boven 272.000 invoertokens in één verzoek, wordt het hele verzoek opnieuw geprijsd tegen $20,00 invoer en $100,00 uitvoer; het batchtarief is $5,00/$25,00.
Dus Claude Opus 5.5 is 2,5 keer goedkoper op input en 2,5 keer goedkoper op output, met gecachte input vijf keer goedkoper. Als je taken tokenvergelijkbaar zijn, is dat de hele beslissing en is de smaakkwestie decoratie.
De kanttekening over tokengebruik hierboven is wat ervoor zorgt dat het niet zo simpel is, en de long-context-prijsherziening van GPT-6 Astra is de andere valkuil. Kom je in één verzoek boven de 272.000 invoertokens, dan gaat het hele verzoek — niet alleen het overschot — over naar het long-context-tarief. Een onderzoeksworkload die een groot corpus in één aanroep propt, is precies de vorm die dit triggert. Batchverwerking tegen halve prijs is de legitieme ontsnappingsroute, en die zit in de langzamere wachtrij.
De eerlijke samenvatting is dat het kostenplaatje omkeert afhankelijk van wat je doet. Voor een taak waarbij beide modellen vergelijkbare tokens gebruiken, wint Claude Opus 5.5 op prijs met een ruime marge. Voor een lange agentische onderzoekslus waarin de tokenaantallen uiteenlopen zoals het eigen lanceringsmateriaal van Anthropic laat zien, convergeren de twee — wat een veel minder opwindende kop is dan een kostenbesparing van 40%, en dichter bij wat de praktijkdeskundige rapporteerde.
Waarom de gebruiker die veel onderzoek doet niet is overgestapt
Zet de stukjes in elkaar en de regel 'nog steeds een voorkeur voor Astra' is niet langer in tegenspraak met de regel 'geweldige smaak'. Het is dezelfde observatie vanaf een andere plek.
De workloads die de gebruiker noemde, zijn lang, open van opzet, maken gebruik van tools en zijn duur per uitvoering. Op die workloads voert GPT-6 Astra de wetenschaps- en automatiseringsranglijsten aan, gebruikt het een fractie van de denktokens, en — volgens onafhankelijke meting — presteert het gelijkwaardig op coderen zodra beide modellen op hetzelfde inspanningsniveau worden uitgevoerd. De voordelen van Claude Opus 5.5 concentreren zich in het werk waarbij je de output kunt zien en kunt beoordelen: proza, ontwerpkeuzes, het afbakenen van een dubbelzinnige briefing, beslissen wat een video over Navier-Stokes eigenlijk zou moeten tonen. Dat is smaak, en smaak is precies het deel dat niet op een benchmarkas voorkomt.
Als je hoopte op een eindoordeel dat één model wint, dan ondersteunt het bewijs dat niet. De verdedigbare versie is beperkter: Claude Opus 5.5 is het betere model voor werk waar het beoordelingsvermogen de bottleneck is, GPT-6 Astra is het betere model voor werk waar langdurige inspanning met een lange context de bottleneck is, en het prijsverschil tussen hen slinkt tot bijna niets bij het tweede soort werk. Dat is een routeringsbeslissing, geen conversie.
Beide uitvoeren zonder een migratie

Dit is het punt waarop de twee modellen ophouden een of/of-keuze te zijn. GPT-6 Astra staat vandaag op OrcaRouter tegen OpenAI's eigen lijstprijs — $10,00 input, $50,00 output, $1,00 voor cache-lezen, $12,50 voor cache-schrijven — met 0% opslag, de lijstprijs van de provider wordt rechtstreeks doorgegeven. Dat betekent dat een tariefwijziging van een leverancier dezelfde dag bij ons doorwerkt, in plaats van wanneer een reseller maar synchroniseert.
Claude Opus 5.5 is bereikbaar via de eigen API van Anthropic en diverse platforms van derden; we vermelden het niet als iets dat wij aanbieden, en je moet sceptisch zijn tegenover iedereen die het tegendeel beweert voordat het model zich heeft verspreid. Wat je vandaag kunt doen, is beide modellen achter één sleutel en één endpoint-vorm plaatsen, en per workload routeren in plaats van per voorkeur: stuur het open, oordeelsintensieve verzoek naar Claude Opus 5.5 en de lange onderzoekslus naar GPT-6 Astra zonder twee contracten of twee clientintegraties te onderhouden.
Automatische failover is wat dat veilig maakt om te testen. Een nieuw model is nog geen productiepad, en routering via één endpoint betekent dat een storing bij een provider of een rate limit het verzoek verplaatst in plaats van het te laten mislukken. Als je wilt ontdekken of het smaakverschil zich ook in je eigen werk voordoet, is dat de goedkope manier om daarachter te komen — laat het naast wat je al hebt draaien in plaats van het te vervangen, en laat je eigen suite beslissen in plaats van de launch-tabellen.
De vraag die de benchmarks niet kunnen beantwoorden
Twee dingen zijn de moeite waard om in de gaten te houden, en geen van beide is een extra benchmarkpunt.
Het eerste is of de asymmetrie in effort-instellingen wordt opgelost. Op dit moment levert een leverancierstabel bij xhigh tegenover een concurrent op high een voorsprong van 8,5 punt op, maar onafhankelijke tests bij overeenkomstige instellingen maken daar een gelijkspel van. Naarmate onafhankelijke labs runs met overeenkomstige instellingen publiceren op de science- en automation-boards waar GPT-6 Astra momenteel leidt, kan dat beeld zich in beide richtingen bewegen — en het zal bewegen op basis van bewijs, niet op basis van de framing van wie dan ook.
Het tweede is de kwestie van token-efficiëntie. Als de denkoverhead van Claude Opus 5.5 in een pointrelease daalt, wordt het tariefkaartvoordeel van 2,5x niet langer gecompenseerd en wint het prijsargument onbetwist. Als dat niet gebeurt, loopt de professional die GPT-6 Astra als belangrijkste driver aanhield niet achter op de nieuwscyclus. Diegene heeft de eigen werklast correct ingeschat, en de lanceringsstabel mat die simpelweg niet.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
