
Claude Opus 5.5 vs GPT-5.6 Sol: twee lanceringstabellen die elkaar nauwelijks overlappen
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Zet Claude Opus 5.5 en GPT-5.6 Sol deze week naast elkaar en het eerste dat je opmerkt is geen winnaar. Het is dat de twee leveranciers benchmarktabellen hebben gepubliceerd die nauwelijks een rij gemeen hebben. Het lanceringsmateriaal voor Claude Opus 5.5, uitgebracht op 22 september 2026, zet het 29 punten voor op GPT-5.6 Sol op Terminal-Bench 4.0. Het lanceringsmateriaal voor Sol, algemeen beschikbaar sinds 9 juli 2026, zet in plaats daarvan Terminal-Bench 2.1 voorop, waar Sol Ultra 91,9% scoorde, en de Artificial Analysis Coding Agent Index, waar het de toppositie innam met 80. Beide tabellen zijn echt. Beide zijn uitgevoerd door de leverancier die er als winnaar uitkomt. De nuttige vraag is niet welk model in abstracto beter is — maar welke benchmark, uitgevoerd onder wiens testharnas, je iets vertelt over je workload. Dat is een moeilijkere vraag dan beide lanceringsberichten je willen laten stellen, en het is degene waarop deze vergelijking is gebouwd.
De twee modellen, naast elkaar

• Leverancier — Anthropic vs OpenAI
• Uitgebracht — Claude Opus 5.5 op 22 september 2026 vs GPT-5.6 Sol op 9 juli 2026
• Prijs per miljoen tokens — $ 4,00 invoer / $ 20,00 uitvoer vs. $ 5,00 invoer / $ 30,00 uitvoer
• Cache-lezen — $0,20 per miljoen op Opus 5.5; het cachetarief van Sol wordt per platform vastgesteld en is niet als één vergelijkbaar cijfer gepubliceerd
• Contextvenster — 1M tokens bij beide
• Maximale output — 128K tokens op beide, met 300K op de Batch API van Anthropic achter een bètaheader
• Kennisafsluitdatum — juni 2026 voor Opus 5.5 vs. 16 februari 2026 voor Sol
• Redeneerbesturing — adaptief denken altijd aan, standaard medium inspanning, schaal loopt van laag tot max tegenover een instelling voor maximale redeneerinspanning plus een Ultra-modus die parallelle subagenten coördineert
• Line-up — Opus 5.5 is de eerste van een 5.5-familie, met Sonnet 5.5 en Haiku 5.5 beloofd in de komende weken, tegenover Sol als het vlaggenschip van een familie met drie niveaus, naast Terra en Luna
Twee van die rijen doen meer werk dan de rest. Het gat in de kennisafsluiting is vier maanden breed, wat van belang is als je prompts iets raken dat deze lente is gebeurd. En Opus 5.5 onderbiedt Sol nu op zowel de input- als de outputprijs — een ommekeer ten opzichte van drie maanden geleden, toen Sol de goedkopere manier was om output van frontier-kwaliteit te bereiken en Claude Opus 5 op $5/$25 stond.
De enige rijen waarin beide modellen daadwerkelijk voorkomen
Er is precies één gepubliceerde tabel die beide modellen bevat, en die is van Anthropic. Elk cijfer erin is door de leverancier gerapporteerd, geproduceerd door het bedrijf dat een van de twee modellen verkoopt:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-5.6 Sol 37,3%
• Terminal-Bench-Science 0.1 — 58,7% tegen 22,4%
• FrontierCode v1.1 (Main) — 54,4% vs. 47,5%
• CursorBench 4.0 — 57,8% vs 41,7%
• AutomationBench — 40,0% tegen 28,8%
• GDPval-AA v2.1 — 1846 Elo vs 1588
Dat is een volledige overwinning, en de marges op de twee Terminal-Bench-rijen zijn groot genoeg dat ze kritische beschouwing verdienen in plaats van acceptatie. Anthropics eigen voetnoot doet een deel van dat werk al voor je: de Opus 5.5 Terminal-Bench-run gebruikte xhigh effort in plaats van de standaard, en bij de standaard medium effort wordt het voordeel van FrontierCode kleiner tot 54,6% tegenover 47,5% — een verschil van zeven punten in plaats van de kopcijfers. Anthropic voegt ook een algemene waarschuwing toe aan de hele tabel, met de opmerking dat op dit capaciteitsniveau benchmarkmarges "een minder betrouwbare gids voor verschillen in de echte wereld" zijn en dat de interne kloof met Claude Fable 5.1 kleiner is dan de scores suggereren. Een leverancier die zijn eigen tabel relativeert, is de meest betrouwbare zin erin.
Merk ook op wat er in die tabel ontbreekt: elke benchmark waarin het model van OpenAI wint. Een leverancierstabel met alleen maar gunstige rijen is geen bewijs van een sweep; het is bewijs van rijselectie.
Wat de eigen cijfers van OpenAI zeggen
Het lanceringsmateriaal van Sol vertelt een ander verhaal, op andere benchmarks, met een andere harness. Gerapporteerd bij de lancering in juli:
• Terminal-Bench 2.1 — 91,9% voor Sol Ultra en 88,8% voor standaard Sol, tegenover Claude Mythos 5 op 88,0% en Claude Fable 5 op 84,3%
• Artificial Analysis Coding Agent Index — 80, destijds beschreven als state-of-the-art, 2,8 punten boven Claude Fable 5
• Agents' Last Exam, langdurige professionele workflows — 53,6, wat OpenAI rapporteerde als een voorsprong van 13,1 punten op Claude Fable 5
• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%
Geen van die rijen bevat Claude Opus 5.5, omdat het in juli nog niet bestond. De tabel van Sol was gebouwd om Fable 5 en Mythos 5 te verslaan, en dat doet hij. Of hij Opus 5.5 verslaat, wordt simpelweg door het materiaal van geen van beide leveranciers beantwoord — de twee tabellen zijn met twee maanden tussenpoos samengesteld tegen verschillende tegenstanders.
De SWE-Bench Pro-rij verdient een specifieke opmerking, want het is de enige plek waar OpenAI's lanceringsmateriaal zijn model ziet verliezen: 64,6% voor Sol tegenover 80% voor Claude Fable 5. OpenAI reageerde door de validiteit van de benchmark in twijfel te trekken, met de schatting dat ongeveer 30% van de taken kapot is. Dat kan heel goed waar zijn. Het is ook een nuttige herinnering dat "deze benchmark is gebrekkig" een bewering is die beide labs doen, en altijd over de benchmark waar ze verliezen.
Het harnasprobleem, dat niemands tafel oplost

De reden dat de twee tabellen niet overeenkomen, is niet dat één leverancier liegt. Het is dat agentische programmeerbenchmarks een model plus een scaffold meten, en de scaffolds verschillen. Terminal-Bench 4.0 en Terminal-Bench 2.1 zijn verschillende revisies van hetzelfde idee, uitgevoerd door verschillende mensen, met verschillende toolbudgetten en verschillende regels voor opnieuw proberen. De cijfers van Anthropic voor Opus 5.5 zijn geproduceerd in de harness van Anthropic; die van OpenAI voor Sol in Codex-achtige tooling. Zet je een van beide modellen in de harness van de ander, dan verschuiven de scores.
Onafhankelijke data, voor zover die bestaan, beschrijven een nauwere race dan beide tabellen. Een benchmark van een derde partij voor agenten uit augustus 2026, uitgevoerd over meerdere modellen op werk aan echte applicaties, noemde GPT-5.6 Sol de beste combinatie van nauwkeurigheid, kosten en snelheid — ongeveer $0,52 en vijf minuten per run — terwijl Claude Opus 5, niet 5.5, het nauwkeurigst was in 92% van de runs. Een aparte ranglijst voor bedrijfscodetaken zette Claude Opus 5 op de eerste plaats met 96,4%, met GPT-5.6 Sol op de derde plaats met 86,5%, waarbij Sol opnieuw werd vergeleken met de vorige Opus in plaats van de nieuwe. Geen van beide is een rechtstreekse vergelijking met Opus 5.5, en geen van beide beslecht iets. Ze tonen wel aan dat wanneer iemand anders dan een leverancier de vergelijking uitvoert, de marges klein worden.
De praktische les is om de tabellen niet langer als een ranglijst te lezen, maar als een lijst met hypotheses. Als jouw werk langdurige terminalautomatisering is, is de Terminal-Bench-kloof van Anthropic een hypothese die het waard is om op je eigen taken te testen. Als het gaat om meerstaps professioneel onderzoek, is het resultaat van Sol's Agents' Last Exam hetzelfde soort hypothese. Geen van beide getallen is zonder een run overdraagbaar naar jouw workload.
Kosten per voltooide taak, de enige kosten die ertoe doen
Op de tariefkaart is Claude Opus 5.5 nu in beide richtingen goedkoper: $4,00 tegen $5,00 voor invoer, $20,00 tegen $30,00 voor uitvoer, en een cache-leestarief van $0,20 dat 60% lager ligt dan wat Claude Opus 5 in rekening bracht. Voor een agent die bij elke beurt een lange systeemprompt opnieuw verzendt, is die cacheregel de dominante kostenpost en de reden waarom een langdurige sessie aanzienlijk goedkoper kan worden zonder enige wijziging aan de prompt.
Maar de prijs per token heeft nog nooit de factuur van een agent bepaald. Het argument van OpenAI voor Sol bij de lancering berustte op token-efficiëntie in plaats van het prijskaartje — OpenAI meldde een verbetering van 54% in de token-efficiëntie bij het coderen, waarbij de outputtokens en de verstreken tijd minder dan de helft bedroegen van die van Claude Fable 5, tegen ongeveer een derde lagere kosten. Anthropic maakt het spiegelbeeldige argument voor Opus 5.5: ongeveer 40% lagere kosten om op typische workloads te draaien dan Claude Opus 5, op een tariefkaart die slechts met 20% daalde, met klantverklaringen van Box, Kiro, Factory en GitHub die allemaal grote reducties in tokens of stappen aanhalen. Beide beweringen wijzen in dezelfde richting — het model dat in minder beurten klaar is, wint — en geen van beide wordt onafhankelijk gecontroleerd.
Waar onafhankelijke berekeningen van de kosten per taak bestaan, vallen die momenteel in het voordeel van Sol uit: één analyse die in september werd gepubliceerd, zette GPT-5.6 Sol op $1,56 per opgeloste issue op SWE-bench Verified bij 96,2% succes, tegenover Claude Opus 4.8 met 88,6%. Dat is Sol gemeten tegen een ouder Anthropic-model, niet tegen Opus 5.5, dus het is een uitgangspunt en geen eindoordeel — maar het is een herinnering eraan dat een model dat de issue in één poging oplost, goedkoper is dan een goedkoper model dat drie pogingen nodig heeft. De enige meting die dit voor jou beslecht, is je eigen taak, op beide manieren uitgevoerd, met de tokenaantallen voor je neus.
Dat is meer een routeringsprobleem dan een inkoopprobleem, en het is de moeite waard precies te zijn over welke kant ervan al oplosbaar is. GPT-5.6 Sol staat vandaag op OrcaRouter tegen OpenAI's eigen lijstprijs met 0% opslag — de lijstprijs van de provider wordt rechtstreeks doorgegeven, zodat een tariefwijziging van een leverancier dezelfde dag al aan onze kant live is in plaats van pas na een synchronisatie. Claude Opus 5.5 is nog niet een van onze routes; het is beschikbaar via Anthropic's eigen API en de grote clouds. Zodra het beschikbaar komt, bedient dezelfde sleutel beide, en dat is wat het experiment verandert in een routeringsregel in plaats van een tweede contract en een tweede SDK: stuur de workload naar het model waaraan je eigen cijfers de voorkeur geven, houd automatische failover op het andere gericht, en laat een routerings-DSL-regel per verzoek beslissen in plaats van per kwartaal. Een prijsverlaging aan beide kanten is een configuratiewijziging, geen migratie.

Waar de twee werkelijk van elkaar verschillen
Haal de benchmarks weg en er blijven vier verschillen over, allemaal controleerbaar:
• Kennisafsluitdatum. Juni 2026 voor Opus 5.5 tegenover 16 februari 2026 voor Sol. Vier maanden is een reëel gat voor alles wat te maken heeft met recente bibliotheken, recente gebeurtenissen of onlangs gewijzigde API's, en geen enkele benchmark legt dat vast.
• Veiligheidsroutering. Opus 5.5 wordt geleverd met veiligheidsmaatregelen van de klasse Fable 5.1: de meeste cyberbeveiligingsverzoeken worden omgeleid naar Claude Opus 4.8 en biologiewerk valt terug op Claude Opus 5, tenzij het account is geverifieerd. Als jouw product in een van beide domeinen zit, wordt een deel van jouw verkeer beantwoord door een kleiner model. Sol heeft geen equivalente gedocumenteerde routering, hoewel OpenAI wel zijn eigen cybergerelateerde veiligheidsevaluaties vermeldt.
• Orkestratie. Sol levert een Ultra-modus die meerdere parallelle subagenten coördineert, standaard vier, plus een instelling voor maximale reasoning-inspanning. Opus 5.5 heeft geen van beide als platformfunctie; de hefboom ervan is de effort-parameter, en multi-modelcompositie is iets wat je zelf bouwt of routeert in plaats van iets wat de leverancier je aanreikt.
Familie-economie. Sol is een van drie niveaus, met Terra en Luna daaronder — en de prijs van Luna werd met 80% verlaagd en die van Terra met 20% in een update van 30 juli. De goedkopere broertjes van Anthropic, Sonnet 5.5 en Haiku 5.5, zijn aangekondigd maar nog niet uitgebracht. Als je workload gemengd is, biedt OpenAI vandaag de dag de goedkopere treden.
Kiezen tussen hen
Kies Claude Opus 5.5 als je werk bestaat uit langdurige agentische codering of kenniswerk, als de prijs per token ertoe doet, als je prompts betrekking hebben op iets uit de laatste vier maanden, of als een context van 1M tokens tegen $0,20 per miljoen gecachete tokens is wat je architectuur betaalbaar maakt. Begin met gemiddelde inspanning, niet de geërfde instelling hoog, en meet of laag standhoudt.
Kies GPT-5.6 Sol als je een door de leverancier gebundelde orchestratiemodus wilt, als je vandaag al een goedkoper niveau onder het vlaggenschip nodig hebt in plaats van over een paar weken, of als je workload van het soort is dat het beste door Sols eigen lanceerbewijs wordt gedekt — professionele workflows met een lange horizon en computergebruik, waar het zijn sterkste resultaten rapporteerde.
Als je al op Claude Opus 5 werkt, let dan op: Opus 5.5 is geen drop-invervanging: thinking kan niet langer worden uitgeschakeld, geforceerd toolgebruik geeft een foutmelding, thinking-blokken zijn gebonden aan het model en het gesprek, en de oudere computer_20251124 computer-use-tool wordt niet geaccepteerd op de Claude API of Google Cloud. De eerste drie gelden ook voor Claude Fable 5.1. Overstappen naar Sol is een heel andere integratie.
Wat deze vergelijking echt zou beslechten, is één enkele onafhankelijke run van beide modellen bij gelijke inspanning, in een gelijke testomgeving, op dezelfde taakset. Tot deze week toe heeft niemand er een gepubliceerd. Totdat iemand dat doet, is het eerlijke standpunt het standpunt dat het bewijs ondersteunt: de tabel van Anthropic spreekt in het voordeel van Opus 5.5 en is door Anthropic geproduceerd; de tabel van OpenAI spreekt in het voordeel van Sol en is door OpenAI geproduceerd; de bestaande onafhankelijke resultaten vergelijken Sol met de vorige Opus en beschrijven een veel nauwere race; en de twee rijen die je factuur zullen bepalen — tokens per voltooide taak en cache-leesvolume — zijn de twee rijen die geen van beide leveranciers publiceert.
Vergeleken in dit artikel4
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
