Hero-titelkaart gegenereerd voor Claude Sonnet 5.5 versus Claude Opus 5.5, met als ondertitel 'De benchmarks convergeren, de rekening niet', met $2,00 en $10,00 per miljoen tokens links tegenover $4,00 en $20,00 rechts, met het OrcaRouter-logo gecompositeerd in de rechteronderhoek.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5: De benchmarks convergeren, de rekening niet

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Claude Sonnet 5.5 bereikte algemene beschikbaarheid op 28 september 2026 voor $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens. Claude Opus 5.5, het vlaggenschip van Anthro​pic, kwam zes dagen eerder uit, op 22 september, voor $4,00 en $20,00 — precies het dubbele op beide lijnen. De voor de hand liggende interpretatie is dat Opus 5.5 het plafond is en Sonnet 5.5 het compromis dat je sluit wanneer het budget echt telt. De eigen lanceringstabel van Anthro​pic ondersteunt die interpretatie niet. Op basis van de cijfers die het bedrijf publiceerde, scoort Claude Sonnet 5.5 1844 tegenover 1846 van Opus 5.5 op GDPval-AA v2.1, 1811 tegenover 1822 op AA-Briefcase v1.1, en 70,6% tegenover 66,4% op Terminal-Bench 4.0 — het wint de enige benchmark die werk meet dat daadwerkelijk in een terminal wordt verricht. Twee regels onder die cijfers staat in het eigen onderschrift van Anthro​pic dat Opus 5.5 "duidelijk sterker blijft bij complex, open-ended werk." Beide beweringen zijn waar, en uitzoeken hoe je ze tegelijkertijd kunt vasthouden, is grotendeels waar deze vergelijking voor bedoeld is.

Wat de lanceringstabel zegt, en wat hij nalaat te zeggen

Het patroon in Anthropics benchmarkblok is een model dat het grootste deel van de kloof heeft gedicht, in plaats van een dat de leiding heeft genomen. GDPval-AA v2.1, een economisch gewogen takenreeks, is een tweepuntsverschil. AA-Briefcase v1.1, een evaluatie van documenten en deliverables, is een elfpuntsverschil. CursorBench 4.0 gaat de andere kant op: 55,5% voor Sonnet 5.5 tegen 57,8% voor Opus 5.5. OSWorld 2.1 komt uit op 80,1% tegen 81,8%, en Humanity's Last Exam op 64,5% met tools tegen 67,7%. Alleen Terminal-Bench 4.0 doorbreekt het patroon, en hoe — 70,6% tegen 66,4%, een voordeel van vier punten voor Sonnet bij agentisch command-linewerk.

Lees de rijlabels in plaats van de getallen en er verschijnt iets anders. Verscheidene van die Opus 5.5-vermeldingen bevatten een annotatie over de inspanning — 66,4% bij Xhigh — en een voetnoot stelt dat de Max-configuratie scoort lager dan Xhigh op FrontierCode, niet hoger. Hogere inspanning is niet monotoon. Een budgetbewust team dat aanneemt dat "max effort" een gratis upgrade is, koopt tokens voor een slechter antwoord op ten minste één van de eigen tests van Anthropic. En in FrontierCode 1.1 plaatst dezelfde voetnoot Sonnet 5.5 op 46,2% in de Max-configuratie tegenover 54,4% van Opus 5.5, wat het duidelijkste enkele getal is voor waar het vlaggenschip nog steeds afstand neemt: langetermijncodewerk onder een taakdefinitie die volharding beloont.

Er is nog één voorbehoud dat het waard is om ronduit te zeggen in plaats van te begraven. Anthropic merkt op dat de GDPval-AA- en AA-Briefcase-runs die het publiceert, zijn uitgevoerd op een pre-release-implementatie met een bug in gestructureerde outputs. Dat beïnvloedt beide modellen in dezelfde tabel, dus de vergelijking wordt niet ongeldig gemaakt, maar het betekent wel dat de absolute cijfers als een momentopname moeten worden behandeld en niet als een definitief resultaat. Benchmarktabellen van leveranciers zijn marketingartefacten met een methodologiebijlage, en deze komt met de bijlage eraan vast.

Waar de onafhankelijke meting uitkomt

Artificial Analysis scoort beide modellen onder een enkele harness, in dezelfde configuratie die het labelt als "Adaptive Reasoning, Max Effort, Default Fallback", op Intelligence Index v4.3. Claude Opus 5.5 staat op 58. Claude Sonnet 5.5 staat op 56. Dat is een verschil van twee punten op een schaal waar dezelfde evaluator Opus 5 op 51 zet, Sonnet 5 op 38, DeepSeek V4 Pro op 36 en Gemini 3.1 Pro Preview op 30. Een nieuwe Sonnet die twee punten onder het vlaggenschip en vijf punten boven de vorige Opus-generatie uitkomt, is de inhoudelijke claim van deze release, en het is een claim van een derde partij, niet van de leverancier.

Dan keert dezelfde pagina de economie ervan om. Artificial Analysis meldt dat een evaluatierun van Sonnet 5.5 $7,60 per taak kost, tegenover $5,98 voor Opus 5.5, ook al is Sonnet 5.5 half zo duur per token. De oorzaak staat gewoon op de pagina: Sonnet 5.5 genereerde 410 miljoen tokens over de index-suite, tegenover een mediaan van 88 miljoen voor de modellen die het volgt — "zeer breedsprakig", in de woorden van de evaluator. Opus 5.5 genereerde 260 miljoen over dezelfde suite. Bij $10 per miljoen outputtokens tegenover $20 blijft Sonnet 5.5 met een breedsprakigheidsfactor van ongeveer 1,6 toch zo'n 27% meer betalen per voltooide taak.

Dit is het deel van de vergelijking dat een prijslijst per token je niet kan laten zien, en het is de reden dat de twee cijfers zonder tegenstrijdigheid naast elkaar bestaan. Per token is Sonnet 5.5 half zo duur. Per afgeronde taak, op een evaluatiesuite met open prompts en zonder enige discipline wat betreft de lengte van de output, kan het duurder zijn. Welke van die twee jouw workload beschrijft, is de eigenlijke beslissing.

Inspanningniveaus, outputplafonds en de vorm van de integratie

Voor een koper zijn de mechanisch belangrijke eigenschappen tussen deze twee modellen bijna identiek.

• Context — 1.000.000 tokens op beide, van dezelfde provider, zodat aannames over prompt-engineering ongewijzigd overgedragen worden

• Maximale output — 128.000 tokens op beide; bulkgeneratie is hier geen onderscheidende factor

• Modaliteit — invoer van tekst, afbeeldingen en bestanden op beide; geen van beide accepteert audio of video

• Reasoning-besturing — adaptief denken op beide, waarbij de diepte wordt bepaald door een inspanningsparameter in plaats van een budget voor denktokens. Op het Claude Platform is de standaard hoog; in de Claude-apps is deze medium

• Cache-schrijven — $5,00 per miljoen voor Claude Opus 5.5 tegenover $2,50 voor Claude Sonnet 5.5, de enige regel waarop het goedkopere model ook het goedkopere model is om met een herbouwde prefix te voeden

• Cachelezen — $0,20 per miljoen voor beide, een exacte gelijke stand op de regel die lange agentruns domineert

Omdat de oppervlakken overeenkomen, is migratie tussen hen een wijziging van de model-string en een hermeting van de inspanning, geen integratieproject. Dat is ongewoon tussen leveranciers, en het is de reden waarom deze specifieke combinatie überhaupt het vergelijken waard is: de twee kandidaten verschillen in prijs en in diepgang, niet in de API die je moet schrijven.

Eén operationeel verschil verdient een eigen regel. Anthropic stelt dat Claude Sonnet 5.5 de eerste Sonnet is die wordt gelanceerd met cyberwaarborgen en fallbacks op gelijke voet met zijn topmodellen, wat betekent dat cyberbeveiligingsverzoeken met een hoger risico zichtbaar worden doorgestuurd naar de vorige Sonnet in plaats van te worden beantwoord door het model dat u heeft genoemd. Als uw workload dat domein raakt, is de modelstring geen garantie voor welk model heeft geantwoord — op geen van beide niveaus. Anthropic merkt ook op dat als u Sonnet uitvoert met thinking uitgeschakeld, u moet overschakelen naar een between-tools-gedrag, wat een codewijziging is in plaats van een configuratievlag. Geen van beide is een reden om het model te vermijden; beide zijn redenen om het te weten voordat u uitbrengt.

Op OrcaRouter, is Claude Opus 5.5 vandaag routeerbaar met dezelfde inloggegevens als elk ander model in de catalogus, tegen de lijstprijs van de aanbieder met 0% opslag, met automatische failover erboven. Claude Sonnet 5.5 is nog geen route op ons platform — het model is één dag oud, en totdat het wordt opgenomen is de eerlijke mededeling dat je het via hun eigen API zou bereiken. Iedereen die Opus 5.5 momenteel via ons draait, kan de overstap prijzen op de dag dat die beschikbaar komt, zonder dat er verder iets aan hun integratie hoeft te veranderen.

Welke waar te plaatsen

De verdeling die uit de cijfers volgt: Claude Sonnet 5.5 voor terminalgebonden agentwerk, waar het de sterkere van de twee is op Anthropics eigen Terminal-Bench 4.0-cijfer en de helft van de prijs kost; Claude Sonnet 5.5 voor alles wat op doorvoer is gericht, aangezien het kostenverschil alleen kleiner wordt wanneer de taak lange outputs afdwingt; Claude Opus 5.5 voor werk van FrontierCode-kaliber, langetermijnrefactors in grote codebases, en elke workload waarin de marge van 54,4% tot 46,2% de vorm van je werkelijke probleem weerspiegelt in plaats van een rij op een leaderboard.

Als je taken open-ended zijn en je de uitvoerlengte niet kunt voorspellen, beschouw de prijs per token dan helemaal als het verkeerde getal. Meet een week lang tokens per voltooide taak op je eigen verkeer voordat je je in welke richting dan ook vastlegt; het artificial-analysis-cijfer van $7,60 tegen $5,98 is een waarschuwing dat het goedkope model kan verliezen op de maatstaf waar je daadwerkelijk voor betaalt.

Het eerlijke oordeel: dit is niet langer een afweging tussen capaciteit en kosten. Het is de vraag of je werk afgebakend is. Voor afgebakende, hoogvolume-, toolgedreven taken is het goedkopere model op basis van het beschikbare bewijs ook het betere, en het vlaggenschip is niet het dubbele waard. Voor open-eindig, langetermijnwerk is Anthropics eigen zin — dat Opus 5.5 duidelijk sterker blijft — degene die je moet geloven, en geen enkele mate van benchmarkconvergentie verandert daar vooralsnog iets aan.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.