
Claude Sonnet 5.5 vs Claude Opus 5.5: De benchmarks convergeren, de rekening niet
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Claude Sonnet 5.5 bereikte algemene beschikbaarheid op 28 september 2026 voor $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens. Claude Opus 5.5, het vlaggenschip van Anthropic, kwam zes dagen eerder uit, op 22 september, voor $4,00 en $20,00 — precies het dubbele op beide lijnen. De voor de hand liggende interpretatie is dat Opus 5.5 het plafond is en Sonnet 5.5 het compromis dat je sluit wanneer het budget echt telt. De eigen lanceringstabel van Anthropic ondersteunt die interpretatie niet. Op basis van de cijfers die het bedrijf publiceerde, scoort Claude Sonnet 5.5 1844 tegenover 1846 van Opus 5.5 op GDPval-AA v2.1, 1811 tegenover 1822 op AA-Briefcase v1.1, en 70,6% tegenover 66,4% op Terminal-Bench 4.0 — het wint de enige benchmark die werk meet dat daadwerkelijk in een terminal wordt verricht. Twee regels onder die cijfers staat in het eigen onderschrift van Anthropic dat Opus 5.5 "duidelijk sterker blijft bij complex, open-ended werk." Beide beweringen zijn waar, en uitzoeken hoe je ze tegelijkertijd kunt vasthouden, is grotendeels waar deze vergelijking voor bedoeld is.
Wat de lanceringstabel zegt, en wat hij nalaat te zeggen
Het patroon in Anthropics benchmarkblok is een model dat het grootste deel van de kloof heeft gedicht, in plaats van een dat de leiding heeft genomen. GDPval-AA v2.1, een economisch gewogen takenreeks, is een tweepuntsverschil. AA-Briefcase v1.1, een evaluatie van documenten en deliverables, is een elfpuntsverschil. CursorBench 4.0 gaat de andere kant op: 55,5% voor Sonnet 5.5 tegen 57,8% voor Opus 5.5. OSWorld 2.1 komt uit op 80,1% tegen 81,8%, en Humanity's Last Exam op 64,5% met tools tegen 67,7%. Alleen Terminal-Bench 4.0 doorbreekt het patroon, en hoe — 70,6% tegen 66,4%, een voordeel van vier punten voor Sonnet bij agentisch command-linewerk.
Lees de rijlabels in plaats van de getallen en er verschijnt iets anders. Verscheidene van die Opus 5.5-vermeldingen bevatten een annotatie over de inspanning — 66,4% bij Xhigh — en een voetnoot stelt dat de Max-configuratie scoort lager dan Xhigh op FrontierCode, niet hoger. Hogere inspanning is niet monotoon. Een budgetbewust team dat aanneemt dat "max effort" een gratis upgrade is, koopt tokens voor een slechter antwoord op ten minste één van de eigen tests van Anthropic. En in FrontierCode 1.1 plaatst dezelfde voetnoot Sonnet 5.5 op 46,2% in de Max-configuratie tegenover 54,4% van Opus 5.5, wat het duidelijkste enkele getal is voor waar het vlaggenschip nog steeds afstand neemt: langetermijncodewerk onder een taakdefinitie die volharding beloont.
Er is nog één voorbehoud dat het waard is om ronduit te zeggen in plaats van te begraven. Anthropic merkt op dat de GDPval-AA- en AA-Briefcase-runs die het publiceert, zijn uitgevoerd op een pre-release-implementatie met een bug in gestructureerde outputs. Dat beïnvloedt beide modellen in dezelfde tabel, dus de vergelijking wordt niet ongeldig gemaakt, maar het betekent wel dat de absolute cijfers als een momentopname moeten worden behandeld en niet als een definitief resultaat. Benchmarktabellen van leveranciers zijn marketingartefacten met een methodologiebijlage, en deze komt met de bijlage eraan vast.
Waar de onafhankelijke meting uitkomt
Artificial Analysis scoort beide modellen onder een enkele harness, in dezelfde configuratie die het labelt als "Adaptive Reasoning, Max Effort, Default Fallback", op Intelligence Index v4.3. Claude Opus 5.5 staat op 58. Claude Sonnet 5.5 staat op 56. Dat is een verschil van twee punten op een schaal waar dezelfde evaluator Opus 5 op 51 zet, Sonnet 5 op 38, DeepSeek V4 Pro op 36 en Gemini 3.1 Pro Preview op 30. Een nieuwe Sonnet die twee punten onder het vlaggenschip en vijf punten boven de vorige Opus-generatie uitkomt, is de inhoudelijke claim van deze release, en het is een claim van een derde partij, niet van de leverancier.
Dan keert dezelfde pagina de economie ervan om. Artificial Analysis meldt dat een evaluatierun van Sonnet 5.5 $7,60 per taak kost, tegenover $5,98 voor Opus 5.5, ook al is Sonnet 5.5 half zo duur per token. De oorzaak staat gewoon op de pagina: Sonnet 5.5 genereerde 410 miljoen tokens over de index-suite, tegenover een mediaan van 88 miljoen voor de modellen die het volgt — "zeer breedsprakig", in de woorden van de evaluator. Opus 5.5 genereerde 260 miljoen over dezelfde suite. Bij $10 per miljoen outputtokens tegenover $20 blijft Sonnet 5.5 met een breedsprakigheidsfactor van ongeveer 1,6 toch zo'n 27% meer betalen per voltooide taak.
Dit is het deel van de vergelijking dat een prijslijst per token je niet kan laten zien, en het is de reden dat de twee cijfers zonder tegenstrijdigheid naast elkaar bestaan. Per token is Sonnet 5.5 half zo duur. Per afgeronde taak, op een evaluatiesuite met open prompts en zonder enige discipline wat betreft de lengte van de output, kan het duurder zijn. Welke van die twee jouw workload beschrijft, is de eigenlijke beslissing.
Inspanningniveaus, outputplafonds en de vorm van de integratie
Voor een koper zijn de mechanisch belangrijke eigenschappen tussen deze twee modellen bijna identiek.
• Context — 1.000.000 tokens op beide, van dezelfde provider, zodat aannames over prompt-engineering ongewijzigd overgedragen worden
• Maximale output — 128.000 tokens op beide; bulkgeneratie is hier geen onderscheidende factor
• Modaliteit — invoer van tekst, afbeeldingen en bestanden op beide; geen van beide accepteert audio of video
• Reasoning-besturing — adaptief denken op beide, waarbij de diepte wordt bepaald door een inspanningsparameter in plaats van een budget voor denktokens. Op het Claude Platform is de standaard hoog; in de Claude-apps is deze medium
• Cache-schrijven — $5,00 per miljoen voor Claude Opus 5.5 tegenover $2,50 voor Claude Sonnet 5.5, de enige regel waarop het goedkopere model ook het goedkopere model is om met een herbouwde prefix te voeden
• Cachelezen — $0,20 per miljoen voor beide, een exacte gelijke stand op de regel die lange agentruns domineert
Omdat de oppervlakken overeenkomen, is migratie tussen hen een wijziging van de model-string en een hermeting van de inspanning, geen integratieproject. Dat is ongewoon tussen leveranciers, en het is de reden waarom deze specifieke combinatie überhaupt het vergelijken waard is: de twee kandidaten verschillen in prijs en in diepgang, niet in de API die je moet schrijven.
Eén operationeel verschil verdient een eigen regel. Anthropic stelt dat Claude Sonnet 5.5 de eerste Sonnet is die wordt gelanceerd met cyberwaarborgen en fallbacks op gelijke voet met zijn topmodellen, wat betekent dat cyberbeveiligingsverzoeken met een hoger risico zichtbaar worden doorgestuurd naar de vorige Sonnet in plaats van te worden beantwoord door het model dat u heeft genoemd. Als uw workload dat domein raakt, is de modelstring geen garantie voor welk model heeft geantwoord — op geen van beide niveaus. Anthropic merkt ook op dat als u Sonnet uitvoert met thinking uitgeschakeld, u moet overschakelen naar een between-tools-gedrag, wat een codewijziging is in plaats van een configuratievlag. Geen van beide is een reden om het model te vermijden; beide zijn redenen om het te weten voordat u uitbrengt.
Op OrcaRouter, is Claude Opus 5.5 vandaag routeerbaar met dezelfde inloggegevens als elk ander model in de catalogus, tegen de lijstprijs van de aanbieder met 0% opslag, met automatische failover erboven. Claude Sonnet 5.5 is nog geen route op ons platform — het model is één dag oud, en totdat het wordt opgenomen is de eerlijke mededeling dat je het via hun eigen API zou bereiken. Iedereen die Opus 5.5 momenteel via ons draait, kan de overstap prijzen op de dag dat die beschikbaar komt, zonder dat er verder iets aan hun integratie hoeft te veranderen.
Welke waar te plaatsen
De verdeling die uit de cijfers volgt: Claude Sonnet 5.5 voor terminalgebonden agentwerk, waar het de sterkere van de twee is op Anthropics eigen Terminal-Bench 4.0-cijfer en de helft van de prijs kost; Claude Sonnet 5.5 voor alles wat op doorvoer is gericht, aangezien het kostenverschil alleen kleiner wordt wanneer de taak lange outputs afdwingt; Claude Opus 5.5 voor werk van FrontierCode-kaliber, langetermijnrefactors in grote codebases, en elke workload waarin de marge van 54,4% tot 46,2% de vorm van je werkelijke probleem weerspiegelt in plaats van een rij op een leaderboard.
Als je taken open-ended zijn en je de uitvoerlengte niet kunt voorspellen, beschouw de prijs per token dan helemaal als het verkeerde getal. Meet een week lang tokens per voltooide taak op je eigen verkeer voordat je je in welke richting dan ook vastlegt; het artificial-analysis-cijfer van $7,60 tegen $5,98 is een waarschuwing dat het goedkope model kan verliezen op de maatstaf waar je daadwerkelijk voor betaalt.
Het eerlijke oordeel: dit is niet langer een afweging tussen capaciteit en kosten. Het is de vraag of je werk afgebakend is. Voor afgebakende, hoogvolume-, toolgedreven taken is het goedkopere model op basis van het beschikbare bewijs ook het betere, en het vlaggenschip is niet het dubbele waard. Voor open-eindig, langetermijnwerk is Anthropics eigen zin — dat Opus 5.5 duidelijk sterker blijft — degene die je moet geloven, en geen enkele mate van benchmarkconvergentie verandert daar vooralsnog iets aan.



