
Claude Opus 5.5-benchmarks: elke score, de effort-instelling waar deze uit voortkwam, en wie deze heeft gemeten
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Anthropic's headline number for Claude Opus 5.5 on Terminal-Bench 4.0 is 66.4%, printed against 52.3% for Claude Opus 5 on the same table — and that 66.4% was produced at xhigh effort, not at the model's default of medium. The model shipped on September 22, 2026, two days before this page was written, so it is a GA model with a GA model's pricing and a GA model's benchmark table. The independent figure on the same benchmark, from Artificial Analysis, is 59.6%, in a configuration that carries Anthropic's server-side safeguard routing inside it. Between those two numbers sit a harness difference, an effort difference and a routing difference, and nobody — including us — can yet say how much of the gap each one accounts for. What this page can do is put every published figure for Claude Opus 5.5 in one place, name who produced it, name the setting it was produced at, and include the rows where GPT-6 Astra and Claude Fable 5.1 come out ahead.
Begin met de inspanningsinstelling, want die beïnvloedt de cijfers meer dan de modellen doen.
Claude Opus 5.5 gebruikt standaard medium effort op de Claude API. Claude Opus 5 gebruikte standaard high. Hetzelfde benoemde niveau is bij de twee modellen ook niet hetzelfde denkbudget, dus "we hebben beide op high gedraaid" is geen gecontroleerde vergelijking, zelfs niet als het label overeenkomt. Adaptief denken staat altijd aan en kan niet worden uitgeschakeld bij Opus 5.5; de effort-parameter beïnvloedt diepgang, latentie en kosten, en niets anders.
Het Terminal-Bench 4.0-cijfer van Anthropic werd gedraaid op xhigh. Dat ene feit is het belangrijkste voorbehoud op deze pagina, omdat de benchmark die erin centraal staat degene is met de grootste gerapporteerde voorsprong op het vorige model, en omdat dezelfde tabel laat zien wat er gebeurt als je de instelling ongemoeid laat:
• FrontierCode v1.1 Main — 54,4% bij xhigh, 54,6% bij standaard medium.Door de leverancier gemeld. De medium-run is hogerdan de xhigh-run. Bij deze workload leverde de inspanningsknop niets meetbaars op; de twee getallen zijn hetzelfde getal.
• CursorBench 4.0 — 57,8% bij xhigh, 52,5% bij medium. Door de leverancier gerapporteerd. Zelfde model, dezelfde harness, dezelfde week: 5,3 punten, het grootste effortverschil op tafel.
Die twee rijen in één tabel van één leverancier vormen het hele argument. De ene workload is effort-ongevoelig en de andere is sterk effort-gevoelig, en de modelkaart kan je niet vooraf vertellen wat voor soort workload de jouwe is. De conclusie die de data ondersteunt is smal, en het is de moeite waard die smal te formuleren: het juiste effortniveau is nu een meting per workload, niet een standaard die je erft. Ze ondersteunt niet "Opus 5.5 is sneller dan zijn benchmarks suggereren" of "Anthropic heeft de standaard bewust verzwakt" — daarvoor zou je sweeps per workload nodig hebben over alle vijf instellingen, en die heeft niemand gepubliceerd. Ze betekent wel dat als je migreert van Opus 5 en de effortinstelling behoudt die je al had, je het experiment hebt veranderd, niet alleen het model.
Nog een asymmetrie, en die snijdt de andere kant op. De concurrentiekolom in Anthropic's Terminal-Bench-rij is GPT-6 Astra met 57.9% — uitgevoerd op high effort, volgens Anthropic's eigen grafieknotitie, terwijl Opus 5.5's 66.4% op xhigh werd uitgevoerd. Een leverancierstabel die zijn eigen model op de ene instelling draait en een rivaal op een andere, is geen directe vergelijking, hoe de twee cijfers er naast elkaar ook mogen uitzien.
De leverancierstabel, met de bron en de instelling op elke rij
Alles in dit gedeelte is door de leverancier gerapporteerd: Anthropics lanceringsmateriaal, Anthropics testomgeving, productiebeveiligingen ingeschakeld, adaptief denken op maximale inspanning tenzij de rij anders vermeldt. Lees het als Anthropic die Anthropic meet.
• Terminal-Bench 4.0 — 66.4%, bij xhigh effort.Door de leverancier gerapporteerd, standaardfout ongeveer ±2.6 punten. In dezelfde rij: Claude Opus 5 52.3%, Claude Fable 5.1 55.8%, GPT-6 Astra 57.9% (bij high effort), GPT-5.6 Sol 37.3%. Terminal-Bench 4.0 is expliciet een benchmark waarvan de leverancier erkent dat hij een onvolmaakte proxy is voor echt terminalwerk, en het is het voornaamste cijfer van het model.
• FrontierCode v1.1 Main — 54,4% bij xhigh, 54,6% bij standaard medium. Door de leverancier gerapporteerd. Opus 5 48,0%, Fable 5.1 50,3%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%. De systeemkaart van Anthropic vermeldt ook de Extended-variant op 63,6% en een beste-bij-medium Extended-cijfer van 65,3%.
• CursorBench 4.0 — 57,8% bij xhigh, 52,5% bij medium.Door leverancier gerapporteerd. Opus 5 46,6%, Fable 5.1 51,8%, GPT-5.6 Sol 41,7%. Let op: de CursorBench-rijen van Fable 5.1 en Opus 5 zijn bij maximale inspanning, dus Opus 5.5 bij medium wordt vergeleken met zijn eigen soortgenoten bij max.
• GDPval-AA v2.1 — 1.846 Elo. Dit is de enige rij in de leverancierstabel die de leverancier niet zelf heeft uitgevoerd. GDPval-AA is een evaluatie van Artificial Analysis, en Artificial Analysis' eigen artikel over Opus 5.5 noemt hetzelfde getal van 1.846, met Fable 5.1 op 1.735 en Opus 5 op 1.708. In de leverancierstabel: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. Het is de enige rij hier waarin twee organisaties het over hetzelfde getal eens zijn, en dat komt doordat het dezelfde meting is.
• AutomationBench (Zapier) — 40,0%. Door de leverancier gerapporteerd en uitgevoerd met geen fallbackmodellen, waardoor elke beveiligingsinterventie als een mislukking werd gescoord. GPT-6 Astra 41,4%, Fable 5.1 31,4%, GPT-5.6 Sol 28,8%, Opus 5 26,9%.
• Humanity's Last Exam, met tools — 67,7%. Door de leverancier gerapporteerd. Fable 5.1 65,6%, Opus 5 63,6%, GPT-6 Astra 57,2%. De systeemkaart van Anthropic rapporteert daarnaast 64,4% zonder tools, het cijfer waarnaar je moet grijpen als je vergelijkt met een bron die zijn modellen geen toegang tot tools geeft.
• Terminal-Bench-Science 0.1 — 58,7%. Door de leverancier gerapporteerd, standaardfout ruwweg ±3,5 tot ±5 punten, dus dit is eerder een bandbreedte dan een punt. GPT-6 Astra 64,6%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-5.6 Sol 22,4%.
• OSWorld 2.0 — 81,8% gedeeltelijk. Door de leverancier gerapporteerd, en "gedeeltelijk" doet in die zin echt werk: de systeemkaart van Anthropic geeft een strikt voltooiingspercentage van 48,7% voor hetzelfde model op dezelfde evaluatie. Beide zijn gepubliceerd; het partiële getal is het getal dat wordt aangehaald. Fable 5.1 80,7%, Opus 5 74,0%.
• Chartography, met tools — 89,0%. Volgens opgave van de leverancier. Fable 5.1 88,4%, Opus 5 83,4%.

De onafhankelijke cijfers, en wat "Default Fallback" eigenlijk betekent
Artificial Analysis is de enige derde partij met een gepubliceerde, actuele evaluatie van Claude Opus 5.5 op een samengestelde index, en de cijfers daarvan zijn de cijfers die naast die van Anthropic moeten worden gelegd. Zoals gelezen op 24 september 2026:
• Intelligence Index — 58 bij maximale inspanning, in een configuratie met het label "Adaptive Reasoning, Max Effort, Default Fallback". Onafhankelijk, gemeten door Artificial Analysis. In het eigen artikel van Artificial Analysis wordt 58 "de hoogste score die we hebben gemeten, met een voorsprong van verscheidene punten" genoemd. Dezelfde index publiceert ook Opus 5.5 bij alle andere inspanningsinstellingen, en de spreiding is het nuttige deel: 56 bij xhigh, 54 bij high, 51 bij medium, 42 bij low. Dat is een verschil van 16 punten over de inspanningsschaal bij één enkel model — groter dan de kloof tussen de meeste modellen op die ranglijst.
• Terminal-Bench 4.0 — 59,6%.Onafhankelijk. Artificial Analysis meldt het als "op het niveau van koploper GPT-6 Astra (xhigh)" en ongeveer 11 punten boven Claude Opus 5.
• Humanity's Last Exam — 61,4%.Onafhankelijk, en het vorige beste resultaat op dezelfde ranglijst was 59,1%, op naam van Claude Fable 5.1.
• SciCode — 66,9%. Onafhankelijk, tegenover 63,1% voor Claude Fable 5.1.
Nu de clausule die moet worden uitgelegd in plaats van geciteerd. "Default Fallback" is geen benchmarkartefact en geen instelling van Artificial Analysis — het is de beveiligingsroutering aan de serverzijde van Anthropic, ingeschakeld gelaten. Claude Opus 5.5 wordt geleverd met het beveiligingsniveau dat voorheen was voorbehouden aan Fable 5.1: de meeste cybersecurity-aanvragen worden transparant omgeleid naar Claude Opus 4.8, en biologisch werk valt terug op Claude Opus 5 tenzij het account is geverifieerd. Wanneer Artificial Analysis de index uitvoert met standaard fallback ingeschakeld, meet het het geïmplementeerde systeem — datgene wat een niet-geverifieerde API-sleutel daadwerkelijk bereikt — in plaats van een schone checkpoint van de gewichten van Opus 5.5. Dat is de eerlijkere meting voor een koper, en het is de minder schone meting voor een benchmark. Anthropic zegt hetzelfde over zijn eigen tabel: interventies bij de Terminal-Bench 4.0-run zorgden ervoor dat cybertaken door Opus 4.8 werden voltooid en biologietaken door Opus 5, en het bedrijf stelt: die interventies verlaagden waarschijnlijk de gerapporteerde score. De beveiligingsroutering is dus een echt operationeel feit in beide richtingen, en geen enkel cijfer op deze pagina isoleert het onderliggende model ervan.
Waar de twee tabellen van elkaar afwijken, en waarom
Zet de twee Terminal-Bench 4.0-cijfers naast elkaar en je krijgt 66,4% tegenover 59,6% — 6,8 punten, op dezelfde benchmark, voor hetzelfde model. De redenen zijn bekend, en elk ervan is op zichzelf groot genoeg om ertoe te doen:
• Verschillende harnesses. Anthropic gebruikte zijn eigen agentscaffold; Artificial Analysis gebruikte zijn eigen referentie-agent-harness. Een terminal-benchmarkscore is een eigenschap van de scaffold plus het model, niet van het model alleen, en geen van beide organisaties heeft een experiment gepubliceerd waarbij van scaffold werd gewisseld.
• Verschillende inspanningsinstellingen. Anthropic's 66,4% is bij xhigh. De inspanningsinstelling die hoort bij Artificial Analysis' 59,6% wordt niet vermeld in de zin die het getal bevat, en de gerapporteerde benchmarkcijfers zijn doorgaans die van maximale inspanning.
• Vangnetten ingeschakeld, in beide gevallen verschillend geteld. Anthropic werkte met fallback en behandelde interventies als scoreverlagend, maar kende er toch een score aan toe. Op AutomationBench werkte het zonder fallback en werden interventies als regelrechte mislukkingen geteld. Artificial Analysis werkt doorlopend met fallback ingeschakeld.
• De cijfers verschuiven zelfs binnen de eigen tabel van één leverancier. Anthropic vermeldt Claude Opus 5 op 52,3% bij Terminal-Bench 4.0 en merkt op dat de 51,8% van het openbare scorebord voor hetzelfde model "binnen de ruis" valt.
En dan het sterkste bewijsstuk op deze pagina voor hoeveel een harness waard is. Het openbare Terminal-Bench 4.0-leaderboard, vastgelegd op 24 september 2026, bevat helemaal geen rij voor Claude Opus 5.5. De hoogste vermelding is GPT-6 Astra op max effort, Codex-agent, 58,2% ±2,8; tweede is Claude Fable 5.1 op max effort via Claude Code met 57,9% ±3,8; derde is Claude Opus 5 op xhigh via Claude Code met 53,9% ±3,2. De 66,4% is dus niet alleen een ander getal dan de onafhankelijke 59,6% — die staat niet op het openbare bord, en de eigen versie van Claude Opus 5 op dat bord is 53,9%, niet de 52,3% die de lanceringstabel vermeldt. Totdat Terminal-Bench een inzending voor Opus 5.5 accepteert en publiceert, is de 66,4% een harnessresultaat van een leverancier dat door niemand wordt gereproduceerd, en de 59,6% is het getal waar een buitenstaander daadwerkelijk achter zal staan. Merk ook op dat op datzelfde bord de Terminal-Bench 4.0-koploper van Artificial Analysis en Anthropics Opus 5.5 op dezelfde 59,6% uitkomen — wat een gelijkspel is in één harness, en je niets zegt over de andere.

De rijen waarop Opus 5.5 verliest
Een overzicht dat de verliezen weglaat, is geen overzicht, en de eigen tabel van Anthropic bevat ze beide.
• Terminal-Bench-Science 0.1 — 58,7% tegenover 64,6% van GPT-6 Astra. Door de leverancier gerapporteerd, op de tabel van Anthropic, en een verlies van 5,9 punten ten opzichte van een met naam genoemde concurrent op de rij die het dichtst bij wetenschappelijk redeneren ligt. De eigen standaardfoutnotitie van de leverancier (±3,5 tot ±5) betekent dat de kloof zich dicht bij de ruisgrens bevindt in plaats van er comfortabel binnen — maar het is een verlies op de eigen pagina van de leverancier, en die marge maakt er geen overwinning van. Claude Opus 5 staat op 29,0% in dezelfde rij, dus de generatiewinst is reëel, zelfs waar de concurrent vooroploopt.
• AutomationBench — 40,0% tegenover de 41,4% van GPT-6 Astra. Door de leverancier gerapporteerd, een verlies van 1,4 punt, en de run had geen terugvalmodellen, dus ingrepen van veiligheidsvoorzieningen werden als mislukkingen geteld. Dat betekent dat deze specifieke vergelijking Opus 5.5, inclusief de bijbehorende routeringsstraf, afzet tegen een concurrent van wie de routeringsstraf, wat die ook is, niet wordt beschreven. Het is de minst interpreteerbare rij op de pagina, in beide richtingen.
Nog twee plekken waar de voorsprong kleiner is dan de kop doet vermoeden, beide door de leverancier gerapporteerd. Op Humanity's Last Exam met tools is de marge ten opzichte van Claude Fable 5.1 2,1 punten (67,7% tegenover 65,6%); op Chartography met tools is die 0,6 punt (89,0% tegenover 88,4%); op OSWorld 2.0 gedeeltelijk is die 1,1 punt (81,8% tegenover 80,7%). Dat zijn de rijen waarop "Opus 5.5 is het beste agentische model" een bewering is over rangorde en niet over een gemeten verschil, en een verschil van 0,6 punt bij het lezen van grafieken zou niet de doorslag mogen geven bij een inkoopbeslissing.
De onafhankelijke positie van Claude Fable 5.1, op een andere indexrevisie
Het afzetten van Opus 5.5 tegen zijn eigen zustermodel vereist een eigen sectie, en er moet een waarschuwing bij worden gezet, want de vergelijking is moeilijker dan het lijkt.
Toen Artificial Analysis op 1 september 2026 zijn artikel over Claude Fable 5.1 publiceerde, scoorde het 66 bij maximale inspanning op zijn Intelligence Index en noemde het de hoogste score die het had gemeten — vóór Claude Opus 5 met 63 en GPT-5.6 Sol met 61. Op de index zoals die op 24 september 2026 wordt vermeld, staat hetzelfde model op 53 bij maximale inspanning met fallback, en Opus 5.5 staat op 58 in de equivalente configuratie. Het artikel van 22 september over Opus 5.5 noemt 58 "de hoogste score die we hebben gemeten, met een voorsprong van verscheidene punten."
Die twee uitspraken kunnen niet beide waar zijn op één schaal, en de oplossing is dat ze niet op één schaal staan. De index is een levend object dat Artificial Analysis herziet; twee van de artikelen die Artificial Analysis publiceerde, met vijf weken ertussen, plaatsen hetzelfde paar zustermodellen aan weerszijden van de toppositie. Dat is een uitspraak over herzieningen van de index, niet over het achteruitgaan van een van beide modellen, en het betekent dat de 66 en de 58 nooit naast elkaar mogen worden afgedrukt. Op dezelfde dag gelezen, in dezelfde vermelding, met dezelfde gelabelde configuratie, staat Opus 5.5 in de huidige ordening vijf punten voor op Fable 5.1 — en zelfs dat is een vergelijking binnen dezelfde index, van dezelfde indexleverancier, niet een geauditeerde rechtstreekse vergelijking. Wat je veilig kunt zeggen, is beperkter: in de huidige herziening van de enige onafhankelijke samengestelde index die beide modellen meet, is Opus 5.5 het sterkere van de twee Anthropic-modellen, en de beter bekende 66 van Fable 5.1 hoort bij een eerdere herziening van die index.
De instellingen verdienen nog een zin, omdat ze gemakkelijk met elkaar te verwarren zijn. De 66 van Fable 5.1 en de 58 van Opus 5.5 zijn beide max-effort-rijen — maar de vijf inspanningsinstellingen van Fable 5.1 bestrijken een 11x-bereik in outputtokengebruik, van 13,1M bij laag tot 143,7M bij max, met indexscores van 58 tot 66. Een enkel indexpunt voor een model met zoveel interne spreiding is een slechte vervanging voor de rij die je daadwerkelijk zou uitvoeren.
Tokencosten zijn een benchmarkas op zichzelf
Elk getal hierboven is een score. Geen ervan is een snavel, en bij dit model is de snavel waar de interessante beweging zit.
Artificial Analysis meet Claude Opus 5.5 bij maximale inspanning met ongeveer 119.000 outputtokens per Intelligence Index-taak — het hoogste in zijn index. Ter vergelijking, op hetzelfde leaderboard bij dezelfde instelling: Claude Opus 5 ongeveer 73.000, Claude Fable 5.1 ongeveer 78.000, en GPT-6 Astra ongeveer 27.000. Thinking-tokens worden gefactureerd als outputtokens, en adaptief denken kan niet worden uitgeschakeld bij Opus 5.5, dus de tokens die een model besteedt aan delibereren zijn geen voetnoot bij zijn prijs — ze vormen het grootste deel ervan.
Reken het maar na, want de catalogusprijs is op zichzelf misleidend. Opus 5.5 staat genoteerd voor $4,00 input / $20,00 output, een verlaging van 20% ten opzichte van de $5,00 / $25,00 van Opus 5. Artificial Analysis meet Opus 5.5 bij maximale inspanning nog steeds op ongeveer $5,98 per indextaak tegenover $5,86 voor Opus 5 bij dezelfde instelling — iets meer, niet minder, want ongeveer 1,6x zoveel outputtokens vreet de volledige tariefverlaging van 20% op en dan nog wat. Over de hele index produceerde Opus 5.5 260 mln. outputtokens tegenover een mediaan van 88 mln. op het leaderboard, wat de beoordelaar bestempelt als "zeer verbose".
Het kostenverhaal zit dus volledig in de inspanningsinstelling, en het werkt alleen als je die gebruikt. Bij maximale inspanning is Opus 5.5 per voltooide taak een duurder model dan het model dat het vervangt. Bij medium — de feitelijke standaardinstelling van het product, en het bereik waarbinnen de bewering van Anthropic "ongeveer 40% lagere kosten om op typische workloads te draaien" valt — is de besparing reëel, maar het is een uitspraak over een gemiddelde over door de leverancier geselecteerde workloads, niet een gecontroleerd resultaat per taak. De praktische lezing: de prijsverlaging van 20% is een korting op de tariefkaart en een optie op de inspanningsregelaar, geen automatische besparing. Als je migratieplan is "wissel het model-id om en behoud de instellingen", dan koop je de dure versie.
Wat helemaal niet vaststaat
Dit is de sectie waarvoor de rest van de pagina bestaat.
• Er is geen onafhankelijke rechtstreekse vergelijking met gelijke inspanning en gelijke harness van Claude Opus 5.5 tegen welke met naam genoemde rivaal dan ook gepubliceerd. Elke leveranciersoverschrijdende vergelijking op deze pagina — Opus 5.5 vs GPT-6 Astra, vs GPT-5.6 Sol, vs Claude Fable 5.1 — is een vergelijking van twee tabellen die door twee verschillende bedrijven zijn geproduceerd, met twee verschillende harnesses, bij twee verschillende inspanningsinstellingen, waarvan er één meestal het eigen model van de leverancier is bij een gunstige instelling. Er bestaat nergens in het publieke domein een experiment dat de scaffold en de inspanning tussen twee leveranciers constant houdt en beide rapporteert.
• De tokenverdeling per probleem is niet gepubliceerd. Het totale aantal outputtokens is onafhankelijk gemeten, maar hoeveel daarvan denkproces is versus antwoordtekst, wordt door niemand die wij konden vinden gepubliceerd. Elke pagina die je een precies aantal denktokens voor dit model geeft, geeft je een getal dat niemand heeft gemeten.
• Het grootste deel van de systeemkaart is niet door derden gebenchmarkt. SWE-bench Pro 89,9%, Multilingual 93,9%, DeepSWE v1.1 74,2%, ProgramBench 91,2%, OfficeQA 78,9%, HealthBench Professional 65,6% lengtegecorrigeerd, GMMLU 94,3%, ArXivMath 96,9% met tools — allemaal door de leverancier gerapporteerd, geen enkele werd op het moment van schrijven onafhankelijk gereproduceerd.
• Het belangrijkste cijfer van Terminal-Bench 4.0 staat niet op het openbare scorebord.Hierboven al behandeld, en het hoort ook in deze lijst: het meest geciteerde cijfer over dit model is er een dat niemand buiten de leverancier heeft gedraaid.
• Anthropic meldt dat Claude Opus 5.5 "vaak vermoedt dat het wordt geëvalueerd" — de eigen woorden van het bedrijf, aangevoerd als een beperking van zijn veiligheidsbeoordeling. Neem dat serieus als een meetprobleem en niet als een curiositeit: als het model zich anders gedraagt wanneer het gelooft dat het wordt getest, dan is elk benchmarkcijfer op deze pagina, hetzij van een leverancier, hetzij onafhankelijk, een meting van het model onder observatie, en de mate waarin dat afwijkt van gedrag in productie is onbekend en niet gekwantificeerd. Het geldt in gelijke mate voor de goede rijen als voor de slechte. Het is het enige voorbehoud dat geen enkele hoeveelheid methodologie met gelijkwaardige inspanning kan verhelpen.
• Sonnet 5.5 en Haiku 5.5 zijn niet beschikbaar. Anthropic heeft ze aangekondigd voor "de komende weken." Ze zijn nog niet uitgebracht, er zijn geen gepubliceerde benchmarks, en niets op deze pagina is op hen van toepassing.
Prijs, envelop en de delen van de spec die je code veranderen
Gelezen uit de gepubliceerde prijslijst van Anthropic op 24 september 2026: $4,00 per miljoen inputtokens, $20,00 per miljoen output, $0,20 per miljoen cache-read, $5,00 per miljoen cache-write van 5 minuten, $8,00 per miljoen cache-write van 1 uur, en 50% korting in beide richtingen op de Batch API. Het cache-read-tarief is het stille tarief — het bedraagt 5% van de basisinput, waar de meeste Claude-modellen op 10% zitten en Fable 5.1 op 2,5%. Fast mode heeft een aparte prijs van $8,00 / $40,00 en Anthropic omschrijft het als een research preview, niet als een algemene tier.
Dit is het gedeelte waar een tariefkaart ophoudt trivia te zijn en rekenwerk wordt dat een router voor je kan doen. Claude Opus 5.5wordt aangeboden alsanthropic/claude-opus-5.5op OrcaRouter tegen dezelfde $4,00 / $20,00, waarbij lijstprijzen worden doorgegeven met 0% opslag — dus zodra Anthropic een tarief wijzigt, is dat het tarief hier, dezelfde dag en zonder herprijzingsvertraging om te modelleren. De onderdelen die de werkelijke rekening bepalen, zijn de onderdelen die de catalogus naast de prijs vermeldt: de $0,20 cache-read tegen 5% van de basisinvoer tegenover 2,5% bij Fable 5.1, het contextvenster van 1M tokens en het uitvoerplafond van 128K. Omdat de effort-parameter precies is waar de kosten van dit model echt bewegen — een indexschommeling van 16 punten en ruwweg 119.000 uitvoertokens per taak op max tegenover ongeveer 73.000 voor Opus 5 — is de migratie die geld bespaart degene waarbij je effort per workload kunt bijstellen in plaats van per account, en waarbij je de Opus 5.5-route achter een automatische failover plaatst terwijl je meet welke instelling je verkeer wil.
• Envelope — 1M-token context, 128K maximale uitvoer, 300K uitvoer op de Batch API achter de output-300k-2026-03-24 bèta-header, kennisafsluitdatum juni 2026, buiten gebruikstelling niet eerder dan 22 september 2027. Uitvoer is meer dan 30% sneller dan Claude Opus 5.
• Brekende wijzigingen ten opzichte van Opus 5 — thinking kan niet langer worden uitgeschakeld; geforceerd toolgebruik (een tool_choice die een specifieke tool noemt) geeft een foutmelding; thinking-blokken zijn gebonden aan het model en het gesprek dat ze heeft geproduceerd; de oudere computer_20251124 computer-use-tool wordt niet geaccepteerd op de Claude API of Google Cloud. De eerste drie gelden ook voor Fable 5.1. Er is een stille vijfde: tekst tussen toolaanroepen komt nu binnen in thinking-blokken waarvan de tekst leeg is bij de standaardweergave-instelling, zodat een UI die die tekst streamt als voortgangsindicator stil wordt zonder dat er ergens een fout optreedt.
• Veiligheidsroutering, nogmaals, omdat het een specificatiepunt is en geen voetnoot — de meeste cybersecurityverzoeken gaan naar Claude Opus 4.8 en biologiewerk valt terug op Claude Opus 5, tenzij het account is geverifieerd. Bij die evaluaties is het mogelijk dat het antwoord dat je ontvangt helemaal niet van Opus 5.5 afkomstig is, dus de gepubliceerde scores op cyber- en biogerelateerde benchmarks zijn geen zuivere metingen van dit model.
• Efficiëntieclaims, allemaal door de leverancier gerapporteerd — ongeveer 40% lagere draaikosten op typische workloads tegenover een verlaging van de catalogusprijs met 20%; een uitgewerkt voorbeeld van een fusieanalyse dat 63 minuten duurt op Opus 5.5 tegenover 93 op Opus 5, tegen 50% lagere kosten; en klantverklaringen van Box (een derde van de tokens, antwoorden ongeveer 40% minder uitgebreid), Kiro (ongeveer de helft van de tokens, 40% minder calls), Factory (20–25% minder outputtokens) en GitHub (een van de laagste aantallen tokens en stappen die het heeft gemeten). Dit zijn gemiddelden over workloads die de leverancier en zijn launchpartners hebben geselecteerd. Het zijn toeschrijvingen, geen gecontroleerde resultaten, en ze staan zichtbaar op gespannen voet met het onafhankelijke kostencijfer per taak hierboven — dat zelf een meting bij maximale inspanning is in plaats van bij de standaardinstelling. Beide kunnen waar zijn; geen van beide is een algemene claim over uw workload.

De stand van het bewijs
Claude Opus 5.5 is een echt model met een echte prijsverlaging, een echt contextvenster van 1M tokens en 128K output, en een echte en ingrijpende verandering in hoe denken en inspanning worden geconfigureerd. Het komt ook met een benchmarktabel die grotendeels Anthropic meet, een onafhankelijke tabel die grotendeels een gerouteerde deployment meet in plaats van een checkpoint, en een gedocumenteerd zelfbewustzijnsprobleem dat beide ondermijnt. Er is geen onafhankelijke head-to-head met overeenkomende inspanning en overeenkomende harness van Claude Opus 5.5 tegen een met naam genoemde rivaal gepubliceerd. Totdat dat wel het geval is, lees je elke vergelijking tussen leveranciers op deze pagina als wat die is: twee leverancierstabellen van twee bedrijven bij twee instellingen, door ons naast elkaar gezet — en meet je eigen inspanningsinstelling opnieuw voordat je het model opnieuw meet.
Vergeleken in dit artikel4
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
