Hero-titelkaart voor Claude Opus 5.5 vs Claude Opus 5, met als kop 'De inspanningsniveaus betekenen niet hetzelfde', met badges met de tekst medium vs. standaard hoog, $4.00 vs. $5.00, en $0.20 vs. $0.50 cache, en het OrcaRouter-logo in de rechteronderhoek.
Engineering & Research

Claude Opus 5.5 vs Claude Opus 5: De inspanningsniveaus betekenen niet hetzelfde

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het eerste dat u moet weten voordat u Claude Opus 5.5 vergelijkt met Claude Opus 5, is dat de twee modellen geen gemeenschappelijke inspanningsschaal delen, en bijna elke rechtstreekse vergelijking die u deze week leest, negeert dat. Opus 5 staat standaard op hoge inspanning. Opus 5.5 staat standaard op gemiddeld, en op het gelijknamige niveau denkt het meer per beurt dan zijn voorganger deed. Dus "Opus 5.5 op standaard versus Opus 5 op standaard" is geen gecontroleerd experiment — het is een vergelijking tussen twee verschillende hoeveelheden denkwerk. De leverancier zegt dit ook in zijn eigen migratiegids: test meerdere inspanningsniveaus, en hergebruik de instellingen van Opus 5 niet, omdat de gelijknamige niveaus niet overeenkomen met hetzelfde denkbudget. Zodra u daarvoor corrigeert, wordt de kloof tussen de twee modellen op sommige plaatsen kleiner, op andere groter, en de upgradebeslissing draait om iets anders dan ruwe capaciteit — kosten per voltooide taak, en vier API-wijzigingen die code die vandaag op Opus 5 draait, zullen breken.

Wat verschilt er nu echt, specificatie voor specificatie

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

De twee modellen liggen op papier dichter bij elkaar dan de versienummers doen vermoeden:

• Prijs — Claude Opus 5.5 tegen $4,00 invoer / $20,00 uitvoer per miljoen tokens versus Claude Opus 5 tegen $5,00 / $25,00

• Cache-lezen — $0,20 per miljoen versus $0,50 per miljoen, een verlaging van 60% op de kostenpost die agentische runs domineert

• Cache-schrijfactie — $5 per miljoen voor het venster van 5 minuten en $8 voor het venster van 1 uur op 5.5, tegenover $6,25 op Opus 5

• Context en output — 1M tokens context en 128K output bij beide; beide bereiken 300K output op de Batch API achter de output-300k-2026-03-24 bètaheader

• Standaardinspanning — gemiddeld op Opus 5.5 vs. hoog op Opus 5

• Denken — adaptief en altijd ingeschakeld in beide, maar op Opus 5.5 kan het helemaal niet meer worden uitgeschakeld

• Kennisafsluitdatum — juni 2026 vs. mei 2026

• Latentie — Anthropic beoordeelt Opus 5.5 als "matig" ten opzichte van de huidige line-up, en zegt dat het output meer dan 30% sneller genereert dan Opus 5

• Buiten gebruikstelling — niet eerder dan 22 september 2027 voor Opus 5.5, en niet eerder dan 24 juli 2027 voor Opus 5

Let op wat niet anders is: contextvenster, uitvoerplafond, batchkorting en het altijd actieve adaptieve denkmodel. Opus 5.5 is geen model met een groter contextvenster of langere uitvoer. Het is een goedkoper, sneller en token-efficiënter model binnen dezelfde grenzen.

Benchmarks, en het sterretje voor de inspanning bij elk ervan

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Deze cijfers komen uit Anthropics lanceringsmateriaal — door de leverancier gerapporteerd, uitgevoerd op zijn eigen modellen — en de effort-instelling is hier belangrijker dan de modelnaam:

• Terminal-Bench 4.0 — 66,4% vs 52,3%, met de Opus 5.5-run op xhigh-inspanning in plaats van de standaard

• FrontierCode v1.1 (Main) — 54,4% vs 48,0%, en 54,6% voor Opus 5.5 bij de standaard gemiddelde inspanning

• CursorBench 4.0 — 57,8% vs 46,6%, en 52,5% bij medium

• GDPval-AA v2.1 — 1846 Elo vs 1708

• AutomationBench — 40,0% vs 26,9%

• Humanity's Last Exam, met tools — 67,7% vs 63,6%

• Terminal-Bench-Science 0.1 — 58,7% vs 29,0%, het grootste verschil in de set

• OSWorld 2.0 — 81,8% gedeeltelijk vs. 74,0%

• Chartography, met tools — 89,0% vs. 83,4%

Het FrontierCode-resultaat is het resultaat om te bestuderen. Opus 5.5 scoort 54,4% bij xhigh en 54,6% bij medium — statistisch hetzelfde getal, tegen een fractie van het denkbudget. Welke verbetering Anthropic ook heeft doorgevoerd, op die benchmark komt die niet voort uit harder nadenken. CursorBench beweegt de andere kant op: 57,8% bij xhigh tegenover 52,5% bij medium, een verschil van vijf punten dat zegt dat inspanning op sommige taken nog steeds echte nauwkeurigheid oplevert. De les is niet "gebruik medium" of "gebruik xhigh"; de les is dat het juiste inspanningsniveau nu een meting per workload is, en de oude gewoonte om Opus 5 op zijn hoge standaardinstelling te laten staan, vertelt je niets meer over het nieuwe model.

Anthropic voegt een voorbehoud toe dat het waard is te herhalen: op dit capaciteitsniveau zijn benchmarkmarges "een minder betrouwbare leidraad voor verschillen in de echte wereld", en het bedrijf zegt dat zijn interne afstand tot Claude Fable 5.1 kleiner is dan de gepubliceerde scores suggereren. Dat is een leverancier die je zegt zijn eigen tabel niet te overinterpreteren.

Kosten per voltooide taak is de vergelijking die de doorslag geeft

Prijs per token is de verkeerde eenheid voor een agent, en deze vergelijking is waar dat duidelijk wordt. Anthropics eigen uitgewerkte voorbeeld: een fusieanalyse die Opus 5.5 63 minuten kostte en 50% minder kostte dan dezelfde taak op Opus 5, die 93 minuten duurde. De tariefkaart verklaart een deel daarvan — een verlaging van 20% op input en output, 60% op cache-reads — maar niet alles. De rest komt doordat het model minder tokens en minder beurten gebruikt om op dezelfde plek uit te komen. Klantquotes die bij de lancering zijn gepubliceerd wijzen dezelfde kant op: Box meldt een derde van de tokens en antwoorden die ongeveer 40% minder uitgebreid zijn, Kiro ongeveer de helft van de tokens met 40% minder calls, Factory 20–25% minder outputtokens, GitHub een van de minste tokens en stappen die het heeft gemeten.

Dat zijn door leveranciers gepubliceerde klantverklaringen, geen gecontroleerde resultaten, en het geaggregeerde "ongeveer 40% goedkoper bij typische workloads" is Anthropics karakterisering van een gemiddelde over workloads die het zelf heeft geselecteerd. De eerlijke versie voor je eigen planning: ga ervan uit dat de korting van 20% op de stickerprijs echt en verzilverbaar is, en behandel de extra 20% als een hypothese die je in een middag kunt testen door dezelfde taak op beide modellen te draaien en tokens te tellen.

Eén structurele opmerking over waarom de cacheverlaging meer effect sorteert dan je op grond van het percentage zou verwachten. Een agent die bij elke beurt een lange systeemprompt en een bestandsboom opnieuw verstuurt, betaalt cache-leestarieven over het merendeel van zijn invoer, niet de tarieven voor nieuwe invoer. Dat verlagen van $0,50 naar $0,20 per miljoen verandert de economie van langdurige sessies veel sterker dan het tarief dat de krantenkoppen haalt — en het is de reden waarom een workload die op Opus 5 marginaal levensvatbaar was, op Opus 5.5 duidelijk levensvatbaar kan worden zonder enige wijziging aan je prompts.

De vier breaking changes, als een migratiechecklist

Opus 5.5 is een nieuw model, geen hernoemde Opus 5, en de migratienotities van Anthropic noemen vier wijzigingen die code die al in productie draait, zullen breken:

• Thinking kan niet worden uitgeschakeld. Elk codepad dat Thinking uitschakelde, zal een fout opleveren of het gedrag veranderen, en de diepte wordt nu alleen nog via de effort-parameter geregeld.

• Geforceerd gebruik van tools geeft een fout terug. Een tool_choice die een specifieke tool forceert, wordt niet ondersteund.

• Denkblokken zijn gebonden aan het model dat ze heeft voortgebracht en aan het gesprek, dus ze kunnen niet over modellen heen opnieuw worden afgespeeld zoals sommige pipelines veronderstellen.

• De eerdere computer_20251124 computergebruik-tool wordt niet geaccepteerd op de Claude API of op Google Cloud.

Er is een vijfde wijziging die niets laat falen en daarom gevaarlijker is. Tekst tussen toolaanroepen komt nu terug in thinking-blokken waarvan de tekst leeg is bij de standaardweergave-instelling. Als je applicatie die tekst als voortgangsupdates naar gebruikers streamt, wordt het stil tussen toolaanroepen totdat je een weergavewaarde instelt die de tekst teruggeeft. Elke test slaagt; de interface houdt gewoon op met vertellen.

De eerste drie gelden ook voor Claude Fable 5.1, dus een team dat al naar dat model is gemigreerd, heeft een deel van dit werk gedaan. Een team dat nog op Opus 5 zit, heeft dat niet.

Wanneer Opus 5 nog steeds de juiste keuze is

De upgrade is niet automatisch, en er zijn vier echte redenen om te blijven:

• Voorspelbaarheid van kosten. Opus 5 is een model dat je al hebt gekarakteriseerd. Als je budget is gebaseerd op het tokenverbruik ervan, maakt een overstap naar een model dat bij hetzelfde genoemde inspanningsniveau een andere hoeveelheid denkt je model ongeldig totdat je opnieuw meet.

• Compatibiliteit. Als een deel van je stack afhankelijk is van het uitschakelen van denken, het forceren van een tool, of de oudere computer-use-tool, dan is de migratie codewerk, geen stringvervanging.

• Routing van veiligheidsmaatregelen. Opus 5.5 wordt geleverd met veiligheidsmaatregelen van het niveau van Fable 5.1, wat betekent dat de meeste cybersecurityverzoeken worden doorgestuurd naar Claude Opus 4.8 en biologiewerk terugvalt op Claude Opus 5, tenzij je account is geverifieerd. Als je product zich in een van beide domeinen bevindt, kan "upgraden" betekenen dat je gebruikers antwoorden krijgen van een kleiner model. Opus 5 heeft die routing niet.

• Levensduur. Opus 5 gaat voorlopig nergens heen — Anthropic noemt een buitendienststelling niet eerder dan 24 juli 2027, wat nog tien maanden duurt.

Voor alle anderen is de rekensom simpel: meer mogelijkheden, een lagere prijs, minder tokens en een migratiechecklist die één enkele engineer op één dag kan doorlopen.

Beide laten draaien tijdens de overschakeling

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

Het lastige van elke vlaggenschipmigratie zit in het midden: je wilt Opus 5.5 op nieuw verkeer zonder het productiepad te laten afhangen van een model dat je nog niet hebt gekarakteriseerd bij je eigen effort-instellingen, en je wilt Opus 5 laten blijven draaien terwijl je het uitzoekt. Dat is een routeringsprobleem in plaats van een re-platforming-probleem, en het loont om precies te zijn over wat waar zit. Claude Opus 5 staat vandaag op OrcaRouter tegen de eigen lijstprijs van Anthropic met 0% opslag — de lijstprijs van de provider wordt rechtstreeks doorgegeven, zodat een tariefwijziging van een leverancier dezelfde dag bij ons live is in plaats van pas na een synchronisatie. Claude Opus 5.5 is nog geen van onze routes; het is beschikbaar via de eigen API van Anthropic en de grote cloudaanbieders. Wanneer het beschikbaar komt, wordt het nog een route op dezelfde sleutel in plaats van een tweede contract en een tweede SDK, wat je in staat stelt een percentage van het verkeer naar het nieuwe model te sturen terwijl automatische failover de rest op het model houdt dat je al hebt gekarakteriseerd. Een aanroep over beide modellen samenstellen — een concept van de ene en een verificatieronde van de andere — is een regel in de routing-DSL.

Wees precies over wat dat je oplevert. Het geeft je geen onafhankelijke benchmark van Opus 5.5; niets doet dat nog, want de enige gepubliceerde head-to-heads zijn die van Anthropic zelf en de onafhankelijke trackers bepalen nog welke effort-configuraties ze hanteren. Wat het je geeft, is de enige meting die daadwerkelijk voorspellend is voor je factuur, op jouw prompts, op het effortniveau dat je gaat uitbrengen.

De beslissingsregel

Als je iets nieuws begint, gebruik dan Claude Opus 5.5 en begin met medium inspanning en meet vervolgens of laag standhoudt bij jouw taak — Anthropic meldt dat laag bij verschillende code-evaluaties tegen veel lagere kosten de hogere instellingen benadert, en de FrontierCode-cijfers hierboven suggereren dat de standaardinstelling niet veel laat liggen.

Als je Claude Opus 5 in productie draait, is de trigger om te migreren niet de benchmarktabel. Het is de vraag of je vier API-wijzigingen kunt absorberen en of je workload in cybersecurity of biologie zit, waar de safeguard-routing stilletjes een deel van je verkeer naar een kleiner model doorsluist. Al het andere aan deze upgrade is een prijsverlaging in de kleren van een modelrelease, en die zijn het waard om te nemen.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt