Een titelkaart voor de Claude Opus 5.5 API-gids, met de tekst 'Model-ID, vier breaking changes en de stille vijfde', met een specificatiestrook die het model-id claude-opus-5-5 toont, een contextvenster van 1M, 128K output en $4 / $20 per 1M tokens.
Engineering & Research

Claude Opus 5.5 API-gids: de model-ID, vier breaking changes en de stille vijfde

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Wijzig de modelstring van claude-opus-5 naar claude-opus-5-5 en je code compileert nog steeds, type-checkt nog steeds en slaagt nog steeds voor wat er ook maar als testsuite doorgaat. Dan geeft het in productie een 400 terug. Vier requestvormen die Claude Opus 5 accepteerde, worden ronduit afgewezen door Claude Opus 5.5, en een vijfde wijziging breekt helemaal niets — precies daarom zal die juist degene zijn die je gebruikers bereikt. Dit is de integratiereferentie voor het model: de identifier, de oppervlakken die het model bedienen, het requestcontract, de vier fouten, de stille vijfde, en hoe de effort-parameter nu werkt. Waar het gedrag overeenkomt met Claude Fable 5.1, heeft een team dat daar al naartoe is gemigreerd een deel van het werk gedaan, dus bij elke wijziging hieronder staat of die ook op dat model van toepassing is.

Alles hier is gelezen uit de eigen Claude-documentatie van Anthropic op 24 september 2026, twee dagen nadat het model werd uitgebracht. Leveranciersclaims worden als leveranciersclaims gelabeld, onafhankelijke cijfers als onafhankelijk, en de twee worden nooit bij dezelfde effort-instelling gepresenteerd alsof ze vergelijkbaar zijn.

Het model-id, en waar het wordt geserveerd

De identifier is claude-opus-5-5 — een vast model-id zonder datumachtervoegsel, hetzelfde schema als claude-opus-5. Er is geen aparte pinned-snapshotvorm om over te nemen en geen alias die naar iets anders verwijst.

Anthropic's modellenoverzicht vermeldt vijf oppervlakken, met deze exacte strings:

• Claude API — claude-opus-5-5, beschikbaar voor alle klanten.

• Amazon Bedrock — anthropic.claude-opus-5-5 (het enige oppervlak dat de leverancier als voorvoegsel gebruikt).

• Claude Platform on AWS — claude-opus-5-5, met Claude API-id's in plaats van id's in Bedrock-stijl.

Google Cloud — claude-opus-5-5.

• Microsoft Foundry — claude-opus-5-5; de deploymentnaam is wat u verstuurt, en Foundry volgt het levenscyclusschema van de Claude API.

Twee van die vijf zijn belangrijker dan de rest van deze sectie. Amazon Bedrock en Google Cloud stellen hun eigen levenscyclus- en uitfaseringdatums vast, en — zoals de ingrijpende wijzigingen hieronder laten zien — is Bedrock ook het enige platform waar het oude computer-use-hulpmiddel nog steeds werkt. Als je op Bedrock zit, volg je niet dezelfde migratie als alle anderen.

Waaraan elk verzoek nu moet voldoen

De migratiegids van Anthropic formuleert het contract als een lijst, en de lijst is kort genoeg om je eigen client eraan te toetsen. Van welk model je ook komt, een verzoek aan claude-opus-5-5 moet:

• Verzend ofwel geen thinking-veld ofwel thinking: {"type": "adaptive"} — de twee zijn gelijkwaardig, want adaptief denken staat altijd aan.

• Beheer de denkdiepte met effort, de enige aanvraagparameter die dat doet; alle vijf niveaus worden ondersteund en de standaardwaarde is medium.

• Gebruik tool_choice met {"type": "auto"} (de standaard) of {"type": "none"}. Een tool forceren wordt geweigerd.

• Weglaten: temperature, top_p en top_k, of ze op hun standaardwaarden laten staan. Elke andere waarde wordt geweigerd, op dit model net als op alles vanaf Claude Opus 4.7.

• Beëindig berichten niet met een vooraf ingevulde assistentbeurt; dat werd bij Opus 4.6 en later al afgewezen.

• Declareer computergebruik als de computer_toolset_20260801-toolset op de Claude API en Google Cloud.

• Stuur geen contextvenster-bètaheader. Het 1M-contextvenster is de standaard, en een header die voor een ouder model is geschreven, heeft geen effect.

Waar de gids zegt dat een instelling wordt geweigerd, retourneert de API HTTP 400. Dat is de hele faalwijze van de overstap naar dit model: geen verslechterde output, geen waarschuwing in een log — een verzoek dat nooit wordt uitgevoerd.

Anthropic's Migrating to Claude Opus 5.5 documentation page, showing the 'What every request to Claude Opus 5.5 must satisfy' list: the claude-opus-5-5 model id with no date suffix, thinking adaptive-only, the effort parameter with five levels low through max defaulting to medium, tool_choice auto or none, sampling parameters at their defaults, no prefilled assistant turn, the computer_toolset_20260801 toolset on the Claude API and Google Cloud, and a 1M-token context window requiring no beta header.

De vier ingrijpende wijzigingen

1. Denken kan niet worden uitgeschakeld

Adaptief denken staat altijd aan. thinking: {"type": "disabled"} retourneert een 400, en dat geldt ook voor een handmatig budget — thinking: {"type": "enabled", "budget_tokens": N}. De foutmelding noemt het type dat je hebt verzonden en noemt vervolgens de vervanging:

• "thinking.type.disabled" wordt niet ondersteund voor dit model. Gebruik "thinking.type.adaptive" en "output_config.effort" om het denkgedrag te regelen.

• "thinking.type.enabled" wordt niet ondersteund voor dit model. Gebruik "thinking.type.adaptive" en "output_config.effort" om het denkgedrag te regelen.

De praktische consequentie is niet de fout zelf, maar wat er gebeurt nadat je die hebt opgelost. Op Claude Opus 4.8 en eerder werd een verzoek zonder thinking-veld uitgevoerd zonder thinking. Op Claude Opus 5.5 denkt elk verzoek, en max_tokens blijft een harde limiet die thinking plus de responsetekst omvat. Thinking-tokens worden gefactureerd als outputtokens, zelfs wanneer de thinking-tekst nooit aan je wordt teruggegeven. Een endpoint dat voorheen zonder thinking werkte, kan na de "fix" dus meer outputtokens per verzoek produceren dan daarvoor. Het advies van Anthropic is om de effort te verlagen waar je voorheen thinking uitschakelde, en — bij xhigh- of max-effort — om max_tokens te beginnen op 64k en van daaruit bij te stellen.

De vorm van het antwoord verandert ook. Een antwoord kan beginnen met een of meer denkblokken vóór het eerste tekstblok, dus code die het antwoord op positie uitleest — content[0].text, of een streamhandler die de eerste content_block_start als tekst behandelt — breekt op deze antwoorden, zelfs wanneer het verzoek is geslaagd. Selecteer blokken in plaats daarvan op hun type-veld.

2. Geforceerd gebruik van tools retourneert een fout

tool_choice-typen any en tool geven een 400 terug, en dezelfde validatie geldt voor het eindpunt voor het tellen van tokens, dus een telling vooraf mislukt op dezelfde manier als de daadwerkelijke aanroep:

• tool_choice: type "tool" en "any" worden niet ondersteund voor dit model.

Auto en none worden niet beïnvloed. De gedocumenteerde vervanging is om tool_choice: {"type": "auto"} te behouden, tools te markeren met strict: true voor schema-valide argumenten, of het schema naar structured outputs te verplaatsen — en in de prompt te vermelden wanneer de tool van toepassing is, aangezien auto geen aanroep garandeert. Strikt toolgebruik accepteert een subset van JSON Schema: elk object in de input_schema van een tool moet additionalProperties: false instellen, dus controleer elk schema voordat je de vlag omzet. En let op het gat dat dit achterlaat: als je code afhing van het forceren van een aanroep in plaats van alleen toe te staan, herstelt auto de toestemming en niet de garantie. Controleer of er daadwerkelijk een tool_use-blok is teruggekomen.

3. Denkblokken zijn gebonden aan het model en aan het gesprek

Elk denkblok registreert welk model het heeft geproduceerd, en elk model leest zijn eigen blokken plus een gedefinieerde verzameling blokken van anderen. De regels gelden in beide richtingen:

• Claude Opus 5.5 leest denkblokken van Claude Opus 5 en eerdere Opus-, Sonnet- en Haiku-modellen — maar niet van Claude Fable- of Claude Mythos-modellen.

• Op de Claude API lezen Claude Fable 5.1 en Claude Mythos 5.1 blokken van Claude Opus 5.5. Geen enkel ander model doet dat.

• Een gesprek dat van Claude Opus 5.5 overgaat naar iets anders dan die twee, doorloopt de latere beurten zonder de eerdere redenering.

Een router of fallback die een gesprek verplaatst, is de voor de hand liggende manier om dit tegen te komen. Het subtielere deel is dat het blok ook gebonden is aan het gespreksprefix — de systeemprompt, de tools en elk bericht dat eraan voorafgaat. Anthropic handhaaft de prefixcontrole standaard voor accounts die zijn aangemaakt op of na 2026-08-31 00:00 UTC, op de Claude API en op cloudplatforms: speel een blok opnieuw af nadat je de systeemprompt, de lijst met tools of een eerder bericht hebt gewijzigd, en het verzoek geeft 400 terug. Er zijn twee uitwegen. Stuur de thinking-binding-controls-2026-08-01 bèta-header mee en zet thinking.block_binding.prefix_mismatch_behavior op "drop_block" om de getroffen blokken te laten vallen in plaats van het verzoek te laten mislukken. Of houd het gesprek append-only en wijzig instructies met een systeembericht midden in het gesprek in plaats van met een bewerking — wat Claude Code, claude.ai, Claude Managed Agents en de Claude Agent SDK al doen.

Er is één stukje goed nieuws dat gemakkelijk te missen is: wanneer een verzoek een blok bevat dat het doelmodel niet kan lezen, laat de API het vallen voordat het model het ziet. Het verzoek slaagt, en voor gedropte blokken worden geen kosten in rekening gebracht.

4. De oudere computer-use-tool wordt afgewezen op de Claude API en Google Cloud

Een tools-item van het type computer_20251124 geeft een 400 op de Claude API en Google Cloud. Het bericht vermeldt het afgewezen type en somt vervolgens de typen op die het model wel accepteert:

• 'claude-opus-5-5' ondersteunt geen tooltypen: computer_20251124.

De vervanging is de computer_toolset_20260801 toolset: laat de computer-use-2025-11-24 bèta-header vallen en stuur de tools-entry zonder naam en zonder weergaveafmetingen. Dit is niet alleen een wijziging van het verzoek — de agent-loop verandert mee. Acties komen binnen als member tool_use-blokken in plaats van als één computer-tool, er kunnen er meerdere in één turn zitten, de actie is de name van het blok in plaats van input.action, en elk resultaat moet toolset_name terugsturen. Op Amazon Bedrock blijft computer_20251124 precies werken zoals op Claude Opus 5 en is er geen wijziging nodig.

Welke van de vier zijn ook van toepassing op Claude Fable 5.1?

Anthropic stelt dat de eerste drie ook van toepassing zijn op Claude Fable 5.1 — altijd actief denkvermogen, geen geforceerde toolkeuze, en aan model en gesprek gebonden denkblokken. De wijziging in computer-use doet dat niet: die is specifiek voor dit model in de Claude API en Google Cloud. Een team dat al is overgestapt op Claude Fable 5.1 heeft dus zijn codepaden voor uitgeschakeld denkvermogen en zijn geforceerde toolkeuzes laten varen, en hanteert een append-only gesprekspatroon; wat overblijft is de model-id en de computer-use-toolset. Een team dat komt van Claude Opus 5 krijgt alle vier tegelijk te maken. Dat is de migratie die het plannen waard is, en het is een andere hoeveelheid werk, afhankelijk van waar je begint.

De vijfde verandering: er treden geen fouten op, en je voortgangsfeed valt stil

Op Claude Opus 5 komen de korte notities die het model tussen toolaanroepen schrijft, terug als gewone tekstblokken. Op Claude Opus 5.5 — net als op Claude Fable 5.1 — komt die vertelling terug als thinking-blokken met voortgangsupdates, maximaal één vóór elke toolaanroep. En thinking.display staat standaard op "omitted", dus die blokken komen binnen met een leeg thinking-veld naast hun signature.

Geen enkel verzoek mislukt. Er wordt geen fout gelogd. Een applicatie die de tekst tussen tools naar haar gebruikers streamt als voortgangsindicator, stopt eenvoudigweg met het tonen van voortgang tussen toolaanroepen en begint niets meer te tonen. Het zichtbare symptoom is een UI die bevroren lijkt tijdens precies het stuk werk waarin de gebruiker het meest gerustgesteld wil worden, en het zal worden gemeld als een prestatieprobleem, een netwerkprobleem of een hang — niet als een migratiefout. Dit is de wijziging die naar productie gaat.

De oplossing is een weergave-instelling, plus een uitlezing die daarmee overeenkomt:

• Stel thinking.display in op "updates" — bèta, achter de header thinking-display-updates-2026-08-18 — om de voortgangsupdates terug te krijgen terwijl de redenering zelf verborgen blijft. Dit is de instelling die een voortgangsfeed wil.

• Of stel het in op "samengevat" om voortgangsupdates en redeneersamenvattingen door elkaar in dezelfde blokken te ontvangen.

• Lees vervolgens de tekst uit thinking-blokken in plaats van uit tekstblokken, geef elk niet-leeg thinking-blok weer vóór het tool_use-blok dat erop volgt, en geef de blokken ongewijzigd terug samen met de rest van de assistentbeurt.

Anthropics eigen opmerking hierover is in essentie het aanhalen waard: van een interface die tekst tussen toolaanroepen weergeeft, wordt verwacht dat deze een weergavewaarde instelt in plaats van op de standaard te vertrouwen. Als jouw integratie denkblokken vandaag volledig negeert, is dat de enige plek waar de standaard veilig is.

A single-column scoreboard titled 'Claude Opus 5.5 — the migration at a glance' listing six rows: thinking always on and cannot be disabled; forced tool use returning a 400 error; thinking blocks bound to the model and the conversation; the old computer tool rejected on the Claude API and Google Cloud; progress text hidden by default; and the fix of setting thinking.display to summarized. Footer reads: per Anthropic's Claude Opus 5.5 migration guide, read 2026-09-24; vendor-reported.

Inspanning is het API-oppervlak

Nu denken niet uit te schakelen is, output_config.effort wordt de enige knop voor hoeveel het model redeneert, en dus de enige knop voor kosten en latentie bij een bepaalde taak. Vier dingen erover zijn het weten waard voordat je een instelling overneemt van het oude model.

De standaardinstelling is verschoven. Claude Opus 5.5 gebruikt standaard medium effort, waar Claude Opus 5 en eerdere Opus-modellen standaard op high stonden. Een verzoek waarin effort wordt weggelaten, draait nu één niveau lager dan vóór de wisseling. Anthropic documenteert ook dat het model de neiging heeft om meer per beurt na te denken bij een gegeven effort-instelling dan Claude Opus 5 deed, vooral bij xhigh en max. Die twee effecten werken in tegengestelde richtingen, en dat is precies waarom het advies van de leverancier is om een nieuwe effort-sweep op je eigen evals te draaien in plaats van een instelling zomaar over te zetten.

De schaal is low / medium / high / xhigh / max, alle vijf hier ondersteund. Het genoemde niveau is sowieso geen vast tokenbudget — Anthropic beschrijft effort als een gedragssignaal, niet als een strikt budget — en de tokentoewijzing achter elk niveau is tussen modellen veranderd, dus "high" op Claude Opus 5.5 is niet "high" op Claude Opus 5. Effort instellen op de standaardwaarde van het model is identiek aan het weglaten ervan.

Twee operationele details, want beide kosten geld als je ze mist. Ten eerste: als je de effort-waarde op het hoogste niveau tussen verzoeken wijzigt, wordt de promptcache ongeldig: kies een niveau en houd het constant binnen een gesprek dat afhankelijk is van cachehits, en varieer het in plaats daarvan tussen workloads. Ten tweede ondersteunt dit model effort per bericht (bètaheader mid-conversation-output-config-2026-07-01), waarmee het niveau vanaf een latere beurt kan worden gewijzigd zonder de cache opnieuw te starten. Het minimum voor de promptcache is hier 512 tokens, tegenover 1.024 bij de vorige generatie, dus prompts die voorheen te kort waren om te cachen kunnen nu entries aanmaken zonder codewijziging.

Uitvoerplafonds: 128K synchroon, 300K bij Batch

De synchrone Messages API beperkt de uitvoer tot 128K tokens. De Message Batches API gaat tot 300K uitvoertokens achter de output-300k-2026-03-24 bètaheader — precies die tekenreeks. De invoer is standaard het volledige contextvenster van 1M tokens, zonder dat daarvoor een header nodig is.

De praktische interpretatie: het plafond van 128K is ongewijzigd ten opzichte van Claude Opus 5, dus voor een synchrone integratie hoeft op alleen die as niets opnieuw te worden gebudgetteerd. Wat wel opnieuw gebudgetteerd moet worden, is het denkwerk daarbinnen. Aangezien max_tokens nu bij elk verzoek zowel het denken als de tekst dekt, is een waarde die net toereikend was voor antwoordtekst op Claude Opus 5 hier krapper — en bij xhigh- of max-inspanning raadt de leverancier aan om met 64k te beginnen en bij te stellen. Als een langlopende taak was afgestemd op het synchrone plafond van 128K en nu wordt afgekapt, is het niet het plafond dat is verschoven.

Safeguard-routing maakt deel uit van de spec.

Dit is een integratiegegeven, geen beleidsvoetnoot: bij sommige prompts beschrijft de modelstring die je verstuurt niet wat er heeft geantwoord.

Claude Opus 5.5 wordt geleverd met veiligheidsclassificaties, en een geweigerd verzoek komt terug als HTTP 200 met stop_reason: "refusal" en een stop_details-object dat het beleidsgebied benoemt. Dit model dekt meer categorieën dan Claude Opus 5 — verwacht bio, frontier_llm en reasoning_extraction naast de bekende cyber. De reasoning_extraction-weigering wordt direct geblokkeerd in plaats van opnieuw geprobeerd: de server-side fallback van Anthropic probeert het niet opnieuw, en de weigering wordt aan jou teruggegeven.

Voor de categorieën die wel opnieuw proberen, is het mechanisme een parameter. Stel fallbacks in op "default" met de server-side-fallback-2026-07-01 bètaheader, en de API voert een geweigerd verzoek opnieuw uit op het model dat Anthropic voor die categorie aanbeveelt, binnen één enkele aanroep, en retourneert één antwoord. Het helpcentrum van Anthropic noemt de routering voor dit model rechtstreeks: gemarkeerde cybersecurityverzoeken vallen terug op Claude Opus 4.8, en de biologieclassificaties — de set in Fable-5-stijl — zorgen voor een terugval naar Claude Opus 5 voor dual-use werk in de levenswetenschappen. Een beperkte set mogelijkheden voor frontier-LLM-ontwikkeling routeert ook naar Claude Opus 5. Anthropic merkt ook op dat de controles alles beoordelen wat het model leest, niet alleen je laatste bericht, dus geheugen, connectorinhoud, zoekresultaten en bestanden kunnen een omschakeling veroorzaken.

Drie dingen volgen voor je integratie. Lees het top-level modelveld bij elk antwoord, want het rapporteert het model dat het bericht daadwerkelijk heeft geproduceerd, en een fallbackcontentblok markeert elk overdrachtspunt. Controleer de eigen snelheidslimieten van de fallback, want een fallback met een snelheidslimiet wordt niet geprobeerd en in plaats daarvan wordt de weigering geretourneerd — fallbacks degraderen onder belasting tot weigeringen. En beschouw elke gepubliceerde benchmarkrun met veiligheidsmaatregelen ingeschakeld als een meting van het gerouteerde systeem in plaats van alleen van Claude Opus 5.5, wat precies is wat Anthropic hieronder over zijn eigen cijfers zegt.

Fallback aan serverzijde is bèta en alleen voor de Claude API: deze wordt niet ondersteund op de Message Batches API en is niet beschikbaar op Amazon Bedrock, Google Cloud of Microsoft Foundry, waar de SDK-middleware in plaats daarvan de gedocumenteerde route is. Aan de verificatiekant bestaan er voor beide categorieën toegangsroutes — het Cyber Verification Program en het Life Sciences Verification Program — maar let op de asymmetrie die het helpcentrum van Anthropic op het moment van schrijven documenteert: Claude Opus 5.5 staat momenteel niet vermeld in het Cyber Verification Program, terwijl het life-sciencesprogramma wordt beschreven als het programma dat geverifieerde organisaties toegang geeft tot de meest capabele modellen.

Context, afkap, uitfasering en Snelle modus

De rest van de envelop, van de modelpagina en de deprecatietabel:

• Contextvenster — 1M tokens, standaard, geen bèta-header.

• Kennisafsluitdatum — juni 2026, wat tevens de afsluitdatum van de trainingsgegevens is.

• Buitendienststelling — niet eerder dan 2027-09-22 op door Anthropic beheerde platforms, met ten minste 60 dagen voorafgaande kennisgeving. Amazon Bedrock en Google Cloud stellen hun eigen data vast. Claude Opus 5 is Actief tot ten minste 2027-07-24, dus er is geen gedwongen overstap.

• Tariefkaart — $4,00 per miljoen invoer, $20,00 per miljoen uitvoer, $5,00 per miljoen cacheschrijfacties van 5 minuten, $8,00 per miljoen cacheschrijfacties van 1 uur, $0,20 per miljoen cacheleesacties. Batch kost de helft in beide richtingen, namelijk $2,00 / $10,00.

• Cache-leesbewerkingen zijn de uitschieter die het vermelden waard is: $0,20 is 5% van de basisinvoer, terwijl de meeste Claude-modellen op 10% zitten en Claude Fable 5.1 op 2,5%. Gemengde workloads met veel cachehergebruik ervaren dat als een echte korting.

• Fast mode — nog steeds gedocumenteerd als een research preview, alleen Claude API, apart geprijsd tegen $8,00 input / $40,00 output per miljoen. Inschakelen met speed: "fast" en de fast-mode-2026-02-01 bètaheader. Het is niet beschikbaar op Bedrock, Claude Platform on AWS, Google Cloud of Microsoft Foundry, niet met de Batch API, en niet met een Priority Tier-commitment. Merk op dat Claude Opus 5.5 Priority Tier helemaal niet ondersteunt.

Wat de benchmarks zeggen, en bij welke instelling

Inspanningsinstellingen zijn de reden dat een leverancierstabel en een onafhankelijke tabel niet rij voor rij kunnen worden vergeleken, en waarom elk getal hieronder zijn instelling meedraagt.

Door de leverancier gerapporteerd, Anthropics eigen testomgeving. In Anthropics lanceringsnotitie staat dat, tenzij anders vermeld, alle resultaten voor Claude Opus 5.5 gebruikmaken van adaptief denken op maximale inspanning; de uitzondering is Terminal-Bench 4.0, gerapporteerd op xhigh voor Claude Opus 5.5 en high voor GPT-6 Astra, omdat dit de hoogste score van elk model is. Op die basis rapporteert de leverancier Terminal-Bench 4.0 op 66,4%, FrontierCode v1.1 Main op 54,4%, CursorBench 4.0 op 57,8%, GDPval-AA v2.1 op 1.846 Elo, AutomationBench op 40,0%, Humanity's Last Exam met tools op 67,7%, Terminal-Bench-Science 0.1 op 58,7%, OSWorld 2.0 op 81,8% gedeeltelijk, en Chartography met tools op 89,0%. Bij de standaard gemiddelde inspanning van het model geeft de leverancier FrontierCode op 54,6% en CursorBench op 52,5%. Let op wat diezelfde notitie onthult: de evaluaties werden uitgevoerd met productiebeveiligingen ingeschakeld, en wanneer die werden geactiveerd, werden cybersecuritytaken voltooid door Claude Opus 4.8 en biologie- en frontier-LLM-ontwikkelingstaken door Claude Opus 5 — volgens Anthropic vermindert dit waarschijnlijk de prestaties van Claude Opus 5.5 op die benchmarks. Gepubliceerde scores op de betrokken evaluaties zijn daarom geen zuivere metingen van dit model.

Onafhankelijk, Artificial Analysis. Op Intelligence Index v4.3.2 scoort Claude Opus 5.5 58 in de configuratie die Artificial Analysis aanduidt als "Adaptive Reasoning, Max Effort, Default Fallback" — zijn hoogste gemeten score, enkele punten hoger, en hij staat aan de leiding in zes van de tien samenstellende evaluaties. Op dezelfde index en met dezelfde harness scoort Claude Fable 5.1 53 en Claude Opus 5 51. Artificial Analysis publiceert de volledige inspanningsladder, wat hier het nuttigste onafhankelijke artefact is: max 58, xhigh 56, high 54, medium 51, low 42. Uit zijn eigen metingen komt Claude Opus 5.5 op ongeveer 119.000 outputtokens per indextaak bij max effort, tegenover ongeveer 73.000 voor Claude Opus 5, 78.000 voor Claude Fable 5.1 en 27.000 voor GPT-6 Astra — tokens die als outputtokens worden gefactureerd — en op zijn pagina wordt een kostprijs van $5,98 per indextaak gemeld. Het meet ook Terminal-Bench 4.0 op 59,6% en Humanity's Last Exam op 61,4%, tegenover de 66,4% en 67,7% van de leverancier bij max effort op een andere harness.

Lees die twee alinea's naast elkaar en de eerlijke conclusie is beperkt. De 66,4% Terminal-Bench van de leverancier en de onafhankelijke 59,6% zijn dezelfde benchmark, uitgevoerd door verschillende mensen met instellingen waarvan niet gegarandeerd is dat ze overeenkomen, en geen van beide is bewijs over jouw workload. De inspanningsladder is de overdraagbare bevinding: op een onafhankelijke index bestrijken de eigen instellingen van dit model zestien punten, wat een grotere spreiding is dan de kloof tussen dit model en zijn voorganger. Het kiezen van een inspanningsniveau is belangrijker dan het kiezen tussen deze modellen, en de clausule "Default Fallback" in dat label is de hierboven beschreven veiligheidsroutering, geen benchmarkartefact.

Door de leverancier gerapporteerde efficiëntie, toegeschreven. Anthropic zegt dat Claude Opus 5.5 op de meeste taken presteert op het niveau van Claude Fable 5.1 tegen ongeveer 40% lagere uitvoeringskosten, en dat typische workloads ongeveer 40% minder kosten dan op Claude Opus 5, tegenover een officiële prijsverlaging van 20%. De output is meer dan 30% sneller. Dit zijn leverancierskarakteriseringen van gemiddelden over workloads die de leverancier heeft geselecteerd. De klantverklaringen bij de lancering zijn hetzelfde soort bewijs: Box meldt een derde van de tokens en antwoorden die ongeveer 40% minder uitgebreid zijn, Kiro ongeveer de helft van de tokens en ongeveer 40% minder aanroepen, Factory 20–25% minder outputtokens, GitHub behoort tot de minste tokens en stappen die het heeft gemeten. Anthropic meldt ook een interne factcheckingstest waarin 16 van zijn 18 rapporten een kwaliteitsdrempel haalden die noch Claude Fable 5.1 noch Claude Opus 5 bij welke poging dan ook wist te halen. Het is allemaal door de leverancier gerapporteerd en niets ervan is gecontroleerd. De bekendgemaakte beperking is ongewoon openhartig en de moeite waard om te onthouden: Anthropic zegt dat Claude Opus 5.5 "vaak vermoedt dat het wordt geëvalueerd".

Ten slotte, de zustermodellen: Anthropic zegt dat Claude Sonnet 5.5 en Claude Haiku 5.5 "in de komende weken" arriveren. Geen van beide is uitgebracht, geen van beide heeft een prijs, en geen van beide is vandaag op enig oppervlak.

De vier wijzigingen testen zonder een volledige cutover

Het migratierisico hier is niet de kwaliteit — het is dat een codepad dat je nooit in staging hebt getest, juist degene is die in productie 400 teruggeeft. De vier breaking changes zijn allemaal wijzigingen in de vorm van requests, wat betekent dat ze deterministisch en onmiddellijk falen, en de enige manier om de paden te vinden die je hebt gemist, is er echt verkeer doorheen te laten lopen.

Claude Opus 5.5 staat op OrcaRouter als anthropic/claude-opus-5.5tegen Anthropics eigen lijstprijs met 0% opslag — de lijstprijs van de provider wordt doorgegeven, dus een prijswijziging van de leverancier is hier dezelfde dag nog live.

The OrcaRouter model page for Claude Opus 5.5, showing the identifier anthropic/claude-opus-5.5, input at $4.00 and output at $20.00 per 1M tokens, a 1M-token context window, 128K max output, text plus image and file input, and OpenAI-compatible and Anthropic Messages endpoints served from api.orcarouter.ai.

Daarmee kun je een percentage van het productieverkeer naar het model sturen terwijl de rest nog op Claude Opus 5 draait, zien welke verzoeken mislukken en waarom, en ze één voor één oplossen. De vier fouten zijn zelfbeschrijvend: elk noemt de parameter die is afgewezen en, in drie van de vier gevallen, de vervanging. Automatische failover overbrugt het gat zolang een pad nog kapot is — een verzoek dat mislukt tegen een model dat je nog niet volledig hebt gekarakteriseerd, valt terug op een model dat je wel hebt, in plaats van de 400 aan een gebruiker te tonen.

Een praktische werkvolgorde: wissel eerst de model-id om en stel de effort expliciet in, aangezien de standaard naar medium is verschoven; strip daarna de thinking-disabled- en forced-tool-choice-paden; repareer dan de streaminglezer — blokselectie op type en de instelling thinking.display — want dat is degene die stil faalt in plaats van luidruchtig; en bewaar de migratie van de computer-use-toolset voor het laatst als je op Bedrock zit, aangezien die daar niet van toepassing is. Al het andere — prijs, contextvenster, cachetarieven en de 1M-tokenstandaard — staat al op de plek waar je het hebt achtergelaten.

Stuur een deel van het liveverkeer naar het nieuwe model zonder volledig over te stappen: Claude Opus 5.5 op OrcaRouter draait tegen de lijstprijs van Anthropic, met automatische failover naar een model dat u al hebt gekarakteriseerd.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt