
Claude Sonnet 5.5: de 30%-kostenclaim, en de zes wijzigingen die Sonnet 5-code breken
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 984 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 195 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Claude Sonnet 5.5 werd op 28 september 2026 uitgebracht tegen exact dezelfde tarieven als Claude Sonnet 5 — $2 per miljoen inputtokens, $10 per miljoen outputtokens, $0,20 per miljoen gecachte reads — terwijl de aankondiging van Anthropic begint met "draait 30%+ sneller en kost tot 30% minder voor het meeste werk." Beide beweringen zijn waar, en de afstand ertussen is het hele verhaal. De besparingen zitten niet in de tariefkaart, omdat de tariefkaart niet is veranderd. Ze komen voort uit het draaien van het model op een lagere effort-instelling dan zijn voorganger nodig had, wat betekent dat het cijfer van 30% een bewering is over een operationeel punt dat je moet kiezen, niet een prijs die je erft. Onafhankelijke meting maakt de tweesprong scherp: op Artificial Analysis, Claude Sonnet 5.5 kost bij maximale inspanning $7,60 per taak op de Intelligence Index tegenover $5,09 voor Claude Sonnet 5 op maximaal — ongeveer 49% meer, niet 30% minder. Dat is geen tegenspraak met het cijfer van Anthropic. Het is het andere uiteinde van dezelfde curve, en het is waar de meeste migraties standaard terechtkomen als niemand de effort-sweep opnieuw uitvoert.
Twee claims die één nummer dragen
De post van Anthropic maakt de claim per taak op drie plaatsen, en elk daarvan steunt op effort. De sterkste versie: op Terminal-Bench 4.0, bij Medium effort — de standaard in de Claude-apps — "overtreft Sonnet 5.5 de beste score van Sonnet 5 ruimschoots, voor minder dan een tiende van de kosten per taak." Op AA-Briefcase v1.1, bij Medium effort, verslaat het het beste resultaat van Sonnet 5 voor ongeveer een negende van de kosten. Op CursorBench 4.0, bij Low effort, overtreft het het beste resultaat van Sonnet 5 voor minder dan een tiende.
Lees die als een geheel en het mechanisme is duidelijk. De ondergrens van Sonnet 5.5 ligt boven de bovengrens van Sonnet 5 op verschillende evaluaties. Je krijgt die 30% niet door minder per token te betalen; je krijgt die doordat je de dure instelling niet meer nodig hebt. Anthropic zegt dat ook in de migratiedocumentatie, één pagina verder dan de marketing: "Effort-niveaus zijn opnieuw gekalibreerd. Een effort-niveau levert niet dezelfde hoeveelheid denkwerk op als op Claude Sonnet 5. Voer je effort-sweep opnieuw uit in plaats van een instelling over te nemen."
Die zin is de belangrijkste regel in operationeel opzicht die Anthropic deze week publiceerde, en het is net die regel die niet in het grootste deel van de berichtgeving over de lancering terechtkwam.
Wat Anthropic heeft gepubliceerd — door de leverancier gerapporteerd, niet gereproduceerd
Alles in deze sectie is de eigen meting van Anthropic, afkomstig uit de aankondiging en systeemkaart van Sonnet 5.5. Het is een leveranciersclaim, geen onafhankelijk resultaat, en het voetnotenspoor is net zo belangrijk als de kopcijfers.
• Terminal-Bench 4.0 (agentisch coderen) — Sonnet 5.5 70,6% vs Sonnet 5 10,3%. Dat is een zevenvoudige sprong op de meest geciteerde rij, en het is het getal waarmee de meeste berichtgeving opende.
• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1% bij Xhigh en 46,2% bij Max; Sonnet 5 42,4%; Claude Opus 5.5 54,4%; GPT-6 Sol 49,3%. Let op de inversie: Sonnet 5.5 scoort lager bij Max dan bij Xhigh.
• CursorBench 4.0 — 55,5% voor Sonnet 5.5 tegenover 34,1% voor Sonnet 5 en 57,8% voor Opus 5.5. CursorBench 4.0 rapporteert GPT-6 Sol niet openbaar.
• GDPval-AA v2.1 (kenniswerk) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.
• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 op dezelfde vier modellen.
• Humanity's Last Exam (met hulpmiddelen) — 64,5% / 54,9% / 67,7%.
• OSWorld 2.1 (computergebruik, gedeeltelijke score) — 80,1% / 57,0% / 81,8%.
• Chartography (visuele grafiekherkenning, geen hulpmiddelen) — 61,6% / 15,6% / 64,4% / 53,6%.
Drie voetnoten verdienen het om met die rijen mee te reizen in plaats van eronder. Ten eerste: het cijfer van 66,4% voor Opus 5.5 in Terminal-Bench 4.0 wordt gerapporteerd bij Xhigh effort, de configuratie waarin Opus 5.5 het hoogst scoort. Ten tweede: de inversie bij FrontierCode Max wordt verklaard: bij Max gebruikte Sonnet 5.5 vaker de code-review-skill van Claude Code, die de beoordeling over veel subagenten verdeelt, en in twee gevallen leidde dat tot een time-out of tot bewerkingen buiten de scope van de taak — FrontierCode bestraft wijzigingen buiten de scope, zelfs als ze goed zijn. Ten derde, en het minst prettig voor de leverancier, liet Artificial Analysis GDPval-AA en AA-Briefcase draaien op een pre-release-implementatie van Sonnet 5.5 waarvan Anthropic zegt dat er een bug in zat die antwoorden op verzoeken met gestructureerde output verslechterde. Anthropic verwacht dat het effect klein is en Sonnet 5.5 onderschat, en zegt dat de bug is verholpen. Het merkt ook op dat OpenAI onlangs een bug in het beeldbegrip van GPT-6 Sol heeft verholpen, dus de cijfers voor GPT-6 Sol in die rijen geven mogelijk nog niet het huidige model weer.

Wat de onafhankelijke run zegt over hetzelfde model
Artificial Analysis heeft Sonnet 5.5 gemeten, en op de bijbehorende pagina wordt de exacte configuratie genoemd: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". Op dezelfde revisie van de index: 216 modellen in de klasse:
• Claude Sonnet 5.5 — Intelligence Index 56, gerangschikt als #3 van 216. $7,60 kosten per indextaak. Het genereerde 410M outputtokens tijdens de indexrun, tegen een mediaan van 88M.
• Claude Sonnet 5 — Index 38, gerangschikt als #58 van 216, op zijn eigen pagina met het label "(Adaptief redeneren, maximale inspanning)". Kosten per taak: $ 5,09. 370M outputtokens.
• Claude Opus 5.5 — Index 58, gerangschikt als #1 van 216. $5,98 per taak. 95,3 outputtokens per seconde.
• GPT-6 Sol — Index 48, plaats 20 van 216, tegen een lijstprijs van $2/$10. $1,06 per taak, 89,8 outputtokens per seconde.
Het verschil in de Intelligence Index — 56 tegenover 38, achttien punten — is de sterkste onafhankelijke bevestiging in dit stuk, en het is het getal dat een lezer daadwerkelijk zou moeten meenemen. Het kostencijfer is het cijfer dat een voorbehoud behoeft, en het is de moeite waard om precies te stellen: beide punten zijn configuraties met maximale inspanning, en maximale inspanning op een model dat langer redeneert, is een bewust dure positie om in te nemen. Sonnet 5.5 verbruikte 410M tokens tijdens de indexrun waarin Sonnet 5 370M verbruikte, en beide liggen ver boven de mediaan van 88M. Een model dat langer nadenkt op de hoogste instelling, kost meer op de hoogste instelling. Wat het getal weerlegt, is niet "goedkoper per taak", maar elke lezing ervan als een eigenschap van het model in plaats van van de instelling.
Artificial Analysis heeft nog geen cijfer voor de outputsnelheid van Sonnet 5.5 gepubliceerd — op hun pagina staat N/A bij Output tokens per seconde, tegenover 78,7 voor Sonnet 5 en 95,3 voor Opus 5.5. Het onderdeel "30%+ sneller" van Anthropics claim is op dit moment dus alleen door de leverancier zelf gerapporteerd. Beschouw het als indicatief totdat een derde partij het heeft gemeten.

Waar de besparing eigenlijk vandaan komt, en hoe je die kunt verkrijgen
Als je het mechanisme accepteert, schrijven de migratie-instructies zichzelf, en Anthropic heeft ze gepubliceerd:
• Begin standaard op high, niet op wat je Sonnet 5-configuratie ook zei. Het advies van Anthropic is high, tenzij je workload agentic is of latentiegevoelig.
• Agentisch coderen en meerstaps toolgebruik — begin op medium voor goed gespecificeerde taken en ga omhoog naar hoog voor moeilijkere of langere taken.
• Chat en ander latentiegevoelig werk — begin op gemiddeld of laag. Dit is de band waarin de beweringen over 'een tiende van de kosten' leven.
Er is een samenhangende verklaring waarom de lagere instelling werkt, en dat is geen marketing. Vroege testers van Anthropic meldden dat Sonnet 5.5 tool calls meer bundelt dan Sonnet 5 deed, wat zorgt voor minder stappen per taak. CodeRabbit's opmerking in de aankondiging is ongewoon specifiek voor een lanceringsquote: "de neiging van Sonnet 5 om te vaak naar webzoekopdrachten te grijpen en het hoge tokengebruik zijn beide verdwenen in dit nieuwe model." Sonnet 5.5 behield ook dezelfde tokenizer als Sonnet 5, dus identieke tekst kost identieke tokens — de reductie zit in minder beurten en minder redundante aanroepen, niet in een goedkopere vocabulaire. Dat betekent ook dat de tokenaantallen in je logs vergelijkbaar blijven na de upgrade, waardoor voor-en-na-meting eenvoudig is.
De zes wijzigingen die Sonnet 5-code breken of veranderen
Dit is het deel van de release dat engineeringtijd kost, en dit is waar de migratiegids meer waard is dan de benchmarkgrafiek. Vijf van de zes geven harde fouten terug; de zesde faalt stil.
• thinking: {"type": "disabled"} geeft nu een 400 terug. De vervanging is thinking: {"type": "between_tools"}, wat denken vooraf uitschakelt en de laagste denk-instelling op dit model is. Het werkt bij lage, gemiddelde en hoge effort, heeft geen bèta-header nodig en is beschikbaar op elk platform dat Sonnet 5.5 aanbiedt. Bij xhigh- of max-effort geeft between_tools zelf een 400 terug — gebruik adaptief denken (laat het veld weg, of stuur {"type": "adaptive"}) als je die niveaus nodig hebt. Met between_tools kun je ook niet midden in een gesprek van effort wisselen.
• Geforceerd gebruik van tools wordt niet ondersteund. tool_choice ingesteld op {"type": "any"} of {"type": "tool", "name": "..."} geeft een 400 terug met het bericht "tool_choice: type 'tool' and 'any' are not supported for this model." Dezelfde controle geldt voor het token-tellende endpoint. De gedocumenteerde vervanging voor schema-valide invoer is tool_choice: {"type": "auto"} plus strict: true op de tool, of het verplaatsen van het schema naar gestructureerde outputs.
• Thinking-blokken zijn gebonden aan het model en het gesprek. Sonnet 5.5 leest thinking-blokken van Sonnet 5, Opus 4.8, Haiku 4.5 en eerder — niet van Opus 5, Opus 5.5 of enig Fable- of Mythos-model. Geen enkel ander model leest de blokken van Sonnet 5.5. Verplaats een gesprek van Sonnet 5 naar 5.5 en de redenering blijft behouden; verplaats het van Sonnet 5.5 naar iets anders en de latere beurten draaien zonder. Daarnaast controleert de API nu of de systeemprompt, de hulpmiddelenlijst of een eerder bericht is gewijzigd sinds een thinking-blok werd geproduceerd, en op accounts die op of na 31 augustus 2026 zijn aangemaakt, retourneert deze een 400 wanneer dat het geval is. Houd gesprekken append-only, of stuur de bètaheader thinking-binding-controls-2026-08-01 mee met prefix_mismatch_behavior: "drop_block".
• computer_20251124 wordt afgewezen op de Claude API en Google Cloud. Computergebruik aldaar vereist de toolset computer_toolset_20260801. Amazon Bedrock accepteert de oudere tool nog steeds — een platformverschil dat het vermelden waard is als je dezelfde agent op beide draait.
• Sommige combinaties van adviseurs zijn verdwenen. Een Sonnet 5.5-executor accepteert Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 of 5.5 zelf als adviseur. Opus 4.8-, Opus 4.7- en Opus 5-adviseurs, die met een Sonnet 5-executor werken, geven een 400 terug met een Sonnet 5.5-executor. Elke adviseur die Sonnet 5.5 accepteert, geeft versleuteld advies terug, waardoor je client de adviestekst niet kan lezen.
• Tekst tussen toolaanroepen komt nu binnen in thinking-blokken — en bij de standaardweergave: "omitted" is die leeg. Dit is de stille variant. Notities van meer dan een zin of twee tussen toolaanroepen komen terug als thinking-blokken met voortgangsupdates in plaats van als tekst. Een applicatie die dat verhaal naar zijn gebruikers streamt, valt stil tussen toolaanroepen, zonder fout en zonder iets in de logs. De oplossing is ofwel thinking.display instellen zodat de tekst wordt teruggegeven, ofwel overschakelen naar between_tools, in welk geval de tekst als gewone tekst terugkomt.
Nog twee dingen die een migratie raakt, geen van beide een fout. Monitoring op weigeringen: Sonnet 5.5 retourneert stop_reason: "refusal" met een stop_details-object dat een van vijf beleidsgebieden noemt — cyber, bio, frontier_llm, reasoning_extraction, general_harms — en Anthropics server-side fallback probeert cyber- en frontier_llm-weigeringen op Sonnet 5 opnieuw, maar niet de andere drie. En de beveiligingshouding is echt veranderd: Sonnet 5.5 is het eerste Sonnet-model dat wordt geleverd met cyberbeveiligingen en fallbacks zoals de Opus-klasse, wat betekent dat cyberbeveiligingsverzoeken met een hoger risico zichtbaar terugvallen op Sonnet 5, en het eerste Sonnet met classifiers tegen reasoning extraction. Als de waardepropositie van je product een beveiligingstool is, test dan die grens voordat je de modelwissel uitbrengt.
Prijzen, en wat er vandaag echt op onze route staat
De tariefkaart is ongewijzigd ten opzichte van Sonnet 5 en de volledige gepubliceerde vorm ervan is kort genoeg om eenvoudig te vermelden:
• Input — $2,00 per miljoen tokens. Output — $10,00 per miljoen tokens. Beide identiek aan Sonnet 5, bevestigd op Anthropic's modelpagina voor Sonnet 5.5.
• Cache-lezen — $0,20 per miljoen, een korting van 90% op input; Cache-schrijven van 5 minuten $2,50 per miljoen; Cache-schrijven van 1 uur $4,00 per miljoen. De minimale prompt die in de cache kan worden opgenomen is 512 tokens op Sonnet 5.5, verlaagd van 1.024 op Sonnet 5.
• Batch — 50% korting in beide richtingen, dus $1,00 / $5,00 per miljoen. Bij de Message Batches API kan de uitvoer oplopen tot 300K tokens met de bèta-header output-300k-2026-03-24.
• Tegen Opus 5.5 — Sonnet 5.5 is precies de helft: $2/$10 tegenover $4/$20, met cache-writes op de helft en cache-reads identiek op $0,20. Dat is de migratie die loont, en Anthropic zegt het ronduit: de twee modellen vullen elkaar het beste aan wanneer Sonnet op lagere inspanning draait, en Opus "blijft duidelijk sterker bij complex, open-ended werk dat een volgehouden oordeelsvermogen vereist."
• Context en uitvoer — 1-token context, maximaal 128K uitvoer, adaptief denken standaard ingeschakeld, standaard inspanning hoog, betrouwbare kennisafsluitdatum juni 2026, nul dataretentie beschikbaar, buitengebruikstelling niet eerder dan 28 september 2027.
Eén opmerking over beschikbaarheid die we liever expliciet vermelden dan suggereren: Claude Sonnet 5.5 staat per 29 september 2026 niet in onze modelcatalogus.Zijn voorganger anthropic/claude-sonnet-5 en zijn grotere broer anthropic/claude-opus-5.5 staan er beide wel in, en de tarieven aan onze kant zijn die van de provider zelf — $2,00 in, $10,00 uit, $0,20 cache read, $2,50 cache write voor Sonnet 5, zonder dat er een opslag wordt toegevoegd, zodat een prijswijziging van de leverancier hier dezelfde dag nog ingaat in plaats van pas bij de volgende factureringscyclus. Die laatste eigenschap is wat het lezen van een tariefkaart nuttig maakt in plaats van decoratief.

Wat je hier vandaag mee kunt doen
De eerlijke volgorde voor een team dat Claude Sonnet 5 al in productie draait, bestaat uit drie stappen, en geen ervan is "de model-string omwisselen en de grafiek in de gaten houden."
Ten eerste, voer de effort-sweep opnieuw uit. Als je een hoge of maximale instelling hebt meegenomen uit Sonnet 5 omdat dat was wat je kwaliteitslat vereiste, betaal je nu voor redeneerwerk dat je niet meer hoeft af te nemen. De onafhankelijke cijfers over kosten per taak zeggen dat de bovenkant van de ladder duurder is geworden, niet goedkoper, en de eigen kostenclaims van de leverancier gaan allemaal over de middenmoot. Ten tweede, repareer de twee foutpaden vóór de uitrol — uitgeschakeld denken en geforceerd toolgebruik — want beide falen luid en onmiddellijk, wat het goede nieuws is. Ten derde, houd het narratiepad in de gaten, want dat faalt stil.
Als het model nog niet op de route staat die je gebruikt, is de manier met weinig risico om het te evalueren: het ernaast laten draaien, niet in plaats ervan: houd Sonnet 5 vastgezet als fallback op dezelfde sleutel, zodat een weigering, een time-out of een slechte evaluatie het verzoek naar het model stuurt dat je al vertrouwt, en de automatische failover sluit de lus zonder een tweede integratie. Dat is het hele argument om een onbewezen model achter één endpoint te evalueren in plaats van vóór je gebruikers — en het geldt hier dubbel, want de weigeringscategorieën van Sonnet 5.5 zijn nieuw en de inspanningskalibratie is expliciet niet dezelfde als die van zijn voorganger. Wanneer je klaar bent om de standaard te verplaatsen, loopt het aanbod op één sleutel tot meer dan 200 modellen, waardoor de vergelijking een configuratiewijziging is in plaats van een tweede contract.
Wat te kijken
Drie dingen zullen de openstaande vragen in dit stuk oplossen, en geen ervan heeft zich nog voorgedaan.
Een onafhankelijke meting van de outputsnelheid is de eerste. Anthropic beweert 30%+ sneller te zijn dan Sonnet 5; Artificial Analysis heeft geen cijfer voor Sonnet 5.5 gepubliceerd, en die claim speelt een wezenlijke rol in het kostenargument, aangezien een sneller model dezelfde taak in minder kloktijd en vaak in minder tokens afrondt. Claude Haiku 5.5 is de tweede — Anthropic zegt dat die "in de komende weken" komt en onder Sonnet 5.5 komt te staan, wat de afweging verandert voor het chatsegment met hoog volume, waar medium en low effort Sonnet 5.5 al concurrerend maken. De derde is de correctieronde: Artificial Analysis heeft GDPval-AA en AA-Briefcase uitgevoerd op een pre-releasebuild met een bug in de gestructureerde output, Anthropic verwacht dat die scores het model te laag inschatten, en geen van beide cijfers is opnieuw uitgevoerd. Als ze omhooggaan, wordt de kloof op het gebied van kenniswerk met Opus 5.5 verder kleiner en wordt het argument "de helft van de prijs" sterker.
Tot dan is de verdedigbare samenvatting beperkter dan de aankondiging en nuttiger dan de benchmarkgrafiek. Claude Sonnet 5.5 is een intelligentiewinst van achttien punten ten opzichte van Sonnet 5 op de onafhankelijke index, tegen dezelfde gepubliceerde tarieven, met een reële en meetbare besparing voor iedereen die een trede lager op de inspanningsladder gaat — en een reële en meetbare straf voor wie dat niet doet.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
