Ett titelkort för Claude Sonnet 5.5 med rubriken ”samma pris, mindre arbete”, underrubriken ”$2 / $10 per miljon tokens, oförändrat jämfört med Sonnet 5” och tre statistikrutor som visar 56 (AA Intelligence Index), #3 / 216 (placering på det indexet) och $7.60 (kostnad per uppgift vid maximal ansträngning).
Guides & Insights

Claude Sonnet 5.5: Påståendet om 30 % lägre kostnad, och de sex ändringarna som bryter Sonnet 5-kod

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Claude Sonnet 5.5 släpptes den 28 september 2026 till exakt samma priser som Claude Sonnet 5 — $2 per miljon indatatokens, $10 per miljon utdatatokens, $0,20 per miljon cachade läsningar — medan Anthropics tillkännagivande inleds med "kör 30 %+ snabbare och kostar upp till 30 % mindre för det mesta av arbetet." Båda påståendena är sanna, och avståndet mellan dem är hela historien. Besparingarna finns inte i prislistan, eftersom prislistan inte rörde sig. De kommer från att köra modellen med en lägre ansträngningsinställning än dess föregångare behövde, vilket innebär att siffran 30 % är ett påstående om en driftpunkt du måste välja, inte ett pris du ärver. Oberoende mätning gör vägskälet skarpt: på Artificial Analysis, Claude Sonnet 5.5 vid maximal ansträngning kostar $7,60 per uppgift på Intelligence Index mot $5,09 för Claude Sonnet 5 vid max — ungefär 49 % mer, inte 30 % mindre. Det är inte en motsägelse av Anthropics siffra. Det är den andra änden av samma kurva, och det är där de flesta migreringar kommer att hamna som standard om ingen kör om sitt ansträngningssvep.

Två påståenden som bär samma nummer

Anthropics inlägg framför påståendet om kostnaden per uppgift på tre ställen, och vart och ett vilar på effort. Den starkaste versionen: på Terminal-Bench 4.0, vid Medium effort – standard i Claude-apparna – Sonnet 5.5 "överträffar Sonnet 5:s bästa resultat med råge för mindre än en tiondel av kostnaden per uppgift." På AA-Briefcase v1.1, vid Medium effort, slår den Sonnet 5:s bästa resultat för ungefär en niondel av kostnaden. På CursorBench 4.0, vid Low effort, överträffar den Sonnet 5:s bästa resultat för mindre än en tiondel.

Läs dem som en uppsättning, så är mekanismen uppenbar. Sonnet 5.5:s lägstanivå ligger över Sonnet 5:s högstanivå i flera utvärderingar. Du får inte de 30 % genom att betala mindre per token; du får dem genom att inte längre behöva den dyra inställningen. Anthropic säger samma sak i migreringsdokumentationen, en sida bort från marknadsföringen: "Ansträngningsnivåerna har omkalibrerats. En ansträngningsnivå ger inte samma mängd tänkande som den gjorde på Claude Sonnet 5. Kör om ditt ansträngningssvep i stället för att föra över en inställning."

Den meningen är den operativt viktigaste raden Anthropic publicerade den här veckan, och det är just den som inte tog sig in i största delen av lanseringsbevakningen.

Vad Anthropic publicerade – leverantörsrapporterat, ej reproducerat

Allt i det här avsnittet är Anthropics egen mätning, från tillkännagivandet av Sonnet 5.5 och systemkortet. Det är ett påstående från leverantören, inte ett oberoende resultat, och fotnotsspåret spelar lika stor roll som rubriksiffrorna.

• Terminal-Bench 4.0 (agentisk kodning) — Sonnet 5.5 70,6 % mot Sonnet 5 10,3 %. Det är en sjudubblad ökning på den enskilt mest citerade raden, och det är siffran som de flesta rapporteringar inledde med.

• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1 % vid Xhigh och 46,2 % vid Max; Sonnet 5 42,4 %; Claude Opus 5.5 54,4 %; GPT-6 Sol 49,3 %. Notera inversionen: Sonnet 5.5 får lägre poäng vid Max än vid Xhigh.

• CursorBench 4.0 — 55,5 % för Sonnet 5.5 mot 34,1 % för Sonnet 5 och 57,8 % för Opus 5.5. CursorBench 4.0 rapporterar inte GPT-6 Sol offentligt.

• GDPval-AA v2.1 (kunskapsarbete) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.

• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 på samma fyra modeller.

• Humanity's Last Exam (med verktyg) — 64,5 % / 54,9 % / 67,7 %.

• OSWorld 2.1 (datoranvändning, delpoäng) — 80,1 % / 57,0 % / 81,8 %.

• Chartography (visuell diagramigenkänning, utan verktyg) — 61,6 % / 15,6 % / 64,4 % / 53,6 %.

Tre fotnoter förtjänar att följa med de raderna i stället för att stå under dem. För det första, siffran 66,4 % för Opus 5.5 i Terminal-Bench 4.0 rapporteras vid Xhigh effort, Opus 5.5:s konfiguration med högst poäng. För det andra, inversionen för FrontierCode Max förklaras: vid Max körde Sonnet 5.5 oftare Claude Codes kodgransknings-skill, som delar upp granskningen mellan många subagenter, och i två fall ledde det till en timeout eller ändringar utanför uppgiftens omfattning – FrontierCode straffar ändringar utanför omfattningen även när de är bra. För det tredje, och minst bekvämt för leverantören, körde Artificial Analysis GDPval-AA och AA-Briefcase på en förhandsversionsdriftsättning av Sonnet 5.5 som Anthropic säger hade en bugg som försämrade svar på begäranden om strukturerad utdata. Anthropic förväntar sig att effekten är liten och underskattar Sonnet 5.5, och säger att buggen är åtgärdad. Anthropic noterar också att OpenAI nyligen åtgärdade en bugg för bildförståelse i GPT-6 Sol, så siffrorna för GPT-6 Sol i dessa rader kanske ännu inte återspeglar den aktuella modellen.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56 at rank #3 of 216, $2.00 input and $10.00 output per 1M tokens, and a $7.60 average cost per index task with 410M tokens generated.

Vad den oberoende körningen säger om samma modell

Artificial Analysis har mätt Sonnet 5.5, och dess sida anger den exakta konfigurationen: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". På samma revision av indexet, 216 modeller i klassen:

• Claude Sonnet 5.5 — Intelligence Index 56, rankad som #3 av 216. 7,60 $ i kostnad per indexuppgift. Den genererade 410 miljoner utdatatokens under indexkörningen, jämfört med en median på 88 miljoner.

• Claude Sonnet 5 — Index 38, rankad som nr 58 av 216, på sin egen sida med etiketten "(Adaptivt resonemang, Maximal ansträngning)". Kostnad per uppgift: $5.09. 370M utdatatokens.

• Claude Opus 5.5 — Index 58, rankad #1 av 216. $5,98 per uppgift. 95,3 utdatatoken per sekund.

• GPT-6 Sol — Index 48, rankad #20 av 216, till listpriset $2/$10. $1,06 per uppgift, 89,8 utdatatoken per sekund.

Gapet i Intelligence Index — 56 mot 38, arton punkter — är det starkaste oberoende bekräftelsen i den här artikeln, och det är siffran som en läsare faktiskt bör ta med sig. Kostnadssiffran är den som behöver en varning, och det är värt att säga exakt: båda punkterna är max-effort-konfigurationer, och max effort på en modell som resonerar längre är en avsiktligt dyr plats att stå på. Sonnet 5.5 brände 410M tokens på indexkörningen där Sonnet 5 brände 370M, och båda ligger långt över medianen på 88M. En modell som tänker längre på den högsta inställningen kostar mer på den högsta inställningen. Vad siffran motbevisar är inte "billigare per uppgift" utan varje tolkning av den som en egenskap hos modellen snarare än hos inställningen.

Artificial Analysis har ännu inte publicerat en siffra för utdatahastighet för Sonnet 5.5 – dess sida visar N/A för utdatatokens per sekund, mot 78,7 för Sonnet 5 och 95,3 för Opus 5.5. Så den "30 %+ snabbare"-hälften av Anthropics påstående är i nuläget endast rapporterad av leverantören. Betrakta den som indikativ tills en tredje part mäter den.

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Sonnet 5 - the cost-per-task fork'. The left column, Claude Sonnet 5.5, reads AA Intelligence Index 56, rank #3 of 216, cost per task at max effort $7.60, 410M output tokens on the index run, $2 / $10 input and output price, default effort high. The right column, Claude Sonnet 5, reads 38, #58 of 216, $5.09, 370M, $2 / $10, high.

Var besparingen faktiskt kommer ifrån, och hur man får den

Om du accepterar mekanismen skriver migreringsinstruktionerna sig själva, och Anthropic har publicerat dem:

• Börja på hög som standard, inte på vad din Sonnet 5-konfiguration än sa. Anthropics rekommendation är hög om inte din arbetsbelastning är agentisk eller latenskänslig.

• Agentisk kodning och verktygsanvändning i flera steg — börja på medium för välspecificerade uppgifter och gå upp till hög för svårare eller längre.

• Chatt och annat latenskänsligt arbete – börja på medium eller låg. Det här är bandet där påståendena om "en tiondel av kostnaden" hör hemma.

Det finns en sammanhängande förklaring till varför den lägre inställningen fungerar, och det är inte marknadsföring. Anthropics tidiga testare rapporterade att Sonnet 5.5 slår samman verktygsanrop i större utsträckning än Sonnet 5 gjorde, vilket ger färre steg per uppgift. CodeRabbits kommentar i tillkännagivandet är ovanligt specifik för att vara ett lanseringscitat: Sonnet 5:s ”benägenhet att ta till webbsökning alltför ofta och dess höga tokenanvändning är båda borta i den här nya modellen”. Sonnet 5.5 behöll också samma tokenizer som Sonnet 5, så identisk text kostar identiska tokens – minskningen består av färre turer och färre redundanta anrop, inte av ett billigare ordförråd. Det innebär också att tokenantalen i dina loggar förblir jämförbara över uppgraderingen, vilket gör mätning före och efter enkel.

De sex ändringarna som bryter eller ändrar Sonnet 5-kod

Det här är den del av releasen som kostar ingenjörstid, och det är här migreringsguiden är värd mer än benchmarkdiagrammet. Fem av de sex ger hårda fel; den sjätte misslyckas tyst.

• thinking: {"type": "disabled"} returnerar nu en 400. Ersättningen är thinking: {"type": "between_tools"}, vilket stänger av inledande tänkande och är den lägsta tänkandeinställningen på den här modellen. Den fungerar vid låg, medel och hög effort, kräver ingen beta-header och är tillgänglig på alla plattformar som erbjuder Sonnet 5.5. Vid xhigh- eller max-effort returnerar between_tools självt en 400 – använd adaptivt tänkande (utelämna fältet eller skicka {"type": "adaptive"}) om du behöver dessa nivåer. Med between_tools kan du dessutom inte ändra effort mitt i en konversation.

• Tvingad verktygsanvändning stöds inte. tool_choice satt till {"type": "any"} eller {"type": "tool", "name": "..."} returnerar en 400 med meddelandet "tool_choice: type 'tool' and 'any' are not supported for this model." Samma kontroll gäller för slutpunkten för tokenräkning. Den dokumenterade ersättningen för schemagiltig indata är tool_choice: {"type": "auto"} samt strict: true på verktyget, eller att flytta schemat till strukturerade utdata.

• Tankeblock är bundna till modellen och konversationen. Sonnet 5.5 läser tankeblock från Sonnet 5, Opus 4.8, Haiku 4.5 och tidigare — inte från Opus 5, Opus 5.5 eller någon Fable- eller Mythos-modell. Ingen annan modell läser Sonnet 5.5:s block. Flytta en konversation från Sonnet 5 till 5.5 och resonemanget bevaras; flytta den från Sonnet 5.5 till något annat och de senare turerna körs utan det. Separat kontrollerar API:et nu om systemprompten, verktygslistan eller ett tidigare meddelande har ändrats sedan ett tankeblock skapades, och för konton som skapades den 31 augusti 2026 eller senare returnerar det en 400 när så har skett. Håll konversationer som endast tillåter tillägg, eller skicka beta-headern thinking-binding-controls-2026-08-01 med prefix_mismatch_behavior: "drop_block".

• computer_20251124 avvisas i Claude API och Google Cloud. Datoranvändning där kräver verktygsuppsättningen computer_toolset_20260801. Amazon Bedrock accepterar fortfarande det äldre verktyget – en plattformsskillnad som är värd att flagga om du kör samma agent på båda.

• Vissa rådgivarparningar finns inte längre. En Sonnet 5.5-utförare accepterar Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 eller Sonnet 5.5 själv som rådgivare. Rådgivarna Opus 4.8, Opus 4.7 och Sonnet 5, som fungerar med en Sonnet 5-utförare, returnerar en 400 med en Sonnet 5.5-utförare. Varje rådgivare som Sonnet 5.5 accepterar returnerar krypterad rådgivning, så din klient kan inte läsa rådgivningstexten.

• Text mellan verktygsanrop kommer nu inuti tankeblock – och med standardvärdet för display: "omitted" är den tom. Det här är den tysta. Anteckningar längre än en eller två meningar mellan verktygsanrop kommer tillbaka som tankeblock för förloppsuppdateringar i stället för som text. Ett program som strömmar den berättelsen till sina användare tystnar mellan verktygsanrop, utan fel och inget i loggarna. Lösningen är antingen att ställa in thinking.display så att texten returneras, eller att byta till between_tools, i vilket fall texten kommer tillbaka som vanlig text.

Ytterligare två saker som en migrering berör, och ingen av dem är ett fel. Övervakning av avslag: Sonnet 5.5 returnerar stop_reason: "refusal" med ett stop_details-objekt som namnger ett av fem policyområden – cyber, bio, frontier_llm, reasoning_extraction, general_harms – och Anthropics fallback på serversidan kommer att försöka igen med cyber- och frontier_llm-avslag på Sonnet 5, men inte med de andra tre. Och säkerhetsläget har verkligen förändrats: Sonnet 5.5 är den första Sonnet-modellen som levereras med cyberskydd och fallbacks som i Opus-klassen, vilket innebär att cybersäkerhetsförfrågningar med högre risk synligt faller tillbaka till Sonnet 5, och den första Sonnet-modellen med klassificerare mot utvinning av resonemang. Om din produkts värdeerbjudande är ett säkerhetsverktyg bör du testa den gränsen innan du släpper modellbytet.

Prissättning, och vad som verkligen finns på vår rutt idag

Prislistan är oförändrad sedan Sonnet 5, och dess fullständiga publicerade form är tillräckligt kort för att kunna anges rakt ut:

• Indata — 2,00 USD per miljon tokens. Utdata — 10,00 USD per miljon tokens. Båda identiska med Sonnet 5, bekräftat på Anthropics modellsida för Sonnet 5.5.

• Cacheläsning — 0,20 $ per miljon, en rabatt på 90 % på indata; cacheskrivning på 5 minuter 2,50 $ per miljon; cacheskrivning på 1 timme 4,00 $ per miljon. Den minsta cachelagringsbara prompten är 512 tokens på Sonnet 5.5, ned från 1 024 på Sonnet 5.

• Batch — 50 % rabatt i båda riktningarna, så $1.00 / $5.00 per miljon. I Message Batches API kan utdata uppgå till 300K tokens med beta-headern output-300k-2026-03-24.

• Mot Opus 5.5 — Sonnet 5.5 är exakt hälften: $2/$10 mot $4/$20, med cache-skrivningar till halva priset och cache-läsningar identiska på $0.20. Det är migreringen som lönar sig, och Anthropic säger det rakt ut: de två modellerna kompletterar varandra bäst när Sonnet körs med lägre ansträngning, och Opus "förblir klart starkare på komplexa, öppna uppgifter som kräver varaktigt omdöme."

• Kontext och utdata — 1M-tokenkontext, 128K maximal utdata, adaptivt tänkande aktiverat som standard, standardansträngning hög, tillförlitlig kunskapsavgränsning juni 2026, noll datalagring tillgänglig, avveckling inte tidigare än den 28 september 2027.

En tillgänglighetsnotis som vi hellre säger rakt ut än antyder: Claude Sonnet 5.5 finns inte i vår modellkatalog per den 29 september 2026. Dess föregångare anthropic/claude-sonnet-5 och dess större syskon anthropic/claude-opus-5.5 finns båda med, och priserna hos oss är leverantörens egna – 2,00 USD in, 10,00 USD ut, 0,20 USD för cacheläsning, 2,50 USD för cacheskrivning för Sonnet 5, utan något påslag, så en prisändring från leverantören slår igenom här samma dag som den sker i stället för vid nästa faktureringscykel. Det är den sista egenskapen som gör en prislista läsvärd snarare än dekorativ.

OrcaRouter model page for anthropic/claude-sonnet-5, attributed to Anthropic and dated 2026-06-30, showing a 1M-token context window, up to 128K output tokens, and the unchanged rates of $2.00 per million input tokens and $10.00 per million output tokens. The page carries a link reading 'the Claude Sonnet 5 API'.

Vad du kan göra med detta idag

Den ärliga ordningen för ett team som redan kör Claude Sonnet 5 i produktion är tre steg, och inget av dem är "att byta ut modellsträngen och titta på grafen."

Först, kör om ansträngningssvepet. Om du har ärvt en hög eller maximal inställning från Sonnet 5 eftersom det var vad din kvalitetsribba krävde, betalar du nu för resonemang du inte längre behöver köpa. De oberoende siffrorna för kostnad per uppgift säger att toppen av stegen blev mer kostsam, inte billigare, och leverantörens egna kostnadspåståenden beskriver alla mitten av den. För det andra, åtgärda de två felvägarna före driftsättningen – inaktiverat tänkande och påtvingad verktygsanvändning – eftersom båda misslyckas högljutt och omedelbart, vilket är den goda nyheten. För det tredje, håll koll på narrationsvägen, eftersom den misslyckas tyst.

Om modellen ännu inte finns på den väg du använder är det lågrisk-sättet att utvärdera den att köra den vid sidan av, inte i stället: håll Sonnet 5 fäst som fallback på samma nyckel så att en vägran, en timeout eller en dålig utvärdering skickar begäran till modellen du redan litar på, och automatisk failover sluter loopen utan en andra integration. Det är hela argumentet för att utvärdera en oprövad modell bakom en enda slutpunkt i stället för framför dina användare — och det gäller dubbelt här, eftersom Sonnet 5.5:s vägranskategorier är nya och dess effort-kalibrering uttryckligen inte är densamma som föregångarens. När du är redo att flytta standarden går listan på en nyckel till mer än 200 modeller, vilket gör jämförelsen till en konfigurationsändring i stället för ett andra avtal.

Vad du ska titta på

Tre saker kommer att avgöra de öppna frågorna i den här artikeln, och ingen av dem har inträffat ännu.

En oberoende mätning av utdatahastigheten är den första. Anthropic hävdar 30 %+ snabbare än Sonnet 5; Artificial Analysis har inte publicerat någon siffra för Sonnet 5.5, och påståendet spelar en verklig roll i kostnadsargumentet, eftersom en snabbare modell slutför samma uppgift på kortare väggklockstid och ofta med färre tokens. Claude Haiku 5.5 är den andra – Anthropic säger att den kommer ”inom de kommande veckorna” och att den kommer att ligga under Sonnet 5.5, vilket förändrar kalkylen för chattsegmentet med hög volym där medel- och låg ansträngning redan gör Sonnet 5.5 konkurrenskraftig. Den tredje är korrigeringsomgången: Artificial Analysis körde GDPval-AA och AA-Briefcase på en förhandsversion med en bugg för strukturerad utdata, Anthropic förväntar sig att dessa resultat underskattar modellen, och ingen av siffrorna har körts om. Om de stiger minskar klyftan i kunskapsarbete gentemot Opus 5.5 ytterligare och argumentet ”halva priset” blir starkare.

Fram till dess är den försvarbara sammanfattningen snävare än tillkännagivandet och mer användbar än benchmarkdiagrammet. Claude Sonnet 5.5 är en intelligensvinst på arton punkter jämfört med Sonnet 5 på det oberoende indexet, till samma publicerade priser, med en verklig och mätbar besparing tillgänglig för alla som rör sig nedåt på ansträngningsstegen – och ett verkligt och mätbart straff för alla som inte gör det.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen