Genererade hero-titelkort för Claude Sonnet 5.5 vs Claude Opus 5.5, med undertexten "The benchmarks converge, the bill does not", som visar $2.00 och $10.00 per miljon tokens till vänster mot $4.00 och $20.00 till höger, med OrcaRouter-logotypen komponerad i det nedre högra hörnet.
Guides & Insights

Claude Sonnet 5.5 vs Claude Opus 5.5: Benchmarkarna konvergerar, notan gör det inte

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Claude Sonnet 5.5 blev allmänt tillgänglig den 28 september 2026 för 2,00 dollar per miljon indatatokens och 10,00 dollar per miljon utdatatokens. Claude Opus 5.5, Anthro​pics flaggskepp, lanserades sex dagar tidigare, den 22 september, för 4,00 och 20,00 dollar – exakt dubbelt på båda raderna. Den uppenbara tolkningen är att Opus 5.5 är taket och att Sonnet 5.5 är kompromissen man gör när budgeten är verklig. Anthro​pics egen lanseringstabell stöder inte den tolkningen. Enligt siffrorna som företaget publicerade får Claude Sonnet 5.5 1844 mot Opus 5.5:s 1846 på GDPval-AA v2.1, 1811 mot 1822 på AA-Briefcase v1.1 och 70,6 % mot 66,4 % på Terminal-Bench 4.0 – den vinner det enda benchmark som mäter arbete som faktiskt utförs i en terminal. Två rader under dessa siffror står det i Anthro​pics egen bildtext att Opus 5.5 ”förblir klart starkare på komplext, öppet arbete”. Båda påståendena är sanna, och att komma underfund med hur man kan hålla båda för sanna samtidigt är större delen av syftet med den här jämförelsen.

Vad lanseringstabellen säger, och vad den avstår från att säga

Mönstret i Anthropics benchmarkblock är en modell som har stängt större delen av gapet snarare än en som har tagit ledningen. GDPval-AA v2.1, en ekonomiskt viktad uppsättning uppgifter, är ett tvåpoängsdödläge. AA-Briefcase v1.1, en utvärdering av dokument och leverabler, är ett elvapoängsdödläge. CursorBench 4.0 går åt andra hållet: 55,5 % för Sonnet 5.5 mot 57,8 % för Opus 5.5. OSWorld 2.1 landar på 80,1 % mot 81,8 %, och Humanity's Last Exam på 64,5 % med verktyg mot 67,7 %. Endast Terminal-Bench 4.0 bryter mönstret, och det bryter hårt – 70,6 % mot 66,4 %, en fyrapoängsfördel för Sonnet inom agentiskt kommandoradsarbete.

Läs radetiketterna i stället för siffrorna, och något annat framträder. Flera av de där Opus 5.5-posterna bär en ansträngningsannotering — 66,4 % vid Xhigh — och en fotnot anger att Max-konfigurationen får lägre poäng än Xhigh på FrontierCode, inte högre. Högre ansträngning är inte monoton. Ett budgetmedvetet team som antar att ”maximal ansträngning” är en gratis uppgradering köper tokens för ett sämre svar på åtminstone ett av Anthropics egna tester. Och på FrontierCode 1.1 placerar samma fotnot Sonnet 5.5 på 46,2 % i Max-konfigurationen mot Opus 5.5:s 54,4 %, vilket är den tydligaste enskilda siffran för var flaggskeppet fortfarande drar ifrån: kodarbete över långa tidshorisonter under en uppgiftsdefinition som belönar uthållighet.

Det finns ytterligare en invändning som är värd att sägas rakt ut i stället för att begravas. Anthropic noterar att de GDPval-AA- och AA-Briefcase-körningar som företaget publicerar utfördes på en förhandsdistribution som hade en bugg i strukturerade utdata. Det påverkar båda modellerna i samma tabell, så jämförelsen ogiltigförklaras inte, men det innebär att de absoluta siffrorna bör betraktas som en ögonblicksbild snarare än ett fastställt resultat. Leverantörers benchmarktabeller är marknadsföringsartefakter med en metodbilaga, och den här kommer med sin bilaga bifogad.

Var den oberoende mätningen landar

Artificial Analysis poängsätter båda modellerna i en och samma testrigg, i samma konfiguration som den kallar ”Adaptive Reasoning, Max Effort, Default Fallback”, på Intelligence Index v4.3. Claude Opus 5.5 ligger på 58. Claude Sonnet 5.5 ligger på 56. Det är en skillnad på två punkter på en skala där samma utvärderare placerar Opus 5 på 51, Sonnet 5 på 38, DeepSeek V4 Pro på 36 och Gemini 3.1 Pro Preview på 30. Att en ny Sonnet hamnar två punkter under flaggskeppet och fem punkter över den förra Opus-generationen är det väsentliga påståendet i den här lanseringen, och det är ett påstående från tredje part snarare än från leverantören.

Sedan vänder samma sida på det ekonomiska. Artificial Analysis rapporterar att en utvärderingskörning med Sonnet 5.5 kostar 7,60 dollar per uppgift jämfört med 5,98 dollar för Opus 5.5, trots att Sonnet 5.5 kostar hälften så mycket per token. Orsaken står rakt där på sidan: Sonnet 5.5 genererade 410 miljoner tokens i indexsviten jämfört med en median på 88 miljoner för de modeller den följer – "mycket mångordig", med utvärderarens ord. Opus 5.5 genererade 260 miljoner i samma svit. Med 10 dollar per miljon utdatatokens mot 20 dollar innebär mångordighetsfaktorn på ungefär 1,6 att Sonnet 5.5 fortfarande betalar omkring 27 % mer per slutförd uppgift.

Det här är den del av jämförelsen som ett prisblad per token inte kan visa dig, och det är anledningen till att de två siffrorna kan samexistera utan motsägelse. Per token är Sonnet 5.5 hälften så dyr. Per slutförd uppgift, i en utvärderingssvit med öppet formulerade prompter och utan disciplin för utdatalängd, kan den vara dyrare. Vilket av dessa som beskriver din arbetsbelastning är det faktiska beslutet.

Ansträngningsnivåer, utdatatak och integrationens utformning

För en köpare är de mekaniskt viktiga egenskaperna nästan identiska mellan dessa två modeller.

• Kontext — 1 000 000 tokens på båda, från samma leverantör, så antaganden om prompt engineering förs över oförändrade

• Maximal utdata — 128 000 tokens på båda; massgenerering är ingen differentieringsfaktor här

• Modalitet – text-, bild- och filinmatning på båda; ingen av dem tar emot ljud eller video

• Resonemangsstyrning – adaptivt tänkande på båda, med djupet styrt av en ansträngningsparameter i stället för en budget för tanketokens. På Claude Platform är standardvärdet högt; i Claude-apparna är det medel

• Cacheskrivning — $5.00 per miljon för Claude Opus 5.5 mot $2.50 för Claude Sonnet 5.5, den enda raden där den billigare modellen också är den billigare modellen att mata med ett återuppbyggt prefix

• Cacheläsning — $0,20 per miljon på båda, exakt lika på den rad som dominerar långa agentkörningar

Eftersom ytorna matchar är migreringen mellan dem ett byte av modellsträng och en ny mätning av arbetsinsatsen, inte ett integrationsprojekt. Det är ovanligt mellan leverantörer, och det är anledningen till att just detta par är värt att jämföra överhuvudtaget: de två kandidaterna skiljer sig åt i pris och djup, inte i det API du måste skriva.

En operativ skillnad förtjänar en egen rad. Anthropic uppger att Claude Sonnet 5.5 är den första Sonnet-modellen som lanseras med cybersäkerhetsskydd och reservvägar på samma nivå som sina främsta modeller, vilket innebär att cybersäkerhetsförfrågningar med högre risk synligt dirigeras till den tidigare Sonnet-modellen i stället för att besvaras av modellen du angav. Om din arbetsbelastning berör den domänen är modellsträngen ingen garanti för vilken modell som svarade – oavsett nivå. Anthropic noterar också att om du kör Sonnet med tänkande inaktiverat måste du byta till ett beteende mellan verktyg, vilket är en kodändring snarare än en konfigurationsflagga. Inget av detta är ett skäl att undvika modellen; båda är skäl att veta innan du levererar.

På OrcaRouter kan Claude Opus 5.5 routas redan i dag med samma autentiseringsuppgifter som alla andra modeller i katalogen, till leverantörens listpris med 0 % påslag, med automatisk failover tillgänglig under det. Claude Sonnet 5.5 är ännu inte en rutt på vår plattform – modellen är en dag gammal, och tills den finns listad är det ärliga beskedet att du skulle nå den via Anthropics eget API. Den som i dag kör Opus 5.5 via oss kan prissätta bytet samma dag som det blir tillgängligt utan att ändra något annat i sin integration.

Vilken ska sättas var?

Uppdelningen som följer av siffrorna: Claude Sonnet 5.5 för terminalbundet agentarbete, där den är den starkare av de två enligt Anthropics egen Terminal-Bench 4.0-siffra och till halva priset; Claude Sonnet 5.5 för allt som är genomströmningspräglat, eftersom kostnadsskillnaden bara minskar när uppgiften tvingar fram långa utdata; Claude Opus 5.5 för arbete av FrontierCode-klass, långsiktiga refaktoreringar över stora kodbaser, och alla arbetsbelastningar där marginalen 54,4 % till 46,2 % speglar formen på ditt faktiska problem snarare än en rad på en topplista.

Om dina uppgifter är öppna till sin natur och du inte kan förutse utdatans längd bör du betrakta priset per token som helt fel siffra. Mät tokens per slutförd uppgift i din egen trafik under en vecka innan du bestämmer dig åt något håll; siffran från artificial-analysis, $7.60 mot $5.98, är en varning om att den billiga modellen kan förlora på det mått du faktiskt betalar för.

Den ärliga domen: detta är inte längre en avvägning mellan förmåga och kostnad. Det är en fråga om huruvida ditt arbete är avgränsat. För avgränsade, högvolymiga, verktygsdrivna uppgifter är den billigare modellen också den bättre enligt tillgänglig evidens, och flaggskeppet är inte värt dubbelt så mycket. För öppna arbeten med lång horisont är Anthropics eget uttalande — att Opus 5.5 förblir klart starkare — den man bör tro på, och ingen mängd benchmark-konvergens ändrar det ännu.

A two-column scoreboard for Claude Sonnet 5.5 and Claude Opus 5.5 across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, AA Intelligence Index v4.3 score 56 at $7.60 per task, Terminal-Bench 4.0 (vendor) 70.6%, GDPval-AA v2.1 (vendor) 1844. Right column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, cache write $5.00, 1M context with 128K max output, AA Intelligence Index v4.3 score 58 at $5.98 per task, Terminal-Bench 4.0 (vendor) 66.4%, GDPval-AA v2.1 (vendor) 1846. The card heading reads "Claude Sonnet 5.5 against Claude Opus 5.5: eight rows, two of them on a different instrument", and a footer line reads "Per-token prices per the OrcaRouter catalogue; index and per-task figures per Artificial Analysis, Intelligence Index v4.3. Terminal-Bench and GDPval-AA rows are Anthropic's own launch table, run on a pre-release deployment, and are not the same instrument as the index."Screenshot of Anthropic's newsroom page for Claude Sonnet 5.5, showing the site navigation bar, the publication date September 28, 2026, the model heading "Claude Sonnet 5.5", and an image-led marketing hero beneath it that carries no machine-readable specification figures.Screenshot of the OrcaRouter model page for Anthropic Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with 128K maximum output, text, image and file input, the Vision, Tools, JSON and Reasoning capability tags, a 4.57-second p50 time to first token, and the $4.00 input and $20.00 output prices per million tokens.