
Claude Sonnet 5.5 vs Claude Opus 5.5: Benchmarkarna konvergerar, notan gör det inte
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 984 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Claude Sonnet 5.5 blev allmänt tillgänglig den 28 september 2026 för 2,00 dollar per miljon indatatokens och 10,00 dollar per miljon utdatatokens. Claude Opus 5.5, Anthropics flaggskepp, lanserades sex dagar tidigare, den 22 september, för 4,00 och 20,00 dollar – exakt dubbelt på båda raderna. Den uppenbara tolkningen är att Opus 5.5 är taket och att Sonnet 5.5 är kompromissen man gör när budgeten är verklig. Anthropics egen lanseringstabell stöder inte den tolkningen. Enligt siffrorna som företaget publicerade får Claude Sonnet 5.5 1844 mot Opus 5.5:s 1846 på GDPval-AA v2.1, 1811 mot 1822 på AA-Briefcase v1.1 och 70,6 % mot 66,4 % på Terminal-Bench 4.0 – den vinner det enda benchmark som mäter arbete som faktiskt utförs i en terminal. Två rader under dessa siffror står det i Anthropics egen bildtext att Opus 5.5 ”förblir klart starkare på komplext, öppet arbete”. Båda påståendena är sanna, och att komma underfund med hur man kan hålla båda för sanna samtidigt är större delen av syftet med den här jämförelsen.
Vad lanseringstabellen säger, och vad den avstår från att säga
Mönstret i Anthropics benchmarkblock är en modell som har stängt större delen av gapet snarare än en som har tagit ledningen. GDPval-AA v2.1, en ekonomiskt viktad uppsättning uppgifter, är ett tvåpoängsdödläge. AA-Briefcase v1.1, en utvärdering av dokument och leverabler, är ett elvapoängsdödläge. CursorBench 4.0 går åt andra hållet: 55,5 % för Sonnet 5.5 mot 57,8 % för Opus 5.5. OSWorld 2.1 landar på 80,1 % mot 81,8 %, och Humanity's Last Exam på 64,5 % med verktyg mot 67,7 %. Endast Terminal-Bench 4.0 bryter mönstret, och det bryter hårt – 70,6 % mot 66,4 %, en fyrapoängsfördel för Sonnet inom agentiskt kommandoradsarbete.
Läs radetiketterna i stället för siffrorna, och något annat framträder. Flera av de där Opus 5.5-posterna bär en ansträngningsannotering — 66,4 % vid Xhigh — och en fotnot anger att Max-konfigurationen får lägre poäng än Xhigh på FrontierCode, inte högre. Högre ansträngning är inte monoton. Ett budgetmedvetet team som antar att ”maximal ansträngning” är en gratis uppgradering köper tokens för ett sämre svar på åtminstone ett av Anthropics egna tester. Och på FrontierCode 1.1 placerar samma fotnot Sonnet 5.5 på 46,2 % i Max-konfigurationen mot Opus 5.5:s 54,4 %, vilket är den tydligaste enskilda siffran för var flaggskeppet fortfarande drar ifrån: kodarbete över långa tidshorisonter under en uppgiftsdefinition som belönar uthållighet.
Det finns ytterligare en invändning som är värd att sägas rakt ut i stället för att begravas. Anthropic noterar att de GDPval-AA- och AA-Briefcase-körningar som företaget publicerar utfördes på en förhandsdistribution som hade en bugg i strukturerade utdata. Det påverkar båda modellerna i samma tabell, så jämförelsen ogiltigförklaras inte, men det innebär att de absoluta siffrorna bör betraktas som en ögonblicksbild snarare än ett fastställt resultat. Leverantörers benchmarktabeller är marknadsföringsartefakter med en metodbilaga, och den här kommer med sin bilaga bifogad.
Var den oberoende mätningen landar
Artificial Analysis poängsätter båda modellerna i en och samma testrigg, i samma konfiguration som den kallar ”Adaptive Reasoning, Max Effort, Default Fallback”, på Intelligence Index v4.3. Claude Opus 5.5 ligger på 58. Claude Sonnet 5.5 ligger på 56. Det är en skillnad på två punkter på en skala där samma utvärderare placerar Opus 5 på 51, Sonnet 5 på 38, DeepSeek V4 Pro på 36 och Gemini 3.1 Pro Preview på 30. Att en ny Sonnet hamnar två punkter under flaggskeppet och fem punkter över den förra Opus-generationen är det väsentliga påståendet i den här lanseringen, och det är ett påstående från tredje part snarare än från leverantören.
Sedan vänder samma sida på det ekonomiska. Artificial Analysis rapporterar att en utvärderingskörning med Sonnet 5.5 kostar 7,60 dollar per uppgift jämfört med 5,98 dollar för Opus 5.5, trots att Sonnet 5.5 kostar hälften så mycket per token. Orsaken står rakt där på sidan: Sonnet 5.5 genererade 410 miljoner tokens i indexsviten jämfört med en median på 88 miljoner för de modeller den följer – "mycket mångordig", med utvärderarens ord. Opus 5.5 genererade 260 miljoner i samma svit. Med 10 dollar per miljon utdatatokens mot 20 dollar innebär mångordighetsfaktorn på ungefär 1,6 att Sonnet 5.5 fortfarande betalar omkring 27 % mer per slutförd uppgift.
Det här är den del av jämförelsen som ett prisblad per token inte kan visa dig, och det är anledningen till att de två siffrorna kan samexistera utan motsägelse. Per token är Sonnet 5.5 hälften så dyr. Per slutförd uppgift, i en utvärderingssvit med öppet formulerade prompter och utan disciplin för utdatalängd, kan den vara dyrare. Vilket av dessa som beskriver din arbetsbelastning är det faktiska beslutet.
Ansträngningsnivåer, utdatatak och integrationens utformning
För en köpare är de mekaniskt viktiga egenskaperna nästan identiska mellan dessa två modeller.
• Kontext — 1 000 000 tokens på båda, från samma leverantör, så antaganden om prompt engineering förs över oförändrade
• Maximal utdata — 128 000 tokens på båda; massgenerering är ingen differentieringsfaktor här
• Modalitet – text-, bild- och filinmatning på båda; ingen av dem tar emot ljud eller video
• Resonemangsstyrning – adaptivt tänkande på båda, med djupet styrt av en ansträngningsparameter i stället för en budget för tanketokens. På Claude Platform är standardvärdet högt; i Claude-apparna är det medel
• Cacheskrivning — $5.00 per miljon för Claude Opus 5.5 mot $2.50 för Claude Sonnet 5.5, den enda raden där den billigare modellen också är den billigare modellen att mata med ett återuppbyggt prefix
• Cacheläsning — $0,20 per miljon på båda, exakt lika på den rad som dominerar långa agentkörningar
Eftersom ytorna matchar är migreringen mellan dem ett byte av modellsträng och en ny mätning av arbetsinsatsen, inte ett integrationsprojekt. Det är ovanligt mellan leverantörer, och det är anledningen till att just detta par är värt att jämföra överhuvudtaget: de två kandidaterna skiljer sig åt i pris och djup, inte i det API du måste skriva.
En operativ skillnad förtjänar en egen rad. Anthropic uppger att Claude Sonnet 5.5 är den första Sonnet-modellen som lanseras med cybersäkerhetsskydd och reservvägar på samma nivå som sina främsta modeller, vilket innebär att cybersäkerhetsförfrågningar med högre risk synligt dirigeras till den tidigare Sonnet-modellen i stället för att besvaras av modellen du angav. Om din arbetsbelastning berör den domänen är modellsträngen ingen garanti för vilken modell som svarade – oavsett nivå. Anthropic noterar också att om du kör Sonnet med tänkande inaktiverat måste du byta till ett beteende mellan verktyg, vilket är en kodändring snarare än en konfigurationsflagga. Inget av detta är ett skäl att undvika modellen; båda är skäl att veta innan du levererar.
På OrcaRouter kan Claude Opus 5.5 routas redan i dag med samma autentiseringsuppgifter som alla andra modeller i katalogen, till leverantörens listpris med 0 % påslag, med automatisk failover tillgänglig under det. Claude Sonnet 5.5 är ännu inte en rutt på vår plattform – modellen är en dag gammal, och tills den finns listad är det ärliga beskedet att du skulle nå den via Anthropics eget API. Den som i dag kör Opus 5.5 via oss kan prissätta bytet samma dag som det blir tillgängligt utan att ändra något annat i sin integration.
Vilken ska sättas var?
Uppdelningen som följer av siffrorna: Claude Sonnet 5.5 för terminalbundet agentarbete, där den är den starkare av de två enligt Anthropics egen Terminal-Bench 4.0-siffra och till halva priset; Claude Sonnet 5.5 för allt som är genomströmningspräglat, eftersom kostnadsskillnaden bara minskar när uppgiften tvingar fram långa utdata; Claude Opus 5.5 för arbete av FrontierCode-klass, långsiktiga refaktoreringar över stora kodbaser, och alla arbetsbelastningar där marginalen 54,4 % till 46,2 % speglar formen på ditt faktiska problem snarare än en rad på en topplista.
Om dina uppgifter är öppna till sin natur och du inte kan förutse utdatans längd bör du betrakta priset per token som helt fel siffra. Mät tokens per slutförd uppgift i din egen trafik under en vecka innan du bestämmer dig åt något håll; siffran från artificial-analysis, $7.60 mot $5.98, är en varning om att den billiga modellen kan förlora på det mått du faktiskt betalar för.
Den ärliga domen: detta är inte längre en avvägning mellan förmåga och kostnad. Det är en fråga om huruvida ditt arbete är avgränsat. För avgränsade, högvolymiga, verktygsdrivna uppgifter är den billigare modellen också den bättre enligt tillgänglig evidens, och flaggskeppet är inte värt dubbelt så mycket. För öppna arbeten med lång horisont är Anthropics eget uttalande — att Opus 5.5 förblir klart starkare — den man bör tro på, och ingen mängd benchmark-konvergens ändrar det ännu.



