Hjälttitelkort för Claude Opus 5.5 med texten "varje poäng, den effort-inställning den kom från, och vem som mätte den", med två statistikchips: 66,4 % på Terminal-Bench 4.0 vid xhigh-effort, leverantörsrapporterat, och 59,6 % på samma benchmark, oberoende.
Guides & Insights

Claude Opus 5.5 prestandatester: Varje resultat, den Effort-inställning det kom från, och vem som mätte det

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Anthropics huvudsiffra för Claude Opus 5.5 på Terminal-Bench 4.0 är 66,4 %, ställd mot 52,3 % för Claude Opus 5 i samma tabell — och de 66,4 % togs fram vid xhigh-ansträngning, inte vid modellens standardinställning medium. Modellen släpptes den 22 september 2026, två dagar innan den här sidan skrevs, så det är en GA-modell med en GA-modells prissättning och en GA-modells benchmarktabell. Den oberoende siffran på samma benchmark, från Artificial Analysis, är 59,6 %, i en konfiguration som har Anthropics serversidiga skyddsrouting inbyggd. Mellan dessa två siffror ligger en skillnad i testramverk, en skillnad i ansträngning och en skillnad i routing, och ingen — inte ens vi — kan ännu säga hur mycket av gapet var och en förklarar. Det den här sidan kan göra är att samla varje publicerad siffra för Claude Opus 5.5 på ett ställe, namnge vem som tog fram den, namnge inställningen den togs fram vid, och inkludera raderna där GPT-6 Astra och Claude Fable 5.1 ligger före.

Börja med effort-inställningen, eftersom den påverkar siffrorna mer än vad modellerna gör.

Claude Opus 5.5 har som standard medium effort i Claude API. Claude Opus 5 hade som standard high. Samma namngivna nivå är inte heller samma tankebudget mellan de två modellerna, så "vi körde båda på high" är inte en kontrollerad jämförelse ens när etiketten matchar. Adaptivt tänkande är alltid på och kan inte stängas av i Opus 5.5; effort-parametern styr djup, latens och kostnad, och inget annat.

Anthropics Terminal-Bench 4.0-siffra kördes med xhigh. Detta enskilda faktum är det viktigaste förbehållet på den här sidan, eftersom det benchmark som den är huvudnyheten för är det med den största rapporterade marginalen gentemot den tidigare modellen, och eftersom samma tabell visar vad som händer när du låter inställningen vara:

FrontierCode v1.1 Main — 54,4 % vid xhigh, 54,6 % vid standard-medium.Leverantörsrapporterat. Körningen på medium är högre än körningen på xhigh. I den här arbetsbelastningen gav ansträngningsratten inget mätbart; de två siffrorna är samma siffra.

CursorBench 4.0 — 57,8 % vid xhigh, 52,5 % vid medium. Leverantörsrapporterat. Samma modell, samma testramverk, samma vecka: 5,3 punkter, vilket är den största deltan i ansträngningsnivå i tabellen.

De två raderna som finns i en enda leverantörstabell utgör hela argumentet. En arbetsbelastning är okänslig för ansträngning och den andra är starkt ansträngningskänslig, och modellkortet kan inte i förväg säga vilken typ av arbetsbelastning din är. Slutsatsen som data stöder är snäv och värd att formulera snävt: rätt ansträngningsnivå är nu en mätning per arbetsbelastning, inte en standard som du ärver. Den stöder inte "Opus 5.5 är snabbare än dess benchmarks antyder" eller "Anthropic sandbaggade standarden" – för det skulle du behöva svep per arbetsbelastning över alla fem inställningarna, och ingen har publicerat dem. Det innebär att om du migrerar från Opus 5 och behåller den ansträngningsinställning du redan hade, har du ändrat experimentet, inte bara modellen.

Ännu en asymmetri, och den slår åt andra hållet. Kolumnen för konkurrenten i Anthropics rad för Terminal-Bench är GPT-6 Astra på 57,9 % — körd med high effort, enligt Anthropics egen anmärkning i diagrammet, medan Opus 5.5:s 66,4 % kördes med xhigh. En leverantörstabell som kör sin egen modell med en inställning och en konkurrent med en annan är inte en direkt jämförelse, hur de två siffrorna än ser ut sida vid sida.

Leverantörstabellen, med källan och inställningen på varje rad

Allt i det här avsnittet är leverantörsrapporterat: Anthropics lanseringsmaterial, Anthropics testramverk, produktionsskyddsåtgärder aktiverade, adaptivt tänkande på högsta ansträngningsnivå om inte raden säger något annat. Läs det som att Anthropic mäter Anthropic.

Terminal-Bench 4.0 – 66,4 %, vid xhigh-ansträngning. Leverantörsrapporterat, standardfel cirka ±2,6 punkter. På samma rad: Claude Opus 5 52,3 %, Claude Fable 5.1 55,8 %, GPT-6 Astra 57,9 % (vid hög ansträngning), GPT-5.6 Sol 37,3 %. Terminal-Bench 4.0 är uttryckligen ett riktmärke som leverantören medger är en ofullkomlig proxy för verkligt terminalarbete, och det är modellens huvudnummer.

FrontierCode v1.1 Main — 54,4 % vid xhigh, 54,6 % vid medium som standard. Leverantörsrapporterat. Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %, GPT-5.6 Sol 47,5 %. Anthropics systemkort innehåller även Extended-varianten på 63,6 % och en bästa-siffra för Extended vid medium på 65,3 %.

CursorBench 4.0 — 57,8 % vid xhigh, 52,5 % vid medium.Leverantörsrapporterat. Opus 5 46,6 %, Fable 5.1 51,8 %, GPT-5.6 Sol 41,7 %. Observera att Fable 5.1:s och Opus 5:s CursorBench-rader avser maximal ansträngning, så Opus 5.5 vid medium jämförs med sina egna syskon vid max.

GDPval-AA v2.1 — 1,846 Elo. Det här är den enda raden i leverantörstabellen som leverantören inte körde. GDPval-AA är en utvärdering från Artificial Analysis, och Artificial Analysiss egen redogörelse för Opus 5.5 anger samma 1,846, med Fable 5.1 på 1,735 och Opus 5 på 1,708. I leverantörstabellen: Fable 5.1 1,735, Opus 5 1,708, GPT-5.6 Sol 1,588, GPT-6 Astra 1,542. Det är den enda raden här där två organisationer är överens om samma siffra, och det beror på att det är samma mätning.

AutomationBench (Zapier) — 40,0 %. Leverantörsrapporterat och kört utan reservmodeller, så varje skyddsåtgärdsingripande bedömdes som ett misslyckande. GPT-6 Astra 41,4 %, Fable 5.1 31,4 %, GPT-5.6 Sol 28,8 %, Opus 5 26,9 %.

Humanity's Last Exam, med verktyg — 67,7 %. Leverantörsrapporterat. Fable 5.1 65,6 %, Opus 5 63,6 %, GPT-6 Astra 57,2 %. Anthropics systemkort rapporterar separat 64,4 % utan verktyg, vilket är siffran att utgå från om du jämför mot en källa som inte ger sina modeller verktygsåtkomst.

Terminal-Bench-Science 0.1 – 58,7 %. Leverantörsrapporterat, standardfel ungefär ±3,5 till ±5 punkter, så detta är ett intervall snarare än en punkt. GPT-6 Astra 64,6 %, Fable 5.1 52,6 %, Opus 5 29,0 %, GPT-5.6 Sol 22,4 %.

OSWorld 2.0 — 81,8 % partiellt. Leverantörsrapporterat, och "partiell" gör verkligen ett viktigt arbete i den meningen: Anthropics systemkort anger en strikt slutförandegrad på 48,7 % för samma modell i samma utvärdering. Båda är publicerade; det partiella talet är det som citeras. Fable 5.1 80,7 %, Opus 5 74,0 %.

Chartography, med verktyg – 89,0 %. Rapporterat av leverantör. Fable 5.1 88,4 %, Opus 5 83,4 %.

Scoreboard for Claude Opus 5.5 with six rows: Terminal-Bench 4.0 66.4% at xhigh effort (vendor-reported); Artificial Analysis Intelligence Index 58 at max effort (independent); Humanity's Last Exam 67.7% with tools (vendor-reported); Terminal-Bench-Science 0.1 58.7% (vendor-reported); about 119k output tokens per task at max (independent); price $4.00 input / $20.00 output per 1M. A footer separates the Anthropic launch table from Artificial Analysis.

De oberoende numren, och vad "Default Fallback" egentligen betyder

Artificial Analysis är den enda tredje parten med en publicerad, aktuell utvärdering av Claude Opus 5.5 på ett sammansatt index, och dess siffror är de som bör ställas bredvid Anthropics. Som läst den 24 september 2026:

Intelligence Index — 58 vid maximal ansträngning, i en konfiguration märkt "Adaptive Reasoning, Max Effort, Default Fallback". Oberoende, mätt av Artificial Analysis. Deras egen artikel kallar 58 "den högsta poängen vi har uppmätt, med flera poängs marginal." Samma index publicerar också Opus 5.5 vid alla andra effort-inställningar, och spridningen är den användbara delen: 56 vid xhigh, 54 vid high, 51 vid medium, 42 vid low. Det är en svängning på 16 poäng över hela effort-skalan på en enda modell — större än gapet mellan de flesta modeller på den resultattavlan.

Terminal-Bench 4.0 – 59,6 %. Oberoende. Artificial Analysis rapporterar att det ligger "i nivå med ledaren GPT-6 Astra (xhigh)" och cirka 11 punkter över Claude Opus 5.

Humanity's Last Exam – 61,4 %.Oberoende, och det tidigare bästa resultatet på samma leaderboard var 59,1 %, som innehades av Claude Fable 5.1.

SciCode — 66,9 %. Oberoende, mot 63,1 % för Claude Fable 5.1.

Nu till den klausul som behöver förklaras snarare än citeras. "Default Fallback" är inte en benchmarkartefakt och inte en inställning i Artificial Analysis — den är Anthropics serversidiga skyddsroutning, lämnad påslagen. Claude Opus 5.5 levereras med den skyddsnivå som tidigare var reserverad för Fable 5.1: de flesta cybersäkerhetsförfrågningar omdirigeras transparent till Claude Opus 4.8, och biologiskt arbete faller tillbaka till Claude Opus 5 om inte kontot är verifierat. När Artificial Analysis kör indexet med standard-fallback aktiverat mäter man det driftsatta systemet — det som en overifierad API-nyckel faktiskt når — snarare än en ren checkpoint av Opus 5.5:s vikter. Det är den mer ärliga mätningen för en köpare, och det är den mindre rena mätningen för en benchmark. Anthropic säger samma sak om sin egen tabell: ingripanden i Terminal-Bench 4.0-körningen gjorde att cyberuppgifter slutfördes av Opus 4.8 och biologiuppgifter av Opus 5, och företaget uppger att dessa ingripanden sannolikt sänkte det rapporterade resultatet. Så skyddsroutningen är ett verkligt operativt faktum i båda riktningarna, och ingen siffra på den här sidan isolerar den underliggande modellen från den.

Där de två tabellerna skiljer sig åt, och varför

Ställ de två Terminal-Bench 4.0-siffrorna sida vid sida och du får 66,4 % mot 59,6 % – 6,8 procentenheter, i samma benchmark, för samma modell. Orsakerna är kända, och var och en är tillräckligt stor för att spela roll på egen hand:

Olika harnessar. Anthropic körde sitt eget agentscaffold; Artificial Analysis körde sin egen referensharness för agenter. Ett resultat i en terminalbenchmark är en egenskap hos scaffoldet plus modellen, inte hos modellen enbart, och ingen av organisationerna har publicerat ett experiment där man byter ut scaffoldet.

Olika ansträngningsinställningar. Anthropics 66,4 % ligger på xhigh. Den ansträngningsinställning som är kopplad till Artificial Analysis 59,6 % anges inte i meningen som innehåller siffran, och dess rapporterade benchmarkvärden är i allmänhet de vid maximal ansträngning.

Skyddsåtgärder aktiverade, i båda fallen, räknades olika. Anthropic körde med fallback och behandlade interventioner som poängsänkande men de fick fortfarande poäng. På AutomationBench körde den utan fallback och räknade interventioner som rena misslyckanden. Artificial Analysis kör med fallback aktiverat genomgående.

Siffrorna ändras även inom en och samma leverantörs egen tabell. Anthropic redovisar Claude Opus 5 på 52,3 % i Terminal-Bench 4.0 och noterar att den offentliga resultattavlans 51,8 % för samma modell ligger ”inom brusnivån”.

Och sedan det starkaste beviset på den här sidan för hur mycket en harness är värd. Den offentliga resultattavlan för Terminal-Bench 4.0, hämtad den 24 september 2026, innehåller ingen rad för Claude Opus 5.5 alls. Dess toppost är GPT-6 Astra vid max effort, Codex-agent, 58,2 % ±2,8; tvåa är Claude Fable 5.1 vid max effort via Claude Code på 57,9 % ±3,8; trea är Claude Opus 5 vid xhigh via Claude Code på 53,9 % ±3,2. Så 66,4 % är inte bara ett annat tal än det oberoende resultatet på 59,6 % – det finns inte med på den offentliga resultattavlan, och resultattavlans egen version av Claude Opus 5 är 53,9 %, inte de 52,3 % som lanseringstabellen visar. Tills Terminal-Bench accepterar och publicerar en inlämning för Opus 5.5 är 66,4 % ett harness-resultat från en leverantör som ingen har reproducerat, och 59,6 % är det tal som en utomstående part faktiskt kommer att stå bakom. Notera också att på samma resultattavla hamnar Artificial Analysis-ledaren i Terminal-Bench 4.0 och Anthropics Opus 5.5 på samma 59,6 % – vilket är ett oavgjort resultat i en harness och inte säger något om den andra.

Effort-dial infographic for Claude Opus 5.5 showing the Artificial Analysis Intelligence Index moving from 42 at low effort through 51 at medium (the product default), 54 at high, 56 at xhigh and 58 at max - a 16-point swing on one model - with two comparison cards: FrontierCode v1.1 at 54.4 xhigh against 54.6 medium (effort-insensitive) and CursorBench 4.0 at 57.8 xhigh against 52.5 medium (effort-sensitive).

Raderna där Opus 5.5 förlorar

En sammanställning som utelämnar förlusterna är inte en sammanställning, och Anthropics egen tabell innehåller dem båda.

Terminal-Bench-Science 0.1 — 58,7 % mot GPT-6 Astras 64,6 %. Leverantörsrapporterat, i Anthropics tabell, och en förlust på 5,9 punkter mot en namngiven konkurrent på raden närmast vetenskapligt resonemang. Leverantörens egen not om standardfel (±3,5 till ±5) innebär att gapet ligger nära brusets gräns snarare än bekvämt inom det — men det är en förlust på leverantörens egen sida, och intervallet gör det inte till en vinst. Claude Opus 5 ligger på 29,0 % på samma rad, så den generationsmässiga vinsten är verklig även där konkurrenten leder.

AutomationBench — 40,0 % mot GPT-6 Astras 41,4 %.Leverantörsrapporterat, en förlust på 1,4 punkter, och körningen hade inga reservmodeller, så skyddsinterventioner bedömdes som misslyckanden. Det innebär att just denna jämförelse mäter Opus 5.5 med dess routingstraff inräknat mot en konkurrent vars routingstraff, vad det än är, inte beskrivs. Det är den minst tolkningsbara raden på sidan i någon riktning.

Ytterligare två ställen där försprånget är mindre än rubriken antyder, båda leverantörsrapporterade. På Humanity's Last Exam with tools är marginalen gentemot Claude Fable 5.1 2,1 punkter (67,7 % mot 65,6 %); på Chartography with tools är den 0,6 punkter (89,0 % mot 88,4 %); på OSWorld 2.0 partial är den 1,1 punkter (81,8 % mot 80,7 %). Det är de raderna där ”Opus 5.5 är den bästa agentiska modellen” är ett påstående om rangordning snarare än om en uppmätt skillnad, och en skillnad på 0,6 punkter i diagramläsning bör inte avgöra en upphandling.

Claude Fable 5.1:s oberoende ställning, vid en annan indexrevision

Att ställa Opus 5.5 mot sitt eget syskon kräver ett eget avsnitt, och det behöver åtföljas av en varning, eftersom jämförelsen är svårare än den ser ut.

När Artificial Analysis publicerade sin artikel om Claude Fable 5.1 den 1 september 2026 fick modellen 66 vid max effort på dess Intelligence Index, och Artificial Analysis kallade det för den högsta poängen som hade uppmätts – före Claude Opus 5 på 63 och GPT-5.6 Sol på 61. I indexet så som det listas den 24 september 2026 återfinns samma modell på 53 vid max effort med fallback, och Opus 5.5 återfinns på 58 i motsvarande konfiguration. Artikeln den 22 september om Opus 5.5 kallar 58 för "den högsta poängen vi har mätt med flera poängs marginal."

De två påståendena kan inte båda vara sanna på en och samma skala, och lösningen är att de inte befinner sig på en och samma skala. Indexet är ett levande objekt som Artificial Analysis reviderar; två av dess publicerade artiklar, fem veckor isär, placerar samma syskonpar på motsatta sidor om topplatsen. Det är ett påstående om indexrevideringar, inte om att någon av modellerna har blivit sämre, och det innebär att 66:an och 58:an får aldrig tryckas sida vid sida. Läst samma dag, samma lista, samma märkta konfiguration, har den aktuella ordningen Opus 5.5 fem poäng före Fable 5.1 — och även det är en jämförelse inom samma index och samma indexleverantör, inte en granskad direkt jämförelse. Det som är säkert att säga är snävare: i den aktuella revideringen av den enda oberoende sammanställning som mäter båda är Opus 5.5 den starkare av de två Anthropic-modellerna, och Fable 5.1:s mer kända 66 tillhör en tidigare revidering av det indexet.

Inställningarna förtjänar en mening till, eftersom de är lätta att sammanblanda. Fable 5.1:s 66 och Opus 5.5:s 58 är båda rader för maximal ansträngning – men Fable 5.1:s fem ansträngningsinställningar spänner över ett 11x-intervall i användning av utdatatoken, från 13,1M vid låg till 143,7M vid max, med indexpoäng från 58 till 66. En enda indexpoäng för en modell med så stor intern spridning är en dålig ersättning för den rad du faktiskt skulle köra.

Tokenkostnad är en egen benchmark-axel

Varje siffra ovan är en poäng. Ingen av dem är en räkning, och i den här modellen är räkningen där den intressanta rörelsen finns.

Artificial Analysis mäter Claude Opus 5.5 vid maximal ansträngning till att använda i storleksordningen 119 000 utdatatoken per Intelligence Index-uppgift — det högsta i deras index. Som jämförelse, på samma lista med samma inställning: Claude Opus 5 omkring 73 000, Claude Fable 5.1 omkring 78 000, och GPT-6 Astra omkring 27 000. Tänkandetoken faktureras som utdatatoken, och adaptivt tänkande kan inte stängas av på Opus 5.5, så de token en modell lägger på att överlägga är inte en fotnot till dess pris — de utgör större delen av det.

Räkna på siffrorna, för prislappen är missvisande i sig. Opus 5.5 har ett listpris på $4.00 för input / $20.00 för output, en sänkning med 20 % från Opus 5:s $5.00 / $25.00. Artificial Analysis mäter fortfarande Opus 5.5 vid maximal ansträngning till en kostnad av cirka $5.98 per indexuppgift mot $5.86 för Opus 5 vid samma inställning – något mer, inte mindre, eftersom ungefär 1,6 gånger så många output-tokens äter upp hela den 20-procentiga sänkningen och lite till. För hela indexet producerade Opus 5.5 260M output-tokens mot en median på 88M för resultattavlan, vilket utvärderaren betecknar som ”mycket mångordigt”.

Kostnadsbilden ligger därför helt och hållet i effort-inställningen, och den fungerar bara om du använder den. Vid maximal effort är Opus 5.5 en dyrare modell per slutförd uppgift än modellen den ersätter. Vid medium – själva produktens standardinställning, och det läge som Anthropics påstående om ”cirka 40 % lägre kostnad att köra typiska arbetsbelastningar” avser – är besparingen verklig, men det är ett påstående om ett genomsnitt över arbetsbelastningar som leverantören har valt ut, inte ett granskat resultat per uppgift. Den praktiska tolkningen: prissänkningen på 20 % är en rabatt på prislistan och en option på effort-reglaget, inte en automatisk besparing. Om din migreringsplan är att ”byta ut modell-id:t och behålla inställningarna” köper du den dyra versionen.

Vad är inte alls fastställt

Det här är avsnittet som resten av sidan finns till för att stödja.

Ingen oberoende direkt jämförelse mellan Claude Opus 5.5 och någon namngiven konkurrent, med matchad ansträngningsnivå och matchat testramverk, har publicerats. Varje jämförelse mellan leverantörer på den här sidan – Opus 5.5 mot GPT-6 Astra, mot GPT-5.6 Sol, mot Claude Fable 5.1 – är en jämförelse av två tabeller som tagits fram av två olika företag, i två olika testramverk, med två olika ansträngningsinställningar, varav den ena vanligtvis är leverantörens egen modell med en fördelaktig inställning. Det finns inget experiment någonstans i det offentliga materialet som håller stommen och ansträngningsnivån konstant över två leverantörer och redovisar båda.

Uppdelningen av tokens per problem publiceras inte. Den sammanlagda siffran för utdatatokens mäts oberoende, men hur mycket av den som är tänkande kontra svarstext publiceras inte av någon vi kunde hitta. Varje sida som ger dig en exakt siffra för tänkandetokens för den här modellen ger dig en siffra som ingen har mätt.

Större delen av systemkortet är inte benchmarkad av tredje part. SWE-bench Pro 89,9 %, Multilingual 93,9 %, DeepSWE v1.1 74,2 %, ProgramBench 91,2 %, OfficeQA 78,9 %, HealthBench Professional 65,6 % längdjusterat, GMMLU 94,3 %, ArXivMath 96,9 % med verktyg — alla rapporterade av leverantören, ingen av dem oberoende reproducerad vid tidpunkten för skrivandet.

Terminal-Bench 4.0:s rubriksiffra finns inte på den offentliga resultattavlan.Behandlat ovan, och det hör hemma i den här listan också: den enskilt mest citerade siffran om den här modellen är en som ingen utanför leverantören har kört.

Anthropic rapporterar att Claude Opus 5.5 "ofta misstänker att den utvärderas" — företagets egna ord, presenterade som en begränsning i dess säkerhetsbedömning. Ta det på allvar som ett mätproblem och inte som en kuriositet: om modellen beter sig annorlunda när den tror att den testas, så är varje benchmark-siffra på den här sidan, från leverantör eller oberoende part, en mätning av modellen under observation, och i vilken grad det skiljer sig från beteende i drift är okänt och okvantifierat. Det gäller de bra raderna och de dåliga lika mycket. Det är det enda förbehållet som ingen mängd metodik med matchad insats kan åtgärda.

Sonnet 5.5 och Haiku 5.5 är inte tillgängliga. Anthropic har annonserat dem för "de kommande veckorna". De har inte släppts, de har inga publicerade riktmärken, och inget på den här sidan gäller för dem.

Pris, kuvert och de delar av specifikationen som ändrar din kod

Läst från Anthropics publicerade prislista den 24 september 2026: $4,00 per miljon indatatoken, $20,00 per miljon utdata, $0,20 per miljon cacheläsning, $5,00 per miljon 5-minuters cacheskrivning, $8,00 per miljon 1-timmars cacheskrivning, och 50 % rabatt i båda riktningarna på Batch-API:et. Cacheläsningspriset är den tysta posten — det är 5 % av basindata, där de flesta Claude-modeller ligger på 10 % och Fable 5.1 ligger på 2,5 %. Fast-läget prissätts separat till $8,00 / $40,00 och Anthropic beskriver det som en forskningsförhandsvisning, inte en allmän nivå.

Det här är avsnittet där ett prisblad slutar vara kuriosa och blir aritmetik som en router kan göra åt dig. Claude Opus 5.5 serveras som anthropic/claude-opus-5.5 på OrcaRouter till samma $4.00 / $20.00, med listpriser vidarebefordrade med 0 % påslag — så i samma stund som Anthropic ändrar en taxa är det taxan här, samma dag och utan någon omprissättningsfördröjning att modellera. De delar som avgör den verkliga fakturan är de som katalogen anger bredvid priset: cacheläsningen på $0.20 vid 5 % av basindata mot Fable 5.1:s 2,5 %, kontextfönstret på 1 M token och utdatataket på 128K. Eftersom effort-parametern är där den här modellens kostnad faktiskt rör sig — en svängning på 16 punkter i indexet och ungefär 119 000 utdatatoken per uppgift vid max, mot omkring 73 000 för Opus 5 — är den migrering som sparar pengar den som låter dig ställa in effort per arbetsbelastning i stället för per konto, och lägga Opus 5.5-rutten bakom en automatisk redundansväxling medan du mäter vilken inställning din trafik vill ha.

Envelope — kontext på 1M tokens, maximal utdata 128K, 300K utdata på Batch-API:et bakom output-300k-2026-03-24-betaheadern, kunskapsgräns juni 2026, avveckling tidigast den 22 september 2027. Utdata är över 30 % snabbare än Claude Opus 5.

Brytande ändringar jämfört med Opus 5 — tänkande kan inte längre inaktiveras; framtvingad verktygsanvändning (en tool_choice som anger ett specifikt verktyg) returnerar ett fel; tänkandeblock är bundna till modellen och konversationen som skapade dem; det äldre computer_20251124-datoranvändningsverktyget accepteras inte på Claude API eller Google Cloud. De tre första gäller även Fable 5.1. Det finns en tyst femte: text mellan verktygsanrop hamnar nu inuti tänkandeblock vars text är tom vid standardinställningen för visning, så ett UI som strömmar den texten som en förloppsindikator tystnar utan att något fel uppstår.

Skyddsroutning, igen, eftersom det är en specifikationspunkt och inte en fotnot — de flesta cybersäkerhetsförfrågningar går till Claude Opus 4.8 och biologiarbete faller tillbaka på Claude Opus 5 om inte kontot är verifierat. I dessa utvärderingar kan svaret du får inte alls komma från Opus 5.5, så de publicerade poängen på cyber- och bioangränsande benchmarks är inte rena mätningar av den här modellen.

Effektivitetsanspråk, samtliga rapporterade av leverantören — omkring 40 % lägre kostnad att köra på typiska arbetsbelastningar mot en listprissänkning på 20 %; ett genomräknat exempel på fusionsanalys som tar 63 minuter på Opus 5.5 mot 93 på Opus 5 till 50 % lägre kostnad; och kundutlåtanden från Box (en tredjedel av tokens, svar omkring 40 % mindre ordrika), Kiro (ungefär hälften av tokens, 40 % färre anrop), Factory (20–25 % färre utdatatokens) och GitHub (bland de minsta antal tokens och steg som GitHub har mätt). Detta är genomsnitt över arbetsbelastningar som leverantören och dess lanseringspartner valde. De är tillskrivningar, inte granskade resultat, och de står i synlig spänning till den oberoende kostnadssiffran per uppgift ovan — som i sig är en mätning vid maximal ansträngning snarare än vid standard. Båda kan vara sanna; ingendera är ett generellt påstående om din arbetsbelastning.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the NEW, FLAGSHIP and FEATURED badges, a 1M-token context window, 128K max output, text plus image plus file input, and the $4.00 input / $20.00 output per 1M token rate with pricing passed through from Anthropic.

Bevisläget

Claude Opus 5.5 är en riktig modell med en riktig prissänkning, ett riktigt omfång på 1M tokens kontext och 128K output, och en riktig och betydelsefull förändring av hur tänkande och ansträngning konfigureras. Den levereras också med en benchmark-tabell som till största delen mäter Anthropic, en oberoende tabell som till största delen mäter en routad driftsättning snarare än en checkpoint, och ett dokumenterat självkännedomsproblem som undergräver båda. Ingen oberoende direktjämförelse av Claude Opus 5.5 mot en namngiven konkurrent med matchad ansträngning och matchat testramverk har publicerats. Tills en sådan har publicerats, läs varje jämförelse mellan leverantörer på den här sidan för vad den är: två leverantörstabeller från två företag vid två inställningar, placerade sida vid sida av oss — och mät om din egen ansträngningsinställning innan du mät om modellen.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen