
Claude Opus 5.5 vs Claude Opus 5: Ansträngningsnivåerna betyder inte samma sak
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Det första du behöver känna till innan du jämför Claude Opus 5.5mot Claude Opus 5är att de två modellerna inte delar samma ansträngningsskala, och nästan varje direktjämförelse du läser den här veckan bortser från det. Opus 5 använder som standard high-ansträngning. Opus 5.5 använder som standard medium, och på samma namngivna nivå tänker den mer per tur än sin föregångare gjorde. Så "Opus 5.5 vid standard kontra Opus 5 vid standard" är inte ett kontrollerat experiment — det är en jämförelse mellan två olika mängder tänkande. Tillverkaren säger själv så mycket i sin egen migreringsguide: testa flera ansträngningsnivåer, och återanvänd inte inställningarna för Opus 5, eftersom nivåer med samma namn inte motsvarar samma tankebudget. När du kontrollerar för det minskar gapet mellan de två modellerna på vissa ställen, ökar på andra, och uppgraderingsbeslutet hänger på något annat än rå kapacitet — kostnad per slutförd uppgift, och fyra API-ändringar som kommer att krascha kod som körs på Opus 5 idag.
Vad är det egentligen som skiljer sig, spec för spec?

De två modellerna ligger närmare varandra på papperet än vad versionsnumren antyder:
• Pris — Claude Opus 5.5 med $4.00 för indata / $20.00 för utdata per miljon tokens jämfört med Claude Opus 5 med $5.00 / $25.00
• Cache-läsning — $0,20 per miljon jämfört med $0,50 per miljon, en minskning med 60 % på posten som dominerar agentiska körningar
• Cache-skrivning — $5 per miljon för 5-minutersfönstret och $8 för 1-timmarsfönstret på 5.5, jämfört med $6,25 på Opus 5
• Kontext och utdata – 1M tokens kontext och 128K utdata på båda; båda når 300K utdata på Batch API bakom output-300k-2026-03-24 beta-headern
• Standardansträngning — medium på Opus 5.5 jämfört med hög på Opus 5
• Tänkande — adaptivt och alltid på i båda, men på Opus 5.5 kan det inte längre inaktiveras alls
• Kunskapsgräns — juni 2026 vs maj 2026
• Latens — Anthropic bedömer Opus 5.5 som ”måttlig” jämfört med det nuvarande modellprogrammet och säger att den genererar utdata mer än 30 % snabbare än Opus 5
• Utfasning – tidigast 22 september 2027 för Opus 5.5, och tidigast 24 juli 2027 för Opus 5
Lägg märke till vad som inte skiljer sig: kontextfönster, tak för utdata, batchrabatt och den alltid aktiva adaptiva tänkmodellen. Opus 5.5 är inte en modell med större kontext eller längre utdata. Det är en billigare, snabbare och mer token-effektiv modell inom samma ram.
Benchmarks, och ansträngningsasterisken på varenda en av dem

Dessa siffror kommer från Anthropics lanseringsmaterial – leverantörsrapporterade, körda mot företagets egna modeller – och effort-inställningen spelar större roll här än modellnamnet:
• Terminal-Bench 4.0 — 66,4 % mot 52,3 %, med Opus 5.5-körningen på xhigh effort i stället för standardinställningen
• FrontierCode v1.1 (Main) — 54,4 % mot 48,0 %, och 54,6 % för Opus 5.5 vid den förvalda medelhöga ansträngningen
• CursorBench 4.0 — 57,8 % mot 46,6 %, och 52,5 % på medium
• GDPval-AA v2.1 — 1846 Elo mot 1708
• AutomationBench — 40,0 % mot 26,9 %
• Humanity's Last Exam, med verktyg — 67,7 % mot 63,6 %
• Terminal-Bench-Science 0.1 — 58,7 % mot 29,0 %, den största skillnaden i uppsättningen
• OSWorld 2.0 — 81,8 % partiell mot 74,0 %
• Kartografi, med verktyg — 89,0 % vs 83,4 %
FrontierCode-resultatet är det man bör studera. Opus 5.5 får 54,4 % på xhigh och 54,6 % på medium – statistiskt sett samma siffra, till en bråkdel av tankebudgeten. Vilken förbättring Anthropic än har gjort kommer den, på det benchmarket, inte från att tänka hårdare. CursorBench rör sig åt andra hållet: 57,8 % på xhigh mot 52,5 % på medium, en spridning på fem punkter som säger att ansträngning fortfarande ger verklig träffsäkerhet på vissa uppgifter. Lärdomen är inte "använd medium" eller "använd xhigh"; den är att rätt ansträngningsnivå nu är en mätning per arbetsbelastning, och den gamla vanan att lämna Opus 5 på dess höga standardvärde säger dig inte längre något om den nya modellen.
Anthropic tillägger ett förbehåll värt att upprepa: på den här kapacitetsnivån är benchmarkmarginaler "en mindre tillförlitlig vägledning för verkliga skillnader", och företaget säger att dess interna gap till Claude Fable 5.1 är mindre än de publicerade poängen antyder. Det är en leverantör som säger åt dig att inte övertolka sin egen tabell.
Kostnad per slutförd uppgift är den jämförelse som avgör
Priset per token är fel enhet för en agent, och det är i den här jämförelsen det visar sig. Anthropics eget genomarbetade exempel: en fusionanalys som tog Opus 5.5 63 minuter och kostade 50 % mindre än samma uppgift på Opus 5, som tog 93 minuter. Prislistan förklarar en del av det – en sänkning med 20 % på input och output, 60 % på cacheläsningar – men inte allt. Resten är att modellen använder färre tokens och färre turer för att nå samma punkt. Kundcitat som publicerades i samband med lanseringen pekar i samma riktning: Box rapporterar en tredjedel av tokens och svar som är omkring 40 % mindre utförliga, Kiro ungefär hälften av tokens med 40 % färre anrop, Factory 20–25 % färre output-tokens, GitHub ligger bland de lägsta när det gäller antal tokens och steg som har uppmätts.
Det där är leverantörspublicerade kundutlåtanden, inte granskade resultat, och det samlade påståendet "cirka 40 % billigare vid typiska arbetsbelastningar" är Anthropics beskrivning av ett genomsnitt över de arbetsbelastningar som Anthropic har valt ut. Den ärliga versionen för din egen planering: utgå från att den 20-procentiga prissänkningen på prislappen är verklig och går att räkna hem, behandla de extra 20 % som en hypotes du kan testa på en eftermiddag genom att köra samma uppgift på båda modellerna och räkna tokens.
En strukturell kommentar om varför cachesänkningen ger oproportionerligt stor effekt. En agent som skickar om en lång systemprompt och ett filträd varje tur betalar cacheläsningspriser för merparten av sin input, inte priser för ny input. Att sänka det från 0,50 USD till 0,20 USD per miljon förändrar ekonomin för långvariga sessioner långt mer än rubrikpriset gör – och det är anledningen till att en arbetsbelastning som var marginellt gångbar på Opus 5 kan bli klart gångbar på Opus 5.5 utan några ändringar av dina prompter.
De fyra brytande ändringarna, som en migreringschecklista
Opus 5.5 är en ny modell, inte en omdöpt Opus 5, och Anthropics migreringsanteckningar listar fyra ändringar som kommer att bryta kod som redan körs i produktion:
• Tänkande kan inte inaktiveras. Varje kodväg som stängde av tänkande kommer att ge fel eller ändra beteende, och djupet styrs nu endast via parametern effort.
• Tvingad verktygsanvändning returnerar ett fel. En tool_choice som tvingar ett namngivet verktyg stöds inte.
• Tänkblock är kopplade till modellen som skapade dem och till konversationen, så de kan inte spelas upp igen mellan modeller på det sätt som vissa pipelines förutsätter.
• Det tidigare computer_20251124 datoranvändningsverktyget accepteras inte i Claude API eller på Google Cloud.
Det finns en femte förändring som inte gör att något misslyckas och därför är farligare. Text mellan verktygsanrop returneras nu inuti tankeblock vars text är tom vid standardvisningsinställningen. Om din applikation strömmar den texten till användare som förloppsuppdateringar, blir den tyst mellan verktygsanrop tills du anger ett visningsvärde som returnerar texten. Varje test går igenom; gränssnittet slutar helt enkelt att berätta.
De tre första gäller även Claude Fable 5.1, så ett team som redan har migrerat till den modellen har gjort en del av detta arbete. Ett team som fortfarande använder Opus 5 har inte gjort det.
När Opus 5 fortfarande är rätt val
Uppgraderingen är inte automatisk, och det finns fyra verkliga anledningar att stanna kvar:
• Kostnadsförutsägbarhet. Opus 5 är en modell som du redan har karakteriserat. Om din budget är modellerad utifrån dess tokenförbrukning, gör ett byte till en modell som tänker olika mycket vid samma namngivna ansträngningsnivå att modellen ogiltigförklaras tills du mäter om.
• Kompatibilitet. Om någon del av din stack är beroende av att inaktivera tänkande, tvinga fram ett verktyg eller det äldre computer-use-verktyget, är migreringen kodarbete, inte ett utbyte av en sträng.
• Skyddsroutning. Opus 5.5 levereras med skyddsåtgärder av Fable 5.1-klass, vilket innebär att de flesta cybersäkerhetsförfrågningar omdirigeras till Claude Opus 4.8 och biologiarbete faller tillbaka till Claude Opus 5 om inte ditt konto är verifierat. Om din produkt finns inom något av dessa områden kan "uppgradering" innebära att dina användare får svar från en mindre modell. Opus 5 har inte den routningen.
• Livslängd. Opus 5 försvinner inte inom kort — Anthropic anger att avveckling sker tidigast den 24 juli 2027, vilket är tio månader bort.
För alla andra är matematiken enkel: mer kapacitet, lägre pris, färre tokens och en migreringschecklista som en enda ingenjör kan arbeta sig igenom på en dag.
Kör båda under växlingen

Det besvärliga med varje flaggskeppsmigrering är mitten: du vill ha Opus 5.5 på ny trafik utan att satsa produktionsvägen på en modell som du inte har karakteriserat vid dina egna effort-inställningar, och du vill låta Opus 5 fortsätta serva medan du tar reda på saken. Det är ett routingproblem snarare än ett problem med att byta plattform, och det är värt att vara precis om vad som ligger var. Claude Opus 5 finns på OrcaRouter i dag till Anthropics eget listpris med 0 % påslag – leverantörens listpris förs direkt vidare, så en prisändring från leverantören slår igenom hos oss samma dag i stället för efter en synk. Claude Opus 5.5 är ännu inte en av våra rutter; den finns via Anthropics eget API och de stora molnen. När den kommer blir den ytterligare en rutt på samma nyckel i stället för ett andra avtal och ett andra SDK, vilket är vad som gör att du kan lägga en procentandel av trafiken på den nya modellen medan automatisk failover behåller resten på den du redan har karakteriserat. Att sätta samman ett anrop över båda – ett utkast från den ena och en verifieringsomgång från den andra – är en rad i routing-DSL.
Var precis om vad det ger dig. Det ger dig inte någon oberoende benchmark av Opus 5.5; inget gör det ännu, eftersom de enda publicerade direktjämförelserna är Anthropics egna och de oberoende bevakarna fortfarande håller på att bestämma sig för konfigurationer för ansträngning. Det du får av den är det enda mått som faktiskt förutsäger din faktura, på dina prompter, vid den ansträngningsnivå du kommer att släppa.
Beslutsregeln
Om du startar något nytt, använd Claude Opus 5.5 och börja på medel ansträngningsnivå, mät sedan om låg håller för din uppgift — Anthropic rapporterar att den låga nivån närmar sig de högre inställningarna i flera kodutvärderingar till mycket lägre kostnad, och siffrorna för FrontierCode ovan tyder på att standardinställningen inte lämnar mycket kvar att hämta.
Om du kör Claude Opus 5 i produktion är utlösaren för att migrera inte benchmarktabellen. Det är huruvida du kan absorbera fyra API-ändringar och huruvida din arbetsbelastning ligger inom cybersäkerhet eller biologi, där skyddsroutningen tyst kommer att skicka en del av din trafik till en mindre modell. Allt annat med den här uppgraderingen är en prissänkning klädd i en modellsläpps kläder, och de är värda att ta.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
