Ett titelkort med texten ”Claude Opus 5.5 toppar Coding Agent Index på 66” och underrubriken ”Billigare tokens, en större uppgiftsnota” samt tre rundade kort under det: Coding Agent Index 66, Kostnad per uppgift 13,04 $ upp 21 %, och Claude Opus 5: 60 för 10,79 $.
Guides & Insights

Claude Opus 5.5 toppar Coding Agent Index på 66 – och uppgiftsräkningen stiger 21 %

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Leverantören sänkte Claude Opus 5.5:s tokenpriser med 20 % den 22 september 2026. Två dagar senare publicerade Artificial Analysis mätningen av kodningsagenten som visar vad sänkningen gjorde med en agents räkning: kostnaden per uppgift gick upp 21 %, till 13,04 dollar, från 10,79 dollar som samma index tar ut för Claude Opus 5. Poängen gick också upp – 66 på Coding Agent Index, som Artificial Analysis beskriver som det högsta man har mätt, sex poäng före Claude Opus 5 och fyra före Claude Fable 5.1 i samma konfiguration. Båda sakerna är sanna samtidigt, och anledningen till att de är sanna samtidigt är hela historien bakom den här rankningen. En billigare token som en modell förbrukar fler av är inte en billigare uppgift, och vid maximal resonemangsansträngning under långa agentkörningar förbrukar Claude Opus 5.5 många fler av dem.

Vad Coding Agent Index faktiskt poängsätter

Detta är inte en modelltopplista. Varje rad på den är ett agentramverks- och modellpar – en checkpoint som körs i en specifik kodagent, vid en specifik ansträngningsinställning. Raden som alla citerar är Claude Opus 5.5 vid max ansträngningsnivå i Claude Code, vilket är det agentramverk som Anthropic bygger och trimmar mot. Claude Opus 5:s 60 och Claude Fable 5.1:s 62 kommer från samma agentramverk och samma ansträngningsinställning, vilket är vad som gör dem till de ärliga jämförelserna; en rad för endera modellen i en annan kodagent är en annan mätning och skrivs inte ut här som om den vore densamma.

Indexet är versionerat, och versionen spelar större roll än varumärkesnamnet på det. Tavlan som för närvarande publiceras som v1.5 utgör ett genomsnitt av tre utvärderingar, var och en viktad lika, var och en rapporterad som pass@1 i genomsnitt över tre försök per uppgift:

Terminal-Bench 4.0 — agentiskt arbete i skal och på kommandoraden: navigera i ett filsystem, använda verktyg korrekt, återhämta sig från ett mellanliggande fel och slutföra ett arbetsflöde i flera steg.

DeepSWE v1.1 — mjukvaruutvecklingsuppgifter, arbetet med att redigera repositoriet.

SWE-Atlas-QnA — frågor om förståelse av kodförråd, där svaret hittas genom att läsa en kodbas snarare än att ändra den.

Tre utvärderingar, ett tal och en kolumn för kostnad per uppgift tryckt intill det. Den kostnadskolumnen är anledningen till att detta index är mer användbart än enbart en poäng, och det är också anledningen till att rubriksiffran är svårare att tolka än den ser ut.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

De tre komponenterna, och varifrån de sex punkterna kom

Artificial Analysis publicerade komponentraderna tillsammans med kompositen, och de förändras inte jämnt:

Terminal-Bench 4.063,1 % för Claude Opus 5.5 mot 54,5 % för Claude Opus 5, en ökning med 8,6 punkter. Detta är den största enskilda förbättringen i uppsättningen.

DeepSWE v1.168,4 % mot 62,5 %, en ökning med 5,9 punkter.

SWE-Atlas-QnA66,4 % mot 62,1 %, en ökning med 4,3 punkter.

Medelvärdet av de tre är 66,0, vilket är det sammansatta måttet. Det intressanta är förbättringens form: modellen förbättrades minst på att läsa en kodbas och mest på att styra ett skal. Terminal-Bench är den utvärdering som ligger närmast vad folk faktiskt menar med ”coding agent” – en långvarig loop där modellen väljer kommandon, läser utdata och bestämmer vad den ska göra härnäst, utan någon människa i loopen mellan stegen. Ett hopp på 8,6 punkter där säger något om uthållig verktygsanvändning, inte om kodgenerering.

Notera vad det innebär för var man kan förvänta sig förbättringen. Om din arbetsbelastning är "förklara det här kodförrådet", är Claude Opus 5.5 en blygsam uppgradering jämfört med Claude Opus 5 – fyra poäng. Om din arbetsbelastning är "kör tills testsviten passerar, åtgärda det som går sönder", är det det största hoppet i tabellen.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

Siffran som står bredvid rankningen: 13,04 $ per uppgift

Här är matematiken som gör att prissänkningen ser annorlunda ut än hur den annonserades. Anthropics listpris för Claude Opus 5.5 är $4.00 per miljon input-tokens och $20.00 per miljon output, ned från $5.00 och $25.00 för Claude Opus 5, med cacheläsningar ned 60% till $0.20 per miljon. Var och en av dessa rader är billigare. Artificial Analysis uppskattning av vad en uppgift kostar vid maximal ansträngning är ändå högre:

Kostnad per uppgift — 13,04 USD för Claude Opus 5.5 mot 10,79 USD för Claude Opus 5, upp 21 % på samma index, samma testramverk, samma ansträngningsinställning.

Totalt antal tokens per uppgift — ungefär 15,6M mot 11,4M, en ökning med cirka 37 %.

Utdata-tokens per uppgift – ungefär 333 000 mot 137 000, mer än dubbelt. Utdata är den dyra riktningen, och det är den post som förändrats mest.

Cachad indata per uppgift – ungefär 14,6M mot 10,9M, en ökning med cirka 34 %. Sänkningen av cache-läsningen med 60 % gör verklig nytta här; den räcker bara inte för att väga upp en uppgift som läser en tredjedel mer kontext.

Räkna ihop summan med de publicerade priserna och mönstret träder fram. Ta enbart utdata-tokens: 333 000 tokens till $20,00 per miljon är cirka $6,66 — ungefär hälften av hela uppskattningen på $13,04, från en enda radpost som fördubblades. Raden för cacheläsning är enorm i volym och nästan gratis i pris: 14,6 M tokens till $0,20 per miljon är under $3. Nedskärningen på 20 % är verklig och cachenedskärningen är verklig; vid maximal ansträngning i en agentloop väger de helt enkelt lättare än en modell som tänker längre och skriver mer.

Det har en direkt konsekvens för hur du budgeterar. Om ditt team kör 500 kodagentuppgifter om dagen vid maximal ansträngning är skillnaden mellan 10,79 $ och 13,04 $ cirka 1 125 $ om dagen — ungefär 34 000 $ i månaden — för samma antal uppgifter. Det är siffran du bör lägga fram för den som godkänner modellbytet, och det är inte siffran som prissänkningen antyder.

Varför både $5.98 och $13.04 är sanna

Artificial Analysis publicerade en annan siffra för kostnad per uppgift för samma modell dagar tidigare, och att läsa de två tillsammans utan etiketterna får dem att framstå som en motsägelse. De är det inte — de är två olika utvärderingar, och skillnaden är lärorik.

Intelligence Index angav artikeln den 22 september kostnaden per uppgift för Claude Opus 5.5 till $5.98, ungefär i nivå med Claude Opus 5:s $5.86, trots cirka 119 000 utdatatoken per uppgift jämfört med Opus 5:s 73 000. Där tar prissänkningen och de extra token ut varandra nästan exakt. På Coding Agent Index vid högsta ansträngning i Claude Code kostar samma modell $13.04 mot $10.79.

Båda är ärliga mätningar av olika arbetsbelastningar. En utvärdering av fråga-svar är ett kort utbyte; en agentuppgift är en lång loop av verktygsanrop med en växande kontext, och tillväxten förstärks i utdatariktningen, där priset är som högst. Den praktiska lärdomen är att ”väger prissänkningen upp de extra tokensen?” inte har något entydigt svar – det beror på uppgiftens längd, och ju längre och mer agentisk uppgiften är, desto sämre blir kompensationen. Om du budgeterar utifrån ett benchmark för korta svar kommer du att underskatta en agents nota.

Tre förbehåll som hör hemma på raden

66:an är en siffra för Claude Code, inte en siffra för enbart modellen. Indexet parar medvetet ihop modeller med testramverk, med argumentet att verktygsroutning, återförsökslogik och kontexthantering är oskiljaktiga från en agents uppmätta prestanda. Det gynnar Anthropic här, eftersom testramverket den poängsätts i är dess eget. Artificial Analysis markerar en jämförelsevy för testramverk som "kommer snart"; tills den finns kan ingen säga hur mycket av sexpunktsledningen som är checkpointen och hur mycket som är byggnadsställningen runt den.

Anthropics egen siffra för Terminal-Bench 4.0 är högre än den här komponenten och kördes av Anthropic. Lanseringsmaterialet anger 66,4 % vid xhigh ansträngning; Coding Agent Index-komponenten är 63,1 % vid max, och Artificial Analysiss separata oberoende körning uppmätte 59,6 % i sin egen harness på samma version av benchmarken. Tre siffror, tre konfigurationer, tre producenter. De 63,1 % på raden ovan är indexets egen komponent och bör bara jämföras med de övriga siffrorna i det indexet; leverantörens 66,4 % är rapporterad av leverantören, inte reproducerad av en tredje part, och tillhör en annan ansträngningsinställning.

Indexrevisionen rör sig. Den här bloggen rapporterade andra rader i Coding Agent Index i början av september, på en tidigare version av samma resultattavla, och dessa äldre siffror är inte jämförbara med v1.5 – själva utvärderingssetet ändrades när Terminal-Bench 4.0 ersatte den tidigare versionen. Tredjepartsspeglar innehåller fortfarande inaktuella ögonblicksbilder med äldre versionsetiketter. Om ett nummer för Claude Opus 5.5 i detta index inte kommer från den aktuella v1.5-raden ska du inte placera det bredvid ett v1.5-nummer, och inte beräkna ett delta mellan de två.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

Vad som faktiskt ska driftsättas

Rangordningen är en siffra för max-ansträngning, och max-ansträngning är den inställning som nästan ingen bör använda som standard. Claude Opus 5.5 har fem ansträngningsnivåer – låg, medel, hög, xhigh och max – och modellen använder medel som standard. Artificial Analysis har inte publicerat rader för Coding Agent Index vid de lägre inställningarna, så besparingen där är okvantifierad i detta index; i Intelligence Index fick samma modell på medel 51 – i nivå med Claude Opus 5:s max – till $1,34 per uppgift. Det är i den riktningen besparingarna finns, och det är en inställning, inte en annan modell.

Det realistiska mönstret är en uppdelning: behåll maximal ansträngning för de långa autonoma looparna där Terminal-Bench-vinsten på 8,6 punkter är det du betalar för, och kör det rutinmässiga arbetet med lägre ansträngning, där modellen fortfarande ligger långt före den nivå där Claude Opus 5 slutade. Eftersom ansträngning är en begärandeparameter snarare än en driftsättning är den uppdelningen en routningsregel, och båda modellerna finns i samma katalog – Anthropics listpriser som förs vidare med 0 % påslag, så en leverantörsprissänkning slår igenom på anthropic/claude-opus-5.5 samma dag som den tillkännages, och det krävs varken ett andra avtal eller någon kodändring för att A/B-testa de två mot dina egna uppgifter. Specifikt för max-ansträngningsvägen, där en enskild uppgift kan vara en lång oövervakad körning, är automatisk failover det som hindrar en leverantör som har fastnat från att kosta dig hela loopen.

Vad är fortfarande omätt?

Tre saker skulle ändra den här bilden och ingen av dem finns ännu. Det finns ingen jämförelse med matchad ansträngning och matchat ramverk av Claude Opus 5.5 mot en konkurrerande checkpoint – varje tillgänglig jämförelse mellan leverantörer är två leverantörstabeller placerade sida vid sida. Det finns ingen publicerad Coding Agent Index-körning vid medel- eller hög ansträngning, vilket är där merparten av produktionstrafiken skulle ligga. Och frågan om ramverkstillskrivning – hur mycket av en 66:a som är modellen och hur mycket som är Claude Code – har erkänts av indexet och skjutits upp.

Det du kan agera på i dag är snävare och mer användbart än en rangordning. Claude Opus 5.5 är genuint bättre på långvarigt shell-drivet agentarbete än Claude Opus 5 – det är den enda komponenten med en stor, konsekvent, oberoende framtagen förbättring. Det kostar också mer per uppgift vid den inställning där förbättringen mättes, med omkring $2.25 per uppgift, och prissänkningen per token når inte upp till den siffran. Driftsätt det vid max effort där loopen är lång och kostnaden för misslyckande är hög; behåll den billigare inställningen överallt annars; och kontrollera indexet igen när raderna med lägre effort visas, eftersom det är den konfiguration som de flesta team faktiskt kommer att betala för. Om du byter enbart för prissänkningen köper du fel sak – modellen är billigare per token och dyrare per uppgift, och bara en av dessa två siffror syns på din faktura.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen