
Claude Opus 5.5 toppar Epoch Capabilities Index med 0,84 poäng
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Siffran är 0,84. Claude Opus 5.5ligger på 167,35 i Epoch Capabilities Index enligt filen vi läste den 2 oktober 2026, medan GPT-6 Astraligger på 166,51 – en skillnad på mindre än en punkt på en skala där de publicerade 95-procentiga intervallen för de två modellerna nästan helt överlappar varandra, 164,0 till 172,0 för Opus 5.5 mot 163,14 till 171,05 för Astra. Under dem hamnar Claude Sonnet 5.5på 165,2 och Claude Fable 5.1på 164,82, så de fyra högsta posterna i ett oberoende sammansatt mått av fler än femtio benchmarks skiljs åt av 2,53 punkter och tre av dem bär samma leverantörs namn. Ordningen är verklig i den meningen att punktskattningarna är ordnade. Den är inte verklig i den meningen att en ledning på 0,84 punkter överlever sina egna felstaplar, och allt som är värt att säga om den här resultattavlan följer av att hålla båda dessa fakta i minnet samtidigt.
Vad indexet är, och vad 0,84 av en punkt inte är
Epoch Capabilities Index är inte en resultattavla för leverantörer. Det byggs av Epoch AI, en oberoende forskningsorganisation, som ett sammansatt mått som syr ihop poäng från fler än femtio olika benchmarks till en enda allmän kapacitetsskala, och härleder varje benchmarks relativa svårighetsgrad från de modeller som råkar förekomma på flera av dem samtidigt. Metodiken beskrivs i en artikel skriven tillsammans med forskare från Google DeepMinds AGI Safety & Alignment-team och finansierad av DeepMind, men Epoch säger uttryckligen att indexet är deras egen produkt och att de har fulla rättigheter till det – en distinktion som är värd att hålla fast vid när finansieringskällan och den som publicerar en poäng inte är samma part. Koden är offentlig.
Två egenskaper hos skalan spelar större roll än rubriken. Den första är att ECI medvetet är förankrat snarare än absolut: råpoäng skalas om så att Claude 3.5 Sonnet hamnar på 130 och GPT-5 på 150, vilket innebär att en siffra på detta index bara är meningsfull bredvid en annan siffra från samma fil, aldrig i sig själv. Den andra är att indexet inte har något tak. Det finns inget 100 att närma sig, så "toppen av indexet" är ett uttalande om ett datum, inte om en gräns som någon har nått.
Det är därför den ärliga tolkningen av 167,35 mot 166,51 inte är ”Claude Opus 5.5 är världens mest kapabla modell.” Den är snävare och mindre citatvänlig: utifrån Epochs modellering av det underlag som fanns tillgängligt den 2 oktober 2026 går de två modellerna inte att skilja åt i toppen, och rangordningen mellan dem är ett tiebreak snarare än en mätning. De publicerade intervallen säger det direkt – 164,0 till 172,0 och 163,14 till 171,05 har merparten av sina intervall gemensamt. Den som citerar 0,84 som en dom citerar en avrundningsartefakt.
Anthropic-blocket, och storleken på en release
Det mer informativa inslaget i tabellen är inte vem som ligger först. Det är tredje och fjärde raden. Claude Sonnet 5.5, som släpptes den 28 september och fick 165,2, hamnar 0,38 poäng över Claude Fable 5.1, som släpptes den 1 september och fick 164,82 – tillräckligt nära för att de två i praktiken är på samma position, och tillräckligt nära för att paret bara ligger 2,15 poäng under toppen av listan. Sonnet är mellanklassprodukten i Anthropics produktlinje och Fable är den modell som företaget historiskt har riktat mot allmänt resonemangsarbete; att båda nu ramar in frontlinjen strax underifrån är den väsentliga förändringen i denna uppdatering, mer än identiteten på ledaren.
Anthropics eget generationskliv är också synligt. Claude Opus 5.5 är efterföljaren till Claude Opus 5, som Epoch poängsätter till 162,94 med ett intervall på 160,2 till 166,7. Det är en förbättring på 4,41 punkter över ungefär två månader, från en lansering den 24 juli till en den 22 september – en större förflyttning än de 0,84 punkter som skiljer dagens första- och andraplats. Sett så är den intressanta kvantiteten i den här tabellen lutningen inom en enda leverantörs linje, inte gapet mellan två leverantörer i toppen.
Var gränsen för öppna vikter går
Epoch separerar modeller efter tillgänglighet, vilket gör gränsen för öppna vikter tydlig utan att man behöver gissa. Den bästa modellen med öppna vikter är Kimi K3 på 157,61, daterad 16 juli och märkt som icke-kommersiell. Bakom den ligger DeepSeek V4 Pro 0813 på 155,38 och DeepSeek V4.1 Flash på 155,0, båda utan begränsningar, sedan GLM-5.3-Flash på 151,94 och GLM-5.2 på 151,78. Den öppna modell som ligger närmast toppen ligger därför 9,74 poäng efter — en lucka som är arton gånger bredare än den mellan första- och andraplatsen, och tillräckligt bred för att intervallen inte ska vara i närheten av att vidröra varandra.
Den asymmetrin är det enda bestående fyndet i tabellen. Den slutna frontlinjen är en klunga inom tre punkter; avståndet från den slutna frontlinjen till de bästa nedladdningsbara vikterna är en storleksordning större. Ett sammansatt index som låter dig jämföra mellan benchmarkgenerationer är precis verktyget för att upptäcka det, eftersom det kan säga samma sak i juli och i september i stället för att rapportera att en benchmark som mättas har tystnat.
Några av de närliggande raderna är värda att fästa för kontext, eftersom det är de modeller som läsarna faktiskt väger mot Opus 5.5:
• Claude Sonnet 5 — 156,34, släppt den 30 juni, intervall 153,61 till 158,81
• Grok 4.6 — 156.61, släppt 12 augusti, intervall 154.66 till 158.93
• Gemini 3.8 Flash — 156,93, släpptes 2 september, intervall 154,64 till 160,42
• Muse Spark 1.3 — 156,86, släppt 2 september, intervall 154,73 till 159,56
• GPT-5.6 Sol — 161,8, släpptes 9 juli, intervall 159,26 till 165,26
En indexposition är inte en räkning.

Här slutar topplistan att vara hela historien, för de två modellerna i topp kostar inte på långa vägar samma sak. Från vår egen katalog, som tillhandahåller båda till leverantörens listpris utan påslag, Claude Opus 5.5 för 4,00/20,00 USD med 0,20 USD för cacheläsningaroch GPT-6 Astra för 10,00/50,00 USD med 1,00 USD för cacheläsningar ligger 2,5 gånger isär i båda riktningarna på prislistan. Astra trappar dessutom upp över 272 000 prompt-tokens, där indata går till 20,00 USD och utdata till 75,00 USD; Opus 5.5 håller 4,00/20,00 USD platt över hela sitt 1M-tokensfönster. Båda levererar 128 000 utdata-tokens.
Räkna på vad en arbetsbelastning med lång kontext faktiskt kostar — ett prefix på 180 000 tokens som serveras från cachen, 5 000 genererade tokens. Med Opus 5.5 är det 180 000 tokens till $0,20 per miljon, eller cirka 3,6 cent, plus 5 000 till $20 per miljon, eller 10 cent: ungefär 13,6 cent. Med GPT-6 Astra är det 180 000 till $1,00, eller 18 cent, plus 5 000 till $50, eller 25 cent: ungefär 43 cent. Ett försprång på 0,84 punkter och en 3,2-faldig kostnadsskillnad är inte samma sorts faktum, och ett inköpsbeslut som bara väger det första har vägt det mindre talet.
Fable 5.1 gör poängen från andra sidan av samma leverantörs priskort: till priset $10,00/$50,00 är det prissatt exakt som Astra, och det får 164,82 — 2,53 poäng under Opus 5.5 för samma pengar. Indexet placerar Anthropics tre frontier-modeller inom 2,53 poäng från varandra och dess prislista skiljer dem med en faktor 2,5, vilket är en mycket bättre beskrivning av valet som en köpare står inför än någon enskild rangordning.
Om du tänker argumentera om en siffra, argumentera utifrån din egen trafik.

Anledningen till att detta index överhuvudtaget är värt att läsa är att det mäts av någon annan än leverantörerna – men det sammansatta indexets egen struktur sätter villkoren för argumentet. Epochs kalibrering, dess svårighetsuppskattningar och dess hantering av modeller som hoppar över benchmarks ligger alla uppströms om siffran i tabellen, och inget av dem är något som en läsare kan återhärleda från en skärmbild. Detsamma gäller varje leverantörs främsta benchmark, vilket är anledningen till att det användbara greppet inte är att välja sida mellan dem utan att jämföra dem på trafik som du kontrollerar.
Båda dessa modeller är åtkomliga från en API-nyckel på OrcaRouter, som vidarebefordrar leverantörens listpris med 0 % påslag: Claude Opus 5.5 till $4.00/$20.00 med $0.20 cache-läsningar och GPT-6 Astra till $10.00/$50.00 med dess över-272K-nivå tillämpad exakt som leverantören anger den. Att skicka samma promptuppsättning till båda är en konfigurationsändring snarare än ett andra kontrakt, och där båda dirigeras, automatisk failover ligger under, vilket spelar roll för ett beslut så nära brusgolvet. Leaderboarden kan säga dig att de två modellerna är oskiljbara. Endast din egen utvärdering kan säga dig vilken som är oskiljbar i ditt arbete.

Vad skulle kunna förändra den här siffran nästa månad?
Epochs fil är levande, och tre saker skulle snabbt förändra läsningen. Det första är en ny utvärdering av en frontiermodell som hamnar inom topp fyra, eftersom en enda ytterligare benchmarkobservation flyttar ett sammansatt mått mer när klustret är så här tätt än när det finns en tydlig ledare. Det andra är konfidensintervallens drift – de senaste posterna har de bredaste, eftersom de har utvärderats mot minst antal överlappande benchmarks, så septembersläppen är de rader som sannolikt flyttar sig mest och julisläppen minst. Det tredje är en benchmark som når mättnad, vilket är det specifika misslyckande som indexet byggdes för att överleva: när en komponent slutar särskilja, viktar Epoch om sammansättningen i stället för att låta en modells fördel avdunsta med testet.
För närvarande är den försvarbara sammanfattningen den snäva. Claude Opus 5.5 innehar förstaplatsen på Epoch Capabilities Index med 167,35, tack vare en marginal på 0,84 punkter som dess eget konfidensintervall inte stöder, Claude Sonnet 5.5 har klättrat från mellanskiktet i samma serie till inom 2,15 punkter från ledningen, och fältet för öppna vikter ligger mer än nio punkter efter dem alla. Vem som leder är en slantsingling mellan två leverantörer. Prisskillnaden på fyra punkter mellan dem är inte det.
Jämförda i den här artikeln4
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
