
Claude Opus 5.5 voert de Epoch Capabilities Index aan met 0,84 punten
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Het getal is 0,84. Claude Opus 5.5 staat op 167,35 op de Epoch Capabilities Index op basis van het bestand dat we op 2 oktober 2026 lazen, met GPT-6 Astra op 166,51 — een verschil van minder dan één punt op een schaal waarop de gepubliceerde 95%-intervallen voor de twee modellen vrijwel volledig overlappen, 164,0 tot 172,0 voor Opus 5.5 tegenover 163,14 tot 171,05 voor Astra. Daaronder, Claude Sonnet 5.5 behaalde 165,2 en Claude Fable 5.1 164,82, dus de top vier vermeldingen op een onafhankelijke samengestelde index van meer dan vijftig benchmarks liggen 2,53 punten uit elkaar en drie ervan dragen de naam van dezelfde leverancier. De ordening is echt in de zin dat de puntschattingen geordend zijn. Die is niet echt in de zin dat een voorsprong van 0,84 punt zijn eigen foutmarges overleeft, en alles wat de moeite waard is om over deze ranglijst te zeggen, volgt uit het tegelijkertijd vasthouden van beide feiten.
Wat de index is, en wat 0,84 van een punt niet is
De Epoch Capabilities Index is geen leveranciersscorebord. Hij wordt gebouwd door Epoch AI, een onafhankelijke onderzoeksorganisatie, als een samengestelde maatstaf die scores van meer dan vijftig verschillende benchmarks samenvoegt tot één schaal voor algemene capaciteiten, waarbij de relatieve moeilijkheidsgraad van elke benchmark wordt afgeleid uit de modellen die toevallig op meerdere ervan tegelijk voorkomen. De methodologie wordt uiteengezet in een paper die is geschreven met onderzoekers van het AGI Safety & Alignment-team van Google DeepMind en gefinancierd door DeepMind, maar Epoch stelt duidelijk dat de index zijn eigen product is en dat het er volledige rechten op heeft — een onderscheid dat de moeite waard is om te behouden wanneer de financieringsbron en de uitgever van een score niet dezelfde partij zijn. De code is openbaar.
Twee eigenschappen van de schaal zijn belangrijker dan de kop. De eerste is dat ECI bewust verankerd is in plaats van absoluut: ruwe scores worden herschaald zodat Claude 3.5 Sonnet op 130 uitkomt en GPT-5 op 150, wat betekent dat een getal op deze index alleen betekenisvol is naast een ander getal uit hetzelfde bestand, nooit op zichzelf. De tweede is dat de index geen plafond heeft. Er is geen 100 om te naderen, dus "top van de index" is een uitspraak over een datum, niet over een limiet die iemand heeft bereikt.
Daarom is de eerlijke lezing van 167,35 tegenover 166,51 niet "Claude Opus 5.5 is het meest capabele model ter wereld." Die is beperkter en minder citeerbaar: in de modellering door Epoch van het bewijs dat op 2 oktober 2026 beschikbaar was, zijn de twee modellen aan de top niet van elkaar te onderscheiden, en de rangorde tussen hen is een tiebreak in plaats van een meting. De gepubliceerde intervallen zeggen dat rechtstreeks — 164,0 tot 172,0 en 163,14 tot 171,05 delen het overgrote deel van hun bereik. Wie 0,84 als eindoordeel citeert, citeert een afrondingsartefact.
Het Anthropic-blok, en de grootte van een release
Het meest informatieve kenmerk van de tabel is niet wie er eerste staat. Het zijn de derde en vierde rij. Claude Sonnet 5.5, uitgebracht op 28 september en met een score van 165,2, staat 0,38 punt boven Claude Fable 5.1, dat op 1 september is uitgebracht met een score van 164,82 — dicht genoeg bij elkaar dat de twee in de praktijk dezelfde positie innemen, en dicht genoeg dat het tweetal slechts 2,15 punten onder de top van de ranglijst staat. Sonnet is het middenklasseproduct in de productlijn van Anthropic en Fable is het model dat het bedrijf van oudsher op algemeen redeneerwerk heeft gericht; dat ze nu allebei de frontier van net eronder flankeren, is de wezenlijke verandering in deze refresh, meer dan de identiteit van de koploper.
De eigen generatiesprong van Anthropic is ook zichtbaar. Claude Opus 5.5 is de opvolger van Claude Opus 5, waaraan Epoch een score van 162,94 toekent, met een interval van 160,2 tot 166,7. Dat is een verbetering van 4,41 punten over ongeveer twee maanden, van een release op 24 juli naar een op 22 september — een grotere sprong dan de 0,84 punten die de huidige nummers één en twee van elkaar scheiden. Zo gelezen is de interessante grootheid in deze tabel de helling binnen de lijn van één enkele leverancier, niet de kloof tussen twee leveranciers bovenaan.
Waar de grens van open weights loopt
Epoch scheidt modellen op basis van toegankelijkheid, waardoor de grens van open weights afleesbaar wordt zonder dat je hoeft te gokken. De beste open-weights-inzending is Kimi K3 met 157,61, gedateerd 16 juli en gelabeld als niet-commercieel. Daarachter staan DeepSeek V4 Pro 0813 met 155,38 en DeepSeek V4.1 Flash met 155,0, beide onbeperkt, en vervolgens GLM-5.3-Flash met 151,94 en GLM-5.2 met 151,78. Het dichtstbijzijnde open model bij de top staat dus 9,74 punten achter — een kloof die achttien keer breder is dan die tussen de eerste en tweede plaats, en breed genoeg dat de intervallen elkaar bij lange na niet raken.
Die asymmetrie is de enige blijvende bevinding in de tabel. De gesloten frontier is een scrum binnen drie punten; de afstand van de gesloten frontier tot de beste downloadbare gewichten is een orde van grootte groter. Een samengestelde index waarmee je benchmarks uit verschillende generaties kunt vergelijken, is precies het hulpmiddel om dat op te merken, omdat hij in juli en in september hetzelfde kan zeggen in plaats van te melden dat een verzadigende benchmark is stilgevallen.
Sommige van de nabijgelegen rijen zijn het waard om vast te pinnen voor context, aangezien het de modellen zijn die lezers daadwerkelijk afwegen tegen Opus 5.5:
• Claude Sonnet 5 — 156.34, uitgebracht op 30 juni, interval 153.61 tot 158.81
• Grok 4.6 — 156,61, uitgebracht op 12 augustus, interval 154,66 tot 158,93
• Gemini 3.8 Flash — 156,93, uitgebracht op 2 september, interval 154,64 tot 160,42
• Muse Spark 1.3 — 156.86, uitgebracht op 2 september, interval 154.73 tot 159.56
• GPT-5.6 Sol — 161,8, uitgebracht op 9 juli, interval 159,26 tot 165,26
Een indexpositie is geen rekening

Hier is de ranglijst niet meer het hele verhaal, want de twee modellen bovenaan kosten lang niet hetzelfde. In onze eigen catalogus, die beide tegen de lijstprijs van de provider aanbiedt zonder opslag, Claude Opus 5.5 voor $4,00/$20,00 met $0,20 voor cache-reads en GPT-6 Astra voor $10,00/$50,00 met $1,00 voor cache-reads liggen 2,5 keer uit elkaar in beide richtingen van de tariefkaart. Astra gaat ook omhoog boven 272.000 prompttokens, waar input naar $20,00 gaat en output naar $75,00; Opus 5.5 blijft vlak op $4,00/$20,00 over zijn volledige venster van 1M tokens. Beide leveren 128.000 outputtokens.
Voer de berekening uit die een workload met lange context daadwerkelijk met zich meebrengt — een prefix van 180.000 tokens die uit de cache wordt geleverd, 5.000 gegenereerde tokens. Bij Opus 5.5 is dat 180.000 tokens tegen $0,20 per miljoen, of ongeveer 3,6 cent, plus 5.000 tegen $20 per miljoen, of 10 cent: ruwweg 13,6 cent. Bij GPT-6 Astra is het 180.000 tegen $1,00, of 18 cent, plus 5.000 tegen $50, of 25 cent: ruwweg 43 cent. Een voorsprong van 0,84 punt en een kostenverschil van 3,2 keer zijn niet hetzelfde soort feit, en een inkoopbeslissing die alleen de eerste weegt, heeft het kleinere getal gewogen.
Fable 5.1 maakt het punt duidelijk vanaf de andere kant van de prijskaart van dezelfde leverancier: voor $10,00/$50,00 heeft het exact dezelfde prijs als Astra, en het scoort 164,82 — 2,53 punten onder Opus 5.5 voor hetzelfde geld. De index plaatst de drie frontier-inzendingen van Anthropic binnen 2,53 punten van elkaar en de tariefkaart zet ze een factor 2,5 uit elkaar, wat een veel betere beschrijving is van de keuze waar een koper voor staat dan welke enkele ranglijst dan ook.
Als je over een getal wilt discussiëren, discussieer dan op je eigen verkeer.

De reden dat deze index überhaupt de moeite waard is om te lezen, is dat hij door iemand anders dan de leveranciers wordt gemeten — maar de structuur van de composiet zelf bepaalt de voorwaarden van het debat. De kalibratie van Epoch, zijn moeilijkheidsschattingen en zijn omgang met modellen die benchmarks overslaan, bevinden zich allemaal stroomopwaarts van het getal in de tabel, en geen daarvan is iets wat een lezer uit een screenshot kan afleiden. Hetzelfde geldt voor de belangrijkste benchmark van elke leverancier, en daarom is de nuttige zet niet om tussen hen partij te kiezen, maar om ze te vergelijken op verkeer dat je zelf controleert.
Beide modellen zijn bereikbaar met één API-sleutel op OrcaRouter, dat de lijstprijs van de provider tegen 0% opslag doorgeeft: Claude Opus 5.5 voor $4,00/$20,00 met $0,20 voor cachereads en GPT-6 Astra voor $10,00/$50,00, waarbij de tier boven 272K exact wordt toegepast zoals de provider die hanteert. Dezelfde promptset naar beide sturen is een configuratiewijziging in plaats van een tweede contract, en waar beide worden gerouteerd, ligt automatische failover daaronder, wat van belang is voor een beslissing die zo dicht bij de ruisvloer ligt. Het leaderboard kan je vertellen dat de twee modellen niet van elkaar te onderscheiden zijn. Alleen je eigen eval kan je vertellen welke van de twee op jouw werk niet te onderscheiden is.

Wat zou dit cijfer volgende maand kunnen beïnvloeden?
Het dossier van Epoch is een levend document, en drie dingen zouden de aflezing snel veranderen. Het eerste is elke nieuwe evaluatie van een frontiermodel die in de top vier terechtkomt, aangezien één extra benchmarkobservatie een samengestelde score meer verandert wanneer de cluster zo dicht opeen ligt dan wanneer er een duidelijke koploper is. Het tweede is de drift van betrouwbaarheidsintervallen — de meest recente entries hebben de breedste, omdat ze op de minste overlappende benchmarks zijn geëvalueerd, dus de releases van september zijn de rijen die het waarschijnlijkst zullen bewegen en die van juli het minst. Het derde is een benchmark die verzadiging bereikt, wat de specifieke tekortkoming is die de index moest overleven: wanneer een component niet meer onderscheidt, herweegt Epoch de samenstelling in plaats van de voorsprong van een model te laten verdampen met de test.
Voorlopig is de verdedigbare samenvatting de beperkte. Claude Opus 5.5 bezet de eerste plaats op de Epoch Capabilities Index met 167,35 op basis van een marge van 0,84 punt die zijn eigen betrouwbaarheidsinterval niet ondersteunt, Claude Sonnet 5.5 is vanuit de middenmoot van dezelfde reeks opgeklommen tot binnen 2,15 punten van de leiding, en het open-weights-veld staat meer dan negen punten achter hen allemaal. Wie de koploper is, is een kwestie van kop of munt tussen twee leveranciers. Het prijsverschil van vier punten tussen hen is dat niet.
Vergeleken in dit artikel4
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
