
Claude Sonnet 5.5 evenaart Claude Fable 5.1 op de Epoch Capabilities Index
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 221 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Een gelijkspel bovenaan een ranglijst is meestal het minst interessante eraan. Deze is de uitzondering, want de twee modellen die bovenaan gelijk staan, kosten niet evenveel geld. In het bestand van de Epoch Capabilities Index dat op 1 oktober 2026 is bijgewerkt, Claude Sonnet 5.5 en Claude Fable 5.1 staan beide op 165 — rijen drie en vier van de 253 gevolgde modellen — twee punten achter Claude Opus 5.5 en GPT-6 Astra, die zelf gelijk staan op 167, en twee punten voor op Claude Opus 5 op 163. Claude Sonnet 5.5 verscheen op 28 september 2026 voor $2 per miljoen inputtokens en $10 per miljoen output. Claude Fable 5.1 verscheen op 1 september voor $10 en $50. Eén getal zegt dat de twee uitwisselbaar zijn qua algemene capaciteiten. Een vijfvoudige outputprijs zegt van niet. Beide houden stand, en de reden dat ze samen standhouden is het deel van de tabel dat niemand aanhaalt.
Wat de index eigenlijk is, en wie er meet
De ECI is geen leveranciersscorebord. Het wordt gebouwd door Epoch AI, een onafhankelijke onderzoeksorganisatie, als een composiet dat scores van meer dan vijftig verschillende benchmarks samenvoegt tot één schaal voor algemene capaciteiten, waarbij de relatieve moeilijkheid van elke benchmark wordt afgeleid uit de modellen die toevallig op meerdere daarvan tegelijk voorkomen. De methodologie wordt uiteengezet in een paper, “A Rosetta Stone for AI Benchmarks”, gefinancierd door Google DeepMind en geschreven met onderzoekers van hun AGI Safety & Alignment-team — maar Epoch verklaart duidelijk dat de index hun eigen product is en dat zij er de volledige rechten op bezit, en de fitting-code is openbaar. Dat onderscheid is van belang wanneer de financier van het onderzoek en de uitgever van de score niet dezelfde partij zijn.
Twee eigenschappen van de schaal bepalen hoe een getal erop gelezen kan worden. De eerste is dat ECI verankerd is in plaats van absoluut: ruwe waarden worden herschaald zodat Claude 3.5 Sonnet op 130 uitkomt en GPT-5 op 150, wat betekent dat een cijfer alleen iets zegt naast een ander cijfer uit hetzelfde bestand. De tweede is dat er geen plafond is. Er is geen 100 om te naderen, dus “top van de index” is een uitspraak over een datum en niet over een limiet die iemand heeft bereikt.
De derde eigenschap is degene die van een gelijkspel een verhaal maakt. De intervallen die naast elke score worden gepubliceerd — 90%-bootstrapintervallen, verkregen door de eigen waargenomen benchmarkresultaten van elk model vijfhonderd keer opnieuw te bemonsteren — zijn identiek voor de twee modellen bij 165: 162 tot 169 voor Claude Sonnet 5.5 en 162 tot 169 voor Claude Fable 5.1. De aantallen die ze hebben voortgebracht, zijn dat niet. De 165 van Claude Sonnet 5.5 is gefit op 11 benchmarkevaluaties. Die van Claude Fable 5.1 is gefit op 20.
Waarom hetzelfde interval niet hetzelfde bewijs betekent
De ECI vereist minimaal vier benchmarkevaluaties voordat een model überhaupt een score krijgt, dus beide cijfers komen ruim boven de ondergrens uit. Maar het interval zegt iets over hoeveel de eigen resultaten van een model uiteenlopen, niet over hoeveel resultaten er zijn — daarom kunnen twee modellen dezelfde band rond dezelfde puntschatting weergeven, terwijl een van hen op ongeveer de helft van het bewijs rust. Behandel de twee 165'en als even solide en je hebt het interval opgevat als een steekproefgroottecorrectie die het niet is.
De asymmetrie heeft een praktische consequentie voor de timing. Epoch herfit het hele model gezamenlijk op alle data telkens wanneer er nieuwe evaluaties binnenkomen, zodat de score van een model kan verschuiven zonder dat er iets aan dat model verandert. Het model met 11 observaties heeft meer ruimte om te verschuiven dan het model met 20, waardoor Claude Sonnet 5.5 van de twee het waarschijnlijkst is om in de volgende revisie te verschuiven — in beide richtingen.
Epochs eigen inkadering van de huidige lezing is enger dan de koppen die eruit zijn voortgekomen. De samenvatting van de update door de organisatie opent met Claude Opus 5.5 dat met 167 de eerste plaats inneemt, nipt voor GPT-6 Astra, en wijdt de tweede zin aan het feit dat Claude Sonnet 5.5 Claude Fable 5.1 op 165 “ruwweg geëvenaard” heeft. Ruwweg geëvenaard is de bepalende formulering, en de gepubliceerde intervallen zijn de reden dat dit de juiste is.
Waar de twee profielen daadwerkelijk uiteenlopen

Gelijk scoren op het samengestelde cijfer betekent niet gelijk scoren op de onderdelen. Epoch publiceert een paneel per benchmark op elke modelpagina, en zes benchmarks staan op zowel de pagina van Claude Sonnet 5.5 als op die van Claude Fable 5.1 — waardoor dat de enige zes zijn waarvoor een een-op-eenvergelijking beschikbaar is op basis van de index zelf.
• Mysterie-spelpuzzels — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%
• FrontierMath Niveaus 1–3 (v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%
• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% vs. Claude Fable 5.1 88%
• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100% tegen Claude Fable 5.1 100%
• Meubelmontage-benchmark — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%
• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%
Vier punten beweging in beide richtingen op een composiet die zo vol zit, en de onderliggende splitsing is verre van symmetrisch. Claude Sonnet 5.5 ligt voorop waar het werk op games lijkt en multimodaal is — puzzels oplossen, fysieke assemblage — en staat gelijk bij wedstrijdwiskunde. Claude Fable 5.1 ligt 8 punten voor op het moeilijkste niveau van FrontierMath en 24 punten op SimpleQA Verified, de wereldkennisset waar een score van 47% tegenover 71% het grootste afzonderlijke gat in het gedeelde panel is. Een koper die tussen deze twee modellen kiest, kiest niet tussen twee interpretaties van dezelfde capaciteit; hij kiest tussen een goedkoper model dat sterker is op sommig werk en een duurder model dat sterker is op ander werk, met een index voor algemene capaciteit die weigert hen te scheiden.
De index van Epoch is er ook expliciet over dat een voorsprong op één enkele benchmark niet in de samengestelde score hoeft terug te komen. Benchmarks worden niet gewogen op nauwkeurigheid, en een model dat zich specialiseert kan onder een anders gevormde rivaal scoren, zelfs terwijl het afzonderlijke tests aanvoert — dat zegt de documentatie zelf met zoveel woorden. Dat is geen defect dat wordt vergoelijkt; dat is precies waar een samengestelde score over zo'n vijftig tests voor bedoeld is.
De twee onafhankelijke instrumenten wijzen in tegengestelde richting.

Er is een tweede onafhankelijke meting in omloop, en die is het niet eens met de eerste over welk van deze twee modellen aan kop gaat. Op de Artificial Analysis Intelligence Index staan de cijfers die onze eigen catalogus voor de twee modellen bevat op 56 voor Claude Sonnet 5.5 en 53,4 voor Claude Fable 5.1, afkomstig uit dezelfde revisie van die index en dus met dezelfde steekproef van geëvalueerde modellen. Drie punten verschil, in het voordeel van het goedkopere model — terwijl Epoch ze als identiek leest.
Geen van beide lezingen is fout, en de manier om ze te gebruiken is te letten op waarover ze van elkaar verschillen. De twee indices bestrijken verschillende benchmarksets en wegen die anders; de Epoch-composiet is gebouwd om bestand te zijn tegen verzadigende benchmarks, terwijl de Artificial Analysis-index een directe aggregatie van een andere verzameling is. Wanneer een paar modellen zo dicht bij elkaar ligt, is de keuze van het instrument meer waard dan het gemeten verschil. Een lezer die de sterkere van twee aangrenzende getallen wil, kan beter naar het paneel hierboven met gedeelde individuele benchmarks kijken dan naar een van beide hoofdscores, want dat is de enige plek waar de twee modellen op dezelfde test met elkaar worden vergeleken.
Er is nog één stuk context dat de composiet niet bevat, en Epoch wel: de releasedatum. Claude Fable 5.1 staat vandaag vierde van de 253 gevolgde modellen. Ten tijde van zijn eigen release op 1 september 2026 stond het eerste van de 247 modellen die toen werden gevolgd. Zijn gewichten zijn niet veranderd. De frontier ging het gewoon in een maand tijd zes plaatsen voorbij — wat de vorm van de hele tabel is, en de reden dat een maandelijkse indexmeting een momentopname is en geen eindoordeel.
Wat het verschil kost, en waar de goedkope kant is

Gelijkwaardig op algemene capaciteit, een factor 2,5 verschil op input en een factor 5 verschil op output: dat is de hele praktische inhoud van deze beschouwing. Beide modellen zijn opgenomen in onze eigen catalogus — anthropic/claude-sonnet-5.5 voor $2,00 per miljoen input en $10,00 per miljoen output met $0,20 voor cache-reads, en anthropic/claude-fable-5.1 voor $10,00 en $50,00 met $0,25 voor cache-reads — en beide worden doorgegeven tegen de eigen lijstprijs van de provider, zonder dat er een opslag wordt toegevoegd, zodat een tariefwijziging van een leverancier bij ons op dezelfde dag aankomt als bij hen.
De herhaling is belangrijker dan de kop. Neem een workload die een prefix van 120.000 tokens uit de cache haalt en 8.000 tokens output genereert, en die een maand lang één keer per dag draait. Bij Claude Sonnet 5.5 kost die prefix 120.000 tokens tegen $0,20 per miljoen, ongeveer 2,4 cent, plus 8.000 tegen $10 per miljoen, 8 cent — ruwweg 10,4 cent per uitvoering, of ongeveer $3,12 over dertig dagen. Bij Claude Fable 5.1 is dezelfde prefix 120.000 tegen $0,25, 3 cent, plus 8.000 tegen $50, 40 cent — ongeveer 43 cent per uitvoering, of $12,90 over de maand. Beide modellen bieden hetzelfde venster van 1M tokens met maximaal 128K output, dus het verschil zit in de kaart, niet in het plafond.
Daartegenover zeggen de zes gedeelde benchmarks in welke richting het extra geld iets oplevert. Een team waarvan het werk lijkt op FrontierMath Tier 4 of open-ended feitelijke recall koopt een reëel verschil van 8 tot 24 punten op die tests door vier keer zoveel te betalen; een team waarvan het werk lijkt op het oplossen van puzzels of multimodale assemblage koopt 5 tot 7 punten in de andere richting terwijl het het kleinere bedrag betaalt. Op één platform zijn dit geen twee inkoopbeslissingen. Beide modellen zitten achter één API-sleutel tussen meer dan 200 modellen, dus het vergelijken ervan op je eigen verkeer is een configuratiewijziging in plaats van een tweede contract, en waar beide worden gerouteerd, zit automatische failover eronder — wat van belang is wanneer twee onafhankelijke instrumenten het oneens zijn over welke aan kop gaat.
Wat zou deze lezing veranderen?
Drie dingen zouden het veranderen, en slechts één daarvan betreft een van beide modellen.
Het eerste zijn meer benchmarkevaluaties. Claude Sonnet 5.5 kwam vier dagen geleden in de index met 11 erachter; elke extra evaluatie vernauwt het interval en kan de puntschatting verschuiven, en een gezamenlijke herfit betekent dat de beweging niet beperkt blijft tot de nieuwe rij.
Het tweede is de komst van nog een grensverleggend model. De bovenste vier rijen beslaan vier punten, met twee gelijke scores binnen dat bereik, dus een enkele goed geëvalueerde nieuwkomer belandt binnen de cluster in plaats van eronder — en de gepubliceerde intervallen, die bij alle vier overlappen, betekenen dat de ordening onderling een tiebreak is in plaats van een meting.
Het derde is de prijs van de modellen zelf, die geen enkele index bijhoudt. De kloof waar dit stuk om draait, is een tariefkaartkloof: $2 en $10 tegenover $10 en $50 vandaag. Een wijziging op een van beide kaarten verandert de beslissing zonder ook maar één capaciteitsscore te veranderen.
De verdedigbare samenvatting is de beperkte. Op de samengestelde index van Epoch AI, in een bestand dat op 1 oktober 2026 is bijgewerkt, zijn Claude Sonnet 5.5 en Claude Fable 5.1 hetzelfde getal — 165, gedeeld op de derde plaats, met identieke gepubliceerde intervallen die op verschillende hoeveelheden bewijs berusten. Op het afzonderlijke instrument van Artificial Analysis liggen dezelfde twee modellen drie punten uit elkaar. Op de zes benchmarks waarop de index ze rechtstreeks vergelijkt, wisselen ze per domein de leiding af in plaats van gelijk te staan. En op de tariefkaart liggen ze helemaal niet dicht bij elkaar. Het enige wat deze lezing niet zal ondersteunen, is de zin waarvoor ze het waarschijnlijkst zal worden aangehaald: dat de modellen gelijkwaardig zijn.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
