
Claude Sonnet 5.5 tangerar Claude Fable 5.1 på Epoch Capabilities Index
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
En delad förstaplats i toppen av en topplista är vanligtvis det minst intressanta med den. Den här är undantaget, eftersom de två modellerna som ligger lika i toppen inte kostar samma pengar. I Epoch Capabilities Index-filen som uppdaterades den 1 oktober 2026, Claude Sonnet 5.5 och Claude Fable 5.1 båda visar 165 — rad tre och fyra av 253 spårade modeller — två poäng bakom Claude Opus 5.5 och GPT-6 Astra, som själva ligger lika på 167, och två poäng före Claude Opus 5 på 163. Claude Sonnet 5.5 släpptes den 28 september 2026 för $2 per miljon indatatoken och $10 per miljon utdatatoken. Claude Fable 5.1 släpptes den 1 september för $10 och $50. En enda siffra säger att de två är utbytbara när det gäller allmän förmåga. Fem gånger utdatapriset säger att de inte är det. Båda håller måttet, och anledningen till att de gör det tillsammans är den del av tabellen som ingen citerar.
Vad indexet faktiskt är, och vem som mäter
ECI är inte en resultattavla för leverantörer. Det byggs av Epoch AI, en oberoende forskningsorganisation, som ett sammansatt mått som fogar samman poäng från fler än femtio olika benchmarkar till en enda skala för allmän förmåga, och härleder varje benchmarks relativa svårighetsgrad utifrån de modeller som råkar förekomma i flera av dem samtidigt. Metodiken presenteras i en artikel, ”A Rosetta Stone for AI Benchmarks”, finansierad av Google DeepMind och skriven tillsammans med forskare från dess AGI Safety & Alignment-team – men Epoch säger uttryckligen att indexet är deras egen produkt och att de har fulla rättigheter till det, och koden för anpassningen är offentlig. Den åtskillnaden spelar roll när forskningens finansiär och den som publicerar poängen inte är samma part.
Två egenskaper hos skalan avgör hur ett tal på den kan läsas. Den första är att ECI är förankrat snarare än absolut: råvärden skalas om så att Claude 3.5 Sonnet hamnar på 130 och GPT-5 på 150, vilket innebär att en siffra bara betyder något bredvid en annan siffra från samma fil. Den andra är att det inte finns något tak. Det finns inget 100 att närma sig, så “toppen av indexet” är ett uttalande om ett datum snarare än om en gräns som någon har nått.
Den tredje egenskapen är den som förvandlar ett oavgjort resultat till en historia. Intervallen som publiceras bredvid varje poäng — 90 % bootstrap-intervall, konstruerade genom att återsampla varje modells egna observerade benchmarkresultat femhundra gånger — är identiska för de två modellerna på 165: 162 till 169 för Claude Sonnet 5.5 och 162 till 169 för Claude Fable 5.1. Antalet som gav upphov till dem är inte desamma. Claude Sonnet 5.5:s 165 har skattats från 11 benchmarkutvärderingar. Claude Fable 5.1:s har skattats från 20.
Varför samma intervall inte betyder samma bevis
ECI kräver minst fyra benchmarkutvärderingar innan en modell alls poängsätts, så båda siffrorna klarar miniminivån med god marginal. Men intervallet säger något om hur mycket en modells egna resultat sprider sig, inte om hur många de är — vilket är anledningen till att två modeller kan visa samma band kring samma punktskattning medan en av dem vilar på ungefär hälften av underlaget. Behandla de två 165:orna som lika säkra och du har tolkat intervallet som en korrigering för urvalsstorlek, vilket det inte är.
Asymmetrin har en praktisk konsekvens för tidpunkten. Epoch anpassar om hela modellen gemensamt över all data när nya utvärderingar anländer, så en modells siffra kan förändras utan att något hos den modellen förändras. Modellen som bär 11 observationer har större rörelseutrymme än den som bär 20, vilket gör Claude Sonnet 5.5 till den av de två som sannolikt förskjuts i nästa revidering – i endera riktningen.
Epochs egen formulering av den aktuella avläsningen är snävare än de rubriker den gav upphov till. Organisationens sammanfattning av uppdateringen inleds med att Claude Opus 5.5 tar topplaceringen på 167, knappt före GPT-6 Astra, och ägnar den andra meningen åt att Claude Sonnet 5.5 har ”i stort sett matchat” Claude Fable 5.1 på 165. I stort sett matchat är den avgörande frasen, och de publicerade intervallen är anledningen till att den är den rätta.
Där de två profilerna faktiskt skiljer sig åt

Nivå på det sammansatta måttet betyder inte nivå på delarna. Epoch publicerar en panel per benchmark på varje modellsida, och sex benchmarks förekommer på både sidan för Claude Sonnet 5.5 och sidan för Claude Fable 5.1 — vilket gör dem till de enda sex där en likvärdig jämförelse finns tillgänglig från själva indexet.
• Pussel för mysterispel — Claude Sonnet 5.5 65 % vs Claude Fable 5.1 58 %
• FrontierMath nivåer 1–3 (v2) — Claude Sonnet 5.5 89 % mot Claude Fable 5.1 90 %
• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80 % mot Claude Fable 5.1 88 %
• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100 % mot Claude Fable 5.1 100 %
• Möbelmonteringsbenchmark — Claude Sonnet 5.5 75 % mot Claude Fable 5.1 70 %
• SimpleQA Verified — Claude Sonnet 5.5 47 % mot Claude Fable 5.1 71 %
Fyra punkter i rörelse åt endera hållet på ett så här trångt sammansatt mått, och den underliggande uppdelningen är inte i närheten av symmetrisk. Claude Sonnet 5.5 ligger före där arbetet är speliknande och multimodalt – pussellösning, fysisk montering – och står jämsides i tävlingsmatematik. Claude Fable 5.1 ligger före med 8 punkter på den svåraste nivån av FrontierMath och med 24 punkter på SimpleQA Verified, den världskunskapsuppsättning där en poäng på 47 % mot 71 % är den största enskilda skillnaden i den gemensamma panelen. En köpare som väljer mellan dessa två modeller väljer inte mellan två tolkningar av samma förmåga; de väljer mellan en billigare modell som är starkare på vissa uppgifter och en dyrare som är starkare på andra uppgifter, med ett allmänförmågeindex som inte skiljer dem åt.
Epochs index säger också uttryckligen att en ledning per benchmark inte behöver synas i kompositen. Benchmarkar viktas inte efter noggrannhet, och en modell som specialiserar sig kan få lägre poäng än en rival med en annan profil även när den leder enskilda tester — dess dokumentation säger det rakt ut. Det är inte en defekt som ursäktas; det är vad en komposit över drygt femtio tester är till för.
De två oberoende instrumenten pekar åt motsatta håll

Det finns en andra oberoende mätning i omlopp, och den stämmer inte med den första om vilken av dessa två modeller som ligger före. På Artificial Analysis Intelligence Index lyder siffrorna som vår egen katalog har för de två modellerna 56 för Claude Sonnet 5.5 och 53,4 för Claude Fable 5.1, hämtade från samma revision av indexet och omfattar därför samma urval av utvärderade modeller. Tre poäng ifrån varandra, till förmån för den billigare modellen – medan Epoch läser dem som identiska.
Ingen av läsningarna är fel, och sättet att använda dem är att lägga märke till vad de är oense om. De två indexen täcker olika benchmarkuppsättningar och viktar dem olika; Epoch-sammansättningen är byggd för att klara av att benchmarks mättas, medan Artificial Analysis-indexet är en rak aggregering av en annan korg. När ett par modeller ligger så här nära varandra är valet av instrument värt mer än gapet som mäts. En läsare som vill ha det starkare av två intilliggande siffror bör titta på panelen med gemensamma enskilda benchmarks ovan i stället för på någon av huvudsiffrorna, eftersom det är den enda platsen där de två modellerna jämförs mot varandra i samma test.
Det finns ytterligare en kontextuell uppgift som compositen inte innehåller, men som Epoch gör: releasedatum. Claude Fable 5.1 ligger i dag på fjärde plats av 253 modeller som följs. Vid tidpunkten för dess egen lansering den 1 september 2026 låg den på första plats av de 247 modeller som då följdes. Dess vikter har inte förändrats. Frontlinjen rörde sig helt enkelt förbi den med sex placeringar inom en månad – vilket är formen för hela tabellen, och anledningen till att en månatlig indexavläsning är en ögonblicksbild snarare än ett slutgiltigt omdöme.
Vad skillnaden kostar, och var den billiga sidan finns

Att de ligger på samma nivå i allmän förmåga och 2,5 gånger ifrån varandra i input och 5 gånger ifrån varandra i output är hela det praktiska innehållet i den här läsningen. Båda modellerna finns i vår egen katalog — anthropic/claude-sonnet-5.5 till $2,00 per miljon input och $10,00 per miljon output med $0,20 för cacheläsningar, och anthropic/claude-fable-5.1 till $10,00 och $50,00 med $0,25 för cacheläsningar — och båda förs vidare till leverantörens eget listpris utan påslag, så en prisändring från leverantören slår igenom hos oss samma dag som den slår igenom hos dem.
Återkomsten spelar större roll än rubriken. Ta en arbetsbelastning som skickar ett prefix på 120 000 token från cachen och genererar 8 000 token utdata, och kör den en gång om dagen i en månad. På Claude Sonnet 5.5 kostar det prefixet 120 000 token till $0,20 per miljon, cirka 2,4 cent, plus 8 000 till $10 per miljon, 8 cent – ungefär 10,4 cent per körning, eller omkring $3,12 under trettio dagar. På Claude Fable 5.1 kostar samma prefix 120 000 till $0,25, 3 cent, plus 8 000 till $50, 40 cent – ungefär 43 cent per körning, eller $12,90 under månaden. Båda modellerna hanterar samma fönster på 1 miljon token med upp till 128 000 token i utdata, så skillnaden ligger i priskortet snarare än i taket.
Som motvikt till detta visar de sex gemensamma benchmarkarna åt vilket håll de extra pengarna köper något. Ett team vars arbete liknar FrontierMath Tier 4 eller öppen faktaminnesåtergivning köper en verklig skillnad på 8–24 punkter i dessa tester genom att betala fyra gånger så mycket; ett team vars arbete liknar pussellösning eller multimodal sammansättning köper 5–7 punkter åt andra hållet medan de betalar det lägre beloppet. På en och samma plattform är dessa inte två upphandlingsbeslut. Båda modellerna ligger bakom en och samma API-nyckel bland fler än 200 modeller, så att jämföra dem på din egen trafik är en konfigurationsändring snarare än ett andra avtal, och där båda routas finns automatisk failover under — vilket spelar roll när två oberoende instrument är oense om vilken som ligger före.
Vad skulle förändra den här läsningen?
Tre saker skulle förändra det, och bara en av dem involverar någon av modellerna.
Det första är fler benchmarkutvärderingar. Claude Sonnet 5.5 kom in i indexet för fyra dagar sedan med 11 bakom sig; varje ytterligare utvärdering gör dess intervall snävare och kan flytta dess punktskattning, och en gemensam omtillpassning innebär att rörelsen inte är begränsad till den nya raden.
Den andra är ankomsten av ännu en frontier-modell. De fyra översta raderna spänner över fyra punkter, med två lika resultat inom det spannet, så en enda välutvärderad nykomling hamnar i klustret i stället för under det — och de publicerade intervallen, som överlappar för alla fyra, innebär att ordningen mellan dem är ett tiebreak snarare än en mätning.
Det tredje är priset på modellerna själva, vilket inget index följer. Gapet som den här artikeln hänger på är ett prislistegap: $2 och $10 mot $10 och $50 i dag. En ändring på endera kortet ändrar beslutet utan att ändra en enda kapacitetspoäng.
Den försvarbara sammanfattningen är den snäva. I Epoch AI:s sammansatta mått, i en fil som uppdaterades den 1 oktober 2026, är Claude Sonnet 5.5 och Claude Fable 5.1 samma siffra – 165, delar tredjeplatsen, med identiska publicerade intervall som vilar på olika mycket underlag. I det separata instrumentet från Artificial Analysis skiljer sig samma två modeller tre punkter åt. På de sex benchmarks där indexet jämför dem direkt växlar de ledning beroende på domän i stället för att ligga på samma nivå. Och på prislistan är de inte alls nära varandra. Det enda den här läsningen inte kommer att stödja är meningen som den med störst sannolikhet kommer att citeras som: att modellerna är likvärdiga.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
