Eine generierte Titelkarte mit der Überschrift „Level bei 165“, dem Untertitel „Epoch Capabilities Index, Datei vom 1. Oktober 2026“, drei Statistik-Karten mit 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) und 11 vs. 20 (Benchmark-Evaluierungen hinter jeder Zahl) sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Claude Sonnet 5.5 zieht mit Claude Fable 5.1 im Epoch Capabilities Index gleich

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein Gleichstand an der Spitze einer Rangliste ist meist das Uninteressanteste daran. Dieser hier ist die Ausnahme, denn die beiden Modelle, die an der Spitze gleichauf liegen, kosten nicht dasselbe Geld. In der am 1. Oktober 2026 aktualisierten Datei des Epoch Capabilities Index stehen Claude Sonnet 5.5 und Claude Fable 5.1 beide bei 165 — den Zeilen drei und vier von 253 erfassten Modellen — zwei Punkte hinter Claude Opus 5.5 und GPT-6 Astra, die selbst bei 167 gleichauf liegen, und zwei Punkte vor Claude Opus 5 mit 163. Claude Sonnet 5.5 erschien am 28. September 2026 für 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output-Tokens. Claude Fable 5.1 erschien am 1. September für 10 und 50 Dollar. Eine einzige Zahl besagt, dass die beiden in ihrer allgemeinen Leistungsfähigkeit austauschbar sind. Der fünffache Output-Preis besagt, dass sie es nicht sind. Beides stimmt, und der Grund, warum beides zugleich stimmt, ist der Teil der Tabelle, den niemand zitiert.

Was der Index tatsächlich ist und wer ihn misst

Das ECI ist keine Anbieter-Rangliste. Es wird von Epoch AI, einer unabhängigen Forschungsorganisation, als ein zusammengesetztes Maß erstellt, das Ergebnisse aus mehr als fünfzig verschiedenen Benchmarks zu einer allgemeinen Fähigkeitsskala zusammenfügt, wobei es die relative Schwierigkeit jedes Benchmarks aus den Modellen ableitet, die zufällig in mehreren davon gleichzeitig auftauchen. Die Methodik ist in einem Paper mit dem Titel „A Rosetta Stone for AI Benchmarks“ dargelegt, das von Google DeepMind finanziert und mit Forschenden aus seinem AGI Safety & Alignment-Team verfasst wurde – doch Epoch stellt unmissverständlich klar, dass der Index ihr eigenes Produkt ist und dass sie die vollen Rechte daran hält, und der Anpassungscode ist öffentlich. Dieser Unterschied ist wichtig, wenn der Geldgeber der Forschung und der Herausgeber des Scores nicht dieselbe Partei sind.

Zwei Eigenschaften der Skala bestimmen, wie eine Zahl auf ihr gelesen werden darf. Die erste ist, dass ECI verankert und nicht absolut ist: Rohwerte werden neu skaliert, sodass Claude 3.5 Sonnet bei 130 und GPT-5 bei 150 landet, was bedeutet, dass eine Zahl nur im Vergleich mit einer anderen Zahl aus derselben Datei etwas aussagt. Die zweite ist, dass es keine Obergrenze gibt. Es gibt keine 100, der man sich nähern könnte, „Spitze des Index“ ist also eine Aussage über ein Datum und nicht über eine Grenze, die irgendjemand erreicht hat.

Die dritte Eigenschaft ist diejenige, die aus einem Gleichstand eine Geschichte macht. Die neben jedem Ergebnis veröffentlichten Intervalle – 90%-Bootstrap-Intervalle, die durch fünfhundertmaliges Resampling der jeweils eigenen beobachteten Benchmark-Ergebnisse jedes Modells konstruiert wurden – sind für die beiden Modelle bei 165 identisch: 162 bis 169 für Claude Sonnet 5.5 und 162 bis 169 für Claude Fable 5.1. Die Anzahlen, die sie erzeugt haben, sind es nicht. Der Wert 165 von Claude Sonnet 5.5 ist aus 11 Benchmark-Evaluierungen geschätzt. Der von Claude Fable 5.1 aus 20.

Warum dasselbe Intervall nicht dieselbe Evidenz bedeutet

Das ECI benötigt mindestens vier Benchmark-Evaluierungen, bevor ein Modell überhaupt bewertet wird, sodass beide Werte die Untergrenze bequem überschreiten. Doch das Intervall sagt etwas darüber aus, wie stark die eigenen Ergebnisse eines Modells streuen, nicht darüber, wie viele es sind – weshalb zwei Modelle dasselbe Band um dieselbe Punktschätzung ausgeben können, während eines von ihnen sich auf ungefähr die Hälfte der Evidenz stützt. Behandelt man die beiden 165er als gleichermaßen belastbar, dann hat man das Intervall als eine Stichprobengrößenkorrektur gelesen, die es nicht ist.

Die Asymmetrie hat eine praktische Konsequenz für das Timing. Epoch passt das gesamte Modell bei jeder neuen Evaluierung gemeinsam über alle Daten neu an, sodass sich der Wert eines Modells verschieben kann, ohne dass sich irgendetwas an diesem Modell ändert. Das Modell mit 11 Beobachtungen hat mehr Spielraum für Veränderungen als das mit 20, was Claude Sonnet 5.5 von den beiden zum wahrscheinlicheren Kandidaten für eine Verschiebung in der nächsten Revision macht – in beide Richtungen.

Epochs eigene Einordnung der aktuellen Auswertung ist enger gefasst als die Schlagzeilen, die sie hervorgebracht hat. Die Zusammenfassung des Updates durch die Organisation führt mit Claude Opus 5.5, der mit 167 den Spitzenplatz knapp vor GPT-6 Astra belegt, und widmet den zweiten Satz der Tatsache, dass Claude Sonnet 5.5 mit 165 „in etwa gleichauf“ mit Claude Fable 5.1 liegt. „In etwa gleichauf“ ist die entscheidende Formulierung, und die veröffentlichten Intervalle sind der Grund, warum sie die richtige ist.

Wo die beiden Profile tatsächlich auseinandergehen

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Ein Niveau beim Composite bedeutet nicht ein Niveau bei den Einzelkomponenten. Epoch veröffentlicht auf jeder Modellseite ein Panel pro Benchmark, und sechs Benchmarks erscheinen sowohl auf der Seite von Claude Sonnet 5.5 als auch auf der Seite von Claude Fable 5.1 — wodurch diese die einzigen sechs sind, für die sich aus dem Index selbst ein direkter Vergleich anstellen lässt.

• Mystery-Spiel-Rätsel — Claude Sonnet 5.5 65 % vs. Claude Fable 5.1 58 %

• FrontierMath-Stufen 1–3 (v2) — Claude Sonnet 5.5 89 % vs. Claude Fable 5.1 90 %

• FrontierMath Stufe 4 (v2) — Claude Sonnet 5.5 80 % vs. Claude Fable 5.1 88 %

• OTIS Mock AIME 2024–2025 — Claude Sonnet 5.5 100 % gegen Claude Fable 5.1 100 %

• Möbelmontage-Benchmark — Claude Sonnet 5.5 75 % vs. Claude Fable 5.1 70 %

• SimpleQA Verified — Claude Sonnet 5.5 47 % vs. Claude Fable 5.1 71 %

Vier Punkte Bewegung in die eine oder andere Richtung bei einem so dicht gedrängten Gesamtwert, und die dahinterliegende Aufteilung ist nicht annähernd symmetrisch. Claude Sonnet 5.5 liegt vorn bei Arbeiten, die spielartig und multimodal sind – Puzzlelösen, physischer Zusammenbau –, und gleichauf bei Wettbewerbsmathematik. Claude Fable 5.1 liegt um 8 Punkte auf der härtesten Stufe von FrontierMath vorn und um 24 Punkte bei SimpleQA Verified, dem Weltwissens-Datensatz, in dem ein Ergebnis von 47 % gegenüber 71 % die größte einzelne Lücke im gemeinsamen Panel ist. Wer sich zwischen diesen beiden Modellen entscheidet, entscheidet nicht zwischen zwei Lesarten derselben Fähigkeit; er entscheidet zwischen einem günstigeren Modell, das bei manchen Arbeiten stärker ist, und einem teureren, das bei anderen Arbeiten stärker ist, mit einem Allgemeinfähigkeits-Index, der sich weigert, sie auseinanderzuhalten.

Der Index von Epoch macht zudem ausdrücklich klar, dass sich ein Vorsprung bei einem einzelnen Benchmark nicht im Gesamtindex niederschlagen muss. Benchmarks werden nicht nach Genauigkeit gewichtet, und ein Modell, das sich spezialisiert, kann hinter einem anders aufgestellten Rivalen zurückliegen, obwohl es bei einzelnen Tests führt – das sagt die Dokumentation direkt. Das ist kein Defekt, der entschuldigt wird; genau dafür ist ein Gesamtindex über gut fünfzig Tests da.

Die beiden unabhängigen Instrumente zeigen in entgegengesetzte Richtungen.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

Es gibt eine zweite unabhängige Messung im Umlauf, und sie stimmt nicht mit der ersten darin überein, welches dieser beiden Modelle vorn liegt. Im Artificial Analysis Intelligence Index lauten die Zahlen, die unser eigener Katalog für die beiden Modelle führt, 56 für Claude Sonnet 5.5 und 53,4 für Claude Fable 5.1; sie stammen aus derselben Revision dieses Index und beruhen daher auf derselben Stichprobe evaluierter Modelle. Drei Punkte Abstand, zugunsten des günstigeren Modells – während Epoch sie als identisch liest.

Keine der beiden Lesarten ist falsch, und sie zu nutzen heißt, darauf zu achten, worüber sie sich uneinig sind. Die beiden Indizes decken unterschiedliche Benchmark-Sets ab und gewichten diese unterschiedlich; der Epoch-Composite ist darauf ausgelegt, eine Sättigung der Benchmarks zu überstehen, während der Artificial Analysis Index eine reine Aggregation eines anderen Bündels ist. Wenn zwei Modelle so dicht beieinanderliegen, wiegt die Wahl des Instruments mehr als der gemessene Abstand. Wer die stärkere von zwei benachbarten Zahlen sucht, sollte eher auf das Panel der gemeinsamen Einzel-Benchmarks oben schauen als auf eine der beiden Schlagzeilenzahlen, denn nur dort werden die beiden Modelle im selben Test direkt miteinander verglichen.

Es gibt noch ein Stück Kontext, das der Composite nicht mitführt, Epoch aber schon: das Veröffentlichungsdatum. Claude Fable 5.1 belegt heute den vierten Platz unter 253 erfassten Modellen. Zum Zeitpunkt seiner eigenen Veröffentlichung am 1. September 2026 belegte es den ersten Platz unter den 247 damals erfassten Modellen. Seine Gewichte haben sich nicht verändert. Die Frontier ist einfach innerhalb eines Monats um sechs Plätze an ihm vorbeigezogen — was die Gestalt der ganzen Tabelle ist und der Grund dafür, dass eine monatliche Indexablesung eher eine Momentaufnahme als ein Urteil ist.

Was der Unterschied kostet und wo die günstige Seite liegt

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Gleichstand bei der allgemeinen Leistungsfähigkeit und ein Abstand um den Faktor 2,5 beim Input sowie um den Faktor 5 beim Output – das ist der gesamte praktische Gehalt dieser Auswertung. Beide Modelle führen wir in unserem eigenen Katalog – anthropic/claude-sonnet-5.5 für 2,00 $ pro Million Input und 10,00 $ pro Million Output mit 0,20 $ für Cache-Reads, und anthropic/claude-fable-5.1 für 10,00 $ und 50,00 $ mit 0,25 $ für Cache-Reads – und beide werden zum eigenen Listenpreis des Anbieters ohne Aufschlag durchgereicht, sodass eine Preisänderung eines Anbieters bei uns am selben Tag ankommt, an dem sie bei ihm ankommt.

Die Wiederholung ist wichtiger als die Schlagzeile. Nehmen Sie eine Arbeitslast, die ein Präfix mit 120.000 Token aus dem Cache sendet und 8.000 Token Ausgabe generiert, und lassen Sie sie einen Monat lang einmal täglich laufen. Bei Claude Sonnet 5.5 kostet dieses Präfix 120.000 Token zu 0,20 $ pro Million, etwa 2,4 Cent, plus 8.000 zu 10 $ pro Million, 8 Cent – rund 10,4 Cent pro Lauf oder etwa 3,12 $ über dreißig Tage. Bei Claude Fable 5.1 kostet dasselbe Präfix 120.000 zu 0,25 $, 3 Cent, plus 8.000 zu 50 $, 40 Cent – etwa 43 Cent pro Lauf oder 12,90 $ über den Monat. Beide Modelle bieten dasselbe 1M-Token-Fenster mit bis zu 128K Ausgabe, der Unterschied liegt also am Tarif und nicht an der Obergrenze.

Demgegenüber sagen die sechs gemeinsamen Benchmarks, in welche Richtung das zusätzliche Geld etwas bringt. Ein Team, dessen Arbeit nach FrontierMath Tier 4 oder offenem Faktenabruf aussieht, erkauft sich bei diesen Tests einen echten 8- bis 24-Punkte-Abstand, indem es viermal mehr zahlt; ein Team, dessen Arbeit nach Rätsellösen oder multimodaler Zusammenstellung aussieht, erkauft sich 5 bis 7 Punkte in die andere Richtung, während es den kleineren Betrag zahlt. Auf einer einzigen Plattform sind das keine zwei Beschaffungsentscheidungen. Beide Modelle stehen hinter einem API-Schlüssel unter mehr als 200 Modellen, sodass der Vergleich der beiden an deinem eigenen Traffic eine Konfigurationsänderung statt eines zweiten Vertrags ist, und wo beide geroutet werden, liegt darunter ein automatisches Failover – was wichtig ist, wenn zwei unabhängige Instrumente sich darüber uneinig sind, welches vorne liegt.

Was würde diesen Wert bewegen?

Drei Dinge würden es ändern, und nur eines davon betrifft eines der beiden Modelle.

Das Erste sind mehr Benchmark-Evaluierungen. Claude Sonnet 5.5 ist vor vier Tagen mit 11 dahinter in den Index eingetreten; jede zusätzliche Evaluierung verengt sein Intervall und kann seine Punktschätzung verschieben, und eine gemeinsame Neuanpassung bedeutet, dass die Verschiebung nicht auf die neue Zeile beschränkt bleibt.

Der zweite Punkt ist die Ankunft eines weiteren Frontier-Modells. Die vier obersten Zeilen umfassen vier Punkte, wobei es innerhalb dieser Spanne zwei Gleichstände gibt, sodass ein einzelner gut bewerteter Neuling innerhalb des Clusters landet statt darunter – und die veröffentlichten Intervalle, die sich über alle vier überschneiden, bedeuten, dass die Reihenfolge unter ihnen ein Tiebreak und keine Messung ist.

Der dritte Punkt ist der Preis der Modelle selbst, den kein Index erfasst. Die Lücke, auf die es in diesem Beitrag ankommt, ist eine Tarifkarten-Lücke: 2 $ und 10 $ gegenüber 10 $ und 50 $ heute. Eine Änderung auf einer der beiden Karten verschiebt die Entscheidung, ohne einen einzigen Fähigkeitswert zu verändern.

Die vertretbare Zusammenfassung ist die eng gefasste. Auf dem Composite von Epoch AI stehen in einer am 1. Oktober 2026 aktualisierten Datei Claude Sonnet 5.5 und Claude Fable 5.1 bei derselben Zahl – 165 –, gleichauf auf dem dritten Platz, wobei identische veröffentlichte Intervalle auf unterschiedlich viel Evidenz beruhen. Auf dem separaten Messinstrument von Artificial Analysis liegen dieselben zwei Modelle drei Punkte auseinander. Bei den sechs Benchmarks, auf denen der Index sie direkt vergleicht, wechseln sie sich je nach Bereich mit der Führung ab, statt gleichauf zu liegen. Und auf der Preisliste sind sie alles andere als dicht beieinander. Das Einzige, was diese Lesart nicht stützen wird, ist der Satz, als der sie am ehesten zitiert werden dürfte: dass die Modelle gleichwertig sind.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert