Generierte Titelkarte für einen Artikel über den Epoch Capabilities Index, mit der Schlagzeile 'Claude Opus 5.5 führt den Epoch Capabilities Index an' über einer hellblauen Monospace-Zeile mit dem Text '167.35 vs 166.51' und einer grauen Unterzeile mit dem Text 'Die zwei Besten in einem Composite aus 50+ Benchmarks', mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Claude Opus 5.5 führt den Epoch Capabilities Index mit 0,84 Punkten Vorsprung an

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die Zahl ist 0,84. Claude Opus 5.5 liegt mit 167,35 auf dem Epoch Capabilities Index, Stand der Datei, die wir am 2. Oktober 2026 gelesen haben, während GPT-6 Astra bei 166,51 liegt — ein Abstand von weniger als einem Punkt auf einer Skala, auf der sich die veröffentlichten 95%-Intervalle der beiden Modelle fast vollständig überschneiden, 164,0 bis 172,0 für Opus 5.5 gegenüber 163,14 bis 171,05 für Astra. Darunter Claude Sonnet 5.5 kam auf 165,2 und Claude Fable 5.1 auf 164,82, sodass die vier obersten Einträge eines unabhängigen Komposits aus mehr als fünfzig Benchmarks um 2,53 Punkte auseinanderliegen und drei von ihnen den Namen desselben Anbieters tragen. Die Reihenfolge ist in dem Sinne real, dass die Punktschätzungen geordnet sind. Sie ist nicht in dem Sinne real, dass ein Vorsprung von 0,84 Punkten seine eigenen Fehlerbalken übersteht, und alles, was es über diese Rangliste zu sagen gibt, folgt daraus, beide Tatsachen gleichzeitig festzuhalten.

Was der Index ist und was 0,84 eines Punktes nicht ist

Der Epoch Capabilities Index ist keine Anbieter-Rangliste. Er wird von Epoch AI, einer unabhängigen Forschungsorganisation, als ein zusammengesetzter Index erstellt, der Scores aus mehr als fünfzig verschiedenen Benchmarks zu einer allgemeinen Fähigkeitsskala zusammenfügt und dabei die relative Schwierigkeit jedes Benchmarks aus den Modellen ableitet, die zufällig bei mehreren von ihnen zugleich auftauchen. Die Methodik wird in einem Paper dargelegt, das mit Forschenden des AGI Safety & Alignment-Teams von Google DeepMind verfasst und von DeepMind finanziert wurde, doch Epoch stellt unmissverständlich klar, dass der Index sein eigenes Produkt ist und dass es die vollständigen Rechte daran hält — eine Unterscheidung, die man beibehalten sollte, wenn die Finanzierungsquelle und der Herausgeber eines Scores nicht dieselbe Partei sind. Der Code ist öffentlich.

Zwei Eigenschaften der Skala sind wichtiger als die Schlagzeile. Die erste ist, dass ECI bewusst verankert und nicht absolut ist: Rohwerte werden neu skaliert, sodass Claude 3.5 Sonnet bei 130 und GPT-5 bei 150 landet, was bedeutet, dass eine Zahl in diesem Index nur im Verhältnis zu einer anderen Zahl aus derselben Datei aussagekräftig ist, nie für sich allein. Die zweite ist, dass der Index keine Obergrenze hat. Es gibt keine 100, der man sich nähern könnte, also ist „Spitze des Index“ eine Aussage über ein Datum, nicht über eine Grenze, die jemand erreicht hat.

Deshalb ist die ehrliche Lesart von 167,35 gegenüber 166,51 nicht „Claude Opus 5.5 ist das leistungsfähigste Modell der Welt.“ Sie ist enger und weniger zitierfähig: Nach Epochs Modellierung der am 2. Oktober 2026 verfügbaren Evidenz sind die beiden Modelle an der Spitze nicht voneinander zu unterscheiden, und die Rangfolge zwischen ihnen ist eher ein Tiebreak als eine Messung. Die veröffentlichten Intervalle sagen das direkt – 164,0 bis 172,0 und 163,14 bis 171,05 haben den Großteil ihres Bereichs gemeinsam. Wer 0,84 als Verdikt zitiert, zitiert ein Rundungsartefakt.

Der Anthropic-Block und die Größe eines Releases

Das aussagekräftigere Merkmal der Tabelle ist nicht, wer an erster Stelle steht. Es sind die dritte und vierte Zeile. Claude Sonnet 5.5, veröffentlicht am 28. September und mit 165,2 Punkten, liegt 0,38 Punkte über Claude Fable 5.1, veröffentlicht am 1. September mit 164,82 – nah genug, dass beide in der Praxis dieselbe Position einnehmen, und nah genug, dass das Paar nur 2,15 Punkte unter der Spitze der Rangliste liegt. Sonnet ist das Mittelklasseprodukt in Anthropics Produktlinie, und Fable ist das Modell, auf das das Unternehmen historisch für allgemeine Reasoning-Arbeit verwiesen hat; dass beide nun die Frontier von direkt darunter einrahmen, ist die substanzielle Veränderung bei dieser Aktualisierung, mehr als die Identität des Spitzenreiters.

Auch bei Anthropic selbst ist der Generationssprung sichtbar. Claude Opus 5.5 ist der Nachfolger von Claude Opus 5, den Epoch mit 162,94 bewertet, mit einem Intervall von 160,2 bis 166,7. Das ist eine Verbesserung um 4,41 Punkte über rund zwei Monate, von einer Veröffentlichung am 24. Juli zu einer am 22. September – ein größerer Sprung als die 0,84 Punkte, die heute den ersten und zweiten Platz trennen. So gelesen ist die interessante Größe in dieser Tabelle die Steigung innerhalb der Linie eines einzelnen Anbieters, nicht der Abstand zwischen zwei Anbietern an der Spitze.

Wo die Grenze bei Open-Weights verläuft

Epoch trennt Modelle nach Zugänglichkeit, wodurch die Open-Weights-Grenze lesbar wird, ohne raten zu müssen. Der beste Open-Weights-Eintrag ist Kimi K3 bei 157,61, datiert auf den 16. Juli und als nicht-kommerziell gekennzeichnet. Dahinter liegen DeepSeek V4 Pro 0813 bei 155,38 und DeepSeek V4.1 Flash bei 155,0, beide uneingeschränkt, dann GLM-5.3-Flash bei 151,94 und GLM-5.2 bei 151,78. Das nächstgelegene offene Modell zur Spitze liegt somit 9,74 Punkte zurück – eine Lücke, die achtzehnmal breiter ist als die zwischen dem ersten und zweiten Platz und breit genug, dass sich die Intervalle nicht einmal annähern.

Diese Asymmetrie ist der einzige beständige Befund in der Tabelle. Die geschlossene Frontier ist ein Gedränge innerhalb von drei Punkten; der Abstand von der geschlossenen Frontier zu den besten herunterladbaren Gewichten ist um eine Größenordnung größer. Ein zusammengesetzter Index, mit dem man über Benchmark-Generationen hinweg vergleichen kann, ist genau das Werkzeug, um das zu bemerken, weil er im Juli und im September dasselbe sagen kann, anstatt zu melden, dass ein saturierender Benchmark verstummt ist.

Einige der benachbarten Zeilen sind es wert, zum Kontext angepinnt zu werden, da sie die Modelle sind, gegen die Leser tatsächlich Opus 5.5 abwägen:

• Claude Sonnet 5 — 156,34, veröffentlicht am 30. Juni, Intervall 153,61 bis 158,81

• Grok 4.6 — 156,61, veröffentlicht am 12. August, Intervall 154,66 bis 158,93

• Gemini 3.8 Flash — 156,93, veröffentlicht am 2. September, Intervall 154,64 bis 160,42

• Muse Spark 1.3 — 156,86, veröffentlicht am 2. September, Intervall 154,73 bis 159,56

• GPT-5.6 Sol — 161.8, veröffentlicht am 9. Juli, Intervall 159.26 bis 165.26

Eine Indexposition ist keine Rechnung.

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Hier hört die Bestenliste auf, die ganze Geschichte zu sein, denn die beiden Modelle an der Spitze kosten beileibe nicht dasselbe. Aus unserem eigenen Katalog, der beide zum Listenpreis des Anbieters ohne Aufschlag führt, Claude Opus 5.5 zu $4,00/$20,00 mit $0,20 für Cache-Lesevorgänge und GPT-6 Astra zu $10,00/$50,00 mit $1,00 für Cache-Lesevorgänge liegen in beiden Richtungen der Preisliste um den Faktor 2,5 auseinander. Astra steigt zudem oberhalb von 272.000 Prompt-Tokens an, wo der Input auf $20,00 und der Output auf $75,00 geht; Opus 5.5 hält $4,00/$20,00 konstant über sein gesamtes Fenster von 1 Mio. Tokens. Beide liefern 128.000 Output-Tokens.

Rechnen Sie einmal nach, was eine Long-Context-Workload tatsächlich kostet – ein Präfix mit 180.000 Token, aus dem Cache bedient, 5.000 generierte Token. Bei Opus 5.5 sind das 180.000 Token zu 0,20 $ pro Million, also etwa 3,6 Cent, plus 5.000 zu 20 $ pro Million, also 10 Cent: rund 13,6 Cent. Bei GPT-6 Astra sind es 180.000 zu 1,00 $, also 18 Cent, plus 5.000 zu 50 $, also 25 Cent: rund 43 Cent. Ein Vorsprung von 0,84 Punkten und eine Kostenlücke um den Faktor 3,2 sind nicht dieselbe Art von Fakt, und eine Beschaffungsentscheidung, die nur den ersten davon abwägt, hat die kleinere Zahl abgewogen.

Fable 5.1 verdeutlicht den Punkt von der anderen Seite der Preisliste desselben Anbieters: Bei $10.00/$50.00 ist es genau wie Astra bepreist, und es erreicht 164,82 – 2,53 Punkte weniger als Opus 5.5 für dasselbe Geld. Der Index hält Anthropics drei Frontier-Einträge innerhalb von 2,53 Punkten zueinander, und die Preisliste des Unternehmens trennt sie um den Faktor 2,5 – was die Wahl, vor der ein Käufer steht, weit besser beschreibt als jedes einzelne Ranking.

Wenn du über eine Zahl streiten willst, dann streite auf deinem eigenen Traffic.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

Der Grund, warum dieser Index überhaupt lesenswert ist, liegt darin, dass er von jemand anderem als den Anbietern gemessen wird – doch die Struktur des zusammengesetzten Index selbst legt die Bedingungen der Debatte fest. Epochs Kalibrierung, seine Schwierigkeitsschätzungen und sein Umgang mit Modellen, die Benchmarks überspringen, sind alle der Zahl in der Tabelle vorgelagert, und nichts davon kann ein Leser aus einem Screenshot rekonstruieren. Dasselbe gilt für den Vorzeige-Benchmark jedes Anbieters, weshalb der nützliche Schritt nicht darin besteht, zwischen ihnen Partei zu ergreifen, sondern sie anhand von Traffic zu vergleichen, den Sie kontrollieren.

Beide dieser Modelle sind über einen einzigen API-Schlüssel auf OrcaRouter erreichbar, der die Listenpreise der Anbieter mit 0 % Aufschlag weitergibt: Claude Opus 5.5 für 4,00 $/20,00 $ mit 0,20 $ für Cache-Lesevorgänge und GPT-6 Astra für 10,00 $/50,00 $, wobei die Stufe oberhalb von 272K genau so angewendet wird, wie der Anbieter sie festlegt. Dasselbe Prompt-Set an beide zu senden ist eher eine Konfigurationsänderung als ein zweiter Vertrag, und wo beide geroutet werden, automatisches Failover darunterliegt, was bei einer Entscheidung so nah an der Rauschgrenze wichtig ist. Die Rangliste kann Ihnen sagen, dass die beiden Modelle nicht unterscheidbar sind. Nur Ihre eigene Eval kann Ihnen sagen, welches auf Ihrer Arbeit nicht unterscheidbar ist.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

Was würde diese Zahl nächsten Monat bewegen

Epochs Datei ist lebendig, und drei Dinge würden die Lesart schnell verändern. Das erste ist jede neue Bewertung eines Frontier-Modells, die es in die Top Vier schafft, denn eine einzelne zusätzliche Benchmark-Beobachtung verschiebt einen zusammengesetzten Wert stärker, wenn das Feld so eng beieinanderliegt, als wenn es einen klaren Spitzenreiter gibt. Das zweite ist die Drift der Konfidenzintervalle – die jüngsten Einträge weisen die breitesten auf, weil sie an den wenigsten überlappenden Benchmarks bewertet wurden, sodass die Veröffentlichungen vom September die Zeilen sind, die sich am wahrscheinlichsten bewegen, und die vom Juli am wenigsten. Das dritte ist ein Benchmark, der die Sättigung erreicht, und zwar genau der Fehlerfall, den zu überstehen der Index gebaut wurde: Wenn eine Komponente nicht mehr unterscheidet, gewichtet Epoch die Zusammensetzung neu, statt zuzulassen, dass der Vorsprung eines Modells mit dem Test verpufft.

Vorerst ist die vertretbare Zusammenfassung die eng gefasste. Claude Opus 5.5 hält mit 167,35 den Spitzenplatz im Epoch Capabilities Index aufgrund eines Vorsprungs von 0,84 Punkten, der von seinem eigenen Konfidenzintervall nicht gedeckt ist, Claude Sonnet 5.5 ist aus dem Mittelfeld derselben Produktlinie bis auf 2,15 Punkte an die Spitze herangeklettert, und das Open-Weights-Feld liegt mehr als neun Punkte hinter ihnen allen zurück. Wer führt, ist ein Münzwurf zwischen zwei Anbietern. Die Vier-Punkte-Lücke beim Preis zwischen ihnen ist es nicht.

In diesem Artikel verglichen4

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert