Eine generierte Titelkarte für Claude Opus 5.5 vs. Claude Fable 5.1, mit dem Untertitel „Das günstigere Modell hat den unabhängigen Index gewonnen“, mit dem echten OrcaRouter-Logo unten rechts eingefügt und einer Fußzeile mit dem Text „Index laut Artificial Analysis bei maximalem Aufwand; Preise laut Anthropic.“
Guides & Insights

Claude Opus 5.5 vs. Claude Fable 5.1: Das günstigere Modell gewann den Independent Index

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ant​hropic verkauft jetzt zwei Modelle an der Spitze seiner Produktpalette, und das Modell, das zweieinhalbmal so viel kostet, ist nicht das an der Tabellenspitze. Claude Opus 5.5, veröffentlicht am 22. September 2026 zu 4 US-Dollar pro Million Eingabe-Tokens und 20 US-Dollar pro Million Ausgabe-Tokens, erreicht 58 Punkte im Artificial Analysis Intelligence Index. Claude Fable 5.1, das seit dem 1. September mit 10 US-Dollar für Eingabe und 50 US-Dollar für Ausgabe die Flaggschiff-Position hält, erreicht 53 Punkte. Beide Zahlen stammen vom selben Evaluator, beide wurden in derselben Konfigurationsfamilie gemessen, und die Lücke verläuft entgegengesetzt zu den Preisschildern. Das ist die Tatsache, von der dieser Vergleich ausgehen muss, denn fast jeder Artikel zur Markteinführung aus der vergangenen Woche stellt Opus 5.5 als die Rabattversion von Fable 5.1 dar – ein günstigeres Modell, das bei den meisten Aufgaben mit dem teuren „mithält“. Die unabhängige Zahl sagt, dass das Rabattmodell vorne liegt.

Ob das ändern sollte, was man einsetzt, ist eine andere Frage, und die Antwort hängt weniger von der Fünf-Punkte-Lücke als von zwei Einstellungen ab, die niemand in eine Schlagzeile setzt: auf welches Aufwandsniveau jedes Modell standardmäßig eingestellt ist und welches sich schnell machen lässt.

Die unabhängigen Zahlen und die eine Sache, die sie gemeinsam haben

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis veröffentlicht pro Modell eine Konfiguration, und bei diesen beiden ist sie mit „Adaptives Reasoning, maximaler Aufwand, Standard-Fallback“ bezeichnet. Gleiches Label, gleicher Evaluator, gleicher Durchlauf – was dies zum saubersten direkten Vergleich macht, den jedes der beiden Modelle hat:

• Intelligenz-Index — Claude Opus 5.5 58, Platz #1 von 210 vs. Claude Fable 5.1 53, Platz #4

Ausgabegeschwindigkeit — Claude Fable 5.1 65,8 Token/Sek., unter dem Board-Median von 71,0, gegenüber Claude Opus 5.5, das noch nicht im Board veröffentlicht ist

• Zeit bis zum ersten Token — Claude Fable 5.1: 274,43 s gegenüber einem Board-Median von 3,83 s; Claude Opus 5.5 noch nicht veröffentlicht

• Ausführlichkeit im Index — Claude Opus 5.5 generierte 260 Mio. Output-Tokens, gegenüber einem Median von 88 Mio. über alle hinweg

• Preis — Claude Opus 5.5 $4,00 / $20,00 pro Million vs. Claude Fable 5.1 $10,00 / $50,00

Zwei dieser Zeilen muss man lesen statt zitieren. Die erste ist das Label „Max Effort“: Keine der Modellwertungen spiegelt die Standardeinstellung wider, in der das Modell ausgeliefert wird, und die beiden Standardeinstellungen sind nicht dieselben – mehr dazu unten. Die zweite ist die Zeile zur Ausführlichkeit, die dem zuwiderläuft, wie Opus 5.5 verkauft wurde. Die Effizienz-Erzählung von Anthropic lautet, dass das Modell mit weniger Tokens dieselbe Antwort erreicht, und das Launch-Material zitiert Partner, die von einem Drittel bis zur Hälfte weniger Ausgabe-Tokens berichten. Im Index, gemessen statt zitiert, gab Opus 5.5 260 Mio. Tokens aus, gegenüber einem Board-Median von 88 Mio. – etwa dreimal gesprächiger als das typische Modell, mit dem es verglichen wird. Beides kann wahr sein: Es mag weniger Tokens als Claude Opus 5 verwenden und dennoch in absoluten Zahlen ein ausführliches Modell sein. Aber wenn Sie von der Zeile „weniger Tokens“ ausgegangen sind und nicht von Ihrer eigenen Rechnung, dann ist die unabhängige Messung diejenige, die Sie prüfen sollten.

Was die zusätzlichen 6 $ pro Million bringen

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

Lässt man die Benchmarks weg, bleibt als Unterschied eine Preisliste. Alles hier stammt von der veröffentlichten Preisseite von Anthropic und ist heute überprüfbar:

• Eingabe — 4,00 $ pro Million bei Opus 5.5 gegenüber 10,00 $ bei Fable 5.1

• Ausgabe — 20,00 $ pro Million vs. 50,00 $

• Cache-Lesevorgang — 0,20 $ pro Million bei Opus 5.5 vs. 0,25 $ bei Fable 5.1

• Cache-Multiplikator — Opus 5.5 berechnet Cache-Treffer mit dem 0,05-Fachen der Basiseingabe; Fable 5.1 berechnet sie mit dem 0,025-Fachen – ein besserer Multiplikator auf einer höheren Basis

• Cache-Schreibvorgang — 5 $ pro Million für ein 5-Minuten-Fenster und 8 $ für eine Stunde bei Opus 5.5, gegenüber 12,50 $ und 20 $ bei Fable 5.1

• Batch-API — Opus 5.5 halbiert sich auf $2.00 / $10.00; Fable 5.1 halbiert sich auf $5.00 / $25.00

• Schnellmodus — Opus 5.5 unterstützt ihn für $8.00 / $40.00 bei bis zu etwa 2,5-facher Ausgabegeschwindigkeit; Fable 5.1 unterstützt den Schnellmodus überhaupt nicht

Die Cache-Zeile ist diejenige, die man zweimal ansehen sollte, denn die beiden Modelle kehren das übliche Muster um. Fable 5.1 hat den aggressiveren Multiplikator – 2,5 % des Basis-Inputs gegenüber 5 % bei Opus 5.5 –, doch weil seine Basis $10 statt $4 beträgt, ist sein Cache-Read in absoluten Dollar gerechnet noch immer der teurere der beiden. Es gibt keine Konfiguration, in der das Premium-Modell bei einem Token gecachten Kontexts gewinnt. Und der Multiplikator ist nichts, das sich einfach übertragen lässt: Eine Agent-Loop, die auf das Cache-Verhalten von Fable 5.1 abgestimmt ist, zahlt bei Opus 5.5 proportional mehr pro Cache-Treffer, auch wenn sie weniger pro frischem Token zahlt.

Fast mode ist die schärfere Asymmetrie. In Anthropics Dokumentation wird Fast mode für Claude Opus 5.5, Claude Opus 5 und Claude Opus 4.8 aufgeführt – Fable 5.1 fehlt in dieser Liste. Das günstigere Modell hat also einen Latenzhebel, den das teurere schlicht nicht hat, bei $8/$40, was noch unter der Standard-Ausgaberate von Fable 5.1 mit $10/$50 liegt. Wenn Ihre Workload interaktiv genug ist, dass ein langsames erstes Token ein Produktproblem darstellt, beachten Sie, dass die gemessene Zeit bis zum ersten Token bei Fable 5.1 274 Sekunden beträgt. Diese Zahl ist ein Artefakt von Reasoning mit maximalem Aufwand, kein Defekt, aber es ist die Zahl, die ein Evaluator aufgezeichnet hat.

Die Standardeinstellungen sind nicht dieselben, und genau das ist die Falle.

In der eigenen Modelldokumentation von Anthropic stehen die beiden Modelle direkt nebeneinander, und die Zeile, die die meisten realen Vergleiche entscheidet, ist nicht der Preis. Es ist die Standard-Effort-Stufe: medium für Claude Opus 5.5, high für Claude Fable 5.1. Beide nutzen adaptives Denken, das sich nicht abschalten lässt; die Tiefe wird ausschließlich über den Effort-Parameter gesteuert, auf einer Skala mit low, medium, high, xhigh, max.

Das ist der Grund, warum die Launch-Zeile „Opus 5.5 ist bei den meisten Aufgaben gleichauf mit Fable 5.1“ und die darunter stehenden Benchmark-Tabellen so wirken, als würden sie sich widersprechen. Anthropics Head-to-head-Zeilen für Opus 5.5 sind häufig mit einer höheren Effort-Einstellung als der Standard gekennzeichnet – der Terminal-Bench-4.0-Wert von 66,4 % gegenüber 55,8 % bei Fable 5.1 wurde mit xhigh effort ausgeführt, nicht mit medium. Die eigenen Zahlen von Fable 5.1 wiederum wurden mit seiner höheren Standardeinstellung erzeugt. Zwei Modelle, die mit unterschiedlichen Effort-Einstellungen verglichen werden, werden überhaupt nicht miteinander verglichen, und genau das sagt Anthropic in seinem eigenen Launch-Material, wenn es davor warnt, dass Benchmark-Abstände auf diesem Fähigkeitsniveau einen weniger verlässlichen Anhaltspunkt für reale Unterschiede darstellen, als die Scores nahelegen.

Praktisch wird die Entscheidung dadurch zu einer Tuning-Übung statt zu einer Auswahl. Wenn Sie von Fable 5.1 auf Opus 5.5 umsteigen und Ihre Einstellung effort unverändert übernehmen, haben Sie still und leise verändert, wie viel Denkarbeit das Modell leistet, und jede Qualitäts- und Kostenzahl, die Sie danach erzeugen, ist verfälscht. Die Empfehlung von Anthropic lautet, mehrere Effort-Stufen zu testen, statt die Einstellungen des alten Modells zu übernehmen. Das ist billig zu machen, und fast niemand tut es, weil es bedeutet, die eigenen Evals zweimal laufen zu lassen.

Der eine Ort, an dem sich die Kombination bezahlt macht

Das Muster, das rechtfertigt, beide zu behalten, ist der Advisor-Loop: Opus 5.5 erledigt die Arbeit, Fable 5.1 wird für die schwierigen Entscheidungen hinzugezogen. Anthropic hat es gemessen, und es bringt tatsächlich mehr Genauigkeit – bei höheren Kosten und höherer Latenz, was genau der Trade-off ist, den man erwartet, wenn man das langsamere Modell in die Schleife einbindet. Was sich geändert hat, ist die Rechnung dahinter. Als die Fähigkeitslücke noch größer war, war es offensichtlich lohnenswert, 10 $/50 $ zu zahlen, um einen Worker für 5 $/25 $ zu beaufsichtigen. Jetzt, da der Worker den Advisor im unabhängigen Index übertrifft, beschränkt sich der Beitrag des Advisors auf die spezifischen Aufgaben, bei denen seine eigenen Evals besser abschneiden als Opus 5.5 – und diese Aufgaben muss man selbst identifizieren. Der Loop ergibt für eine schwierige Teilmenge weiterhin Sinn; als pauschale Konfiguration ergibt er keinen Sinn mehr.

Beide sind nur eine Taste entfernt

Das Migrationsdetail, das Teams hier erwischt, ist nicht die API-Oberfläche – es ist die Tatsache, dass es sich um Modelle desselben Anbieters mit unterschiedlichen Effort-Skalen, unterschiedlichen Cache-Multiplikatoren und unterschiedlichen Standardeinstellungen handelt, und ein ehrlicher Vergleich bedeutet, beide mit den eigenen Prompts bei identischer Konfiguration laufen zu lassen. Claude Opus 5.5 gibt es auf OrcaRouter zu Anthropics eigenen $4.00 / $20.00, und Claude Fable 5.1 gibt es auf OrcaRouter zu $10.00 / $50.00 — der Listenpreis des Anbieters wird mit 0 % Aufschlag durchgereicht, sodass sich beide Zahlen am Tag ändern, an dem Anthropic sie ändert, und keiner von beiden einen zweiten Vertrag oder ein zweites SDK mit sich bringt.

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

Das ist es, was die Aufteilung praktisch statt theoretisch macht. Den Großteil Ihres Traffics an Opus 5.5 zu senden und eine Routing-Regel festzulegen, die die wirklich schwierigen Fälle an Fable 5.1 eskaliert, ist eine Konfiguration an einem einzigen Endpunkt, nicht zwei Integrationen – und einen Aufruf so zusammenzusetzen, dass ein Modell entwirft, während das andere verifiziert, ist eine Zeile in der Routing-DSL statt einer Pipeline, die Sie aufbauen und pflegen müssen. Sollte sich der Eskalationspfad für Ihre Workload als falsch erweisen, sorgt automatisches Failover dafür, dass die Anfrage bei einem Modell landet, das Sie bereits charakterisiert haben, statt einfach fehlzuschlagen.

Was würde es klären

Der ehrliche Stand dieses Vergleichs ist, dass Anthropic eine Tabelle veröffentlicht hat, in der das günstigere Modell die meisten Zeilen gewinnt, Artificial Analysis eine andere, in der es klar gewinnt, und beide wurden mit Effort-Einstellungen gefahren, die Sie nicht ausliefern. Keiner davon ist ein kontrollierter Direktvergleich bei identischen Standardeinstellungen, und kein Drittanbieter hat einen durchgeführt. Die Lücke, die all das übersteht – dass Claude Opus 5.5 bei jeder Position der Preisliste deutlich günstiger ist, einen Schnellmodus unterstützt, den Fable 5.1 nicht hat, und beim einzigen unabhängigen Score, den beide Modelle besitzen, nicht zurückliegt –, ist groß genug, dass sich die Beweislast verschoben hat. Wenn Sie standardmäßig auf Fable 5.1 setzen, lautet die Frage nicht mehr, ob Opus 5.5 gut genug ist; sie lautet, welche konkreten Aufgaben in Ihrer Arbeitslast bei medium Effort fehlschlagen, denn nur für diese zahlen Sie den Aufpreis.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert