Hero-Titelkarte für Claude Opus 5.5 vs. Claude Opus 5, mit der Überschrift „Die Effort-Level bedeuten nicht dasselbe“, mit Badges mit der Aufschrift „medium vs. high Standard“, „4,00 $ vs. 5,00 $“ und „0,20 $ vs. 0,50 $ Cache“ sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

Claude Opus 5.5 vs. Claude Opus 5: Die Effort-Levels bedeuten nicht dasselbe

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Erste, was man wissen muss, bevor man Claude Opus 5.5 mit Claude Opus 5 vergleicht, ist, dass die beiden Modelle keine gemeinsame Effort-Skala haben, und fast jeder Direktvergleich, den Sie diese Woche lesen werden, ignoriert das. Opus 5 verwendet standardmäßig den hohen Effort. Opus 5.5 verwendet standardmäßig den mittleren, und auf derselben benannten Stufe denkt es pro Turn mehr als sein Vorgänger. „Opus 5.5 in der Standardeinstellung gegen Opus 5 in der Standardeinstellung" ist also kein kontrolliertes Experiment — es ist ein Vergleich zwischen zwei unterschiedlich großen Mengen an Denkleistung. Der Anbieter sagt das selbst in seinem eigenen Migrationsleitfaden: Testen Sie mehrere Effort-Stufen, und verwenden Sie die Einstellungen von Opus 5 nicht erneut, denn gleich benannte Stufen entsprechen nicht demselben Denkbudget. Wenn man das kontrolliert, verengt sich die Lücke zwischen den beiden Modellen an manchen Stellen, an anderen wird sie größer, und die Upgrade-Entscheidung hängt von etwas anderem ab als der reinen Leistungsfähigkeit — von den Kosten pro abgeschlossener Aufgabe und von vier API-Änderungen, die Code brechen werden, der heute auf Opus 5 läuft.

Was unterscheidet sich tatsächlich, Spec für Spec?

A two-column scoreboard for Claude Opus 5.5 and Claude Opus 5. Left column: price $4.00 / $20.00, cache read $0.20 per million, default effort medium, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.6% at medium effort, GDPval-AA 1846 Elo. Right column: price $5.00 / $25.00, cache read $0.50 per million, default effort high, Terminal-Bench 4.0 52.3%, FrontierCode v1.1 48.0%, GDPval-AA 1708 Elo. A sourcing footer notes the figures are vendor-reported and the effort settings differ between runs.

Die beiden Modelle liegen auf dem Papier näher beieinander, als die Versionsnummern vermuten lassen:

• Preis — Claude Opus 5.5 bei $4.00 Eingabe / $20.00 Ausgabe pro Million Tokens gegenüber Claude Opus 5 bei $5.00 / $25.00

• Cache-Lesevorgang — 0,20 $ pro Million statt 0,50 $ pro Million, eine Senkung um 60 % bei dem Posten, der agentische Runs dominiert

• Cache-Schreibvorgang — 5 $ pro Million für das 5-Minuten-Fenster und 8 $ für das 1-Stunden-Fenster bei 5.5, gegenüber 6,25 $ bei Opus 5

• Kontext und Ausgabe — 1 Mio. Tokens Kontext und 128K Ausgabe bei beiden; beide erreichen 300K Ausgabe bei der Batch-API hinter dem output-300k-2026-03-24 Beta-Header

• Standard-Aufwand — mittel bei Opus 5.5 vs. hoch bei Opus 5

• Thinking — adaptiv und in beiden immer aktiv, aber auf Opus 5.5 lässt es sich überhaupt nicht mehr deaktivieren

• Wissens-Cutoff — Juni 2026 vs. Mai 2026

• Latenz — Anthropic stuft Opus 5.5 im Vergleich zum aktuellen Lineup als „moderat“ ein und gibt an, dass es Ausgaben mehr als 30 % schneller als Opus 5 generiert

• Außerbetriebnahme — nicht vor dem 22. September 2027 für Opus 5.5 und nicht vor dem 24. Juli 2027 für Opus 5

Beachte, was nicht anders ist: Kontextfenster, Ausgabeobergrenze, Batch-Rabatt und das stets aktive adaptive Denkmodell. Opus 5.5 ist kein Modell mit größerem Kontext oder längerer Ausgabe. Es ist ein günstigeres, schnelleres und token-effizienteres Modell bei gleichem Rahmen.

Benchmarks – und das Aufwands-Sternchen bei jedem einzelnen davon

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Diese Zahlen stammen aus Anthropics Launch-Material – vom Anbieter selbst berichtet, an den eigenen Modellen erhoben – und die Effort-Einstellung ist hier wichtiger als der Modellname:

• Terminal-Bench 4.0 — 66,4 % vs. 52,3 %, wobei der Opus-5.5-Lauf mit xhigh-Aufwand statt mit der Standardeinstellung durchgeführt wurde

• FrontierCode v1.1 (Main) — 54,4 % gegenüber 48,0 % und 54,6 % für Opus 5.5 bei der standardmäßigen mittleren Aufwandsstufe

• CursorBench 4.0 — 57,8 % vs. 46,6 % und 52,5 % bei mittlerer Stufe

• GDPval-AA v2.1 — 1846 Elo gegen 1708

• AutomationBench — 40,0 % vs. 26,9 %

• Humanity's Last Exam, mit Werkzeugen — 67,7 % vs. 63,6 %

• Terminal-Bench-Science 0.1 — 58,7 % vs. 29,0 %, die größte Kluft im Set

• OSWorld 2.0 — 81,8 % teilweise vs. 74,0 %

• Chartografie, mit Werkzeugen — 89,0 % vs. 83,4 %

Das FrontierCode-Ergebnis ist das, was man untersuchen sollte. Opus 5.5 erreicht 54,4 % bei xhigh und 54,6 % bei medium – statistisch dieselbe Zahl, bei einem Bruchteil des Denkbudgets. Welche Verbesserung Anthropic auch immer vorgenommen hat, in diesem Benchmark stammt sie nicht daher, dass härter gedacht wird. CursorBench entwickelt sich in die andere Richtung: 57,8 % bei xhigh gegenüber 52,5 % bei medium, eine Fünf-Punkte-Spanne, die besagt, dass Aufwand bei manchen Aufgaben noch echte Genauigkeit erkauft. Die Lehre ist nicht „medium verwenden“ oder „xhigh verwenden“; sie lautet, dass das richtige Aufwandsniveau inzwischen eine Messung pro Workload ist, und die alte Gewohnheit, Opus 5 auf seiner hohen Voreinstellung zu belassen, verrät einem über das neue Modell nichts mehr.

Anthropic fügt einen Vorbehalt hinzu, der es wert ist, wiederholt zu werden: Auf diesem Fähigkeitsniveau seien Benchmark-Abstände „ein weniger verlässlicher Wegweiser für Unterschiede in der realen Welt“, und das Unternehmen erklärt, sein interner Abstand zu Claude Fable 5.1 sei geringer, als die veröffentlichten Werte nahelegen. Das ist ein Anbieter, der Ihnen sagt, Sie sollten seine eigene Tabelle nicht überinterpretieren.

Die Kosten pro abgeschlossener Aufgabe sind der Vergleich, der den Ausschlag gibt

Der Preis pro Token ist die falsche Einheit für einen Agenten, und in diesem Vergleich zeigt sich das. Anthropics eigenes durchgerechnetes Beispiel: eine Fusionsanalyse, für die Opus 5.5 63 Minuten brauchte und die 50 % weniger kostete als dieselbe Aufgabe mit Opus 5, für die 93 Minuten nötig waren. Die Preisliste erklärt einen Teil davon – 20 % weniger bei Input und Output, 60 % bei Cache-Reads –, aber nicht alles. Der Rest ist darauf zurückzuführen, dass das Modell weniger Token und weniger Turns braucht, um zum selben Ergebnis zu kommen. Zur Markteinführung veröffentlichte Kundenaussagen weisen in dieselbe Richtung: Box meldet ein Drittel der Token und rund 40 % weniger ausführliche Antworten, Kiro etwa die Hälfte der Token bei 40 % weniger Aufrufen, Factory 20–25 % weniger Output-Token, GitHub gehört zu den wenigsten Token und Schritten, die es gemessen hat.

Das sind von Anbietern veröffentlichte Kundenaussagen, keine geprüften Ergebnisse, und die aggregierte Aussage „etwa 40 % günstiger bei typischen Workloads“ ist Anthropics Charakterisierung eines Durchschnitts über die von Anthropic ausgewählten Workloads. Die ehrliche Version für Ihre eigene Planung: Gehen Sie davon aus, dass die 20 % Preisnachlass auf dem Preisschild real und verlässlich einkalkulierbar sind, und behandeln Sie die zusätzlichen 20 % als Hypothese, die Sie an einem Nachmittag testen können, indem Sie dieselbe Aufgabe mit beiden Modellen ausführen und Tokens zählen.

Eine strukturelle Anmerkung dazu, warum die Cache-Senkung überproportional stark wirkt. Ein Agent, der in jeder Runde einen langen System-Prompt und einen Dateibaum erneut sendet, zahlt für den Großteil seiner Eingabe Cache-Lese-Tarife, nicht Tarife für frische Eingaben. Diese von 0,50 $ auf 0,20 $ pro Million zu senken, verändert die Ökonomie langlebiger Sitzungen weit stärker als der nominelle Tarif – und es ist der Grund, warum eine Workload, die auf Opus 5 grenzwertig wirtschaftlich war, auf Opus 5.5 ohne jede Änderung an Ihren Prompts eindeutig wirtschaftlich werden kann.

Die vier Breaking Changes als Migrations-Checkliste

Opus 5.5 ist ein neues Modell, kein umbenanntes Opus 5, und in Anthropics Migrationshinweisen sind vier Änderungen aufgeführt, die Code, der bereits in der Produktion läuft, brechen werden:

• Thinking kann nicht deaktiviert werden. Jeder Codepfad, der Thinking deaktivierte, führt zu einem Fehler oder ändert das Verhalten, und die Tiefe wird jetzt nur noch über den Effort-Parameter gesteuert.

• Die erzwungene Tool-Nutzung gibt einen Fehler zurück. Ein tool_choice, das ein benanntes Tool erzwingt, wird nicht unterstützt.

• Thinking-Blöcke sind an das Modell, das sie erzeugt hat, und an die Konversation gebunden, sodass sie nicht so über Modelle hinweg wiedergegeben werden können, wie manche Pipelines annehmen.

• Das frühere computer_20251124 Computer-Nutzungs-Tool wird in der Claude API oder bei Google Cloud nicht akzeptiert.

Es gibt eine fünfte Änderung, die nichts fehlschlagen lässt und deshalb gefährlicher ist. Text zwischen Tool-Aufrufen wird jetzt innerhalb von Thinking-Blöcken zurückgegeben, deren Text bei der Standardanzeigeeinstellung leer ist. Wenn Ihre Anwendung diesen Text als Fortschrittsaktualisierungen an Benutzer streamt, bleibt es zwischen Tool-Aufrufen still, bis Sie einen Anzeigewert festlegen, der den Text zurückgibt. Jeder Test besteht; die Oberfläche hört einfach auf zu erzählen.

Die ersten drei gelten auch für Claude Fable 5.1, ein Team, das bereits zu diesem Modell migriert ist, hat also einen Teil dieser Arbeit erledigt. Ein Team, das noch Opus 5 verwendet, hat das nicht.

Wann Opus 5 immer noch die richtige Wahl ist

Das Upgrade erfolgt nicht automatisch, und es gibt vier echte Gründe zu bleiben:

• Kostenvorhersagbarkeit. Opus 5 ist ein Modell, das Sie bereits charakterisiert haben. Wenn Ihr Budget auf dessen Token-Verbrauch basiert, wird das Modell durch einen Wechsel zu einem Modell, das bei derselben benannten Effort-Stufe anders viel nachdenkt, ungültig, bis Sie neu messen.

• Kompatibilität. Wenn irgendein Teil Ihres Stacks davon abhängt, das Denken zu deaktivieren, ein Tool zu erzwingen oder das ältere Computer-Use-Tool zu verwenden, ist die Migration Code-Arbeit, kein String-Austausch.

• Routing absichern. Opus 5.5 wird mit Schutzmechanismen der Fable-5.1-Klasse ausgeliefert, das heißt, die meisten Cybersicherheitsanfragen werden an Claude Opus 4.8 weitergeleitet und Biologie-Arbeiten fallen auf Claude Opus 5 zurück, sofern Ihr Konto nicht verifiziert ist. Wenn Ihr Produkt in einem dieser beiden Bereiche angesiedelt ist, kann „Upgraden“ bedeuten, dass Ihre Nutzer Antworten von einem kleineren Modell erhalten. Bei Opus 5 gibt es dieses Routing nicht.

• Langlebigkeit. Opus 5 wird so schnell nicht verschwinden — Anthropic gibt als frühesten Auslauftermin den 24. Juli 2027 an, also in zehn Monaten.

Für alle anderen ist die Rechnung einfach: mehr Leistungsfähigkeit, niedrigerer Preis, weniger Tokens und eine Migrationscheckliste, die ein einzelner Entwickler an einem Tag durcharbeiten kann.

Beide während des Wechsels laufen lassen

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'by Anthropic - 2026-07-24', and the model description.

Das Unangenehme an jeder Flagship-Migration ist die Mitte: Sie wollen Opus 5.5 für neuen Traffic, ohne den Produktionspfad auf ein Modell zu verwetten, das Sie mit Ihren eigenen Effort-Einstellungen noch nicht charakterisiert haben, und Sie wollen Opus 5 weiter bedienen lassen, während Sie es herausfinden. Das ist eher ein Routing-Problem als eines der Re-Plattformierung, und es lohnt sich, genau zu sein, was wo liegt. Claude Opus 5 ist heute auf OrcaRouter verfügbar zum Anthropic-eigenen Listenpreis mit 0 % Aufschlag — der Anbieter-Listenpreis wird direkt durchgereicht, sodass eine Änderung der Anbieterpreise bei uns noch am selben Tag live ist, statt erst nach einer Synchronisierung. Claude Opus 5.5 ist noch keine unserer Routen; es ist über Anthropics eigene API und die großen Clouds verfügbar. Wenn es verfügbar wird, wird es eine weitere Route unter demselben Schlüssel statt eines zweiten Vertrags und eines zweiten SDKs, was Ihnen ermöglicht, einen Prozentsatz des Traffics auf das neue Modell zu legen, während automatisches Failover den Rest auf demjenigen hält, den Sie bereits charakterisiert haben. Einen Aufruf über beide hinweg zusammenzusetzen — ein Entwurf von dem einen und ein Verifizierungsdurchlauf von dem anderen — ist eine Zeile in der Routing-DSL.

Sei präzise dabei, was dir das bringt. Es liefert dir keinen unabhängigen Benchmark für Opus 5.5; das tut derzeit nichts, denn die einzigen veröffentlichten Direktvergleiche stammen von Anthropic selbst, und die unabhängigen Trackers einigen sich noch auf Effort-Konfigurationen. Was es dir liefert, ist die eine Messung, die tatsächlich prädiktiv für deine Rechnung ist – auf deinen Prompts, auf dem Effort-Level, das du ausliefern wirst.

Die Entscheidungsregel

Wenn Sie etwas Neues beginnen, verwenden Sie Claude Opus 5.5 und starten Sie mit mittlerem Aufwand; messen Sie dann, ob niedrig bei Ihrer Aufgabe standhält – Anthropic berichtet, dass die niedrige Einstellung bei mehreren Evaluierungen im Programmierbereich mit deutlich geringeren Kosten an ihre höheren Einstellungen heranreicht, und die obigen FrontierCode-Zahlen legen nahe, dass die Standardeinstellung nicht viel Potenzial verschenkt.

Wenn Sie Claude Opus 5 in der Produktion einsetzen, ist nicht die Benchmark-Tabelle der Auslöser für eine Migration. Entscheidend ist, ob Sie vier API-Änderungen verkraften können und ob Ihr Workload im Bereich Cybersicherheit oder Biologie angesiedelt ist, wo das Safeguard-Routing einen Teil Ihres Traffics still und leise an ein kleineres Modell weiterleitet. Alles andere an diesem Upgrade ist eine Preissenkung im Gewand eines Modell-Releases – und die lohnt es sich mitzunehmen.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert