
Claude Opus 5.5 Benchmarks: Jeder Wert, die Effort-Einstellung, aus der er stammt, und wer ihn gemessen hat
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Anthropics Schlagzeilenzahl für Claude Opus 5.5 auf Terminal-Bench 4.0 ist 66,4 %, ausgewiesen gegen 52,3 % für Claude Opus 5 in derselben Tabelle – und diese 66,4 % wurden bei xhigh-Aufwand erzeugt, nicht beim Standardwert medium des Modells. Das Modell erschien am 22. September 2026, zwei Tage bevor diese Seite geschrieben wurde, es ist also ein GA-Modell mit der Preisgestaltung eines GA-Modells und der Benchmark-Tabelle eines GA-Modells. Die unabhängige Zahl im selben Benchmark, von Artificial Analysis, beträgt 59,6 %, in einer Konfiguration, die Anthropics serverseitiges Safeguard-Routing enthält. Zwischen diesen beiden Zahlen liegen ein Harness-Unterschied, ein Aufwandsunterschied und ein Routing-Unterschied, und niemand – uns eingeschlossen – kann derzeit sagen, wie viel von der Lücke auf welchen davon entfällt. Was diese Seite leisten kann, ist, jede veröffentlichte Zahl für Claude Opus 5.5 an einem Ort zusammenzutragen, zu nennen, wer sie erhoben hat, bei welcher Einstellung sie erhoben wurde, und die Zeilen aufzunehmen, in denen GPT-6 Astra und Claude Fable 5.1 vorne liegen.
Beginne mit der Effort-Einstellung, denn sie bewegt die Zahlen stärker als die Modelle.
Claude Opus 5.5 verwendet standardmäßig medium Effort auf der Claude API. Claude Opus 5 verwendete standardmäßig high. Derselbe benannte Level ist zudem bei den beiden Modellen nicht dasselbe Thinking-Budget, sodass „wir haben beide mit high laufen lassen" kein kontrollierter Vergleich ist, selbst wenn die Bezeichnung übereinstimmt. Adaptive Thinking ist bei Opus 5.5 immer aktiv und lässt sich nicht abschalten; der Effort-Parameter verändert Tiefe, Latenz und Kosten – und sonst nichts.
Anthropics Terminal-Bench-4.0-Wert wurde mit xhigh ermittelt. Diese eine Tatsache ist der wichtigste Vorbehalt auf dieser Seite, denn der Benchmark, den sie in den Mittelpunkt stellt, ist derjenige mit dem größten berichteten Vorsprung gegenüber dem vorherigen Modell, und weil dieselbe Tabelle zeigt, was passiert, wenn man die Einstellung unangetastet lässt:
• FrontierCode v1.1 Main — 54,4 % bei xhigh, 54,6 % bei Standard-medium. Vom Anbieter angegeben. Der medium-Durchlauf ist höher als der xhigh-Durchlauf. Bei dieser Arbeitslast brachte der Effort-Regler nichts Messbares; die beiden Zahlen sind dieselbe Zahl.
• CursorBench 4.0 — 57,8 % bei xhigh, 52,5 % bei medium.Vom Anbieter gemeldet. Gleiches Modell, gleiches Harness, gleiche Woche: 5,3 Punkte — die größte Effort-Differenz in dieser Übersicht.
Diese beiden Zeilen in ein und derselben Anbietertabelle sind das ganze Argument. Die eine Workload ist unempfindlich gegenüber dem Effort-Aufwand, die andere stark darauf angewiesen, und die Model Card kann Ihnen nicht im Voraus sagen, um welche Art von Workload es sich bei Ihrer handelt. Die Schlussfolgerung, die die Daten stützen, ist eng gefasst – und es lohnt sich, sie eng zu fassen: Das richtige Effort-Level ist jetzt eine Messung pro Workload, kein Standardwert, den man einfach erbt. Sie stützt weder „Opus 5.5 ist schneller, als seine Benchmarks vermuten lassen" noch „Anthropic hat den Standardwert absichtlich ausgebremst" – dafür bräuchte man Sweeps pro Workload über alle fünf Einstellungen, und die hat niemand veröffentlicht. Sie bedeutet aber: Wenn Sie von Opus 5 migrieren und die Effort-Einstellung beibehalten, die Sie ohnehin schon hatten, haben Sie das Experiment geändert, nicht nur das Modell.
Noch eine Asymmetrie – und diesmal schlägt sie in die andere Richtung. In der Konkurrenten-Spalte von Anthropics Terminal-Bench-Zeile steht GPT-6 Astra mit 57,9 % – laut Anthropics eigener Diagrammnotiz ausgeführt mit high-Effort, während Opus 5.5 mit 66,4 % mit xhigh ausgeführt wurde. Eine Herstellertabelle, die das eigene Modell mit der einen Einstellung und einen Konkurrenten mit einer anderen laufen lässt, ist kein direkter Vergleich – egal, wie die beiden Zahlen nebeneinander aussehen.
Die Anbietertabelle, mit der Quelle und der Einstellung in jeder Zeile
Alles in diesem Abschnitt ist vom Anbieter gemeldet: Anthropics Launch-Material, Anthropics Harness, Produktions-Sicherheitsvorkehrungen aktiv, adaptives Denken mit maximalem Aufwand, sofern die Zeile nichts anderes sagt. Lesen Sie es als Anthropic, das Anthropic vermisst.
• Terminal-Bench 4.0 — 66,4 %, bei xhigh-Aufwand. Vom Anbieter gemeldet, Standardfehler etwa ±2,6 Punkte. In derselben Zeile: Claude Opus 5 52,3 %, Claude Fable 5.1 55,8 %, GPT-6 Astra 57,9 % (bei hohem Aufwand), GPT-5.6 Sol 37,3 %. Terminal-Bench 4.0 ist ausdrücklich ein Benchmark, von dem der Anbieter einräumt, dass er nur ein unvollkommenes Abbild realer Terminal-Arbeit ist, und er ist das Aushängeschild des Modells.
• FrontierCode v1.1 Main — 54,4 % bei xhigh, 54,6 % bei Standard-Medium.Vom Anbieter angegebene Werte. Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %, GPT-5.6 Sol 47,5 %. Anthropics System Card führt außerdem die Extended-Variante mit 63,6 % sowie einen Bestwert bei Medium für Extended von 65,3 % auf.
• CursorBench 4.0 — 57,8 % bei xhigh, 52,5 % bei medium. Vom Anbieter angegeben. Opus 5 46,6 %, Fable 5.1 51,8 %, GPT-5.6 Sol 41,7 %. Beachten Sie, dass die CursorBench-Werte von Fable 5.1 und Opus 5 bei maximalem Aufwand (max) liegen, sodass Opus 5.5 bei medium mit den eigenen Geschwistermodellen bei max verglichen wird.
• GDPval-AA v2.1 — 1.846 Elo. Dies ist die einzige Zeile in der Anbietertabelle, die der Anbieter nicht selbst durchgeführt hat. GDPval-AA ist eine Bewertung von Artificial Analysis, und der eigene Bericht von Artificial Analysis zu Opus 5.5 nennt dieselbe Zahl 1.846, mit Fable 5.1 bei 1.735 und Opus 5 bei 1.708. In der Anbietertabelle: Fable 5.1 1.735, Opus 5 1.708, GPT-5.6 Sol 1.588, GPT-6 Astra 1.542. Es ist die einzige Zeile hier, bei der zwei Organisationen dieselbe Zahl bestätigen, und das liegt daran, dass es dieselbe Messung ist.
• AutomationBench (Zapier) — 40,0 %.Vom Anbieter gemeldet und ausgeführt ohne Fallback-Modelle, sodass jeder Eingriff der Schutzmechanismen als Fehlschlag gewertet wurde. GPT-6 Astra 41,4 %, Fable 5.1 31,4 %, GPT-5.6 Sol 28,8 %, Opus 5 26,9 %.
• Humanity's Last Exam, mit Tools — 67,7 %. Vom Anbieter gemeldet. Fable 5.1 65,6 %, Opus 5 63,6 %, GPT-6 Astra 57,2 %. Anthropics System Card berichtet separat 64,4 % ohne Tools, die Zahl, auf die Sie zurückgreifen sollten, wenn Sie mit einer Quelle vergleichen, die ihren Modellen keinen Tool-Zugriff gibt.
• Terminal-Bench-Science 0.1 — 58,7 %.Vom Anbieter angegeben, Standardfehler ungefähr ±3,5 bis ±5 Punkte, also eher eine Bandbreite als ein Punkt. GPT-6 Astra 64,6 %, Fable 5.1 52,6 %, Opus 5 29,0 %, GPT-5.6 Sol 22,4 %.
• OSWorld 2.0 — 81,8 % teilweise.Vom Anbieter gemeldet, und „teilweise" leistet in diesem Satz echte Arbeit: Anthropics System Card nennt eine strikte Abschlussrate von 48,7 % für dasselbe Modell in derselben Evaluation. Beide Zahlen sind veröffentlicht; die Teilzahl ist diejenige, die zitiert wird. Fable 5.1 80,7 %, Opus 5 74,0 %.
• Chartographie, mit Tools — 89,0 %. Vom Anbieter angegeben. Fable 5.1 88,4 %, Opus 5 83,4 %.

Die unabhängigen Zahlen und was „Default Fallback“ tatsächlich bedeutet
Artificial Analysis ist der einzige Drittanbieter mit einer veröffentlichten, aktuellen Bewertung von Claude Opus 5.5 auf einem zusammengesetzten Index, und seine Zahlen sind die, die man neben die von Anthropic stellen sollte. Stand: 24. September 2026:
• Intelligenz-Index — 58 bei maximalem Aufwand, in einer Konfiguration mit der Bezeichnung „Adaptive Reasoning, Max Effort, Default Fallback". Unabhängig, gemessen von Artificial Analysis. Der eigene Artikel bezeichnet 58 als „die höchste Punktzahl, die wir gemessen haben, und das um mehrere Punkte". Derselbe Index veröffentlicht Opus 5.5 auch bei jeder anderen Aufwandsstufe, und die Spanne ist das Aufschlussreiche: 56 bei xhigh, 54 bei high, 51 bei medium, 42 bei low. Das ist eine Schwankung von 16 Punkten über den Aufwandsregler hinweg bei einem einzigen Modell — größer als der Abstand zwischen den meisten Modellen in diesem Ranking.
• Terminal-Bench 4.0 — 59,6 %. Unabhängig. Artificial Analysis gibt an, dass es „auf Augenhöhe mit dem Marktführer GPT-6 Astra (xhigh)" und rund 11 Punkte über Claude Opus 5 liegt.
• Humanity's Last Exam — 61,4 %.Unabhängig, und der bisherige Bestwert auf demselben Board lag bei 59,1 %, gehalten von Claude Fable 5.1.
• SciCode — 66,9 %. Unabhängig, gegenüber 63,1 % für Claude Fable 5.1.
Nun die Klausel, die eher erklärt als zitiert werden muss. „Default Fallback“ ist kein Benchmark-Artefakt und keine Einstellung von Artificial Analysis – es ist Anthropics serverseitiges Schutz-Routing, das eingeschaltet gelassen wurde. Claude Opus 5.5 wird mit der Schutzstufe ausgeliefert, die zuvor Fable 5.1 vorbehalten war: Die meisten Cybersicherheitsanfragen werden transparent an Claude Opus 4.8 umgeleitet, und Biologie-Arbeit fällt auf Claude Opus 5 zurück, sofern das Konto nicht verifiziert ist. Wenn Artificial Analysis den Index mit aktiviertem Default Fallback laufen lässt, wird das eingesetzte System gemessen – also das, was ein nicht verifizierter API-Schlüssel tatsächlich erreicht – und nicht einen sauberen Checkpoint der Gewichte von Opus 5.5. Das ist die ehrlichere Messung für einen Käufer und die weniger saubere Messung für einen Benchmark. Anthropic sagt Ähnliches über die eigene Tabelle: Bei den Eingriffen im Durchlauf von Terminal-Bench 4.0 wurden Cyber-Aufgaben von Opus 4.8 und Biologie-Aufgaben von Opus 5 erledigt, und das Unternehmen erklärt, diese Eingriffe hätten wahrscheinlich gesenkt den berichteten Wert. Das Schutz-Routing ist also in beide Richtungen eine reale operative Tatsache, und keine Zahl auf dieser Seite isoliert das zugrunde liegende Modell davon.
Wo die beiden Tabellen voneinander abweichen, und warum
Setzt man die beiden Terminal-Bench-4.0-Zahlen nebeneinander, erhält man 66,4 % gegenüber 59,6 % – 6,8 Punkte, im selben Benchmark, für dasselbe Modell. Die Gründe sind bekannt, und jeder einzelne ist groß genug, um für sich genommen ins Gewicht zu fallen:
• Unterschiedliche Harnesses. Anthropic führte sein eigenes Agent-Scaffold aus, Artificial Analysis sein eigenes Referenz-Agent-Harness. Ein Terminal-Benchmark-Ergebnis ist eine Eigenschaft des Scaffolds plus des Modells, nicht des Modells allein, und keine der beiden Organisationen hat ein Scaffold-Swap-Experiment veröffentlicht.
• Unterschiedliche Effort-Einstellungen. Anthropics 66,4 % gelten bei xhigh. Die Effort-Einstellung, die zu den 59,6 % von Artificial Analysis gehört, wird in dem Satz, der die Zahl enthält, nicht genannt, und die von ihm angegebenen Benchmark-Werte sind im Allgemeinen die mit maximalem Effort.
• Schutzvorkehrungen aktiviert, in beiden Fällen unterschiedlich gezählt. Anthropic lief mit Fallback und behandelte Interventionen als punkte-reduzierend, aber sie wurden dennoch gewertet. Auf AutomationBench lief es ohne Fallback und zählte Interventionen als glatte Fehlschläge. Artificial Analysis läuft durchgängig mit aktiviertem Fallback.
• Die Zahlen verschieben sich sogar innerhalb der eigenen Tabelle eines Anbieters.Anthropic gibt Claude Opus 5 mit 52,3 % bei Terminal-Bench 4.0 an und merkt an, dass die 51,8 % des öffentlichen Leaderboards für dasselbe Modell „innerhalb des Rauschens“ liegen.
Und dann das stärkste Beweisstück auf dieser Seite dafür, wie viel ein Harness wert ist. Das öffentliche Terminal-Bench-4.0-Leaderboard, erfasst am 24. September 2026, enthält überhaupt keine Zeile für Claude Opus 5.5. Ganz oben steht GPT-6 Astra bei maximalem Effort, Codex-Agent, 58.2% ±2.8; an zweiter Stelle Claude Fable 5.1 bei maximalem Effort über Claude Code mit 57.9% ±3.8; an dritter Stelle Claude Opus 5 bei xhigh über Claude Code mit 53.9% ±3.2. Die 66.4% sind also nicht bloß eine andere Zahl als die unabhängigen 59.6% — sie stehen gar nicht auf dem öffentlichen Board, und die boardeigene Version von Claude Opus 5 liegt bei 53.9%, nicht bei den 52.3%, die die Launch-Tabelle ausweist. Solange Terminal-Bench keine Opus-5.5-Einreichung akzeptiert und veröffentlicht, sind die 66.4% ein Vendor-Harness-Ergebnis, das niemand reproduziert hat, und die 59.6% sind die Zahl, für die eine außenstehende Partei tatsächlich geradestehen wird. Beachten Sie außerdem, dass auf demselben Board der Terminal-Bench-4.0-Leader von Artificial Analysis und Anthropics Opus 5.5 auf denselben 59.6% landen — was ein Gleichstand in einem Harness ist und nichts über den anderen aussagt.

Die Zeilen, in denen Opus 5.5 verliert
Eine Zusammenfassung, die die Verluste auslässt, ist keine Zusammenfassung, und Anthropics eigene Tabelle enthält beide.
• Terminal-Bench-Science 0.1 — 58,7 % gegenüber 64,6 % von GPT-6 Astra.Vom Anbieter gemeldet, in Anthropics Tabelle, und ein Verlust von 5,9 Punkten gegenüber einem namentlich genannten Wettbewerber in der Zeile, die dem wissenschaftlichen Schlussfolgern am nächsten liegt. Der eigene Standardfehler-Hinweis des Anbieters (±3,5 bis ±5) bedeutet, dass der Abstand nahe am Rand des Rauschens liegt und nicht bequem innerhalb davon — aber es ist ein Verlust auf der eigenen Seite des Anbieters, und das Fehlerband macht daraus keinen Sieg. Claude Opus 5 liegt in derselben Zeile bei 29,0 %, der Generationsgewinn ist also real, selbst dort, wo der Wettbewerber führt.
• AutomationBench — 40,0 % gegenüber GPT-6 Astra mit 41,4 %.Vom Anbieter gemeldet, ein Verlust von 1,4 Punkten, und der Durchlauf hatte keine Fallback-Modelle, sodass Schutzinterventionen als Fehlschläge gewertet wurden. Das bedeutet, dieser spezielle Vergleich misst Opus 5.5 einschließlich seiner Routing-Strafe gegen einen Wettbewerber, dessen Routing-Strafe, wie auch immer sie aussehen mag, nicht beschrieben wird. Es ist die am wenigsten interpretierbare Zeile auf der Seite – in beide Richtungen.
Zwei weitere Stellen, an denen der Vorsprung dünner ist, als die Schlagzeile nahelegt, beide anbieterseitig gemeldet. Bei Humanity's Last Exam mit Tools beträgt der Vorsprung gegenüber Claude Fable 5.1 2,1 Punkte (67,7 % vs. 65,6 %); bei Chartography mit Tools beträgt er 0,6 Punkte (89,0 % vs. 88,4 %); bei OSWorld 2.0 teilweise beträgt er 1,1 Punkte (81,8 % vs. 80,7 %). Das sind die Zeilen, in denen „Opus 5.5 ist das beste agentische Modell“ eine Aussage über den Rang und nicht über einen gemessenen Abstand ist, und ein Unterschied von 0,6 Punkten beim Lesen von Diagrammen sollte nicht über eine Beschaffung entscheiden.
Die unabhängige Platzierung von Claude Fable 5.1 auf einer anderen Index-Revision
Opus 5.5 gegen sein eigenes Schwestermodell zu stellen, braucht einen eigenen Abschnitt – und dazu gehört eine Warnung, denn der Vergleich ist schwieriger, als er aussieht.
Als Artificial Analysis am 1. September 2026 seinen Bericht zu Claude Fable 5.1 veröffentlichte, erzielte es 66 bei maximalem Aufwand auf seinem Intelligence Index und nannte dies die höchste Bewertung, die es gemessen hatte – vor Claude Opus 5 mit 63 und GPT-5.6 Sol mit 61. Auf dem Index in der am 24. September 2026 aufgeführten Fassung erscheint dasselbe Modell bei 53 bei maximalem Aufwand mit Fallback, und Opus 5.5 erscheint bei 58 in der entsprechenden Konfiguration. Der Bericht vom 22. September zu Opus 5.5 bezeichnet 58 als „die höchste Bewertung, die wir mit mehreren Punkten Vorsprung gemessen haben“.
Diese beiden Aussagen können nicht zugleich auf einer Skala wahr sein, und die Auflösung besteht darin, dass sie nicht auf einer Skala stehen. Der Index ist ein lebendiges Objekt, das Artificial Analysis überarbeitet; zwei seiner veröffentlichten Artikel, fünf Wochen auseinander, platzieren dasselbe Geschwisterpaar auf entgegengesetzten Seiten des Spitzenplatzes. Das ist eine Aussage über Index-Revisionen, nicht darüber, dass eines der Modelle sich verschlechtert hat, und es bedeutet, dass die 66 und die 58 niemals nebeneinander gedruckt werden dürfen. Am selben Tag gelesen, in derselben Auflistung, in derselben gekennzeichneten Konfiguration, liegt Opus 5.5 in der aktuellen Reihenfolge fünf Punkte vor Fable 5.1 – und selbst das ist ein Vergleich innerhalb desselben Index und desselben Index-Anbieters, kein auditierter direkter Vergleich. Was sich mit Sicherheit sagen lässt, ist enger gefasst: In der aktuellen Revision des einen unabhängigen zusammengesetzten Indikators, der beide misst, ist Opus 5.5 das stärkere der beiden Anthropic-Modelle, und die bekanntere 66 von Fable 5.1 gehört zu einer früheren Revision dieses Index.
Die Einstellungen sind einen weiteren Satz wert, weil sie leicht verwechselt werden. Die 66 von Fable 5.1 und die 58 von Opus 5.5 sind beides Zeilen mit maximalem Aufwand – doch Fable 5.1s fünf Aufwands-Einstellungen umfassen beim Verbrauch an Ausgabe-Tokens eine Spanne von 11x, von 13,1 Mio. bei niedrig bis 143,7 Mio. bei max, mit Index-Werten von 58 bis 66. Ein einzelner Indexpunkt für ein Modell mit einer so großen internen Streuung ist ein schlechter Ersatz für die Zeile, die man tatsächlich ausführen würde.
Token-Kosten sind eine eigenständige Benchmark-Achse
Jede Zahl oben ist ein Score. Keine davon ist ein Gesetzentwurf, und in diesem Modell ist der Gesetzentwurf der Ort, an dem die interessante Bewegung stattfindet.
Artificial Analysis misst Claude Opus 5.5 bei maximalem Aufwand mit ungefähr 119.000 Ausgabe-Tokens pro Intelligence-Index-Aufgabe – der höchste Wert in seinem Index. Zum Vergleich, auf demselben Board mit derselben Einstellung: Claude Opus 5 etwa 73.000, Claude Fable 5.1 etwa 78.000 und GPT-6 Astra etwa 27.000. Denk-Tokens werden als Ausgabe-Tokens abgerechnet, und adaptives Denken lässt sich bei Opus 5.5 nicht abschalten, sodass die Tokens, die ein Modell zum Nachdenken aufwendet, keine Fußnote zu seinem Preis sind – sie machen den Großteil davon aus.
Rechnen Sie nach, denn der Listenpreis ist für sich genommen irreführend. Opus 5.5 wird mit 4,00 $ Eingabe / 20,00 $ Ausgabe gelistet, eine Senkung um 20 % gegenüber den 5,00 $ / 25,00 $ von Opus 5. Artificial Analysis misst Opus 5.5 bei maximalem Aufwand weiterhin mit Kosten von etwa 5,98 $ pro Index-Aufgabe gegenüber 5,86 $ für Opus 5 bei derselben Einstellung – etwas mehr, nicht weniger, denn rund 1,6-mal so viele Ausgabe-Tokens fressen die gesamte 20-prozentige Preissenkung auf und noch einiges mehr. Über den gesamten Index hinweg erzeugte Opus 5.5 260 Mio. Ausgabe-Tokens gegenüber einem Board-Median von 88 Mio., was der Evaluator als „sehr wortreich“ bezeichnet.
Die Kostenfrage entscheidet sich also vollständig über die Aufwandseinstellung, und sie funktioniert nur, wenn man sie nutzt. Bei maximalem Aufwand ist Opus 5.5 pro abgeschlossener Aufgabe ein teureres Modell als das Modell, das es ersetzt. Bei mittlerem Aufwand – dem tatsächlichen Produktstandard und dem Bereich, auf den sich Anthropics Behauptung „etwa 40 % niedrigere Kosten für typische Workloads“ bezieht – ist die Einsparung real, aber sie ist eine Aussage über einen Durchschnitt über die vom Anbieter ausgewählten Workloads, kein geprüftes Ergebnis pro Aufgabe. Die praktische Lesart: Die Preissenkung um 20 % ist ein Rabatt auf der Preisliste und eine Option am Aufwandsregler, keine automatische Einsparung. Wenn Ihr Migrationsplan „Modell-ID austauschen und Einstellungen beibehalten“ lautet, kaufen Sie die teure Version.
Was überhaupt nicht etabliert ist
Dies ist der Abschnitt, für den der Rest der Seite existiert.
• Es wurde kein unabhängiger direkter Vergleich von Claude Opus 5.5 mit einem namentlich genannten Konkurrenten bei identischem Aufwand und identischem Harness veröffentlicht.Jeder anbieterübergreifende Vergleich auf dieser Seite – Opus 5.5 vs. GPT-6 Astra, vs. GPT-5.6 Sol, vs. Claude Fable 5.1 – ist ein Vergleich zweier Tabellen, die von zwei verschiedenen Unternehmen erstellt wurden, auf zwei verschiedenen Harnesses, bei zwei verschiedenen Aufwandseinstellungen, wobei eine der beiden normalerweise das eigene Modell des Anbieters bei einer vorteilhaften Einstellung ist. In keiner öffentlich zugänglichen Quelle gibt es ein Experiment, das das Scaffold und den Aufwand über zwei Anbieter hinweg konstant hält und beide ausweist.
• Die Token-Aufteilung pro Problem wird nicht veröffentlicht. Die Gesamtzahl der Ausgabe-Token wird unabhängig gemessen, aber wie viel davon auf Denktext gegenüber Antworttext entfällt, wird von niemandem veröffentlicht, den wir finden konnten. Jede Seite, die Ihnen eine präzise Zahl der Denk-Token für dieses Modell nennt, nennt Ihnen eine Zahl, die niemand gemessen hat.
• Der größte Teil der Systemkarte wurde nicht von Dritten gebenchmarkt. SWE-bench Pro 89,9 %, Multilingual 93,9 %, DeepSWE v1.1 74,2 %, ProgramBench 91,2 %, OfficeQA 78,9 %, HealthBench Professional 65,6 % längenbereinigt, GMMLU 94,3 %, ArXivMath 96,9 % mit Tools – alle vom Anbieter angegeben, keine davon zum Zeitpunkt des Verfassens unabhängig reproduziert.
• Die wichtigste Kennzahl von Terminal-Bench 4.0 steht nicht auf der öffentlichen Bestenliste.Oben bereits erwähnt, und sie gehört auch in diese Liste: Die meistzitierte Zahl über dieses Modell ist eine, die niemand außerhalb des Anbieters ausgeführt hat.
• Anthropic berichtet, dass Claude Opus 5.5 „oft vermutet, dass es evaluiert wird“ – die eigenen Worte des Unternehmens, vorgebracht als Einschränkung seiner Sicherheitsbewertung. Nehmen Sie das ernst: als Messproblem, nicht als Kuriosität. Denn wenn das Modell sich anders verhält, wenn es glaubt, getestet zu werden, dann ist jede Benchmark-Zahl auf dieser Seite – ob vom Anbieter oder unabhängig erhoben – eine Messung des Modells unter Beobachtung, und in welchem Maß diese vom Verhalten im Einsatz abweicht, ist unbekannt und nicht quantifiziert. Das gilt für die guten Zeilen wie für die schlechten gleichermaßen. Es ist der eine Vorbehalt, den noch so viel Methodik mit gleichem Aufwand nicht ausräumt.
• Sonnet 5.5 und Haiku 5.5 sind nicht verfügbar. Anthropic hat sie für „die kommenden Wochen“ angekündigt. Sie sind nicht erschienen, es gibt keine veröffentlichten Benchmarks, und nichts auf dieser Seite lässt sich auf sie übertragen.
Preis, Envelope und die Teile der Spezifikation, die Ihren Code ändern
Aus der von Anthropic veröffentlichten Preisliste vom 24. September 2026: 4,00 $ pro Million Input-Tokens, 20,00 $ pro Million Output, 0,20 $ pro Million Cache-Lesevorgänge, 5,00 $ pro Million 5-Minuten-Cache-Schreibvorgänge, 8,00 $ pro Million 1-Stunden-Cache-Schreibvorgänge und 50 % Rabatt in beide Richtungen bei der Batch API. Der Cache-Lese-Tarif ist der unauffällige — er beträgt 5 % des Basis-Inputs, während die meisten Claude-Modelle bei 10 % liegen und Fable 5.1 bei 2,5 %. Der Fast-Modus wird separat mit 8,00 $ / 40,00 $ berechnet, und Anthropic beschreibt ihn als Research Preview, nicht als allgemeine Tarifstufe.
Dies ist der Abschnitt, in dem eine Preisliste aufhört, eine Randnotiz zu sein, und zu einer Rechnung wird, die ein Router für Sie erledigen kann. Claude Opus 5.5 wird als anthropic/claude-opus-5.5 auf OrcaRouter zum selben Preis von 4,00 $ / 20,00 $ bereitgestellt, wobei Listenpreise mit 0 % Aufschlag durchgereicht werden — ändert Anthropic also einen Preis, gilt hier genau dieser Preis, noch am selben Tag und ohne Preisumstellungsverzögerung, die man einplanen müsste. Die Größen, die über die tatsächliche Rechnung entscheiden, sind die, die der Katalog neben dem Preis mitführt: der Cache-Lesevorgang für 0,20 $ bei 5 % des Basis-Inputs gegenüber 2,5 % bei Fable 5.1, das Kontextfenster von 1 Mio. Token und die Ausgabegrenze von 128K. Weil der Effort-Parameter der Punkt ist, an dem sich die Kosten dieses Modells tatsächlich bewegen – ein Index-Ausschlag von 16 Punkten und rund 119.000 Ausgabe-Token pro Aufgabe bei max gegenüber etwa 73.000 bei Opus 5 –, ist die Migration, die Geld spart, diejenige, mit der Sie den Effort pro Workload statt pro Konto regeln und die Opus-5.5-Route hinter ein automatisches Failover legen können, während Sie messen, welche Einstellung Ihr Traffic möchte.
• Envelope — 1M-Token-Kontext, maximale Ausgabe von 128K, 300K Ausgabe in der Batch-API hinter dem output-300k-2026-03-24 Beta-Header, Wissensstichtag Juni 2026, Außerbetriebnahme nicht vor dem 22. September 2027. Die Ausgabe ist mehr als 30 % schneller als Claude Opus 5.
• Breaking Changes gegenüber Opus 5 — Thinking kann nicht mehr deaktiviert werden; erzwungene Tool-Nutzung (ein tool_choice, das ein bestimmtes Tool benennt) gibt einen Fehler zurück; Thinking-Blöcke sind an das Modell und die Konversation gebunden, die sie erzeugt hat; das ältere computer_20251124 Computer-Use-Tool wird in der Claude API oder in Google Cloud nicht akzeptiert. Die ersten drei gelten auch für Fable 5.1. Es gibt einen stillen fünften Punkt: Text zwischen Tool-Aufrufen kommt jetzt in Thinking-Blöcken an, deren Text bei der Standardanzeigeeinstellung leer ist, sodass eine UI, die diesen Text als Fortschrittsanzeige streamt, verstummt, ohne dass irgendetwas einen Fehler meldet.
• Safeguard-Routing, noch einmal, weil es ein Spezifikationspunkt und keine Fußnote ist — die meisten Cybersicherheitsanfragen gehen an Claude Opus 4.8 und Biologie-Arbeiten fallen auf Claude Opus 5 zurück, es sei denn, das Konto ist verifiziert. Bei diesen Evaluierungen stammt die Antwort, die Sie erhalten, möglicherweise überhaupt nicht von Opus 5.5, sodass die veröffentlichten Ergebnisse zu Cyber- und Bio-nahen Benchmarks keine sauberen Messungen dieses Modells sind.
• Effizienzangaben, alle vom Anbieter berichtet — etwa 40 % geringere Betriebskosten bei typischen Workloads gegenüber einer Senkung des Listenpreises um 20 %; ein ausgearbeitetes Beispiel einer Fusionsanalyse, das auf Opus 5.5 63 Minuten benötigt gegenüber 93 auf Opus 5 bei 50 % geringeren Kosten; sowie Kundenaussagen von Box (ein Drittel der Tokens, Antworten etwa 40 % weniger wortreich), Kiro (etwa die Hälfte der Tokens, 40 % weniger Aufrufe), Factory (20–25 % weniger Ausgabe-Tokens) und GitHub (unter den wenigsten Tokens und Schritten, die es gemessen hat). Dies sind Durchschnittswerte über Workloads, die der Anbieter und seine Launch-Partner ausgewählt haben. Es sind Zuschreibungen, keine geprüften Ergebnisse, und sie stehen in sichtbarem Widerspruch zu der oben genannten unabhängigen Kostenkennzahl pro Aufgabe – die selbst eine Messung bei maximalem Aufwand statt bei Standardeinstellung ist. Beides kann zutreffen; keines von beiden ist eine allgemeine Aussage über Ihren Workload.

Der Stand der Beweislage
Claude Opus 5.5 ist ein echtes Modell mit einer echten Preissenkung, einem echten Umfang von 1 Mio. Tokens Kontext und 128K Ausgabe und einer echten und folgenreichen Änderung daran, wie Denken und Aufwand konfiguriert werden. Es kommt außerdem mit einer Benchmark-Tabelle, die überwiegend Anthropic misst, einer unabhängigen Tabelle, die überwiegend ein geroutetes Deployment statt eines Checkpoints misst, und einem dokumentierten Problem der Selbstwahrnehmung, das beides untergräbt. Es wurde kein unabhängiger direkter Vergleich von Claude Opus 5.5 mit einem namentlich genannten Rivalen bei angeglichenem Aufwand und angeglichenem Harness veröffentlicht. Bis es einen gibt, lies jeden herstellerübergreifenden Vergleich auf dieser Seite als das, was er ist: zwei Anbietertabellen von zwei Unternehmen bei zwei Einstellungen, von uns Seite an Seite gestellt — und miss deine eigene Aufwands-Einstellung erneut, bevor du das Modell erneut misst.
In diesem Artikel verglichen4
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
