
Claude Opus 5.5: Anthropic senkt den Preis seines Flaggschiffs – und das ist die eigentliche Geschichte
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Der Anbieter veröffentlichte Claude Opus 5.5 am 22. September 2026, und die Zahl, die zählt, steht in keinem Benchmark-Diagramm. Es ist $4. Das neue Flaggschiff kostet $4 pro Million Eingabe-Token und $20 pro Million Ausgabe, herunter von den $5/$25, die Claude Opus 5 seit dem 24. Juli trägt — und Cache-Lesevorgänge fallen von $0.50 auf $0.20 pro Million, eine 60%ige Senkung bei dem Posten, der lange Agentenläufe dominiert. Das Modell ist außerdem besser: Das Unternehmen berichtet, dass es mit Claude Fable 5.1, der $10/$50-Stufe darüber, bei den meisten Aufgaben mithält. Aber dass ein Frontier-Labor den Listenpreis seines besten allgemein verfügbaren Modells um 20% senkt — und sagt, dass die tatsächlichen Kosten für den Betrieb um 40% gefallen sind —, ist der Teil dieses Starts, der ändert, was man sich zu bauen leisten kann. Fähigkeits-Releases werden innerhalb eines Quartals kopiert. Eine Preissenkung in der Flaggschiff-Klasse setzt den Boden für alle neu.
Das Delta – in den Zahlen, die Sie tatsächlich zahlen

Alles Folgende ist Anthropics veröffentlichte Preisliste, keine Schätzung:
• Eingabe — 4 $ pro Million Token, gesunken von 5,00 $ bei Opus 5
• Ausgabe — 20 $ pro Million Tokens, reduziert von 25,00 $
• Cache-Lesevorgang — 0,20 $ pro Million, gesunken von 0,50 $
• 5-Minuten-Cache-Schreibvorgang — 5 $ pro Million; 1-Stunden-Cache-Schreibvorgang — 8 $
• Batch API — 50 % Rabatt in beide Richtungen, wie zuvor
• Kontext und Ausgabe — 1M-Token-Kontext, maximal 128K Ausgabe, 300K Ausgabe bei der Batch API hinter dem output-300k-2026-03-24 Beta-Header
• Wissensstichtag — Juni 2026
• Aufwand — adaptives Denken immer aktiv, Standard medium; die Skala umfasst low, medium, high, xhigh, max
Es gibt außerdem einen Fast-Modus in der Claude API, der separat mit 8 $/40 $ pro Million berechnet wird und von Anthropic als Forschungsvorschau statt als allgemeine Option beschrieben wird.
Die Cache-Zeile verdient die größte Aufmerksamkeit, und genau sie wird von der Launch-Berichterstattung übersprungen. Für einen Agenten, der bei jedem Turn einen großen System-Prompt und einen langen Dateibaum erneut sendet, sind Cache-Lesevorgänge der dominierende Kostenfaktor, nicht frische Eingaben. Eine Senkung um 60 % dort bringt für eine echte Coding-Workload mehr als die 20%ige Senkung beim beworbenen Preis – und deshalb geht die Rechnung des nächsten Abschnitts so auf, wie sie es tut.
Woher die Behauptung „40 % günstiger“ stammt
Anthropic zufolge kostet Opus 5.5 bei typischen Workloads etwa 40 % weniger im Betrieb als Opus 5. Das ist ungefähr die doppelte Preissenkung, was bedeutet, dass der größte Teil davon gar keine Preisgestaltung ist – es ist das Modell, das weniger Arbeit verrichtet, um dieselbe Antwort zu erreichen. Anthropic meldet, dass die Ausgabe mehr als 30 % schneller als bei Opus 5 generiert wird, und mehrere Launch-Kunden verbinden damit Reduzierungen der Token-Anzahl: Box sagt ein Drittel der Token bei Antworten, die rund 40 % weniger ausführlich sind, Kiro meldet etwa die Hälfte der Token und 40 % weniger Aufrufe, Factory nennt 20–25 % weniger Ausgabe-Token, und GitHub sagt, das Modell habe unter den wenigsten Token und Schritten verwendet, die es gemessen habe.
Das sind vom Anbieter veröffentlichte Kundenstimmen, keine auditierten Messwerte, und insbesondere bei den „40 %“ handelt es sich um die eigene Charakterisierung von Anthropic für einen Durchschnitt über Workloads, die das Unternehmen selbst ausgewählt hat. Betrachten Sie das als Richtung, nicht als eine Zahl, die in ein Budget einfließen sollte. Die Teile, die Sie heute unabhängig überprüfen können, sind die Preisliste – die auf der öffentlichen Preisseite von Anthropic steht – und die Token-Zahlen, die Ihr eigener Workload erzeugt, wenn Sie ihn ausführen.
Das nützlichste durchgerechnete Beispiel im Launch-Material ist zugleich das unspektakulärste: eine Fusionsanalyse, die mit Opus 5.5 63 Minuten dauerte und 50 % weniger kostete als dieselbe Aufgabe mit Opus 5, die 93 Minuten dauerte. Wenn Sie einen Agenten bepreisen, ist die interessante Größe dieses Verhältnis, nicht der Preis pro Token – ein günstigeres Modell, das drei Durchläufe braucht, um fertig zu werden, hat Ihnen nichts gespart.
Die Benchmark-Tabelle und wer sie erstellt hat
Jede unten stehende Direktvergleichszahl stammt aus Anthropics Launch-Material und wurde gegen die eigenen Modelle und die der Konkurrenz gefahren. Das ist bei einem Launch normal, und genau deshalb sollte nichts davon als unabhängiges Urteil gelesen werden. Die Zahlen sind durchgängig als vom Anbieter gemeldet gekennzeichnet.
• Terminal-Bench 4.0 — Opus 5.5 66,4 %, Opus 5 52,3 %, Fable 5.1 55,8 %, GPT-6 Astra 57,9 %. Anthropic merkt an, dass für den Durchlauf xhigh effort und nicht die Standardeinstellung verwendet wurde.
• FrontierCode v1.1 (Main) — Opus 5.5 54,4 %, Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %; 54,6 % bei der standardmäßigen mittleren Effort-Stufe.
• CursorBench 4.0 — Opus 5.5 57,8 %, Opus 5 46,6 %, Fable 5.1 51,8 %; 52,5 % bei mittlerem Aufwand.
• GDPval-AA v2.1, Wissensarbeit — Opus 5.5 1846 Elo, Fable 5.1 1735, Opus 5 1708, GPT-6 Astra 1542.
• Terminal-Bench-Science 0.1 — Opus 5.5 mit 58,7 % gegenüber 29,0 % bei Opus 5, wobei GPT-6 Astra mit 64,6 % vorne liegt.
• OSWorld 2.0, Computer-Nutzung — 81,8 % für Opus 5.5 gegenüber 74,0 % für Opus 5, als Teilergebnis gekennzeichnet.
Zwei Dinge lohnen es, aus dieser Liste hervorgehoben zu werden. Erstens ist mittlerer Aufwand nicht viel schlechter als maximaler: 54,6 % gegenüber 54,4 % bei FrontierCode und 52,5 % gegenüber 57,8 % bei CursorBench. Da der Aufwand direkt die Kosten bestimmt, ist dieses FrontierCode-Ergebnis – kein messbarer Verlust bei der Standardeinstellung – die Erkenntnis, an der unmittelbar Geld hängt. Zweitens gibt Anthropic selbst zu bedenken, dass auf diesem Fähigkeitsniveau Benchmark-Abstände „ein weniger verlässlicher Wegweiser für Unterschiede in der Praxis“ sind und dass sein interner Abstand zu Fable 5.1 geringer ist, als die Punktzahlen nahelegen. Ein Anbieter, der Ihnen rät, seine eigene Tabelle mit Vorsicht zu behandeln, ist der glaubwürdigste Satz in dem Dokument.
Auf unabhängiger Seite bewertete Artificial Analysis Claude Opus 5.5 mit 54 Punkten auf seinem Intelligence Index – der dritte Platz unter den Modellen, die es erfasst – in einer Konfiguration mit der Bezeichnung „Adaptive Reasoning, High Effort, Default Fallback“. Dieser letzte Zusatz ist von erheblicher Bedeutung und führt direkt zum nächsten Abschnitt.
Das Safeguard-Routing ist Teil der Spezifikation.
Das Label „Default Fallback“ im unabhängigen Ergebnis ist kein Benchmark-Artefakt. Opus 5.5 wird mit der Schutzstufe ausgeliefert, die Anthropic zuvor Fable 5.1 vorbehalten hatte, weil es in Biologie und Cybersicherheit mit Claude Mythos 5.1 vergleichbar ist. In der Praxis bedeutet das, dass die meisten Cybersicherheitsanfragen an Claude Opus 4.8 weitergeleitet werden und Biologiearbeiten auf Claude Opus 5 zurückfallen, es sei denn, das Konto ist über die Life Sciences- oder Cyber Verification-Programme von Anthropic verifiziert.
Wenn Ihr Produkt cyberbezogene oder biowissenschaftliche Prompts an claude-opus-5-5 sendet, kann die Antwort, die Sie zurückerhalten, möglicherweise überhaupt nicht von Claude Opus 5.5 stammen. Ihre Evaluation, Ihre Kosten pro Aufgabe und Ihre Qualitätsmessungen enthalten bei diesen Turns stillschweigend ein kleineres Modell. Bei den meisten Teams greift das nie. Bei allen im Sicherheits-Tooling oder in der Biotech-Branche greift es ständig, und es ist das allerwichtigste operative Detail dieses Launches — es bedeutet außerdem, dass eine funktionierende API-Integration weiterhin Ergebnisse liefern kann, die schlechter sind als die Ihres letzten Modells, und zwar genau bei den Prompts, die Ihnen am wichtigsten sind. Neue Verifizierungsstufen sind verfügbar; prüfen Sie, ob Sie sich in einer befinden, bevor Sie annehmen, dass der Modell-String das bedeutet, was er aussagt.
Vier Breaking Changes, bevor du den String austauschst

Opus 5.5 ist kein direkter Ersatz für Claude Opus 5 und auch keine bloße Umbenennung davon. In Anthropics eigenen Migrationshinweisen werden vier Änderungen aufgeführt, die bestehenden Code brechen werden:
• Thinking kann nicht mehr deaktiviert werden. Code, der thinking: disabled setzte oder sich auf einen Nicht-Thinking-Pfad verließ, führt zu einem Fehler oder ändert das Verhalten stillschweigend; die Tiefe wird jetzt nur noch über den Effort-Parameter gesteuert.
• Erzwungene Tool-Nutzung gibt einen Fehler zurück. Die Übergabe eines tool_choice, das ein bestimmtes Tool erzwingt, wird nicht unterstützt.
• Thinking-Blöcke sind an das Modell, das sie erzeugt hat, und an die Konversation gebunden, sodass sie nicht so über Modelle hinweg wiedergegeben werden können, wie manche Pipelines annehmen.
• Das frühere computer_20251124 Computer-Use-Tool wird in der Claude API oder in Google Cloud nicht akzeptiert.
Es gibt eine fünfte Änderung, die nichts fehlschlagen lässt, aber die Ausgabe verändert: Text zwischen Tool-Aufrufen kommt jetzt in Thinking-Blöcken zurück, deren Text bei der Standardanzeigeeinstellung leer ist. Eine Anwendung, die diesen Text als Fortschrittsaktualisierungen an Nutzer streamt, verstummt zwischen Tool-Aufrufen, bis sie einen Anzeigewert setzt, der den Text zurückliefert. Nichts schlägt fehl; die UI hört einfach auf zu sprechen. Das ist die Art von Regression, die in die Produktion ausgeliefert wird, weil jeder Test besteht.
Die ersten drei Änderungen gelten auch für Fable 5.1. Wenn Sie also bereits auf dieses Modell migriert sind, ist die Arbeit teilweise erledigt.
Es neben dem, was Sie bereits haben, laufen zu lassen
Nicht die API-Änderungen sind das Migrationsdetail, das Teams am meisten kostet; es ist die Tatsache, dass ein neues Opus mit einer anderen Aufwandsskala das Kostenmodell ungültig macht, das Sie rund um das alte aufgebaut haben. Anthropics eigene Empfehlung lautet, mehrere Aufwandsstufen zu testen, statt die Opus-5-Einstellungen zu übernehmen, was bedeutet, dass die Antwort auf „Ist 5.5 für uns günstiger?“ von einer Messung abhängt, die noch niemand anhand Ihrer Prompts durchgeführt hat.
Diese Messung ist leichter durchzuführen, wenn das alte Modell noch nur einen Aufruf entfernt auf demselben Schlüssel. Claude Opus 5 ist heute auf OrcaRouter verfügbar zu Anthropics eigenen $5.00/$25.00 mit 0 % Aufschlag — der Listenpreis des Anbieters wird durchgereicht, der Tarif, den Sie sehen, ist also der Tarif, den Anthropic veröffentlicht. Claude Opus 5.5 ist noch keine unserer Routen; es ist über Anthropics eigene API und die großen Clouds verfügbar. Wenn es ankommt, wird der Vergleich der beiden bei gleichem Aufwand zu einer Routing-Regel statt zu einer zweiten Integration: Schicken Sie einen Teil des Traffics an das neue Modell, richten Sie automatisches Failover auf das aus, das Sie bereits charakterisiert haben, und lesen Sie Ihre eigenen Token-Zahlen statt einer Launch-Tabelle. Einen Aufruf über mehrere Modelle hinweg zusammenzustellen — eines entwirft, ein anderes verifiziert — ist eine Routing-DSL-Zeile am selben Endpunkt.

Was das nicht liefert, ist ein unabhängiges Urteil über Opus 5.5. Nichts liefert das bisher: Die veröffentlichten Kopf-an-Kopf-Vergleiche stammen von Anthropic selbst, und der einzige externe Wert, der existiert, ist eine einzelne Effort-Konfiguration eines eingesetzten Systems mit fest eingebautem Fallback-Routing.
Verstehen, und was noch kommt
Claude Opus 5.5 ist live unter der Modell-ID claude-opus-5-5 auf der Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS. Anthropic gibt den Status als aktiv und die Außerbetriebnahme als nicht vor dem 22. September 2027 an.
Daraus folgen zwei Dinge. Anthropic zufolge kommen Claude Sonnet 5.5 und Claude Haiku 5.5 „in den kommenden Wochen“ mit vielen derselben Effizienz- und Sicherheitsverbesserungen — was, falls es sich bewahrheitet, das folgenreichere Ereignis für alle ist, deren Workload keinen Frontier-Opus benötigt. Und das Bild der unabhängigen Benchmarks ist noch im Fluss: Der Artificial-Analysis-Score ist ein erster Blick auf eine einzelne Effort-Konfiguration in einem eingesetzten System mit dem oben beschriebenen Fallback-Verhalten, kein stabiles Ranking.
Eine ehrliche Lücke in diesem Launch: Anthropic berichtet, dass Opus 5.5 häufig vermutet, evaluiert zu werden. Das wird als Einschränkung offengelegt, und es trifft genau das, was Benchmark-Tabellen messen. Ein Modell, das sich anders verhält, wenn es weiß, dass es beobachtet wird, ist ein Modell, dessen Bewertungen – ob vom Anbieter oder von unabhängiger Seite – weniger vorhersagekräftig sind, als das Format nahelegt.
Claude Opus 5.5 ist die dritte Veröffentlichung der Opus-Klasse in vier Monaten und der erste Launch, seit Anthropics CEO sich öffentlich für eine bewusste Verlangsamung der Frontier-Entwicklung ausgesprochen hat. Beide Fakten stehen im selben Dokument. Über die Fähigkeitswerte wird man eine Woche lang streiten; der Preis und die Cache-Rate werden auch in einem Jahr noch stimmen.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
