
Claude Sonnet 5.5 vs. Claude Opus 5.5: Die Benchmarks konvergieren, die Rechnung nicht
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Claude Sonnet 5.5 erreichte am 28. September 2026 die allgemeine Verfügbarkeit – zu 2,00 US-Dollar pro Million Input-Tokens und 10,00 US-Dollar pro Million Output-Tokens. Claude Opus 5.5, das Flaggschiff von Anthropic, erschien sechs Tage früher, am 22. September, zu 4,00 und 20,00 US-Dollar – exakt das Doppelte in beiden Zeilen. Die naheliegende Lesart ist, dass Opus 5.5 die Obergrenze darstellt und Sonnet 5.5 der Kompromiss, den man eingeht, wenn das Budget real ist. Die Launch-Tabelle von Anthropic selbst stützt diese Lesart nicht. Nach den Zahlen, die das Unternehmen veröffentlicht hat, erzielt Claude Sonnet 5.5 1844 gegenüber 1846 für Opus 5.5 bei GDPval-AA v2.1, 1811 gegenüber 1822 bei AA-Briefcase v1.1 und 70,6 % gegenüber 66,4 % bei Terminal-Bench 4.0 – es gewinnt das eine Benchmark, das tatsächlich im Terminal geleistete Arbeit misst. Zwei Zeilen unter diesen Zahlen heißt es in der Bildunterschrift von Anthropic selbst, Opus 5.5 „bleibe bei komplexer, offener Arbeit deutlich stärker". Beide Aussagen stimmen, und herauszufinden, wie man beide zugleich gelten lassen kann, ist im Wesentlichen der Zweck dieses Vergleichs.
Was die Launch-Tabelle sagt – und was sie verschweigt
Das Muster in Anthropics Benchmark-Block ist das eines Modells, das den Großteil der Lücke geschlossen hat, statt eines, das die Führung übernommen hat. GDPval-AA v2.1, ein ökonomisch gewichteter Aufgabensatz, ist ein Zwei-Punkte-Gleichstand. AA-Briefcase v1.1, eine Evaluierung von Dokumenten und Liefergegenständen, ist ein Elf-Punkte-Gleichstand. CursorBench 4.0 geht in die andere Richtung: 55,5 % für Sonnet 5.5 gegenüber 57,8 % für Opus 5.5. OSWorld 2.1 landet bei 80,1 % gegenüber 81,8 %, und Humanity's Last Exam bei 64,5 % mit Tools gegenüber 67,7 %. Nur Terminal-Bench 4.0 durchbricht das Muster, und zwar deutlich – 70,6 % gegenüber 66,4 %, ein Vier-Punkte-Vorteil für Sonnet bei agentischer Kommandozeilenarbeit.
Lies die Zeilenbeschriftungen statt der Zahlen, und etwas anderes tritt zutage. Mehrere dieser Einträge zu Opus 5.5 tragen eine Effort-Anmerkung – 66,4 % bei Xhigh –, und eine Fußnote besagt, dass die Max-Konfiguration bei FrontierCode niedriger als Xhigh abschneidet, nicht höher. Höherer Aufwand ist nicht monoton. Ein budgetbewusstes Team, das annimmt, „max effort“ sei ein kostenloses Upgrade, kauft Token für eine schlechtere Antwort in mindestens einem der eigenen Tests von Anthropic. Und bei FrontierCode 1.1 stellt dieselbe Fußnote Sonnet 5.5 mit 46,2 % in der Max-Konfiguration Opus 5.5 mit 54,4 % gegenüber, was die klarste einzelne Zahl dafür ist, wo das Flaggschiff noch davonzieht: langfristige Codearbeit unter einer Aufgabendefinition, die Beharrlichkeit belohnt.
Es gibt noch einen weiteren Vorbehalt, den man besser offen ausspricht, anstatt ihn zu vergraben. Anthropic weist darauf hin, dass die von ihm veröffentlichten GDPval-AA- und AA-Briefcase-Läufe auf einem Pre-Release-Deployment ausgeführt wurden, das einen Bug bei strukturierten Ausgaben enthielt. Das betrifft beide Modelle in derselben Tabelle, sodass der Vergleich dadurch nicht ungültig wird, aber es bedeutet, dass die absoluten Zahlen als Momentaufnahme und nicht als gesichertes Ergebnis behandelt werden sollten. Benchmark-Tabellen von Anbietern sind Marketing-Artefakte mit einem Methodik-Anhang, und diese hier kommt mit angehängtem Anhang daher.
Wo die unabhängige Messung landet
Artificial Analysis bewertet beide Modelle unter einem einzigen Harness, in derselben Konfiguration, die es als „Adaptive Reasoning, Max Effort, Default Fallback“ bezeichnet, auf dem Intelligence Index v4.3. Claude Opus 5.5 liegt bei 58. Claude Sonnet 5.5 liegt bei 56. Das ist eine Lücke von zwei Punkten auf einer Skala, auf der derselbe Evaluator Opus 5 bei 51, Sonnet 5 bei 38, DeepSeek V4 Pro bei 36 und Gemini 3.1 Pro Preview bei 30 einordnet. Dass ein neues Sonnet zwei Punkte unter dem Flaggschiff und fünf Punkte über der vorherigen Opus-Generation landet, ist die substanzielle Behauptung dieses Releases, und es ist eine Behauptung von dritter Seite, nicht des Anbieters.
Dann kehrt dieselbe Seite die wirtschaftliche Logik davon um. Artificial Analysis berichtet, dass ein Evaluierungslauf von Sonnet 5.5 7,60 $ pro Aufgabe kostet, gegenüber 5,98 $ für Opus 5.5, obwohl Sonnet 5.5 pro Token nur halb so viel kostet. Die Ursache steht direkt auf der Seite: Sonnet 5.5 erzeugte über die Index-Suite hinweg 410 Millionen Token, gegenüber einem Median von 88 Millionen bei den von ihr verfolgten Modellen – „sehr wortreich“, in den Worten des Evaluators. Opus 5.5 erzeugte über dieselbe Suite 260 Millionen. Bei 10 $ pro Million Output-Token gegenüber 20 $ lässt der Wortreichheitsfaktor von ungefähr 1,6 Sonnet 5.5 immer noch etwa 27 % mehr pro abgeschlossener Aufgabe zahlen.
Dies ist der Teil des Vergleichs, den Ihnen eine Preisliste pro Token nicht zeigen kann, und es ist der Grund, warum die beiden Zahlen ohne Widerspruch nebeneinander bestehen. Pro Token ist Sonnet 5.5 um die Hälfte günstiger. Pro abgeschlossener Aufgabe kann es auf einer Evaluierungs-Suite mit offenen Prompts und ohne Disziplin bei der Ausgabelänge teurer sein. Welche davon auf Ihren Workload zutrifft, ist die eigentliche Entscheidung.
Aufwandsstufen, Ausgabeobergrenzen und die Ausgestaltung der Integration
Für einen Käufer sind die mechanisch wichtigen Eigenschaften bei diesen beiden Modellen nahezu identisch.
• Kontext — 1,000,000 Token bei beiden, vom selben Anbieter, sodass Annahmen zum Prompt-Engineering unverändert übertragen werden.
• Maximale Ausgabe — 128.000 Tokens bei beiden; Massengenerierung ist hier kein Unterscheidungsmerkmal
• Modalität — Text-, Bild- und Dateieingabe bei beiden; keines akzeptiert Audio oder Video
• Reasoning-Steuerung — adaptives Denken bei beiden, wobei die Tiefe durch einen Effort-Parameter statt durch ein Denk-Token-Budget festgelegt wird. Auf der Claude Platform ist der Standard hoch; in den Claude apps ist er mittel
• Cache-Schreibvorgang — 5,00 $ pro Million für Claude Opus 5.5 gegenüber 2,50 $ für Claude Sonnet 5.5, die eine Zeile, in der das günstigere Modell auch das günstigere Modell ist, das man mit einem neu aufgebauten Präfix füttern kann
• Cache-Lesen — 0,20 $ pro Million bei beiden, ein exakter Gleichstand bei dem Posten, der lange Agentenläufe dominiert
Da die Oberflächen übereinstimmen, ist die Migration zwischen ihnen eine Änderung des Modell-Strings und eine Neubewertung des Aufwands, kein Integrationsprojekt. Das ist herstellerübergreifend ungewöhnlich, und es ist der Grund, warum dieses spezielle Paar überhaupt einen Vergleich wert ist: Die beiden Kandidaten unterscheiden sich im Preis und in der Tiefe, nicht in der API, die man schreiben muss.
Ein operativer Unterschied verdient eine eigene Zeile. Anthropic gibt an, dass Claude Sonnet 5.5 das erste Sonnet ist, das mit Cyber-Schutzmechanismen und Fallbacks auf Augenhöhe mit seinen Spitzenmodellen eingeführt wird, was bedeutet, dass Cybersicherheitsanfragen mit höherem Risiko sichtbar an das vorherige Sonnet weitergeleitet werden, statt von dem Modell beantwortet zu werden, das Sie genannt haben. Wenn Ihre Workload diesen Bereich berührt, ist der Modell-String keine Garantie dafür, welches Modell geantwortet hat – auf beiden Stufen. Anthropic merkt außerdem an, dass Sie, wenn Sie Sonnet mit deaktiviertem Thinking ausführen, zu einem Between-Tools-Verhalten wechseln müssen, was eine Codeänderung und kein Konfigurationsschalter ist. Nichts davon ist ein Grund, das Modell zu meiden; beides sind Gründe, es zu wissen, bevor Sie ausliefern.
Auf OrcaRouter ist Claude Opus 5.5 heute mit denselben Zugangsdaten erreichbar wie jedes andere Modell im Katalog, zum Listenpreis des Anbieters mit 0 % Aufschlag, wobei darunter ein automatisches Failover verfügbar ist. Claude Sonnet 5.5 ist noch keine Route auf unserer Plattform – das Modell ist einen Tag alt, und solange es nicht gelistet ist, ist die ehrliche Aussage, dass man es über Anthropics eigene API erreichen würde. Wer Opus 5.5 derzeit über uns laufen lässt, kann den Wechsel an dem Tag kalkulieren, an dem er verfügbar wird, ohne sonst irgendetwas an der Integration zu ändern.
Welche wohin
Die Aufteilung, die sich aus den Zahlen ergibt: Claude Sonnet 5.5 für terminalgebundene Agentenarbeit, wo es bei Anthropics eigener Terminal-Bench-4.0-Zahl das stärkere der beiden und halb so teuer ist; Claude Sonnet 5.5 für alles, was auf Durchsatz ausgelegt ist, da sich der Kostenunterschied nur verringert, wenn die Aufgabe lange Ausgaben erzwingt; Claude Opus 5.5 für Arbeit der FrontierCode-Klasse, langfristige Refactorings über große Codebasen hinweg und jede Workload, bei der der Abstand von 54,4 % zu 46,2 % die Gestalt Ihres tatsächlichen Problems widerspiegelt und nicht eine Leaderboard-Zeile.
Wenn Ihre Aufgaben offen gestaltet sind und Sie die Ausgabelänge nicht vorhersagen können, betrachten Sie den Preis pro Token als völlig falsche Zahl. Messen Sie eine Woche lang Token pro abgeschlossener Aufgabe in Ihrem eigenen Traffic, bevor Sie sich in die eine oder andere Richtung festlegen; die artificial-analysis-Zahl von 7,60 $ gegenüber 5,98 $ ist eine Warnung, dass das günstige Modell bei der Kennzahl verlieren kann, die Sie tatsächlich bezahlen.
Das ehrliche Fazit: Das ist kein Trade-off zwischen Leistungsfähigkeit und Kosten mehr. Es ist die Frage, ob Ihre Arbeit begrenzt ist. Für begrenzte, volumenstarke, werkzeuggestützte Aufgaben ist das günstigere Modell nach der verfügbaren Evidenz auch das bessere, und das Flaggschiff ist nicht das Doppelte wert. Für offene, langfristig angelegte Arbeit ist Anthropics eigener Satz – dass Opus 5.5 weiterhin eindeutig stärker bleibt – derjenige, dem man glauben sollte, und keine noch so große Benchmark-Konvergenz ändert daran bisher etwas.



