
Claude Sonnet 5.5 vs. Claude Opus 5: In jeder Zeile günstiger und beim Index voraus
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Claude Opus 5 erschien am 24. Juli 2026 für $5.00 pro Million Input-Tokens und $25.00 pro Million Output-Tokens. Claude Sonnet 5.5 erreichte am 28. September 2026 die allgemeine Verfügbarkeit für $2.00 und $10.00. Das ist eine Senkung um 60 % beim Input und um 60 % beim Output für ein Modell, das zwei Generationen neuer ist – und, gemessen mit dem Harness, den Artificial Analysis für beide einsetzt, ein Modell, das auf dem Intelligence Index v4.3 bei 56 landet, gegenüber 51 bei Claude Opus 5. Dies ist der seltene Vergleich, bei dem das neuere, günstigere Modell zugleich das auf einem Drittanbieter-Index höher bewertete ist und bei dem das verbleibende Argument für das etablierte Modell nicht der Benchmark-Rang ist, sondern eine bestimmte Klasse von Arbeit. Beide Modelle haben 1M Tokens Kontext, beide geben bis zu 128K Tokens aus, beide lesen Text, Bilder und Dateien, und beide konfigurieren das Reasoning über einen Effort-Parameter statt über ein Thinking-Token-Budget. Da die Oberflächen identisch sind, ist die Wahl zwischen ihnen eine reine Frage dessen, was eine erledigte Aufgabe kostet und welche Aufgaben fehlschlagen.
Zwei Releases, eine Oberfläche
Fang damit an, wie wenig sich ändert, denn es ist mehr als bei den meisten Generationssprüngen.
• Kontextfenster — 1.000.000 Tokens bei beiden
• Maximale Ausgabe — 128.000 Tokens auf beiden
• Eingabemodalität – Text, Bild und Datei bei beiden; weder Audio noch Video bei einer der beiden
• Reasoning — adaptives Denken mit konfigurierbarem Aufwand bei beiden, sodass die Tiefe ein Anfrageparameter und kein separater Modell-String ist
• Fähigkeiten – Vision, Tools, JSON und Reasoning bei beiden, laut den OrcaRouter-Katalogeinträgen für anthropic/claude-opus-5 und die Sonnet-Reihe
Die praktische Konsequenz ist, dass ein für Claude Opus 5 geschriebener Prompt nicht umgeschrieben werden muss, um auf Claude Sonnet 5.5 zu laufen, und eine Agenten-Schleife, die auf eine 128K-Ausgabegrenze abgestimmt ist, keine neue Stufe benötigt. Die Migration ist ein Austausch der Modell-Zeichenkette plus eine erneute Prüfung, welche Effort-Einstellung man festgelegt hatte — mehr nicht. Für Teams, die die multimodalen, multiparametrigen Übergänge der letzten zwei Jahre miterlebt haben, ist das die Schlagzeile, nicht der Benchmark.
Das Einzige, das sich tatsächlich ändert, ist der Preis, und er ändert sich bei jedem statt nur bei den beiden auf der Marketing-Folie.
• Eingabe — 2,00 $ pro Million gegenüber 5,00 $, eine Senkung um 60 %
• Ausgabe — 10,00 $ pro Million gegenüber 25,00 $, eine Senkung um 60 %
• Cache-Lesevorgang — 0,20 $ pro Million gegenüber 0,50 $, eine Senkung um 60 %
• Cache-Schreibvorgang — 2,50 $ pro Million gegenüber 10,00 $ für das Fünf-Minuten-Fenster, eine Senkung um 75 %
Wenn Sie einen Agenten betreiben, der bei jeder Runde ein langes Präfix erneut liest, ist die Cache-Lesezeile diejenige, die die Migration bezahlt. Bei $0,20 gegenüber $0,50 kostet jedes gecachte Token in einer langen Sitzung nur noch 40 % seiner früheren Kosten, und Cache-Lesevorgänge machen in den meisten agentischen Schleifen den Großteil der Token-Anzahl aus. Die Ersparnis summiert sich auf eine Weise, die die Pro-Token-Schlagzeile nicht erfasst.
Woher die fünf Punkte kommen
Artificial Analysis bewertet Claude Sonnet 5.5 mit 56 und Claude Opus 5 mit 51 auf dem Intelligence Index v4.3, beide gemessen unter der Konfiguration „Adaptive Reasoning, Max Effort“. Fünf Punkte sind auf dieser Skala kein Rundungsfehler – zum Vergleich: Derselbe Evaluator ordnet Sonnet 5 bei 38 und Gemini 3.1 Pro Preview bei 30 ein, sodass der Abstand zwischen Claude Opus 5 und Claude Sonnet 5.5 ein Drittel des Abstands zwischen Claude Opus 5 und der vorherigen Sonnet-Generation beträgt.
Anthropics eigene Launch-Zahlen für Claude Sonnet 5.5 weisen mit einem anderen Instrument in dieselbe Richtung. Das Unternehmen meldet 70,6 % auf Terminal-Bench 4.0 – derselbe Test, für den Claude Opus 5 in einer früheren Anthropic-Tabelle mit 89,1 % dokumentiert ist, ein Wert, der auf einer anderen Harness-Revision beruhte und nicht von dem neueren abgezogen werden sollte. Das ist der mit Abstand wichtigste Hinweis zur Quellenangabe in diesem Artikel: Terminal-Bench wechselte im Verlauf des Jahres 2026 auf 4.0, der Index, der ihn führt, wurde passend dazu auf v4.3 überarbeitet, und versionsübergreifende Vergleiche dieses Benchmarks sind nicht einfach Arithmetik. Wenn an einer Zahl eine Version hängt, geben Sie die Version mit an.
Sauber vergleichen lässt sich die anbietereigene Entwicklung auf der Sonnet-Seite – 10,3 % auf Terminal-Bench 4.0 für Sonnet 5 bis 70,6 % für Sonnet 5.5 – sowie die Messung des Drittanbieter-Index, bei der beide Werte vom selben Harness am selben Tag stammen. Auf dieser Grundlage hat der Nachfolger das Juli-Flaggschiff beim allgemeinen Schlussfolgern tatsächlich überholt, was eine stärkere Behauptung ist, als sie irgendeine Anbieterfolie aufstellt.
Die Ausgabelängen-Falle
Hier ist der Punkt, an dem die Arithmetik nicht mehr freundlich zum neueren Modell ist.
Artificial Analysis berichtet, dass die Evaluierung von Claude Sonnet 5.5 in seiner Index-Suite 7,60 US-Dollar pro Aufgabe kostet. Claude Opus 5 kostet 5,86 US-Dollar pro Aufgabe in derselben Suite. Das neuere Modell ist – bei 60 % Rabatt auf jede Position der Preisliste – rund 30 % teurer darin, eine Aufgabe abzuschließen. Der Grund steht im selben Bericht: Sonnet 5.5 gab in der Suite 410 Millionen Tokens aus, gegenüber einem Median von 88 Millionen bei den erfassten Modellen, was der Evaluator als „sehr wortreich“ bezeichnet. Claude Opus 5 gab in derselben Suite 140 Millionen aus.
Rechnet man es durch, ist der Mechanismus einfach. Sonnet 5.5 erzeugt bei identischer Arbeit ungefähr dreimal so viele Ausgabe-Tokens wie Claude Opus 5, zu 40 % des Ausgabepreises. Dreimal 0,4 ist 1,2 — eine Strafe von 20 % vor Cache-Effekten, was in der Größenordnung des Ergebnisses von 7,60 $ gegenüber 5,86 $ liegt. Der Preis pro Token ist nicht falsch; er ist nur nicht die Zahl, die die Rechnung bestimmt.
Dies macht das neuere Modell nicht zum schlechteren Kauf. Es macht die Entscheidung von etwas abhängig, das die meisten Vergleiche auslassen: ob Ihre Workload es zulässt, die Ausgabe zu begrenzen. Ein Zusammenfassungsjob mit Längenvorgabe, eine Pipeline zur strukturierten Extraktion, die JSON erzeugt, ein Klassifikator, der ein Label zurückgibt – in all diesen Fällen schlägt die Weitschweifigkeit nie zu Buche, und der Rabatt von 60 % auf der Preisliste ist echtes Geld. Ein Agent mit offenem Auftrag, dem ohne Ausgabedisziplin die Aufgabe „Repariere das Repo“ gestellt wird, gibt Sonnet 5.5 dreimal so viel Leine.
Aufwands-Einstellungen und die Migration, die niemand einkalkuliert
Beide Modelle machen die Reasoning-Tiefe über einen Effort-Parameter mit mehreren Stufen verfügbar, und beide liefern standardmäßig einen Default statt eines festen Werts — high auf der Claude Platform, medium in den Claude-Apps. Bei einer Migration ist die Versuchung groß, die Einstellung dort zu belassen, wo sie beim alten Modell war, und die Sache als erledigt zu betrachten.
Das ist aus einem messbaren Grund ein Fehler. Anthropics eigene Fußnote zu Claude Sonnet 5.5 besagt, dass die Max-Effort-Konfiguration bei FrontierCode schlechter abschneidet als Xhigh, was bedeutet, dass Effort kein monotoner Regler ist und die höchste Einstellung kein kostenloses Upgrade darstellt. Lege den Effort anhand der Messung deiner Aufgabe fest, nicht indem du die teuerste verfügbare Option wählst.
Es gibt außerdem einen harten Verhaltensunterschied auf der Sonnet-Seite, den man vor einem Rollout kennen sollte. Anthropic gibt an, dass Claude Sonnet 5.5 das erste Sonnet ist, das mit Cyber-Schutzmechanismen und Fallbacks ausgeliefert wird, die mit seinen Top-Tier-Modellen übereinstimmen, sodass Sicherheitsanfragen mit höherem Risiko sichtbar auf das frühere Sonnet zurückfallen, anstatt von dem von Ihnen benannten Modell bedient zu werden. Wenn Ihre Workload in diesem Bereich liegt, werden Ihre Logs ein Modell anzeigen, das Sie nicht angefordert haben. Claude Opus 5 stammt aus der Zeit vor dieser Regelung in der Sonnet-Reihe, obwohl dieselbe Art von Routing in Anthropics Produkt für Biologie- und Cybersicherheitsarbeiten auf den Flaggschiff-Ebenen existiert.
Auf OrcaRouter sind heute beide Endpunkte live — anthropic/claude-opus-5 und anthropic/claude-sonnet-5 stehen im selben Katalog wie alles andere, zum Listenpreis des Anbieters mit 0 % Aufschlag — und Claude Sonnet 5.5 wird über dieselben Zugangsdaten erreichbar sein, sobald es gelistet ist. Die relevante Fähigkeit ist in der Zwischenzeit das automatische Failover: Wenn eine Anthropic-Stufe rate-limitiert wird oder Fehler zurückgibt, kann die Anfrage ohne Codeänderung auf die andere umgelenkt werden, was die günstigstmögliche Absicherung dagegen ist, bei diesem Vergleich falsch zu liegen.
Die Entscheidung, als Regel formuliert
Wenn Ihre Arbeit klar begrenzt ist – Sie kontrollieren die Form der Ausgabe, die Prompts sind strukturiert und die Token-Anzahl pro Aufgabe ist vorhersehbar – wechseln Sie zu Claude Sonnet 5.5 und nehmen Sie die 60 % Einsparung mit. Der Index stimmt zu, die Preisliste stimmt zu, und auf der anderen Seite bleibt kein Fähigkeitsargument mehr übrig.
Wenn Ihre Arbeit offen und agentisch ist, führen Sie das Experiment durch, bevor Sie einem der beiden Preisblätter glauben. Messen Sie eine Woche lang bei jedem Modell die Tokens pro abgeschlossener Aufgabe in Ihrem eigenen Traffic; das Drittanbieter-Ergebnis von 7,60 $ gegenüber 5,86 $ ist eine konkrete Warnung, dass die günstigere Tarifkarte die höhere Rechnung erzeugen kann. Claude Opus 5 bleibt die sicherere Standardwahl für autonome Arbeit mit langem Zeithorizont, bis Sie diese Zahl haben.
Das ehrliche Urteil: Dies ist die erste Sonnet-Generation, in der die Argumentation für das Flaggschiff auf dem Aufgabenzuschnitt statt auf reiner Leistungsfähigkeit beruht, und wer die Entscheidung weiterhin allein am Modellnamen festmacht, lässt jetzt 60 % auf dem Tisch liegen oder zahlt 30 % mehr pro erledigter Aufgabe – je nachdem, in welche Richtung geraten wird.



In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
