
Claude Sonnet 5.5 vs. Claude Sonnet 5: Identische Preise, unterschiedliche Rechnungen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Zwei Modelle desselben Anbieters, derselben Leistungsklasse, mit demselben Namen und – in jeder Zeile der veröffentlichten Preisliste – demselben Preis. Claude Sonnet 5 wurde am 30. Juni 2026 zu $2.00 pro Million Input-Tokens und $10.00 pro Million Output-Tokens eingeführt. Claude Sonnet 5.5 erreichte am 28. September 2026 die allgemeine Verfügbarkeit zu $2.00 und $10.00, mit Cache-Lesevorgängen zu $0.20 und fünfminütigen Cache-Schreibvorgängen zu $2.50 bei beiden. Am Preis änderte sich nichts. Geändert hat sich alles, was eine Preisliste nicht misst, und das Ergebnis ist, dass eines dieser beiden Modelle deutlich günstiger zu betreiben ist als das andere, obwohl es pro Token exakt gleich viel kostet. Die eigene Schlagzeile von Anthropic zur Veröffentlichung sagt genau das, ohne es ganz auszusprechen: bis zu 30 % geringere Kosten für die meisten Arbeiten, bei unveränderter Preisliste. Beide Sätze können nur dann wahr sein, wenn das neuere Modell dieselbe Aufgabe mit weniger Tokens abschließt – genau das zeigen die Benchmarks, und das bestätigen die unabhängigen Zahlen pro Aufgabe.
Ist Claude Sonnet 5.5 teurer als Claude Sonnet 5?
Nein – und die Frage ist es trotzdem wert, ernst genommen zu werden, denn sehr viele Migrationen sind schiefgegangen, weil man eine Pauschaltarifkarte wie eine Pauschalrechnung behandelt hat.
Pro Token sind die beiden Modelle identisch: 2,00 $ für die Eingabe, 10,00 $ für die Ausgabe, 0,20 $ für das Lesen eines zwischengespeicherten Tokens, 2,50 $ für das Schreiben eines solchen. Es gibt keine gestaffelten Preisstufen und keinen Langkontext-Zuschlag. Was auch immer das neuere Modell sein mag, es ist keine als Generation verkleidete Preiserhöhung.
Pro abgeschlossener Aufgabe kippt das Bild, je nachdem, wessen Workload man beschreibt. Artificial Analysis meldet Kosten von 5,09 $ pro Aufgabe für Claude Sonnet 5 und 7,60 $ pro Aufgabe für Claude Sonnet 5.5 in derselben Intelligence-Index-v4.3-Suite – das neuere Modell ist bei identischem Tarif 49 % teurer darin, eine Aufgabe abzuschließen. Der gleiche Bericht merkt an, dass Sonnet 5.5 410 Millionen Token über die Suite hinweg ausgab, gegenüber 370 Millionen bei Sonnet 5, beide gegenüber einem Median von 88 Millionen für das beobachtete Feld. Bei den offenen Prompts des Evaluators schreibt das neuere Modell einfach mehr, und bei gleichen Preisen bedeuten mehr Token eine höhere Rechnung.
Anthropics Behauptung, 30 % günstiger zu sein, ist eine Anbieteraussage über die eigenen ausgewählten Workloads. Die Drittanbieter-Messung von 7,60 $ gegenüber 5,09 $ bezieht sich auf ein anderes Set. Keines von beiden ist falsch; die Diskrepanz ist die ganze Geschichte, und der entscheidende Faktor ist, ob Ihre Aufgaben ihre eigene Ausgabe begrenzen.
Was sich zwischen den beiden Generationen tatsächlich verändert hat
Die Preisliste ist statisch; das Modell nicht. In einer einzigen Liste dargestellt, sind die Differenzen groß und verlaufen überwiegend in eine Richtung.
• Terminal-Bench 4.0 — 70,6 % für Claude Sonnet 5.5 gegenüber 10,3 % für Claude Sonnet 5, der größte Generationssprung, den Anthropic bei diesem Test veröffentlicht hat
• CursorBench 4.0 — 55,5 % gegenüber 34,1 %
• Chartography, ohne Tools — 61,6 % gegenüber 15,6 %
• GDPval-AA v2.1 — 1844 gegen 1449
• AA-Briefcase v1.1 — 1811 gegen 1359
• Humanity's Last Exam, mit Tools — 64,5 % gegenüber 54,9 %
• OSWorld 2.1, teilweise abgeschlossen — 80,1 % gegenüber 57,0 %
• Artificial Analysis Intelligence Index v4.3 — 56 gegen 38, eine Lücke von achtzehn Punkten auf einer Drittanbieter-Skala, gemessen unter derselben Konfiguration „Adaptive Reasoning, Max Effort“
Die Gestalt dieser Liste ist kein gleichmäßiger Fortschritt. Dass Chartography von 15,6 % auf 61,6 % und Terminal-Bench von 10,3 % auf 70,6 % steigen, wirkt wie Fähigkeiten, die fehlten und nun vorhanden sind, nicht wie Fähigkeiten, die sich verbessert haben. Dass Humanity's Last Exam um zehn Punkte und OSWorld um dreiundzwanzig Punkte bei unverändertem Preis zulegen, ist das Muster einer Generation, die bestimmte Lücken geschlossen hat, statt einer, die allgemein intelligenter geworden ist. Die Achtzehn-Punkte-Lücke im Index ist das arithmetische Mittel davon: real, groß und konzentriert auf Tool-Nutzung, Code-Ausführung und visuelle Arbeit.
Eine Fußnote ist für alle wichtig, die die Anbietertabelle genau lesen. Anthropic gibt an, dass bei FrontierCode die Max-effort-Konfiguration niedriger als Xhigh abschneidet, und weist darauf hin, dass die Durchläufe GDPval-AA und AA-Briefcase auf einem Pre-Release-Deployment ausgeführt wurden, das einen structured-outputs-Bug aufwies. Die obigen Zahlen sind weiterhin die besten verfügbaren, aber betrachten Sie sie als eine Momentaufnahme eines einzelnen Deployments und nicht als dauerhafte Eigenschaft des Modells.
Warum der Preis gleich ist und die Rechnung nicht
Drei Mechanismen, in absteigender Reihenfolge danach, wie stark sie eine echte Rechnung verändern.
Das erste ist Disziplin bei der Ausgabelänge. Sonnet 5.5 ist ein leistungsfähigerer Agent, was bedeutet, dass er mehr tut, bevor er antwortet, und in einer Suite ohne Längenbeschränkung schreibt er rund 11 % mehr als Sonnet 5, kostet aber pro Token gleich viel. Bei einer Arbeitslast, die die Ausgabe begrenzt – Extraktion in ein festes Schema, Klassifikation, begrenzte Zusammenfassungen –, kommen diese 11 % nie zum Tragen, und die 30-%-Behauptung wird glaubwürdig, weil der Gewinn darin liegt, in weniger Turns zur Antwort zu gelangen statt in weniger Tokens pro Turn.
Das Zweite ist das Cache-Verhalten, und es ist der Grund, warum ein unveränderter Cache-Lese-Preis nicht bedeutet, dass die Cache-Kosten unverändert sind. Cache-Lesevorgänge und -Schreibvorgänge werden bei beiden Modellen identisch berechnet, sodass jede Änderung des Volumens zwischengespeicherter Token direkt auf die Rechnung durchschlägt. Ein Modell, das weniger Runden benötigt, um eine agentische Aufgabe abzuschließen, liest sein Präfix weniger oft. Das ist eine Einsparung, hinter der überhaupt keine Preisänderung steht, und sie ist in jeder Vergleichstabelle unsichtbar, die nur Zeilen der Preisliste aufführt.
Das dritte ist das, was die meisten Teams am Migrationstag falsch machen: der Standardwert für den Effort. Claude Sonnet 5.5 konfiguriert Reasoning über einen Effort-Parameter mit den Einstellungen low, medium, high, xhigh und max, wobei der Standard auf der Claude Platform high und in den Claude-Apps medium ist. Wenn Sie von einer Sonnet-5-Bereitstellung migriert sind, in der Sie ein Reasoning-Budget festgelegt hatten, kann der neue Standardwert eine andere Tiefe haben als die, für die Sie bezahlt haben. Messen Sie, bevor Sie entweder eine Einsparung oder eine Erhöhung annehmen.
Es gibt außerdem eine verhaltensbezogene Konsequenz, die man vor dem Rollout und nicht erst danach benennen sollte. Anthropic gibt an, dass Claude Sonnet 5.5 das erste Sonnet ist, das mit Cybersicherheits-Schutzmaßnahmen und Fallbacks gleichrangig mit seinen Top-Tier-Modellen eingeführt wird, sodass risikoreichere Cybersicherheitsanfragen sichtbar auf das vorherige Sonnet zurückfallen. In Ihren Logs wird ein Modell angezeigt, das Sie nicht angefordert haben. Damit zusammenhängend: Wenn Sie Sonnet mit deaktiviertem Thinking ausführen, müssen Sie zu einem Zwischen-Tools-Verhalten wechseln – eine Codeänderung, kein Flag.
Auf OrcaRouter ist anthropic/claude-sonnet-5 heute mit einem einzigen Credential zum Listenpreis des Anbieters mit 0 % Aufschlag routbar, zusammen mit Claude Opus 5.5, Claude Opus 5, DeepSeek V4 Pro und Gemini 3.1 Pro Preview. Claude Sonnet 5.5 selbst ist noch keine Route auf unserer Plattform, deshalb sieht die praktische Form dieses Vergleichs derzeit so aus, dass ein Team, das Sonnet 5 bereits laufen hat, das Delta an dem Tag messen kann, an dem es gelistet wird, ohne einen API-Schlüssel anzufassen, und kann in der Zwischenzeit zwischen den Stufen ein Failover durchführen, indem es einen String ändert.
Fragen, die Menschen vor einem Wechsel stellen
Kann ich beide gleichzeitig laufen lassen und anhand meines eigenen Traffics vergleichen? Noch nicht über einen einzigen OrcaRouter-Zugang, da Claude Sonnet 5.5 keine aufgeführte Route ist. Der Workaround besteht darin, das neuere Modell über Anthropics eigene API laufen zu lassen und das ältere über uns, und dann Tokens pro abgeschlossener Aufgabe statt Kosten pro Token zu vergleichen, denn das ist die Kennzahl, bei der sich die beiden Modelle tatsächlich unterscheiden.
Bedeutet der unveränderte Preis, dass Anthropic für die neue Fähigkeit nichts berechnet? Es bedeutet, dass der Listenpreis konstant gehalten wird, während sich das Modell verbessert, was demselben Muster wie bei den beiden vorherigen Sonnet-Generationen entspricht. Ob das Bestand hat, ist eine kommerzielle Frage, keine technische, und das veröffentlichte Auslaufzeitfenster – nicht vor September 2027 – ist die einzige daran geknüpfte Zusage.
Welcher Zahl sollte ich vertrauen, den 30 % von Anthropic oder den 49 % von Drittanbietern?Weder der einen noch der anderen als allgemeine Aussage. Anthropics Zahl beschreibt Workloads, bei denen das Modell mit weniger Turns zu einer Antwort gelangt; die Zahl von Artificial Analysis beschreibt eine uneingeschränkte Index-Suite, in der die Ausführlichkeit frei wachsen kann. Wählen Sie diejenige, die Ihrem Prompt-Set ähnelt, und wenn Sie nicht sagen können, welche das ist, ist diese Mehrdeutigkeit selbst die Antwort – messen Sie sie.
Fazit
Claude Sonnet 5.5 ist keine Preiserhöhung, aber auch keine automatische Einsparung. Anthropic hat jede Position der Preisliste unverändert gelassen und das Modell darunter verschoben, was bedeutet, dass der gesamte wirtschaftliche Fall auf Tokens pro abgeschlossener Aufgabe beruht – einer Zahl, die bei den vom Anbieter gewählten Workloads um 30 % besser und bei der von einem unabhängigen Prüfer gewählten Suite um 49 % schlechter ist. Wenn Ihre Aufgaben ihre eigene Ausgabe begrenzen, wechseln Sie und nehmen Sie den Vorteil mit. Wenn nicht, ist der gleichbleibende Preis kein Grund, die Messung zu überspringen, denn Sie können pro Aufgabe das Anderthalbfache für ein Modell zahlen, das bei der Arbeit eindeutig besser ist.



