
Claude Sonnet 5.5: Die 30%-Kostenbehauptung und die sechs Änderungen, die Sonnet-5-Code brechen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Claude Sonnet 5.5 wurde am 28. September 2026 zu genau denselben Preisen veröffentlicht wie Claude Sonnet 5 — 2 $ pro Million Input-Tokens, 10 $ pro Million Output-Tokens, 0,20 $ pro Million gecachter Lesevorgänge — während die Ankündigung von Anthropic mit "läuft 30 %+ schneller und kostet für die meiste Arbeit bis zu 30 % weniger" beginnt. Beide Aussagen sind wahr, und der Abstand zwischen ihnen ist die ganze Geschichte. Die Einsparungen stecken nicht in der Preisliste, denn die Preisliste hat sich nicht bewegt. Sie entstehen dadurch, dass man das Modell mit einer niedrigeren Effort-Einstellung laufen lässt, als sein Vorgänger benötigte, was bedeutet, dass die Angabe von 30 % eine Aussage über einen Betriebspunkt ist, den man wählen muss, nicht ein Preis, den man erbt. Unabhängige Messungen machen die Gabelung deutlich: bei Artificial Analysis, Claude Sonnet 5.5 kostet bei maximalem Effort 7,60 $ pro Aufgabe im Intelligence Index gegenüber 5,09 $ für Claude Sonnet 5 bei max. Effort — ungefähr 49 % mehr, nicht 30 % weniger. Das ist kein Widerspruch zur Zahl von Anthropic. Es ist das andere Ende derselben Kurve, und dort werden die meisten Migrationen standardmäßig landen, wenn niemand seinen Effort-Sweep erneut durchlaufen lässt.
Zwei Behauptungen unter einer Nummer
Anthropics Beitrag stellt die Pro-Aufgabe-Behauptung an drei Stellen auf, und jede stützt sich auf den Aufwand. Die stärkste Version: Auf Terminal-Bench 4.0 übertrifft Sonnet 5.5 bei mittlerem Aufwand – dem Standard in den Claude-Apps – den besten Wert von Sonnet 5 deutlich, und das für weniger als ein Zehntel der Kosten pro Aufgabe. Auf AA-Briefcase v1.1 schlägt es bei mittlerem Aufwand den besten Wert von Sonnet 5 für etwa ein Neuntel der Kosten. Auf CursorBench 4.0 übertrifft es bei niedrigem Aufwand den besten Wert von Sonnet 5 für weniger als ein Zehntel.
Liest man sie als Satz, ist der Mechanismus klar. Die Untergrenze von Sonnet 5.5 liegt über der Obergrenze von Sonnet 5 bei mehreren Evaluierungen. Sie erhalten die 30 % nicht dadurch, dass Sie weniger pro Token bezahlen; Sie erhalten sie dadurch, dass Sie die teure Einstellung nicht mehr brauchen. Anthropic sagt genau das in der Migrationsdokumentation, eine Seite neben dem Marketing: "Die Effort-Stufen sind neu kalibriert. Eine Effort-Stufe erzeugt nicht die gleiche Menge an Denkleistung wie auf Claude Sonnet 5. Führen Sie Ihren Effort-Sweep erneut aus, statt eine Einstellung zu übernehmen."
Dieser Satz ist die operativ wichtigste Aussage, die Anthropic diese Woche veröffentlicht hat, und er ist diejenige, die es nicht in den Großteil der Launch-Berichterstattung geschafft hat.
Was Anthropic veröffentlichte — vom Anbieter berichtet, nicht reproduziert
Alles in diesem Abschnitt ist Anthropics eigene Messung, aus der Ankündigung und der Systemkarte zu Sonnet 5.5. Es handelt sich um eine Herstellerangabe, nicht um ein unabhängiges Ergebnis, und die Spur der Fußnoten ist genauso wichtig wie die Schlagzeilen-Zahlen.
• Terminal-Bench 4.0 (agentisches Coding) — Sonnet 5.5 70,6 % vs. Sonnet 5 10,3 %. Das ist ein siebenfacher Sprung in der am häufigsten zitierten Zeile überhaupt, und es ist die Zahl, mit der die meisten Berichte begannen.
• FrontierCode 1.1 (Main) — Sonnet 5.5 52,1 % bei Xhigh und 46,2 % bei Max; Sonnet 5 42,4 %; Claude Opus 5.5 54,4 %; GPT-6 Sol 49,3 %. Beachten Sie die Umkehrung: Sonnet 5.5 erzielt bei Max niedrigere Werte als bei Xhigh.
• CursorBench 4.0 — 55,5 % für Sonnet 5.5 gegenüber 34,1 % für Sonnet 5 und 57,8 % für Opus 5.5. CursorBench 4.0 meldet GPT-6 Sol nicht öffentlich.
• GDPval-AA v2.1 (Wissensarbeit) — Sonnet 5.5 1844 Elo, Sonnet 5 1449, Opus 5.5 1846, GPT-6 Sol 1487.
• AA-Briefcase v1.1 — 1811 / 1359 / 1822 / 1483 auf denselben vier Modellen.
• Humanity's Last Exam (mit Tools) — 64,5 % / 54,9 % / 67,7 %.
• OSWorld 2.1 (Computernutzung, teilweise Anrechnung) — 80,1 % / 57,0 % / 81,8 %.
• Chartography (visuelle Diagrammerkennung, ohne Hilfsmittel) — 61,6 % / 15,6 % / 64,4 % / 53,6 %.
Drei Fußnoten verdienen es, mit diesen Zeilen mitzureisen, statt unter ihnen zu stehen. Erstens: Der Opus-5.5-Wert von 66,4 % bei Terminal-Bench 4.0 wird bei Xhigh-Aufwand, der höchstbewerteten Konfiguration von Opus 5.5, angegeben. Zweitens: Die FrontierCode-Max-Inversion wird erklärt: Bei Max führte Sonnet 5.5 häufiger den Code-Review-Skill von Claude Code aus, der die Überprüfung auf viele Subagenten aufteilt, und in zwei Fällen führte das zu einem Timeout oder zu Änderungen außerhalb des Aufgabenbereichs — FrontierCode bestraft Änderungen außerhalb des Aufgabenbereichs, selbst wenn sie gut sind. Drittens – und am unangenehmsten für den Anbieter – führte Artificial Analysis GDPval-AA und AA-Briefcase auf einer Vorab-Bereitstellung von Sonnet 5.5 aus, von der Anthropic sagt, dass sie einen Fehler aufwies, der Antworten auf Anfragen mit strukturierter Ausgabe beeinträchtigte. Anthropic erwartet, dass der Effekt gering ausfällt und Sonnet 5.5 unterbewertet, und sagt, dass der Fehler behoben ist. Anthropic merkt außerdem an, dass OpenAI kürzlich einen Fehler beim Bildverständnis in GPT-6 Sol behoben hat, sodass die GPT-6-Sol-Werte in diesen Zeilen möglicherweise noch nicht das aktuelle Modell widerspiegeln.

Was der unabhängige Durchlauf über dasselbe Modell sagt
Artificial Analysis hat Sonnet 5.5 gemessen, und seine Seite benennt die genaue Konfiguration: "Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)". In derselben Revision des Index, 216 Modelle in der Klasse:
• Claude Sonnet 5.5 — Intelligenzindex 56, Rang 3 von 216. 7,60 $ Kosten pro Index-Aufgabe. Während des Index-Durchlaufs generierte es 410 Mio. Output-Tokens, gegenüber einem Median von 88 Mio.
• Claude Sonnet 5 — Index 38, auf Platz 58 von 216, auf einer eigenen Seite mit der Bezeichnung „(Adaptive Reasoning, Max Effort)". 5,09 $ Kosten pro Aufgabe. 370 Mio. Ausgabe-Tokens.
• Claude Opus 5.5 — Index 58, Rang 1 von 216. 5,98 $ pro Aufgabe. 95,3 Ausgabe-Tokens pro Sekunde.
• GPT-6 Sol — Index 48, Platz 20 von 216, zum Listenpreis von $2/$10. $1,06 pro Aufgabe, 89,8 Ausgabe-Token pro Sekunde.
Die Lücke im Intelligence Index – 56 gegen 38, achtzehn Punkte – ist die stärkste unabhängige Bestätigung in diesem Artikel, und sie ist die Zahl, die ein Leser tatsächlich mitnehmen sollte. Die Kostenangabe ist diejenige, die einen Vorbehalt braucht, und es lohnt sich, sie genau zu benennen: Beide Punkte sind Konfigurationen mit maximalem Aufwand, und maximaler Aufwand bei einem Modell, das länger nachdenkt, ist ein bewusst teurer Ort, an dem man steht. Sonnet 5.5 verbrauchte 410 Mio. Token im Index-Lauf, während Sonnet 5 370 Mio. verbrauchte, und beide liegen weit über dem Median von 88 Mio. Ein Modell, das bei der höchsten Einstellung länger nachdenkt, kostet bei der höchsten Einstellung mehr. Was die Zahl widerlegt, ist nicht „günstiger pro Aufgabe“, sondern jede Lesart, sie als Eigenschaft des Modells statt der Einstellung zu verstehen.
Artificial Analysis hat noch keine Ausgabegeschwindigkeitszahl für Sonnet 5.5 veröffentlicht – auf der Seite steht N/A bei Ausgabe-Token pro Sekunde, gegenüber 78,7 für Sonnet 5 und 95,3 für Opus 5.5. Der Teil von Anthropics Behauptung, der „30 %+ schneller“ lautet, ist damit derzeit nur eine Angabe des Anbieters. Betrachten Sie ihn als Richtwert, bis eine unabhängige Stelle ihn misst.

Woher die Ersparnis tatsächlich kommt und wie man sie erzielt
Wenn man den Mechanismus akzeptiert, schreiben sich die Migrationsanweisungen von selbst, und Anthropic hat sie veröffentlicht:
• Beginne standardmäßig mit high, nicht mit dem, was deine Sonnet-5-Konfiguration gesagt hat. Anthropics Empfehlung ist high, es sei denn, deine Arbeitslast ist agentisch oder latenzempfindlich.
• Agentisches Coding und mehrstufige Tool-Nutzung – beginnen Sie bei mittel für gut spezifizierte Aufgaben und wechseln Sie bei schwierigeren oder längeren zu hoch.
• Chat und andere latenzkritische Arbeit – beginnen Sie mit mittel oder niedrig. Dies ist der Bereich, in dem die Behauptungen von „einem Zehntel der Kosten“ zu Hause sind.
Es gibt eine stimmige Erklärung dafür, warum die niedrigere Einstellung funktioniert, und sie ist kein Marketing. Die frühen Tester von Anthropic berichteten, dass Sonnet 5.5 Tool-Aufrufe stärker zu Batches zusammenfasst als Sonnet 5, was zu weniger Schritten pro Aufgabe führt. CodeRabbits Anmerkung in der Ankündigung ist ungewöhnlich konkret für ein Launch-Zitat: Die „Neigung von Sonnet 5, zu oft zur Websuche zu greifen, und sein hoher Token-Verbrauch sind in diesem neuen Modell beide verschwunden“. Sonnet 5.5 behielt außerdem denselben Tokenizer wie Sonnet 5, sodass identischer Text identische Token kostet – die Reduktion besteht aus weniger Zügen und weniger redundanten Aufrufen, nicht aus einem günstigeren Vokabular. Das bedeutet außerdem, dass die Token-Zahlen in Ihren Logs über das Upgrade hinweg vergleichbar bleiben, was Vorher-nachher-Messungen unkompliziert macht.
Die sechs Änderungen, die Sonnet 5-Code brechen oder verändern
Das ist der Teil des Releases, der Engineering-Zeit kostet, und hier ist der Migrationsleitfaden mehr wert als das Benchmark-Diagramm. Fünf der sechs geben harte Fehler zurück; das sechste schlägt still fehl.
• thinking: {"type": "disabled"} gibt jetzt einen 400 zurück. Der Ersatz ist thinking: {"type": "between_tools"}, wodurch das Vorab-Denken abgeschaltet wird und die niedrigste Denk-Einstellung dieses Modells ist. Es funktioniert bei niedrigem, mittlerem und hohem Aufwand, benötigt keinen Beta-Header und ist auf jeder Plattform verfügbar, die Sonnet 5.5 anbietet. Bei xhigh- oder maximalem Aufwand gibt between_tools selbst einen 400 zurück – verwenden Sie adaptives Denken (lassen Sie das Feld weg oder senden Sie {"type": "adaptive"}), wenn Sie diese Stufen benötigen. Mit between_tools können Sie außerdem den Aufwand nicht mitten im Gespräch ändern.
• Erzwungene Tool-Nutzung wird nicht unterstützt. tool_choice, das auf {"type": "any"} oder {"type": "tool", "name": "..."} gesetzt ist, gibt einen 400-Fehler mit der Meldung "tool_choice: type 'tool' and 'any' are not supported for this model." zurück. Dieselbe Prüfung gilt für den Endpunkt zur Token-Zählung. Der dokumentierte Ersatz für schema-valide Eingaben ist tool_choice: {"type": "auto"} zusammen mit strict: true am Tool oder das Umstellen des Schemas auf strukturierte Ausgaben.
• Thinking-Blöcke sind an das Modell und die Konversation gebunden.Sonnet 5.5 liest Thinking-Blöcke von Sonnet 5, Opus 4.8, Haiku 4.5 und früher – nicht von Opus 5, Opus 5.5 oder einem Fable- oder Mythos-Modell. Kein anderes Modell liest die Blöcke von Sonnet 5.5. Verschieben Sie eine Konversation von Sonnet 5 zu 5.5, bleibt das Reasoning erhalten; verschieben Sie sie von Sonnet 5.5 zu irgendetwas anderem, laufen die späteren Turns ohne es. Separat prüft die API jetzt, ob sich der System-Prompt, die Tool-Liste oder eine frühere Nachricht geändert hat, seit ein Thinking-Block erzeugt wurde, und bei Konten, die am oder nach dem 31. August 2026 erstellt wurden, gibt sie einen 400 zurück, wenn dies geschehen ist. Halten Sie Konversationen append-only, oder senden Sie den Beta-Header thinking-binding-controls-2026-08-01 mit prefix_mismatch_behavior: "drop_block".
• computer_20251124 wird auf der Claude API und Google Cloud abgelehnt. Die Computernutzung dort erfordert das Toolset computer_toolset_20260801. Amazon Bedrock akzeptiert weiterhin das ältere Tool – eine Plattformdivergenz, die erwähnenswert ist, wenn Sie denselben Agenten auf beiden ausführen.
• Einige Advisor-Paarungen gibt es nicht mehr. Ein Sonnet 5.5 Executor akzeptiert Mythos 5.1, Fable 5.1, Mythos 5, Fable 5, Opus 5.5, Opus 5 oder Sonnet 5.5 selbst als Advisor. Die Advisors Opus 4.8, Opus 4.7 und Sonnet 5, die mit einem Sonnet 5 Executor funktionieren, liefern mit einem Sonnet 5.5 Executor einen 400-Fehler zurück. Jeder Advisor, den Sonnet 5.5 akzeptiert, gibt Ratschläge verschlüsselt zurück, sodass Ihr Client den Ratschlagstext nicht lesen kann.
• Text zwischen Tool-Aufrufen kommt jetzt in Thinking-Blöcken an — und bei der Standardanzeige „omitted“ ist er leer. Das ist der stille Fall. Notizen, die länger als ein oder zwei Sätze sind, kommen zwischen Tool-Aufrufen als Thinking-Blöcke für Fortschrittsaktualisierungen statt als Text zurück. Eine Anwendung, die diese Ausführungen an ihre Nutzer streamt, wird zwischen Tool-Aufrufen still — ohne Fehler und ohne etwas in den Logs. Die Lösung besteht entweder darin, thinking.display so festzulegen, dass der Text zurückgegeben wird, oder auf between_tools umzustellen; in diesem Fall kommt der Text als gewöhnlicher Text zurück.
Noch zwei Punkte, die eine Migration berührt, wobei es sich bei keinem um einen Fehler handelt. Überwachung auf Ablehnungen: Sonnet 5.5 gibt stop_reason: "refusal" mit einem stop_details-Objekt zurück, das einen von fünf Richtlinienbereichen benennt — cyber, bio, frontier_llm, reasoning_extraction, general_harms —, und der serverseitige Fallback von Anthropic unternimmt bei Ablehnungen in den Bereichen cyber und frontier_llm auf Sonnet 5 einen erneuten Versuch, bei den anderen drei jedoch nicht. Und die Sicherheitsausrichtung hat sich tatsächlich verändert: Sonnet 5.5 ist das erste Sonnet-Modell, das mit Cyber-Schutzmaßnahmen und Fallbacks wie in der Opus-Klasse ausgeliefert wird, was bedeutet, dass Cybersicherheitsanfragen mit höherem Risiko sichtbar auf Sonnet 5 zurückfallen, und das erste Sonnet mit Klassifikatoren gegen Reasoning-Extraktion. Wenn das Wertversprechen Ihres Produkts in einem Sicherheitstool besteht, testen Sie diese Grenze, bevor Sie den Modellwechsel ausliefern.
Preisgestaltung und was heute tatsächlich auf unserer Route liegt
Die Tarifkarte ist unverändert gegenüber Sonnet 5, und ihre vollständig veröffentlichte Form ist kurz genug, um sie klar darzulegen:
• Eingabe — 2,00 $ pro Million Token. Ausgabe — 10,00 $ pro Million Token. Beide sind identisch mit Sonnet 5, bestätigt auf der Modellseite von Anthropic für Sonnet 5.5.
• Cache-Lesen — 0,20 $ pro Million, ein Rabatt von 90 % auf den Input; Cache-Schreiben für 5 Minuten 2,50 $ pro Million; Cache-Schreiben für 1 Stunde 4,00 $ pro Million. Die Mindestgröße für cachefähige Prompts beträgt 512 Tokens bei Sonnet 5.5, gegenüber 1.024 bei Sonnet 5.
• Batch — 50 % Rabatt in beide Richtungen, also 1,00 $ / 5,00 $ pro Million. Bei der Message Batches API kann die Ausgabe mit dem Beta-Header output-300k-2026-03-24 bis zu 300K Token umfassen.
• Gegenüber Opus 5.5 — Sonnet 5.5 kostet genau die Hälfte: 2 $/10 $ gegenüber 4 $/20 $, wobei Cache-Schreibvorgänge die Hälfte kosten und Cache-Lesevorgänge mit 0,20 $ identisch sind. Das ist die Migration, die sich lohnt, und Anthropic sagt es unverblümt: Die beiden Modelle ergänzen sich am besten, wenn Sonnet mit geringerem Aufwand läuft, und Opus „bleibt eindeutig stärker bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen erfordert".
• Kontext und Ausgabe — 1M-Token-Kontext, 128K maximale Ausgabe, adaptives Denken standardmäßig aktiviert, Standardaufwand hoch, zuverlässiger Wissensstichtag Juni 2026, Zero-Data-Retention verfügbar, Außerbetriebnahme nicht vor dem 28. September 2027.
Ein Verfügbarkeitshinweis, den wir lieber aussprechen als bloß andeuten: Claude Sonnet 5.5 steht zum 29. September 2026 nicht in unserem Modellkatalog. Sein Vorgänger anthropic/claude-sonnet-5 und sein größeres Schwestermodell anthropic/claude-opus-5.5 stehen beide drin, und die Preise dafür auf unserer Seite sind die des Anbieters selbst — 2,00 $ Input, 10,00 $ Output, 0,20 $ Cache-Lesen, 2,00 $ Cache-Schreiben für Sonnet 5, ohne jeglichen Aufschlag, sodass eine Preisänderung des Anbieters hier noch am selben Tag greift, an dem sie kommt, statt erst im nächsten Abrechnungszyklus. Genau diese letzte Eigenschaft macht das Ablesen an der Preistabelle nützlich statt dekorativ.

Was Sie heute damit machen können
Die ehrliche Reihenfolge für ein Team, das Claude Sonnet 5 bereits produktiv einsetzt, besteht aus drei Schritten, und keiner davon ist „den Modell-String austauschen und den Graphen beobachten“.
Erstens: Führen Sie den Aufwands-Sweep erneut aus. Wenn Sie eine hohe oder maximale Einstellung von Sonnet 5 übernommen haben, weil das Ihre Qualitätslatte erforderte, zahlen Sie jetzt für Reasoning, das Sie nicht mehr kaufen müssen. Die unabhängigen Kostendaten pro Aufgabe zeigen, dass die Spitze der Leiter teurer wurde, nicht günstiger, und die eigenen Kostenangaben des Anbieters beschreiben alle die Mitte davon. Zweitens: Reparieren Sie die beiden Fehlerpfade vor dem Deployment — deaktiviertes Denken und erzwungene Werkzeugnutzung —, weil beide laut und sofort fehlschlagen, was die gute Nachricht ist. Drittens: Beobachten Sie den Narrationspfad, denn er schlägt still fehl.
Wenn das Modell noch nicht auf der Route liegt, die Sie verwenden, besteht die risikoarme Möglichkeit, es zu bewerten, darin, es parallel laufen zu lassen statt stattdessen: Behalten Sie Sonnet 5 als Fallback auf demselben Schlüssel fest verankert, sodass eine Ablehnung, ein Timeout oder eine schlechte Bewertung die Anfrage an das Modell weiterleitet, dem Sie bereits vertrauen, und das automatische Failover schließt den Kreis ohne eine zweite Integration. Das ist das ganze Argument dafür, ein unerprobtes Modell hinter einem einzigen Endpunkt statt vor Ihren Nutzern zu bewerten — und hier gilt es doppelt, denn die Ablehnungskategorien von Sonnet 5.5 sind neu und seine Effort-Kalibrierung ist ausdrücklich nicht dieselbe wie die seines Vorgängers. Wenn Sie bereit sind, den Standard umzustellen, reicht das Verzeichnis auf einem Schlüssel bis zu mehr als 200 Modelle, was den Vergleich zu einer Konfigurationsänderung statt zu einem zweiten Vertrag macht.
Was zu sehen
Drei Dinge werden die offenen Fragen in diesem Beitrag klären, und keines davon ist bisher eingetreten.
Eine unabhängige Messung der Ausgabegeschwindigkeit steht an erster Stelle. Anthropic behauptet, 30 %+ schneller als Sonnet 5 zu sein; Artificial Analysis hat keine Zahl für Sonnet 5.5 veröffentlicht, und die Behauptung spielt eine echte Rolle im Kostenargument, da ein schnelleres Modell dieselbe Aufgabe in weniger Wall-Clock-Zeit und oft mit weniger Tokens erledigt. Claude Haiku 5.5 steht an zweiter Stelle — Anthropic sagt, es kommt „in den kommenden Wochen“ und wird unter Sonnet 5.5 angesiedelt sein, was die Kalkulation für das High-Volume-Chat-Band verändert, wo mittlerer und niedriger Aufwand Sonnet 5.5 bereits wettbewerbsfähig machen. An dritter Stelle steht der Korrekturlauf: Artificial Analysis ließ GDPval-AA und AA-Briefcase auf einem Pre-Release-Build mit einem Structured-Output-Bug laufen, Anthropic erwartet, dass diese Ergebnisse das Modell unterschätzen, und keine der beiden Zahlen wurde erneut ermittelt. Wenn sie nach oben gehen, verkleinert sich der Abstand bei Wissensarbeit zu Opus 5.5 weiter und das Argument „halber Preis“ wird stärker.
Bis dahin ist die belastbare Zusammenfassung enger gefasst als die Ankündigung und nützlicher als das Benchmark-Diagramm. Claude Sonnet 5.5 ist ein Intelligenzzuwachs von achtzehn Punkten gegenüber Sonnet 5 auf dem unabhängigen Index, bei denselben veröffentlichten Preisen, mit einer echten und messbaren Einsparung für jeden, der auf der Aufwandsleiter nach unten geht — und einer echten und messbaren Strafe für jeden, der das nicht tut.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
