
Claude Opus 5.5 und der Wassermelonen-Test: Anthropic hat die Prosa repariert, doch der Kern bleibt verschüttet
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Eines der Beispiele, die aus der Startwoche am weitesten reisten, war eine Kurzgeschichte über eine Wassermelone. Ein paar hundert Wörter, kein Benchmark dabei, kein Diagramm — nur ein Modell, das gebeten wurde, etwas Kleines zu schreiben, und das es größtenteils richtig hinbekam. Das ist ein seltsames Artefakt, das nahe am Zentrum einer Flaggschiff-Veröffentlichung sitzt, doch es deutet auf das hin, womit der Anbieter vorangehen wollte, als er Claude Opus 5.5 am 22. September 2026 auslieferte: nicht noch ein Punkt auf Terminal-Bench, sondern Prosa. Die Rahmung des Unternehmens ist, dass dieses Modell weniger „Claudish" schreibt — ihr Wort für das formelhafte, übermäßig abgesicherte, räuspernde Register, für das Claude Opus 5 Kritik einsteckte und an dem sich seitdem Claude Fable 5.1, GPT-6 Astra und GPT-5.6 Sol jeweils messen lassen mussten. Die Frage, die es zu beantworten gilt, ist also nicht, ob die Demo charmant war. Sondern ob sich die Prosa messbar verbessert hat, um wie viel, und wo sie noch scheitert.
Was Anthropic nach eigener Aussage behoben hat

Anthropics Behauptung ist konkret genug, um getestet zu werden. Opus 5.5, so heißt es, stellt die wichtigsten Informationen an den Anfang, verwendet weniger Fachjargon und befolgt die vom Nutzer angegebenen Schreibregeln genauer als frühere Opus-Modelle. Das unterstützende Material ist vom Anbieter gemeldet und nicht reproduziert: interne Faktencheck-Tests, die laut Anthropic 16 von 18 Versuchen bestanden, gegenüber null von 18 bei sowohl Claude Fable 5.1 als auch Claude Opus 5. Kundenstimmen im Markteinführungsmaterial weisen in dieselbe Richtung — John Ruelas von Ramp beschreibt eine Ausgabe, die „wie ein guter Kollege schreibt“, Box meldet rund 40 % weniger Ausführlichkeit bei den eigenen Arbeitslasten.
Zwei Dinge sind hier zu trennen. Das erste ist, dass „weniger Claudish“ ein realer, benennbarer Fehlermodus ist, keine Marketing-Erfindung. Praktiker beschweren sich seit den Opus-Generationen nach 4.6 über verdichtete, schlecht strukturierte Claude-Prosa, und die Beschwerde ist konkret: zu viel Vorrede, zu viele Wiederholungen des Prompts, die Angewohnheit, erst zwei Absätze später auf den Punkt zu kommen, als der Leser ihn gebraucht hätte. Das zweite ist, dass Anthropics eigene Zahlen dafür, dass sie es behoben haben, genau das sind – Anthropics eigene Zahlen. Für die 16-von-18-Angabe gibt es keine unabhängige Replikation, und „40 % weniger Weitschweifigkeit“ ist eine interne Messung eines Kunden, keine veröffentlichte Methodik.
Das Release bringt außerdem eine nicht schreibbezogene Änderung mit sich, die wissenswert ist: Opus 5.5 ist das erste Opus-Modell, das mit Cybersicherheits-, Biologie- und Frontier-LLM-Entwicklungs-Safeguards ausgeliefert wird, die denen von Claude Fable 5.1 entsprechen. Wenn eine Anfrage eine davon auslöst, leitet Anthropic sie laut eigener Aussage transparent an ein anderes Modell weiter, anstatt sie rundheraus abzulehnen.
Die Zahlen, die nicht von Anthropic sind

Die nützlichste unabhängige Einschätzung zur Schreibbehauptung stammt von Every's Vibe Check, bei dem dieselben Prompts durch fünf Frontier-Modelle liefen und die Ausgabe mit zwei standardmäßigen Lesbarkeitsinstrumenten bewertet wurde. Bei diesem Prompt-Set Claude Opus 5.5schnitt als das lesbarste der Gruppe ab – und die Lücke zu dem Modell, das es ersetzt hat, ist die eigentliche Geschichte:
• Flesch-Kincaid-Klassenstufe — Claude Opus 5.5 bei 6,95, gegenüber Claude Opus 5 bei 7,97
• Flesch-Lesbarkeit — 68,4 für Opus 5.5 gegenüber 61,35 für Opus 5
• Claude Fable 5.1 — 7,43 Klassenstufe, 66,09 Reading Ease
• GPT-6 Astra — Klassenstufe 7,52, 64,55 Lesefreundlichkeit
• GPT-5.6 Sol — 8.74 Klassenstufe, 56.62 Reading Ease
Lesen Sie die beiden Instrumente zusammen, denn sie bewegen sich in entgegengesetzte Richtungen, und genau darum geht es: Ein niedrigerer Klassenstufenwert und ein höherer Ease-Wert bedeuten beide einfachere Prosa. Opus 5.5 liegt etwa eine ganze Klassenstufe unter Opus 5, rund eine halbe Klassenstufe unter sowohl Claude Fable 5.1 als auch GPT-6 Astra und fast zwei Klassenstufen unter GPT-5.6 Sol. Einfach ausgedrückt: ein Leseniveau der siebten Klasse statt der achten.
Das ist eine echte Verbesserung, und sie ist zugleich eine eng begrenzte. Dies ist das Prompt-Set eines einzigen Outlets, kein Benchmark mit einer festen Aufgabenliste und einer dahinterstehenden Rangliste. Es verrät die Richtung, in die es geht, und ungefähr die Größe des Schritts. Es sagt dir nicht, dass Opus 5.5 bei deiner Arbeit gut schreibt, und die eigenen qualitativen Notizen von Every machen deutlich, dass auch der Rezensent nicht dieser Meinung war.
Wo es den Punkt noch immer begräbt
Dieselbe Rezension, die die Lesbarkeitszahlen hervorbrachte, äußert sich unverblümt über den Fehler, der den Fix überlebt hat. Aufgefordert, einen Essay zu beginnen, brauchte Opus 5.5 37 bis 39 Sätze, um abzudecken, was der Rezensent in 21 Sätzen abdeckte, und widmete einen ganzen Absatz einem Punkt, den der Rezensent in acht Wörtern ausführte. Die Zusammenfassung des Rezensenten lautet, dass das Modell „den Punkt noch immer begräbt“ – und die schärfere Fassung der Kritik ist, dass es korrekt diagnostizieren kann, was ein Absatz braucht, und dann eine Überarbeitung produziert, die seine eigene Diagnose ignoriert.
Als Lektor schnitt es schlechter ab als als Autor. Im Vergleich zu den anderen Modellen bei Bearbeitungsaufgaben landete Opus 5.5 hinter Claude Opus 5, GPT-5.6 Sol und GPT-6 Astra — das Modell ist besser darin, lesbare Sätze zu produzieren, als darin zu erkennen, welcher Satz zuerst hätte stehen sollen. Das Urteil des Rezensenten mündet in einen Satz, der es wert ist, zitiert zu werden, weil er das Nützlichste in der gesamten Rezension ist: „Ich bin mit ihm als Kollaborationspartner zufriedener als mit der Prosa, die es produziert.“
Was das in der Praxis bedeutet, ergibt sich direkt daraus. Entwirf damit, und zwar mit hohem Aufwand oder mehr – bei den niedrigeren Aufwandsstufen ist das Aufblähen am schlimmsten. Liefere eigene Beispiele, statt es zu bitten, welche zu erfinden. Dann setz den Kern selbst nach oben, oder übergib den Entwurf an etwas, das es tut. Was Opus 5.5 dir bietet, ist ein schnellerer Weg zu einem sauberen ersten Entwurf und ein wirklich besserer Partner für die Durchgänge danach. Einen Lektor liefert es dir nicht.
Was die zusätzlichen Wörter kosten

Das Verbositätsproblem hat eine Kostendimension, die die Schreib-Reviews meist auslassen, und sie läuft dem Launch-Narrativ zuwider. Artificial Analysis, das eigene Bewertungen durchführt, statt sich auf Herstellerangaben zu verlassen, platziert Claude Opus 5.5 auf Platz 1 von 212 Modellen in seinem Intelligence Index mit einer Punktzahl von 58 – aber auf Platz 95 von 212 bei der Verbosität, wobei es in diesem Index-Durchlauf 260 Millionen Ausgabe-Tokens erzeugte, gegenüber einem Median von 88 Millionen. Die Bewertung kostete 5,98 US-Dollar pro Aufgabe im Intelligence Index und insgesamt 8.708,20 US-Dollar.
Stellt man das neben Anthropics eigene Effizienzbehauptung, stimmen die beiden nicht offensichtlich überein. Die vom Anbieter berichtete Position ist, dass Opus 5.5 weniger Tokens verwendet und Ausgaben mehr als 30 % schneller erzeugt als Opus 5. Der unabhängige Testlauf von Artificial Analysis ergab, dass das Modell im Vergleich zu seinen Peers sehr wortreich ist. Beides kann gleichzeitig zutreffen – unterschiedliche Aufgabenmixe, unterschiedliche Aufwandsstufen, unterschiedliche Definitionen von „weniger Tokens“ –, aber niemand sollte das Framing zum Launch als gesicherte Tatsache über die Token-Ökonomie lesen. Beim Preis ist das Bild klarer: 4 $ pro Million Eingabe- und 20 $ pro Million Ausgabe-Tokens, gegenüber 5 $/25 $, mit einem Cache-Rabatt von 95 % in den Zahlen von Artificial Analysis.
Wenn Sie pro Ausgabe-Token bezahlen, ist weitschweifige Prosa keine Stilpräferenz. Sie ist die Rechnungsposition.
Es gegen das laufen lassen, was Sie bereits haben
Eine ehrliche Anmerkung vor dem praktischen Teil: Claude Opus 5.5 ist keine unserer Routen. Wir hosten es nicht, und nichts im Folgenden sollte als Behauptung gelesen werden, dass wir es tun. Sie erhalten es über Anthropics eigene API und mehrere Plattformen von Drittanbietern.
Was heute auf OrcaRouter läuft, ist das Modell, das es ersetzt hat, sowie die Stufe darüber. Claude Opus 5 ist heute auf OrcaRouter, und Claude Fable 5.1 ebenfalls, beide zum Listenpreis des Anbieters, wobei 0 % Aufschlag durchgereicht werden — was bedeutet, dass eine Preisänderung eines Anbieters noch am selben Tag bei uns landet und nicht erst dann, wenn ein Wiederverkäufer sich irgendwann darum kümmert. Wenn Sie entscheiden wollen, ob die Prosa von Opus 5.5 den Wechsel wert ist, ist das eine nützliche Paarung: Sie können den Vergleich mit einem einzigen Schlüssel durchführen, ohne einen zweiten Vertrag oder eine Codeänderung, weil beide Modelle eine API für 200+ Modelle entfernt am selben Endpunkt sind.
Der andere Grund, ein zweites Modell mitlaufen zu lassen, ist der Fehlermodus, um den es in diesem Artikel geht. Ein Modell, das das Wesentliche verschüttet, ist ein Modell, das man mitten in der Aufgabe umgehen können möchte, und automatisches Failovergibt es genau deshalb, damit aus einer schlechten Generierung keine ins Stocken geratene Pipeline wird. Wenn Sie lieber gar kein Modell auswählen möchten, fasst die Routing-DSL mehrere zu einem einzigen Aufruf zusammen, und Modellfusion lässt ein Panel von Modellen gemeinsam antworten – was für redaktionelle Arbeit eine sinnvolle Form ist, bei der das Scheitern im Urteilsvermögen und nicht in der Fähigkeit liegt.
Wer sollte handeln, und wer sollte warten?
Wenn Ihre Beschwerde über Claude Opus 5 darin bestand, dass Sie seine Einstiege umschreiben mussten, ist Opus 5.5 eine echte Abhilfe für ungefähr eine Klassenstufe dieses Problems, und die Lesbarkeitsdaten sagen, dass die Verbesserung messbar ist und nicht nur Bauchgefühl. Wenn Ihre Beschwerde war, dass es drei Absätze braucht, um auf den Punkt zu kommen, sagt nichts in den unabhängigen Belegen, dass sich das geändert hat. Das sind unterschiedliche Beschwerden, und die Berichterstattung zum Launch hat sie als eine behandelt.
Speziell für kreative Arbeit ist die Wassermelonen-Geschichte kein Beweis für irgendetwas, außer dafür, dass Menschen zu kleinen, warmen, risikoarmen Prompts greifen, wenn sie ein neues Modell ausloten wollen. Das ist eine vernünftige Sache. Es ist außerdem genau das Setting, in dem eine Neigung, den Punkt zu vergraben, am wenigsten sichtbar ist, weil niemand eine Wassermelonen-Geschichte wegen der These liest. Setzt man das Modell vor ein Dokument, bei dem die Leserin oder der Leser die Schlussfolgerung in den ersten beiden Sätzen braucht, findet man heraus, welches der beiden Probleme man tatsächlich hatte.
Als Nächstes gilt es zu beobachten, ob das nächste Modell der Familie – Sonnet 5.5 und Haiku 5.5 werden beide in den kommenden Wochen erwartet – den Lesbarkeitsgewinn erbt und ob jemand eine Lesbarkeitszahl für das Bearbeiten statt für das Verfassen veröffentlicht. Die Zahl für das Verfassen ist die einfache. Die Zahl für das Bearbeiten ist die, bei der Opus 5.5 noch hinter drei seiner Konkurrenten zurückliegt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
