Eine Hero-Titelkarte mit der Aufschrift „Claude Opus 5.5 vs GPT-6 Astra“ und dem Untertitel „Ein Geschmackstest, der die Benchmarks überholte“, eine Überzeile mit der Aufschrift „Vergleich der Frontier-Flaggschiffe – September 2026“, drei Badges mit der Aufschrift „Geschmack: auf keiner Benchmark-Achse“, „Forschungs-Workloads: Astra hält“ und „Preis: $4.00 / $20.00 vs. $10.00 / $50.00 pro 1M“, eine Fußzeile mit der Aufschrift „Vendor-Launch-Tabellen und unabhängige Läufe sind sich über die Größe des Vorsprungs uneinig.“ sowie das OrcaRouter-Logo unten rechts.
Guides & Insights

Claude Opus 5.5 vs. GPT-6 Astra: Ein Geschmackstest, der die Benchmarks überholte

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Jemand bat Claude Opus 5.5, ein kurzes Video darüber zu erstellen, wie ein konkurrierendes Labor Navier-Stokes löst, postete das Ergebnis und schrieb dann den Satz, der diesen Vergleich lohnenswert macht: Das Modell sei „sehr nett“, habe „großartigen Geschmack“, und es sei das erste Claude seit Opus 4.7, das sie wirklich intensiv nutzen wollen – aber sie behalten weiterhin GPT-6 Astra und GPT-5.6 Sol als ihre Haupttreiber, weil ihre Arbeit forschungsintensiv ist. Das sind drei Behauptungen in einem Beitrag, und sie ziehen in unterschiedliche Richtungen. Ein Modell kann das Angenehmste sein, mit dem man arbeitet, und trotzdem nicht das, an das man Produktionsverkehr weiterleitet. Die interessante Frage ist nicht, welches Modell besser ist. Sondern welches dieser beiden Urteile den Kontakt mit den Zahlen übersteht und welches sich als Aussage über Geschmack herausstellt.

Der Beitrag ist der Bericht eines Praktikers, kein Benchmark-Durchlauf – behandle ihn als Signal dafür, wie sich die Arbeit mit dem Modell im kreativen und offenen Bereich anfühlt, nicht als Beleg für dessen Leistungsfähigkeit. Alle Zahlen unten sind mit der Angabe versehen, wer sie erhoben hat.

Was ein Geschmackstest Ihnen sagen kann und was nicht

Hier zählt das Artefakt. Ein Video über ein mathematisches Ergebnis zu machen, ist keine Programmieraufgabe mit einem Bestanden-/Durchgefallen-Gate. Es gibt keinen Kompilierungsschritt, keine Testsuite, keine Terminal-Bench-Harness, die bewertet, ob das Ding etwas taugt. Das Modell musste einen Blickwinkel wählen, entscheiden, was gezeigt werden soll, es kohärent halten und aufhören. Wenn ein Praktiker sagt, ein Modell habe „großartigen Geschmack“, dann beschreibt er genau das: Urteilsvermögen in Bezug auf Umfang und Schwerpunktsetzung, das in Arbeiten sichtbar wird, in denen die Spezifikation bewusst vage ist.

Das ist eine echte Fähigkeit, und sie ist genau diejenige, die Benchmark-Suiten am schlechtesten messen. Das ist auch der Grund, warum dieselbe Person ein Modell loben und trotzdem nicht darauf umsteigen kann. Geschmack ist das, was man will, wenn man erkundet. Es ist nicht das, was man will, wenn man 200.000 Codezeilen zu prüfen und eine Rechnung zu rechtfertigen hat.

Anthropics eigene Einführung deutet in Prosa statt im Video auf dieselbe Fähigkeit hin: Claude Opus 5.5 wird damit beworben, weniger „Claudehaft“ zu schreiben – weniger Einleitungsgerede, weniger Absicherungen, mehr Bereitschaft, den Punkt an den Anfang zu stellen. Unabhängige Lesbarkeitsbewertungen stützen die Richtung dieser Behauptung, selbst dort, wo sie beim Ausmaß widersprechen. Der Anbieter berichtet außerdem, dass ein interner Faktenprüfungstest 16 von 18 Versuchen bestanden habe, gegenüber null von 18 bei sowohl Claude Fable 5.1 als auch Claude Opus 5; diese Zahl stammt von Anthropic selbst, wurde nicht reproduziert und sollte als Behauptung und nicht als Ergebnis gelesen werden.

Zwei Anzeigetafeln, eine Unstimmigkeit, die zählt

A two-column scoreboard titled "Claude Opus 5.5 vs GPT-6 Astra - the scoreboard". The Claude Opus 5.5 column reads: Released Sep 22 2026, Price per 1M $4.00 / $20.00, Terminal-Bench 4.0 66.4% vendor and 59.6% independent, Terminal-Bench-Science 0.1 58.7%, GDPval-AA v2.1 1,846 Elo, Tokens per problem about 119,000. The GPT-6 Astra column reads: Released Sep 3 2026, Price per 1M $10.00 / $50.00, Terminal-Bench 4.0 57.9%, Terminal-Bench-Science 0.1 64.6%, GDPval-AA v2.1 1,542 Elo, Tokens per problem about 27,000. A footer reads "Opus 5.5 figures per Anthropic unless noted; Astra and independent figures per Artificial Analysis."

Bei den unverarbeiteten veröffentlichten Benchmarks liegt Claude Opus 5.5 häufiger als nicht vor GPT-6 Astra. Das Problem ist, dass die beiden am häufigsten zitierten Quellen nicht darin übereinstimmen, um wie viel.

Anthropics Starttabelle führt Claude Opus 5.5 mit 66,4 % bei Terminal-Bench 4.0 auf, mit GPT-6 Astra bei 57,9 % und Claude Fable 5.1 bei 55,8 %. Das ist ein vom Anbieter gemeldeter Vorsprung von 8,5 Punkten beim agentischen Codieren – die Art von Abstand, die eine Diskussion in einem Marketing-Deck beendet. Artificial Analysis, das seine eigene Testumgebung nutzt, maß Claude Opus 5.5 mit 59,6 % im selben Benchmark: gleichauf mit GPT-6 Astra bei xhigh-Aufwand und etwa 11 Punkte über Claude Opus 5. Der Vorsprung ist in beiden Auswertungen real. Das Ausmaß nicht.

Wo die beiden Modelle die Plätze tauschen, ist nützlicher als dort, wo sie es nicht tun:

• Terminal-Bench 4.0 (agentisches Programmieren) — Claude Opus 5.5 66,4 % laut Anthropics eigener Tabelle, 59,6 % laut Artificial Analysis; GPT-6 Astra 57,9 %.

• Humanity's Last Exam mit Werkzeugen — Claude Opus 5.5 67,7 % laut Anbieter, unabhängig gemessen bei 61,4 %; GPT-6 Astra 57,2 %.

• GDPval-AA v2.1 (praxisnahe Wissensarbeit in 44 Berufen) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Beide Werte stammen aus dem unabhängigen Ranking von Artificial Analysis, nicht vom Anbieter.

• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6 % vs. Claude Opus 5.5 58,7 %. Dies ist ein klarer Sieg für Astra, und es handelt sich um den wissenschaftlich geprägten agentischen Benchmark.

• AutomationBench — GPT-6 Astra 41,4 % vs. Claude Opus 5,5 40,0 %. Knapp, aber wieder Astra.

• FrontierCode v1.1 — Claude Opus 5.5 54,4 % gegenüber GPT-6 Astra 53,3 %. Innerhalb eines Punktes.

Lesen Sie diese Liste so, wie ein Praktiker sie lesen würde. Die forschungsintensiven Workloads — die mit einer Wissenschafts- oder Literaturkomponente, die, die eine lange Schleife mit Werkzeugnutzung durchlaufen und bei denen das Modell nicht ins Straucheln geraten darf — sind genau die, in denen GPT-6 Astra sich behauptet. Die Knowledge-Work- und Coding-Boards, auf denen Claude Opus 5.5 davonzieht, sind die, auf die Sie zeigen würden, wenn es Ihre Aufgabe wäre, Software auszuliefern. Beide Personen in diesem Gespräch lesen ihren eigenen Benchmark richtig. Sie lesen lediglich unterschiedliche Benchmarks.

Die Effort-Einstellung leistet mehr Arbeit als das Modell.

Es gibt einen zweiten, weniger schmeichelhaften Grund dafür, dass die Headline-Margen schwach ausfallen. Die Anbietervergleiche werden nicht mit derselben Einstellung durchgeführt.

Die veröffentlichten Werte von Claude Opus 5.5 stammen aus einer Konfiguration mit extrahohem (xhigh) Reasoning-Aufwand, verglichen mit GPT-6 Astra bei high. Die unabhängigen Läufe von Artificial Analysis setzen beide Modelle auf xhigh, und die Coding-Lücke verschwindet – der 8,5-Punkte-Vorsprung des Anbieters wird zu einem Gleichstand. Das ist keine Anschuldigung eines Fehlverhaltens; es ist das, was passiert, wenn ein Anbieter die Konfiguration wählt, die sein Modell am besten dastehen lässt, und ein unabhängiges Labor die Konfiguration wählt, die zur Konkurrenz passt. Bevor Sie eine Workload aufgrund einer Benchmark-Tabelle verlagern, prüfen Sie, mit welcher Reasoning-Aufwandsstufe sie ausgeführt wurde, denn die Antwort lautet häufig „die schmeichelhafte“.

Die Token-Rechnung erzählt dieselbe Geschichte aus einem anderen Blickwinkel. In Anthropics eigenem Launch-Material verbraucht Claude Opus 5.5 in der Größenordnung von 119.000 Tokens pro Problem, wovon etwa 84.000 aufs Denken entfallen, während GPT-6 Astra vergleichbare Probleme in ungefähr 27.000 Tokens löst. Denk-Tokens werden als Ausgabe-Tokens abgerechnet. Ein Modell, das viermal so viele Tokens bei einem Fünftel des Ausgabepreises verbraucht, kommt nahezu aufs Gleiche heraus – und das, bevor man berücksichtigt, dass das günstigere Modell oft genau dasjenige ist, das man ohnehin bereit gewesen wäre, mit einer höheren Effort-Einstellung laufen zu lassen.

Ein weiterer Vorbehalt gilt speziell für Claude Opus 5.5: Das Sicherheitsrouting von Anthropic kann einige cyber- und bio-nahe Anfragen auf einen restriktiveren Pfad umleiten, was die veröffentlichten Werte für diese Evaluierungen gegenüber dem senkt, was das zugrunde liegende Modell leisten würde. Wenn Ihre Arbeit diese Bereiche berührt, wird die Kluft zwischen dem Benchmark und Ihrer Erfahrung real sein, und zwar in die Richtung, dass der Benchmark optimistisch ist.

Was eine echte Aufgabe jeweils kostet

Screenshot of Anthropic's Claude Platform release notes page, with "September 22, 2026" selected in the sidebar. The entry announces the launch of Claude Opus 5.5 (claude-opus-5-5) with a 1M token context window by default, 128k max output tokens and always-on adaptive thinking, at $4 / $20 USD per MTok against Claude Opus 5 at $5 / $25, and notes that thinking cannot be disabled, that depth is controlled through the effort parameter, and that Fast mode is available as a research preview.

Claude Opus 5.5 ist das günstigere Modell auf der Preisliste, und das nicht knapp:

• Claude Opus 5.5 — 4,00 $ pro Million Eingabe, 20,00 $ pro Million Ausgabe, 0,20 $ pro Million zwischengespeicherte Eingabe, 5,00 $ pro Million Cache-Schreibvorgänge. 1M-Token-Kontext, max. 128k Ausgabe.

• GPT-6 Astra — 10,00 $ pro Million Eingabe, 50,00 $ pro Million Ausgabe, 1,00 $ pro Million gecachter Eingabe, 12,50 $ pro Million Cache-Schreibvorgänge. Bei über 272.000 Eingabe-Tokens in einer einzelnen Anfrage wird die gesamte Anfrage mit 20,00 $ Eingabe und 100,00 $ Ausgabe neu bepreist; der Batch-Tarif beträgt 5,00 $/25,00 $.

Also ist Claude Opus 5.5 bei der Eingabe 2,5-mal günstiger und bei der Ausgabe 2,5-mal günstiger, wobei zwischengespeicherte Eingabe fünfmal günstiger ist. Wenn deine Aufgaben token-ähnlich sind, ist das die ganze Entscheidung, und die Geschmacksfrage ist Dekoration.

Der oben genannte Vorbehalt zur Token-Nutzung ist der Grund, warum es nicht so einfach ist, und die Preisanpassung von GPT-6 Astra für langen Kontext ist die andere Falle. Überschreiten Sie 272.000 Eingabe-Token in einer Anfrage, wird die gesamte Anfrage – nicht nur der Überschuss – auf den Long-Context-Tarif umgestellt. Eine Research-Workload, die ein großes Korpus in einen einzigen Aufruf packt, ist genau die Form, die das auslöst. Batch zum halben Preis ist der legitime Ausweg, und er befindet sich in der langsameren Warteschlange.

Die ehrliche Zusammenfassung lautet, dass sich das Kostenbild umkehrt, je nachdem, was man tut. Bei einer Aufgabe, bei der beide Modelle vergleichbare Token-Mengen verwenden, gewinnt Claude Opus 5.5 beim Preis mit großem Abstand. Bei einer langen agentischen Rechercheschleife, in der die Token-Zahlen so auseinandergehen, wie es Anthropics eigenes Launch-Material zeigt, nähern sich die beiden an – was eine weit weniger spannende Schlagzeile ist als eine 40-prozentige Kostensenkung und näher an dem, was der Praktiker berichtete.

Warum der rechercheintensive Nutzer nicht gewechselt ist

Setzt man die Teile zusammen, ist die Aussage „ich nehme trotzdem lieber Astra" kein Widerspruch mehr zu der Aussage „großartiger Geschmack". Es ist dieselbe Beobachtung von einem anderen Platz aus.

Die vom Nutzer genannten Workloads sind lang, offen, werkzeugnutzend und teuer pro Lauf. Bei diesen führt GPT-6 Astra die Science- und Automation-Boards an, verbraucht einen Bruchteil der Denk-Tokens und liegt – laut unabhängiger Messung – gleichauf beim Coding, sobald beide Modelle mit demselben Aufwand laufen. Die Vorteile von Claude Opus 5.5 konzentrieren sich auf die Arbeit, bei der man die Ausgabe sehen und beurteilen kann: Prosa, Designentscheidungen, das Abstecken eines mehrdeutigen Briefings, die Entscheidung, was ein Video über Navier-Stokes tatsächlich zeigen sollte. Das ist Geschmack, und Geschmack ist genau der Teil, der nicht auf einer Benchmark-Achse auftaucht.

Wenn Sie auf ein Urteil gehofft haben, dass ein Modell gewinnt, stützt die Beweislage das nicht. Die belastbare Version ist enger gefasst: Claude Opus 5.5 ist das bessere Modell für Arbeit, bei der Urteilsvermögen der Engpass ist, GPT-6 Astra ist das bessere Modell für Arbeit, bei der anhaltender Langkontext-Aufwand der Engpass ist, und die Preislücke zwischen ihnen schrumpft bei der zweiten Art von Arbeit auf nahezu null. Das ist eine Routing-Entscheidung, keine Konversion.

Beide ohne Migration ausführen

Screenshot of the OrcaRouter models catalogue filtered by the query "astra", showing one result card: OpenAI GPT-6 Astra, model id openai/gpt-6-astra, described as OpenAI's flagship model for demanding long-horizon end-to-end work, with a 1M context window and a per-1M-token base rate of $10.00 input, $50.00 output, $1.00 cache read and $12.50 cache write.

Dies ist der Punkt, an dem die beiden Modelle aufhören, ein Entweder-oder zu sein. GPT-6 Astra ist ab heute auf OrcaRouter zum Listenpreis von OpenAI selbst verfügbar — 10,00 $ Input, 50,00 $ Output, 1,00 $ gecachtes Lesen, 12,50 $ Cache-Schreiben — mit 0 % Aufschlag, der Listenpreis des Anbieters wird direkt weitergegeben. Das bedeutet, dass eine Preisänderung des Anbieters noch am selben Tag bei uns ankommt und nicht erst, wenn ein Reseller synchronisiert.

Claude Opus 5.5 ist über Anthropics eigene API und mehrere Drittplattformen erreichbar; wir führen es nicht als etwas, das wir anbieten, und Sie sollten gegenüber jedem skeptisch sein, der etwas anderes behauptet, bevor das Modell sich verbreitet hat. Was Sie heute tun können, ist, beide Modelle hinter einen einzigen Schlüssel und eine einheitliche Endpoint-Form zu bringen und pro Workload statt nach Vorliebe zu routen: Schicken Sie die offene, urteilintensive Anfrage an Claude Opus 5.5 und die lange Rechercheschleife an GPT-6 Astra, ohne zwei Verträge oder zwei Client-Integrationen pflegen zu müssen.

Automatisches Failover ist das, was dieses Testen gefahrlos macht. Ein neues Modell ist noch kein Produktionspfad, und das Routing über einen einzigen Endpunkt bedeutet, dass ein Anbieter-Zwischenfall oder ein Rate Limit die Anfrage verschiebt, statt sie fehlschlagen zu lassen. Wenn Sie herausfinden möchten, ob die Geschmackslücke bei Ihrer eigenen Arbeit real ist, ist das der günstige Weg, das herauszufinden – lassen Sie es neben dem laufen, was Sie bereits haben, statt es zu ersetzen, und lassen Sie Ihre eigene Suite entscheiden statt der Launch-Tabellen.

Die Frage, die die Benchmarks nicht beantworten können

Zwei Dinge sind es wert, beobachtet zu werden, und keines davon ist ein weiterer Benchmark-Punkt.

Der erste Punkt ist, ob die Asymmetrie bei den Effort-Einstellungen aufgelöst wird. Derzeit erzeugt eine Anbietertabelle mit xhigh gegen einen Wettbewerber mit high einen Vorsprung von 8,5 Punkten, den unabhängiges Testen bei identischen Einstellungen in ein Unentschieden verwandelt. Während unabhängige Labore Läufe mit identischen Einstellungen auf den Science- und Automation-Boards veröffentlichen, wo GPT-6 Astra derzeit führt, kann sich dieses Bild in die eine oder andere Richtung verschieben — und es wird sich aufgrund von Belegen verschieben, nicht aufgrund der Darstellung von irgendjemandem.

Das zweite ist die Frage der Token-Effizienz. Wenn der Denk-Overhead von Claude Opus 5.5 in einem Point Release sinkt, wird sein 2,5-facher Preislisten-Vorteil nicht länger aufgewogen und das Preisargument gewinnt eindeutig. Wenn nicht, dann liegt der Praktiker, der GPT-6 Astra als seinen Haupttreiber beibehalten hat, keineswegs hinter dem Nachrichtenzyklus zurück. Er hat seine eigene Arbeitslast richtig gelesen, und die Launch-Tabelle hat sie schlicht nicht gemessen.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert