Eine generierte Titelkarte für Claude Opus 5.5 vs. GPT-6 Astra, untertitelt mit „Eine Sechs-Dollar-Lücke und ein Zuschlag oberhalb von 272.000 Tokens“, mit einem flachen Waage-Symbol und einer Fußzeile mit dem Wortlaut „Index laut Artificial Analysis bei maximalem Aufwand; Preise laut den Anbietern.“ Das echte OrcaRouter-Logo ist unten rechts eingefügt.
Guides & Insights

Claude Opus 5.5 vs. GPT-6 Astra: Die $6-Lücke und der zweite Preis, den Astra oberhalb von 272K verlangt

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Anbieter haben diesen Monat Benchmark-Tabellen für ihre Flaggschiffe veröffentlicht, jede zeigte das eigene Modell als Sieger, und keine der Tabellen enthält auch nur eine einzige Zeile, in der die beiden Modelle gegeneinander getestet wurden. Claude Opus 5.5, erschienen am 22. September 2026 zu 4 US-Dollar pro Million Input-Tokens, und GPT-6 Astra, erschienen am 3. September 2026 zu 10 US-Dollar pro Million Input-Tokens, haben zwischen sich genau zwei Benchmarks, die sich überschneiden — und sie teilen sie unter sich auf: Opus 5.5 übernimmt die AutomationBench-nahe Arbeit in Ant​hropics Tabelle und Astra übernimmt sie in Open​AIs, und bei wissenschaftlichem Reasoning liegt Astra in beiden eindeutig vorn. Das ist es, was das Anbietermaterial hergibt. Das unabhängige Bild ist weniger mehrdeutig und weist in die andere Richtung, und das Bild bei den Preisen ist ungleicher als beides.

Was jede Seite veröffentlichte

Anthropics Tabelle für Opus 5.5 nutzt ihr eigenes Harness und ihre eigenen Effort-Einstellungen, und wo sie Astra aufführt, stammen die Zahlen von Anthropic und nicht aus einem erneuten Durchlauf. Behandle den gesamten Satz als vom Anbieter gemeldet:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % vs. GPT-6 Astra 57,9 % (Anthropic merkt an, dass für den Opus-Lauf xhigh-Aufwand verwendet wurde)

• FrontierCode v1.1 — Claude Opus 5.5 54,4 % vs. GPT-6 Astra 53,3 %

• GDPval-AA v2.1, Wissensarbeit — Claude Opus 5.5 1.846 Elo vs. GPT-6 Astra 1.542

• AutomationBench — Claude Opus 5.5 40,0 % vs. GPT-6 Astra 41,4 % (Astra liegt vorn)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7 % vs. GPT-6 Astra 64,6 % (Astra liegt vorn)

• Humanity's Last Exam, mit Werkzeugen — Claude Opus 5.5 67,7 % vs. GPT-6 Astra 57,2 %

OpenAIs Seite ist schwieriger in Einklang zu bringen, weil OpenAI Astra gegen seinen eigenen Vorgänger und nicht gegen Anthropics Flaggschiff veröffentlicht hat, und die Benchmarks, die es wählte – Computer Use, Frontend-Engineering, Allgemeinwissen – tauchen in Anthropics Tabelle größtenteils überhaupt nicht auf. Das ist keine Unehrlichkeit, sondern normales Launch-Verhalten, und genau deshalb ist ein Vergleich, der aus zwei Anbieter-Tabellen gebaut wird, ein Vergleich zweier Auswahlen und nicht zweier Modelle. Das Einzige, worin sich beide Tabellen einig sind, ist, dass Astra bei agentischer Wissenschaft und Computer Use stark ist und dass die beiden Modelle beim Coding nah genug beieinanderliegen, dass die Wahl des Harness das Ergebnis verschieben könnte.

Die unabhängige Lesart, für die sich keiner der Anbieter entschieden hat

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis führt jedes Modell in einer veröffentlichten Konfiguration aus, daher sind seine Zahlen die einzigen hier, die vom selben Evaluator unter denselben Bedingungen erzeugt wurden:

• Intelligenzindex — Claude Opus 5.5 58, Platz 1 von 210 vs. GPT-6 Astra 53, Platz 6

• Konfigurationsbezeichnung — Claude Opus 5.5 „Adaptives Reasoning, Maximaler Aufwand, Standard-Fallback“, GPT-6 Astra „max“

• Ausgabegeschwindigkeit — GPT-6 Astra 52,5 Tokens/Sek., am unteren Ende seiner Preisklasse im Vergleich zu Claude Opus 5.5, noch nicht veröffentlicht

• Zeit bis zum ersten Token — GPT-6 Astra 352,15 s vs. ein Board-Median von 3,83 s; Claude Opus 5.5 noch nicht veröffentlicht

• Preis — Claude Opus 5.5 4,00 $ Eingabe / 20,00 $ Ausgabe pro Million vs. GPT-6 Astra 10,00 $ / 50,00 $

• Kontext und Ausgabe — GPT-6 Astra 1M Kontext und 128K maximale Ausgabe vs. Claude Opus 5.5 1M und 128K

Ein Abstand von fünf Punkten im Index ist für sich genommen nicht entscheidend, und er sollte nicht als solcher gelesen werden — beide Modelle landen im selben Fähigkeitsband, und genau das bedeutet in diesem Quartal „Frontier“. Was die Astra-Zeilen jedoch belegen, ist, dass der Aufpreis keinen Fähigkeitsvorsprung auf dem einen Board erkauft, auf dem beide Modelle auftauchen. Die Latenz-Zeile ist die ehrliche Komplikation: 352 Sekunden bis zum ersten Token sind der mit Abstand höchste Wert in dieser Gruppe, obwohl er bei maximalem Aufwand gemessen wird und ein Reasoning-Modell, das nachdenkt, bevor es ausgibt, nach dieser Metrik immer langsam aussieht. Die Zahl von 52,5 Tokens/Sek. ist die besser übertragbare, und sie ist für ein Modell bei $10/$50 eher niedrig.

Astras zweiter Preis, über 272.000 Token

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

Die Preisliste ist der Punkt, an dem diese beiden überhaupt nicht mehr vergleichbar sind, denn Astras Preisgestaltung enthält eine Stufe. Die Standardtarife liegen bei 10,00 $ Eingabe, 1,00 $ gecachte Eingabe, 12,50 $ Cache-Schreiben und 50,00 $ Ausgabe pro Million Token. Überschreitet man jedoch 272.000 Eingabe-Token, wird die gesamte Anfrage neu bepreist – nicht nur der Überschuss, sondern der gesamte Aufruf – mit dem 2-fachen für Eingabe- und Cache-Tarife und dem 1,5-fachen für die Ausgabe. Damit landet Long-Context-Arbeit bei ungefähr 20 $ Eingabe und 75 $ Ausgabe pro Million Token.

Claude Opus 5.5 macht das nicht. Anthropic berechnet 4,00 $ und 20,00 $ für das volle 1M-Token-Fenster zum Standardpreis und gibt ausdrücklich an, dass eine Anfrage mit 900K Token zum selben Preis pro Token abgerechnet wird wie eine mit 9K Token. Das vordergründige Verhältnis zwischen diesen beiden – Astra kostet in beide Richtungen 2,5x so viel wie Opus 5.5 – ist also nicht das Verhältnis, das für die Workloads gilt, für die beide Modelle tatsächlich verkauft werden. Bei einem Long-Horizon-Agenten mit großem Arbeitskontext lautet der Vergleich 20 $/75 $ gegen 4 $/20 $, was einen Faktor von fünf beim Input und fast vier beim Output bedeutet. Batch-Pricing verstärkt das, statt es zu beheben: Opus 5.5 halbiert sich auf 2,00 $/10,00 $, während sich Astras Flex-Tier auf 5,00 $/25,00 $ halbiert – auf einer Basis, die im Long-Context-Fall bereits fünfmal höher ist.

Dies ist die mit Abstand entscheidungsrelevanteste Asymmetrie in diesem Vergleich, und sie ist in keiner Launch-Tabelle beider Unternehmen sichtbar, weil beide Anbieter den Headline-Preis nennen. Wenn Ihre Prompts unter 272K Tokens liegen, ignorieren Sie sie. Wenn Sie einen Agenten bauen, der ein Repository oder eine Dokumentensammlung liest, setzen Sie ihn mit $20/$75 an, bevor Sie überhaupt etwas vergleichen.

Zugriff ist Teil der Spezifikation

Astra ist das erste OpenAI-Modell, das unter dem unternehmenseigenen Preparedness Framework die kritische Schwelle für Cybersicherheitsfähigkeiten überschreitet, und der Rollout spiegelt diese Einstufung wider und nicht die Kapazität. Der Zugang wurde zuerst für eine begrenzte Gruppe von Organisationen geöffnet, für Unternehmenszugriff muss ein Administrator ihn erst aktivieren, bevor Nutzer ihn sehen, und das ausgelieferte Modell lehnt bestimmte Kategorien von Arbeit rundheraus ab. Claude Opus 5.5 bringt eine Variante desselben Problems aus der entgegengesetzten Richtung mit: Es wird mit der Schutzstufe ausgeliefert, die Anthropic zuvor für Claude Fable 5.1 reserviert hatte, was bedeutet, dass die meisten Cybersicherheitsanfragen an Claude Opus 4.8 umgeleitet werden und Biologiearbeit auf Claude Opus 5 zurückfällt, es sei denn, das Konto ist verifiziert.

Beide Verhaltensweisen zeigen sich an derselben Stelle, nämlich in Ihrer Evaluation. Artificial Analysis bezeichnet die Konfiguration von Opus 5.5 genau deshalb als „Default Fallback“, weil Anfragen bei einem anderen Modell landen können als dem, das Sie angegeben haben, und bei Prompts zu Sicherheit oder Lebenswissenschaften passiert das routinemäßig. Wenn Ihr Workload in diesen Bereichen liegt, ist der Modell-String in Ihrer Anfrage keine Garantie dafür, welches Modell geantwortet hat, und Ihre Qualitätskennzahlen enthalten bei einem unbekannten Anteil der Aufrufe ein kleineres Modell. Keiner der beiden Anbieter verbirgt das – beide dokumentieren es –, aber in keiner der beiden Schlagzeilen wird es erwähnt.

Zwischen ihnen wählen

Die Entscheidung, die dieser Vergleich tatsächlich aufwirft, ist, ob ein Long-Context-Workload die Stufenpreisgestaltung von Astra rechtfertigt, und für die meisten Teams wird die Antwort nein lauten: Opus 5.5 ist bei jeder Zeile unter 272K günstiger, oberhalb davon drastisch günstiger, schneidet auf dem einen unabhängigen Board besser ab und erreicht 1M Tokens Kontext ohne Aufpreis. Astras Anwendungsfall ist enger und real — wissenschaftliches Schlussfolgern, Computer Use und das Tooling des OpenAI-Ökosystems — und wenn Ihre Evals Astra bei diesen Punkten vorne sehen, ist der Aufpreis ein Posten und kein Fehler.

Praktisch wird das dort, wo es darum geht, wie du die beiden gegeneinander laufen lässt, denn ein fairer Vergleich braucht beide Modelle mit demselben Schlüssel und derselben Abrechnung. Beide lassen sich über OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag routen — Claude Opus 5.5 bei Anthropic zu 4,00 $/20,00 $ und GPT-6 Astra zu 10,00 $/50,00 $ — was bedeutet, dass die 272K-Entscheidung am eigenen Traffic getestet werden kann, statt sie anhand von zwei Pressemitteilungen zu diskutieren. Astra auf die Aufgabenklassen festzunageln, in denen es gewinnt, und automatisches Failover den Rest übernehmen zu lassen, ist eine Routing-Regel, und eine Anfrage, die die 272K-Grenze überschreitet, kann ohne Codeänderung über einen günstigeren Pfad geleitet werden, weil die Regel im Router und nicht in deiner Anwendung lebt.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Was würde die Antwort ändern?

Eines wäre: ein kontrollierter direkter Vergleich bei identischem Aufwand auf gemeinsamen Benchmarks. Keiner der Anbieter hat einen solchen veröffentlicht, und keiner hat einen Anreiz dazu, was den unabhängigen Index als den einzigen verfügbaren Vergleich unter gleichen Bedingungen übrig lässt — und dieser Index setzt Opus 5.5 fünf Punkte und fünf Ränge über Astra bei weniger als der Hälfte des Token-Preises. Das Gegenargument, das es zu beobachten gilt, ist, dass beide Modelle mit maximalem Aufwand bewertet wurden, während Opus 5.5 standardmäßig auf medium eingestellt ist; wenn Astas Vorteil bei langfristiger wissenschaftlicher Arbeit einen Lauf mit identischem Aufwand übersteht, wird der Fall für den Aufpreis stärker statt schwächer. Bis jemand ihn durchführt, ist die verteidigbare Position, dass Astra ein Spezialist ist, der wie ein Generalist bepreist wird, und Opus 5.5 der Generalist ist, der zufällig höher punktet.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert