
GPT-6 vs. Claude Opus 5: Beide Seiten dieses Duells wurden bereits ersetzt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Das Nützlichste, was man über GPT-6 versus Claude Opus 5 wissen sollte, ist, dass beide Seiten des Duells jeweils eine Generation hinter dem zurückliegen, was ihre eigenen Anbieter bereits veröffentlicht haben. Claude Opus 5 wurde am 24. Juli 2026 veröffentlicht und am 22. September durch Claude Opus 5.5 ersetzt. GPT-6 Sol wurde am 22. September veröffentlicht und am 29. September durch GPT-6.1 Sol ersetzt. Wenn Sie nach diesem Vergleich gesucht haben, weil Sie für neue Arbeit zwischen ihnen wählen, wählen Sie zwischen zwei Modellen, die jeder Anbieter bereits hinter sich gelassen hat – und die ehrliche Version dieses Artikels handelt davon, wann das ältere Paar noch die richtige Wahl ist, und nicht davon, wer gewinnt.
Was die beiden Modelle tatsächlich sind
Claude Opus 5 war Anthropics Flaggschiff: ein Kontextfenster von 1.000.000 Tokens, 128.000 Tokens maximale Ausgabe, Text-, Bild- und Dateieingabe, angegeben mit 5,00 US-Dollar pro Million Eingabe-Tokens und 25,00 US-Dollar pro Million Ausgabe-Tokens, mit einem Tarif von 0,50 US-Dollar für zwischengespeicherte Eingaben und 10,00 US-Dollar für Cache-Schreibvorgänge. Es ist ein einzelnes Modell mit einer einzigen ID, anthropic/claude-opus-5.
GPT-6 Sol ist die mittlere Stufe einer Drei-Modell-Generation — GPT-6 Astra darüber und GPT-6 Luna darunter — mit demselben Kontext von über 1.000.000 Token (der Katalog führt 1.050.000 für die OpenAI-Seite gegenüber 1.000.000 bei Opus 5), derselben Ausgabegrenze von 128.000 Token und derselben Text-/Bild-/Dateieingabe. Es ist mit 2,00 $ / 10,00 $ gelistet, mit einem Cache-Eingabe-Preis von 0,20 $ und einem Cache-Schreib-Preis von 2,50 $. Seine Tarifkarte enthält einen Schritt, den die Anthropic-Karte nicht hat: Jede Anfrage über 272.000 Eingabe-Token berechnet die gesamte Anfrage neu auf 4,00 $ / 15,00 $.
Das ist eine Preiskluft von 2,5x pro Token zugunsten von Sol am kurzen Ende, und die Kluft bleibt auch beim Cache bestehen – ein Rabatt von 90 % auf gecachte Eingaben bei Sol gegenüber einem Rabatt von 98 % bei Opus 5, was den Unterschied auf 0,20 $ gegenüber 0,50 $ pro Million verringert, statt ihn zu beseitigen. Bei einer Long-Context-Workload halbiert sich die Kluft, statt sich zu schließen.
• Eingabe — GPT-6 Sol 2,00 $ pro Million vs. Claude Opus 5 5,00 $
• Ausgabe — GPT-6 Sol 10,00 $ pro Million vs. Claude Opus 5 25,00 $
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro Million vs. Claude Opus 5 0,50 $
• Cache-Schreibvorgänge — GPT-6 Sol 2,50 $ pro Million vs. Claude Opus 5 10,00 $
• Über 272K Eingabe — GPT-6 Sol berechnet die gesamte Anfrage neu auf 4,00 $ / 15,00 $; kein entsprechender Schritt auf der Opus-5-Karte
• Kontext und Ausgabe — 1.050.000 Eingabe und 128.000 Ausgabe vs. 1.000.000 Eingabe und 128.000 Ausgabe
Das unabhängige Board, bei dem die Lücke größer ist als der Preis
Beim Preis liegt GPT-6 Sol um den Faktor 2,5 vorn. Das Board bevorzugt Claude Opus 5 stärker, als die Preisdifferenz vermuten ließe – das Gegenteil der üblichen Geschichte vom günstigen Modell.
• AA Intelligence Index — Claude Opus 5 50.8, belegt Platz 11; GPT-6 Sol 47.6, belegt Platz 14
• AA Coding Index — Claude Opus 5 78.0, belegt Platz 2 in dieser Rangliste; GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 vs GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 vs GPT-6 Sol 43.9
• τ-bench banking — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 vs GPT-6 Sol 57.6
• Long-context recall — Claude Opus 5 79.3 vs GPT-6 Sol 83.7
Zwei Zeilen laufen in die andere Richtung, und sie verdienen es, benannt zu werden, denn die aggregierte Betrachtung verbirgt sie. GPT-6 Sol schlägt Opus 5 bei Recall über lange Kontexte um 4,4 Punkte und liegt bei SciCode um 1,2 Punkte knapp vorn. Das ehrliche Bild ist also nicht „Opus 5 ist bei allem besser“ – sondern dass Opus 5 auf den Coding- und Agentic-Boards entschieden vorn liegt (ein Vorsprung von 24 Punkten im Coding-Index ist eine andere Kategorie von Ergebnis), während Sol die Zeile für den Abruf über ein langes Kontextfenster hält und bei einem der beiden Science-Code-Maße gleichauf liegt.
Ein methodischer Vorbehalt, bevor eine der beiden Zahlen irgendwo anders zitiert wird: Artificial Analysis garantiert nicht, dass zwei Modellseiten am selben Tag anhand derselben Index-Revision dargestellt werden, und es teilt seine Vergleichsgruppen auf – Open-Weights-Modelle werden gegen andere Open-Weights-Modelle derselben Größenklasse eingestuft, proprietäre Modelle über ein proprietäres Preisband hinweg. Beide Modelle hier sind proprietär, die beiden Zahlen stammen also von derselben Seite dieser Trennlinie, aber behandle die Unterschiede unterhalb eines Punktes als Richtung und nicht als kontrollierte Messung. Jede Anbieterangabe in diesem Beitrag ist ein Benchmarking des eigenen Modells durch den Anbieter gegen seinen eigenen Vorgänger und ist als solche gekennzeichnet.
Was die beiden Ersetzungen geändert haben
Claude Opus 5.5erschien am 22. September für 4,00 $ / 20,00 $ — bei beiden Messwerten günstiger als Opus 5, mit einem Cache-Input-Preis von 0,20 $, der dem von Sol entspricht — und erzielt 57,6 Punkte auf demselben Intelligence Index. Das sind 6,8 Punkte mehr als Opus 5 für 20 % weniger Geld. Jedes Argument, Opus 5 in einem neuen Build beizubehalten, muss erklären, warum es 6,8 Indexpunkte und 1,00 $/5,00 $ pro Million wert ist, beim älteren Checkpoint zu bleiben.
GPT-6.1 Sol erschien am 29. September zum selben Preis von 2,00 $ / 10,00 $ wie GPT-6 Sol und erzielte 51,8 im Index gegenüber 47,6 bei Sol, mit einem Cache-Input-Tarif von 0,10 $, der den Cache-Lesezugriff halbiert. Es ist derselbe Preis bei besserer Punktzahl und besserer Cache-Ökonomie. Das einzige Argument speziell für GPT-6 Sol ist dasselbe, das auch für Opus 5 gilt: eine Regressionssuite, die darauf baselined wurde, bei der ein Modellwechsel die Vergleiche ungültig macht, denen Sie bereits vertrauen.
Es gibt einen zweiten, leiseren Grund, warum ein Team beim älteren Paar bleibt, und er hat nichts mit Benchmarks zu tun. Beide sind die Checkpoints, die die längste Produktionsgeschichte hinter sich haben. Opus 5 ist seit dem 24. Juli aufrufbar, GPT-6 Sol seit dem 22. September, und die Messungen des unabhängigen Evaluators zu beiden laufen lange genug, um eine Form statt eines einzelnen Messwerts zu zeigen. Sols Traffic der letzten sieben Tage in unseren eigenen Routing-Daten beläuft sich auf etwa 2,1 Millionen Tokens; der von Opus 5 auf etwa 23,0 Millionen. Das ist ein rollierendes Fenster, keine Gesamtsumme über die gesamte Lebensdauer, und es verschiebt sich zwischen den Auslesungen – aber es erinnert daran, dass Opus 5 noch immer echte Arbeit in der Produktion leistet, selbst nachdem sein Nachfolger ausgeliefert wurde.
Der Latenz- und Kostenverlauf – genau hier macht Sol sich bezahlt
• Mediane Zeit bis zum ersten Token — GPT-6 Sol 6.785 ms vs. Claude Opus 5 4.652 ms
• Mediane Ausgabegeschwindigkeit — GPT-6 Sol 179,6 Token/s vs. Claude Opus 5 82,2 Token/s
• Über sieben Tage beobachteter Traffic auf unserer Seite — GPT-6 Sol ~2,1 Mio. Token, Claude Opus 5 ~23,0 Mio. Token
Sol gibt sein erstes Token nach etwa 2,1 Sekunden aus, streamt dann aber mit mehr als der doppelten Rate von Opus 5. Bei einer langen Generierung – der Art von Lauf, bei dem die Ausgabe Tausende von Token statt Dutzende umfasst – dominiert diese zweite Zahl, und ein günstiges Modell, das früher fertig wird, ist mehr wert, als seine Preisliste vermuten lässt. Bei einem kurzen, latenzempfindlichen Aufruf ist die First-Token-Zahl diejenige, die der Nutzer spürt.
Beide sind Serving-Messwerte aus unserem eigenen Routing, erhoben über ein rollierendes Sieben-Tage-Fenster, und sie schwanken von Auslesung zu Auslesung. Sie eignen sich, um die Ausprägung der beiden Modelle zu vergleichen, nicht aber, um sie als Service-Level-Erwartung zu zitieren.

Das Paar betreiben, solange die Migration noch nicht entschieden ist
Der Grund, warum es überhaupt lohnt, diesen Vergleich zu beantworten, ist, dass keine der beiden Ersetzungen eine Entscheidung ist, die man einfach so treffen kann. Wenn Ihre Evaluierungen gegen Claude Opus 5 aufgebaut wurden, ist der Wechsel zu Opus 5.5 eine Neubasierung, kein Upgrade; dasselbe gilt für GPT-6 Sol gegenüber GPT-6.1 Sol. Sinnvoll ist es in diesem Zeitfenster, beide Generationen parallel mit Ihrem eigenen Traffic laufen zu lassen, statt anhand des Leaderboards von jemand anderem auszuwählen.
Alle vier Modelle liegen im selben Katalog auf OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol und GPT-6.1 Sol, aufgerufen über eine einzige API vor über 200 Modellen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag weitergegeben wird, sodass eine Preissenkung des Anbieters noch am selben Tag hier ankommt und nicht erst bei Ihrer nächsten Abstimmung — was den Vergleich zu einer Routing-Frage statt zu einer Beschaffungsfrage macht. Die Routing-DSL ermöglicht die Aufteilung nach Anfragegröße oder nach Anteil: Schicken Sie einen Teil des Produktionsverkehrs an den neueren Checkpoint, vergleichen Sie ihn anhand Ihrer eigenen Evaluierungen mit der Baseline, erweitern Sie den Anteil, wenn die Zahlen stimmen, und behalten Sie das ältere Modell als Fallback, bis sie dies tun. Automatisches Failover über Anbieter hinweg deckt den Fall ab, dass eine Route mitten in der Migration degradiert — genau das Fehlerszenario, das dazu führt, dass Menschen eine Migration auf halbem Weg abbrechen.


Wer sollte welches wählen, da beide abgelöst sind?
Wenn Sie etwas Neues beginnen: keines von beiden. Claude Opus 5.5 ist günstiger als Claude Opus 5 und erzielt 6,8 Punkte mehr, und GPT-6.1 Sol kostet dasselbe wie GPT-6 Sol, bietet einen besseren Index und einen halbierten Cache-Lesevorgang. Der einzige Grund, mit dem älteren Paar zu beginnen, ist eine harte Abhängigkeit von einem Checkpoint, den Sie nicht ändern können.
Wenn Sie bereits eines davon einsetzen: Die Entscheidung betrifft Ihre Regressionssuite, nicht die Boards. Claude Opus 5 bleibt mit großem Abstand das stärkere Coding- und Agentic-Modell der beiden, daher sollte eine Coding-Pipeline, die darauf stabil läuft, den Vergleich mit Opus 5.5 suchen, statt seitwärts auf eine GPT-6-Klasse zu migrieren. Eine Pipeline mit hohem Volumen und Kostenempfindlichkeit auf GPT-6 Sol hat das einfachere Upgrade – gleicher Preis, bessere Punktzahl, besserer Cache – und der ehrliche Grund für eine Verzögerung ist nur, dass Sie Ihre Evaluierungen noch nicht erneut ausgeführt haben.
Und wenn die Antwort, die du wolltest, einfach nur war, welcher der beiden gewinnt: Claude Opus 5 tut es, auf fast jedem Board, für den 2,5-fachen Preis. Das Argument für GPT-6 Sol war nie, dass es besser war. Es war, dass es günstig genug war, um den Unterschied wert zu sein – und dieses Argument gehört jetzt GPT-6.1 Sol zum gleichen Preis mit einer besseren Punktzahl.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
