
Claude Opus 5.5 vs. GPT-6 Sol: Zum halben Preis – bis der Kontext lang wird
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Anthropic und OpenAI veröffentlichten am selben Nachmittag konkurrierende Flaggschiffmodelle. Claude Opus 5.5 wurde am 22. September 2026 für 4 US-Dollar pro Million Input-Tokens und 20 US-Dollar pro Million Output-Tokens veröffentlicht, eine Senkung um 20 % bei beiden Werten gegenüber Claude Opus 5. GPT-6 Sol wurde am selben Tag für 2 US-Dollar Input und 10 US-Dollar Output veröffentlicht, eine glatte Senkung um 50 % gegenüber GPT-5.6 Sol, die OpenAI als dauerhaft statt als Werbeaktion bezeichnete. Liest man nur diese beiden Sätze, wirkt das Duell entschieden, bevor es beginnt: Das OpenAI-Modell kostet die Hälfte, und halber Preis ist halber Preis. Liest man den Rest beider Preislisten, schließt sich die Lücke größtenteils – nicht weil einer der Anbieter etwas geändert hätte, sondern weil beide Modelle auf dieselbe Art von Anfrage einen Zuschlag erheben, und er zehrt bei Sol weit stärker am Vorsprung als bei Anthropic.
Zwei Tarifkarten, beide mit einer Stufe darin
Unter 272.000 Eingabe-Tokens ist dies der einfachste Vergleich an der aktuellen Frontier:
• Eingabe — GPT-6 Sol 2,00 $ pro Million vs. Claude Opus 5.5 4,00 $
• Ausgabe — GPT-6 Sol 10,00 $ pro Million vs. Claude Opus 5.5 20,00 $
• Zwischengespeicherte Eingabe — GPT-6 Sol etwa 90 % günstiger beim zwischengespeicherten Anteil als Claude Opus 5.5 mit 0,20 $ pro Million, ein 5-%-Multiplikator auf die Basiseingabe
• Kontext und Ausgabe — GPT-6 Sol 872K gemessen von Artificial Analysis, 1M andernorts angegeben, 128K maximale Ausgabe vs. Claude Opus 5.5 1M und 128K
• Wissensstand – Claude Opus 5.5 Juni 2026 vs. GPT-6 Sol nicht in denselben Begriffen angegeben
Oberhalb von 272.000 Eingabe-Tokens ändert sich die Rechnung auf beiden Seiten – und nicht im gleichen Umfang. GPT-6 Sol berechnet die gesamte Anfrage neu – nicht den Überschuss, den gesamten Aufruf – mit etwa dem Doppelten des Eingabe-Tarifs und dem Anderthalbfachen des Ausgabe-Tarifs, was bei etwa $4,00 Eingabe und $15,00 Ausgabe landet. Die Tarifkarte von Claude Opus 5.5 kennt keine Long-Context-Stufe: Anthropic berechnet $4,00 und $20,00 über das gesamte 1-Mio.-Token-Fenster und gibt an, dass eine Anfrage mit 900.000 Tokens pro Token genauso viel kostet wie eine mit 9.000 Tokens.
Nimmt man beides zusammen, kippt die Reihenfolge an einer unerwarteten Stelle. Bei einem Aufruf mit langem Kontext konvergieren die Input-Tarife bei beiden Modellen bei ungefähr $4 – Sols Halbpreisvorteil beim Input verschwindet vollständig –, während sich der Output von einer 2x-Lücke auf etwa $15 gegenüber $20 verengt, ein Vorteil von 25 % statt 50 %. Sol ist weiterhin günstiger. Es ist nicht mehr günstig genug, um die einzige Zahl in der Entscheidung zu sein, und der Grund dafür ist, dass die beiden Zuschläge unterschiedliche Formen haben: Das Modell von Anthropic berechnet einen Pauschaltarif, der zufällig höher ausfällt, während das von OpenAI eine Strafgebühr berechnet, die ausgerechnet bei den agentischen, Repository-lesenden, Dokumentensatz-Workloads am härtesten einschlägt, für die beide Unternehmen diese Modelle verkaufen.

Die unabhängige Bewertung, die der einzige Vergleich unter gleichen Bedingungen ist

Keine der beiden Launch-Tabellen enthält das neue Modell der jeweils anderen – beide wurden verfasst, bevor die am selben Tag veröffentlichten Modelle erschienen – daher kann das Anbietermaterial diese beiden überhaupt nicht einordnen. Artificial Analysis kann es, weil es jedes Modell in einer einzigen veröffentlichten Konfiguration ausführt:
• Intelligenz-Index — Claude Opus 5.5 58, Platz 1 von 210 vs. GPT-6 Sol 48, Platz 18
• Konfigurationsbezeichnung — beide mit maximalem Aufwand bewertet; Claude Opus 5.5 zusätzlich als „Default Fallback" gekennzeichnet
• Ausgabegeschwindigkeit — GPT-6 Sol 113,3 Token/Sek., auf Rang 38 gegenüber Claude Opus 5.5, noch nicht veröffentlicht
• Zeit bis zum ersten Token — GPT-6 Sol 142,74 s vs. einem Board-Median von 3,83 s; Claude Opus 5.5 noch nicht veröffentlicht
• Preis — GPT-6 Sol 2,00 $ / 10,00 $ pro Million vs. Claude Opus 5.5 4,00 $ / 20,00 $
Zehn Indexpunkte und siebzehn Ränge sind der größte Abstand in einer aktuellen Claude-versus-OpenAI-Paarung, und er fällt zum zweiten Mal in diesem Monat gegen das günstigere Modell aus — dasselbe Muster zeigte sich, als GPT-6 Sol in einem früheren Vergleich auf Claude Opus 5 traf und bei 60 % niedrigeren Kosten um drei Punkte verlor. Die Geschwindigkeitszeile schlägt in die andere Richtung aus und ist wichtiger, als es aussieht: 113,3 Token pro Sekunde sind etwa doppelt so viel, wie das GPT-6 Astra Flaggschiff schafft, und es ist der schnellste Wert in dieser Gruppe. In Kombination mit einem First Token nach 142 Sekunden ergibt sich das Profil eines Modells, das lange nachdenkt und dann schnell schreibt, was schlecht zu allem Interaktiven passt und für lange unbeaufsichtigte Läufe angemessen ist.
Beide Zahlen tragen denselben Vorbehalt wie die der Anbieter: Es sind Messungen bei maximalem Aufwand, und die werksseitige Standardeinstellung keines der beiden Modelle ist maximaler Aufwand. Claude Opus 5.5 verwendet standardmäßig medium auf einer Aufwandsskala, die von niedrig bis maximal reicht; GPT-6 Sol bietet eine Skala, die von keiner bis maximal reicht. Ein Maximalaufwand-Index ist ein fairer Weg, um Obergrenzen zu vergleichen, und ein irreführender Weg, um die Rechnung vorherzusagen.
Was bricht, wenn du umschaltest, in beide Richtungen?
Die Migrationsreibung ist hier asymmetrisch und wissenswert, bevor man den einen oder anderen Schritt geht.
Claude Opus 5.5 ist kein Drop-in-Ersatz für Claude Opus 5. Thinking lässt sich nicht mehr deaktivieren, sodass Code, der einen Pfad ohne Thinking gesetzt hat, einen Fehler auslöst oder sein Verhalten stillschweigend ändert. Erzwungene Tool-Nutzung gibt einen Fehler zurück. Thinking-Blöcke sind an das Modell und die Konversation gebunden, die sie erzeugt haben, sodass sie nicht modellübergreifend wiedergegeben werden können. Das ältere computer_20251124 Computer-Use-Tool wird in der Claude API oder in Google Cloud nicht akzeptiert. Davon abgesehen wird Text zwischen Tool-Aufrufen jetzt in Thinking-Blöcken zurückgegeben, die bei der Standard-Anzeigeeinstellung leer sind, sodass eine Anwendung, die diesen Text als Fortschritt streamt, zwischen Aufrufen einfach verstummt, ohne irgendetwas auszulösen.
Die Effort-Skala von GPT-6 Sol ist die flexiblere der beiden: Sie lässt sich mitten im Gespräch ändern, ohne den Prompt-Cache zu invalidieren, was bedeutet, dass ein günstiger erster Durchlauf und ein teurer erneuter Versuch im selben Kontext ein unterstütztes Muster darstellen und kein cache-zerstörendes. Das ist ein echter technischer Vorteil für alle, die abgestuftes Reasoning innerhalb einer einzigen Sitzung betreiben, und es ist das stärkste Argument für Sol, das in keiner Preistabelle auftaucht.
Beides ausführen und mit Ihren eigenen Zahlen entscheiden
Die ehrliche Einschätzung zu diesem Duell ist, dass die Herstellertabellen es nicht entscheiden können und der unabhängige Index nur die Obergrenze klärt. Was bleibt, ist die Frage der Arbeitslast — wie lange Ihre Kontexte tatsächlich laufen und wie viel ein fehlgeschlagener Versuch kostet — und die lässt sich an Ihrem eigenen Traffic messen statt anhand einer Pressemitteilung diskutieren.
Beide Modelle sind über OrcaRouter zum Listenpreis des Anbieters mit 0 % Aufschlag routbar: GPT-6 Sol zu OpenAIs $2.00 / $10.00 und Claude Opus 5.5 zu Anthropics $4.00 / $20.00. Da die Durchleitung exakt ist und sich die Preise an dem Tag ändern, an dem die Anbieter sie ändern, ist das Verhältnis, das Sie im Staging messen, das Verhältnis, das Sie in der Produktion zahlen – ohne eine Aufschlagsebene, die neu hergeleitet werden müsste. Ein Schlüssel deckt beide ab, sodass die Routing-Regel, die Aufrufe unter 272K an Sol und Long-Context-Aufrufe an das Modell weiterleitet, das in Ihren Evals gewinnt, eine Konfigurationsänderung statt einer zweiten Integration ist – und automatisches Failover bedeutet, dass ein Launch am selben Tag auf einer der beiden Seiten etwas ist, auf das Sie einen Teil des Traffics legen können, statt eine Wette, die Sie mit einer ganzen Pipeline eingehen.

Die Version davon, die den Kontakt mit einem Gesetzentwurf übersteht
GPT-6 Sol ist in jeder Zeile, in jeder Konfiguration das günstigere Modell, und das steht außer Frage. Was sich nicht hält, ist die Annahme, „halber Preis“ sei die Zahl, mit der man planen sollte: Bei einem Aufruf mit langem Kontext treffen sich die Eingabetarife bei etwa 4 $, und die Ausgabelücke schrumpft auf ein Viertel – eine andere Entscheidung als die, die die Launch-Seiten beschreiben. Rechnet man dagegen eine Indexlücke von zehn Punkten, siebzehn Ränge und ein gemessenes erstes Token nach 142 Sekunden, ergibt sich die Aufteilung für die meisten Workloads von selbst – Sol als Standard für hohes Volumen bei kurzen und mittleren Kontexten, Claude Opus 5.5 dort, wo der Kontext lang wird oder die Aufgabe so schwer ist, dass ein erneuter Versuch mehr kostet als die Token-Differenz. Der Fehler, den es zu vermeiden gilt, ist, eines davon allein aufgrund des Schlagzeilenpreises zu wählen, denn die zweite Zahl auf jeder Preisliste entscheidet den Fall, für den beide Modelle gebaut wurden.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
