
GPT-6 Sol Pro vs. Claude Opus 5: Die Aufwandsleiter, die niemand in die Tabelle aufnimmt
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
GPT-6 Sol Pro und Claude Opus 5 werden ständig miteinander verglichen – und fast immer mit der falschen Einstellung. Der kursierende Vergleich stellt Claude Opus 5 mit seinem höchsten Reasoning-Aufwand gegen GPT-6 Sol Pro mit seinem höchsten Reasoning-Aufwand, was eine Drei-Punkte-Lücke auf dem neutralen Index und einen fünffachen Kostenunterschied ergibt. Setzt man beide Modelle auf die Konfiguration, die ihre jeweiligen Anbieter standardmäßig ausliefern – und bedenkt man, dass „Pro“ im Namen des erstgenannten Modells eine Reasoning-Konfiguration und kein separates Modell ist –, verschwindet die Drei-Punkte-Lücke vollständig. Was bleibt, ist der Kostenunterschied, und er ist der einzige Teil der Geschichte, der den Kontakt mit einer Produktionsrechnung übersteht.
Das ist kein Darstellungstrick. Es ist die direkte Folge zweier Aufwandstreppen, die nicht aufeinander kalibriert sind und von zwei Anbietern veröffentlicht wurden, die sich an den älteren Modellen des jeweils anderen messen.
Was die beiden Modelle tatsächlich sind, bevor irgendein Vergleich erfolgt
GPT-6 Sol ist OpenAIs Reasoning-Modell der Mittelklasse, allgemein verfügbar seit dem 22. September 2026, für 2,00 US-Dollar pro Million Input-Tokens und 10,00 US-Dollar pro Million Output-Tokens. In der Entwicklerdokumentation von OpenAI gibt es keine Modellkennung gpt-6-sol-pro — die Seite führt einen einzigen Sol-Eintrag auf, ein Kontextfenster von 1.050.000 Tokens, eine maximale Eingabe von 922.000 Tokens, eine Obergrenze von 128.000 Tokens für die Ausgabe, einen Wissensstand vom 20. April 2026 sowie eine Stufenleiter für den Reasoning-Aufwand mit none, low, medium, high, xhigh und max, wobei medium der Standard ist. „Pro" ist ein Wert des Reasoning-Modus, dasselbe Alias-Muster, das die GPT-5.6-Generation etabliert hat und das diese hier übernommen hat. Einen Katalogeintrag eines Drittanbieters namens GPT-5.6 Sol Pro gibt es zwar, und er nennt inzwischen 2,00 US-Dollar und 10,00 US-Dollar — die Zahlen von GPT-6 Sol —, doch das ist ein Namensartefakt und kein Produkt.
Claude Opus 5 ist ein echtes, separat bepreistes Modell von Anthropic, allgemein verfügbar seit dem 24. Juli 2026 zu 5,00 $ für Input und 25,00 $ für Output pro Million Tokens. Sein Kontextfenster umfasst 1.000.000 Tokens, seine synchrone Ausgabengrenze liegt bei 128.000, und seine eigene Effort-Leiter – output_config.effort – reicht von low über medium, high und xhigh bis max, wobei high der Standard ist. Thinking ist adaptiv und standardmäßig aktiviert – eine Premiere für die Opus-Familie.
Ein weiterer Fakt, der alles Folgende prägt und den keine bestehende Vergleichsseite aufführt: In Anthropics eigener Lifecycle-Tabelle wird Claude Opus 5 als Aktiv (Legacy)geführt, mit einem Migrationsbanner, das auf Claude Opus 5.5 verweist; dieses erreichte am 22. September 2026 die allgemeine Verfügbarkeit – zu 4,00 $ und 20,00 $. Die Launch-Charts von OpenAI benchmarken weiterhin gegen Opus 5, nicht gegen 5.5. Das im Vergleich betrachtete Modell ist das Opus der vorherigen Generation.
Die beiden Preiszeilen, Zeile für Zeile
Beides sind Anbieterlisten – die von OpenAI und Anthropic selbst veröffentlichten Zahlen, unverändert weitergegeben von den Plattformen, die sie hosten.
• Eingabe — GPT-6 Sol 2,00 $ pro Million Tokens vs. Claude Opus 5 5,00 $ pro Million Tokens
• Ausgabe — GPT-6 Sol 10,00 $ pro Million Token vs. Claude Opus 5 25,00 $ pro Million Token
• Cache-Lesevorgang — GPT-6 Sol 0,20 $ pro Million Token vs. Claude Opus 5 0,50 $ pro Million Token; beide liegen pauschal bei 10 % des Tarifs für ungecachten Input
• Cache-Schreibvorgang — GPT-6 Sol 2,50 $ pro Million Tokens bei einer einzigen TTL vs. Claude Opus 5 6,25 $ bei einer TTL von fünf Minuten und 10,00 $ bei einer TTL von einer Stunde; die längere TTL ist eine Option, die OpenAI nicht anbietet, und sie ist die Stufe, die die meisten Vergleichstabellen versehentlich angeben, weil sie diejenige ist, die auf den Karten des gehosteten Katalogs erscheint
• Umgang mit langem Kontext — GPT-6 Sol berechnet eine Anfrage oberhalb seiner Eingabeschwelle für die gesamte Anfrage zu einem höheren Satz; Claude Opus 5 erhebt überhaupt keinen Langkontext-Zuschlag, sodass eine 900.000-Token-Anfrage zum gleichen Preis pro Token abgerechnet wird wie eine 9.000-Token-Anfrage.
• Batch — GPT-6 Sol hat einen Batch-Endpunkt mit Standardrabatt, verglichen mit der Message Batches API von Claude Opus 5 mit 50 % Rabatt in beide Richtungen, und der Anthropic-Batch-Rabatt lässt sich mit Prompt-Caching kombinieren
• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. Claude Opus 5 1.000.000 Token
• Maximale Ausgabe — 128.000 Tokens für beide, wobei Claude Opus 5 dies in der Message Batches API unter dem Beta-Header output-300k-2026-03-24 auf 300.000 erhöht
Der Batch-plus-Caching-Stack ist der am wenigsten diskutierte Punkt auf dieser Liste und derjenige, der die Arithmetik am stärksten verändert. Ein Batch-Rabatt von 50 %, der sich mit einem Cache-Read zu einem Zehntel des Eingabetarifs kombinieren lässt, ist ein anderes Angebot als ein Batch-Rabatt von 50 % allein, und bei langen Synthese-Aufträgen – bei denen zusätzlich die Batch-Ausgabengrenze von 300.000 Token von Anthropic gilt – schließt er einen bedeutenden Teil einer Lücke, die zum Listenpreis unüberbrückbar erscheint.

Die Aufwandsleiter ist der eigentliche Vergleich.
Hier ist die Zahl, die in jedem dieser Artikel stehen sollte. Bei Artificial Analysis, deren Testumgebung die einzige neutrale ist, die eine vollständige Aufwandsleiter für beide Modelle veröffentlicht, erreicht Claude Opus 5 bei maximalem Aufwand 51 Punkte und kostet 5,86 $ pro Index-Aufgabe. Bei der standardmäßigen hohen Einstellung erreicht es 48 Punkte und kostet 3,61 $. GPT-6 Sol erreicht bei maximalem Aufwand 48 Punkte und kostet 1,06 $ – und 43 bei hohem Aufwand für 0,37 $.
Lesen Sie diese beiden Zeilen zusammen. Claude Opus 5, der mit der von Anthropic standardmäßig ausgelieferten Effort-Einstellung läuft, landet auf exakt demselben Indexwert wie GPT-6 Sol, der mit voller Leistung läuft. Die Lücke, über die die Launch-Berichterstattung berichtet hat – drei Punkte –, existiert nur, wenn man jedes Modell am oberen Anschlag seines eigenen Reglers vergleicht, und der obere Anschlag des Reglers ist nicht dort, wo eines der beiden Modelle standardmäßig läuft. Der Vorteil von Opus 5 bei maximalem Effort ist real, und ihn zu erzielen kostet pro abgeschlossener Aufgabe etwa fünfeinhalbmal mehr.
An diese Zahlen gehören zwei einschränkende Hinweise hinsichtlich der Ehrlichkeit, und beide fehlen auf den Seiten, die sie zitieren.
• Die Indexversion ändert sich. Der Score von Opus 5 wurde seit Juli über aufeinanderfolgende Revisionen des Artificial Analysis Index hinweg mit 61, 63, 54 und 51 veröffentlicht. Keiner davon ist falsch; jeder einzelne ist falsch ohne sein Versionslabel. Die oben stehende 51 ist der aktuelle Stand der Rangliste, und sie ist nicht mit einer 61 vergleichbar, die aus einem Artikel vom Launch-Tag zitiert wird.
• Aufwandsstufen sind nicht über Anbieter hinweg kalibriert. Ein „high“ bei einem Modell ist nicht dasselbe Maß an Denkleistung wie ein „high“ bei einem anderen. Übereinstimmende Scores bei nominell unterschiedlichen Einstellungen sind ein Beleg für Kosten, nicht für eine Äquivalenz der Fähigkeiten.
Wo die unabhängige Aufzeichnung dünner ist, als sie aussieht
Claude Opus 5 hat acht Wochen Drittanbieter-Messungen hinter sich sowie eine Reihe vom Anbieter gemeldeter Markteinführungswerte, die klar als solche gekennzeichnet sind – Frontier-Bench v0.1 bei 43,3 %, ARC-AGI-3 bei 30,2 %, GDPval-AA v2 bei 1.861 Elo. Jeder einzelne dieser Werte wurde gegen GPT-5.6 Sol oder Claude Fable 5 gemessen, nicht gegen GPT-6 Sol. Es gibt nirgends ein Ergebnis aus einem gemeinsamen Test-Harness, das Opus 5 und GPT-6 Sol in Anthropics eigenen Benchmarks direkt gegeneinander antreten lässt, und Anthropics System Card räumt ein, dass das Modell insgesamt nicht leistungsfähiger ist als Claude Fable 5.
Die unabhängige Bilanz enthält zudem einen Vorbehalt in entgegengesetzter Richtung. In der AA-Omniscience-Bewertung von Artificial Analysis liegt die Halluzinationsrate von Opus 5 bei 50 %, vierzehn Punkte mehr als bei Opus 4.8 — die dokumentierte Ursache ist, dass die Ablehnungen von rund 23 % auf 7 % gefallen sind, sodass das Modell mehr Fragen beantwortet und bei mehr von ihnen falsch liegt. Vals AI hat separat offengelegt, dass Opus 5 und Fable 5 während Terminal-Bench-Durchläufen Opus 4.8 als Fallback für Ablehnungen verwendeten; die Neuklassifizierung der neun betroffenen bestandenen Durchläufe als Fehlschläge verschiebt Opus 5 von 84,64 % auf 81,27 %. Dies sind keine disqualifizierenden Befunde, aber ein Beitrag, der argumentiert, dass Opus 5 die zuverlässigere Wahl ist, muss sie beifügen.

GPT-6 Sols unabhängige Bilanz ist diese Woche nur eine Zahl breit: der oben stehende Indexwert, gemessen bei maximalem Aufwand, mit achtzehn Monaten Modellveröffentlichungen im Rücken, die sich in Tests durch Dritte angesammelt haben. Diese Asymmetrie – acht Wochen Prüfung gegen einen Tag – ist der ehrliche Grund, warum ein Käufer den fünffachen Aufpreis womöglich immer noch zahlt, und sie ist ein besserer Grund als die Drei-Punkte-Schlagzeile.
Wo eine Routing-Schicht die Entscheidung ändert
Claude Opus 5 ist im OrcaRouter-Katalog für $5.00 Input, $25.00 Output, $0.50 Cache-Lesen und $10.00 Cache-Schreiben pro Million Tokens verfügbar, mit einem Fenster von 1.000.000 Tokens, einer Ausgabegrenze von 128.000 Tokens und sowohl den Endpunkten /v1/chat/completions als auch /v1/messages — die Listenpreise des Anbieters werden durchgereicht, mit ohne Aufschlag obendrauf, sodass eine Preisänderung von Anthropic bei uns am selben Tag live ist, an dem sie bei ihnen live ist. Die Cache-Schreib-Angabe auf der Modellkarte entspricht dem Satz für eine TTL von einer Stunde; die Fünf-Minuten-Stufe von Anthropic beträgt $6.25, und wenn man eine nennt, ohne zu sagen, welche, sehen die beiden Zahlen wie ein Widerspruch aus.
GPT-6 Sol ist keine unserer Routen, daher ist nichts hier eine Aussage über seinen Preis bei uns.

Was ein einzelner Endpunkt in diesem Vergleich tatsächlich bringt, ist die Fähigkeit, beide Antworten gleichzeitig zu halten. Die Argumente für Opus 5 und die Argumente für Sol sind beide aufwandsabhängig, und Aufwand ist ein Parameter pro Anfrage, kein Vertrag. Ein Team, das beide Modelle hinter einem Schlüssel mit automatischem Failover routet, kann die Arbeit, die die maximale Aufwandsgrenze von Opus 5 benötigt, an Opus 5 senden und die Volumenstufe an Sol mit mittlerem Aufwand, ohne eine zweite Integration oder einen zweiten Satz Rate Limits. Die Routing-DSL integriert diese Entscheidung in den Aufruf statt in ein Migrationsprojekt — was hier speziell wichtig ist, weil die richtige Antwort für dieses Paar sich mit der Anfrage ändert, nicht mit dem Quartal.
Die Entscheidungsregel
• Volumenarbeit auf einem bekannten Qualitätsniveau — GPT-6 Sol mit mittlerem oder hohem Aufwand. Vierzig Indexpunkte zu $0,25 pro Aufgabe sind die günstigste glaubwürdige Position auf diesem Board, und der Aufwandsregler ist ein dokumentierter Parameter, keine Vermutung.
• Arbeit, die die Spitze des Fähigkeitsspektrums erfordert und sie bezahlen kann – Claude Opus 5 mit xhigh oder max. Drei Indexpunkte über Sols Obergrenze, bei 4,88 $ bis 5,86 $ pro Aufgabe, und der einzige der beiden mit einer Batch-Ausgabe-Obergrenze von 300.000 Token.
• Batch-Jobs mit großem Korpus — Claude Opus 5, mit dem strukturellen Argument statt dem Pro-Token-Argument. Kein Langkontext-Zuschlag, ein Batch-Rabatt, der sich mit Caching kombinieren lässt, und eine einstündige Cache-TTL für Präfixe, die ein Fünf-Minuten-Fenster überdauern.
• Alles, bei dem eine falsche Antwort teuer ist – nach der aktuellen Datenlage keiner von beiden. Die Halluzinationsrate von Opus 5 ist bei diesem Release um vierzehn Punkte gestiegen, und die Drittanbieter-Bilanz von Sol besteht aus einer einzigen Zahl.
• Wenn es sich bei dem Vergleich, der Ihnen gezeigt wurde, um „Opus 5 max versus Sol max“ handelte, führen Sie ihn vor Ihrer Entscheidung mit Standardaufwand erneut aus. Dort wird die Entscheidung tatsächlich getroffen, und es ist die eine Konfiguration, die Ihnen die bestehende Abdeckung nie zeigt.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
