Hero-Titelkarte für Claude Opus 5.5 vs. GPT-5.6 Sol, betitelt „Zwei Launch-Tabellen, die sich kaum überschneiden“, mit Badges, auf denen $4,00 vs. $5,00, 66,4 % vs. 37,3 % und Cutoff Jun. vs. Feb. stehen, und dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Claude Opus 5.5 vs. GPT-5.6 Sol: Zwei Markteinführungstabellen, die sich kaum überschneiden

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellen Sie Claude Opus 5.5 und GPT-5.6 Sol diese Woche nebeneinander, und das Erste, was Ihnen auffällt, ist kein Sieger. Es ist, dass die beiden Anbieter Benchmark-Tabellen veröffentlicht haben, die kaum eine Zeile gemeinsam haben. Das Markteinführungsmaterial für Claude Opus 5.5, veröffentlicht am 22. September 2026, weist auf Terminal-Bench 4.0 einen Vorsprung von 29 Punkten gegenüber GPT-5.6 Sol aus. Das Markteinführungsmaterial für Sol, allgemein verfügbar seit dem 9. Juli 2026, führt stattdessen mit Terminal-Bench 2.1, wo Sol Ultra 91,9 % erzielte, und dem Artificial Analysis Coding Agent Index, wo es mit 80 den Spitzenplatz belegte. Beide Tabellen sind echt. Beide wurden von dem Anbieter durchgeführt, der sie gewinnt. Die nützliche Frage ist nicht, welches Modell abstrakt besser ist — sondern welcher Benchmark, unter wessen Harness ausgeführt, Ihnen irgendetwas über Ihre Workload verrät. Das ist eine schwierigere Frage, als irgendeiner der beiden Launch-Posts möchte, dass Sie sie stellen, und genau darum herum ist dieser Vergleich aufgebaut.

Die beiden Modelle, Seite an Seite

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• Anbieter — Anthropic vs. OpenAI

• Veröffentlicht — Claude Opus 5.5 am 22. September 2026 vs. GPT-5.6 Sol am 9. Juli 2026

• Preis pro Million Tokens — 4,00 $ Eingabe / 20,00 $ Ausgabe vs. 5,00 $ Eingabe / 30,00 $ Ausgabe

• Cache-Lesevorgang — 0,20 $ pro Million bei Opus 5.5; Sols Cache-Tarif wird pro Plattform festgelegt und nicht als einzelne vergleichbare Zahl veröffentlicht

• Kontextfenster — 1 Mio. Tokens bei beiden

• Maximale Ausgabe – 128K Tokens bei beiden, mit 300K bei Anthropics Batch API hinter einem Beta-Header

• Wissens-Cutoff — Juni 2026 für Opus 5.5 vs. 16. Februar 2026 für Sol

• Reasoning-Steuerung — adaptives Denken immer aktiv, standardmäßig mittlerer Aufwand, Skala reicht von niedrig bis maximal gegenüber einer Einstellung für maximalen Reasoning-Aufwand plus einem Ultra-Modus, der parallele Sub-Agenten koordiniert

• Produktpalette — Opus 5.5 ist das erste Mitglied einer 5.5-Familie; Sonnet 5.5 und Haiku 5.5 werden in den kommenden Wochen erwartet, während Sol das Flaggschiff einer dreistufigen Familie neben Terra und Luna ist.

Zwei dieser Zeilen leisten mehr als der Rest. Die Lücke beim Wissensstichtag ist vier Monate groß, was relevant ist, wenn Ihre Prompts irgendetwas berühren, das in diesem Frühjahr passiert ist. Und Opus 5.5 unterbietet Sol jetzt sowohl beim Eingabe- als auch beim Ausgabepreis – eine Umkehr gegenüber vor drei Monaten, als Sol der günstigere Weg war, um Output der Frontier-Klasse zu erreichen, und Claude Opus 5 bei $5/$25 lag.

Die einzigen Zeilen, in denen beide Modelle tatsächlich vorkommen

Es gibt genau eine veröffentlichte Tabelle, die beide Modelle enthält, und sie stammt von Anthropic. Jede Zahl darin ist vom Anbieter angegeben und wurde von dem Unternehmen erstellt, das eines der beiden Modelle verkauft:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4 % vs. GPT-5.6 Sol 37,3 %

• Terminal-Bench-Science 0.1 — 58,7 % vs. 22,4 %

• FrontierCode v1.1 (Main) — 54,4 % vs. 47,5 %

• CursorBench 4.0 — 57,8 % vs. 41,7 %

• AutomationBench — 40,0 % vs. 28,8 %

• GDPval-AA v2.1 — 1846 Elo vs. 1588

Das ist ein glatter Durchmarsch, und die Abstände in den beiden Terminal-Bench-Zeilen sind groß genug, dass sie eine genauere Prüfung verdienen statt bloßer Hinnahme. Anthropics eigene Fußnote nimmt Ihnen einen Teil dieser Arbeit ab: Der Opus-5.5-Terminal-Bench-Lauf erfolgte mit xhigh effort statt mit der Standardeinstellung, und bei der standardmäßigen medium-Stufe schrumpft der FrontierCode-Vorsprung auf 54,6 % gegenüber 47,5 % – eine Lücke von sieben Punkten statt der Schlagzeilen-Zahlen. Anthropic hängt zudem eine allgemeine Warnung an die gesamte Tabelle: Auf diesem Fähigkeitsniveau seien Benchmark-Abstände „ein weniger verlässlicher Wegweiser für Unterschiede in der realen Welt“, und sein interner Abstand zu Claude Fable 5.1 sei geringer, als die Werte nahelegen. Ein Anbieter, der seine eigene Tabelle relativiert, ist der vertrauenswürdigste Satz darin.

Beachten Sie außerdem, was in dieser Tabelle fehlt: jeglicher Benchmark, bei dem OpenAIs Modell gewinnt. Eine Anbietertabelle, die nur vorteilhafte Zeilen enthält, ist kein Beleg für einen Rundumsieg; sie ist ein Beleg für Zeilenauswahl.

Was die eigenen Zahlen von OpenAI sagen

Das Launch-Material von Sol erzählt eine andere Geschichte, bei anderen Benchmarks, in einem anderen Harness. Berichtet zu seinem Juli-Launch:

• Terminal-Bench 2.1 — 91,9 % für Sol Ultra und 88,8 % für Standard-Sol, gegenüber Claude Mythos 5 mit 88,0 % und Claude Fable 5 mit 84,3 %

• Artificial Analysis Coding Agent Index — 80, damals als State of the Art beschrieben, 2,8 Punkte über Claude Fable 5

• Agents' Last Exam, lang andauernde professionelle Workflows — 53,6, was OpenAI als 13,1 Punkte Vorsprung vor Claude Fable 5 meldete

• BrowseComp — 92,2 %; OSWorld 2.0 — 62,6 %; SWE-Bench Pro — 64,6 %

Keine dieser Zeilen enthält Claude Opus 5.5, weil es im Juli noch nicht existierte. Sols Tabelle wurde erstellt, um Fable 5 und Mythos 5 zu schlagen, und das tut sie. Ob sie Opus 5.5 schlägt, wird von den Materialien keines der beiden Anbieter schlicht nicht beantwortet – die beiden Tabellen wurden mit zwei Monaten Abstand und gegen unterschiedliche Gegner zusammengestellt.

Die SWE-Bench-Pro-Zeile verdient eine besondere Erwähnung, denn sie ist die einzige Stelle in OpenAIs Launch-Material, an der dessen Modell verliert: 64,6 % für Sol gegenüber 80 % für Claude Fable 5. OpenAI reagierte darauf, indem das Unternehmen die Validität des Benchmarks infrage stellte und schätzte, dass rund 30 % seiner Aufgaben fehlerhaft seien. Das mag durchaus stimmen. Es ist außerdem eine nützliche Erinnerung daran, dass „dieser Benchmark ist fehlerhaft“ eine Behauptung ist, die beide Labore aufstellen – und zwar immer über den Benchmark, bei dem sie verlieren.

Das Harness-Problem, das niemandes Tabelle löst

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Der Grund, warum die beiden Tabellen nicht übereinstimmen, ist nicht, dass ein Anbieter lügt. Er liegt darin, dass agentische Coding-Benchmarks ein Modell plus ein Scaffold messen, und die Scaffolds unterscheiden sich. Terminal-Bench 4.0 und Terminal-Bench 2.1 sind unterschiedliche Revisionen derselben Idee, durchgeführt von unterschiedlichen Leuten, mit unterschiedlichen Tool-Budgets und unterschiedlichen Retry-Regeln. Anthropics Opus 5.5-Zahlen wurden in Anthropics Harness erzeugt; OpenAIs Sol-Zahlen in Codex-artigem Tooling. Verschiebt man eines der beiden Modelle in das Harness des anderen, ändern sich die Scores.

Unabhängige Daten, wo es sie gibt, beschreiben ein engeres Rennen als jede der beiden Tabellen. Ein Agenten-Benchmark eines Drittanbieters von August 2026, der mehrere Modelle an echten Anwendungsaufgaben testete, kürte GPT-5.6 Sol zur besten Kombination aus Genauigkeit, Kosten und Geschwindigkeit – etwa 0,52 US-Dollar und fünf Minuten pro Durchlauf –, während Claude Opus 5, nicht 5.5, mit 92 % der Durchläufe am genauesten war. Ein separates Leaderboard für Unternehmens-Codeaufgaben setzte Claude Opus 5 mit 96,4 % auf Platz eins und GPT-5.6 Sol mit 86,5 % auf Platz drei – wobei wiederum Sol mit dem vorherigen Opus verglichen wurde und nicht mit dem neuen. Keines von beiden ist ein direkter Vergleich mit Opus 5.5, und keines von beiden klärt irgendetwas. Sie belegen jedoch, dass die Abstände klein werden, wenn jemand anderes als ein Anbieter den Vergleich durchführt.

Die praktische Erkenntnis ist, die Tabellen nicht länger als Rangliste, sondern als Liste von Hypothesen zu lesen. Wenn es bei Ihrer Arbeit um Long-Horizon-Terminal-Automatisierung geht, ist die Terminal-Bench-Lücke von Anthropic eine Hypothese, die es wert ist, an Ihren eigenen Aufgaben getestet zu werden. Wenn es um mehrstufige professionelle Recherche geht, ist das Ergebnis von Sol's Agents' Last Exam eine Hypothese derselben Art. Keine der beiden Zahlen lässt sich ohne einen Durchlauf auf Ihre Arbeitslast übertragen.

Kosten pro abgeschlossener Aufgabe, die einzigen Kosten, die zählen

Auf der Preisliste ist Claude Opus 5.5 jetzt in beide Richtungen günstiger: 4,00 $ gegenüber 5,00 $ beim Input, 20,00 $ gegenüber 30,00 $ beim Output und ein Cache-Lesetarif von 0,20 $, der 60 % unter dem liegt, was Claude Opus 5 berechnete. Für einen Agenten, der bei jedem Turn einen langen System-Prompt erneut sendet, ist diese Cache-Zeile der dominierende Kostenfaktor und der Grund, warum eine lang laufende Sitzung ohne jede Prompt-Änderung deutlich günstiger werden kann.

Doch der Preis pro Token hat noch nie über die Rechnung eines Agenten entschieden. OpenAIs Argumentation für Sol zum Start stützte sich eher auf Token-Effizienz als auf den Listenpreis – das Unternehmen berichtete von einer um 54 % verbesserten Token-Effizienz beim Coding, wobei Ausgabe-Tokens und verstrichene Zeit weniger als halb so hoch wie bei Claude Fable 5 ausfielen, bei rund einem Drittel geringeren Kosten. Anthropic führt für Opus 5.5 das spiegelbildliche Argument an: etwa 40 % niedrigere Kosten für den Betrieb bei typischen Workloads als bei Claude Opus 5, bei einer Preisliste, die nur um 20 % sank, wobei Kundenaussagen von Box, Kiro, Factory und GitHub allesamt große Reduzierungen bei Tokens oder Schritten anführen. Beide Aussagen weisen in dieselbe Richtung – das Modell, das mit weniger Turns auskommt, gewinnt – und keine von beiden ist unabhängig geprüft.

Wo es unabhängige Kosten-pro-Aufgabe-Rechnungen gibt, sprechen sie derzeit für Sol: Eine im September veröffentlichte Analyse setzte GPT-5.6 Sol bei 96,2 % Erfolgsquote auf 1,56 US-Dollar pro gelöstem Issue bei SWE-bench Verified an, gegenüber Claude Opus 4.8 mit 88,6 %. Das ist Sol im Vergleich zu einem älteren Anthropic-Modell, nicht gegen Opus 5.5, also eher ein Ausgangspunkt als ein Urteil – aber es erinnert daran, dass ein Modell, das das Issue beim ersten Versuch löst, günstiger ist als ein günstigeres Modell, das drei Durchläufe braucht. Die einzige Messung, die das für Sie klärt, ist Ihre eigene Aufgabe, auf beide Arten ausgeführt, mit den Token-Zahlen vor Augen.

Das ist eher ein Routing-Problem als ein Beschaffungsproblem, und es lohnt sich, genau zu sein, welche Seite davon bereits lösbar ist.GPT-5.6 Sol ist ab heute auf OrcaRouter verfügbar zu OpenAIs eigenem Listenpreis mit 0 % Aufschlag — der Anbieter-Listenpreis wird direkt durchgereicht, sodass eine Tarifänderung des Anbieters bei uns noch am selben Tag live ist statt erst nach einem Sync. Claude Opus 5.5 ist noch keine unserer Routen; es ist über Anthropics eigene API und die großen Clouds verfügbar. Sobald es verfügbar ist, bedient derselbe Schlüssel beide, und genau das macht aus dem Experiment eine Routing-Regel statt eines zweiten Vertrags und eines zweiten SDK: Schicken Sie die Workload an das Modell, das Ihre eigenen Zahlen begünstigen, halten Sieautomatisches Failover auf das andere gerichtet, und lassen Sie eineRouting-DSL-Zeile pro Anfrage statt pro Quartal entscheiden. Eine Preissenkung auf einer der beiden Seiten ist eine Konfigurationsänderung, keine Migration.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

Wo sich die beiden wirklich unterscheiden

Klammert man die Benchmarks aus, bleiben vier Unterschiede übrig, und alle sind überprüfbar:

• Wissensstichtag. Juni 2026 für Opus 5.5 gegenüber dem 16. Februar 2026 für Sol. Vier Monate sind eine echte Lücke für alles, was aktuelle Bibliotheken, aktuelle Ereignisse oder kürzlich geänderte APIs betrifft, und kein Benchmark erfasst sie.

• Schutz-Routing. Opus 5.5 wird mit Schutzvorkehrungen der Fable-5.1-Klasse ausgeliefert: Die meisten Cybersicherheitsanfragen werden an Claude Opus 4.8 umgeleitet, und Arbeiten im Biologiebereich fallen auf Claude Opus 5 zurück, sofern das Konto nicht verifiziert ist. Wenn Ihr Produkt in einem dieser beiden Bereiche angesiedelt ist, wird ein Teil Ihres Traffics von einem kleineren Modell beantwortet. Sol bietet kein gleichwertiges dokumentiertes Routing, allerdings erwähnt OpenAI seine eigenen cyberbezogenen Sicherheitsbewertungen.

• Orchestrierung. Sol liefert einen Ultra-Modus, der mehrere parallele Sub-Agenten koordiniert – standardmäßig vier –, plus eine Einstellung für maximale Reasoning-Anstrengung. Opus 5.5 hat beides nicht als Plattform-Feature; sein Hebel ist der Effort-Parameter, und Multi-Modell-Komposition ist etwas, das man selbst baut oder routet, statt dass der Anbieter sie einem mitliefert.

• Familienökonomie. Sol ist eine von drei Stufen, darunter Terra und Luna – und in einem Update vom 30. Juli wurde Lunas Preis um 80 % und Terras um 20 % gesenkt. Anthropics günstigere Geschwister, Sonnet 5.5 und Haiku 5.5, sind angekündigt, aber noch nicht ausgeliefert. Wenn Ihre Workload gemischt ist, bietet OpenAI derzeit die günstigeren Stufen.

Zwischen ihnen wählen

Wählen Sie Claude Opus 5.5, wenn Ihre Arbeit lang andauernde agentische Coding- oder Wissensarbeit ist, wenn der Preis pro Token eine Rolle spielt, wenn Ihre Prompts irgendetwas aus den letzten vier Monaten betreffen oder wenn ein 1M-Token-Kontext bei 0,20 $ pro Million gecachter Token das ist, was Ihre Architektur bezahlbar macht. Beginnen Sie mit mittlerem Aufwand, nicht mit der übernommenen hohen Einstellung, und messen Sie, ob niedrig standhält.

Wähle GPT-5.6 Sol, wenn du einen anbietergebündelten Orchestrierungsmodus möchtest, wenn du heute statt in ein paar Wochen eine günstigere Stufe unter dem Flaggschiff brauchst, oder wenn deine Arbeitslast von der Art ist, die die Belege aus Sols eigener Markteinführung am besten abdecken – langfristig angelegte professionelle Workflows und Computernutzung, wo es seine stärksten Ergebnisse meldete.

Wenn Sie bereits Claude Opus 5 verwenden, beachten Sie, dass Opus 5.5 kein direkter Ersatz ist: Thinking kann nicht mehr deaktiviert werden, erzwungene Tool-Nutzung gibt einen Fehler zurück, Thinking-Blöcke sind an das Modell und die Konversation gebunden, und das ältere computer_20251124 Computer-Use-Tool wird in der Claude API oder bei Google Cloud nicht akzeptiert. Die ersten drei gelten auch für Claude Fable 5.1. Der Wechsel zu Sol ist eine völlig andere Integration.

Was diesen Vergleich tatsächlich entscheiden würde, ist ein einzelner unabhängiger Lauf beider Modelle bei identischem Aufwand, in einem identischen Harness, auf demselben Aufgabensatz. Stand dieser Woche hat niemand einen veröffentlicht. Bis das jemand tut, ist die ehrliche Position diejenige, die die Beweislage stützt: Anthropics Tabelle begünstigt Opus 5.5 und wurde von Anthropic erstellt; OpenAIs Tabelle begünstigt Sol und wurde von OpenAI erstellt; die unabhängigen Ergebnisse, die es gibt, vergleichen Sol mit dem vorherigen Opus und beschreiben ein viel knapperes Rennen; und die beiden Zeilen, die Ihre Rechnung entscheiden werden – Tokens pro abgeschlossener Aufgabe und Cache-Lesevolumen – sind die beiden Zeilen, die kein Anbieter veröffentlicht.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert