Titelkarte für „GPT-5 Codex vs GPT-5.6 Sol — Der Coding-Spezialist gegen das Flaggschiff, das es verschlungen hat“: große marineblaue Überschrift, Untertitelzeile und zwei abgerundete Karten — GPT-5 Codex ($1.25 / $10 pro 1 M · Coding-Spezialist) und GPT-5.6 Sol ($5 / $30 pro 1 M · Flaggschiff-Generalist) — mit dem OrcaRouter-Logo unten rechts eingefügt.
Guides & Insights

GPT-5 Codex vs GPT-5.6 Sol: Der Coding-Spezialist vs. das Flaggschiff, das ihn verschlungen hat

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Als O​penAI am 9. Juli 2026 die G​PT-​5.6-Familie veröffentlichte, zog es die eigenständige Codex-App leise zurück und integrierte den Coding-Agent-Modus in ChatGPT. Die von O​penAI verfasste Modellseite für GPT-5.6 Sol las sich daraufhin wie eine Stellenbeschreibung von einem Coding-Spezialisten – „tiefes mehrstufiges Denken, groß angelegte Softwareentwicklung und langfristige agentische Workflows.“ So ist der Vergleich zwischen GPT-5 Codex und GPT-5.6 Sol kein routinemäßiger Spec-Kampf. Es ist der Spezialist, der fragt, ob das Flaggschiff, das gerade seine Produktkategorie absorbiert hat, ihn auch überflüssig gemacht hat.

Die kurze Antwort ist nein – aber der Grund ist interessanter als „Codex ist immer noch gut.“ GPT-5 Codex bleibt live auf der API zu 1,25 $ pro Million Eingabe-Token und 10 $ pro Million Ausgabe-Token: ein speziell entwickelter Software-Engineering-Agent, optimiert für CLI-, IDE- und GitHub-Automatisierung, mit unabhängig gemessenen Ergebnissen. GPT-5.6 Sol kostet viermal so viel für Eingabe und dreimal so viel für Ausgabe (5 $ / 30 $) und ist das neueste allgemeine Flaggschiff mit höheren – aber meist vom Anbieter gemeldeten – Programmierwerten. Worauf es bei dieser Paarung tatsächlich ankommt, sind Preis, Kontext und der Unterschied zwischen einem Spezialisten und einem Generalisten, der gut programmiert. Alles unten ist mit einer Quelle gekennzeichnet.

Was jedes Modell ist

GPT-5 Codex ist genau das, was seine Modellseite sagt: „eine spezialisierte Version von GPT-5, optimiert für Softwareentwicklung und Coding-Workflows." Es wurde im September 2025 veröffentlicht und ist das API-Modell hinter O​penAIs Coding-Agent – demjenigen, der Projekte von Grund auf erstellt, Feature-Arbeit erledigt, im großen Maßstab refaktoriert, Code überprüft und Mehrdatei-Änderungen mit einem einstellbaren Reasoning-Effort-Regler plant. Es nimmt Text- und Bildeingaben entgegen (Screenshots für UI-Arbeit), hat einen Kontext von 400K Token, eine Ausgabegrenze von 128K und ist ausdrücklich auf agentische Coding-Anwendungen ausgerichtet: CLI, IDE-Erweiterungen, GitHub und Cloud-Aufgaben.

GPT-5.6 Sol ist die Flaggschiff-Stufe der G​PT-​5.6-Serie, veröffentlicht am 9. Juli 2026 mit einem Wissensstand von Februar 2026. Es ist das Modell, an das O​penAI die schwierigsten allgemeinen Aufgaben weiterleitet: tiefes mehrstufiges Denken, groß angelegte Softwareentwicklung, langfristige Agenten, Computernutzung und einen Multi-Agenten-„Ultra“-Denkmodus. Sein Kontext umfasst 1,05 Millionen Tokens – das 2,6-fache von GPT-5 Codex – bei derselben 128K-Ausgabegrenze, und es akzeptiert Text-, Bild- und Dateieingaben. Sol läuft auch in ChatGPT. Wenn O​penAI heute im Produktsinne über „Codex“ spricht, meint es damit normalerweise Sol, das agentische Programmierarbeit leistet.

Preis: eine 4x/3x-Lücke, die sich verengt, aber nie schließt.

Die wichtigsten Zahlen, beide zum Listenpreis des Anbieters: GPT-5 Codex bei 1,25 $ / 10 $ pro Million Tokens (Cache-Lesen 0,125 $); GPT-5.6 Sol bei 5 $ / 30 $ (Cache-Lesen 0,50 $). Das ist der vierfache Eingabepreis und der dreifache Ausgabepreis. An einem normalen Codierungstag mit zehn Millionen Tokens bei einer 75/25-Aufteilung von Eingabe zu Ausgabe kostet GPT-5 Codex etwa 34 $; GPT-5.6 Sol kostet etwa 112 $. Die Kluft ist nicht theoretisch.

Zwei Dinge verringern den Abstand. Erstens: Caching. Beide Modelle bepreisen gecachten Input deutlich günstiger als frischen Input, und Agenten-Schleifen lesen ständig denselben Repository-Kontext erneut, sodass ein großer Teil der Tokens in die günstige Preisstufe fällt. Zweitens: Effizienz. O​penAI behauptet, dass die 5.6-Generation agentische Aufgaben mit etwa 54 % weniger Ausgabetoken abschließt als die vorherige Generation. Wenn Sol für dieselbe Aufgabe nur halb so viele Ausgabetoken benötigt, schrumpft die Lücke pro Aufgabe von etwa 3,3x auf etwa 2x — eine echte Ersparnis, aber eine, die einen 4x Unterschied beim Eingabepreis nicht aufhebt, und eine Effizienzangabe, die von O​penAI stammt und nicht unabhängig gemessen wurde.

Sol hat ebenfalls einen gestaffelten Eingabepreis: Auf der Modellseite von OrcaRouter gilt der Basistarif von $5 / $30 für Anfragen bis zu 32K Eingabetoken, während größere Anfragen mit der oberen Stufe von $10 / $45 abgerechnet werden. Das ist die Langkontext-Steuer – genau die Anfragen, die ein Agent für große Repositories stellt. Der praktische Preisvergleich hängt also noch stärker von der Arbeitslast ab, als es die Überschrift 3-4x vermuten lässt.

The OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the flagship description, $5.00 input / $30.00 output per 1M tokens, the 1.05M-token context window, and seven-day telemetry (p50 TTFT 3.82s, ~465 tok/s, 39.0M tokens/7d).

Kontext und wie man sie nennt

Die Kontextlücke ist die zweite echte Trennlinie. 400.000 Token decken eine umfangreiche Codebasis ab, und Codex, als Spezialist, wurde entwickelt, um innerhalb dieses Fensters effizient zu sein. Aber ein 1,05-Millionen-Token-Kontext von Sol verändert, was man einem Modell übergeben kann: ein gesamtes Monorepo, lange Agent-Traces, ein Onboarding-Wiki plus den Code. Für Teams, die ganze Repositories in einer Anfrage einspeisen, ist das größere Fenster der Unterschied zwischen „das Modell kann die relevanten Dateien sehen“ und „das Modell kann die relevanten Dateien sehen plus alles, was sie importiert“. Es ist auch der Unterschied zwischen einem Eingabe-Token für 1,25 $ und einem für 5 $, weshalb die Kontextentscheidung eine Kostenentscheidung ist.

Beide Modelle sprechen dieselben beiden API-Formen — O​penAI Chat Completions und die Responses API — und beide unterstützen Tool-/Funktionsaufrufe und strukturierte Ausgaben. Bei OrcaRouter befinden sich beide hinter einem einzigen O​penAI-kompatiblen Endpunkt, sodass der Wechsel zwischen ihnen eine Änderung des Modellnamens ist, keine Integrationsänderung.

Wo die Benchmarks auseinandergehen – und der Hinweis zur Ehrlichkeit

Interessant ist, dass die beiden Modelle kaum einen Benchmark gemeinsam haben. GPT-5 Codex hat tatsächlich unabhängige Ergebnisse: Artificial Analysis misst einen Intelligence-Index von 36,1 und einen Coding-Index von 38,9, mit einem Math-Index von 98,7, LiveCodeBench bei 84,0 und SWE-Bench Verified bei 74,5 Prozent. Die Flaggschiff-Zahlen von GPT-5.6 Sol — Terminal-Bench 2.1 bei 88,8, ein Artificial Analysis Coding Agent Index von 80 bei maximalem Reasoning, Agents' Last Exam bei 53,6 — sind diejenigen, die OpenAI zum Start veröffentlicht hat und die von keinem unabhängigen Gutachter reproduziert wurden. „88,8 gegenüber 84,0“ ist kein fairer Vergleich, denn die eine Zahl wurde geprüft, die andere ist eine Herstellerangabe. Die ehrliche Zusammenfassung: Sol ist eine Generation neuer und seine Obergrenze ist eindeutig höher, aber die einzige Coding-Punktzahl, die eines der beiden Modelle vorweisen kann und die ein unabhängiges Labor verifiziert hat, gehört dem günstigeren, älteren Spezialisten.

Comparison scoreboard for GPT-5 Codex vs GPT-5.6 Sol. Left column GPT-5 Codex: Input price $1.25/1M, Output price $10.00/1M, Context 400K, Released Sep 2025, Coding bench LiveCodeBench 84.0, Cache read $0.125. Right column GPT-5.6 Sol: Input price $5.00/1M, Output price $30.00/1M, Context 1.05M, Released Jul 2026, Coding bench Terminal-Bench 2.1 88.8, Cache read $0.50. Footer: 'Codex figures per Artificial Analysis; Sol figures OpenAI-reported.' OrcaRouter logo composited bottom-right.

Es gibt auch einen Benchmark, den OpenAI selbst anzweifelt. Bei SWE-Bench Pro erzielt GPT-5.6 Sol 64,6 Prozent, während Claude Fable 5 mit 80 führt — und OpenAI hat die Gültigkeit des Benchmarks öffentlich infrage gestellt. Bei diesem ist das interessante Signal nicht die Punktzahl, sondern die Tatsache, dass ein führender Anbieter nun argumentiert, seine eigene niedrige Punktzahl sei die Schuld des Benchmarks. Für ein Entwicklungsteam ist das eine Erinnerung daran, das Modell am eigenen Repository zu testen, bevor man irgendeiner Bestenliste vertraut, auch unserer.

Geschwindigkeit: die Verkehrswarnung

In der Sieben-Tage-Telemetrie von OrcaRouter zeigt GPT-5.6 Sol eine mediane Time-to-First-Token von 3,82 Sekunden und etwa 465 Output-Token pro Sekunde bei 39 Millionen Token an Traffic. Die Seite von GPT-5 Codex sammelt noch immer Telemetrie – sein Traffic durch den Router ist so dünn, dass es noch nichts zu mitteln gibt. Dieser dünne Traffic ist selbst eine Information: Aus Sicht des Marktes ist die Arbeit an der Coding-Agent-API bereits auf neuere Modelle übergegangen. Das bedeutet nicht, dass GPT-5 Codex langsam oder defekt ist; es bedeutet, dass die Frage „Welches ist schneller?" anhand der Router-Daten nicht beantwortet werden kann, bis jemand echtes Volumen durch das System schickt.

Welches solltest du wählen?

Wählen Sie GPT-5 Codex, wenn…

Ihre Arbeit ist wirklich code-zentriert: Sie betreiben einen Agenten, der Code bearbeitet, Pull Requests prüft, Refactorings durchführt, Tests schreibt und in einer IDE- oder CLI-Umgebung arbeitet. Sie wollen den Fokus des Spezialisten, den viermal günstigeren Input und den einzigen unabhängig verifizierten Coding-Score in diesem Vergleich. GPT-5 Codex ist auch die richtige Wahl, wenn Sie die Agentic-Coder-Semantik von O​penAI möchten – den Reasoning-Effort-Regler, die Tool-Use-Schleife – ohne Flaggschiff-Preise für allgemeine Fähigkeiten zu zahlen, die Sie nicht nutzen werden.

Wählen Sie GPT-5.6 Sol, wenn…

Deine Arbeit verbindet Codierung mit anspruchsvollem allgemeinem Denken, langfristig angelegten Agenten, Computernutzung oder dateiintensiven Eingaben – oder du willst einfach ein Flaggschiff für alles. Der 1,05M-Kontext, der Multi-Agent-Ultra-Modus, das neuere Training und die Produktintegration von ChatGPT und Codex sprechen alle für Sol. Seine Codierungszahlen sind auf dem Papier höher, und bei einem Benchmark, an den der Anbieter glaubt, ist es der beste Codierungsagent, den O​penAI je herausgebracht hat. Du zahlst das Drei- bis Vierfache pro Token für diese Breite; die Story zur Token-Effizienz verringert die Lücke bei Aufgaben, bei denen Sol tatsächlich gewinnt.

Die Antwort ist oft beides — je nach Aufgabe routen

Da beide auf OrcaRouter ohne Aufschlag live sind, ist das stärkste Setup überhaupt keine Wahl. Richten Sie das Coding-Volumen auf GPT-5 Codex — den Spezialisten für $1.25 / $10 — und eskalieren Sie nur die Aufgaben, die Flaggschiff-Breite erfordern, an GPT-5.6 Sol für $5 / $30. Ein API-Schlüssel, ein O​penAI-kompatibler Endpunkt, eine Änderung des Modellnamens beim Routing und automatisches Failover, wenn ein Anbieter eine schlechte Stunde hat. Die Preisweitergabe ist hier in besonderer Weise wichtig: Die $1.25 / $10 und $5 / $30, die Sie einplanen, sind die Listenpreise der Anbieter, sodass eine künftige Preissenkung von O​penAI am selben Tag, an dem sie angekündigt wird, auf unserem Endpunkt live ist, und Ihre Routing-Logik muss nicht geändert werden.

The OrcaRouter model page for GPT-5 Codex (openai/gpt-5-codex), showing the $1.25 input / $10.00 output per 1M pricing, the 400K-token context window, the description of the specialized software-engineering model, and 'Collecting...' telemetry placeholders on thin traffic.

Fragen, die dies aufwirft

Hat GPT-5.6 Sol GPT-5 Codex ersetzt?

Im Produkt: ja – die eigenständige Codex-App wurde beim 5.6-Launch in ChatGPT integriert, und Sol ist die Engine, die dort den Coding-Agent-Modus betreibt. In der API: nein – GPT-5 Codex ist weiterhin ein aktives, bereitgestelltes Modell mit eigenem Preis, und viele Agent-Pipelines nutzen es weiterhin, weil es speziell entwickelt und günstig ist.

Ist Sols Programmierung wirklich besser als die von Codex?

Bei den von O​penAI veröffentlichten Zahlen ja – Terminal-Bench 2.1 mit 88,8 gegenüber Codex' LiveCodeBench mit 84,0 – aber das sind verschiedene Benchmarks, und Sols Zahlen stammen vom Anbieter, während die von Codex unabhängig gemessen wurden. Testen Sie in Ihrem eigenen Repository; das ist die einzige Punktzahl, die zählt.

Warum sollte irgendjemand immer noch GPT-5 Codex ausführen?

Preis und Eignung. Bei einem Viertel des Eingabepreises von Sol spart eine dedizierte Coding-Agent-Pipeline, die niemals die Breite des allgemeinen Flaggschiffs benötigt, echtes Geld pro Million Tokens, und der Fokus des Spezialisten bedeutet weniger Prompt-Formung, um sie bei der Coding-Arbeit zu halten.

Dieses Duell ist deshalb eine Überlegung wert, weil O​penAI die Antwort in sein eigenes Produkt eingebaut hat. Das Unternehmen hat ein Jahr lang einen Coding-Spezialisten verkauft und ihn dann in ein Generalisten-Flaggschiff integriert, das gut genug programmiert, um dem Spezialisten die Krone streitig zu machen — während der Spezialist über die API zu einem Bruchteil des Preises verfügbar bleibt. Das ist kein Trick; es ist die Preisuntergrenze für „Wir wollen den Coding-Agenten, ohne für das Flaggschiff zu zahlen.“ GPT-5 Codex ist der günstige, fokussierte, unabhängig gemessene Spezialist. GPT-5.6 Sol ist das neuere, breitere, teurere Flaggschiff, dessen Coding-Behauptungen Sie an Ihrer eigenen Arbeit überprüfen sollten. Die meisten Produktionsteams werden feststellen, dass die ehrliche Antwort beides ist — und wenn beide an einem Pass-through-Endpunkt verfügbar sind, ist das Routing zwischen ihnen eine Konfiguration, keine Migration.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube