
GPT-6.1 Sol vs. GPT-5.6 Sol: Viereinhalb Indexpunkte, die Hälfte der Rechnung, zwei Regressionen
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
OpenAI released GPT-6.1 Sol on 29 September 2026, eleven weeks after GPT-5.6 Sol, which shipped on 9 July 2026 as the flagship of the previous generation. Both are still on sale, both are still callable, and the difference between them on the neutral board is 4.8 points — 51.8 against 47.0 on Artificial Analysis's Intelligence Index, both measured at maximum reasoning effort on the same ten-evaluation suite. The price difference is much larger than the score difference: $0.72 per completed index task against $1.99, and $2.00/$10.00 per million tokens against $4.00/$20.00. That is the short version. The long version is that the upgrade is not uniform, and two of the evaluations moved backwards.
Was jedes Modell ist und was wodurch ersetzt wurde
GPT-5.6 Sol was the top of the 5.6 line — a closed, API-only model with a 1,050,000-token context window, a 128,000-token output ceiling, text, image and file input, and a reasoning ladder running from none through max. It was described by OpenAI as the tier built for the hardest work: long-horizon agentic workflows, multi-file software engineering, deep reasoning, and it was priced accordingly at $4.00 and $20.00 per million tokens with cached input at $0.40 and cache writes at $5.00. Above 272,000 input tokens it repriced to $8.00 and $30.00, and it carried a Batch tier at $2.50 and $15.00.
GPT-6.1 Sol is the mid-tier of the generation that came after: below GPT-6 Astra, above GPT-6 Luna, and now the model OpenAI points cost-sensitive developers at. It keeps the 1,050,000-token window and the 128,000-token output cap, extends the knowledge cutoff from April 20 to April 30, 2026, and cuts the effort ladder from six rungs to five — low, medium (default), high, xhigh, max. The none value that GPT-5.6 Sol accepted now returns an error, and OpenAI's migration guidance is explicit that the substitution is low, not a silent upgrade.
Das ist einen Moment des Innehaltens wert, denn es ist die einzige Änderung in diesem Release, die Geld kostet, statt Geld einzusparen. Eine Pipeline, die auf none zurückgriff, um einen günstigen, schnellen, Nicht-Reasoning-Aufruf zu erhalten, hat diese Konfiguration nicht mehr, und zwar in keiner der beiden Modellfamilien. Die günstigste Stufe auf GPT-6.1 Sol ist eine Reasoning-Stufe, und Reasoning-Tokens werden als Output-Tokens abgerechnet, ob man sie sehen kann oder nicht.
Die Leiter, Sprosse für Sprosse
Das unabhängige Gremium veröffentlicht für jede Aufwandsstufe beider Modelle eine Punktzahl und Laufkosten, was den Direktvergleich zu etwas Nützlicherem als einen bloßen Einzelvergleich macht. Bei äquivalenten Einstellungen gegenübergestellt:
• Aufwandsstufen, GPT-6.1 Sol — max. 51,8 bei 0,72 $ pro Index-Aufgabe; xhigh 51,0 bei 0,39 $; high 50,2 bei 0,32 $; medium (Standard) 47,8 bei 0,21 $ • Ausgabegeschwindigkeit — 59,7 Token pro Sekunde für GPT-6.1 Sol vs. 87,8 für GPT-5.6 Sol
• Zeit bis zum ersten Chunk — 332 Sekunden für GPT-6.1 Sol vs. ein schnellerer Wert für GPT-5.6 Sol, gegenüber einem Board-Median von etwa 4 Sekunden
• Ausgabe-Token im Index-Lauf — 67,2 Millionen für GPT-6.1 Sol vs. 90,0 Millionen für GPT-5.6 Sol
• Eingabe-/Ausgabepreis — 2,00 $ / 10,00 $ vs. 4,00 $ / 20,00 $
• Zwischengespeicherte Eingabe — 0,10 $ vs. 0,40 $; Cache-Schreibvorgänge 2,50 $ vs. 5,00 $
• Batch-Preis — für GPT-6.1 Sol nicht veröffentlicht vs. 2,50 $ / 15,00 $ für GPT-5.6 Sol
• Langkontext-Stufe — oberhalb von 272.000 Eingabe-Token wird GPT-6.1 Sol für die gesamte Anfrage mit 4,00 $ / 15,00 $ neu bepreist vs. 8,00 $ / 30,00 $ bei GPT-5.6 Sol
• Aufwandsuntergrenze — low vs. none
Aus dieser Liste ergeben sich zwei Dinge. Das erste ist, dass die Preissenkung strukturell und nicht werblich ist: GPT-6.1 Sols Standardtarif von 2,00 $ und 10,00 $ unterbietet GPT-5.6 Sols Batchtarif von 2,50 $ und 15,00 $, sodass sogar die rabattierte Stufe des alten Modells teurer ist als der Listenpreis des neuen Modells. Das zweite ist, dass das Upgrade bei der Latenz nicht linear ist. GPT-6.1 Sol erzeugt Ausgaben etwa ein Drittel langsamer und benötigte 332 Sekunden bis zum ersten Chunk bei den Long-Prompt-Tests des Boards – dieselbe Größenordnung wie die 107 Sekunden von GPT-6 Sol und etwa achtzigmal so viel wie der Median des Boards. Wenn Sie ein interaktives Produkt auf GPT-5.6 Sol gebaut haben, ist dies eine funktionale Regression, unabhängig von jeglichem Benchmark, und die Lösung ist architektonisch, nicht durch einen Parameter.

Zwei Bewertungen gingen in die falsche Richtung.
Der Gesamtzuwachs beträgt 4,8 Punkte. Die Komponenten sind nicht durchweg positiv, und die Bewertungsergebnisse des Boards pro Bewertung bestätigen das:
• SciCode — GPT-6.1 Sol 0,542 vs. GPT-5.6 Sol 0,571. Ein Rückgang um 2,9 Punkte beim wissenschaftlichen Programmieren.
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575,1 vs. GPT-5.6 Sol Elo 1611,3. Ein Elo-Rückgang um 36 Punkte bei wirtschaftlich wertvoller Wissensarbeit.
• Humanity's Last Exam — GPT-6.1 Sol 0,529 vs. GPT-5.6 Sol 0,495. Ein Zugewinn von 3,4 Punkten.
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,561 vs. GPT-5.6 Sol 0,399. Ein Zugewinn von 16 Punkten – die größte einzelne Veränderung im Vergleichspaar.
• AA-Omniscience — GPT-6.1 Sol 41,5 vs. GPT-5.6 Sol 22,0, wobei es um Wissenszuverlässigkeit und Halluzination geht und nicht um reine Abrufleistung.
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — die übrigen fünf, die den Gesamtwert vervollständigen und in denen der Rest des Zugewinns von 4,8 Punkten erzielt wird.
A model that is meaningfully better on terminal work, substantially better on factual reliability, and measurably worse on scientific coding and on professional-work Elo is not a strictly better model. It is a different point on the frontier, and it was placed there deliberately: OpenAI's own launch framing for GPT-6.1 Sol is cost per completed task at near-flagship quality, not maximum score. If your workload is SciCode-shaped or GDPval-shaped, the composite number is not the one that applies to you, and the regression is.
GPT-5.6 Sol hat immer noch das veröffentlichte Langkontext-Ergebnis.
Die einzige Stelle, an der das ältere Modell eine Zahl hat, die das neuere nicht hat, ist die Retrieval-Genauigkeit in dem Kontextbereich, in dem sich die Tarifkarte von GPT-6.1 Sol ändert. GPT-5.6 Sol verfügt über ein veröffentlichtes MRCR-v2-Eight-Needle-Ergebnis von 91,5 % im Bereich von 256.000 bis 512.000 Token. GPT-6.1 Sol hat kein veröffentlichtes Gegenstück, und oberhalb von 272.000 Input-Tokens wird seine gesamte Anfrage mit 2× Input und Cache und 1,5× Output neu bepreist.
Nimmt man diese beiden Fakten zusammen, ist das Segment, in dem die Ökonomie des neuen Modells am schwächsten ist, genau das Segment, in dem das alte Modell die einzige dokumentierte Stärke hat. Die Einsparungen verschwinden nicht – 4,00 $ und 15,00 $ in der neu bepreisten Tarifstufe gegenüber 8,00 $ und 30,00 $ in GPT-5.6 Sols eigener Long-Context-Tarifstufe sind immer noch eine Halbierung –, aber die Halbpreis-Story ist eine Geschichte für allgemeine Workloads, und eine Long-Context-Retrieval-Pipeline ist das nicht. Wenn das Ihr Workload ist, ist GPT-5.6 Sol bei 4,00 $ und 20,00 $ mit veröffentlichten 91,5 % eine vertretbare Wahl zum Bleiben.
GPT-5.6 Sol's other published results remain intact and are the reason some teams will not move: BrowseComp 90.4 for web-research agents, Terminal-Bench 2.1 at 88.8 and 88.0, SWE-Bench Pro 64.6, Agents' Last Exam 53.6, OSWorld 2.0 at 62.6. Those are OpenAI-reported, on OpenAI's harness, and they were reported in July. What has changed since is that the board now scores both models on one suite at one set of settings, and the older model loses on the composite and on cost.
Die Migration selbst ist eine String-Änderung, mit einer Ausnahme
Derselbe Anbieter, dieselbe API-Oberfläche, im Ranking direkt benachbart, dasselbe Fenster und dieselbe Output-Obergrenze – für die meisten Stacks ist das also eine Modellkennung und ein Preis, der sich halbiert. Die Ausnahmen sind konkret und es lohnt sich, sie zu nennen, bevor Sie den Schalter umlegen.
Wenn Ihr Code reasoning.effort auf none oder minimal setzt, schlägt er fehl, statt sich zu verschlechtern, und low ist der dokumentierte Wert. Wenn Ihr Traffic über 272.000 Eingabe-Tokens liegt, prüfen Sie die neu bepreiste Stufe, bevor Sie die Einsparungen modellieren. Wenn Ihr Produkt von der Zeit bis zum ersten Token abhängt, messen Sie, bevor Sie ausliefern, denn die 332-Sekunden-Angabe des Boards ist kein Rundungsfehler. Und wenn Ihre Evals einen SciCode-förmigen oder GDPval-förmigen Anteil enthalten, lassen Sie diesen Anteil auf beiden Modellen laufen, statt dem Composite zu vertrauen.
Both models are on OrcaRouter at OpenAI's own list prices — GPT-6.1 Sol at $2.00 and $10.00 with cached input at $0.10, GPT-5.6 Sol at $4.00 and $20.00 with cached input at $0.40 — under a pass-through model that puts an OpenAI price change on our side the same day it lands rather than after a reseller renegotiates. Because the price list is passed through unchanged rather than marked up, the arithmetic in this article is the arithmetic you get: the same $0.72-per-task model, the same halving, no platform premium layered on either side.

Der praktische Nutzen, beide hinter einem Endpunkt zu haben, besteht darin, dass der Vergleich live bleibt. Leiten Sie neuen Traffic an GPT-6.1 Sol, halten Sie GPT-5.6 Sol mit einer einzigen Konfigurationsänderung als Fallback und als Long-Context-Pfad verfügbar, und lassen Sie das automatische Failover das Zeitfenster überbrücken, in dem sich Verfügbarkeit und Enterprise-Enablement eines zwei Monate alten Flaggschiffs noch einpendeln. Eine Migration, die die Rechnung halbiert und zwei Sub-Benchmarks zurückwirft, ist keine Entscheidung, die man einmal trifft und dann vergisst; sie ist pro Route zu treffen, und eine Routing-Schicht ist das, was das günstig macht.

Wo jeder Einzelne hingehört
• Allgemeine agentische und Terminal-Arbeit — GPT-6.1 Sol. Sechzehn Punkte bei Terminal-Bench 4.0 und der halbe Preis sind keine knappe Entscheidung.
• Faktenzuverlässigkeit, Produkte mit abgerufenen Antworten — GPT-6.1 Sol, bei einer AA-Omniscience-Lücke von fast zwanzig Punkten.
• Wissenschaftliches Coding — prüfe zuerst deine eigenen Evals. Das Board zeigt eine Regression von 2,9 Punkten, und der Composite wird sie nicht sichtbar machen.
• Wirtschaftlich wertvolle Wissensarbeit — dieselbe Vorsicht. Die GDPval-AA-Elo-Regression beträgt 36 Punkte.
• Langkontext-Retrieval über 272.000 Token — GPT-5.6 Sol, bis GPT-6.1 Sol eine veröffentlichte Zahl in diesem Bereich hat.
• Interaktive, latenzempfindliche Oberflächen — vor der Migration messen. Schnellere Ausgabe, deutlich langsameres erstes Token.
• Günstigster Nicht-Reasoning-Aufruf — keiner von beiden. Diese Konfiguration existiert in dieser Familie nicht mehr.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
