
Claude Sonnet 5.5 vs. GPT-6 Sol: Die 2-Dollar-Klasse hat jetzt zwei Flaggschiffe
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Claude Sonnet 5.5 und GPT-6 Sol kosten dasselbe – 2 $ pro Million Input-Tokens, 10 $ pro Million Output-Tokens – und sie erschienen im späten September 2026 im Abstand von sechs Tagen. Dieser Zufall ist nicht das Interessante. Das Interessante ist, dass das Anthropic-Modell der mittleren Preisklasse vor dem Modell lag, das OpenAI als sein Flaggschiff verkauft, als Artificial Analysis beide mit seinem v4.3.2 Intelligence Index maß: 56 für Claude Sonnet 5.5 gegenüber 47 für GPT-6 Sol. In derselben Revision liegt Claude Sonnet 5 – das Modell, das Sonnet 5.5 ersetzt – bei 38.
Das ist also kein Vergleich mehr zwischen einer billigen und einer teuren Stufe. Es ist ein Vergleich zweier Modelle zum gleichen Preis, aus zwei Labors, mit einer Differenz von 18 Punkten zwischen dem Anthropic-Modell und seinem eigenen Vorgänger sowie einem Vorsprung von neun Punkten für Anthropic gegenüber OpenAIs Top-End-Veröffentlichung. Alles Folgende ist der Versuch, herauszufinden, welche dieser Lücken den Kontakt mit einer echten Arbeitslast überstehen und welche von ihnen ein Benchmark-Artefakt sind.
Was jedes Modell tatsächlich ist
Claude Sonnet 5.5 ist das zweite Modell in Anthropics 5.5-Generation und wurde am 28. September 2026 veröffentlicht, fünf Tage nach dem Start von Claude Opus 5.5, der es versprochen hatte. Es trägt die ID claude-sonnet-5-5 in der Claude API, Amazon Bedrock, Google Cloud und Microsoft Foundry, behält das Kontextfenster dieser Stufe von 1 Mio. Token und die Ausgabegrenze von 128K bei und behält die Preise von Claude Sonnet 5 exakt bei: 2 $ Eingabe, 10 $ Ausgabe, 0,20 $ pro Million für Cache-Lesevorgänge, 2,50 $ für einen fünfminütigen Cache-Schreibvorgang. Es ist ab dem ersten Tag ohne Datenaufbewahrung verfügbar, und Anthropics Stilllegungsverpflichtung reicht bis zum 28. September 2027.

GPT-6 Sol ist der Nachfolger des verwirrend benannten Modells GPT-5.6 Sol – desjenigen, das OrcaRouter noch als erreichbar zu 4 $ Eingabe und 20 $ Ausgabe listet und das Artificial Analysis inzwischen als veraltet markiert hat, mit einem Verweis auf GPT-6 Sol. Das neue Modell erschien am 22. September 2026 zu 2 $ / 10 $ mit einem Kontextfenster von 1.050.000 Token, einer Ausgabegrenze von 128K und einem Staffelpreis: Der angegebene Preis von 2 $ / 10 $ gilt bis zu 272.000 Eingabe-Tokens, und alles darüber wird mit 4 $ / 15 $ abgerechnet.
Dieses letzte Detail ist der erste Punkt, an dem das Framing „identische Preisgestaltung“ bricht.
Der Preisgleichstand gilt nur für kurze Prompts.
Beide Tarifkarten nennen $2 und $10, und fast jeder Vergleich am Starttag endete dort. Stellen Sie die beiden anhand der Konditionen gegenüber, die über eine Rechnung entscheiden:
• Listenpreis — Claude Sonnet 5.5 $2 / $10 vs. GPT-6 Sol $2 / $10
• Langkontext-Tarif — Sonnet 5.5 berechnet das volle 1M-Fenster zum Standardtarif; GPT-6 Sol verdoppelt sich ab 272.000 Eingabe-Tokens auf $4 / $15
• Kontextfenster — 1.000.000 Token vs. 1.050.000 Token
• Maximale Ausgabe — 128K Token bei der synchronen API für beide; Sonnet 5.5 erreicht 300K bei der Message Batches API hinter dem output-300k-2026-03-24 Header
• Batch-Rabatt — 50 % Rabatt auf Input und Output für Sonnet 5.5; prüfe die aktuellen Bedingungen von OpenAI für Sol, statt Parität anzunehmen
• Cache-Lesevorgänge — 0,20 $ pro Million bei beiden
Ein Repository-Sweep über 800.000 Token kostet pro Token auf GPT-6 Sol doppelt so viel wie auf Claude Sonnet 5.5 – und genau das ist die Workload, für die beide Modelle vermarktet werden. Wenn Ihre Prompts kurz sind, sind die Preislisten wirklich gleichauf, und der Preis sollte nichts entscheiden. Wenn sie lang sind, hat er das bereits getan.
Anthropics eigenes Scoreboard, aufmerksam lesen.
Anthropic hat einen vierteiligen Vergleich gegen Claude Sonnet 5, Claude Opus 5.5 und GPT-6 Sol veröffentlicht. Die vom Anbieter angegebenen Werte, die bisher noch keine dritte Partei reproduziert hat:

• Terminal-Bench 4.0 — Sonnet 5.5 70,6 % vs. Sonnet 5 10,3 %
• FrontierCode 1.1, Haupt — Sonnet 5.5 46,2 % bei Max-Aufwand, Sonnet 5 42,4 %, Opus 5.5 54,4 %, GPT-6 Sol 49,3 %
• CursorBench 4.0 — Sonnet 5.5 55,5 % vs. Sonnet 5 34,1 % vs. Opus 5.5 57,8 %
• GDPval-AA v2.1 — Sonnet 5.5 1844 vs. Sonnet 5 1449 vs. Opus 5.5 1846 vs. GPT-6 Sol 1487
• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs. Sonnet 5 1359 vs. Opus 5.5 1822 vs. GPT-6 Sol 1483
• Humanity's Last Exam, mit Werkzeugen — Sonnet 5.5 64,5 % vs. Sonnet 5 54,9 % vs. Opus 5.5 67,7 %
• OSWorld 2.1, teilweise — Sonnet 5.5 80,1 % vs. Sonnet 5 57,0 % vs. Opus 5.5 81,8 %
• Chartography, keine Tools — Sonnet 5.5 61,6 % vs. Sonnet 5 15,6 % vs. Opus 5.5 64,4 % vs. GPT-6 Sol 53,6 %
Zwei dieser Zeilen tragen Fußnoten, und beide sind wichtig. Die GDPval-AA-, AA-Briefcase- und Chartography-Werte für GPT-6 Sol sind von Anthropic als Werte gekennzeichnet, die nach einer Korrektur des Bildverständnisses auf Seiten von OpenAI gemessen wurden, und die FrontierCode-Zahl für Sonnet 5.5 ist dessen Max-effort-Ergebnis, das laut Anthropic unter seinem eigenen Xhigh-Ergebnis in derselben Auswertung lag. Ein Anbieter, der sich auf einem Benchmark, den er selbst betreibt, mit einem Konkurrenten vergleicht, während Fußnoten beide Seiten einschränken, ist kein neutraler Beleg. Es ist der beste am Tag der Markteinführung verfügbare Beleg, und es ist nicht dasselbe wie eine Messung.
Was die unabhängigen Zahlen sagen – und was nicht.
Artificial Analysis hat einen ersten unabhängigen Durchlauf veröffentlicht: Index 56 auf v4.3.2, Kosten von 7,60 $ pro Index-Aufgabe und einen Ausführlichkeitswert von 410 Mio. Ausgabe-Tokens gegenüber einem Median von 88 Mio. Diese Ausführlichkeitszahl verdient mehr Aufmerksamkeit, als ihr derzeit zuteilwird. Sie bedeutet, dass das Modell dazu neigt, auf dem Weg zu einer Antwort sehr viele Tokens zu verbrauchen, und sie ist der Mechanismus hinter der einen Effizienzaussage, die nicht aus Anthropics eigener Tabelle stammt.
Anthropic sagt, Claude Sonnet 5.5 erzeuge Ausgaben 30 % schneller als Claude Sonnet 5 und koste bei gleichem Preis pro Token „bis zu 30 % weniger pro Aufgabe“. Diese beiden Behauptungen zusammen beschreiben ein Modell, das dieselbe Arbeit mit weniger Token erledigt, nicht eine günstigere Preisliste. Ob das zutrifft, genau dafür ist eine Verbositätsmessung über 410 Mio. Token gedacht, und ein einzelner unabhängiger Durchlauf reicht nicht aus, um das abschließend zu klären – aber er reicht aus, um zu sagen, dass der Marketing-Satz und die gemessene Tokenzahl in entgegengesetzte Richtungen weisen, und die gemessene ist die, die auf einer Rechnung auftaucht.
Beachten Sie außerdem, was der unabhängige Index noch nicht enthält. Es gibt keine veröffentlichte OSWorld-, Terminal-Bench- oder CursorBench-Replikation von jemandem außer Anthropic. Und die 56 ist ein zusammengesetzter Wert: Sie sagt nichts darüber aus, welche der zehn darin enthaltenen Evaluationen die Lücke zu Sols 47 bewirkt hat. Ein Vorsprung von neun Punkten im zusammengesetzten Wert kann einen Verlust von fünfzehn Punkten bei der einen Evaluation verbergen, von der Ihre Workload abhängt.
Wo sie auf Weisen voneinander abweichen, die eine Preiskarte nicht zeigen kann
Preis und Index-Score sind die beiden einfachen Achsen. Die, die über eine Migration entscheiden, sind die verhaltensbezogenen, und hier liegen die beiden Modelle nicht nah beieinander.

Claude Sonnet 5.5 aktiviert adaptives Denken standardmäßig mit high als Standard-Aufwand und entfernt drei Dinge, die die vorherige Generation erlaubte: das Senden von thinking: {"type": "disabled"} gibt jetzt einen 400-Fehler zurück und muss durch between_tools ersetzt werden; erzwungene Tool-Nutzung – tool_choice auf "any" oder ein benanntes Tool gesetzt – gibt direkt einen 400-Fehler zurück; und das ältere computer_20251124 Computer-Use-Tool wird in der Claude API und in Google Cloud zugunsten eines Toolsets abgelehnt. Denkblöcke sind jetzt außerdem an das Modell gebunden, das sie erzeugt hat, sodass eine Konversation von Claude Sonnet 5 auf Claude Sonnet 5.5 wechseln und ihr Reasoning behalten kann, aber nicht wieder damit zurückwechseln kann.
Wenn Ihre Agent-Schleife tool_choice: "any" festlegt, um einen schema-gültigen Aufruf zu erzwingen, lehnt Claude Sonnet 5.5 die Anfrage ab, bis Sie zu auto mit strikter Tool-Nutzung oder strukturierten Ausgaben wechseln. Das ist eine echte Migrationsaufgabe, und es ist die Art von Sache, die einen einzeiligen Austausch der Modell-ID in einen ganzen Nachmittag verwandelt.
Die Kosten eines Wechsels zu GPT-6 Sol sind grundlegend anderer Art, weil das Modell, das es ersetzt, noch im Katalog steht und noch immer aufgerufen wird. GPT-5.6 Sol wurde nicht zurückgezogen; es ist bei Artificial Analysis als veraltet eingestuft, kostet doppelt so viel wie das neue Modell und erhält weiterhin Traffic. Die eigenen Messungen von OrcaRouter zeigen, dass darüber wöchentlich etwa 95 Millionen Token laufen, was ein brauchbarer Näherungswert dafür ist, wie viele Integrationen noch nicht migriert sind. Der Wechsel zu GPT-6 Sol ist eine Preisentscheidung, die Sie später treffen können; Sie müssen sie nicht jetzt treffen.
Ausführen des Vergleichs für einen Schlüssel
Das praktische Problem bei einem Vergleich zweier Anbieter ist, dass er üblicherweise zwei Konten, zwei SDK-Pfade und zwei Sätze Rate Limits kostet, bevor man überhaupt etwas lernt. OrcaRouter existiert, um genau das zu bündeln: ein OpenAI-kompatibler Endpoint, über 200 Modelle, Anbieter-Listenpreis ohne Aufschlag durchgereicht, und automatisches Failover über Anbieter hinweg.
Beide Modelle, auf die es hier ankommt, lassen sich heute darüber routen. GPT-6 Sol steht mit 2 $ / 10 $ im Katalog, die Long-Context-Stufe bleibt erhalten, und Claude Sonnet 5 – das Modell, über das noch immer der größte Teil des Claude-API-Verkehrs läuft, mit gemessenen 150 Ausgabe-Tokens pro Sekunde und einer p50-Ersttoken-Zeit von rund fünf Sekunden – ist seit dem 30. Juni zu Anthropics eigenen 2 $ / 10 $ auf der Plattform.
Claude Sonnet 5.5 selbst ist noch nicht in unserem Katalog. Das ist zwar richtig, doch der ehrliche Weg dorthin führt über die API des Anbieters selbst und die drei Clouds, die Anthropic auflistet, und die ehrliche Art, es zu bewerten, besteht darin, es auf einen Teil des Traffics zu richten, dessen Verlust Sie sich leisten können. Dafür ist die Routing-Schicht da: einen Prozentsatz hochstufen, die Fehlerrate beobachten und das vorherige Modell als Fallback beibehalten statt als Rollback-Plan.
Welche geht in die Produktion?
Wähle nach der Form der Arbeitslast aus, nicht nach einem zusammengesetzten Score.
Claude Sonnet 5.5 ist die bessere Wahl für Langkontext-Arbeit, für alles, was bereits gegen die Tool-Use- und Computer-Use-Oberfläche von Anthropic geschrieben wurde, und für Teams, deren Prompts regelmäßig über eine Viertelmillion Tokens hinausgehen – das Flatrate-Fenster ist dort mehr wert als jedes Index-Delta. Akzeptiere, dass an der Migration eine Checkliste hängt: erzwungene Tool-Nutzung, der Thinking-Schalter, die Advisor-Tool-Paarungen und eine Änderung am Computer-Use-Tool.
GPT-6 Sol ist die sicherere Wahl für Kontinuität bei einem OpenAI-förmigen Stack und die günstigere, wenn Ihre Prompts kurz sind und Ihre Integrationen bereits erstellt wurden. Sein Vorteil liegt nicht in der Leistungsfähigkeit – im Gesamtergebnis liegt es zurück –, sondern darin, dass sein Vorgänger noch im Einsatz ist und die Migration keine Frist hat.
Nach den heute verfügbaren Zahlen gewinnt Claude Sonnet 5.5 das direkte Duell auf dem unabhängigen Index und bei der Wirtschaftlichkeit langer Kontexte und verliert in nichts, was eine veröffentlichte Messung jenseits der Konfidenz der anbietereigenen Tabelle bisher erkennen kann. Das ist eine engere Behauptung, als das Launch-Material aufstellt, und sie ist diejenige, auf die hin zu handeln sich lohnt.
Was die Antwort ändern würde, ist ein zweiter unabhängiger Durchlauf der agentischen Evaluierungen und eine veröffentlichte Tokens-pro-Aufgabe-Kennzahl für beide Modelle bei denselben Aufgaben. Solange beides nicht existiert, ist der Composite Index ein Neun-Punkte-Vorsprung für das im Betrieb kostengünstigere Modell, und ein Neun-Punkte-Vorsprung im Composite Index ist nicht dasselbe wie ein Neun-Punkte-Vorsprung bei Ihrer Arbeitslast.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
