Hero-Titelkarte mit der Aufschrift „GPT-6 vs Claude Opus 5.5“, mit einem Chip mit der Aufschrift „GPT-6 in ChatGPT ausgerollt am 2026-10-07“, zwei Preiszeilen mit der Aufschrift „GPT-6 Sol $2 / $10“ und „Claude Opus 5.5 $4 / $20“ sowie einer Fußzeile mit der Aufschrift „Die GPT-6-Werte enthalten vom Anbieter gemeldete Posten; Indexwerte laut Artificial Analysis.“ Das OrcaRouter-Logo ist in die untere rechte Ecke einkomponiert.
Guides & Insights

GPT-6 vs Claude Opus 5.5: Das Modell, das gerade alle bekommen haben, gegen das, das immer noch führt

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 7. Oktober 2026 wurde GPT-6 zum Modell, mit dem mehr als 1,2 Milliarden wöchentliche ChatGPT-Nutzer sprechen, und es ist noch immer nicht das Modell mit der höchsten Punktzahl auf dem unabhängigen Board. GPT-6 Sol – die Stufe, die OpenAI für ChatGPT Plus, Pro, Business und Enterprise aktiviert hat – erreicht 47,6 auf dem Intelligence Index v4.3.2 von Artificial Analysis. Claude Opus 5.5, das Anthropic am 22. September 2026 für 4,00 US-Dollar pro Million Eingabe-Tokens und 20,00 US-Dollar pro Million Ausgabe-Tokens auf den Markt brachte, erreicht 57,6 in derselben Revision. Zehn Punkte, bei der einen Messung, bei der beide Marketingteams der Anbieter bereit sind, sich bewerten zu lassen.

Diese Lücke ist real, und ich werde sie nicht kleinreden. Aber sie ist zugleich die am wenigsten interessante Tatsache an dieser Paarung im Oktober, denn was sich diese Woche geändert hat, ist kein Benchmark. GPT-6 ist in ChatGPT für alle verfügbar geworden, mit einer Fähigkeit, die OpenAI Intelligent UI nennt, und das Modell, das die bezahlten Stufen dieses Rollouts antreibt, ist GPT-6 Sol. Die nützliche Frage lautet also nicht mehr „welche API ist besser“, sondern „was haben die 1,2 Milliarden Menschen, die gerade GPT-6 bekommen haben, tatsächlich bekommen, und reicht es aus, dass ein Entwickler oder ein Team aufhören sollte, für Claude Opus 5.5 zu bezahlen“. Die beiden Antworten unterscheiden sich, und der Unterschied sind nicht die zehn Punkte.

Was hat sich am 7. Oktober tatsächlich geändert?

Um das Datum genau zu fassen, denn dies ist keine Markteinführung: GPT-6 Sol und GPT-6 Luna wurden am 22. September 2026 als API-Modelle bereitgestellt. GPT-6 Astra, das Flaggschiff, kam vor ihnen heraus – OpenAI veröffentlichte es am 3. September 2026. Was am 7. Oktober geschah, ist, dass GPT-6 den ChatGPT-Chat-Tab weltweit für Plus, Pro, Business und Enterprise erreichte, wobei Free- und Go-Tarife ab dem 8. Oktober folgten; der Enterprise-Zugang hängt weiterhin von den Einstellungen eines Arbeitsplatz-Administrators ab. Es ist ein Distributionsereignis, keine Veröffentlichung, und der Unterschied ist wichtig für alle, die die ältere Berichterstattung lesen.

Die damit verbundene Fähigkeit ist der wirklich neue Teil. Intelligent UI ermöglicht es GPT-6, eine Antwort aus Text, Grafiken, antippbaren Schaltflächen, Formularen und Diagrammen zusammenzustellen – je nach Frage ausgewählt – und die Benutzeroberfläche zu streamen, während das Modell sie generiert. OpenAIs eigene Darstellung ist, dass ein Vergleich nebeneinander zurückkommen könnte, eine Erklärung als interaktives Diagramm und eine reine Textantwort, wenn Text die richtige Antwort ist. Zwei vom Anbieter gemeldete interne Ergebnisse begleiten dies: Bei wertvollen alltäglichen agentischen Aufgaben beginnt GPT-6 mit Extra High Effort in derselben Zeit zu antworten wie GPT-5.6 mit Medium und erzielt insgesamt bessere Werte als GPT-5.6 mit Extra High, und bei Fragen, die eine Websuche erfordern, beginnt GPT-6 Instant im Durchschnitt 44 % früher zu antworten als GPT-5.6 Instant. Beides sind OpenAIs Zahlen, übernommen aus der eigenen Ankündigung, und keine davon wurde bisher unabhängig reproduziert.

Zwei Tarifkarten, und wo die zehn Punkte gekauft werden

Keines der beiden Modelle hat diese Woche seinen Preis geändert. Claude Opus 5.5 liegt seit dem 22. September bei 4,00 $ für die Eingabe und 20,00 $ für die Ausgabe. GPT-6 Sol liegt seit demselben Tag bei 2,00 $ und 10,00 $. Eine Zeile pro Dimension, beide Seiten in jeder Zeile:

• Headline-Eingabe — GPT-6 Sol 2,00 $ pro 1 Mio. vs. Claude Opus 5.5 4,00 $; Sol kostet die Hälfte
• Headline-Ausgabe — GPT-6 Sol 10,00 $ pro 1 Mio. vs. Claude Opus 5.5 20,00 $; wieder die Hälfte
• Langkontext-Klausel — GPT-6 Sol bepreist die gesamte Anfrage oberhalb von 272.000 Eingabe-Token neu mit 4,00 $ für Eingabe und 15,00 $ für Ausgabe; Claude Opus 5.5 hat bei seinem 1-Mio.-Fenster keinen vergleichbaren Schritt
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro 1 Mio. vs. Claude Opus 5.5 0,20 $; gleichauf
• Kosten für die Ausführung der vollständigen Intelligence-Index-Suite — Claude Opus 5.5 5,98 $ pro Aufgabe vs. GPT-6 Sol 1,04 $, eine 5,7-fache Spanne, erkauft für diese zehn Punkte
• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. Claude Opus 5.5 1.000.000, mit einer Ausgabe-Obergrenze von 128.000 Token bei beiden

A two-column comparison scoreboard for GPT-6 Sol and Claude Opus 5.5, showing GPT-6 Sol at an Intelligence Index of 47.6 and $1.04 per index task against Claude Opus 5.5 at 57.6 and $5.98, plus input and output prices of $2.00/$10.00 against $4.00/$20.00 and 1,050,000 against 1,000,000-token context windows. A footer reads "Index figures per Artificial Analysis v4.3.2; GPT-6 vendor-reported items labelled in text."

Die vierte Zeile ist diejenige, die über die meisten realen Deployments entscheidet, und sie ist nicht die auf der Marketingseite. Der Langkontext-Zuschlag von GPT-6 Sol ist aggressiv im Verhältnis zu seinem eigenen beworbenen Preis: Überschreitet eine Anfrage 272.000 Eingabe-Tokens, wird die gesamte Anfrage mit 4,00 $ und 15,00 $ abgerechnet, nicht nur der Überschuss. Für einen Agenten, der eine lange Sitzung mit einem großen Dokument im Kontext hält, beseitigt das still und leise den größten Teil des Halbpreisvorteils. Claude Opus 5.5 hat keine entsprechende Staffel, sodass eine Anfrage mit 400.000 Tokens bei ihm denselben Preis pro Token kostet wie eine mit 4.000 Tokens.

Wo die zehn Punkte liegen, denn sie sind nicht gleichmäßig verteilt.

Ein Index-Aggregat verbirgt seine eigenen Bestandteile, und dieses hier verbirgt ein ungewöhnlich ungleichmäßiges Profil. Ziehen Sie die einzelnen Bewertungen heran, gegen die sich die Zahlen beider Anbieter lesen lassen:

• Humanity's Last Exam — Claude Opus 5.5 61,4 % vs. GPT-6 Sol 47,9 %, eine Differenz von 13,5 Punkten beim abstrakten Schlussfolgern
• SciCode — Claude Opus 5.5 66,9 % vs. GPT-6 Sol 57,6 %, eine Differenz von 9,3 Punkten bei Code auf Forschungsniveau
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % vs. GPT-6 Sol 43,9 %
• Abruf bei langem Kontext — Claude Opus 5.5 84,7 % vs. GPT-6 Sol 83,7 %, eine Differenz von 1,0 Punkten, die geringste auf dieser Seite
• Mehrrundige agentische Werkzeugnutzung — die beiden Modelle liegen in der τ²-Bench-Familie innerhalb weniger Punkte, wo beide stark sind

A screenshot of the top of the Artificial Analysis leaderboard table, under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response column headings, showing Claude Opus 5.5 (max with fallback) at 58 and $5.98 per index task, Claude Sonnet 5.5 at 56, Claude Opus 5.5 (xhigh) at 56 and (high) at 54, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and $1.99, GPT-6 Astra (xhigh) at 52 and GPT-6.1 Sol (max) at 52 and $0.72.

Die Verteilung sagt alles. Beim abstrakten Schlussfolgern – eine schwere Prüfungsfrage, ein Forschungsproblem, für das es keine bestehende Antwort zum Abschreiben gibt – liegt Claude Opus 5.5 entschieden vorn, und die Lücke ist viel zu groß, um Rauschen zu sein. Beim Herausziehen einer Tatsache aus einer sehr langen Eingabe liegen die beiden praktisch gleichauf, und GPT-6 Sol hat das geringfügig größere Kontextfenster. Wenn Ihre Arbeitslast den Abruf aus langen Dokumenten und Agentenarbeit über lange Sitzungen umfasst, sind die zehn Punkte größtenteils das Problem von jemand anderem. Wenn sie aus neuartigem Schlussfolgern besteht, sind sie Ihr Problem, und sie zu vermeiden kostet Sie 5,7× pro Aufgabe.

Was der ChatGPT-Rollout Ihnen sagt – und was nicht

Es gibt die Versuchung, „1,2 Milliarden wöchentliche Nutzer haben jetzt GPT-6“ als Beleg für Leistungsfähigkeit zu lesen. Das ist es nicht. Es ist ein Beleg für Verbreitung, und OpenAI stellt ausdrücklich klar, dass der ChatGPT-Rollout von GPT-6 Sol für die kostenpflichtigen Tarife und GPT-6 Luna für Free und Go angetrieben wird, beide „für alltägliche Konversation optimiert“ – ein anderes Optimierungsziel als das API-Produkt. Die Modelle hinter Work und Codex bleiben durch dieses Release unverändert, was das eindeutigste Signal in der Ankündigung dafür ist, dass es sich um ein Ereignis an der Consumer-Oberfläche und nicht um ein Release neuer Fähigkeiten handelt. Wer „das GPT-6, das 1,2 Milliarden Menschen nutzen“ benchmarkt, sollte wissen, dass er ein chat-optimiertes Deployment misst, nicht den API-Endpunkt.

Was der Rollout sehr wohl ändert, ist der Standard. Ein Modell, das einfach für alle verfügbar ist, landet in weit mehr Prototypen, internen Tools und halbfertigen Nebenprojekten als ein Modell, das man bewusst auswählen muss. Wenn Sie eine API für etwas Langlebiges wählen, ist diese allgegenwärtige Vertrautheit etwas wert – aber sie ist keine zehn Indexpunkte wert und nicht 5,7× die Kosten pro Aufgabe in einer Pipeline mit hohem Reasoning-Anteil.

Beide ausführen, ohne auszuwählen

Die ehrliche Antwort auf die Frage „Sollte ich hier wechseln?“ lautet, dass die beiden Modelle unterschiedliche Aufgaben erfüllen sollen, und die Wechsel-Frage ist größtenteils eine Routing-Frage. Beide stehen in OrcaRouters Katalog — GPT-6 Sol zum Anbieterpreis von 2,00 $/10,00 $, wobei die Long-Context-Stufe zu 4,00 $/15,00 $ unverändert durchgereicht wird, und Claude Opus 5.5 zu 4,00 $/20,00 $ — hinter einem Schlüssel und einem OpenAI-kompatiblen Endpunkt, mit 0 % Aufschlag auf den Listenpreis des Anbieters. Das ist in einer Woche, in der ein Anbieter einen Consumer-Rollout ändert, wichtiger als sonst, denn unsere Preisangabe stammt vom Anbieter, nicht von uns.

Das Muster, das zu dieser Paarung passt, ist eine Aufteilung: Senden Sie den Traffic für lange Dokumente und lange Sitzungen an denjenigen der beiden, der bei dieser Token-Anzahl günstiger ist – der jenseits von 272.000 Tokens nicht mehr GPT-6 Sol ist –, und senden Sie den Traffic für neuartiges Reasoning an Claude Opus 5.5, wobei GPT-6 Sol als automatisches Failover vorgehalten wird, damit ein Rate-Limit auf einer Route nicht zu einem Ausfall auf Ihrer Seite wird. Sie müssen die Zehn-Punkte-Debatte nicht klären, um auszuliefern; Sie müssen wissen, welche Ihrer Anfragen in dem Teil der Verteilung liegen, in dem es zutrifft.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, showing the Anthropic vendor label, a 2026-09-22 release date, a 1M-token context window, a 128K-token maximum output, text, image and file input with vision, tool calling, JSON output and reasoning modes, and pricing of $4.00 per million input tokens and $20.00 per million output tokens with a $0.20 cached-input rate.

Das Urteil, so wie es ist

Claude Opus 5.5 ist das bessere Modell bei der Kennzahl, die beide Labore veröffentlichen, und bei den zwei Evaluierungen, die für anspruchsvolles Schlussfolgern am wichtigsten sind, ist es nicht knapp. GPT-6 Sol kostet zum Listenpreis die Hälfte, ein Fünftel der Kosten pro Aufgabe in der unabhängigen Testsuite und ist jetzt das Standardmodell in der App, die die meisten Ihrer Kolleginnen und Kollegen bereits geöffnet haben. Keine dieser beiden Tatsachen hat sich diese Woche geändert; was sich geändert hat, ist, dass GPT-6 nicht mehr etwas ist, das man wählen muss, sondern etwas, das man hat.

Zu beobachten ist, ob der nächste Schritt von OpenAI ein Fähigkeitsschritt oder ein weiterer Distributionsschritt ist. Die eigene Ankündigung formuliert diese Erwartung ausdrücklich – das Unternehmen sagt, dass ChatGPT mit der Zeit mehr von den Schnittstellen aufbauen soll, die die Menschen brauchen – und das ist eine Roadmap über Oberflächen, nicht über Indexpunkte. Wenn Ihre Entscheidung vom Index abhängt, gewinnt Claude Opus 5.5 ihn weiterhin. Wenn sie von den Kosten bei hohem Volumen und davon abhängt, dass das Modell eines ist, das alle bereits kennen, ist GPT-6 Sol heute die sicherere Standardwahl, wobei die Langkontext-Klausel die eine Zeile in seiner Preisliste ist, die Sie im Budget berücksichtigen müssen.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert