
GPT-6.1 Sol vs. Claude Opus 5.5: Eine echte Lücke, ungleich verteilt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Die Kluft von 5,8 Punkten zwischen Claude Opus 5.5 und GPT-6.1 Sol im Artificial Analysis Intelligence Index ist die größte aller Paarungen in diesem Set, und anders als bei den meisten von ihnen wird sie sich nicht durch eine Einstellungsänderung schließen. Claude Opus 5.5, veröffentlicht am 22. September 2026 und abgerechnet mit 4,00 $ pro Million Input- und 20,00 $ pro Million Output-Token, erreicht 57,6 Punkte. GPT-6.1 Sol, veröffentlicht am 29. September 2026 zu 2,00 $ und 10,00 $, erreicht 51,8 Punkte. Claude Opus 5.5 ist das besser bewertete Modell, und zwar mit einem Vorsprung, der größer ist als der, der die meisten Frontier-Modelle voneinander trennt, und es kostet pro Aufgabe 8,3× mehr, um dorthin zu gelangen – 5,98 $ gegenüber 0,72 $. Bislang gewinnt das teure Modell schlicht, was die am wenigsten interessante Variante dieses Vergleichs ist. Was ihn lesenswert macht, ist, dass die 5,8 Punkte nicht gleichmäßig über die Testsuite verteilt sind: Auf der einen Achse, die den größten Teil der Arbeit mit langen Dokumenten und langen Sitzungen entscheidet, liegen die beiden Modelle weniger als zwei Punkte auseinander.
Beide sind Flaggschiffmodelle im selben Marktsegment: Kontextfenster der 1M-Klasse, Ausgabelimits von 128K, Text-, Bild- und Dateieingabe, erweitertes Denken auf der einen Seite und eine fünfstufige Aufwandsleiter auf der anderen. Claude Opus 5.5 folgt auf Claude Opus 5 und ist für anspruchsvolles Reasoning, Coding und langhorizontige agentische Arbeit positioniert; GPT-6.1 Sol steht eine Stufe unter GPT-6 Astra und ist auf agentisches Coding, Computer-Nutzung und dokumentenintensive professionelle Arbeit ausgerichtet. Sie zielen auf dieselben Aufgaben. Die Messung zeigt, dass sie nicht bei allen gleichermaßen gut sind.
Wo die 5,8 Punkte tatsächlich liegen
Ein zusammengesetzter Index verbirgt seine Komponenten. Zieht man die einzelnen Bewertungen heran, sieht die Lücke nicht mehr wie eine Lücke aus und beginnt, wie ein Profil auszusehen.
• Humanity's Last Exam — Claude Opus 5.5 mit 61,4 % vs. GPT-6.1 Sol mit 52,9 %, eine Differenz von 8,5 Punkten beim abstrakten Schlussfolgern
• SciCode — Claude Opus 5.5 66,9 % vs. GPT-6.1 Sol 54,2 %, eine Differenz von 12,7 Punkten bei Code in Forschungsqualität
• Langkontext-Recall — Claude Opus 5.5 84,7 % vs. GPT-6.1 Sol 83,0 %, eine Differenz von 1,7 Punkten beim Abrufen von Fakten aus einer langen Eingabe
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % gegenüber einem Sol-Wert, der in derselben Revision nicht veröffentlicht wurde
• Kontextfenster — GPT-6.1 Sol 1.050.000 Tokens vs. Claude Opus 5.5 1.000.000 Tokens, mit einer Ausgabegrenze von 128.000 Tokens bei beiden
• Kosten pro Index-Aufgabe — Claude Opus 5.5 $5.98 vs. GPT-6.1 Sol $0.72
Die Verteilung ist die Geschichte. Wo die Aufgabe im Abstrakten liegt – eine schwierige Prüfungsfrage, ein Programmierproblem auf Forschungsniveau, für das es keine bestehende Lösung zum Abschreiben gibt –, liegt Claude Opus 5.5 entschieden vorn, und eine SciCode-Lücke von 12,7 Punkten ist kein Rauschen. Wo die Aufgabe darin besteht, die richtige Passage in einer sehr langen Eingabe zu finden und zu nutzen, sind die beiden Modelle praktisch gleichauf, und GPT-6.1 Sol hält diese Position mit 50.000 Token mehr Kapazität. Ein großer Teil der Produktionsarbeit mit LLMs ist von der zweiten Art: retrieval-augmentiertes Antworten, Vertrags- und Aktenprüfung, Log- und Transkriptanalyse, Code-Review über ein großes Repository. Diese Arbeit wird am dritten Punkt gemessen, nicht an den ersten beiden, und bei diesem Punkt erkauft der Aufpreis 1,7 Punkte.
Die Indexzeilen ehrlich lesen
Zwei Einschränkungen gehören eher neben diese Zahlen als ans Ende der Seite.
Die Konfigurationen unterscheiden sich. Artificial Analysis stellt Claude Opus 5.5 in einer „Max, Default Fallback“-Konfiguration und GPT-6.1 Sol mit maximalem Effort dar. Beides sind die stärksten Einstellungen, unter denen die jeweiligen Modelle veröffentlicht werden, was den Vergleich fair macht, doch es ist ein Vergleich zweier Obergrenzen statt zweier ausgelieferter Standardeinstellungen. Die eigenen Standardeinstellungen von Claude Opus 5.5 in einer gehosteten API können von dem im Chart dargestellten Lauf abweichen, und der Standard-Effort von GPT-6.1 Sol ist medium.
Die Terminal-Bench-Zeile ist auf einer Seite bewusst leer. Die 59,6 % von Claude Opus 5.5 stammen aus der Revision von Artificial Analysis, in der sie veröffentlicht wurden; der entsprechende Wert für GPT-6.1 Sol ist in einer passenden Revision nicht verfügbar. Eine Zahl aus einem anderen Durchlauf desselben Benchmarks zu zitieren, wäre ein falscher Vergleich, und der ehrliche Schritt ist, die Zelle leer zu lassen, statt sie mit etwas zu füllen, das ungefähr richtig ist.
Die Ausführlichkeit wirkt hier in dieselbe Richtung wie gegenüber den günstigeren Geschwistern: Claude Opus 5.5 gibt auf der Index-Suite 260M Output-Tokens aus, gegenüber den 67M von GPT-6.1 Sol – ein 3,9-facher Unterschied bei einer Rate, die ohnehin schon doppelt so hoch ist. Daher stammt das 8,3-fache Verhältnis pro Aufgabe, wenn die Preisliste 2× beim Input und 2× beim Output ausweist. Der Aufpreis beträgt nicht das 8,3-Fache, weil das Modell das 8,3-Fache kostet – er beträgt das 8,3-Fache, weil es das 2-Fache kostet und 3,9-mal so lange denkt.
Das Plädoyer dafür
Wenn Ihre Arbeit den ersten beiden Punkten ähnelt, ist die Rechnung einfach, und sie spricht für Claude Opus 5.5. Ein Abstand von 12,7 Punkten bei wissenschaftlichem Code auf Forschungsniveau oder 8,5 Punkte bei schwierigem abstraktem Schlussfolgern ist der Unterschied zwischen einem Agenten, der ein Ticket unbeaufsichtigt abschließt, und einem, der bei jedem dritten Schritt einen Menschen braucht. Agentisches Coding über eine große Codebasis ist die Arbeitslast, die beide Anbieter an erster Stelle nennen, und es ist die Arbeitslast, bei der die Spanne am größten ist. 5,98 $ statt 0,72 $ pro Aufgabe zu zahlen, um einen fehlgeschlagenen Durchlauf zu vermeiden, der einen Entwickler zwanzig Minuten kostet, ist alles andere als eine knappe Entscheidung.
Es gibt ein zweites Argument, das überhaupt nicht von Punktzahlen handelt. Claude Opus 5.5 ist fünfzehn Tage alt und hat einen Fundus an Evaluierungen, Reviews und Deployment-Erfahrungen von Drittanbietern hervorgebracht, über den ein acht Tage altes Modell nicht verfügt. Für einen Produktionspfad ist die Reife des umgebenden Wissens etwas wert, das der Index nicht bepreist.
Die Argumente dagegen – und die Zahl, die den Ausschlag gibt
Das Gegenargument ist die Langkontext-Zeile. Wenn die dominierende Form Ihres Traffics „große Eingabe, kurze Antwort“ ist – und für sehr viele Teams ist sie das –, dann ist die Achse, für die Sie abgerechnet werden, nicht die Achse, die Sie verbrauchen. Beim Langkontext-Recall liegen die beiden Modelle bei einem Preisverhältnis von 8,3× 1,7 Punkte auseinander, und das günstigere Modell hat das größere Kontextfenster. Das ist der Fall, in dem der Aufpreis real und messbar ist und für eine Fähigkeit ausgegeben wird, die die Workload nie in Anspruch nimmt.
Die entscheidende Zahl ist also nicht der Index. Sie ist der Anteil Ihrer Aufgaben, die eher wie SciCode als wie Recall aussehen. Teams, die diese Frage aus ihren eigenen Logs beantworten können, sollten sie aus ihren eigenen Logs beantworten; eine Benchmark-Suite ist ein Proxy für eine Mischung von Jobs, und die Mischung ist die Variable.
Beides auf einer Taste, was die Frage beantwortbar macht.


Claude Opus 5.5 ist auf OrcaRouter zu seinen eigenen $4,00 / $20,00 erhältlich, mit Cache-Lesevorgängen zu $0,20. GPT-6.1 Sol ist auf OrcaRouter für $2,00 / $10,00 erhältlich, ab 272.000 Prompt-Tokens steigend auf $4,00 / $15,00, mit Cache-Lesevorgängen zu $0,10. Beide zum Listenpreis des Anbieters, ohne Aufschlag, über einen einzigen Schlüssel und eine einzige Rechnung.
Das ist bei dieser Paarung wichtiger als sonst, denn die beiden Modelle sind keine Ersatzmodelle füreinander – sie sind eine Routing-Entscheidung. Schicken Sie die Arbeit mit langen Dokumenten und hohem Volumen an GPT-6.1 Sol, lassen Sie die anspruchsvolle Schlussfolgerungs- und Codeänderungsarbeit bei Claude Opus 5.5, und beide laufen hinter demselben Endpunkt mit denselben Anmeldedaten. Wenn eine Route schlechter wird, verschiebt ein automatisches Failover den Aufruf, anstatt ihn fehlschlagen zu lassen, und weil das Routing deklarativ ist, kann es pro Aufgabenklasse statt pro Anwendung ausgedrückt werden. Das Testen der Aufteilung ist eine Konfigurationsänderung, keine Migration.
Das Letzte, was sich zu sagen lohnt, betrifft die Haltbarkeit dieses Vergleichs. Beide Modelle sind erst Tage oder Wochen alt. Für GPT-6.1 Sol ist eine unabhängige Konfiguration veröffentlicht, für Claude Opus 5.5 ebenfalls eine. Ein einzelner Durchlauf pro Modell ist eine Momentaufnahme, und der interessante Fehlermodus ist nicht, dass eine davon falsch ist – sondern dass eine Konfiguration mit mittlerem Aufwand oder ein zweiter Evaluator das Profil neu zeichnet. Bis dahin gilt die Lesart, die die eine hergibt: eine Lücke beim anspruchsvollen Schlussfolgern und bei Forschungscode, eine kleine bei Long-Context-Arbeit, und eine Rechnung über das 8,3-Fache, die durch den Teil Ihrer Arbeitslast gerechtfertigt werden muss, der dem Ersteren ähnelt.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
