
GPT-6 vs. Grok 4.6: Zwei mittlere Tarifstufen, eine Rechnung, die oberhalb von 200K Tokens divergiert
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
GPT-6 Sol und Grok 4.6 kosten an der Spitze der beiden Spalten dasselbe: 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens. Was fast niemand daneben schreibt, ist, dass die Spalten an unterschiedlichen Punkten in der Anfrage aufhören übereinzustimmen. Grok 4.6 beginnt seinen Langkontext-Tarif zu berechnen, sobald ein Prompt 200.000 Input-Tokens überschreitet; GPT-6 Sol wartet bis 272.000. Oberhalb dieser Grenzen wird die gesamte Anfrage neu bepreist – nicht nur der Überlauf –, und die beiden Anbieter bepreisen sie in entgegengesetzte Richtungen neu, und genau das ist der Teil, der die Rechnung für einen langen Agentenlauf entscheidet. GPT-6 Sol und seine Geschwister GPT-6 Astra und GPT-6 Luna wurden am 22. September 2026 veröffentlicht; Grok 4.6, die mittlere Stufe der SpaceXAI-Reihe, erschien am 12. August 2026 und wurde bereits durch Grok 4.7 ergänzt, sodass es sich um einen Vergleich zwischen zwei bereits veröffentlichten Modellen handelt und nicht um die Markteinführung eines der beiden.
Eine zweite Sache änderte sich am 7. Oktober 2026, die dafür relevant ist, wie Sie GPT-6 überhaupt lesen: OpenAI begann, GPT-6 in den Haupt-Chat-Tab von ChatGPT auszurollen, wobei am 8. Oktober die kostenlosen Tarife erreicht wurden, während in den Tarifen Plus, Pro, Business und Enterprise GPT-6 Sol läuft und in den Tarifen Free und Go GPT-6 Luna. Das ist eine Oberflächenänderung – dieselben Modelle, ein viel größeres Publikum und eine neue Schnittstellenebene, die OpenAI Intelligent UI nennt. Sie ändert keinen einzigen API-Tarif. Sie bedeutet aber, dass Sie, wenn Sie „GPT-6“ gegen irgendetwas benchmarken, jetzt gegen ein Modell benchmarken, mit dem sich auch eine sehr große Zahl von Menschen in einem Browser-Tab unterhält.
Wo sich die beiden Karten tatsächlich unterscheiden
• Kurzkontext-Eingabe — GPT-6 Sol 2,00 $ pro Million vs. Grok 4.6 2,00 $ pro Million
• Kurzkontext-Ausgabe — GPT-6 Sol 10,00 $ pro Million vs. Grok 4.6 6,00 $ pro Million
• Schwelle für lange Anfragen — GPT-6 Sol ändert den Preis oberhalb von 272.000 Eingabe-Tokens vs. Grok 4.6 oberhalb von 200.000
• Eingabe bei langen Anfragen — GPT-6 Sol 4,00 $ pro Million vs. Grok 4.6 4,00 $ pro Million
• Ausgabe bei langen Anfragen — GPT-6 Sol 15,00 $ pro Million vs. Grok 4.6 12,00 $ pro Million
• Cache-Eingabe — GPT-6 Sol 0,20 $ pro Million vs. Grok 4.6 0,50 $ pro Million
• Kontextfenster — GPT-6 Sol 1.050.000 Tokens vs. Grok 4.6 500.000 Tokens
• Eingabemodalitäten — beide akzeptieren Text, Bild und Datei
• Wissensarbeits-Score — GPT-6 Sol 47,6 vs. Grok 4.6 44,3 im Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol nicht für dieselbe Revision veröffentlicht vs. Grok 4.6 88,4
Liest man die beiden Ausgabezeilen zusammen, zeigt sich die Form der Entscheidung. Grok 4.6 ist bei jeder Anfrage unter 200K um 4,00 $ pro Million Ausgabe-Tokens günstiger und darüber nur um 3,00 $. Das ist eine viel kleinere Lücke, als die Schlagzeile von 40 % nahelegt, weil beide Modelle die gesamte Anfrage neu bepreisen und nicht nur den Teil über der Grenze – ein Detail, bei dem man verweilen sollte, denn ein Prompt mit 200.001 Tokens wird nicht als ein Token zum teuren Tarif plus 200.000 zum günstigen abgerechnet.
Dann verläuft die Schwelle selbst andersherum. Grok 4.6 beginnt 72.000 Token früher mit der Preisumstellung als GPT-6 Sol. Für eine Arbeitslast, die durchgängig zwischen 200K und 272K liegt, ist Grok 4.6 trotz seines günstigeren Pro-Token-Nennwerts das teurere Modell, und es ist das einzige der beiden, bei dem sich überhaupt etwas bewegt hat. Auf welcher Seite dieses Fensters deine Prompts landen, ist eine nützlichere Frage als die, welcher Nennwert niedriger ist.

Die Benchmark-Lücke ist kleiner und enger als die Preislücke.
Im Intelligence Index von Artificial Analysis, einer Messung durch Dritte und nicht einer Anbietertabelle, liegt GPT-6 Sol bei 47,6 und Grok 4.6 bei 44,3. Eine Lücke von 3,3 Punkten auf einer Skala von 0 bis 100 ist real, aber sie ist nicht die Art von Abstand, die das eine Modell für eine Aufgabe ungeeignet und das andere geeignet macht. Außerdem wird er pro Modell bei einer bestimmten Reasoning-Einstellung gemessen, und GPT-6 Sol bietet konfigurierbaren Reasoning-Aufwand, während Grok 4.6 seinen eigenen bietet – wer also eine einzelne Direktvergleichszahl zitiert, zitiert einen Punkt in einem zweidimensionalen Raster.
Wo die beiden wirklich weiter auseinanderliegen, ist terminalartige agentische Arbeit. Auf Terminal-Bench 2.1 erzielt Grok 4.6 88,4. GPT-6 Sol hat keine vergleichbare veröffentlichte Zahl für die Revision, die unser Katalog führt, und die ehrliche Lesart einer leeren Zelle ist, dass die Zahl nicht veröffentlicht ist – nicht, dass das Modell schlecht abgeschnitten hat. Wenn ein lang laufender, Shell-gesteuerter Agent die Arbeitslast ist, spricht die veröffentlichte Evidenz für Grok 4.6, und die fehlende Evidenz zählt für keine der beiden Seiten als Evidenz.
Umgekehrt verhält es sich beim Wissensabruf über lange Kontexte. GPT-6 Sol verzeichnet 83,7 beim Long-Context-Recall gegenüber 80,3 von Grok 4.6, und die Anbieter beider Modelle berichten ihre eigenen Zahlen an anderer Stelle — SpaceXAI hebt GPQA Diamond mit 94,9 für Grok 4.6 hervor, und das GPT-6-Material von OpenAI basiert größtenteils auf Anbieterangaben und ist nicht reproduziert. Zwei Regeln halten das auseinander: Eine Anbieterzahl ist eine Behauptung, und eine Indexzahl ist eine Messung an einer benannten Revision. Sie sind nicht austauschbar und sollten niemals zu einem einzigen „besseren“ Score gemittelt werden.
Das Nachfolgerproblem
Keines der beiden ist das neueste Modell aus dem jeweils eigenen Labor, und etwas anderes vorzugeben, wäre das Irreführendste, was dieser Vergleich tun könnte. SpaceXAI veröffentlichte Grok 4.7 am 21. September 2026 zum selben Basistarif von 2,00 $ / 6,00 $, wobei der Intelligence Index von 44,3 auf 46,4 stieg. OpenAI veröffentlichte GPT-6.1 Sol am 29. September 2026, ebenfalls zu 2,00 $ / 10,00 $, wobei der Intelligence Index bei 51,8 lag und sich ein Tarif sogar verbesserte: Die zwischengespeicherte Eingabe fiel von 0,20 $ auf 0,10 $ pro Million. Artificial Analysis kennzeichnet inzwischen seine Seite zu GPT-6 Sol als veraltet und verweist Leser auf GPT-6.1 Sol.
Die faire Formulierung lautet also nicht „welche dieser beiden solltest du einsetzen“, sondern „welche dieser beiden – und bist du sicher, dass nicht auf der einen oder anderen Seite eine Generation neuer ist?“ Der Grund, bei GPT-6 Sol zu bleiben, ist meist eine bestimmte acht Tage alte Integration und keine Fähigkeitsaussage; der Grund, bei Grok 4.6 zu bleiben, ist eine veröffentlichte Terminal-Agent-Kennzahl, die ihr Nachfolger öffentlich noch nicht erreicht hat. Beides ist legitim, und beides ist zeitlich befristet.

Beide von einer Taste aus ausführen
Beide Modelle werden von OrcaRouter geroutet, daher kostet der mechanische Teil, zwei Kandidaten am Leben zu halten, nichts: eine API vor über 200 Modellen, derselbe Schlüssel, kein zweiter Vertrag und keine Codeänderung zwischen ihnen. Das zählt hier mehr als sonst, denn das Argument für ein zweites Modell in diesem speziellen Duell ist keine Absicherung bei den Fähigkeiten, sondern eine Routing-Entscheidung — schicke das Fenster von 200K bis 272K an GPT-6 Sol und alles Kürzere an Grok 4.6, und dieselbe Anwendung erhält auf beiden Seiten einer Schwelle, die kein Anbieter dich wählen lässt, die günstigere Rechnung.
Automatisches Failover ist die langweilige Hälfte desselben Aufbaus. Agenten-Läufe mit langem Kontext sind genau deshalb lang, weil irgendetwas eine Sitzung offen hält, und ein Aussetzer beim Anbieter in Minute vierzig ist die teure Art von Fehler. Eine im Voraus konfigurierte zweite Route macht daraus einen erneuten Versuch statt eines erneuten Durchlaufs.
Unser Katalog führt beide zum eigenen Listenpreis des jeweiligen Anbieters auf, ohne Aufschlag, sodass eine Preisänderung bei einer der beiden Karten bei uns am selben Tag ankommt, an dem sie bei ihnen ankommt. Das sollte man klar sagen und nicht als Slogan: Der Grund, warum das wichtig ist, ist, dass der oben genannte Unterschied von 0,20 USD gegenüber 0,50 USD bei gecachtem Input genau die Art von Posten ist, die Anbieter still und leise verschieben, und eine Weitergabe bedeutet, dass Sie nie darauf warten müssen, dass ein Reseller nachzieht.

Was entscheidet es eigentlich?
Wenn Ihre Prompts kurz sind, gewinnt Grok 4.6 beim Ausgabepreis mit einem Vorsprung, den kein Index-Delta schließt, und sein Terminal-Agent-Score ist die stärkste veröffentlichte Zahl in beiden Spalten. Wenn Ihre Prompts lang sind, sind die spätere Preisanpassungsschwelle von GPT-6 Sol und sein längeres Fenster mehr wert als seine höhere Ausgaberate, und die Position für zwischengespeicherte Eingaben macht nur ein Viertel der Kosten aus. Wenn Ihre Prompts zwischen 200K und 272K liegen, haben Sie es mit der einen Workload zu tun, bei der das scheinbar günstigere Modell das teurere ist, und die Lösung ist die Routenauswahl statt der Modellauswahl.
Worauf man achten sollte, ist nicht eines der beiden Modelle, sondern die beiden Nachfolger, die bereits erhältlich sind. Grok 4.7 und GPT-6.1 Sol schwächen beide das Argument, hier mit einer Entscheidung zu warten, und ein Vergleich, der alle drei Wochen neu durchgeführt werden muss, gehört hinter einen Router und nicht in ein Architekturdiokument.
In diesem Artikel verglichen3
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
