
GPT-6 vs. Grok 4.7: Die Output-Spalte gibt den Ausschlag
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
GPT-6 Sol und Grok 4.7 verlangen dasselbe für Eingabe-Token – 2,00 $ pro Million, beide –, was die Eingabespalte für die Wahl zwischen ihnen nutzlos macht. Die Entscheidung liegt eine Spalte weiter rechts. GPT-6 Sol berechnet 10,00 $ pro Million Ausgabe-Token; Grok 4.7 berechnet 6,00 $. Und die beiden Modelle unterscheiden sich um den Faktor dreieinhalb darin, wie viel Ausgabe man in einem einzigen Aufruf erzeugen darf: GPT-6 Sol begrenzt auf 128.000 Token, während Grok 4.7 – SpaceXAIs Flaggschiff, veröffentlicht am 21. September 2026 als Nachfolger von Grok 4.6 – bis zu 450.000 geht.
Alles andere in diesem Vergleich ergibt sich aus diesen beiden Tatsachen, plus einer weiteren: GPT-6 Sol hat das größere Kontextfenster – 1.050.000 Tokens gegenüber 500.000 bei Grok 4.7. Es geht also nicht um die Frage, welches Modell besser ist. Es geht um zwei Modelle mit unterschiedlichen Formen und darum, welche Form Ihre Arbeitslast hat.
Bringen Sie zuerst die Form Ihrer Anfrage in Ordnung.
Die nützliche Art, eine Entscheidung zwischen GPT-6 und Grok 4.7 einzuordnen, richtet sich danach, welche Ressource Ihr Job tatsächlich verbraucht. Drei Fälle decken den größten Teil des Produktionsverkehrs ab.
Lange Eingabe, kurze Ausgabe. Sie speisen ein großes Dokument, eine Codebasis oder ein langes Agenten-Transkript ein und bekommen eine Zusammenfassung, einen Diff oder eine Entscheidung zurück. Hier ist das Kontextfenster der limitierende Faktor, und GPT-6 Sols 1.050.000 Token sind ungefähr doppelt so viele wie die 500.000 von Grok 4.7. Beachten Sie jedoch die Tarifgrenze auf beiden Karten: Grok 4.7s Tarif von 2,00 $ gilt bis zu 200.000 Eingabe-Token und steigt danach auf 4,00 $, während GPT-6 Sols Tarif von 2,00 $ bis 272.000 gilt und danach auf 4,00 $ steigt. Bei 200.001 Token hat Grok den Preis bereits angepasst und GPT-6 Sol noch nicht, sodass ein Dokument mit 250.000 Token auf Grok 4.7 4,00 $ pro Million kostet und auf GPT-6 Sol 2,00 $ pro Million — doppelt so teuer, bevor Sie die Ausgabe mitzählen.
Kurze Eingabe, lange Ausgabe.Sie generieren: ein Langform-Dokument, eine große Codedatei, ein strukturiertes Artefakt oder eine Kette von Tool-Aufrufen, deren Ergebnisse das Modell ausschreiben muss. Das ist der Anwendungsfall, für den Grok 4.7 gebaut wurde. Eine Ausgabegrenze von 450.000 Tokens liegt mehr als eine Größenordnung über dem, was die meisten Modelle zulassen, und bei 6,00 $ pro Million Ausgabe gegenüber 10,00 $ zahlen Sie für jedes dieser Tokens 40 % weniger. Wenn Ihre Generierung routinemäßig über 128.000 Ausgabe-Tokens hinausläuft, kann GPT-6 Sol die Anfrage nicht einmal in einem einzigen Aufruf bedienen, und Grok 4.7 kann es.
Ausgewogen und bei beidem stark. Lange Eingabe und lange Ausgabe zusammen sind der Fall, in dem die beiden Karten interagieren. Eine Eingabe von 400.000 Tokens mit einer Ausgabe von 200.000 Tokens wird bei Grok 4.7 mit 4,00 $ Eingabe und 12,00 $ Ausgabe berechnet (beides über seinem Schwellenwert) und bei GPT-6 Sol mit 4,00 $ Eingabe und 15,00 $ Ausgabe. Das ist die einzige Konfiguration, in der GPT-6 Sol das teurere Modell pro Token ist, und es lohnt sich, die eigenen Durchschnittswerte damit abzugleichen, bevor man annimmt, dass der Standard aus der ChatGPT-Ära günstiger ist.
Was OpenAI geändert hat und warum es hier wichtig ist
GPT-6 ist eine Familie aus drei Modellen, und am 7. Oktober 2026 stellte OpenAI das mittlere der Öffentlichkeit vor. GPT-6 in ChatGPT – der Rollout der Intelligent UI – wird für Plus, Pro, Business und Enterprise von GPT-6 Sol angetrieben und für Free und Go von GPT-6 Luna, womit mehr als 1,2 Milliarden Menschen erreicht werden, die ChatGPT wöchentlich nutzen. Das ist eher eine Verbreitungs- als eine Fähigkeitstatsache, und es verändert, was „GPT-6“ in einem Vergleich bedeutet: Wenn jemand sagt, GPT-6 habe bei irgendeinem Benchmark ein anderes Modell geschlagen oder gegen es verloren, meint er normalerweise speziell GPT-6 Sol oder das Flaggschiff GPT-6 Astra zu $10.00 / $50.00.
Für dieses Matchup ist der ChatGPT-Rollout in einer konkreten Hinsicht relevant. Grok 4.7 wurde am 21. September 2026 veröffentlicht, vier Tage vor GPT-6 Sol, und es ist ein reines API- und App-Modell ohne entsprechendes Consumer-Standardangebot für Milliarden von Nutzern. SpaceXAIs eigene Beschreibung davon ist eng und spezifisch: ein Flaggschiff für langlaufende Softwareentwicklung, agentische Workflows mit Tool-Nutzung und Selbstverifikation sowie Wissensarbeit. Das ist eine Aussage über output-lastige Arbeit, genau die Form, in der Groks Karte stärker ist.
Die Anzeigetafel, ehrlich beschriftet
Unabhängige Bewertung dieser beiden stammt von Artificial Analysis, und die Zusammenfassung ist, dass sie beim zusammengesetzten Index nahe beieinanderliegen und bei den Einzeltests in einer Weise auseinandergehen, die zu den Produkten passt.
• AA Intelligence Index: Grok 4.7 46,4 (Rang 16 der Modelle, die er bewertet), GPT-6 Sol 47,6 — GPT-6 Sol liegt um etwa einen Punkt vorn
• Humanity's Last Exam: Grok 4.7 43,1 %, GPT-6 Sol 47,9 %
• SciCode: Grok 4.7 57,4 %, GPT-6 Sol 57,6 % — praktisch gleichauf
• Long-Context Recall: Grok 4.7 76,7 %, GPT-6 Sol 83,7 % — GPT-6 Sol liegt vorn, konsistent mit dem größeren Fenster
• Terminal-Bench (v4.0 auf Groks Model-Card): Grok 4.7 25,8 %, GPT-6 Sol 43,9 % in derselben Harness-Familie
• Coding: Grok 4.7 landet im obersten Dezil des Coding-Index, in der Gesellschaft der stärksten Modelle auf dem Board
Zwei Einschränkungen, und sie sind nicht bloß schmückendes Beiwerk. Die Indexwerte für die beiden Modelle wurden an unterschiedlichen Daten ermittelt, daher ist dies kein direkter Vergleich am selben Tag, und ein Unterschied von einem Punkt liegt innerhalb der Schwankung, die eine Revision erzeugt. Und jede oben genannte Grok-4.7-Zahl ist die vom Anbieter selbst veröffentlichte Zahl, wie sie im Katalog geführt wird, kein Wert, den wir erneut berechnet haben – die ehrliche Lesart ist, dass Grok 4.7 ein Coding-Modell im obersten Dezil ist, das bei einem allgemeinen Reasoning-Kompositwert etwa ein Punkt hinter GPT-6 Sol liegt, und dass die Lücke bei terminal-bench das größte einzelne Signal im Set ist.

Latenz und Zuverlässigkeit, die das Datenblatt verschweigt.
Veröffentlichte Tarifkarten und Benchmark-Tabellen lassen beide genau das weg, was die Servicequalität im Produktivbetrieb bestimmt; deshalb lohnt es sich, die gemessenen Zahlen statt der Marketing-Zahlen zu betrachten.
Bei OrcaRouters eigenen Playground-Messungen in der ersten Oktoberwoche 2026 ergab Grok 4.7 eine mediane First-Token-Latenz von 3.825 ms und erzeugte Ausgaben mit etwa 147 Tokens pro Sekunde, bei einer Fehlerquote von rund 8 %. Die gemessene mediane Latenz von GPT-6 Sol im selben Zeitfenster war höher – 6.363 ms – bei einer deutlich höheren Fehlerquote. Dies sind Playground-Beobachtungen auf einer gemeinsam genutzten Route, kein Anbieter-SLA, und eine Fehlerquote von 39 % auf der Route eines Modells ist ein Routing-Problem und kein Modellproblem; genau diese Art von Lücke soll Failover abdecken. Der Punkt für einen Vergleich ist, dass eine Grok-4.7-Route in diesem speziellen Zeitfenster wesentlich reaktionsschneller und zuverlässiger wirkte als eine GPT-6-Sol-Route und dass die veröffentlichte Modellkarte keines der beiden Anbieter Ihnen das verraten hätte.
Beide betreiben, ohne sich auf eines von beiden festzulegen.
Die Versuchung bei einem derart knappen Vergleich besteht darin, sich im Voraus nach dem Preis für eines zu entscheiden und drei Monate später festzustellen, dass sich die Struktur Ihres Traffics verändert hat. Genau dieses Problem löst Routing. Auf OrcaRouter sind sowohl grok/grok-4.7 als auch GPT-6 Sol live verfügbare Routen im selben Katalog hinter einer einzigen API, zum Listenpreis des Anbieters mit 0 % Aufschlag — wenn SpaceXAI oder OpenAI also einen Tarif ändert, ist die Änderung noch am selben Tag live und nicht erst bei Ihrer nächsten Rechnungsabstimmung. Automatisches Failover über Anbieter hinweg deckt den Fall ab, dass eine Route schlechter wird, was angesichts der oben genannten Fehlerraten-Spanne unmittelbar relevant ist. Und die Routing-DSL lässt Sie Traffic nach der Form der Anfrage statt nach Modellpräferenz aufteilen: Schicken Sie Arbeit mit langem Input und kurzem Output an das Modell mit dem größeren Kontextfenster, schicken Sie Generierungen mit langem Output an das mit der 450K-Obergrenze und dem günstigeren Output-Preis, und lassen Sie ein Prädikat für die Anfragegröße die Auswahl treffen statt einen Menschen.
Wählen
Wenn es bei Ihrer Arbeit um Langdokumentanalyse, Reasoning mit großem Kontext oder irgendetwas geht, das über 200.000 Eingabe-Tokens liegt, ist GPT-6 Sol die bessere Karte: doppelter Kontext, ein höherer unabhängiger Index und eine Schwelle, die um 72.000 Tokens weiter draußen liegt. Wenn es bei Ihrer Arbeit um Generierung geht – lange Code-Artefakte, Longform-Texte, lange Tool-Calling-Ketten, in denen das Modell aufschreiben muss, was es gefunden hat –, ist Grok 4.7 die bessere Karte: eine Ausgabeobergrenze von 450.000 Tokens, die GPT-6 Sol nicht erreichen kann, 40 % günstigere Ausgabe-Tokens und ein Coding-Profil im obersten Dezil, das mithalten kann. Wenn Sie wirklich beides machen, ist die Antwort kein Modell. Sie ist eine Route.


In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
