Eine Hero-Titelkarte für einen Artikel, der GPT-6 Sol Pro mit Grok 4.7 vergleicht, mit der Aufschrift 'GPT-6 Sol Pro vs Grok 4.7' und dem Untertitel 'Doppelte Geschwätzigkeit, ein Drittel des Preises'.
Guides & Insights

GPT-6 Sol Pro vs. Grok 4.7: Doppelt so wortreich, ein Drittel des Preises

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die beiden günstigsten frontier-nahen Modelle des Septembers 2026 erschienen mit einem Tag Abstand, und das Interessante daran ist nicht, welches von beiden klüger ist. GPT-6 Sol — das Modell, zu dem Leute greifen, wenn sie GPT-6 Sol Pro, also dasselbe Modell, dessen reasoning.mode auf pro gesetzt ist, statt eines separaten Produkts — veröffentlicht am 22. September 2026 zu 2,00 $ pro Million Eingabe-Tokens und 10,00 $ pro Million Ausgabe-Tokens. Grok 4.7 vom Anbieter veröffentlicht am 21. September zum selben Preis von 2,00 $ für Eingabe und 6,00 $ für Ausgabe. Auf dem neutralen Test-Harness von Artificial Analysis liegen die beiden zwei Indexpunkte auseinander und etwa zwei Dollar pro abgeschlossener Aufgabe auseinander, und der Grund für diese Lücke ist nicht die Leistungsfähigkeit. Es liegt daran, wie viele Tokens jedes von beiden verbrennt, um dorthin zu gelangen.

Sol generierte 77 Millionen Ausgabe-Tokens beim Ausführen des Intelligence Index. Grok 4.7 generierte 240 Millionen. Dieses Verhältnis – etwas mehr als drei zu eins – macht den gesamten Vergleich aus und kehrt die Schlussfolgerung um, die Ihnen eine Preistabelle pro Token liefert.

Die zwei Tarifkarten und wo die günstige nicht günstig ist

Beide Anbieter veröffentlichen diese Zahlen selbst; keiner von beiden wurde unabhängig neu bepreist.

• Eingabe — GPT-6 Sol 2,00 $ pro Million Token vs. Grok 4.7 2,00 $ pro Million Token

• Ausgabe — GPT-6 Sol 10,00 $ pro Million Token vs. Grok 4.7 6,00 $ pro Million Token

• Zwischengespeicherte Eingabe – GPT-6 Sol 0,20 $ pro Million Tokens vs. Grok 4.7 0,50 $ pro Million Tokens; Sols Cache-Lesevorgang ist um den Faktor zweieinhalb günstiger, was dem Gegenteil dessen entspricht, was die beworbene Ausgaberate nahelegt

• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. Grok 4.7 500.000 Token

• Langkontext-Zuschlag — GPT-6 Sol berechnet eine Anfrage ab 272.000 Eingabe-Tokens mit dem 2-fachen Eingabe- und Cache-Tarif sowie dem 1,5-fachen Output für die gesamte Anfrage, während Grok 4.7 bei 200.000 Eingabe-Tokens jeden Tarif verdoppelt, ebenfalls für die gesamte Anfrage

• Wissens-Cutoff — GPT-6 Sol 20. April 2026 vs. Grok 4.7, ein Pretraining-Cutoff, der mit Juni 2026 angegeben wird, mit ergänzendem Training bis August

• Reasoning-Aufwand — GPT-6 Sol: keine, niedrig, mittel (Standard), hoch, xhigh, max vs. Grok 4.7: niedrig, mittel (Standard), hoch, xhigh

• Modalität — beide akzeptieren Text- und Bildeingaben und geben Text zurück

Die Cache-Lese-Zeile ist die, mit der sich ein Käufer eingehend befassen sollte. Die Ausgaberate von Grok 4.7 ist 40 % niedriger, doch sein gecachter Input ist 150 % höher, und gecachter Input ist genau dort, wo lange Agent-Historien und wiederholte System-Prompts liegen. Eine Workload, die überwiegend einen großen, stabilen Kontext erneut liest, wird die beiden Modelle viel näher beieinanderfinden, als es $6 gegenüber $10 nahelegt.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Die unabhängige Aufzeichnung und die eine Zahl, die darüber entscheidet

Artificial Analysis ist die einzige Testumgebung, die beide Modelle gemessen hat, und es lohnt sich, die Zahlen nebeneinanderzustellen, weil die Abweichung aufschlussreich ist.

• Intelligence Index — GPT-6 Sol 48 bei maximalem Aufwand vs. Grok 4.7 46 bei xhigh; beide deutlich über dem Median vergleichbarer Modelle von 25

• Kosten pro Index-Aufgabe — GPT-6 Sol 1,06 $ vs. Grok 4.7 3,74 $

• Ausgabe-Tokens für den Index-Lauf — GPT-6 Sol 77M vs. Grok 4.7 240M, gegenüber einem Median von 88M

• Ausgabegeschwindigkeit — Grok 4.7 mit 39 Tokens pro Sekunde gemessen, was das Harness selbst als auffallend langsam einstuft; Sols Wert auf derselben Rangliste wird in derselben Übersichtszeile nicht angegeben

• Coding-Agent-Index — GPT-6 Sol 57 bei 2,99 $ pro Aufgabe vs. Grok 4.7 56 mit seinem First-Party-Harness Grok Build, neun Punkte mehr als Grok 4.6

Zwei Punkte Indexunterschied, dreieinhalb Mal die Kosten pro Aufgabe. Das ist keine Preis-Anomalie – es ist die Arithmetik der Weitschweifigkeit. Grok 4.7 ist ein Modell, das ausgiebig laut denkt; der Harness stuft es als „sehr wortreich“ gegenüber einem Median von 88 Mio. Tokens ein, und die Kosten folgen den Tokens, nicht der Preisliste.

Der Coding-Agent-Vergleich birgt einen Vorbehalt, den die Rangliste verbirgt. Die 56 von Grok 4.7 wird im eigenen Grok-Build-Harness von xAI gemessen, der Konfiguration, die xAI ausliefert und gegen die sie benchmarkt. Die 57 von Sol wird in einem neutralen Harness gemessen. Ein First-Party-Harness-Vorteil von ein bis zwei Punkten liegt problemlos innerhalb des Bereichs, den die Wahl des Harness erklärt, was bedeutet, dass die ehrliche Lesart ist, dass diese beiden beim agentischen Coding gleichauf liegen – nicht, dass Sol einen Punkt voraus ist.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Was jeder Anbieter behauptet – und was keiner von beiden gezeigt hat

Das Launch-Material von xAI ist konkret und erzählt eine Geschichte mit langem Zeithorizont: Grok 4.7 basiert auf einem größeren Basismodell als Grok 4.6 und erhielt einen längeren Reinforcement-Learning-Durchlauf, der auf Aufgaben ausgerichtet war, die „Stunden dauern können“, wodurch Selbstverifikation, der Umgang mit langem Kontext und das Verhalten innerhalb der Grok-Bot-Umgebung geschärft wurden. Zu den vom Anbieter gemeldeten Zahlen gehören Terminal-Bench 4.0 mit 38,0 % gegenüber 20,3 % bei Grok 4.6, CursorBench 4.0 mit 46,3 % und DeepSWE v1.1 mit 71,0 %. Jede einzelne davon ist eine Messung von xAI selbst, und keine wurde unabhängig reproduziert; die kursierende unabhängige Terminal-Bench-4.0-Zahl ist deutlich niedriger als die des Anbieters, was die übliche Ausprägung dieser Lücke ist.

OpenAIs Angaben zu GPT-6 Sol sind die bereits oben genannten, und sie tragen dieselbe Kennzeichnung. Die vom Anbieter gemeldeten Werte liegen bei 33,2 % auf AutomationBench mit xhigh-Aufwand gegenüber Claude Opus 5 mit 26,9 % bei max, bei ungefähr 9 % der Kosten pro Aufgabe, und bei 68,8 % auf DeepSWE v1.1 mit max-Aufwand – innerhalb von 1,1 Punkten von Claude Fable 5 bei xhigh, bei etwa 80 % niedrigeren Kosten pro Aufgabe. Beachten Sie das Vergleichsziel: OpenAIs eigene Diagramme stellen Sol gegen Anthropic-Modelle, nicht gegen Grok 4.7. Keiner der beiden Anbieter hat einen Direktvergleich gegen den anderen veröffentlicht.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Wo sich die Routing-Schicht ihren Platz verdient

OrcaRouter führt keines der beiden Modelle in diesem Duell — Grok 4.7 und GPT-6 Sol fehlen beide in unserem Katalog, es handelt sich hier also um keine Aussage über ihren Preis bei uns. Was eine Routing-Schicht in dieser speziellen Paarung wert ist, ist der Fehlermodus und nicht die Preisliste. Der Grund, zu Grok 4.7 zu greifen, ist sein langfristiges agentisches Verhalten; der Grund, nicht danach zu greifen, ist, dass eine Ausgabegeschwindigkeit von 39 Token pro Sekunde einen langen Agentenlauf so langsam macht, dass es ins Gewicht fällt, und ein langsamer Lauf ist ein Lauf, der in ein Timeout laufen kann. Automatisches Failover über Anbieter hinweg bedeutet, dass ein langer Auftrag an das Modell geroutet werden kann, das tatsächlich verfügbar ist, ohne dass diese Geschwindigkeit zu einem Single Point of Failure wird, und die Routing-DSL drückt die Modellwahl als Regel innerhalb des Aufrufs aus statt als Migration — was hier wichtig ist, denn die richtige Antwort für dieses Paar hängt davon ab, ob die Aufgabe tokenhungrig oder latenzempfindlich ist, und das ist eine Eigenschaft der Anfrage, nicht des Quartals.

Die Entscheidungsregel

• Agentisches Coding bei festem Budget — GPT-6 Sol. Leistungsniveau auf dem neutralen Coding-Index, zu etwa einem Drittel der Kosten pro Aufgabe, weil es mit einem Drittel der Tokens dorthin gelangt.

• Long-Horizon-Aufgaben, bei denen es genau auf die Laufdauer ankommt — Grok 4.7. Das Release wurde speziell für mehrstündige Arbeit trainiert, und die Anbieterzahlen zu SWE-Marathon und CursorBench gehen genau in diese Richtung.

• Latenzempfindliches Volumen — nach derzeitigem Stand keines von beiden. Die Kosten pro Aufgabe von Sol sind die bessere Zahl, aber die gemessenen 39 Token pro Sekunde von Grok 4.7 sind eine echte Einschränkung für alles Interaktive.

• Überwiegend gecachte Long-Context-Workloads — GPT-6 Sol, auf der Cache-Lese-Zeile statt auf der Ausgabezeile. Bei 0,20 $ gegenüber 0,50 $ pro Million gecachter Tokens und mit einem doppelt so großen Kontextfenster wird das Argument umso stärker, je mehr Ihres Prompts stabil ist.

• Wenn Ihr Vergleich auf der Preistabelle pro Token aufgebaut wurde – bauen Sie ihn auf Kosten pro Aufgabe um. 6,00 $ gegenüber 10,00 $ für die Ausgabe sind das am wenigsten aussagekräftige Zahlenpaar in diesem Artikel, und es ist das Paar, mit dem jede bestehende Seite beginnt.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert