Eine generierte Hero-Karte für einen Vergleich von GPT-6.1 Sol gegen Grok 4.7, mit der Überschrift „40 % günstiger pro Token, 5,2-fache Rechnung“, drei Badges mit den Aufschriften „Grok 4.7 Ausgabe: 6,00 $ pro 1 Mio.“, „GPT-6.1 Sol Ausgabe: 10,00 $ pro 1 Mio.“ und „Output-Token beim Index-Lauf: 67 Mio. vs. 240 Mio.“ sowie dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

GPT-6.1 Sol vs. Grok 4.7: Die günstigste Ausgaberate im Raum und die teuerste Konversation

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Grok 4.7, der Nachfolger von Grok 4.6 bei xAI, erschien am 21. September 2026 zu 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens. GPT-6.1 Sol, die Mittelklasse-Aktualisierung von OpenAI, erschien acht Tage später am 29. September zu 2,00 $ für Eingabe und 10,00 $ für Ausgabe. Die Eingabe-Preise sind identisch, der Ausgabe-Preis ist bei Grok 4.7 um 40 % günstiger, und genau dort enden die meisten Vergleiche. Es ist der falsche Ort, um aufzuhören, denn dasselbe unabhängige Gremium hat nun beide Modelle Ende-zu-Ende gemessen: Grok 4.7 verbrauchte rund 240 Millionen Ausgabe-Tokens beim Absolvieren des Artificial Analysis Intelligence Index; GPT-6.1 Sol verbrauchte 67 Millionen. Multipliziert man den günstigeren Preis mit der dreieinhalbfachen Menge, kostet das Modell mit dem niedrigeren Preis pro Token 3,74 $ pro abgeschlossener Aufgabe gegenüber 0,72 $.

Zwei Modelle, acht Tage auseinander, und eine Preisliste, die sich umkehrt

Grok 4.7 ist xAIs stärkstes Modell für Coding und Wissensarbeit: ein Kontextfenster von 500.000 Token, laut der eigenen Auflistung des Anbieters bis zu 450.000 Ausgabe-Token in einer einzigen Antwort, Text-, Bild- und Dateieingabe sowie eine Reasoning-Stufe, die sich über low, medium (Standard), high und xhigh konfigurieren lässt. xAI hat keine Parameteranzahl offengelegt, und als Pretraining-Cutoff wird Juni 2026 genannt, mit ergänzendem Training bis August.

GPT-6.1 Sol ist OpenAIs Aktualisierung des GPT-6-Sol-Tiers um eine Stufe, angesiedelt unterhalb von GPT-6 Astra und oberhalb von GPT-6 Luna: 1.050.000 Token Kontext – rund doppelt so viel wie bei Grok – mit einer Obergrenze von 128.000 Token für die Ausgabe, etwa ein Drittel von der von Grok, einem Wissensstichtag vom 30. April 2026 und denselben Text-, Bild- und Datei-Eingaben. Seine Reasoning-Leiter reicht low bis max mit einem Standardwert von medium, und none akzeptiert es überhaupt nicht mehr.

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe — GPT-6.1 Sol $2,00 pro 1 Mio. vs. Grok 4.7 $2,00 pro 1 Mio.; identisch
• Ausgabe — GPT-6.1 Sol $10,00 pro 1 Mio. vs. Grok 4.7 $6,00 pro 1 Mio.; Grok ist 40 % günstiger
• Zwischengespeicherte Eingabe — GPT-6.1 Sol $0,10 pro 1 Mio. vs. Grok 4.7 $0,50 pro 1 Mio.; Sol ist fünfmal günstiger, das Gegenteil dessen, was die Ausgabezeile nahelegt
• Kontextfenster — 1.050.000 Tokens vs. 500.000
• Maximale Ausgabe in einer Antwort — 128.000 Tokens vs. 450.000 angegeben
• Langkontext-Stufe — oberhalb von 272.000 Eingabe-Tokens wird die gesamte Anfrage neu bepreist, mit 2× Eingabe und Cache sowie 1,5× Ausgabe vs. oberhalb von 200.000 Eingabe-Tokens wird jeder Tarif verdoppelt, ebenfalls für die gesamte Anfrage
• Reasoning-Aufwand — niedrig, mittel (Standard), hoch, xhigh, max vs. niedrig, mittel (Standard), hoch, xhigh
• Gewichte und Parameter — geschlossen, nicht offengelegt vs. geschlossen, nicht offengelegt; keines von beiden liefert dir einen Checkpoint
• Intelligence Index bei maximal veröffentlichtem Aufwand — GPT-6.1 Sol 51,8 bei max vs. Grok 4.7 46,4 bei xhigh
• Kosten pro Index-Aufgabe, unabhängig — $0,72 vs. $3,74
• Ausgabe-Tokens beim Index-Lauf — 67 Millionen vs. 240 Millionen, gegenüber einem Board-Median nahe 81 Millionen

Zwei Zeilen in dieser Liste sind der ganze Vergleich. Grok 4.7s Ausgaberate ist tatsächlich niedriger, und seine Cache-Zeile ist tatsächlich fünfmal höher; und es generierte dreieinhalb Mal so viele Tokens, um gemessen zu werden. Die Tarifkarte, für sich allein gelesen, weist in eine Richtung. Die Messung weist in die andere, um den Faktor fünf.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Wo Grok 4.7 tatsächlich vorne liegt

Es wäre unehrlich, diesen Artikel als einen Kantersieg darzustellen, denn Grok 4.7 gewinnt bei echten Evaluierungen. Seite an Seite bewertet bei maximal veröffentlichtem Aufwand auf Artificial Analysis v4.3.2 — Grok bei xhigh, Sol bei max, ein Konfigurationsunterschied, den man durchweg im Hinterkopf behalten sollte:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 vs. GPT-6.1 Sol Elo 1575,1. Ein Vorsprung von 140 Elo-Punkten bei wirtschaftlich wertvoller Wissensarbeit und der größte einzelne unabhängige Sieg für das Modell mit der günstigeren Preisliste.
• AutomationBench-AA — Grok 4.7 0,6556 vs. GPT-6.1 Sol 0,6487. Effektiv ein Unentschieden, nominell für Grok.
• SciCode — Grok 4.7 0,5741 vs. GPT-6.1 Sol 0,5417. Ein Vorsprung von 3,2 Punkten beim wissenschaftlichen Programmieren.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 vs. GPT-6.1 Sol 0,5606. Ein Defizit von 30 Punkten und die größte Lücke in dieser Paarung.
• Humanity's Last Exam — Grok 4.7 0,4314 vs. GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, Langkontext-Reasoning — Grok 4.7 0,7667 vs. GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 vs. GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 vs. GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 vs. GPT-6.1 Sol 0,3171.

Drei von neun Bewertungen gehen an Grok 4.7 oder enden unentschieden, einschließlich derjenigen, gegen die am schwersten zu argumentieren ist: GDPval-AA ist darauf ausgelegt, wirtschaftlich wertvolle professionelle Arbeit zu bewerten, und ein Elo-Vorsprung von 140 Punkten ist kein Rauschen. Wenn Ihre Arbeitslast der Art entspricht, die GDPval repräsentieren soll — dokumentenlastige Analyse, professionelle Ergebnisse, Ermessensentscheidungen mit einer richtigen Antwort —, dann ist das Modell mit der günstigeren Preisliste auch das bessere Modell auf dem neutralen Board, und die Kosten-pro-Aufgabe-Strafe ist das, was Sie dafür zahlen.

Die eigenen Launch-Zahlen von x​AI sind groß und, wie alle Hersteller-Launch-Zahlen, nicht reproduziert. CursorBench 4.0 bei 46,3 % bei xhigh gegen die 40,4 % von Grok 4.6; Terminal-Bench 4.0 bei 38,0 % gegen 20,3 %, der größte einzelne angegebene Zugewinn im Release; DeepSWE v1.1 bei 71,0 % bei high gegen 65,2 %; EEBench bei 64,0 % gegen 53,0 %. Dabei handelt es sich um x​AIs Harness, x​AIs Einstellungen und x​AIs Reporting — und man beachte, dass die 38,0-%-Angabe zu Terminal-Bench 4.0 dem Wert 0,2576 des unabhängigen Boards für dasselbe Modell im selben Benchmark gegenübersteht, was genau die Art von Abweichung ist, die man zwischen einer abgestimmten Konfiguration eines Anbieters und einem neutralen Lauf mit maximalem Aufwand erwarten sollte.

Die Zahlen von Open​AI für GPT-6.1 Sol verdienen denselben Abschlag und haben dieselbe Schwäche. Bei der einzigen Zahl in diesem Vergleich, die keiner der beiden Anbieter geliefert hat, handelt es sich um die Kosten pro abgeschlossener Aufgabe; denn sie werden aus gemessenem Tokenverbrauch berechnet und nicht aus einer Punktetabelle. Das ist die Zahl, die Bestand hat.

Warum 240 Millionen Tokens den Ausschlag geben

Artificial Analysis beschreibt die Ausführlichkeit von Grok 4.7 in seiner eigenen Zusammenfassung, und die Token-Zahl hinter dem Index-Lauf ist der Beleg: 240 Millionen Output-Tokens gegenüber einem Board-Median von knapp 81 Millionen, etwa dreimal so viel, wie ein typisches Modell in derselben Suite produziert. Die 67 Millionen von GPT-6.1 Sol liegen deutlich unter dem Median. Fasst man die beiden Verhältnisse zusammen – 3,6-faches Volumen bei 0,6-fachem Preis –, erkauft der günstigere Output-Tarif mehr Tokens statt einer kleineren Rechnung, und genau so sieht ein Kosten-pro-Aufgabe-Unterschied von $3.74 gegenüber $0.72 aus.

Caching ändert die Größe des Effekts, aber nicht seine Richtung, und genau das ist das Detail, das die Leute aus dem Tritt bringt. Der gecachte Input von Grok 4.7 kostet $0.50 pro Million gegenüber $0.10 bei Sol — fünfmal teurer in der Zeile, in der lange Agenten-Historien und wiederholte System-Prompts liegen. Eine Workload, die vom erneuten Lesen eines großen, stabilen Präfixes dominiert wird, sieht die beiden Modelle daher näher beieinander, als $6 gegenüber $10 vermuten lassen, und sobald Groks Ausführlichkeit obendrauf kommt, weiter auseinander, als die Input-Raten vermuten lassen. Die Cache-Zeile und die Token-Zeile weisen hier in dieselbe Richtung, was ungewöhnlich ist und diese Paarung sauberer macht, als die Preislisten nahelegen.

Die Long-Context-Klauseln sollten separat bepreist werden, weil sie an unterschiedlichen Punkten greifen. GPT-6.1 Sol berechnet eine gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens neu; Grok 4.7 macht dasselbe oberhalb von 200.000. Bei einem Aufruf mit 250.000 Tokens hat Grok bereits verdoppelt – 4,00 $ und 12,00 $ mit einem Cache-Lesevorgang von 1,00 $ –, während Sol noch bei seinen Standardwerten von 2,00 $ und 10,00 $ liegt. Zwischen 200.000 und 272.000 Tokens ist das Modell mit der günstigeren Preisliste das deutlich teurere, und dieses Band ist bei Dokumentenarbeit üblich.

Wo Grok wirklich bei der Struktur und nicht bei der Punktzahl gewinnt, ist die Ausgabeobergrenze. Eine maximale Antwort von 450.000 Token gegenüber 128.000 bei Sol ist eine andere Klasse von Artefakt: eine komplette generierte Codebasis, ein langes Transkript, eine buchlange Synthese in einem einzigen Aufruf. Wenn Sie heute an Ausgabegrenzen stoßen, entscheidet diese Zeile den Vergleich, und nichts in der obigen Kostenrechnung trifft zu — Sie können eine Fähigkeit, die das andere Modell nicht hat, zu keinem Preis kaufen.

Beide liegen auf einer Taste, was der nützliche Teil ist.

Grok 4.7 läuft auf OrcaRouter zu x​AIs eigenem Listenpreis — 2,00 $ und 6,00 $ pro Million Tokens mit 0,50 $ für Cache-Lesevorgänge und der 200.000-Token-Stufe zu 4,00 $ und 12,00 $, exakt so durchgereicht, wie x​AI es ausweist — und GPT-6.1 Sol ist am Veröffentlichungstag zu Open​AIs Preis auf unseren Routen gelandet, 2,00 $ und 10,00 $ mit gecachtem Input zu 0,10 $ und der 272.000-Token-Stufe unverändert. Bei keinem der beiden wird etwas aufgeschlagen: Die Plattform reicht die Listenpreise der Anbieter durch, statt sie mit einem Aufschlag zu versehen, was bedeutet, dass eine Preissenkung eines Anbieters auf einer der beiden Seiten hier am selben Tag gilt, an dem sie dort gilt — ohne zweite Rechnung und ohne Zwischenhändler dazwischen.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

In diesem konkreten Fall ist das mehr wert als Bequemlichkeit. Die beiden Modelle sind sich uneinig darüber, worin sie gut sind — Grok 4.7 führt beim Professional-Work-Elo und beim wissenschaftlichen Coding, GPT-6.1 Sol führt bei Terminal-Ausführung, Faktenzuverlässigkeit und Long-Context-Retrieval — und die Grenze zwischen diesen Workloads ist in Ihrem eigenen Traffic sichtbar, bevor sie in einem Benchmark sichtbar ist. GDPval-förmige Anfragen in die eine Richtung und langhorizontige Agent-Läufe in die andere zu schicken, hinter einem einzigen Endpunkt, mit automatischem Failover über beide hinweg und einer Routing-Regel, die Sie in der Konfiguration statt in einem Deployment ändern, ist ein billigerer Weg, diese Grenze zu finden, als ein Evaluierungsprojekt. Model Fusion, bei der ein Gremium von Modellen gemeinsam antwortet, ist die andere Option, die die Plattform bietet, wenn Sie lieber gar nicht pro Anfrage wählen möchten.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

Der Anruf.

• Agentische und Terminal-Arbeit mit langen Ausgaben, Schleifen mit zwischengespeichertem Präfix — GPT-6.1 Sol. Dreißig Punkte auf Terminal-Bench 4.0, eine Cache-Zeile fünfmal günstiger und ein Fünftel der Kosten pro abgeschlossener Aufgabe.
• Professionelle Wissensarbeit, Dokumentenanalyse, Beurteilungsaufgaben — Grok 4.7 dank eines 140-Punkte-Vorsprungs beim GDPval-AA-Elo, wobei die Token-Rechnung budgetiert statt angenommen wird.
• Wissenschaftliches Programmieren — Grok 4.7, knapp, beim SciCode-Split des Boards. Vergleichen Sie es mit Ihrer eigenen Suite; 3,2 Punkte liegen innerhalb der Spanne, die ein anderes Prompt-Set verschieben kann.
• Einzelantworten über 128.000 Ausgabe-Tokens — Grok 4.7, und es gibt keine Arithmetik, die das ersetzt.
• Anfragen zwischen 200.000 und 272.000 Eingabe-Tokens — GPT-6.1 Sol, weil Grok 4.7 seine gesamte Anfrage bereits verdoppelt hat und Sol nicht.
• Möglichst günstige Konversation — keines von diesen beiden. Beide sind Modelle mit Frontier-Preisen und dem Token-Hunger von Frontier-Modellen; der Vergleich dreht sich darum, welches Ihre Aufgabe erledigt, nicht darum, welches abstrakt günstig ist.
• Wenn ein Vergleich mit „Grok ist billiger pro Token“ endet — dann hat er einen Schritt zu früh geendet. Der nächste Schritt ist die Token-Anzahl, und sie lautet 240 Millionen gegen 67.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert