Eine Hero-Titelkarte für einen Artikel, der GPT-6 Sol mit Grok 4.7 vergleicht, mit der Aufschrift „GPT-6 Sol vs Grok 4.7“ und dem Untertitel „Das günstigere Token, das dreimal so viel kostet“, mit der Statistik „240M vs 77M Output-Token“, wobei Grok 4.7 bei 6,00 $ Output und 3,74 $ pro Aufgabe liegt und GPT-6 Sol bei 10,00 $ Output und 1,06 $ pro Aufgabe.
Guides & Insights

GPT-6 Sol vs. Grok 4.7: Der günstigere Token, der dreimal so viel kostet

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei Modelle wurden im September 2026 mit einem Tag Abstand veröffentlicht, und auf dem Preisschild liegen sie nicht nah beieinander. Grok 4.7 erschien am 21. September für 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens. GPT-6 Sol erschien am 22. September bei denselben 2,00 $ für Eingabe und 10,00 $ für Ausgabe. Groks Ausgabe ist 40 % günstiger. Das ist die gesamte Grundlage, auf der die meisten Vergleiche es auswählen werden, und es ist die falsche Zahl, auf die man schauen sollte.

Die Zahl, die über diese Paarung entscheidet, steht auf keiner der beiden Preislisten. Es sind 240 Millionen gegen 77 Millionen – die Ausgabe-Tokens, die jedes Modell erzeugte, während Artificial Analysis seinen Intelligence Index durchführte. Grok 4.7 verbrauchte etwas mehr als dreimal so viele Tokens, um denselben Fragensatz zu beantworten. Multipliziert man das mit dem Preis pro Token, kostet das Modell mit der günstigeren Ausgabe am Ende 3,74 $ pro abgeschlossener Aufgabe gegenüber 1,06 $. Günstiger pro Token, mehr als dreimal so hohe Rechnung.

Was jedes Modell tatsächlich ist

Grok 4.7 ist der Nachfolger von Grok 4.6 von xAI und positioniert sich als sein stärkstes Coding- und Wissensarbeitsmodell, mit einem 500.000-Token-Kontextfenster, Text- und Bildeingabe, Textausgabe und Reasoning-Aufwand, der über low, medium, high und xhigh konfigurierbar ist. xAI hat keine Parameteranzahl bekannt gegeben. Es hat einen Pretraining-Cutoff, der mit Juni 2026 angegeben wird, mit ergänzendem Training bis August.

GPT-6 Sol ist das Mittelklasse-Modell von OpenAI unter den GPT-6-Modellen – unterhalb des Flaggschiffs GPT-6 Astra, oberhalb des Budgetmodells GPT-6 Luna – mit einem Kontextfenster von 1.050.000 Token, einer maximalen Eingabe von 922.000 Token, einer Ausgabeobergrenze von 128.000 Token und einem Wissensstichtag vom 20. April 2026. Es verarbeitet Text und Bilder als Eingabe und gibt Text aus, mit Reasoning-Aufwand von none bis max, und OpenAI hat seine Preisgestaltung als dauerhaft statt als Werbeaktion beschrieben.

Die Kontextfenster liegen nicht nahe beieinander. Das von Sol ist ungefähr doppelt so groß. Das ist für genau eine Klasse von Workloads relevant, und es ist nicht die Klasse, die die meisten Leute ausführen.

Die Tarifkarte und die Zeile, die sie umkehrt

• Eingabe — GPT-6 Sol 2,00 $ pro Million Token vs. Grok 4.7 2,00 $ pro Million Token; identisch

• Ausgabe — GPT-6 Sol 10,00 $ pro Million Token vs. Grok 4.7 6,00 $ pro Million Token; Grok ist 40 % günstiger

• Gecachte Eingabe — GPT-6 Sol 0,20 $ pro Million Tokens gegenüber Grok 4.7 0,50 $ pro Million Tokens; der Cache-Lesevorgang von Sol ist um den Faktor zweieinhalb günstiger, was das Gegenteil dessen ist, was die Output-Rate impliziert

• Cache-Schreibvorgänge — GPT-6 Sol 2,50 $ pro Million Token vs. Grok 4.7, ein Tarif, der nicht auf derselben Tabelle veröffentlicht ist

• Kontextfenster — GPT-6 Sol 1.050.000 Token vs. Grok 4.7 500.000 Token

• Langkontext-Zuschlag — GPT-6 Sol berechnet eine Anfrage ab 272.000 Eingabe-Tokens mit dem 2-fachen Eingabe- und Cache-Tarif sowie dem 1,5-fachen Output für die gesamte Anfrage, während Grok 4.7 bei 200.000 Eingabe-Tokens jeden Tarif verdoppelt, ebenfalls für die gesamte Anfrage

• Wissens-Cutoff — GPT-6 Sol 20. April 2026 vs. Grok 4.7, ein Pretraining-Cutoff, der mit Juni 2026 angegeben wird, mit ergänzendem Training bis August

• Reasoning-Aufwand — GPT-6 Sol: keine, niedrig, mittel (Standard), hoch, xhigh, max vs. Grok 4.7: niedrig, mittel (Standard), hoch, xhigh

• Modalität — Text und Bild als Eingabe, Text als Ausgabe, für beide

Die Cache-Zeile ist die, mit der sich ein Käufer beschäftigen sollte. Groks Output-Rate ist niedriger, doch sein gecachter Input ist zweieinhalbmal so teuer wie der von Sol, und gecachter Input ist der Ort, an dem lange Agenten-Historien und wiederholte System-Prompts zu Hause sind. Eine Workload, die überwiegend einen großen, stabilen Kontext erneut liest, wird die beiden viel näher beieinander finden, als $6 gegenüber $10 vermuten lässt – und sobald man zusätzlich das Token-Volumen-Verhältnis anwendet, kehrt sich die Reihenfolge um.

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

Warum 240 Millionen Tokens die ganze Geschichte ist

Artificial Analysis hat Grok 4.7 bei xhigh gemessen: Über seinen Index-Lauf hinweg generierte das Modell rund 240 Millionen Ausgabe-Tokens, verglichen mit einem Median von etwa 88 Millionen für die Modelle auf demselben Board. In der eigenen Zusammenfassung wird das Modell als „auffallend langsam und sehr wortreich“ bezeichnet. GPT-6 Sol generierte, mit demselben Harness gemessen, 77 Millionen – auf dem Board als „ziemlich prägnant“ beschrieben.

Das Board berichtet außerdem direkt über die Konsequenz. Grok 4.7 erreicht 46 Punkte im Intelligence Index bei 3,74 US-Dollar pro Aufgabe. In seiner hohen Einstellung liegt der Wert ebenfalls bei 46 und die Kosten betragen 2,73 US-Dollar pro Aufgabe. GPT-6 Sol erreicht 48 Punkte bei 1,06 US-Dollar pro Aufgabe. Derselbe Index, dieselbe Testumgebung und ein zwei- bis dreieinhalbfacher Kostenunterschied, den keine Preisliste ausweist.

Zwei Warnhinweise, bevor Sie diese Zahlen als sauberen direkten Vergleich betrachten. Die beiden Seiten wurden am selben Tag erfasst, aber die Leaderboards weisen unterschiedliche Gesamtzahlen auf – Groks Seite zeigt eine Klasse mit 212 Modellen, und eine separate Grok-Auflistung nennt einen Rang aus 655 –, sodass die beiden Werte nicht garantiert auf demselben Index-Build basieren. Und keine der beiden Zahlen ist eine Anbieterangabe: Artificial Analysis betreibt einen eigenen Testaufbau, was ja der Punkt ist, doch die Reasoning-Einstellungen unterscheiden sich zwischen den beiden Auflistungen (xhigh für Grok, max für Sol). Betrachten Sie daher die Kostendifferenz von fünfhundert Prozent als den Befund und die Indexdifferenz von zwei Punkten als ungefähr.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

Was xAI veröffentlicht hat und was niemand überprüft hat

xAIs eigene Launch-Zahlen sind stark und, wie alle Launch-Zahlen von Anbietern, nicht reproduziert. CursorBench 4.0 mit 46,3 % bei xhigh gegenüber 40,4 % von Grok 4.6. Terminal-Bench 4.0 mit 38,0 % gegenüber 20,3 % – der größte Einzelzuwachs des Releases. DeepSWE v1.1 mit 71,0 % bei high gegenüber 65,2 %. EEBench mit 64,0 % gegenüber 53,0 %. Das sind xAIs Testumgebung, xAIs Einstellungen, xAIs Berichterstattung.

Die Zahlen von OpenAI für GPT-6 Sol folgen demselben Muster und verdienen denselben Abschlag. Der Unterschied ist, dass Sol einen weiteren unabhängigen Beleg hat als Grok: die Kosten-pro-Aufgabe-Zahl von Artificial Analysis, die aus gemessenem Tokenverbrauch berechnet wird und nicht aus der Punktetabelle eines Anbieters. Das ist die Zahl, die diesen Vergleich übersteht.

Was niemand für eines der beiden Modelle veröffentlicht hat, ist ein Head-to-Head-Vergleich auf denselben Aufgaben mit demselben Harness und derselben Effort-Einstellung. Wenn du einen siehst, prüfe, welche dieser drei Variablen sich geändert hat.

Preisgestaltung für einen Monat gecachten Agenten-Traffic

Nehmen Sie eine Workload, die überwiegend aus stabilem Kontext besteht: einen Coding-Agenten mit einem 60.000 Token umfassenden System-Prompt und einer Repository-Zusammenfassung, die bei 5.000 Aufrufen pro Monat erneut gelesen werden, wobei jeder Aufruf 4.000 Ausgabe-Token zurückgibt. Gehen Sie davon aus, dass das Caching funktioniert und das stabile Präfix zum Cache-Tarif abgerechnet wird.

Bei GPT-6 Sol: 300 Millionen zwischengespeicherte Eingabe-Tokens zu 0,20 $ pro Million sind 60,00 $. Zwanzig Millionen Ausgabe-Tokens zu 10,00 $ pro Million sind 200,00 $. Insgesamt 260,00 $.

Bei Grok 4.7: Dieselben 300 Millionen gecachten Eingabe-Tokens zu 0,50 $ pro Million ergeben 150,00 $. Zwanzig Millionen Ausgabe-Tokens zu 6,00 $ pro Million ergeben 120,00 $. Insgesamt 270,00 $.

Nahezu identisch – und das bei konstant gehaltenem Token-Volumen, was die großzügige Annahme ist. Die gemessene Ausführlichkeit von Grok 4.7 beim Index-Lauf war dreimal so hoch wie die von Sol. Wendet man auch nur einen 1,5-fachen Multiplikator auf das Ausgabevolumen an, steigt Groks Rechnung auf 330,00 $ gegenüber Sols 320,00 $, und die Lücke wird von da an größer. Die günstigere Ausgaberate übersteht Caching plus Ausführlichkeit nicht; sie übersteht Caching allein kaum.

Nichts hier ist eine Aussage über den Preis eines der beiden Modelle über OrcaRouter – keines von beiden ist in unserem Katalog. GPT-6 Sol ist über die eigene API von OpenAI erreichbar und Grok 4.7 über die von xAI; der Rest der Grok-Reihe, einschließlich Grok 4.6, kann über uns geroutet werden zum Listenpreis von xAI im Pass-through-Modell. Der Sinn der Rechnung ist, dass die Eskalationsregel, die Sie schreiben, auf den Kosten pro abgeschlossener Aufgabe in Ihrem eigenen Traffic basieren sollte, nicht auf der Preisliste – und eine Routing-Schicht ist das, was es Ihnen ermöglicht, diese Regel ohne einen zweiten Vertrag zu testen.

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

Wo jeder Einzelne hingehört

• Agentenarbeit mit hohem Volumen und gecachtem Kontext — GPT-6 Sol. Die Zeile für gecachte Eingabe fällt 2,5× zugunsten von Sol aus, und die Zeile für Ausgabevolumen fällt noch stärker zugunsten von Grok aus als das, und sie verstärken sich gegenseitig.

• Programmierarbeit, bei der Sie die stärkste veröffentlichte Terminal-Bench-Verbesserung im Release wollen — Grok 4.7 ist das Modell mit der Zahl, und sie ist groß. Rechnen Sie einfach mit den Tokens, nicht mit der Rate.

• Lange Dokumente mit mehr als 500.000 Token – GPT-6 Sol, und das ist keine knappe Entscheidung. Groks Fenster endet dort, wo Sols erst zur Hälfte reicht.

• Latenzempfindliche Pfade — keines von beiden. Artificial Analysis listet Grok 4.7 mit 39,2 Ausgabe-Tokens pro Sekunde auf, was als auffallend langsam beschrieben wird. Prüfen Sie Sols eigenen Geschwindigkeitswert auf dem aktuellen Board, bevor Sie davon ausgehen, dass er besser ist.

• Wenn dir ein Vergleich pro Token gezeigt wurde, der mit „also ist Grok günstiger“ endet – er endete einen Schritt zu früh. Der nächste Schritt ist die Token-Anzahl.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert