
Grok 4.7 vs. Grok 4.6: Gleicher $2/$6-Preis, ein anderes Modell unter der Haube
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 1009 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
SpaceXAI lieferte Grok 4.7 am 21. September 2026 aus, und das Erste, was daran bemerkenswert ist, ist, was sich nicht geändert hat: der Preis. Grok 4.7 kostet 2 $ pro Million Eingabe-Token und 6 $ pro Million Ausgabe-Token, genau das, was Grok 4.6 seit seiner Einführung am 12. August 2026 kostet. Gleiche Preisliste, gleiches 500.000-Token-Kontextfenster, gleiche Text- und Bild-Eingabe — und doch liegen die beiden Modelle bei den Evaluierungen, die für agentische Arbeit zählen, nicht dicht beieinander. Laut den von SpaceXAI selbst veröffentlichten Zahlen verdoppelt Grok 4.7 Grok 4.6 bei Terminal-Bench 4.0 nahezu, 38,0 % gegenüber 20,3 %. Das ist die ganze Gestalt dieses Vergleichs: ein Generationswechsel zum gleichen Preis, bei dem fast der gesamte Zugewinn an einer Stelle landet, und die Teile von Grok 4.6, die Produktionsteams gestört haben, sind immer noch da.
Was hat sich tatsächlich zwischen den beiden Modellen geändert?
SpaceXAIs eigene Beschreibung der Veröffentlichung ist eng gefasst, und es lohnt sich, ihre Form statt der Adjektive zu zitieren. Grok 4.7 basiert auf einem größeren Basismodell als Grok 4.6 und erhielt einen längeren Reinforcement-Learning-Lauf, der auf Aufgaben ausgerichtet war, die „Stunden dauern können“. Das Unternehmen sagt, dieser Lauf habe drei Dinge geschärft: Selbstverifikation, den Umgang mit langem Kontext und das Verhalten innerhalb der Grok-Bot-Umgebung. Es gibt keine Behauptung über eine neue Architektur, eine neue Modalität oder einen anderen Serving-Stack.
Diese Einordnung ist wichtig, weil sie vorhersagt, wo die Benchmark-Zuwächse auftauchen, und sie tauchen genau dort auf. Ein längerer RL-Durchlauf über schwierige mehrstündige Aufgaben verbessert Terminal- und Repository-Arbeit weit stärker als ein Wissensquiz. Wenn Sie gehofft hatten, Grok 4.7 wäre ein breiteres Modell als Grok 4.6, sagen die Versionshinweise etwas anderes – es ist dieselbe Modellform, weiter in das schwierige Ende agentischer Arbeit hineintrainiert.
Die Parameter-Geschichte ist der einzige Teil davon, der keine Anbieterangabe ist. Musk sagte Anfang September, Grok 4.7 habe rund 2,1 Billionen Parameter gegenüber 1,5 Billionen bei Grok 4.6, eine Steigerung um 40 %, und diese Zahl wurde seitdem überall wiederholt. Sie ist nie auf einem Spezifikationsblatt von SpaceXAI aufgetaucht. Betrachten Sie sie als eine breit weitergegebene Behauptung über das Basismodell, nicht als bestätigte Spezifikation – und beachten Sie, dass Parameterzahlen sehr wenig über Bereitstellungskosten oder Leistungsfähigkeit aussagen, wenn die Architektur dünn besetzt ist, was bei der Grok-Reihe der Fall ist.
Die Benchmark-Lücke, mit dem angehängten Sourcing-Label
Jede Angabe in diesem Abschnitt stammt aus dem Startmaterial von SpaceXAI. Nichts davon wurde zum Zeitpunkt des Verfassens unabhängig reproduziert, und die ehrliche Art, es zu lesen, ist die als eine Reihe von Behauptungen, die zufällig ungewöhnlich spezifisch ist – was sie später überprüfbar macht, sie aber jetzt nicht als verifiziert ausweist.
• Terminal-Bench 4.0 — Grok 4.7 38,0 % (vom Anbieter angegeben) vs. Grok 4.6 20,3 %. Das größte einzelne Delta im Release und dasjenige, das zur Behauptung „längeres RL bei schwierigeren Aufgaben“ passt.
• CursorBench 4.0 — Grok 4.7 46,3 % (Anbieterangabe) vs. Grok 4.6 40,4 %. Ein echter Zugewinn, aber ein bescheidener — unter sechs Punkte, bei einem Benchmark, der näher an alltäglicher Editor-Arbeit liegt als an autonomen Terminal-Sitzungen.
• DeepSWE v1.1 — Grok 4.7 71,0 % bei hohem Reasoning-Aufwand (laut Anbieter) vs. Grok 4.6 65,2 %. Wieder eine solide, unspektakuläre Verbesserung.
• EEBench — Grok 4.7 64,0 % (Anbieterangabe). Daneben wurde kein Wert für Grok 4.6 veröffentlicht, daher sagt diese Zahl nichts über das Upgrade aus.
• AA-Briefcase v1.1 — Grok 4.7 mit 1.657 Elo (vom Anbieter angegeben), bei der Bewertung für professionelle Wissensarbeit.
Lies die Liste als Ganzes, und das Muster ist konsistent: Grok 4.7 ist deutlich besser, wo die Aufgabe lang und agentisch ist, und geringfügig besser, wo die Aufgabe kurz ist. Der Sprung bei Terminal-Bench ist ungefähr eine Verdopplung; die Zugewinne bei der Editor-Arbeit liegen im einstelligen Prozentbereich. Wenn deine Arbeitslast autocomplete-förmig ist, zahlst du dieselben 2 $/6 $ für eine kleine Verbesserung. Wenn deine Arbeitslast „zwei Stunden laufen und dann zurückkommen“ ist, richtet sich das Release direkt an dich.
Was unabhängige Messungen bisher sagen
Es gibt eine unabhängige Zahl, und es lohnt sich, sie sorgfältig zu formulieren, weil sie leicht falsch verstanden werden kann. Artificial Analysis bewertet Grok 4.7 mit 46 auf seinem Intelligence Index, Version v4.3.2, womit es in der Rangliste Platz 16 von 655 Modellen belegt. Grok 4.6 liegt auf derselben Skala bei 44. Ein Zwei-Punkte-Abstand auf einem zusammengesetzten Index ist nicht die Verdopplung, die Terminal-Bench zeigt, und diese Diskrepanz ist informativ statt widersprüchlich: Der Index kombiniert Reasoning, Wissen, Mathematik und Coding, sodass ein großer Zuwachs in einem agentischen Teilbereich durch alles verwässert wird, was das Modell nicht verändert hat.
Zwei weitere Details auf derselben Seite sind nützlicher als der Schlagzeilen-Score. Erstens: Grok 4.7 erzeugte beim Ausführen des Index 240 Millionen Ausgabe-Tokens, gegenüber einem Median von 92 Millionen – es ist ein ausführlicher Reasoner, und bei einer Ausgaberate von 6 $ pro Million ist diese Ausführlichkeit ein eigener Kostenpunkt. Zweitens: Der Composite-Wert des Index platziert es unter den stärksten Modellen seiner Preisklasse, und das ist der Vergleich, der für einen Käufer tatsächlich zählt. Artificial Analysis hat auf der Modellseite keinen ausgefüllten Preis für Grok 4.7 veröffentlicht, also übernehmen Sie die Kosten-pro-Aufgabe-Zahl nicht von dort; verwenden Sie die 2 $/6 $ des Anbieters.

Die Preisklippe, die keines der beiden Modelle beseitigte
Hier ist der Teil der Grok-4.6-Preiskarte, den Produktionsteams zu hassen lernten, und Grok 4.7 hat daran nichts geändert. Unter 200.000 Eingabe-Tokens beträgt der Tarif 2 $ für die Eingabe und 6 $ für die Ausgabe. Oberhalb dieser Grenze wird die gesamte Anfrage auf 4 $ für die Eingabe und 12 $ für die Ausgabe neu bepreist. Nicht die überschüssigen Tokens – die gesamte Anfrage. Ein Aufruf mit 210.000 Tokens kostet doppelt so viel wie ein Aufruf mit 199.000 Tokens, für 11.000 zusätzliche Tokens.
Mit einem Kontextfenster von 500.000 Tokens bei beiden Modellen ist es leicht, diese Klippe hinunterzustürzen. Langkontext-Agentenläufe und Whole-Repository-Prompts sind genau die Workloads, für die Grok 4.7 optimiert wurde, was bedeutet, dass der beste Anwendungsfall des Modells auch derjenige ist, der am ehesten die Verdopplung auslöst. Wenn Sie Arbeit auf Grok 4.7 verlagern, weil es lange agentische Sitzungen besser bewältigt, planen Sie die Neupreisgestaltung ein, bevor Sie sie verlagern, nicht danach.
Es gibt außerdem eine Geschwindigkeitsstufe, die berücksichtigt werden muss. SpaceXAI liefert eine schnelle Variante von Grok 4.7, die die Ausgabegeschwindigkeit verdoppelt und den Listenpreis verdoppelt. Das ist ein legitimer Kompromiss für interaktives Programmieren und ein schlechter für Batch-Arbeit – dieselbe Aufgabe in derselben Qualität kostet doppelt so viel für eine Einsparung bei der Wall-Clock-Zeit, die niemand im Blick hat.
Migration von Grok 4.6 ohne Rewrite
Die praktische gute Nachricht ist: Dies ist ein Modelltausch, keine Plattformmigration. Beide Modelle nehmen Text und Bilder entgegen und geben Text zurück, beide verwenden dieselben Reasoning-Effort-Stufen von low bis xhigh, und die Request-Form ist die, die SpaceXAI seit Grok 4.5 bedient. Code, der Grok 4.6 mit einem Effort-Parameter aufruft, muss nicht umstrukturiert werden, um Grok 4.7 aufzurufen.
Der Wechsel ist nicht kostenlos, was die Evaluation angeht. Die Zugewinne von Grok 4.7 konzentrieren sich auf lange agentische Läufe, daher wird eine Testsuite aus kurzen Single-Turn-Prompts Ihnen fast nichts zeigen – Sie werden die Verbesserung in der Größenordnung von CursorBench sehen und schlussfolgern, dass das Upgrade den Aufwand nicht wert war, obwohl der Fall dafür in Aufgaben steckt, die Ihre Suite nie abdeckt. Die Messgröße, die das tatsächlich entscheiden würde, ist der Aufgabenabschluss bei mehrstufiger Arbeit: akzeptierte Patches, eingeführte Regressionen, Tool-Aufrufe pro abgeschlossener Aufgabe und wie oft ein Lauf menschliche Rettung braucht. Das sind die Achsen, auf die die eigenen Zahlen des Anbieters hindeuten, und es sind diejenigen, die kein veröffentlichter Benchmark für Ihre Codebasis abdeckt.
Die Ausführlichkeit ist die zweite Messgröße. Ein Modell, das bei einem Standardindex 240 Millionen Tokens ausgibt, wird bei Ihrer Arbeitslast mehr Tokens ausgeben als sein Vorgänger, und bei 6 $ pro Million Output kann das den Wert eines Upgrades zum gleichen Preis still und leise zunichtemachen. Verfolgen Sie eine Woche lang die Output-Tokens pro abgeschlossener Aufgabe, bevor Sie sich festlegen.

Welchen anrufen?
Die Entscheidung ist wirklich einfach, was für einen Modellvergleich ungewöhnlich ist. Grok 4.6 bleibt die richtige Wahl für Traffic mit kurzen Turns und Kostenempfindlichkeit: Chat, Klassifizierung, Zusammenfassung und Code-Unterstützung im Editor-Maßstab, wo die Zugewinne von Grok 4.7 gering und seine Weitschweifigkeit eine Belastung sind. Grok 4.7 ist die richtige Wahl für die Workload, für die es gebaut wurde – langfristiges agentisches Coding und Terminal-Arbeit, bei der eine Aufgabe stundenlang läuft und die Selbstverifikation den Unterschied zwischen einem abgeschlossenen Auftrag und einem festhängenden ausmacht.
Beides laufen zu lassen ist hier kein Kompromiss, sondern die richtige Antwort, und es ist günstig umzusetzen. Grok 4.6 ist in OrcaRouters Katalog zum Listenpreis von SpaceXAI enthalten, mit 0 % Aufschlag direkt durchgereicht, sodass die oben genannte Preisliste von 2 $/6 $ genau das ist, was Sie zahlen — und da wir den Listenpreis des Anbieters durchreichen, statt ihn aufzuschlagen, ist jede Preisänderung eines Anbieters am selben Tag, an dem sie erfolgt, auch bei uns live. Ein API-Schlüssel deckt Grok 4.6 und über 200 weitere Modelle ab, sodass das Verschieben von Traffic zwischen ihnen je nach Aufgabe eine Konfigurationsänderung statt eines zweiten Vertrags ist. Wenn Sie Grok 4.7 auf einem Produktionspfad testen möchten, bevor Sie ihm vertrauen, besteht das sicherere Muster darin, den Fallback auf Grok 4.6 zu belassen — einem Modell, das Sie heute routen können — und das automatische Failover über Anbieter hinweg die Anfrage zurückverschieben zu lassen, wenn das neue Modell sich problematisch verhält.

Was als Nächstes ansehen
Zwei Dinge werden diesen Vergleich entscheiden, und keines von beiden ist bisher eingetreten. Das erste ist eine unabhängige Reproduktion des Terminal-Bench-4.0-Werts – 38 % sind ein so großer Sprung, dass jemand ihn erneut überprüfen wird, und wenn er Bestand hat, ist das Argument für Grok 4.7 in Agentic-Pipelines stark aus sachlicher Substanz und nicht aus Marketing. Das zweite ist der Rest der Grok-Roadmap: SpaceXAI hat öffentlich Grok 4.8, Grok 4.9 und Grok 5 nach diesem Release eingeordnet, und Grok 4.6 selbst war nur etwa fünf Wochen lang aktuell. Wer sich auf Grok 4.7 als langfristige Plattformannahme einlässt, würde den Fehler wiederholen, den Teams mit Grok 4.5 gemacht haben.
Fürs Erste ist das Upgrade zum gleichen Preis real, und die Richtung, in die es geht, ist klar. Die Zahl, die man sich merken sollte, ist: Für $2/$6 bekam man ein Modell, das sich bei langfristiger Terminal-Arbeit ungefähr verdoppelt und sich ansonsten kaum bewegt – und das ist eine konkrete, nützliche, überprüfbare Behauptung statt eines Generationssprungs.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
