Eine Titelkarte für den Artikel zum Erscheinungsdatum von Grok 4.7 mit dem Titel „Grok 4.7 – die Frage nach dem Erscheinungsdatum“ und dem Untertitel „Nicht veröffentlicht. Das hat xAI tatsächlich gesagt.“ sowie drei Chips: „Erstes Training abgeschlossen“, „SpaceX-Daten vorhanden“ und „Musk: 3–4 Wochen“, mit einer unteren Zeile: „~2,1T Parameter – Behauptung, nicht Spezifikation“.
Guides & Insights

Grok 4.7 erzielt 46 Punkte im Artificial Analysis Intelligence Index und bringt SpaceXAI unter die Top Vier

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Grok 4.7 erzielt 46 Punkte im Artificial Analysis Intelligence Index und bringt SpaceXAI unter die Top Vier

Grok 4.7 ist da. SpaceXAI hat es am Montag, dem 21. September 2026, veröffentlicht – zu denselben 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens wie Grok 4.6, mit demselben Kontextfenster von 500.000 Tokens, einem späteren Wissensstichtag und einer neuen obersten Reasoning-Stufe. Es ist live in Cursor und Grok Build, über die eigene API des Anbieters sowie über Coding-Harnesses, Modell-Router und Cloud-Plattformen von Drittanbietern. Grok 4.5 vom 8. Juli bleibt als günstigere Option darunter, und die Modelle, die es weiterhin schlagen muss, sind unverändert: Claude Fable 5.1, Claude Opus 5 und GPT-5.6 Sol liegen alle über ihm im v4.3.2 Intelligence Index von Artificial Analysis, wo die erste unabhängige Punktzahl von Grok 4.7 – 46 – zwei Punkte über Grok 4.6 und sieben unter Claude Fable 5.1 liegt. Auf dem AA-Briefcase-Board desselben Bewerters für langfristige Wissensarbeit landet es auf Platz vier, hinter drei Claude-Einträgen und vor Claude Opus 5 bei xhigh-Aufwand, bei etwa der Hälfte der Kosten pro Aufgabe von Claude Opus 5 – das erste unabhängige Ergebnis in dieser Veröffentlichung, das eher als Preis-Leistungs-Sieg denn als Lücke zu lesen ist. Elf Tage später hat sich das Bild eher an den Rändern als in der Mitte erweitert: Seit dem 1. Oktober wird es in Groks eigenen Web- und Mobile-Apps ausgerollt, wo die Modus-Auswahl es nun bei ihren zwei schwierigsten Einträgen aufführt, und es ist auf OrcaRouter zu SpaceXAIs eigenen 2 $/6 $ gelistet.

Das ist der Launch. Die nützlicheren Zahlen kamen am selben Tag, von dem einen Evaluator in dieser Geschichte, der nicht der Anbieter ist: Artificial Analysis veröffentlichte seinen ersten unabhängigen Durchgang zu Grok 4.7, und es ist ein dreiteiliges Ergebnis – eine 46 im Intelligence Index, die nur zwei Punkte vor Grok 4.6 liegt, eine 56 im Coding Agent Index, die neun Punkte darüber liegt, und eine 1.657 Elo auf AA-Briefcase, die 111 Punkte darüber liegt. Diese drei Zahlen weisen in unterschiedliche Richtungen, und die Spanne zwischen ihnen ist das Interessanteste an dieser Veröffentlichung. Was folgt, ist die ausgelieferte Spezifikation, die eigene Benchmark-Tabelle des Anbieters mit dem Label, das jede Zeile braucht, und dann die unabhängigen Werte, richtig gelesen – einschließlich dessen, was sie über den Bereitschaftsvorbehalt aussagen, auf den SpaceXAI nie eingegangen ist.

Was SpaceXAI am 21. September veröffentlichte

Beginnen Sie mit der Spezifikation, denn sie liegt ungewöhnlich nah an der ihres Vorgängers. Grok 4.7 hat denselben Preis wie Grok 4.6 – 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens unter 200.000 Eingabe-Tokens, steigend auf 4 $ für die Eingabe und 12 $ für die Ausgabe, sobald eine Anfrage diese Schwelle überschreitet, dieselbe Struktur, die Grok 4.6 eingeführt hat. Das Kontextfenster beträgt 500.000 Tokens. Der Wissensstichtag ist Mai 2026, drei Monate später als der von Grok 4.6, der auf den 1. Februar 2026 fällt. Der Reasoning-Aufwand erstreckt sich über vier Stufen – niedrig, mittel, hoch und xhigh – und die veröffentlichten Werte beziehen sich auf xhigh. Eine schnelle Variante läuft mit doppelter Ausgabegeschwindigkeit zum doppelten Preis.

Im Kern beschreibt xAI drei Änderungen statt einer neuen Architektur. Das Basismodell ist größer als das von Grok 4.6. Der Reinforcement-Learning-Lauf war länger und gewichtet zugunsten von Aufgaben, deren Bearbeitung viele Stunden dauert. Und das Modell wurde darauf trainiert, seine eigene Arbeit zu überprüfen und langen Kontext besser zu halten, einschließlich eines nativen Verständnisses des Grok Bot Harness. Der eigene Einzeiler des Unternehmens lautet „doppelt so schnell, zum halben Preis vergleichbarer Modelle“ – eine Positionierungsaussage über Rivalen statt einer Messung, und es lohnt sich, sie als solche zu lesen.

Die Verfügbarkeit war am ersten Tag breit und hat sich seitdem zweimal erweitert. Zum Start: Cursor und Grok Build, die eigene API des Anbieters, Coding-Harnesses von Drittanbietern, Modell-Router und Cloud-Plattformen; SpaceXAIs eigene Grok-Build-Seite sagt jetzt unumwunden, man solle „mit Grok 4.7 mit dem Entwickeln beginnen“. Am 28. September fügte Amazon Web Services es Amazon Bedrock mit demselben Kontextfenster von 500.000 Token und denselben vier Reasoning-Effort-Stufen hinzu, bereitgestellt über Cross-Region-Inference-Profile, sodass das Modell nun über den eigenen Katalog eines Hyperscalers erreichbar ist und nicht nur über die API des Anbieters. Dann, am 1. Oktober, begann der Rollout in Groks Consumer-Web- und Mobile-Apps, und zwei Tage später ist es dort noch immer. Der letzte Punkt ist ungewöhnlich still: SpaceXAI kündigte den entsprechenden Schritt für Grok 4.5 mit einem Blogbeitrag mit dem Titel „Bringing Grok 4.5 to iOS, Android, Web, and X“ an und hat für Grok 4.7 nichts veröffentlicht, sodass die Änderung im Produkt sichtbar ist, statt erklärt zu werden. Sie erfolgt serverseitig und nicht als ausgeliefertes Update, was die App-Einträge bestätigen: Sowohl Groks iOS- als auch Android-Eintrag wurden am 1. Oktober aktualisiert – der App-Store-Build ist 1.4.47, an jenem Tag veröffentlicht, und seine Versionshinweise erwähnen nur „Improvements to Chat, Voice and Imagine“, während der Play-Eintrag am selben Tag aktualisiert wurde. Die Änderung wird vom Backend aus ausgerollt und nicht in eine Binary eingebaut. Weil über den Rollout berichtet und nicht dokumentiert wird, ist der genaue Umfang schwerer festzustellen als beim Bedrock-Eintrag, hinter dem ein datierter AWS-Beitrag steht, und die Berichterstattung hat sich bereits verschoben: Die Accounts, die dies verfolgen, beschreiben Grok 4.7 nun als Basismodell über alle Modi hinweg – Fast, Expert, Build und Heavy –, eine Liste, die nicht dem entspricht, was grok.com tatsächlich ausliefert. Lesen Sie es als Berichterstattung der Tracker selbst und nicht als Beschreibung des Anbieters. Ausgewählte Cybersicherheitspartner erhalten nur auf Einladung Zugang zu den Red-Team-Fähigkeiten des Modells.

Eine Korrektur an der Darstellung, die dieser Beitrag beibehalten hat. Die Parameteranzahl, die zwei Monate lang kursierte – rund 2,1 Billionen, etwa 40 % über den 1,5 Billionen von Grok 4.6 –, steht nach wie vor auf keinem Datenblatt. xAI hat keine Parameteranzahl für Grok 4.7 veröffentlicht, und Artificial Analysis führt die Modellgröße als nicht offengelegt. Die Zahl war stets eine Behauptung eines Gründers, und die Markteinführung hat sie nicht in eine Spezifikation überführt.

Die Benchmark-Tabelle ist xAIs eigene – hier ist, was nicht von xAI ist.

Jede Zahl in der folgenden Liste stammt aus der Ankündigung des Anbieters, und keine davon wurde unabhängig reproduziert. Lies sie mit diesem Etikett versehen: Dies sind die Zahlen von xAI zu den von xAI ausgewählten Evaluationen, veröffentlicht am Tag der Veröffentlichung, und die erste Woche nach jedem Launch ist die Zeit, in der Anbieter-Benchmarks am wenigsten verlässlich sind. Auch die Vergleichsspalten stammen vom Anbieter selbst — Grok 4.6 (high), GPT-5.6 Sol (max) und Claude Fable 5.1 (max), jeweils mit dem vom Anbieter gewählten Aufwandsniveau ausgeführt.

• CursorBench 4.0 — Grok 4.7 46,3 %, Grok 4.6 40,4 %, GPT-5.6 Sol 41,7 %, Claude Fable 5.1 51,8 %. Vom Anbieter angegeben.

• DeepSWE v1.1 — Grok 4.7 71,0 % bei hohem Aufwand, Grok 4.6 65,2 %, GPT-5.6 Sol 72,7 %, Claude Fable 5.1 70,0 %. Herstellerangaben.

• Terminal-Bench 4.0 — Grok 4.7 37,6 %, Grok 4.6 20,3 %, GPT-5.6 Sol 37,3 %, Claude Fable 5.1 57,9 %. Vom Hersteller angegeben und überarbeitet: In der Tabelle zum Starttag las sich die Grok-4.7-Zeile mit 38,0 %, und auf der heutigen Herstellerseite steht 37,6 %.

• EEBench — Grok 4.7 64,0 %, Grok 4.6 53,0 %, GPT-5.6 Sol 39,4 %, Claude Fable 5.1 56,4 %. Vom Hersteller angegeben.

• Harvey Legal Agent — Grok 4.7 19,6 %, Grok 4.6 15,8 %, GPT-5.6 Sol 2,5 %, Claude Fable 5.1 6,7 %. Vom Anbieter gemeldet.

• HealthBench Professional — Grok 4.7 56,7 %, Grok 4.6 48,5 %, GPT-5.6 Sol 60,5 %, Claude Fable 5.1 62,1 %. Vom Anbieter angegeben.

• AA Briefcase v1.1 — Grok 4.7 1.657, Grok 4.6 1.546, GPT-5.6 Sol 1.487, Claude Fable 5.1 1.678. Dies ist die einzige Zeile in der Tabelle, die nicht mehr nur vom Anbieter stammt: Das eigene AA-Briefcase-Board von Artificial Analysis veröffentlicht denselben Wert von 1.657 für Grok 4.7 bei xhigh-Aufwand und 1.546 für Grok 4.6 bei high. Die Vergleichsspalten sind weiterhin die vom Anbieter getroffene Auswahl an Modellen und Aufwandsstufen.

• GDPval Elo — Grok 4.7 1.695, Grok 4.6 1.605, GPT-6 Astra 1.542, Claude Fable 5.1 1.735. Vom Anbieter angegeben.

Die ehrliche Lesart dieses Sets ist nicht „Grok 4.7 gewinnt“. Es schlägt Grok 4.6 bei allen acht, was das Mindeste ist, das ein Nachfolger einem schuldet. Im Vergleich zum Feld ist es eine gemischte Bilanz: vor GPT-5.6 Sol bei CursorBench, Terminal-Bench und EEBench, dahinter bei DeepSWE; hinter Claude Fable 5.1 bei CursorBench, Terminal-Bench, HealthBench und beiden Elo-artigen Metriken, davor bei EEBench und der Harvey-Evaluierung für juristische Agenten. Es veranschaulicht außerdem, wie sehr ein Benchmark-Ergebnis von der Effort-Stufe abhängt — DeepSWEs 71,0 % ist eine High-Effort-Zahl in einer Tabelle, die ansonsten mit xhigh angegeben wird.

Sicherheit ist der eine Bereich, in dem die Behauptungen des Anbieters ungewöhnlich konkret sind. xAI sagt, Grok 4.7 basiere auf einem vollständig neuen Safeguard-Stack, und bezeichnet es als das stärkste Modell, das das Unternehmen für Verweigerungen und Jailbreak-Resistenz getestet hat. Auf LatchBios Biosicherheits-Benchmark meldet es 62,4 %; auf HackerBench v0.3 meldet es, dass 3,3 % riskanter Dual-Use-Prompts durchgelassen werden, während legitime Sicherheitsarbeit selten blockiert wird. Das sind vom Anbieter gemeldete Evaluierungen zum eigenen Release, und keine unabhängige Drittpartei hat sie reproduziert.

Die ersten Zahlen in diesem Beitrag, die nicht vom Anbieter stammen, sind die drei, die Artificial Analysis am 21. September veröffentlicht hat, und sie weichen auf informative Weise voneinander ab. Im Intelligence Index erzielt Grok 4.7 bei xhigh effort auf der v4.3.2-Skala 46 Punkte — Platz 16 in dieser Rangliste — gegenüber 44 für Grok 4.6. Dieser Zuwachs um zwei Punkte ist laut Artificial Analysis ausreichend, um SpaceXAI in die Top-4-Labore des Index zu bringen. Lesen Sie die Platzierung genau: Sie ist eine Aussage über das beste Modell eines Labors, nicht über dieses hier, und das Modell selbst liegt weiterhin vier Punkte unter den 50 von Claude Fable 5 und sieben unter den 53, die Claude Fable 5.1 und GPT-6 Astra gemeinsam haben. Ein Zuwachs um zwei Punkte liegt außerdem in dem Bereich, der zwischen den Effort-Stufen desselben Modells auftritt, was daran erinnert, dass ein Nachfolger, der besser abschneidet als sein Vorgänger, nicht dasselbe ist wie ein Nachfolger, der verändert, was möglich ist. Noch ein Hinweis zum Lesen der Zahl: Die Skalenversion ist wichtig, weil Artificial Analysis seinen Index neu dargestellt hat und die Werte 61/62/63, die in einem Großteil der Berichterstattung von Juli und August auftauchen, zur ausgemusterten Skala von vor September 2026 gehören — sie können nicht mit diesen verglichen werden.

Der Coding Agent Index ist die zweite Zahl, und sie ist diejenige, die sich verändert hat. Grok 4.7, ausgeführt in SpaceXAIs eigenem Grok Build Harness mit xhigh effort, erzielt 56 gegenüber 47 von Grok 4.6 – neun Punkte, nicht zwei –, womit es unter den Modellen, die in ihren nativen Harnesses evaluiert wurden, den vierten Platz belegt, hinter Claude Fable 5.1, GPT-6 Astra und Claude Opus 5 und vor GPT-5.6 Sol. Der Index ist ein gleich gewichteter zusammengesetzter Wert aus DeepSWE v1.1, Terminal-Bench 4.0 und SWE-Atlas-QnA über 303 Aufgaben, und alle drei Komponenten haben sich verbessert: DeepSWE von 65 % auf 73 %, Terminal-Bench von 18 % auf 33 %, SWE-Atlas-QnA von 58 % auf 63 %. Dies ist der erste unabhängige Beleg dafür, dass die von xAI beschriebene Korrektur – längeres Reinforcement Learning mit Gewichtung auf mehrstündige Aufgaben – etwas bewirkt hat, und es ist die Zahl, die ein Team, das einen Coding-Agent auswählt, am stärksten gewichten sollte, weil sie in dem Harness gemessen wird, mit dem das Modell tatsächlich ausgeliefert wird, und nicht in der hauseigenen Tabelle des Anbieters.

Der Vorbehalt liegt darin, was die neun Punkte kosten. Der eigene Durchlauf von Artificial Analysis generierte 240 Millionen Output-Tokens im Intelligence Index, gegenüber einem Median von 94 Millionen über die Modelle hinweg, die Artificial Analysis erfasst – mehr als das Doppelte – und veranschlagte die Kosten für die Bewertung einer Index-Aufgabe auf 3,74 $. Bei 6 $ pro Million Output-Tokens ist die Ausführlichkeit die Kostenposition, die darüber entscheidet, ob eine agentische Schleife bezahlbar ist; ein Zugewinn von neun Punkten, der mit mehr als dem Doppelten des Median-Outputs erkauft wird, ist daher ein echter Trade-off und kein kostenloses Upgrade. Dieselbe Messung bedeutet außerdem, dass die Schlagzeilenwerte nicht als ein einziges Urteil gelesen werden sollten: Auf Pro-Token-Basis ist der Vorsprung von Grok 4.7 gegenüber Grok 4.6 kleiner, als das Index-Delta nahelegt, und bei den Allgemeinwissens-Bewertungen, aus denen sich der Intelligence Index zusammensetzt, ist es nahezu dasselbe Modell mit einer erheblich höheren Rechnung. Das AA-Briefcase-Ergebnis im nächsten Abschnitt ist die Ausnahme davon, und zwar eine große.

The Artificial Analysis model page for Grok 4.6 (high) showing an Intelligence Index of 61 against a median of 34, pricing of $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, and a released August 2026 label.

Das zweite unabhängige Board: AA-Briefcase, und was man für die halben Kosten pro Aufgabe bekommt

Artificial Analysis veröffentlichte am selben Tag eine dritte Zahl für Grok 4.7, und sie ist diejenige, die sich auf Wissensarbeit statt auf Code bezieht. Auf AA-Briefcase – dem eigenen Board für langfristig angelegte agentische Wissensarbeit, aufgebaut aus vier mehrwöchigen Projekt-Szenarien und 91 bewerteten Deliverables – erreicht Grok 4.7 bei xhigh-Aufwand 1.657 Elo, Platz vier im Board und nur hinter Anthropic-Einträgen: Claude Fable 5.1 bei maximalem Aufwand (1.678), Claude Opus 5 bei maximalem Aufwand (1.673) und Claude Fable 5.1 bei xhigh (1.669). Es liegt 16 Elo hinter Claude Opus 5 bei maximalem Aufwand und bei xhigh 8 Elo vor Claude Opus 5 bei xhigh (1.649). Lesen Sie die Platzierung genau: „nur hinter Anthropic-Modellen“ ist die Formulierung, die Artificial Analysis selbst verwendet hat, und sie ist zutreffend – doch Platz vier ist nicht Platz zwei, und die drei Zeilen darüber stammen alle vom selben Anbieter.

Der Zuwachs gegenüber der vorherigen Generation ist der größte einzelne Sprung in diesem Release. Gegenüber Grok 4.6 bei hohem Aufwand (1.546) gewinnt Grok 4.7 bei xhigh 111 Elo auf AA-Briefcase — mehr als das Fünfzigfache des Zuwachses von zwei Punkten beim Intelligence Index. Artificial Analysis führt dies fast vollständig auf die Analysequalität zurück: 1.994 Elo dort gegenüber 1.690 für Grok 4.6, während die Präsentationsqualität leicht nachgibt, 1.499 gegenüber 1.519. Das ist eine gut lesbare Signatur: Das Modell denkt besser über die Analyse nach und formatiert das Ergebnis etwas schlechter. Dieselbe Richtung zeigt sich in den Zahlen, die Artificial Analysis für AA-Briefcase-Lite anführt, das öffentliche Due-Diligence-Szenario, das auf Hugging Face veröffentlicht wurde — Analysequalität steigt von 1.698 auf 1.994, Präsentation sinkt von 1.531 auf 1.499. Zwei Einschränkungen zu diesem Vergleich. AA-Briefcase-Lite ist ausdrücklich demonstrativ: Die eigene Methodikseite von Artificial Analysis sagt, dass das öffentliche fünfte Szenario „nicht zu den offiziellen AA-Briefcase-Ergebnissen zählt". Und die dafür angeführten Qualitätszahlen stimmen mit den xhigh-Zeilen überein, die auf dem Hauptboard veröffentlicht wurden, sodass der Lite-Absatz eher als Illustration der Entwicklungsrichtung denn als separate Rangliste zu verstehen ist.

Die Kostenzeile ist der Punkt, an dem dieses Ergebnis eine Entscheidung verändert. Die Kosten-pro-Aufgabe-Kennzahl von AA-Briefcase ist definiert als die Gesamtkosten für die Durchführung der vollständigen Submission geteilt durch ihre 91 Aufgaben; dividiert man die von Artificial Analysis veröffentlichten Gesamtsummen durch die Aufgabenanzahl, ergeben sich grob 9,30 $ pro Aufgabe für Grok 4.7 bei xhigh gegenüber grob 17,79 $ für Claude Opus 5 bei max effort — etwa die Hälfte, für einen Elo-Abstand von 16. Artificial Analysis’ eigene Zusammenfassung des Ergebnisses lautet, dass Grok 4.7 „knapp hinter Opus 5 bei ~50 % von dessen Kosten pro Aufgabe“ liegt. Das ist derselbe Trade-off, den der Rest dieses Artikels beschreibt, und er kommt aus einer anderen Richtung zum selben Ergebnis: Grok 4.7 schlägt die Frontier nicht, sondern unterbietet sie. Zwei Einschränkungen, beide ehrlich. Die Token-Rechnung ist real — bei AA-Briefcase-Lite bezifferte Artificial Analysis die API-Kosten für die Erzeugung der Beispiel-Decks auf etwa 8 $ für Grok 4.7 bei xhigh gegenüber etwa 4,40 $ für Grok 4.6 bei xhigh, sodass der Nachfolger für dieselbe Arbeit rund 80 % mehr kostet als das Modell, das er ersetzt. Und die Werte pro Aufgabe werden aus der Token-Nutzung zu Listenpreisen mit einer repräsentativen Cache-Hit-Rate berechnet, sie verschieben sich also mit Ihrem Caching: Sie sind ein Modell einer Rechnung, nicht Ihre Rechnung.

Wo Grok 4.7 im Vergleich zu Grok 4.6 und der Konkurrenz steht

• Preis pro 1 Mio. Token — Grok 4.7 $2 in / $6 out unter 200 K Input, $4/$12 darüber; Grok 4.6 identisch.

• Kontextfenster — 500.000 Token für beide.

• Wissensstichtag — Mai 2026 für Grok 4.7 gegenüber dem 1. Februar 2026 für Grok 4.6.

• Reasoning-Aufwand – niedrig / mittel / hoch / xhigh für Grok 4.7 im Vergleich zu den veröffentlichten Stufen von Grok 4.6.

• Unabhängiger Score – 46 bei xhigh-Aufwand gegenüber 44 im v4.3.2 Intelligence Index von Artificial Analysis. Genug, sagt Artificial Analysis, um SpaceXAI unter die Top-Vier-Labore des Index zu bringen.

• Unabhängiger Coding-Score — 56 gegenüber 47 im Artificial Analysis Coding Agent Index, jedes Modell in seinem nativen Harness. Vierter unter den Modellen mit nativem Harness, vor GPT-5.6 Sol.

• Unabhängiger Score für Wissensarbeit — 1.657 Elo bei xhigh-Aufwand gegenüber 1.546 für Grok 4.6 bei hohem Aufwand, auf dem AA-Briefcase-Board von Artificial Analysis. Insgesamt Platz vier, hinter drei Anthropic-Einträgen und vor Claude Opus 5 bei xhigh.

• Kosten pro AA-Briefcase-Aufgabe — etwa 9,30 $ gegenüber etwa 17,79 $ für Claude Opus 5 bei maximalem Aufwand, auf demselben Board. Rund die Hälfte der Rechnung pro Aufgabe für eine Differenz von 16 Elo.

• Ausgabe-Tokens pro Index-Lauf – 240 Millionen gegenüber einem Median von 94 Millionen über die Modelle hinweg, die Artificial Analysis erfasst. Die Verbesserung ist nicht kostenlos.

• Anbieter-Coding-Eval — CursorBench 4.0 46,3 % gegenüber 40,4 %.

• Bedienungsgeschwindigkeit — eine schnelle Variante mit doppelter Ausgabegeschwindigkeit zum doppelten Preis, gegenüber Grok 4.6s Standardbereitstellung.

• Sicherheit — ein neuer Schutzmaßnahmen-Stack, mit berichteten 62,4 % auf LatchBios Biosicherheits-Benchmark; Grok 4.6 wurde ohne diese Angabe ausgeliefert.

Und das Feld, auf demselben Scoreboard: Claude Fable 5.1 bei 53, Claude Opus 5 bei 51, GPT-5.6 Sol bei 47, Kimi K3 bei 44. Musks eigene Vorhersage – dass Grok 4.7 „in etwa auf Augenhöhe mit Opus 5.0 liegen sollte, nicht mit 5.1“ – hat jetzt eine Zahl darunter, und die Zahl landete dort, wo er sagte: unterhalb der Frontier, nicht darüber. Die gemessene Lücke zu Claude Fable 5.1 beträgt sieben Punkte; die Preislücke verläuft in die andere Richtung, mit Claude Fable 5.1 zu $10/$50 pro Million Tokens gegenüber Grok 4.7 zu $2/$6 – das Fünffache beim Input-Preis und mehr als das Achtfache beim Output-Preis. Das ist der eigentliche Kompromiss, den ein Team eingehen soll, und es ist eine Preis-Leistungs-Abwägung statt eines Fähigkeitsgewinns. AA-Briefcase ist das einzige Board in diesem Artikel, bei dem sich die Reihenfolge ändert: Dort liegt Grok 4.7 bei xhigh vor Claude Opus 5 bei xhigh, 1.657 zu 1.649, allerdings weiterhin hinter Opus 5 mit maximalem Aufwand bei 1.673 und hinter Claude Fable 5.1 bei 1.678. Es lohnt sich außerdem, die drei unabhängigen Werte nebeneinanderzustellen, bevor man die Linie zieht, denn sie weisen nicht in dieselbe Richtung: sieben Punkte zurück bei allgemeiner Intelligenz, vor GPT-5.6 Sol beim Coding-Agent-Index, 111 Elo vor seinem Vorgänger bei Knowledge Work und die Zugewinne mit Output-Tokens erkauft. Welche dieser Tatsachen Ihre Wahl entscheidet, hängt davon ab, ob die Workload ein Coding-Agent, ein Knowledge-Deliverable oder ein Chat-Prompt ist, und das ist eine nützlichere Aufteilung als ein einzelner Rang.

Was die Leaks richtig hatten – und das eine, was sie nicht klärten

Die Artefakte, die dieser Beitrag bis September verfolgte, waren echt, und der Launch macht sie zu einem Test dafür, was diese Art von Beweisen wert ist. Hier ist das Verzeichnis.

• Der Katalog-Pull-Request lag beim Preis richtig. Die Einreichung vom 21. September, mit der Grok 4.7 zu den Zen- und Go-Katalogen eines Open-Source-Agenten-Clients hinzugefügt wurde – eröffnet um 05:36 UTC, automatisch geschlossen von einem Compliance-Bot um 07:46 UTC wegen eines fehlenden Abschnitts der Pull-Request-Vorlage, nie zusammengeführt –, führte das Modell zu den veröffentlichten Preisen von Grok 4.6 auf. Es stellte sich als genau richtig heraus: $2/$6, unverändert. Doch der Mechanismus ist wichtiger als das Ergebnis. Der Beitragende kopierte die Preise vom darüber stehenden Modell, und das Kopieren war zufällig die richtige Vermutung. Das ist Glück, nicht Autorität, und die Fähigkeitsaussagen desselben Pull-Requests trugen ebenfalls keine Informationen. Ein Vorschlag kann richtig sein und trotzdem kein Beleg.

• Die Bereitstellungsspur war echt und war nicht das Release. Die grok-4.7-Zeile auf der Modellkontingentseite der Google Cloud Console, gemeldet von Community-Trackern am 16.–17. September, und der datierte Build-Slug grok-4-7-0907, der in einem Konfigurationsfehler des Grok Bot auftauchte, deuteten beide auf ein Modell hin, das vorbereitet wurde. Keines von beiden war von irgendjemandem mit einem Datum versehen, und keines von beiden war die Ankündigung. Was sie belegen, ist, dass Drittanbieter-Infrastruktur bereitgestellt wurde — was im Rückblick zutreffend war und dennoch kein Zeitplan.

• Die Parameteranzahl wurde nie bestätigt. Rund 2,1 Billionen, etwa 40 % über Grok 4.6, am 2. September von Musk wiederholt — und bei der Markteinführung weiterhin in keinem Datenblatt zu finden. Dies ist der klarste Fall in der gesamten Saga für eine Zahl, die so weit verbreitet war, dass sie als Tatsache behandelt wurde, obwohl sie nie eine Herstellerquelle hatte.

A what-we-know-so-far card for Grok 4.7 listing six rows: Status not released — in supplemental training, Model ID none — docs top out at grok-4.6, Release date none — Musk says 3–4 weeks, Parameters ~2.1T (claim, not verified), Training data SpaceX engineering corpus (reported), Benchmarks none published, with a footer reading that all figures are Musk claims or community reports and no independent scores exist.

Die oben stehende Karte hält den Vorab-Veröffentlichungsstand fest, wie dieser Beitrag ihn zuletzt überprüft hat: keine Modell-ID, kein Veröffentlichungsdatum, keine veröffentlichten Benchmarks. Jede Zeile darauf wurde inzwischen von der Ankündigung vom 21. September überholt, und sie wird hier beibehalten, weil die Lücke zwischen dieser Karte und dem ausgelieferten Modell die eigentliche Geschichte der letzten sechs Wochen ist – ein Frontier-Launch, der bis zum Tag seiner Auslieferung überhaupt keine bestätigten Spezifikationen hervorbrachte.

• Der Vorbehalt zur Einsatzbereitschaft ist die offene Frage, und dafür gibt es inzwischen teilweise Belege. Musk sagte Mitte September, Grok 4.7 „breche bei sehr schwierigen Aufgaben vorzeitig ab“ und seine Antwortprüfung sei „nicht streng genug“, was er auf eine zu hoch angesetzte Reinforcement-Learning-Strafe für lange Antworten zurückführte und mit „möglicherweise“ abschwächte. Die Startankündigung geht darauf nicht ein. Die von xAI genannte Abhilfe ist indirekt: längeres, auf mehrstündige Aufgaben ausgerichtetes Reinforcement Learning und bessere Selbstverifizierung sind genau die Veränderungen, die man vornehmen würde, um vorzeitigen Abbruch zu beheben. Das Ergebnis des Coding Agent Index ist das erste externe Anzeichen dafür, dass dies etwas bewirkt hat – 56 gegenüber 47 bei Grok 4.6, wobei sich Terminal-Bench 4.0 nahezu verdoppelt, von 18% auf 33%, was genau dem langhorizontigen, vielschrittigen Ende des Spektrums entspricht. Es ist keine eindeutige Antwort, denn dieselben Harness-Werte sind auch diejenigen, die ihre Zugewinne mit deutlich mehr Ausgabe-Tokens erkaufen. Ob das Modell weiterhin lange schwierige Aufgaben aufgibt, lässt sich von jedem mit API-Zugang testen, und es bleibt das Erste, was getestet werden sollte.

• Der SpaceX-Korpus ist weiterhin unbestätigt. Die berichtete Trainingsergänzung – Starlink-Telemetrie, Raptor-Brennkammerdruckprotokolle, Starship-Wiedereintrittstelemetrie, interne Slack-Threads, Jira-Tickets, GitHub-Repositories und ERP-Datensätze – ist Community-Berichterstattung darüber, was Musk gesagt hat, und keine Offenlegung des Unternehmens. Die Ankündigung zum Start beschreibt ein größeres Basismodell und einen längeren Reinforcement-Learning-Lauf und sagt nichts über den Korpus. Wenn er darin enthalten ist, wird kein Spezifikationsblatt es bestätigen; der einzige Beweis wird sein, ob das Modell bei echter Ingenieursarbeit etwas leistet, was vergleichbare Modelle nicht können.

Der Zeitplan, der viermal danebenlag – und was der Markt richtig voraussah

Grok 4.7 wurde öffentlich an fünf verschiedenen Zeitplänen versprochen, und die ersten vier liefen ab. Am 24.–25. Juli sagte Musk etwa vier Wochen, was auf den 22. August hindeutete. Am 12. August korrigierte er auf „3 bis 4 Wochen“, was auf den 2.–9. September hindeutete. Am 2. September verengte er auf ungefähr zehn Tage, was auf den 12. September deutete. Am 11. September, dem Tag, an dem diese Frist ablief, sagte er „noch ein paar Tage“. Der fünfte war überhaupt kein Zeitfenster – eine grok-4.7-Zeile auf einer Google-Cloud-Kontingentseite – und er war derjenige, der der Wahrheit am nächsten kam: Das Modell wurde am 21. September ausgeliefert, kurz nach dem letzten Datum, auf das sich irgendjemand festgelegt hatte, und ohne dass dem Artefakt, das ihm vorausging, ein Datum beigefügt war.

Die Prognosemärkte lagen beim Kalender richtig und beim Modell falsch. Kalshis „SpaceXAI veröffentlicht Grok 4.7 vor dem 18. September?“ stellte den Handel am 18. September um 03:59 UTC ein, nachdem zuletzt bei 65 ¢ gehandelt worden war, bei 1.785 gehandelten und 1.211 offenen Kontrakten. Jeder abgerechnete Kontrakt an beiden großen Märkten – Kalshis Fenster vom 14., 21., 28. und 31. August sowie vom 4., 8. und 11. September und Polymarkets Kontrakte vom 12. und 14. September – wurde mit Nein abgerechnet. Polymarkets „nächstes Grok-Modell (4.7 oder höher) bis zum 18. September veröffentlicht?“ stand am 15. September bei 64 %, nachdem es über elf Tage zwischen 42 % und 88,5 % geschwankt war. Der Markt hatte recht, gegen die tweetgetriebenen Ausschläge zu setzen, und recht damit, dass das Fenster vom 18. September leer schließen würde. Er lag beim Modell drei Tage zu früh, was genau das Einzige ist, was ein datierter Kontrakt nicht bepreisen kann.

Die Aufrufzahlen sind es wert, als Kalibrierungsnotiz festgehalten zu werden. Musks Countdown vom 2. September, „erscheint in 10 Tagen“, erzielte 10,29 Millionen Aufrufe und lag falsch. Sein Rückzieher vom 11. September erzielte 2,05 Millionen und lag ebenfalls falsch. Seine Roadmap-Beiträge vom 13.–14. September erzielten etwa 1,99 Millionen und kamen der Wahrheit am nächsten — er beschrieb Grok 4.8, ein Modell mit rund 2,5 Billionen Parametern, das auf einem von Grund auf neu entwickelten C++-Stack trainiert wurde, als „eine merkliche Verbesserung“ gegenüber Grok 4.7. Die Reichweite folgte über den gesamten Verlauf hinweg der Zuversicht, nicht der Genauigkeit.

Zwei der Roadmap-Punkte sind inzwischen offene Fragen statt Vorhersagen. Für Grok 4.8 gibt es nirgends eine Modell-ID, keine Preisangabe, kein Kontextfenster und keinen Benchmark-Eintrag. Und die Deutung, Grok 4.7 sei still und leise zu Grok 4.8 „rebrandet“ worden – die Lesart eines Mediums, wonach Musk 4.8 nannte, während 4.7 auf sich warten ließ –, ist andersherum geklärt: 4.7 wurde als 4.7 ausgeliefert, mit 46 im Index gegenüber 44 bei Grok 4.6, was der Zuwachs eines Nachfolgers und kein Relaunch ist.

Was das für Teams bedeutet, die heute Grok aufrufen

Das praktische Bild änderte sich am 21. September, und zwar auf die denkbar undramatischste Weise: eine neue Modell-ID zum selben Preis, dasselbe Kontextfenster, ein Plus von zwei Punkten im Index, ein Plus von neun Punkten beim Coding-Agenten und ein Plus von 111 Punkten bei Wissensarbeit. Zwei Änderungen seitdem sind wichtiger, als sie wirken. Die Grok-Apps reichen das Modell jetzt an normale Nutzer weiter statt nur an Entwickler, und der Katalog auf dieser Seite führt es nun auf – zusammen machen diese beiden die am Ende dieses Artikels beschriebene Routing-Schicht von einem Plan zum Standard. Wenn Ihr Kostenmodell auf Grok 4.6 zu $2/$6 aufgebaut wurde, ist der Preis pro Token für Grok 4.7 weiterhin korrekt – die Tokenzahl aber nicht. Der eigene Lauf von Artificial Analysis verbrauchte 240 Millionen Output-Tokens im Intelligence Index gegenüber einem Median von 94 Millionen über die von ihm verfolgten Modelle hinweg, sodass dieselbe Anfrage weit mehr als doppelt so viel kosten kann, obwohl die Preisliste identisch ist – eine Art von Veränderung, die in einer Preistabelle nie auftaucht. Kalkulieren Sie eine echte agentische Schleife über die Output-Tokens, nicht über den Preis pro Million, bevor Sie zu dem Schluss kommen, dass dieses Release kostenlos ist. Wenn Ihr Grund zu wechseln die vom Anbieter beanspruchte Preis-Leistungs-Frontier ist, dann sind die stärksten Belege dafür jetzt AA-Briefcase und nicht die Tabelle des Anbieters: Platz vier in dieser Rangliste bei ungefähr der Hälfte der Kosten von Claude Opus 5 pro Aufgabe, im Kontrast zu einem Abstand von sieben Punkten im Intelligence Index zu Claude Fable 5.1 und einer Preislücke, die beim Input in die andere Richtung das Fünffache und beim Output mehr als das Achtfache beträgt. Und wenn Ihre Workload speziell ein Coding-Agent ist, ist der Fall stärker, als der Index nahelegt: 56 im Coding Agent Index im Grok Build Harness, vor GPT-5.6 Sol, ist eine andere Liga als 46 bei allgemeiner Intelligenz. Welches davon stärker zählt, hängt vollständig von Ihrer Workload ab, und niemand außerhalb von SpaceXAI hat Grok 4.7 auf Ihrer laufen lassen.

Im Katalog von OrcaRouter führt die Grok-Reihe jetzt Grok 4.7 neben Grok 4.6, Grok 4.5 und Grok 4.3, abgerechnet zum Listenpreis des Anbieters mit 0 % Aufschlag — 2 $ pro Million Eingabe-Tokens und 6 $ pro Million Ausgabe-Tokens, gecachte Eingabe-Lesevorgänge zu 0,50 $, und derselbe Sprung auf 4 $ Eingabe und 12 $ Ausgabe, sobald eine Anfrage 200.000 Eingabe-Tokens überschreitet, den SpaceXAI berechnet. Das ist es, was einem das unangetastete Durchreichen der Preisliste bringt: Der Preis pro Token in Ihrem Kostenmodell ist der Preis pro Token auf Ihrer Rechnung, und jedes Modell der Familie wird über einen einzigen Schlüssel angesprochen, sodass das Verschieben einer Arbeitslast von Grok 4.6 auf Grok 4.7 eine Änderung an einer Zeichenkette statt eines zweiten Vertrags ist. Diese Seite führt das Kontextfenster von 500.000 Tokens und dieselbe OpenAI-kompatible Oberfläche — Chat Completions und Responses —, auf die eine Grok-4.6-Integration bereits abzielt.

The OrcaRouter model page for grok/grok-4.6 showing the New and Featured badges, $2.00 per 1M input and $6.00 per 1M output tokens, a 500K-token context window, text and image input, and the released August 12, 2026 label for Grok 4.6 by SpaceXAI.

Diese Routing-Schicht ist zugleich der risikoarme Weg, ein Modell zu bewerten, dessen unabhängige Zahlen am selben Tag erschienen sind wie die des Anbieters. Die obige Benchmark-Liste ist nach wie vor die des Anbieters selbst – seine ausgewählten Evaluierungen, seine ausgewählten Effort-Level, seine ausgewählten Vergleichsspalten – und nichts davon wurde reproduziert. Was sich geändert hat, ist, dass die drei Werte von Artificial Analysis nicht vom Anbieter stammen, sodass sich die Frage von „Ist irgendetwas davon echt?“ zu „Welchem dieser Ergebnisse ähnelt meine Workload?“ verschoben hat: die 46, die allgemeine Intelligenz im Mittelfeld bedeutet, die 56, die Platz vier unter den Coding-Agenten mit nativem Harness bedeutet, oder die 1.657, die Platz vier bei Knowledge Work zu halb so hohen Pro-Task-Kosten wie die Frontier bedeutet. Und die Zahl, die die Wirtschaftlichkeit entscheidet, ist überhaupt kein Benchmark, sondern die Output-Tokens, die ein Lauf verbraucht – und die kann nur Ihr eigener Traffic bepreisen: 240 Millionen pro Index-Lauf nach der Messung von Artificial Analysis gegenüber einem Median von 94 Millionen und rund 8 $ gegenüber 4,40 $ pro Satz Beispiel-Decks in dessen öffentlichem AA-Briefcase-Lite-Szenario. Automatisches Failover ermöglicht es Ihnen, echten Traffic auf das neue Modell zu lenken und auf einen Anbieter zurückzufallen, der weiterhin antwortet, falls die Token-Rechnung oder das Verhalten bei vorzeitigem Abbruch schlechter ausfällt als beworben – was der Unterschied zwischen dem Testen eines unbewiesenen Modells und dem Verwetten einer Pipeline darauf ist.

Wie man zuerst erkennt (der Check, der funktioniert hat)

Dieser Abschnitt war früher eine Liste von Signalen, auf die man während des Wartens achten sollte. Das Warten ist vorbei, hier ist also dieselbe Liste, abgeglichen damit, was tatsächlich passiert ist.

• Die Modellliste war die Bestätigung, und sie hat sich bewegt. Sechs Wochen lang lautete der Rat in diesem Artikel, die Modellliste des Anbieters zu beobachten statt die Tweets, denn in dem Moment, in dem Grok 4.7 real wäre, würde die Liste eine Modell-ID mit zugehörigem Preis und Kontextfenster erhalten. Genau das ist eingetreten: grok-4.7 erscheint jetzt mit einem 500K-Kontextfenster, Preisen von $2/$6 unter 200K Input und $4/$12 darüber, einem Wissensstichtag Mai 2026 und vier Aufwandsstufen. Jedes Musk-Fenster, jedes Argument zur Taktung und jedes Marktdatum konnten diese Liste nicht bewegen; das Release hat sie bewegt.

• Kataloge von Drittanbietern gehen der Ankündigung voraus, und sie sind Vorschläge, keine Bereitstellungen. Der Katalog-Pull-Request vom 21. September war die bislang klarste Ausprägung davon, und seine Schließung ist lehrreich: Ein Mitwirkender bereitete ein Modell vor, ein Bot schloss die Änderung zwei Stunden später wegen eines fehlenden Vorlagenabschnitts, und das Modell wurde zwei Tage danach ausgeliefert. Lesen Sie diese Art von Artefakt als Absicht mit einem Zeitstempel. Es ist der Ankündigung tatsächlich vorgelagert, und es bedeutet keine Verfügbarkeit.

• Verfolgen Sie den OrcaRouter-Modellkatalog. Inzwischen hat sich das geändert. Den ganzen September über lautete der Rat in diesem Artikel, dass eine grok-4.7-Modellseite auf orcarouter.ai das Signal „Sie können es heute über uns aufrufen“ wäre, weil ein Modell erst gelistet wird, nachdem ein Anbieter es integriert hat. Der Katalog führt Grok 4.7 jetzt zum Tarif des Anbieters ohne Aufschlag, die Prüfung, zu der einem Leser geraten wurde, hat also eine Antwort: Es ist heute über eine einzige API routbar.

• Für die Sichtbarkeit auf Verbraucherseite hat die Grok-App Grok 4.7 nun vor Nutzer gebracht, die niemals eine API-Konsole öffnen werden. Beim erneuten Lesen am 2. Oktober nennen die Picker-Daten, die grok.com einem ausgeloggten Besucher ausliefert, das Modell noch immer bei zwei ihrer vier Einträge – Expert zeigt „Thinks hard · Grok 4.7“ und Heavy zeigt „Team of Experts · Grok 4.7“ –, während Fast, der Modus, in dem die App standardmäßig startet, nur als „Quick responses“ beschrieben wird und Auto als Auswahl zwischen Fast und Expert. Die vier Einträge sind Auto, Fast, Expert und Heavy. Build ist keiner davon: Grok Build ist ein separates Terminal-Produkt auf einer eigenen Seite, und von dieser Seite stammt die Build-Zuordnung des Modells tatsächlich – sie fordert Besucher auf: „install now and start building with Grok 4.7“. Die Behauptung also, die am 1. Oktober kursierte und am 2. Oktober wiederholt wurde – dass Grok 4.7 jetzt das Basismodell in „Fast, Expert, Build und Heavy“ sei –, führt einen Modus auf, den die App nicht anbietet, und lässt denjenigen aus, in dem sie startet; und sie ist die Lesart der Tracker, nicht die des Anbieters, denn SpaceXAI hat zu diesem Rollout überhaupt nichts veröffentlicht. Der entsprechende Schritt bei Grok 4.5 bekam einen eigenen Blogbeitrag; dieser hier hat ein Produkt, das sich leise unter einer Nachrichtenseite veränderte, die sich nicht veränderte.

Der Stand der Dinge

Grok 4.7 wurde am 21. September 2026 veröffentlicht, zu $2 pro Million Input-Tokens und $6 pro Million Output-Tokens mit einem Kontextfenster von 500.000 Tokens und einem Wissens-Cutoff von Mai 2026. Was sich in den elf Tagen seitdem geändert hat, ist eher die Verfügbarkeitskarte als das Modell: Amazon Bedrock hat es am 28. September hinzugefügt, es begann am 1. Oktober mit dem Rollout in Groks eigenen Web- und Mobile-Apps und war dort am 2. Oktober noch im Rollout, und es ist jetzt auf OrcaRouter zu SpaceXAIs eigenem Tarif ohne Aufschlag gelistet. Seine unabhängigen Bewertungen erschienen am selben Tag wie der Launch und sind immer noch uneinig: 46 bei xhigh-Aufwand auf dem v4.3.2 Intelligence Index von Artificial Analysis, zwei Punkte über Grok 4.6 und genug, um SpaceXAI in die Top vier Labore des Index zu bringen; 56 auf dem Coding Agent Index im Grok Build Harness, neun Punkte über Grok 4.6 und Vierter unter den Native-Harness-Modellen vor GPT-5.6 Sol; und 1.657 Elo auf AA-Briefcase, 111 Punkte über Grok 4.6 und Vierter auf dem Board hinter drei Anthropic-Einträgen, bei ungefähr der Hälfte von Claude Opus 5s Kosten pro Aufgabe. Jeder Benchmark in der Launch-Tabelle des Anbieters ist der eigene des Anbieters und nicht reproduziert, mit einer Ausnahme: Das eigene AA-Briefcase-Board von Artificial Analysis veröffentlicht dieselben 1.657, und der Anbieter hat seitdem seine eigene Terminal-Bench-Zeile von 38,0 % auf 37,6 % nach unten korrigiert. Die Fortschritte bei Coding und Wissensarbeit sind real und sie kosten Output-Tokens — 240 Millionen pro Index-Lauf gegenüber einem Median von 94 Millionen, und etwa $8 gegenüber $4,40 pro Satz Beispiel-Decks im öffentlichen Due-Diligence-Szenario von AA — was die Zahl ist, die entscheidet, ob dieses Release günstig ist. Die Zahl von ~2,1 Billionen Parametern, die zwei Monate lang kursierte, hat immer noch keine Anbieterquelle, und der Vorbehalt des vorzeitigen Abbruchs wurde nie direkt angesprochen, obwohl der Terminal-Bench-Sprung von 18 % auf 33 % im Grok Build Harness der erste externe Beweis dafür ist, dass die Korrektur funktioniert hat. Beide Signale, auf die dieser Artikel die Leser aufmerksam gemacht hat, sind eingetreten: Die Modellliste des Anbieters hat grok-4.7 mit einem Preis und einem Kontextfenster erhalten, und der Katalog hier listet es zum selben Tarif. Der Gewinnzug ist also einfacher als im September — Grok 4.6 zu $2/$6 war die Antwort, und Grok 4.7 zu $2/$6 ist dieselbe Antwort mit einer neueren Modell-ID, besseren Coding- und Wissensarbeits-Werten, einer viel größeren Token-Rechnung und einer Consumer-App, die es in ihren zwei härtesten Modi nennt.

In diesem Artikel verglichen3

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert