Grok 4.6 Erscheinungsdatum: Ausgeliefert am 12. August zum gleichen Preis von 2 $/6 $
Guides & Insights

Grok 4.6 Erscheinungsdatum: Ausgeliefert am 12. August zum gleichen Preis von 2 $/6 $

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am Mittwoch, dem 12. August 2026, hörte die Frage, um die herum diese Seite aufgebaut war, auf, eine Frage zu sein: Grok 4.6 wurde veröffentlicht. SpaceXAI – das Unternehmen, das Grok betrieben hat, seit es das Startup im Februar 2026 übernommen und im Juli umbenannt hat – veröffentlichte es zu demselben Preis von $2/$6 wie Grok 4.5, auf derselben V9-Grundlage, mit demselben 500K-Token-Kontextfenster, und Musk nannte es auf X „einen Knaller“. Die Veröffentlichung beantwortete die beiden Fragen, die die vorherige Version dieser Seite verfolgte: Das Modell existiert, und es handelt sich um eine gleich große Post-Training-Auffrischung und nicht um eine Skalierung. Die einzige Frage, die sie nicht beantwortete, ist die Parameteranzahl, die offiziell nicht bekannt gegeben wird.

Vor einer Woche lautete die ehrliche Schlagzeile, dass das Modell noch nicht ausgeliefert worden war: Das von Musk am 27. Juli gesetzte Ziel „um den 7. August" war verfehlt worden, und die Lesart einer unveränderten Größenordnung war weiterhin nur eine Prognose. Diese Seite vertrat die Ansicht, dass das Modell am besten als Aktualisierung bei unveränderter Größenordnung zu verstehen sei und dass solche Aktualisierungen in der Regel ohne Preiserhöhung erscheinen. Der Starttag bestätigte die geschäftliche Hälfte dieser Einschätzung exakt — 2 $/6 $/0,50 $ pro Million Token, identisch mit Grok 4.5 — und die ersten unabhängigen Messungen sind nun eingetroffen. Im Folgenden wird beschrieben, was ausgeliefert wurde, was die Zahlen bisher aussagen und was noch auf Angaben des Anbieters beruht.

Was wurde am 12. August verschickt?

Grok 4.6 ist live auf der SpaceXAI-API als Modell-ID grok-4.6 sowie in Grok Build, Cursor und der Grok-Bot-App; Cursor- und Grok-Build-Nutzer erhalten in der ersten Woche das Doppelte ihres enthaltenen Nutzungskontingents. Es ist ein Reasoning-Modell mit erweitertem Chain-of-Thought, akzeptiert Text- und Bildeingaben und erzeugt Text, und fügt eine neue Einstellung „xhigh reasoning-effort“ oberhalb der Standardeinstellung hinzu.

Die API behält OpenAI-kompatible Endpunkte bei und ergänzt serverseitig drei Tools: Websuche, X-Suche und Codeausführung. Für alle, die bereits über einen OpenAI-kompatiblen Endpunkt mit Grok 4.5 kommunizieren, bedeutet das, dass der Wechsel eine Änderung des Modell-Strings ist und keine Neuimplementierung des Clients.

Was diese Seite vorhergesagt hat — und was eingetroffen ist

Das Argument der vorherigen Version war, dass Musks „das 1.5T-Modell mit deutlich verbessertem SFT & RL" auf einen Refresh gleicher Größenordnung hindeutete und dass der Preis gehalten würde. Die Einführung bestätigte beide Teile der Geschäftsprognose:

Preis: $2 / $6 / $0,50 (Cache-Treffer) pro Million Tokens — identisch mit Grok 4.5. Die Vorhersage „keine Preisänderung“ hat sich bestätigt.

Kontext: 500K Tokens, identisch mit Grok 4.5.

Größe: weiterhin offiziell nicht bekannt gegeben. In der Modellkarte ist keine Parameteranzahl angegeben, daher bleibt Musks 1,5T-Angabe die beste verfügbare Behauptung, jedoch keine bestätigte Spezifikation. Die 2T-Zahl, die in früher Berichterstattung kursierte, war eine Fehlzuschreibung der 2,1T von Grok 4.7.

Die unabhängige Zahl — 61 im Artificial Analysis Intelligence Index

Die erste Drittanbieter-Messung ist da, und sie ist eine gute. Artificial Analysis bewertet Grok 4.6 mit 61 auf seinem Intelligence Index — gleichauf mit GPT-5.6 Sols Max-Reasoning-Konfiguration, einen Punkt hinter Claude Fable 5 (62), zwei hinter Claude Opus 5 (63) und vor Kimi K3 (60). Das ist ein Sprung um fünf Punkte gegenüber den 56 von Grok 4.5, was ein großer Gewinn für ein Post-Training-Refresh ist.

Zwei Einschränkungen sind mit der Zahl verbunden. Der Index ist ein zusammengesetzter Wert, und die einzelnen Dimensionen fallen gemischter aus. Und Grok 4.6 startet langsam: eine Zeit von 42 Sekunden bis zum ersten Token gegenüber einem Median von rund 2,9 Sekunden in seiner Preisklasse und etwa 68 Ausgabe-Token pro Sekunde – langsamer als der Klassendurchschnitt. Für einen langlaufenden Agenten ist das Rauschen, aber für interaktiven Chat ist es das gesamte Erlebnis.

An der Pareto-Grenze von Intelligenz und Kosten sieht das Bild schmeichelhaft aus: etwa 0,84 $ pro Aufgabe, wobei eine typische AA-Briefcase-Workload in etwa 53 Runden und ~0,5 Mrd. Eingabetokens erledigt wird, gegenüber ~103 Runden und ~2 Mrd. für Claude Opus 5 Max. Das macht es zu einem legitimen Frontier-Schnäppchen, nicht nur zu einem billigen.

Was ist noch vom Anbieter angegeben?

Die Launch-Behauptungen von SpaceXAI – „Intelligenz vergleichbar mit GPT-5.6 Sol und Claude Fable 5“, Verbesserung gegenüber Grok 4.5 bei jeder aufgeführten Evaluation, zurückgeführt auf „einen längeren ergänzenden Trainingslauf, stärkere technische Daten und erweitertes bestärkendes Lernen“ – sind Angaben des Anbieters und noch nicht unabhängig verifiziert. Die Launch-Benchmark-Tabelle (CursorBench, FrontierCode, APEX-Agents, Terminal-Bench und die beworbene Elo-Zahl von 1.753 auf GDPval-AA v2) stammt von xAI; keine dieser Zahlen wurde bisher von einem Labor reproduziert, das das Modell nicht verkauft.

Die erste Drittanbieter-Messung ist da (vorläufig)

Das bislang einzige unabhängige Arena-Ergebnis ist vorläufig, aber real. LMArena listet Grok 4.6 (als grok-4.6-high) auf Platz #43 seiner Text-Gesamtrangliste mit 1.464 Elo bei 2.448 Stimmen – als vorläufig markiert und vier Punkte unter dem Debüt von Grok 4.5 (1.468). Die Stichprobe ist zu klein für die von LMArena geführte Frontier-Tabelle, die eine über zwei Wochen konstante Punktzahl erfordert.

Die Agenten-Bestenliste der Live-Sitzungen wurde noch nicht veröffentlicht. Wenn es so weit ist, wird sie die erste Ablesung sein, gegen die nicht im Voraus optimiert werden kann.

Die Preismathematik

Bei 2 $/6 $ ist Grok 4.6 mit Abstand die günstigste Frontier-API der aktuellen Generation. Gegenüber GPT-5.6 Sol für 5 $/30 $ ist der Input 60 % günstiger und der Output 80 % günstiger – und da die Lücke beim Output größer ist, unterschätzt das Marketing-Framing „halber Preis“ die Ersparnis bei output-intensiven Codierungs-Workloads.

Das Kleingedruckte: Anfragen mit mehr als 200.000 Eingabe-Tokens wechseln in eine Preisstufe von 4 $ / 12 $ / 1 $, und eine schnellere Variante kostet das Doppelte. Beim Wechseln bewegt sich die Rechnerei kaum — Grok 4.5 und Grok 4.6 teilen sich Preis und Kontext, der Wechsel zwischen ihnen ist also eine Konfigurationsänderung und keine Budgetentscheidung.

Da OrcaRouter die Listenpreise der Anbieter ohne Aufschlag (0 %) direkt durchreicht, sind die 2 $/6 $ auf einem grok-4.6-Endpoint SpaceXAIs eigene Zahl und kein Wiederverkaufspreis – eine Preissenkung des Anbieters würde noch am selben Tag hier ankommen, und das Failover auf einen zweiten Anbieter ist eine Routing-Regel und keine Beschaffungsmaßnahme.

Grok 4.7 und Grok 5 sind immer noch vorn.

Grok 4.7 ist der nächste Schritt, und Musks Beschreibung ist unverändert: „das 2.1T-Modell", besser als Grok 4.6 „in jeder Hinsicht, außer dass es etwas langsamer zu bedienen ist." Am 5. August gab er an, es sei noch drei bis vier Wochen entfernt, was Ende August oder Anfang September ergibt. Diese Zeitangabe stammt von Musk und hat sich bei jeder Nennung weiter nach hinten verschoben, also behandelt sie als Richtwert.

Grok 5 liegt zum Jahresende vor, trainiert — laut dem Earnings Call vom 4. August — auf „praktisch allen Daten, die SpaceX je generiert hat."

Was als Nächstes zu prüfen ist

Vier Dinge werden das Bild konkretisieren, und jedes davon ist derzeit noch offen.

Die LMArena-Agenten-Bestenliste, Stand 13. August unveröffentlicht.

• Eine Reproduktion der Coding- und Agentic-Zahlen durch Dritte — DeepSWE, CursorBench, APEX-Agents von jemandem, der das Modell nicht verkauft.

• Der tatsächliche Preis und die Latenz der schnelleren Variante, sobald sie allgemein verfügbar ist.

• Ob Grok 4.7s Zeitplan für Ende August Bestand hat, angesichts dessen, dass jedes konkrete Datum bisher um ein paar Tage nach hinten abgerutscht ist.

Und der, der für eine Entscheidung wirklich zählt: Ihre eigene Arbeitslast. Eine Leaderboard-Position ist eine Hypothese über Ihre Aufgabe, kein Ergebnis dafür.

Häufig gestellte Fragen

Wann wurde Grok 4.6 tatsächlich veröffentlicht? Am 12. August 2026 über die SpaceXAI-API sowie in Grok Build, Cursor und der Grok-Bot-App. Musks Ziel vom 27. Juli („ungefähr der 7. August“) verzögerte sich um fünf Tage; die Formulierung „nächste Woche“ aus der Telefonkonferenz zu den Quartalszahlen am 4. August war das zutreffende Zeitfenster.

Was kostet Grok 4.6?$2 / $6 / $0,50 pro Million Tokens — identisch mit Grok 4.5 und weit unter den $5/$30 von GPT-5.6 Sol. Über 200K Eingabe-Tokens steigt es auf $4 / $12 / $1, und eine schnellere Variante kostet das Doppelte.

Ist Grok 4.6 ein 2T-Modell? Es wurde keine Parameterzahl veröffentlicht. Musks 1,5T-Angabe bleibt die beste verfügbare (unbestätigte) Behauptung; die kursierende 2T-Zahl war Grok 4.7s 2,1T, die fälschlich 4.6 zugeschrieben wurde.

Ist Grok 4.6 so gut wie GPT-5.6 Sol? Beim Artificial Analysis Intelligence Index liegen beide bei 61 (Konfiguration mit maximalem Reasoning). Der Anbieter behauptet, dass es mit GPT-5.6 Sol und Claude Fable 5 vergleichbar ist. Es ist deutlich langsamer bei der Zeit bis zum ersten Token und weitaus billiger; die agentischen Fortschritte müssen noch unabhängig verifiziert werden.

Wo dich das hinstellt

Der praktische Schritt ist unverändert gegenüber der Vorabversion dieser Seite. Wenn Ihr Code bereits über einen OpenAI-kompatiblen Endpoint mit Grok 4.5 kommuniziert, ist Grok 4.6 eine Konfigurationsänderung zum gleichen Preis – tauschen Sie den Modellstring aus, behalten Sie die Budgetzeile bei und führen Sie Ihre Evaluierungen erneut aus, da der Build neu ist. Falls nicht, macht ein einzelner Endpoint mit Pass-through-Pricing ein neues Frontier-Modell umschaltbar, ohne einen Produktionspfad auf die Benchmarks der ersten Woche zu verwetten – genau das sind diese vorläufigen Arena-Zahlen.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert