Hero-Titelkarte für den Grok-4.5-Explainer: die Schlagzeile „Was ist Grok 4.5?“ über der Unterüberschrift „Das V9-Flaggschiff, das mit Token-Ökonomie punktete, nicht mit Spitzenwerten“, dann drei Karten mit den Aufschriften „Kontext – 500K Token“, „Listenpreis pro 1M – 2,00 $ / 6,00 $“ und „AA Intelligence – 39“, dazu eine Fußzeile „Grok 4.5 veröffentlicht am 8. Juli 2026. Preis laut xAI-Dokumentation; AA-Wert laut Artificial Analysis Intelligence Index v4.3.2.“ und das OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Was ist Grok 4.5? Das V9-Flaggschiff, das Token-Ökonomie statt Spitzenergebnissen verkaufte

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Grok 4.5 ist ein Mixture-of-Experts-Reasoning-Modell mit 1,5 Billionen Parametern vom Anbieter – dem Unternehmen, das inzwischen unter der Marke SpaceXAI vertreibt und vermarktet –, veröffentlicht am 8. Juli 2026. Es nimmt Text und Bilder entgegen, gibt Text zurück, verfügt über ein Kontextfenster von 500.000 Token und kostet 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar pro Million Ausgabe-Token. Es war das Modell, das „Token pro abgeschlossener Aufgabe“ auf die Vorderseite einer Launch-Folie brachte, und es ist das Modell, auf dem das Labor seitdem zwei neuere Flaggschiffe aufgebaut hat.

Der letzte Satz ist der ganze Grund, warum diese Seite geschrieben werden muss. Suche nach „Grok 4.5“ und du bekommst Launch-Berichterstattung von Juli: die Cursor-Partnerschaft, das „Opus-Klasse“-Zitat, die 80-Token-pro-Sekunde-Behauptung. Was du nicht bekommst, ist eine klare Antwort auf die Frage, die ein Entwickler Ende September tatsächlich hat: nämlich, ob Grok 4.5 es noch wert ist, in irgendetwas eingebunden zu werden, wenn Grok 4.6 und Grok 4.7 zum gleichen Listenpreis existieren. Diese Seite ist also ein Referenzeintrag, kein Nachrichtenartikel: was das Modell ist, wo es steht, was es messbar gut macht, was es messbar schlecht macht und wer etwas anderes wählen sollte. Nichts hier wird als Launch dargestellt, denn es ist keiner.

Zur Quellenlage, da sie auf einer Seite wie dieser mehr als üblich zählt: Jede unten stehende Zahl ist danach gekennzeichnet, woher sie stammt. Zahlen, die xAI über sein eigenes Modell veröffentlicht hat, sind als vom Anbieter gemeldet gekennzeichnet. Zahlen von Artificial Analysis sind unabhängige Messungen, direkt abgelesen von der Modellseite am 23. September 2026. Wo eine Zahl nicht anhand einer Primärquelle bestätigt werden konnte, vermerkt die Seite dies, statt zu schätzen.

Wo Grok 4.5 in seiner eigenen Familie steht – und es ist nicht die Spitze

Der mit Abstand häufigste Fehler in der Berichterstattung über Grok 4.5 ist, ihn als Flaggschiff zu behandeln. Das war er etwa fünf Wochen lang. Seitdem hat xAI am 12. August 2026 Grok 4.6 und Anfang September Grok 4.7 veröffentlicht, die beide weiterhin mit 2,00 $ bzw. 6,00 $ pro Million Tokens bepreist sind. Grok 4.5 ist jetzt die Mitte des Stacks: leistungsfähiger als die günstige Stufe, zwei Generationen hinter der Spitze und – das ist der entscheidende Punkt – das einzige Modell in der aktuellen Grok-Reihe, dessen Tarif für gecachte Eingaben günstiger ist als der seiner Nachfolger. Grok 4.5 kostet für gecachte Eingaben 0,30 $ pro Million Tokens; Grok 4.6 und Grok 4.7 kosten beide 0,50 $, laut xAIs eigener Preistabelle.

Hier ist die Aufstellung, wie die Preisdokumentation des Anbieters sie derzeit aufführt, alle Angaben pro Million Tokens und alle vom Anbieter veröffentlicht:

• Grok 4.20 (drei Varianten: Multi-Agent, Reasoning, Non-Reasoning) — 1 Mio. Kontext, $1,25 Eingabe / $2,50 Ausgabe, $0,20 gecacht, veröffentlicht am 31. März 2026

• Grok 4.3 — 1 Mio. Kontext, 1,25 $ Eingabe / 2,50 $ Ausgabe, 0,20 $ gecacht, plus Batch-Rabatt; der günstigste Weg, eine Million Token Grok-Kontext zu bekommen

• Grok 4.5 — 500K Kontext, $2,00 Eingabe / $6,00 Ausgabe, $0,30 gecacht, veröffentlicht am 8. Juli 2026

• Grok 4.6 — 500K Kontext, 2,00 $ Eingabe / 6,00 $ Ausgabe, 0,50 $ für Cache, veröffentlicht am 12. August 2026

• Grok 4.7 — 500K Kontext, 2,00 $ Eingabe / 6,00 $ Ausgabe, 0,50 $ zwischengespeichert, veröffentlicht Anfang September 2026

• Grok Build 0.1 — 256K Kontext, $1,00 Eingabe / $2,00 Ausgabe, eher ein Coding-Spezialist als ein allgemeines Modell

Zwei Dinge ergeben sich aus dieser Liste. Erstens: Grok 4.5 wurde nicht im Preis gesenkt, als es aufhörte, das Flaggschiff zu sein – es behielt den Flaggschiff-Preis, was bedeutet, dass Grok 4.6 jetzt für dasselbe Geld ein strikt besseres Preis-Leistungs-Verhältnis bietet, es sei denn, Sie wollen speziell den günstigeren Cache-Tarif oder sind auf den 4.5-Snapshot festgelegt. Zweitens: Grok 4.5 hat den halben Kontext von Grok 4.3 und der 4.20-Familie bei doppeltem Eingabepreis. Das V9-Fundament ist der Grund: 1,5 Billionen Parameter, etwa dreimal so groß wie Grok 4.3, und ein größeres Basismodell ist es, was die Fähigkeit auf Kosten des Fensters erkauft hat.

Wenn du tatsächlich langen Kontext zu einem günstigen Preis brauchst, ist Grok 4.3 die ehrliche Antwort innerhalb dieser Familie, und Grok 4.5 ist es nicht. Dieser Kompromiss – Leistungsfähigkeit gegen Kontextfenster – ist die entscheidende Entscheidung in der Grok-Reihe, und es lohnt sich, ihn klar auszusprechen, statt vorzugeben, die neuere Nummer sei in allem besser.

Das Datenblatt

Screenshot of the xAI developer documentation model page for grok-4.5, showing the model identifier and aliases grok-4.5-latest and grok-build-latest, the description 'intelligent coding model for agentic software, engineering, and workflow tasks', an At a glance block giving modalities 'Text, Image to Text' and a 500,000-token context window, capability rows for function calling, structured outputs and reasoning, and the pricing rows $2.00 input, $0.30 cached input and $6.00 output per million tokens, above a collapsed 'Higher context pricing' note about requests exceeding the 200K context window.

Dies sind die Spezifikationen, die xAI auf ihrer eigenen Modellseite veröffentlicht, nicht Schätzungen von Drittanbietern:

• Modellkennung — grok-4.5, mit den Aliasnamen grok-4.5-latest und grok-build-latest

• Modalität — Text und Bild als Eingabe, Text als Ausgabe. Bilder werden als Eingabe akzeptiert; das Modell generiert sie nicht

• Kontextfenster — 500.000 Token, zwischen Prompt und Antwort geteilt statt 500K Eingabe plus einem separaten Ausgabekontingent

• Lizenz — proprietär. Es gibt keine offenen Gewichte und keinen herunterladbaren Checkpoint; Sie erreichen Grok 4.5 über eine API oder über die eigenen Produkte des Anbieters.

• Listenpreis — 2,00 $ pro Million Input-Tokens, 6,00 $ pro Million Output, 0,30 $ für zwischengespeicherte Eingabe

• Preisgestaltung für langen Kontext — bei 200.000 Prompt-Tokens und darüber steigt der Tarif auf 4,00 $ Eingabe / 12,00 $ Ausgabe / 0,60 $ Cache, und der höhere Tarif gilt für jedes Token in der Anfrage, nicht nur für die Tokens jenseits des Schwellenwerts. Dies ist das mit Abstand teuerste Detail auf der Seite, das man übersehen kann

• Reasoning-Steuerung — vier Stufen, niedrig, mittel, hoch und extra hoch, standardmäßig hoch. Reasoning kann nicht vollständig deaktiviert werden, und Reasoning-Tokens werden als Ausgabe-Tokens abgerechnet

• Unterstützung für Tools und Formate — Funktionsaufrufe und strukturierte Ausgaben werden nativ unterstützt. Serverseitige Suchwerkzeuge werden zusätzlich zur Token-Nutzung abgerechnet; die aktuellen Kosten pro Aufruf konnten wir auf der Modellseite des Anbieters nicht bestätigen, nur dass es sie gibt

• Rate Limits — 150 Anfragen pro Sekunde und 50 Millionen Tokens pro Minute

• Batch API – wird auf Grok 4.5 nicht unterstützt, anders als bei Grok 4.3

• Bereitstellungsregionen — us-east-1 und us-west-2 zum Start. Europäische Verfügbarkeit war am ersten Tag ausdrücklich nicht gegeben und wurde vom Anbieter als voraussichtlich Mitte Juli 2026 beschrieben; wir haben keine spätere Primärquellenangabe gefunden, die das genaue Datum der Inbetriebnahme bestätigt, daher ist der EU-Zeitplan hier als unbestätigt zu betrachten

Eine Diskrepanz, die es wert ist, festgehalten statt beschönigt zu werden: Der eigene Katalogeintrag von OrcaRouter für grok/grok-4.5 weist einen Cache-Lese-Tarif von 0,50 $ pro Million aus, was eher dem entspricht, was xAI für Grok 4.6 und Grok 4.7 berechnet, als den 0,30 $, die die Preistabelle des Anbieters für Grok 4.5 zeigt. Die Dokumentation des Anbieters ist die maßgebliche Quelle für den Preis; unsere Seite scheint den Cache-Tarif des Nachfolgers zu führen, und es wurde entsprechend gekennzeichnet, statt hier stillschweigend wiederholt zu werden.

Worin Grok 4.5 messbar gut ist

Die zentrale Behauptung beim Launch war Token-Ökonomie, und sie ist die eine Behauptung auf der Launch-Seite, hinter der ein Mechanismus steht und nicht nur eine Punktzahl. Auf SWE-bench Pro berichtet xAI, dass Grok 4.5 durchschnittlich 15.954 Ausgabe-Tokens pro gelöster Aufgabe verbraucht – gegenüber 67.020 für Claude Opus 4.8 bei maximalem Aufwand – rund 4,2-mal weniger Tokens, um dieselbe Arbeit zu erledigen. Weniger Ausgabe-Tokens pro gelöster Aufgabe sind der Unterschied zwischen einem Modell, das günstiger ist, und einem Modell, das günstiger und schneller in Bezug auf die reale Zeit ist, weil Ausgabe-Tokens das sind, worauf man wartet. Vom Anbieter berichtet, auf dem eigenen Test-Harness des Anbieters und von keiner unabhängigen Stelle reproduziert – aber es ist eine strukturelle Behauptung, kein herausgepickter Prozentwert.

Die Benchmark-Tabelle des Anbieters, die zusammen mit dem Modell veröffentlicht wurde und daher durchweg Anbieterangaben enthält, sieht im Vergleich zu denselben Modellen so aus:

• DeepSWE 1.0 — Grok 4.5 62,0 %, hinter Claude Fable 5 mit 66,1 % und GPT-5.5 mit 64,31 %, vor Claude Opus 4.8 mit 55,75 %

• SWE-Marathon, Lösungsrate — Grok 4.5 29,0 %, vor Claude Opus 4.8 mit 26,0 % und Claude Fable 5 mit 24,0 %. Dies ist der eine Coding-Benchmark, bei dem Grok 4.5 das Feld anführte

• Terminal-Bench 2.1 — Grok 4.5 83,3 %, praktisch gleichauf mit Claude Fable 5 bei 84,3 % und GPT-5.5 bei 83,4 %, vor Claude Opus 4.8 bei 78,9 %

• DeepSWE 1.1 — Grok 4.5 53 %, hinter Claude Fable 5 mit 70 % und GPT-5.5 mit 67 %

• SWE-bench Pro — Grok 4.5 64,7 %, hinter Claude Fable 5 mit 80,4 % und Claude Opus 4.8 mit 69,2 %

Die ehrliche Interpretation ist, dass Grok 4.5 bei der Lösung von Aufgaben mit langem Zeithorizont und bei der Wirtschaftlichkeit des Abschlusses einer Aufgabe gewinnt und bei den schwierigeren Single-Shot-Coding-Benchmarks verliert. Es ist ein gutes Modell für Agentenschleifen und ein mittelmäßiges für schwierige One-Shot-Probleme – und genau diese Unterscheidung entspricht exakt dem, was die Token-Effizienz-Kennzahl vorhersagt.

A single-column scoreboard card for Grok 4.5 titled 'Grok 4.5 - the scoreboard' with six rows reading: AA Intelligence Index 39 (#52 of 212); Output speed 55.1 tok/s (#126 of 212); Time to first token 10.94 s; Context window 500K tokens; Price per 1M $2.00 / $6.00, $0.30 cached; SWE-bench Pro 64.7% (vendor). Footer: 'Price and spec rows per xAI docs; AA Index and speed per Artificial Analysis Intelligence Index v4.3.2; SWE-bench Pro vendor-reported.'

Das unabhängige Bild ist dünner, und hier muss diese Seite vorsichtig sein. Artificial Analysis führt Grok 4.5 (high) derzeit in Indexversion v4.3.2 mit einem Wert von 39 im Intelligence Index auf Rang #52 von 212 Modellen – über dem Median von 25 für vergleichbare Modelle, aber nicht an der Spitze. Wenn Sie in der Berichterstattung vom Juli einen für dieses Modell genannten Wert von 54 oder 56 gesehen haben, vergleichen Sie ihn nicht mit 39: Artificial Analysis hat den Index seit der Einführung überarbeitet, und die beiden Zahlen stammen aus unterschiedlichen Revisionen. Genau diese Art von Vergleich veralteter Zahlen macht Benchmark-Tabellen unzuverlässig, und deshalb nennt diese Seite die Indexversion zusammen mit dem Wert.

Worin Grok 4.5 messbar schlecht ist

Artificial Analysis meldet eine Ausgabegeschwindigkeit von 55,1 Token pro Sekunde, auf Platz 126 von 212 Modellen und unter dem Median von 74 — weit entfernt von den 80 Token pro Sekunde, die xAI beim Launch nannte, und noch weiter von den ~340 Token pro Sekunde, die die schnellsten aktuellen Modelle erreichen. Außerdem meldet es eine Zeit bis zum ersten Token von 10,94 Sekunden gegenüber einem Median von 3,86 Sekunden. Diese beiden Zahlen zusammen beschreiben die wahren Kosten eines Reasoning-Modells, das standardmäßig auf hoch steht und nicht abgeschaltet werden kann: Du wartest, und dann spricht es langsam. Lass die Reasoning-Stufe auf der Standardeinstellung, und Grok 4.5 wird sich wie das langsamste Modell anfühlen, das du auf dem Key hast.

Drei weitere abgewogene Nachteile, geordnet danach, wie stark sie eine Entscheidung beeinflussen sollten:

• Artificial Analysis hat Grok 4.5 als veraltet (deprecated) gekennzeichnet und gibt an, dass für es weiterhin nur der standardmäßige Workload mit 10.000 Token Eingabe benchmarkt wird. Das ist ein Drittanbieter, der Ihnen sagt, dass er aufgehört hat, das Modell, das Sie in Betracht ziehen, vollständig zu messen, und er empfiehlt stattdessen Grok 4.6. Veraltet auf einem Leaderboard bedeutet nicht, dass es über eine API nicht verfügbar ist – es bedeutet, dass die unabhängige Evidenzbasis eingefroren ist

• Es verliert die beiden Benchmarks, die hartem Single-Shot-Coding am nächsten kommen – DeepSWE 1.1 und SWE-bench Pro –, sowohl an Claude Fable 5 als auch an GPT-5.5, laut xAIs eigener Tabelle

• Es hat den halben Kontext von Grok 4.3 bei doppeltem Eingabepreis und überhaupt keine Batch-API. Wenn Ihre Workload aus der Verarbeitung langer Dokumente oder Offline-Batch-Inferenz besteht, ist Grok 4.5 das falsche Modell in seiner eigenen Familie

Zu Halluzination und Kalibrierung konnte diese Seite keine aktuelle unabhängige Zahl bestätigen. In der Berichterstattung vom Juli kursierte eine Halluzinationsrate von rund 54 %, doch wir konnten diese Zahl auf der von uns gelesenen Modellseite von Artificial Analysis nicht verifizieren, und sie erscheint auch nicht auf der Seite des Anbieters. Statt eine Zahl zu wiederholen, für die wir keine Quelle nennen können, erfassen wir sie hier als nicht gemessen.

Wer sollte Grok 4.5 wählen, und wer sollte etwas anderes wählen?

Wählen Sie Grok 4.5, wenn Sie agentische Loops betreiben, bei denen die Kosten pro abgeschlossener Aufgabe wichtiger sind als die Kosten pro Token, und Sie bereits gemessen haben, dass das Token-Ökonomie-Verhalten von V9 für Ihre Workload Bestand hat. Es ist außerdem die richtige Wahl, wenn Sie einen Snapshot aus der Grok-Familie mit einem Cache-Input-Tarif von 0,30 $ auf einem großen, stabilen, wiederholt abgerufenen Prefix benötigen – dieser Cache-Tarif ist tatsächlich günstiger als das, was Grok 4.6 und Grok 4.7 verlangen, und bei einer cache-lastigen Workload kann dieser Unterschied zwei Generationen an Leistungsfähigkeit aufwiegen.

Wählen Sie stattdessen Grok 4.6 oder Grok 4.7 für fast alles andere. Gleicher Listenpreis, gleiches 500K-Fenster, neueres Training, bessere unabhängige Bewertungen und die eigene Empfehlung von Artificial Analysis. Es gibt keine Version von „Ich will den besten Grok“, bei der die Antwort heute 4.5 lautet.

Wählen Sie Grok 4.3, wenn der Kontext der limitierende Faktor ist: 1 Mio. Tokens zu $1,25 und $2,50, mit einem Batch-Rabatt, den Grok 4.5 nicht bietet. RAG für lange Dokumente und die Analyse ganzer Repositories bleiben nach wie vor sein Terrain.

Wähle etwas außerhalb der Familie wenn du auf Spitzenwerte statt auf den Preis pro Aufgabe optimierst — Claude Fable 5 führt jeden Coding-Benchmark in xAIs eigener Vergleichstabelle an, und GPT-5.5 liegt bei DeepSWE 1.0 und 1.1 vor Grok 4.5. Wenn du offene Gewichte willst und ein kleineres Modell akzeptieren kannst, ist das eine ganz andere Anschaffung, und kein Grok-Modell kann damit konkurrieren.

Grok 4.5 ohne einen zweiten Vertrag aufrufen

Grok 4.5 ist live auf OrcaRouter zum Listenpreis von xAI, wobei der Tarif des Anbieters ohne Aufschlag durchgereicht wird — die oben genannten 2,00 $ und 6,00 $ sind also genau das, was Sie zahlen, und eine Preisänderung des Anbieters landet am selben Tag bei uns wie bei ihm. Das ist bei diesem speziellen Modell wichtiger als sonst, denn die Entscheidung, vor der die meisten Leser stehen, lautet nicht „Grok 4.5 oder nichts“, sondern „Grok 4.5 oder Grok 4.6 oder Grok 4.3“, und drei Modelle aus einer Familie zu vergleichen, ist genau das, was ein einzelner Endpunkt über 200 Modelle günstig macht. Ein Schlüssel, kein zweiter Vertrag und ein A/B-Test, der eine Änderung an einer Zeichenkette statt einer Integration ist.

Das Failover-Argument ist hier ungewöhnlich konkret. Grok 4.5 ist weiterhin routbar, wird aber von den unabhängigen Trackern nicht mehr vollständig gebenchmarkt und ist nicht länger das Flaggschiff des Anbieters – ein Modell, das man eher in einer Fallback-Kette haben möchte, statt es als einzigen Pfad zu verwenden. Automatisches Failover über Anbieter hinweg ist der Mechanismus, mit dem man es für das behalten kann, worin es gut ist, ohne eine Produktionsroute auf einen Snapshot zu setzen, den das Ökosystem bereits hinter sich zu lassen begonnen hat.

Was diese Seite nicht tun wird, ist so zu tun, als wäre die Wahl offensichtlich. Grok 4.5 ist ein gutes Modell mit einer ganz bestimmten Stärke, das zu einer Familie gehört, in der man für dasselbe Geld inzwischen ein neueres bekommt. Wenn Sie heute ganz neu anfangen, lautet die ehrliche Empfehlung Grok 4.6. Wenn Sie Grok 4.5 bereits in einer Agent-Loop laufen haben und es die Aufgaben mit den Token-Zahlen abschließt, die Sie eingeplant haben, lautet die ehrliche Empfehlung: nichts ändern und in einem Quartal neu messen.

Screenshot of the OrcaRouter model page for Grok 4.5 (grok/grok-4.5), showing the SpaceXAI provider label, the Featured badge, capability tags for Vision, Tools, JSON and Reasoning, the 500K-token context window, the $2.00 per million input and $6.00 per million output pricing rows, and the benchmark table sourced from Artificial Analysis.

Grok 4.5 lässt sich heute über OrcaRouter routen, und dasselbe gilt für Grok 4.6, Grok 4.7 und Grok 4.3. OrcaRouter gibt den Listenpreis des Anbieters ohne Aufschlag weiter, sodass eine Preisänderung des Anbieters am selben Tag bei uns ankommt, an dem sie bei ihm ankommt, und das Verschieben einer Workload zwischen zwei Grok-Modellen ist eine String-Änderung statt eines zweiten Vertrags.

In diesem Artikel verglichen4

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert