
Grok 4.5 vs. GPT-6 Astra: Sechsmal der Listenpreis, dreimal die Rechnung
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Stellt man Grok 4.5 und GPT-6 Astra auf ihren Preislisten nebeneinander, wirkt die Lücke absurd: 2,00 $ gegenüber 10,00 $ pro Million Eingabe-Token, 6,00 $ gegenüber 50,00 $ pro Million Ausgabe-Token. Lässt man dieselben beiden durch den Intelligence Index von Artificial Analysis laufen, verengt sich die Lücke auf etwas, worüber ein Team tatsächlich streiten kann – 1,04 $ pro abgeschlossener Aufgabe gegenüber 3,26 $. Der Listenpreis-Multiplikator beträgt das 5-Fache bei der Eingabe und das 8,3-Fache bei der Ausgabe. Der Rechnungs-Multiplikator, gemessen an realen Token-Zahlen, liegt bei etwas mehr als dem 3-Fachen. Und die Dimension, in der sich diese beiden Modelle am stärksten unterscheiden, ist keine von beiden. Es ist die Wartezeit auf das erste Token, wobei die unabhängige Messung 10,94 Sekunden gegenüber 342,30 Sekunden beträgt.
Das ist das gesamte Duell in einem Absatz, und deshalb ist diese Seite keine Krönung für die eine oder andere Seite. GPT-6 Astra ist das intelligentere Modell – mit einem klaren und reproduzierbaren Vorsprung. Grok 4.5 ist das günstigere – mit einem Vorsprung, der real, aber deutlich kleiner ist, als seine Preisliste suggeriert. Alles andere – Geschwindigkeit, Token-Effizienz, Kontext, die Coding-Benchmarks – spaltet sich entweder auf, endet unentschieden oder stellt sich als mit zwei verschiedenen Maßstäben gemessen heraus.
Keines davon ist ein neues Modell
Es lohnt sich, das klar zu sagen, denn viele Vergleichsseiten lesen sich, als wären beide erst letzte Woche aufgetaucht.
xAI veröffentlichte Grok 4.5 am 8. Juli 2026. Es basiert auf der V9-Grundlage mit 1,5 Billionen Parametern und wurde gemeinsam mit Cursor anhand von Daten aus Entwickler-Sitzungen und nicht nur anhand statischen Codes trainiert, worauf sein Ruf im Bereich agentisches Codieren zurückgeht. Es verfügt über ein Kontextfenster von 500.000 Token. Die eigene Modellliste des Anbieters führt es bis heute auf, neben zwei Nachfolgern – xAI hat seitdem Grok 4.6 und Grok 4.7 veröffentlicht –, betrachte Grok 4.5 daher als die $2/$6-Stufe der Grok-Reihe und nicht als ihr Spitzenmodell.
OpenAI kündigte GPT-6 Astra am 3. September 2026 an, mit einer stufenweisen Einführung in den folgenden Tagen, und es bleibt das Flaggschiff von OpenAI: ein Kontextfenster von 1 Mio. Token (OrcaRouters Katalog listet 1.050.000 Eingabe- und 128.000 maximale Ausgabe-Token), ein Wissensstichtag vom 30. April 2026 und eine klare Ausrichtung auf langfristig angelegte agentische Arbeit – Computernutzung, Recherche, wissenschaftliche und Cybersicherheitsaufgaben. Nach OpenAI-eigener Darstellung ist es das erste Modell, das die Cybersicherheitsschwelle „Critical“ überschreitet, weshalb der Unternehmenszugriff standardmäßig deaktiviert ist, bis ein Administrator ihn aktiviert.
Beide sind über die APIs ihrer Anbieter allgemein verfügbar. Keines von beiden wird derzeit eingeführt. Das Einzige, was sich diese Woche bewegt hat, ist die Produktfamilie rund um eines der beiden, und das kommt am Ende dieses Beitrags, weil es eher die Empfehlung als den Vergleich verändert.
Die Tarifkarten, einschließlich der Stufe, die niemand nennt
• Eingabe, kurzer Kontext — Grok 4.5 $2,00 pro 1 Mio. vs. GPT-6 Astra $10,00 pro 1 Mio.
• Ausgabe, kurzer Kontext — Grok 4.5 6,00 $ pro 1 Mio. vs. GPT-6 Astra 50,00 $ pro 1 Mio.
• Zwischengespeicherte Eingabe — Grok 4.5 0,30 $ pro 1 Mio. vs. GPT-6 Astra 1,00 $ pro 1 Mio.
• Langkontext-Eingabe — Grok 4.5 4,00 $ pro 1M vs. GPT-6 Astra 20,00 $ pro 1M
• Langkontext-Ausgabe — Grok 4.5 12,00 $ pro 1 Mio. vs. GPT-6 Astra 75,00 $ pro 1 Mio.
• Kontextfenster — Grok 4.5 500.000 Token vs. GPT-6 Astra 1.000.000 Token
Die entscheidende Klausel ist die, die fast keine Vergleichsseite abdruckt. Bei Grok 4.5 wird die gesamte Anfrage zum höheren Tarif neu berechnet, sobald der Prompt einer Anfrage 200.000 Tokens erreicht – die Dokumentation von xAI stellt ausdrücklich klar, dass sie „für alle Tokens in der Anfrage zum höheren Satz abgerechnet wird“, nicht nur für die Tokens jenseits der Grenze. Das 500.000-Token-Fenster ist also real, doch ungefähr die oberen 60 % davon werden doppelt abgerechnet. Die Preisseite von OpenAI für Astra zeigt dieselbe zweispaltige Kurz-/Lang-Struktur, ohne anzugeben, wo der Übergang liegt. Betrachten Sie daher die Spalte für den langen Kontext als diejenige, die gilt, sobald Sie im großen Maßstab arbeiten, und prüfen Sie die Grenze anhand Ihrer eigenen Rechnung.

Auf Astras Zahlen kommen zwei Multiplikatoren auf Service-Ebene obendrauf: Batch und Flex laufen zum halben Standardtarif, der Fast-Modus zum doppelten Satz – 20,00 $ Eingabe und 100,00 $ Ausgabe bei kurzem Kontext. Grok 4.5 hat keine Batch-Stufe in xAIs Tabelle; seine Hebel sind der Cache-Rabatt und Priority Processing bei 2x.
Unsere eigene Haltung zu all dem ist bewusst langweilig: OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, sodass beide obenstehenden Tarifkarten bei uns am selben Tag live sind, an dem der jeweilige Anbieter sie ändert, und zwischengespeicherte Tokens werden zum Cache-Tarif des Anbieters statt zum Vollpreis abgerechnet. Es gibt keine zweite Zahl, die abgeglichen werden müsste.
Was eine Workload tatsächlich kostet
Die Listenpreise sind hier ein schlechter Maßstab, denn die beiden Modelle verbrauchen nicht die gleiche Anzahl an Tokens, um dieselbe Aufgabe zu erledigen. Nehmen wir eine Coding-Agent-Aufgabe mit einem Repository-Kontext von 120.000 Tokens und einer Antwort von 25.000 Tokens. Bei Grok 4.5 sind das 0,24 $ für den Input und 0,15 $ für den Output, also 0,39 $. Bei GPT-6 Astra sind es 1,20 $ und 1,25 $, also 2,45 $. Eine Differenz um den Faktor 6,3.
Nun schiebe den Prompt über die Long-Context-Grenze hinaus: 300.000 Token Eingabe, 20.000 Ausgabe. Grok 4.5 berechnet $1,20 plus $0,24, also $1,44. GPT-6 Astra berechnet $6,00 plus $1,50, also $7,50. Die Lücke schrumpft auf das 5,2-Fache, weil beide Anbieter den Eingabe-Tarif verdoppeln und sich Astras Ausgabe-Vielfaches in der obersten Tarifstufe verringert.
Keines von beidem ist das, was Artificial Analysis misst, und deren Zahl ist die nützlichere. Beim vollständigen Intelligence Index betragen die durchschnittlichen Kosten pro abgeschlossener Aufgabe 1,04 $ für Grok 4.5 bei hohem Aufwand und 3,26 $ für GPT-6 Astra bei maximalem Aufwand. Der Grund, warum der Faktor auf das 3,1-Fache sinkt, wenn der Eingabepreis um den Faktor 5 auseinanderliegt, ist die Token-Effizienz: Über den gesamten Index hinweg erzeugte Grok 4.5 77 Mio. Ausgabe-Token und Astra 60 Mio. Astra ist das prägnantere Modell und schließt damit einen Teil der Lücke, die es beim Preis aufgerissen hat. Wenn Sie in einem Budgetdokument bisher „fünfmal günstiger“ zitiert haben, ist 3x die Zahl, die auf der Rechnung auftauchen wird.
Geschwindigkeit ist Gleichstand. Latenz nicht.
Das ist der Befund, der uns überrascht hat, und er widerspricht der Intuition, dass das günstige Modell das schnelle ist.
Artificial Analysis misst Grok 4.5 mit 55 Ausgabe-Tokens pro Sekunde und GPT-6 Astra mit 58. Das ist ein Unterschied von 5 % bei derselben Index-Revision, und die eigene Zusammenfassung von AA beschreibt beide als langsamer als der Durchschnitt – der Vergleichsmedian liegt bei 74 Tokens pro Sekunde. Wenn der Durchsatz Ihr Auswahlkriterium ist, lassen sich diese beiden Modelle nicht trennen. Sagen Sie es klar, anstatt einen Sieger zu konstruieren: Bei der einen Geschwindigkeitszahl, die für beide auf dieselbe Weise gemessen wurde, sind sie gleichauf.
Die Latenz trennt sie drastisch. AA beziffert die Zeit bis zum ersten Antwort-Token bei Grok 4.5 auf 10,94 Sekunden bei 20,01 Sekunden Ende-zu-Ende; GPT-6 Astra auf 342,30 Sekunden bei 350,91 Sekunden Ende-zu-Ende. Das ist rund 31-mal so viel, und bei einer synchronen Anfrage ist es der Unterschied zwischen einem Lade-Spinner und einer Kaffeepause.
Zwei ehrliche Einschränkungen, bevor irgendjemand darauf budgetiert. Erstens sind das Zahlen, die das Reasoning einschließen – AA' „time to first answer token“ zählt bewusst die Denkzeit des Modells mit –, sie beschreiben also eine anspruchsvolle Aufgabe, nicht einen Chat-Turn. Zweitens sind sie nicht auf gleichen Effort abgestimmt: Astras veröffentlichter Eintrag liegt bei max effort, der von Grok 4.5 bei high, und eine Effort-Einstellung ist genau der Regler, der diese Zahl bewegt. OrcaRouters eigene Auflistung für GPT-6 Astra zeigt über Live-Traffic hinweg eine p50-Zeit bis zum ersten Token von 8,31 Sekunden und eine p95 von 10,00 Sekunden – ein völlig anderer Messpunkt: erstes Token bei echten Produktionsaufrufen, nicht erstes Antwort-Token bei einer Benchmark-Aufgabe. Die beiden sind nicht vergleichbar und sollten nicht im selben Satz als Vergleich genannt werden.

Coding-Benchmarks: Prüfe die Version, bevor du sie zitierst
Wenn du nach diesem Duell suchst, findest du Grok 4.5 mit 83,3 % auf Terminal-Bench 2.1 gegen GPT-6 Astra mit 57,9 % auf Terminal-Bench 4.0. Das sind unterschiedliche Benchmarks, die denselben Namen tragen. Sie lassen sich nicht vergleichen, und die Vergleichsseiten, die sie einander gegenüberstellen, sagen dir nichts.
Die meisten der von beiden Anbietern veröffentlichten Coding-Zahlen haben dieses Problem. xAIs Datenblatt für Grok 4.5 meldet SWE-bench Pro 64,7 %, Terminal-Bench 2.1 83,3 %, DeepSWE 1.0 62,0 % und DeepSWE 1.1 53 %. OpenAIs Datenblatt für Astra meldet Terminal-Bench 4.0 57,9 %, OSWorld 2.0 72,6 %, FrontierMath Tier 4 97,6 % und ARC-AGI-3 99,9 %. Alles vom Anbieter selbst gemeldet, und fast keine davon überschneiden sich.
Es gibt eine Stelle, an der die beiden tatsächlich auf demselben Harness aufeinandertreffen: DeepSWE v1.1 von Datacurve, das jedes Modell durch dasselbe mini-swe-agent-Scaffold bei 113 originalen, kontaminationsfreien Aufgaben laufen lässt. Dort erreicht GPT-6 Astra 74,1 % bei ungefähr 6,52 $ pro Aufgabe, während Grok 4.5 auf 53 % kommt. Das ist das sauberste einzelne Ergebnis auf dieser Seite, und es spricht entschieden für Astra. Ein weiterer Vorbehalt speziell zu Grok 4.5: Der CursorBench-Wert von xAI wurde aus dem öffentlichen Vergleich ausgeschlossen, nachdem festgestellt wurde, dass eine frühere Codebasis in das Training gelangt war; betrachten Sie daher jede CursorBench-Zahl für dieses Modell als unbrauchbar.
Agentisches Verhalten und Tool-Aufruf
Die beiden nehmen unterschiedliche Wege zum selben Ziel, und der Unterschied ist architektonisch bedingt und nicht eine Frage der Punktzahl.
Die entwicklernahen Funktionen von GPT-6 Astra gehen davon aus, dass Sie einen Orchestrator bauen. Es unterstützt asynchrones Tool-Calling, sodass das Warten auf ein Tool das Modell nicht daran hindert, andere Arbeit fortzusetzen; Steuerung mitten in der Aufgabe über WebSockets, sodass ein laufender Durchlauf umgelenkt werden kann, ohne ihn neu zu starten; sowie einen mitten im Gespräch anpassbaren Reasoning-Aufwand. In Codex fügt es einen Mechanismus zur Kontexterhaltung hinzu, der Notizen über Kontextfenster hinweg beibehält, während früherer Kontext durchsuchbar bleibt. OpenAIs eigene Systemkarte hält Berichten zufolge fest, dass das Modell schwieriger zu überwachen ist als sein Vorgänger, was ein Grund ist, Tool-Call-Protokolle und den Systemzustand – nicht die Erzählung des Modells – als Ihre Audit-Nachweise zu behandeln.
Grok 4.5s agentische Story dreht sich weniger um neue Primitive und mehr darum, wo es trainiert wurde. Das Co-Training mit Cursor an echten Multi-File-Editing- und Debugging-Sessions ist das, was xAI für seine Token-Effizienz bei Software-Aufgaben verantwortlich macht, und es ist der Grund, warum das Modell als Standard in Coding-Oberflächen auftaucht und nicht als generalistisches Flaggschiff. Function Calling, strukturierte Ausgabe, Streaming und Prompt-Caching werden alle unterstützt; Tool Calling folgt der OpenAI-kompatiblen Form, weshalb es in einen bestehenden Client zu integrieren eine Änderung der Base-URL ist.
Es gibt keinen gemeinsamen unabhängigen agentischen Benchmark, in dem beide bei vergleichbarem Aufwand auftreten, also werden wir hier keinen Sieger erfinden. Was sich sagen lässt, ist, dass Astras Tool-Calling-Oberfläche für Arbeit mit langem Zeithorizont die ausdrucksstärkere der beiden ist und die Token-Ökonomie pro Aufgabe von Grok 4.5 für High-Volume-Arbeit die attraktivere ist.
Wähle Grok 4.5, wenn
• Sie führen Arbeiten mit hohem Volumen oder hoher Frequenz durch, bei denen die Kosten pro Aufgabe die Entscheidung bestimmen und ein Wert von 39 im AA Intelligence Index Ihre Qualitätslatte überschreitet.
• Ihre Prompts liegen unter 200.000 Tokens. Genau dort ist der Preisvorteil von Grok 4.5 am größten und die Neubepreisung für langen Kontext wird nie ausgelöst.
• Du willst, dass ein Cache-Rabatt echte Arbeit leistet. Bei 0,30 $ pro Million gecachter Eingabe-Tokens gegenüber Astras 1,00 $ werden Workloads mit wiederholtem Präfix – lange System-Prompts, geteilter Repo-Kontext – schnell günstig.
• Sie benötigen bei schwierigen Aufgaben eine First-Token-Latenz von unter einer Minute und können keine mehrminütige Wartezeit hinnehmen.
Wähle GPT-6 Astra, wenn
• Die Aufgabe ist das Produkt, und die Rechnung ist ein Rundungsfehler neben einer falschen Antwort. Vierzehn Indexpunkte an diesem Ende der Kurve sind ein echter Unterschied in der Leistungsfähigkeit, kein Marketing.
• Du arbeitest wirklich jenseits von 500.000 Tokens. Astras Kontextfenster ist ungefähr doppelt so groß wie das von Grok 4.5, und es ist das einzige der beiden, das es ohne eine Preisänderungsklausel erreicht.
• Sie benötigen Computer-Nutzung, Deep Research oder die Cybersicherheits-Positionierung – einschließlich der unternehmensseitig standardmäßig deaktivierten Kontrollen, die mit der Critical-Schwelle von OpenAI einhergehen.
• Sie schreiben Orchestrator-Code, der asynchrone Tool-Aufrufe und Steuerung während des Laufs statt eines direkten Anfrage-Antwort-Aufrufs wünscht.
Was sich diese Woche bewegt hat – und warum das die Empfehlung ändert
Am 22. September 2026 veröffentlichte OpenAI GPT-6 Sol und GPT-6 Luna zu 2,00 $/10,00 $ bzw. 0,10 $/0,50 $ pro Million Tokens und bezeichnete die Preise als dauerhaft statt als Werbeaktion. Sol ist das Mittelklasse-Modell für Coding und Analyse und kostet damit etwa ein Fünftel von Astras Eingabepreis.
Das ist für genau diese Entscheidung von Bedeutung. Wenn der Grund, aus dem du Grok 4.5 gegen GPT-6 Astra abgewogen hast, der Preis war, ist der ehrliche Vergleich auf OpenAI-Seite nicht mehr Astra – Astra ist das Flaggschiff, und Sol besetzt inzwischen die Stufe, in der Grok 4.5 tatsächlich konkurriert. Grok 4.5 unterbietet Sol beim Output weiterhin ($6.00 gegenüber $10.00) und zieht beim Input gleich ($2.00 jeweils), ist also nicht verdrängt; aber ein vor dieser Woche verfasster Vergleich stellte ein Value-Modell einem Flaggschiff gegenüber und nannte das Ergebnis eine Preisgeschichte.
Auf der Seite von xAI gilt dasselbe: Die eigene Modellliste von xAI führt grok-4.6 und grok-4.7 neben grok-4.5, sodass Grok 4.5 eine Option in einer Familie ist und nicht die aktuelle Spitze.

Was das eigentliche Argument für Routing statt Auswahl ist. Der Zwei-Modell-Stack, der in Erfahrungsberichten aus der Praxis immer wieder auftaucht – den Großteil an das günstige Modell senden, den schwierigen Tail an das teure eskalieren –, ist eine Routing-Entscheidung, und sie lässt sich als Konfiguration statt als Rewrite ausdrücken. OrcaRouter stellt beide Modelle hinter eine API und einen Schlüssel, reicht den Anbieter-Listenpreis mit 0 % Aufschlag durch, bietet automatisches Failover über Anbieter hinweg und eine Routing-DSL, mit der Sie Arbeit unterhalb eines Schwellenwerts an grok/grok-4.5 senden und zu openai/gpt-6-astra eskalieren können, wenn eine Aufgabe fehlschlägt oder eine Größengrenze überschreitet. Sie können den teuren Pfad mit einem kleinen Ausschnitt des Traffics ausprobieren, ohne dafür eine Produktions-Pipeline aufs Spiel zu setzen.
Die Kurzfassung
GPT-6 Astra ist das bessere Modell. Das ist nicht knapp, und diese Seite wäre wertlos, wenn sie etwas anderes vorgeben würde – 53 gegenüber 39 bei derselben Index-Revision, 74,1 % gegenüber 53 % beim einzigen Coding-Benchmark, den beide absolviert haben.
Grok 4.5 ist das günstigere Modell, aber um das 3,1-Fache pro abgeschlossener Aufgabe statt um das 5- bis 8,3-Fache, das seine Preisliste nahelegt, weil Astra weniger Tokens dafür verbraucht. Und bei der einen Geschwindigkeitszahl, die für beide identisch gemessen wurde, liegen sie gleichauf.
Es geht nicht darum, welches Modell gewinnt. Es geht darum, ob ein Abstand von 14 Punkten im Index bei Ihrer spezifischen Workload rund den dreifachen Rechnungsbetrag wert ist — und ob die Antwort für jede Anfrage, die Sie senden, dieselbe ist.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
