
GPT-6 Luna vs. Grok 4.6: Der Preisunterschied ist zwanzigfach, und das Fenster ist der eigentliche Unterschied
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Setzt man GPT-6 Luna und Grok 4.6 auf dieselbe Seite, und der erste Vergleich schreibt sich von selbst. Luna wird mit 0,10 $ pro Million Eingabe-Tokens und 0,50 $ pro Million Ausgabe-Tokens gelistet. Grok 4.6 wird mit 2,00 $ und 6,00 $ gelistet, mit 0,50 $ für einen gecachten Lesevorgang. Zwanzigmal so viel bei der Eingabe, zwölfmal so viel bei der Ausgabe und ein Tarif für gecachte Eingabe, der beim Modell des Anbieters fünfzigmal höher ist. Das ist der Listenpreis, und gemessen am Listenpreis ist die Antwort nicht knapp.
Der Grund, warum es sich lohnt, den Rest dieses Beitrags zu schreiben, ist, dass die beiden Modelle in etwas Strukturellerem als dem Preis nicht übereinstimmen. Grok 4.6 hat ein Kontextfenster von 500.000 Token und berechnet die gesamte Anfrage neu, sobald der Prompt 200.000 Token überschreitet. GPT-6 Luna hat 1.050.000 Token und berechnet bei 272.000 neu. Beide Schwellenwerte sind Klippen und keine marginalen Raten – überschreitet man eine, wird die gesamte Anfrage mit der höheren Zahl abgerechnet, nicht nur der Teil oberhalb der Grenze. Wo diese beiden Klippen liegen und was mit einer Long-Context-Workload auf der falschen Seite jeder Klippe passiert, entscheidet mehr über diesen Vergleich als die zwanzigfache Schlagzeile.
Zwei Modelle, zwei sehr unterschiedliche Haltungen
Grok 4.6 ist xAIs Modell vom 12. August 2026 und eine Allzweck-Frontier-Veröffentlichung: Text rein, Text raus, ein 500.000-Token-Fenster, veröffentlichte Kosten von $1,86 pro Aufgabe auf dem unabhängigen Board bei hohem Aufwand und eine gemessene Geschwindigkeit von 57,7 Ausgabe-Tokens pro Sekunde. Es ist die Art von Modell, die ein Team annimmt, weil es in vielen Dingen gut ist und der Anbieter schnell liefert.
GPT-6 Luna nimmt die entgegengesetzte Haltung ein. OpenAI veröffentlichte es am 22. September 2026 als Volumenstufe der GPT-6-Familie, unterhalb von GPT-6 Sol zu $2,00/$10,00 und dem Flaggschiff GPT-6 Astra zu $10,00/$50,00. Text- und Bildeingabe, Textausgabe, ein 1.050.000-Token-Fenster mit einer maximalen Eingabe von 922.000 Token, einer Ausgabegrenze von 128.000 Token und einer Reasoning-Leiter, die von none über low, medium, high, xhigh bis max reicht, wobei medium der Standard ist. Es ist kein Modell, das jemand wegen seiner Breite annimmt. Es ist ein Modell, das man unter eine Arbeitslast legt.
Die ehrliche Formulierung lautet also nicht „Welche davon ist besser?“, sondern „Welche davon ist auf die Art von Arbeit zugeschnitten, die du hast“ – und diese beiden Arten sind wirklich unterschiedlich.
Die Karten, Zeile für Zeile
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Eingabe pro 1M — GPT-6 Luna 0,10 $ vs. Grok 4.6 2,00 $
• Ausgabe pro 1 Mio. — GPT-6 Luna 0,50 $ vs. Grok 4.6 6,00 $
• Gecachte Eingabe pro 1 Mio. – GPT-6 Luna 0,01 $ vs. Grok 4.6 0,50 $, ein Zehntel des eigenen Eingabepreises gegenüber einem Viertel des xAI-Preises
• Langkontext-Schwellenwert — GPT-6 Luna 272.000 Eingabe-Tokens vs. Grok 4.6 200.000 Prompt-Tokens
• Langkontext-Preise — GPT-6 Luna setzt den Preis für die gesamte Anfrage neu auf 0,20 $ Eingabe, 0,75 $ Ausgabe, 0,02 $ gecacht, während Grok 4.6 den Preis für die gesamte Anfrage neu auf 4,00 $ Eingabe, 12,00 $ Ausgabe, 1,00 $ gecacht setzt
• Kontextfenster — GPT-6 Luna 1.050.000 Tokens vs. Grok 4.6 500.000 Tokens
• Maximale Ausgabe — GPT-6 Luna 128.000 Tokens vs. Grok 4.6, nicht als separate Obergrenze auf der Karte angegeben
• Intelligenzindex, unabhängig — GPT-6 Luna 37 bei maximalem Aufwand vs. Grok 4.6 44 bei hohem Aufwand in Index-Revision v4.3.2
• Standardaufwand-Score — GPT-6 Luna 29 bei seinem Standard-Medium vs. Grok 4.6 43 bei Medium, wobei die Rangliste ihn ebenfalls misst
• Kosten pro Index-Aufgabe, unabhängig — GPT-6 Luna etwa 0,07 $ vs. Grok 4.6 1,86 $ bei hohem Aufwand
• Ausgabe-Tokens beim Index-Lauf — GPT-6 Luna 150M vs. Grok 4.6 94M, gegenüber einem Board-Median von 88M
• Ausgabegeschwindigkeit, unabhängig — GPT-6 Luna 153,9 Tokens/Sek. vs. Grok 4.6 57,7 Tokens/Sek. bei High
• Zeit bis zum ersten Token, unabhängig — Grok 4.6 38,63 s, Ende-zu-Ende 47,31 s; GPT-6 Luna liefert ein erstes Token in einer Zeit, die es einem Nutzer erlaubt, zu warten
• Cyber-Fähigkeit, unabhängig — Grok 4.6 erzielt 57 Punkte in der Cyber-Bewertung des Boards; für GPT-6 Luna wird kein vergleichbarer Wert veröffentlicht
• Auf OrcaRouter — GPT-6 Luna nicht in unserem Katalog vs. Grok 4.6, routbar zum Listenpreis von xAI

200.000 gegen 272.000 – darauf läuft die ganze Argumentation hinaus
Lies die beiden Schwellenwerte neben den beiden Fenstern, und der Vergleich ordnet sich selbst neu.
Die Klippe von Grok 4.6 liegt bei 200.000 Tokens in einem 500.000-Token-Fenster – 40 % des Fensters. Die von GPT-6 Luna liegt bei 272.000 innerhalb von 1.050.000 – 26 % des Fensters. Das günstigere Modell beginnt also nicht nur später mit der Neubepreisung, sondern hat nach der Schwelle auch mehr als doppelt so viel Spielraum, bevor ihm überhaupt das Fenster ausgeht.
Konkret: Eine Anfrage mit 450.000 Token passt in beide Modelle. Bei GPT-6 Luna wird sie zum Langkontext-Tarif von 0,20 $ und 0,75 $ abgerechnet. Bei Grok 4.6 wird sie mit 4,00 $ und 12,00 $ abgerechnet. Das ist zwanzigmal so viel bei der Eingabe und sechzehnmal so viel bei der Ausgabe für denselben Prompt – und es ist eine Anfrage, die Grok 4.6 bedienen kann, die Entscheidung also real und nicht theoretisch.
Der umgekehrte Fall ist der, der viele auf dem falschen Fuß erwischt. Eine Anfrage mit 190.000 Tokens liegt unter beiden Schwellenwerten und wird bei beiden zu den Standardtarifen abgerechnet: 0,10 $/0,50 $ gegenüber 2,00 $/6,00 $ – ein glattes Zwanzig- und Zwölffaches. Eine Anfrage mit 210.000 Tokens liegt über der Grenze von Grok 4.6 und unter der von GPT-6 Luna. Sie wird auf Grok 4.6 mit 4,00 $/12,00 $ und auf Luna mit 0,10 $/0,50 $ abgerechnet – eine vierzig- bzw. vierundzwanzigfache Lücke, die allein durch einen Unterschied von 20.000 Tokens in der Prompt-Länge entsteht, ohne dass sich an einem der beiden Modelle etwas geändert hätte.
Das ist kein Grund, Grok 4.6 zu meiden. Es ist ein Grund zu wissen, wo Ihre Prompts tatsächlich landen, denn eine Workload, die durchschnittlich 180.000 Token umfasst und auf 220.000 Token ansteigt, zahlt nach zwei verschiedenen Tarifkarten und wird im ersten Monat, in dem das passiert, wie ein Abrechnungsfehler aussehen.
Was die Preisdifferenz im unabhängigen Gremium bringt
Grok 4.6 erreicht 44 Punkte im Artificial Analysis Intelligence Index bei hohem Aufwand. GPT-6 Luna erreicht 37 bei maximalem Aufwand. Sieben Punkte, bei einem zusammengesetzten Index, bei dem ein einzelner Punkt im Rauschen einer Wiederholung liegt — und die beiden Modelle unterscheiden sich um etwa das Sechsundzwanzigfache bei den Kosten pro abgeschlossener Aufgabe, 1,86 $ gegenüber etwa 0,07 $.
Bei diesem Zahlenpaar lohnt es sich, zwei Dinge zu unterscheiden.
Der erste Wert ist die Standard-Aufwandsstufe. Die 37 von GPT-6 Luna ist ein Wert bei maximalem Aufwand, und sein Standard ist medium, wo es 29 erreicht. Die 44 von Grok 4.6 ist ein Wert bei hohem Aufwand, und das Board misst es auch bei medium, wo es 43 erreicht. Der direkte Vergleich bei Standardeinstellungen ist also 29 gegen 43 – vierzehn Punkte, nicht sieben, und die Vierzehn-Punkte-Version ist diejenige, die ein Team, das beide einsetzt und nichts ändert, tatsächlich erleben wird. Grok 4.6 verliert einen Punkt beim Wechsel von high zu medium. GPT-6 Luna verliert acht. Der Aufwandsregler kostet das günstige Modell weit mehr als das teure, und diese Asymmetrie ist in den prominenten Indexwerten unsichtbar.
Das Zweite ist die Ausführlichkeit, und hier ist die Richtung das Gegenteil dessen, was das Preisverhältnis nahelegt. GPT-6 Luna generierte beim Vervollständigen des Index 150 Millionen Ausgabe-Token; Grok 4.6 generierte 94 Millionen. Das Modell, das pro Ausgabe-Token nur ein Zwölftel so viel kostet, verbrauchte 60 % mehr Token und erreichte damit eine niedrigere Punktzahl. Auf einer Preiskarte, die auf Ausgabe-Token-Preisen basiert, ist das der Unterschied zwischen einer 26-fachen Lücke bei den Kosten pro Aufgabe und einer kleineren, und es ist der Grund, warum jeder Vergleich, der allein auf Listenpreisen beruht, den Fall für die günstige Preisklasse überzeichnen wird.
Grok 4.6 veröffentlicht außerdem auf demselben Board einen Cyber-Fähigkeitswert von 57. Es gibt keinen vergleichbaren Wert für GPT-6 Luna, daher hat diese Dimension nur eine Seite – aber es ist die Art von Angabe, auf die es ankommt, wenn Ihre Workload sicherheitsrelevantes Tooling berührt, und das Fehlen eines solchen Werts beim günstigeren Modell ist eine Information und keine Lücke, die durch Annahmen gefüllt werden sollte.
Latenz, wenn die beiden nicht nahe beieinanderliegen und nicht dieselbe Richtung haben
Die unabhängigen Latenzwerte für Grok 4.6 betragen 38,63 Sekunden bis zum ersten Token und 47,31 Sekunden Ende-zu-Ende bei hohem Aufwand. Das ist ein Wert für ein Modell, das ernsthaft nachdenkt, bevor es spricht, und er ist nicht mit einer Person vereinbar, die einen Cursor beobachtet. Unser eigener Eintrag für das Modell verzeichnet eine p50-Zeit bis zum ersten Token von 6,71 Sekunden und eine p95 von 10,00 Sekunden über ein Sieben-Tage-Fenster, was einen anderen Punkt in der Antwort misst und nicht mit dem unabhängigen Wert vergleichbar ist – die beiden Zahlen widersprechen sich nicht, sie beantworten unterschiedliche Fragen.
GPT-6 Luna läuft mit 153,9 Ausgabe-Tokens pro Sekunde und gibt sein erstes Token schnell genug zurück, um hinter einer interaktiven Oberfläche zu stehen. Bei hohem Aufwand erreicht es fast das Dreifache des Durchsatzes von Grok 4.6. Für einen Batch-Job ist dieser Unterschied ein reiner Zeitvorteil. Für alles, worauf ein Nutzer wartet, ist es der Unterschied zwischen einem Produkt und einem Prototyp.
Die Kombination ist ungewöhnlich und verdient eine klare Benennung: Das günstige Modell ist das schnelle, das teure Modell ist das langsame, und das teure Modell liegt beim Composite bei gleichem Aufwand sieben Punkte vorne. Das ist das Profil eines Modells, das darauf ausgelegt ist, einmal gründlich nachzudenken, und eines Modells, das darauf ausgelegt ist, sehr oft schnell zu antworten. Wenn Ihre Arbeitslast einen Aufruf pro Aufgabe umfasst, ist die Latenz von Grok 4.6 vertretbar. Wenn sie tausend Aufrufe pro Aufgabe umfasst, ist sie es nicht.
Was Sie auf der xAI-Seite tatsächlich kaufen
Grok 4.6 kostet pro abgeschlossener Aufgabe rund sechsundzwanzig Mal so viel wie GPT-6 Luna und liegt bei gleichem Aufwand sieben Indexpunkte vorne. Das ist ein schlechter Wechselkurs für eine allgemeine Arbeitslast und ein angemessener für eine bestimmte Klasse von Arbeit.
Drei Dinge rechtfertigen das. Der Cyber-Score von 57 ist eine Fähigkeit, zu der GPT-6 Luna kein Gegenstück veröffentlicht. Der Indexlauf mit 94 Millionen Token gegenüber Lunas 150 Millionen ist ein echter Prägnanzvorteil bei jeder Aufgabe, bei der die Ausgabe von einem Menschen statt von einem Parser konsumiert wird. Und das Modell ist seit dem 12. August in Produktion, sechs Wochen länger, als GPT-6 Luna überhaupt existiert – was kein Benchmark ist, aber eine Erfolgsbilanz, und für ein Team, das bereits darauf aufgebaut hat, gehören die Migrationskosten des Weggangs zum Preis des Weggangs.
Dagegen ist bei GPT-6 Luna nicht in erster Linie der zwanzigfache Satz ausschlaggebend. Es ist die 272.000-Token-Schwelle innerhalb eines Fensters von einer Million Token, die Möglichkeit, angewiesen zu werden, das Schlussfolgern vollständig einzustellen, ein Preis für gecachte Eingaben von einem Cent pro Million und eine Durchsatzrate, die es als Komponente statt als Endpunkt nutzbar macht. Das sind strukturelle Eigenschaften der günstigen Stufe, und kein noch so großer Indexvorteil auf der anderen Seite ersetzt sie.
Einen von ihnen ausführen, oder beide
Grok 4.6 ist bei OrcaRouter zum Listenpreis von xAI verfügbar, bei einer Pass-through-Preisgestaltung, die eine Änderung der Anbieterpreise noch am selben Tag auf unserer Seite wirksam werden lässt, anstatt darauf zu warten, dass ein Reseller neu verhandelt. Automatisches Failover ist der Teil, der sich speziell für dieses Modell seinen Platz verdient: Ein 500.000-Token-Fenster mit einer 200.000-Token-Klippe ist eine Arbeitslast, bei der eine Anfrage gelegentlich auf der falschen Seite der Linie landet, und eine Route, die ohne Deployment zwischen Upstreams wechselt, ist mehr wert als ein Bruchteil eines Cents pro Token.
GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog enthalten und wird über die eigene API von OpenAI erreicht. Ein Team, das beide möchte, verwendet also einen Schlüssel für Grok 4.6 neben dem, was es bereits für OpenAI nutzt. Die Routing-DSL ist das Element, das zu dieser Paarung passt: Eine Regel, die Prompts oberhalb einer Token-Schwelle an das Modell sendet, dessen Klippe sie überwinden, und alles darunter an das Modell, das ein Zwölftel des Preises kostet, lässt sich als Konfiguration ausdrücken statt als Verzweigung in Ihrer Anwendung – was wichtig ist, wenn die Schwellen so nah an üblichen Prompt-Größen liegen wie diese beiden.

Welches, und wann
Nimm GPT-6 Luna, wenn dein Workload hochvolumig, von Programmen konsumiert und kurz ist. Klassifikation, Extraktion, Routing, Massen-Zusammenfassung, die innere Schleife eines Agenten. Bei $0,10/$0,50 mit einem gecachten Lesezugriff für einen Cent, gegenüber einem Modell, das bei gleichem Aufwand für sieben Indexpunkte pro abgeschlossener Aufgabe das Sechsundzwanzigfache kostet, ist die Rechnung alles andere als knapp. Setze den Effort-Parameter explizit — der Standard ist medium und die beworbene 37 ist ein Max-Effort-Wert — und halte deine langen Aufrufe unter 272.000 Tokens.
Nimm Grok 4.6, wenn du die Cyber-Fähigkeit brauchst, wenn deine Ausgabe von einem Menschen gelesen wird und ihre Prägnanz es wert ist, dafür zu zahlen, oder wenn du eine Arbeitslast von 300.000 bis 500.000 Tokens hast, die GPT-6 Luna bedienen kann, bei der du aber lieber nicht das erste Team sein willst, das herausfindet, wie sie sich bei dieser Länge verhält. Kalkuliere die 200.000-Token-Klippe ausdrücklich ein, und setze es nicht bei hohem Aufwand hinter eine interaktive Oberfläche — 38 Sekunden bis zum ersten Token sind keine Latenzzahl, sondern eine Aussage darüber, wofür das Modell gedacht ist.
Der Fehler, zu dem dieser Vergleich verleitet, besteht darin, den zwanzigfachen Satz für die Entscheidung zu halten. Für die eine Workload-Form ist er die Entscheidung. Für die andere fällt die Entscheidung bei 200.000 und 272.000 Tokens, und das Preisverhältnis ist ein Detail, das man erst danach liest.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
