
GPT-6 Luna vs. GPT-6 Astra: Hundertfacher Preis für sechzehn Indexpunkte
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 218 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Der Anbieter lieferte beide dieser Modelle im selben Monat aus. GPT-6 Astra erschien am 3. September 2026 zu 10,00 $ pro Million Eingabe-Token und 50,00 $ pro Million Ausgabe-Token und wurde als das leistungsfähigste System des Unternehmens für professionelle Arbeit mit langem Zeithorizont positioniert. GPT-6 Luna folgte am 22. September 2026 zu 0,10 $ und 0,50 $ — ein Hundertstel des Eingabepreises, ein Hundertstel des Ausgabepreises — als Effizienzstufe der Modellfamilie. Sechzehn Indexpunkte trennen sie auf der unabhängigen Rangliste, die beide misst. Sechzehn Punkte für einen hundertfachen Preis sind der ganze Vergleich in einer Zeile, und das ist nicht der interessante Teil.
Der interessante Teil ist, dass der hundertfache Preisaufkleber auf eher das Sechsundvierzigfache zusammenschrumpft, sobald man berücksichtigt, wie sich jedes Modell bei einer Aufgabe tatsächlich verhält, und dass die verbleibende Lücke überhaupt nicht in der allgemeinen Intelligenz liegt. Sie liegt in der Computernutzung, in der Autonomie über lange Zeithorizonte und in einer Sicherheitseinstufung, die entscheidet, ob Ihre Organisation das Modell überhaupt aufrufen darf. Der letzte Punkt ist der, den keine Benchmark-Tabelle erfasst, und für viele Teams entscheidet er die Frage, bevor der Preis überhaupt erwähnt wird.
Zwei Ebenen einer Familie, neunzehn Tage auseinander
Astra ist OpenAIs Flaggschiff und das Modell, das das Unternehmen als das intelligenteste und am besten ausgerichtete der Welt beschreibt. Es akzeptiert Text-, Bild- und Dateieingaben, besitzt ein Kontextfenster von 1.050.000 Token mit einer Ausgabegrenze von 128.000 Token und verfügt über eine immer aktive Schlussfolgerungsfähigkeit mit konfigurierbarem Aufwand von niedrig bis max. Es ist das erste OpenAI-Modell, das die kritische Schwelle für Cybersicherheitsfähigkeiten im Rahmen des Preparedness Framework des Unternehmens überschreitet, und der Rollout folgte aus dieser Einstufung und nicht aus der Kapazität: zuerst begrenzte Organisationen, Unternehmenszugriff standardmäßig deaktiviert und ab dem 9. September verwaltbar, wobei die Schutzstufen danach ausgeweitet werden.
Luna ist das andere Ende derselben Familie. Text und Bild hinein, Text hinaus, dasselbe Kontextfenster von 1.050.000 Token und dieselbe Ausgabegrenze von 128.000 Token, und eine Reasoning-Leiter, die von none über low, medium, high, xhigh bis max reicht, wobei medium die Standardeinstellung ist. Kein Gating, kein Enterprise-Schalter, keine Safety-Stufe, für die man sich qualifizieren muss. Es ist allgemein für alle mit einem API-Schlüssel verfügbar, und OpenAIs eigene Beschreibung ist knapp und ehrlich: das effizienteste Modell für fokussierte Aufgaben mit hohem Volumen.
Die beiden Modelle teilen sich ein Kontextfenster, eine Ausgabebegrenzung, eine Knowledge-Cutoff-Familie und eine Long-Context-Preisklausel. Ansonsten haben sie kaum etwas gemeinsam, und der Grund dafür ist, dass sie für unterschiedliche Hälften derselben Aufgabe gebaut wurden.
Die Tarifkarte nennt einhundert Mal. Die Aufgabenkosten nennen sechsundvierzig.
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Input pro 1M — GPT-6 Luna $0,10 vs. GPT-6 Astra $10,00
• Output pro 1M — GPT-6 Luna 0,50 $ vs. GPT-6 Astra 50,00 $
• Zwischengespeicherte Eingabe — GPT-6 Luna 0,01 $ pro 1 Mio. vs. GPT-6 Astra 1,00 $ pro 1 Mio., beide mit 90 % Rabatt auf ihren jeweiligen Preis ohne Caching
• Kosten pro Index-Aufgabe — GPT-6 Luna etwa 0,07 $ vs. GPT-6 Astra etwa 3,26 $
• Kosten für die Ausführung des vollständigen Index — GPT-6 Luna 122,39 $ vs. GPT-6 Astra 5.324,10 $
• AA-Intelligenzindex — GPT-6 Luna 37 bei maximalem Aufwand vs. GPT-6 Astra 53 bei maximalem Aufwand
• Ausgabe-Tokens beim Index-Lauf — GPT-6 Luna 150M vs. GPT-6 Astra 60M, gegenüber einem Board-Median von 88M
• Ausgabegeschwindigkeit — GPT-6 Luna 153,9 Tokens/Sek. gegenüber GPT-6 Astra 51,4 Tokens/Sek. bei xhigh
• Zeit bis zum ersten Token — GPT-6 Luna schnell genug, um hinter einer interaktiven Oberfläche zu stehen, vs. GPT-6 Astra 208,73 s bei xhigh
• Reasoning-Aus-Schalter — GPT-6 Luna none bis max, wobei none eine Option ist, im Vergleich zu GPT-6 Astra immer aktiv, kein Nicht-Reasoning-Modus
• Computernutzung und Autonomie — GPT-6 Luna Tool-Calling und agentische Schleifen vs. GPT-6 Astra, entwickelt für die End-to-End-Bedienung eines Computers
• Zugriff — GPT-6 Luna allgemein für jeden verfügbar vs. GPT-6 Astra zugangsbeschränkt, Enterprise standardmäßig deaktiviert, Admin-Steuerung erforderlich
• Auf OrcaRouter — GPT-6 Luna nicht in unserem Katalog vs. GPT-6 Astra routbar zum OpenAI-Listenpreis

Stellt man die Zeile mit den Kosten pro Aufgabe dem Preislisten-Verhältnis gegenüber, schrumpft die Lücke um mehr als die Hälfte. Luna verbraucht 150 Millionen Output-Tokens für die Fertigstellung des Index; Astra verbraucht 60 Millionen. Astra ist zweieinhalbmal knapper, und bei einem output-bepreisten Modell ist das sehr viel wert – es ist der Grund, warum aus einem hundertfachen Preislistenunterschied ein sechsundvierzigfacher Aufgabenkostenunterschied wird, und der Grund, warum jeder Vergleich, der allein auf Listenpreisen basiert, den Vorteil der günstigen Stufe um den Faktor zwei überzeichnen wird.
Die Geschwindigkeitszeilen verlaufen in die entgegengesetzte Richtung und liegen nicht dicht beieinander. Luna erzeugt dreimal so viele Token pro Sekunde wie Astra und liefert sein erstes Token in einer Zeit, die es einem Nutzer erlaubt zu warten. Astras 208,73 Sekunden bis zum ersten Token bei xhigh sind keine Latenzangabe; sie sind eine Aussage darüber, wofür das Modell gedacht ist. Nichts, was eine Person gerade verfolgt, kann bei dieser Einstellung auf Astra laufen.
Was sechzehn Punkte tatsächlich einbringen
Die Indexlücke ist real, und die nützliche Frage ist, was darin steckt, denn die Antwort lautet nicht „sechzehn Prozent mehr Intelligenz“.
Astras veröffentlichte Fähigkeiten konzentrieren sich an einer bestimmten Stelle. OpenAI meldet 72,6 % auf OSWorld 2.0 und 69 % auf AutomationBench-AA – beides Messgrößen dafür, wie ein Modell Software so bedient, wie es ein Mensch tut, über viele Schritte hinweg und über einen langen Zeitraum. Auf der Wissensseite liegen die Werte bei 96,1 auf GPQA Diamond, 97,6 % auf FrontierMath Tier 4 und 57,2 % auf Humanity's Last Exam mit Tools, und Langkontext-Retrieval wird als Stärke besonders hervorgehoben: 100 % bei OpenAIs eigenem Eight-Needle-Benchmark zwischen 256K und 512K Tokens, 96,3 % zwischen 512K und 1M. Diese Angaben stammen vom Anbieter und sind nicht reproduziert, und der Harness ist entscheidend – dasselbe Modell erreicht 99,9 % auf ARC-AGI-3 unter OpenAIs benutzerdefiniertem Provider-Adapter gegenüber 62,7 % mit dem Standard-Harness, eine Schwankung, die ebenso viel über den Harness wie über das Modell aussagt.
Zusammengenommen ist das kein allgemeiner Vorteil. Es ist ein Vorteil, der sich auf Aufgaben konzentriert, die lange dauern, einen Computer erfordern und einen überprüfbaren Endpunkt haben. Astras Wettbewerbsrahmung richtet sich nicht gegen einen anderen Chatbot; sie richtet sich gegen eine Arbeitssitzung, und die Modelle, neben denen es auf dem unabhängigen Board gemessen wird, sind die anderen Flaggschiffe derselben Stufe – es liegt gleichauf mit Claude Fable 5.1 bei 53 im Intelligence Index zu ungefähr 40 % der Kosten pro Aufgabe.
Lunas Rückstand von sechzehn Punkten ist daher nicht gleichmäßig verteilt. Bei einer kurzen, gut spezifizierten Aufgabe, die von Programmen genutzt wird, liefern die beiden Modelle häufig dieselbe brauchbare Antwort, und der Unterschied bleibt unsichtbar. Bei einer Aufgabe, die vierzig aufeinanderfolgende Aktionen in einem Browser mit einem Kontrollpunkt am Ende erfordert, ist der Rückstand der Unterschied zwischen Erledigen und Nichterledigen – und das ist die Aufgabe, für die Astra gebaut wurde und Luna nicht.
Das Tor, das niemand einpreist
Astra ist das erste OpenAI-Modell, das die kritische Cybersicherheitsschwelle im Rahmen des Preparedness Framework des Unternehmens überschreitet, und die praktische Konsequenz ist, dass es für Unternehmenskonten deaktiviert ausgeliefert wird. Ein Administrator muss es aktivieren, gemäß einer geltenden Preisliste und Vereinbarung, bevor Benutzer es überhaupt sehen. Der Zugang wurde am 3. September für eine begrenzte Anzahl von Organisationen geöffnet und von dort aus erweitert; die Administrationsmechanik traf am 9. September ein.
Luna hat nichts davon. Es ist ab dem ersten Tag für jeden mit einem API-Schlüssel verfügbar, ohne Qualifikationsschritt, ohne Admin-Schalter und ohne eine Sicherheitsstufe, die zwischen einem Entwickler und einem ersten Aufruf steht.
Für ein Team in einer regulierten Branche, einen Verteidigungsauftragnehmer oder überall dort, wo im Beschaffungsweg eine Sicherheitsprüfung vorgesehen ist, ist dies die ganze Entscheidung. Der hundertfache Preisunterschied ist eine Einzelposten; ein Zugangs-Gate ist ein Projekt. Und für ein Team außerhalb dieser Einschränkungen ist das Gate irrelevant, und Astra ist einfach ein teures Modell mit einer ungewöhnlich langen Zeit bis zum ersten Token.
Es lohnt sich hinzuzufügen, dass die Zugangsbeschränkung eine wohlüberlegte Position ist und keine bloße Unannehmlichkeit. Ein Modell, das einen Computer autonom bedient und gut darin ist, Schwachstellen zu finden, ist ein Modell, dessen Herausgabe ein Labor sorgfältig abwägen sollte, und die Form der Bereitstellung folgt dem Ergebnis der Fähigkeitsbewertung. Das macht die Beschaffung nicht einfacher, bedeutet aber, dass die Einschränkung wahrscheinlich nicht durch ein Support-Ticket gelockert wird.
Dieselbe Klippe, dieselbe Familie, zweimal
Beide Modelle enthalten die identische Langkontext-Klausel, die das Teuerste ist, was man auf einer der beiden Preislisten übersehen kann. Anfragen, die 272.000 Eingabe-Tokens überschreiten, werden zum doppelten Eingabe- und Cache-Tarif sowie zum 1,5-Fachen des Ausgabe-Tarifs abgerechnet – und zwar für die gesamte Anfrage, nicht nur für den Teil oberhalb der Grenze. Bei Astra wird dadurch aus einem $10.00/$50.00-Aufruf ein $20.00/$75.00-Aufruf. Bei Luna wird aus einem $0.10/$0.50-Aufruf ein $0.20/$0.75-Aufruf.
Da die Klausel proportional ist, ändert sie das Verhältnis zwischen den beiden Modellen nicht — sie verdoppelt beide. Was sie ändert, ist die absolute Größe des Fehlers, und der Fehler ist bei Astra wahrscheinlicher, weil die Workloads, für die Astra existiert, genau die sind, die einen Arbeitskontext von einer Million Tokens mit sich bringen. Ein einzelner Astra-Aufruf mit langem Kontext kostet 75 $ pro Million Ausgabe-Tokens; dieselbe Arbeit auf zwei Aufrufe unter 272K aufzuteilen halbiert die Kosten, ohne dass sich der Prompt ändert. Bei einem Modell, dessen gesamtes Wertversprechen Long-Horizon-Arbeit ist, lohnt es sich, diese Rechnung vor dem ersten Produktionsaufruf anzustellen, nicht danach.
Die Entscheidung ist eine Routing-Entscheidung
Was diese Paarung unter den Vergleichen in diesem Blog ungewöhnlich macht, ist, dass beide Modelle zum selben Anbieter gehören, über dasselbe Konto laufen und über denselben Endpunkt erreicht werden. Es gibt keinen zweiten Vertrag zu unterschreiben und kein zweites SDK zu erlernen. Die Wahl zwischen ihnen ist überhaupt keine Kaufentscheidung – sie ist eine Routing-Entscheidung, und sie ist eine, die die meisten Teams pro Anfrage statt einmal treffen sollten.
Die Form der Aufteilung ist klar genug. Luna für die tausend kleinen Aufrufe, die ein Agent auf dem Weg zu einer Aufgabe macht: Klassifizierung, Extraktion, Tool-Auswahl, Zusammenfassung eines Zwischenergebnisses. Astra für die Aufgabe selbst, einmal, am Ende, wo die Antwort das Produkt ist. Das ist eine zweistufige Pipeline innerhalb einer Anwendung, und der Kostenunterschied zwischen dem Betrieb des Ganzen auf Astra und dem Betrieb der inneren Schleife auf Luna ist der Unterschied zwischen einer tragfähigen und einer nicht tragfähigen Unit Economics.
GPT-6 Astra ist bei OrcaRouter zum Listenpreis von OpenAI verfügbar, was bei Pass-through-Preisen bedeutet, dass eine Preisänderung von OpenAI noch am selben Tag auf unserer Seite wirksam wird. GPT-6 Luna ist zum Zeitpunkt dieses Textes nicht in unserem Katalog und wird über die eigene API von OpenAI erreicht, sodass ein Team, das beide möchte, einen Schlüssel für GPT-6 Astra neben dem betreibt, was es bereits für OpenAI nutzt. Dies ist auch die Paarung, bei der Modell-Fusion sich bezahlt macht: ein Gremium aus einem günstigen Modell mit hohem Durchsatz und einem teuren, sorgfältigen Modell, die gemeinsam antworten, wobei das günstige Mitglied den Großteil der Arbeit erledigt und das teure den Ausschlag gibt, ist eine Konfiguration, die die Routing-Schicht ausdrücken kann, ohne dass die Anwendung weiß, dass eines der beiden Modelle existiert.

Welches, und wann
Nimm GPT-6 Luna, es sei denn, du hast einen konkreten Grund, es nicht zu tun. Es kostet ein Hundertstel des Listenpreises und ein Sechsundvierzigstel des Preises pro abgeschlossener Aufgabe, es ist dreimal so schnell, sein erstes Token kommt in einer Zeit an, die ein Nutzer abwarten kann, und man kann ihm sagen, das Reasoning vollständig einzustellen – was es als Klassifikator nutzbar macht. Setze den Effort-Parameter explizit, denn der Standardwert ist medium und die beworbene 37 ist ein Wert bei maximalem Effort. Halte lange Aufrufe unter 272.000 Input-Tokens. Prüfe die Zwei-Punkte-Regression im Coding Agent Index anhand deiner eigenen Eval statt anhand eines Anbieter-Diagramms.
Nimm GPT-6 Astra, wenn die Aufgabe die lange ist und die Antwort das Produkt ist. Computer-Nutzung über viele Schritte hinweg, professionelle Analyse mit einem verifizierbaren Endpunkt, alles, wo sechzehn Indexpunkte den Unterschied zwischen Fertigstellen und stillem Aufhören ausmachen. Akzeptiere die Zeit bis zum ersten Token – 208 Sekunden bei xhigh sind keine Zahl, die man hinter einen Menschen stellen kann – und akzeptiere das Beschaffungs-Gate, falls Ihre Organisation eines hat. Lass dann alles, was zu dieser Aufgabe hinführt, auf der günstigen Stufe laufen, denn die innere Schleife ist der Ort, an dem das Geld hingeht.
Der Fehler, zu dem dieser Vergleich verleitet, besteht darin, ihn als Wahl zwischen zwei Modellen zu betrachten. Es ist eine Entscheidung darüber, wo in einer Pipeline jedes einzelne seinen Platz hat, und die Antwort lautet fast immer: beide.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
