
GPT-5.6 Luna: Was die 80-prozentige Preissenkung von OpenAI wirklich verändert hat
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
GPT-5.6 Luna ist seit Ende Juli 80 % günstiger als sein Einführungspreis, und OpenAI hat begonnen, das als Argument statt als Rabatt zu behandeln. Das Modell – die schnelle, kostengünstige Stufe der GPT-5.6-Familie – wurde am 9. Juli 2026 allgemein verfügbar, bei 1,00 US-Dollar pro Million Input-Tokens und 6,00 US-Dollar pro Million Output. Heute wird es mit 0,20 und 1,20 US-Dollar abgerechnet. Am 9. September sagte OpenAIs Finanzvorständin Sarah Friar auf der Communacopia-Konferenz von Goldman Sachs, die Senkung habe zu einer etwa zehnfachen Nutzungssteigerung geführt und der Einsatz von Luna sei günstiger als der Betrieb von Z.ai GLM 5.3 auf einer Cloud-Ebene.
Diese letzte Behauptung stammt von OpenAI selbst, vorgebracht von einer Führungskraft auf einer Investorenkonferenz, und sie verdient dieselbe Behandlung wie jede andere Anbieterzahl: berichtenswert, prüfenswert, nicht als gesicherte Tatsache wiederholenswert. Der Preis selbst ist eine andere Sache. Er ist öffentlich, und er ist nicht wieder zurückgegangen.
Was sich tatsächlich geändert hat, und wann
An den Fähigkeiten, dem Kontextfenster oder der Verfügbarkeit von GPT-5.6 Luna hat sich im September nichts geändert. Geändert hat sich, wie OpenAI es vermarktet, und hinter dieser Verschiebung stehen fünf Daten.
• 26. Juni 2026 — OpenAI kündigte die GPT-5.6-Familie (GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna) in einer begrenzten Vorschau für eine kleine Gruppe von Partnern an, nach Abstimmung mit US-Regierungsbehörden.
• 9. Juli 2026 — allgemeine Verfügbarkeit. Sol, Terra und Luna erreichten die API mit $5/$30, $2,50/$15 bzw. $1/$6 pro Million Input-/Output-Tokens.
• Ende Juli 2026 — die 80-prozentige Senkung allein bei Luna, auf 0,20 $ Input und 1,20 $ Output. Gecachte Input-Reads erhalten einen Rabatt von rund 90 %. Oberhalb der Long-Context-Schwelle verdoppelt sich der Satz in etwa, auf rund 0,40 $/1,80 $.
• 6.–7. August 2026 — Luna ersetzte GPT-5.5 Instant als Standardmodell für ChatGPT Free und Go, mit unbegrenzten Textchats und einem „Think“-Button für tiefergehendes Reasoning, der in der darauffolgenden Woche kommt. OpenAIs interne Evaluierung ergab, dass Lunas Anteil an Antworten mit mindestens einem sachlichen Fehler bei Finanz-, Medizin- und Rechts-Prompts etwa 62 % unter dem von GPT-5.5 Instant lag — eine vom Anbieter gemeldete Zahl, keine unabhängige.
• 9. September 2026 — Friars Äußerungen, die erstmals öffentliche Zahlen zur Auswirkung der Kürzung vorlegten: etwa 10-fache Nutzung, Enterprise-Umsatz von Juni bis Juli um 32 % gestiegen gegenüber 20 % Gesamtwachstum auf annualisierter Basis, und Codex bei 25 Millionen Nutzern.
Zusammengenommen beschreiben diese Datumsangaben eine zweimonatige Umwandlung einer kostengünstigen Stufe in eine Volumenstrategie. Luna war immer die Stufe, die dafür gedacht war, Arbeit mit hohem Volumen und geringer Komplexität aufzunehmen – Klassifizierung, Extraktion, Routing, Erstentwürfe. Die Kürzung machte die Kalkulation hinter dieser Positionierung deutlich schwerer zu bestreiten.
Die Zahl, die mehr zählt als der Token-Preis

Listenpreise sind der Punkt, an dem die meisten Vergleiche aufhören, und für Luna fallen sie schmeichelhaft aus. Mit 0,20 $/1,20 $ unterbietet Luna Anthropics Claude Haiku 4.5 – den engsten direkten Konkurrenten, den Luna hat – um etwa das Fünffache bei der Eingabe und das Vierfache bei der Ausgabe.
Artificial Analysis misst etwas weniger Bequemes: die Kosten pro abgeschlossener Aufgabe des Intelligence Index, wobei einfließt, wie viele Tokens ein Modell tatsächlich verbraucht, um dieselbe Arbeit zu erledigen. Im aktuellen Index kommt die Reasoning-Konfiguration von GPT-5.6 Luna auf 0,18 $ pro Aufgabe. Claude Haiku 4.5 landet in seiner Reasoning-Konfiguration bei 0,21 $.
Das ist eine Lücke von etwa 14 %, nicht das Fünffache. Der Grund ist die Ausführlichkeit. Für das Abschließen dieses Evaluierungssets benötigte Luna ungefähr 150 Mio. Ausgabe-Tokens gegenüber 78 Mio. bei Haiku. Luna denkt ausgiebig nach, und Ausgabe-Tokens werden mit dem Sechsfachen des Eingabe-Tarifs abgerechnet.
Die praktische Interpretation lässt sich klar aufteilen. Für Arbeit mit kurzen Ausgaben und hohem Volumen – Klassifizierung, Tagging, Extraktion, Anfrage-Routing, Erstentwürfe – ist die 80%-Kürzung real, groß und schlägt sich direkt auf der Rechnung nieder. Bei Arbeit, bei der das Modell erst nachdenkt, bevor es antwortet, wird ein erheblicher Teil des Rabatts durch zusätzliche Ausgabe-Tokens verbraucht. Beide Aussagen sind gleichzeitig wahr, und der zweite Punkt ist der Teil, den die Betrachtung der Kürzung ausgelassen hat.
Es ist auch gut zu wissen, was der Index über die Leistungsfähigkeit aussagt, denn die Stufen liegen nicht nah beieinander. Artificial Analysis bewertet GPT-5.6 Luna derzeit mit 38, dem vierten Platz von 177 Modellen seiner Klasse. Die Reasoning-Konfiguration von Claude Haiku 4.5 erreicht 18, den 138. Platz von 200. Zwei Vorbehalte zu diesen Zahlen. Erstens wurde der Index im September 2026 neu bewertet, sodass Werte zum Marktstart – einschließlich der 51 und 52, die für Luna noch im Umlauf sind – aus einer nicht mehr verwendeten Skala stammen. Zweitens hat Artificial Analysis GPT-5.6 Luna als einzigen Bewerter für mehrere seiner eigenen Evaluierungen übernommen, was man bei der Lektüre der Ergebnisse bedenken sollte.
Warum OpenAI dieses Argument jetzt vorbringt
Eine Ende Juli angekündigte Kürzung um 80 % brauchte im September keinen CFO, der sie erneut aufrollt. Dass sie es trotzdem tat, verrät, wozu die Kürzung diente.
Chinesische Open-Weight-Modelle haben 2026 damit verbracht, genau auf der Achse Druck zu machen, die Luna besetzt: ausreichende Qualität zu einem Preis, der die Abrechnung pro Token zum ausschlaggebenden Faktor macht. Das bei einem Cloud-Deployment zu unterbieten, ist ein schwerer zu belegender Anspruch, als es bei den Gewichten zu unterbieten, und genau diesen Anspruch hat OpenAI gewählt – indem das Unternehmen GLM 5.3 explizit nennt, statt allgemein auf „offene Modelle" anzuspielen.
Die Enterprise-Zahlen, die Friar damit in Verbindung brachte, weisen in dieselbe Richtung. Ein Enterprise-Umsatz, der im Monatsvergleich um 32 % wächst – gegenüber 20 % insgesamt –, ist genau das Bild eines Unternehmens, das in Beschaffungszyklen hineinverkauft, und Beschaffungszyklen sind der Bereich, in dem ein Rechnungsposten infrage gestellt wird. Sie bestätigte außerdem, dass OpenAI mit ergebnisbasierter Preisgestaltung experimentiert und die Gebühren an Geschäftsergebnisse statt an den Tokenverbrauch knüpft. Das ist ein bedeutsames Eingeständnis für ein Unternehmen, dessen gesamtes Umsatzmodell auf Pro-Token basierte: Es deutet darauf hin, dass am günstigen Ende des Marktes die Pro-Token-Zahl zu einem schwächeren Verkaufsargument wird als das, was das Modell am Ende abliefert.
Nichts davon macht den GLM-Vergleich verifiziert. Friars Behauptung stützt sich auf einen Cloud-Deployment-Vergleich, den OpenAI nicht im Detail veröffentlicht hat, und „günstiger als X selbst auf einer Cloud-Ebene zu betreiben“ hängt ganz davon ab, welche Cloud, welche Instanz und welche Auslastungsannahme man wählt. Behandeln Sie sie als positionierte Behauptung einer interessierten Seite, und prüfen Sie sie anhand Ihrer eigenen Workload, bevor sie irgendetwas an dem ändert, was Sie bauen.
Was ändert sich, wenn du bereits modelübergreifend routest?

Drei Dinge zählen hier mehr als der beworbene Preis.
Preissenkungen greifen am Tag, an dem sie kommen. OrcaRouter reicht den Listenpreis des Anbieters mit 0 % Aufschlag durch; wenn ein Anbieter einen Tarif ändert, ändert sich der Preis auf unserer Seite mit — kein Support-Ticket, kein neu verhandelter Vertrag, keine zweite Abrechnungsbeziehung. Das ist der ganze Grund, warum es sich lohnt, über die Juli-Senkung zu schreiben, statt sie nur zu erwähnen: für alle, die Luna über eine API für 200+ Modelle, war sie am selben Tag live.
Der Alias ist eine Falle.Der nicht suffixierte gpt-5.6-Bezeichner verweist auf die Flaggschiff-Sol-Stufe, nicht auf Luna, sodass jede Integration, die Lunas Wirtschaftlichkeit nutzen möchte, gpt-5.6-luna explizit festlegen muss. Dies ist in den Entwicklerleitfäden der Familie dokumentiert, und es ist nach wie vor eine der häufigsten Arten, wie eine Migration auf eine „günstige Stufe“ still zu Flaggschiff-Preisen abgerechnet wird.
Günstige Tarifstufen meistern Failover zuverlässig. Ein Modell in diesem Preissegment erledigt oft Arbeit, bei der ein kurzer 503 teuer ist – tausende Klassifizierungsaufrufe, nicht eine einzige wichtige Completion. Dieselbe Anfrage über mehrere Anbieter von GPT-5.6 Luna mit automatischem Failover zu routen, ist der Unterschied zwischen einer Wiederholungswarteschlange und einem Ausfall, und es ist die Funktion, die eine kostengünstige Tarifstufe sicher in einen Produktionspfad einsetzbar macht.
Den aktuellen Preis und die p50/p95-Werte für die Zeit bis zum ersten Token finden Sie auf der Seite GPT-5.6 Luna on OrcaRouter — ein Blick lohnt sich, denn Preislisten der Anbieter hinken Preissenkungen hinterher, und Tracker von Drittanbietern hinken beiden hinterher.
Was als Nächstes ansehen
Drei Dinge würden aus dieser Preisgeschichte eine ganz andere Geschichte machen.
Eine weitere Senkung. Die chinesischsprachige Finanzberichterstattung stellte OpenAI Anfang September als ein Unternehmen dar, das sich darauf vorbereitet, die Preise erneut anzupassen, um der Open-Weight-Konkurrenz zu begegnen. Diese Berichterstattung ist vorausschauend und unbestätigt, doch sie passt zu einem Unternehmen, das bereits eine Senkung um 80 % bei seinem Volumentarif akzeptiert hat und nun öffentlich über die Kosten pro Deployment streitet.
Ergebnisbasierte Preisgestaltung wird Realität. Wenn OpenAI beginnt, Luna nach Geschäftsergebnis statt nach Token zu verkaufen, ist der Vergleich pro Token, auf dem dieser gesamte Markt basiert, nicht mehr das relevante Scoreboard – und jede Kostenschätzung pro Aufgabe, einschließlich der oben genannten, muss neu hergeleitet werden.
Ein fähiger Nachfolger zum selben Preis. GPT-6 Astra existiert bereits oberhalb der GPT-5.6-Linie, und Lunas eigene Position hängt davon ab, dass OpenAI sie dort belässt, wo sie ist. Sobald eine neuere kleine Stufe für $0.20/$1.20 erscheint, ist die interessante Frage nicht mehr, ob Luna günstig ist, sondern ob sie noch das günstigste Ziel ist, zu dem sich Routing lohnt.

Für den Moment ist die Situation ungewöhnlich einfach. GPT-5.6 Luna ist ein zwei Monate altes Modell, bei dem der Preis – nicht seine Leistungsfähigkeit – die Neuigkeit ist, und der Token-Preis ist die schmeichelhafteste Art, es zu betrachten, nicht die genaueste.
