OpenAI senkt GPT-5.6-API-Preise: Was sich geändert hat, warum und wie man es erhält
Guides & Insights

OpenAI senkt GPT-5.6-API-Preise: Was sich geändert hat, warum und wie man es erhält

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 30. Juli 2026 senkte OpenAI die API-Preise seiner beiden günstigeren GPT-5.6-Modelle – die günstigste Preisstufe wurde deutlich reduziert, die mittlere leicht gesenkt. Drei Wochen später wandte sich das Unternehmen dem Flaggschiff zu: Am 21. August 2026 kündigte OpenAI an, dass die API-Preise von GPT-5.6 Sol in den nächsten drei Monaten um mehr als 20 % fallen, während das Unternehmen daran arbeitet, das Modell effizienter zu betreiben. Dieser Artikel erklärt genau, was sich in beiden Runden geändert hat, die technischen Hintergründe, wie sich die neuen Preise im Vergleich zu Konkurrenten schlagen, welche versteckten Kosten zu beachten sind, wie Sie Ihre Rechnung weiter senken können – und dass die niedrigeren Preise bereits live auf OrcaRouter mit 0 % Aufschlag verfügbar sind.

Jede unten aufgeführte Zahl ist mit einer Quellenangabe versehen. Die Preise gelten pro Million Token (Eingabe / Ausgabe). Die Luna- und Terra-Preise entsprechen der Preisliste von OpenAI vom 30. Juli 2026, wie von Medienunternehmen einschließlich Unite.AI berichtet; die Sol-Senkung entspricht der Ankündigung von OpenAI vom 21. August 2026, mit Preisen pro Token, wie von Medienunternehmen einschließlich Runtimewire und Reuters berichtet. Die Pass-through-Modellseiten von OrcaRouter zeigen dieselben Zahlen; Wettbewerbszahlen sind mit Quellenangabe versehen. Preise ändern sich – prüfen Sie, bevor Sie bauen.

TL;DR. OpenAI senkte die Preise für GPT-5.6 Luna auf 0,20 $ / 1,20 $ (von 1 $ / 6 $, etwa 80 % Rabatt) und für GPT-5.6 Terra auf 2 $ / 12 $ (von 2,50 $ / 15 $, etwa 20 % Rabatt) am 30. Juli. Am 21. August wurde der Rabatt auf das Flaggschiff ausgeweitet: Die API-Preise für GPT-5.6 Sol fallen für die nächsten drei Monate um über 20 % – auf 4 $ / 20 $ pro Million Tokens von 5 $ / 30 $, so OpenAI. Gleichzeitig bekommt man für token-basierte Codex- und ChatGPT-Work-Guthaben mehr, während die Abo-Nutzung unverändert bleibt. Zwei Effizienzgewinne finanzierten die Juli-Senkung: neu geschriebene GPU-Kernel (etwa 20 % geringere Serving-Kosten) und ein neu gestaltetes Draft-Modell für spekulatives Decoding (über 15 % schnellere Tokenerzeugung). Wenn Sie über einen anbieterneutralen Endpunkt ohne Aufschlag wie OrcaRouter routen, sind die neuen Tarife bereits live – gleicher Preis, eine OpenAI-kompatible API, mit jedem Konkurrenzmodell daneben zum Vergleichen und Routen.

Wichtige Erkenntnisse

• GPT-5.6 Luna: jetzt 0,20 $ / 1,20 $ pro 1 M Token, gesenkt von 1 $ / 6 $ — eine Reduzierung um rund 80 %.

• GPT-5.6 Terra: jetzt 2 $ / 12 $, statt 2,50 $ / 15 $ — etwa 20 % weniger.

• GPT-5.6 Sol (Flaggschiff): jetzt 4 $ / 20 $ für die nächsten drei Monate, statt 5 $ / 30 $ – eine Senkung um über 20 %, angekündigt am 21. August 2026.

• Codex & ChatGPT Work tokenbasierte Credits kaufen mehr: Sol-Input sinkt auf 100 Credits und Output auf 500 Credits pro 1M Tokens (von 125 / 750).

• Abonnements unverändert: Das enthaltene Nutzungsvolumen für Plus, Pro und Business, die wöchentlichen Fünf-Stunden-Limits und die Legacy-Kreditsätze bleiben unberührt.

• Warum: OpenAI präsentierte beide Runden als Effizienzdividenden — neu geschriebene Produktions-GPU-Kernel (~20 % geringere Serving-Kosten) plus ein Redesign des Draft-Modells für spekulatives Decoding (15 %+ höhere Token-Generierungseffizienz), laut OpenAIs Engineering-Beitrag vom 29. Juli.

Wie Sie es erhalten: Die Preisänderungen sind bereits in OrcaRouter berücksichtigt (0% Aufschlag) — Luna für 0,20 $ / 1,20 $, Sol für 4 $ / 20 $ — über einen OpenAI-kompatiblen Endpunkt.

Was genau hat sich geändert?

Die GPT-5.6-Familie von OpenAI läuft als Stufenmodell: Luna (schnell, am günstigsten), Terra (mittel) und Sol (Flaggschiff). Der Preisschnitt am 30. Juli traf die beiden günstigeren Stufen. Laut der veröffentlichten Preisliste fiel GPT-5.6 Luna von 1 $ / 6 $ auf 0,20 $ / 1,20 $ pro Million Input-/Output-Token – eine Reduktion um etwa 80 % bei Input und Output – und GPT-5.6 Terra fiel von 2,50 $ / 15 $ auf 2 $ / 12 $, also um rund 20 %. GPT-5.6 Sol, das Flaggschiff für die anspruchsvollsten Reasoning- und Agentic-Coding-Aufgaben, blieb an jenem Tag unangetastet – doch am 21. August 2026 kündigte OpenAI auch dafür eine vorübergehende Senkung an: Die API-Preise fallen für die nächsten drei Monate um mehr als 20 %, auf 4 $ pro Million Input-Token und 20 $ pro Million Output-Token, wobei gecachter Input von 0,50 $ auf 0,40 $ sinkt. In derselben Ankündigung hieß es, dass die gekauften Credits in Codex bei tokenbasierten Tarifen weiter reichen, während der in deinem Abonnement enthaltene Verbrauch unverändert bleibt.

Der Basispreis pro Token ist nicht die ganze Geschichte. Die GPT-5.6-Preise umfassen auch Eingabelängen-Stufen (sehr lange Kontexte wechseln zu einem höheren Satz), einen Prompt-Caching-Rabatt (gecachte Eingaben sind weitaus günstiger als frische Eingaben) und eine Batch-Option (asynchrone Aufträge mit Rabatt). Alle drei gelten auch nach der Kürzung weiter, sodass der effektive Preis für eine Cache- oder Batch-lastige Arbeitslast noch niedriger sein kann. Beachten Sie die Langkontext-Stufe in die andere Richtung: Das Einspeisen riesiger Prompts kann Sie in eine höhere Stufe befördern.

Die zwei Optimierungen hinter dem Schnitt

Das war keine Lockvogel-Aktion – OpenAI stellte es als Effizienzdividende dar. In einem Engineering-Beitrag vom 29. Juli 2026 beschrieben Mitglieder des technischen Teams von OpenAI Optimierungen bei der Inferenz und der Agent-Infrastruktur hinter Codex und ChatGPT Work. Zwei stechen hervor. Erstens: GPU-Kernel-Neufassungen in der Produktionsinfrastruktur – wobei Sol, das in Codex läuft, dazu genutzt wurde, die eigenen Kernel des Unternehmens neu zu schreiben –, die laut OpenAI die End-to-End-Bereitstellungskosten um etwa 20 % senkten. Zweitens: Ein neu gestaltetes Draft-Modell für spekulative Dekodierung, das die Token-Erzeugungseffizienz Berichten zufolge um mehr als 15 % verbesserte. Die geringeren Bereitstellungskosten, die als niedrigere Preise in den Volumentarifen an die Kunden weitergegeben werden, sind die Story – und sie bieten einen Blick auf eine Feedbackschleife, die die gesamte Branche verfolgt: den Einsatz von Frontier-Modellen zur Optimierung genau der Infrastruktur, die ihnen dient.

Die am 21. August angekündigte Sol-Senkung weist dieselbe Rahmung auf. Laut OpenAI erfolgt die Reduzierung — mehr als 20 % für die nächsten drei Monate — im Zuge der Effizienzsteigerung des Modellbetriebs, und sie ist ausdrücklich vorübergehend und keine dauerhafte Preiskorrektur.

Wie die neuen Preise im Vergleich abschneiden

Der Preisnachlass zielt direkt auf den Wettbewerb. Laut Unite.AI unterbietet Lunas neuer Preis von $0.20 / $1.20 Anthropics Haiku 4.5 um etwa das Fünffache beim Input und etwa das Vierfache beim Output, und Terras neue Preise von $2 / $12 liegen unter der Standardpreisgestaltung von Claude Sonnet 5 (die Berichten zufolge nach dem 31. August 2026 mit $3 / $15 in Kraft tritt). Bei den Open-Weight-Modellen liegt Luna nun nahe am günstigen Inferenz-Boden, den DeepSeeks V4-Linie und Zhipus GLM-5.2 (rund $1.20 / $4.10) etabliert haben, wobei sich Alibabas Qwen und Googles Gemini-Flash-Stufen in derselben Größenordnung bewegen. Sols vorübergehende Senkung auf $4 / $20 hält das Flaggschiff deutlich über seinen eigenen Volumentarifen, reduziert aber die Prämie – und die Senkung um ein Drittel bei den Output-Tokens ist für stark ausgabeintensive Agent-Workloads am wichtigsten. Die Berichterstattung über diesen Schritt weist darauf hin, dass er erfolgt, während OpenAI wachsendem Wettbewerb durch Anthropic und chinesische KI-Modelle ausgesetzt ist.

Inferenz wird immer günstiger.

Zoomt man heraus, passt diese Preissenkung in einen mehrjährigen Trend: Die Kosten für ein bestimmtes Leistungsniveau sind Generation für Generation stark gesunken, da die Labore mehr Durchsatz aus derselben Hardware herausholen. OpenAIs eigene ältere Preisstufen veranschaulichen die Abwärtsbewegung im Laufe der Zeit, und jeder Effizienzdurchbruch – bessere Kernel, spekulative Dekodierung, günstigere Aufmerksamkeit – zeigt sich in der Regel innerhalb von Monaten als Preissenkung. Für Käufer bedeutet das praktisch, für eine Welt zu planen, in der Inferenz planmäßig billiger wird: Verlasse dich nicht zu sehr auf die Preisgestaltung eines einzelnen Modells und halte die Wechselkosten niedrig.

Die versteckten Kosten, auf die man achten sollte: Reasoning-Tokens

GPT-5.6-Modelle sind Reasoning-Modelle, und das prägt die realen Ausgaben. Wenn Reasoning aktiviert ist, erzeugt das Modell interne Reasoning-Tokens, die als Output abgerechnet werden – Ihre effektiven Output-Kosten können also höher sein, als eine naive Schätzung auf Basis der „Wörter in der Antwort“ vermuten lässt, insbesondere bei schwierigen Prompts mit hohem Reasoning-Aufwand. Die Lösung besteht darin, den Reasoning-Aufwand an die Aufgabe anzupassen (niedrig oder aus für einfache Aufrufe), den Output wo möglich zu begrenzen und den tatsächlichen Token-Verbrauch zu messen, statt Annahmen zu treffen. Ein günstigerer Preis pro Token hilft, aber die Kontrolle darüber, wie viele Tokens Sie erzeugen, hilft mehr.

Was das für Entwickler bedeutet

Wenn Sie GPT-5.6 Luna oder Terra für umfangreiche Arbeiten nutzen — Klassifizierung, Extraktion, Routing, leichtgewichtige Agenten, Chat —, ist Ihre Rechnung gerade gesunken, in manchen Fällen um den größten Teil ihres Wertes, ohne dass eine Codeänderung erforderlich ist. Das macht die Volumenstufen für kostenbewusste Arbeitslasten noch attraktiver und verringert die Preislücke zu günstigen offenen Modellen. Auch die Kostenrechnung des Flaggschiffs hat sich geändert, zumindest vorerst: Sol für 4 $ / 20 $ in den nächsten drei Monaten senkt die Kosten für reasoning-intensive und agentische Arbeit in der obersten Stufe, und tokenbasierte Codex- und ChatGPT-Work-Guthaben reichen nun weiter. Es bleibt eine Premium-Wahl für die schwierigsten Aufgaben — nur eine günstigere als zuvor. Das Erfolgsmuster ist dasselbe: Routing nach Schwierigkeit — günstige Stufen (oder günstige offene Modelle) für die einfachen 80 %, das Flaggschiff nur dort, wo es seine Kosten rechtfertigt.

So senken Sie Ihre Rechnung noch weiter

Die Preissenkung ist ein Fundament, auf dem man aufbauen kann, nicht die Ziellinie. Die größten zusätzlichen Hebel: Prompt-Caching (ein stabiles System-Prompt oder einen langen Kontext wiederverwenden und den deutlich günstigeren Tarif für gecachte Eingaben zahlen); die Batch-Option (nicht dringende Aufträge asynchron zu einem ermäßigten Tarif ausführen); Stufen- und Modell-Routing (jede Anfrage an das günstigste Modell senden, das sie bewältigen kann, einschließlich offener Modelle); und Reasoning-Steuerung (nicht für tiefgehendes Reasoning bei trivialen Aufrufen zahlen). Zusammengenommen senken diese Maßnahmen die tatsächlichen Rechnungen routinemäßig weitaus stärker als jede einzelne Tarifänderung. Als konkretes Beispiel: Bei 10 Millionen Token pro Monat mit einem Input-Anteil von 70 % ergeben Lunas neue Tarife grob 5 $ pro Monat (etwa 4,37 $ mit Caching); dasselbe Volumen auf Sol kostet etwa 125 $ pro Monat – das deutlichste Argument für ein Routing nach Schwierigkeit.

So sichern Sie sofort die niedrigeren Preise.

Hier ist der Teil, der alles zusammenhält. OrcaRouter verlangt 0 % Aufschlag und leitet die Preise der Anbieter direkt weiter, sodass die Preissenkungen von OpenAI bereits auf OrcaRouter live sind: GPT-5.6 Luna zeigt derzeit $0,20 / $1,20, Terra $2 / $12 und GPT-5.6 Sol $4 / $20 auf den Modellseiten — dieselben Preise wie auf OpenAIs eigener Preisliste, erreichbar über einen einzigen OpenAI-kompatiblen Endpunkt neben über 185 weiteren Modellen. Sie erhalten die Preissenkungen ohne Migration und können Sol, Luna und Terra an einem Ort gegen DeepSeek, GLM, Qwen, Gemini und Claude preislich vergleichen und dann jede Anfrage an das jeweils günstigste Modell weiterleiten. Es gibt außerdem einen kostenlosen Tarif und eine Angebotsseite für zusätzliche Ersparnisse.

Die Preissenkungen sind bereits live auf OrcaRouter: GPT-5.6 Luna für 0,20 $ / 1,20 $ und GPT-5.6 Sol für 4 $ / 20 $ pro 1M Tokens, ohne Aufschlag durchgereicht.

Route nach Schwierigkeit, um noch mehr zu sparen.

Die günstigste Rechnung ist nicht ein einziges Modell — sondern das richtige Modell pro Anfrage. Da OrcaRouter das gesamte Feld über einen einzigen Endpoint zugänglich macht, kannst du einfache, hochvolumige Anfragen an Luna oder ein günstiges offenes Modell senden und Sol oder ein anderes Flaggschiff für die schwierigen aufsparen — der Wechsel erfolgt per Konfigurationsänderung statt einer Neu-Integration. Eine Preissenkung bei Luna macht diese Strategie des Weiterleitens nach Schwierigkeitsgrad noch günstiger, und der befristete Sol-Rabatt senkt auch die Kosten der schwierigen Anfragen — ohne dass du irgendetwas umverdrahten müsstest.

FAQ

Um wie viel hat OpenAI die Preise für GPT-5.6 gesenkt?

GPT-5.6 Luna fiel von 1 $ / 6 $ auf 0,20 $ / 1,20 $ pro Million Token (etwa 80%), und GPT-5.6 Terra von 2,50 $ / 15 $ auf 2 $ / 12 $ (etwa 20%). Am 21. August 2026 senkte OpenAI außerdem GPT-5.6 Sol von 5 $ / 30 $ auf 4 $ / 20 $ für die nächsten drei Monate.

Wann trat die Preissenkung in Kraft?

Die Kürzungen bei Luna und Terra traten am 30. Juli 2026 in Kraft, live auf der veröffentlichten Preisliste. OpenAI kündigte am 21. August 2026 die vorübergehende Sol-Senkung für die nächsten drei Monate an.

Warum hat OpenAI die Preise gesenkt?

OpenAI führt die Senkung im Juli auf Inferenzoptimierungen zurück — neu geschriebene Produktions-GPU-Kernel (etwa 20 % niedrigere Serving-Kosten) und ein neu gestaltetes Draft-Modell für spekulatives Dekodieren (über 15 % Effizienzsteigerung bei der Token-Erzeugung) — laut einem Technikbeitrag vom 29. Juli 2026. Es erklärte die Senkung für Sol auf dieselbe Weise, als einen Schritt, der unternommen wurde, während das Modell günstiger im Betrieb wird, in einem Markt mit zunehmendem Wettbewerb.

Ist das Flaggschiff (Sol) billiger geworden?

Ja — vorübergehend. Die Preissenkung vom 30. Juli ließ GPT-5.6 Sol bei 5 $ / 30 $, aber am 21. August 2026 kündigte OpenAI eine Preisreduzierung von mehr als 20 % für die nächsten drei Monate an, auf 4 $ / 20 $ pro Million Tokens. Auch die tokenbasierten Credits von Codex und ChatGPT Work bringen mehr ein, während die Abonnementnutzung unverändert bleibt.

Wie schneiden die neuen Preise im Vergleich zu Anthropic und offenen Modellen ab?

Berichten zufolge unterbietet Luna Anthropics Haiku 4.5 nun um etwa das 5-fache beim Input / 4-fache beim Output, und Terra fällt unter die Standardpreise von Claude Sonnet 5 ($3 / $15). Luna liegt außerdem nahe an der günstigen Preisuntergrenze offener Modelle, die DeepSeek und GLM-5.2 gesetzt haben.

Was ist der Haken bei Reasoning-Tokens?

GPT-5.6 sind Reasoning-Modelle; interne Reasoning-Token werden als Ausgabe abgerechnet, sodass die effektiven Ausgabekosten eine naive Schätzung übersteigen können. Passen Sie den Reasoning-Aufwand an und begrenzen Sie die Ausgabe, um die Kosten zu kontrollieren.

Wie bekomme ich die neuen niedrigeren Preise?

Sie sind bereits live auf der OpenAI-API und, mit 0 % Aufschlag, auf OrcaRouter — wo GPT-5.6 Luna $0,20 / $1,20 und GPT-5.6 Sol $4 / $20 zeigt — über einen einzigen OpenAI-kompatiblen Endpunkt, ohne dass eine Codeänderung erforderlich ist.

Fazit

Openais Preissenkung vom 30. Juli machte GPT-5.6 Luna und Terra deutlich günstiger für Arbeiten mit hohem Volumen, und die Ankündigung vom 21. August führt die Geschichte bis zum Flaggschiff fort: GPT-5.6 Sol fällt für die nächsten drei Monate auf 4 $ / 20 $, während Codex-Token-Credits mehr kaufen und die Abo-Nutzung unverändert bleibt. Beide Runden sind Effizienzdividenden – Kernel-Neufassungen und Gewinne durch spekulatives Decoding auf der einen Seite, kostengünstigerer Betrieb auf der anderen – und eine klare Antwort auf einen echten Preiskampf. Leiten Sie nach Schwierigkeit, setzen Sie auf Caching und Batching und kontrollieren Sie Reasoning-Tokens, um am meisten zu sparen. Und weil OrcaRouter die Anbieterpreise ohne Aufschlag weitergibt, sind die niedrigeren Tarife dort bereits live – Luna mit 0,20 $ / 1,20 $, Sol mit 4 $ / 20 $ – gleicher Preis, ein OpenAI-kompatibler Endpunkt, das gesamte Modellangebot an einem Ort. Sichern Sie sich die Senkungen, ohne eine Zeile Code zu ändern, und lassen Sie jede Anfrage das günstigste Modell wählen, das die Aufgabe erfüllen kann.