
OpenAI senkt GPT-5.6-API-Preise: Was sich geändert hat, warum und wie man es erhält
- qwenNEUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 pro 1 Mio. Tokens · 55 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligenz69Coding
- qwenNEUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 206 tok/s
- orcaNEUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEUAnthropic: Claude Opus 52026-07-2461Intelligenz78Coding
- googleNEUGoogle: Gemini 3.6 Flash2026-07-2150Intelligenz69Coding
- googleNEUGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1651Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1557Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0854Intelligenz72Coding
- tencentTencent: Hy32026-07-0641Intelligenz59Coding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenz42Coding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenz39Coding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligenz72Coding
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenz52Coding57Mathe
- z-aiZ.ai: GLM 5.22026-06-1651Intelligenz69Coding60Mathe
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligenz61Coding61Mathe
Am 30. Juli 2026 senkte OpenAI die API-Preise seiner beiden kostengünstigeren GPT-5.6-Modelle — der günstigste Tarif wurde drastisch reduziert und der mittlere Tarif etwas gesenkt, während das Flaggschiff unangetastet blieb. Dies ist ein bemerkenswerter Schritt in einem sich verschärfenden Preiskampf, und er fand sofort Eingang in die veröffentlichte Preisliste. Dieser Artikel erklärt genau, was sich geändert hat, die Technik dahinter, wie sich die neuen Preise im Vergleich zu Mitbewerbern schlagen, auf welche versteckten Kosten Sie achten sollten, wie Sie Ihre Rechnung weiter senken können — und wie die niedrigeren Preise bereits live auf OrcaRouter mit 0% Aufschlag sind.
Jede unten aufgeführte Abbildung ist mit der Quelle gekennzeichnet. Die Preise gelten pro Million Tokens (Eingabe / Ausgabe) und entsprechen der Preisliste von OpenAI vom 30. Juli 2026, wie unter anderem von Unite.AI berichtet, sowie den Pass-through-Modellseiten von OrcaRouter; Wettbewerbszahlen werden mit Quellenangabe versehen. Preise ändern sich – vergewissern Sie sich, bevor Sie etwas bauen.
TL;DR. OpenAI hat GPT-5.6 Luna auf 0,20 $ / 1,20 $ gesenkt (von 1 $ / 6 $, ca. 80 % Rabatt) und GPT-5.6 Terra auf 2 $ / 12 $ (von 2,50 $ / 15 $, ca. 20 % Rabatt), während GPT-5.6 Sol weiterhin bei 5 $ / 30 $ liegt. Zwei Effizienzgewinne haben das bezahlt: neu geschriebene GPU-Kernel (etwa 20 % niedrigere Serving-Kosten) und ein neu gestaltetes Draft-Modell für spekulative Dekodierung (über 15 % schnellere Token-Erzeugung). Die Senkung drückt Luna unter Anthropics Haiku 4.5 und in Richtung der günstigen Open-Model-Untergrenze, die von DeepSeek und GLM gesetzt wird. Wenn Sie über einen anbieterneutralen, 0%-Aufschlags-Endpunkt wie OrcaRouter routen, sind die neuen Tarife bereits live – gleicher Preis, eine OpenAI-kompatible API, mit jedem Konkurrenzmodell daneben zum Vergleichen und Routen.
Wichtige Erkenntnisse
• GPT-5.6 Luna: jetzt 0,20 $ / 1,20 $ pro 1 M Token, gesenkt von 1 $ / 6 $ — eine Reduzierung um rund 80 %.
• GPT-5.6 Terra: jetzt 2 $ / 12 $, statt 2,50 $ / 15 $ — etwa 20 % weniger.
• GPT-5.6 Sol (Flaggschiff): unverändert bei $5 / $30.
• Warum: laut OpenAIs Engineering-Beitrag vom 29. Juli umgeschriebene Produktions-GPU-Kernel (~20 % geringere Serving-Kosten) plus eine Neugestaltung des Draft-Modells für spekulative Dekodierung (15 %+ Effizienzsteigerung bei der Token-Generierung).
• So erhalten Sie es: Der Rabatt ist bereits auf OrcaRouter (0% Aufschlag) abgebildet — Luna für $0.20 / $1.20 — über einen OpenAI-kompatiblen Endpunkt.
Was genau hat sich geändert?
OpenAI's GPT-5.6-Familie läuft als Tarifstufen-Leiter: Luna (schnell, am günstigsten), Terra (Mittelstufe) und Sol (Flaggschiff). Der Preisschnitt vom 30. Juli traf die beiden günstigeren Stufen. Laut der gemeldeten Preisliste sank GPT-5.6 Luna von 1 $ / 6 $ auf 0,20 $ / 1,20 $ pro Million Input-/Output-Tokens – also um etwa 80 % sowohl bei Input als auch Output – und GPT-5.6 Terra fiel von 2,50 $ / 15 $ auf 2 $ / 12 $, also um grob 20 %. GPT-5.6 Sol, das Flaggschiff für die anspruchsvollsten Reasoning- und Agentic-Coding-Aufgaben, blieb bei 5 $ / 30 $. Die Volumenstufen wurden drastisch günstiger; die oberste Stufe bewegte sich nicht.
Der Basispreis pro Token ist nicht die ganze Geschichte. Die GPT-5.6-Preise umfassen auch Eingabelängen-Stufen (sehr lange Kontexte wechseln zu einem höheren Satz), einen Prompt-Caching-Rabatt (gecachte Eingaben sind weitaus günstiger als frische Eingaben) und eine Batch-Option (asynchrone Aufträge mit Rabatt). Alle drei gelten auch nach der Kürzung weiter, sodass der effektive Preis für eine Cache- oder Batch-lastige Arbeitslast noch niedriger sein kann. Beachten Sie die Langkontext-Stufe in die andere Richtung: Das Einspeisen riesiger Prompts kann Sie in eine höhere Stufe befördern.

Die zwei Optimierungen hinter dem Schnitt
Das war keine Lockvogel-Aktion – OpenAI stellte es als Effizienzdividende dar. In einem Engineering-Beitrag vom 29. Juli 2026 beschrieben Mitglieder des technischen Teams von OpenAI Optimierungen bei der Inferenz und der Agent-Infrastruktur hinter Codex und ChatGPT Work. Zwei stechen hervor. Erstens: GPU-Kernel-Neufassungen in der Produktionsinfrastruktur – wobei Sol, das in Codex läuft, dazu genutzt wurde, die eigenen Kernel des Unternehmens neu zu schreiben –, die laut OpenAI die End-to-End-Bereitstellungskosten um etwa 20 % senkten. Zweitens: Ein neu gestaltetes Draft-Modell für spekulative Dekodierung, das die Token-Erzeugungseffizienz Berichten zufolge um mehr als 15 % verbesserte. Die geringeren Bereitstellungskosten, die als niedrigere Preise in den Volumentarifen an die Kunden weitergegeben werden, sind die Story – und sie bieten einen Blick auf eine Feedbackschleife, die die gesamte Branche verfolgt: den Einsatz von Frontier-Modellen zur Optimierung genau der Infrastruktur, die ihnen dient.
Wie die neuen Preise im Vergleich abschneiden
Die Preissenkung zielt direkt auf den Wettbewerb. Laut Berichterstattung von Unite.AI unterbietet Lunas neuer Preis von 0,20 $ / 1,20 $ Anthropics Haiku 4.5 um etwa das Fünffache beim Input und etwa das Vierfache beim Output, und Terras neue 2 $ / 12 $ liegen unter der Standardpreisgestaltung von Claude Sonnet 5 (berichtet mit 3 $ / 15 $, die nach dem 31. August 2026 wirksam werden). Im Vergleich zu den Open-Weight-Modellen liegt Luna nun nahe der günstigen Inferenz-Untergrenze, die von DeepSeeks V4-Linie und Zhipus GLM-5.2 (etwa 1,20 $ / 4,10 $) etabliert wurde, wobei Alibabas Qwen und Googles Gemini-Flash-Stufen in derselben Größenordnung liegen. Mit anderen Worten: OpenAI hat seine Volumenstufen auf das Niveau gesenkt, auf dem die günstigsten leistungsfähigen Modelle bereits angesiedelt sind – und damit den Preisnachteil für die Wahl eines proprietären Modells gegenüber einem offenen Modell verringert.
Inferenz wird immer günstiger.
Zoomt man heraus, passt diese Preissenkung in einen mehrjährigen Trend: Die Kosten für ein bestimmtes Leistungsniveau sind Generation für Generation stark gesunken, da die Labore mehr Durchsatz aus derselben Hardware herausholen. OpenAIs eigene ältere Preisstufen veranschaulichen die Abwärtsbewegung im Laufe der Zeit, und jeder Effizienzdurchbruch – bessere Kernel, spekulative Dekodierung, günstigere Aufmerksamkeit – zeigt sich in der Regel innerhalb von Monaten als Preissenkung. Für Käufer bedeutet das praktisch, für eine Welt zu planen, in der Inferenz planmäßig billiger wird: Verlasse dich nicht zu sehr auf die Preisgestaltung eines einzelnen Modells und halte die Wechselkosten niedrig.
Die versteckten Kosten, auf die man achten sollte: Reasoning-Tokens
GPT-5.6-Modelle sind Reasoning-Modelle, und das prägt die realen Ausgaben. Wenn Reasoning aktiviert ist, erzeugt das Modell interne Reasoning-Tokens, die als Output abgerechnet werden – Ihre effektiven Output-Kosten können also höher sein, als eine naive Schätzung auf Basis der „Wörter in der Antwort“ vermuten lässt, insbesondere bei schwierigen Prompts mit hohem Reasoning-Aufwand. Die Lösung besteht darin, den Reasoning-Aufwand an die Aufgabe anzupassen (niedrig oder aus für einfache Aufrufe), den Output wo möglich zu begrenzen und den tatsächlichen Token-Verbrauch zu messen, statt Annahmen zu treffen. Ein günstigerer Preis pro Token hilft, aber die Kontrolle darüber, wie viele Tokens Sie erzeugen, hilft mehr.
Was das für Entwickler bedeutet
Wenn Sie GPT-5.6 Luna oder Terra für Aufgaben mit hohem Volumen einsetzen — Klassifizierung, Extraktion, Routing, leichtgewichtige Agents, Chat — ist Ihre Rechnung gerade gesunken, in manchen Fällen um den Großteil ihres Werts, ohne dass eine Codeänderung erforderlich ist. Dadurch werden die Volumentarife noch attraktiver für kosten sensible Workloads und verringern die Preislücke zu günstigen offenen Modellen. Die Mathematik beim Flaggschiff bleibt unverändert: Sol zu 5 $ / 30 $ ist weiterhin eine Premium-Wahl für die schwierigsten Aufgaben. Das Erfolgsmuster besteht darin, nach Schwierigkeit zu routen — günstige Tarife (oder günstige offene Modelle) für die einfachen 80 %, das Flaggschiff nur dort, wo es seine Kosten rechtfertigt.
So senken Sie Ihre Rechnung noch weiter
Die Preissenkung ist ein Fundament, auf dem man aufbauen kann, nicht die Ziellinie. Die größten zusätzlichen Hebel: Prompt-Caching (ein stabiles System-Prompt oder einen langen Kontext wiederverwenden und den deutlich günstigeren Tarif für gecachte Eingaben zahlen); die Batch-Option (nicht dringende Aufträge asynchron zu einem ermäßigten Tarif ausführen); Stufen- und Modell-Routing (jede Anfrage an das günstigste Modell senden, das sie bewältigen kann, einschließlich offener Modelle); und Reasoning-Steuerung (nicht für tiefgehendes Reasoning bei trivialen Aufrufen zahlen). Zusammengenommen senken diese Maßnahmen die tatsächlichen Rechnungen routinemäßig weitaus stärker als jede einzelne Tarifänderung. Als konkretes Beispiel: Bei 10 Millionen Token pro Monat mit einem Input-Anteil von 70 % ergeben Lunas neue Tarife grob 5 $ pro Monat (etwa 4,37 $ mit Caching); dasselbe Volumen auf Sol kostet etwa 125 $ pro Monat – das deutlichste Argument für ein Routing nach Schwierigkeit.
So sichern Sie sofort die niedrigeren Preise.
Hier ist der Teil, der alles zusammenhält. a href="https://www.orcarouter.ai/">OrcaRouter/a> erhebt keinen Aufschlag und gibt die Anbieterpreise direkt weiter, sodass OpenAIs Preisvorteil bereits live auf OrcaRouter ist: GPT-5.6 Luna zeigt $0,20 / $1,20 und Terra $2 / $12 auf den Modellseiten — dieselben Preise wie auf OpenAIs eigener Preiskarte, erreichbar über einen einzigen OpenAI-kompatiblen Endpunkt neben 185+ anderen Modellen. Sie können Luna und Terra an einem Ort preislich mit DeepSeek, GLM, Qwen, Gemini und Claude vergleichen und dann jede Anfrage an das jeweils günstigste Modell für die jeweilige Aufgabe weiterleiten. Es gibt auch einen kostenlosen Tarif und eine Angebotsseite für zusätzliche Ersparnisse.

Der Preis ist bereits live auf OrcaRouter: GPT-5.6 Luna zu $0,20 / $1,20 pro 1M Tokens, mit 0% Aufschlag durchgereicht.
Route nach Schwierigkeit, um noch mehr zu sparen.
Die günstigste Rechnung ist nicht ein einziges Modell — es ist das richtige Modell pro Anfrage. Da OrcaRouter das gesamte Feld über einen einzigen Endpunkt bereitstellt, können Sie einfache, hochvolumige Aufrufe an Luna oder ein günstiges offenes Modell senden und Sol oder ein anderes Flaggschiff für die schwierigen reservieren, wobei Sie per Konfigurationsänderung statt Neuintegration umschalten. Eine Preissenkung bei Luna macht diese Strategie des Routings nach Schwierigkeit noch günstiger, ohne dass Sie irgendetwas umbauen müssen.

FAQ
Um wie viel hat OpenAI die Preise für GPT-5.6 gesenkt?
GPT-5.6 Luna fiel von $1 / $6 auf $0,20 / $1,20 pro Million Tokens (etwa 80 %), und GPT-5.6 Terra von $2,50 / $15 auf $2 / $12 (etwa 20 %). GPT-5.6 Sol blieb bei $5 / $30.
Wann trat die Preissenkung in Kraft?
30. Juli 2026, eingetragen im OpenAI-API-Änderungsprotokoll und live auf der veröffentlichten Preisliste.
Warum hat OpenAI die Preise gesenkt?
OpenAI führt es auf Inferenzoptimierungen zurück — neu geschriebene Produktions-GPU-Kernel (etwa 20% geringere Serving-Kosten) und ein neu gestaltetes Draft-Modell für spekulative Dekodierung (15%+ Effizienz bei der Token-Generierung) — laut einem Engineering-Blogbeitrag vom 29. Juli 2026.
Ist das Flaggschiff (Sol) billiger geworden?
Nein. GPT-5.6 Sol bleibt bei $5 / $30 pro Million Token. Nur die beiden günstigeren Stufen, Luna und Terra, wurden gesenkt.
Wie schneiden die neuen Preise im Vergleich zu Anthropic und offenen Modellen ab?
Berichten zufolge unterbietet Luna Anthropics Haiku 4.5 nun um etwa das 5-fache beim Input / 4-fache beim Output, und Terra fällt unter die Standardpreise von Claude Sonnet 5 ($3 / $15). Luna liegt außerdem nahe an der günstigen Preisuntergrenze offener Modelle, die DeepSeek und GLM-5.2 gesetzt haben.
Was ist der Haken bei Reasoning-Tokens?
GPT-5.6 sind Reasoning-Modelle; interne Reasoning-Token werden als Ausgabe abgerechnet, sodass die effektiven Ausgabekosten eine naive Schätzung übersteigen können. Passen Sie den Reasoning-Aufwand an und begrenzen Sie die Ausgabe, um die Kosten zu kontrollieren.
Wie bekomme ich die neuen niedrigeren Preise?
Sie sind bereits live auf der OpenAI-API und, zu 0% Aufschlag, auf OrcaRouter – wo GPT-5.6 Luna $0.20 / $1.20 zeigt – über einen OpenAI-kompatiblen Endpunkt, ohne dass eine Codeänderung erforderlich ist.
Fazit
OpenAIs Preissenkung vom 30. Juli macht GPT-5.6 Luna und Terra deutlich günstiger für hohe Volumina – ein Effizienzgewinn durch Kernel-Neufassungen und spekulative Dekodierungsvorteile, und eine klare Antwort auf einen echten Preiskrieg, der nun die günstigeren Tarife von Anthropic unterbietet und sich dem Niveau offener Modelle annähert. Das Flaggschiff Sol bleibt unverändert, also richten Sie sich nach Schwierigkeit, setzen Sie auf Caching und Batching und steuern Sie Reasoning-Token, um am meisten zu sparen. Und da OrcaRouter die Preise der Anbieter mit einem Aufschlag von 0 % durchreicht, sind die niedrigeren Tarife dort bereits live – gleicher Preis, ein OpenAI-kompatibler Endpunkt, das gesamte Modellfeld an einem Ort. Sichern Sie sich die Preissenkung, ohne eine Zeile Code zu ändern, und lassen Sie jede Anfrage das günstigste Modell wählen, das die Aufgabe erfüllen kann.
