
GPT-6 vs. GPT-6 Luna: Ein Groschen pro Million Tokens und die Stufe, die den kostenlosen Plan beantwortet
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Es gibt eine Version dieses Vergleichs, bei der die Antwort aus einer Zeile besteht: Man kann GPT-6 nicht aufrufen, und man kann GPT-6 Luna für zehn Cent pro Million Eingabe-Tokens aufrufen. Aber die nützlichere Version ist die, die erklärt, warum Luna jetzt das Modell ist, das die meisten Leute tatsächlich benutzt haben – OpenAI hat es am 8. Oktober 2026 hinter die Free- und Go-Tarife von ChatGPT gestellt, was es zum günstigsten Tarif der Generation und, gemessen an der Nutzerzahl, zum meistgenutzten macht. Was folgt, ist die Stufenleiter, einmal erklärt, und dann, was zehn Cent pro Million wirklich bringen.
Die Familie und Lunas Platz darin
OpenAI veröffentlicht die GPT-6-Generation als drei Modell-IDs, die am 22. September 2026 erscheinen, wobei hinter dem Familiennamen kein openai/gpt-6-Endpunkt steht:
• GPT-6 Astra — das Flaggschiff, 10,00 $ Eingabe / 50,00 $ Ausgabe pro Million Tokens, in OpenAIs Preisliste als das Topmodell der Generation geführt
• GPT-6 Sol — die mittlere Stufe, 2,00 $ / 10,00 $, und das Modell, das OpenAI für den Chat in den kostenpflichtigen ChatGPT-Tarifen nennt
• GPT-6 Luna — die günstige Stufe, 0,10 $ / 0,50 $, und das Modell, das OpenAI für die Tarife Free und Go nennt
Diese letzte Zeile ist der Punkt, den man festhalten sollte, denn sie ist der Grund, warum Lunas Traffic alles andere in der Familie in den Schatten stellt. Die eigene Ankündigung von OpenAI für den Rollout vom 7. bis 8. Oktober besagt: „GPT-6 in ChatGPT wird für die Tarife Plus, Pro, Business und Enterprise von GPT-6 Sol angetrieben und für die Tarife Free und Go von GPT-6 Luna.“ Ein Modell zu $0,10 / $0,50, das den Free-Tarif bedient, ist ein Modell, das pro Tag mehr Fragen beantwortet als jeder Premium-Tarif, und es ist derselbe Checkpoint, den man über die API aufrufen kann. Die Consumer-Oberfläche ist ein Vertriebskanal, kein separates SKU.
Ein Vorbehalt, der hier wiederholt werden muss, weil dieser Blog darüber berichtet hat: Dieselbe Ankündigung besagt, dass Free und Go GPT-6 Luna erhalten, während die Help-Center-Seite von OpenAI zu GPT-6 in ChatGPT Free und Go an dem Tag, an dem sie gelesen wurde, als auf GPT-5.6 Luna laufend beschrieb. Das sind keine miteinander vereinbaren Aussagen über denselben Tarif, OpenAI hat nicht gesagt, welche aktuell ist, und wenn Ihre Arbeit davon abhängt, welches günstige Modell hinter dem kostenlosen Plan steckt, sollten Sie den Help-Center-Eintrag als die spezifischere Seite behandeln und es erneut prüfen, bevor Sie auf Basis eines der beiden entwickeln.
Was zehn Cent pro Million tatsächlich kaufen
Die Schlagzeile ist die am wenigsten interessante Zahl auf Lunas Karte. Hier ist die ganze Karte und die Stufe darunter:
• Kurzer Kontext, bis zu 272.000 Eingabe-Token — 0,10 $ pro Million Eingabe, 0,50 $ pro Million Ausgabe
• Über 272.000 Eingabe-Token — 0,20 $ pro Million Eingabe, 0,75 $ pro Million Ausgabe, auf die gesamte Anfrage angewendet
• Zwischengespeicherte Eingabe — 0,01 $ pro Million in der kurzen Stufe, ein Rabatt von 90 %; 0,02 $ oberhalb der Grenze
• Cache-Schreibvorgänge — 0,125 $ pro Million in der kurzen Stufe, 0,25 $ oberhalb davon
• Kontext und Ausgabe — 1.050.000 Eingabe-Token, 128.000 Ausgabe-Token
• Eingabemodalitäten — Text, Bild und Datei, die gleiche multimodale Eingabe wie Sol und Astra
• Schlussfolgerung — ein konfigurierbarer Aufwandsparameter, zusammen mit Tools, JSON-Ausgabe und Seed-Sampling
Zwei Dinge folgen daraus. Das erste ist, dass Luna kein abgespecktes Modell ist. Es nimmt Bilder und Dateien entgegen, es bietet dieselbe Oberfläche für Tool-Aufrufe und strukturierte Ausgaben wie seine beiden teureren Geschwister, und das Einzige, was es auf dem Datenblatt von Sol unterscheidet, ist die Tiefe und nicht die Leistungsfähigkeit. Das zweite ist die Stufe. Ein Prompt über 272.000 Eingabe-Token verdoppelt Lunas Eingabetarif und erhöht seinen Ausgabetarif um die Hälfte – und zwar für die gesamte Anfrage, nicht nur für den Überlauf. Das ist bei diesen Preisen eine sanfte Stufe – eine Anfrage mit 300.000 Token kostet etwa sechs Cent Eingabe statt drei –, sodass die Langkontext-Klausel, die die Budgetplanung für Astra dominiert und für Sol von Bedeutung ist, hier nahezu irrelevant ist.
Die Zahl, die im großen Maßstab wirklich Geld bewegt, ist der Cache-Lesevorgang. Bei einem Cent pro Million zahlt eine Workload, die bei jedem Turn denselben großen Kontext erneut sendet, für den wiederholten Teil fast nichts. In einer Hochvolumen-Pipeline für Extraktion oder Klassifizierung mit stabilem System-Prompt und stabilem Dokument ist das der Unterschied zwischen einem günstigen Modell und einem nahezu kostenlosen, und es ist der konkrete Grund, warum Lunas tatsächliche Kosten pro fertiger Antwort weit unter dem liegen, was die Preisliste vermuten lässt.
Was es dich an Leistungsfähigkeit kostet
Luna ist die günstigste Stufe, weil sie die leistungsschwächste ist, und das unabhängige Gremium lässt keine Zweifel daran, um wie viel weniger. Lies für jedes Modell am 8. Oktober 2026 die Angaben von Artificial Analysis über den OrcaRouter-Katalogeintrag ab:
• AA Intelligence Index — GPT-6 Sol 47,6, Rang 14; GPT-6 Luna 38,1, Rang 37
• Humanity's Last Exam — GPT-6 Sol 47,9 vs. GPT-6 Luna 38,5
• SciCode — GPT-6 Sol 57,6 vs. GPT-6 Luna 54,6
• Langkontext-Recall — GPT-6 Sol 83,7 vs. GPT-6 Luna 83,3
• Terminal-Bench 4.0 — GPT-6 Sol 43,9 vs. GPT-6 Luna 12,6
• Traffic über sieben Tage — GPT-6 Luna etwa 574 Millionen Tokens; GPT-6 Sol etwa 2,1 Millionen
• Mediane Zeit bis zum ersten Token — GPT-6 Luna 1.494 ms vs. GPT-6 Sol 6.785 ms
• Mediane Ausgabegeschwindigkeit — GPT-6 Luna 132,9 Tokens/s vs. GPT-6 Sol 179,6 Tokens/s
Die Form dessen ist aussagekräftiger als die Schlagzeilen-Lücke. Luna liegt 9,5 Indexpunkte hinter Sol, und der Abstand ist nicht gleichmäßig verteilt: Long-Context-Recall ist mit 0,4 Punkten ein Gleichstand, und SciCode – Codeverständnis statt Codeerzeugung – liegt nur 3 Punkte auseinander. Was einbricht, ist die agentische, mehrstufige Ausführung: Terminal-Bench 4.0 bei 12,6 gegenüber Sols 43,9. Ein Modell, das aus einem Dokument mit einer Million Token ungefähr so gut abrufen kann wie sein größeres Geschwistermodell und eine brauchbare Antwort mit einem einzigen Durchlauf verfasst, ist ein anderes Instrument als eines, das eine Tool-Schleife bis zum Abschluss treiben kann.
Zwei Einschränkungen. Die Indexwerte stammen von Artificial Analysis, nicht von OpenAI, und dieser Evaluator garantiert nicht, dass zwei Modellseiten am selben Tag gegen dieselbe Index-Revision gerendert werden – betrachten Sie Unterschiede unterhalb eines Punkts als Tendenz, nicht als Präzision. Und die Serving-Werte sind unsere eigenen Routing-Messungen über ein rollierendes Sieben-Tage-Fenster; sie schwanken zwischen den Auslesungen und sind eher für die Form des Unterschieds nützlich als als Service-Level-Zusage.
Es gibt eine Serving-Kennzahl, bei der es sich lohnt, innezuhalten. Lunas mediane Zeit bis zum ersten Token beträgt 1.494 ms gegenüber Sols 6.785 ms – etwa 4,5-mal schneller bis zum ersten Token – und ihr Durchsatz ist deutlich niedriger, sobald das Streaming einsetzt. Für eine Chat-Oberfläche, auf der der Nutzer auf die erste Zeile wartet, ist diese Umkehrung der eigentliche Sinn der Stufe, und deshalb kann sich der kostenlose Tarif schnell anfühlen, obwohl er das günstigste Modell der Familie ausführt.
Der frische Wettbewerb innerhalb der Familie
Lunas Preisvorteil innerhalb der Generation hat sich seit der Einführung verringert. GPT-6.1 Sol erschien am 29. September zu Sols $2,00 / $10,00 mit einem Index von 51,8 und senkte den Tarif für zwischengespeicherte Eingaben auf $0,10 pro Million. Das berührt Lunas Kurzkontext-Tarif nicht – zehn Cent für die Eingabe, fünfzig Cent für die Ausgabe; bei der Eingabe ist das immer noch zwanzigmal günstiger als bei jedem Sol –, aber es bedeutet, dass die Stufe über Luna bei zwischengespeichertem Datenverkehr günstiger zu betreiben ist, was genau die Arbeitslast ist, bei der Lunas Vorteil am größten war. Die Lücke ist weiterhin groß. Sie ist nicht mehr so groß, wie die Tarifkarten allein nahelegen.

Wo die Stufengrenze in der Praxis verläuft
Teile die Arbeit danach auf, was die Aufgabe erfordert, nicht danach, welches Modell besser abschneidet.
Luna ist die richtige Wahl für Chat mit hohem Volumen, Klassifizierung, Extraktion, Moderation und Zusammenfassung über ein langes Dokument hinweg — die Zeile, in der es bei Retrieval mit seinem größeren Geschwistermodell gleichauf liegt, ist genau die Zeile, die darüber entscheidet, ob ein großer Kontext nutzbar ist. Seine First-Token-Latenz macht es zur besseren Wahl für alles Interaktive, das nicht stark auf Reasoning setzt. Und bei einem Cent pro Million gecachter Token ist eine Pipeline mit stabilem Kontext für den wiederholten Teil nahezu kostenlos.
Sol, oder inzwischen GPT-6.1 Sol, ist die richtige Wahl, sobald die Aufgabe eine Tool-Schleife, einen langfristigen Plan oder eine Kette von Schritten erfordert, die abgeschlossen werden muss. Die Terminal-Bench-Spanne – 43,9 gegenüber 12,6 – ist das eindeutigste Signal in diesem Vergleich, und sie bildet den tatsächlichen Fehlermodus ab: ein günstiges Modell, das den ersten Schritt gut beantwortet und dann den Faden verliert. Der Effort-Parameter bedeutet, dass du Luna um mehr Reasoning bitten kannst, aber Effort erhöht die Token-Anzahl, nicht die Obergrenze; aus einer 12,6 wird dadurch keine 43,9.
Und Astra bleibt die Antwort für die Arbeit, die nur das Flaggschiff erledigen kann – was bei $10,00 in und $50,00 out gegenüber Lunas zehn Cent eine Entscheidung ist, die Sie pro Aufruf statt pro Team rechtfertigen können sollten.
Die Ein-API-Version dieser Auswahl
Das Unbequeme an einer dreistufigen Familie ist, dass sich die Stufengrenze pro Feature verschiebt – und sie verschiebt sich pro Anfrage: Dieselbe Anwendung will meist Luna für den einen Endpoint und Sol für den nächsten. Das ist eher ein Routing-Problem als ein Beschaffungsproblem. Alle drei GPT-6-Stufen liegen im selben OrcaRouter-Katalog und werden über eine einzige OpenAI-kompatible API vor über 200 Modellen angesprochen, wobei der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht wird, sodass eine Preisänderung des Anbieters bei jeder Stufe noch am selben Tag hier live ist und nicht erst bei Ihrem nächsten Abgleich. Die Routing-DSL setzt die Aufteilung explizit zusammen – nach Anfragegröße, nach Endpoint oder nach Anteil –, sodass der Klassifizierungspfad Luna laufen lassen kann, während der agentische Pfad Sol ausführt, und automatisches Failover über Anbieter hinweg fängt eine Route auf, die schlechter wird, statt dass Sie es erst anhand eines fehlgeschlagenen Laufs entdecken.
Eines bewirkt dies nicht: dass Sie eine Luna erhalten, die sich wie Sol verhält. Stufen existieren, weil die Modelle unterschiedlich sind, und die Zahlen oben sind das Ausmaß dieses Unterschieds. Was Ihnen ein einzelner Schlüssel und eine Routing-Regel verschaffen, ist die Möglichkeit, jede Anfrage auf die Stufe zu setzen, die tatsächlich zu ihr passt, statt alles aus Sicherheitsgründen auf die teuerste oder aus Budgetgründen auf die günstigste zu setzen.

Die Antwort, gemessen an der einzigen Frage, die zählt.
Wenn die Aufgabe Retrieve-then-Answer über ein großes Dokument, einen Chat oder eine Massentextverarbeitung ist, ist GPT-6 Luna die Stufe, und die Zehn-Cent-Karte ist kein Kompromiss – die Langkontext-Recall-Zeile besagt, dass es genauso gut abruft wie das Modell, das zwanzigmal mehr kostet. Wenn die Aufgabe einen mehrstufigen Agenten erfordert, um abgeschlossen zu werden, ist Luna die falsche Stufe, und der ehrliche Schritt ist GPT-6 Sol oder GPT-6.1 Sol, wo der Preis in absoluten Zahlen immer noch niedrig ist und die agentischen Evaluierungen nicht mehr zusammenbrechen.
Was „GPT-6“ für sich allein genommen wieder einmal ist, ist nichts, was man so bezeichnen kann. Es ist ein Familienname, der drei IDs zu drei Preisstufen und drei unterschiedlichen Leistungsobergrenzen abdeckt, und Luna ist diejenige ganz unten – die günstigste, die am schnellsten zum ersten Token kommt, diejenige, die den kostenlosen Tarif bedient, und diejenige, deren Obergrenze in dem Moment sichtbar wird, in dem eine Aufgabe mehr als eine einzige sichere Antwort braucht.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
