
GPT-6 Luna vs. GPT-6 Sol: Zwei Tarifkarten mit derselben Form und einer zwanzigfachen Zahl
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Luna kostet 0,10 US-Dollar pro Million Eingabe-Token und 0,50 US-Dollar pro Million Ausgabe-Token. GPT-6 Sol kostet 2,00 US-Dollar und 10,00 US-Dollar. Der Anbieter lieferte beide am 22. September 2026 als die beiden unteren Stufen der GPT-6-Generation unterhalb des Flaggschiffs GPT-6 Astra aus, und der zwanzigfache Abstand zwischen ihnen ist das Erste, was man auf der Seite liest. Was schwerer zu erkennen und dabei nützlicher ist: wie wenig sonst sie trennt. Dasselbe Kontextfenster von 1.050.000 Token. Dieselbe maximale Eingabe von 922.000 Token. Dieselbe Ausgabeobergrenze von 128.000 Token. Dieselbe Reasoning-Stufenleiter von none über low, medium, high, xhigh bis max, wobei medium die Standardeinstellung ist. Dieselbe Knowledge-Cutoff-Familie, einen Monat auseinander. Dieselbe Klausel, die eine gesamte Anfrage neu bepreist, sobald sie 272.000 Eingabe-Token überschreitet.
Zwei Modelle, die jede strukturelle Zeile einer Preisliste teilen, unterscheiden sich nicht durch ihre Funktionen. Sie unterscheiden sich durch einen Score – und dadurch, was es kostet, diesen Score zu erlangen. Auf dem unabhängigen Board, das beides misst, liegt GPT-6 Sol bei gleichgesetztem maximalem Aufwand elf Punkte über GPT-6 Luna und kostet etwa fünfzehn Mal so viel, um dieselbe Evaluation abzuschließen. Elf Punkte und fünfzehn Mal sind eine andere Aussage als zwanzig Mal, und der Unterschied zwischen diesen beiden Aussagen ist der eigentliche Kern dieses Vergleichs.
Wofür jeder dieser beiden gedacht ist
GPT-6 Sol ist das Alltagsmodell der Familie – die Stufe, die OpenAI für komplexes Programmieren, agentische Workflows und professionelle Arbeit positioniert, die von Menschen gelesen wird. Es akzeptiert Text und Bild, erzeugt Text und ist für alle mit einem API-Schlüssel verfügbar. Es ist das Modell, zu dem die meisten Teams standardmäßig greifen, wenn sie GPT-6-Klasse-Fähigkeiten wollen, ohne die Preisliste des Flaggschiffs oder dessen Zugangsbeschränkung.
GPT-6 Luna ist das Volumen-Tier. OpenAIs eigene Beschreibung ist eng und bewusst unglamourös: das effizienteste Modell für fokussierte Aufgaben mit hohem Volumen. Zusammenfassung, Extraktion, Klassifizierung, Routing, die innere Schleife eines Agenten, der auf dem Weg zu einer Aufgabe tausend kleine Aufrufe macht. Gleiches Fenster, gleiche Ausgabengrenze, gleicher Aufwandsregler — ein günstigerer Motor in identischem Chassis.
Beide wurden mit Methoden trainiert, die von GPT-6 Astra abgeleitet wurden, statt als separate Reihe entwickelt zu werden, weshalb die Datenblätter so exakt übereinstimmen. Der Preis ist der einzige Punkt, an dem die beiden sich konstruktionsbedingt unterscheiden.
Die Preisliste, Zeile für Zeile
Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:
• Eingabe pro 1 Mio. — GPT-6 Luna 0,10 $ vs. GPT-6 Sol 2,00 $
• Output pro 1 Mio. — GPT-6 Luna 0,50 $ vs. GPT-6 Sol 10,00 $
• Gecachte Eingabe pro 1 Mio. — GPT-6 Luna 0,01 $ vs. GPT-6 Sol 0,20 $; beide liegen bei einem Zehntel ihres eigenen Preises für ungecachte Eingabe, sodass das zwanzigfache Verhältnis den Rabatt unverändert übersteht.
• Cache-Schreibvorgänge pro 1 Mio. — GPT-6 Luna 0,125 $ vs. GPT-6 Sol 2,50 $, in beiden Fällen ein Aufschlag von 25 % auf den Eingabe-Tarif
• Long-Context-Stufe — identische Klausel auf beiden Karten: Ab 272.000 Eingabe-Tokens wird die gesamte Anfrage mit 2× für Eingabe und Cache sowie 1,5× für Ausgabe abgerechnet, was GPT-6 Luna auf 0,20 $ und 0,75 $ und GPT-6 Sol auf 4,00 $ und 15,00 $ bringt
• Kontextfenster — 1.050.000 Token für beide, mit einer maximalen Eingabe von 922.000 Token und einer Ausgabegrenze von 128.000 Token
• Reasoning-Aufwand — keiner, niedrig, mittel (Standard), hoch, sehr hoch, maximal für beide; der Regler ist in beiden Modellen dasselbe Bauteil
• Service-Stufen — Flex halbiert die Rechnung und Priority verdoppelt sie auf beiden Karten, ausgewählt über denselben service_tier Parameter
• Wissensstichtag — GPT-6 Luna 18. Mai 2026 vs. GPT-6 Sol 20. April 2026, was innerhalb einer Familie einen Monat auseinanderliegt und wissenswert ist, bevor man annimmt, dass die beiden eine gemeinsame Weltsicht haben
• Intelligence Index, unabhängig — GPT-6 Luna 37 bei maximalem Aufwand vs. GPT-6 Sol 48 bei maximalem Aufwand, gleiche Index-Revision
• Punktzahl bei Standard-Aufwand — GPT-6 Luna 29 im standardmäßigen Medium vs. GPT-6 Sol 48 im Max-Modus, die Einstellung, bei der Artificial Analysis sie gemessen hat
• Kosten pro Index-Aufgabe, unabhängig — GPT-6 Luna etwa 0,07 $ vs. GPT-6 Sol 1,06 $
• Ausgabe-Tokens beim Indexlauf — GPT-6 Luna 150M vs. GPT-6 Sol 77M, im Vergleich zu einem Board-Median von 88M
• Coding Agent Index, unabhängig — GPT-6 Luna 41, zwei Punkte niedriger als GPT-5.6 Luna vs. GPT-6 Sol 57, zwei Punkte höher als GPT-5.6 Sol
• Halluzinationsrate bei AA-Omniscience — GPT-6 Luna 77 %, zurückgegangen von 93 %, gegenüber GPT-6 Sol 60 %, zurückgegangen von 92 %; beide Modelle waren eher bereit abzulehnen statt kenntnisreicher, und Sol kam weiter
• Auf OrcaRouter — weder GPT-6 Luna noch GPT-6 Sol sind zum jetzigen Zeitpunkt in unserem Katalog; beide sind über die eigene API von OpenAI erreichbar

Der Aufwandsregler ist in beiden Modellen dasselbe Bauteil, und das ändert die Rechnung.
Da die Reasoning-Leiter identisch ist, sind die Indexwerte in der Überschrift für beide Modelle Maximalaufwands-Werte. Die 37 von GPT-6 Luna ist der Wert, den es erreicht, wenn es so lange denken darf, wie es möchte. Sein Standard ist medium, bei dem es 29 erreicht. Die 48 von GPT-6 Sol ist ebenfalls ein Maximalaufwands-Wert, und sie ist die Einstellung, mit der das unabhängige Gremium es laufen ließ.
Das ist hier wichtiger als in den meisten Vergleichen, denn es bedeutet, dass die beiden Modelle auf derselben Stufe verglichen werden. Ein Team, das GPT-6 Luna einsetzt und nichts ändert, tritt nicht mit 37 gegen 48 an; es tritt mit 29 gegen 48 an. Das ist eine Lücke von neunzehn Punkten statt von elf, und ihre Größe ist eine Eigenschaft der Standardeinstellung, nicht des Modells.
Derselbe Regler ist außerdem die günstigste Optimierung, die auf beiden Karten verfügbar ist, und er funktioniert in beide Richtungen. GPT-6 Sol bei Arbeit, die ein Mensch prüft, von max auf medium herunterzustufen, ist eine größere Einsparung, als einen Bruchteil Ihres Traffics von Sol auf Luna umzustellen, und es kostet eine Parameteränderung statt einer Migration. GPT-6 Luna bei dem einen Aufruf pro Aufgabe, der tatsächlich über das Ergebnis entscheidet, auf xhigh hochzustufen, ist ein Rundungsfehler gegenüber der Gesamtsumme. Der Regler existiert bei beiden Modellen speziell deshalb, damit die Wahl der Stufe und die Wahl des Aufwands getrennt getroffen werden können, und die meisten Teams treffen nur eine davon.
Die Klippe ist identisch, und das ist der Punkt.
Beide Modelle enthalten dieselbe Langkontext-Klausel, und weil die Klausel proportional ist, verringert sie den Abstand zwischen ihnen nicht – sie verdoppelt beide Seiten davon. Eine Anfrage mit 300.000 Tokens auf GPT-6 Luna wird mit 0,20 $ pro Million Input für alle 300.000 Tokens abgerechnet, nicht nur für die 28.000, die über der Grenze liegen. Dieselbe Anfrage auf GPT-6 Sol wird mit 4,00 $ abgerechnet. Teilt man eines der Dokumente in zwei Aufrufe unterhalb der Schwelle auf, halbieren sich die Kosten, ohne dass sich der Prompt ändert.
Was die identische Klausel durchaus ändert, ist das Ausmaß des Fehlers. Im Volumen-Tarif kostet eine falsch dimensionierte Anfrage ein Fünftel eines Cents pro tausend Token. Im Tages-Tarif kostet sie vier Dollar pro Million. Die Teams, die am ehesten einen Arbeitskontext von 300.000 Token haben, sind diejenigen, die die agentischen Pipelines betreiben, in die beide Modelle verkauft werden. Das bedeutet, dass der Tarif, der sich den Fehler am wenigsten leisten kann, nicht der Tarif ist, der ihn am häufigsten begeht.
Wo Sols elf Punkte sind und wo sie nicht sind
Die Lücke ist real, und sie ist nicht gleichmäßig über die Aufgaben verteilt, die Sie möglicherweise ausführen.
Die Vorteile von GPT-6 Sol konzentrieren sich auf das Codieren und die agentische Ausführung. Sein Coding Agent Index von 57 liegt sechzehn Punkte über GPT-6 Lunas 41, auf einem Board, auf dem die Äquivalente der vorherigen Generation 55 und 43 betrugen – die beiden Modelle bewegten sich bei diesem Maß also in entgegengesetzte Richtungen, was man wissen sollte, bevor man annimmt, dass die neue Generation durchweg ein Upgrade gegenüber der alten darstellt. Laut den vom Anbieter selbst veröffentlichten Zahlen meldet Sol 68,8 % bei DeepSWE v1.1 mit maximalem Aufwand gegenüber Lunas 66,6 %, und rund 43 % bei Terminal-Bench 4.0 gegenüber 37 %. Diese Werte wurden von OpenAI gemeldet und nicht reproduziert, und die Lücke, die sie beschreiben, ist enger als die Indexlücke vermuten lässt.
Wo Sol sich absetzt, sind die Bewertungen, die eine lange Kette korrekter Entscheidungen belohnen: GPT-6 Sol meldet etwa 62 % auf AutomationBench-AA gegenüber 53 % bei GPT-6 Luna und eine Halluzinationsrate von 60 % gegenüber 77 % auf demselben Allwissenheits-Board. Ein Unterschied von siebzehn Punkten darin, wie oft ein Modell eine Antwort erfindet, ist kein Leistungsvorsprung; für alles mit einem nachgelagerten Nutzer ist es die gesamte Entscheidung.
Wo die elf Punkte nicht zum Tragen kommen, ist allgemeine Textarbeit. Bei Extraktion, Klassifizierung, Routing und Zusammenfassung – den Aufgaben, für die GPT-6 Luna preislich positioniert ist – werden beide Modelle in der überwiegenden Mehrheit der Fälle dieselbe brauchbare Antwort liefern, und der Unterschied wird den Kontakt mit Ihrem eigenen Eval-Set nicht überleben. Artificial Analysis meldet bei maximalem Effort bei beiden Modellen eine Regression: GPT-6 Sol verliert auf GDPval-AA v2.1 gegenüber seinem Vorgänger etwa 100 Elo, GPT-6 Luna etwa 75. Wenn Ihre Arbeit wie GDPval aussieht, ist keine der Stufen das Upgrade, das Ihnen versprochen wurde, und die elf Punkte sind ein Vergleich zwischen zwei Modellen, die beide Rückschritte gemacht haben.
Die Wahl zwischen zwei Stufen, die Sie bereits haben
Das Ungewöhnliche an dieser Paarung ist, dass es sich nicht um eine Kaufentscheidung handelt. Beide Modelle laufen über dasselbe Konto, denselben Endpunkt und dasselbe SDK. Es gibt keinen zweiten Vertrag, keine zweite Tarifverhandlung und keine Integrationsarbeit, um Traffic von einem zum anderen zu verlagern. Dadurch wird daraus eine Routing-Entscheidung, und Routing-Entscheidungen sind diejenigen, die man pro Anfrage statt einmal treffen sollte.
Weder GPT-6 Luna noch GPT-6 Sol ist zum jetzigen Zeitpunkt in unserem Katalog – beide werden über OpenAIs eigene API erreicht, sodass die Aufteilung in Ihrer Anwendung und nicht in einer Router-Konfiguration ausgedrückt werden muss. Das ist ein Grund, dabei wohlüberlegt vorzugehen, denn der Preis eines Fehlers ist eine Codeänderung statt einer Einstellungsänderung. Die Form der Aufteilung ist nicht kompliziert: GPT-6 Luna für die tausend kleinen Aufrufe, die ein Agent auf dem Weg zu einer Aufgabe macht, und GPT-6 Sol für den Aufruf, der das Artefakt erzeugt, das ein Mensch lesen wird. Setzen Sie den Effort-Parameter auf beiden Seiten explizit, denn der Standardwert ist medium, und jede veröffentlichte Zahl für beide Modelle ist ein Maximum-Effort-Wert.
Teams, die tatsächlich über Anbieter hinweg routen – und die meisten, die wir sehen, tun das –, können GPT-6 Astra, Grok 4.6, Kimi K3 und Qwen3.8-Max mit einem Schlüssel über OrcaRouter zum Listenpreis des Anbieters, mit 0 % Aufschlag und Failover zwischen Upstreams betreiben. GPT-6 Luna und GPT-6 Sol in dasselbe Bild aufzunehmen bedeutet einen zweiten Schlüssel statt einer zweiten Architektur, was das kleinere der beiden Probleme ist, die diese Paarung erzeugt.

Welches, und wann
Nimm GPT-6 Luna, es sei denn, du kannst die Fähigkeit benennen, die du mit dem Zwanzigfachen bezahlst. Es ist bei jeder Zeile des Datenblatts günstiger, einschließlich gecachter Eingabe, es hat dasselbe Kontextfenster und dieselbe Ausgabeobergrenze, ihm kann gesagt werden, das Reasoning vollständig einzustellen, und seine Kosten pro abgeschlossener Aufgabe auf dem unabhängigen Board betragen etwa ein Fünfzehntel der von GPT-6 Sol. Setze den Effort explizit, halte lange Aufrufe unter 272.000 Eingabe-Tokens und prüfe die 16-Punkte-Lücke im Coding Agent Index an deinem eigenen Repository, bevor du annimmst, dass sie für dich gilt.
Nimm GPT-6 Sol, wenn die Aufgabe das Produkt ist und der Fehlermodus eine still falsche Antwort statt einer langsamen ist. Coding-Agents, die ein echtes Repository bearbeiten, langfristige professionelle Analysen, alles, wo eine halluzinierte Tatsache mehr kostet als die eingesparten Tokens. Akzeptiere, dass du das Fünfzehnfache pro abgeschlossener Aufgabe für elf Indexpunkte zahlst und dass ein bedeutender Anteil dieser elf Punkte in der Halluzinationsspalte statt in der Fähigkeitsspalte liegt – was für dieses spezielle Paar die bessere Hälfte ist, für die man zahlt.
Der Fehler, den es zu vermeiden gilt, ist, den zwanzigfachen Preisaufkleber für die Antwort zu halten. Er ist die Antwort auf die Frage, was ein Token kostet, und sagt nichts darüber aus, was eine erledigte Aufgabe kostet oder wie oft die Antwort des billigen Modells auf eine Weise falsch ist, die du nicht bemerken wirst.

