
GPT-6.1 Sol vs GPT-6 Luna: Dreizehn Indexpunkte, zehnmal so viel Geld und zwei Evals, bei denen es nicht zutrifft
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
OpenAI released GPT-6.1 Sol on 29 September 2026, one week after GPT-6 Luna arrived on 22 September in the same keynote cycle. They are the two ends of the same generation: Luna is the cheap tier, Sol is the mid-tier above it, and GPT-6 Astra sits above both. The price difference between the two is an order of magnitude — $0.10 and $0.50 per million tokens against $2.00 and $10.00, cached input $0.01 against $0.10 — and the capability difference on the independent board is 13.7 Intelligence Index points, 51.8 against 38.1 at maximum reasoning effort. Ten times the money for thirteen points is roughly the worst exchange rate in the current OpenAI lineup. What makes the comparison worth writing about is the forty-dollar question that follows: which thirteen points?
Die beiden Modelle und die Woche dazwischen
GPT-6 Luna ist das kleine Modell der GPT-6-Generation – dasjenige, das OpenAI als für hochvolumige, latenzsensitive Arbeit gebaut beschreibt: Klassifizierung, Extraktion, Routing, Massenzusammenfassung, die innere Schleife eines Agenten. Es verfügt über ein Kontextfenster von 1.050.000 Token und eine Ausgabegrenze von 128.000 Token, nimmt Text, Bilder und Dateien als Eingabe entgegen und behält die vollständige sechsstufige Effort-Leiter einschließlich nonebei, die die 6.1-Stufe fallen ließ. Die Preisliste ist der Grund für seine Existenz: 0,10 $ hinein und 0,50 $ hinaus pro Million Token, gecachte Eingabe bei 0,01 $ und Cache-Schreibvorgänge bei 0,125 $, mit einem Long-Context-Schritt oberhalb von 272.000 Eingabe-Token auf 0,20 $, 0,75 $ und 0,02 $ gecacht.
GPT-6.1 Sol ist das eine Woche später veröffentlichte Mid-Tier-Refresh. Gleiches Kontextfenster, gleiche Ausgabeobergrenze, gleiche Eingabemodalitäten, ein Wissensstichtag vom 30. April 2026 gegenüber dem von Luna, und eine Aufwandsleiter, die bei niedrig weil keine und minimal rundweg abgelehnt werden. Es kostet 2,00 $ und 10,00 $, wobei gecachte Eingabe 0,10 $ kostet — zwanzigmal Lunas Eingaberate und zwanzigmal seine Ausgaberate, mit einer Cache-Zeile, die pro Treffer zehnmal teurer ist.
Beide sind im Angebot, beide sind in ChatGPT Work und Codex sowie in der API enthalten, und beide sind auf unserer Seite über denselben Schlüssel aufrufbar. Nichts an dieser Kombination erfordert eine Entscheidung.
Was dreizehn Indexpunkte tatsächlich bringen
Der zusammengesetzte Wert ist die am wenigsten aussagekräftige Zahl im Vergleich, weil er über Aufgaben mittelt, die sich sehr unterschiedlich verhalten. Bewertet man auf Artificial Analysis v4.3.2 Auswertung für Auswertung bei maximalem Reasoning-Aufwand, ist die Form eine Aufspaltung statt einer Steigung:
• AA-LCR v1.1, Langkontext-Reasoning — GPT-6 Luna 0,833 vs. GPT-6.1 Sol 0,830. Luna liegt knapp vorn.
• SciCode — GPT-6 Luna 0,546 vs. GPT-6.1 Sol 0,542. Wieder praktisch gleichauf, und wieder liegt das günstigere Modell nominell vorn.
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 vs. GPT-6.1 Sol 0.561. Eine 43-Punkte-Lücke; die beiden Modelle spielen bei Terminal-Arbeit in unterschiedlichen Ligen.
• Humanity's Last Exam — GPT-6 Luna 0,385 vs. GPT-6.1 Sol 0,529.
• AutomationBench-AA — GPT-6 Luna 0,532 gegen GPT-6.1 Sol 0,649.
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437,1 vs. GPT-6.1 Sol Elo 1575,1, eine Elo-Differenz von 138 Punkten bei professioneller Wissensarbeit.
• GDP.pdf — GPT-6 Luna 0,228 vs. GPT-6.1 Sol 0,310.
• CritPt — GPT-6 Luna 0,194 gegen GPT-6.1 Sol 0,317.
• AA-Omniscience — GPT-6 Luna 0,65 vs. GPT-6.1 Sol 41,5. Auf einer Skala, auf der null bedeutet, dass es genauso viele richtige wie falsche Antworten gibt, liegt Luna an der Wasserlinie und Sol deutlich darüber.
• MMMU-Pro — GPT-6 Luna 0,797 vs. GPT-6.1 Sol 0,860.
• Kosten pro Indexierungsaufgabe, unabhängig — GPT-6 Luna 0,068 $ vs. GPT-6.1 Sol 0,72 $; etwa ein zehnfacher Unterschied zugunsten des günstigen Modells
• Ausgabe-Tokens beim Index-Lauf — GPT-6 Luna 144 Millionen vs. GPT-6.1 Sol 67 Millionen, gegenüber einem Klassenmedian von 100 Millionen für Luna und etwa 81 Millionen für Sol
Zwei von zehn Bewertungen enden unentschieden zugunsten des günstigen Modells. Acht gehen an das teure, und bei sechs dieser acht ist der Abstand nicht marginal. Das ist die ehrliche Interpretation der dreizehn Punkte: Es ist kein gleichmäßiger Qualitätsgradient, es sind zwei Fähigkeiten – anhaltende agentische Ausführung und faktische Zuverlässigkeit –, bei denen Luna schlicht nicht dieselbe Modellklasse ist, und eine breite Mitte, in der der Unterschied real, aber klein genug ist, um in Ihrem eigenen Evaluierungsset unsichtbar zu bleiben.
Das AA-LCR-Ergebnis verdient einen Vorbehalt, denn es ist die Zahl, die Luna am meisten schmeichelt. Long-Context-Reasoning mit 0,833 ist ein starker Wert, und die beiden Modelle liegen weniger als einen halben Punkt auseinander, doch der Benchmark misst Retrieval und Reasoning über lange Eingaben, nicht die Fähigkeit, über eine lange Sitzung hinweg zu handeln. Die Lücke bei Terminal-Bench 4.0 zeigt, wie „über eine lange Sitzung hinweg handeln“ aussieht, wenn es bewertet wird, und sie ist 43 Punkte breit.

Die Kosten-pro-Aufgabe-Rechnung, und wo sie nicht mehr stimmt
Artificial Analysis bepreist jeden Index-Lauf anhand des gemessenen Token-Verbrauchs, sodass die Kostenangabe keine Ableitung aus einer Preisliste ist. Der Lauf von GPT-6 Luna kostete 0,068 $ pro Aufgabe; der von GPT-6.1 Sol kostete 0,72 $. Das Verhältnis liegt bei 10,7× und ist nur deshalb etwas schlechter als das nominale zwanzigfache Preisverhältnis, weil Luna in diesem Lauf 144 Millionen Output-Tokens erzeugte gegenüber 67 Millionen bei Sol — das günstige Modell ist mehr als doppelt so gesprächig und zehrt dadurch an seinem eigenen Vorteil. Dennoch ist der Abstand in der Rangfolge alles andere als knapp, und bei einer Kurzantwort-Workload würde er sogar größer werden: Ein geringeres Ausgabevolumen bedeutet, dass Lunas Geschwätzigkeitsstrafe schrumpft, während ihr Preisvorteil gleich bleibt.
Dort, wo die Rechnung nicht mehr aufgeht, ist jede Workload, die dem Index nicht ähnelt. Wenn Ihre Aufgabe eine Bearbeitung im Repository-Maßstab ist, bei der zwanzig Tool-Aufrufe kohärent zusammengehalten werden müssen, dann kostet Sie ein 0,07-$-Modell, das die Aufgabe nicht schafft, die gesamte Wiederholungsschleife plus die Wanduhrzeit, und das 0,72-$-Modell, das einmal fertig wird, ist günstiger. Die eigene Launch-Rahmung von GPT-6.1 Sol baut ganz auf dieser Idee auf – Kosten pro abgeschlossener Aufgabe – und das ist der richtige Rahmen: Der relevante Vergleich ist nicht die Token-Rate, sondern die erwarteten Kosten pro Ergebnis, und bei Aufgaben, die Luna nicht abschließen kann, ist diese Erwartung unbegrenzt.
Zwei strukturelle Details schärfen die Grenze. Erstens der Long-Context-Schritt: beide Modelle werden oberhalb von 272.000 Eingabe-Tokens neu bepreist, Luna auf 0,20 $ und 0,75 $, Sol auf 4,00 $ und 15,00 $, sodass die absolute Lücke an der Grenze größer wird statt sich zu schließen, doch Lunas neu bepreister Tarif liegt immer noch eine Größenordnung unter Sols Standardtarif. Zweitens, und leicht zu übersehen: die Effort-Leiter hat nicht dieselbe Form. Luna akzeptiert none; Sol nicht. Eine Kaskade, die zuerst an Sol weiterleitet und bei Fehler oder Timeout auf Luna zurückfällt, darf den reasoning.effort der Anfrage nicht unverändert mitführen, denn eine Konfiguration, die auf dem einen Modell zulässig ist, führt auf dem anderen zu einem Fehler. Das ist eine Angelegenheit der Routing-Schicht, keine der Modellqualität, und genau so etwas soll ein einzelner Endpunkt mit einer Routing-Regel auffangen.
Beides zu betreiben ist der Punkt, nicht eine Absicherung.
Beide Modelle sind auf OrcaRouter zu den eigenen Listenpreisen von OpenAI ohne Aufschlag verfügbar: GPT-6 Luna zu $0,10 und $0,50 mit zwischengespeichertem Input zu $0,01, GPT-6.1 Sol zu $2,00 und $10,00 mit zwischengespeichertem Input zu $0,10, und der 272.000-Token-Schritt bei jedem wird genau so durchgereicht, wie der Anbieter ihn listet. Da die Plattform den Listenpreis des Anbieters durchreicht, statt ihn aufzuschlagen, ist das zwanzigfache Verhältnis in diesem Artikel das Verhältnis, das Sie tatsächlich zahlen – auf beiden Seiten.

Der Grund, warum das hier speziell relevant ist, ist, dass dieses Paar eine Kaskade ist, die nur darauf wartet, geschrieben zu werden. Ein Klassifikator, ein Router, ein Massenextraktionsjob und ein Coding-Agent im Repository-Maßstab gehören nicht auf dasselbe Modell, und die Preisspanne ist groß genug, dass eine falsche Wahl in beide Richtungen teuer ist — zwanzigmal zu viel pro Aufruf in die eine Richtung, eine fehlgeschlagene Aufgabe in die andere. Ein Schlüssel, zwei Modelle und eine Regel, die einfachen Traffic an Luna schickt und an Sol eskaliert, wenn sich die Aufgabenklasse ändert oder wenn Lunas Ausgabe eine Prüfung nicht besteht, ist eine Konfigurationsänderung auf unserer Seite statt eines zweiten Anbietervertrags. Automatisches Failover deckt den Fall ab, dass eines der beiden beeinträchtigt ist, was bei einem Modell, das vor acht Tagen veröffentlicht wurde, noch eine reale Möglichkeit ist.

Die Entscheidung, in einem Durchgang
• Klassifizierung, Extraktion, Routing, Massenzusammenfassung, innere Schleifen von Agenten — GPT-6 Luna, und hören Sie auf zu lesen. Bei $0.10/$0.50 mit einem zwischengespeicherten Lesevorgang für einen Cent sind dreizehn Indexpunkte allgemeiner Leistungsfähigkeit bei Arbeit, bei der die Antwort kurz und überprüfbar ist, nicht das Zehnfache der Rechnung wert.
• Coding im Repo-Maßstab, Terminal-Agenten, mehrstufige Ausführung — GPT-6.1 Sol. Der Abstand von 43 Punkten bei Terminal-Bench 4.0 ist das ganze Argument; genau diese Fähigkeit wird mit dem Preis erkauft.
• Fragen aus der Wissensarbeit, bei denen eine falsche Antwort teuer ist — GPT-6.1 Sol, zu den Lücken bei AA-Omniscience und GDPval-AA. Lunas Punktwert für Faktenzuverlässigkeit liegt an der Wasserlinie.
• Lange Eingaben mit einer kurzen generierten Antwort — GPT-6 Luna. Es schließt über langen Kontext hinweg auf Augenhöhe mit einem Modell, das zwanzigmal so viel kostet, und seine Verbositätsstrafe von 144 Millionen Token kann nie zum Tragen kommen.
• Alles, was bereits none setzt — bleiben Sie bei Luna, oder kalkulieren Sie den Wechsel ein. Diese Stufe gibt es auf GPT-6.1 Sol nicht.
• Latenzkritische Oberflächen — GPT-6 Luna, gemessen an den eigenen Messungen des Boards: 129,4 Ausgabe-Tokens pro Sekunde und 100 Sekunden bis zum ersten Chunk gegenüber 59,7 und 332 bei Sol.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
