
GPT-5.6 Luna Max: Wie Entwickler es tatsächlich in Codex nutzen — und wo es scheitert
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 221 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Am 1. August begann eine vierzeilige Konfigurationsdatei auf X zu kursieren. Sie erstellt einen Codex-Agenten namens luna_worker, setzt sein Modell auf gpt-5.6-luna, setzt seinen Reasoning-Aufwand auf max und übergibt ihm die langweilige Hälfte deiner Arbeit, während GPT-5.6 Sol den Plan behält. Innerhalb weniger Tage wurde dasselbe Rezept auf Englisch, Chinesisch, Japanisch, Koreanisch, Spanisch und Arabisch erneut veröffentlicht, und ein Plugin, das auf derselben Idee basiert, hatte in vier Tagen mehr als 1.300 GitHub-Sterne erreicht. Es ist außerdem, mehr oder weniger an dem Tag, an dem es viral ging, der falsche Weg, es zu verdrahten: Der Autor dieses Plugins entfernte GPT-5.6 Luna innerhalb von 48 Stunden öffentlich aus seinem eigenen Projekt, weil ein Kollege ihm sagte, dass es nicht als Codex-Subagent funktioniert — und baute es zwei Tage später wieder ein, auf eine völlig andere Weise verdrahtet.
Diese ganze Entwicklung geschah innerhalb einer Woche, und es ist das Nützlichste, was irgendjemand über dieses Modell veröffentlicht hat. Es zeigt, dass das Muster des billigen Arbeiters real ist, dass der naheliegende Weg, es zu verdrahten, der falsche ist, und dass der Unterschied zwischen beiden den Großteil des Werts ausmacht. Alles in diesem Artikel, was die Technik betrifft, stammt von Praktikern, die zwischen dem 30. Juli und dem 5. August 2026 ihre eigenen Ergebnisse veröffentlicht haben – nicht aus der Unternehmensdokumentation, die GPT-5.6 Luna als ein Modell für „kostensensible, hochvolumige Arbeitslasten“ beschreibt und zu all dem nichts sagt. Wo eine Zahl von einem unabhängigen Dritten gemessen wurde, sagen wir das; wo es sich um das Session-Log eines einzelnen Entwicklers handelt, sagen wir das ebenfalls – auch wenn sie einander widersprechen. Das tun sie, und zwar oft.
Was „Luna Max" ist und warum die meisten Menschen es nie zu sehen bekommen
Es gibt kein Modell namens Luna Max. Es gibt zwei Regler, und Luna Max ist eine Kombination aus beiden: die günstigste Stufe der GPT-5.6-Familie, ausgeführt mit der tiefsten Denk-Einstellung. Der Stufenregler wählt zwischen GPT-5.6 Sol, GPT-5.6 Terra und GPT-5.6 Luna. Der Aufwandsregler hat sechs Positionen — none, low, medium, high, xhigh und max — und er bestimmt, wie viel Denken das Modell vor seiner Antwort aufwendet.
Aus einem banalen Grund kombinierte fast niemand die günstige Stufe mit der tiefen Einstellung: max ist standardmäßig ausgeblendet. In der ChatGPT/Codex-Desktop-App befindet es sich hinter Einstellungen → Konfiguration → Verfügbare Reasoning-Aufwände, wobei die oberste Option in der Liste standardmäßig nicht ausgewählt ist. Sechs verschiedene Entwickler veröffentlichten in der ersten Augustwoche denselben Drei-Klick-Fix, was ein guter Indikator dafür ist, wie viele Leute Luna mit seiner Standardtiefe betrieben hatten und das Modell daraufhin beurteilten. Auf der API-Seite müssen Sie keinen Umschalter suchen: Sie übergeben die Modell-ID gpt-5.6-luna und setzen den Reasoning-Aufwand auf max im Anfragekörper, und das ist die gesamte Änderung.
Eine Konsequenz, die man sich verinnerlichen sollte, bevor man irgendeinen Benchmark liest: Wenn Artificial Analysis einen Intelligenz-Score für dieses Modell veröffentlicht, lautet der Seitentitel GPT-5.6 Luna (max). Die unabhängige Zahl, die alle für Luna nennen, ist die Max-Effort-Konfiguration. Wenn Sie die Standardeinstellung verwendet haben und sich fragen, warum Ihre Erfahrung nicht mit der Rangliste übereinstimmt, dann ist das der Grund.
Der Regler, den niemand erklärt: Aufwand ändert die Token-Anzahl, nicht den Token-Preis.
Die Erhöhung des Reasoning-Aufwands bringt dich nicht in eine teurere Preisstufe. GPT-5.6 Luna kostet 0,20 $ pro Million Eingabe-Token und 1,20 $ pro Million Ausgabe-Token bei jeder Aufwandsstufe. Was sich ändert, ist, wie viele Token das Modell für eine Antwort aufwendet – und beim Maximum gibt es eine Menge aus.
Artificial Analysis hat dies im Rahmen seines Intelligence Index gemessen, und die Zahlen sind die klarste unabhängige Bestätigung dessen, worüber sich Praktiker beschwerten:
• Punktzahl — 51 im Artificial Analysis Intelligence Index, gegenüber einem Median von 17 für die Modelle, die er in dieser Klasse benchmarkt.
• Ausführlichkeit — 130 M Ausgabe-Tokens wurden über den Indexlauf generiert, gegenüber einem Median von 61 M. Artificial Analysis kennzeichnet das Modell als „sehr wortreich".
• Rohgeschwindigkeit — 182,5 Ausgabe-Token pro Sekunde, 16. von 163 Modellen. Schnell pro Token.
• Zeit bis zum ersten Token — etwa 136 Sekunden bei maximalem Aufwand, was laut Artificial Analysis selbst für Reasoning-Modelle in dieser Preisklasse am oberen Ende liegt.
• Gesamtausgaben — $174.06, um das Modell auf dem gesamten Index zu evaluieren.
Lies die dritte und vierte Zeile zusammen, denn dieses Paar ist die gesamte Benutzererfahrung. Luna streamt bei Maximum Tokens schnell, braucht aber Minuten zum Starten und erzeugt dann ungefähr doppelt so viele Tokens wie ein typisches Modell bei derselben Arbeit. Deshalb ist die häufigste Beschwerde in den Feldberichten nicht „es ist falsch“, sondern „es ist langsam“ – und warum der günstige Preis sich nicht in eine proportional günstige Sitzung übersetzt. Du kaufst einen niedrigen Satz bei einer hohen Token-Anzahl.
Zum Vergleich: Auf unserer eigenen Modellseite für GPT-5.6 Luna beträgt die beobachtete mediane Zeit bis zum ersten Token über sieben Tage echten Datenverkehrs 1,78 Sekunden, mit einem 95. Perzentil von 9,26 Sekunden. Das widerspricht der 136-Sekunden-Zahl nicht — es ist dasselbe Modell, gemessen über eine Mischung von Aufwandsstufen, von denen die meisten nicht das Maximum sind. Die Latenz, die du erhältst, ist eine Eigenschaft des gewählten Reglers, nicht des Endpunkts, den du aufrufst.

Ist Luna Max wirklich „Sol Medium zu einem Sechstel der Kosten“?
Dies ist die Behauptung, die das Muster viral gehen ließ, und sie stammt von Dan McAteer, der es als Luna bei maximalem Reasoning einstufte, das bei etwa GPT-5.6 liegt, Sol bei mittlerem oder Claude Opus 5 bei mittlerem – für ungefähr ein Sechstel der Kosten. Sie wurde von vielen Accounts wiederholt, manchmal ohne die Absicherungen, und es lohnt sich, das, was gemessen wurde, von dem zu trennen, was Vibes sind.
Das unabhängige Scoreboard unterstützt die Kostenseite der Behauptung nachdrücklich und die Leistungsseite nur teilweise. Beim Durchlaufen derselben Benchmark-Suite mit maximalem Aufwand über alle Preisklassen hinweg verzeichnete Artificial Analysis Luna bei Index 51 für 174 $, Terra bei 55 für 1.403 $, Kimi K3 bei 57 für 2.437 $ und Sol bei 59 für 2.824 $. Luna gibt acht Indexpunkte an Sol ab und kostet etwa ein Sechzehntel so viel, um dieselbe Arbeit zu erledigen.

Der unabhängige Scoreboard wurde am 13. August präzisiert, als DeepSWE v1.1 veröffentlichte — eine Revision seines Langzeit-Engineering-Benchmarks, die 113 ursprüngliche Aufgaben aus 91 Repositories in fünf Sprachen beibehält, aber nun jede Korrektur bewertet, indem sie den eingereichten Diff in einem isolierten Container ausführt, was schwerer zu manipulieren ist. Auf dem aktualisierten Board landen alle drei GPT-5.6-Stufen mit maximalem Aufwand dort, wo der Juli-Bericht sie verortet hatte: Luna Max bei 67,2 % pass@1 und 0,61 $ pro Aufgabe, Terra Max bei etwa 70 %, Sol Max bei 73 % für 8,39 $ — sechs Prozentpunkte Erfolgsrate für ungefähr das Vierzehnfache des Geldes.
Der Vergleich, der einen zweiten Blick wert ist, liegt unter Luna, nicht darüber. Claude Sonnet 5 Max erzielt bei denselben 113 Aufgaben 54 % – etwa dreizehn Punkte hinter Luna Max – bei 26,40 $ pro Aufgabe, was ungefähr 44-mal so viel ist, wie Luna für dieselbe Lösung bezahlt hat. Luna Max übertrifft auch Gemini 3.7 Flash (65 % für die Konfiguration mit hohem Aufwand auf demselben Leaderboard); der Community-Beitrag, der diese Runde aufgezeigt hat, beziffert den Abstand zu Gemini 3.7 Flash Medium auf etwa 1,7 Punkte. DeepSWE ist die unabhängige Testumgebung von Datacurve, keine Unternehmensbewertung – die eigene Behauptung des Unternehmens, dass die GPT-5.6-Familie auf Terminal-Bench 2.1 und DeepSWE Spitzenergebnisse erzielt habe, bleibt eine separate, vom Anbieter gemeldete Behauptung.
Dann gibt es die Belege aus der Praxis, und die sind wirklich gespalten. Pawel Huryn führte seinen eigenen Bug-Fixing-Benchmark durch — 105 absichtlich eingebaute Bugs in zwei realen Codebasen, Blindbewertung, eine Runde pro Modell — und berichtete, dass Luna bei maximalem Aufwand 33 Bugs für 1,80 $ behob, gegenüber 24 von Claude Fable 5 für 68 $. In die andere Richtung verbrachte Diego Haz zwei Tage mit vergleichbaren Sitzungen und kam zu einem Ergebnis, das gegen das Muster sprach: Luna kostete durchschnittlich 1,20 $ pro Sitzung, Sol dagegen durchschnittlich 29 $, aber er musste den Großteil von Lunas Ausgabe neu machen und bekam für seine Anwendungsfälle nichts Lieferbares, was die Ersparnis eher zu einer Illusion als zu einem Rabatt macht. Ein anderer Entwickler, der dieselbe Testumgebung nutzte, berichtete, dass Sol bei mittlerem Aufwand in etwa der halben Zeit ein deutlich besseres Ergebnis lieferte als Luna bei maximalem Aufwand. Ein chinesischsprachiger Vergleichstest mit einer einzelnen 3D-Szenenaufgabe lieferte konkrete Zahlen für dieses Muster: Sol Medium schloss in 21m30s ab, mit der höchsten Qualitätsbewertung und den wenigsten Tokens; Luna Max brauchte 40m55s, verbrauchte rund 130k Tokens, erzielte die niedrigste Qualitätsbewertung und verbrauchte die Hälfte des wöchentlichen Abonnementkontingents.
Die ehrliche Zusammenfassung der Position der Community nach einer Woche: Luna Max ist nicht Sol Medium. Es ist ein gutes Stück billiger als Sol Medium und es ist schlechter, und ob dieser Tausch gut ist, hängt vollständig davon ab, ob die Aufgabe eng genug spezifiziert ist, sodass „schlechter“ keine Rolle spielt. Genau dafür sind die untenstehenden Verdrahtungsmuster gedacht.
Das Muster, das den Kontakt überlebt hat: Sol plant, Luna setzt um, ein frischer Sol überprüft
Niemand, der Luna Max weiterhin verwendet, nutzt es als universellen Coding-Agenten. Das Setup, das funktioniert und auf das sich Praktiker in jeder Version geeinigt haben, hat vier Rollen:
• Orchestrator — GPT-5.6 Sol mit hohem Aufwand, verbleibt im Hauptthread. Er ist verantwortlich für Anforderungen, Architektur, Aufgabenzerlegung und finale Abnahme. Er schreibt den Code nicht.
• Routine-Implementierer — GPT-5.6 Luna bei maximalem Einsatz, bei begrenzten, vollständig spezifizierten Aufgaben: mechanische Refactorings, Testfallerstellung, Modulanalyse, Dokumentationsdurchgänge, die Art von Aufgabe, bei der das Ziel eindeutig ist.
• Strikter Implementierer — GPT-5.6 Terra bei maximalem Aufwand, für kontextlastige Builds, bei denen Lunas Anweisungsdrift teuer wird.
• Reviewer — eine frische, schreibgeschützte GPT-5.6-Sol-Instanz, die den finalen Diff und sonst nichts sieht. Der Sinn von „frisch" ist, dass ein Reviewer, der den Kontext der Implementierung mit sich trägt, dazu neigt, seine eigene Argumentation zu bestätigen.
Die Referenzimplementierung ist sol-advisor, ein MIT-lizenziertes Codex-Plugin von Dan McAteer, das in der ersten Woche etwa 1.400 Sterne erreichte. Sie installieren es über den Codex-Plugin-Marktplatz, indem Sie das DannyMac180/sol-advisor-Repository und dann das sol-advisor-Plugin hinzufügen. Seine aktuelle Form ist lehrreich: die native Lane pinnt einen Terra/High-Implementierer, gefolgt von einem frischen Sol/High-Reviewer, während Luna bei Maximum eine explizite Opt-in-Lane ist, die als separate sichtbare Aufgabe läuft, wobei die primäre Sol-Session ihre Arbeit direkt überprüft und akzeptiert, anstatt sie durch den nativen Reviewer zu leiten.
Wenn Sie lieber nichts installieren möchten, ist die vielfach kopierte Minimalversion eine benutzerdefinierte Agentendefinition unter ~/.codex/agents/luna-worker.toml mit zwei Einstellungen — model = "gpt-5.6-luna" und model_reasoning_effort = "max" — sowie einer Beschreibung und Anweisungen, die ihn auf delegierte Arbeiten mit klaren Grenzen beschränken, ihm verbieten, das Gesamtziel zu ändern oder seinen eigenen Aufgabenbereich zu erweitern, und Architekturentscheidungen sowie mehrdeutige Anforderungen an den Hauptagenten zurückschicken. Die kursierende Empfehlung lautet, Sol diese Datei für Sie schreiben zu lassen, sie gegen Ihre installierte Codex-Version zu prüfen und Ihnen den Diff zu zeigen, bevor Sie sie akzeptieren, was sinnvoll ist, ganz gleich, ob Sie dem Rezept vertrauen oder nicht.
Die Subagent-Falle und die Lösung, auf die sich die Community geeinigt hat.
Hier trennen sich die virale Version dieses Musters und die funktionierende Version.
Codex' natives Subagentensystem behandelt GPT-5.6 Luna nicht als Bürger erster Klasse. McAteer stieß auf eine harte Blockade — Luna ist als Subagent nicht zugelassen — und umging sie, indem er sie stattdessen als benutzerdefinierten Agenten deklarierte; anschließend wies er öffentlich auf die Kosten dieses Workarounds hin: Ein benutzerdefinierter Agent teilt den Kontext nicht so mit dem Hauptagenten, wie es ein nativer Subagent tut. Tage später entfernte er die Luna-Spur aus sol-advisor gänzlich, wobei er sich auf die Erkenntnis eines anderen auf Codex fokussierten Entwicklers berief, dass Luna sich in der Subagentenrolle schlecht verhält, mit der Annahme, dass sie nicht für das v2-Multi-Agenten-Protokoll nachtrainiert wurde. Diego Haz beschrieb unabhängig davon dieselbe Mauer von der anderen Seite aus: Sol kann Luna nicht als Subagenten spawnen, also muss Luna in einem Top-Level-Thread laufen, was die Koordination unübersichtlich macht.
Die Lösung, die inzwischen die Mehrheitsposition ist, besteht darin, nicht mehr dagegen anzukämpfen:
• Gib Luna Max einen eigenen Thread, keinen Slot im Subagenten-Graph. Weisen Sie den Sol-Orchestrator an, eine separate Top-Level-Codex-Aufgabe auf Luna zu starten, sie zu überwachen und das Ergebnis zurückzuholen. Genau das hat McAteer am 4. August wieder zu sol-advisor hinzugefügt, und worauf auch mehrere andere unabhängig voneinander gestoßen waren.
• Akzeptiere die Kontextisolierung als den Preis. Ein separater Thread bedeutet eine separate Historie. Das ist die Steuer, die Sie zahlen, und es ist auch der Grund, warum die Übergabe unten hier eine größere Rolle spielt als in einem nativen Subagenten-Setup.
• Wenn du es unbedingt in Multi-Agent v2 erzwingen musst, ist der Katalog der Grund, warum es herausgefiltert wird.Ein Entwickler führte den Ausschluss auf den Standard-Modellkatalog zurück, der Luna als v1 markiert, und berichtete von einem Workaround: Kopiere ~/.codex/models_cache.json, setze Lunas multi_agent_version auf v2, richte model_catalog_json auf deine Kopie aus, starte Codex neu, lass dann den Orchestrator Luna mit maximaler Kapazität und einer schnellen Service-Stufe starten und schalte das Forking ab. Behandle das als inoffiziellen Hack einer einzelnen Person an einer internen Datei — genau so etwas macht ein Codex-Update kaputt.
Das Übergabepaket: fünf Fragen, die die häufigste Beschwerde beheben
Der am häufigsten gemeldete Fehler von Luna Max ist, dass es Anweisungen nicht genau befolgt, insbesondere wenn man ihm einen bestimmten Workflow oder eine Iterationsschleife zur Ausführung übergibt. Diese Beschwerde taucht sowohl bei Entwicklern auf, die das Modell mögen, als auch bei Entwicklern, die es aufgegeben haben. Die Lösung, auf die Praktiker immer wieder stoßen, ist kein besserer Prompt im Sinne des Schreibstils, sondern ein strengerer Vertrag. Bevor der Luna-Thread beginnt, beantworte fünf Dinge:
• Welche genaue Aufgabe soll dieser Agent erledigen? Nicht der Arbeitsbereich — der fertige Zustand.
• Welche Dateien, Dokumente oder Systeme sind im Geltungsbereich? Aufgezählt, nicht impliziert.
• Was darf es nicht ändern? Die Schnittstellen, Migrationen, Konfigurationen und öffentlichen Verträge, die tabu sind.
• Welcher Nachweis belegt die Fertigstellung? Ein benannter Test, die Ausgabe eines bestimmten Befehls, ein Diff, das nur die aufgeführten Dateien betrifft.
• Welche fehlende Entscheidung sollte es stoppen? Der Auslöser, zurückzukommen statt zu raten — das ist derjenige, der ein übereifriges billiges Modell davon abhält, eine Architektur zu erfinden.
Dies ist auch der Punkt, an dem die eigenen Prompting-Leitlinien des Unternehmens einbezogen werden sollten, mit dem Etikett, das ihnen zusteht: Das Unternehmen berichtet, dass in seinen internen Evaluierungen von Coding-Agenten schlankere System-Prompts die Eval-Werte um 10–15 % verbesserten und gleichzeitig die Gesamtzahl der Tokens um 41–66 % sowie die Kosten um 33–67 % senkten. Es empfiehlt außerdem, von GPT-5.5 oder GPT-5.4 übernommene Prompts zu überprüfen, anstatt sie unverändert zu übernehmen. Das sind vom Anbieter gemeldete Zahlen. Aber die Richtung stimmt mit dem überein, was die Fachwelt festgestellt hat: Beschreibe das Ziel präzise und streiche die Erzählung jedes einzelnen Schritts. Man beachte die Spannung zum obigen Absatz – Präzision bei Umfang und Einschränkungen ist nicht dasselbe wie Ausführlichkeit, und der Konsens der Community ist, dass Luna Max mehr von Ersterem und weniger von Letzterem braucht.
Einzuplanende Fehlermodi
• Instruktionsdrift. Von mehreren Entwicklern bestätigt: Es ignoriert Teile des ursprünglichen Auftrags, und am schlimmsten ist es, wenn der Auftrag eine zu befolgende Prozedur ist, statt eines zu erreichenden Ergebnisses.
• Langsamkeit in Echtzeit. Wiederholt berichtet und konsistent mit den ~136 Sekunden Time-to-First-Token, die Artificial Analysis bei maximalem Aufwand gemessen hat. Gut für Arbeiten, die man laufen lassen kann; schmerzhaft in einer interaktiven Schleife.
• Kontextverbrauch. Ein Entwickler berichtete, dass Luna Max ein 258k-Codex-Thread-Fenster alarmierend schnell verschlingt, und vermutete, dass der Kontingentverbrauch sprunghaft ansteigt, sobald Codex nahe am Limit mit der Komprimierung beginnt. Der Komprimierungsteil ist sein Eindruck, kein gemessenes Ergebnis – aber die Verbrauchsrate ist die erwartete Konsequenz der Ausführlichkeit, die Artificial Analysis unabhängig gemessen hat. Auf der API-Seite sollte man die Langkontext-Stufe beachten: Die Durchreich-Preisstaffel für dieses Modell wechselt von $0.20/$1.20 auf $0.40/$1.80, sobald eine Anfrage grob 272k Token überschreitet, sodass ein Thread, der ständig wächst, pro Token teurer wird, nicht nur insgesamt teurer.
• Alles Visuelle. Dies ist die schärfste Grenze in den Feldberichten. Ein viel gelesener Praktiker, der ein Codierungs-Abo für Kimi K3 zugunsten von Luna Max kündigte, bewertete es als genauso gut wie das, was er aufgab, und weitaus günstiger – mit einer ausdrücklichen Ausnahme für das Frontend. Ein anderer war unverblümter: Verwenden Sie Luna nicht für Design-, Grafik-, Formatierungs- oder Folienarbeiten; die Aufteilung in Planen mit Sol und Ausführen mit Luna ist für schrittweise Anleitungsaufgaben gedacht, nicht für ästhetische.
• Der Subagenten-Katalog. Oben behandelt — wenn Luna in einem Multi-Agenten-Lauf stillschweigend nie ausgewählt wird, wird sie herausgefiltert, schlägt aber nicht fehl.
• Trügerische Ersparnis. Der eine Fehlermodus, der in keinem Benchmark auftaucht: eine Sitzung, die 1,20 $ statt 29 $ kostete und Arbeit produzierte, die du von Hand neu geschrieben hast, hat dich 1,20 $ plus deinen Nachmittag gekostet.
Wann man nicht zum Maximum greifen sollte.
Max ist kein kostenloses Upgrade, und die Anleitung, die sich bewährt hat, ist eher eine Leiter als eine Einstellung:
• Klare Transformationen — eine Feldumbenennung, eine mechanische Extraktion, ein Formatierungsdurchlauf. Geringer oder mittlerer Aufwand auf Luna. Mach es vom Bestehen eines benannten Tests abhängig.
• Routineimplementierung — high oder xhigh. Die Standardeinstellung der Community für einen Luna-Worker ist xhigh, nicht max, genau weil max Zeit und Tokens für Aufgaben kostet, die nie schwer waren.
• Begrenzt, aber wirklich schwer — das ist max' eigentliche Aufgabe. Das Paket muss sowohl schwierig als auch eng spezifiziert sein, damit das zusätzliche Denken zu einem besseren Ergebnis führt.
• Mehrdeutige Untersuchung — ändern Sie die Stufe, nicht den Regler. Wenn das Modell eher falsch beurteilt statt zu wenig plant, wird mehr Denkzeit auf einem günstigeren Modell das nicht beheben; das ist eine Sol-Aufgabe.
• Vage Vorgabe — Korrektur am Vertrag, nicht am Modell. Keine Aufwandseinstellung gleicht ein unausgesprochenes Abnahmekriterium aus.
Eine Warnung speziell zu Abonnements, aus einem Drittanbieter-Leitfaden und leicht falsch zu machen: Die Kreditsätze, die Codex pro Modell berechnet, haben nicht die gleichen Verhältnisse wie die API-Listenpreise. Man kann also kein API-Preisverhältnis übernehmen und es als Routing-Regel für sein Abonnement verwenden. Die gemeldeten Fünf-Stunden-Nachrichtenlimits auf der Plus-Stufe veranschaulichen das — etwa 15–90 lokale Nachrichten bei Sol, 20–110 bei Terra, 50–280 bei Luna, wobei die Spannen so breit sind, weil eine „Nachricht" keine feste Arbeitseinheit ist. Wenn Ihre Routing-Entscheidungen eher durch ein Abonnementlimit als durch eine Rechnung bestimmt werden, dann messen Sie am Limit.
Jenseits von Codex: Worauf die Leute das sonst noch richten
Die Kombination aus kostengünstigem und tiefgründigem Denken erweist sich auch außerhalb von Coding-Agenten als nützlich – und dies sind die Anwendungsfälle mit Belegen:
• Browser-Agenten. Ein Entwickler ließ einen Browser-Automations-Stack auf GPT-5.6 Luna laufen, um die Top-15-Beiträge von Hacker News zu öffnen, jede verlinkte Seite zu lesen und einen Bericht zu schreiben – Gesamtkosten: 3 Cent. Langfristig, risikoarm, tokenintensiv: Genau die Form, für die dieses Modell bepreist ist.
• Fähigkeitsketten. Zwei Praktiker berichteten unabhängig voneinander, dass sie mit einem einzigen Luna-Max-Ziel eine Pipeline aus zwei Fähigkeiten betrieben haben — Bildgenerierung in einen Bild-zu-Three.js-Konverter — um ein interaktives Low-Poly-3D-Objekt zu erhalten, wobei jeder anmerkte, dass es den eigenen wöchentlichen Nutzungszähler kaum bewegte. Es lohnt sich, dies zusammen mit der Warnung „Luna nicht für visuelle Arbeiten verwenden“ zu lesen: Luna orchestrierte Werkzeuge, die die visuelle Arbeit erledigten, anstatt selbst die Ästhetik zu beurteilen.
• Eine Sitzung heiß halten. Gecachter Input bei diesem Modell kostet 0,02 $ pro Million Tokens gegenüber 0,20 $ für frischen Input — ein Rabatt von 90 %, den Artificial Analysis auf seinem Preispanel auflistet — und das Cache-Fenster beträgt etwa 30 Minuten. Die praktische Konsequenz, zu der mehrere Anleitungen unabhängig voneinander gelangen: Eine langlaufende Sitzung, die immer wieder dieselbe Codebasis liest, ist erheblich günstiger als eine neue Sitzung pro Aufgabe.
• Quoten-Arbitrage. Die kühnste Behauptung im gesamten Set, und klar als Behauptung gekennzeichnet: Ein Entwickler berichtet, dass er — weil Aufwand fast nichts kostet, während der Tier-Multiplikator groß ist — mit maximalem Aufwand im günstigen Tarif 4,9 Milliarden Token über drei Wochen mit einem 200-Dollar-Plan durchschleusen konnte — sechsstellige Beträge zu API-Preisen — und dass er Kimi K3, Grok und DeepSeek-Modelle im selben Picker hinter einem lokalen Router behält, damit die Arbeit nicht stoppt, wenn ein Anbieter sein Limit erreicht. Niemand hat die Token-Zahl unabhängig reproduziert. Die Routing-Praxis dahinter ist jedoch der Teil, den es nachzuahmen lohnt.
Denselben Split ohne Codex-Abonnement ausführen.
All das oben Genannte ist eine abonnementförmige Geschichte: Der Grund, warum sich die Leute für Luna Max interessieren, ist, dass es eine wöchentliche Obergrenze ausweitet. Auf der API-Seite ist dieselbe Architektur einfacher zu bauen und leichter nachzuvollziehen, weil man eine Rechnung bezahlt, anstatt ein Kontingent zu verwalten — und die Orchestrator/Worker-Trennung hört auf, ein Plugin zu sein, und wird zu gewöhnlichem Routing.
GPT-5.6 Luna ist über OrcaRouter zu 0,20 $ pro Million Input und 1,20 $ pro Million Output verfügbar – der Listenpreis des Anbieters, den wir ohne Aufschlag weitergeben. Deshalb war die Preissenkung vom 30. Juli bei uns bereits am Tag der Ankündigung des Unternehmens live, nicht erst einen Abrechnungszyklus später. Es wird über eine kompatible API bereitgestellt unter /v1/chat/completions und /v1/responses, sodass das Feld „reasoning-effort“ im Request-Body genauso mitgesendet wird wie beim direkten Aufruf, und die Modell-ID ist openai/gpt-5.6-luna. GPT-5.6 Sol und GPT-5.6 Terra liegen hinter demselben Schlüssel – und genau das ist für dieses Muster entscheidend: ein Orchestrator auf einer Ebene und ein Worker auf einer anderen sind zwei Modell-IDs in einer Integration, nicht zwei Anbieterverträge. Die Routing-DSL ermöglicht es, diese Aufteilung als einen einzigen Aufruf auszudrücken, statt Threads von Hand zusammenzukleben, und automatisches Failover deckt den Fall ab, den die Quoten-Arbitrage-Szene mit einem lokalen Router löst: Wenn ein Anbieter schwächelt, landet die Anfrage woanders, anstatt abzubrechen.

Zwei ehrliche Vorbehalte. Codex-spezifische Mechanismen — der Subagenten-Graph, der Plugin-Marktplatz, der Modellkatalog, das Wochenkontingent — gehören dem Unternehmen, und nichts davon ist in einem API-Schlüssel enthalten; wenn das Muster, das du suchst, sol-advisor in der Codex-App ist, brauchst du ein Codex-Abonnement. Und die oben genannten Fehlermodi sind Eigenschaften des Modells, nicht des Transports: Routing ändert, was ein Aufruf kostet und was passiert, wenn ein Anbieter ausfällt, nicht ob Luna deinen Anweisungen folgt.
Wer sollte das kopieren, und wer nicht?
Wenn deine Arbeit ein hohes Volumen hat und mechanisch spezifizierbar ist – Refactorings, Test-Scaffolding, Extraktion, Dokumentation, Analyse-Durchläufe über ein großes Repo –, dann aktiviere max, setze Luna mit einer Übergabe von fünf Fragen in einen eigenen Thread, behalte eine Sol-Instanz davor für die Planung und dahinter für die Überprüfung, und erwarte, eine Größenordnung weniger aufzuwenden. Die Leute, die die größten Erfolge melden, machen alle eine Variante davon, und die unabhängigen Kostenzahlen stützen die Richtung, auch wo sie nicht die Darstellung „so gut wie Sol“ stützen.
Wenn Ihre Arbeit explorativ oder ästhetisch ist oder als vage Vorgabe ankommt, die sich erst nach und nach schärft, sagen die Feldberichte deutlich, dass Sie die Ersparnis doppelt wieder ausgeben werden, um das Ergebnis zu überarbeiten. Und wenn Sie interaktiv arbeiten – wenn Sie dabei zusehen –, wird Sie der zweiminütige Kaltstart bei maximaler Anstrengung mehr stören, als Sie der Preis erfreut.
Worauf man achten sollte: ob das Unternehmen Luna für das v2-Subagenten-Protokoll nachtrainiert. Jeder unbeholfene Teil des aktuellen Playbooks — der separate Thread, der verlorene gemeinsame Kontext, der Katalog-Hack, die ganze Retract-and-Rewire-Episode — existiert wegen dieser einen Lücke. Schließt man sie, wird die beste Version dieses Musters um mehrere Schritte einfacher.
Fragen, die eine echte Antwort wert sind
Kostet maximale Reasoning-Anstrengung mehr pro Token als die Standardeinstellung?
Nein, und das ist das häufigste Missverständnis über diese Einstellung. GPT-5.6 Luna berechnet 0,20 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens, unabhängig vom Aufwand. Was „max“ verändert, ist die Anzahl der verbrauchten Tokens – das Modell plant mehr, prüft sich selbst und überarbeitet seine Antwort, bevor es antwortet. Artificial Analysis hat gemessen, dass dieses Modell bei einer Benchmark-Suite 130M Ausgabe-Tokens erzeugt, während das Median-Modell 61M erzeugt. Eine Sitzung mit maximalem Aufwand kostet also mehr als eine mit mittlerem Aufwand bei derselben Aufgabe – allein durch das Volumen – und es dauert auch länger, bis das erste Token erzeugt wird. Aufwand ist ein Regler für die Token-Anzahl, der ein Qualitätsetikett trägt.
Kann GPT-5.6 Luna schon als nativer Codex-Subagent laufen?
Stand 5. August 2026: Nein – und die Community hat aufgehört, es zu versuchen. Der native Subagent-Pfad von Codex akzeptiert Luna nicht; der Custom-Agent-Workaround bringt es zum Laufen, verliert aber den gemeinsamen Kontext mit dem Hauptagenten; und der Entwickler hinter dem bekanntesten Plugin für dieses Muster hat Luna entfernt und dann als separat gestartete Top-Level-Aufgabe wieder hinzugefügt, die der Orchestrator überwacht. Wenn Sie einen Multi-Agenten-Lauf sehen, bei dem Luna nie ausgewählt wird, wird es wahrscheinlich herausgefiltert, weil der Standardmodellkatalog es als v1 statt v2 markiert – was ein Entwickler auf eigenes Risiko von Hand gepatcht hat. Das ist mit Abstand das wahrscheinlichste Element auf der Liste, das sich mit einem Codex-Update ändern wird. Überprüfen Sie es also anhand Ihrer installierten Version, statt irgendeinem Rezept zu vertrauen, einschließlich diesem.
Ist es gut genug, um ein Claude- oder Kimi-K3-Coding-Abo zu ersetzen?
Mehrere Entwickler haben öffentlich einen 200-Dollar-pro-Monat-Plan genau deswegen gekündigt. Der Beitrag, der die Frage öffentlich machte, stammte von einem Immunologen, der täglich Code schreibt: Er kündigte sein Kimi-K3-Coding-Abonnement nicht, weil es schlecht war, sondern weil er es nicht rechtfertigen konnte, da GPT-5.6 Luna seiner Erfahrung nach für seine Arbeit genauso gut und viel billiger war – Frontend ausgenommen. Die unabhängigen Kostenberechnungen machen das Argument schwer von der Hand zu weisen: Im selben Benchmark-Set erreichte Kimi K3 bei maximalem Aufwand 57 Punkte für 2.437 Dollar, während GPT-5.6 Luna bei Maximum 51 für 174 Dollar erzielte. Aber lies die Gegenstimmen, bevor du etwas kündigst. Die Entwickler, die abgeglichene Sitzungen gemessen und negativ abgeschnitten hatten, testeten nicht ein anderes Modell; sie testeten eine andere Art von Aufgabe – offen, visuell oder vage spezifiziert – und bei einer solchen Aufgabe verlor das billigere Modell so deutlich, dass die Ersparnis wieder zunichte gemacht wurde. Die vertretbare Antwort ist, dass Luna Max einen großen Teil deiner Coding-Arbeit, aber nicht unbedingt dein bestes Coding-Modell, und dass diejenigen, die am meisten davon profitieren, diejenigen sind, die sich eine Spitzenklasse (Frontier-Tier) zur Planung und Überprüfung gehalten haben.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
