GPT-5.6 Luna Max-1
Guides & Insights

GPT-5.6 Luna Max: Hoe ontwikkelaars het daadwerkelijk gebruiken in Codex — en waar het misgaat

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op 1 augustus begon een configuratiebestand van vier regels te circuleren op X. Het creëert een Codex-agent genaamd luna_worker, stelt het model in op gpt-5.6-luna, stelt de redeneerinspanning in op max, en geeft het de saaie helft van je werk terwijl GPT-5.6 Sol het plan behoudt. Binnen enkele dagen was hetzelfde recept opnieuw geplaatst in het Engels, Chinees, Japans, Koreaans, Spaans en Arabisch, en een plugin die op hetzelfde idee was gebouwd, had in vier dagen meer dan 1.300 GitHub-sterren verzameld. Het is ook, min of meer op de dag dat het viraal ging, de verkeerde manier om het aan te sluiten: de auteur van die plugin haalde GPT-5.6 Luna binnen 48 uur publiekelijk uit zijn eigen project, omdat een collega hem vertelde dat het niet werkt als Codex-subagent — om het twee dagen later terug te plaatsen, op een heel andere manier aangesloten.

Die hele boog gebeurde binnen één week, en het is het nuttigste wat iemand over dit model heeft gepubliceerd. Het vertelt je dat het goedkope-werkerpatroon echt is, dat de voor de hand liggende manier om het aan te sluiten de verkeerde is, en dat het verschil tussen die twee het grootste deel van de waarde vormt. Alles in dit artikel wat techniek betreft komt van beoefenaars die tussen 30 juli en 5 augustus 2026 hun eigen resultaten postten — niet van de documentatie van het bedrijf, die GPT-5.6 Luna beschrijft als een model voor 'kostengevoelige workloads met een hoog volume' en hierover niets zegt. Waar een getal is gemeten door een onafhankelijke derde partij, zeggen we dat; waar het een sessielogboek van één ontwikkelaar is, zeggen we dat ook, ook wanneer ze elkaar tegenspreken. Dat doen ze, vaak.

Wat "Luna Max" is, en waarom de meeste mensen het nooit zien

Er is geen model dat Luna Max heet. Er zijn twee knoppen, en Luna Max is één combinatie daarvan: de goedkoopste laag van de GPT-5.6-familie, uitgevoerd met de diepste redeneerinstelling. De laagknop kiest tussen GPT-5.6 Sol, GPT-5.6 Terra en GPT-5.6 Luna. De inspanningsknop heeft zes standen — none, low, medium, high, xhigh en max — en bepaalt hoeveel het model nadenkt voordat het antwoordt.

Bijna niemand combineerde de goedkope laag met de diepe instelling, om een alledaagse reden: max is standaard verborgen. In de ChatGPT/Codex-desktopapp zit het achter Instellingen → Configuratie → Beschikbare reasoning efforts, waar de lijst wordt geleverd met de bovenste optie uitgevinkt. Zes verschillende ontwikkelaars plaatsten in de eerste week van augustus dezelfde fix van drie klikken, een goede aanwijzing hoeveel mensen Luna op de standaarddiepte hadden draaien en het model daaraan beoordeelden. Aan de API-kant is er geen schakelaar te vinden: je geeft de model-id gpt-5.6-luna door en stelt reasoning effort in op max in de requestbody, en dat is de hele wijziging.

Eén consequentie die de moeite waard is om je eigen te maken voordat je een benchmark leest: wanneer Artificial Analysis een intelligentiescore voor dit model publiceert, is de pagina getiteld GPT-5.6 Luna (max). Het onafhankelijke getal dat iedereen voor Luna aanhaalt, is de configuratie met maximale inspanning. Als je de standaard hebt gebruikt en je afvraagt waarom je ervaring niet overeenkomt met het leaderboard, dan is dat de reden.

De knop die niemand uitlegt: inspanning verandert het aantal tokens, niet de tokenprijs.

Het verhogen van de redeneerinspanning brengt je niet in een duurdere prijsklasse. GPT-5.6 Luna kost $0,20 per miljoen invoertokens en $1,20 per miljoen uitvoertokens bij elke inspanningsinstelling. Wat er verandert, is hoeveel tokens het model besteedt om tot een antwoord te komen — en bij maximaal verbruikt het veel.

Artificial Analysis heeft dit gemeten tijdens het uitvoeren van zijn Intelligence Index, en de cijfers zijn de duidelijkste onafhankelijke bevestiging van waar beoefenaars over klaagden:

• Score — 51 op de Artificial Analysis Intelligence Index, vergeleken met een mediaan van 17 voor de modellen die het in die klasse benchmarkt.

• Uitvoerigheid — 130M outputtokens gegenereerd tijdens de indexrun, tegenover een mediaan van 61M. Artificial Analysis bestempelt het model als "zeer uitvoerig".

• Ruwe snelheid — 182,5 outputtokens per seconde, 16e van 163 modellen. Snel per token.

• Tijd tot eerste token — ruwweg 136 seconden bij maximale inspanning, wat volgens Artificial Analysis aan de hoge kant is, zelfs voor redeneringsmodellen in die prijsklasse.

• Totale uitgaven — $174.06 om het model op de volledige index te evalueren.

Lees de derde en vierde regel samen, want dat paar is de volledige gebruikerservaring. Luna op max streamt tokens snel, maar heeft minuten nodig om te starten, en produceert vervolgens ongeveer twee keer zoveel tokens als een typisch model bij hetzelfde werk. Daarom is de meest voorkomende klacht in de veldrapporten niet "het is fout", maar "het is traag" — en waarom de lage prijs zich niet vertaalt naar een evenredig goedkope sessie. Je koopt een laag tarief voor een hoog aantal tokens.

Ter contrast: op onze eigen modelpagina voor GPT-5.6 Luna is de waargenomen mediane tijd tot het eerste token over zeven dagen aan echt verkeer 1,78 seconden, met een 95e percentiel van 9,26 seconden. Dat is geen tegenspraak met het cijfer van 136 seconden — het is hetzelfde model gemeten over een mix van inspanningsniveaus, waarvan de meeste niet maximaal zijn. De latentie die je krijgt is een eigenschap van de knop die je instelt, niet van het endpoint dat je aanroept.

GPT-5.6 Luna Max-2

Is Luna Max echt 'Sol Medium voor een zesde van de prijs'?

Dit is de bewering die het patroon viraal deed gaan, en hij is afkomstig van Dan McAteer, die het als volgt stelde: Luna met maximale redenering landt rond GPT-5.6, Sol op medium, of Claude Opus 5 op medium, voor ongeveer een zesde van de kosten. Het werd door veel accounts herhaald, soms zonder de voorbehouden, en het is de moeite waard om te scheiden wat gemeten is van wat vibes zijn.

De onafhankelijke scoreboard ondersteunt de kostenhelft van de claim nadrukkelijk en de capaciteitshelft slechts gedeeltelijk. Bij het draaien van dezelfde benchmark-suite met maximale inspanning over de verschillende niveaus registreerde Artificial Analysis Luna op index 51 voor $174, Terra op 55 voor $1.403, Kimi K3 op 57 voor $2.437 en Sol op 59 voor $2.824. Luna geeft acht indexpunten toe aan Sol en kost ongeveer een zestiende zoveel om hetzelfde werk te doorlopen.

GPT-5.6 Luna Max-3

Het onafhankelijke scorebord werd op 13 augustus verscherpt, toen DeepSWE v1.1 uitbracht — een herziening van zijn langetermijn-engineeringbenchmark die 113 originele taken uit 91 repositories in vijf talen behoudt, maar nu elke fix beoordeelt door de gecommitteerde diff in een geïsoleerde container uit te voeren, wat moeilijker te manipuleren is. Op het bijgewerkte scorebord belanden alle drie GPT-5.6-niveaus met maximale inspanning waar de juli-bespreking ze had: Luna Max op een pass@1 van 67,2% en $0,61 per taak, Terra Max rond de 70%, Sol Max op 73% voor $8,39 — zes procentpunten succesratio voor ongeveer veertien keer zoveel geld.

De vergelijking die een tweede blik waard is, staat onder Luna, niet erboven. Claude Sonnet 5 Max scoort 54% op dezelfde 113 taken — ongeveer dertien punten achter Luna Max — tegen $26,40 per taak, oftewel ongeveer 44 keer wat Luna voor dezelfde oplossing betaalde. Luna Max verslaat ook Gemini 3.7 Flash (65% voor de configuratie met hoge inspanning op hetzelfde bord); het communitybericht dat deze ronde signaleerde, stelt het verschil met Gemini 3.7 Flash Medium op ongeveer 1,7 punten. DeepSWE is de onafhankelijke testomgeving van Datacurve, geen bedrijfsevaluatie — de eigen bewering van het bedrijf dat de GPT-5.6-familie state-of-the-art resultaten behaalde op Terminal-Bench 2.1 en DeepSWE blijft een afzonderlijke, door de leverancier gerapporteerde bewering.

Dan is er nog het bewijsmateriaal uit de praktijk, dat werkelijk verdeeld is. Pawel Huryn draaide zijn eigen bugfix-benchmark — 105 opzettelijk geplaatste bugs in twee echte codebases, blinde beoordeling, één ronde per model — en rapporteerde dat Luna met maximale inspanning 33 bugs oploste voor $1,80, tegenover de 24 van Claude Fable 5 voor $68. Andersom besteedde Diego Haz twee dagen aan het draaien van vergelijkbare sessies en kwam tot een tegengestelde conclusie: Luna kostte gemiddeld $1,20 per sessie terwijl Sol gemiddeld $29 kostte, maar hij moest het grootste deel van Luna's output overdoen en kreeg niets bruikbaars voor zijn use cases, waardoor de besparing een illusie is in plaats van een korting. Een andere ontwikkelaar die dezelfde testopstelling gebruikte, meldde dat Sol op medium een duidelijk beter resultaat opleverde dan Luna op max, in ongeveer de helft van de tijd. Een bake-off in het Chinees rond één enkele 3D-scèneopdracht kwantificeerde dat beeld: Sol Medium was klaar in 21m30s met de hoogste kwaliteitsbeoordeling en de minste tokens; Luna Max deed er 40m55s over, verbruikte ongeveer 130k tokens, scoorde het laagst op kwaliteit en gebruikte de helft van de wekelijkse abonnementslimiet.

De eerlijke samenvatting van de positie van de gemeenschap na een week: Luna Max is niet Sol Medium. Het is een stuk goedkoper dan Sol Medium en het is slechter, en of die afweging goed is hangt er geheel van af of de taak nauwkeurig genoeg is gespecificeerd dat "slechter" er niet toe doet. Dat is precies waar de bedradingspatronen hieronder voor dienen.

Het patroon dat contact overleefde: Sol plant, Luna voert uit, een nieuwe Sol beoordeelt.

Niemand die Luna Max blijft gebruiken, gebruikt het als een algemene codeeragent. De opstelling die werkt, waar beoefenaars in elke versie op zijn uitgekomen, heeft vier rollen:

• Orchestrator — GPT-5.6 Sol met hoge inspanning, die in de hoofdthread blijft. Het is verantwoordelijk voor de vereisten, de architectuur, de taakdecompositie en de uiteindelijke acceptatie. Het schrijft de code niet.

• Routine-implementeerder — GPT-5.6 Luna met maximale inspanning, aan afgebakend, volledig gespecificeerd werk: mechanische refactors, tests schrijven, moduleanalyse, documentatierondes, het soort taak waarbij de bestemming ondubbelzinnig is.

• Strikte implementeerder — GPT-5.6 Terra met maximale inspanning, voor context-zware builds waar Luna's instructiedrift duur wordt.

• Reviewer — een verse, alleen-lezen GPT-5.6 Sol-instantie die alleen de uiteindelijke diff ziet en niets anders. Het punt van 'vers' is dat een reviewer die de context van de implementatie meedraagt, geneigd is zijn eigen redenering goed te keuren.

De referentie-implementatie is sol-advisor, een MIT-gelicenseerde Codex-plugin van Dan McAteer die in de eerste week ongeveer 1.400 sterren bereikte. Je installeert het via de Codex-pluginmarktplaats door de DannyMac180/sol-advisor repository toe te voegen en vervolgens de sol-advisor plugin toe te voegen. De huidige vorm is leerzaam: de native lane wijst een Terra/High-implementeerder aan, gevolgd door een verse Sol/High-reviewer, terwijl Luna op max een expliciete opt-in-lane is die draait als een aparte, voor de gebruiker zichtbare taak, waarbij de primaire Sol-sessie het werk direct beoordeelt en accepteert in plaats van het via de native reviewer te routeren.

Als je liever niets installeert, is de veelgekopieerde minimale versie een aangepaste agentdefinitie in ~/.codex/agents/luna-worker.toml met twee instellingen — model = "gpt-5.6-luna" en model_reasoning_effort = "max" — plus een beschrijving en instructies die het beperken tot gedelegeerd werk met duidelijke grenzen, verbieden dat het het algemene doel wijzigt of zijn eigen reikwijdte verruimt, en architectuurbeslissingen en dubbelzinnige vereisten terugsturen naar de hoofdagent. Het advies dat de ronde doet, is om Sol dit bestand voor je te laten schrijven, het te valideren tegen je geïnstalleerde Codex-versie, en je de diff te tonen voordat je het accepteert, wat verstandig is, ongeacht of je het recept wel of niet vertrouwt.

De subagent-valkuil, en de oplossing waar de community op uitkwam

Hier is het punt waar de virale versie van dit patroon en de werkende versie uit elkaar gaan.

Het native subagentsysteem van Codex behandelt GPT-5.6 Luna niet als een eersteklas burger. McAteer stuitte op een harde blokkade — Luna is niet toegestaan als subagent — en omzeilde dat door haar in plaats daarvan als aangepaste agent te declareren, waarna hij de kosten van die workaround publiekelijk aangaf: een aangepaste agent deelt geen context met de hoofdagent zoals een native subagent dat wel doet. Dagen later verwijderde hij de Luna-baan uit sol-advisor, volledig, onder verwijzing naar de bevinding van een andere op Codex gerichte ontwikkelaar dat Luna zich slecht gedraagt in de subagentrol, met de veronderstelling dat ze niet is nagetraind voor het v2-multi-agentprotocol. Diego Haz beschreef onafhankelijk dezelfde muur vanaf de andere kant: Sol kan Luna niet als subagent spawnen, dus Luna moet in een thread op het hoogste niveau leven, wat de coördinatie rommelig maakt.

De oplossing, die nu het meerderheidsstandpunt is, is om er niet meer tegen te vechten.

• Geef Luna Max een eigen thread, niet een plek in de subagent-graaf. Instrueer de Sol-orchestrator om een afzonderlijke top-level Codex-taak op Luna op te starten, deze te monitoren en het resultaat terug te halen. Dit is wat McAteer opnieuw toevoegde aan sol-advisor op 4 augustus, en waar verschillende anderen onafhankelijk op waren uitgekomen.

• Aanvaard contextisolatie als de prijs. Een aparte thread betekent een aparte geschiedenis. Dat is de tol die je betaalt, en het is ook de reden waarom de onderstaande overdracht hier meer van belang is dan in een native subagent-opstelling.

• Als je het per se in multi-agent v2 moet forceren, is de catalogus de reden dat het wordt weggefilterd. Een ontwikkelaar herleidde de uitsluiting tot de standaard modelcatalogus die Luna als v1 markeert, en meldde een workaround: kopieer ~/.codex/models_cache.json, zet Luna's multi_agent_version op v2, wijs model_catalog_json naar je kopie, herstart Codex, en laat de orchestrator Luna dan op maximaal spawnen met een snelle servicetier en zet forking uit. Beschouw dit als iemands officieuze hack op een intern bestand — het is precies het soort ding dat een Codex-update breekt.

Het overdrachtsdocument: vijf vragen die de meest voorkomende klacht oplossen

De meest gerapporteerde tekortkoming van Luna Max is dat het instructies niet nauwkeurig opvolgt, met name wanneer je het een specifieke workflow of een iteratielus geeft om uit te voeren. Die klacht komt zowel van ontwikkelaars die het model waarderen als van ontwikkelaars die het hebben laten vallen. De oplossing waar beoefenaars steeds op uitkomen is niet een betere prompt in de zin van schrijfstijl; het is een strikter contract. Voordat de Luna-thread begint, beantwoord vijf dingen:

• Welke exacte taak moet deze agent afronden?Niet het werkterrein — de eindtoestand.

• Welke bestanden, documenten of systemen zijn in scope? Opgesomd, niet impliciet.

• Wat mag het niet veranderen? De interfaces, migraties, configuraties en publieke contracten die niet gewijzigd mogen worden.

• Welk bewijs toont voltooiing aan? Een benoemde test, de output van een specifiek commando, een diff die alleen de vermelde bestanden raakt.

• Welke ontbrekende beslissing zou ervoor moeten zorgen dat het stopt?De trigger om terug te komen in plaats van te raden — dit is degene die voorkomt dat een overijverig goedkoop model een architectuur verzint.

Dit is ook waar de eigen promptrichtlijnen van het bedrijf de moeite waard zijn om mee te nemen, met het label dat ze verdienen: het bedrijf meldt dat in zijn interne evaluaties van coding-agents slankere systeemprompts de evalscores met 10–15% verbeterden, terwijl ze het totale aantal tokens met 41–66% en de kosten met 33–67% verminderden, en het adviseert om prompts die zijn overgeërfd van GPT-5.5 of GPT-5.4 te controleren in plaats van ze zonder meer over te zetten. Dat zijn door de leverancier gerapporteerde cijfers. Maar de richting komt overeen met wat het vakgebied heeft vastgesteld: beschrijf de bestemming nauwkeurig en schrap de vertelling van elke voetstap. Let op de spanning met de bovenstaande alinea — precisie over reikwijdte en beperkingen is niet hetzelfde als breedsprakigheid, en de consensus in de community is dat Luna Max meer van het eerste en minder van het laatste nodig heeft.

Faalwijzen om rekening mee te houden

• Instructiedrift. Bevestigd door meerdere ontwikkelaars: het negeert delen van de oorspronkelijke opdracht, en het is het ergst wanneer de opdracht een procedure is om te volgen in plaats van een resultaat om te bereiken.

• Traagheid in kloktijd. Herhaaldelijk gemeld, en consistent met de ~136 seconden tijd-tot-eerste-token die Artificial Analysis mat bij maximale inspanning. Prima voor werk dat je kunt laten draaien; pijnlijk in een interactieve lus.

• Contextverbruik. Eén ontwikkelaar meldde dat Luna Max een Codex-threadvenster van 258k tokens alarmerend snel opgebruikte, en vermoedde dat het quotumverbruik piekte zodra Codex vlak bij de limiet begon te compacteren. Dat is zijn indruk, geen gemeten resultaat — maar het verbruikstempo is het verwachte gevolg van de breedsprakigheid die Artificial Analysis onafhankelijk heeft gemeten. Aan de API-kant moet je op de lange-contextstap letten: de doorberekende prijsschaal voor dit model verschuift van $0.20/$1.20 naar $0.40/$1.80 zodra een aanvraag de grens van ongeveer 272k tokens overschrijdt, dus een thread die blijft groeien wordt duurder per token, niet alleen maar duurder in totaal.

• Alles visueels. Dit is de scherpste grens in de veldrapporten. Een veelgelezen beoefenaar, die een Kimi K3-codeerabonnement opzegt ten gunste van Luna Max, beoordeelde het als even goed als wat hij opzegde en veel goedkoper — met een expliciete uitzondering voor frontend. Een ander was directer: gebruik Luna niet voor ontwerp-, grafische, opmaak- of diawerk; de aanpak 'plannen met Sol, uitvoeren met Luna' is bedoeld voor stapsgewijze instructietaken, niet voor esthetische taken.

• De subagentcatalogus. Hierboven behandeld — als Luna in een multi-agentrun stilletjes nooit wordt geselecteerd, wordt ze gefilterd, niet dat ze faalt.

• Schijnbesparing. De enige faalmodus die in geen enkele benchmark voorkomt: een sessie die $1,20 kostte in plaats van $29 en werk opleverde dat je met de hand herschreef, kostte je $1,20 plus je middag.

Wanneer je niet naar max moet grijpen

Max is geen gratis upgrade, en de richtlijn die stand heeft gehouden is een ladder in plaats van een instelling:

• Eenvoudige transformaties — een veldhernoeming, een mechanische extractie, een opmaakbewerking. Lage of gemiddelde inspanning op Luna. Laat het afhangen van het slagen van een benoemde test.

• Routine-implementatie — hoog of xhoog. De community-standaard voor een Luna-worker is xhoog, niet max, juist omdat max tijd en tokens kost aan taken die nooit moeilijk waren.

• Begrensd maar echt moeilijk — dit is de echte taak van max. Het pakket moet zowel moeilijk als nauwkeurig gespecificeerd zijn, zodat de extra redenering zich vertaalt in een beter resultaat.

• Dubbelzinnig onderzoek — verander de tier, niet de regelaar. Als het model verkeerd beoordeelt in plaats van te weinig te plannen, zal meer nadenken op een goedkoper model het niet oplossen; dat is een Sol-taak.

• Vage briefing — verbeter het contract, niet het model. Geen enkele inspanningsinstelling compenseert een niet-vermeld acceptatiecriterium.

Een waarschuwing specifiek voor abonnementen, uit een handleiding van derden en makkelijk verkeerd te begrijpen: de credittarieven die Codex per model in rekening brengt, hebben niet dezelfde verhoudingen als de API-lijstprijzen, dus u kunt een API-prijsverhouding niet zomaar overnemen en gebruiken als routeringsregel voor uw abonnement. Gerapporteerde berichtlimieten voor vijf uur op de Plus-tier illustreren het punt — ongeveer 15–90 lokale berichten op Sol, 20–110 op Terra, 50–280 op Luna, met zulke brede bereiken omdat een 'bericht' geen vaste werkeenheid is. Als uw routeringsbeslissingen worden gedreven door een abonnementslimiet in plaats van een factuur, meet dan af tegen de limiet.

Voorbij Codex: waar mensen dit nog meer op richten

De combinatie van goedkoop en diep redeneren blijkt nuttig buiten codeeragenten, en dit zijn de toepassingen met bewijs:

• Browseragents. Een ontwikkelaar draaide een stack voor browserautomatisering op GPT-5.6 Luna om de top 15 Hacker News-posts te openen, elke gelinkte pagina te lezen en een rapport te schrijven — totale kosten: 3 cent. Lange horizon, lage inzet, hoog tokenverbruik: precies de vorm waar dit model voor is geprijsd.

• Skillketens. Twee beoefenaars meldden onafhankelijk van elkaar dat ze een pipeline met twee vaardigheden — beeldgeneratie naar een image-naar-Three.js-converter — vanuit één enkel Luna Max-doel hadden aangestuurd om een interactief low-poly 3D-object te krijgen, waarbij elk opmerkte dat het hun wekelijkse gebruiksteller nauwelijks bewoog. Het is de moeite waard om dit te lezen naast de waarschuwing 'gebruik Luna niet voor visueel werk': Luna orkestreerde tools die het visuele werk deden, en beoordeelde niet zelf de esthetiek.

• Eén sessie warm houden. Gecachte invoer voor dit model kost $0.02 per miljoen tokens tegenover $0.20 voor verse invoer — een korting van 90% die Artificial Analysis vermeldt op zijn prijspaneel — en het cachevenster is ongeveer 30 minuten. De praktische implicatie waar meerdere gidsen onafhankelijk op uitkomen: een langlopende sessie die steeds dezelfde codebase opnieuw leest, is aanzienlijk goedkoper dan een nieuwe sessie per taak.

• Quota-arbitrage.De meest gewaagde claim in de hele set, en duidelijk als claim bestempeld: één ontwikkelaar meldt dat, omdat inspanning bijna gratis is terwijl de tier-multiplier groot is, hij met maximale inspanning op de goedkope tier in drie weken 4,9 miljard tokens op een $200-plan kon verwerken — een zescijferig bedrag tegen API-tarieven — en dat hij de Kimi K3-, Grok- en DeepSeek-modellen in dezelfde picker houdt, achter een lokale router, zodat het bereiken van de limiet van één provider het werk niet stopzet. Niemand heeft het tokencijfer onafhankelijk kunnen reproduceren. De routeringsgewoonte erachter is echter het deel dat het kopiëren waard is.

Dezelfde split uitvoeren zonder een Codex-abonnement.

Alles hierboven is een verhaal in de vorm van een abonnement: de reden waarom mensen om Luna Max geven, is dat het een wekelijkse limiet oprekt. Aan de API-kant is dezelfde architectuur eenvoudiger te bouwen en makkelijker te beredeneren, omdat je een factuur betaalt in plaats van een tegoed te beheren — en de scheiding tussen orchestrator en worker is niet langer een plugin, maar wordt gewone routing.

GPT-5.6 Luna is beschikbaar via OrcaRouter tegen $0,20 per miljoen input en $1,20 per miljoen output — de lijstprijs van de provider, zonder opslag doorberekend. Daarom was de prijsverlaging van 30 juli bij ons al live op de dag van de aankondiging, in plaats van een factureringscyclus later. Het wordt aangeboden via een compatibele API op /v1/chat/completions en /v1/responses, dus het reasoning-effort-veld gaat mee in de request body, precies zoals dat bij een directe verbinding zou gaan, en de model-id is openai/gpt-5.6-luna. GPT-5.6 Sol en GPT-5.6 Terra vallen onder dezelfde sleutel, en dat is precies wat er voor dit patroon toe doet: een orchestrator op de ene laag en een worker op een andere betekent twee model-id's in één integratie, niet twee leverancierscontracten. Met de routing-DSL kun je die splitsing uitdrukken als één aanroep in plaats van threads handmatig aan elkaar te lijmen, en automatische failover dekt het geval dat de quota-arbitrageclub met een lokale router oplost — wanneer een provider minder presteert, komt de aanvraag ergens anders terecht in plaats van stil te vallen.

GPT-5.6 Luna Max-4

Twee eerlijke kanttekeningen. Codex-specifieke machinerie — de subagent-graaf, de plugin-marktplaats, de modelcatalogus, het wekelijkse tegoed — is van het bedrijf, en niets daarvan wordt meegeleverd met een API-sleutel; als het patroon dat je wilt sol-advisor in de Codex-app is, wil je een Codex-abonnement. En de faalmodi hierboven zijn eigenschappen van het model, niet van het transport: routing verandert wat een aanroep kost en wat er gebeurt als een provider uitvalt, niet of Luna je instructies opvolgt.

Wie zou dit moeten kopiëren, en wie niet?

Als je werk grootschalig en mechanisch specificeerbaar is — refactors, testscaffolding, extractie, documentatie, analysepasses over een grote repo — zet max aan, plaats Luna in een eigen thread met een handoff van vijf vragen, houd een Sol-instantie ervoor voor planning en erachter voor review, en verwacht een orde van grootte minder te besteden. De mensen die de grootste winsten rapporteren, doen allemaal een variant daarop, en de onafhankelijke kostencijfers ondersteunen de richting, zelfs waar ze de 'net zo goed als Sol'-framing niet ondersteunen.

Als je werk verkennend of esthetisch is, of binnenkomt als een vage opdracht die gaandeweg scherper wordt, zeggen de veldrapporten ronduit dat je de besparing dubbel uitgeeft aan het herdoen van het resultaat. En als je interactief werkt — er zittend naar te kijken — zal de koude start van twee minuten op maximale inspanning je meer storen dan dat de prijs je bevalt.

Waar je op moet letten: of het bedrijf Luna post-trains voor het v2-subagentprotocol. Elk onhandig onderdeel van het huidige draaiboek — de aparte thread, de verloren gedeelde context, de catalogus-hack, de hele retract-and-rewire-episode — bestaat vanwege die ene kloof. Dicht die kloof en de beste versie van dit patroon wordt meerdere stappen eenvoudiger.

Vragen die een echt antwoord waard zijn

Kost maximale redeneerinspanning meer per token dan de standaard?

Nee, en dit is het meest voorkomende misverstand over de instelling. GPT-5.6 Luna rekent $0,20 per miljoen invoertokens en $1,20 per miljoen uitvoertokens, ongeacht de inspanning. Wat 'max' verandert, is het aantal verbruikte tokens — het model plant meer, controleert zichzelf en herziet voordat het antwoordt. Artificial Analysis heeft gemeten dat dit model 130M uitvoertokens genereert op een benchmarksuite waar het mediane model 61M genereert. Een sessie met maximale inspanning kost dus meer dan een sessie met gemiddelde inspanning bij dezelfde taak, puur door het volume, en het duurt ook langer voordat het eerste token wordt geproduceerd. Inspanning is een token-aantalknop met een kwaliteitslabel.

Kan GPT-5.6 Luna al draaien als een native Codex-subagent?

Per 5 augustus 2026: nee — en de community is gestopt met proberen. Het native subagentpad van Codex accepteert Luna niet; de workaround met een aangepaste agent zorgt dat het draait, maar verliest de gedeelde context met de hoofdagent; en de ontwikkelaar achter de bekendste plugin voor dit patroon heeft Luna verwijderd en vervolgens opnieuw toegevoegd als een afzonderlijk gestarte taak op topniveau die de orkestrator bewaakt. Als je een multi-agentrun ziet waarin Luna nooit wordt geselecteerd, wordt deze waarschijnlijk gefilterd omdat de standaardmodelcatalogus het als v1 markeert in plaats van v2, wat een ontwikkelaar op eigen risico met de hand heeft gepatcht. Dit is verreweg het meest waarschijnlijke punt op de lijst om te veranderen met een Codex-update, dus verifieer het aan de hand van jouw geïnstalleerde versie in plaats van een recept te vertrouwen, inclusief dit recept.

Is het goed genoeg om een Claude- of Kimi K3-codeerabonnement te vervangen?

Verschillende ontwikkelaars hebben publiekelijk een abonnement van $200 per maand opgezegd vanwege precies dit. Het bericht dat de vraag aan het licht bracht, kwam van een immunoloog die dagelijks codeert: hij zegde zijn Kimi K3-codeerabonnement op, niet omdat het slecht was, maar omdat hij het niet kon rechtvaardigen aangezien GPT-5.6 Luna naar zijn ervaring even goed was voor zijn werk en veel goedkoper — met uitzondering van frontend. De onafhankelijke kostencijfers maken de zaak moeilijk te negeren: op dezelfde benchmarksuite scoorde Kimi K3 op maximale inspanning 57 voor $2,437 terwijl GPT-5.6 Luna op max 51 scoorde voor $174. Maar lees het tegengeluid voordat je iets opzegt. De ontwikkelaars die vergelijkbare sessies maten en negatief uitkwamen, testten geen ander model; ze testten een ander soort taak — open-ended, visueel of vaag gespecificeerd — en bij dat soort taak verloor het goedkopere model zo slecht dat de besparing teniet werd gedaan. Het verdedigbare antwoord is: Luna Max vervangt een groot deel van je codeerwerk, niet noodzakelijk je beste codeermodel, en degenen die er het meeste uit halen, zijn degenen die een frontier-tier hebben aangehouden om te plannen en te controleren.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt