
GPT-5.6 Luna Max: Hur utvecklare faktiskt använder det i Codex — och var det brister
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 221 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Den 1 augusti började en fyra rader lång konfigurationsfil cirkulera på X. Den skapar en Codex-agent som heter luna_worker, ställer in dess modell till gpt-5.6-luna, ställer in dess resonemangsansträngning till max och ger den den tråkiga hälften av ditt arbete medan GPT-5.6 Sol behåller planen. Inom några dagar hade samma recept återpublicerats på engelska, kinesiska, japanska, koreanska, spanska och arabiska, och ett plugin byggt på samma idé hade passerat 1 300 GitHub-stjärnor på fyra dagar. Det är också, mer eller mindre samma dag som det gick viralt, fel sätt att koppla det: pluginets författare tog bort GPT-5.6 Luna från sitt eget projekt inom 48 timmar, offentligt, eftersom en kollega sa till honom att det inte fungerar som en Codex-subagent — och lade sedan tillbaka det två dagar senare, kopplat på ett helt annat sätt.
Hela den bågen utspelade sig inom en vecka, och det är det mest användbara som någon har publicerat om den här modellen. Det visar att cheap-worker-mönstret är verkligt, att det uppenbara sättet att koppla det är fel sätt, och att skillnaden mellan dessa två är det mesta av värdet. Allt i den här artikeln som rör teknik kommer från utövare som publicerade sina egna resultat mellan 30 juli och 5 augusti 2026 — inte från företagets dokumentation, som beskriver GPT-5.6 Luna som en modell för "kostnadskänsliga arbetsbelastningar med hög volym" och inte nämner något av detta. Där en siffra är mätt av en oberoende tredje part säger vi det; där det är en enda utvecklares sessionslogg säger vi också det, inklusive när de motsäger varandra. Det gör de ofta.
Vad "Luna Max" är, och varför de flesta aldrig ser det
Det finns ingen modell som heter Luna Max. Det finns två rattar, och Luna Max är en kombination av dem: den billigaste nivån i GPT-5.6-familjen, som körs med den djupaste resoneringsinställningen. Nivårratten väljer mellan GPT-5.6 Sol, GPT-5.6 Terra och GPT-5.6 Luna. Ansträngningsratten har sex lägen — none, low, medium, high, xhigh och max — och den styr hur mycket modellen tänker innan den svarar.
Nästan ingen kombinerade den billiga nivån med djupinställningen, av en banal anledning: max är dolt som standard. I ChatGPT/Codex-skrivbordsappen ligger det under Inställningar → Konfiguration → Tillgängliga resonemangsinsatser, där listan som standard har det översta alternativet avmarkerat. Sex olika utvecklare publicerade samma tre-klicksfix under första veckan i augusti, vilket är en bra indikator på hur många som hade kört Luna på dess standarddjup och bedömt modellen utifrån det. På API-sidan finns det ingen omkopplare att hitta: du anger modell-ID:t gpt-5.6-luna och ställer in reasoning effort till max i request body, och det är hela ändringen.
En konsekvens som är värd att ta till sig innan du läser något benchmark: när Artificial Analysis publicerar ett intelligenspoäng för den här modellen, är sidan titulerad GPT-5.6 Luna (max). Den oberoende siffra som alla citerar för Luna är maxinsatskonfigurationen. Om du har kört med standardinställningen och undrat varför din upplevelse inte matchar topplistan, är det därför.
Reglaget ingen förklarar: ansträngningen ändrar antalet tokens, inte tokenpriset.
Att höja resonemangsansträngningen flyttar dig inte till en dyrare prisnivå. GPT-5.6 Luna kostar 0,20 USD per miljon inmatningstokens och 1,20 USD per miljon utmatningstokens vid varje ansträngningsnivå. Det som ändras är hur många tokens modellen förbrukar för att nå ett svar — och på max förbrukar den många.
Artificial Analysis mätte detta i samband med att man körde sitt Intelligence Index, och siffrorna är den tydligaste oberoende bekräftelsen på vad praktiker klagade över:
• Poäng — 51 på Artificial Analysis Intelligence Index, jämfört med en median på 17 för de modeller som indexet benchmarkar i den klassen.
• Mångordighet — 130M utdatatokens genererades under indexkörningen, jämfört med en median på 61M. Artificial Analysis flaggar modellen som "mycket mångordig".
• Rå hastighet — 182,5 utdatatoken per sekund, 16:e av 163 modeller. Snabb per token.
• Tid till första token — cirka 136 sekunder vid maximal ansträngning, vilket Artificial Analysis noterar är i det högre spannet även för resonemangsmodeller i den prisklassen.
• Totala utgifter — $174.06 för att utvärdera modellen på hela indexet.
Läs den tredje och fjärde raden tillsammans, eftersom det paret är hela användarupplevelsen. Luna på max strömmar tokens snabbt men tar minuter att starta, och producerar sedan ungefär dubbelt så många tokens som en typisk modell gör för samma arbete. Det är därför det vanligaste klagomålet i fältrapporterna inte är "det är fel", utan "det är långsamt" — och varför det billiga priset inte innebär en proportionellt billig session. Du köper en låg taxa för ett högt tokenantal.
{{1}}Som jämförelse: på vår egen modellsida för GPT-5.6 Luna är den observerade medianen för tid till första token över sju dagar med riktig trafik 1,78 sekunder, med en 95:e percentil på 9,26 sekunder.{{/1}} {{2}}Det är ingen motsägelse mot siffran 136 sekunder — det är samma modell mätt över en blandning av ansträngningsinställningar, varav de flesta inte är max. Den latens du får är en egenskap hos ratten du ställer in, inte hos slutpunkten du anropar.{{/2}}

Är Luna Max verkligen "Sol Medium till en sjättedel av priset"?
Detta är påståendet som fick mönstret att gå viralt, och det har sitt ursprung hos Dan McAteer, som beskrev det som Luna vid maximal resonemangsförmåga som landar runt GPT-5.6, Sol vid medel, eller Claude Opus 5 vid medel, för ungefär en sjättedel av kostnaden. Det upprepades av många konton, ibland med reservationerna bortfilade, och det är värt att skilja på vad som är mätt och vad som är vibbar.
Den oberoende resultattavlan stödjer kostnadsdelen av påståendet eftertryckligt och kapacitetsdelen endast delvis. Genom att köra samma benchmark-svit med maximal insats över nivåerna noterade Artificial Analysis Luna vid index 51 för 174 dollar, Terra vid 55 för 1 403 dollar, Kimi K3 vid 57 för 2 437 dollar och Sol vid 59 för 2 824 dollar. Luna tappar åtta indexpoäng jämfört med Sol och kostar ungefär en sextondel så mycket för samma arbete.

Den oberoende resultattavlan vässades den 13 augusti, när DeepSWE släppte v1.1 — en revidering av dess långsiktiga ingenjörsbenchmark som behåller 113 ursprungliga uppgifter från 91 repositories på fem språk, men nu betygsätter varje fix genom att köra den incheckade diffen i en isolerad container, vilket är svårare att manipulera. På den uppdaterade tavlan hamnar alla tre GPT-5.6-nivåerna vid max ansträngning där julirapporten placerade dem: Luna Max på 67,2 % pass@1 och 0,61 USD per uppgift, Terra Max runt 70 %, Sol Max på 73 % för 8,39 USD — sex procentenheter i framgångsfrekvens för ungefär fjorton gånger så mycket pengar.
Jämförelsen som är värd en andra titt ligger under Luna, inte ovanför den. Claude Sonnet 5 Max får 54% på samma 113 uppgifter — ungefär tretton poäng bakom Luna Max — till $26,40 per uppgift, vilket är ungefär 44 gånger vad Luna betalade för samma lösning. Luna Max klarar också Gemini 3.7 Flash (65% för konfigurationen med hög ansträngning på samma lista); community-inlägget som uppmärksammade denna omgång anger gapet till Gemini 3.7 Flash Medium till cirka 1,7 poäng. DeepSWE är Datacurves oberoende testmiljö, inte en företagsutvärdering — företagets eget påstående att GPT-5.6-familjen satte state-of-the-art-resultat på Terminal-Bench 2.1 och DeepSWE förblir ett separat påstående som rapporterats av leverantören.
Sedan har vi fältbevisen, som verkligen är splittrade. Pawel Huryn körde sitt eget benchmark för buggfixning — 105 inplanterade buggar i två riktiga kodbaser, blindbedömning, en omgång per modell — och rapporterade att Luna med maxinsats fixade 33 buggar för 1,80 dollar, jämfört med Claude Fable 5:s 24 för 68 dollar. Åt andra hållet tillbringade Diego Haz två dagar med att köra matchade sessioner, och hans resultat talade emot mönstret: Luna kostade i genomsnitt 1,20 dollar per session, medan Sol kostade 29 dollar, men han fick göra om större delen av Lunas output och fick inget leveransbart för sina användningsfall, vilket gör besparingen till en illusion snarare än en rabatt. En annan utvecklare som körde samma testmiljö rapporterade att Sol på medium gav ett klart bättre resultat än Luna på max på ungefär halva tiden. En kinesiskspråkig bake-off på en enda 3D-scenuppgift satte siffror på den bilden: Sol Medium blev klar på 21m30s med högst kvalitetsbetyg och minst antal tokens; Luna Max tog 40m55s, förbrukade runt 130 000 tokens, fick lägst kvalitetsbetyg och använde hälften av den veckovisa abonnemangskvoten.
Den ärliga sammanfattningen av communityns ståndpunkt efter en vecka: Luna Max är inte Sol Medium. Den är mycket billigare än Sol Medium och den är sämre, och huruvida det bytet är bra beror helt på om uppgiften är specificerad tillräckligt snävt för att "sämre" inte spelar någon roll. Vilket är precis vad ledningsmönstren nedan är till för.
Det mönster som överlevde kontakten: Sol planerar, Luna implementerar, en ny Sol granskar
Ingen som fortsatt använder Luna Max använder den som en allmän kodningsagent. Den uppsättning som fungerar, som utövare har enats om i varje version, har fyra roller:
• Orchestrator — GPT-5.6 Sol med hög ansträngning, som håller sig i huvudtråden. Den äger krav, arkitektur, uppgiftsdekomponering och slutligt godkännande. Den skriver inte koden.
• RutinimplementerareGPT-5.6 Luna på max insats, på avgränsat, fullt specificerat arbete: mekaniska refaktoreringar, testskrivning, modulanalys, dokumentationsgenomgångar, den typ av uppgift där målet är otvetydigt.
• Hård implementerare — GPT-5.6 Terra med maximal ansträngning, för kontexttunga byggen där Lunas instruktionsavvikelse blir kostsam.
• Granskare — en färsk, skrivskyddad GPT-5.6 Sol-instans som ser den slutliga diffen och inget annat. Poängen med "färsk" är att en granskare som bär med sig implementeringens kontext tenderar att godkänna sitt eget resonemang.
Referensimplementationen är sol-advisor, en MIT-licensierad Codex-plugin av Dan McAteer som nådde ungefär 1 400 stjärnor under sin första vecka. Du installerar den via Codex plugin-marknadsplatsen genom att lägga till DannyMac180/sol-advisor-repositoryt och sedan lägga till sol-advisor-pluginen. Dess nuvarande upplägg är instruktivt: den inbyggda banan fäster en Terra/High-implementerare följd av en ny Sol/High-granskare, medan Luna på max är en explicit opt-in-bana som körs som en separat användarsynlig uppgift, där den primära Sol-sessionen granskar och accepterar dess arbete direkt snarare än att dirigera det genom den inbyggda granskaren.
Om du hellre inte vill installera något, är den flitigt kopierade minimiversionen en skräddarsydd agentdefinition på ~/.codex/agents/luna-worker.toml med två inställningar — model = "gpt-5.6-luna" och model_reasoning_effort = "max" — plus en beskrivning och instruktioner som begränsar den till delegerat arbete med tydliga gränser, förbjuder den att ändra det övergripande målet eller utöka sitt eget arbetsområde, och skickar arkitekturbeslut och tvetydiga krav tillbaka till huvudagenten. Rådet som cirkulerar är att låta Sol skriva den här filen åt dig, validera den mot din installerade Codex-version och visa dig diffen innan du accepterar den, vilket är vettigt oavsett om du litar på receptet eller inte.
Subagentfällan och lösningen som communityn enades om.
Här går den virala versionen av detta mönster och den fungerande versionen skilda vägar.
Codex inbyggda delagentsystem behandlar inte GPT-5.6 Luna som en fullvärdig medborgare. McAteer stötte på en hård spärr — Luna tillåts inte som delagent — och kringgick den genom att i stället deklarera Luna som en anpassad agent. Han flaggade sedan offentligt kostnaden för kringgåendet: en anpassad agent delar inte kontext med huvudagenten på samma sätt som en inbyggd delagent gör. Några dagar senare tog han bort Luna-spåret från sol-advisor helt och hållet, med hänvisning till en annan Codex-fokuserad utvecklares slutsats att Luna fungerar dåligt i delagentrollen, med antagandet att den inte har eftertränats för v2-multiagentprotokollet. Diego Haz beskrev oberoende samma vägg från andra sidan: Sol kan inte skapa Luna som delagent, så Luna måste leva i en toppnivåtråd, vilket gör koordineringen rörig.
Resolutionen, som nu är majoritetsståndpunkten, är att sluta bekämpa det:
• Ge Luna Max en egen tråd, inte en plats i subagentgrafen. Instruera Sol-orkestratorn att starta en separat toppnivåuppgift för Codex på Luna, övervaka den och hämta tillbaka resultatet. Detta är vad McAteer lade till igen i sol-advisor den 4 augusti, och vad flera andra oberoende hade kommit fram till.
• Acceptera kontextisolering som priset. En separat tråd innebär en separat historik. Det är skatten du betalar, och det är också därför överlämningen nedan spelar större roll här än i ett inbyggt subagentupplägg.
• Om du måste tvinga in den i multi-agent v2, är katalogen anledningen till att den filtreras bort. En utvecklare spårade uteslutningen till att standardmodellkatalogen markerar Luna som v1, och rapporterade en kringgående lösning: kopiera ~/.codex/models_cache.json, ställ in Lunas multi_agent_version till v2, peka model_catalog_json mot din kopia, starta om Codex, och låt sedan orkestreraren starta Luna på max med en snabb servicenivå och stäng av forkning. Betrakta detta som en persons inofficiella hack på en intern fil — det är precis den typen av sak som en Codex-uppdatering bryter.
Överlämningspaketet: fem frågor som åtgärdar det vanligaste klagomålet
Den enskilt mest rapporterade bristen hos Luna Max är att den inte följer instruktioner noggrant, särskilt när du ger den ett specifikt arbetsflöde eller en iterationsslinga att köra. Det klagomålet kommer från både utvecklare som gillar modellen och utvecklare som övergett den. Den åtgärd som utövare hela tiden hamnar i är inte en bättre prompt i bemärkelsen skrivstil; det är ett striktare kontrakt. Innan Luna-tråden börjar, svara på fem saker:
• Vilken exakt uppgift ska den här agenten slutföra? Inte arbetsområdet — det färdiga tillståndet.
• Vilka filer, dokument eller system omfattas? Uppräknade, inte underförstådda.
• Vad får det inte ändra? Gränssnitten, migreringarna, konfigurationerna och de offentliga kontrakten som inte får ändras.
• Vilka bevis visar att det är slutfört? Ett namngivet test, utdata från ett specifikt kommando, en diff som bara berör de listade filerna.
• Vilket saknat beslut bör få den att sluta? Utlösaren för att komma tillbaka snarare än att gissa — det här är det som hindrar en alltför ivrig billig modell från att uppfinna en arkitektur.
Detta är också där företagets egna råd om promptning är värda att väva in, med den beteckning de förtjänar: företaget rapporterar att i sina interna utvärderingar av kodningsagenter förbättrade mer avskalade systempromptar utvärderingsresultaten med 10–15 % samtidigt som de minskade det totala antalet tokens med 41–66 % och kostnaden med 33–67 %, och det rekommenderar att granska promptar som ärvts från GPT-5.5 eller GPT-5.4 snarare än att portera dem vidare. Det är leverantörsrapporterade siffror. Men riktningen stämmer överens med vad fältet har funnit: beskriv destinationen exakt och radera berättelsen om varje fotsteg. Notera spänningen med stycket ovan — precision kring omfattning och begränsningar är inte samma sak som mångordighet, och konsensus i communityn är att Luna Max behöver mer av det förra och mindre av det senare.
Felmoder att planera för
• Instruktionsdrift. Bekräftas av flera utvecklare: den ignorerar delar av den ursprungliga briefen, och det är värst när briefen är en procedur att följa snarare än ett resultat att uppnå.
• Långsamhet i verklig tid. Har rapporterats upprepade gånger och överensstämmer med tiden till första token på cirka 136 sekunder som Artificial Analysis uppmätte vid max ansträngning. Bra för arbete som du kan lämna igång; smärtsamt i en interaktiv loop.
• Kontextförbrukning. En utvecklare rapporterade att Luna Max gjorde slut på ett 258k Codex-trådfönster alarmerande snabbt, och misstänkte att kvotförbrukningen skjuter i höjden när Codex börjar kompaktera nära gränsen. Kompakteringsdelen är hans intryck, inte ett uppmätt resultat — men förbrukningstakten är den förväntade konsekvensen av den mångordighet som Artificial Analysis oberoende mätt. På API-sidan, håll koll på långkontextsteget: pass-through-prisschemat för den här modellen går från $0.20/$1.20 till $0.40/$1.80 när en begäran passerar ungefär 272k tokens, så en tråd som fortsätter växa blir dyrare per token, inte bara dyrare totalt.
• Allt visuellt. Detta är den skarpaste gränsen i fältrapporterna. En flitigt läst utövare, som sa upp sin Kimi K3-kodprenumeration till förmån för Luna Max, betygsatte den som lika bra som det han lämnade och mycket billigare — med ett uttryckligt undantag för frontend. En annan var brutalare: använd inte Luna för att utföra design, grafik, formatering eller presentationsarbete; uppdelningen planera-med-Sol-genomföra-med-Luna är till för steg-för-steg-instruktionsuppgifter, inte estetiska sådana.
• Underagentkatalogen. Behandlas ovan — om Luna tyst aldrig väljs i en multi-agentkörning, beror det på att den filtreras, inte att den misslyckas.
• Falsk ekonomi. Det enda feltillståndet som inte visas i något riktmärke: en session som kostade 1,20 dollar i stället för 29 dollar och producerade arbete som du skrev om för hand kostade dig 1,20 dollar plus din eftermiddag.
När man inte ska sträva efter max
Max är inte en gratis uppgradering, och den vägledning som har hållit är en stege snarare än en inställning:
• Tydliga transformationer — en omdöpning av fält, en mekanisk extraktion, en formateringsomgång. Låg eller medelhög insats på Luna. Villkora det på att ett namngivet test passerar.
• Rutinimplementering — high eller xhigh. Communityns standardinställning för en Luna-worker är xhigh, inte max, just för att max kostar tid och tokens på uppgifter som aldrig var svåra.
• Begränsat men genuint svårt — det är max faktiska jobb. Paketet måste vara både svårt och strikt specificerat för att det extra resonemanget ska omvandlas till ett bättre resultat.
• Tvetydig utredning — ändra nivån, inte vredet. Om modellen missbedömer snarare än underplanerar, kommer mer tänkande på en billigare modell inte att lösa det; det är en Sol-uppgift.
• Otydlig brief — fixa kontraktet, inte modellen. Ingen ansträngningsinställning kompenserar för ett outtalat acceptanskriterium.
En varning specifik för prenumerationer, från en tredjepartsguide och lätt att få fel: de kreditpriser Codex tar ut per modell har inte samma förhållanden som API:s listpriser, så du kan inte lyfta ett API-prisförhållande och använda det som din routingregel för prenumerationer. Rapporterade meddelandekvoter på fem timmar på Plus-nivån illustrerar poängen — ungefär 15–90 lokala meddelanden på Sol, 20–110 på Terra, 50–280 på Luna, med så breda intervall eftersom ett "meddelande" inte är en fast arbetsenhet. Om dina routingbeslut drivs av en prenumerationsgräns snarare än en faktura, mät mot gränsen.
Bortom Codex: vad mer folk riktar detta mot
Kombinationen billig-djupresonemang visar sig vara användbar utanför kodningsagenter, och här är användningsområdena med bevis:
• Webbläsaragenter. En utvecklare körde en webbläsarautomatiseringsstack på GPT-5.6 Luna för att öppna de 15 främsta inläggen på Hacker News, läsa varje länkad sida och skriva en rapport — total kostnad 3 cent. Lång horisont, låga insatser, hög tokenförbrukning: exakt den form denna modell är prissatt för.
• Färdighetskedjor. Två praktiker rapporterade oberoende av varandra att de drev en pipeline med två färdigheter — bildgenerering in i en bild-till-Three.js-konverterare — från ett enda Luna Max-mål för att få ett interaktivt low-poly 3D-objekt, och båda noterade att det knappt rörde deras veckovisa användningsräknare. Värt att läsa tillsammans med varningen "använd inte Luna för visuellt arbete": Luna orkestrerade verktyg som utförde det visuella arbetet, inte bedömde estetik själv.
• Håll en session varm. Cachad indata på den här modellen kostar 0,02 dollar per miljon tokens jämfört med 0,20 dollar för färsk indata — en 90 % rabatt som Artificial Analysis listar på sin prispanel — och cachefönstret är ungefär 30 minuter. Den praktiska innebörden som flera guider landar i oberoende av varandra: en långvarig session som kontinuerligt läser om samma kodbas är dramatiskt mycket billigare än en ny session per uppgift.
• Kvotarbitrage. Det mest långtgående påståendet i hela uppsättningen, och tydligt markerat som ett påstående: en utvecklare rapporterar att eftersom ansträngningen är nästan gratis medan nivåmultiplikatorn är stor, kunde han genom att köra med maximal ansträngning på den billiga nivån pressa 4,9 miljarder tokens genom tre veckor på en $200-plan — sexsiffrigt till API-priser — och att han har Kimi K3, Grok och DeepSeek-modeller i samma väljare bakom en lokal router så att om man når en leverantörs gräns stoppas inte arbetet. Ingen har oberoende kunnat reproducera token-siffran. Routningsvanan bakom det är dock den del som är värd att kopiera.
Att köra samma split utan en Codex-prenumeration.
Allt ovan är en prenumerationsformad berättelse: anledningen till att människor bryr sig om Luna Max är att den tänjer på ett veckotak. På API-sidan är samma arkitektur enklare att bygga och lättare att resonera kring, eftersom du betalar en faktura istället för att hantera en tilldelning — och orchestrator/worker-uppdelningen slutar vara en plugin och blir vanlig routing.
GPT-5.6 Luna finns tillgänglig via OrcaRouter för 0,20 USD per miljon input-token och 1,20 USD per miljon output-token — leverantörens listpris, vidarebefordrat med 0 % påslag, vilket är anledningen till att prissänkningen den 30 juli var live hos oss samma dag som företaget tillkännagav den i stället för en faktureringscykel senare. Det levereras via ett kompatibelt API på /v1/chat/completions och /v1/responses, så fältet reasoning-effort följer med i requestkroppen precis som det skulle vid direktanrop, och modell-ID:t är openai/gpt-5.6-luna. GPT-5.6 Sol och GPT-5.6 Terra ligger bakom samma nyckel, vilket är den del som spelar roll för det här mönstret: en orkestrerare på en nivå och en worker på en annan är två modell-ID:n i en integration, inte två leverantörsavtal. Routing-DSL:n låter dig uttrycka den uppdelningen som ett enda anrop i stället för att limma ihop trådar för hand, och automatisk failover täcker det fall som den grupp som ägnar sig åt kvotarbitrage löser med en lokal router — när en leverantör försämras hamnar begäran någon annanstans i stället för att stoppas.

Två ärliga förbehåll. Codex-specifik infrastruktur — subagentgrafen, plugin-marknadsplatsen, modellkatalogen, veckokvoten — tillhör företaget, och inget av detta följer med en API-nyckel; om mönstret du vill ha är sol-advisor i Codex-appen, vill du ha ett Codex-abonnemang. Och felsätten ovan är egenskaper hos modellen, inte hos transporten: routing ändrar vad ett anrop kostar och vad som händer när en leverantör går ner, inte om Luna följer dina instruktioner.
Vem bör kopiera detta, och vem bör inte?
Om ditt arbete är högfrekvent och mekaniskt specificerbart — refaktoreringar, testställningar, extraktion, dokumentation, analysgenomgångar av ett stort repo — sätt på max, lägg Luna i en egen tråd med en överlämning på fem frågor, håll en Sol-instans framför den för planering och bakom den för granskning, och räkna med att spendera en storleksordning mindre. De som rapporterar de största vinsterna gör alla någon variant av det, och de oberoende kostnadssiffrorna stödjer riktningen även där de inte stödjer beskrivningen "lika bra som Sol".
Om ditt arbete är utforskande, estetiskt, eller kommer som en vag brief som skärps vartefter, säger fältrapporterna tydligt att du kommer att göra av med besparingarna två gånger om på att göra om resultatet. Och om du är interaktiv – sitter där och tittar på – kommer den två minuter långa kallstarten vid maximal ansträngning att störa dig mer än priset gläder dig.
Vad man ska hålla koll på: huruvida företaget posttränar Luna för v2-subagentprotokollet. Varje besvärlig del av den nuvarande spelboken – den separata tråden, den förlorade delade kontexten, kataloghacket, hela retract-and-rewire-episoden – finns på grund av den enda luckan. Täpp igen den och den bästa versionen av det här mönstret blir flera steg enklare.
Frågor värda ett riktigt svar
Kostar maximal resoneringsansträngning mer per token än standardinställningen?
Nej, och detta är det vanligaste missförståndet kring inställningen. GPT-5.6 Luna debiterar $0,20 in och $1,20 ut per miljon tokens oavsett ansträngning. Det som max ändrar är antalet tokens som förbrukas — modellen planerar mer, kontrollerar sig själv och reviderar innan den svarar. Artificial Analysis uppmätte att denna modell genererade 130M utdatatokens i en benchmarksvit där medianmodellen genererar 61M. Så en session med max ansträngning kostar mer än en med medelansträngning för samma uppgift, enbart genom volym, och den tar också längre tid på sig att producera sin första token. Ansträngning är en ratt för tokenantal som bär en kvalitetsetikett.
Kan GPT-5.6 Luna köra som en inbyggd Codex-subagent ännu?
Från och med 5 augusti 2026, nej — och communityn har slutat försöka. Codex inbyggda subagent-sökväg accepterar inte Luna; workarounden med anpassad agent får den igång men förlorar delad kontext med huvudagenten; och utvecklaren bakom det mest kända plugin-programmet för detta mönster tog bort Luna och lade sedan tillbaka den som en separat startad toppnivåuppgift som orkestreraren övervakar. Om du ser en multi-agent-körning där Luna aldrig väljs, är det troligt att den filtreras bort eftersom standardmodellkatalogen markerar den som v1 snarare än v2, vilket en utvecklare har patchat för hand på egen risk. Detta är den enskilt mest sannolika punkten på listan att ändras med en Codex-uppdatering, så verifiera det mot din installerade version snarare än att lita på något recept, inklusive detta.
Är det tillräckligt bra för att ersätta ett Claude- eller Kimi K3-kodningsabonnemang?
Flera utvecklare har offentligt avslutat en prenumeration på 200 dollar i månaden just på grund av detta. Inlägget som förde frågan ut i ljuset kom från en immunolog som kodar dagligen: han sa upp sin Kimi K3-kodprenumeration inte för att den var dålig, utan för att han inte kunde motivera den när GPT-5.6 Luna, enligt hans erfarenhet, var lika bra för hans arbete och mycket billigare – frontend undantaget. De oberoende kostnadssiffrorna gör det svårt att avfärda fallet: på samma benchmarksvit fick Kimi K3 med max ansträngning 57 poäng för 2 437 dollar medan GPT-5.6 Luna med max fick 51 poäng för 174 dollar. Men läs invändningen innan du säger upp något. Utvecklarna som mätte matchade sessioner och fick negativa resultat testade inte en annan modell; de testade en annan typ av uppgift – öppen, visuell eller löst specificerad – och på den typen av uppgift förlorade den billigare modellen så rejält att besparingen raderades ut. Det försvarbara svaret är att Luna Max ersätter en stor del av ditt kodande arbete, inte nödvändigtvis din bästa kodande modell, och att de utövare som får ut mest av den är de som behöll en frontier-nivå i närheten för att planera och kontrollera.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
