GPT-5.6 Luna Max-1
Guides & Insights

GPT-5.6 Luna Max: come lo usano davvero gli sviluppatori in Codex — e dove si rompe

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 1° agosto un file di configurazione di quattro righe ha iniziato a circolare su X. Crea un agente Codex chiamato luna_worker, imposta il suo modello su gpt-5.6-luna, imposta il suo sforzo di ragionamento su max, e gli affida la metà noiosa del tuo lavoro mentre GPT-5.6 Sol mantiene il piano. Nel giro di pochi giorni la stessa ricetta è stata ripubblicata in inglese, cinese, giapponese, coreano, spagnolo e arabo, e un plugin basato sulla stessa idea ha superato 1.300 stelle GitHub in quattro giorni. Ed è anche, più o meno il giorno in cui è diventato virale, il modo sbagliato di collegarlo: l'autore di quel plugin ha rimosso GPT-5.6 Luna dal proprio progetto nel giro di 48 ore, pubblicamente, perché un collega gli ha detto che non funziona come subagente Codex — poi l'ha rimesso due giorni dopo, collegato in modo completamente diverso.

Quell'intera vicenda si è svolta in una settimana, ed è la cosa più utile che qualcuno abbia mai pubblicato su questo modello. Ti dice che il pattern del lavoratore a basso costo è reale, che il modo ovvio di collegarlo è quello sbagliato, e che la differenza tra i due costituisce la maggior parte del valore. Tutto ciò che in questo articolo riguarda la tecnica proviene da professionisti che hanno pubblicato i propri risultati tra il 30 luglio e il 5 agosto 2026 — non dalla documentazione dell'azienda, che descrive GPT-5.6 Luna come un modello per "carichi di lavoro sensibili ai costi e ad alto volume" e non dice nulla di tutto ciò. Quando un numero è misurato da una terza parte indipendente, lo diciamo; quando è il log di sessione di uno sviluppatore, lo diciamo anche quello, compreso quando si contraddicono a vicenda. E lo fanno, spesso.

Cos'è "Luna Max" e perché la maggior parte delle persone non la vede mai.

Non esiste un modello chiamato Luna Max. Ci sono due selettori, e Luna Max è una loro combinazione: il livello più economico della famiglia GPT-5.6, eseguito con l'impostazione di ragionamento più profonda. Il selettore del livello sceglie tra GPT-5.6 Sol, GPT-5.6 Terra e GPT-5.6 Luna. Il selettore dello sforzo ha sei posizioni — none, low, medium, high, xhigh e max — e determina quanto il modello pensa prima di rispondere.

Quasi nessuno combinava il livello economico con l'impostazione profonda, per un motivo banale: max è nascosto per impostazione predefinita. Nell'app desktop ChatGPT/Codex si trova in Settings → Configuration → Available reasoning efforts, dove l'elenco viene fornito con l'opzione in alto non selezionata. Sei sviluppatori diversi hanno pubblicato la stessa correzione in tre clic nella prima settimana di agosto, il che è un buon indicatore di quante persone avevano usato Luna alla profondità predefinita, giudicando il modello su quella base. Sul lato API non c'è alcun interruttore da cercare: passi l'ID del modello gpt-5.6-luna e imposti reasoning effort su max nel corpo della richiesta, e questa è l'intera modifica.

Una conseguenza che vale la pena interiorizzare prima di leggere qualsiasi benchmark: quando Artificial Analysis pubblica un punteggio di intelligenza per questo modello, la pagina è intitolata GPT-5.6 Luna (max). Il numero indipendente che tutti citano per Luna è la configurazione a massimo sforzo. Se hai usato la configurazione predefinita e ti stai chiedendo perché la tua esperienza non corrisponde alla classifica, è per questo.

La manopola che nessuno spiega: l'effort cambia il numero di token, non il prezzo dei token

Aumentare lo sforzo di ragionamento non ti sposta in una fascia di prezzo più alta. GPT-5.6 Luna costa $0.20 per milione di token di input e $1.20 per milione di token di output a ogni livello di sforzo. Ciò che cambia è quanti token il modello spende per arrivare a una risposta — e al massimo, ne spende molti.

Artificial Analysis ha misurato questo mentre eseguiva il suo Intelligence Index, e i numeri sono la più chiara conferma indipendente di ciò di cui i professionisti si lamentavano:

Punteggio — 51 sull'Artificial Analysis Intelligence Index, contro una mediana di 17 per i modelli che valuta in quella classe.

Verbosità — 130M token di output generati durante l'esecuzione dell'indice, rispetto a una mediana di 61M. Artificial Analysis segnala il modello come "molto verboso."

Velocità grezza — 182,5 token di output al secondo, 16° su 163 modelli. Veloce per token.

Tempo al primo token — circa 136 secondi al massimo sforzo, che Artificial Analysis nota essere all'estremità superiore anche per i modelli di ragionamento in quella fascia di prezzo.

Spesa totale — $174.06 per valutare il modello sull'intero indice.

Leggi insieme la terza e la quarta riga, perché quella coppia è l'intera esperienza utente. Luna al massimo genera token rapidamente, ma impiega minuti per avviarsi, e poi produce circa il doppio dei token rispetto a un modello tipico sullo stesso lavoro. È per questo che il reclamo più comune nei report sul campo non è "è sbagliato", ma "è lento" — ed è per questo che il prezzo economico non si traduce in una sessione proporzionalmente economica. Stai comprando una tariffa bassa su un numero elevato di token.

Per contrasto: nella nostra pagina del modello per GPT-5.6 Luna, il tempo mediano osservato per il primo token su sette giorni di traffico reale è di 1,78 secondi, con un 95° percentile di 9,26 secondi. Non è una contraddizione del dato di 136 secondi: è lo stesso modello misurato su una combinazione di impostazioni di sforzo, la maggior parte delle quali non è al massimo. La latenza che ottieni è una proprietà della manopola che imposti, non dell'endpoint che chiami.

GPT-5.6 Luna Max-2

Luna Max è davvero "Sol Medium a un sesto del costo"?

Questa è l'affermazione che ha fatto diventare virale lo schema, e proviene da Dan McAteer, che l'ha formulata come Luna con ragionamento massimo che si assesta intorno a GPT-5.6, Sol a intensità media, o Claude Opus 5 a intensità media, per circa un sesto del costo. È stata ripetuta da molti account, a volte senza le attenuazioni, e vale la pena distinguere ciò che è misurato da ciò che sono sensazioni.

Il quadro di valutazione indipendente sostiene con enfasi la parte relativa ai costi dell'affermazione e solo parzialmente quella relativa alle capacità. Eseguendo la stessa suite di benchmark al massimo sforzo su diversi livelli, Artificial Analysis ha registrato Luna con indice 51 per 174 dollari, Terra con 55 per 1.403 dollari, Kimi K3 con 57 per 2.437 dollari e Sol con 59 per 2.824 dollari. Luna cede otto punti di indice a Sol e costa circa un sedicesimo per eseguire lo stesso lavoro.

GPT-5.6 Luna Max-3

Il punteggio indipendente si è inasprito il 13 agosto, quando DeepSWE ha rilasciato la v1.1 — una revisione del suo benchmark di ingegneria a lungo orizzonte che mantiene 113 compiti originali tratti da 91 repository in cinque linguaggi, ma ora valuta ogni correzione eseguendo il diff committato in un container isolato, che è più difficile da aggirare. Nella classifica aggiornata, tutti e tre i livelli di GPT-5.6 al massimo sforzo si attestano dove li aveva posizionati il resoconto di luglio: Luna Max al 67.2% di pass@1 e $0.61 per compito, Terra Max intorno al 70%, Sol Max al 73% per $8.39 — sei punti percentuali di tasso di successo per circa quattordici volte il denaro.

Il confronto che merita un secondo sguardo sta sotto Luna, non sopra. Claude Sonnet 5 Max ottiene il 54% sugli stessi 113 compiti — circa tredici punti dietro Luna Max — a 26,40 $ per compito, cioè circa 44 volte quanto Luna ha pagato per la stessa soluzione. Luna Max supera anche Gemini 3.7 Flash (65% per la configurazione ad alto sforzo sulla stessa classifica); il post della community che ha segnalato questo round colloca il divario da Gemini 3.7 Flash Medium a circa 1,7 punti. DeepSWE è l'harness indipendente di Datacurve, non una valutazione aziendale — l'affermazione della stessa azienda secondo cui la famiglia GPT-5.6 ha stabilito risultati all'avanguardia su Terminal-Bench 2.1 e DeepSWE rimane una dichiarazione separata riportata dal fornitore.

Poi c'è l'evidenza sul campo, che è davvero contrastante. Pawel Huryn ha eseguito il suo benchmark di correzione dei bug — 105 bug iniettati in due codebase reali, valutazione alla cieca, un round per modello — e ha riportato che Luna a sforzo massimo ha corretto 33 bug per 1,80 $, contro i 24 di Claude Fable 5 per 68 $. Nella direzione opposta, Diego Haz ha trascorso due giorni eseguendo sessioni abbinate e si è espresso contro il pattern: Luna ha avuto un costo medio di 1,20 $ a sessione, contro i 29 $ di Sol, ma ha dovuto rifare la maggior parte dell'output di Luna e non ha ottenuto nulla di rilasciabile per i suoi casi d'uso, il che rende il risparmio un'illusione piuttosto che uno sconto. Un altro sviluppatore che ha usato lo stesso harness ha riportato che Sol a sforzo medio produceva un risultato chiaramente migliore di Luna a sforzo massimo in circa la metà del tempo. Un bake-off in lingua cinese su un singolo task di scena 3D ha quantificato quella tendenza: Sol Medium ha terminato in 21m30s con il punteggio di qualità più alto e il minor numero di token; Luna Max ha impiegato 40m55s, bruciando circa 130k token, ha ottenuto il punteggio di qualità più basso e ha utilizzato metà della quota settimanale dell'abbonamento.

Il riassunto onesto della posizione della community dopo una settimana: Luna Max non è Sol Medium. Costa molto meno di Sol Medium ed è peggiore, e se questo scambio sia vantaggioso dipende interamente dal fatto che il compito sia specificato in modo abbastanza preciso da far sì che "peggiore" non abbia importanza.Il che è esattamente ciò a cui servono gli schemi di cablaggio qui sotto.

Il modello che è sopravvissuto al contatto: Sol pianifica, Luna implementa, un nuovo Sol revisiona

Nessuno che abbia continuato a usare Luna Max lo sta usando come agente di codifica generico. La configurazione che funziona, sulla quale i professionisti hanno convergito in ogni versione, ha quattro ruoli:

Orchestrator — GPT-5.6 Sol ad alto impegno, rimanendo nel thread principale. È responsabile di requisiti, architettura, scomposizione dei compiti e accettazione finale. Non scrive il codice.

Implementatore di routine — GPT-5.6 Luna al massimo sforzo, su lavoro delimitato e completamente specificato: refactoring meccanici, scrittura di test, analisi dei moduli, passate di documentazione, il tipo di attività in cui la destinazione è inequivocabile.

Implementatore avanzato — GPT-5.6 Terra al massimo sforzo, per build con molto contesto dove la deriva delle istruzioni di Luna diventa costosa.

Revisore — un'istanza GPT-5.6 Sol fresca, in sola lettura, che vede il diff finale e nient'altro. Il punto di "fresca" è che un revisore che porta con sé il contesto dell'implementazione tende ad approvare il proprio ragionamento.

L'implementazione di riferimento è sol-advisor, un plugin Codex con licenza MIT di Dan McAteer che ha raggiunto circa 1.400 stelle nella sua prima settimana. Puoi installarlo tramite il marketplace dei plugin di Codex aggiungendo il DannyMac180/sol-advisor repository e quindi aggiungendo il sol-advisor plugin. La sua struttura attuale è istruttiva: la corsia nativa fissa un implementatore Terra/High seguito da un nuovo revisore Sol/High, mentre Luna al massimo è una corsia opt-in esplicita che viene eseguita come attività separata visibile all'utente, con la sessione Sol primaria che rivede e accetta direttamente il lavoro di quest'ultima invece di instradarlo attraverso il revisore nativo.

Se preferisci non installare nulla, la versione minimale ampiamente copiata è una definizione di agente personalizzata in ~/.codex/agents/luna-worker.toml con due impostazioni — model = "gpt-5.6-luna" e model_reasoning_effort = "max" — più una descrizione e istruzioni che lo limitano al lavoro delegato con confini chiari, gli impediscono di modificare l'obiettivo complessivo o di ampliare il proprio ambito, e rimandano le decisioni architetturali e i requisiti ambigui all'agente principale. Il consiglio che circola è di far scrivere a Sol questo file, validarlo rispetto alla versione di Codex installata e mostrarti la diff prima di accettarlo: un approccio sensato, sia che tu ti fidi della ricetta, sia che no.

La trappola del subagent, e la soluzione su cui la comunità ha convergito

È qui che la versione virale di questo modello e la versione funzionante si separano.

Il sistema nativo di subagent di Codex non tratta GPT-5.6 Luna come un cittadino di prima classe. McAteer si è scontrato con un blocco duro — Luna non è consentita come subagent — e lo ha aggirato dichiarandola come agente personalizzato, poi ha segnalato pubblicamente il costo di quel workaround: un agente personalizzato non condivide il contesto con l'agente principale come fa un subagent nativo. Giorni dopo rimosse la corsia Luna da sol-advisor del tutto, citando la scoperta di un altro sviluppatore focalizzato su Codex secondo cui Luna si comporta male nel ruolo di subagent, con la presunzione che non sia stata post-addestrata per il protocollo multi-agente v2. Diego Haz ha descritto indipendentemente lo stesso muro dall'altro lato: Sol non può creare Luna come subagent, quindi Luna deve vivere in un thread di primo livello, il che rende la coordinazione complicata.

La soluzione, che ora è la posizione di maggioranza, è di smettere di combatterla:

Assegna a Luna Max un thread dedicato, non uno slot nel grafo dei subagent. Istruisci l'orchestratore Sol ad avviare un task Codex di primo livello separato su Luna, monitorarlo e recuperare il risultato. Questo è ciò che McAteer ha reinserito in sol-advisor il 4 agosto, e ciò a cui diversi altri erano arrivati in modo indipendente.

Accetta l'isolamento del contesto come prezzo. Un thread separato significa una cronologia separata. Questa è la tassa che paghi, ed è anche il motivo per cui il passaggio di consegne qui sotto è più importante che in una configurazione con subagent nativi.

Se devi forzarla nel multi-agent v2, il catalogo è il motivo per cui viene filtrata. Uno sviluppatore ha ricondotto l’esclusione al catalogo dei modelli standard che contrassegna Luna come v1, e ha riportato una soluzione alternativa: copia ~/.codex/models_cache.json, imposta per Luna la multi_agent_version a v2, punta model_catalog_json alla tua copia, riavvia Codex, poi fai avviare Luna al massimo con un tier di servizio veloce e disattiva il forking. Tratta questo come un hack non ufficiale di una persona su un file interno — è esattamente il tipo di cosa che un aggiornamento di Codex rompe.

Il pacchetto di consegna: cinque domande che risolvono il reclamo più comune

Il fallimento più segnalato di Luna Max è che non segue le istruzioni in modo rigoroso, soprattutto quando gli affidi un flusso di lavoro specifico o un ciclo di iterazione da eseguire. Questo reclamo emerge sia da sviluppatori a cui il modello piace, sia da sviluppatori che lo hanno abbandonato. La mitigazione su cui i professionisti continuano a convergere non è un prompt migliore in senso stilistico; è un contratto più rigoroso. Prima che inizi il thread su Luna, rispondi a cinque cose:

Qual è il compito esatto che questo agente dovrebbe portare a termine? Non l'ambito di lavoro — lo stato finale.

Quali file, documenti o sistemi rientrano nell'ambito? Enumerati, non impliciti.

Cosa non deve cambiare? Le interfacce, le migrazioni, le configurazioni e i contratti pubblici che sono vietati.

Quali prove dimostrano il completamento? Un test nominato, l'output di un comando specifico, un diff che tocca solo i file elencati.

Quale decisione mancante dovrebbe fermarlo?L'innesco per tornare indietro piuttosto che indovinare — questo è ciò che impedisce a un modello economico troppo zelante di inventare un'architettura.

È anche qui che vale la pena integrare le indicazioni di prompting della stessa azienda, con l'etichetta che meritano: l'azienda riferisce che nelle sue valutazioni interne degli agenti di codifica, prompt di sistema più snelli hanno migliorato i punteggi di valutazione del 10–15%, riducendo i token totali del 41–66% e i costi del 33–67%, e consiglia di sottoporre a audit i prompt ereditati da GPT-5.5 o GPT-5.4 piuttosto che trasferirli in avanti. Si tratta di numeri dichiarati dal fornitore. Ma la direzione coincide con ciò che il settore ha riscontrato: descrivi con precisione la destinazione ed elimina la narrazione di ogni singolo passo. Da notare la tensione con il paragrafo precedente — la precisione su ambito e vincoli non è la stessa cosa della verbosità, e il consenso della comunità è che Luna Max abbia bisogno di più della prima e meno della seconda.

Modalità di guasto di cui tenere conto

Deriva delle istruzioni. Confermato da più sviluppatori: ignora parti del brief iniziale, ed è al peggio quando il brief è una procedura da seguire piuttosto che un risultato da raggiungere.

Lentezza del tempo reale. Ripetutamente segnalata e coerente con i ~136 secondi di tempo al primo token misurati da Artificial Analysis con il massimo sforzo. Adatta per lavori che puoi lasciare in esecuzione; dolorosa in un ciclo interattivo.

Consumo del contesto.Uno sviluppatore ha segnalato che Luna Max consuma una finestra di thread Codex da 258k a una velocità allarmante, e ha sospettato che il consumo di quota subisca un picco quando Codex inizia a compattare vicino al limite. La parte della compattazione è una sua impressione, non un risultato misurato — ma il tasso di consumo è la conseguenza attesa della verbosità che Artificial Analysis ha misurato in modo indipendente. Sul lato API, fai attenzione allo scaglione del contesto lungo: il listino prezzi pass-through per questo modello passa da $0.20/$1.20 a $0.40/$1.80 quando una richiesta supera all'incirca 272k token, quindi un thread che continua a crescere diventa più costoso per token, non solo più costoso in totale.

Qualsiasi cosa visiva. Questo è il confine più netto nei report di campo. Un professionista molto letto, cancellando un abbonamento di codifica Kimi K3 a favore di Luna Max, lo ha giudicato buono quanto ciò che stava abbandonando e molto più economico — con un’eccezione esplicita per il frontend. Un altro è stato più diretto: non usare Luna per eseguire lavori di design, grafica, formattazione o slide; la suddivisione pianifica-con-Sol-esegui-con-Luna è per attività didattiche passo-passo, non per quelle estetiche.

Il catalogo dei sottoagenti.Già trattato sopra — se Luna non viene mai selezionata silenziosamente in un'esecuzione multi-agente, viene filtrata, non fallisce.

Falsa economia. L'unica modalità di errore che non compare in nessun benchmark: una sessione costata $1.20 invece di $29 e che ha prodotto un lavoro che hai riscritto a mano ti è costata $1.20 più il tuo pomeriggio.

Quando non puntare al massimo

Max non è un aggiornamento gratuito, e l'indicazione che ha retto è una scala piuttosto che un'impostazione:

Trasformazioni semplici — una rinomina di campo, un'estrazione meccanica, una passata di formattazione. Impegno basso o medio su Luna. Subordinalo al superamento di un test nominato.

Implementazione di routine — high o xhigh. Il default della community per un worker Luna è xhigh, non max, proprio perché max costa tempo e token su compiti che non sono mai stati difficili.

Delimitato ma genuinamente difficile — questo è il vero lavoro di max. Il pacchetto deve essere sia difficile che specificato rigorosamente affinché il ragionamento extra si traduca in un risultato migliore.

Indagine ambigua — cambia il livello, non la manopola. Se il modello sbaglia la valutazione piuttosto che pianificare troppo poco, ragionare di più su un modello più economico non lo risolverà; è un compito per Sol.

Brief vago — correggi il contratto, non il modello. Nessun livello di sforzo compensa un criterio di accettazione non dichiarato.

Un avvertimento specifico per gli abbonamenti, tratto da una guida di terze parti e facile da sbagliare: i tassi di credito che Codex addebita per modello non hanno gli stessi rapporti dei prezzi dell'API, quindi non puoi prendere un rapporto di prezzo dell'API e usarlo come regola di instradamento per l'abbonamento. I limiti di messaggi su cinque ore riportati per il livello Plus illustrano il punto: circa 15–90 messaggi locali su Sol, 20–110 su Terra, 50–280 su Luna, con un intervallo così ampio perché un "messaggio" non è un'unità di lavoro fissa. Se le tue decisioni di instradamento sono guidate da un tetto di abbonamento piuttosto che da una fattura, misura in base al tetto.

Oltre Codex: a cos'altro lo stanno puntando le persone?

La combinazione cheap-deep-reasoning si rivela utile al di fuori degli agenti di codifica, e questi sono gli usi con prove:

Agenti browser. Un sviluppatore ha eseguito uno stack di automazione browser su GPT-5.6 Luna per aprire i primi 15 post di Hacker News, leggere ogni pagina collegata e scrivere un report — costo totale, 3 centesimi. Orizzonte lungo, rischi bassi, token elevati: esattamente la forma per cui questo modello è prezzato.

Catene di skill. Due professionisti hanno riferito indipendentemente di aver fatto girare una pipeline a due skill — generazione di immagini in un convertitore da immagine a Three.js — a partire da un singolo obiettivo di Luna Max per ottenere un oggetto 3D low-poly interattivo; entrambi hanno notato che il contatore di utilizzo settimanale si era mosso a malapena. Vale la pena leggerlo insieme all'avvertimento «non usare Luna per il lavoro visivo»: Luna orchestrava gli strumenti che svolgevano il lavoro visivo, non giudicava l'estetica in sé.

Mantenere calda una sessione.L'input in cache su questo modello costa $0,02 per milione di token contro $0,20 per input fresco — uno sconto del 90% che Artificial Analysis elenca nel suo pannello dei prezzi — e la finestra di cache è di circa 30 minuti. L'implicazione pratica su cui diverse guide convergono in modo indipendente: una sessione di lunga durata che continua a rileggere lo stesso codebase è drasticamente più economica di una sessione nuova per ogni attività.

Arbitraggio di quota. L'affermazione più aggressiva dell'intero set, e chiaramente etichettata come affermazione: uno sviluppatore riferisce che, poiché lo sforzo è quasi a costo zero mentre il moltiplicatore di livello è elevato, eseguire lo sforzo massimo sul livello economico gli ha permesso di processare 4,9 miliardi di token nell'arco di tre settimane con un piano da 200 dollari — sei cifre alle tariffe API — e che tiene i modelli Kimi K3, Grok e DeepSeek nello stesso selettore dietro un router locale, in modo che il raggiungimento del limite di un fornitore non blocchi il lavoro. Nessuno ha riprodotto in modo indipendente la cifra dei token. L'abitudine di routing che ne sta alla base, però, è la parte che vale la pena copiare.

Eseguire lo stesso split senza un abbonamento a Codex

Tutto quanto sopra è una storia a forma di abbonamento: il motivo per cui le persone si interessano a Luna Max è che estende un limite settimanale. Sul lato API, la stessa architettura è più semplice da costruire e più facile da comprendere, perché si paga una fattura invece di gestire una quota — e la separazione orchestrator/worker smette di essere un plugin e diventa un normale routing.

GPT-5.6 Luna è disponibile tramite OrcaRouter a $0,20 per milione di token in input e $1,20 per milione di token in output — il prezzo di listino del provider, trasmesso con un ricarico dello 0%, il che spiega perché il taglio del 30 luglio è stato attivo dalla nostra parte il giorno stesso in cui l'azienda lo ha annunciato, invece che nel ciclo di fatturazione successivo. È servito tramite un'API compatibile su /v1/chat/completions e /v1/responses, quindi il campo reasoning-effort viaggia nel corpo della richiesta esattamente come avverrebbe in una chiamata diretta, e l'ID del modello è openai/gpt-5.6-luna. GPT-5.6 Sol e GPT-5.6 Terra sono accessibili tramite la stessa chiave, ed è proprio questo l'aspetto che conta per questo pattern: un orchestrator su un livello e un worker su un altro sono due ID di modello in un'unica integrazione, non due contratti con vendor diversi. Il DSL di routing permette di esprimere questa suddivisione come una singola chiamata, invece di incollare insieme i thread a mano, e il failover automatico copre il caso che chi fa arbitraggio di quote risolve con un router locale — quando un provider degrada, la richiesta finisce da un'altra parte invece di fermarsi.

GPT-5.6 Luna Max-4

Due oneste avvertenze. I meccanismi specifici di Codex — il grafo dei subagent, il marketplace dei plugin, il catalogo dei modelli, il credito settimanale — appartengono all'azienda, e nessuno di essi viene fornito con una chiave API; se il pattern che vuoi è sol-advisor nell'app Codex, ti serve un abbonamento a Codex. E le modalità di errore sopra descritte sono proprietà del modello, non del trasporto: il routing cambia quanto costa una chiamata e cosa succede quando un provider va giù, non se Luna segue le tue istruzioni.

Chi dovrebbe copiare questo, e chi no.

Se il tuo lavoro è ad alto volume e meccanicamente specificabile — refactoring, scaffolding di test, estrazione, documentazione, passate di analisi su un grande repository — spingi al massimo, metti Luna in un thread dedicato con un passaggio di consegne di cinque domande, tieni un'istanza di Sol davanti per la pianificazione e dietro per la revisione, e aspettati di spendere un ordine di grandezza in meno. Le persone che riportano i risultati migliori stanno tutte facendo una qualche versione di questo, e i dati sui costi indipendenti confermano la direzione anche dove non confermano l'inquadramento "brava quanto Sol".

Se il tuo lavoro è esplorativo, estetico, o arriva come un brief vago che diventa più nitido man mano che procedi, i report sul campo dicono chiaramente che spenderai i risparmi due volte per rifare l'output. E se sei interattivo — seduto lì a guardarlo — l'avvio a freddo di due minuti al massimo sforzo ti darà più fastidio di quanto il prezzo ti faccia piacere.

Cosa tenere d'occhio: se l'azienda sottopone Luna a post-addestramento per il protocollo subagent v2. Ogni parte scomoda del playbook attuale — il thread separato, il contesto condiviso perso, l'hack del catalogo, l'intero episodio di retract-and-rewire — esiste a causa di quell'unica lacuna. Colmala e la versione migliore di questo pattern diventa più semplice di diversi passaggi.

Domande che meritano una risposta vera

Il massimo sforzo di ragionamento costa di più per token rispetto al default?

No, e questo è il malinteso più comune riguardo a questa impostazione. GPT-5.6 Luna addebita $0.20 in ingresso e $1.20 in uscita per milione di token, indipendentemente dallo sforzo. Ciò che "max" cambia è il numero di token spesi: il modello pianifica di più, si controlla e rivede prima di rispondere. Artificial Analysis ha misurato questo modello emettendo 130 milioni di token di output su una suite di benchmark in cui il modello mediano ne emette 61 milioni. Quindi una sessione con sforzo massimo costa più di una con sforzo medio sullo stesso compito, interamente a causa del volume, e impiega anche più tempo a produrre il primo token. Lo sforzo è una manopola sul conteggio dei token travestita da etichetta di qualità.

GPT-5.6 Luna può già funzionare come subagente nativo di Codex?

Al 5 agosto 2026, no — e la community ha smesso di provarci. Il percorso nativo dei sottoagenti di Codex non accetta Luna; la soluzione alternativa con agente personalizzato lo fa girare ma perde il contesto condiviso con l'agente principale; e lo sviluppatore dietro al plugin più noto per questo schema ha rimosso Luna, per poi riaggiungerlo come attività di livello superiore avviata separatamente, che l'orchestratore monitora. Se vedi un'esecuzione multi-agente in cui Luna non viene mai selezionato, è probabile che venga filtrato perché il catalogo di modelli standard lo classifica come v1 piuttosto che v2, cosa che uno sviluppatore ha corretto a mano a proprio rischio. Questa è la voce dell'elenco con la maggiore probabilità di cambiare con un aggiornamento di Codex, quindi verificala rispetto alla tua versione installata piuttosto che fidarti di qualsiasi ricetta, inclusa questa.

È abbastanza buono da sostituire un abbonamento di coding come Claude o Kimi K3?

Diversi sviluppatori hanno pubblicamente cancellato un piano da 200$ al mese proprio per questo. Il post che ha portato la questione allo scoperto è venuto da un immunologo che programma ogni giorno: ha abbandonato il suo abbonamento di coding Kimi K3 non perché fosse scarso, ma perché non poteva giustificarlo quando GPT-5.6 Luna, nella sua esperienza, era altrettanto valido per il suo lavoro e molto più economico — frontend a parte. Le cifre di costo indipendenti rendono difficile ignorare la questione: sulla stessa suite di benchmark, Kimi K3 con massimo sforzo ha ottenuto 57 per 2.437$, mentre GPT-5.6 Luna con massimo ha ottenuto 51 per 174$. Ma leggete il dissenso prima di cancellare qualunque cosa. Gli sviluppatori che hanno misurato sessioni abbinate e hanno ottenuto risultati negativi non stavano testando un modello diverso; stavano testando un tipo diverso di compito — aperto, visivo o vagamente specificato — e su quel tipo di compito il modello più economico ha perso in modo così netto da cancellare il risparmio. La risposta difendibile è che Luna Max sostituisce una gran parte del tuo lavoro di coding, non necessariamente il tuo miglior modello di coding, e che i professionisti che ne traggono il massimo beneficio sono quelli che hanno tenuto un livello frontier per pianificare e verificare.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube