
GPT-6 Luna vs GPT-5.6 Luna: lo stesso nome, metà del prezzo e un risultato peggiore
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Due modelli, una parola in comune, e un punteggio indipendente che è praticamente identico. GPT-6 Luna raggiunge 37.26 sull'Artificial Analysis Intelligence Index; GPT-5.6 Luna ha raggiunto 37.32. Una differenza di 0.07 punti non è una misurazione, è rumore, ed è il fatto più importante in assoluto di questo confronto. Ciò che separa i due modelli non è la capacità — è $0.0681 per attività completata dell'indice contro $0.1783, e una serie di regressioni nel lavoro intellettuale che il taglio di prezzo non menziona.
Le date contano per interpretare i numeri. GPT-5.6 Luna è stato rilasciato il 9 luglio 2026 a $0,20 per milione di token di input e $1,20 per milione di output. GPT-6 Luna è stato rilasciato il 22 settembre 2026 a $0,10 e $0,50 — esattamente la metà della tariffa di input e il 58% in meno sulla tariffa di output, che OpenAI ha descritto come permanente anziché promozionale. Si tratta di un taglio reale, ed è anche la metà più piccola della storia. La metà più grande è che il modello più recente è un modello diverso, non lo stesso modello con un prezzo rivisto.

Cosa si guadagna davvero con una migrazione, in numeri
Confronta i due sulle dimensioni che decidono una migrazione e il quadro è disomogeneo. Alcune righe migliorano, altre peggiorano, e una migliora notevolmente.
• Prezzo — GPT-6 Luna $0,10 in input / $0,50 in output per milione di token rispetto a GPT-5.6 Luna $0,20 / $1,20. Metà sull'input, 58% in meno sull'output.
• Input in cache — $0,01 per milione contro $0,02. Lo stesso sconto del 90% su una base dimezzata, quindi un prefisso ripetuto costa la metà di quanto costava a luglio.
• Costo per attività completata — 0,0681 $ contro 0,1783 $ sulla stessa suite. Una riduzione del 62%, superiore al taglio del prezzo dei token perché il mix di attività non è identico.
• Token di output per attività — 50.537 contro 41.235. Il nuovo modello è più verboso del 23% per ogni lavoro completato, e il 78% del suo output è ragionamento che non compare mai nella risposta.
• Finestra di contesto — 1,050,000 token contro 1,000,000. Lo stesso tetto pratico; entrambi limitano l'output a 128,000 token.
• Astensione — un tasso di allucinazione del 76,7% su AA-Omniscience contro il 92,6%. Questo è il miglioramento singolo più ampio del set, e non è un guadagno di conoscenza: l'accuratezza passa dal 42,7% al 43,8%, sostanzialmente invariata. Il modello più recente si astiene invece di inventare, il che è un cambiamento comportamentale più che di capacità.
• Deliverable del lavoro intellettuale — AA-Briefcase v1.1 scende da 1.345,38 Elo a 1.299,23, e GDPval-AA v2.1 scende da 1.443,14 a 1.367,09. Entrambi in calo, di circa 46 e 76 punti.
• Lavoro di codifica e a lungo termine — Terminal-Bench 4.0 passa dall'11,6% al 12,6% e SciCode dal 53,6% al 54,6%, le due righe qui che aumentano. Di contro, il Coding Agent Index scende da 43 a 41 e le valutazioni agentiche in stile SWE si muovono allo stesso modo.
• AutomationBench-AA — 53,2% rispetto a 50,2%. In aumento, e più di qualsiasi altra misura agentica del set.

La regressione è nell'artefatto, non nel ragionamento
Lo schema in quelle ultime due righe merita un nome, perché è l'intera decisione. Il nuovo modello è migliore nelle azioni agentiche a singolo passo e peggiore nel riconsegnare un documento finito. Artificial Analysis attribuisce il calo nel lavoro basato sulla conoscenza alla qualità della presentazione e a deliverable che hanno saltato elementi obbligatori della rubrica, piuttosto che a fallimenti fattuali o di ragionamento — che è esattamente il tipo di regressione che supera uno smoke test e fallisce una revisione.
Metti insieme i due fatti e la migrazione si divide nettamente in base a ciò che consuma l'output. Se la tua pipeline legge output strutturati — JSON, una classificazione, un campo estratto, una decisione di routing — la regressione nella presentazione non ti costa nulla, il miglioramento nell'astensione è un guadagno reale, e la riduzione del 62% dei costi del task si realizza pienamente. Se è una persona a leggere il deliverable — un report, un memo, un documento per il cliente — il modello più recente è misurabilmente peggiore proprio nella cosa per cui stai pagando, e il risparmio ti sta comprando un revisore.
Il numero di astensioni merita lo stesso trattamento. Un modello che passa dall'inventare sul 93% di ciò che non sa all'inventare sul 77% è un oggetto sostanzialmente diverso per una guardrail, uno screening di conformità o qualsiasi pipeline in cui una risposta sbagliata ma sicura si propaga. Questo miglioramento è reale, è misurato in modo indipendente ed è l'argomento più forte per spostare il lavoro sul nuovo modello che non dipende affatto dal prezzo.
Cosa cambia nel tuo codice, e cosa no
Meno di quanto lascerebbe intendere un taglio di prezzo di questa portata, il che è la buona notizia. La finestra di contesto è della stessa classe, l'output massimo è identico a 128.000 token e la clausola di riprezzamento per il contesto lungo della famiglia è invariata: le richieste superiori a 272.000 token di input vengono fatturate a 2x le tariffe di input e cache e a 1,5x l'output, per l'intera richiesta anziché per la porzione oltre la soglia. Una richiesta che era costosa a 300.000 token su GPT-5.6 Luna è costosa anche su GPT-6 Luna — metà tariffa, stesso salto, quindi un carico di lavoro che avrebbe dovuto essere suddiviso a luglio dovrebbe ancora essere suddiviso ora.
La scala dei livelli di effort è il punto in cui cambia il comportamento, non il costo. GPT-6 Luna espone i livelli none, low, medium (il valore predefinito), high, xhigh e max, e il valore predefinito conta: una pipeline tarata sull'effort predefinito di un modello non è automaticamente tarata su quello di un altro. I team che hanno fissato esplicitamente un'impostazione non ne risentono. I team che hanno lasciato il valore predefinito stanno usando una configurazione diversa da quella che avevano a luglio, e il sintomo visibile sarà il volume di token, non la qualità.
Una trappola merita di essere ribadita perché non scompare con il nuovo modello. Sull'endpoint Chat Completions, la chiamata di funzioni funziona solo quando il reasoning effort è impostato su none; ogni altro livello di effort, e ogni strumento integrato, richiede l'API Responses. Un team che esegue il porting di un ciclo di tool calling cambiando la stringa del modello scoprirà che i suoi strumenti sono silenziosamente non disponibili con l'effort medium predefinito, e la soluzione è riscrivere la superficie di chiamata anziché un parametro.
Cosa puoi instradare oggi, e cosa non puoi
Questa è la parte della migrazione che non ha nulla a che vedere con i benchmark. GPT-5.6 Luna è su OrcaRouter al suo prezzo di listino — 0,20 $ per milione di token in input, 1,20 $ per milione in output, una finestra di contesto di 1.000.000 di token, un output massimo di 128.000 token e un tempo p50 al primo token di 1,60 secondi misurato sul traffico live nella nostra pagina del modello. Applichiamo i prezzi di listino dei provider senza alcun ricarico, così il giorno in cui OpenAI ha riprezzato questa famiglia la modifica era già attiva dalla nostra parte, anziché al ciclo di fatturazione successivo.

GPT-6 Luna non è instradabile tramite OrcaRouter a partire dal 23 settembre 2026. La disponibilità è data dall'API di OpenAI stessa e dai cataloghi cloud che includono questa famiglia, e noi non elenchiamo un modello che non possiamo servire. La conseguenza pratica è che un team che pianifica questa migrazione può spostare oggi la tariffazione e non può spostare oggi il routing — le due metà del cambiamento avvengono in date diverse.
Ciò che questo rende possibile nel frattempo è l'assetto che la maggior parte dei team finirà comunque per volere. Mantieni GPT-5.6 Luna sui percorsi in cui il risultato finale è il prodotto, usa GPT-6 Luna ovunque l'output venga consumato dal codice, e considera il confine come un livello anziché una riscrittura. Poiché i modelli a cui puoi accedere stanno dietro un unico endpoint con oltre 200 modelli sulla stessa chiave e failover automatico tra provider, aggiungere o rimuovere un livello è una voce di configurazione anziché una seconda integrazione — e il percorso di escalation smette di dipendere dalla disponibilità di un singolo modello.
La decisione sulla migrazione, detta chiaramente
Sposta il lavoro dove l'output viene letto dalla macchina e la condizione di successo è verificabile. Classificazione, estrazione, decisioni di routing, chiamate ai guardrail, passaggi di trasformazione in blocco e azioni degli agenti a passo singolo rientrano tutti: il composito resta invariato, il comportamento di astensione è sostanzialmente migliore e il costo del task è diminuito di circa il 62%. Con Batch a metà delle tariffe standard e l'input in cache a un decimo di una base dimezzata, una pipeline che a luglio era marginale ora può essere conveniente.
Non spostare il lavoro in cui una persona approva l'artefatto e non spostare alla cieca i percorsi degli agenti di codifica. Un calo di 46 punti in AA-Briefcase e un calo di 76 punti in GDPval sono numeri piccoli che indicano la stessa direzione di un calo di due punti nel Coding Agent Index, e la modalità di errore descritta da Artificial Analysis — elementi della rubrica saltati, presentazione più debole — è invisibile a un controllo automatizzato. Mantieni il modello precedente dove la rifinitura è il risultato finale.
E considerate il pareggio di 0,07 punti nell'indice per quello che è: un dato. Non è un modello più intelligente a un prezzo inferiore. È un modello di forma diversa a un prezzo inferiore, e la domanda a cui deve rispondere un piano di migrazione è quale forma consuma il tuo carico di lavoro — non quale punteggio sia più alto, perché sul record indipendente quei due punteggi sono lo stesso numero.
