
GPT-5.6 Luna: cosa ha cambiato davvero il taglio di prezzo dell'80% di OpenAI
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
GPT-5.6 Luna è stato più economico dell'80% rispetto al suo prezzo di lancio da fine luglio, e OpenAI ha iniziato a trattarlo come un argomento piuttosto che come uno sconto. Il modello — il livello veloce e a basso costo della famiglia GPT-5.6 — è diventato disponibile a livello generale il 9 luglio 2026 a 1,00 $ per milione di token in input e 6,00 $ per milione in output. Oggi viene fatturato a 0,20 $ e 1,20 $. Il 9 settembre, la direttrice finanziaria di OpenAI, Sarah Friar, ha dichiarato alla conferenza Communacopia di Goldman Sachs che il taglio ha prodotto un aumento dell'utilizzo di circa dieci volte e che distribuire Luna costa meno che eseguire GLM 5.3 di Z.ai su uno strato cloud.
Quest'ultima affermazione è di OpenAI stessa, pronunciata da un dirigente a una conferenza per investitori, e merita lo stesso trattamento di qualsiasi altro dato di un fornitore: vale la pena riportarlo, vale la pena verificarlo, non vale la pena ripeterlo come fatto assodato. Il prezzo in sé è una questione diversa. È pubblico, e non è tornato indietro.
Cosa è effettivamente cambiato, e quando
A settembre non è cambiato nulla delle capacità, della finestra di contesto o della disponibilità di GPT-5.6 Luna. Quello che è cambiato è come OpenAI lo sta vendendo, e dietro questa svolta ci sono cinque date.
• 26 giugno 2026 — OpenAI ha annunciato la famiglia GPT-5.6 (GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna) in anteprima limitata per un piccolo gruppo di partner, a seguito del coordinamento con le agenzie governative statunitensi.
• 9 luglio 2026 — disponibilità generale. Sol, Terra e Luna hanno raggiunto l'API rispettivamente a $5/$30, $2,50/$15 e $1/$6 per milione di token di input/output.
• Fine luglio 2026 — il taglio dell'80% solo su Luna, a $0,20 in entrata e $1,20 in uscita. Le letture dell'input in cache usufruiscono di uno sconto di circa il 90%. Oltre la soglia di contesto lungo la tariffa raddoppia all'incirca, arrivando a circa $0,40/$1,80.
• 6–7 agosto 2026 — Luna ha sostituito GPT-5.5 Instant come modello predefinito per ChatGPT Free e Go, con chat testuali illimitate e un pulsante "Think" per un ragionamento più approfondito in arrivo la settimana successiva. La valutazione interna di OpenAI ha stimato che il tasso di risposte di Luna contenenti almeno un errore fattuale è circa il 62% inferiore a GPT-5.5 Instant su prompt finanziari, medici e legali — una cifra riportata dal fornitore, non indipendente.
• 9 settembre 2026 — le dichiarazioni di Friar, che per la prima volta hanno reso pubblici i numeri sull'effetto del taglio: un utilizzo circa 10 volte superiore, i ricavi enterprise in aumento del 32% da giugno a luglio rispetto a una crescita annualizzata complessiva del 20%, e Codex a 25 milioni di utenti.
Lette insieme, quelle date descrivono una conversione di due mesi di un livello economico in una strategia di volume. Luna era da sempre il livello destinato ad assorbire lavoro ad alto volume e bassa complessità — classificazione, estrazione, routing, bozze iniziali. Il taglio ha reso l'aritmetica dietro quel posizionamento molto più difficile da contestare.
Il numero che conta più del prezzo del token

I prezzi di listino sono il punto in cui la maggior parte dei confronti si ferma, e nel caso di Luna la favoriscono. A 0,20 $/1,20 $ è più economico di Claude Haiku 4.5 di Anthhropic — la cosa più vicina a un concorrente diretto — di circa 5 volte sull'input e 4 volte sull'output.
Artificial Analysis misura qualcosa di meno comodo: il costo per attività completata dell'Intelligence Index, che tiene conto di quanti token un modello consuma effettivamente per portare a termine lo stesso lavoro. Sull'indice attuale, la configurazione di ragionamento di GPT-5.6 Luna si attesta su 0,18 $ per attività. Claude Haiku 4.5, nella sua configurazione di ragionamento, arriva a 0,21 $.
Si tratta di un divario di circa il 14%, non di 5 volte. Il motivo è la verbosità. Completare quel set di valutazione ha richiesto a Luna circa 150 milioni di token di output, contro i 78 milioni di Haiku. Luna ragiona a lungo, e i token di output vengono fatturati a sei volte la tariffa dei token di input.
L'interpretazione pratica si divide nettamente. Per il lavoro a output breve e ad alto volume — classificazione, tagging, estrazione, instradamento delle richieste, bozze di primo passaggio — il taglio dell'80% è reale, consistente e si vede direttamente in fattura. Per il lavoro in cui il modello ragiona prima di rispondere, una quota sostanziale dello sconto viene consumata da token di output aggiuntivi. Entrambe le affermazioni sono vere contemporaneamente, e la seconda è la parte che la copertura del taglio ha lasciato fuori.
Vale anche la pena sapere cosa dice l'indice riguardo alle capacità, perché i livelli non sono vicini. Artificial Analysis attualmente assegna a GPT-5.6 Luna un punteggio di 38, quarto su 177 modelli della sua classe. La configurazione di ragionamento di Claude Haiku 4.5 ottiene 18, 138º su 200. Due avvertenze su questi numeri. Primo, l'indice è stato rivalutato a settembre 2026, quindi le cifre risalenti al momento del lancio — inclusi il 51 e il 52 che ancora circolano per Luna — sono citate da una scala ritirata. Secondo, Artificial Analysis ha adottato GPT-5.6 Luna come unico valutatore per diverse delle proprie valutazioni, cosa da tenere presente quando si leggono i suoi punteggi.
Perché OpenAI sostiene questa tesi ora
Un taglio dell'80% annunciato a fine luglio non aveva bisogno che una CFO lo rimettesse in discussione a settembre. Il fatto che l'abbia fatto ti dice a cosa serviva quel taglio.
I modelli cinesi open-weight hanno passato il 2026 a insistere esattamente sull'asse che Luna occupa: qualità adeguata a un prezzo che rende la contabilità per token il fattore decisivo. Battere quel prezzo su un deployment cloud è un'affermazione più difficile da sostenere che batterlo sui pesi, ed è l'affermazione che OpenAI ha scelto — nominando specificamente GLM 5.3 invece di accennare in generale a "modelli aperti".
I numeri enterprise che Friar vi ha abbinato puntano nella stessa direzione. Un fatturato enterprise che cresce del 32% mese su mese contro il 20% complessivo è l'aspetto di un'azienda che vende a chi ha cicli di procurement, e i cicli di procurement sono il luogo in cui una voce di spesa viene messa in discussione. Ha anche confermato che OpenAI sta sperimentando un modello di prezzo basato sui risultati, legando le tariffe ai risultati di business anziché al consumo di token. È un'ammissione significativa per un'azienda il cui intero modello di ricavi è sempre stato per token: suggerisce che nella fascia economica del mercato il numero per token stia diventando un argomento di vendita più debole di ciò che il modello porta a termine.
Niente di tutto ciò rende verificato il confronto con GLM. L'affermazione di Friar si basa su un confronto di deployment cloud che OpenAI non ha pubblicato nel dettaglio, e "più economico che eseguire X da soli su uno strato cloud" dipende interamente da quale cloud, quale istanza e quale ipotesi di utilizzo si sceglie. Trattala come un'affermazione posizionata da una parte interessata, e verificala rispetto al tuo carico di lavoro prima che cambi qualcosa di ciò che costruisci.
Cosa cambia se già instradi tra i modelli

Qui contano tre cose più del prezzo di copertina.
I tagli di prezzo entrano in vigore il giorno stesso in cui vengono annunciati. OrcaRouter trasferisce il prezzo di listino del provider con markup 0%, quindi quando un fornitore modifica una tariffa, la tariffa dalla nostra parte si muove di conseguenza — nessun ticket di assistenza, nessun contratto da rinegoziare, nessun secondo rapporto di fatturazione. È proprio questo il motivo per cui vale la pena scrivere del taglio di luglio invece di limitarsi a segnalarlo: per chiunque chiami Luna tramite un'unica API per oltre 200 modelli, era attivo lo stesso giorno.
L'alias è una trappola. L'identificatore senza suffisso gpt-5.6 viene risolto verso il tier di punta Sol, non verso Luna, quindi qualsiasi integrazione che voglia l'economia di Luna deve fissare esplicitamente gpt-5.6-luna. Questo è documentato nelle guide per sviluppatori della famiglia ed è ancora uno dei modi più comuni in cui una migrazione verso un "tier economico" finisce per fatturare silenziosamente alle tariffe del tier di punta.
I tier economici gestiscono bene il failover. Un modello a questo prezzo spesso svolge un lavoro in cui un breve 503 è costoso: migliaia di chiamate di classificazione, non un'unica completion importante. Instradare la stessa richiesta su più provider di GPT-5.6 Luna con failover automatico è la differenza tra una coda di tentativi e un'interruzione del servizio, ed è la funzionalità che rende sicuro inserire un tier a basso costo in un percorso di produzione.
Puoi vedere la tariffa attuale e i valori p50/p95 del tempo al primo token sulla pagina GPT-5.6 Luna su OrcaRouter — vale la pena darci un'occhiata, perché le pagine dei prezzi dei fornitori sono in ritardo rispetto ai ribassi e i tracker di terze parti sono in ritardo rispetto a entrambi.
Cosa guardare dopo
Tre cose la trasformerebbero da una storia sui prezzi in una storia diversa.
Un ulteriore taglio. All'inizio di settembre, la copertura finanziaria in lingua cinese ha descritto OpenAI come in procinto di adeguare nuovamente i prezzi per affrontare la concorrenza open-weight. Quel resoconto è prospettico e non confermato, ma è coerente con un'azienda che ha già accettato una riduzione dell'80% sul proprio livello di volume e ora sta discutendo pubblicamente del costo per implementazione.
Il pricing basato sui risultati sta diventando realtà. Se OpenAI inizia a vendere Luna in base al risultato aziendale anziché al token, il confronto per token su cui si basa l'intero mercato smette di essere il tabellone di riferimento — e ogni stima del costo per attività, comprese quelle sopra, deve essere ricalcolata da capo.
Un successore capace allo stesso prezzo. GPT-6 Astra esiste già al di sopra della linea GPT-5.6, e la posizione stessa di Luna dipende dal fatto che OpenAI la lasci dov'è. Nel momento in cui arriva un tier piccolo più recente a $0.20/$1.20, la domanda interessante smette di essere se Luna sia economica e diventa se sia ancora la cosa più economica verso cui valga la pena instradare.

Per ora la situazione è insolitamente semplice. GPT-5.6 Luna è un modello di due mesi il cui prezzo, non la sua capacità, è la notizia — e il prezzo per token è il modo più lusinghiero di guardarlo, non il più accurato.
