OpenAI Taglia i Prezzi delle API di GPT-5.6: Cosa È Cambiato, Perché e Come Ottenerlo
Guides & Insights

OpenAI Taglia i Prezzi delle API di GPT-5.6: Cosa È Cambiato, Perché e Come Ottenerlo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 30 luglio 2026, OpenAI ha tagliato i prezzi API dei suoi due modelli GPT-5.6 più economici — riducendo drasticamente la fascia più conveniente e limando quella intermedia. Tre settimane dopo si è rivolta al modello di punta: il 21 agosto 2026, OpenAI ha annunciato che i prezzi API di GPT-5.6 Sol diminuiranno di oltre il 20% per i prossimi tre mesi, mentre l'azienda lavora per rendere il modello più efficiente. Questo articolo spiega esattamente cosa è cambiato in entrambe le tornate, l'ingegneria alla base, come i nuovi prezzi reggono il confronto con i concorrenti, i costi nascosti da tenere d'occhio, come ridurre ulteriormente la fattura — e come i prezzi ridotti sono già attivi su OrcaRouter con un ricarico dello 0%.

Ogni valore riportato di seguito è indicato con la relativa fonte. I prezzi sono per milione di token (input / output). Le tariffe Luna e Terra riflettono il listino prezzi di OpenAI del 30 luglio 2026, come riportato da testate tra cui Unite.AI; la riduzione Sol riflette l'annuncio di OpenAI del 21 agosto 2026, con prezzi per token come riportato da testate tra cui Runtimewire e Reuters. Le pagine del modello pass-through di OrcaRouter mostrano gli stessi numeri; le cifre dei concorrenti sono attribuite. I prezzi cambiano: verifica prima di creare.

TL;DR. Il 30 luglio OpenAI ha ridotto i prezzi di GPT-5.6 Luna a $0,20 / $1,20 (da $1 / $6, ~80% di sconto) e di GPT-5.6 Terra a $2 / $12 (da $2,50 / $15, ~20% di sconto). Il 21 agosto ha esteso lo sconto al modello di punta: i prezzi dell'API di GPT-5.6 Sol scendono di oltre il 20% per i prossimi tre mesi — a $4 / $20 per milione di token da $5 / $30, secondo OpenAI — mentre i crediti basati su token per Codex e ChatGPT Work comprano di più e l'utilizzo in abbonamento rimane invariato. Due miglioramenti in termini di efficienza hanno finanziato il taglio di luglio: kernel GPU riscritti (costo di erogazione inferiore di circa il 20%) e un modello draft ridisegnato per il speculative decoding (generazione di token più veloce del 15%+). Se instradi il traffico attraverso un endpoint indipendente dal fornitore, con markup allo 0%, come OrcaRouter, le nuove tariffe sono già attive — stesso prezzo, un'API compatibile con OpenAI, con ogni modello rivale a fianco per confrontarli e instradare il traffico tra di essi.

Punti chiave

• GPT-5.6 Luna: ora $0,20 / $1,20 per 1 milione di token, in calo rispetto a $1 / $6 — circa un taglio dell'80%.

• GPT-5.6 Terra: ora $2 / $12, in calo rispetto a $2,50 / $15 — circa un taglio del 20%.

• GPT-5.6 Sol (ammiraglia): ora $4 / $20 per i prossimi tre mesi, in calo rispetto a $5 / $30 — un taglio superiore al 20% annunciato il 21 agosto 2026.

• I crediti basati su token di Codex e ChatGPT Work comprano di più: l'input di Sol scende a 100 crediti e l'output a 500 crediti per 1M di token (da 125 / 750).

Abbonamenti invariati: Plus, Pro e Business mantengono l'utilizzo incluso, i limiti settimanali di cinque ore e le tariffe legacy dei crediti non subiscono variazioni.

• Perché: OpenAI ha presentato entrambi i round come dividendi di efficienza — kernel GPU di produzione riscritti (costo di servizio inferiore di ~20%) più una riprogettazione del modello draft con decodifica speculativa (efficienza di generazione dei token superiore al 15%), secondo il post tecnico di OpenAI del 29 luglio.

• Come ottenerlo: i tagli sono già riflessi su OrcaRouter (ricarico 0%) — Luna a $0.20 / $1.20, Sol a $4 / $20 — tramite un endpoint compatibile con OpenAI.

Cosa è cambiato esattamente?

La famiglia GPT-5.6 di OpenAI funziona come una scala a livelli: Luna (veloce, la più economica), Terra (medio) e Sol (ammiraglia). Il taglio del 30 luglio ha colpito i due livelli più economici. Secondo la tariffa riportata, GPT-5.6 Luna è scesa da $1 / $6 a $0,20 / $1,20 per milione di token in input/output — circa una riduzione dell'80% sia su input che su output — e GPT-5.6 Terra è scesa da $2,50 / $15 a $2 / $12, circa il 20%. GPT-5.6 Sol, l'ammiraglia progettata per i ragionamenti più difficili e la codifica agentica, non è stata toccata quel giorno — ma il 21 agosto 2026, OpenAI ha annunciato un taglio temporaneo anche per lei: i prezzi API scendono di oltre il 20% per i prossimi tre mesi, a $4 per milione di token in input e $20 per milione di token in output, con l'input in cache che scende da $0,50 a $0,40. Lo stesso annuncio ha precisato che i crediti acquistati rendono di più in Codex sui piani basati su token, e l'utilizzo incluso nell'abbonamento rimane invariato.

La tariffa base per token non è l'unico fattore. Il pricing di GPT-5.6 prevede anche fasce in base alla lunghezza dell'input (i contesti molto lunghi passano a una tariffa superiore), uno sconto per il caching dei prompt (l'input in cache costa molto meno di quello nuovo) e un'opzione batch (lavori asincroni con sconto). Tutti e tre si applicano anche al taglio, quindi il prezzo effettivo per un carico di lavoro che fa ampio uso di cache o batch può essere ancora più basso. Attenzione alla fascia dei contesti lunghi nella direzione opposta: fornire prompt enormi può farti salire di fascia.

Le due ottimizzazioni dietro il taglio

Non è stata una mossa da loss-leader: OpenAI l'ha presentata come un dividendo di efficienza. In un post tecnico del 29 luglio 2026, alcuni membri dello staff tecnico di OpenAI hanno descritto ottimizzazioni a livello di inferenza e di harness degli agenti alla base di Codex e ChatGPT Work. Due spiccano in particolare. La prima: riscritture dei kernel GPU su tutta l'infrastruttura di produzione — con Sol, eseguito all'interno di Codex, usato per riscrivere i kernel stessi dell'azienda — che, secondo OpenAI, hanno ridotto i costi di serving end-to-end di circa il 20%. La seconda: un modello draft di decodifica speculativa ridisegnato che, secondo quanto riferito, ha migliorato l'efficienza di generazione dei token di oltre il 15%. Il costo di serving più basso, trasferito ai clienti come prezzi ridotti sui tier ad alto volume: questa è la storia — ed è uno scorcio di un loop di feedback che l'intera industria sta inseguendo: usare i modelli di frontiera per ottimizzare l'infrastruttura stessa che li serve.

Il taglio di Sol annunciato il 21 agosto segue la stessa impostazione. Secondo OpenAI, la riduzione — oltre il 20% per i prossimi tre mesi — arriva mentre l'azienda rende il modello più efficiente da eseguire, ed è esplicitamente temporanea, non un ripristino permanente dei prezzi.

Come si confrontano i nuovi prezzi

Il taglio è mirato direttamente alla concorrenza. Secondo quanto riportato da Unite.AI, i nuovi $0,20 / $1,20 di Luna sottocostano l'Haiku 4.5 di Anthropic di circa 5x in input e circa 4x in output, e i nuovi $2 / $12 di Terra si collocano al di sotto dei prezzi standard di Claude Sonnet 5 (riportati a $3 / $15, in vigore dopo il 31 agosto 2026). Rispetto al campo open-weight, Luna ora si posiziona vicino alla soglia minima di inferenza a basso costo stabilita dalla linea V4 di DeepSeek e da GLM-5.2 di Zhipu (circa $1,20 / $4,10), con le fasce Qwen di Alibaba e Gemini Flash di Google nella stessa zona. Il taglio temporaneo di Sol a $4 / $20 mantiene il modello di punta ben al di sopra delle proprie fasce di volume, ma riduce il premio — e la riduzione di un terzo sui token di output è particolarmente rilevante per i carichi di lavoro degli agenti ad alta intensità di output. La copertura della mossa rileva che arriva mentre OpenAI affronta una concorrenza crescente da parte di Anthropic e dei modelli AI cinesi.

L'inferenza continua a diventare più economica.

Facendo un passo indietro, questo taglio si inserisce in una tendenza pluriennale: il costo di un dato livello di capacità è diminuito nettamente, generazione dopo generazione, mentre i laboratori ottengono più produttività dallo stesso hardware. I vecchi livelli di servizio di OpenAI illustrano il trend discendente nel tempo, e ogni salto di efficienza — kernel migliori, decodifica speculativa, attenzione più economica — tende a manifestarsi come un taglio di prezzo entro pochi mesi. Per gli acquirenti, l'implicazione pratica è progettare per un mondo in cui l'inferenza diventa più economica con cadenza regolare: non impegnarsi eccessivamente sul prezzo di un singolo modello e mantenere basso il costo del passaggio da uno all'altro.

Il costo nascosto da tenere d'occhio: token di ragionamento

I modelli GPT-5.6 sono modelli di ragionamento, e questo incide sulla spesa reale. Quando il ragionamento è abilitato, il modello emette token di ragionamento interni che vengono fatturati come output — quindi il costo effettivo dell'output può essere superiore a quanto suggerisce una stima ingenua basata sulle "parole nella risposta", soprattutto su prompt difficili con elevato sforzo di ragionamento. La soluzione è adattare lo sforzo di ragionamento al compito (basso o disattivato per chiamate semplici), limitare l'output dove possibile e misurare l'uso effettivo dei token invece di fare supposizioni. Una tariffa per token più economica aiuta, ma controllare quanti token si generano aiuta di più.

Cosa significa per gli sviluppatori

Se usi GPT-5.6 Luna o Terra per lavoro ad alto volume — classificazione, estrazione, routing, agenti leggeri, chat — la tua fattura è appena calata, in alcuni casi di quasi tutto il suo valore, senza alcuna modifica al codice. Questo rende i livelli di volume ancora più interessanti per i carichi di lavoro sensibili ai costi e riduce il divario di prezzo rispetto ai modelli open economici. I conti del modello di punta sono cambiati, almeno per ora: Sol a $4 / $20 per i prossimi tre mesi riduce il costo del lavoro ad alta intensità di ragionamento e degli agenti sul livello superiore, e i crediti token-based di Codex e ChatGPT Work rendono di più. È ancora una scelta premium per i compiti più difficili — solo più conveniente di prima. Il modello vincente è lo stesso: instrada in base alla difficoltà — livelli economici (o modelli open economici) per il facile 80%, il modello di punta solo dove ripaga il suo costo.

Come tagliare ulteriormente la tua bolletta

La riduzione del prezzo è una base su cui costruire, non il traguardo. Le leve aggiuntive più importanti: la cache dei prompt (riutilizza un system prompt stabile o un contesto lungo e paga la tariffa di input in cache molto più bassa); l'opzione batch (esegui i lavori non urgenti in modalità asincrona con uno sconto); il routing per tier e modello (invia ogni richiesta al modello più economico in grado di gestirla, inclusi i modelli open); e il controllo del ragionamento (non pagare per un ragionamento approfondito su chiamate banali). Se combinate, queste leve riducono di routine le bollette reali molto più di qualsiasi singola modifica tariffaria. Come riferimento concreto: con 10 milioni di token al mese e una quota di input del 70%, le nuove tariffe di Luna ammontano a circa 5 dollari al mese (circa 4,37 dollari con la cache); lo stesso volume su Sol costa circa 125 dollari al mese — l'argomento più chiaro per il routing in base alla difficoltà.

Come catturare immediatamente i prezzi più bassi.

Ecco la parte che tiene tutto insieme. OrcaRouter applica un markup dello 0% e trasmette direttamente i prezzi dei fornitori, quindi i tagli di OpenAI sono già attivi su OrcaRouter: GPT-5.6 Luna mostra $0.20 / $1.20, Terra $2 / $12 e GPT-5.6 Sol $4 / $20 sulle pagine dei modelli in questo momento — le stesse tariffe della scheda di OpenAI, raggiungibili tramite un unico endpoint compatibile con OpenAI insieme ad altri 185+ modelli. Ottieni i tagli senza migrazione e puoi confrontare i prezzi di Sol, Luna e Terra con DeepSeek, GLM, Qwen, Gemini e Claude in un unico posto, poi instradare ogni richiesta verso ciò che è più conveniente per il compito. C'è anche un piano gratuito e una pagina Offers per ulteriori risparmi.

Le riduzioni sono già attive su OrcaRouter: GPT-5.6 Luna a $0.20 / $1.20 e GPT-5.6 Sol a $4 / $20 per 1M token, applicati con margine dello 0%.

Scegli il percorso in base alla difficoltà per risparmiare ancora di più

La bolletta più economica non è un unico modello — è il modello giusto per ogni richiesta. Poiché OrcaRouter espone l'intero campo tramite un unico endpoint, puoi inviare chiamate facili e ad alto volume a Luna o a un modello open economico e riservare Sol o un altro modello di punta per quelle difficili, passando da un modello all'altro con un cambio di configurazione invece che con una re-integrazione. Un taglio di prezzo su Luna rende quella strategia di instradamento per difficoltà ancora più conveniente, e lo sconto temporaneo su Sol riduce anche il costo delle chiamate difficili — senza che tu debba ricollegare nulla.

Domande frequenti

Di quanto ha ridotto OpenAI i prezzi di GPT-5.6?

GPT-5.6 Luna è scesa da $1 / $6 a $0,20 / $1,20 per milione di token (circa l'80%), e GPT-5.6 Terra da $2,50 / $15 a $2 / $12 (circa il 20%). Il 21 agosto 2026, OpenAI ha anche ridotto GPT-5.6 Sol da $5 / $30 a $4 / $20 per i prossimi tre mesi.

Quando è entrato in vigore il taglio dei prezzi?

I tagli Luna e Terra sono entrati in vigore il 30 luglio 2026, pubblicati sulla tariffa ufficiale. OpenAI ha annunciato la riduzione temporanea di Sol il 21 agosto 2026, per i prossimi tre mesi.

Perché OpenAI ha abbassato i prezzi?

OpenAI attribuisce il taglio di luglio a ottimizzazioni dell'inferenza — kernel GPU di produzione riscritti (costo di servizio inferiore di circa il 20%) e un modello draft per il speculative decoding ridisegnato (efficienza di generazione dei token superiore del 15%) — secondo un post tecnico del 29 luglio 2026. Ha presentato il taglio di Sol allo stesso modo, come un passo compiuto mentre il modello diventa più economico da eseguire, in un mercato con concorrenza crescente.

Il modello di punta (Sol) è diventato più economico?

Sì — temporaneamente. Il taglio del 30 luglio ha lasciato GPT-5.6 Sol a $5 / $30, ma il 21 agosto 2026 OpenAI ha annunciato una riduzione dei prezzi di oltre il 20% per i prossimi tre mesi, portandoli a $4 / $20 per milione di token. Anche i crediti basati su token di Codex e ChatGPT Work comprano di più, mentre l'utilizzo in abbonamento rimane invariato.

Come si confrontano i nuovi prezzi con quelli di Anthropic e dei modelli open?

Per la reportistica, Luna ora sottoprezza l'Haiku 4.5 di Anthropic di circa 5x in input / 4x in output, e Terra scende sotto il prezzo standard di Claude Sonnet 5 ($3 / $15). Luna si colloca inoltre vicino al limite minimo di prezzo dei modelli open source economici stabilito da DeepSeek e GLM-5.2.

Qual è il trucco con i token di ragionamento?

I modelli GPT-5.6 sono modelli di ragionamento; i token di ragionamento interni vengono fatturati come output, quindi il costo effettivo dell'output può superare una stima approssimativa. Calibra lo sforzo di ragionamento e limita l'output per controllarlo.

Come posso ottenere i nuovi prezzi più bassi?

Sono già disponibili sull'API di OpenAI e, con un ricarico dello 0%, su OrcaRouter — dove GPT-5.6 Luna mostra $0.20 / $1.20 e GPT-5.6 Sol $4 / $20 — tramite un endpoint compatibile con OpenAI, senza dover modificare il codice.

Il risultato finale

Il taglio del 30 luglio di OpenAI ha reso GPT-5.6 Luna e Terra drasticamente più economici per il lavoro ad alto volume, e l'annuncio del 21 agosto estende la storia al modello di punta: GPT-5.6 Sol scende a $4 / $20 per i prossimi tre mesi, mentre i crediti token di Codex acquistano di più e l'utilizzo in abbonamento rimane invariato. Entrambi i round sono dividendi di efficienza — riscritture del kernel e guadagni di decodifica speculativa da un lato, serving più economico da eseguire dall'altro — e una chiara risposta a una vera guerra dei prezzi. Instrada in base alla difficoltà, sfrutta caching e batching e controlla i token di ragionamento per risparmiare al massimo. E poiché OrcaRouter trasmette i prezzi dei fornitori con un margine dello 0%, le tariffe più basse sono già attive lì — Luna a $0.20 / $1.20, Sol a $4 / $20 — stesso prezzo, un endpoint compatibile con OpenAI, tutto il panorama dei modelli in un unico posto. Sfrutta i tagli senza cambiare una riga di codice e lascia che ogni richiesta scelga il modello più economico in grado di fare il lavoro.