OpenAI Taglia i Prezzi delle API di GPT-5.6: Cosa È Cambiato, Perché e Come Ottenerlo
Guides & Insights

OpenAI Taglia i Prezzi delle API di GPT-5.6: Cosa È Cambiato, Perché e Come Ottenerlo

Autore

jinhao song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 30 luglio 2026, OpenAI ha ridotto i prezzi API dei suoi due modelli GPT-5.6 di costo inferiore — tagliando nettamente il livello più economico e riducendo quello intermedio, mentre ha lasciato invariato il suo modello di punta. È una mossa notevole in una guerra dei prezzi sempre più intensa, ed è entrata subito in vigore nella tariffa pubblicata. Questo articolo spiega esattamente cosa è cambiato, l'ingegneria che c'è dietro, come i nuovi prezzi si confrontano con quelli della concorrenza, i costi nascosti a cui prestare attenzione, come ridurre ulteriormente la tua bolletta — e come i prezzi più bassi sono già attivi su OrcaRouter con ricarico 0%.

Ogni valore riportato di seguito è indicato con la propria fonte. I prezzi sono per milione di token (input / output) e riflettono la tariffa di OpenAI del 30 luglio 2026, come riportato da testate tra cui Unite.AI, oltre alle pagine dei modelli pass-through di OrcaRouter; i valori dei concorrenti sono attribuiti alle rispettive fonti. I prezzi cambiano: verifica prima di sviluppare.

TL;DR. OpenAI ha portato GPT-5.6 Luna a $0,20 / $1,20 (da $1 / $6, ~80% di sconto) e GPT-5.6 Terra a $2 / $12 (da $2,50 / $15, ~20% di sconto), mentre GPT-5.6 Sol resta a $5 / $30. Il taglio è stato reso possibile da due miglioramenti in efficienza: kernel GPU riscritti (costi di servizio inferiori di circa il 20%) e un modello di draft per la decodifica speculativa ridisegnato (generazione di token più veloce del 15%+). Il ribasso porta Luna sotto Haiku 4.5 di Anthropic e verso il pavimento di prezzo dei modelli open economici fissato da DeepSeek e GLM. Se instradi il traffico tramite un endpoint neutrale rispetto ai vendor e con margine 0% come OrcaRouter, le nuove tariffe sono già attive — stesso prezzo, un'API compatibile OpenAI, con tutti i modelli rivali a fianco per confrontarli e instradare il traffico tra di loro.

Punti chiave

• GPT-5.6 Luna: ora $0,20 / $1,20 per 1 milione di token, in calo rispetto a $1 / $6 — circa un taglio dell'80%.

• GPT-5.6 Terra: ora $2 / $12, in calo rispetto a $2,50 / $15 — circa un taglio del 20%.

• GPT-5.6 Sol (ammiraglia): invariato a $5 / $30.

• Perché: kernel GPU di produzione riscritti (~20% di costo di servizio in meno) più una riprogettazione del modello draft con decodifica speculativa (15%+ di efficienza nella generazione dei token), secondo il post tecnico di OpenAI del 29 luglio.

• Come ottenerlo: la commissione è già riflessa su OrcaRouter (ricarico 0%) — Luna a $0.20 / $1.20 — tramite un endpoint compatibile con OpenAI.

Cosa è cambiato esattamente?

La famiglia GPT-5.6 di OpenAI funziona come una scaletta a livelli: Luna (veloce, più economica), Terra (intermedia) e Sol (ammiraglia). Il taglio del 30 luglio ha colpito i due livelli più economici. Secondo il listino prezzi riportato, GPT-5.6 Luna è passata da $1 / $6 a $0,20 / $1,20 per milione di token in input/output — circa una riduzione dell'80% sia su input che su output — e GPT-5.6 Terra è scesa da $2,50 / $15 a $2 / $12, circa il 20%. GPT-5.6 Sol, l'ammiraglia progettata per il ragionamento più complesso e la codifica agentica, è rimasta ferma a $5 / $30. I livelli volumetrici sono diventati drasticamente più economici; il livello massimo non si è mosso.

La tariffa base per token non è l'unico fattore. Il pricing di GPT-5.6 prevede anche fasce in base alla lunghezza dell'input (i contesti molto lunghi passano a una tariffa superiore), uno sconto per il caching dei prompt (l'input in cache costa molto meno di quello nuovo) e un'opzione batch (lavori asincroni con sconto). Tutti e tre si applicano anche al taglio, quindi il prezzo effettivo per un carico di lavoro che fa ampio uso di cache o batch può essere ancora più basso. Attenzione alla fascia dei contesti lunghi nella direzione opposta: fornire prompt enormi può farti salire di fascia.

Le due ottimizzazioni dietro il taglio

Non è stata una mossa da loss-leader: OpenAI l'ha presentata come un dividendo di efficienza. In un post tecnico del 29 luglio 2026, alcuni membri dello staff tecnico di OpenAI hanno descritto ottimizzazioni a livello di inferenza e di harness degli agenti alla base di Codex e ChatGPT Work. Due spiccano in particolare. La prima: riscritture dei kernel GPU su tutta l'infrastruttura di produzione — con Sol, eseguito all'interno di Codex, usato per riscrivere i kernel stessi dell'azienda — che, secondo OpenAI, hanno ridotto i costi di serving end-to-end di circa il 20%. La seconda: un modello draft di decodifica speculativa ridisegnato che, secondo quanto riferito, ha migliorato l'efficienza di generazione dei token di oltre il 15%. Il costo di serving più basso, trasferito ai clienti come prezzi ridotti sui tier ad alto volume: questa è la storia — ed è uno scorcio di un loop di feedback che l'intera industria sta inseguendo: usare i modelli di frontiera per ottimizzare l'infrastruttura stessa che li serve.

Come si confrontano i nuovi prezzi

Il taglio è mirato direttamente alla concorrenza.{{1}} Secondo il report di Unite.AI, i nuovi prezzi di Luna a $0,20 / $1,20 sottocostano Haiku 4.5 di Anthropic di circa 5x in input e circa 4x in output, e i nuovi $2 / $12 di Terra si collocano al di sotto della tariffa standard di Claude Sonnet 5 (riportata a $3 / $15, in vigore dopo il 31 agosto 2026).{{/1}} {{2}}Rispetto al campo dei modelli open-weight, Luna ora si trova vicino al livello minimo di inference a basso costo stabilito dalla linea V4 di DeepSeek e da GLM-5.2 di Zhipu (circa $1,20 / $4,10), con i tier Qwen di Alibaba e Gemini Flash di Google nella stessa fascia.{{/2}} {{3}}In altre parole, OpenAI ha spostato le sue fasce di volume verso il basso, fino a dove vivono già i modelli capaci più economici — riducendo il sovrapprezzo per chi sceglie un modello proprietario rispetto a uno open.{{/3}}

L'inferenza continua a diventare più economica.

Facendo un passo indietro, questo taglio si inserisce in una tendenza pluriennale: il costo di un dato livello di capacità è diminuito nettamente, generazione dopo generazione, mentre i laboratori ottengono più produttività dallo stesso hardware. I vecchi livelli di servizio di OpenAI illustrano il trend discendente nel tempo, e ogni salto di efficienza — kernel migliori, decodifica speculativa, attenzione più economica — tende a manifestarsi come un taglio di prezzo entro pochi mesi. Per gli acquirenti, l'implicazione pratica è progettare per un mondo in cui l'inferenza diventa più economica con cadenza regolare: non impegnarsi eccessivamente sul prezzo di un singolo modello e mantenere basso il costo del passaggio da uno all'altro.

Il costo nascosto da tenere d'occhio: token di ragionamento

I modelli GPT-5.6 sono modelli di ragionamento, e questo incide sulla spesa reale. Quando il ragionamento è abilitato, il modello emette token di ragionamento interni che vengono fatturati come output — quindi il costo effettivo dell'output può essere superiore a quanto suggerisce una stima ingenua basata sulle "parole nella risposta", soprattutto su prompt difficili con elevato sforzo di ragionamento. La soluzione è adattare lo sforzo di ragionamento al compito (basso o disattivato per chiamate semplici), limitare l'output dove possibile e misurare l'uso effettivo dei token invece di fare supposizioni. Una tariffa per token più economica aiuta, ma controllare quanti token si generano aiuta di più.

Cosa significa per gli sviluppatori

Se usi GPT-5.6 Luna o Terra per lavori ad alto volume — classificazione, estrazione, instradamento, agenti leggeri, chat — la tua bolletta è appena scesa, in alcuni casi quasi del tutto, senza richiedere modifiche al codice. Questo rende i livelli di volume ancora più interessanti per i carichi di lavoro sensibili ai costi e riduce il divario di prezzo rispetto ai modelli open economici. La matematica del modello di punta è invariata: Sol a $5 / $30 rimane una scelta premium per i compiti più difficili. Lo schema vincente è instradare in base alla difficoltà — livelli economici (o modelli open economici) per il facile 80%, il modello di punta solo dove giustifica il suo costo.

Come tagliare ulteriormente la tua bolletta

La riduzione del prezzo è una base su cui costruire, non il traguardo. Le leve aggiuntive più importanti: la cache dei prompt (riutilizza un system prompt stabile o un contesto lungo e paga la tariffa di input in cache molto più bassa); l'opzione batch (esegui i lavori non urgenti in modalità asincrona con uno sconto); il routing per tier e modello (invia ogni richiesta al modello più economico in grado di gestirla, inclusi i modelli open); e il controllo del ragionamento (non pagare per un ragionamento approfondito su chiamate banali). Se combinate, queste leve riducono di routine le bollette reali molto più di qualsiasi singola modifica tariffaria. Come riferimento concreto: con 10 milioni di token al mese e una quota di input del 70%, le nuove tariffe di Luna ammontano a circa 5 dollari al mese (circa 4,37 dollari con la cache); lo stesso volume su Sol costa circa 125 dollari al mese — l'argomento più chiaro per il routing in base alla difficoltà.

Come catturare immediatamente i prezzi più bassi.

Ecco la parte che tiene tutto insieme. a href="https://www.orcarouter.ai/">OrcaRouter/a> applica un ricarico dello 0% e trasmette i prezzi dei provider direttamente, quindi la tariffa di OpenAI è già disponibile su OrcaRouter: GPT-5.6 Luna mostra $0,20 / $1,20 e Terra $2 / $12 nelle pagine dei modelli in questo momento — le stesse tariffe del listino di OpenAI, raggiungibili tramite un singolo endpoint compatibile con OpenAI insieme ad altri 185+ modelli. Ottieni queste tariffe senza migrazione e puoi confrontare i prezzi di Luna e Terra con DeepSeek, GLM, Qwen, Gemini e Claude in un unico posto, per poi instradare ogni richiesta verso la soluzione più conveniente per il compito. C'è anche un piano gratuito e una pagina Offerte per risparmi aggiuntivi.

Il taglio è già attivo su OrcaRouter: GPT-5.6 Luna a $0,20 / $1,20 per 1M di token, passato con markup allo 0%.

Scegli il percorso in base alla difficoltà per risparmiare ancora di più

Il conto più basso non è un unico modello — è il modello giusto per ogni richiesta. Poiché OrcaRouter espone l'intera gamma tramite un unico endpoint, puoi inviare chiamate semplici e ad alto volume a Luna o a un modello open economico e riservare Sol o un altro modello di punta per quelle difficili, passando da uno all'altro con un cambio di configurazione invece che con una re-integrazione. Un taglio di prezzo su Luna rende quella strategia di instradamento per difficoltà ancora più conveniente, senza che tu debba rifare alcun collegamento.

Domande frequenti

Di quanto ha ridotto OpenAI i prezzi di GPT-5.6?

Il prezzo di GPT-5.6 Luna è sceso da $1 / $6 a $0,20 / $1,20 per milione di token (circa l'80%), mentre quello di GPT-5.6 Terra da $2,50 / $15 a $2 / $12 (circa il 20%). Il prezzo di GPT-5.6 Sol è rimasto a $5 / $30.

Quando è entrato in vigore il taglio dei prezzi?

30 luglio 2026, registrato nel changelog dell'API di OpenAI e attivo sulla scheda tariffaria pubblicata.

Perché OpenAI ha abbassato i prezzi?

OpenAI lo attribuisce a ottimizzazioni di inferenza — kernel GPU di produzione riscritti (costo di servizio inferiore di circa il 20%) e un modello draft di decodifica speculativa ridisegnato (efficienza di generazione dei token superiore al 15%) — secondo un post di ingegneria del 29 luglio 2026.

Il modello di punta (Sol) è diventato più economico?

No. GPT-5.6 Sol rimane a $5 / $30 per milione di token. Solo i due livelli più economici, Luna e Terra, sono stati tagliati.

Come si confrontano i nuovi prezzi con quelli di Anthropic e dei modelli open?

Per la reportistica, Luna ora sottoprezza l'Haiku 4.5 di Anthropic di circa 5x in input / 4x in output, e Terra scende sotto il prezzo standard di Claude Sonnet 5 ($3 / $15). Luna si colloca inoltre vicino al limite minimo di prezzo dei modelli open source economici stabilito da DeepSeek e GLM-5.2.

Qual è il trucco con i token di ragionamento?

I modelli GPT-5.6 sono modelli di ragionamento; i token di ragionamento interni vengono fatturati come output, quindi il costo effettivo dell'output può superare una stima approssimativa. Calibra lo sforzo di ragionamento e limita l'output per controllarlo.

Come posso ottenere i nuovi prezzi più bassi?

Sono già live sull'API di OpenAI e, con un ricarico dello 0%, su OrcaRouter — dove GPT-5.6 Luna mostra $0.20 / $1.20 — tramite un unico endpoint compatibile con OpenAI, senza bisogno di modificare il codice.

Il risultato finale

Il taglio del 30 luglio di OpenAI rende GPT-5.6 Luna e Terra drammaticamente più economici per lavori ad alto volume: un dividendo di efficienza derivante da riscritture del kernel e dai guadagni della decodifica speculativa, oltre a una chiara risposta a una vera guerra dei prezzi che ora scende sotto le fasce economiche di Anthropic e si avvicina al minimo dei modelli open. Il Sol di punta rimane invariato, quindi instrada in base alla difficoltà, fai leva su caching e batching e controlla i token di ragionamento per risparmiare al massimo. E poiché OrcaRouter trasmette i prezzi dei provider con un ricarico dello 0%, le tariffe ridotte sono già attive lì: stesso prezzo, un endpoint compatibile con OpenAI, l'intero panorama di modelli in un unico posto. Approfitta del taglio senza cambiare una riga di codice e lascia che ogni richiesta scelga il modello più economico in grado di svolgere il lavoro.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube