
GPT-6 vs GPT-6 Luna: dieci centesimi per un milione di token, e il tier che risponde al piano gratuito
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Esiste una versione di questo confronto in cui la risposta è una riga: non puoi chiamare GPT-6, e puoi chiamare GPT-6 Luna a dieci centesimi per milione di token di input. Ma la versione più utile è quella che spiega perché Luna è ormai il modello che la maggior parte delle persone ha effettivamente usato — OpenAI l'ha messo dietro i livelli Free e Go di ChatGPT l'8 ottobre 2026, il che lo rende il livello più economico della generazione e, per numero di utenti, il più trafficato. Quello che segue è la scala dei livelli spiegata una volta, e poi cosa comprano davvero dieci centesimi per milione.
La famiglia, e dove si colloca Luna al suo interno
OpenAI distribuisce la generazione GPT-6 come tre ID di modello rilasciati il 22 settembre 2026, senza alcun openai/gpt-6 endpoint dietro il nome della famiglia:
• GPT-6 Astra — il modello di punta, 10,00 $ in ingresso / 50,00 $ in uscita per milione di token, indicato nella tabella tariffaria di OpenAI come il vertice della generazione
• GPT-6 Sol — il livello intermedio, 2,00 $ / 10,00 $, e il modello che OpenAI indica per la chat nei piani a pagamento di ChatGPT
• GPT-6 Luna — il livello economico, 0,10 $ / 0,50 $, e il modello che OpenAI indica per i piani Free e Go
Quell'ultima riga è la parte che vale la pena fissare, perché è il motivo per cui il traffico di Luna sovrasta tutto il resto della famiglia. L'annuncio di OpenAI stesso per il 7–10 ottobre afferma che "GPT-6 in ChatGPT è alimentato da GPT-6 Sol per i piani Plus, Pro, Business e Go, e da GPT-6 Luna per i piani Free e Go". Un modello a $0.10 / $0.50 che risponde al piano gratuito è un modello che serve più domande al giorno di qualsiasi piano premium, ed è lo stesso checkpoint che puoi chiamare tramite l'API. La superficie consumer è un canale di distribuzione, non uno SKU separato.
Un avvertimento che va ripetuto qui, perché questo blog ne ha già parlato: lo stesso annuncio dice che Free e Go ricevono GPT-6 Luna, mentre la pagina del centro assistenza di OpenAI dedicata a GPT-6 in ChatGPT descriveva Free e Go come basati su GPT-5.6 Luna il giorno in cui è stata consultata. Non sono affermazioni compatibili sullo stesso livello, OpenAI non ha detto quale sia quello attuale, e se il vostro lavoro dipende da quale modello economico si trova dietro il piano gratuito, considerate la voce del centro assistenza come la pagina più specifica e ricontrollate prima di sviluppare su una o sull'altra.
Che cosa comprano davvero dieci centesimi per milione
Il numero in evidenza è il meno interessante sulla scheda di Luna. Ecco la scheda completa, e il passaggio di livello sottostante:
• Contesto breve, fino a 272.000 token di input — $0,10 per milione in input, $0,50 per milione in output
• Oltre 272.000 token di input — $0,20 per milione in input, $0,75 per milione in output, applicati all'intera richiesta
• Input in cache — $0,01 per milione al livello breve, uno sconto del 90%; $0,02 oltre la soglia
• Scritture in cache — $0,125 per milione al livello breve, $0,25 oltre la soglia
• Contesto e output — 1.050.000 token in input, 128.000 token in output
• Modalità di input — testo, immagine e file, lo stesso input multimodale di Sol e Astra
• Ragionamento — un parametro effort configurabile, insieme a strumenti, output JSON e campionamento con seed
Ne seguono due cose. La prima è che Luna non è un modello depotenziato. Accetta immagini e file, espone la stessa superficie di chiamata di strumenti e di output strutturato dei suoi due fratelli più costosi, e l'unica cosa che lo distingue da Sol sulla scheda tecnica è la profondità, non la capacità. La seconda è il gradino. Un prompt oltre i 272.000 token di input raddoppia la tariffa di Luna e aumenta la sua tariffa di output, sull'intera richiesta anziché solo sull'eccesso. A questi prezzi è un gradino contenuto — una richiesta da 300.000 token costa circa sei centesimi di input invece di tre — quindi la clausola sul contesto lungo che domina la pianificazione del budget per Auroram e conta per Sol qui è quasi irrilevante.
Il numero che fa davvero la differenza sui costi su larga scala è la lettura dalla cache. A un centesimo per milione, un carico di lavoro che reinvia lo stesso grande contesto a ogni turno paga quasi nulla per la parte ripetuta. In una pipeline di estrazione o classificazione ad alto volume con un prompt di sistema stabile e un documento stabile, questa è la differenza tra un modello economico e uno quasi gratuito, ed è la ragione specifica per cui il costo reale di Luna per ogni risposta completata è ben al di sotto di quanto suggerisca il tariffario.
Quanto ti costa in termini di capacità
Luna è il livello più economico perché è quello meno capace, e il comitato indipendente non lascia dubbi su quanto sia inferiore. Consulta i dati di Artificial Analysis tramite la voce di catalogo di OrcaRouter per ciascun modello l'8 ottobre 2026:
• AA Intelligence Index — GPT-6 Sol 47,6, posizione 14; GPT-6 Luna 38,1, posizione 37
• Humanity's Last Exam — GPT-6 Sol 47,9 vs GPT-6 Luna 38,5
• SciCode — GPT-6 Sol 57,6 vs GPT-6 Luna 54,6
• Richiamo su contesto lungo — GPT-6 Sol 83,7 vs GPT-6 Luna 83,3
• Terminal-Bench 4.0 — GPT-6 Sol 43,9 vs GPT-6 Luna 12,6
• Traffico in sette giorni — GPT-6 Luna circa 574 milioni di token; GPT-6 Sol circa 2,1 milioni
• Tempo mediano al primo token — GPT-6 Luna 1.494 ms vs GPT-6 Sol 6.785 ms
• Velocità mediana di output — GPT-6 Luna 132,9 token/s vs GPT-6 Sol 179,6 token/s
La forma di questo è più informativa del divario principale. Luna è 9,5 punti indice dietro Sol, e la perdita non è distribuita in modo uniforme: il richiamo su contesto lungo è un pareggio a 0,4 punti, e SciCode — comprensione del codice più che produzione di codice — è distante solo 3 punti. Ciò che crolla è l'esecuzione agentica a più passaggi: Terminal-Bench 4.0 a 12,6 contro il 43,9 di Sol. Un modello che riesce a recuperare da un documento da un milione di token quasi quanto il suo fratello maggiore, e a scrivere una risposta competente in un colpo solo, è uno strumento diverso da uno che riesce a portare a termine un ciclo di utilizzo di strumenti.
Due avvertenze. I valori dell'indice provengono da Artificial Analysis, non da OpenAI, e quel valutatore non garantisce che due pagine di modello siano renderizzate rispetto alla stessa revisione dell'indice nello stesso giorno — considerate le differenze inferiori a un punto come indicative della direzione, non della precisione. E i valori di serving sono le nostre misurazioni di routing su una finestra mobile di sette giorni; variano tra una lettura e l'altra e sono utili per la forma della differenza più che come promessa a livello di servizio.
C'è un dato di serving su cui vale la pena soffermarsi. Il tempo mediano al primo token di Luna è 1.494 ms contro i 6.785 ms di Sol — circa 4,5 volte più veloce al primo token — e il suo throughput è sensibilmente inferiore una volta avviato lo streaming. Per una superficie di chat in cui l'utente è in attesa della battuta iniziale, quell'inversione è l'intero senso del tier, ed è il motivo per cui il piano gratuito può sembrare veloce pur eseguendo il modello più economico della famiglia.
La nuova competizione all'interno della famiglia
Il vantaggio di prezzo di Luna all'interno della generazione si è ridotto da quando è stata lanciata. GPT-6.1 Solè arrivato il 29 settembre al prezzo di Sol di 2,00 $ / 10,00 $ con un indice di 51,8, e ha abbassato la tariffa per l'input in cache a 0,10 $ per milione. Questo non intacca la tariffa di Luna per il contesto breve — dieci centesimi in ingresso e cinquanta centesimi in uscita restano venti volte più economici sull'input rispetto a qualsiasi Sol — ma significa che il livello sopra Luna è diventato meno costoso da usare sul traffico in cache, che è esattamente il carico di lavoro in cui il vantaggio di Luna era più ampio. Il divario è ancora ampio. Non è più ampio come lascerebbero intendere i soli listini prezzi.

Dove cade in pratica la linea tra le fasce
Dividi il lavoro in base a ciò di cui ha bisogno il compito, non in base a quale modello ottiene un punteggio più alto.
Luna è la scelta giusta per chat ad alto volume, classificazione, estrazione, moderazione e riepilogo su un documento lungo — la riga in cui pareggia il suo fratello maggiore sul retrieval è esattamente la riga che determina se un contesto ampio è utilizzabile. La sua latenza del primo token la rende la scelta migliore per qualsiasi cosa interattiva che non sia incentrata sul ragionamento. E a un centesimo per milione di token in cache, una pipeline a contesto stabile è quasi gratuita sulla porzione ripetuta.
Sol, o ormai GPT-6.1 Sol, è la scelta giusta nel momento in cui il compito richiede un ciclo di attività, un piano a lungo termine o una catena di passaggi che deve essere completata. Il divario di Terminal-Bench — 43,9 contro 12,6 — è il segnale più chiaro in assoluto in questo confronto, e riflette il vero modo di fallire: un modello economico che risponde bene al primo passo e poi perde il filo. Il parametro effort significa che puoi chiedere a Luna di ragionare di più, ma effort aumenta il numero di token anziché il tetto massimo; non trasforma un 12,6 in un 43,9.
E Astra resta la risposta per il lavoro che solo il modello di punta può svolgere — che, a $10,00 in input e $50,00 in output contro i dieci centesimi di Luna, è una decisione che dovresti poter giustificare per chiamata anziché per team.
La versione con API unica di questa scelta
La parte scomoda di una famiglia a tre livelli è che il confine tra i livelli si sposta da funzionalità a funzionalità, e si sposta da richiesta a richiesta — la stessa applicazione di solito vuole Luna per un endpoint e Sol per quello successivo. Questo è un problema di routing più che di approvvigionamento. Tutti e tre i livelli di GPT-6 si trovano nello stesso catalogo OrcaRouter, richiamati attraverso un'unica API compatibile con OpenAI davanti a oltre 200 modelli, con il prezzo di listino del fornitore passato a markup 0%, così una variazione di prezzo del fornitore su qualsiasi livello è attiva qui lo stesso giorno anziché alla prossima riconciliazione. Il DSL di routing compone esplicitamente la suddivisione — per dimensione della richiesta, per endpoint o per quota — così il percorso di classificazione può eseguire Luna mentre il percorso agentico esegue Sol, e il failover automatico tra fornitori copre una rotta che peggiora invece di lasciarti scoprirlo da un'esecuzione fallita.
Una cosa che questo non fa è darti una Luna che si comporti come Sol. I tier esistono perché i modelli sono diversi, e i numeri sopra riportati indicano l'entità della differenza. Quello che una singola chiave e una regola di routing ti offrono è la possibilità di assegnare ogni richiesta al tier che le si addice davvero, invece di mettere tutto su quello più costoso per sicurezza o tutto su quello più economico per questioni di budget.

La risposta, dall'unica domanda che conta
Se il compito è recuperare e poi rispondere su un documento di grandi dimensioni, in una chat o su un'elaborazione di testo in blocco, GPT-6 Luna è il livello giusto e la scheda da dieci centesimi non è un compromesso — la riga del recall a contesto lungo dice che recupera tanto bene quanto il modello che costa venti volte di più. Se il compito richiede un agente multi-step per essere completato, Luna è il livello sbagliato e la mossa onesta è GPT-6 Sol o GPT-6.1 Sol, dove il prezzo è comunque basso in termini assoluti e le valutazioni agentiche smettono di crollare.
Ciò che "GPT-6" è di per sé, ribadiamolo, non è qualcosa che si possa chiamare. È un nome di famiglia che copre tre ID a tre fasce di prezzo e tre diversi tetti di capacità, e Luna è quella in fondo — la più economica, la più veloce al primo token, quella che risponde al piano gratuito, e quella il cui tetto si manifesta nel momento in cui un compito richiede più di una singola risposta sicura.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
