
GPT-6 Luna vs GPT-6 Sol: due tariffari dalla stessa struttura e un numero venti volte superiore
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Lunaha un prezzo di listino di $0.10 per milione di token di input e $0.50 per milione di output. GPT-6 Solha un prezzo di listino di $2.00 e $10.00. Il fornitore li ha rilasciati entrambi il 22 settembre 2026, come i due livelli inferiori della generazione GPT-6 al di sotto del modello di punta GPT-6 Astra, e il divario di venti volte tra i due è la prima cosa che chiunque legge sulla pagina. Ciò che è più difficile da vedere, e più utile, è quanto poco altro li separi. Stessa finestra di contesto da 1,050,000 token. Stesso input massimo di 922,000 token. Stesso tetto di output di 128,000 token. Stessa scala di ragionamento da none a low, medium, high, xhigh e max, con medium come impostazione predefinita. Stessa famiglia di data di cutoff delle conoscenze, a un mese di distanza. Stessa clausola che ricalcola il prezzo di un'intera richiesta una volta superati i 272,000 token di input.
Due modelli che condividono ogni riga strutturale di un listino non si differenziano per le funzionalità. Si differenziano per un punteggio, e per quanto quel punteggio ti costa ottenere. Sulla classifica indipendente che misura entrambi, GPT-6 Sol si colloca undici punti sopra GPT-6 Luna a parità di sforzo massimo e costa circa quindici volte tanto completare la stessa valutazione. Undici punti e quindici volte è una frase diversa da venti volte, e la differenza tra queste due frasi è dove vive realmente questo confronto.
A cosa serve ciascuno di questi due
GPT-6 Sol è il cavallo di battaglia della famiglia — il livello che OpenAI posiziona per la programmazione complessa, i flussi di lavoro agentici e il lavoro professionale che una persona leggerà. Accetta testo e immagini, produce testo ed è disponibile per chiunque abbia una chiave API. È il modello a cui la maggior parte dei team si rivolgerà per impostazione predefinita quando vuole capacità di classe GPT-6 senza il listino prezzi dell'ammiraglia né la sua barriera di accesso.
GPT-6 Luna è il livello volumetrico. La descrizione di OpenAI è asciutta e deliberatamente poco glamour: il modello più efficiente per attività mirate e ad alto volume. Riassunto, estrazione, classificazione, instradamento, il ciclo interno di un agente che effettua mille piccole chiamate lungo il cammino verso un'unica attività. Stessa finestra, stesso limite di output, stesso selettore di impegno: un motore più economico in un telaio identico.
Entrambi sono stati addestrati con metodi derivati da GPT-6 Astra anziché essere sviluppati come una linea separata, ed è per questo che le schede tecniche coincidono in modo così preciso. Il prezzo è l'unico punto in cui i due divergono per scelta progettuale.
Il listino prezzi, riga per riga
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1M — GPT-6 Luna $0.10 vs GPT-6 Sol $2.00
• Output per 1M — GPT-6 Luna $0.50 vs GPT-6 Sol $10.00
Input in cache per 1M — GPT-6 Luna $0,01 vs GPT-6 Sol $0,20; entrambi sono un decimo della rispettiva tariffa di input non in cache, quindi il rapporto di venti volte sopravvive intatto allo sconto
• Scritture in cache per 1M — GPT-6 Luna $0,125 vs GPT-6 Sol $2,50, un sovrapprezzo del 25% sulla tariffa di input in entrambi i casi
• Livello a contesto lungo — clausola identica su entrambe le schede: oltre 272.000 token di input l'intera richiesta viene fatturata a 2× per input e cache e 1,5× per output, portando GPT-6 Luna a $0,20 e $0,75 e GPT-6 Sol a $4,00 e $15,00
• Finestra di contesto — 1.050.000 token per entrambi, con un massimo di input di 922.000 token e un tetto di output di 128.000 token
• Sforzo di ragionamento — nessuno, basso, medio (predefinito), alto, xhigh, max per entrambi; il selettore è lo stesso componente in entrambi i modelli
• Livelli di servizio — Flex dimezza il costo e Priority lo raddoppia su entrambe le carte, selezionati tramite lo stesso service_tier parametro
• Data limite delle conoscenze — GPT-6 Luna 18 maggio 2026 vs GPT-6 Sol 20 aprile 2026, che distano un mese all'interno della stessa famiglia e vale la pena saperlo prima di presumere che i due condividano una visione del mondo
• Intelligence Index, indipendente — GPT-6 Luna 37 con massimo sforzo vs GPT-6 Sol 48 con massimo sforzo, stessa revisione dell'indice
• Punteggio con sforzo predefinito — GPT-6 Luna 29 con il suo livello medio predefinito vs GPT-6 Sol 48 al massimo, l'impostazione con cui Artificial Analysis l'ha misurato
• Costo per attività Index, indipendente — GPT-6 Luna circa 0,07 $ rispetto a GPT-6 Sol 1,06 $
• Token di output nell'esecuzione dell'indice — GPT-6 Luna 150M vs GPT-6 Sol 77M, rispetto a una mediana della board di 88M
• Coding Agent Index, indipendente — GPT-6 Luna 41, due punti in meno su GPT-5.6 Luna rispetto a GPT-6 Sol 57, due in più su GPT-5.6 Sol
• Tasso di allucinazione su AA-Omniscience — GPT-6 Luna 77%, in calo dal 93% rispetto a GPT-6 Sol 60%, in calo dal 92%; entrambi i modelli sono diventati più propensi a rifiutare anziché più competenti, e Sol si è spinto oltre
• Su OrcaRouter — né GPT-6 Luna né GPT-6 Sol sono nel nostro catalogo al momento in cui scriviamo; entrambi sono raggiungibili tramite l'API di OpenAI

Il quadrante dello sforzo è lo stesso componente in entrambi i modelli, e questo cambia i conti
Poiché la scala di ragionamento è identica, le cifre principali dell'indice per entrambi i modelli sono valori ottenuti con il massimo sforzo. Il 37 di GPT-6 Luna è il punteggio che ottiene quando può pensare quanto vuole. La sua impostazione predefinita è media, con cui ottiene 29. Anche il 48 di GPT-6 Sol è un valore ottenuto con il massimo sforzo, ed è l'impostazione con cui lo ha eseguito il consiglio indipendente.
Questo qui conta più che nella maggior parte dei confronti, perché significa che i due modelli vengono citati allo stesso livello. Un team che implementa GPT-6 Luna e non cambia nulla non sta facendo girare un 37 contro un 48; sta facendo girare un 29 contro un 48. Si tratta di un divario di diciannove punti anziché di undici, e la sua ampiezza è una proprietà della configurazione predefinita, non del modello.
Lo stesso controllo è anche l'ottimizzazione più economica disponibile su entrambe le schede, e funziona in entrambe le direzioni. Abbassare GPT-6 Sol da max a medium sul lavoro che un umano rivede è un risparmio maggiore rispetto a spostare una frazione del tuo traffico da Sol a Luna, e costa un cambio di parametro invece di una migrazione. Alzare GPT-6 Luna a xhigh sull'unica chiamata per attività che decide davvero l'esito è un errore di arrotondamento rispetto al totale. Il controllo esiste su entrambi i modelli proprio per permettere di fare separatamente la scelta del livello e la scelta dello sforzo, e la maggior parte dei team ne fa solo una.
La scogliera è identica, ed è proprio questo il punto
Entrambi i modelli presentano la stessa clausola sul contesto lungo e, poiché la clausola è proporzionale, non riduce il divario tra loro: lo raddoppia da entrambe le parti. Una richiesta da 300.000 token su GPT-6 Luna viene fatturata a $0,20 per milione di input per tutti i 300.000 token, non per i 28.000 oltre la soglia. La stessa richiesta su GPT-6 Sol viene fatturata a $4,00. Suddividi uno dei due documenti in due chiamate sotto la soglia e il costo si dimezza senza alcuna modifica al prompt.
Ciò che la clausola identica cambia è la dimensione dell'errore. Sul livello volume, una richiesta dimensionata male costa un quinto di centesimo per mille token. Sul livello giornaliero costa quattro dollari per milione. I team che più probabilmente hanno un contesto di lavoro di 300.000 token sono quelli che gestiscono le pipeline agentiche in cui entrambi i modelli vengono venduti, il che significa che il livello che può permettersi meno l'errore non è quello che lo commette più spesso.
Dove sono gli undici punti di Sol, e dove no
Il divario è reale e non è distribuito in modo uniforme tra le attività che potresti eseguire.
I vantaggi di GPT-6 Sol si concentrano nel coding e nell'esecuzione agentica. Il suo Coding Agent Index di 57 è sedici punti sopra il 41 di GPT-6 Luna, in una classifica in cui gli equivalenti della generazione precedente erano 55 e 43 — quindi entrambi i modelli si sono mossi in direzioni opposte su quella misura, cosa che vale la pena sapere prima di dare per scontato che la nuova generazione sia un miglioramento della vecchia su tutta la linea. Secondo i dati pubblicati dal fornitore stesso, Sol riporta il 68,8% su DeepSWE v1.1 al massimo sforzo contro il 66,6% di Luna, e circa il 43% su Terminal-Bench 4.0 contro il 37%. Si tratta di dati riportati da OpenAI e non riprodotti, e il divario che descrivono è più stretto di quanto suggerisca il divario dell'indice.
È sulle valutazioni che premiano una lunga catena di decisioni corrette che Sol prende il largo: GPT-6 Sol riporta circa il 62% su AutomationBench-AA contro il 53% di GPT-6 Luna, e un tasso di allucinazioni del 60% contro il 77% nella stessa classifica di omniscienza. Una differenza di diciassette punti nella frequenza con cui un modello inventa una risposta non è un margine di capacità; per qualsiasi cosa abbia un consumatore a valle, è l'intera decisione.
Il campo in cui gli undici punti non contano è il lavoro testuale generico. Nell'estrazione, nella classificazione, nel routing e nella sintesi — i compiti per cui è pensato il prezzo di GPT-6 Luna — entrambi i modelli produrranno la stessa risposta utilizzabile nella stragrande maggioranza dei casi, e la differenza non sopravvivrà al confronto con il vostro set di valutazione. Artificial Analysis segnala una regressione su entrambi i modelli al massimo sforzo: GPT-6 Sol perde circa 100 Elo su GDPval-AA v2.1 rispetto al suo predecessore, e GPT-6 Luna circa 75. Se il vostro lavoro assomiglia a GDPval, nessuno dei due livelli è l'aggiornamento che vi era stato promesso, e gli undici punti sono un confronto tra due modelli che hanno entrambi fatto passi indietro.
Scegliere tra due livelli che hai già
La cosa insolita di questo abbinamento è che non si tratta di una decisione di acquisto. Entrambi i modelli girano sullo stesso account, sullo stesso endpoint e sullo stesso SDK. Non c'è un secondo contratto, né una seconda negoziazione di tariffe, né lavoro di integrazione per spostare il traffico da uno all'altro. Questo lo rende una decisione di routing, e le decisioni di routing sono quelle che vale la pena prendere per ogni richiesta anziché una volta sola.
Né GPT-6 Luna né GPT-6 Sol è nel nostro catalogo al momento in cui scriviamo: entrambi sono accessibili tramite l'API di OpenAI stessa, quindi la suddivisione deve essere espressa nella vostra applicazione anziché in una configurazione del router. Questo è un motivo per affrontarla con ponderatezza, perché il costo di sbagliare è una modifica al codice anziché una modifica alle impostazioni. La forma della suddivisione non è complicata: GPT-6 Luna per le mille piccole chiamate che un agente effettua lungo il percorso verso un'attività, e GPT-6 Sol per la chiamata che produce l'artefatto che una persona leggerà. Impostate esplicitamente il parametro effort su entrambi i lati, perché il valore predefinito è medium e ogni cifra pubblicata per entrambi i modelli è un numero relativo allo sforzo massimo.
I team che fanno routing tra fornitori diversi — e la maggior parte di quelli che vediamo lo fa — possono tenere GPT-6 Astra, Grok 4.6, Kimi K3 e Qwen3.8-Max su un'unica chiave tramite OrcaRouter al prezzo di listino del fornitore, con 0% di markup e failover tra gli upstream. Aggiungere GPT-6 Luna e GPT-6 Sol allo stesso quadro significa una seconda chiave anziché una seconda architettura, che è il minore dei due problemi creati da questo abbinamento.

Quale, e quando
Scegli GPT-6 Luna a meno che tu non riesca a indicare la capacità che stai acquistando con le venti volte. È più economico su ogni riga della scheda, incluso l'input in cache, ha la stessa finestra e lo stesso tetto di output, gli si può dire di interrompere del tutto il ragionamento, e il suo costo per attività completata nella classifica indipendente è circa un quindicesimo di quello di GPT-6 Sol. Imposta esplicitamente lo sforzo, mantieni le chiamate lunghe sotto i 272.000 token di input e verifica il divario di sedici punti del Coding Agent Index rispetto al tuo repository prima di presumere che si applichi a te.
Scegli GPT-6 Sol quando il compito è il prodotto e la modalità di fallimento è una risposta silenziosamente sbagliata piuttosto che lenta. Agenti di programmazione che operano su un repository reale, analisi professionali a lungo termine, qualsiasi cosa in cui un fatto allucinato costi più dei token risparmiati. Accetta di pagare quindici volte per compito completato per undici punti indice, e che una quota significativa di quegli undici punti si trovi nella colonna delle allucinazioni piuttosto che in quella delle capacità — il che, per questa particolare coppia, è la metà migliore per cui pagare.
L'errore da evitare è considerare l'etichetta del "venti volte" come la risposta. È la risposta a quanto costa un token, e non dice nulla su quanto costi un compito completato o su quanto spesso la risposta del modello economico sia sbagliata in un modo che non noterai.

