Un tabellone comparativo a due colonne generato automaticamente, intitolato "GPT-6.1 Sol vs GPT-6 Luna - il tabellone". Colonna sinistra "GPT-6.1 Sol": righe che riportano "Intelligence Index: 51.8", "Costo per attività dell'indice: $0,72", "Prezzo per 1M: $2,00 / $10,00", "Token di output nell'esecuzione dell'indice: 67M", "Terminal-Bench 4.0: 56,1%", "Soglia di sforzo: bassa". Colonna destra "GPT-6 Luna": righe che riportano "Intelligence Index: 38.1", "Costo per attività dell'indice: $0,07", "Prezzo per 1M: $0,10 / $0,50", "Token di output nell'esecuzione dell'indice: 144M", "Terminal-Bench 4.0: 12,6%", "Soglia di sforzo: nessuna". Un piè di pagina recita "Dati indipendenti secondo Artificial Analysis v4.3.2 a sforzo massimo; prezzi di listino dei fornitori."
Guides & Insights

GPT-6.1 Sol vs GPT-6 Luna: tredici punti di indice, dieci volte i soldi e due valutazioni in cui non regge

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

AI GPT-6.1 Sol il 29 2026, una settimana GPT-6 Luna è arrivato il 22 settembre, nello stesso ciclo di keynote. Sono i due estremi della stessa generazione: Luna è il livello economico, Sol è il livello intermedio al di sopra, e GPT-6 Astra si colloca sopra entrambi. La differenza di prezzo tra i due è di un ordine di grandezza: 0,10 $ e 0,50 $ per milione di token contro 2,00 $ e 10,00 $, input in cache 0,01 $ contro 0,10 $, mentre la differenza di capacità sul board indipendente è di 13,7 punti di Intelligence Index, 51,8 contro 38,1 con il massimo sforzo di ragionamento. Dieci volte il denaro per tredici punti è all'incirca il peggior tasso di cambio nell'attuale lineup di OpenAI. Ciò che rende il confronto degno di essere scritto è la domanda da quaranta dollari che ne consegue: quali tredici punti?

I due modelli, e la settimana tra loro

GPT-6 Luna è il modello piccolo della generazione GPT-6 — quello che OpenAI descrive come progettato per carichi di lavoro ad alto volume e sensibili alla latenza: classificazione, estrazione, routing, riepilogo in blocco, il ciclo interno di un agente. Ha una finestra di contesto di 1.050.000 token e un limite di output di 128.000 token, accetta in input testo, immagini e file, e mantiene la scala completa a sei livelli di effort incluso none, che il tier 6.1 ha eliminato. La scheda tariffaria è il motivo per cui esiste: 0,10 $ in input e 0,50 $ in output per milione di token, input in cache a 0,01 $ e scritture in cache a 0,125 $, con uno scatto per contesto lungo oltre 272.000 token di input a 0,20 $, 0,75 $ e 0,02 $ in cache.

GPT-6.1 Sol è l'aggiornamento di fascia media rilasciato una settimana dopo. Stessa finestra, stesso limite di output, stesse modalità di input, una data di cutoff delle conoscenze al 30 aprile 2026 rispetto a quella di Luna, e una scala di effort che parte da low perché none e minimal vengono rifiutati a priori. Il prezzo è di $2,00 e $10,00 con input in cache a $0,10 — venti volte la tariffa di input di Luna e venti volte la sua tariffa di output, con una voce di cache che costa dieci volte di più per hit.

Entrambi sono in vendita, entrambi sono disponibili in ChatGPT Work e Codex oltre che nell'API, ed entrambi sono richiamabili tramite la stessa chiave dalla nostra parte. Nulla in questo abbinamento richiede di scegliere.

Cosa comprano davvero tredici punti indice

Il punteggio composito è il numero meno informativo del confronto, perché fa una media su attività che si comportano in modo molto diverso. Valutato valutazione per valutazione al massimo sforzo di ragionamento su Artificial Analysis v4.3.2, la forma è una spaccatura più che una pendenza:

• AA-LCR v1.1, ragionamento a contesto lungo — GPT-6 Luna 0,833 vs GPT-6.1 Sol 0,830. Luna è marginalmente in vantaggio.

• SciCode— GPT-6 Luna 0.546 vs GPT-6.1 Sol 0.542. Di nuovo praticamente allo stesso livello, e ancora una volta il modello più economico è nominalmente in testa.

• Terminal-Bench 4.0 — GPT-6 Luna 0,126 contro GPT-6.1 Sol 0,561. Un divario di 43 punti; i due modelli appartengono a categorie diverse sul lavoro da terminale.

• Humanity's Last Exam — GPT-6 Luna 0,385 vs GPT-6.1 Sol 0,529.

• AutomationBench-AA — GPT-6 Luna 0,532 vs GPT-6.1 Sol 0,649.

• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 contro GPT-6.1 Sol Elo 1575.1, un divario Elo di 138 punti nel lavoro professionale basato sulla conoscenza.

• GDP.pdf — GPT-6 Luna 0,228 vs GPT-6.1 Sol 0,310.

• CritPt — GPT-6 Luna 0,194 vs GPT-6.1 Sol 0,317.

• AA-Omniscience — GPT-6 Luna 0,65 vs GPT-6.1 Sol 41,5. Su una scala in cui zero significa tante risposte corrette quante errate, Luna è sulla linea di galleggiamento e Sol è decisamente al di sopra di essa.

MMMU-Pro — GPT-6 Luna 0.797 vs GPT-6.1 Sol 0.860.

• Costo per attività di indicizzazione, indipendente — GPT-6 Luna $0,068 vs GPT-6.1 Sol $0,72; un divario di circa dieci volte a favore del modello economico

• Token di output nell'esecuzione dell'indice — GPT-6 Luna 144 milioni contro GPT-6.1 Sol 67 milioni, a fronte di una mediana di classe di 100 milioni per Luna e circa 81 milioni per Sol

Due valutazioni su dieci sono un pareggio a favore del modello economico. Otto vanno a quello costoso, e in sei di queste otto il margine non è marginale. Questa è la lettura onesta dei tredici punti: non è un gradiente di qualità uniforme, ma due capacità — esecuzione agentica sostenuta e affidabilità fattuale — in cui Luna semplicemente non è della stessa classe di modello, e una vasta zona intermedia in cui la differenza è reale ma abbastanza piccola da risultare invisibile nel tuo stesso set di valutazione.

Il risultato di AA-LCR merita una precisazione, perché è il dato che più di tutti lusinga Luna. Il ragionamento su contesti lunghi a 0,833 è un punteggio solido e i due modelli sono a meno di mezzo punto l'uno dall'altro, ma il benchmark misura il recupero e il ragionamento su input lunghi, non la capacità di agire nell'arco di una sessione lunga. Il divario su Terminal-Bench 4.0 è ciò che significa «agire nell'arco di una sessione lunga» quando viene misurato, ed è ampio 43 punti.

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

L'aritmetica del costo per attività, e dove smette di essere vera

Artificial Analysis calcola il prezzo di ogni esecuzione dell'indice dal consumo misurato di token, quindi la cifra di costo non è una deduzione dal listino prezzi. L'esecuzione di GPT-6 Luna è costata $0,068 per attività; quella di GPT-6.1 Sol è costata $0,72. Il rapporto è 10,7×, che è leggermente peggiore del rapporto di prezzo nominale di venti volte solo perché Luna ha generato 144 milioni di token di output durante l'esecuzione contro i 67 milioni di Sol — il modello economico è più che due volte più loquace, e intacca il proprio vantaggio. Anche così, la graduatoria non è ravvicinata, e su un carico di lavoro con risposte brevi si amplierebbe: un minor volume di output significa che la penalità di verbosità di Luna si riduce mentre il suo vantaggio di prezzo rimane fisso.

Il punto in cui l'aritmetica smette di valere è qualsiasi carico di lavoro a cui l'indice non assomiglia. Se il tuo compito è una modifica su scala di repository che richiede venti chiamate a strumenti mantenute coerenti, un modello da $0,07 che fallisce il compito ti costa l'intero ciclo di tentativi più il tempo trascorso, mentre il modello da $0,72 che lo porta a termine una volta sola è più economico. La stessa impostazione di lancio di GPT-6.1 Sol è interamente costruita su questa idea — costo per compito completato — ed è l'inquadramento corretto: il confronto rilevante non è il costo per token, ma il costo atteso per risultato, e sui compiti che Luna non riesce a completare quell'aspettativa è illimitata.

Due dettagli strutturali rendono il confine più netto. Primo, il gradino del contesto lungo: entrambi i modelli cambiano prezzo oltre 272.000 token di input, Luna a $0,20 e $0,75 e Sol a $4,00 e $15,00, quindi il divario assoluto al confine si allarga anziché chiudersi, ma la tariffa rivalutata di Luna resta comunque un ordine di grandezza sotto quella standard di Sol. Secondo, ed è facile lasciarselo sfuggire: la scala dell'effort non ha la stessa forma. Luna accetta none; Sol no. Una cascata che instrada prima verso Sol e ripiega su Luna in caso di errore o timeout non deve trasportare il reasoning.effort della richiesta così com'è, perché una configurazione legale su un modello restituisce un errore sull'altro. Questa è una questione che riguarda il livello di routing, non la qualità del modello, ed è esattamente il tipo di cosa che un singolo endpoint con una regola di routing dovrebbe assorbire.

Eseguire entrambi è il punto, non una copertura

Entrambi i modelli sono su OrcaRouter ai prezzi di listino di OpenAI, senza alcuna aggiunta: GPT-6 Luna a $0,10 e $0,50 con input in cache a $0,01, GPT-6.1 Sol a $2,00 e $10,00 con input in cache a $0,10, e lo scaglione di 272.000 token su ciascuno viene passato esattamente come lo elenca il fornitore. Poiché la piattaforma trasferisce il prezzo di listino del fornitore invece di applicarvi un ricarico, il rapporto di venti volte in questo articolo è il rapporto che paghi effettivamente, da entrambe le parti.

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

La ragione che qui conta davvero è che questa coppia è una cascata in attesa di essere scritta. Un classificatore, un router, un job di estrazione massiva e un agente di coding su scala repository non dovrebbero stare sullo stesso modello, e il divario di prezzo è abbastanza ampio che sbagliare in una direzione o nell'altra costa caro: venti volte troppo per chiamata da una parte, un compito fallito dall'altra. Una sola chiave, due modelli e una regola che instrada il traffico facile verso Luna e lo escala a Sol quando cambia la classe del compito o quando l'output di Luna non supera un controllo: è una modifica di configurazione dalla nostra parte, non un secondo contratto con un fornitore. Il failover automatico copre il caso in cui uno dei due sia degradato, il che, per un modello rilasciato otto giorni fa, è ancora una possibilità concreta.

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

La decisione, in un solo passaggio

• Classificazione, estrazione, routing, riepilogo in blocco, cicli interni degli agenti — GPT-6 Luna, e smetti di leggere. A $0,10/$0,50 con una lettura in cache da un centesimo, tredici punti indice di capacità generale non valgono dieci volte la fattura su un lavoro dove la risposta è breve e verificabile.

• Programmazione su scala di repository, agenti da terminale, esecuzione multi-step — GPT-6.1 Sol. Il divario di 43 punti su Terminal-Bench 4.0 è tutto l'argomento che serve; questa è la capacità che il prezzo sta acquistando.

• Domande di knowledge work in cui una risposta sbagliata costa cara — GPT-6.1 Sol, sui divari di AA-Omniscience e GDPval-AA. Il punteggio di affidabilità fattuale di Luna è sulla linea di galleggiamento.

• Input lunghi con una risposta generata breve — GPT-6 Luna. Ragiona su contesti lunghi alla pari di un modello che costa venti volte tanto, e la sua penalità di verbosità di 144 milioni di token non ha mai modo di applicarsi.

• Qualsiasi cosa già impostata su nessuno — resta su Luna, oppure prevedi il budget per il cambiamento. Quel gradino non esiste su GPT-6.1 Sol.

• Superfici sensibili alla latenza — GPT-6 Luna, secondo le misurazioni della board stessa: 129,4 token di output al secondo e 100 secondi al primo chunk, contro i 59,7 e i 332 di Sol.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno