
GPT-6 Luna vs Gemini 3.1 Pro: un'anteprima vecchia di sette mesi a venti volte il prezzo di input
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il modello di ragionamento di frontiera è etichettato "Preview" da quando Gemini 3.1 Proè stato lanciato il 19 febbraio 2026. Sette mesi dopo è ancora un'anteprima, ancora a 2,00 $ per milione di token in input e 12,00 $ per milione in output, e ancora quello che la pagina di prodotto definisce il modello di ragionamento di frontiera dell'azienda. Il 22 settembre 2026, il fornitore ha rilasciato GPT-6 Luna come livello piccolo con disponibilità generale a 0,10 $ e 0,50 $. Metti a confronto le due schede tariffarie e il modello più recente, più economico e GA è venti volte più economico sull'input e ventiquattro volte più economico sull'output — e ottiene un punteggio superiore sull'indice indipendente a cui tengono i reparti marketing di entrambi i fornitori.
Quell’ultima clausola è la parte su cui vale la pena soffermarsi. GPT-6 Luna misura 37 sull’Artificial Analysis Intelligence Index con sforzo massimo. Gemini 3.1 Pro Preview misura 30 sulla stessa revisione. Un modello venduto come soluzione di efficienza ad alto volume è sette punti avanti rispetto a un modello venduto come sistema di ragionamento all’avanguardia, a un ventesimo del prezzo di input. Non si tratta di un modello economico che recupera terreno su uno costoso. Su questo particolare asse, il modello economico è semplicemente avanti, e quello costoso è in anteprima da sette mesi.
La conclusione naturale — che Gemini 3.1 Pro costi troppo — non è del tutto giusta neppure, e il resto di questo pezzo riguarda i tre ambiti in cui il modello di Google giustifica il suo listino prezzi, perché sono reali e non di poco conto.
Le cinque cose che lo decidono
Prima dei dettagli, la versione breve:
• GPT-6 Luna vince sul prezzo di circa 20x sull'input e 24x sull'output, sull'input in cache con un ampio margine, e sull'indice general-purpose di sette punti a parità di sforzo massimo.
• Gemini 3.1 Pro vince sul fronte della modalità di input — accetta audio e video, cosa che GPT-6 Luna non fa — e su quello dell'essere accessibile da sette mesi, il che, per un'anteprima, è un lungo track record produttivo.
• I limiti massimi di output non sono vicini in nessuna delle due direzioni: GPT-6 Luna emette fino a 128.000 token, Gemini 3.1 Pro fino a 65.000.
• Entrambi presentano un limite di fascia per il contesto lungo che ricalcola il prezzo dell'intera richiesta, a 272.000 token di input per GPT-6 Luna e intorno ai 200.000 per Gemini 3.1 Pro.
• La trappola dello sforzo predefinito si applica solo a Luna: il suo 37 è un punteggio con sforzo massimo e la sua impostazione media predefinita ottiene 29, che è inferiore al 30 di Gemini 3.1 Pro.
Due tariffari e l'aritmetica tra di loro
Una riga per dimensione, entrambi i lati su ciascuna:
• Input per 1M — GPT-6 Luna 0,10 $ vs Gemini 3.1 Pro 2,00 $
• Output per 1M — GPT-6 Luna $0,50 vs Gemini 3.1 Pro $12,00
• Input in cache — GPT-6 Luna $0,01 per 1M, uno sconto del 90% rispetto a Gemini 3.1 Pro $0,20 per 1M, uno sconto del 90%
• Confine del contesto lungo — GPT-6 Luna oltre 272K token di input rispetto a Gemini 3.1 Pro oltre circa 200K token di input
• Effetto contesto lungo — GPT-6 Luna 2x input e cache, 1,5x output, sull'intera richiesta rispetto a Gemini 3.1 Pro $4,00 in / $18,00 out, anche sull'intera richiesta
• Finestra di contesto — GPT-6 Luna 1.050.000 token vs Gemini 3.1 Pro 1 mln di token
• Output massimo — GPT-6 Luna 128.000 token vs Gemini 3.1 Pro 65.000 token
• Modalità di input — testo e immagini di GPT-6 Luna vs testo, immagini, audio, video e file di Gemini 3.1 Pro
• Indice di Intelligenza AA — GPT-6 Luna 37 al massimo sforzo, 29 con l'impostazione predefinita vs Gemini 3.1 Pro 30
• Velocità di output — GPT-6 Luna 153,9 token/sec contro Gemini 3.1 Pro circa 115-143 token/sec a seconda dello snapshot
• Interruttore di disattivazione del ragionamento — GPT-6 Luna, da nessuno fino a max vs Gemini 3.1 Pro con ragionamento prioritario, nessuna modalità senza ragionamento esposta
• Stato — GPT-6 Luna disponibile a livello generale dal 2026-09-22 vs Gemini 3.1 Pro in anteprima dal 2026-02-19

La riga interessante non è il prezzo. È la coppia di righe in fondo. L'etichetta di anteprima di Gemini 3.1 Pro non è un tecnicismo: cambia ciò che Google ti deve. Un modello in anteprima può essere modificato, riprezzato o ritirato senza l'avviso di deprecazione che riceve un modello GA, e un prezzo rimasto invariato per sette mesi è una promessa che nessuno ha fatto per iscritto. Tutto ciò che segue sul fatto che il modello di Google sia la scommessa più sicura per la produzione va letto tenendo conto di questa avvertenza, perché "sette mesi di stabilità" e "sette mesi senza una garanzia di stabilità" sono gli stessi sette mesi.
Dove il modello di Google guadagna le venti volte in più
Tre punti, e il primo è quello che per alcune squadre chiude del tutto il confronto.
Modalità. Gemini 3.1 Pro accetta input audio e video. GPT-6 Luna accetta testo e immagini. Se la tua pipeline acquisisce registrazioni di chiamate, catture dello schermo o video, non esiste alcuna versione di questo confronto in cui la differenza di prezzo conti, perché uno dei due modelli non è in grado di svolgere il compito. Non è un divario di benchmark che si restringe con un rilascio puntuale; è una capacità che o è presente o è assente, ed è la singola ragione più forte per cui il listino prezzi di Google sopravvive al contatto con un processo di acquisto reale.
Tetto di output, nella direzione opposta. I limiti di output tagliano nella direzione opposta rispetto alla modalità di input, e questo favorisce OpenAI. GPT-6 Luna emette fino a 128.000 token in una singola risposta; Gemini 3.1 Pro fino a 65.000. Se stai generando artefatti strutturati di lunga estensione — un documento completo, un refactoring massiccio, una patch multi-file — il tetto di Google è all'incirca la metà di quello di OpenAI, e una pipeline che tronca a 65.000 token è rotta indipendentemente da quanto paga per token.
Lavoro di frontiera multimodale. Il posizionamento di Gemini 3.1 Pro è quello di un modello di ragionamento che è anche multimodale, e la conseguenza pratica è che i compiti che richiedono ragionamento su un diagramma, un grafico o una registrazione dello schermo finiscono su di esso anziché su una fascia piccola incentrata sul testo. GPT-6 Luna accetta immagini, quindi il confine non è dato solo da audio e video: è che il modello di Google è costruito per il ragionamento visivo e audio come caso d'uso primario, mentre quello di OpenAI è costruito per il throughput.
Dove la fascia economica perde davvero, e non è dove ti aspetti
L'impostazione predefinita di effort è la trappola in questo confronto, e qui fa più male di quanto farebbe contro un avversario più debole. Il punteggio indice principale di GPT-6 Luna, 37, è misurato con il massimo sforzo di ragionamento. Il suo default è medio, e con il livello medio ottiene 29 — un punto sotto i 30 di Gemini 3.1 Pro. Quindi il vantaggio di sette punti con cui questo articolo si apriva è un confronto tra il tetto di un modello e il tetto di un altro, e un team che installa GPT-6 Luna e lascia la configurazione invariata sta usando un modello che è leggermente dietro quello di Google, sette mesi più vecchio, ancora in anteprima, a un ventesimo del prezzo.
Per la maggior parte dei carichi di lavoro, resta comunque il compromesso giusto — un punto di indice non è una differenza di capacità, mentre lo è un divario di prezzo di 20 volte. Ma è un compromesso diverso da quello pubblicizzato dalle tabelle tariffarie, ed è invisibile a meno che tu non vada a cercare il parametro effort.
Il secondo punto in cui la fascia economica perde è l'aritmetica del contesto lungo. Entrambi i modelli ricalcolano il prezzo dell'intera richiesta una volta superata una soglia, invece di applicare un sovrapprezzo sull'eccedenza, ed entrambe le soglie sono abbastanza basse da contare: 272.000 token di input su GPT-6 Luna, circa 200.000 su Gemini 3.1 Pro. La clausola di GPT-6 Luna raddoppia il prezzo di input e cache e aumenta del 50% quello dell'output. Quella di Gemini 3.1 Pro porta l'intera chiamata a 4,00 $ in input e 18,00 $ in output. Nessuna delle due è un sovrapprezzo marginale, e su un modello che si vende sul prezzo la clausola è il prezzo.
Il terzo è la verbosità, la voce di costo che non compare mai su un listino prezzi. Artificial Analysis ha misurato GPT-6 Luna mentre generava 150 milioni di token in output durante l'esecuzione dell'indice, contro una mediana di 85 milioni: il modello è loquace, e a 0,50 $ per milione di output sono 75 $ di token, laddove un modello conciso ne avrebbe spesi 42,50 $. Resta comunque un ordine di grandezza più economico dell'alternativa. È anche il motivo per cui i numeri di costo per attività e quelli di costo per token raccontano storie diverse, nonché il motivo per cui conviene misurare il proprio volume di output prima di modellare il risparmio.
Come si presenta una migrazione tra loro
Il modello di Google è raggiungibile tramite l'API del fornitore stesso e diverse piattaforme di terze parti; GPT-6 Luna è raggiungibile tramite l'API di OpenAI, e al momento in cui scriviamo nessuno dei due è la metà più semplice della coppia su cui standardizzare. Entrambi espongono una superficie di chat completions compatibile con OpenAI, il che significa che la forma della chiamata non è il problema — i parametri lo sono. La scala di effort di GPT-6 Luna, la sua clausola dei 272.000 token e il suo requisito che la chiamata di funzione su Chat Completions venga eseguita con reasoning effort impostato su none sono tutti comportamenti che Gemini 3.1 Pro non condivide, e un port che cambia solo la stringa del modello produrrà una chiamata funzionante con un profilo di costo errato.
Gemini 3.1 Pro Preview è su OrcaRouter al prezzo di listino di Google, con il prezzo pass-through che significa che una variazione delle tariffe di Google è attiva dalla nostra parte lo stesso giorno. GPT-6 Luna non è nel nostro catalogo al momento in cui scriviamo. Per un team che li usa entrambi — il modello di Google per tutto ciò che richiede audio o video, quello di OpenAI per il testo ad alto volume — è una sola chiave per Gemini 3.1 Pro accanto a qualunque cosa tu già usi per OpenAI, con la decisione di routing espressa come configurazione anziché come due percorsi di codice. È l'abbinamento in cui questo conta di più, perché i due modelli non sono affatto intercambiabili: una route che deve scegliere tra un'anteprima multimodale e un tier piccolo GA solo testo è una route che verrà ridecisa ogni volta che uno dei due fornitori rilascia qualcosa.

Cosa cambierebbe questo
La comparazione così com'è è un'istantanea di un momento insolito: un modello GA di settembre che batte un modello in anteprima di febbraio sull'indice generale a un ventesimo del prezzo di input, pur perdendo sulla modalità e sulla maturità che un'anteprima non si guadagna mai del tutto. Tre cose la smuoverebbero, e ciascuna merita di essere osservata invece che tirata a indovinare.
Il primo è Gemini 3.1 Pro che esce dall'anteprima. Un rilascio GA comporterebbe una politica di deprecazione, un listino prezzi stabile e molto probabilmente un movimento di prezzo — Google ha mantenuto $2.00/$12.00 per sette mesi di anteprima mentre il resto del mercato si dimezzava attorno a essa, e quella moderazione è più coerente con un prezzo di lancio in attesa di una data GA che con una posizione meditata.
Il secondo è se OpenAI estende la scala dei livelli di effort di Luna o ne cambia il valore predefinito. Il divario di ventidue punti tra il punteggio di GPT-6 Luna con effort massimo e il suo punteggio con effort predefinito è la sensibilità di configurazione più ampia in questo articolo, e un cambiamento del valore predefinito modificherebbe la capacità effettiva del modello per ogni chiamante che non ha mai toccato il parametro.
Il terzo è il divario di modalità. È l'unica dimensione qui che non è una questione di grado, ed è quella che impedisce che si tratti di un semplice confronto di prezzo. Finché uno di questi modelli non sarà in grado di fare ciò che l'altro non può, il divario di venti volte è un numero reale che indica due compiti diversi.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
