
GPT-6 Sol vs Gemini 3.1 Pro: Il divario di prezzo è più piccolo di quanto ammetta ciascun post di lancio
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Entrambi i modelli costano $2,00 per milione di token di input. GPT-6 Sol fa pagare $10,00 per milione di token di output; Gemini 3.1 Pro ne fa pagare $12,00. Sulle tariffe di listino, GPT-6 Sol e il Gemini 3.1 Pro uscito da sei mesi sono entro il 20% l'uno dall'altro, il che rende questo il confronto di prezzo meno eclatante della gamma attuale — e il più fuorviante, perché nessuno dei due modelli applica in realtà la propria tariffa di listino per lavori a contesto lungo, e i due confini tra i livelli si collocano in punti diversi e rideterminano i prezzi in direzioni diverse.
Questo è il confronto che vale la pena fare per bene. GPT-6 Sol è stato rilasciato il 22 settembre 2026 a $2/$10, una riduzione del 50% rispetto a GPT-5.6 Sol, con un livello per contesto lungo oltre 272.000 token di input che all'incirca raddoppia l'input e aumenta l'output della metà. Gemini 3.1 Pro è disponibile dal 19 febbraio 2026 a $2/$12, con una soglia di livello a 200.000 token che lo porta a $4/$18 e una tariffa batch di $1/$6. Stesso prezzo di listino, geometria della scheda tariffaria diversa, e l'aritmetica di seguito è ciò che decide quale sia più economico per il tuo traffico.
Due schede tariffarie, disegnate in scala
• Input di base — GPT-6 Sol $2,00 per 1M vs Gemini 3.1 Pro $2,00 per 1M
• Output di base — GPT-6 Sol $10,00 per 1M rispetto a Gemini 3.1 Pro $12,00 per 1M
• Soglia di contesto lungo — GPT-6 Sol oltre 272K di input rispetto a Gemini 3.1 Pro oltre 200K di input
• Tariffa per contesto lungo — GPT-6 Sol circa $4,00 / $15,00 vs Gemini 3.1 Pro $4,00 / $18,00
• Ambito del riprezzamento — GPT-6 Sol riprezza l'intera richiesta vs Gemini 3.1 Pro riprezza l'intera richiesta
• Cache — GPT-6 Sol circa il 90% di sconto sull'input in cache rispetto a Gemini 3.1 Pro, il cui prezzo della cache non è stato ribadito al lancio
• Batch — tariffa batch di GPT-6 Sol non pubblicata rispetto a Gemini 3.1 Pro $1,00 / $6,00
• Finestra di contesto — GPT-6 Sol 872K secondo Artificial Analysis, 1,05M dichiarati contro 1M di input di Gemini 3.1 Pro
• Output massimo — GPT-6 Sol 128K vs Gemini 3.1 Pro circa da 64K a 66K
• AA Intelligence Index (v4.3.2) — GPT-6 Sol 48 vs Gemini 3.1 Pro 30

Da ciò derivano due punti strutturali. In primo luogo, le soglie del contesto lungo sono vicine tra loro ma non identiche — 272K contro 200K — ed entrambe applicano la tariffa più alta all'intera richiesta anziché all'eccedenza. Una chiamata che porta 210K token paga la tariffa premium su Gemini 3.1 Pro e la tariffa base su GPT-6 Sol. È in quella fascia di 72.000 token che i due modelli divergono maggiormente sul prezzo.
Secondo, lo spazio di output non è comparabile. GPT-6 Sol consente 128K token di output; Gemini 3.1 Pro si ferma intorno ai 64K-66K. Se il tuo carico di lavoro genera artefatti lunghi — riscritture complete di file, bozze di lungo periodo, lunghe tracce di chain-of-thought che effettivamente conservi — quel limite conta più della differenza di $2 sul prezzo dell'output.
Un esempio svolto, perché i tassi di facciata nascondono la risposta
Prendi un carico di lavoro mensile realistico: 10 milioni di token di input e 2 milioni di token di output, tutti a contesto breve.
• GPT-6 Sol — 10M di input a $2,00 sono $20,00, 2M di output a $10,00 sono $20,00. Totale: $40,00
Gemini 3.1 Pro — 10M di input a 2,00 $ sono 20,00 $, 2M di output a 12,00 $ sono 24,00 $. Totale: 44,00 $.
GPT-6 Sol costa il 9% in meno. È tutto qui il divario, ed è così piccolo che una singola decisione ingegneristica altrove nello stack può cancellarlo.
Ora rendi lo stesso carico di lavoro a contesto lungo — un agente che porta 300K token di stato di lavoro a ogni chiamata. Entrambi i modelli superano le loro soglie.
• GPT-6 Sol — input a circa $4,00 dà $40,00, output a circa $15,00 dà $30,00. Totale: $70,00
• Gemini 3.1 Pro — input a $4,00 dà $40,00, output a $18,00 dà $36,00. Totale: $76,00
Entrambe le bollette quasi raddoppiano e GPT-6 Sol resta in vantaggio, ma il divario è ancora inferiore al 10%. Il contesto lungo non rompe questo confronto; rende solo entrambe le opzioni costose.
Il caso interessante è quello del caching e del batching, dove i due fornitori hanno fatto scommesse diverse. Se l'80% del tuo input è un prefisso stabile, lo sconto sulla cache di circa il 90% di GPT-6 Sol cambia notevolmente i calcoli: 8M di token in cache a circa $0,20 per milione fanno $1,60, più 2M di token nuovi a $2,00 per $4,00, più $20,00 di output, per un totale vicino a $25,60. La tariffa batch di Gemini 3.1 Pro fa lo stesso genere di lavoro dalla direzione opposta: con $1,00 di input e $6,00 di output, lo stesso carico di lavoro da 10M/2M si attesta a $10,00 più $12,00, ovvero $22,00.
Quindi il riepilogo onesto è questo: GPT-6 Sol vince sul traffico interattivo e sui carichi di lavoro con prefisso in cache, Gemini 3.1 Pro vince su tutto ciò che si può mettere in batch, e la differenza tra i due casi migliori è di qualche dollaro ogni dieci milioni di token. Questa non è una decisione di prezzo. È una decisione sulla forma del carico di lavoro.
Il divario di capacità è la decisione effettiva
Cinquantuno punti Index separano questi modelli sulla stessa classifica: GPT-6 Sol a 48, Gemini 3.1 Pro a 30. Non sono affatto vicini, ed è per questo che la parità di prezzo è una curiosità più che una minaccia competitiva.
L'Intelligence Index di Artificial Analysis è un indice composito, e gli indici compositi possono risultare lusinghieri. Ma un divario di quella entità regge in tutti i benchmark componenti pubblicati da ciascun fornitore:
• AA Intelligence Index — GPT-6 Sol 48, al 18° posto su 212 contro Gemini 3.1 Pro 30, all'81° posto su 212
• Velocità di output — GPT-6 Sol 104,4 token/sec vs Gemini 3.1 Pro 115,0 token/sec
• Tempo al primo token — GPT-6 Sol 107,18s vs Gemini 3.1 Pro 32,96s, rispetto a una mediana del board di 3,87s
• GPQA Diamond — Gemini 3.1 Pro 94,3% (dato riportato da Google)
• ARC-AGI-2 — Gemini 3.1 Pro 77,1% (riportato da Google)
• HLE — Gemini 3.1 Pro 44,4% (riportato da Google)
• SWE-bench Verified — Gemini 3.1 Pro 80,6% (dato riportato da Google)
• Terminal-Bench 2.0 — Gemini 3.1 Pro 68,5% (dato riportato da Google)
• LiveCodeBench Pro — Gemini 3.1 Pro 2887 Elo (riportato da Google)
Leggi attentamente quei numeri di Google, perché non sono deboli. Un 94,3% su GPQA Diamond e un 77,1% su ARC-AGI-2 sono risultati solidi, e sono stati pubblicati a febbraio. Il motivo per cui l'Index colloca ancora Gemini 3.1 Pro trenta punti più in basso è che l'Index dà molto peso ai compiti agentici e a lungo orizzonte, ed è lì che si fanno sentire i sei mesi tra queste due release. Gemini 3.1 Pro è un forte modello di ragionamento. GPT-6 Sol è un forte agente.
La linea della latenza è dove Gemini 3.1 Pro vince nettamente e non è una vittoria da poco. Un primo token a 33 secondi è lento in termini assoluti — la mediana della classifica è di 3,87 secondi — ma è un terzo dei 107 secondi di GPT-6 Sol. Per qualsiasi cosa una persona attenda, Gemini 3.1 Pro è l'unico dei due che sia minimamente utilizzabile. Il primo token a 107 secondi di GPT-6 Sol è il numero che ucciderà più progetti pilota, e vale la pena notare che il suo throughput una volta avviato è eccellente: 104,4 token al secondo non è significativamente dietro ai 115,0 di Gemini. Il modello non è lento. È lento a iniziare.
La cosa a cui Gemini 3.1 Pro non è sfuggito
Gemini 3.1 Pro è in anteprima da febbraio. Sei mesi sono tanti per portare l'etichetta di anteprima, e nel frattempo Google ha rilasciato i modelli Flash 3.5, 3.6 e 3.8 senza promuovere Gemini 3.1 Pro alla disponibilità generale. Su OrcaRouter lo slug instradabile è ancora gemini-3.1-pro-preview, e una variante separata gemini-3.1-pro-preview-customtools esiste in parallelo.
Questo conta per il procurement in un modo in cui i benchmark non contano. Gli endpoint di anteprima possono cambiare sotto i tuoi piedi, essere deprecati con breve preavviso e avere limiti di frequenza diversi rispetto a un modello GA. Se oggi stai costruendo su Gemini 3.1 Pro, stai costruendo su un'anteprima, e dovresti prezzare di conseguenza il rischio di migrazione — soprattutto quando i modelli Flash più recenti di Google lo hanno già superato su diversi fronti.
GPT-6 Sol non ha quel problema, ma ne ha un altro: la disponibilità al lancio era più limitata di quanto lasciasse intendere l'annuncio. È presente nell'API, in ChatGPT Work e in Codex sui piani a pagamento — e gli amministratori Enterprise devono abilitarlo prima che i loro utenti possano vederlo. Non è presente in ChatGPT Chat. Un flagship che salta la superficie consumer è un flagship mirato agli sviluppatori.
Eseguire quello economico e quello buono insieme
Questo è il raro confronto in cui la risposta è ovviamente «entrambi», e il prezzo lo conferma. Gemini 3.1 Pro è il modello da mettere davanti a una persona: primo token rapido, tariffe batch che rendono economici i lavori in blocco, solidi punteggi di ragionamento pubblicati. GPT-6 Sol è il modello da mettere dietro una coda: lento a partire, throughput eccellente, cinquantuno punti Index in più, e a un prezzo entro il 20% rispetto al modello che sostituisce sul lavoro interattivo.
Gemini 3.1 Pro è su OrcaRouter al prezzo di listino di Google, nell'ambito del modello pass-through ciò significa che una variazione di prezzo di Google è attiva dalla nostra parte lo stesso giorno invece di aspettare che un rivenditore rinegozi. GPT-6 Sol non è nel nostro catalogo al momento in cui scriviamo — è raggiungibile tramite l'API di OpenAI stessa — quindi un percorso che copre entrambi significa una chiave per Gemini e un'integrazione diretta con OpenAI accanto. L'instradamento tra un modello di anteprima veloce e un modello di frontiera più lento è esattamente il caso per cui è stato creato il failover automatico: quando l'endpoint di anteprima si degrada o viene deprecato, il percorso si sposta, e lo scopri da una riga di log anziché dai tuoi utenti.

La regola di decisione
Scegli Gemini 3.1 Pro quando un essere umano è in attesa, quando il lavoro è batchabile o quando l'output resta breve. Un primo token a 33 secondi non è un granché, ma è tre volte meglio di quello di GPT-6 Sol, e la tariffa batch da 1 $/6 $ è il modo più economico per far passare un grande corpus attraverso un potente modello di ragionamento. Accetta il fatto di trovarti su un endpoint di anteprima e pianifica la migrazione.
Scegli GPT-6 Sol quando il lavoro è agentico, a lungo orizzonte e senza supervisione, e quando il tuo contesto resta sotto i 272K token. Ottiene 48 contro 30, produce 128K di output contro circa 64K, e il suo prezzo con prefisso in cache con uno sconto del 90% rende i cicli agentici ripetitivi insolitamente economici. Il suo primo token in 107 secondi è una caratteristica del suo modo di ragionare, non un bug, e diventa un problema solo quando lo metti davanti a qualcuno.
Non scegliere in base al prezzo. I due sono entro il 9% l'uno dall'altro su un carico di lavoro con contesto breve e entro il 10% su uno con contesto lungo. La differenza mensile di nove dollari su un libro da dieci milioni di token non è una ragione per scegliere l'uno o l'altro modello, mentre lo è il divario di cinquantuno punti dell'Index.

Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
