
GPT-6 vs Gemini 3.1 Pro: il tier Pro di Google non ha rilasciato un nuovo modello da febbraio
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Gemini 3.1 Pro has been on Google's price list for seven and a half months and has never left preview. It was announced on 19 February 2026, it is still served under an endpoint named Gemini 3.1 Pro Preview, and as of today there is no general-availability commitment and no shutdown date — the two dates that would tell you where the model sits in its own vendor's plan. GPT-6 Sol, by contrast, shipped on 22 September 2026, and on 7 October 2026 it became the model behind the paid tiers of ChatGPT's global rollout to more than 1.2 billion weekly users.
So the headline comparison is not between two flagship tiers. It is between a shipping product and an open-ended preview, and that difference turns out to be worth more than the benchmark gap does. Put them side by side on Artificial Analysis's Intelligence Index v4.3.2 and Google's seven-month-old preview scores 29.7 against GPT-6 Sol's 47.6 while charging 1.25× more per completed index task — $1.30 against $1.04. Both of those numbers are real, and both need a caveat attached before you spend money on them.
Ciò che rende questa cosa degna di essere letta anziché liquidata è che l’anteprima vince davvero qualcosa. Supera GPT-6 Sol su GPQA Diamond, su τ²-Bench nell’uso agentico degli strumenti e su una misurazione a contesto lungo — e accetta audio e video come input, cosa che GPT-6 Sol non fa. Un’anteprima vecchia di sette mesi che vince ancora due incontri su quattro non è un modello da scartare. È un modello il cui problema è il ciclo di vita, non la capacità.
I numeri, e l'avvertenza di revisione che deve accompagnarli
Artificial Analysis riesegue la sua suite e ripubblica i punteggi secondo la revisione corrente dell'indice, il che significa che lo stesso modello può riportare due numeri diversi a seconda di quando lo si legge. Per Gemini 3.1 Pro questa varianza è insolitamente ampia: la copertura precedente di questo modello riportava 57 su una revisione più vecchia, mentre la pagina così com'è oggi riporta 29,7 su v4.3.2. Entrambi i valori sono autentici ed entrambi si trovano sullo stesso sito web.
Questo è importante perché solo i valori provenienti dalla stessa revisione sono sottraibili. Il 29,7 e il 47,6 sono la coppia da usare qui, poiché entrambi provengono dalla v4.3.2 — la stessa esecuzione che assegna a Claude Opus 5.5 un punteggio di 57,6 e a GPT-6 Astra 52,7. La lettura della stessa esecuzione, una riga per dimensione:
• Indice di intelligenza, v4.3.2 — GPT-6 Sol 47,6 vs Gemini 3.1 Pro 29,7
• Costo per attività dell'indice completata — Gemini 3.1 Pro $1,30 vs GPT-6 Sol $1,04; il modello più vecchio costa il 25% in più per ogni risposta completata
• Prezzo di input — $2,00 per 1M su entrambi, identico a livello di listino
• Prezzo di output — GPT-6 Sol $10,00 vs Gemini 3.1 Pro $12,00; Sol costa il 17% in meno
• Clausola per contesto lungo — GPT-6 Sol ricalcola l'intera richiesta a $4,00/$15,00 oltre 272.000 token di input; Gemini 3.1 Pro passa a $4,00/$18,00 oltre 200.000
• Finestra di contesto — GPT-6 Sol 1.050.000 token vs Gemini 3.1 Pro 1.048.576, effettivamente identiche
• Output massimo — GPT-6 Sol 128.000 token vs Gemini 3.1 Pro 65.536; Sol è quasi il doppio
• Modalità di input — GPT-6 Sol testo, immagine, file vs Gemini 3.1 Pro testo, immagine, audio, video, PDF

Due righe lì meritano un approfondimento, perché capovolgono la lettura più ovvia. La riga del costo per attività dice che il listino dall'aria più economica appartiene al modello più costoso per singolo lavoro completato — la tariffa di output di 12 $ di Gemini 3.1 Pro, insieme al suo volume di ragionamento, svolge più lavoro di quanto suggerisca la sua tariffa di input nominale di 2 $. E il passaggio al contesto lungo vale la pena rileggerlo da entrambe le parti: la fascia di Gemini 3.1 Pro inizia a 200.000 token, inferiore ai 272.000 di GPT-6 Sol, ma rimodula il prezzo dell'output a 18,00 $, mentre Sol lo rimodula a 15,00 $. Nessuno dei due è un listino a tariffa fissa, e i punti di incrocio non coincidono.
Dove l'anteprima vince ancora
Google's model is not a relic. Pull the evaluations both cards carry:
• GPQA Diamond — Gemini 3.1 Pro 94,1% vs GPT-6 Sol, nessun dato comparabile pubblicato in questa revisione
• τ²-Bench sull'uso agentico degli strumenti — Gemini 3.1 Pro 95,6% vs GPT-6 Sol, non pubblicato sulla stessa classifica
• Richiamo su contesto lungo — Gemini 3.1 Pro 82,0% vs GPT-6 Sol 83,7%, uno scarto di 1,7 punti
• SciCode — Gemini 3.1 Pro 58,7% vs GPT-6 Sol 57,6%, praticamente allo stesso livello
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% vs GPT-6 Sol 43,9%; l'unica categoria in cui l'anteprima non è competitiva

Un 94,1% su GPQA Diamond e un 95,6% nel punteggio di uso agentico degli strumenti sono numeri di frontiera, non numeri del passato, ed è per questo che il divario di 17,9 punti nell'indice sovrastima la distanza pratica. L'indice è un composito su dieci valutazioni, e le perdite di Gemini 3.1 Pro si concentrano dove la suite è fortemente orientata all'ingegneria del software: il 4,0% su Terminal-Bench 4.0 è un outlier catastrofico accanto al suo 58,7% su SciCode e al suo 73,8% su Terminal-Bench 2.1. Un modello che si colloca vicino ai vertici in un benchmark agentico e vicino al fondo del suo successore ti sta dicendo qualcosa sulla sua data di addestramento, non sul suo tetto di capacità.
L'input audio e video è l'altro vantaggio concreto, ed è un cancello piuttosto che un gradiente. Se la tua pipeline accetta come input la registrazione di una riunione o la cattura dello schermo, Gemini 3.1 Pro può entrarci e GPT-6 Sol no. Nessuna quantità di leadership negli indici può sostituire questo.
Quanto ti costa, concretamente, "ancora in anteprima"
Lo stato di anteprima non è un'etichetta cosmetica, e i costi sono di quelli che emergono solo dopo che ci hai costruito sopra qualcosa.
A preview endpoint carries no general-availability commitment, which means the vendor has not promised the model will still be there on a schedule you can plan around. It also carries no shutdown date, which sounds like the good version of that — nothing is being retired — but reads the other way too: Google has not published a lifecycle for a model that has been in this state since February while shipping Flash-tier models through the same period. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, the 3.6 and 3.8 Flash line: the Pro tier stayed where it was, and the successor arrived instead as Gemini 4 Argon, which Google announced on 30 September 2026 in a phased rollout to a named cohort of security partners with no general-availability date attached either.
That is the pattern this comparison is really about. If you build a durable pipeline on Gemini 3.1 Pro Preview, you are building on a model whose own vendor has not said when it will graduate, replace or retire it. GPT-6 Sol's position is the opposite: it is a generally available API product with a published rate card, and since 7 October 2026 it is also the default in the app most of your colleagues use. Vendor-reported and as yet unreproduced, OpenAI says that in ChatGPT GPT-6 composes answers using text, graphics, charts and interactive controls through a capability it calls Intelligent UI, answers that need web search begin 44% sooner than GPT-5.6 Instant, and the Extra High effort level begins responding as fast as GPT-5.6 at Medium. None of that changes an API integration. All of it is why GPT-6 is now the ambient default and the preview is not.
Esiste anche una versione semplice dell'argomento. Stai pagando il 25% in più per ogni attività completata, con un punteggio di capacità inferiore, per un modello il cui ciclo di vita non è dichiarato. La controargomentazione è reale — ottieni GPQA Diamond al 94,1% e input audio — ma è un argomento specifico per un carico di lavoro specifico, non una ragione generale per preferire il modello più vecchio.
Testare un'anteprima senza scommettere su di essa
The mistake to avoid with a model in Gemini 3.1 Pro's position is to treat "should we use it" as a single binary decision. It is not. Both Gemini 3.1 Pro Preview and GPT-6 Sol sit on OrcaRouter's catalogue behind one OpenAI-compatible endpoint and one key, at 0% markup over provider list price — so the preview is something you can put in a real request path, measure against your own workloads, and keep or drop without a second vendor contract or a code change.
Il failover automatico è ciò che lo rende sicuro per un modello in un ciclo di vita di anteprima. Instrada il traffico audio e video verso Gemini 3.1 Pro, dove è l'unico dei due in grado di accettare l'input; instrada il traffico di ingegneria del software e di output lungo verso GPT-6 Sol; e configura il fallback in modo che, se l'endpoint di anteprima viene deprecato, soggetto a limiti di frequenza o silenziosamente riprezzato, la richiesta arrivi su un modello in disponibilità generale invece di fallire. Questa è la struttura che un'anteprima di sette mesi si merita — non l'evitamento, ma un percorso che non dipende da essa.
Se vuoi spingerti oltre, il DSL di routing compone diversi modelli in un'unica chiamata logica, così una richiesta può essere provata su Gemini 3.1 Pro e GPT-6 Sol e la risposta selezionata in base ai tuoi criteri anziché a quelli di un singolo fornitore. La fusione di modelli fa la stessa cosa nella direzione opposta — un panel di modelli che rispondono a una sola domanda — il che è un modo ragionevole per scoprire dove i punti di forza specifici di una preview valgono la spesa prima di impegnare un percorso di produzione su di essa.

Il verdetto, e il numero da tenere d'occhio
Per i nuovi lavori, GPT-6 Sol è la scelta più sicura su quattro delle sei dimensioni che decidono un deployment, ed è più economico per attività completata, con un punteggio superiore di 17,9 punti indice alla stessa revisione. Per i carichi di lavoro che richiedono input audio o video, o in cui il 94,1% su GPQA Diamond è ciò che si sta acquistando, Gemini 3.1 Pro Preview vince ancora e l'etichetta preview è un rischio da gestire, non un motivo per rinunciare.
Il numero da tenere d'occhio non è l'indice. È la data nel nome dell'endpoint di Gemini 3.1 Pro. Quando il suffisso preview verrà rimosso — o quando Argon raggiungerà la disponibilità generale con un vero identificatore API — questo confronto cambia completamente forma, e il divario di sette mesi tra l'ultimo rilascio del livello Pro e oggi diventa ciò di cui parla l'articolo.
Confrontati in questo articolo3
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
