
GPT-6.1 Sol contro Gemini 3.1 Pro: sette mesi di anteprima contro otto giorni di rilascio
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Gemini 3.1 Pro figura nel listino prezzi del fornitore da sette mesi e mezzo e non ha mai lasciato l'anteprima. Annunciato il 19 febbraio 2026, documentato oggi su un endpoint che termina con -preview, senza alcun impegno alla disponibilità generale e — cosa ancora più significativa — nemmeno una data di dismissione. GPT-6.1 Sol ha otto giorni, rilasciato il 29 settembre 2026 a 2,00 $ per milione di token in input e 10,00 $ per milione di token in output. Metteteli fianco a fianco sull'Artificial Analysis Intelligence Index e l'anteprima di sette mesi non è semplicemente competitiva: è a 22 punti dal modello più recente sulla revisione più nuova dell'indice — 29,7 contro 51,8 sulla v4.3.2 — pur costando 1,8× di più per attività dell'indice, 1,30 $ contro 0,72 $. È questa combinazione a rendere il confronto interessante e non una formalità: su questa classifica il modello più vecchio è sia indietro in capacità sia avanti sul costo, il che è il verso sbagliato per un'anteprima che avrebbe dovuto diventare definitiva. Ma il caveat sulla revisione dell'indice qui conta più che in qualsiasi altro punto di questo insieme, perché sia 29,7 sia 53 vengono citati sullo stesso sito e non sono la stessa misura.
Entrambi sono grandi modelli multimodali con finestre di contesto di classe 1M. Gemini 3.1 Pro accetta testo, immagini, video, audio e PDF con un tetto di output di 65.536 token e una fascia di prezzo di 200.000 token oltre la quale la tariffa raddoppia. GPT-6.1 Sol accetta testo, immagini e file con una finestra di 1.050.000 token, un tetto di output di 128.000 token, cinque livelli di sforzo di ragionamento e una fascia di contesto lungo oltre 272.000 token di prompt. Uno è un prodotto già disponibile con un impegno di supporto. L'altro è un'anteprima con un ciclo di vita aperto, e questa differenza si rivela valere più del divario nell'indice.
Al numero di indice deve essere allegata la sua revisione.
Artificial Analysis riesegue la propria suite e ripubblica i punteggi in base alla revisione attuale dell'indice, il che significa che lo stesso modello può riportare due numeri diversi a seconda di quando lo si legge. Per Gemini 3.1 Pro quel divario è insolitamente ampio: la precedente copertura della testata su questo modello riportava 57 su una revisione più vecchia, mentre la pagina così com'è oggi riporta 29,7 su v4.3.2, la versione a dieci valutazioni che riporta anche il 51,8 di GPT-6.1 Sol. Entrambi i valori sono reali ed entrambi si trovano sullo stesso sito web.
Ciò che questo significa per un confronto è di portata ristretta e importante. Solo i numeri della stessa revisione sono sottraibili tra loro. Un 29,7 e un 51,8 della v4.3.2 producono un divario di 22 punti; un 57 e un 51,8 producono un divario di cinque punti nella direzione opposta. La cifra di 22 punti è quella da usare qui, perché è quella in cui entrambi i modelli sono stati misurati dalla stessa suite sulla stessa scala — e perché le cifre del costo per attività, 1,30 $ contro 0,72 $, provengono da quella stessa esecuzione.
• Indice di intelligenza, v4.3.2 — GPT-6.1 Sol 51,8 vs Gemini 3.1 Pro 29,7
• Costo per attività di indicizzazione — GPT-6.1 Sol $0,72 vs Gemini 3.1 Pro $1,30
• Costo per eseguire l'intera suite — GPT-6.1 Sol 1.082 $ vs Gemini 3.1 Pro 1.935 $
• Finestra di contesto — GPT-6.1 Sol 1.050.000 token vs Gemini 3.1 Pro 1.000.000 token
• Output massimo — GPT-6.1 Sol 128.000 token vs Gemini 3.1 Pro 65.536 token
• Modalità di input — testo, immagine e file su entrambi, più video, audio e PDF su Gemini 3.1 Pro
Due di quelle righe favoriscono l'anteprima e meritano di essere dette chiaramente. Gemini 3.1 Pro accetta video e audio, cosa che GPT-6.1 Sol non fa; se la tua pipeline acquisisce una registrazione dello schermo o una chiamata, si tratta di un divario di capacità che nessun punteggio colma. E il suo tetto di output di 65.536 token è la metà di quello di GPT-6.1 Sol, il che conta per la generazione di testi lunghi ma raramente è vincolante nel lavoro agentico, dove gli output sono brevi e i turni numerosi.
Perché il numero più recente è quello che dovrebbe guidare la tua decisione
La questione del prezzo è più interessante della questione dell'indice.
Il tariffario di Gemini 3.1 Pro è di $2.00 in input e $12.00 in output per milione di token, con input in cache a $0.20 e scritture in cache a $0.375, e una soglia di fascia a 200.000 token di prompt oltre la quale le tariffe diventano $4.00 e $18.00. GPT-6.1 Sol è a $2.00 in input e $10.00 in output, con input in cache a $0.10, scritture in cache a $2.50 e una soglia a 272.000 token oltre la quale le sue tariffe diventano $4.00 e $15.00. Il prezzo di input principale è identico. Il prezzo di output è inferiore del 20% su GPT-6.1 Sol, e il salto per il contesto lungo è più basso su entrambi gli assi. È sulla cache che i due tariffari si separano: $0.10 contro $0.20 per milione di token di input in cache, con il modello preview che scrive la cache a un costo inferiore, $0.375 contro $2.50.

Quell'ultima coppia inverte la lettura superficiale. Se il tuo carico di lavoro è intensivo nell'uso della cache — un lungo prompt di sistema fisso reinviato a ogni turno, o un documento riletto nel corso di una sessione — la voce di scrittura in cache di Gemini 3.1 Pro è drasticamente più economica e la sua voce di lettura dalla cache è doppia. Quale modello vince dipende da quante volte rileggi ciò che hai scritto, e questo è un numero che i tuoi log contengono e che nessun benchmark pubblica. Ciò che non è ambiguo è il costo dell'indice: su un lavoro di valutazione identico, il modello vecchio di otto giorni ha terminato con un costo inferiore del 33%, e l'anteprima vecchia di sette mesi ha terminato con un costo superiore del 79% rispetto al modello più nuovo nel complesso.
Il badge di anteprima è il fatto operativo
Questa è la parte del confronto che una tabella dei punteggi non può trasmettere e, per un deployment in produzione, supera in importanza tutto quanto sopra.
Gemini 3.1 Pro è in anteprima da febbraio, senza un annuncio di disponibilità generale e senza una data di dismissione. Entrambe le assenze contano e vanno in direzioni opposte. L'assenza di disponibilità generale significa nessun impegno sul ciclo di vita: gli endpoint in anteprima non sono coperti dagli stessi termini di preavviso di deprecazione di quelli in disponibilità generale, e possono essere modificati sotto il chiamante senza un incremento di versione, che è la ragione standard per fissare un identificatore esatto del modello in produzione anziché un alias. L'assenza di una data di dismissione significa che non puoi pianificare nemmeno una finestra di migrazione — il modello è già sopravvissuto al trimestre in cui tutti si aspettavano che passasse a disponibilità generale, e questa famiglia ha già dismesso un modello Pro in passato.
La posizione di GPT-6.1 Sol è l'immagine speculare. Ha otto giorni di vita, il che significa che il suo record di valutazione indipendente copre una sola configurazione e le sue modalità di errore non sono documentate; non c'è alcun corpus di professionisti da consultare quando si comporta male. Il suo stesso rilascio è stato la notizia, e viene distribuito con una struttura di supporto che l'anteprima non ha.
Quelli sono rischi diversi, non quantità diverse di rischio. Scegli la preview e stai scommettendo che il fornitore continui a servire un endpoint senza alcun obbligo contrattuale di farlo. Scegli il modello vecchio di otto giorni e stai scommettendo che una singola esecuzione di benchmark e otto giorni di disponibilità siano prove sufficienti per il tuo carico di lavoro. L'indice non aiuterà in nessuno dei due casi.
L'unica cosa che renderebbe questo facile
Un annuncio di disponibilità generale per Gemini 3.1 Pro, con un identificatore di modello al di fuori del namespace -preview e un impegno pubblicato sul ciclo di vita, risolverebbe gran parte di questo. Non colmerebbe il divario di 22 punti nell'indice né il divario di costo per attività di 1,8×, ma eliminerebbe il rischio di deprecazione che attualmente rende il confronto sbilanciato, e consentirebbe a un team di adottare il modello senza dover fissare un identificatore di anteprima e sperare.
L'assenza di quell'annuncio, dopo sette mesi e mezzo, è di per sé un'informazione. Un'anteprima che doveva servire a validare gli aggiornamenti prima del passaggio in GA "a breve", secondo la formulazione del fornitore di febbraio, ha avuto due trimestri interi per farlo. O la validazione è ancora in corso, oppure l'anteprima è il prodotto — e un chiamante non può capire quale delle due cose dall'esterno. Ciò che un chiamante può fare è prezzare l'incertezza e instradare di conseguenza.
Entrambi su una sola chiave, così la risposta può essere per workload

Gemini 3.1 Pro è su OrcaRouter alle sue tariffe indicate — $2,00 / $12,00, che salgono a $4,00 / $18,00 oltre 200.000 token di prompt, con letture dalla cache a $0,20. GPT-6.1 Sol è su OrcaRouter a $2,00 / $10,00, che salgono a $4,00 / $15,00 oltre 272.000 token di prompt, con letture dalla cache a $0,10. Prezzo di listino del provider su entrambi, nulla in aggiunta, una chiave e una fattura.
Questo rende poco costoso risolvere le parti scomode di questo confronto. L’ingest di video e audio resta sulla preview perché nessun altro elemento della coppia lo accetta; il lavoro su testo e codice ad alto volume va al modello più recente, che costa meno per attività ed è più economico del 33% su un identico lavoro di valutazione. Se l’endpoint preview viene revisionato o ritirato, il failover automatico sposta quelle chiamate su un’altra rotta invece di farle fallire — ed è proprio la protezione richiesta dal rischio legato al ciclo di vita di una preview. E poiché entrambi stanno dietro un unico endpoint compatibile con OpenAI, il confronto prezzi che conta davvero può essere eseguito sul tuo traffico in un pomeriggio invece di essere discusso sulla base di un listino.

La lettura difendibile, quindi, non è quale modello sia migliore. È che questi due hanno un prezzo quasi equivalente pur essendo distanti sette mesi in maturità del ciclo di vita e 22 punti nella classifica indipendente attuale, e che i reali vantaggi del modello in anteprima — input video e audio, scritture in cache economiche — sono ristretti e specifici. Se il tuo carico di lavoro richiede quelle modalità, Gemini 3.1 Pro è l'unica opzione tra le due e il divario nell'indice è il prezzo d'ingresso. In caso contrario, ti viene offerto un endpoint in anteprima con un futuro aperto a un costo per attività superiore dell'80% rispetto a un modello rilasciato la settimana scorsa, e l'onere della prova va nella direzione opposta.
