Card del titolo con scritto “Grok 4.7 vs Gemini 3.1 Pro” e il sottotitolo “La classifica si è mossa; il modello no”, e tre card: AA Index v4.3.2 46 vs 30, Prezzo standard per 1M $2/$6 vs $2/$12, e Stato GA vs anteprima.
Guides & Insights

Grok 4.7 vs Gemini 3.1 Pro: la classifica si è mossa, il modello no

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il 19 febbraio 2026, Artificial Analysis ha pubblicato un articolo intitolato "Gemini 3.1 Pro Preview: il nuovo leader nell'IA". Era in testa in sei valutazioni su dieci e distanziava di quattro punti Claude Opus 4.6. Leggi oggi la pagina di quello stesso modello e il numero è 30, al sessantanovesimo posto su 200. Il fornitore non ha cambiato nulla. Ciò che è cambiato è il metro: Artificial Analysis ha revisionato il suo Intelligence Index alla v4.3.2 il 19 settembre 2026, ricalcolando il punteggio di ogni modello del catalogo rispetto a un diverso insieme di valutazioni, e un leader di febbraio è diventato un centrocampista di settembre mentre il modello stesso è rimasto intatto in anteprima. Questo è lo sfondo di un confronto con Grok 4.7 — rilasciato dal fornitore il 21 settembre 2026 — ed è il motivo per cui questa sfida riguarda meno quale modello sia più intelligente e più su quale dei due puoi ancora contare sul fatto che sia la stessa cosa il mese prossimo.

Che cosa è in realtà ognuno di questi

Gemini 3.1 Pro è il più recente modello di fascia Pro di Google e non ha mai raggiunto la disponibilità generale. È stato distribuito come gemini-3.1-pro-preview il 19 febbraio 2026, e la tabella delle deprecazioni di Google lo elenca ancora con "nessuna data di disattivazione annunciata" — un'anteprima che ormai è in anteprima da sette mesi, mentre Google ha distribuito una scala Flash sotto di essa: 3.5 Flash a maggio, 3.6 a luglio, 3.7 ad agosto, 3.8 a settembre. Non esiste alcun modello Pro GA più recente di Gemini 3 Pro. Ha una finestra di input di 1.048.576 token e un tetto di output di 65.536 token, accetta in input testo, immagini, video, audio e PDF con output testuale, ed espone un controllo del livello di pensiero su basso, medio e alto senza parametro di budget e senza impostazione minima. I pesi sono chiusi.

Grok 4.7 ha un giorno di vita ed è anche a pesi chiusi. Mantiene un contesto di 500k token — la metà di quello di Gemini — e accetta in input testo e immagini, quindi non può acquisire video o audio in alcun modo, che è la differenza di capacità più netta in questo confronto. Ha un prezzo di listino di $2,00 per milione di token di input e $6,00 per milione di token di output sotto i 200k token di prompt, passando a $4,00 e $12,00 sopra quella soglia, con letture dalla cache a $0,50 e $1,00; xAI elenca anche una variante più veloce a circa il doppio della velocità di output e il doppio del prezzo. Non è pubblicato alcun valore massimo di output per esso nella documentazione consultata qui.

Il sovrano si è mosso. Questa è la storia.

Entrambi i modelli sono attualmente valutati su Artificial Analysis Intelligence Index v4.3.2, che ha sostituito Terminal-Bench 2.1 con Terminal-Bench 4.0 e tau3-Banking con AutomationBench-AA, e ha riancorato la scala Elo GDPval-AA. Il numero di ogni modello si è spostato quando è stato pubblicato. Quello di Gemini 3.1 Pro si è spostato più di molti altri, perché i suoi punti di forza di febbraio erano concentrati in valutazioni che il nuovo indice ha ritirato o riponderato. Leggendo oggi le due colonne affiancate:

Composito — Grok 4.7 (xhigh): 46 sull'Artificial Analysis Intelligence Index v4.3.2. Gemini 3.1 Pro Preview: 30 sulla stessa revisione, classificato #69 su 200.

Contesto lungo — Grok 4.7: finestra da 500k, AA-LCR v1.1 77%. Gemini 3.1 Pro: finestra da 1M — grande il doppio — e un tetto di output di 65K che è circa la metà di ciò che di solito richiede una sessione agentica a contesto lungo.

Modalità di input — Grok 4.7: testo e immagini. Gemini 3.1 Pro: testo, immagini, video, audio e PDF. Non c'è partita, e non è un divario da benchmark — è un divario di capacità.

Velocità — Grok 4.7: nessuna misurazione pubblicata finora. Gemini 3.1 Pro: 124,4 token di output al secondo, classificato #39 su 200, con un tempo al primo token di 63,62 secondi tramite Google AI Studio.

Prezzo, livello standard — Grok 4.7: $2,00 in input / $6,00 in output per 1M. Gemini 3.1 Pro: $2,00 in input / $12,00 in output. Input identico, output doppio.

Prezzo, fascia long-context — Grok 4.7: raddoppia a $4.00 / $12.00 a 200k token di prompt. Gemini 3.1 Pro: sale a $4.00 / $18.00 alla stessa soglia di 200k. Stesso input, 50% di output in più.

Maturità — Grok 4.7: un giorno di vita, benchmark del fornitore in gran parte non riprodotti. Gemini 3.1 Pro: sette mesi sul mercato, ma ancora una build di anteprima senza impegno alla disponibilità generale e senza data di dismissione.

OrcaRouter model page for Gemini 3.1 Pro Preview showing the google/gemini-3.1-pro-preview identifier, a 1M-token context window, a 65K maximum output, audio, file, image, text and video input with text output, and list rates of $2.00 per 1M input and $12.00 per 1M output.

Ora il problema dell'anteprima è reale

Un'anteprima di sette mesi sarebbe una stranezza più che un rischio se nulla fosse andato storto. Invece qualcosa è andato storto. Dal 18 settembre 2026, gli utenti hanno iniziato a segnalare che Gemini 3.1 Pro era sparito dal selettore di modelli di AI Studio e, al momento in cui scriviamo, non c'è stata alcuna risposta da parte del personale Google, nessun avviso di deprecazione e nessuna causa dichiarata: un incidente di disponibilità irrisolto più che un ritiro confermato. Mettete questo accanto alla cronologia degli annunci: Google ha dichiarato all'I/O di maggio 2026 che Gemini 3.5 Pro "sarebbe stato distribuito il mese successivo", e i resoconti della stampa di fine agosto dicevano che quel modello era stato accantonato perché i candidati interni "non erano sufficientemente migliori della serie Flash". La pagina Pro di Google stessa pubblicizza ancora "3.5 Pro in arrivo", che è la contraddizione racchiusa in una sola schermata. Qualunque sia la soluzione, la lettura pratica è che Gemini 3.1 Pro è un endpoint di anteprima senza data di GA, senza un successore nominato e con un punto interrogativo sulla disponibilità attuale.

Il rischio di Grok 4.7 è l'immagine speculare e di entità minore. Ha un giorno di vita, quindi i suoi numeri sono scarni — Artificial Analysis non ha pubblicato alcuna misurazione di velocità o latenza, e la suite di benchmark di xAI per esso non è stata riprodotta in modo indipendente. Ciò che non è in discussione è che il modello è generalmente disponibile, ha un prezzo, è documentato e ha un'identità stabile. Un modello la cui identità è stabile e i cui numeri non sono comprovati è una cosa molto più facile su cui costruire rispetto a un modello i cui numeri sono pubblicati e la cui disponibilità non lo è.

Quanto costa la separazione, in pratica

Supponi di dover scegliere per una pipeline documentale. Su 100k token in ingresso e 8k in uscita, Grok 4.7 costa $0,20 in ingresso e $0,048 in uscita — circa un quarto di dollaro. Gemini 3.1 Pro costa $0,20 in ingresso e $0,096 in uscita — circa trenta centesimi. I due si collocano entro il venti per cento l'uno dall'altro, e se i tuoi documenti sono scansioni, PDF, audio o video, Gemini è l'unico dei due in grado di leggerli. Non è una questione di benchmark; chiude il confronto per quel tipo di carico di lavoro.

Ora supponi di dover scegliere per un agente a contesto lungo. Con 300k di input e 8k di output, Grok 4.7 costa $1,20 in input e $0,096 in output, circa $1,30. Gemini 3.1 Pro costa $1,20 in input e $0,144 in output, circa $1,35. In pratica identici — e qui la finestra da 1M e il tetto di output da 65K di Gemini diventano il vincolo che decide, perché un limite di 65K è il punto in cui le lunghe esecuzioni agentiche cedono. Nessuno dei due modelli è l'opzione economica in questo confronto, e nessuno dei due è costoso secondo gli standard di frontiera.

Two-column scoreboard titled “Grok 4.7 vs Gemini 3.1 Pro - the scoreboard”: AA Index 46 vs 30, context 500k vs 1M, input modality “text + image” vs “text + image + video + audio + PDF”, max output “not stated” vs 65k, price per 1M $2/$6 vs $2/$12, and status GA vs preview.

Instradare attorno a un bersaglio mobile

OrcaRouter include Gemini 3.1 Pro, elencato sulla propria pagina del modello alle tariffe del provider — 2,00 $ in ingresso e 12,00 $ in uscita, con la finestra da 1M e un output massimo di 65k — perché trasferiamo i prezzi di listino del provider a ricarico zero. Non è uno slogan pubblicitario in un caso come questo: Google ha una build di anteprima dalla durata non annunciata la cui disponibilità ha vacillato a settembre, e la cosa utile che fa un router è mantenere stabile l'integrazione mentre ciò che gli sta dietro cambia. Il failover automatico fa sì che un endpoint di anteprima che smette di rispondere diventi un evento di routing anziché un'interruzione, e il DSL di routing ti permette di comporre un modello multimodale con uno solo testuale in un'unica chiamata — che è esattamente la forma suggerita da questa coppia, Gemini che legge il video e Grok che ragiona sulla sua trascrizione. Grok 4.7 non è nel catalogo OrcaRouter al momento in cui scriviamo; chiamarlo oggi significa passare attraverso l'API di xAI e le piattaforme di terze parti che lo ospitano.

Il pattern che vale la pena costruire: mantenere Gemini 3.1 Pro per tutto ciò che deve acquisire video, audio o PDF, e trattare il suo stato di anteprima come un rischio operativo da aggirare piuttosto che come un motivo per evitarlo. Metti Grok 4.7 sul lavoro su testo e immagini dove si applicano il suo prezzo di output inferiore e il suo punteggio composito superiore, e dove il modello che integri oggi è il modello che chiamerai ancora tra sei mesi. L'unica cosa da non fare è leggere la classifica al sessantanovesimo posto come un verdetto sul modello — è un verdetto su una revisione del benchmark, e la stessa revisione che ha declassato Gemini 3.1 Pro ha declassato anche dozzine di modelli che Google non ha mai toccato.

La chiamata

Sull'indice attuale, Grok 4.7 supera Gemini 3.1 Pro di sedici punti e, sul prezzo di output, costa la metà nel livello standard ed è più economico di un terzo nel livello long-context. Se il tuo carico di lavoro è testo e immagini, questo basta per deciderlo. Se il tuo carico di lavoro è video, audio o documenti scansionati, Gemini 3.1 Pro è l'unico candidato dei due e il confronto finisce lì — stai acquistando una capacità, non un punteggio. L'avvertenza che dovrebbe accompagnare entrambi riguarda la provenienza più che le prestazioni: uno è un'anteprima di sette mesi senza una data di GA e con alle spalle un incidente di disponibilità a settembre, l'altro ha un giorno di vita, con un numero di punta e nessuna riproduzione indipendente di nient'altro. Nessuno dei due è una scelta definitiva. Entrambi meritano di essere instradati anziché adottati in modo definitivo.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno