
Mistral Large 4 vs Gemini 3.1 Pro: Otto mesi, due direzioni
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Gemini 3.1 Pro è sul mercato dal 19 febbraio 2026 e si posiziona ancora vicino ai primi posti di ogni tabella generale delle capacità, comprese quelle in cui viene confrontato con modelli rilasciati quest'autunno. Mistral Large 4 ha al massimo tre settimane: un'anteprima annunciata il 6 ottobre 2026, con i pesi promessi per la fine di ottobre e nessuna licenza indicata. Nell'Intelligence Index di Artificial Analysis, consultato il 6 ottobre, Gemini 3.1 Pro, vecchio di otto mesi, ottiene 29,7 contro il 38,4 del nuovo arrivato. Questo è il punto di partenza onesto per questo confronto, ed è l'opposto di ciò che suggeriscono le date di rilascio.
La spiegazione non è misteriosa. Gemini 3.1 Pro è un flagship della linea preview che Google non ha mai promosso a release stabile, e la pagina di Artificial Analysis ad esso dedicata è etichettata "Gemini 3.1 Pro Preview" — la stessa pagina in cui un indice inferiore si trova accanto a un GPQA Diamond di fascia alta. È un modello costruito per l'ampiezza: una finestra di contesto molto ampia, un'ampia gamma di modalità e un ragionamento che è forte sulle domande di conoscenza. Mistral Large 4 è costruito per una mappa del mondo completamente diversa, e il suo prezzo è adeguato di conseguenza.
Che cosa è ciascuno
Gemini 3.1 Pro è il modello di ragionamento multimodale di frontiera di Google, con ID API gemini-3.1-pro-preview, una finestra di contesto di 1.048.576 token e un limite di output di 65.536 token. Accetta testo, immagini, video, audio e file. È servito dal catalogo di OrcaRouter alle tariffe proprie di Google. La documentazione di Google non elenca alcun Gemini 3.1 Pro non-preview; il nome preview è il prodotto.
Mistral Large 4 è un mixture-of-experts sparso da 1,05 trilioni di parametri con 49 miliardi di parametri attivi e un encoder visivo dedicato da 1,6 miliardi di parametri, offerto come "Mistral Large 4 Preview" con l'ID API mistral-large-4-0. La documentazione di Mistral indica una finestra di contesto di 1M token; Artificial Analysis legge 524.288 sulla configurazione che sta testando. L'output massimo non è pubblicato. Mistral lo descrive come il suo modello più grande e più capace fino ad oggi e afferma che i pesi arriveranno alla fine di ottobre.
I numeri, con la loro provenienza allegata
Entrambi i modelli hanno pagine indipendenti, quindi il confronto seguente è a parità di harness piuttosto che tra vendor diversi:
• Indice di intelligenza v4.3 — Mistral Large 4 Preview 38.4 vs Gemini 3.1 Pro 29.7
• Costo per attività di indicizzazione — 1,13 $ vs 1,30 $
• Ragionamento su contesto lungo — 81,3% vs 82,0%
• GPQA Diamond — non pubblicato per l'anteprima vs 94,1%
• L'ultimo esame dell'umanità — 35,0% vs 47,0%
• Terminal-Bench 4.0 — 26,8% vs 4,0%
• SciCode — 54,2% vs 58,7%
• AutomationBench, flussi di lavoro aziendali — 59,9% vs 35,4%
• MMMU-Pro, ragionamento multimodale — 76,4% vs 82,4%
• Finestra di contesto — 1M dichiarata / 524.288 testata vs 1.048.576 servita
• Limite di output — non pubblicato vs 65.536 token
• Prezzo per milione, input / output — $1.36 / $4.18 di listino, $0.68 / $2.09 in promozione, rispetto a $2.00 / $12.00 sotto i 200K token e $4.00 / $18.00 sopra
• Pesi — promessi, licenza non specificata, vs proprietario

La riga in assoluto più eclatante è Terminal-Bench 4.0. Gemini 3.1 Pro ottiene il 4,0% — non è un refuso, né un'allucinazione nella tabella: riflette un modello di febbraio eseguito su un harness per agenti da terminale successivo a esso. Il 26,8% di Mistral Large 4 è sei volte più alto nello stesso test. Chiunque abbia escluso Gemini sulla base di un vecchio punteggio di coding agentico dovrebbe reinserirlo sulla base del suo GPQA Diamond, e chiunque abbia escluso Mistral in base alla posizione in classifica dovrebbe guardare prima la riga del terminale.
Dove Gemini 3.1 Pro ha ancora la meglio
Conoscenza e ampiezza. Un 94,1% su GPQA Diamond è il valore più alto in assoluto in questo articolo, da entrambe le parti, ed è un benchmark scientifico di livello universitario — non un numero che un modello può raggiungere a parole. Humanity's Last Exam al 47,0% contro il 35,0%, e un punteggio SciCode che supera di poco il nuovo arrivato, raccontano la stessa storia. Se il tuo carico di lavoro consiste nel rispondere accuratamente a domande difficili da un corpus di conoscenze, Gemini 3.1 Pro rimane il modello più forte otto mesi dopo il rilascio.
L'ampiezza delle modalità è il secondo vantaggio. Gemini 3.1 Pro accetta video e audio oltre a testo e immagini. Mistral 3 accetta testo e immagini. Se la tua pipeline acquisisce riunioni registrate, screencast o audio di sensori, solo un modello può vedere l'intero input.
Il tetto di output è il terzo. 65.536 token è un tetto pubblicato e garantito; Mistral non ne ha pubblicato alcuno per l'anteprima. Niente in un post di lancio è più suscettibile di crearti problemi in produzione di un limite di output non dichiarato.
E la finestra di contesto di Gemini è realmente erogata a 1.048.576 token, mentre il milione di Mistral è la cifra dichiarata dal fornitore a fronte di 524.288 rilevati in modo indipendente. Per un carico di lavoro che si colloca all'estremità più lontana della finestra, la differenza tra un numero dichiarato e uno misurato è una riscrittura.
Dove Mistral Large 4 cambia la decisione
Il lavoro agentico, e in particolare tutto ciò che ha a che fare con un terminale, è il punto in cui i due modelli smettono di essere comparabili. Il post di lancio di Mistral stesso raggruppa 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4.0 in un Coding Agent Index del 49,8%, e dichiara apertamente di essersi posizionato davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max su quella misura combinata. Quelle tre cifre sono, secondo Mistral, numeri che Artificial Analysis ha valutato privatamente prima che il suo harness diventasse pubblico; non sono ancora presenti nell'indice pubblico e dovrebbero essere etichettate come pubblicate dal fornitore finché non lo saranno.
Le prove indipendenti puntano nella stessa direzione. Su AutomationBench — 657 flussi di lavoro aziendali che spaziano tra Gmail, Sheets, Slack e Salesforce — Mistral Large 4 ottiene il 59,9%, davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro, e sullo stesso harness Gemini 3.1 Pro non compare affatto perché il benchmark è stato pubblicato dopo di esso. Uno studio umano in cieco condotto da Surge AI ha classificato Mistral Large 4 Preview al secondo posto su cinque modelli per qualità di codifica, con 3,74, davanti a GLM-5.3 e Kimi K3 e dietro solo a Claude Opus 5.
L'affermazione sulla sicurezza informatica è la più incisiva nel post di Mistral e vale la pena riportarla esattamente: 82% al test dell'Artificial Analysis Cyber Index che chiede a un modello di riprodurre una vulnerabilità reale e poi applicarvi una patch, descritto come il più alto di qualunque modello, con il 93% nei 40 esercizi di competizione di Cybench, e l'asserzione di Mistral che si posiziona nella top five globale nel Cyber Index complessivo, essendo leader tra i modelli open-weight sviluppati al di fuori della Cina. Si tratta di dati citati dal fornitore su un indice indipendente. Il loro vantaggio pratico è che Mistral ha costruito il modello per svolgere il lavoro anziché rifiutarlo.
La riga meno cara della tabella appartiene anche a Mistral, ma solo di stretta misura: 1,13 $ per attività contro 1,30 $, un vantaggio del 13% che la tariffa promozionale produce e che il listino prezzi cancellerebbe. Gemini 3.1 Pro è un modello del 2026 con prezzi del 2026 e non è costoso eseguirvi un'attività di indicizzazione.
Il fattore decisivo che nessuno sottopone a benchmark
Ci sono due cose in gioco che le tabelle non possono mostrare. La prima è quella delle licenze. Gemini 3.1 Pro è proprietario e continuerà a esserlo; Mistral Large 4 è un'anteprima il cui intero argomento di vendita è che diventa un artefatto scaricabile che puoi eseguire secondo le tue policy, sul tuo hardware, sotto la legge europea — Mistral lo ha addestrato su 3.800 GPU Grace Blackwell nei propri datacenter e vi serve l'anteprima. Questo argomento non vale nulla finché il repository non compare e la licenza non ha un nome. Varrà moltissimo il giorno in cui ciò accadrà.

Il secondo è il rischio operativo. Un'anteprima ancora in fase di rifinitura cambierà sotto di te. Su OrcaRouter entrambi i lati di questo confronto sono raggiungibili tramite un unico endpoint compatibile con OpenAI ai prezzi di listino dei fornitori con 0% di markup — Gemini 3.1 Pro è disponibile nel catalogo alle tariffe di Google, mentre Mistral Large 4 deve essere raggiunto tramite l'API di Mistral stessa e diverse piattaforme di terze parti, poiché non è una rotta che offriamo. Il DSL di routing è il pezzo utile qui: invia classificazione ed estrazione al modello che costa meno quella settimana, escala il residuo difficile e lascia che il failover automatico assorba le giornate storte dell'anteprima invece che sia la tua rotazione di reperibilità ad assorbirle.

Il verdetto
Chiedi quale sia il carico di lavoro, non quale modello sia migliore. Per il lavoro basato sulla conoscenza, gli input audio e video, un tetto massimo di output garantito e una finestra da un milione di token servita, Gemini 3.1 Pro è ancora il modello più forte e la sua età non è un difetto — sono otto mesi in cui altri ne hanno trovato i limiti. Per il coding agentico, il lavoro da terminale e le operazioni di sicurezza, Mistral Large 4 è avanti di un margine abbastanza ampio che la posizione in classifica è fuorviante, ed è l'unico dei due che potrebbe finire per essere self-hostabile.
Lo spareggio da tenere d'occhio è la fine di ottobre. Se i pesi arriveranno con una licenza permissiva, Mistral Large 4 smetterà di competere con Gemini 3.1 Pro sul prezzo e inizierà a competere con esso sul controllo, e quella è una battaglia diversa. Se arriveranno con una restrittiva, la risposta di questo articolo non cambia molto — ma la ragione sì.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
