Una scheda del titolo generata per l'articolo 'Mistral Large 4 vs Gemini 3.1 Pro' che mostra il titolo in grassetto geometrico sans-serif, il sottotitolo 'Otto mesi, due direzioni' al di sotto, e una fila di tre icone piatte a linee sopra — una pagina di calendario, una finestra di terminale e una cornice per immagini — su sfondo bianco con accenti sfumati blu e ciano e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro: Otto mesi, due direzioni

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Gemini 3.1 Pro è sul mercato dal 19 febbraio 2026 e si posiziona ancora vicino ai primi posti di ogni tabella generale delle capacità, comprese quelle in cui viene confrontato con modelli rilasciati quest'autunno. Mistral Large 4 ha al massimo tre settimane: un'anteprima annunciata il 6 ottobre 2026, con i pesi promessi per la fine di ottobre e nessuna licenza indicata. Nell'Intelligence Index di Artificial Analysis, consultato il 6 ottobre, Gemini 3.1 Pro, vecchio di otto mesi, ottiene 29,7 contro il 38,4 del nuovo arrivato. Questo è il punto di partenza onesto per questo confronto, ed è l'opposto di ciò che suggeriscono le date di rilascio.

La spiegazione non è misteriosa. Gemini 3.1 Pro è un flagship della linea preview che Google non ha mai promosso a release stabile, e la pagina di Artificial Analysis ad esso dedicata è etichettata "Gemini 3.1 Pro Preview" — la stessa pagina in cui un indice inferiore si trova accanto a un GPQA Diamond di fascia alta. È un modello costruito per l'ampiezza: una finestra di contesto molto ampia, un'ampia gamma di modalità e un ragionamento che è forte sulle domande di conoscenza. Mistral Large 4 è costruito per una mappa del mondo completamente diversa, e il suo prezzo è adeguato di conseguenza.

Che cosa è ciascuno

Gemini 3.1 Pro è il modello di ragionamento multimodale di frontiera di Google, con ID API gemini-3.1-pro-preview, una finestra di contesto di 1.048.576 token e un limite di output di 65.536 token. Accetta testo, immagini, video, audio e file. È servito dal catalogo di OrcaRouter alle tariffe proprie di Google. La documentazione di Google non elenca alcun Gemini 3.1 Pro non-preview; il nome preview è il prodotto.

Mistral Large 4 è un mixture-of-experts sparso da 1,05 trilioni di parametri con 49 miliardi di parametri attivi e un encoder visivo dedicato da 1,6 miliardi di parametri, offerto come "Mistral Large 4 Preview" con l'ID API mistral-large-4-0. La documentazione di Mistral indica una finestra di contesto di 1M token; Artificial Analysis legge 524.288 sulla configurazione che sta testando. L'output massimo non è pubblicato. Mistral lo descrive come il suo modello più grande e più capace fino ad oggi e afferma che i pesi arriveranno alla fine di ottobre.

I numeri, con la loro provenienza allegata

Entrambi i modelli hanno pagine indipendenti, quindi il confronto seguente è a parità di harness piuttosto che tra vendor diversi:

• Indice di intelligenza v4.3 — Mistral Large 4 Preview 38.4 vs Gemini 3.1 Pro 29.7

• Costo per attività di indicizzazione — 1,13 $ vs 1,30 $

• Ragionamento su contesto lungo — 81,3% vs 82,0%

• GPQA Diamond — non pubblicato per l'anteprima vs 94,1%

• L'ultimo esame dell'umanità — 35,0% vs 47,0%

• Terminal-Bench 4.0 — 26,8% vs 4,0%

• SciCode — 54,2% vs 58,7%

• AutomationBench, flussi di lavoro aziendali — 59,9% vs 35,4%

• MMMU-Pro, ragionamento multimodale — 76,4% vs 82,4%

• Finestra di contesto — 1M dichiarata / 524.288 testata vs 1.048.576 servita

• Limite di output — non pubblicato vs 65.536 token

• Prezzo per milione, input / output — $1.36 / $4.18 di listino, $0.68 / $2.09 in promozione, rispetto a $2.00 / $12.00 sotto i 200K token e $4.00 / $18.00 sopra

• Pesi — promessi, licenza non specificata, vs proprietario

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

La riga in assoluto più eclatante è Terminal-Bench 4.0. Gemini 3.1 Pro ottiene il 4,0% — non è un refuso, né un'allucinazione nella tabella: riflette un modello di febbraio eseguito su un harness per agenti da terminale successivo a esso. Il 26,8% di Mistral Large 4 è sei volte più alto nello stesso test. Chiunque abbia escluso Gemini sulla base di un vecchio punteggio di coding agentico dovrebbe reinserirlo sulla base del suo GPQA Diamond, e chiunque abbia escluso Mistral in base alla posizione in classifica dovrebbe guardare prima la riga del terminale.

Dove Gemini 3.1 Pro ha ancora la meglio

Conoscenza e ampiezza. Un 94,1% su GPQA Diamond è il valore più alto in assoluto in questo articolo, da entrambe le parti, ed è un benchmark scientifico di livello universitario — non un numero che un modello può raggiungere a parole. Humanity's Last Exam al 47,0% contro il 35,0%, e un punteggio SciCode che supera di poco il nuovo arrivato, raccontano la stessa storia. Se il tuo carico di lavoro consiste nel rispondere accuratamente a domande difficili da un corpus di conoscenze, Gemini 3.1 Pro rimane il modello più forte otto mesi dopo il rilascio.

L'ampiezza delle modalità è il secondo vantaggio. Gemini 3.1 Pro accetta video e audio oltre a testo e immagini. Mistral 3 accetta testo e immagini. Se la tua pipeline acquisisce riunioni registrate, screencast o audio di sensori, solo un modello può vedere l'intero input.

Il tetto di output è il terzo. 65.536 token è un tetto pubblicato e garantito; Mistral non ne ha pubblicato alcuno per l'anteprima. Niente in un post di lancio è più suscettibile di crearti problemi in produzione di un limite di output non dichiarato.

E la finestra di contesto di Gemini è realmente erogata a 1.048.576 token, mentre il milione di Mistral è la cifra dichiarata dal fornitore a fronte di 524.288 rilevati in modo indipendente. Per un carico di lavoro che si colloca all'estremità più lontana della finestra, la differenza tra un numero dichiarato e uno misurato è una riscrittura.

Dove Mistral Large 4 cambia la decisione

Il lavoro agentico, e in particolare tutto ciò che ha a che fare con un terminale, è il punto in cui i due modelli smettono di essere comparabili. Il post di lancio di Mistral stesso raggruppa 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4.0 in un Coding Agent Index del 49,8%, e dichiara apertamente di essersi posizionato davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max su quella misura combinata. Quelle tre cifre sono, secondo Mistral, numeri che Artificial Analysis ha valutato privatamente prima che il suo harness diventasse pubblico; non sono ancora presenti nell'indice pubblico e dovrebbero essere etichettate come pubblicate dal fornitore finché non lo saranno.

Le prove indipendenti puntano nella stessa direzione. Su AutomationBench — 657 flussi di lavoro aziendali che spaziano tra Gmail, Sheets, Slack e Salesforce — Mistral Large 4 ottiene il 59,9%, davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro, e sullo stesso harness Gemini 3.1 Pro non compare affatto perché il benchmark è stato pubblicato dopo di esso. Uno studio umano in cieco condotto da Surge AI ha classificato Mistral Large 4 Preview al secondo posto su cinque modelli per qualità di codifica, con 3,74, davanti a GLM-5.3 e Kimi K3 e dietro solo a Claude Opus 5.

L'affermazione sulla sicurezza informatica è la più incisiva nel post di Mistral e vale la pena riportarla esattamente: 82% al test dell'Artificial Analysis Cyber Index che chiede a un modello di riprodurre una vulnerabilità reale e poi applicarvi una patch, descritto come il più alto di qualunque modello, con il 93% nei 40 esercizi di competizione di Cybench, e l'asserzione di Mistral che si posiziona nella top five globale nel Cyber Index complessivo, essendo leader tra i modelli open-weight sviluppati al di fuori della Cina. Si tratta di dati citati dal fornitore su un indice indipendente. Il loro vantaggio pratico è che Mistral ha costruito il modello per svolgere il lavoro anziché rifiutarlo.

La riga meno cara della tabella appartiene anche a Mistral, ma solo di stretta misura: 1,13 $ per attività contro 1,30 $, un vantaggio del 13% che la tariffa promozionale produce e che il listino prezzi cancellerebbe. Gemini 3.1 Pro è un modello del 2026 con prezzi del 2026 e non è costoso eseguirvi un'attività di indicizzazione.

Il fattore decisivo che nessuno sottopone a benchmark

Ci sono due cose in gioco che le tabelle non possono mostrare. La prima è quella delle licenze. Gemini 3.1 Pro è proprietario e continuerà a esserlo; Mistral Large 4 è un'anteprima il cui intero argomento di vendita è che diventa un artefatto scaricabile che puoi eseguire secondo le tue policy, sul tuo hardware, sotto la legge europea — Mistral lo ha addestrato su 3.800 GPU Grace Blackwell nei propri datacenter e vi serve l'anteprima. Questo argomento non vale nulla finché il repository non compare e la licenza non ha un nome. Varrà moltissimo il giorno in cui ciò accadrà.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Il secondo è il rischio operativo. Un'anteprima ancora in fase di rifinitura cambierà sotto di te. Su OrcaRouter entrambi i lati di questo confronto sono raggiungibili tramite un unico endpoint compatibile con OpenAI ai prezzi di listino dei fornitori con 0% di markup — Gemini 3.1 Pro è disponibile nel catalogo alle tariffe di Google, mentre Mistral Large 4 deve essere raggiunto tramite l'API di Mistral stessa e diverse piattaforme di terze parti, poiché non è una rotta che offriamo. Il DSL di routing è il pezzo utile qui: invia classificazione ed estrazione al modello che costa meno quella settimana, escala il residuo difficile e lascia che il failover automatico assorba le giornate storte dell'anteprima invece che sia la tua rotazione di reperibilità ad assorbirle.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Il verdetto

Chiedi quale sia il carico di lavoro, non quale modello sia migliore. Per il lavoro basato sulla conoscenza, gli input audio e video, un tetto massimo di output garantito e una finestra da un milione di token servita, Gemini 3.1 Pro è ancora il modello più forte e la sua età non è un difetto — sono otto mesi in cui altri ne hanno trovato i limiti. Per il coding agentico, il lavoro da terminale e le operazioni di sicurezza, Mistral Large 4 è avanti di un margine abbastanza ampio che la posizione in classifica è fuorviante, ed è l'unico dei due che potrebbe finire per essere self-hostabile.

Lo spareggio da tenere d'occhio è la fine di ottobre. Se i pesi arriveranno con una licenza permissiva, Mistral Large 4 smetterà di competere con Gemini 3.1 Pro sul prezzo e inizierà a competere con esso sul controllo, e quella è una battaglia diversa. Se arriveranno con una restrittiva, la risposta di questo articolo non cambia molto — ma la ragione sì.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno