
Mistral Large 4 vs Claude Opus 5: il divario è più piccolo del divario di prezzo
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
L'unico dato di confronto diretto che qualcuno abbia pubblicato per Mistral Large 4 contro Claude Opus 5 proviene da una valutazione umana in cieco, ed è più vicino di quanto suggeriscano le tabelle dei benchmark. Surge AI ha nascosto l'identità dei modelli e ha chiesto ad annotatori professionisti di valutare l'output di programmazione su una scala da 1 a 5; Claude Opus 5 è arrivato primo con 4,22 e Mistral Large 4 Preview secondo con 3,74, davanti a Kimi K3, GLM-5.3 e GLM-5.2. Nell'aggregato indipendente i due non sono affatto vicini — 50,8 contro 38,4 sull'Intelligence Index di Artificial Analysis, rilevato il 6 ottobre. Ciò che rende l'abbinamento degno di un pomeriggio è che il modello che totalizza 12 punti in meno costa circa un quinto per eseguire un compito.
A entrambe le cifre va attribuita la loro provenienza, perché non sono lo stesso tipo di numero. La valutazione di Surge AI è uno studio umano di terze parti che Mistral ha commissionato e pubblicato — una forma di evidenza più forte di un benchmark eseguito in proprio, e comunque uno studio di cui Mistral controllava la pubblicazione. I punteggi dell'indice sono esecuzioni di Artificial Analysis stessa, comparabili tra loro, e quindi la coppia giusta su cui basare il ragionamento. Nessuno dei due ti dice su quale modello costruire; insieme delimitano la questione.
Due prodotti, non due generazioni di uno solo.
Claude Opus 5 è un modello di punta a pesi chiusi del fornitore, rilasciato il 24 luglio 2026, servito con una finestra di contesto da 1M di token e fino a 128K token di output, a 5 $ per milione di token di input e 25 $ per milione di output, con letture dalla cache a 0,50 $. È il modello più capace del fornitore nella linea Opus ed è posizionato esattamente sul lavoro agentico a lungo orizzonte — rimanendo coerente attraverso sessioni multi-step con uso intensivo di strumenti.
Mistral Large 4 è un'anteprima, annunciata il 6 ottobre 2026, che Mistral descrive come un modello sparse mixture-of-experts da 1,05 trilioni di parametri con 49 miliardi di parametri attivi e un encoder visivo da 1,6 miliardi di parametri. Il suo id API è mistral-large-4-0, è nativamente multimodale e la documentazione di Mistral gli attribuisce una finestra di contesto di 1M token, mentre Artificial Analysis rileva 524.288 sulla configurazione che sta testando. I pesi sono promessi per la fine di ottobre e la licenza non è stata indicata.
Quindi non si tratta di un modello più recente contrapposto a uno più vecchio. È un modello proprietario di frontiera contrapposto a uno sfidante destinato a diventare open-weight, e i due hanno prezzi adeguati a questa differenza.

Lo stesso indice, entrambi i modelli
Letto il 6 ottobre dalle loro pagine di Artificial Analysis, sull'Intelligence Index v4.3:
• Indice di Intelligenza — Mistral Large 4 Preview 38.4 vs Claude Opus 5 50.8
• Costo per attività di indicizzazione — 1,13 $ per Mistral Large 4 Preview vs 5,86 $ per Claude Opus 5
• Terminal-Bench 4.0 — 26,8% vs 49,0%, il divario singolo più ampio tra loro
• Humanity's Last Exam — 35,0% vs 54,9%
• MMMU-Pro, ragionamento multimodale — 76,4% vs 84,7%
• AutomationBench, flussi di lavoro aziendali — 59,9% vs 56,6%, l'unica riga in cui Mistral Large 4 è in testa
• Finestra di contesto — 1M dichiarati da Mistral e 524.288 sulla configurazione testata, vs 1M serviti
• Limite massimo di output — non pubblicato per l'anteprima rispetto a 128K token
• Prezzo per milione, input / output — $1,36 / $4,18 di listino, attualmente $0,68 / $2,09 in promozione, rispetto a $5,00 / $25,00

Il pattern è leggibile. Opus 5 è in vantaggio nelle due righe più difficili ad alto contenuto di ragionamento — lavoro da terminale e conoscenza aperta — e in vantaggio nella comprensione multimodale nonostante Mistral Large 4 sia il modello venduto sulla sua visione. Mistral Large 4 guida la riga dell'automazione dei flussi di lavoro, che è la riga più vicina a ciò che un'unità di business chiede effettivamente a un modello di fare, e lo fa a un quinto del prezzo per attività.
Dove Mistral Large 4 vince davvero
L'affermazione più interessante nel post di lancio di Mistral non è un punteggio di benchmark. È che su uno dei test dell'Artificial Analysis Cyber Index — riprodurre una vulnerabilità reale in software open source, quindi correggerla — Mistral Large 4 ottiene l'82%, si dice il più alto di qualsiasi modello, e che diversi modelli chiusi leader ottengono quasi zero nello stesso test perché rifiutano il compito. Mistral cita Claude Opus 5.5 e GPT-6 Astra come esempi di tale rifiuto.
Questa è un'interpretazione del fornitore di una cifra citata dal fornitore stesso, e va letta in questo modo. È anche una reale differenza operativa, se regge: un modello che non è in grado di riprodurre una vulnerabilità non può essere usato per dimostrare che una è reale, il che è il primo passo della maggior parte delle attività di incident response. Mistral abbina l'82% a un punteggio del 93% sui 40 esercizi di competizione di Cybench e a una controaffermazione secondo cui il suo tasso di rifiuto sui prompt informatici tratti da JailbreakBench, StrongREJECT e AgentHarm è più alto di quello di altri modelli open-weight — l'argomento è che si vogliono la capacità e la disciplina nello stesso modello, invece di sacrificare l'una per l'altra.
Oltre l'ambito cyber, la tesi a favore di Mistral Large 4 poggia su tre cose che Opus 5 non offre. È addestrato ed erogato su infrastrutture europee in base al diritto europeo, il che conta per gli acquirenti con obblighi di residenza dei dati. Sarà, promette Mistral, scaricabile — il punto di tutta l'operazione, dato che è la distribuzione autonoma a eliminare il rischio di accesso durante un incidente che Mistral si premura di descrivere. Ed è abbastanza economico per attività che usarlo come prima passata e scalare il residuo difficile a un modello di frontiera è economicamente sensato, anziché un errore di arrotondamento.
Dove Claude Opus 5 giustifica ancora il suo prezzo
Un divario di 12 punti sull'indice non è piccolo, e il quadro riga per riga dice dove si annida. Terminal-Bench 4.0 è quasi il doppio — 49,0% contro 26,8% — e il lavoro da terminale è il proxy pubblico più vicino al coding agentico, che è la maggior parte di ciò per cui i team stanno acquistando modelli di frontiera quest'anno. Humanity's Last Exam li separa di 20 punti. Sull'autonomia a lungo orizzonte, il design di ragionamento adattivo di Opus 5, il suo tetto di output di 128K e un contesto servito da 1M sono la configurazione che desideri se il tuo carico di lavoro è una sessione agentica di più ore anziché una singola domanda difficile.
Il tetto di output è la differenza più silenziosa. Mistral non ha pubblicato una lunghezza massima di output per l'anteprima, e i 128K di Opus 5 rimuovono davvero un vincolo per la generazione di codice e per i documenti strutturati lunghi. Se la tua pipeline produce file anziché risposte, controlla quel numero prima di passare, perché è il tipo di divario che emerge solo in produzione.
Il costo per attività è il numero da tenere stretto
I prezzi per token lusingano i modelli economici e traggono in inganno su quelli costosi. Il costo per attività dell'indice stesso — la spesa totale per completare un'attività di valutazione, cache inclusa — è il numero che regge il confronto con un budget: 1,13 $ contro 5,86 $.
Non è una licenza per spostare tutto sul modello più economico, perché un compito che il modello economico non riesce a svolgere è un compito che paghi due volte. È una licenza per smettere di trattare un singolo modello di frontiera come l'unica opzione. Su OrcaRouter, Claude Opus 5 è nel catalogo al prezzo di listino del fornitore con 0% di ricarico, nello stesso endpoint compatibile con OpenAI di oltre 200 altri modelli, ed è questo che rende una pipeline a due modelli il lavoro di un pomeriggio invece di un secondo contratto con un fornitore. Mistral Large 4 oggi non è nel catalogo — l'anteprima si raggiunge tramite l'API di Mistral stessa e diverse piattaforme di terze parti. Quando i suoi pesi saranno disponibili e un provider lo ospiterà, vale la stessa regola di pass-through: qualunque importo addebiti il fornitore è quello che ti viene addebitato, e un taglio di prezzo del fornitore compare sulla tua fattura lo stesso giorno.

Per un'anteprima non ancora collaudata, la funzionalità di routing che conta di più è il failover. Inviare una fetta del traffico di produzione a Mistral Large 4 mentre Opus 5 gestisce il resto significa che una regressione si trasforma in un reindirizzamento anziché in un'interruzione del servizio, e le reali modalità di errore del modello le scopri sui tuoi dati invece che su una classifica.
Cosa risolve questo in tre settimane
Tre fatti restano aperti, e ognuno sposta la risposta. Se i pesi arrivano con una licenza permissiva, Mistral Large 4 diventa l'unico modello di questa coppia che puoi ospitare autonomamente, e il calcolo per gli acquirenti in settori regolamentati pende nettamente. Se il prezzo promozionale di $0,68 / $2,09 torna a $1,36 / $4,18 sul listino prezzi, il divario per attività si riduce ma resta decisivo. E se Artificial Analysis sposta invariati sul suo indice pubblico i dati di coding valutati privatamente, la narrazione sul coding diventa verificata da terzi anziché pubblicata dal fornitore per conto di terzi.
Fino a quel momento: Opus 5 è il default sicuro per la produzione e vale il suo sovrapprezzo per il lavoro agentico e a forte uso del terminale. Mistral Large 4 è la scommessa interessante — abbastanza economico per singolo task da essere eseguito al suo fianco, abbastanza capace su automazione e cyber da guadagnarsi traffico già oggi, e con la promessa di un self-deployment che nessun modello chiuso in questo confronto può eguagliare.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
