Una card del titolo generata per l'articolo "Mistral Large 4 vs Claude Opus 5" che mostra il titolo in sans-serif geometrico in grassetto, il sottotitolo "Il divario è più piccolo del divario di prezzo" sotto di esso, e una fila di tre icone lineari piatte sopra — due barre di altezza disuguale, un cartellino del prezzo e una scala di valutazione umana — su uno sfondo bianco con accenti sfumati blu e ciano e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Mistral Large 4 vs Claude Opus 5: il divario è più piccolo del divario di prezzo

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

L'unico dato di confronto diretto che qualcuno abbia pubblicato per Mistral Large 4 contro Claude Opus 5 proviene da una valutazione umana in cieco, ed è più vicino di quanto suggeriscano le tabelle dei benchmark. Surge AI ha nascosto l'identità dei modelli e ha chiesto ad annotatori professionisti di valutare l'output di programmazione su una scala da 1 a 5; Claude Opus 5 è arrivato primo con 4,22 e Mistral Large 4 Preview secondo con 3,74, davanti a Kimi K3, GLM-5.3 e GLM-5.2. Nell'aggregato indipendente i due non sono affatto vicini — 50,8 contro 38,4 sull'Intelligence Index di Artificial Analysis, rilevato il 6 ottobre. Ciò che rende l'abbinamento degno di un pomeriggio è che il modello che totalizza 12 punti in meno costa circa un quinto per eseguire un compito.

A entrambe le cifre va attribuita la loro provenienza, perché non sono lo stesso tipo di numero. La valutazione di Surge AI è uno studio umano di terze parti che Mistral ha commissionato e pubblicato — una forma di evidenza più forte di un benchmark eseguito in proprio, e comunque uno studio di cui Mistral controllava la pubblicazione. I punteggi dell'indice sono esecuzioni di Artificial Analysis stessa, comparabili tra loro, e quindi la coppia giusta su cui basare il ragionamento. Nessuno dei due ti dice su quale modello costruire; insieme delimitano la questione.

Due prodotti, non due generazioni di uno solo.

Claude Opus 5 è un modello di punta a pesi chiusi del fornitore, rilasciato il 24 luglio 2026, servito con una finestra di contesto da 1M di token e fino a 128K token di output, a 5 $ per milione di token di input e 25 $ per milione di output, con letture dalla cache a 0,50 $. È il modello più capace del fornitore nella linea Opus ed è posizionato esattamente sul lavoro agentico a lungo orizzonte — rimanendo coerente attraverso sessioni multi-step con uso intensivo di strumenti.

Mistral Large 4 è un'anteprima, annunciata il 6 ottobre 2026, che Mistral descrive come un modello sparse mixture-of-experts da 1,05 trilioni di parametri con 49 miliardi di parametri attivi e un encoder visivo da 1,6 miliardi di parametri. Il suo id API è mistral-large-4-0, è nativamente multimodale e la documentazione di Mistral gli attribuisce una finestra di contesto di 1M token, mentre Artificial Analysis rileva 524.288 sulla configurazione che sta testando. I pesi sono promessi per la fine di ottobre e la licenza non è stata indicata.

Quindi non si tratta di un modello più recente contrapposto a uno più vecchio. È un modello proprietario di frontiera contrapposto a uno sfidante destinato a diventare open-weight, e i due hanno prezzi adeguati a questa differenza.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Lo stesso indice, entrambi i modelli

Letto il 6 ottobre dalle loro pagine di Artificial Analysis, sull'Intelligence Index v4.3:

• Indice di Intelligenza — Mistral Large 4 Preview 38.4 vs Claude Opus 5 50.8

• Costo per attività di indicizzazione — 1,13 $ per Mistral Large 4 Preview vs 5,86 $ per Claude Opus 5

• Terminal-Bench 4.0 — 26,8% vs 49,0%, il divario singolo più ampio tra loro

• Humanity's Last Exam — 35,0% vs 54,9%

• MMMU-Pro, ragionamento multimodale — 76,4% vs 84,7%

• AutomationBench, flussi di lavoro aziendali — 59,9% vs 56,6%, l'unica riga in cui Mistral Large 4 è in testa

• Finestra di contesto — 1M dichiarati da Mistral e 524.288 sulla configurazione testata, vs 1M serviti

• Limite massimo di output — non pubblicato per l'anteprima rispetto a 128K token

• Prezzo per milione, input / output — $1,36 / $4,18 di listino, attualmente $0,68 / $2,09 in promozione, rispetto a $5,00 / $25,00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Il pattern è leggibile. Opus 5 è in vantaggio nelle due righe più difficili ad alto contenuto di ragionamento — lavoro da terminale e conoscenza aperta — e in vantaggio nella comprensione multimodale nonostante Mistral Large 4 sia il modello venduto sulla sua visione. Mistral Large 4 guida la riga dell'automazione dei flussi di lavoro, che è la riga più vicina a ciò che un'unità di business chiede effettivamente a un modello di fare, e lo fa a un quinto del prezzo per attività.

Dove Mistral Large 4 vince davvero

L'affermazione più interessante nel post di lancio di Mistral non è un punteggio di benchmark. È che su uno dei test dell'Artificial Analysis Cyber Index — riprodurre una vulnerabilità reale in software open source, quindi correggerla — Mistral Large 4 ottiene l'82%, si dice il più alto di qualsiasi modello, e che diversi modelli chiusi leader ottengono quasi zero nello stesso test perché rifiutano il compito. Mistral cita Claude Opus 5.5 e GPT-6 Astra come esempi di tale rifiuto.

Questa è un'interpretazione del fornitore di una cifra citata dal fornitore stesso, e va letta in questo modo. È anche una reale differenza operativa, se regge: un modello che non è in grado di riprodurre una vulnerabilità non può essere usato per dimostrare che una è reale, il che è il primo passo della maggior parte delle attività di incident response. Mistral abbina l'82% a un punteggio del 93% sui 40 esercizi di competizione di Cybench e a una controaffermazione secondo cui il suo tasso di rifiuto sui prompt informatici tratti da JailbreakBench, StrongREJECT e AgentHarm è più alto di quello di altri modelli open-weight — l'argomento è che si vogliono la capacità e la disciplina nello stesso modello, invece di sacrificare l'una per l'altra.

Oltre l'ambito cyber, la tesi a favore di Mistral Large 4 poggia su tre cose che Opus 5 non offre. È addestrato ed erogato su infrastrutture europee in base al diritto europeo, il che conta per gli acquirenti con obblighi di residenza dei dati. Sarà, promette Mistral, scaricabile — il punto di tutta l'operazione, dato che è la distribuzione autonoma a eliminare il rischio di accesso durante un incidente che Mistral si premura di descrivere. Ed è abbastanza economico per attività che usarlo come prima passata e scalare il residuo difficile a un modello di frontiera è economicamente sensato, anziché un errore di arrotondamento.

Dove Claude Opus 5 giustifica ancora il suo prezzo

Un divario di 12 punti sull'indice non è piccolo, e il quadro riga per riga dice dove si annida. Terminal-Bench 4.0 è quasi il doppio — 49,0% contro 26,8% — e il lavoro da terminale è il proxy pubblico più vicino al coding agentico, che è la maggior parte di ciò per cui i team stanno acquistando modelli di frontiera quest'anno. Humanity's Last Exam li separa di 20 punti. Sull'autonomia a lungo orizzonte, il design di ragionamento adattivo di Opus 5, il suo tetto di output di 128K e un contesto servito da 1M sono la configurazione che desideri se il tuo carico di lavoro è una sessione agentica di più ore anziché una singola domanda difficile.

Il tetto di output è la differenza più silenziosa. Mistral non ha pubblicato una lunghezza massima di output per l'anteprima, e i 128K di Opus 5 rimuovono davvero un vincolo per la generazione di codice e per i documenti strutturati lunghi. Se la tua pipeline produce file anziché risposte, controlla quel numero prima di passare, perché è il tipo di divario che emerge solo in produzione.

Il costo per attività è il numero da tenere stretto

I prezzi per token lusingano i modelli economici e traggono in inganno su quelli costosi. Il costo per attività dell'indice stesso — la spesa totale per completare un'attività di valutazione, cache inclusa — è il numero che regge il confronto con un budget: 1,13 $ contro 5,86 $.

Non è una licenza per spostare tutto sul modello più economico, perché un compito che il modello economico non riesce a svolgere è un compito che paghi due volte. È una licenza per smettere di trattare un singolo modello di frontiera come l'unica opzione. Su OrcaRouter, Claude Opus 5 è nel catalogo al prezzo di listino del fornitore con 0% di ricarico, nello stesso endpoint compatibile con OpenAI di oltre 200 altri modelli, ed è questo che rende una pipeline a due modelli il lavoro di un pomeriggio invece di un secondo contratto con un fornitore. Mistral Large 4 oggi non è nel catalogo — l'anteprima si raggiunge tramite l'API di Mistral stessa e diverse piattaforme di terze parti. Quando i suoi pesi saranno disponibili e un provider lo ospiterà, vale la stessa regola di pass-through: qualunque importo addebiti il fornitore è quello che ti viene addebitato, e un taglio di prezzo del fornitore compare sulla tua fattura lo stesso giorno.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

Per un'anteprima non ancora collaudata, la funzionalità di routing che conta di più è il failover. Inviare una fetta del traffico di produzione a Mistral Large 4 mentre Opus 5 gestisce il resto significa che una regressione si trasforma in un reindirizzamento anziché in un'interruzione del servizio, e le reali modalità di errore del modello le scopri sui tuoi dati invece che su una classifica.

Cosa risolve questo in tre settimane

Tre fatti restano aperti, e ognuno sposta la risposta. Se i pesi arrivano con una licenza permissiva, Mistral Large 4 diventa l'unico modello di questa coppia che puoi ospitare autonomamente, e il calcolo per gli acquirenti in settori regolamentati pende nettamente. Se il prezzo promozionale di $0,68 / $2,09 torna a $1,36 / $4,18 sul listino prezzi, il divario per attività si riduce ma resta decisivo. E se Artificial Analysis sposta invariati sul suo indice pubblico i dati di coding valutati privatamente, la narrazione sul coding diventa verificata da terzi anziché pubblicata dal fornitore per conto di terzi.

Fino a quel momento: Opus 5 è il default sicuro per la produzione e vale il suo sovrapprezzo per il lavoro agentico e a forte uso del terminale. Mistral Large 4 è la scommessa interessante — abbastanza economico per singolo task da essere eseguito al suo fianco, abbastanza capace su automazione e cyber da guadagnarsi traffico già oggi, e con la promessa di un self-deployment che nessun modello chiuso in questo confronto può eguagliare.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno