Una scheda del titolo per Mistral Large 4 vs MiniMax M3, costruita attorno a una differenza mensile di 48 $ su 100 milioni di token, con MiniMax M3 che accetta input video e output da 512K e Mistral Large 4 una preview solo immagini.
Guides & Insights

Mistral Large 4 vs MiniMax M3: quanto costano cinque mesi di progresso

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MiniMax M3 è il modello più economico di questa classe e lo è dal 31 maggio 2026. A 0,30 $ per milione di token di input, 1,20 $ per milione di output e 0,06 $ per milione di cache, batte Mistral Large 4 di circa la metà sull'input e del doppio sull'output — e, a differenza del modello più recente, puoi acquistarlo oggi senza etichetta di anteprima. Mistral Large 4, un modello open-weight da 1,05 trilioni di parametri in anteprima pubblica dal 6 ottobre 2026, costa 0,68 $ e 2,09 $ e promette i pesi entro la fine del mese. Due flagship open-weight, a cinque mesi di distanza, e i cinque mesi sono visibili in un solo punto: il punteggio indipendente Intelligence Index di M3 pari a 29,2 contro un punteggio di Mistral Large 4 che non esiste ancora.

Questa è la forma onesta di questo confronto, ed è più interessante di quanto suggerisca una tabella dei prezzi. M3 è stato costruito attorno a una precisa scommessa architetturale — MiniMax Sparse Attention, sostenuta su oltre un milione di token di contesto, con il video come input di prima classe — e sulla carta vince in due categorie che Mistral Large 4 non contende: la lunghezza grezza dell'output e il video nativo. In tutto il resto, il modello più recente è quello che un acquirente preferirebbe avere, a un prezzo ancora abbastanza contenuto da far sì che la differenza raramente decida l'acquisto.

Due architetture, due scommesse

MiniMax M3 è il modello fondazionale di punta a pesi aperti di MiniMax e il primo a combinare prestazioni di frontiera nel coding e nell'agentica, una finestra di contesto da un milione di token e multimodalità nativa in un'unica release. Accetta testo, immagini e video e restituisce testo, ed è basato su MiniMax Sparse Attention, un'architettura progettata per sostenere fino a 1.048.576 token di contesto con una soglia minima garantita di 512K. La pipeline di pre-addestramento è stata ricostruita per scalare oltre i 100 trilioni di token con dati multimodali fin dal primo passaggio, anziché essere aggiunti in un secondo momento. Il suo output massimo è di 512.000 token.

Mistral Large 4 fa una scommessa diversa. È un modello mixture-of-experts granulare, con 49 miliardi di parametri attivi su 1,05 trilioni totali, dotato di un encoder visivo da 1,6 miliardi di parametri, addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell all'interno dei datacentre europei di Mistral, su dati che coprono più di 160 lingue. Accetta testo e immagini — non video — con una finestra di contesto di circa un milione di token, e Mistral lo posiziona attorno al deployment sovrano: infrastruttura europea, pesi aperti e la possibilità di eseguirlo secondo le proprie policy, con la cybersecurity come caso d'uso di punta.

• Finestra di contesto — MiniMax M3 1.048.576 token vs Mistral Large 4 circa 1.000.000

• Output massimo — MiniMax M3 512.000 token vs Mistral Large 4 non ancora documentato

• Modalità di input — MiniMax M3 testo, immagine e video vs Mistral Large 4 testo e immagine

• Prezzo di input — MiniMax M3 0,30 $ per 1M rispetto a Mistral Large 4 0,68 $ per 1M

• Prezzo di output — MiniMax M3 $1.20 per 1M vs Mistral Large 4 $2.09 per 1M

• Input in cache — MiniMax M3 0,06 $ per 1M vs Mistral Large 4 0,07 $ per 1M

• Parametri — Mistral Large 4 1,05T totali / 49B attivi vs MiniMax M3 non divulgati

• Rilasciato — MiniMax M3 31 maggio 2026 vs Mistral Large 4 6 ottobre 2026, anteprima

• Pesi — entrambi con licenza aperta, quelli di Mistral Large 4 promessi entro la fine di ottobre 2026

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

Il punteggio non è ravvicinato, e non è nemmeno giusto.

Nell'Artificial Analysis Intelligence Index v4.3.2, MiniMax M3 ottiene 29,2 punti e si posiziona 62º su 147 modelli. È un risultato di metà classifica e non è una critica al modello — l'Indice è stato revisionato dopo il rilascio di M3 e include valutazioni che non esistevano quando MiniMax era in fase di addestramento. Il suo sub-score di coding racconta una storia migliore: 58,6 sull'AA Coding index, 46º su 138, e 65,2% su Terminal-Bench 2.1. Detiene il 92,9% su GPQA Diamond, l'83% sul richiamo a contesto lungo, e il 47,1% su SciCode.

Mistral Large 4 non ha un punteggio Index sulla stessa board; la pagina è online con il titolo "Mistral Large 4 Preview" e il numero è assente. Ciò che Mistral pubblica è che ML4 supera DeepSeek V4 Pro 0813 e Qwen3.8 Max sul Coding Agent Index combinato al 49,8%, e che su AutomationBench — 657 flussi di lavoro aziendali su Gmail, Sheets, Slack e Salesforce — ottiene il 59,9%, davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro. MiniMax non è nominato in nessuno dei due confronti, il che è di per sé un segnale su quale modello Mistral consideri il vero concorrente.

Quindi la lettura equa è questa: M3 è un modello capace, economico e ben documentato, con un punteggio generale di metà classifica e un profilo di coding rispettabile, che ha cinque mesi. ML4 è un modello in anteprima con un tetto dichiarato più alto, nessun punteggio generale pubblicato e una serie di cifre agentiche che Artificial Analysis ha valutato privatamente e pubblicherà sul Coding Agent Index quando quel harness sarà rilasciato. Se ti serve un numero oggi, M3 te ne dà uno. Se puoi aspettare qualche settimana, anche ML4 te ne darà uno, e Mistral scommette che sarà più alto.

Dove M3 non ha affatto concorrenza da parte di ML4

Due righe su quella lista non sono un compromesso, sono un'assenza.

L'input video è il primo. M3 accetta video in modo nativo, insieme a testo e immagini. Mistral Large 4 accetta testo e immagini e nient'altro — l'approfondimento realizzato da Mistral riguarda il grounding su immagini satellitari gigapixel e disegni tecnici, che resta comunque lavoro su immagini. Se la tua pipeline acquisisce registrazioni dello schermo, filmati di sorveglianza o documentazione video, ML4 non può essere il modello, qualunque sia il suo prezzo. Non è una lacuna che Mistral colmerà con un riprezzamento.

La lunghezza dell'output viene al secondo posto. M3 genera fino a 512.000 token in una singola risposta. Mistral non ha pubblicato alcun limite massimo di output per ML4. Generare un lungo artefatto strutturato in un'unica passata — un report completo, un grande script di migrazione, una specifica completa — è il carico di lavoro in cui un limite di 512K vale più di un punto dell'Intelligence Index, e finché Mistral non documenta il limite di ML4, M3 è l'unico dei due sul quale puoi pianificare quel carico di lavoro.

I numeri agentici di M3 riportati dal fornitore rafforzano lo stesso profilo. MiniMax lo colloca a 83,5 su BrowseComp per la ricerca web autonoma, a 70 su OSWorld-verified per l'uso del computer, a 74,2 su MCP Atlas per l'uso degli strumenti, a 76,7 sui rubriche GDPval e a 59 su SWE Bench Pro. Questi provengono dalle valutazioni di MiniMax stessa e non sono stati riprodotti in modo indipendente, e stonano con il suo punteggio Index di 29,2 — ed è proprio per questo che la distinzione tra valutazioni del fornitore e valutazioni indipendenti è importante. Un modello può guidare i benchmark scelti da un fornitore e posizionarsi a metà classifica su una media neutrale di dieci valutazioni, ed entrambe le cose possono essere vere.

Vale la pena il 2x?

Il divario di prezzo qui è davvero piccolo in termini assoluti, il che cambia il calcolo rispetto a un disallineamento con un modello di punta proprietario. Prendiamo un mese da cento milioni di token con una ripartizione input/output di 4:1: 80 milioni di token in input e 20 milioni in output. M3 fattura 24 $ più 24 $, per un totale di 48 $. Mistral Large 4 fattura 54,40 $ più 41,80 $, per un totale di 96,20 $. Il sovrapprezzo è di circa 48 $ al mese — denaro reale su larga scala, ma il tipo di divario che un singolo errore evitato ripaga.

Il caching lo riduce ulteriormente, e solo marginalmente a favore di M3: $0,06 contro $0,07 per milione di token memorizzati nella cache è un errore di arrotondamento a questo livello di prezzo. Entrambi sono abbastanza economici da far sì che la decisione venga presa in base a capacità e adeguatezza anziché sulla fattura, che è l'opposto di come questo confronto si presenta a prima vista.

Ciò che il sovrapprezzo acquista è l'ampiezza. ML4 è stato addestrato cinque mesi dopo su dati più recenti, in una configurazione mixture-of-experts da mille miliardi di parametri con 49 miliardi attivi, e Mistral sta eseguendo apprendimento per rinforzo su di esso a un ritmo dichiarato di 33 miliardi di token al giorno con un'esecuzione che non si è ancora saturata. M3 è finito; ML4 sta migliorando secondo una cadenza pubblicata. Quando un fornitore dice che il modello che stai acquistando oggi è la versione più debole che ti capiterà mai di pagare, e il sovrapprezzo rispetto al modello attuale è inferiore a un dollaro per milione di token, il modello più recente è di solito la scelta predefinita migliore. L'eccezione sono i due carichi di lavoro sopra, dove il modello più vecchio è l'unico adatto.

Instradamento attorno al gap

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

Questo è un abbinamento in cui eseguirli entrambi non è una copertura, ma la risposta vera, perché i due modelli sono forti in ambiti disgiunti. Video in ingresso, artefatti lunghi in uscita, o un ciclo di uso del computer: M3. Analisi di documenti e immagini, workflow agentici, o qualsiasi cosa che debba girare su infrastruttura europea secondo le tue policy: ML4. Non esiste una regola di routing che renda uno dei due ridondante.

Entrambi si trovano dietro un unico endpoint compatibile con OpenAI su OrcaRouter con markup dello 0% e i prezzi di listino dei provider passati senza modifiche, il che mantiene onesto uno spread di prezzo su cinque mesi — se MiniMax taglia la tariffa di M3 o Mistral termina la tariffa di anteprima, il numero rispetto al quale viene valutata la tua route cambia lo stesso giorno. Il DSL di routing è ciò che trasforma i punti di forza disgiunti in un'unica superficie di chiamata: una regola che ispeziona la modalità della richiesta invia i payload contenenti video a M3 e tutto il resto a ML4, con la certezza che i cali di disponibilità di un modello in anteprima siano assorbiti dal failover automatico anziché propagati ai tuoi utenti. Quando un singolo output conta più di un singolo prezzo, la fusione di modelli può eseguirli entrambi e lasciare che un panel scelga, il che è un modo ragionevole di acquistare il tetto dichiarato di Mistral mantenendo il comportamento documentato di M3 come base.

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

Verdetto

MiniMax M3 è la risposta giusta per due workload e una risposta difendibile per un terzo. L'input video, la generazione in singolo passaggio da diverse centinaia di migliaia di token e gli agenti per l'uso del computer sono il suo territorio, il suo prezzo è il più basso di qualsiasi flagship in questa classe, e i suoi punteggi pubblicati di fascia media significano che sai esattamente cosa ottieni. Cinque mesi non sono molti per un modello che non è stato superato nella sua nicchia.

Mistral Large 4 è l'opzione predefinita migliore per tutto il resto. Un mese da cento milioni di token costa circa 48 $ in più, il numero di parametri e la discendenza europea nell'addestramento indicano un tetto più alto, le dichiarazioni sulla cybersicurezza sono abbastanza specifiche da poter essere verificate, e i pesi aperti promessi più l'implementazione on-premises soddisfano requisiti che la proposta enterprise di M3 basata solo su API non soddisfa. Il prezzo di quella scommessa è che ti stai impegnando su un modello il cui punteggio dell'Independent Intelligence Index non è stato pubblicato e il cui comportamento, secondo Mistral, cambierà in modo sostanziale nel giro di settimane.

Le due date che risolvono la questione: la fine di ottobre 2026, quando i pesi di ML4 arriveranno oppure la promessa degli open-weights inizierà a sembrare debole, e la pubblicazione del Coding Agent Index, dove il 49,8% valutato privatamente di Mistral incontra il punteggio di coding pubblico di 58,6 di M3 sulla stessa revisione. Fino ad allora, M3 è il modello che puoi verificare e ML4 è il modello su cui stai scommettendo — e con un sovrapprezzo mensile di 48 $ su cento milioni di token, non è una grande scommessa.