
Mistral Large 4 è un'anteprima da 1T di parametri: i pesi non sono ancora stati rilasciati
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 151 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Mistral Large 4 è arrivato il 6 ottobre 2026 come anteprima pubblica — un modello mixture-of-experts da mille miliardi di parametri con 49 miliardi di parametri attivi, un encoder visivo da 1,6 miliardi di parametri e l'affermazione del suo creatore che è il modello open-weight più forte costruito fuori dalla Cina. Ciò che non è arrivato è la parte descritta dalle parole "open-weight". Non ci sono checkpoint da scaricare oggi, nessun file di licenza e nessun repository. Mistral afferma che i pesi arriveranno "alla fine di questo mese", dopo una finestra di red-teaming durante la quale partner verificati e autorità nazionali ricevono una build sbloccata con moderazione ridotta e capacità cyber ampliate. Quindi la descrizione accurata di Mistral Large 4 questa settimana è un'API di anteprima che puoi chiamare e un modello che non puoi ancora possedere.
Quella separazione è la storia, non una sua nota a piè di pagina. Ogni numero che Mistral ha pubblicato insieme all'annuncio — i punteggi di programmazione, i punteggi di cybersicurezza, le valutazioni finanziarie e legali — è stato prodotto su una build che viene ancora modificata, e ogni titolo che lo confronta con un modello di frontiera chiuso sta confrontando un artefatto che non sarà l'artefatto che scaricherai. La cosa utile da fare con un lancio come questo è separare ciò che puoi verificare oggi da ciò che ti viene chiesto di prendere per fede, e il post di mistral.ai stesso è insolitamente generoso nel dire quale sia quale.
Cosa c'è davvero in diretta il 6 ottobre
L'API di anteprima è disponibile su Mistral Studio con l'id del modello mistral-large-4-0. La model card di Mistral lo descrive come "un modello multimodale all'avanguardia, a pesi aperti e di uso generale", costruito su un'architettura MoE granulare, e scompone il conteggio dei parametri in 49B attivi contro 1,05T totali, più l'encoder visivo. L'azienda lo ha addestrato da zero su 3.800 GPU NVIDIA Grace Blackwell nei propri datacenter europei, e l'anteprima viene servita sulla stessa infrastruttura — un argomento di sovranità che Mistral porta avanti con la stessa insistenza di quello sulle prestazioni.
La specifica, come la dichiara il fornitore:
• Parametri totali vs attivi — 1,05 trilioni in totale, 49 miliardi attivi per token, MoE sparso
• Modalità — testo e immagini in ingresso, testo in uscita; nativamente multimodale anziché un adattatore aggiunto a posteriori
• Finestra di contesto — la documentazione di Mistral dichiara 1M token; Artificial Analysis rileva 524.288 sulla configurazione che sta testando, quindi considera 1M come il tetto massimo del fornitore anziché la finestra servita
• Prezzo — 1,36 $ per milione di token di input e 4,18 $ per milione di output, con input in cache a 0,14 $, secondo la scheda pubblicata da Mistral
Offerta di lancio — la stessa scheda mostra una promozione barrata di $0.68 / $2.09 con input in cache a $0.07, ovvero metà prezzo
• Pesi — non rilasciati; «entro la fine di questo mese», secondo l'annuncio
• Licenza — non nominata nell'annuncio e nella pagina della documentazione, che etichetta la voce soltanto come "Open"
Due di quelle righe meritano di essere lette due volte. La finestra di contesto differisce di un fattore due a seconda che si legga il fornitore o il laboratorio di terze parti, il che non è insolito per un'anteprima la cui configurazione di serving è ancora in evoluzione, ma vale la pena saperlo prima di dimensionare un carico di lavoro su di essa. E il prezzo che pagherai dipende dal fatto che la tariffa promozionale sopravviva alla finestra di lancio; $1,36 / $4,18 è il numero riportato nel listino prezzi di Mistral, mentre $0,68 / $2,09 è il numero che attualmente applica. Quando calcoli la tua fattura, presupponi il primo valore.

I numeri del benchmark, e chi li ha eseguiti
Il post di Mistral è attento alla provenienza, e la cautela merita di essere mantenuta. Tre delle cifre di spicco dell'agentic coding — 61,7% su DeepSWE v1.1, 59,4% su SWE-Atlas-QnA e 28,3% su Terminal-Bench 4.0, che si combinano in un punteggio di 49,8% nel Coding Agent Index — sono, per usare le parole di Mistral stesso, "i numeri valutati privatamente da Artificial Analysis prima del lancio pubblico dell'harness". Non sono ancora nell'indice pubblico di Artificial Analysis. Lo saranno, quando l'harness sarà rilasciato. Fino ad allora sono cifre pubblicate dal fornitore che una terza parte ha prodotto ma non ha ancora pubblicato, il che è una provenienza più solida di quella della maggior parte delle dichiarazioni di lancio, ma non equivale comunque a un punteggio pubblico riproducibile.

Ciò che è pubblico e indipendente oggi, leggendo la pagina del modello di Artificial Analysis il 6 ottobre: Mistral Large 4 Preview ottiene 38.4 sull'Intelligence Index v4.3, impiegando circa 507 secondi per attività, con Terminal-Bench 4.0 al 26,8% e Long-Context Reasoning all'81,3%. La stessa pagina lo elenca come un modello a pesi aperti che, in realtà, non è a pesi aperti — il flag riporta isOpenWeights: false con la categorizzazione "proprietary", perché ciò che esiste è una preview servita dal cluster dello stesso fornitore. Quel flag è l'illustrazione singola più chiara del divario di cui parla questo articolo.

Il risultato più citabile è quello che Mistral non ha eseguito in proprio. Surge AI, una società di annotazione di terze parti, ha condotto una valutazione umana in cieco sulla qualità del codice con le identità dei modelli nascoste, e annotatori professionisti hanno valutato Mistral Large 4 Preview a 3,74 su una scala da 1 a 5 — secondo su cinque, davanti a Kimi K3 a 3,59, GLM-5.3 a 3,60 e GLM-5.2 a 3,40, e dietro solo a Claude Opus 5 a 4,22. Una valutazione umana in cieco con un laboratorio con un nome preciso dall'altra parte è un tipo di prova diverso da un benchmark eseguito in proprio, ed è il singolo dato indipendente più forte nell'annuncio.
Poi c’è il cyber, dove Mistral fa la sua affermazione più netta. Sul Cyber Index di Artificial Analysis, l’azienda sostiene che Mistral Large 4 si colloca nella top five globale e guida i modelli open-weight sviluppati fuori dalla Cina. Su uno specifico test — riprodurre una vulnerabilità reale in software open source, per poi correggerla — ottiene l’82%, descritto come il punteggio più alto di qualsiasi modello, con il 93% sui 40 esercizi competitivi di Cybench. Mistral aggiunge un’osservazione pungente: diversi modelli chiusi di primo piano, Claude Opus 5.5 e GPT-6 Astra citati tra questi, ottengono un punteggio vicino allo zero su quello stesso test perché rifiutano il compito. Senza la pagina di terze parti davanti a te, l’82% è un dato del fornitore; l’argomento sul tasso di rifiuto è un’interpretazione del fornitore. Entrambi sono plausibili e nessuno dei due è confermato in modo indipendente oggi.
Perché l'inquadratura dell'anteprima cambia il calcolo del prezzo
Un'anteprima non è semplicemente un'etichetta di fase. Significa che il modello può essere reindirizzato, riprezzato o dismesso con un preavviso inferiore rispetto a un rilascio GA, e significa che la configurazione di serving su cui esegui i benchmark potrebbe non essere quella su cui esegui il deployment. Per una decisione di routing, questo è un costo reale: una pipeline messa a punto sulla build di questa settimana porta con sé una fattura di rivalidazione che non rientrava nel tuo budget.
Su OrcaRouter, dove oltre 200 modelli si trovano dietro un unico endpoint compatibile con OpenAI al prezzo di listino del fornitore, con uno 0% di markup trasferito direttamente, un cambiamento di prezzo sulla card del venditore stesso è un cambiamento di prezzo sulla nostra lo stesso giorno — il che qui conta proprio perché questo lancio propone due prezzi, uno barrato. Il failover automatico è l'altra metà della risposta per un'anteprima non ancora collaudata: ti consente di mettere una frazione del traffico di produzione su Mistral Large 4 mentre un modello first-party sostiene il resto, così un'anteprima che regredisce sotto il tuo carico di lavoro reale degrada in un reindirizzamento anziché in un incidente. Ciò che i lettori attenti non dovrebbero presumere è che Mistral Large 4 sia instradabile su OrcaRouter oggi. Non è nel catalogo — l'anteprima si raggiunge tramite l'API di Mistral stessa e diverse piattaforme di terze parti, e i suoi pesi, quando arriveranno, saranno una proposta self-hosted.
L'affermazione open-weight al momento è una promessa
La posizione di Mistral è che Mistral Large 4 "spinge la frontiera delle prestazioni open-weight" e che i pesi aperti sono il meccanismo con cui le imprese mantengono il controllo di un modello. Si tratta di un argomento difendibile per il modello che Mistral intende rilasciare. Per il modello che ha rilasciato questa settimana, il meccanismo è assente: nessun repository Hugging Face, nessun testo di licenza, nessun checkpoint scaricabile. L'organizzazione Hugging Face della stessa azienda, verificata il 6 ottobre, non ha nulla di più recente di luglio, e le sue voci più recenti non hanno alcun rapporto con la linea Large.
Questa non è una critica al piano; un rilascio scaglionato dei pesi dopo una finestra di red-teaming è una politica coerente, e Mistral è esplicito al riguardo. È un avvertimento sull'aggettivo. "Open-weight" sta svolgendo un lavoro di marketing in un paragrafo in cui i pesi sono a quattro settimane di distanza, e la licenza che li governa non è stata nominata. Una licenza permissiva e termini in stile Apache sono un esito; una licenza solo per ricerca o con tetto ai ricavi è un altro, e l'annuncio non sceglie tra i due.
Cosa controllare prima della fine di ottobre
Cinque cose trasformerebbero questa anteprima in un fatto stabilito, e ciascuna è verificabile senza chiedere nulla a Mistral:
• Un repository Hugging Face nell'organizzazione Mistral contenente il checkpoint e un file di licenza — la release che Mistral si è impegnata a pubblicare questo mese
• Il nome stesso della licenza, che determina se "open weight" significhi libertà in stile Apache-2.0 o una concessione con limiti d'uso
• Se la tariffa promozionale di $0,68 / $2,09 rimane in vigore, oppure si torna a $1,36 / $4,18 sul listino prezzi
• Se Artificial Analysis sposterà i dati sul coding valutati privatamente sul proprio indice pubblico quando l'harness sarà rilasciato, e se rimarranno agli stessi valori
La finestra di contesto erogata, attualmente indicata come 1M dal fornitore e rilevata come 524.288 dal laboratorio indipendente
Finché non saranno risolte, l'atteggiamento giusto verso Mistral Large 4 è quello che il suo stesso lancio invita ad assumere: chiamarlo, misurarlo sul proprio carico di lavoro e mantenere il percorso di produzione su un modello il cui comportamento non è destinato a cambiare. I pesi sono l'evento. L'anteprima è il trailer.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
