
Che cos'è MiniMax M3? Il flagship multimodale di MiniMax con contesto da 1M
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 è un modello linguistico nativamente multimodale e a pesi aperti, proveniente dal laboratorio cinese che sta dietro ai modelli testuali della serie M, ai modelli video Hailuo e alla serie Music. Il laboratorio lo ha annunciato il 1º giugno 2026 e ha conquistato il primo posto nella lista dei modelli della stessa azienda, strappandolo a MiniMax M2.7, portando con sé una finestra di contesto da un milione di token, input nativo di testo, immagini e video, e un'architettura ad attenzione sparsa che il laboratorio chiama MSA.
Quattordici articoli nell'archivio di questo blog citano MiniMax M3. Fino a ora, nessuno di essi lo riguardava. Il modello compare come avversario in un confronto dopo l'altro — il punto di riferimento open-weight rispetto al quale viene misurato un Gemini, Qwen, Grok o GPT più recente — e non c'è stata alcuna pagina, qui, su cui un lettore potesse atterrare per scoprire che cos'è davvero MiniMax M3. Questa è quella pagina.
La scheda tecnica
MiniMax M3 è un modello mixture-of-experts con circa 428 miliardi di parametri totali e circa 23 miliardi attivati per token, secondo la model card che MiniMax pubblica insieme ai pesi. È nativamente multimodale anziché solo testuale con la visione aggiunta a posteriori: la card descrive l'addestramento su modalità intercalate fin dal primo passo, e il modello accetta input di testo, immagini e video e restituisce testo.
• Finestra di contesto: 1.048.576 token, con la nostra voce di catalogo che indica un minimo garantito di 512.000 token di contesto utilizzabile
• Output massimo: 512.000 token sulla nostra pagina di catalogo; MiniMax non pubblica una cifra di output massimo nel proprio materiale, quindi considera 512K come il nostro numero, non quello del fornitore
• Modalità: input testo, immagine e video; output testo
• Parametri: ~428B totali, ~23B attivi per token
• Controllo del ragionamento: un parametro thinking con modalità enabled, adaptive e disabled
• Campionamento consigliato: temperature 1.0, top_p 0.95
• Architettura: MiniMax Sparse Attention (MSA), oggetto del paper arXiv 2606.13392
• Forma dell'endpoint: chat completions compatibili con OpenAI
La principale rivendicazione architetturale riguarda il costo dell'attenzione sui contesti lunghi. MiniMax afferma che MSA offre un prefill più di 9 volte più veloce e una decodifica più di 15 volte più veloce rispetto a M2 con una finestra di un milione di token, riducendo il calcolo per token a circa un ventesimo rispetto alla generazione precedente. Questi sono dati del fornitore e non li abbiamo visti riprodotti in modo indipendente.
Dove si colloca MiniMax M3 nella gamma di MiniMax
È al vertice della linea linguistica, ma vale la pena essere precisi su ciò che quella linea contiene, perché MiniMax mantiene una coda più lunga di modelli ancora elencati rispetto alla maggior parte dei laboratori. La documentazione dei modelli dello stesso fornitore li suddivide in due.
• Modelli attuali: MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• Modelli legacy, ancora elencati: MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• MiniMax M2, il più datato tra loro, dispone di un contesto di 200.000 token e di un output massimo di 128.000 token, inclusa la catena di pensiero
• MiniMax non pubblica i limiti di contesto o di output per M2.7 o M2.1 nello stesso documento
Il divario generazionale è reale ma non enorme sull'unico indice su cui entrambi i modelli compaiono. Artificial Analysis assegna a MiniMax M3 un punteggio di 29 sull'Intelligence Index revisione v4.3.2, e a MiniMax M2.7 un punteggio di 23 sulla stessa revisione: 29 colloca M3 al 16° posto su 114 modelli nella tabella di quella revisione, e 23 colloca M2.7 al 36° posto. M2.7 è stato rilasciato a marzo 2026. Il salto è un passo, non una generazione, e vale la pena leggere i due numeri riferendoli alla stessa revisione: questo indice è stato ricalibrato il 7 settembre 2026, e i punteggi precedenti a tale data non sono comparabili con quelli successivi.
Quanto costa
MiniMax applica a M3 un prezzo in base alla dimensione della richiesta sul suo listino a consumo, e le tariffe pubblicate beneficiano di uno sconto permanente del 50% rispetto a un prezzo di listino più elevato.
• Fino a 512K token di input: $0,30 per milione di token di input, $1,20 per milione di token di output, $0,06 per milione di letture dalla cache — rispetto a un listino di $0,60 / $2,40 / $0,12
• Oltre 512K token di input: $0,60 per milione di input, $2,40 per milione di output, $0,12 per milione di letture dalla cache — rispetto a un listino di $1,20 / $4,80 / $0,24
• Livello di servizio prioritario: 1,5 volte la tariffa standard, quindi $0,45 / $1,80 / $0,09 nel livello per richieste di piccole dimensioni, selezionato impostando service_tier su "priority"
• Non pubblicato: MiniMax non indica alcun prezzo per la scrittura in cache per M3, solo un prezzo per la lettura dalla cache
OrcaRouter offre MiniMax M3 agli stessi valori — 0,30 $ in ingresso, 1,20 $ in uscita — senza alcun ricarico sulla tariffa del provider. È un modello in evidenza nel nostro catalogo, e il traffico non è trascurabile: 153,7 milioni di token instradati negli ultimi sette giorni al momento della stesura, con un p50 del tempo al primo token di 4,26 secondi e un p95 di 10,00 secondi.

In cosa MiniMax M3 è misurabilmente bravo
Iniziamo con i numeri che MiniMax riporta per sé, tutti dichiarati dal fornitore e nessuno dei quali abbiamo visto riprodotto da terze parti.
• SWE-Bench Pro: 59,0%
• Terminal-Bench 2.1: 66,0%
• SWE-fficiency: 34,8%
• MCP Atlas: 74,2%
• BrowseComp: 83,5, il dato su cui il fornitore punta di più nella ricerca agentica
• Video-MME: 84,6 a 512 fotogrammi, mentre l'API esterna limita i fotogrammi a 640
• KernelBench Hard: 28,8%
• OSWorld-Verified: 68,70% a 100 passaggi massimi, che sale a 70,06% a 200
Il quadro indipendente concorda sulla direzione. Artificial Analysis colloca MiniMax M3 a un Intelligence Index di 29 sulla revisione v4.3.2, al 16º posto su 114 modelli, a 0,51 $ per eseguire l'indice per modello — 21º posto su 114 per quella misura di costo. La velocità di output è di 106,4 token al secondo contro una mediana di 67,1, e il tempo al primo token è di 1,25 secondi contro una mediana di 2,33 secondi. Entrambi sono migliori del tipico per la fascia, e il prezzo è ben al di sotto.
La ripubblicazione da parte di terzi della stessa famiglia di indici completa i sotto-punteggi: SWE-bench Verified all'80,5%, tau-squared-bench all'88,9%, AA-GPQA Diamond al 92,9%, AA-LCR all'83,0%, AA-IFBench all'82,9%, OmniDocBench 1.5 al 91,6% e USAMO 2026 all'85,7%. La comprensione dei documenti e il rispetto delle istruzioni sembrano punti di forza autentici, e il punteggio di ragionamento su contesto lungo corrisponde alla storia architetturale.

In cosa è misurabilmente scarso
Le debolezze oneste si concentrano in due punti, ed entrambe sono visibili nei numeri pubblicati.
• Il divario agentico è quello più importante: sulla stessa ripubblicazione di terze parti, MiniMax M3 ottiene 58,6 sull'AA Coding Index ma solo 30,8 sull'AA Agentic Index. Scrive codice molto meglio di quanto porti avanti autonomamente un lungo compito a più passaggi.
• Conoscenza e allucinazione: un AA-Omniscience Index di 1,4, un'accuratezza del 16,7% e un tasso di allucinazione del 18,4%. Questo è un modello che risponderà con sicurezza su cose che non conosce.
• OSWorld 2.0: 4,6%
• CritPt: 3,7%, il punteggio pubblicato più debole che abbiamo trovato per M3 in assoluto
• ResearchClawBench: 19,8%
• Verbosità: 120 milioni di token di output per completare l'Intelligence Index, posizione 11 su 114 — è un modello loquace, e sui prompt ad alta intensità di ragionamento questo si fa sentire sul conto
• Il limite inferiore composito: un aggregatore di terze parti lo colloca a 55,28 su 100, posizione 60 su 505, sebbene su una copertura parziale di 50 benchmark su 481, quindi quel composito è un limite inferiore più che un verdetto
Diverse cose semplicemente non sono misurate, e preferiamo dirlo piuttosto che riempire il vuoto. Nessuno al di fuori di MiniMax ha riprodotto la tabella di benchmark del fornitore qui sopra. Artificial Analysis non pubblica di per sé una cifra del Coding Index o dell’Agentic Index per M3 — la coppia 58,6 e 30,8 proviene da una terza parte che ripubblica la stessa famiglia di indici. Artificial Analysis cita AA-Omniscience come componente del suo indice, ma non pubblica alcun punteggio numerico Omniscience per M3. MiniMax non pubblica alcuna cifra di output massimo, quindi il 512K sulla nostra pagina del modello è nostro. E sul listino prezzi del fornitore non esiste affatto un prezzo di scrittura cache.
Chi dovrebbe scegliere MiniMax M3 e chi dovrebbe scegliere qualcos'altro
Scegli MiniMax M3 quando il lavoro è insieme a contesto lungo e multimodale. Un milione di token con input video, pesi aperti che puoi scaricare ed eseguire da solo e un prezzo di input di $0,30 per milione di token sono una combinazione che nient'altro nel campo dei pesi aperti riesce a eguagliare in modo altrettanto netto. L'analisi di documenti lunghi, la comprensione video, la lettura di codice su scala di repository e le pipeline di estrazione di documenti sono gli ambiti in cui risiedono i punti di forza misurati — 91,6% su OmniDocBench e 83,0% su AA-LCR sono i numeri che depongono a suo favore.
Scegli qualcos'altro in tre casi. Se non hai bisogno della finestra di contesto o dell'input visivo, MiniMax M2.7 costa gli stessi 0,30 $/1,20 $, ottiene 23 contro i 29 di M3 nell'attuale revisione dell'indice, ed è una cosa più piccola da gestire — il vantaggio di M3 non è gratis, ha semplicemente lo stesso prezzo di listino. Se il tuo carico di lavoro riguarda agenti autonomi anziché la programmazione, il divario agentico è il motivo per guardare altrove, e la stessa tabella di confronto di MiniMax punta nella stessa direzione: su PostTrainBench il fornitore riporta 0,37 per M3 contro 0,42 per Opus 4.7 e 0,39 per GPT-5.5, l'unico benchmark pubblicato in cui M3 perde contro entrambi. E se hai bisogno di una licenza senza vincoli, leggi il paragrafo successivo prima di impegnarti.
La licenza è l'insidia che molti approfondimenti trascurano. MiniMax M3 viene distribuito con la MiniMax Community License, non con Apache o MIT. L'uso non commerciale è gratuito. L'uso commerciale è consentito, ma è necessario mostrare in modo ben visibile "Built with MiniMax M3". Al di sotto dei 20 milioni di dollari di fatturato annuo basta inviare una comunicazione una tantum; al di sopra serve un'autorizzazione scritta preventiva da MiniMax, da richiedere via email con oggetto "M3 licensing - authorization request". La licenza include anche un'appendice sugli usi vietati. Se stai distribuendo un prodotto, non è una formalità: è una revisione legale.
Il riepilogo pratico
MiniMax M3 è l'attuale fiore all'occhiello della linea linguistica di MiniMax: un modello mixture-of-experts da ~428 miliardi di parametri, con ~23 miliardi attivi per token, un contesto da un milione di token, input nativo per video e immagini e un'attenzione sparsa a cui il fornitore attribuisce una riduzione di 20 volte del calcolo per token a contesto pieno. È stato annunciato il 1° giugno 2026, quindi è un modello consolidato, non nuovo: la domanda interessante a settembre 2026 non è se sia valido, ma per quale metà del tuo carico di lavoro lo sia.
La risposta misurata è che è forte sul codice e sui documenti, ordinario sulla conoscenza e debole nel lavoro agentico autonomo. È economico per quello che fa, ed è il raro modello a pesi aperti in cui l’affermazione sul contesto lungo regge a un esame indipendente. La licenza è la parte che la maggior parte dei team dovrà negoziare con se stessa.
MiniMax M3 gira su OrcaRouter alla tariffa del provider, senza alcun ricarico, tramite lo stesso endpoint compatibile con OpenAI di tutto il resto qui: una sola chiave API raggiunge oltre 200 modelli, con failover automatico se un endpoint cade e un DSL di routing quando vuoi fissare o combinare. Se vuoi confrontarlo con il resto del catalogo prima di impegnarti, la pagina del modello mostra il listino tariffe in tempo reale, i percentili di time-to-first-token e il traffico.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
