
MiniMax M3.1 Flash Preview vs MiniMax M3: quando il modello più recente è quello più rischioso
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 468 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 192 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
La documentazione ufficiale del fornitore ora elenca MiniMax-M3.1-Flash-Preview sopra MiniMax-M3, e quest'ordine svolge un ruolo persuasivo notevole. È il modello testuale più recente della linea, porta la stessa finestra di contesto da un milione di token e aggiunge un controllo della profondità di ragionamento che il modello più vecchio non ha. Ciò che la tabella non mostra è che il modello più vecchio è l'unico dei due che puoi scaricare, prezzare per token, confrontare con qualsiasi cosa tramite benchmark o chiamare senza un abbonamento — e che quello più recente ha tolto un interruttore che MiniMax-M3 ti dava.
Questa non è una storia di un modello superato. È una storia di un fornitore che scinde la propria linea in un cavallo di battaglia a consumo e un'anteprima accessibile solo tramite abbonamento, e i due non sono intercambiabili in nessuna delle due direzioni. Ecco cosa sono realmente ciascuno di essi.
Le due schede tecniche, affiancate
Inizia da ciò che le pagine del fornitore stesso dichiarano per entrambi, perché la forma della differenza emerge qui anziché in una tabella di benchmark.
• Annunciato — MiniMax-M3 il 1° giugno 2026 con una nota sull'architettura, una scheda di benchmark e un listino prezzi; MiniMax-M3.1-Flash-Preview il 27 settembre 2026 con una voce di documentazione e un post sull'account agente di MiniMax • Finestra di contesto — 1.000.000 di token per entrambi, secondo le tabelle dei modelli di MiniMax stesso • Output massimo — 512.000 token per MiniMax-M3 nella nostra scheda di catalogo, una cifra che MiniMax non pubblica direttamente; non pubblicato da nessuna parte per MiniMax-M3.1-Flash-Preview • Modalità di input — testo, immagini e video in ingresso, testo in uscita, per entrambi • Controllo del thinking — un parametro thinking che si può chiedere a MiniMax-M3 di saltare e che può essere separato in un campo reasoning_details tramite reasoning_split; su MiniMax-M3.1-Flash-Preview il thinking è obbligatorio e reasoning_split non può essere disattivato • Profondità del thinking — non disponibile su MiniMax-M3; una scala effort di low, medium, high, xhigh e max, con valore predefinito max, su MiniMax-M3.1-Flash-Preview • Velocità di output dichiarata — circa 100+ token al secondo per MiniMax-M3, secondo la tabella dei modelli di MiniMax stesso; nulla di pubblicato per MiniMax-M3.1-Flash-Preview • Pesi — MiniMax-M3 è open-weight con un repository pubblico; MiniMax-M3.1-Flash-Preview non ne ha nessuno • Prezzi — 0,30 $ per milione di token di input e 1,20 $ per milione di token di output per MiniMax-M3 alla tariffa del provider; non esiste alcuna tariffa per token per MiniMax-M3.1-Flash-Preview • Accesso — MiniMax-M3 con pagamento a consumo e con Token Plan, e instradabile tramite piattaforme di terze parti; MiniMax-M3.1-Flash-Preview solo su Token Plan e MiniMax Code
Due righe lì appartengono a una categoria diversa dalle altre. La velocità di output pubblicata è un dato del fornitore solo per il modello più vecchio, quindi il modello più nuovo viene venduto come quello veloce senza un valore associato. E il controllo del pensiero si è mosso nella direzione opposta rispetto al marketing: il modello più nuovo offre un controllo più fine su quanto pensa, togliendo però la possibilità di impedirgli del tutto di pensare.
Lo switch che MiniMax ha tolto
Questo è il dettaglio che più probabilmente causa problemi, ed è documentato anziché nascosto. Con MiniMax-M3, inviare thinking: {"type": "disabled"} sull'endpoint compatibile con OpenAI salta il ragionamento e restituisce una risposta diretta; sull'endpoint compatibile con Anthropic, il ragionamento è disattivato per impostazione predefinita e può essere abilitato con adaptive. Su MiniMax-M3.1-Flash-Preview, la stessa richiesta restituisce HTTP 400 con il messaggio requires adaptive thinking. Non esiste un modo supportato per ottenere una risposta senza ragionamento.
In pratica, questo significa che un carico di lavoro che usava MiniMax-M3 come classificatore o router economico e veloce — prompt breve in ingresso, risposta strutturata breve in uscita, nessuna catena di pensiero — non ha un percorso di aggiornamento diretto al modello più recente. Puoi abbassare effort a low, e le linee guida di MiniMax specificano esplicitamente che ridurre effort è il modo previsto per diminuire la latenza e i token del pensiero, anziché disabilitarlo. Ma i token e la latenza non scendono a zero, e per un lavoro di estrazione ad alto volume che scrive quattro campi per chiamata, "pensa sempre prima" è una forma di costo diversa da "pensa quando richiesto".

Che cosa viene effettivamente misurato su ciascuno
Un lato di questo confronto ha dei numeri e l'altro ha una colonna vuota, e vale la pena essere precisi su quali numeri siano di chi.
Il record indipendente di MiniMax-M3 è reale: Artificial Analysis lo colloca a 29,2 sull'Intelligence Index — 60º su 145 — con 58,6 sul Coding Index, 59,18 sul suo indice Math, 92,9% su GPQA Diamond nell'ambito della stessa famiglia di indici, 83% di recall long-context e 82,9% su IFBench. Queste sono valutazioni di terze parti di un modello che chiunque può scaricare e rieseguire. I numeri di lancio di MiniMax per M3 — BrowseComp all'83,5%, SWE-Bench Pro al 59,0%, Terminal-Bench 2.1 al 66,0%, MCP Atlas al 74,2%, OSWorld-Verified al 70% — sono dati del fornitore e non abbiamo visto riprodurli.
MiniMax-M3.1-Flash-Preview non ha né l'uno né l'altro. MiniMax non ha pubblicato alcuna tabella di benchmark, e il modello non ha alcuna voce nell'indice di Artificial Analysis, quindi non esiste un punteggio indipendente, nessun indice di coding, nessun valore di richiamo su contesto lungo e nessuna misurazione di allucinazione. Ogni caratterizzazione in circolazione — "veloce", "affidabile", "costruito per lo sviluppo quotidiano" — è l'aggettivo del fornitore stesso dal post di lancio. L'assenza vale la pena di essere dichiarata chiaramente perché è a doppio taglio: nulla è stato dimostrato essere peggiore, e nulla è stato dimostrato essere migliore.
Quell'asimmetria è l'intera decisione. Puoi valutare MiniMax-M3 questo pomeriggio scaricandolo o chiamandolo, e puoi confrontare quella valutazione con una classifica pubblica. Con MiniMax-M3.1-Flash-Preview puoi solo usarlo e formarti un'opinione privata.
Dove il modello più recente vince davvero
Sarebbe facile leggere quanto sopra come un argomento per ignorare il nuovo modello, e neanche questa è la conclusione giusta. Tre cose sono reali e specifiche di esso.
La scala dello sforzo è una vera capacità, non un interruttore. Cinque livelli — basso fino a massimo — consentono a un singolo modello di gestire una rinomina di routine e un refactoring sull'intero repository a costi di calcolo diversi, ed è documentata come efficace solo per MiniMax-M3.1-Flash-Preview. Su MiniMax-M3 la scelta è binaria. Se il tuo problema è che non riesci a prevedere la latenza per singola attività, una profondità regolabile è esattamente il controllo che desideravi.
È il modello di punta attuale del fornitore, il che significa che eredita tutto ciò che la linea della serie M ha imparato da giugno, e MiniMax è esplicito sul fatto che è il modello più recente per il ragionamento agentico, l'uso degli strumenti, la programmazione e le attività a contesto lungo. Il meccanismo di uso degli strumenti con pensiero intercalato introdotto da M3 viene mantenuto, incluso il requisito di reinserire la risposta completa — blocchi di pensiero e tutto il resto — nella cronologia dei messaggi.
E accetta video, a un prezzo da modello Flash, all'interno di un abbonamento. Anche MiniMax-M3 lo fa, a un prezzo per token. Se stai già pagando per una postazione del Token Plan e il tuo unico ostacolo all'utilizzo dell'input video era il costo marginale per chiamata, M3.1-Flash-Preview rimuove quell'ostacolo.
Dove il modello precedente resta quello su cui puntare
Tre casi, tutti incentrati sulla prevedibilità piuttosto che sulla qualità.
Quando devi modellare il costo. MiniMax-M3 ha un listino: 0,30 $ per milione di token di input, 1,20 $ per milione di output e una tariffa di lettura cache di 0,06 $ per milione sul nostro catalogo. Puoi stimare al centesimo la fattura mensile di un carico di lavoro prima di eseguirlo. MiniMax-M3.1-Flash-Preview non ha alcuna tariffa per token da nessuna parte nelle pagine di MiniMax, quindi il suo costo è il tuo abbonamento diviso per quanto lo usi — ottimo per un budget fisso, inutile per l'economia unitaria.
Quando hai bisogno che il modello sia il modello. MiniMax-M3 è open-weight: puoi scaricarlo, eseguirlo sul tuo hardware e sapere che l'artefatto che risponderà alle tue chiamate tra sei mesi è lo stesso che risponde oggi. MiniMax-M3.1-Flash-Preview non ha checkpoint, e l'accesso di livello preview significa che lo stack di serving, la composizione delle quote e la disponibilità sono tutti controllati dal fornitore ed esplicitamente soggetti a modifiche.
Quando ti serve una risposta non basata sul ragionamento. Come sopra — questa è l'unica regressione di capacità nel confronto, ed è quella che sorprende le persone, perché un modello più nuovo che non riesce a fare qualcosa che quello più vecchio riusciva a fare non è un caso per cui qualcuno si prepari.

Chiamare entrambi da un unico posto
La stranezza qui è che i due modelli si acquistano in modi diversi — uno a consumo, uno in abbonamento — e l'istinto naturale è quello di schierarsi. La mossa più utile è instradare tra i due in base alla forma del compito, il che funziona solo se il lato a consumo è raggiungibile dallo stesso posto di tutto il resto.
MiniMax-M3 su OrcaRouter riporta il prezzo di listino di MiniMax con uno 0% di ricarico aggiunto, quindi gli $0,30 e $1,20 sulla scheda delle tariffe sono quanto costa una chiamata, senza alcun margine della piattaforma in aggiunta. Si trova sullo stesso endpoint compatibile con OpenAI di MiniMax M2.7 — lo stesso prezzo di $0,30/$1,20 su una finestra di 200.000 token, anch'esso open-weight — e di oltre 200 altri modelli, dietro una sola chiave API, con failover automatico tra provider quando un endpoint vacilla. Rispetto alla nostra telemetria, che è un tipo di numero diverso da quello di un fornitore: negli ultimi sette giorni M3 ha risposto a circa 238 token di output al secondo con un p50 di circa 4,1 secondi al primo token, con un tasso di errore vicino allo 0,15%, misurato sul playground di OrcaRouter. Se vuoi tenere MiniMax-M3 come la metà affidabile di una pipeline e trattare MiniMax-M3.1-Flash-Preview come la metà sperimentale, la metà affidabile è una riga di configurazione anziché un secondo rapporto con un fornitore. MiniMax-M3.1-Flash-Preview stesso non è nel nostro catalogo; la via per arrivarci è il Token Plan e il prodotto di coding dello stesso fornitore.
Ciò che cambierebbe questo articolo è specifico e facile da tenere d'occhio. Un listino prezzi pubblicato per MiniMax-M3.1-Flash-Preview annullerebbe il motivo principale per preferire M3 sul piano economico. Un insieme di punteggi indipendenti sostituirebbe la colonna vuota con qualcosa di comparabile. Un checkpoint scaricabile eliminerebbe l'obiezione sulla riproducibilità. Finché non arriva almeno uno di questi elementi, MiniMax-M3 resta il modello di questa coppia che puoi chiamare a rendere conto — e quello più recente resta l'anteprima più veloce, meglio controllata e non misurata che MiniMax ha deciso di far pagare al mese invece che a token.

