
MiniMax M3.1: cosa dicono i documenti di anteprima trapelati — e cosa nessuno ha confermato
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 434 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
C'è un checkpoint da 250 GB su Hugging Face denominato MiniMax-M3.1-preview-private che nessuno al di fuori di una manciata di partner di inferenza può aprire. C'è un documento datato 22 settembre che si legge esattamente come la nota di architettura del fornitore, e che circola in un repository pubblico di ingegneria dei partner invece che sul sito del fornitore stesso. E il 26 settembre, un osservatore di modelli molto seguito ha pubblicato che MiniMax M3.1 è «il prossimo modello in arrivo per la settimana prossima» e che ne stanno già testando un'anteprima. Metti insieme questi tre elementi e ottieni l'intero registro pubblico di MiniMax M3.1 — un modello il cui nome, i cui delta architetturali, il cui numero di pesi e la cui settimana di arrivo sono tutti in circolazione, e di nessuno dei quali il fornitore ha detto una parola in pubblico. Il predecessore da cui discende, MiniMax M3, è tutta un'altra storia: quello è stato rilasciato, ed è il motivo per cui qualcuno si interessa a quest'ultimo.
Questo è l'aspetto che ha dall'esterno un modello non ancora rilasciato, e vale la pena essere precisi sulla forma delle prove, perché i tre filoni non sono ugualmente solidi. L'esistenza del checkpoint è corroborata: più linee indipendenti puntano allo stesso nome di repository privato e allo stesso numero di file. Il documento di architettura non è corroborato in questo modo — è la trascrizione di un terzo, e potrebbe essere autentico, obsoleto o in parte inventato. L'affermazione sulla "prossima settimana" è l'aspettativa di una persona, non una pianificazione. Tutto in questo articolo è etichettato con la solidità che effettivamente ha, e nulla qui dovrebbe essere letto come un annuncio di rilascio.
Ciò che rende MiniMax M3.1 degno di un articolo prima ancora che esista è il predecessore. MiniMax M3 era, per la maggior parte delle fonti, il modello open-weight più forte che MiniMax avesse mai rilasciato — un modello da 1M di token, testo-immagine-video, che ha raggiunto l'Artificial Analysis Intelligence Index a 29,2 ed è ancora uno dei pochi modelli aperti in grado di tenere insieme un contesto davvero lungo. Se M3.1 arriverà nell'ultima settimana di settembre, i numeri che contano per uno sviluppatore non sono la plausibilità del leak, ma cosa è cambiato nei layer e quanto costa servirlo — e su entrambe queste cose, il documento trapelato è insolitamente specifico.
Che cosa è confermato e che cosa è solo in circolazione?
La divisione onesta, al 27 settembre 2026:
• Confermato: non esiste alcuna versione pubblica di MiniMax M3.1. L'organizzazione MiniMaxAI su Hugging Face restituisce 401 — la risposta della piattaforma "non trovato o non visibile a te" — per MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview e MiniMaxAI/MiniMax-M3.1-preview-private allo stesso modo. I suoi caricamenti pubblici più recenti sono ancora MiniMax-Music3 (7 agosto 2026) e MiniMax-H3 (28 luglio 2026).
• Confermato: MiniMax M3.1 non è instradabile in nessun luogo che possiamo verificare. È assente dal catalogo dei modelli di OrcaRouter e dagli elenchi pubblici che monitoriamo; il modello MiniMax che puoi effettivamente chiamare oggi è MiniMax M3, su minimax/minimax-m3.
• Confermato: MiniMax non ha pubblicato nulla. Nessuna scheda del modello, nessun post sul blog, nessuna pagina dei prezzi, nessun peso, nessun ID del modello API. Non c'è copertura stampa di un lancio perché non c'è stato alcun lancio.
• In circolazione: il documento di architettura. È riprodotto integralmente in un repository pubblico — longsco/innoferra-eval, una suite di onboarding per partner per endpoint di modelli ospitati, creata il 23 settembre 2026 — con il nome file PREVIEW-20260922.md, con un'intestazione che lo descrive come un documento di un fornitore condiviso il 25 settembre e un'avvertenza secondo cui «nome del modello, data di rilascio del fornitore e lancio pubblico restano soggetti al rilascio effettivo». Questa è una cautela del documento stesso, non nostra, ed è quella giusta: la copia di una nota di un fornitore da parte di terzi non è una dichiarazione di MiniMax.
• In circolazione: il checkpoint da 250 GB e il suo secondo rilascio. La specifica di onboarding del repository registra un checkpoint multimodale privato presso MiniMaxAI/MiniMax-M3.1-preview-private — 62 file, 48 file safetensors, circa 250 GB, stringa di architettura MiniMaxM3SparseForConditionalGeneration — e poi un secondo rilascio più grande, MiniMax-M3.1-preview2-dspark-private, con 101 file e circa 236 GB, che ha aggiunto una bozza speculativa fp8 da 2,3 GB. Entrambi sono privati. Non possiamo aprire nessuno dei due, e nemmeno tu.
• In circolazione: la cronologia. Il post del 26 settembre è l'unica datazione pubblica che qualcuno abbia offerto, e "settimana prossima" è un'aspettativa. Considera la settimana del 28 settembre come la finestra da tenere d'occhio, non come una data.
L'unico documento che contiene i dettagli tecnici
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
Tutto ciò che si sa di specifico sul design di MiniMax M3.1 risale a quel singolo file markdown, più due file di corredo nello stesso repository: un documento demo SGLang che descrive come il checkpoint dovrebbe essere servito, e uno spec.yaml che un endpoint partner dovrebbe soddisfare. Leggendo il repository nel suo insieme, sembra un provider di inferenza che fa esattamente ciò che fa un provider di inferenza — riceve un drop anticipato da MiniMax, annota ciò che è cambiato e ne costruisce una suite di validazione. Il repository non è un press kit e non è scritto per persuadere nessuno.
Questo è un punto a suo favore, ed è anche il limite di ciò che dimostra. Niente in esso è firmato da MiniMax. I tre documenti concordano tra loro nel modo in cui concordano i documenti reali — le stesse costanti di quantizzazione, gli stessi nomi di variabili d'ambiente, gli stessi flag di avvio — e discordano nel modo in cui discordano i rilasci reali: l'anteprima del 22 settembre afferma che il nuovo metodo di decodifica speculativa non ha una confidence head, e il secondo drop di checkpoint ha distribuito una configurazione draft con enable_confidence_head impostato su true. Una fabbricazione di solito non includerebbe un arco di correzione. Ma «insolitamente coerente» non è «confermato», e la modalità di errore per un lettore è assorbire le costanti riportate sotto come il design pubblicato di MiniMax, quando esse sono, tutt'al più, il design privato di MiniMax così come letto da qualcun altro.
Le cinque modifiche ingegneristiche, secondo quel documento
Ecco il delta tra MiniMax M3 e MiniMax M3.1 così come lo descrive il documento. Ogni riga è derivata dal fornitore e non verificata — nessuna parte indipendente ha misurato un output di MiniMax M3.1 di alcun tipo.
• Copertura dell'attenzione. L'attenzione completa nei primi tre livelli è sostituita con l'attenzione sparsa, quindi tutti i livelli sono sparsi. Su MiniMax M3, i primi tre livelli erano l'ancora di attenzione completa dello stack sparso.
• Precisione dell'attenzione — "Q8KV4". Le query, incluse quelle dell'indicizzatore, escono dalla proiezione in BF16 e vengono convertite in FP8 E4M3. Le chiavi e i valori — ancora una volta inclusi quelli dell'indicizzatore — sono quantizzati a E2M1, quattro bit, in blocchi di 16, con una scala E4M3 per blocco di amax/6 limitata a [1/512, 448]. Il documento sottolinea con enfasi che la scala di quantizzazione è round-half-to-even con soglie asimmetriche, che la scala del tensore esterno è esattamente 1, e che una grandezza zero deve codificarsi come zero positivo. M3 utilizzava un percorso KV a otto bit della stessa famiglia, quindi questo dimezza ancora i byte KV.
• Precisione degli esperti. Gli esperti instradati del MoE passano da MXFP8 a W4A4 NVFP4, con l'esperto condiviso deliberatamente escluso. Le due proiezioni degli esperti ricevono schemi di attivazione diversi: FC1 utilizza una scala dinamica per riga di 2688 divisa per il massimo assoluto della riga, con la scala di riga applicata dopo il GEMM ma prima della funzione di attivazione; FC2 utilizza una scala esterna fissa di 16. La conseguenza pratica, esplicitata nel README del partner, è schietta: "un provider che esegue il checkpoint attraverso un percorso NVFP4 generico senza queste produrrà risultati numerici silenziosamente diversi."
• Decodifica speculativa. La testa di previsione multi-token in stile EAGLE è scomparsa, sostituita da un metodo che MiniMax chiama DSpark — una testa Markov standard e, nel documento del 22 settembre, nessuna testa di confidenza. Questo è il cambiamento che ha l'effetto maggiore su come si percepisce un endpoint servito, perché è l'unica leva di velocità per flusso nel design. Il motore demo che MiniMax ha distribuito insieme al checkpoint non include DSpark, e il fornitore ha misurato il divario: sulla stessa finestra di 80.000 token senza speculazione, il throughput per flusso è di 63,9 token al secondo con concorrenza 1 e scende sotto 60 con concorrenza 4, quindi la conclusione del documento stesso è che senza DSpark lo stack non può mantenere il proprio obiettivo di latenza sotto carico.
• Un nuovo campo della richiesta. MiniMax M3.1 aggiunge un campo reasoning_effort di primo livello che accetta max, xhigh, high, medium o low, iniettato nel prompt di sistema come tag di effort dal template della chat. M3 aveva solo un interruttore thinking con adaptive e disabled. Il documento nota, in modo strano e specifico, che il campo viene trasportato senza validazione e senza un default obbligatorio — cosa che il provider ha interpretato come permesso di accettare o rifiutare un valore non elencato, e che significa che due endpoint conformi potrebbero comportarsi diversamente sulla stessa richiesta.

Due dettagli nel checkpoint meritano di essere segnalati separatamente perché sono il tipo di cosa che un post di lancio omette. Primo, il checkpoint include sia una configurazione del preprocessore per immagini sia una configurazione del preprocessore per video — MiniMax M3.1 è un modello multimodale per costruzione, non un modello testuale con la visione aggiunta a posteriori, e le indicazioni fornite dal provider stesso dicono di non rifiutare gli input immagine sul nuovo stack. Secondo, il secondo rilascio del checkpoint ha rimosso del tutto le chiavi MTP e NEXTN e non ha aggiunto nulla che le sostituisca, ed è per questo che la draft DSpark ha dovuto arrivare come artefatto separato da 2,3 GB. Non c'è alcuna testa di draft nei pesi principali da attivare.
Perché non ci sono numeri di benchmark per M3.1, e perché non si tratta di una svista
Ogni resoconto su una fuga di notizie prima o poi arriva al punto in cui o inventa una tabella di benchmark o ammette di non averne alcuna. MiniMax M3.1 non ne ha alcuna. La specifica del partner lo dice esplicitamente, in un campo che esiste unicamente per impedire che qualcuno commetta l'errore:
• "Nessuna baseline 3.1 ancora pubblicata; non riutilizzare i numeri di M3 come soglie di accettazione."
Quell'istruzione è la frase più utile dell'intero corpus, perché la versione pigra di questo articolo scrive i punteggi di Artificial Analysis di MiniMax M3 sotto un'intestazione MiniMax M3.1. Non dovrebbe. Lo stesso repository esegue sonde AIME-25 e GPQA-Diamond contro l'endpoint M3.1 di MiniMax stesso e le registra come confronti tra compagno di squadra e fornitore, con i punteggi non ancora definiti: su GPQA-Diamond, 0.904 per l'esecuzione del team contro 0.813 per quella del fornitore, e su un sottoinsieme MMLU-Pro di 600 domande, 0.898 contro 0.821. Quelle sono due esecuzioni della stessa valutazione che non concordano, non un risultato del modello, e sono etichettate come anteprima con ripetizioni conteggiate. Chiunque oggi citi un singolo numero di benchmark di MiniMax M3.1 sta citando qualcosa che non esiste ancora.
Che cos'è MiniMax M3, per poter dimensionare il seguito
MiniMax M3 è stato rilasciato alla fine di maggio 2026 ed è stato pubblicato su Hugging Face il 2 giugno — 428 miliardi di parametri totali con 23 miliardi attivi, 60 livelli, 128 esperti instradati con routing top-4, 4 teste KV contro 64 teste di attenzione, e una finestra di contesto di 1.048.576 token con un output massimo di 512.000. Sul fronte indipendente, Artificial Analysis gli assegna 29,2 sull'Intelligence Index, collocandolo al 60º posto su 145 modelli campionati, con 58,6 sull'indice di coding e un p50 di 3.348 millisecondi al primo token nella nostra telemetria di routing. Il numero di punta dichiarato da MiniMax stesso per M3 è 83,5 su BrowseComp, che è un dato del fornitore e in quanto tale non verificato.
Il prezzo è la parte che invecchia meglio in un ciclo di indiscrezioni. MiniMax M3 costa 0,30 $ per milione di token in input e 1,20 $ per milione di token in output, con le letture dalla cache a 0,06 $ — ed è già attivo su OrcaRouter come minimax/minimax-m3, alla tariffa di listino del fornitore con 0% di ricarico, quindi se MiniMax prezza M3.1 allo stesso modo, la nuova tariffa è attiva dalla nostra parte il giorno stesso in cui esiste, anziché un ciclo di fatturazione dopo.
Il senso di ribadire tutto ciò non è la nostalgia. È che l'unica ragione per cui qualcuno sta aggiornando una pagina di organizzazione di Hugging Face questa settimana è che MiniMax M3 era abbastanza buono da rendere il suo successore una questione di produzione anziché uno sport da spettatori — e che un modello da 428 miliardi di parametri con una finestra di contesto da 1M a $0.30/$1.20 fissa un'asticella di rapporto prezzo-prestazioni che M3.1 deve superare, non solo un'asticella di capacità.
L'aspetto dell'inserzione anonima, e perché potrebbe aver già ricevuto una risposta
Un filone di inizio settembre merita di essere chiuso qui. Un annuncio anonimo in modalità stealth è apparso su una piattaforma di coding di terze parti con un contesto di 1.000.000 di token, prezzo $0 e livelli di ragionamento obbligatori, e ne abbiamo parlato con il nome Space Bunny Alpha, notando il tasso base per cui ogni annuncio anonimo di questo tipo prima o poi viene rivendicato da un fornitore — Pony Alpha è diventato un modello Zhipu, Hunter Alpha è diventato quello di Xiaomi, Ox Alpha è diventato un rilascio MiniMax con un nome diverso. Il tokenizer e le impronte delle anomalie in quell'annuncio puntavano a un checkpoint di anteprima MiniMax. Se MiniMax M3.1 arriverà davvero questa settimana, l'interpretazione più probabile è che l'annuncio anonimo sia stato il suo test sul campo, e il mistero si risolverà con un annuncio anziché con ulteriori indagini forensi. Questa è un'inferenza, non una prova, ed è l'ultima inferenza in questo pezzo.

Cosa tenere d'occhio e cosa fare questa settimana
I segnali che trasformerebbero questa cosa da una fuga di notizie in un lancio sono specifici e verificabili, e non sono quelli che la maggior parte dei commenti segue. Un repository pubblico su Hugging Face sotto l'organizzazione MiniMaxAI — non uno privato — con una model card è il singolo indicatore più forte; la cronologia dei caricamenti dell'organizzazione è pubblica e data ogni rilascio al giorno esatto. Una pagina modello MiniMax o un ID modello API è il secondo. Un prezzo pubblicato è il terzo, e quello che conta per un budget. Una tabella di benchmark su Artificial Analysis datata dopo il rilascio è il quarto, e l'unico indipendente.
Fino ad allora, la posizione pratica per chiunque stia sviluppando è invariata rispetto a qualsiasi altra settimana di pre-rilascio: il modello che puoi instradare oggi è MiniMax M3, una sola chiave API lo raggiunge insieme a oltre 200 altri modelli, il failover automatico significa che un'oscillazione dell'endpoint non diventa un'interruzione per te, e una rotta fissa o mista attraverso il routing DSL o un pannello di modelli che rispondono insieme tramite model fusion è il modo in cui riduci il rischio di un modello che non hai messo in produzione. Se arriva M3.1, si tratta di sostituire un solo ID modello, non di una migrazione — che è l'intero argomento per non costruire un'integrazione su misura contro una fuga di notizie.
Una cosa che questo articolo non farà è fingere di sapere quando. Il checkpoint è reale, i documenti sono specifici, e la dichiarazione pubblica più recente è una persona che dice "la prossima settimana". Dei tre, solo i primi due sono cose che puoi verificare da solo.
