Una hero card generata intitolata Minima M3.1 Token Plan Preview, con il sottotitolo 'Live sul Token Plan, 27 settembre 2026'. Tre voci riportano 'contesto da 1 token', 'testo + immagine + in' e 'Solo Token Plan — nessun pay-as-you-go'. Una scheda a sinistra riporta 'Confermato dal fornitore: stessa Security Key di M3 e M2.7, abilitata per impostazione predefinita, impegno da basso a massimo'; una scheda a destra riporta 'Non divulgati: prezzo per token, model card, benchmark, pesi, misurazione indipendente'. Il logo OrcaRouter si trova in basso a destra.
Guides & Insights

MiniMax M3.1 Flash Preview è disponibile sul Token Plan: cosa sblocca davvero il tuo abbonamento

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MiniMax-M3.1-Flash-Preview è diventato operativo il 27 settembre 2026, e il modo in cui è successo è la storia. Non è un modello pay-as-you-go. Il fornitore ha messo il suo modello testuale più recente dietro la stessa Token Plan Subscription Key che già copre MiniMax-M3, MiniMax M2.7 e la variante M2.7-highspeed, quindi se hai una licenza non c'è nessuna nuova chiave da generare e nessun secondo contratto da firmare. Quello che però, a oggi, non esiste neppure è un prezzo per token, una model card, un benchmark pubblicato o qualsiasi modo per disattivare il ragionamento del modello.

Quella combinazione — accesso senza attriti accompagnata da condizioni economiche del tutto non pubblicate — è abbastanza insolita da meritare un’analisi approfondita prima che qualcuno vi colleghi una pipeline di produzione. Il resto di questo articolo è ciò che la documentazione del fornitore stesso dice effettivamente, ciò che vistosamente non dice, e l’unica riga di codice che ti dirà in un minuto se questo modello si adatta al tuo modo di lavorare.

Che cosa è realmente atterrato il 27 settembre

La documentazione per sviluppatori di MiniMax ora contiene una nota permanente, ripetuta su ogni pagina dedicata ai modelli di testo: Per ora MiniMax-M3.1-Flash-Preview è disponibile solo tramite Token Plan e MiniMax Code. Il modello compare per primo nella tabella dei modelli dello stesso fornitore, sopra MiniMax-M3, ed è descritto come un modello di coding multimodale di frontiera con una finestra di contesto da 1M e una profondità di ragionamento regolabile.

• Finestra di contesto — 1.000.000 di token, lo stesso tetto massimo di MiniMax-M3
• Modalità di input — testo, immagine e video, restituendo testo
• Profondità di pensiero — un'impostazione dello sforzo che accetta basso, medio, alto, xhigh e max, con valore predefinito max quando omesso
• Supporto ai protocolli — lo stesso ID del modello funziona sull'endpoint di MiniMax compatibile con Anthropic, sul suo endpoint compatibile con OpenAI e sul suo endpoint OpenAI Responses
• Disponibilità — solo Token Plan e MiniMax Code; non su pay-as-you-go
• Prezzo — nessuna tariffa per token pubblicata da nessuna parte
• Pesi — nessuno; i due repository pubblici più recenti dell'organizzazione MiniMaxAI restano MiniMax-Music3 e MiniMax-H3
• Benchmark indipendenti — nessuno; il modello non ha una voce sull'indice dei modelli di Artificial Analysis

L'azienda lo ha annunciato lo stesso giorno sul proprio account MiniMaxAgent, presentandolo come pensato per lo sviluppo quotidiano anziché per il lavoro di frontiera: veloce e affidabile, dalle rapide correzioni di bug allo sviluppo completo di funzionalità. Questo è il mandato di un livello Flash, non di un modello di punta. La copertura di agenzie di stampa terze di PANews e KuCoin lo ha descritto negli stessi termini e ha osservato che gli sviluppatori avevano individuato il modello nel selettore di MiniMax Code prima che l'azienda lo confermasse.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the standing note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, above the vendor's language-model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', ahead of MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Quale tasto usi conta più del solito

Questo è il punto che trae in inganno le persone. MiniMax gestisce due tipi distinti di credenziali, e M3.1-Flash-Preview risponde solo a uno dei due. La Token Plan Subscription Key proviene da Billing > Token Plan e copre l'utilizzo dell'abbonamento e i Credits acquistati. La API Key pay-as-you-go copre i modelli a consumo per token. La documentazione del fornitore è esplicita sul fatto che le due non sono intercambiabili, e che una Subscription Key può esistere prima che qualsiasi risorsa a pagamento vi sia associata — nel qual caso è una chiave valida senza nulla dietro.

Quindi il test pratico non è «ho una chiave API MiniMax?» ma «ho un posto in un Token Plan?». I posti esistenti sono coperti. La documentazione osserva che una Subscription Key diventa utilizzabile quando viene assegnato un posto o l'accesso ai Credits, e che l'eccedenza di Credits viene attinta automaticamente una volta esaurita la quota dell'abbonamento.

C'è anche un'incoerenza nella documentazione che vale la pena conoscere, perché confonderà chiunque legga prima la pagina dei prezzi. La nota a piè di pagina sulla copertura della pagina dei prezzi di Token Plan elenca ancora la gamma ammissibile come M3, M2.7, immagine e voce, con H3 escluso — non è stata aggiornata per indicare M3.1-Flash-Preview. Le pagine dei modelli dicono l'opposto: che M3.1-Flash-Preview è disponibile su Token Plan e nient'altro. Entrambe le pagine sono pagine del fornitore attive alla data odierna. Solo la chiave che hai in mano può stabilirlo.

Il 400 che ti dice che tipo di modello è questo

Ogni modello della serie M di MiniMax pensa prima di rispondere, ma M3.1-Flash-Preview è il primo che si rifiuta di fermarsi. Invia thinking: {"type": "disabled"} oppure reasoning_effort: "none" e l'API restituisce HTTP 400 con il messaggio:

il modello "MiniMax-M3.1-Flash-Preview" richiede il pensiero adattivo; thinking.type="disabled" (incluso reasoning.effort=none) non è consentito (2013)

L'indicazione del fornitore stesso è di ridurre lo sforzo invece di cercare di disabilitare il pensiero, e la scala è la leva della latenza: una modifica di routine a low e una modifica su tutto il repository a xhigh sono lo stesso modello che fa compromessi diversi. Due ulteriori dettagli sono specifici di questo modello. Il reasoning_effort, parametro documentato come efficace solo per MiniMax-M3.1-Flash-Preview — non è un controllo generale della serie M. E il reasoning_split, interruttore di output che separa il pensiero in un campo reasoning_content, al momento non può essere impostato su false su questo modello.

Dove finisce il testo di ragionamento dipende dal protocollo: l'endpoint compatibile con Anthropic lo restituisce come un thinking blocco di contenuto, l'endpoint compatibile con OpenAI lo restituisce su reasoning_content, e l'endpoint Responses lo restituisce come un elemento di output di ragionamento. Se stavi estraendo <think> tag dall'output di MiniMax-M3, quel lavoro non è più necessario sul modello più recente — e per le conversazioni interlacciate con uso di strumenti, la risposta completa, incluso il blocco thinking, deve essere aggiunta di nuovo alla cronologia dei messaggi, altrimenti la catena di ragionamento si interrompe.

La promozione in corso proprio adesso

MiniMax Code sta promuovendo un'iniziativa di check-in dal 28 settembre al 7 ottobre in UTC+8, raddoppiando i crediti gratuiti assegnati per gli accessi giornalieri e rendendola accessibile sia ai nuovi utenti sia a quelli esistenti. I crediti accreditati si applicano ai modelli supportati, con M3.1-Flash-Preview e i modelli video H3 citati come esempi. Separatamente, l'azienda ha dichiarato che le quote di Token Plan sono state reimpostate per tutti gli utenti al lancio e che sono previste ulteriori reimpostazioni durante l'evento, con l'idoneità mostrata nell'app.

Considera quei due come dichiarazioni del fornitore riportate dalla copertura del lancio — sono termini promozionali con date allegate, non comportamento del prodotto, e la stessa copertura osserva che l'annuncio non specificava il numero di crediti per check-in né le regole precise per i giorni saltati. L'economia a regime è più facile da enunciare: Token Plan ha un prezzo di listino di 22 $ al mese per Plus, 55 $ per Max e 132 $ per Ultra, con finestre di quota scorrevoli di 5 ore e settimanali, dimensionate dal fornitore rispettivamente a circa tre o quattro, quattro o cinque, e sei o sette agenti concorrenti. I Crediti acquistati sono a 1.000 crediti per dollaro e vengono detratti al prezzo di listino pay-as-you-go di ciascun modello.

Le quattro cose che questo modello ancora non ha

Nessuno dei seguenti è una critica al modello; ciascuno è una falla che un team deve considerare in fase di pianificazione, e tutte e quattro sono verificabili oggi.

• Nessun prezzo. Non esiste una tariffa per token per M3.1-Flash-Preview su nessuna pagina MiniMax, quindi non può essere confrontato con M3 a $0,30 per milione di input e $1,20 per milione di output, né con qualsiasi altra cosa, in termini di costo per token.
• Nessun benchmark. MiniMax non ha pubblicato alcuna tabella di valutazione con questo rilascio. Nemmeno altri: il modello è assente dall'indice di Artificial Analysis, quindi la sua colonna è davvero vuota, non solo precoce.
• Nessun peso. MiniMax-M3 è stato distribuito a pesi aperti; M3.1-Flash-Preview non ha repository né checkpoint scaricabile.
• Nessuna misurazione indipendente. Nessun dato su velocità di output, latenza o tasso di errore da terze parti, e nessuno dalla nostra telemetria di routing, perché il modello non è nel nostro catalogo.

Rispetto al lancio di M3 nel giugno 2026, arrivato con una nota architetturale, una scheda di benchmark e un listino prezzi fin dal primo giorno, questo è un rilascio deliberatamente silenzioso. La lettura plausibile — e si tratta di una lettura, non di un piano dichiarato — è che MiniMax voglia un utilizzo reale all'interno del proprio prodotto prima di decidere quanto costi il modello e se aprirlo.

A generated two-column infographic titled 'What the vendor confirms, and what it has not published', for MiniMax M3.1 Flash Preview. The left column, headlined 'Confirmed on day one', lists 'Listed first in MiniMax's own model table, above MiniMax-M3', '1,000,000-token context window', 'Text, image and video input returning text', 'An effort ladder from low to max, defaulting to max', 'Reachable over Anthropic-, OpenAI- and Responses-compatible endpoints', and 'Covered by the existing Token Plan Subscription Key'. The right column, headlined 'Still unpublished', lists 'Per-token price, anywhere on MiniMax's pages', 'A model card or evaluation table', 'Public weights or a downloadable checkpoint', 'Any entry on Artificial Analysis's model index', and 'Output-speed and latency figures from any third party'. A footer reads 'Per platform.minimax.io documentation and the launch announcement, 27 September 2026.'

Cosa ha azzeccato la nota di anteprima trapelata

Quattro giorni prima del lancio, è circolato un documento di anteprima trascritto in un repository pubblico di un partner che descriveva un MiniMax M3.1 con attenzione sparsa, quantizzazione dell'attenzione Q8KV4, esperti instradati NVFP4, una testa di decodifica speculativa DSpark e un nuovo reasoning_effort campo che accettava valori da max fino a low. All'epoca lo avevamo presentato come non verificato, perché lo era: non esistevano pesi, model card, pagina dei prezzi né un id di modello API.

Una di quelle cinque affermazioni è ora confermata dalla documentazione dello stesso fornitore, e si tratta del reasoning_effort campo — inclusa la scala da max a low, che corrisponde esattamente ai valori distribuiti. Le altre quattro restano non confermate. La descrizione pubblicata da MiniMax di M3.1-Flash-Preview afferma soltanto che si tratta di un modello di coding multimodale di frontiera con una finestra di contesto da 1M e una profondità di pensiero regolabile; non descrive lo schema di attenzione, la quantizzazione o la testa di decodifica. Chiunque ripeta le affermazioni sull'attenzione sparsa e su NVFP4 come specifica consolidata non fa che ripetere la trascrizione di una terza parte, che è esattamente ciò che la release non ha confermato.

Se vuoi provarlo senza scommetterci una pipeline

La parte scomoda di un'anteprima solo Token-Plan è che il modo naturale di valutare un nuovo modello — chiamarlo dal tuo stack esistente e misurarlo — è l'unica cosa che non puoi fare in modo pulito. Non c'è una tariffa per token da usare come riferimento, nessun profilo di latenza pubblicato e nessuna strategia di failover all'interno del prodotto dello stesso fornitore se l'anteprima vacilla.

Questa è la situazione per cui è nato un livello di routing. Tutto ciò che puoi chiamare oggi vive dietro un endpoint compatibile con OpenAI e una sola chiave API, e i modelli adiacenti a questo sono già lì: MiniMax-M3 alla tariffa del fornitore di $0,30 per milione di token in input e $1,20 per milione in output, MiniMax M2.7 allo stesso prezzo di listino con una finestra di 200.000 token e pesi aperti, e i tier DeepSeek e Qwen Flash nella stessa fascia di prezzo. I prezzi dalla nostra parte sono il prezzo di listino del fornitore trasferito con markup dello 0%, quindi quando un fornitore taglia una tariffa arriva qui lo stesso giorno, invece che seguire un ciclo di rinegoziazione. Il failover automatico significa che una dipendenza di livello preview può stare accanto a un percorso di produzione anziché sotto di esso, e quando MiniMax pubblicherà davvero un listino e un endpoint per MiniMax-M3.1-Flash-Preview, la questione diventa una voce nella tabella di routing invece di un progetto di migrazione. MiniMax-M3.1-Flash-Preview di per sé non è nel nostro catalogo, e il modo per raggiungerlo oggi è il Token Plan del fornitore stesso e il suo prodotto di coding.

Il riepilogo onesto per un team che legge questo il giorno del lancio: il modello è attivo, gratuito al margine se paghi già una licenza Token Plan, e completamente privo di prezzo e non misurato secondo i suoi stessi parametri. Provalo dentro MiniMax Code, mantieni la pipeline da cui dipendi su un modello con un tariffario e uno storico comprovato, e tieni d'occhio le due cose che lo trasformeranno da curiosità in una decisione — un prezzo pubblicato e i primi punteggi indipendenti.

A generated scorecard infographic titled 'The models you can call today, and what they cost'. Six rows read: 'MiniMax M3 — $0.30 in / $1.20 out per 1M tokens, 1,048,576-token context, open weights', 'MiniMax M2.7 — $0.30 in / $1.20 out per 1M tokens, 204,800-token context, open weights', 'DeepSeek V4 Flash — $0.22 in / $0.66 out per 1M tokens, 1,048,576-token context', 'DeepSeek V4.1 Flash — routed on the same key in the same price band', 'MiniMax M3.1 Flash Preview — no per-token rate published; Token Plan and MiniMax Code only', and 'One OrcaRouter API key reaches 200+ models with 0% markup on the provider's list price and automatic failover across providers'. A footer reads 'Catalogue figures per OrcaRouter's public model API, 28 September 2026; MiniMax M3.1 Flash Preview is not on the OrcaRouter catalogue.'