Una hero card generata intitolata MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash, con sottotitolo 'La stessa finestra di 1M token, due proposte di vendita molto diverse'. Una card a sinistra recita 'MiniMax M3.1 Flash Preview: contesto 1M, prezzo non pubblicato, solo Token Plan, il thinking non può essere disattivato'; una card a destra recita 'DeepSeek V4 Flash: contesto 1M, $0.15/$0.60 fuori picco, solo testo, sostituito da V4.1 Flash'. Un piè di pagina recita 'I dati di MiniMax secondo platform.minimax.io; i dati di DeepSeek secondo il listino prezzi pubblicato da DeepSeek'.
Engineering & Research

MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: due biglietti economici da 1M di contesto, un enorme asterisco

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Se stai cercando una finestra di contesto da un milione di token a un prezzo basso per token, MiniMax-M3.1-Flash-Preview e DeepSeek V4 Flash sono i due nomi che continuano a saltare fuori — e non sono davvero lo stesso tipo di prodotto. DeepSeek V4 Flash è un modello ritirato il cui identificatore risponde ancora, e vive all'interno di un listino prezzi del fornitore che puoi leggere al centesimo. MiniMax-M3.1-Flash-Preview è un'anteprima live senza alcuna tariffa pubblicata. Il confronto che segue è quindi in parte un confronto di specifiche e in parte una dimostrazione di quanto diversamente questi due fornitori stiano scegliendo di vendere la stessa fascia.

Entrambi i lati della questione meritano di essere enunciati con precisione, perché i numeri che la decidono sono sparsi tra una pagina dei prezzi di un fornitore, un albero di documentazione di un fornitore e il nostro catalogo, e una delle affermazioni più frequentemente ripetute su DeepSeek V4 Flash — il suo prezzo — è una che DeepSeek ha da allora sostituito.

Su cosa corrispondono effettivamente le due schede tecniche

Le specifiche principali sono abbastanza simili da non costituire il fattore decisivo, con un'eccezione che nessuno pubblicizza.

• Finestra di contesto — 1.000.000 di token per MiniMax-M3.1-Flash-Preview rispetto a 1.048.576 per DeepSeek V4 Flash: nominalmente identici, una differenza di 48.576 token
• Output massimo — non pubblicato per MiniMax-M3.1-Flash-Preview; 384.000 token per DeepSeek V4 Flash, il che è insolito a questo prezzo ed è il numero che dovrebbe orientare molte decisioni d'acquisto
• Modalità di input — testo, immagine e video per MiniMax-M3.1-Flash-Preview; solo testo per DeepSeek V4 Flash
• Controllo del thinking — una scala di effort da low a max, thinking sempre attivo, per MiniMax-M3.1-Flash-Preview; thinking o non-thinking su DeepSeek V4 Flash, con il non-thinking come opzione reale
• Supporto ai protocolli — endpoint compatibili con Anthropic, compatibili con OpenAI e OpenAI Responses per MiniMax-M3.1-Flash-Preview; gli stessi tre più il completamento del prefisso di chat su DeepSeek V4 Flash
• Pesi — nessuno per MiniMax-M3.1-Flash-Preview; i pesi di DeepSeek V4 Flash sono stati pubblicati, anche se il modello stesso è stato superato
• Prezzo — non pubblicato per MiniMax-M3.1-Flash-Preview; pubblicato e basso per DeepSeek V4 Flash

Leggi quella lista due volte, perché il limite di output è quello silenzioso. Un milione di token di contesto con 384.000 token di output è una finestra di generazione in singolo passaggio davvero lunga. Un milione di token di contesto con un limite di output non dichiarato è una promessa sulla lettura, non sulla scrittura. Se il tuo carico di lavoro è "leggi un repository, produci un piano di migrazione", il secondo numero è quello che determina se l'attività rientra in una singola chiamata.

A che valore viene misurato ciascuno

Questa è la sezione meno piacevole del confronto, ed è breve.

DeepSeek V4 Flash ha un record di benchmark, ed è indipendente. Artificial Analysis gli assegna 34,3 nell'Intelligence Index — 42º su 145 modelli in quell'indice — con 69,1 nel Coding Index e 90,8% su GPQA Diamond. Il 95,0 su τ²-Bench con cui si apre la nostra voce di catalogo è la stessa cifra che accompagnava il materiale di lancio di DeepSeek, quindi è un dato del fornitore collocato accanto a dati indipendenti, anziché un dato verificato. Il suo recall su contesto lungo è del 79,7% e il suo valore su terminal-bench è del 78,7% sull'harness v2.1. Queste sono misurazioni reali e comparabili di un modello noto.

MiniMax-M3.1-Flash-Preview non ne ha alcuna. MiniMax non ha pubblicato alcuna tabella di valutazione con il rilascio, e nemmeno una terza parte ne ha una — il modello non compare affatto nell'indice di Artificial Analysis. Non è una lacuna della nostra ricerca; è lo stato attuale della documentazione pubblica, e significa che ogni affermazione sulla qualità del modello più recente è, in questo momento, un aggettivo del fornitore. Chiunque oggi ti presenti una tabella di benchmark di MiniMax-M3.1-Flash-Preview o sta citando il più vecchio MiniMax-M3 oppure se la sta inventando.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Coding score: none published', 'Context window: 1M', 'Max output: not published', 'Weights: none', 'Price: not published'. The right column, DeepSeek V4 Flash, reads 'AA Intelligence: 34.3', 'Coding score: 69.1', 'Context window: 1,048,576', 'Max output: 384,000', 'Weights: published', 'Price: $0.15 / $0.60 off-peak'. A footer reads 'MiniMax figures per platform.minimax.io documentation, 27 September 2026; DeepSeek figures per DeepSeek's published rate card and Artificial Analysis. The MiniMax column is empty because nothing has been published, not because a result is pending.'

DeepSeek V4 Flash non è venduto al prezzo che ricordi

Ecco la trappola. La cifra ampiamente citata per DeepSeek V4 Flash — 0,14 $ per milione di token di input e 0,28 $ per milione di output — era la scheda prezzi che il modello aveva prima del 10 settembre 2026. In quella data DeepSeek ha rilasciato DeepSeek-V4.1-Flash, ha ritirato sia V4 Flash sia l'esperimento V4-Flash-Vision-Exp e ha tagliato i prezzi. L'identificatore deepseek-v4-flash funziona ancora, ma la documentazione di DeepSeek afferma che al momento viene indirizzato temporaneamente a V4.1 Flash e fatturato al prezzo di Flash. In altre parole, puoi ancora digitare il vecchio nome del modello; non stai chiamando il vecchio modello.

Quindi la vera tariffa con cui confrontarsi è quella attuale, per 1M di token — e off-peak ne è la metà più economica:

• Input con cache-miss — 0,15 $ fuori picco, 0,30 $ in picco
• Input con cache-hit — 0,003 $ fuori picco, 0,006 $ in picco
• Output — 0,60 $ fuori picco, 1,20 $ in picco
• Fasce di picco — 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì, escluse le festività pubbliche cinesi; tutto il resto, inclusi i fine settimana completi, è fuori picco

Al contrario, MiniMax-M3.1-Flash-Preview non ha alcun tipo di tariffa per token. Il suo costo è quello che costa il tuo posto nel Token Plan — 22, 55 o 132 dollari al mese per Plus, Max e Ultra — consumato attraverso un pool di quota condiviso al prezzo di listino pay-as-you-go di ciascun modello, con il fornitore che si riserva il diritto di modificare la composizione di quel pool. Per un budget mensile fisso con un volume prevedibile, può rappresentare un valore eccellente. Per un progetto che deve attribuire il costo per chiamata, è opacità travestita da abbonamento.

Il motivo per cui questo conta più del solito sul fronte DeepSeek è il moltiplicatore di picco. Un team in Europa o in Asia che opera durante il proprio orario lavorativo si trova dentro una finestra di picco per una quota significativa del suo traffico e paga il doppio per questo privilegio, il che trasforma una tariffa di input nominale di $0.15 in $0.30 proprio nelle ore in cui la maggior parte dei prodotti è più occupata. Calcola il budget sulla colonna di picco a meno che il tuo traffico non venga davvero generato di notte in UTC.

Dove MiniMax M3.1 Flash Preview è la scelta sbagliata

Tre casi, e i primi due sono facili da non notare perché sono documentati anziché sottratti.

Il tetto di output è sconosciuto. Se il tuo compito si conclude con una lunga generazione — una specifica completa, la riscrittura di una trascrizione, un report annotato — stai scegliendo un budget di output che non puoi vedere. DeepSeek V4 Flash ne pubblica 384.000. Questa asimmetria favorisce il modello più vecchio per qualsiasi cosa che scriva molto.

Il pensiero non può essere disattivato. Invia thinking: {"type": "disabled"} a MiniMax-M3.1-Flash-Preview e ottieni un HTTP 400: il modello richiede il pensiero adattivo. Su DeepSeek V4 Flash, la modalità non-thinking esiste ed è un'opzione supportata. Per classificazione ad alto throughput, routing o estrazione strutturata breve, un modello che ragiona sempre prima paga latenza e token che non hai richiesto — e l'unica leva che hai è abbassare effort a low, non rimuovere il ragionamento.

Non è invocabile in modalità pay-as-you-go. La documentazione del fornitore è inequivocabile: al momento MiniMax-M3.1-Flash-Preview è disponibile solo tramite Token Plan e MiniMax Code, e la Subscription Key non è intercambiabile con una chiave API pay-as-you-go. Se hai già una postazione assegnata, è una modifica di una sola riga. In caso contrario, valutare questo modello significa acquistare un abbonamento.

Dove il numero di DeepSeek è la scelta sbagliata

L'immagine speculare è che DeepSeek V4 Flash è solo testo e già superato. Non ha mai accettato immagini — quel lavoro richiedeva la build sperimentale separata, ormai ritirata insieme ad esso — e l'identificatore del modello ora serve pesi diversi da quanto suggerisce il nome. Una pipeline fissata a deepseek-v4-flash per la riproducibilità si affida a un reindirizzamento che DeepSeek descrive come temporaneo.

MiniMax-M3.1-Flash-Preview accetta nativamente testo, immagini e video, ed è l'attuale modello testuale di punta del fornitore. L'input video a un prezzo Flash non è comune in questa fascia.

Entrambe le avvertenze puntano nella stessa direzione per chiunque gestisca traffico di produzione: non è garantito che l'identificatore sulla fattura e il modello che ha risposto restino la stessa cosa a tempo indefinito, e un livello di routing è il punto in cui questo viene gestito anziché scoperto.

A generated infographic titled 'The two Flash brackets, side by side' listing six paired rows: 'Sales motion — subscription seat vs per-token rate card', 'Effective input rate — Token Plan quota vs $0.15 off-peak / $0.30 peak', 'Peak surcharge — not applicable vs doubles 01:00-04:00 and 06:00-10:00 UTC', 'Cost attribution — pooled quota vs metered per call', 'Failure mode — no published output ceiling vs identifier now serves a successor', and 'Best fit — fixed-budget teams vs metered pipelines'. A footer reads 'Both models carry a 1M-token context window; neither figure is a quality claim.'

Come deciderlo in un pomeriggio

Inizia dalla fine del compito invece che dall'inizio.

Se il lavoro è la generazione long-form — qualsiasi cosa che termini scrivendo decine di migliaia di token — DeepSeek V4 Flash è l'unico dei due che pubblica un tetto abbastanza alto da poterlo promettere, e il suo listino è abbastanza contenuto da rendere sostenibile il moltiplicatore di picco. Calcola il costo al picco, non fuori picco, e considera l'identificatore dismesso come una migrazione che non hai ancora fatto, anziché come un contratto stabile.

Se il compito è leggere e ragionare su input multimodale con un budget mensile fisso — registrazioni dello schermo, documenti scansionati, revisione di video — MiniMax-M3.1-Flash-Preview è la forma più capace, e all'interno di una licenza Token Plan è il modo più economico per ottenere input video a questa lunghezza di contesto. Accetta il fatto che stai acquistando un modello non misurato, e limita il raggio d'impatto: mantieni il carico di lavoro che conta su qualcosa con un listino prezzi pubblicato, e lascia che l'anteprima gestisca la metà esplorativa.

Se entrambe le descrizioni si adattano alla tua pipeline, si tratta di un problema di routing più che di selezione del modello, ed è il caso per cui esistiamo. DeepSeek V4 Flash su OrcaRoutersi posiziona alla tariffa del provider con 0% di markup — la sua voce di catalogo mostra $0,22 per milione di token in input e $0,66 per milione in output, ovvero la colonna di picco dell'attuale scheda Flash, passata direttamente — insieme a MiniMax-M3 e MiniMax M2.7 nella stessa fascia di prezzo sulla stessa chiave. Un unico endpoint raggiunge oltre 200 modelli con failover automatico alle spalle, così un workload può spostarsi tra fasce di prezzo senza una seconda integrazione. MiniMax-M3.1-Flash-Preview non è nel nostro catalogo; per raggiungerlo servono il Token Plan del fornitore e il suo prodotto di coding.

La versione in una riga: DeepSeek V4 Flash è la quantità nota con il tetto di output pubblicato, il tariffario leggibile e un successore che risponde silenziosamente al suo nome; MiniMax-M3.1-Flash-Preview è quello più nuovo, multimodale e non misurato che costa un abbonamento per essere provato. Nessuno dei due è un motivo per scegliere l'altro — sono solo i fatti che non avresti ottenuto da un confronto prezzo-per-token che cita un tariffario che DeepSeek ha ritirato a settembre.

A headless Chromium screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash, showing the model title 'DeepSeek: DeepSeek V4 Flash', a pricing row reading 0.22 US dollars per million input tokens and 0.66 per million output tokens, a context window of 1,048,576 tokens, and a maximum output of 384,000 tokens, captured 28 September 2026.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno