
MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: due biglietti economici da 1M di contesto, un enorme asterisco
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 468 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 192 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Se stai cercando una finestra di contesto da un milione di token a un prezzo basso per token, MiniMax-M3.1-Flash-Preview e DeepSeek V4 Flash sono i due nomi che continuano a saltare fuori — e non sono davvero lo stesso tipo di prodotto. DeepSeek V4 Flash è un modello ritirato il cui identificatore risponde ancora, e vive all'interno di un listino prezzi del fornitore che puoi leggere al centesimo. MiniMax-M3.1-Flash-Preview è un'anteprima live senza alcuna tariffa pubblicata. Il confronto che segue è quindi in parte un confronto di specifiche e in parte una dimostrazione di quanto diversamente questi due fornitori stiano scegliendo di vendere la stessa fascia.
Entrambi i lati della questione meritano di essere enunciati con precisione, perché i numeri che la decidono sono sparsi tra una pagina dei prezzi di un fornitore, un albero di documentazione di un fornitore e il nostro catalogo, e una delle affermazioni più frequentemente ripetute su DeepSeek V4 Flash — il suo prezzo — è una che DeepSeek ha da allora sostituito.
Su cosa corrispondono effettivamente le due schede tecniche
Le specifiche principali sono abbastanza simili da non costituire il fattore decisivo, con un'eccezione che nessuno pubblicizza.
• Finestra di contesto — 1.000.000 di token per MiniMax-M3.1-Flash-Preview rispetto a 1.048.576 per DeepSeek V4 Flash: nominalmente identici, una differenza di 48.576 token
• Output massimo — non pubblicato per MiniMax-M3.1-Flash-Preview; 384.000 token per DeepSeek V4 Flash, il che è insolito a questo prezzo ed è il numero che dovrebbe orientare molte decisioni d'acquisto
• Modalità di input — testo, immagine e video per MiniMax-M3.1-Flash-Preview; solo testo per DeepSeek V4 Flash
• Controllo del thinking — una scala di effort da low a max, thinking sempre attivo, per MiniMax-M3.1-Flash-Preview; thinking o non-thinking su DeepSeek V4 Flash, con il non-thinking come opzione reale
• Supporto ai protocolli — endpoint compatibili con Anthropic, compatibili con OpenAI e OpenAI Responses per MiniMax-M3.1-Flash-Preview; gli stessi tre più il completamento del prefisso di chat su DeepSeek V4 Flash
• Pesi — nessuno per MiniMax-M3.1-Flash-Preview; i pesi di DeepSeek V4 Flash sono stati pubblicati, anche se il modello stesso è stato superato
• Prezzo — non pubblicato per MiniMax-M3.1-Flash-Preview; pubblicato e basso per DeepSeek V4 Flash
Leggi quella lista due volte, perché il limite di output è quello silenzioso. Un milione di token di contesto con 384.000 token di output è una finestra di generazione in singolo passaggio davvero lunga. Un milione di token di contesto con un limite di output non dichiarato è una promessa sulla lettura, non sulla scrittura. Se il tuo carico di lavoro è "leggi un repository, produci un piano di migrazione", il secondo numero è quello che determina se l'attività rientra in una singola chiamata.
A che valore viene misurato ciascuno
Questa è la sezione meno piacevole del confronto, ed è breve.
DeepSeek V4 Flash ha un record di benchmark, ed è indipendente. Artificial Analysis gli assegna 34,3 nell'Intelligence Index — 42º su 145 modelli in quell'indice — con 69,1 nel Coding Index e 90,8% su GPQA Diamond. Il 95,0 su τ²-Bench con cui si apre la nostra voce di catalogo è la stessa cifra che accompagnava il materiale di lancio di DeepSeek, quindi è un dato del fornitore collocato accanto a dati indipendenti, anziché un dato verificato. Il suo recall su contesto lungo è del 79,7% e il suo valore su terminal-bench è del 78,7% sull'harness v2.1. Queste sono misurazioni reali e comparabili di un modello noto.
MiniMax-M3.1-Flash-Preview non ne ha alcuna. MiniMax non ha pubblicato alcuna tabella di valutazione con il rilascio, e nemmeno una terza parte ne ha una — il modello non compare affatto nell'indice di Artificial Analysis. Non è una lacuna della nostra ricerca; è lo stato attuale della documentazione pubblica, e significa che ogni affermazione sulla qualità del modello più recente è, in questo momento, un aggettivo del fornitore. Chiunque oggi ti presenti una tabella di benchmark di MiniMax-M3.1-Flash-Preview o sta citando il più vecchio MiniMax-M3 oppure se la sta inventando.

DeepSeek V4 Flash non è venduto al prezzo che ricordi
Ecco la trappola. La cifra ampiamente citata per DeepSeek V4 Flash — 0,14 $ per milione di token di input e 0,28 $ per milione di output — era la scheda prezzi che il modello aveva prima del 10 settembre 2026. In quella data DeepSeek ha rilasciato DeepSeek-V4.1-Flash, ha ritirato sia V4 Flash sia l'esperimento V4-Flash-Vision-Exp e ha tagliato i prezzi. L'identificatore deepseek-v4-flash funziona ancora, ma la documentazione di DeepSeek afferma che al momento viene indirizzato temporaneamente a V4.1 Flash e fatturato al prezzo di Flash. In altre parole, puoi ancora digitare il vecchio nome del modello; non stai chiamando il vecchio modello.
Quindi la vera tariffa con cui confrontarsi è quella attuale, per 1M di token — e off-peak ne è la metà più economica:
• Input con cache-miss — 0,15 $ fuori picco, 0,30 $ in picco
• Input con cache-hit — 0,003 $ fuori picco, 0,006 $ in picco
• Output — 0,60 $ fuori picco, 1,20 $ in picco
• Fasce di picco — 01:00–04:00 e 06:00–10:00 UTC, dal lunedì al venerdì, escluse le festività pubbliche cinesi; tutto il resto, inclusi i fine settimana completi, è fuori picco
Al contrario, MiniMax-M3.1-Flash-Preview non ha alcun tipo di tariffa per token. Il suo costo è quello che costa il tuo posto nel Token Plan — 22, 55 o 132 dollari al mese per Plus, Max e Ultra — consumato attraverso un pool di quota condiviso al prezzo di listino pay-as-you-go di ciascun modello, con il fornitore che si riserva il diritto di modificare la composizione di quel pool. Per un budget mensile fisso con un volume prevedibile, può rappresentare un valore eccellente. Per un progetto che deve attribuire il costo per chiamata, è opacità travestita da abbonamento.
Il motivo per cui questo conta più del solito sul fronte DeepSeek è il moltiplicatore di picco. Un team in Europa o in Asia che opera durante il proprio orario lavorativo si trova dentro una finestra di picco per una quota significativa del suo traffico e paga il doppio per questo privilegio, il che trasforma una tariffa di input nominale di $0.15 in $0.30 proprio nelle ore in cui la maggior parte dei prodotti è più occupata. Calcola il budget sulla colonna di picco a meno che il tuo traffico non venga davvero generato di notte in UTC.
Dove MiniMax M3.1 Flash Preview è la scelta sbagliata
Tre casi, e i primi due sono facili da non notare perché sono documentati anziché sottratti.
Il tetto di output è sconosciuto. Se il tuo compito si conclude con una lunga generazione — una specifica completa, la riscrittura di una trascrizione, un report annotato — stai scegliendo un budget di output che non puoi vedere. DeepSeek V4 Flash ne pubblica 384.000. Questa asimmetria favorisce il modello più vecchio per qualsiasi cosa che scriva molto.
Il pensiero non può essere disattivato. Invia thinking: {"type": "disabled"} a MiniMax-M3.1-Flash-Preview e ottieni un HTTP 400: il modello richiede il pensiero adattivo. Su DeepSeek V4 Flash, la modalità non-thinking esiste ed è un'opzione supportata. Per classificazione ad alto throughput, routing o estrazione strutturata breve, un modello che ragiona sempre prima paga latenza e token che non hai richiesto — e l'unica leva che hai è abbassare effort a low, non rimuovere il ragionamento.
Non è invocabile in modalità pay-as-you-go. La documentazione del fornitore è inequivocabile: al momento MiniMax-M3.1-Flash-Preview è disponibile solo tramite Token Plan e MiniMax Code, e la Subscription Key non è intercambiabile con una chiave API pay-as-you-go. Se hai già una postazione assegnata, è una modifica di una sola riga. In caso contrario, valutare questo modello significa acquistare un abbonamento.
Dove il numero di DeepSeek è la scelta sbagliata
L'immagine speculare è che DeepSeek V4 Flash è solo testo e già superato. Non ha mai accettato immagini — quel lavoro richiedeva la build sperimentale separata, ormai ritirata insieme ad esso — e l'identificatore del modello ora serve pesi diversi da quanto suggerisce il nome. Una pipeline fissata a deepseek-v4-flash per la riproducibilità si affida a un reindirizzamento che DeepSeek descrive come temporaneo.
MiniMax-M3.1-Flash-Preview accetta nativamente testo, immagini e video, ed è l'attuale modello testuale di punta del fornitore. L'input video a un prezzo Flash non è comune in questa fascia.
Entrambe le avvertenze puntano nella stessa direzione per chiunque gestisca traffico di produzione: non è garantito che l'identificatore sulla fattura e il modello che ha risposto restino la stessa cosa a tempo indefinito, e un livello di routing è il punto in cui questo viene gestito anziché scoperto.

Come deciderlo in un pomeriggio
Inizia dalla fine del compito invece che dall'inizio.
Se il lavoro è la generazione long-form — qualsiasi cosa che termini scrivendo decine di migliaia di token — DeepSeek V4 Flash è l'unico dei due che pubblica un tetto abbastanza alto da poterlo promettere, e il suo listino è abbastanza contenuto da rendere sostenibile il moltiplicatore di picco. Calcola il costo al picco, non fuori picco, e considera l'identificatore dismesso come una migrazione che non hai ancora fatto, anziché come un contratto stabile.
Se il compito è leggere e ragionare su input multimodale con un budget mensile fisso — registrazioni dello schermo, documenti scansionati, revisione di video — MiniMax-M3.1-Flash-Preview è la forma più capace, e all'interno di una licenza Token Plan è il modo più economico per ottenere input video a questa lunghezza di contesto. Accetta il fatto che stai acquistando un modello non misurato, e limita il raggio d'impatto: mantieni il carico di lavoro che conta su qualcosa con un listino prezzi pubblicato, e lascia che l'anteprima gestisca la metà esplorativa.
Se entrambe le descrizioni si adattano alla tua pipeline, si tratta di un problema di routing più che di selezione del modello, ed è il caso per cui esistiamo. DeepSeek V4 Flash su OrcaRoutersi posiziona alla tariffa del provider con 0% di markup — la sua voce di catalogo mostra $0,22 per milione di token in input e $0,66 per milione in output, ovvero la colonna di picco dell'attuale scheda Flash, passata direttamente — insieme a MiniMax-M3 e MiniMax M2.7 nella stessa fascia di prezzo sulla stessa chiave. Un unico endpoint raggiunge oltre 200 modelli con failover automatico alle spalle, così un workload può spostarsi tra fasce di prezzo senza una seconda integrazione. MiniMax-M3.1-Flash-Preview non è nel nostro catalogo; per raggiungerlo servono il Token Plan del fornitore e il suo prodotto di coding.
La versione in una riga: DeepSeek V4 Flash è la quantità nota con il tetto di output pubblicato, il tariffario leggibile e un successore che risponde silenziosamente al suo nome; MiniMax-M3.1-Flash-Preview è quello più nuovo, multimodale e non misurato che costa un abbonamento per essere provato. Nessuno dei due è un motivo per scegliere l'altro — sono solo i fatti che non avresti ottenuto da un confronto prezzo-per-token che cita un tariffario che DeepSeek ha ritirato a settembre.

Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
