
MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash : deux tickets pas chers au contexte de 1M, un énorme astérisque
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 468 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 192 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Si vous cherchez une fenêtre de contexte d’un million de tokens à un faible prix par token, MiniMax-M3.1-Flash-Preview et DeepSeek V4 Flash sont les deux noms qui reviennent sans cesse — et ce ne sont pas vraiment le même type de produit. DeepSeek V4 Flash est un modèle retiré dont l’identifiant répond encore, hébergé dans une grille tarifaire de fournisseur que vous pouvez lire au centime près. MiniMax-M3.1-Flash-Preview est un aperçu actif sans aucun tarif publié. La comparaison ci-dessous est donc en partie une comparaison de caractéristiques techniques et en partie une démonstration de la manière très différente dont ces deux fournisseurs choisissent de vendre le même segment.
Les deux aspects de la question méritent d’être énoncés avec précision, car les chiffres qui la tranchent sont dispersés entre une page tarifaire de fournisseur, l’arborescence de documentation d’un fournisseur et notre propre catalogue, et l’une des affirmations les plus souvent répétées à propos de DeepSeek V4 Flash — son prix — est une affirmation que DeepSeek a depuis remplacée.
Ce sur quoi les deux fiches techniques concordent réellement
Les caractéristiques phares sont suffisamment proches pour ne pas être décisives, à une exception près que personne ne met en avant.
• Fenêtre de contexte — 1 000 000 jetons pour MiniMax-M3.1-Flash-Preview contre 1 048 576 pour DeepSeek V4 Flash : nominalement identiques, une différence de 48 576 jetons
• Sortie maximale — non publiée pour MiniMax-M3.1-Flash-Preview ; 384 000 jetons pour DeepSeek V4 Flash, ce qui est inhabituel à ce prix et est le chiffre qui devrait décider de nombreux achats
• Modalités d'entrée — texte, image et vidéo pour MiniMax-M3.1-Flash-Preview ; texte uniquement pour DeepSeek V4 Flash
• Contrôle de la réflexion — le réglage de l'effort se fait sur une échelle de faible à max, réflexion toujours activée, pour MiniMax-M3.1-Flash-Preview ; réflexion ou non-réflexion sur DeepSeek V4 Flash, avec la non-réflexion comme véritable option
• Prise en charge des protocoles — points de terminaison compatibles avec Anthropic, compatibles avec OpenAI et OpenAI Responses pour MiniMax-M3.1-Flash-Preview ; les trois mêmes plus la complétion de préfixe de chat sur DeepSeek V4 Flash
• Poids — aucun pour MiniMax-M3.1-Flash-Preview ; les poids de DeepSeek V4 Flash ont été publiés, bien que le modèle lui-même ait été supplanté
• Prix — non publié pour MiniMax-M3.1-Flash-Preview ; publié et bas pour DeepSeek V4 Flash
Relisez cette liste deux fois, car c’est le plafond de sortie qui est discret. Un million de tokens de contexte avec 384 000 tokens de sortie représente une fenêtre de génération en un seul passage véritablement longue. Un million de tokens de contexte avec un plafond de sortie non divulgué est une promesse sur la lecture, pas sur l’écriture. Si votre charge de travail consiste à « lire un dépôt, émettre un plan de migration », c’est le second chiffre qui détermine si la tâche tient en un seul appel.
Ce sur quoi chacun est mesuré
C'est la partie la moins confortable de la comparaison, et elle est courte.
DeepSeek V4 Flash dispose d'un palmarès de benchmarks, et celui-ci est indépendant. Artificial Analysis lui attribue 34,3 sur l'Intelligence Index — 42e sur 145 modèles à cet indice — avec 69,1 sur le Coding Index et 90,8 % sur GPQA Diamond. Le 95,0 sur τ²-Bench que notre propre fiche de catalogue met en avant est le même chiffre que celui véhiculé par les supports de lancement de DeepSeek, il s'agit donc d'un chiffre de fournisseur placé aux côtés de mesures indépendantes plutôt que d'un chiffre audité. Son rappel en contexte long est de 79,7 % et son score terminal-bench est de 78,7 % sur le harnais v2.1. Ce sont là des mesures réelles et comparables d'un modèle connu.
MiniMax-M3.1-Flash-Preview n'en a aucune. MiniMax n'a publié aucun tableau d'évaluation au moment de la sortie, et aucun tiers n'en possède non plus — le modèle n'apparaît pas du tout dans l'index d'Artificial Analysis. Ce n'est pas une lacune de nos recherches ; c'est l'état actuel des informations publiques, et cela signifie que toute affirmation sur la qualité du modèle plus récent n'est, à cet instant, qu'un adjectif commercial. Quiconque vous présente aujourd'hui un tableau de benchmarks de MiniMax-M3.1-Flash-Preview cite soit l'ancien MiniMax-M3, soit l'invente.

DeepSeek V4 Flash ne se vend pas au prix dont vous vous souvenez
Voici le piège. Le chiffre largement cité pour DeepSeek V4 Flash — 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie — était la fiche tarifaire que le modèle portait avant le 10 septembre 2026. À cette date, DeepSeek a publié DeepSeek-V4.1-Flash, retiré à la fois V4 Flash et l'expérience V4-Flash-Vision-Exp, et baissé les prix. deepseek-v4-flash fonctionne toujours, mais la documentation de DeepSeek indique qu'il est temporairement acheminé vers V4.1 Flash et facturé au prix de Flash. Autrement dit, vous pouvez toujours saisir l'ancien nom de modèle ; vous n'appelez pas l'ancien modèle.
Donc la vraie carte à comparer est l'actuelle, par 1M de tokens — et le tarif hors pointe en est la moitié la moins chère :
• Entrée en cas d'échec de cache — $0.15 hors pointe, $0.30 en pointe
• Entrée en cas de succès de cache — $0.003 hors pointe, $0.006 en pointe
• Sortie — $0.60 hors pointe, $1.20 en pointe
• Plages de pointe — 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi, hors jours fériés chinois ; tout le reste, y compris les week-ends entiers, est hors pointe
En revanche, MiniMax-M3.1-Flash-Preview n’a aucun tarif par token, d’aucune sorte. Son coût correspond à ce que coûte votre siège Token Plan — 22 $, 55 $ ou 132 $ par mois pour Plus, Max et Ultra — consommé via un pool de quotas partagé aux prix catalogue à l’usage de chaque modèle, le fournisseur se réservant le droit de modifier la composition de ce pool. Pour un budget mensuel fixe avec un volume prévisible, cela peut représenter un excellent rapport qualité-prix. Pour un projet qui doit imputer le coût par appel, c’est de l’opacité déguisée en abonnement.
La raison pour laquelle cela compte plus que d’habitude du côté de DeepSeek, c’est le multiplicateur de pointe. Une équipe en Europe ou en Asie qui travaille pendant ses heures ouvrées se trouve, pour une part significative de son trafic, dans une fenêtre de pointe et paie le double pour ce privilège, ce qui transforme un tarif d’entrée affiché de 0,15 $ en 0,30 $, précisément pendant les heures où la plupart des produits sont en pleine activité. Basez votre budget sur la colonne des heures de pointe, sauf si votre trafic a réellement lieu la nuit en UTC.
Où {{1}}MiniMax M3 Flash Preview{{/1}} est le mauvais {{2}}endroit{{/2}}
Trois cas, et les deux premiers sont faciles à manquer parce qu'ils sont documentés plutôt que soustraits.
Le plafond de sortie est inconnu. Si votre tâche se termine par une longue génération — une spécification complète, une réécriture de transcription, un rapport annoté — vous choisissez un budget de sortie que vous ne pouvez pas voir. DeepSeek V4 Flash publie 384 000. Cette asymétrie favorise le modèle plus ancien pour tout ce qui écrit beaucoup.
La réflexion ne peut pas être désactivée. Envoyez thinking: {"type": "disabled"} à MiniMax-M3.1-Flash-Preview et vous obtenez une erreur HTTP 400 : le modèle exige une réflexion adaptative. Sur DeepSeek V4 Flash, le mode sans réflexion existe et est une option prise en charge. Pour la classification à haut débit, le routage ou l'extraction structurée courte, un modèle qui raisonne toujours en premier paie une latence et des jetons que vous n'avez pas demandés — et le seul levier dont vous disposez est de faire passer effort à low, et non de supprimer le raisonnement.
Il n'est pas appelable en mode paiement à l'usage. La documentation du fournisseur est sans ambiguïté : MiniMax-M3.1-Flash-Preview n'est actuellement disponible que via Token Plan et MiniMax Code, et la Subscription Key n'est pas interchangeable avec une clé API en paiement à l'usage. Si vous disposez déjà d'un siège, il s'agit d'un changement d'une seule ligne. Si vous n'en avez pas, évaluer ce modèle implique l'achat d'un abonnement.
Là où le numéro de DeepSeek est le mauvais choix
L'image miroir, c'est que DeepSeek V4 Flash est uniquement textuel et déjà supplanté. Il n'a jamais accepté d'images — ce travail nécessitait la version expérimentale distincte, qui a désormais été retirée en même temps que lui — et l'identifiant du modèle sert désormais des poids différents de ceux que le nom suggère. Un pipeline épinglé à deepseek-v4-flash pour la reproductibilité repose sur une redirection que DeepSeek décrit comme temporaire.
MiniMax-M3.1-Flash-Preview prend nativement en charge le texte, l'image et la vidéo, et c'est actuellement le meilleur modèle de texte du fournisseur. Une entrée vidéo à un tarif de la gamme Flash n'est pas courante dans ce segment.
Ces deux mises en garde convergent pour quiconque exploite du trafic de production : l’identifiant figurant sur la facture et le modèle qui a répondu ne sont pas garantis d’être la même chose indéfiniment, et c’est au niveau d’une couche de routage que cela se gère plutôt que se découvre.

Comment décider cela en un après-midi
Commencez par la fin de la tâche plutôt que par le début.
Si la tâche relève de la génération de textes longs — tout ce qui se termine par l'écriture de dizaines de milliers de tokens — DeepSeek V4 Flash est le seul des deux à publier un plafond assez élevé pour le promettre, et sa grille tarifaire est assez modeste pour que le multiplicateur en période de pointe soit supportable. Modélisez le coût en période de pointe, pas en période creuse, et considérez l'identifiant retiré comme une migration que vous n'avez pas encore effectuée plutôt que comme un contrat stable.
Si le travail consiste à lire et à raisonner sur des entrées multimodales dans le cadre d'un budget mensuel fixe — enregistrements d'écran, documents numérisés, analyse vidéo —, MiniMax-M3.1-Flash-Preview est la configuration la plus capable, et au sein d'une licence Token Plan, c'est la façon la moins chère d'obtenir une entrée vidéo à cette longueur de contexte. Acceptez le fait que vous achetez un modèle non mesuré, et limitez le rayon d'impact : gardez la charge de travail qui compte sur une solution dotée d'une grille tarifaire publiée, et laissez la version preview se charger de la part exploratoire.
Si les deux descriptions correspondent à votre pipeline, il s'agit d'un problème de routage plutôt que d'un problème de sélection de modèle, et c'est précisément le cas pour lequel nous existons. DeepSeek V4 Flash sur OrcaRouter est proposé au tarif du fournisseur avec 0 % de marge — sa fiche catalogue indique 0,22 $ par million de tokens en entrée et 0,66 $ par million en sortie, soit la colonne de pointe de la fiche Flash actuelle, transmise telle quelle — aux côtés de MiniMax-M3 et MiniMax M2.7 dans la même tranche de prix sur la même clé. Un seul point de terminaison donne accès à plus de 200 modèles avec un basculement automatique en arrière-plan, ce qui permet à une charge de travail de passer d'une tranche de prix à l'autre sans seconde intégration. MiniMax-M3.1-Flash-Preview ne figure pas dans notre catalogue ; pour y accéder, il faut le Token Plan du fournisseur et son produit de codage.
La version en une ligne : DeepSeek V4 Flash est la valeur connue, avec le plafond de sortie publié, la grille tarifaire lisible et un successeur qui répond discrètement à son nom ; MiniMax-M3.1-Flash-Preview est le plus récent, multimodal, non mesuré, dont l'essai nécessite un abonnement. Aucun des deux n'est une raison de choisir l'autre — ce ne sont que les faits que vous n'alliez pas obtenir d'une comparaison prix par token qui cite une grille que DeepSeek a retirée en septembre.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
