Une carte principale générée intitulée MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash, avec pour sous-titre « La même fenêtre de 1 M de tokens, deux argumentaires commerciaux très différents ». Une carte de gauche indique « MiniMax M3.1 Flash Preview : 1 M de contexte, prix non publié, Token Plan uniquement, la réflexion ne peut pas être désactivée » ; une carte de droite indique « DeepSeek V4 Flash : 1 M de contexte, 0,15 $/0,60 $ en heures creuses, texte uniquement, remplacé par V4.1 Flash ». Un pied de page indique « Les chiffres de MiniMax proviennent de platform.minimax.io ; ceux de DeepSeek proviennent de la grille tarifaire publiée par DeepSeek ».
Engineering & Research

MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash : deux tickets pas chers au contexte de 1M, un énorme astérisque

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous cherchez une fenêtre de contexte d’un million de tokens à un faible prix par token, MiniMax-M3.1-Flash-Preview et DeepSeek V4 Flash sont les deux noms qui reviennent sans cesse — et ce ne sont pas vraiment le même type de produit. DeepSeek V4 Flash est un modèle retiré dont l’identifiant répond encore, hébergé dans une grille tarifaire de fournisseur que vous pouvez lire au centime près. MiniMax-M3.1-Flash-Preview est un aperçu actif sans aucun tarif publié. La comparaison ci-dessous est donc en partie une comparaison de caractéristiques techniques et en partie une démonstration de la manière très différente dont ces deux fournisseurs choisissent de vendre le même segment.

Les deux aspects de la question méritent d’être énoncés avec précision, car les chiffres qui la tranchent sont dispersés entre une page tarifaire de fournisseur, l’arborescence de documentation d’un fournisseur et notre propre catalogue, et l’une des affirmations les plus souvent répétées à propos de DeepSeek V4 Flash — son prix — est une affirmation que DeepSeek a depuis remplacée.

Ce sur quoi les deux fiches techniques concordent réellement

Les caractéristiques phares sont suffisamment proches pour ne pas être décisives, à une exception près que personne ne met en avant.

• Fenêtre de contexte — 1 000 000 jetons pour MiniMax-M3.1-Flash-Preview contre 1 048 576 pour DeepSeek V4 Flash : nominalement identiques, une différence de 48 576 jetons
• Sortie maximale — non publiée pour MiniMax-M3.1-Flash-Preview ; 384 000 jetons pour DeepSeek V4 Flash, ce qui est inhabituel à ce prix et est le chiffre qui devrait décider de nombreux achats
• Modalités d'entrée — texte, image et vidéo pour MiniMax-M3.1-Flash-Preview ; texte uniquement pour DeepSeek V4 Flash
• Contrôle de la réflexion — le réglage de l'effort se fait sur une échelle de faible à max, réflexion toujours activée, pour MiniMax-M3.1-Flash-Preview ; réflexion ou non-réflexion sur DeepSeek V4 Flash, avec la non-réflexion comme véritable option
• Prise en charge des protocoles — points de terminaison compatibles avec Anthropic, compatibles avec OpenAI et OpenAI Responses pour MiniMax-M3.1-Flash-Preview ; les trois mêmes plus la complétion de préfixe de chat sur DeepSeek V4 Flash
• Poids — aucun pour MiniMax-M3.1-Flash-Preview ; les poids de DeepSeek V4 Flash ont été publiés, bien que le modèle lui-même ait été supplanté
• Prix — non publié pour MiniMax-M3.1-Flash-Preview ; publié et bas pour DeepSeek V4 Flash

Relisez cette liste deux fois, car c’est le plafond de sortie qui est discret. Un million de tokens de contexte avec 384 000 tokens de sortie représente une fenêtre de génération en un seul passage véritablement longue. Un million de tokens de contexte avec un plafond de sortie non divulgué est une promesse sur la lecture, pas sur l’écriture. Si votre charge de travail consiste à « lire un dépôt, émettre un plan de migration », c’est le second chiffre qui détermine si la tâche tient en un seul appel.

Ce sur quoi chacun est mesuré

C'est la partie la moins confortable de la comparaison, et elle est courte.

DeepSeek V4 Flash dispose d'un palmarès de benchmarks, et celui-ci est indépendant. Artificial Analysis lui attribue 34,3 sur l'Intelligence Index — 42e sur 145 modèles à cet indice — avec 69,1 sur le Coding Index et 90,8 % sur GPQA Diamond. Le 95,0 sur τ²-Bench que notre propre fiche de catalogue met en avant est le même chiffre que celui véhiculé par les supports de lancement de DeepSeek, il s'agit donc d'un chiffre de fournisseur placé aux côtés de mesures indépendantes plutôt que d'un chiffre audité. Son rappel en contexte long est de 79,7 % et son score terminal-bench est de 78,7 % sur le harnais v2.1. Ce sont là des mesures réelles et comparables d'un modèle connu.

MiniMax-M3.1-Flash-Preview n'en a aucune. MiniMax n'a publié aucun tableau d'évaluation au moment de la sortie, et aucun tiers n'en possède non plus — le modèle n'apparaît pas du tout dans l'index d'Artificial Analysis. Ce n'est pas une lacune de nos recherches ; c'est l'état actuel des informations publiques, et cela signifie que toute affirmation sur la qualité du modèle plus récent n'est, à cet instant, qu'un adjectif commercial. Quiconque vous présente aujourd'hui un tableau de benchmarks de MiniMax-M3.1-Flash-Preview cite soit l'ancien MiniMax-M3, soit l'invente.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Coding score: none published', 'Context window: 1M', 'Max output: not published', 'Weights: none', 'Price: not published'. The right column, DeepSeek V4 Flash, reads 'AA Intelligence: 34.3', 'Coding score: 69.1', 'Context window: 1,048,576', 'Max output: 384,000', 'Weights: published', 'Price: $0.15 / $0.60 off-peak'. A footer reads 'MiniMax figures per platform.minimax.io documentation, 27 September 2026; DeepSeek figures per DeepSeek's published rate card and Artificial Analysis. The MiniMax column is empty because nothing has been published, not because a result is pending.'

DeepSeek V4 Flash ne se vend pas au prix dont vous vous souvenez

Voici le piège. Le chiffre largement cité pour DeepSeek V4 Flash — 0,14 $ par million de tokens d'entrée et 0,28 $ par million de tokens de sortie — était la fiche tarifaire que le modèle portait avant le 10 septembre 2026. À cette date, DeepSeek a publié DeepSeek-V4.1-Flash, retiré à la fois V4 Flash et l'expérience V4-Flash-Vision-Exp, et baissé les prix. deepseek-v4-flash fonctionne toujours, mais la documentation de DeepSeek indique qu'il est temporairement acheminé vers V4.1 Flash et facturé au prix de Flash. Autrement dit, vous pouvez toujours saisir l'ancien nom de modèle ; vous n'appelez pas l'ancien modèle.

Donc la vraie carte à comparer est l'actuelle, par 1M de tokens — et le tarif hors pointe en est la moitié la moins chère :

• Entrée en cas d'échec de cache — $0.15 hors pointe, $0.30 en pointe
• Entrée en cas de succès de cache — $0.003 hors pointe, $0.006 en pointe
• Sortie — $0.60 hors pointe, $1.20 en pointe
• Plages de pointe — 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi, hors jours fériés chinois ; tout le reste, y compris les week-ends entiers, est hors pointe

En revanche, MiniMax-M3.1-Flash-Preview n’a aucun tarif par token, d’aucune sorte. Son coût correspond à ce que coûte votre siège Token Plan — 22 $, 55 $ ou 132 $ par mois pour Plus, Max et Ultra — consommé via un pool de quotas partagé aux prix catalogue à l’usage de chaque modèle, le fournisseur se réservant le droit de modifier la composition de ce pool. Pour un budget mensuel fixe avec un volume prévisible, cela peut représenter un excellent rapport qualité-prix. Pour un projet qui doit imputer le coût par appel, c’est de l’opacité déguisée en abonnement.

La raison pour laquelle cela compte plus que d’habitude du côté de DeepSeek, c’est le multiplicateur de pointe. Une équipe en Europe ou en Asie qui travaille pendant ses heures ouvrées se trouve, pour une part significative de son trafic, dans une fenêtre de pointe et paie le double pour ce privilège, ce qui transforme un tarif d’entrée affiché de 0,15 $ en 0,30 $, précisément pendant les heures où la plupart des produits sont en pleine activité. Basez votre budget sur la colonne des heures de pointe, sauf si votre trafic a réellement lieu la nuit en UTC.

Où {{1}}MiniMax M3 Flash Preview{{/1}} est le mauvais {{2}}endroit{{/2}}

Trois cas, et les deux premiers sont faciles à manquer parce qu'ils sont documentés plutôt que soustraits.

Le plafond de sortie est inconnu. Si votre tâche se termine par une longue génération — une spécification complète, une réécriture de transcription, un rapport annoté — vous choisissez un budget de sortie que vous ne pouvez pas voir. DeepSeek V4 Flash publie 384 000. Cette asymétrie favorise le modèle plus ancien pour tout ce qui écrit beaucoup.

La réflexion ne peut pas être désactivée. Envoyez thinking: {"type": "disabled"} à MiniMax-M3.1-Flash-Preview et vous obtenez une erreur HTTP 400 : le modèle exige une réflexion adaptative. Sur DeepSeek V4 Flash, le mode sans réflexion existe et est une option prise en charge. Pour la classification à haut débit, le routage ou l'extraction structurée courte, un modèle qui raisonne toujours en premier paie une latence et des jetons que vous n'avez pas demandés — et le seul levier dont vous disposez est de faire passer effort à low, et non de supprimer le raisonnement.

Il n'est pas appelable en mode paiement à l'usage. La documentation du fournisseur est sans ambiguïté : MiniMax-M3.1-Flash-Preview n'est actuellement disponible que via Token Plan et MiniMax Code, et la Subscription Key n'est pas interchangeable avec une clé API en paiement à l'usage. Si vous disposez déjà d'un siège, il s'agit d'un changement d'une seule ligne. Si vous n'en avez pas, évaluer ce modèle implique l'achat d'un abonnement.

Là où le numéro de DeepSeek est le mauvais choix

L'image miroir, c'est que DeepSeek V4 Flash est uniquement textuel et déjà supplanté. Il n'a jamais accepté d'images — ce travail nécessitait la version expérimentale distincte, qui a désormais été retirée en même temps que lui — et l'identifiant du modèle sert désormais des poids différents de ceux que le nom suggère. Un pipeline épinglé à deepseek-v4-flash pour la reproductibilité repose sur une redirection que DeepSeek décrit comme temporaire.

MiniMax-M3.1-Flash-Preview prend nativement en charge le texte, l'image et la vidéo, et c'est actuellement le meilleur modèle de texte du fournisseur. Une entrée vidéo à un tarif de la gamme Flash n'est pas courante dans ce segment.

Ces deux mises en garde convergent pour quiconque exploite du trafic de production : l’identifiant figurant sur la facture et le modèle qui a répondu ne sont pas garantis d’être la même chose indéfiniment, et c’est au niveau d’une couche de routage que cela se gère plutôt que se découvre.

A generated infographic titled 'The two Flash brackets, side by side' listing six paired rows: 'Sales motion — subscription seat vs per-token rate card', 'Effective input rate — Token Plan quota vs $0.15 off-peak / $0.30 peak', 'Peak surcharge — not applicable vs doubles 01:00-04:00 and 06:00-10:00 UTC', 'Cost attribution — pooled quota vs metered per call', 'Failure mode — no published output ceiling vs identifier now serves a successor', and 'Best fit — fixed-budget teams vs metered pipelines'. A footer reads 'Both models carry a 1M-token context window; neither figure is a quality claim.'

Comment décider cela en un après-midi

Commencez par la fin de la tâche plutôt que par le début.

Si la tâche relève de la génération de textes longs — tout ce qui se termine par l'écriture de dizaines de milliers de tokens — DeepSeek V4 Flash est le seul des deux à publier un plafond assez élevé pour le promettre, et sa grille tarifaire est assez modeste pour que le multiplicateur en période de pointe soit supportable. Modélisez le coût en période de pointe, pas en période creuse, et considérez l'identifiant retiré comme une migration que vous n'avez pas encore effectuée plutôt que comme un contrat stable.

Si le travail consiste à lire et à raisonner sur des entrées multimodales dans le cadre d'un budget mensuel fixe — enregistrements d'écran, documents numérisés, analyse vidéo —, MiniMax-M3.1-Flash-Preview est la configuration la plus capable, et au sein d'une licence Token Plan, c'est la façon la moins chère d'obtenir une entrée vidéo à cette longueur de contexte. Acceptez le fait que vous achetez un modèle non mesuré, et limitez le rayon d'impact : gardez la charge de travail qui compte sur une solution dotée d'une grille tarifaire publiée, et laissez la version preview se charger de la part exploratoire.

Si les deux descriptions correspondent à votre pipeline, il s'agit d'un problème de routage plutôt que d'un problème de sélection de modèle, et c'est précisément le cas pour lequel nous existons. DeepSeek V4 Flash sur OrcaRouter est proposé au tarif du fournisseur avec 0 % de marge — sa fiche catalogue indique 0,22 $ par million de tokens en entrée et 0,66 $ par million en sortie, soit la colonne de pointe de la fiche Flash actuelle, transmise telle quelle — aux côtés de MiniMax-M3 et MiniMax M2.7 dans la même tranche de prix sur la même clé. Un seul point de terminaison donne accès à plus de 200 modèles avec un basculement automatique en arrière-plan, ce qui permet à une charge de travail de passer d'une tranche de prix à l'autre sans seconde intégration. MiniMax-M3.1-Flash-Preview ne figure pas dans notre catalogue ; pour y accéder, il faut le Token Plan du fournisseur et son produit de codage.

La version en une ligne : DeepSeek V4 Flash est la valeur connue, avec le plafond de sortie publié, la grille tarifaire lisible et un successeur qui répond discrètement à son nom ; MiniMax-M3.1-Flash-Preview est le plus récent, multimodal, non mesuré, dont l'essai nécessite un abonnement. Aucun des deux n'est une raison de choisir l'autre — ce ne sont que les faits que vous n'alliez pas obtenir d'une comparaison prix par token qui cite une grille que DeepSeek a retirée en septembre.

A headless Chromium screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash, showing the model title 'DeepSeek: DeepSeek V4 Flash', a pricing row reading 0.22 US dollars per million input tokens and 0.66 per million output tokens, a context window of 1,048,576 tokens, and a maximum output of 384,000 tokens, captured 28 September 2026.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement