
MiniMax M3.1 Flash Preview vs MiniMax M3 : quand le modèle le plus récent est le plus risqué
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 468 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 192 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
La documentation du fournisseur lui-même place désormais MiniMax-M3.1-Flash-Preview au-dessus de MiniMax-M3, et ce classement joue un rôle persuasif considérable. C'est le modèle textuel le plus récent de la gamme, il offre la même fenêtre de contexte d'un million de tokens et il ajoute un réglage de profondeur de réflexion que le modèle plus ancien n'a pas. Ce que le tableau ne montre pas, c'est que le modèle plus ancien est le seul des deux que vous pouvez télécharger, dont vous pouvez connaître le prix par token, comparer les performances à n'importe quoi, ou appeler sans abonnement — et que le plus récent a retiré un interrupteur que MiniMax-M3 vous offrait.
Ce n’est pas l’histoire d’un modèle qui se fait supplanter. C’est l’histoire d’un fournisseur qui scinde sa propre gamme en un cheval de trait facturé à l’usage et une préversion réservée aux abonnés, et ces deux éléments ne sont pas interchangeables, dans un sens comme dans l’autre. Voici ce que chacun d’eux est réellement.
Les deux fiches techniques, côte à côte
Commencez par ce que les pages du fournisseur lui-même indiquent pour les deux, car la forme de la différence apparaît ici plutôt que dans un tableau de référence.
• Annoncé — MiniMax-M3 le 1er juin 2026 avec une note d'architecture, une fiche de benchmarks et une grille tarifaire ; MiniMax-M3.1-Flash-Preview le 27 septembre 2026 avec une entrée de documentation et une publication sur le compte agent de MiniMax • Fenêtre de contexte — 1 000 000 de tokens pour les deux, selon les propres tableaux de modèles de MiniMax • Sortie maximale — 512 000 tokens pour MiniMax-M3 sur notre fiche catalogue, un chiffre que MiniMax ne publie pas elle-même ; non publié pour MiniMax-M3.1-Flash-Preview, où que ce soit • Modalités d'entrée — texte, image et vidéo en entrée, texte en sortie, pour les deux • Contrôle de la réflexion — un paramètre de réflexion que MiniMax-M3 peut être invité à ignorer, et qui peut être séparé dans un champ reasoning_details via reasoning_split ; sur MiniMax-M3.1-Flash-Preview, la réflexion est obligatoire et reasoning_split ne peut pas être désactivé • Profondeur de réflexion — non disponible sur MiniMax-M3 ; une échelle d'effort de low, medium, high, xhigh et max, avec pour valeur par défaut max, sur MiniMax-M3.1-Flash-Preview • Vitesse de sortie publiée — environ 100+ tokens par seconde pour MiniMax-M3, selon le propre tableau de modèles de MiniMax ; aucune donnée publiée pour MiniMax-M3.1-Flash-Preview • Poids — MiniMax-M3 est à poids ouverts avec un dépôt public ; MiniMax-M3.1-Flash-Preview n'en a aucun • Tarification — 0,30 $ par million de tokens d'entrée et 1,20 $ par million de tokens de sortie pour MiniMax-M3 au tarif du fournisseur ; aucun tarif par token n'existe pour MiniMax-M3.1-Flash-Preview • Accès — MiniMax-M3 en paiement à l'usage et sur Token Plan, et routable via des plateformes tierces ; MiniMax-M3.1-Flash-Preview sur Token Plan et MiniMax Code uniquement
Deux lignes, ici, appartiennent à une catégorie différente des autres. La vitesse de sortie publiée est un chiffre fournisseur pour l’ancien modèle uniquement ; le nouveau modèle est donc vendu comme le rapide, sans chiffre associé. Et la commande de réflexion a évolué à l’opposé du marketing : le nouveau modèle offre un contrôle plus fin sur l’ampleur de sa réflexion, tout en vous retirant la capacité de l’empêcher complètement de réfléchir.
Le switch que MiniMax a retiré
C'est le détail qui risque le plus de poser problème, et il est documenté plutôt que caché. Avec MiniMax-M3, envoyer thinking: {"type": "disabled"} sur le point de terminaison compatible OpenAI ignore la réflexion et renvoie une réponse directe ; sur le point de terminaison compatible Anthropic, la réflexion est désactivée par défaut et peut être activée avec le mode adaptatif. Sur MiniMax-M3.1-Flash-Preview, la requête identique renvoie HTTP 400 avec le message nécessite une réflexion adaptative. Il n'existe aucun moyen pris en charge d'obtenir une réponse sans raisonnement.
Concrètement, cela signifie qu'une charge de travail qui utilisait MiniMax-M3 comme classificateur rapide et économique — prompt court en entrée, réponse structurée courte en sortie, pas de chaîne de raisonnement — n'a pas de voie de mise à niveau directe vers le modèle plus récent. Vous pouvez abaisser effort à faible, et les consignes de MiniMax indiquent explicitement que la réduction de l'effort est le moyen prévu pour diminuer la latence de réflexion et les jetons plutôt que de la désactiver. Mais les jetons et la latence ne tombent pas à zéro, et pour une tâche d'extraction à fort volume qui écrit quatre champs par appel, « réfléchit toujours d'abord » a une structure de coûts différente de « réfléchit sur demande ».

Qu'est-ce qui est réellement mesuré sur chacun ?
D’un côté de cette comparaison, il y a des chiffres et, de l’autre, une colonne vide, et il vaut la peine de préciser à qui appartiennent ces chiffres.
Le bilan indépendant de MiniMax-M3 est réel : Artificial Analysis le place à 29,2 sur l’Intelligence Index — 60e sur 145 — avec 58,6 sur le Coding Index, 59,18 sur son indice Math, 92,9 % sur GPQA Diamond dans la même famille d’indices, 83 % de rappel en contexte long et 82,9 % sur IFBench. Ce sont des évaluations tierces d’un modèle que n’importe qui peut télécharger et réexécuter. Les propres chiffres de lancement de MiniMax pour M3 — BrowseComp à 83,5 %, SWE-Bench Pro à 59,0 %, Terminal-Bench 2.1 à 66,0 %, MCP Atlas à 74,2 %, OSWorld-Verified à 70 % — sont des chiffres du fournisseur et nous ne les avons pas vus reproduits.
MiniMax-M3.1-Flash-Preview n’a ni l’un ni l’autre. MiniMax n’a publié aucun tableau de benchmarks, et le modèle ne figure pas dans l’index d’Artificial Analysis, donc il n’existe aucun score indépendant, aucun indice de codage, aucun chiffre de rappel en contexte long et aucune mesure d’hallucination. Chaque caractérisation qui en circule — « rapide », « fiable », « conçu pour le développement quotidien » — est l’adjectif du fournisseur lui-même, tiré de l’article de lancement. Cette absence mérite d’être énoncée sans détour, car elle a un double tranchant : rien n’a été démontré comme étant pire, et rien n’a été démontré comme étant meilleur.
Cette asymétrie est toute la décision. Vous pouvez évaluer MiniMax-M3 cet après-midi en le téléchargeant ou en l'appelant, et vous pouvez comparer cette évaluation à un classement public. Avec MiniMax-M3.1-Flash-Preview, vous pouvez seulement l'utiliser et vous forger une opinion privée.
Là où le modèle plus récent l’emporte vraiment
Il serait facile de lire ce qui précède comme un argument en faveur du fait d’ignorer le nouveau modèle, et ce n’est pas non plus la bonne conclusion. Trois choses sont réelles et lui sont propres.
L'échelle d'effort est une véritable capacité, et non une simple bascule. Cinq niveaux — low jusqu'à max permettent à un même modèle d'assurer un renommage de routine comme une refactorisation à l'échelle de tout le dépôt, à des coûts de calcul différents, et elle est documentée comme n'étant efficace que pour MiniMax-M3.1-Flash-Preview. Sur MiniMax-M3, votre choix est binaire. Si votre problème est que vous ne pouvez pas prédire la latence par tâche, une profondeur réglable est exactement le contrôle que vous recherchiez.
Il s'agit du modèle actuel le plus haut de gamme du fournisseur, ce qui signifie qu'il hérite de tout ce que la lignée de la série M a appris depuis juin, et MiniMax précise explicitement qu'il s'agit du tout dernier modèle pour le raisonnement agentique, l'utilisation d'outils, le codage et les tâches à contexte long. Le mécanisme d'utilisation d'outils à réflexion entrelacée introduit par M3 est conservé, y compris l'obligation de réinjecter la réponse complète — blocs de réflexion compris — dans l'historique des messages.
Et il prend en charge la vidéo, à un tarif de type Flash, dans le cadre d'un abonnement. MiniMax-M3 aussi, à un prix par token. Si vous payez déjà un siège Token Plan et que votre seul obstacle à l'utilisation de l'entrée vidéo était le coût marginal par appel, M3.1-Flash-Preview supprime cet obstacle.
Là où l’ancien modèle reste encore celui qu’il faut appeler
Trois cas, tous liés à la prévisibilité plutôt qu'à la qualité.
Lorsque vous devez modéliser un coût. MiniMax-M3 dispose d'une grille tarifaire : 0,30 $ par million de jetons d'entrée, 1,20 $ par million de jetons de sortie, et un tarif de lecture du cache de 0,06 $ par million sur notre catalogue. Vous pouvez estimer au centime près la facture mensuelle d'une charge de travail avant de l'exécuter. MiniMax-M3.1-Flash-Preview n'affiche aucun tarif au jeton où que ce soit sur les pages de MiniMax ; son coût correspond donc à votre abonnement divisé par votre volume d'utilisation — parfait pour un budget fixe, inutile pour l'économie unitaire.
Lorsque vous avez besoin que le modèle soit le modèle. MiniMax-M3 est à poids ouverts : vous pouvez le télécharger, l'exécuter sur votre propre matériel et savoir que l'artefact qui répond à vos appels dans six mois est le même que celui qui y répond aujourd'hui. MiniMax-M3.1-Flash-Preview n'a pas de checkpoint, et un accès de niveau aperçu signifie que la pile de service, la composition des quotas et la disponibilité sont toutes contrôlées par le fournisseur et explicitement susceptibles de changer.
Quand vous avez besoin d'une réponse sans raisonnement. Comme ci-dessus — c'est la seule régression de capacité dans la comparaison, et c'est celle qui surprend les gens, car un modèle plus récent qui ne peut pas faire quelque chose que l'ancien pouvait faire n'est pas un cas que quiconque prévoit.

Appeler les deux depuis un même endroit
Ce qui est délicat ici, c'est que les deux modèles s'achètent différemment — l'un facturé à l'usage, l'autre par abonnement — et le réflexe naturel est de choisir son camp. Le geste plus utile consiste à router entre eux en fonction de la forme des tâches, ce qui ne fonctionne que si le côté facturé à l'usage est accessible depuis le même endroit que tout le reste.
MiniMax-M3 sur OrcaRouter applique le tarif catalogue de MiniMax sans aucune marge ajoutée : les 0,30 $ et 1,20 $ de la grille tarifaire correspondent donc à ce que coûte un appel, sans marge de plateforme en supplément. Il se trouve sur le même point de terminaison compatible OpenAI que MiniMax M2.7 — la même étiquette à 0,30 $/1,20 $ sur une fenêtre de 200 000 jetons, également à poids ouverts — et que plus de 200 autres modèles, derrière une seule clé API, avec un basculement automatique entre fournisseurs lorsqu'un point de terminaison vacille. Face à notre propre télémétrie, qui est un tout autre type de chiffre que celui d'un fournisseur : au cours des sept derniers jours, M3 a répondu à environ 238 jetons de sortie par seconde, avec un p50 d'environ 4,1 secondes jusqu'au premier jeton et un taux d'erreur proche de 0,15 %, mesurés sur le playground OrcaRouter. Si vous souhaitez conserver MiniMax-M3 comme la moitié fiable d'un pipeline et traiter MiniMax-M3.1-Flash-Preview comme la moitié expérimentale, la moitié fiable se résume à une ligne de configuration plutôt qu'à une seconde relation fournisseur. MiniMax-M3.1-Flash-Preview lui-même ne figure pas dans notre catalogue ; la voie pour y accéder passe par le Token Plan et le produit de codage du fournisseur.
Ce qui changerait cet article est précis et facile à surveiller. Une grille tarifaire publiée pour MiniMax-M3.1-Flash-Preview ferait s’effondrer la principale raison de préférer M3 sur le plan économique. Un ensemble de scores indépendants remplacerait la colonne vide par quelque chose de comparable. Un checkpoint téléchargeable supprimerait l’objection de reproductibilité. Jusqu’à ce qu’au moins l’un de ces éléments se concrétise, MiniMax-M3 reste le modèle de cette paire auquel on peut demander des comptes — et le plus récent reste l’aperçu plus rapide, mieux contrôlé et non mesuré que MiniMax a décidé de facturer au mois plutôt qu’au token.

