
MiniMax M3.1 Flash Preview est désormais disponible sur le Token Plan : ce que votre abonnement débloque réellement
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 468 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 192 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
MiniMax-M3.1-Flash-Preview a été lancé le 27 septembre 2026, et la façon dont il a été lancé, c’est toute l’histoire. Ce n’est pas un modèle à l’usage. Le fournisseur a placé son tout nouveau modèle de texte derrière la même Token Plan Subscription Key qui couvre déjà MiniMax-M3, MiniMax M2.7 et la variante M2.7-highspeed, donc si vous disposez d’une place, il n’y a pas de nouvelle clé à générer ni de second contrat à signer. Ce qui n’existe pas non plus, à ce jour, c’est un prix par token, une fiche modèle, un benchmark publié, ou un moyen quelconque de désactiver la réflexion du modèle.
Cette combinaison — un accès sans friction associé à des conditions économiques entièrement non divulguées — est suffisamment inhabituelle pour mériter d’être décortiquée avant que quiconque y connecte un pipeline de production. Le reste de cet article présente ce que la documentation du fournisseur dit réellement, ce qu’elle ne dit manifestement pas, et l’unique ligne de code qui vous dira en moins d’une minute si ce modèle correspond à votre façon de travailler.
Qu’est-ce qui a réellement atterri le 27 septembre
La documentation développeur de MiniMax comporte désormais une note permanente, répétée sur chaque page de modèle textuel : MiniMax-M3.1-Flash-Preview n'est disponible que via Token Plan et MiniMax Code pour l'instant. Le modèle apparaît en premier dans le tableau des modèles du fournisseur lui-même, au-dessus de MiniMax-M3, décrit comme un modèle de codage multimodal de pointe doté d'une fenêtre de contexte de 1 M et d'une profondeur de réflexion ajustable.
• Fenêtre de contexte — 1 000 000 de tokens, le même plafond que celui de MiniMax-M3
• Modalités d'entrée — texte, image et vidéo, renvoyant du texte
• Profondeur de réflexion — un réglage d'effort acceptant faible, moyen, élevé, xhigh et max, la valeur par défaut étant max lorsqu'il est omis
• Prise en charge des protocoles — le même identifiant de modèle fonctionne sur le point de terminaison compatible avec Anthropic de MiniMax, son point de terminaison compatible avec OpenAI et son point de terminaison OpenAI Responses
• Disponibilité — Token Plan et MiniMax Code uniquement ; pas en paiement à l'usage
• Prix — aucun tarif par token publié où que ce soit
• Poids — aucun ; les deux dépôts publics les plus récents de l'organisation MiniMaxAI restent MiniMax-Music3 et MiniMax-H3
• Benchmarks indépendants — aucun ; le modèle n'a pas d'entrée dans l'index des modèles d'Artificial Analysis
L'entreprise l'a annoncé le jour même sur son compte MiniMaxAgent, le présentant comme destiné au développement quotidien plutôt qu'aux travaux de pointe : rapide et fiable, des corrections de bugs rapides au développement complet de fonctionnalités. C'est la mission d'un niveau Flash, pas celle d'un modèle phare. Des articles de tiers de PANews et KuCoin l'ont décrit dans les mêmes termes et ont noté que des développeurs avaient repéré le modèle dans le sélecteur MiniMax Code avant que l'entreprise ne le confirme.

La clé que vous utilisez compte plus que d'habitude
C'est le point qui prend les gens au dépourvu. MiniMax gère deux types d'identifiants distincts, et M3.1-Flash-Preview ne répond qu'à l'un d'eux. La clé d'abonnement Token Plan provient de Facturation > Token Plan et couvre l'utilisation de l'abonnement et les crédits achetés. La clé API pay-as-you-go couvre les modèles facturés au token. La documentation du fournisseur précise explicitement que les deux ne sont pas interchangeables, et qu'une clé d'abonnement peut exister avant qu'une ressource payante y soit associée — auquel cas il s'agit d'une clé valide sans rien derrière elle.
Ainsi, le test pratique n'est pas « ai-je une clé API MiniMax » mais « ai-je un siège Token Plan ». Les sièges existants sont couverts. La documentation indique qu'une Subscription Key devient utilisable lorsqu'un siège ou un accès Credits est attribué, et que le dépassement de Credits est consommé automatiquement une fois le quota de l'abonnement épuisé.
Il y a aussi une incohérence dans la documentation qu'il vaut la peine de connaître, car elle perturbera quiconque consulte d'abord la page de tarification. La note de bas de page sur la couverture de la page de tarification de Token Plan répertorie encore la gamme éligible comme M3, M2.7, image et parole, avec H3 exclu — elle n'a pas été mise à jour pour mentionner M3.1-Flash-Preview. Les pages des modèles disent le contraire : que M3.1-Flash-Preview est disponible sur Token Plan et rien d'autre. Les deux pages sont des pages fournisseur en ligne à ce jour. Seule la clé que vous avez en main permet de trancher.
Le 400 qui vous dit de quel type de modèle il s'agit
Chaque modèle de la série M de MiniMax réfléchit avant de répondre, mais M3.1-Flash-Preview est le premier à refuser de s'arrêter. Envoyez thinking: {"type": "disabled"} ou reasoning_effort: "none" et l'API renvoie HTTP 400 avec le message :
le modèle « MiniMax-M3.1-Flash-Preview » nécessite la réflexion adaptative ; thinking.type="disabled" (y compris reasoning.effort=none) n'est pas autorisé (2013)
Les recommandations du fournisseur lui-même sont de réduire effort plutôt que d'essayer de désactiver la réflexion, et l'échelle est le levier de latence : une modification de routine à low et une modification à l'échelle du dépôt à xhigh sont le même modèle qui effectue des compromis différents. Deux autres détails sont spécifiques à ce modèle. Le paramètre reasoning_effort est documenté comme efficace uniquement pour MiniMax-M3.1-Flash-Preview — il ne s'agit pas d'un contrôle général de la série M. Et l'reasoning_splitinterrupteur de sortie, qui sépare la réflexion dans un champ reasoning_content, ne peut actuellement pas être réglé sur false sur ce modèle.
L'endroit où atterrit le texte de réflexion dépend du protocole : le point de terminaison compatible Anthropic le renvoie sous la forme d'un bloc de contenu thinking, le point de terminaison compatible OpenAI le renvoie dans reasoning_content, et le point de terminaison Responses le renvoie comme un élément de sortie de raisonnement. Si vous analysiez les balises <think> dans la sortie de MiniMax-M3, ce travail n'est plus nécessaire sur le modèle plus récent — et pour les conversations entrelacées avec utilisation d'outils, la réponse complète incluant le bloc de réflexion doit être réintégrée à l'historique des messages, sinon la chaîne de raisonnement se brise.
La promotion en cours en ce moment
MiniMax Code organise une promotion de check-in du 28 septembre au 7 octobre en UTC+8, doublant les crédits gratuits accordés pour les connexions quotidiennes et l’ouvrant aussi bien aux nouveaux utilisateurs qu’aux utilisateurs existants. Les crédits annoncés s’appliquent à l’ensemble des modèles pris en charge, M3.1-Flash-Preview et les modèles vidéo H3 étant cités à titre d’exemples. Par ailleurs, l’entreprise a indiqué que les quotas du Token Plan sont réinitialisés pour tous les utilisateurs au lancement et que d’autres réinitialisations sont prévues pendant l’événement, l’éligibilité étant affichée dans l’application.
Considérez ces deux éléments comme des déclarations de fournisseur relayées par la couverture du lancement — il s’agit de conditions promotionnelles assorties de dates, et non d’un comportement produit, et la même couverture indique que l’annonce n’a pas précisé le nombre de crédits par check-in ni les règles précises applicables aux jours manqués. L’économie en régime stable est plus simple à énoncer : Token Plan est affiché à 22 $ par mois pour Plus, 55 $ pour Max et 132 $ pour Ultra, avec des fenêtres de quota glissantes de 5 heures et hebdomadaires, dimensionnées par le fournisseur à environ trois à quatre, quatre à cinq et six à sept agents simultanés respectivement. Les Purchased Credits s’établissent à 1 000 crédits pour un dollar et sont déduits au prix catalogue à l’usage de chaque modèle.
Les quatre choses que ce modèle n’a toujours pas
Aucun de ce qui suit n'est une critique du modèle ; chacun est une faille qu'une équipe doit anticiper, et les quatre sont vérifiables aujourd'hui.
• Aucun prix. Il n'existe aucun tarif par token pour M3.1-Flash-Preview sur aucune page MiniMax, il est donc impossible de le comparer au prix de M3 de 0,30 $ par million de tokens d'entrée et 1,20 $ par million de tokens de sortie, ou à quoi que ce soit d'autre, en termes de coût par token.
• Aucun benchmark. MiniMax n'a publié aucun tableau d'évaluation avec cette version. Personne d'autre non plus : le modèle est absent de l'index d'Artificial Analysis, sa colonne est donc véritablement vide, et non simplement précoce.
• Aucun poids. MiniMax-M3 est sorti en open-weight ; M3.1-Flash-Preview n'a ni dépôt ni point de contrôle téléchargeable.
• Aucune mesure indépendante. Aucun chiffre de vitesse de sortie, de latence ou de taux d'erreur provenant d'un tiers, et aucun de notre propre télémétrie de routage, car le modèle ne figure pas dans notre catalogue.
Face au lancement de M3 en juin 2026, qui est arrivé dès le premier jour avec une note d'architecture, une fiche de benchmarks et une grille tarifaire, il s'agit d'une sortie délibérément discrète. L'interprétation plausible — et c'est bien une interprétation, pas un plan annoncé — est que MiniMax veut un usage réel au sein de son propre produit avant de décider combien coûte le modèle et s'il sera ouvert.

Ce que la note d’aperçu divulguée a vu juste
Quatre jours avant le lancement, un document de prévisualisation transcrit dans un dépôt public de partenaire a circulé, décrivant un MiniMax M3.1 doté d'une attention éparse, d'une quantification d'attention Q8KV4, d'experts routés NVFP4, d'une tête de décodage spéculatif DSpark et d'un nouveau reasoning_effort champ prenant des valeurs allant de max à low. À l'époque, nous l'avions présenté comme non vérifié, car il l'était : aucun poids, aucune fiche de modèle, aucune page de tarification et aucun identifiant de modèle d'API n'existait.
L'une de ces cinq affirmations est désormais confirmée par la documentation du fournisseur lui-même, et il s'agit du champ reasoning_effort — y compris l'échelle allant de max à low, qui correspond exactement aux valeurs livrées. Les quatre autres restent non confirmées. La description publiée par MiniMax de M3.1-Flash-Preview indique seulement qu'il s'agit d'un modèle de codage multimodal de pointe avec une fenêtre de contexte de 1 M et une profondeur de réflexion ajustable ; elle ne décrit pas le schéma d'attention, la quantification ni la tête de décodage. Quiconque répète les affirmations sur l'attention éparse et le NVFP4 comme une spécification établie répète la transcription d'un tiers, ce que la version n'a précisément pas confirmé.
Si vous voulez l'essayer sans y risquer un pipeline
Le côté délicat d’un aperçu limité au forfait Token-Plan, c’est que la façon naturelle d’évaluer un nouveau modèle — l’appeler depuis votre pile existante et mesurer — est précisément ce que vous ne pouvez pas faire proprement. Il n’y a pas de tarif par jeton sur lequel se baser pour modéliser, pas de profil de latence publié, et aucune solution de basculement au sein même du produit du fournisseur si l’aperçu vacille.
C'est exactement la situation pour laquelle une couche de routage est conçue. Tout ce que vous pouvez appeler aujourd'hui se trouve derrière un point de terminaison compatible OpenAI et une seule clé API, et les modèles proches de celui-ci y sont déjà : MiniMax-M3 au tarif du fournisseur, soit 0,30 $ par million de jetons d'entrée et 1,20 $ par million de jetons de sortie, MiniMax M2.7 au même prix affiché avec une fenêtre de 200 000 jetons et des poids ouverts, ainsi que les paliers DeepSeek et Qwen Flash dans la même gamme de prix. De notre côté, les prix correspondent au prix catalogue du fournisseur répercuté avec 0 % de marge, donc lorsqu'un fournisseur baisse un tarif, il est répercuté ici le jour même plutôt qu'au fil d'un cycle de renégociation. Le basculement automatique signifie qu'une dépendance de niveau aperçu peut se trouver à côté d'un chemin de production plutôt qu'en dessous, et lorsque MiniMax publiera une grille tarifaire et un point de terminaison pour MiniMax-M3.1-Flash-Preview, la question devient une entrée dans une table de routage plutôt qu'un projet de migration. MiniMax-M3.1-Flash-Preview lui-même ne figure pas dans notre catalogue, et le moyen d'y accéder aujourd'hui est le Token Plan du fournisseur lui-même et son produit de codage.
Le résumé honnête, à l'attention d'une équipe qui lit ceci le jour du lancement : le modèle est en production, gratuit à la marge si vous payez déjà pour une place Token Plan, et totalement dépourvu de prix et de mesures selon ses propres critères. Essayez-le dans MiniMax Code, gardez le pipeline dont vous dépendez sur un modèle doté d'une grille tarifaire et d'un historique éprouvé, et surveillez les deux éléments qui feront passer ce modèle du statut de curiosité à celui de décision — un prix publié et les premiers scores indépendants.

