
Qu'est-ce que MiniMax M3 ? Le fleuron multimodal à contexte de 1M de MiniMax
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 est un modèle de langage à poids ouverts, nativement multimodal, du laboratoire chinois à l'origine des modèles de texte de la série M, des modèles vidéo Hailuo et de la série Music. Le laboratoire l'a annoncé le 1er juin 2026 et il a ravi à MiniMax M2.7 la première place dans la propre liste de modèles de l'entreprise, apportant une fenêtre de contexte d'un million de jetons, une entrée native texte-image-vidéo et une architecture à attention parcimonieuse que le laboratoire appelle MSA.
Quatorze articles dans les archives de ce blog mentionnent MiniMax M3. Jusqu’à présent, aucun d’entre eux ne lui était consacré. Le modèle apparaît comme l’adversaire comparaison après comparaison — le point de référence à poids ouverts auquel on mesure un Gemini, Qwen, Grok ou GPT plus récent — et il n’y a jamais eu ici de page sur laquelle un lecteur pourrait tomber pour découvrir ce qu’est réellement MiniMax M3. Voici cette page.
La fiche technique
MiniMax M3 est un modèle à mélange d'experts comptant environ 428 milliards de paramètres au total et environ 23 milliards activés par token, selon la fiche de modèle que MiniMax publie avec les poids. Il est nativement multimodal plutôt que textuel avec la vision ajoutée après coup : la fiche décrit un entraînement sur des modalités entrelacées dès la première étape, et le modèle accepte en entrée du texte, des images et de la vidéo et renvoie du texte.
• Fenêtre de contexte : 1 048 576 tokens, notre propre fiche catalogue indiquant un minimum garanti de 512 000 tokens de contexte exploitable
• Sortie maximale : 512 000 tokens sur notre page catalogue ; MiniMax ne publie pas de chiffre de sortie maximale dans ses propres documents, donc considérez 512 K comme notre chiffre, et non celui du fournisseur
• Modalité : entrée texte, image et vidéo ; sortie texte
• Paramètres : ~428 B au total, ~23 B actifs par token
• Contrôle du raisonnement : un paramètre thinking avec les modes enabled, adaptive et disabled
• Échantillonnage recommandé : temperature 1.0, top_p 0.95
• Architecture : MiniMax Sparse Attention (MSA), sujet de l'article arXiv 2606.13392
• Forme de l'endpoint : chat completions compatible OpenAI
L’affirmation architecturale phare concerne le coût de l’attention en contexte long. MiniMax affirme que MSA offre un préremplissage plus de 9 fois plus rapide et un décodage plus de 15 fois plus rapide que M2 sur une fenêtre d’un million de jetons, réduisant le calcul par jeton à environ un vingtième de celui de la génération précédente. Ce sont des chiffres du fournisseur, et nous ne les avons pas vus reproduits de manière indépendante.
Où se situe MiniMax M3 dans la propre gamme de MiniMax
C'est le sommet de la gamme linguistique, mais il vaut la peine d'être précis sur ce que contient cette gamme, car MiniMax conserve une queue plus longue de modèles encore répertoriés que la plupart des laboratoires. La documentation des modèles du fournisseur les répartit en deux.
• Modèles actuels : MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• Modèles hérités, toujours listés : MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• MiniMax M2, le plus ancien d'entre eux, dispose d'un contexte de 200 000 tokens et d'une sortie maximale de 128 000 tokens, y compris la chaîne de raisonnement
• MiniMax ne publie pas les limites de contexte ou de sortie pour M2.7 ou M2.1 dans le même document
L'écart générationnel est réel, mais pas énorme sur le seul indice où les deux modèles apparaissent. Artificial Analysis attribue à MiniMax M3 un score de 29 sur l'Intelligence Index révision v4.3.2, et à MiniMax M2.7 un score de 23 sur cette même révision — 29 place M3 au rang 16 sur 114 modèles dans le tableau de cette révision, et 23 place M2.7 au rang 36. M2.7 est sorti en mars 2026. Le saut est un pas, pas une génération, et il vaut la peine de lire les deux chiffres dans la même révision : cet indice a été recalibré le 7 septembre 2026, et les scores antérieurs à cette date ne sont pas comparables aux scores postérieurs.
Ce que ça coûte
MiniMax tarifie M3 en fonction de la taille des requêtes sur sa grille tarifaire à l'usage, et les tarifs publiés bénéficient d'une remise permanente de 50 % par rapport à un prix catalogue plus élevé.
• Jusqu'à 512 K tokens d'entrée : 0,30 $ par million de tokens d'entrée, 1,20 $ par million de tokens de sortie, 0,06 $ par million de lectures mises en cache — contre un tarif catalogue de 0,60 $ / 2,40 $ / 0,12 $
• Au-delà de 512 K tokens d'entrée : 0,60 $ par million d'entrée, 2,40 $ par million de sortie, 0,12 $ par million de lectures mises en cache — contre un tarif catalogue de 1,20 $ / 4,80 $ / 0,24 $
• Niveau de service Prioritaire : 1,5x le tarif standard, soit 0,45 $ / 1,80 $ / 0,09 $ sur le niveau des petites requêtes, sélectionné en définissant service_tier sur « priority »
• Non publié : MiniMax n'indique aucun prix d'écriture dans le cache pour M3, seulement un prix de lecture du cache
OrcaRouter propose MiniMax M3 aux mêmes tarifs — 0,30 $ en entrée, 1,20 $ en sortie — sans marge ajoutée au tarif du fournisseur. C'est un modèle mis en avant dans notre catalogue, et le trafic n'est pas négligeable : 153,7 millions de tokens acheminés au cours des sept derniers jours au moment de la rédaction, avec un temps jusqu'au premier token (p50) de 4,26 secondes et un p95 de 10,00 secondes.

Ce en quoi MiniMax M3 est mesurablement bon
Commençons par les chiffres que MiniMax rapporte pour elle-même, tous déclarés par le fournisseur et dont aucun, à notre connaissance, n’a été reproduit par un tiers.
• SWE-Bench Pro : 59,0 %
• Terminal-Bench 2.1 : 66,0 %
• SWE-fficiency : 34,8 %
• MCP Atlas : 74,2 %
• BrowseComp : 83,5, le chiffre que le fournisseur met en avant pour la recherche agentique
• Video-MME : 84,6 à 512 images, alors que l'API externe plafonne les images à 640
• KernelBench Hard : 28,8 %
• OSWorld-Verified : 68,70 % à 100 étapes maximum, pour atteindre 70,06 % à 200
Le tableau indépendant s'accorde sur la direction. Artificial Analysis place MiniMax M3 à un indice d'intelligence de 29 sur la révision v4.3.2, au 16e rang sur 114 modèles, à 0,51 $ pour exécuter l'indice par modèle — 21e rang sur 114 pour ce critère de coût. La vitesse de sortie est de 106,4 jetons par seconde contre une médiane de 67,1, et le temps jusqu'au premier jeton est de 1,25 seconde contre une médiane de 2,33 secondes. Ces deux éléments sont meilleurs que la moyenne pour cette catégorie, et le prix est bien inférieur à celle-ci.
La republication par des tiers de la même famille d'indices vient compléter les sous-scores : SWE-bench Verified à 80,5 %, tau-squared-bench à 88,9 %, AA-GPQA Diamond à 92,9 %, AA-LCR à 83,0 %, AA-IFBench à 82,9 %, OmniDocBench 1.5 à 91,6 % et USAMO 2026 à 85,7 %. La compréhension de documents et le suivi d'instructions semblent être de véritables points forts, et le score de raisonnement à long contexte correspond au récit architectural.

Ce en quoi il est mesurablement mauvais
Les faiblesses avouées se concentrent en deux endroits, et toutes deux sont visibles dans les chiffres publiés.
• L'écart agentique est le plus important : sur la même republication tierce, MiniMax M3 obtient 58,6 sur l'AA Coding Index mais seulement 30,8 sur l'AA Agentic Index. Il écrit du code bien mieux qu'il ne mène une longue tâche multi-étapes de façon autonome.
• Connaissances et hallucination : un indice AA-Omniscience de 1,4, une précision de 16,7 % et un taux d'hallucination de 18,4 %. C'est un modèle qui répondra avec assurance sur des choses qu'il ne connaît pas.
• OSWorld 2.0 : 4,6 %
• CritPt : 3,7 %, le score publié le plus faible que nous ayons trouvé pour M3, toutes sources confondues
• ResearchClawBench : 19,8 %
• Verbosité : 120 millions de jetons en sortie pour terminer l'Intelligence Index, rang 11 sur 114 — c'est un modèle bavard, et sur les invites à forte composante de raisonnement, cela se voit sur la facture
• Le plancher composite : un agrégateur tiers le situe à 55,28 sur 100, rang 60 sur 505, mais sur une couverture partielle de 50 benchmarks sur 481, donc ce composite est un plancher plutôt qu'un verdict
Plusieurs éléments ne sont tout simplement pas mesurés, et nous préférons le dire plutôt que de combler le vide. Personne en dehors de MiniMax n'a reproduit le tableau de référence du fournisseur ci-dessus. Artificial Analysis ne publie pas de chiffre pour un Coding Index ni pour un Agentic Index concernant M3 en propre — le couple 58,6 et 30,8 provient d'un tiers qui republie la même famille d'indices. Artificial Analysis cite AA-Omniscience comme composante de son indice, mais ne publie aucun score Omniscience numérique pour M3. MiniMax ne publie aucune valeur de sortie maximale, donc le 512K figurant sur notre propre page de modèle est le nôtre. Et il n'y a aucun prix d'écriture de cache sur la grille tarifaire du fournisseur.
Qui devrait choisir MiniMax M3, et qui devrait choisir autre chose ?
Choisissez MiniMax M3 lorsque la tâche est à la fois à long contexte et multimodale. Un million de tokens avec entrée vidéo, des poids ouverts que vous pouvez télécharger et exécuter vous-même, et un prix d'entrée de 0,30 $ par million de tokens : une combinaison qu'aucun autre acteur du domaine des poids ouverts n'égale aussi proprement. L'analyse de longs documents, la compréhension vidéo, la lecture de code à l'échelle d'un dépôt et les pipelines d'extraction de documents sont là où se situent ses forces mesurées — 91,6 % sur OmniDocBench et 83,0 % sur AA-LCR sont les chiffres qui plaident en sa faveur.
Choisissez autre chose dans trois cas. Si vous n’avez pas besoin de la fenêtre de contexte ni de l’entrée visuelle, MiniMax M2.7 coûte le même tarif de 0,30 $/1,20 $, obtient 23 contre 29 pour M3 sur la révision actuelle de l’indice, et est plus léger à exploiter — l’avantage de M3 n’est pas gratuit : il est simplement affiché au même prix. Si votre charge de travail concerne des agents autonomes plutôt que du codage, l’écart agentique est la raison de regarder ailleurs, et le tableau comparatif de MiniMax pointe lui aussi au même endroit : sur PostTrainBench, le fournisseur annonce 0,37 pour M3 contre 0,42 pour Opus 4.7 et 0,39 pour GPT-5.5, son seul benchmark publié où M3 perd face aux deux. Et si vous avez besoin d’une licence sans conditions, lisez le paragraphe suivant avant de vous engager.
La licence est le hic que beaucoup d'articles passent sous silence. MiniMax M3 est distribué sous la MiniMax Community License, et non sous Apache ou MIT. L'usage non commercial est gratuit. L'usage commercial est autorisé, mais vous devez afficher bien en évidence « Built with MiniMax M3 ». En dessous de 20 millions de dollars de chiffre d'affaires annuel, vous déposez une notification unique ; au-dessus, vous avez besoin d'une autorisation écrite préalable de MiniMax, à demander par e-mail avec pour objet « M3 licensing - authorization request ». La licence comporte également une annexe des usages interdits. Si vous commercialisez un produit, c'est un examen juridique, pas une formalité.
Le résumé pratique
MiniMax M3 est le fleuron actuel de la gamme de modèles de langage de MiniMax : un modèle à mélange d’experts d’environ 428 milliards de paramètres, avec environ 23 milliards de paramètres actifs par token, un contexte d’un million de tokens, une entrée vidéo et image native, et une attention éparse à laquelle le fournisseur attribue une réduction de 20x du calcul par token à contexte plein. Il a été annoncé le 1er juin 2026 ; il s’agit donc d’un modèle établi, et non d’un nouveau modèle — la question intéressante en septembre 2026 n’est pas de savoir s’il est bon, mais à quelle moitié de votre charge de travail il est adapté.
La réponse mesurée est qu’il est performant pour le code et les documents, ordinaire pour les connaissances, et faible pour le travail agentique autonome. Il est bon marché pour ce qu’il fait, et c’est le rare modèle à poids ouverts où l’affirmation de contexte long résiste à un examen indépendant. La licence est la partie que la plupart des équipes devront négocier avec elles-mêmes.
MiniMax M3 tourne sur OrcaRouter au tarif du fournisseur, sans marge, via le même point de terminaison compatible OpenAI que tout le reste ici : une seule clé API donne accès à plus de 200 modèles, avec basculement automatique si un point de terminaison tombe et un DSL de routage lorsque vous voulez épingler ou combiner. Si vous souhaitez le comparer au reste du catalogue avant de vous engager, la page du modèle affiche la grille tarifaire en direct, les percentiles de temps jusqu'au premier token et le trafic.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
