
Mistral Large 4 vs MiniMax M3 : ce que coûtent cinq mois de progrès
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 151 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 249 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
MiniMax M3 est le modèle le moins cher de sa catégorie, et ce depuis le 31 mai 2026. À 0,30 $ par million de jetons d'entrée, 1,20 $ par million de jetons de sortie et 0,06 $ par million de jetons mis en cache, il passe sous les tarifs de Mistral Large 4 d'environ moitié en entrée et du double en sortie — et contrairement au modèle plus récent, vous pouvez l'acheter dès aujourd'hui sans étiquette d'aperçu. Mistral Large 4, un modèle à poids ouverts de 1,05 billion de paramètres en aperçu public depuis le 6 octobre 2026, coûte 0,68 $ et 2,09 $ et promet la publication des poids d'ici la fin du mois. Deux fleurons à poids ouverts, à cinq mois d'écart, et ces cinq mois ne se voient qu'à un seul endroit : le score indépendant de 29,2 de M3 à l'Intelligence Index, face à un score de Mistral Large 4 qui n'existe pas encore.
Voilà la forme honnête de cette comparaison, et elle est plus intéressante qu’une grille tarifaire ne le suggère. M3 a été conçu autour d’un pari architectural précis — MiniMax Sparse Attention, maintenue sur plus d’un million de tokens de contexte, avec la vidéo comme entrée de premier ordre — et il l’emporte sur le papier dans deux catégories que Mistral Large 4 ne dispute pas : la longueur brute de sortie et la vidéo native. Partout ailleurs, c’est le modèle le plus récent que l’acheteur préférerait avoir, à un prix encore suffisamment bas pour que la différence décide rarement de l’achat.
Deux architectures, deux paris
MiniMax M3 est le modèle de fondation à poids ouverts phare de MiniMax, et le premier à réunir dans une même version des performances de pointe en codage et en tâches agentiques, une fenêtre de contexte d'un million de tokens et une multimodalité native. Il accepte le texte, les images et la vidéo et renvoie du texte, et il repose sur MiniMax Sparse Attention, une architecture conçue pour soutenir jusqu'à 1,048,576 tokens de contexte avec un plancher garanti de 512K. Le pipeline de pré-entraînement a été reconstruit pour dépasser 100 billions de tokens avec des données multimodales dès la première étape, plutôt que greffées après coup. Sa sortie maximale est de 512,000 tokens.
Mistral Large 4 fait un pari différent. C'est un modèle granulaire de mélange d'experts, avec 49 milliards de paramètres actifs sur 1,05 billion au total, et un encodeur visuel de 1,6 milliard de paramètres, entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans les propres centres de données européens de Mistral, sur des données couvrant plus de 160 langues. Il prend en charge le texte et les images — pas la vidéo — sur environ un million de tokens de contexte, et Mistral le positionne autour du déploiement souverain : infrastructure européenne, poids ouverts, et la capacité de l'exécuter selon vos propres politiques, avec la cybersécurité comme cas d'usage phare.
• Fenêtre de contexte — MiniMax M3 1 048 576 jetons vs Mistral Large 4 environ 1 000 000
• Sortie maximale — MiniMax M3 512 000 tokens vs Mistral Large 4 pas encore documenté
• Modalité d'entrée — MiniMax M3 texte, image et vidéo vs Mistral Large 4 texte et image
• Prix d'entrée — MiniMax M3 0,30 $ par million contre Mistral Large 4 0,68 $ par million
• Prix de sortie — MiniMax M3 1,20 $ pour 1 M vs Mistral Large 4 2,09 $ pour 1 M
• Entrée mise en cache — MiniMax M3 0,06 $ par million vs Mistral Large 4 0,07 $ par million
• Paramètres — Mistral Large 4 : 1,05 T au total / 49 Md actifs contre MiniMax M3 non divulgué
• Sortie — MiniMax M3 31 mai 2026 vs Mistral Large 4 6 octobre 2026, aperçu
• Poids — les deux sous licence ouverte, ceux de Mistral Large 4 promis d’ici fin octobre 2026

Le tableau d'affichage n'est pas serré, et il n'est pas juste non plus.
Sur l'Artificial Analysis Intelligence Index v4.3.2, MiniMax M3 obtient un score de 29,2 et se classe 62e sur 147 modèles. C'est un résultat de milieu de tableau, et ce n'est pas une critique du modèle — l'Index a été révisé après la sortie de M3 et inclut des évaluations qui n'existaient pas au moment où MiniMax entraînait le modèle. Son sous-score en codage raconte une meilleure histoire : 58,6 sur l'AA Coding index, 46e sur 138, et 65,2 % sur Terminal-Bench 2.1. Il obtient 92,9 % sur GPQA Diamond, 83 % en rappel de contexte long et 47,1 % sur SciCode.
Mistral Large 4 n'a pas de score Index sur le même tableau ; la page est en ligne sous le titre « Mistral Large 4 Preview » et le chiffre est absent. Ce que Mistral publie, en revanche, c'est que ML4 devance DeepSeek V4 Pro 0813 et Qwen3.8 Max sur l'Index combiné Coding Agent, à 49,8 %, et que sur AutomationBench — 657 flux de travail métier couvrant Gmail, Sheets, Slack et Salesforce — il obtient 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro. MiniMax n'est nommé dans aucune des deux comparaisons, ce qui est en soi un signal quant au modèle que Mistral considère comme le véritable concurrent.
Donc, la lecture équitable est la suivante : M3 est un modèle compétent, bon marché et bien documenté, avec un score général de milieu de tableau et un profil de codage respectable, âgé de cinq mois. ML4 est un modèle en aperçu avec un plafond annoncé plus élevé, aucun score général publié, et une série de chiffres agentiques qu'Artificial Analysis a évalués en privé et publiera sur le Coding Agent Index lorsque ce harnais sera disponible. Si vous avez besoin d'un chiffre aujourd'hui, M3 vous en donne un. Si vous pouvez attendre quelques semaines, ML4 vous en donnera un aussi, et Mistral parie qu'il sera plus élevé.
Là où M3 n’a absolument aucune concurrence de la part de ML4
Deux lignes de cette liste ne sont pas un compromis, elles sont une absence.
L’entrée vidéo est la première. M3 accepte la vidéo nativement, aux côtés du texte et des images. Mistral Large 4 ne prend en charge que le texte et les images, et rien d’autre — l’analyse approfondie de Mistral porte sur l’ancrage sur l’imagerie satellite gigapixel et les plans techniques, ce qui relève encore du travail sur image. Si votre pipeline ingère des enregistrements d’écran, des séquences de surveillance ou de la documentation vidéo, ML4 ne peut pas être le modèle, quel que soit son prix. Ce n’est pas une lacune que Mistral comblera par une nouvelle tarification.
La longueur de sortie est le second point. M3 émet jusqu'à 512 000 tokens en une seule réponse. Mistral n'a publié aucun plafond de sortie pour ML4. Générer un long artefact structuré en une seule passe — un rapport complet, un gros script de migration, une spécification complète — est la charge de travail où un plafond de 512K vaut plus qu'un point d'Intelligence Index, et tant que Mistral ne documente pas la limite de ML4, M3 est le seul des deux autour duquel vous pouvez planifier cette charge de travail.
Les chiffres agentiques de M3 rapportés par le fournisseur renforcent le même profil. MiniMax le situe à 83,5 sur BrowseComp pour la recherche web autonome, à 70 sur OSWorld-verified pour l’utilisation d’un ordinateur, à 74,2 sur MCP Atlas pour l’utilisation d’outils, à 76,7 sur les rubriques GDPval et à 59 sur SWE Bench Pro. Ces résultats proviennent des propres évaluations de MiniMax et n’ont pas été reproduits de manière indépendante, et ils contrastent étrangement avec son score Index de 29,2 — c’est précisément pourquoi la distinction entre évaluations du fournisseur et évaluations indépendantes compte. Un modèle peut mener sur les benchmarks choisis par un fournisseur et se classer en milieu de tableau sur une moyenne neutre de dix évaluations, et les deux peuvent être vrais.
Le 2x en vaut-il la peine ?
L'écart de prix ici est vraiment faible en termes absolus, ce qui change le calcul par rapport à un décalage face à un modèle phare fermé. Prenons un mois de cent millions de tokens avec une répartition entrée/sortie de 4:1 : 80 millions de tokens d'entrée et 20 millions de sortie. M3 facture 24 $ plus 24 $, soit un total de 48 $. Mistral Large 4 facture 54,40 $ plus 41,80 $, soit un total de 96,20 $. Le surcoût est d'environ 48 $ par mois — une dépense bien réelle à grande échelle, mais le genre d'écart qu'un seul échec évité permet de rentabiliser.
La mise en cache réduit encore l’écart, et seulement marginalement en faveur de M3 : 0,06 $ contre 0,07 $ par million de tokens mis en cache est une erreur d’arrondi à ce niveau de prix. Les deux sont suffisamment bon marché pour que la décision repose sur les capacités et l’adéquation plutôt que sur la facture, soit l’inverse de ce que cette comparaison laisse penser à première vue.
Ce que le surcoût achète, c'est la portée. ML4 a été entraîné cinq mois plus tard sur des données plus récentes, dans une architecture de mélange d'experts d'un billion de paramètres avec 49 milliards de paramètres actifs, et Mistral y exécute un apprentissage par renforcement à un rythme déclaré de 33 milliards de tokens par jour, avec une exécution qui n'a pas saturé. M3 est terminé ; ML4 s'améliore selon une cadence publiée. Lorsqu'un fournisseur dit que le modèle que vous achetez aujourd'hui est la version la plus faible que vous paierez jamais, et que le surcoût par rapport au modèle en place est inférieur à un dollar par million de tokens, le modèle le plus récent est généralement le meilleur choix par défaut. L'exception concerne les deux charges de travail ci-dessus, où le modèle plus ancien est le seul qui convient.
Routage autour de l'écart

Il s’agit d’un duo où faire tourner les deux n’est pas une couverture, mais la vraie réponse, car les deux modèles sont forts dans des domaines disjoints. Vidéo en entrée, artefact long en sortie, ou boucle d’utilisation d’un ordinateur : M3. Analyse de documents et d’images, workflows agentiques, ou tout ce qui doit tourner sur une infrastructure européenne selon vos propres politiques : ML4. Aucune règle de routage ne rend l’un des deux redondant.
Les deux se trouvent derrière un seul point de terminaison compatible OpenAI sur OrcaRouter, avec 0 % de marge et les prix catalogue des fournisseurs répercutés sans modification, ce qui préserve l’honnêteté d’un écart de prix sur cinq mois — si MiniMax réduit le tarif de M3 ou si Mistral met fin au tarif de préversion, le nombre par rapport auquel votre route est évaluée change le jour même. Le DSL de routage est ce qui transforme les forces disjointes en une surface d’appel unique : une règle qui inspecte la modalité de la requête envoie les charges utiles contenant de la vidéo à M3 et tout le reste à ML4, avec l’assurance que les micro-incidents de disponibilité d’un modèle de préversion sont absorbés par un basculement automatique plutôt que propagés à vos utilisateurs. Lorsqu’une sortie unique compte plus qu’un prix unique, la fusion de modèles peut exécuter les deux et laisser un panel choisir, ce qui est une façon raisonnable d’acheter le plafond revendiqué de Mistral tout en conservant le comportement documenté de M3 comme plancher.

Verdict
MiniMax M3 est la bonne réponse pour deux charges de travail et une réponse défendable pour une troisième. L’entrée vidéo, la génération en une seule passe de plusieurs centaines de milliers de jetons et les agents d’utilisation d’ordinateur sont son territoire, son prix est le plus bas de tous les fleurons de cette catégorie, et ses scores publiés de milieu de tableau signifient que vous savez exactement ce que vous obtenez. Cinq mois, ce n’est pas vieux pour un modèle qui n’a pas été supplanté dans sa propre niche.
Mistral Large 4 est le meilleur choix par défaut pour tout le reste. Un mois à cent millions de tokens coûte environ 48 $ de plus, le nombre de paramètres et l'ascendance européenne de l'entraînement indiquent un plafond plus élevé, les affirmations en matière de cybersécurité sont suffisamment précises pour être vérifiables, et les poids ouverts promis ainsi que le déploiement sur site répondent à des exigences que l'offre d'entreprise limitée à l'API de M3 ne satisfait pas. Le prix de ce pari, c'est que vous vous engagez sur un modèle dont le score à l'Independent Intelligence Index n'a pas été publié et dont le comportement, selon Mistral, changera sensiblement en quelques semaines.
Les deux dates qui permettront de trancher : fin octobre 2026, lorsque les poids de ML4 seront soit publiés, soit la promesse de poids ouverts commencera à sembler bien fragile, et la publication du Coding Agent Index, où le 49,8 % évalué en privé de Mistral rencontrera le score de codage public de 58,6 de M3 sur la même révision. D’ici là, M3 est le modèle que vous pouvez vérifier et ML4 est le modèle sur lequel vous pariez — et avec un supplément mensuel de 48 $ pour cent millions de tokens, ce n’est pas un gros pari.
