
MiniMax M3 vs Muse Spark 1.2 : un écart de prix de 4x face à un balayage des benchmarks
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 coûte 0,30 $ par million de tokens d'entrée sur notre catalogue. Muse Spark 1.2 coûte 1,25 $. Cela représente un écart de 4,2× en entrée et de 3,5× en sortie, et c'est le fait le plus utile à propos de ce duo, car sur les mêmes pages de catalogue, Muse Spark 1.2 devance MiniMax M3 sur chaque ligne de benchmark que les deux modèles partagent. L'un est l'option bon marché à poids ouverts, avec 512 K de contexte utilisable garanti par le fournisseur et un plafond de sortie de 512 K. L'autre est un checkpoint de raisonnement de Meta qui a désormais une génération de retard sur sa propre famille et qui le surclasse encore presque partout. Le reste de cette page porte sur lequel de ces deux faits détermine réellement une charge de travail — et la réponse n'est pas la même selon la charge de travail.
Ce qu’est réellement chacun de ces modèles
Les deux sont sortis cette année et ni l’un ni l’autre n’est nouveau. Cela compte, car une page de comparaison écrite comme si l’un ou l’autre était en cours de lancement se date elle-même en moins d’un mois.

MiniMax M3 est une version propre à MiniMax, annoncée sur le blog du fournisseur le 2026-06-01 sous le titre « MiniMax M3 : codage de pointe, contexte de 1 M, multimodalité native — tout en un seul modèle. » L'article commence sans détour : « MiniMax M3 est officiellement publié aujourd'hui. » Les trois affirmations de MiniMax à son sujet sont qu'il atteint des performances de niveau frontière en matière de codage et de travail agentique, qu'il utilise MSA (MiniMax Sparse Attention), une nouvelle architecture d'attention proposée par l'entreprise, et qu'il est nativement multimodal — il accepte les entrées d'images et de vidéos et, selon les mots de MiniMax, « peut piloter un ordinateur de bureau. » MiniMax ajoute que ces trois capacités sont des conditions minimales pour les modèles frontière à source fermée, et que M3 est « le premier et le seul modèle à poids ouverts à réunir les trois. » Notre catalogue répertorie le modèle comme disponible depuis le 2026-05-31, soit un jour avant la date du blog.
Muse Spark 1.2 appartient à Meta. Notre catalogue le date du 2026-08-05. Il ne s'agit pas d'un nouveau niveau — c'est un checkpoint mis à jour de Muse Spark 1.1, avec des performances légèrement supérieures, servi sur le même niveau Standard à un tarif identique, ce qui en fait une mise à niveau immédiate plutôt qu'un produit distinct. Sa caractéristique distinctive est la surface d'entrée : texte, images, vidéo, audio et PDF. La sortie est du texte.
Un élément de contexte a sa place ici plutôt que d’être enfoui plus loin. Meta a fait passer la famille Muse Spark à un checkpoint 1.3 le 2026-09-02, ce qui fait de 1.2 la génération précédente de sa propre gamme. Cela s’est produit il y a trois semaines, donc ce n’est pas une nouveauté et cette page ne la traite pas comme telle — mais quiconque doit choisir entre ces deux modèles aujourd’hui doit savoir qu’il compare un modèle MiniMax actuel à un modèle Meta remplacé par une version plus récente.
Prix par million de tokens, et ce que coûte réellement une charge de travail

Les tarifs publiés, issus de la page de chaque modèle sur notre propre catalogue, qui répercute le prix catalogue du fournisseur sans aucune marge ajoutée :
• Entrée — MiniMax M3 0,30 $ par million de tokens vs Muse Spark 1.2 1,25 $ par million de tokens
• Sortie — MiniMax M3 1,20 $ par 1 M contre Muse Spark 1.2 4,25 $ par 1 M
• Lecture du cache — MiniMax M3 0,060 $ par 1 M contre Muse Spark 1.2 0,150 $ par 1 M
• Ratio — Muse Spark 1.2 est 4,2x en entrée, 3,5x en sortie, 2,5x sur les lectures de cache
Ces ratios abstraits deviennent concrets dans le calculateur de coûts présent sur chaque page. Réglez les deux sur 10 millions de tokens par mois avec une part d'entrée de 70 % — une configuration raisonnable pour une tâche de résumé ou d'extraction, et la valeur par défaut livrée avec l'estimateur — et MiniMax M3 ressort à 5,70 $ par mois. Muse Spark 1.2 ressort à 11,30 $ par mois. Activez la mise en cache des prompts et la même charge de travail tombe à environ 4,86 $ contre environ 9,63 $. Le calculateur qualifie les deux d'estimations fondées sur le prix catalogue, ce qui est la mise en garde qui s'impose : le nombre réel de tokens dépend du tokeniseur du fournisseur.
Pour une charge de travail peu coûteuse, l'écart représente le prix d'un café. L'important, c'est la forme de la courbe, pas la valeur absolue : une charge de travail de cent millions de tokens à forte proportion de sortie par mois passe de trois à quatre chiffres rien que du côté de Muse Spark. Si le coût est la contrainte qui vous a fait examiner cette association, c'est le chiffre à modéliser sur votre propre trafic.
Comme nous répercutons le prix catalogue du fournisseur tel quel, sans marge, une baisse de prix d’un fournisseur apparaît de notre côté le jour même de son annonce, et ces deux modèles sont routés ici — une seule clé couvre les deux, donc les comparer en termes de prix ne nécessite ni un second contrat ni une modification de code.
Fenêtre de contexte, et ce qui y tient réellement
C’est la section où les deux se ressemblent le plus sur une fiche technique et le moins à l’usage.
• Fenêtre de contexte — MiniMax M3 1 048 576 jetons vs Muse Spark 1.2 1 048 576 jetons
• Sortie maximale — MiniMax M3 512 000 tokens vs Muse Spark 1.2 131 072 tokens
• Surface d’entrée — MiniMax M3 texte, image et vidéo vs Muse Spark 1.2 texte, image, vidéo, audio et PDF
• Surface de sortie — les deux n’émettent que du texte
• Paramètres structurés — MiniMax M3 expose tools et tool_choice ; Muse Spark 1.2 expose reasoning_effort et structured_outputs
Les deux fenêtres de contexte font le même million de tokens, donc la question « qui a le plus de contexte » n’a pas de gagnant. La ligne de sortie maximale est ce qui les distingue : une réponse de MiniMax M3 peut atteindre 512 000 tokens, soit environ quatre fois le plafond de 131 072 de Muse Spark 1.2. Si votre travail relève de la génération de texte long — réécriture complète d’un fichier, rapport long, sortie à l’échelle d’une transcription —, cette différence est structurelle, pas incrémentale. Si votre travail consiste en réponses courtes sur une entrée longue, elle est sans pertinence.
La ligne consacrée aux entrées prises en charge joue en sens inverse. Muse Spark 1.2 accepte directement l’audio et le PDF ; la surface d’entrée documentée de MiniMax M3 s’arrête à l’image et à la vidéo. Un pipeline qui ingère des enregistrements d’appels ou des documents numérisés doit effectuer un prétraitement d’ampleur différente sur chacun de ces deux.
Du côté de MiniMax, l’affirmation sur le contexte comporte une note architecturale qu’il convient d’étiqueter clairement comme émanant du fournisseur lui-même. MiniMax attribue le comportement de M3 en contexte long à MSA (MiniMax Sparse Attention), que notre catalogue décrit comme prenant en charge jusqu’à 1 million de tokens de contexte « avec un minimum garanti de 512K ». La formulation de minimum garanti est celle de MiniMax ; nous ne pouvons citer aucune mesure indépendante à ce sujet, alors considérez le plancher de 512K comme une affirmation du fournisseur plutôt qu’un chiffre testé.
Latence et débit sur notre propre passerelle
Voici les chiffres dont nous pouvons parler le plus directement, car ce sont nos propres chiffres. Ils couvrent les sept jours précédant le 2026-09-23 et décrivent le trafic sur notre passerelle, et non un benchmark de fournisseur.
• temps jusqu’au premier jeton (p50) — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s
• Temps jusqu’au premier token (p95) — MiniMax M3 10,00 s vs Muse Spark 1.2 10,00 s
• Vitesse de sortie — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s
• Taux d'erreur — MiniMax M3 0,12 % vs Muse Spark 1.2 0,15 %
• Trafic, 7 derniers jours — MiniMax M3 153,8 M tokens vs Muse Spark 1.2 79,6 M tokens
Lisez ceci honnêtement, et le tableau est contrasté. Sur le temps jusqu’au premier token, les deux sont proches — 4,28 contre 4,82 secondes en médiane, et le p95 est identique au centième près à 10,00 secondes, ce qui est un artefact d’arrondi dû au fait que les deux se situent près du même plafond plutôt qu’à une véritable égalité. En vitesse de sortie, ils ne sont pas proches du tout : Muse Spark 1.2 génère en flux à environ 1,75x le débit de MiniMax M3, ce qui change la façon dont une longue génération est perçue par un utilisateur qui la regarde, même lorsque le coût total est plus élevé. Les taux d’erreur se situent à moins d’une erreur d’arrondi l’un de l’autre, et tous deux sont faibles.
La ligne de trafic mérite d'être lue comme un signal plutôt que comme un tableau de scores : sur les mêmes sept jours, MiniMax M3 a fait transiter environ deux fois plus de tokens que Muse Spark 1.2 sur notre passerelle. C'est ce que le marché choisit, pas ce que disent les benchmarks, et sur ce duo, les deux ne sont pas d'accord.
Router les deux derrière un seul point de terminaison est aussi le moyen économique de découvrir lequel votre charge de travail préfère, car le basculement signifie qu’une dégradation côté fournisseur sur l’un ou l’autre modèle est redirigée vers un chemin fonctionnel au lieu de produire une erreur.
Appel d'outils et travail agentique à long horizon
C'est là que les deux se distinguent le plus quant aux résultats mesurés, et que les mises en garde comptent le plus.
• Terminal-Bench v2.1 — MiniMax M3 52.4 contre Muse Spark 1.2 80.1
• tau_banking (utilisation d'outils) — MiniMax M3 12,3 vs Muse Spark 1,2 34,8
• MCP Atlas — MiniMax M3 74,2 (déclaré par le fournisseur) vs Muse Spark 1.2 non mesuré
• BrowseComp — MiniMax M3 83,5 (déclaré par le fournisseur) vs Muse Spark 1.2 non mesuré
• OSWorld-Verified — MiniMax M3 70.0 (rapporté par le fournisseur) vs Muse Spark 1.2 non mesuré
Les deux premières lignes proviennent du panneau de benchmark sur nos propres pages catalogue et sont les seules lignes agentiques que les deux modèles ont remplies. Ils ne sont pas proches : Muse Spark 1.2 fait plus que doubler MiniMax M3 sur tau_banking et devance Terminal-Bench v2.1 de près de 28 points. Si votre charge de travail est un agent à long horizon avec une surface d’outils, c’est le plus grand écart unique sur cette page.
Les trois lignes suivantes sont les chiffres de MiniMax lui-même, publiés dans l’article de lancement. Ils ne sont pas comparables aux deux premières — harnais différents, aucun audit indépendant — mais ce sont les seuls chiffres publiés pour MiniMax M3 sur ces tâches, donc les omettre sous-estimerait le modèle. Lisez-les comme des chiffres déclarés par le fournisseur, et rien de plus.
Une divergence mérite son propre paragraphe, car c’est le genre de détail qu’une page de comparaison passe généralement sous silence. L’article de lancement de MiniMax affiche Terminal-Bench 2.1 à 66,0 pour M3, dans une image de graphique sans tableau numérique associé. La ligne indépendante Terminal-Bench v2.1 de notre page de catalogue indique 52,4 pour le même modèle. Les noms de tâches sont suffisamment proches pour que les lecteurs les voient côte à côte, et les deux chiffres diffèrent de plus de 13 points. Nous n’allons pas déclarer que l’un des deux est erroné : l’explication la plus probable est un harnais différent ou une configuration d’exécution différente, et l’affirmation honnête est que le propre chiffre du fournisseur et le chiffre audité ne concordent pas, celui du fournisseur étant le plus élevé.
Les listes de paramètres racontent une histoire plus modeste et plus pratique. MiniMax M3 expose tools et tool_choice, de sorte que la sélection des outils peut être pilotée depuis la requête. Muse Spark 1.2 expose reasoning_effort, de sorte que c’est la profondeur du raisonnement qui peut être pilotée à la place. Aucun des deux n’expose le réglage de l’autre. Si le problème de contrôle de votre application est « faire en sorte qu’il appelle la bonne fonction », cela indique une direction ; s’il est « le faire réfléchir plus longtemps sur les cas difficiles », cela indique l’autre.
Codage
Le codage constitue la promesse phare de MiniMax M3, et c'est précisément là que l'écart mesuré est le plus embarrassant pour lui.
• AA Coding Index — MiniMax M3 38,7 vs Muse Spark 1.2 72,2
• SciCode — MiniMax M3 43,1 contre Muse Spark 1.2 57,4
• SWE-Bench Pro — MiniMax M3 59,0 (rapporté par le fournisseur) vs Muse Spark 1.2 non mesuré
• KernelBench Hard — MiniMax M3 28,8 (rapporté par le fournisseur) vs Muse Spark 1.2 non mesuré
Le positionnement de MiniMax pour M3 fait du codage sa priorité — le titre de lancement place « Frontier Coding » devant le contexte d'un million de tokens et la multimodalité. Le chiffre de 59.0 rapporté par MiniMax pour SWE-Bench Pro est un score solide sur le harnais du fournisseur. En revanche, sur les lignes indépendantes Coding Index et SciCode que les deux modèles ont remplies, Muse Spark 1.2 arrive largement en tête, et l'écart de 33 points sur le Coding Index est le deuxième plus important de cette page, après celui de tau_banking.
Il n’existe pas de manière honnête de présenter MiniMax M3 comme le meilleur modèle de codage au vu des preuves disponibles. Ce que l’on peut dire, c’est que les chiffres de codage du fournisseur lui-même sont élevés et que les chiffres indépendants ne le sont pas, suivant le même schéma que la divergence de Terminal-Bench ci-dessus. Toute personne dont la décision repose sur le codage devrait accorder plus de poids aux lignes auditées qu’aux graphiques de l’article de lancement, et devrait tester sur son propre dépôt plutôt que sur l’un ou l’autre.
Là où ils sont vraiment proches
Trois lignes refusent de produire un vainqueur, et le dire est plus utile que d'en fabriquer un.
• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, un écart de 0,5 point qui est une égalité à toutes fins pratiques
• p95 temps jusqu'au premier token — les deux à 10,00 s sur les sept derniers jours sur notre passerelle
• Fenêtre de contexte et modalité de sortie — identiques à 1 048 576 jetons en entrée et sortie texte uniquement
En matière de raisonnement scientifique de niveau master/doctorat, les deux sont pratiquement indiscernables, et c'est la seule catégorie de raisonnement où le modèle bien moins cher de MiniMax M3 tient tête au plus cher. Il convient de s'en souvenir lorsqu'on lit les indices agrégés : l'écart entre ces modèles n'est pas uniforme selon les capacités, il se concentre sur le travail agentique et la programmation, et il est à peu près nul sur les questions à choix multiples à forte composante de connaissances.

Choisissez MiniMax M3 si, choisissez Muse Spark 1.2 si
Les deux faits du paragraphe d’ouverture se résolvent différemment selon ce que vous construisez, voici donc la distinction sans faux-fuyants.
• Choisissez MiniMax M3 si le coût par token est la contrainte déterminante, si vous avez besoin d’une sortie longue au-delà de 131 072 tokens, si vous avez besoin de poids ouverts, si vous voulez une entrée vidéo sans pipeline séparé, ou si vous voulez un travail intellectuel à forte composante de raisonnement pour environ un quart du prix d’entrée — GPQA Diamond est à égalité parfaite, et c’est la ligne où le modèle bon marché mérite sa place.
• Choisissez Muse Spark 1.2 si votre charge de travail est un agent à long horizon doté d’outils, si vous avez besoin des meilleurs scores de codage audités, si vous voulez un curseur reasoning_effort explicite, si vous devez ingérer de l’audio ou un PDF directement, ou si vous avez besoin d’une sortie en streaming rapide — 507 tok/s contre 289 tok/s est une différence visible, pas une différence de benchmark.
• Si vous ne savez pas encore lequel choisir, l'élément décisif ne figure pas sur cette page. Mettez les deux modèles à l'épreuve sur un échantillon de votre propre trafic et mesurez-les ; le calculateur de prix sur chaque page de modèle vous donnera l'aspect coût en une minute, et les chiffres de latence sur sept jours ci-dessus sont ce qui se rapproche le plus d'un aperçu du volet performance.
Les deux passent par une seule API, sans surcoût par rapport au prix catalogue du fournisseur, de sorte que l'essai se résume à un changement d'identifiant de modèle plutôt qu'à une migration, et le basculement automatique fait qu'un mauvais jour chez l'un ou l'autre fournisseur se traduit par une réponse plus lente plutôt que par une panne.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
