Carte principale générée intitulée Claude Sonnet 5.5 vs MiniMax M3, sous-titrée là où le modèle 15 fois moins cher arrive à égalité, avec trois cartes de statistiques : rappel en contexte long 82,7 % vs 83,0 %, Terminal-Bench 4.0 63,6 % vs 2,0 %, et coût par tâche 7,60 $ vs 0,51 $, avec un pied de page indiquant Tous les chiffres selon Artificial Analysis v4.3.2 ; spécifications de MiniMax M3 selon MiniMax.
Guides & Insights

Claude Sonnet 5.5 vs MiniMax M3 : là où le modèle 15× moins cher fait en réalité jeu égal

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il y a une ligne sur le tableau de bord indépendant où MiniMax M3 et Claude Sonnet 5.5 sont le même modèle, et ce n'est pas celui que quiconque devinerait. En rappel sur contexte long, MiniMax M3 obtient 83,0 % et Claude Sonnet 5.5 obtient 82,7 %. MiniMax M3 coûte 0,30 $ par million de jetons d'entrée et 1,20 $ par million de jetons de sortie. Claude Sonnet 5.5 coûte 2,00 $ et 10,00 $. Sur l'ensemble de l'Intelligence Index, le coût mesuré de M3 est de 0,51 $ par tâche, contre 7,60 $ pour Claude Sonnet 5.5 — quinze fois moins cher, et sur la seule évaluation qui mesure si un modèle peut encore trouver quelque chose dans un document très long, il n'est pas du tout en retard.

Ensuite, vous ouvrez les évaluations agentiques et le tableau s'inverse tellement que cela cesse d'être une comparaison. Sur Terminal-Bench 4.0, qui demande à un modèle de piloter un shell et de réellement terminer une tâche logicielle, MiniMax M3 obtient 2,0 % et Claude Sonnet 5.5 obtient 63,6 %. Un écart de trente fois sur le seul benchmark qui ressemble le plus au travail de production n'est pas une question de prix, et aucune économie par token n'y survit. La question utile que soulève cette confrontation n'est pas « lequel est le meilleur » mais lequel de ces deux modes de défaillance votre charge de travail peut absorber : MiniMax M3 est le modèle à poids ouverts, à million de tokens, natif vidéo, qui égale un modèle de pointe en récupération et s'effondre à l'exécution, et Claude Sonnet 5.5 est le modèle fermé sorti le 28 septembre 2026 pour faire l'inverse.

Ce que chacun est, dit simplement

MiniMax M3 est le modèle de fondation à poids ouverts phare du laboratoire chinois, annoncé le 1er juin 2026 et téléchargeable sous la licence communautaire propre à MiniMax. C'est un mélange d'experts d'environ 428 milliards de paramètres au total, avec environ 23 milliards actifs par jeton, et il est nativement multimodal au sens fort : du texte, des images et de la vidéo en entrée, du texte en sortie, la chaîne multimodale ayant été reconstruite dès la première étape de pré-entraînement plutôt que greffée après coup. La fenêtre est de 1 048 576 jetons — avec un minimum utilisable garanti de 512 000 dans notre propre fiche catalogue — et la sortie maximale est de 512 000 jetons, chiffre qui est le nôtre et non celui du fournisseur, car MiniMax n'en publie aucun. L'architecture est MiniMax Sparse Attention, objet de l'arXiv 2606.13392, et la revendication du fournisseur à son sujet est un préremplissage plus de 9× plus rapide et un décodage plus de 15× plus rapide que la génération précédente avec une fenêtre d'un million de jetons. Ce sont des chiffres du fournisseur et nous ne les avons pas vus reproduits de manière indépendante.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d'Anthropic, âgé d'un jour au moment de la rédaction, et il est fermé. Anthropic le décrit comme la meilleure combinaison de vitesse et d'intelligence de la gamme, et les caractéristiques sont 1 000 000 de tokens de contexte, 128 000 tokens de sortie synchrone avec 300 000 sur l'API Message Batches, une entrée texte, image et fichier, une réflexion adaptative avec effort sélectionnable, une date de coupure des connaissances en juin 2026, et une rétention nulle des données disponible dès le lancement. Son prix n'a pas bougé par rapport à Claude Sonnet 5 : 2,00 $ en entrée, 10,00 $ en sortie, 0,20 $ pour les lectures de cache, 2,50 $ pour les écritures de cache. Anthropic affirme qu'il est 30 % plus rapide et coûte jusqu'à 30 % de moins par tâche que Claude Sonnet 5 — des chiffres de fournisseur, non reproduits, à interpréter comme des affirmations sur le nombre de tokens plutôt que sur les tarifs, puisque les tarifs sont identiques.

La forme du benchmark, c’est toute l’histoire.

Les deux modèles sont mesurés sur le même indice, révision v4.3.2, et ce sont les résultats par évaluation qui rendent cet appariement intéressant plutôt que déséquilibré.

• Rappel en contexte long — MiniMax M3 83,0 % vs Claude Sonnet 5.5 82,7 %, une différence d’arrondi sur une véritable égalité

• SciCode — MiniMax M3 47,1 % contre Claude Sonnet 5.5 61,0 %, un écart réel mais surmontable

• Humanity's Last Exam — MiniMax M3 39,0 % contre Claude Sonnet 5,5 55,0 %

• Terminal-Bench 4.0 — MiniMax M3 2,0 % contre Claude Sonnet 5.5 63,6 %, là où la comparaison cesse d’être utile

• Indice d'intelligence — MiniMax M3 29 vs Claude Sonnet 5.5 56

• Coût par tâche Index — MiniMax M3 0,51 $ contre Claude Sonnet 5.5 7,60 $

• Tokens de sortie générés à travers l'Index — MiniMax M3 120M vs Claude Sonnet 5.5 410M

• Vitesse de sortie — MiniMax M3 115,3 jetons/s vs Claude Sonnet 5.5 138,7 jetons/s

Lisez ces lignes dans l'ordre et un modèle cohérent émerge. MiniMax M3 est compétent pour le raisonnement statique et la récupération d'informations, et faible en exécution soutenue. Son résultat à Terminal-Bench n'est pas un léger déficit ; un score de 2,0 % signifie que le modèle ne termine pratiquement pas les tâches, et le même schéma se retrouve dans son score de benchmark d'automatisation de 0,21 contre 0,71, ainsi que dans un score d'omniscience de 1,35 contre 32,3. Là où MiniMax M3 tient bon, c'est exactement là où son architecture revendique un avantage : une entrée réellement longue, lue et à laquelle il répond. C'est MSA qui fait ce pour quoi MiniMax l'a vendu.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

La ligne de coût ajoute un deuxième point, moins évident. MiniMax M3 n’est pas seulement moins cher par token — 1/6,7 en entrée et 1/8,3 en sortie — il consomme aussi moins de tokens pour parvenir à une réponse, environ 120 millions contre 410 millions sur le même panel. Deux effets se multiplient pour produire l’écart de quinze fois par tâche. Une partie de cet écart relève d’une véritable efficacité, et une autre tient simplement au fait que MiniMax M3 abandonne plus tôt les tâches qu’il échoue ; une tâche bon marché qui renvoie la mauvaise réponse n’est pas une économie, et c’est la leçon la moins coûteuse de l’article.

La dimension que la liste de prix ne peut pas montrer

MiniMax M3 possède une propriété que Claude Sonnet 5.5 n'a pas et ne peut pas acquérir : on peut récupérer les poids. Cela compte pour exactement une catégorie d'acheteurs, et pour cet acheteur, cela l'emporte sur tout ce qui précède. Si une requête ne peut pas quitter une juridiction, ne peut pas franchir une frontière réseau, ou doit s'exécuter là où aucune API n'est joignable du tout, un modèle sans poids téléchargeables n'est une option à aucun prix, tandis qu'un modèle à poids ouverts de 428 milliards de paramètres l'est. La même propriété est un handicap dans l'autre sens : héberger soi-même 428 milliards de paramètres avec 23 milliards actifs est une décision d'investissement, pas une clé API, et les propres affirmations de MiniMax en matière d'attention éparse existent parce que l'alternative à un million de jetons représente une infrastructure inabordable.

Pour tous les autres, la formulation honnête est qu’il s’agit d’une ligne « construire ou acheter » avec une étiquette de prix attachée. Claude Sonnet 5.5 est le meilleur modèle pour tout ce qui est agentique. MiniMax M3 est le meilleur modèle pour lire quelque chose d’énorme et répondre à une question à son sujet, et c’est de loin le meilleur modèle pour traiter la vidéo, que Claude Sonnet 5.5 n’accepte pas du tout — sa surface d’entrée est le texte, les images et les fichiers.

• Poids — MiniMax M3 ouvert sous licence communautaire de MiniMax vs Claude Sonnet 5.5 fermé

• Modalité d'entrée — MiniMax M3 texte, image et vidéo vs Claude Sonnet 5.5 texte, image et fichier

• Sortie maximale — MiniMax M3 512 000 tokens selon notre catalogue, contre Claude Sonnet 5.5 128 000 en mode synchrone, 300 000 sur Batches

• Tarification du cache — MiniMax M3 0,06 $ par million de lectures, contre Claude Sonnet 5.5 0,20 $ en lecture et 2,50 $ en écriture

• Contrôle de l'effort — réflexion MiniMax M3 activée, adaptative ou désactivée vs la réflexion adaptative de Claude Sonnet 5.5, où la désactivation nécessite désormais la between_tools forme

• Conservation des données — MiniMax M3 régie par votre propre déploiement si auto-hébergé, contre Claude Sonnet 5.5 : rétention nulle des données disponible auprès d'A​nthropic dès le lancement

Exécuter les deux sans exécuter deux contrats

Mélangez un modèle chinois à poids ouverts et un modèle Anthropic fermé dans un même pipeline, et le coût opérationnel n'est généralement pas celui des tokens ; c'est le deuxième contrat, la deuxième clé, le deuxième ensemble de limites de débit, et le deuxième endroit où une défaillance peut survenir. un seul point de terminaison compatible OpenAI couvrant plus de 200 modèles, avec le tarif catalogue du fournisseur transmis sans modification — aucune marge ajoutée d'un côté comme de l'autre —, un basculement automatique entre les fournisseurs en amont et un DSL de routage pour composer plusieurs modèles en un seul appel. MiniMax M3 est routable ici en tant que minimax/minimax-m3 aux tarifs de MiniMax de 0,30 $ et 1,20 $, avec des lectures de cache à 0,06 $, et c'est l'un des modèles les plus sollicités du catalogue en termes de trafic, ce qui est en soi un signal utile : la couche de routage peut vous indiquer la charge réelle que porte un modèle, pas seulement son score obtenu.

Claude Sonnet 5.5 ne figure pas encore dans notre catalogue, et l'article fonctionnera autrement. La voie pour y accéder aujourd'hui passe par l'API d'Anthropic elle-même. Claude Sonnet 5 est routable ici aux mêmes tarifs de 2,00 $ et 10,00 $ et ce depuis le 30 juin, et il constitue la cible de préproduction naturelle et le partenaire de basculement, alors que son successeur n'a qu'un jour d'existence.

Cette combinaison — le basculement de contexte long et le parcours agentique derrière une seule authentification — c’est précisément à cela que sert un routeur. MiniMax M3 achemine 63,2 millions de tokens de trafic par semaine via ce catalogue, contre 7,9 millions pour Claude Sonnet 5, si bien que le modèle bon marché n’est pas ici un substitut théorique ; il porte déjà le volume. Router les deux à partir d’une même clé signifie que la répartition est une décision de configuration sur laquelle vous pouvez déplacer le trafic, plutôt qu’un second contrat à signer avant de pouvoir tester l’option moins chère.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Que faire de la cravate

Si votre charge de travail consiste en des réponses à des questions à l’échelle de documents — une entrée très longue, une réponse factuelle courte, une latence tolérable —, l’égalité sur le contexte long est bien réelle, et l’avantage de coût d’un facteur quinze de MiniMax M3 l’est tout autant. C’est un remplacement simple, qui mérite d’être testé cette semaine.

Si votre charge de travail est agentique, la ligne Terminal-Bench tranche la question avant même que le prix n'entre dans la conversation. Claude Sonnet 5.5 à 7,60 $ par tâche Index contre MiniMax M3 à 0,51 $ représente une prime de 15× pour un modèle qui obtient soixante points de plus sur l'évaluation la plus proche de votre trafic de production, et l'option quinze fois moins chère qui échoue à la tâche est la plus coûteuse. La mesure à exécuter sur vos propres données est le nombre de tokens par tâche terminée, et non le nombre de tokens par requête, car c'est le seul chiffre de cet article auquel l'avantage de prix de MiniMax M3 ne survit pas par défaut.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement