
MiMo-V2.6-Pro vs Claude Opus 5 : 21 fois moins cher, cinq points d'indice derrière
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 632 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 187 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 112 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Xiaomi MiMo-V2.6-Pro et Claude Opus 5 sont les deux extrémités d'un même échange, et cet échange a un prix. Sur l'Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (effort maximal) obtient 51 et Xiaomi MiMo-V2.6-Pro obtient 46. Sur la grille tarifaire, Claude Opus 5 coûte 5,00 $ par million de tokens d'entrée et 25,00 $ par million de tokens de sortie ; MiMo-V2.6-Pro coûte 0,43 $ et 0,87 $. Faites la division et la réponse est 11,6x en entrée et 28,7x en sortie — et 21x sur le tarif mixte qu'Artificial Analysis publie pour chacun. Cinq points d'indice coûtent vingt et un fois le prix. Que ce soit une bonne affaire ou un gaspillage dépend entièrement de ce que votre charge de travail fait du cinquième point, et la plupart des équipes ne le déterminent jamais avant de s'engager.
Les deux modèles, énoncés simplement.
Claude Opus 5 est le modèle phare propriétaire d'Anthropic, publié le 24 juillet 2026, avec une fenêtre de contexte d'un million de tokens et un nombre de paramètres non divulgué. Xiaomi MiMo-V2.6-Pro est un modèle à mélange d'experts clairsemé comptant 1,02 billion de paramètres au total et 42 milliards activés, avec une fenêtre de contexte d'un million de tokens, une multimodalité native couvrant texte, image, vidéo et audio, et des poids publiés sous licence MIT.
• Poids — MiMo-V2.6-Pro sous licence MIT et téléchargeable ; Claude Opus 5 propriétaire, API uniquement
• Paramètres — MiMo-V2.6-Pro 1,02 T au total / 42 B actifs ; Claude Opus 5 non divulgué
• Contexte — 1M de tokens pour les deux ; Claude Opus 5 limite la sortie à 128K sur l'API Messages et à 300K sur l'API Batch
• Modalité — MiMo-V2.6-Pro prend en charge le texte, l'image, la vidéo et l'audio ; les entrées publiées de Claude Opus 5 sont le texte et l'image
• Prix catalogue — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million de tokens ; Claude Opus 5 5,00 $ / 25,00 $
• Cache — MiMo-V2.6-Pro annonce une remise de 99 % sur le cache ; Claude Opus 5 facture la lecture du cache à 0,50 $ par million, avec des écritures à 6,25 $ pour un TTL de 5 minutes
• Coût mesuré par tâche de l'Intelligence Index — MiMo-V2.6-Pro 0,13 $ ; Claude Opus 5 5,86 $
• Service — MiMo-V2.6-Pro : 134,3 jetons de sortie/seconde et 2,15 s jusqu’au premier jeton ; Claude Opus 5 : 57,9 jetons/seconde
Cette dernière paire est celle qui se perd. Le modèle le moins cher est aussi le plus rapide — d'un facteur 2,3 sur le débit de sortie — parce qu'il est servi sur du matériel que Xiaomi et ses partenaires contrôlent et peuvent regrouper agressivement. Claude Opus 5 à effort maximal est un modèle de raisonnement qui fait plus de travail par token ; l'écart de vitesse n'est pas un défaut, c'est un produit différent. Mais cela signifie bien que la voie bon marché ne paie pas sa remise en latence. Elle la paie en cinq points d'indice et dans la queue des tâches où vit ce cinquième point.

Où se trouvent réellement les cinq points
Un écart de cinq points sur un composite de dix évaluations n'est pas réparti uniformément, et l'agrégat masque ce qui compte. Les deux modèles ont été exécutés sur la même suite v4.3.2, qui comprend AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1. Les pages publiées ne détaillent pas les scores par évaluation pour aucun des deux modèles, ce qui constitue une véritable limite des deux côtés de cette comparaison, et il vaut mieux le dire plutôt que de l'occulter.
Ce qui est officiellement consigné est indicatif. Claude Opus 5, avec un effort maximal, a obtenu 49,0 % sur Terminal-Bench 4.0 au sein de la suite v4.3, derrière GPT-6 Astra à 59,1 % et Claude Fable 5.1 à 52,0 %. Sur AutomationBench-AA, Opus 5 a mené à bien chaque objectif sans violation de garde-fou sur 28,3 % des flux de travail, contre 41,6 % pour GPT-6 Astra et 32,1 % pour Fable 5.1. Ce sont là des chiffres agentiques concrets, et ce sont exactement les catégories où un écart composite de cinq points est le moins susceptible d’être réparti uniformément — l’entrée d’index de MiMo-V2.6-Pro elle-même ne publie pas de ventilation agentique comparable.
Pendant ce temps, les chiffres que publient les deux entreprises ne sont pas comparables entre eux, et il vaut la peine d’être direct sur les raisons. La documentation de lancement d’Anthropic rapporte SWE-bench Verified à 96,0 % et SWE-bench Pro à 79,2 % ; un site de suivi note qu’Opus 5 est sorti sans entrée SWE-bench autonome, et il n’existe aucun chiffre SWE-bench Verified audité indépendamment pour ce modèle. La documentation de Xiaomi rapporte que MiMo-V2.6-Pro passe de 58,4 à 72,57 sur DeepSWE v1.1 au cours de son exécution RL, sur le propre harnais de Xiaomi avec mini-swe-agent en moyenne sur trois, sans avoir été soumis au tableau public DeepSWE. Deux harnais de fournisseurs, deux tâches différentes, aucun chevauchement. Placer 96,0 % à côté de 72,57 et en tirer une conclusion reviendrait à inventer une comparaison qui n’existe pas.

La comparaison des coûts, réalisée correctement
Le calcul par token sous-estime l’écart, car les deux modèles ne consomment pas le même nombre de tokens pour accomplir la même tâche. Artificial Analysis a mesuré ce que chacun a réellement coûté pour exécuter l’indice Intelligence Index complet : 0,13 $ pour MiMo-V2.6-Pro, 5,86 $ pour Claude Opus 5. Cela représente un écart de 45x sur un ensemble de tâches contrôlé et identique, et c’est le chiffre unique le plus juste disponible, car les deux ont été mesurés de la même manière.
Maintenant, mettez en regard une boucle de production plausible. Une exécution d'agent en 30 étapes qui lit 200 000 tokens de contexte par étape et écrit 2 000 tokens par étape représente 6 millions de tokens d'entrée et 60 000 tokens de sortie par exécution. Sur Claude Opus 5 au tarif catalogue, cela donne 30,00 $ d'entrée et 1,50 $ de sortie — 31,50 $ par exécution avant toute mise en cache. Sur MiMo-V2.6-Pro, cela donne 2,58 $ d'entrée et 0,05 $ de sortie — 2,63 $. Avec les remises de cache proposées par les deux fournisseurs, le coût des entrées s'effondre sur l'un comme sur l'autre modèle, et le ratio se déplace au lieu de disparaître : une remise de cache de 99 % sur un modèle bon marché, face à une lecture de cache à 0,50 $ sur un modèle coûteux, laisse encore le modèle coûteux un ordre de grandeur devant sur une boucle gourmande en contexte.
Ce qui constitue tout l'argument en faveur d'une voie économique et contre un basculement généralisé. Si votre charge de travail est une boucle d'agent à long horizon qui relit le même contexte des centaines de fois, la différence de coût par exécution n'est pas une erreur d'arrondi — c'est la différence entre une fonctionnalité que vous pouvez vous permettre d'exécuter par utilisateur et une que vous ne pouvez pas. C'est l'argument pour placer MiMo-V2.6-Pro devant la majeure partie de votre trafic. Ce n'est pas un argument pour supprimer Claude Opus 5, car les tâches où le cinquième point d'indice est rentable sont, par construction, les tâches où l'échec d'un modèle bon marché coûte cher.

À quoi ressemble une décision de routage ici
Claude Opus 5 est accessible via une seule clé OrcaRouter, au prix catalogue du fournisseur et sans marge, sous la forme anthropic/claude-opus-5, avec les modèles de pointe auxquels vous le compareriez placés à ses côtés sur la même clé. Comme nous répercutons le prix catalogue du fournisseur sans marge, tout changement de prix côté fournisseur est effectif chez nous le jour même, sans attendre un nouveau devis. C'est dans le DSL de routage que se trouve la partie intéressante : vous pouvez composer les deux modèles en un seul appel plutôt que de choisir entre eux, envoyer l'essentiel d'une charge de travail vers la voie bon marché et router la queue — les tâches qui échouent à une auto-vérification, ou qui correspondent à un prédicat de complexité — vers la voie coûteuse. Le basculement, c'est l'autre moitié. Claude Opus 5 bénéficie d'une large couverture de fournisseurs ; MiMo-V2.6-Pro n'était listé que par un seul fournisseur d'API lorsque Artificial Analysis l'a relevé, ce qui fait une route bien mince pour un modèle que vous mettriez dans un chemin de production. C'est un routeur capable de basculer qui rend la voie bon marché sûre à adopter.
Cela mérite d’être dit clairement, car il est facile de supposer le contraire : nous n’hébergeons pas MiMo-V2.6-Pro. Y accéder aujourd’hui suppose de passer par la plateforme de Xiaomi elle-même ou par l’un des catalogues tiers qui le référencent. L’argument de routage ici porte sur la manière dont vous utilisez un modèle comme celui-ci aux côtés de ceux que nous proposons, et non sur l’affirmation qu’il s’agit de l’un des nôtres.
Lequel choisir
Choisissez Claude Opus 5 lorsque le coût d'un échec de la tâche dépasse suffisamment le coût en tokens pour que cinq points d'indice constituent une assurance bon marché — travail agentique à long horizon avec de véritables effets secondaires, utilisation d'outils où un appel erroné est pire qu'un appel lent, tout cas où vous payez déjà un humain pour vérifier le résultat. Le chiffre de 5,86 $ par tâche d'indice n'est pas une raison de l'éviter ; c'est le prix du palier, et le palier existe pour une raison.
Choisissez MiMo-V2.6-Pro lorsque le volume est la contrainte, lorsque la charge de travail est intensive en contexte et répétitive, lorsque vous voulez les poids dans votre propre infrastructure — la licence MIT autorise le déploiement commercial, la modification et l’entraînement ultérieur — ou lorsque vous construisez quelque chose dont l’économie unitaire ne fonctionne qu’à un cinquième de cent par millier de jetons. Ses 134,3 jetons/seconde le rendent viable pour une utilisation interactive, ce que la plupart des modèles ouverts à un billion de paramètres ne sont pas.
Prenez les deux, si vous avez un routeur, car la réponse honnête à « lequel est meilleur » est qu’ils ne sont pas en concurrence pour les mêmes requêtes. Le mode de défaillance à éviter est celui qui coûte le plus cher : standardiser sur le modèle bon marché parce que le ratio affiché est de 21x, découvrir au troisième mois qu’une classe spécifique de requêtes nécessite le modèle coûteux, et n’avoir aucun chemin pour l’y router. Le deuxième mode de défaillance est l’image miroir — payer des tarifs Opus 5 pour une tâche de résumé qu’un modèle à indice 46 termine à l’identique. Ni l’un ni l’autre n’est un problème de modèle. Les deux sont des problèmes de configuration, et la configuration est la partie que vous pouvez modifier un mardi après-midi.
