Carte héros du radar de modèles OrcaRouter pour la comparaison entre MiMo-V2.6-Pro et Claude Opus 5, sous-titrée « Cinq points d'indice. Vingt et un fois le prix. », avec un panneau par modèle.
Guides & Insights

MiMo-V2.6-Pro vs Claude Opus 5 : 21 fois moins cher, cinq points d'indice derrière

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Xiaomi MiMo-V2.6-Pro et Claude Opus 5 sont les deux extrémités d'un même échange, et cet échange a un prix. Sur l'Artificial Analysis Intelligence Index v4.3.2, Claude Opus 5 (effort maximal) obtient 51 et Xiaomi MiMo-V2.6-Pro obtient 46. Sur la grille tarifaire, Claude Opus 5 coûte 5,00 $ par million de tokens d'entrée et 25,00 $ par million de tokens de sortie ; MiMo-V2.6-Pro coûte 0,43 $ et 0,87 $. Faites la division et la réponse est 11,6x en entrée et 28,7x en sortie — et 21x sur le tarif mixte qu'Artificial Analysis publie pour chacun. Cinq points d'indice coûtent vingt et un fois le prix. Que ce soit une bonne affaire ou un gaspillage dépend entièrement de ce que votre charge de travail fait du cinquième point, et la plupart des équipes ne le déterminent jamais avant de s'engager.

Les deux modèles, énoncés simplement.

Claude Opus 5 est le modèle phare propriétaire d'Anthropic, publié le 24 juillet 2026, avec une fenêtre de contexte d'un million de tokens et un nombre de paramètres non divulgué. Xiaomi MiMo-V2.6-Pro est un modèle à mélange d'experts clairsemé comptant 1,02 billion de paramètres au total et 42 milliards activés, avec une fenêtre de contexte d'un million de tokens, une multimodalité native couvrant texte, image, vidéo et audio, et des poids publiés sous licence MIT.

• Poids — MiMo-V2.6-Pro sous licence MIT et téléchargeable ; Claude Opus 5 propriétaire, API uniquement

• Paramètres — MiMo-V2.6-Pro 1,02 T au total / 42 B actifs ; Claude Opus 5 non divulgué

• Contexte — 1M de tokens pour les deux ; Claude Opus 5 limite la sortie à 128K sur l'API Messages et à 300K sur l'API Batch

• Modalité — MiMo-V2.6-Pro prend en charge le texte, l'image, la vidéo et l'audio ; les entrées publiées de Claude Opus 5 sont le texte et l'image

• Prix catalogue — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million de tokens ; Claude Opus 5 5,00 $ / 25,00 $

• Cache — MiMo-V2.6-Pro annonce une remise de 99 % sur le cache ; Claude Opus 5 facture la lecture du cache à 0,50 $ par million, avec des écritures à 6,25 $ pour un TTL de 5 minutes

• Coût mesuré par tâche de l'Intelligence Index — MiMo-V2.6-Pro 0,13 $ ; Claude Opus 5 5,86 $

• Service — MiMo-V2.6-Pro : 134,3 jetons de sortie/seconde et 2,15 s jusqu’au premier jeton ; Claude Opus 5 : 57,9 jetons/seconde

Cette dernière paire est celle qui se perd. Le modèle le moins cher est aussi le plus rapide — d'un facteur 2,3 sur le débit de sortie — parce qu'il est servi sur du matériel que Xiaomi et ses partenaires contrôlent et peuvent regrouper agressivement. Claude Opus 5 à effort maximal est un modèle de raisonnement qui fait plus de travail par token ; l'écart de vitesse n'est pas un défaut, c'est un produit différent. Mais cela signifie bien que la voie bon marché ne paie pas sa remise en latence. Elle la paie en cinq points d'indice et dans la queue des tâches où vit ce cinquième point.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs Claude Opus 5 — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists Intelligence Index v4.3.2 score 46, list price $0.43 / $0.87 per million tokens, measured cost per index task $0.13, serving speed 134.3 tokens per second, size 1.02T total and 42B active parameters, MIT-licensed downloadable weights, and text, image, video and audio input. The Claude Opus 5 column lists index score 51, list price $5.00 / $25.00, measured cost per index task $5.86, serving speed 57.9 tokens per second, undisclosed size, proprietary API-only weights, and text and image input.

Où se trouvent réellement les cinq points

Un écart de cinq points sur un composite de dix évaluations n'est pas réparti uniformément, et l'agrégat masque ce qui compte. Les deux modèles ont été exécutés sur la même suite v4.3.2, qui comprend AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1. Les pages publiées ne détaillent pas les scores par évaluation pour aucun des deux modèles, ce qui constitue une véritable limite des deux côtés de cette comparaison, et il vaut mieux le dire plutôt que de l'occulter.

Ce qui est officiellement consigné est indicatif. Claude Opus 5, avec un effort maximal, a obtenu 49,0 % sur Terminal-Bench 4.0 au sein de la suite v4.3, derrière GPT-6 Astra à 59,1 % et Claude Fable 5.1 à 52,0 %. Sur AutomationBench-AA, Opus 5 a mené à bien chaque objectif sans violation de garde-fou sur 28,3 % des flux de travail, contre 41,6 % pour GPT-6 Astra et 32,1 % pour Fable 5.1. Ce sont là des chiffres agentiques concrets, et ce sont exactement les catégories où un écart composite de cinq points est le moins susceptible d’être réparti uniformément — l’entrée d’index de MiMo-V2.6-Pro elle-même ne publie pas de ventilation agentique comparable.

Pendant ce temps, les chiffres que publient les deux entreprises ne sont pas comparables entre eux, et il vaut la peine d’être direct sur les raisons. La documentation de lancement d’Anthropic rapporte SWE-bench Verified à 96,0 % et SWE-bench Pro à 79,2 % ; un site de suivi note qu’Opus 5 est sorti sans entrée SWE-bench autonome, et il n’existe aucun chiffre SWE-bench Verified audité indépendamment pour ce modèle. La documentation de Xiaomi rapporte que MiMo-V2.6-Pro passe de 58,4 à 72,57 sur DeepSWE v1.1 au cours de son exécution RL, sur le propre harnais de Xiaomi avec mini-swe-agent en moyenne sur trois, sans avoir été soumis au tableau public DeepSWE. Deux harnais de fournisseurs, deux tâches différentes, aucun chevauchement. Placer 96,0 % à côté de 72,57 et en tirer une conclusion reviendrait à inventer une comparaison qui n’existe pas.

Screenshot of the OrcaRouter model page for Claude Opus 5, showing the 1M-token context window, a 128K maximum output, input pricing of $5.00 per million tokens and output pricing of $25.00 per million, cache reads at $0.50 per million and cache writes at $6.25 per million on a five-minute TTL, and the provider uptime table listing the routes behind the model.

La comparaison des coûts, réalisée correctement

Le calcul par token sous-estime l’écart, car les deux modèles ne consomment pas le même nombre de tokens pour accomplir la même tâche. Artificial Analysis a mesuré ce que chacun a réellement coûté pour exécuter l’indice Intelligence Index complet : 0,13 $ pour MiMo-V2.6-Pro, 5,86 $ pour Claude Opus 5. Cela représente un écart de 45x sur un ensemble de tâches contrôlé et identique, et c’est le chiffre unique le plus juste disponible, car les deux ont été mesurés de la même manière.

Maintenant, mettez en regard une boucle de production plausible. Une exécution d'agent en 30 étapes qui lit 200 000 tokens de contexte par étape et écrit 2 000 tokens par étape représente 6 millions de tokens d'entrée et 60 000 tokens de sortie par exécution. Sur Claude Opus 5 au tarif catalogue, cela donne 30,00 $ d'entrée et 1,50 $ de sortie — 31,50 $ par exécution avant toute mise en cache. Sur MiMo-V2.6-Pro, cela donne 2,58 $ d'entrée et 0,05 $ de sortie — 2,63 $. Avec les remises de cache proposées par les deux fournisseurs, le coût des entrées s'effondre sur l'un comme sur l'autre modèle, et le ratio se déplace au lieu de disparaître : une remise de cache de 99 % sur un modèle bon marché, face à une lecture de cache à 0,50 $ sur un modèle coûteux, laisse encore le modèle coûteux un ordre de grandeur devant sur une boucle gourmande en contexte.

Ce qui constitue tout l'argument en faveur d'une voie économique et contre un basculement généralisé. Si votre charge de travail est une boucle d'agent à long horizon qui relit le même contexte des centaines de fois, la différence de coût par exécution n'est pas une erreur d'arrondi — c'est la différence entre une fonctionnalité que vous pouvez vous permettre d'exécuter par utilisateur et une que vous ne pouvez pas. C'est l'argument pour placer MiMo-V2.6-Pro devant la majeure partie de votre trafic. Ce n'est pas un argument pour supprimer Claude Opus 5, car les tâches où le cinquième point d'indice est rentable sont, par construction, les tâches où l'échec d'un modèle bon marché coûte cher.

Cost card headed 'The same agent run, priced twice', listing a stated assumption of a 30-step agent run reading 200,000 tokens of context per step and writing 2,000 tokens per step for 6M input and 60K output tokens per run; MiMo-V2.6-Pro at $0.43 / $0.87 costing $2.58 input plus $0.05 output for $2.63 per run before caching; Claude Opus 5 at $5.00 / $25.00 costing $30.00 input plus $1.50 output for $31.50 per run before caching; a per-token ratio of 11.6x on input, 28.7x on output and 21x on the blended rate; a measured $0.13 against $5.86 per Intelligence Index task, a 45x gap; and the caching comparison of a 99% cache discount against a $0.50 cache read and $6.25 cache write.

À quoi ressemble une décision de routage ici

Claude Opus 5 est accessible via une seule clé OrcaRouter, au prix catalogue du fournisseur et sans marge, sous la forme anthropic/claude-opus-5, avec les modèles de pointe auxquels vous le compareriez placés à ses côtés sur la même clé. Comme nous répercutons le prix catalogue du fournisseur sans marge, tout changement de prix côté fournisseur est effectif chez nous le jour même, sans attendre un nouveau devis. C'est dans le DSL de routage que se trouve la partie intéressante : vous pouvez composer les deux modèles en un seul appel plutôt que de choisir entre eux, envoyer l'essentiel d'une charge de travail vers la voie bon marché et router la queue — les tâches qui échouent à une auto-vérification, ou qui correspondent à un prédicat de complexité — vers la voie coûteuse. Le basculement, c'est l'autre moitié. Claude Opus 5 bénéficie d'une large couverture de fournisseurs ; MiMo-V2.6-Pro n'était listé que par un seul fournisseur d'API lorsque Artificial Analysis l'a relevé, ce qui fait une route bien mince pour un modèle que vous mettriez dans un chemin de production. C'est un routeur capable de basculer qui rend la voie bon marché sûre à adopter.

Cela mérite d’être dit clairement, car il est facile de supposer le contraire : nous n’hébergeons pas MiMo-V2.6-Pro. Y accéder aujourd’hui suppose de passer par la plateforme de Xiaomi elle-même ou par l’un des catalogues tiers qui le référencent. L’argument de routage ici porte sur la manière dont vous utilisez un modèle comme celui-ci aux côtés de ceux que nous proposons, et non sur l’affirmation qu’il s’agit de l’un des nôtres.

Lequel choisir

Choisissez Claude Opus 5 lorsque le coût d'un échec de la tâche dépasse suffisamment le coût en tokens pour que cinq points d'indice constituent une assurance bon marché — travail agentique à long horizon avec de véritables effets secondaires, utilisation d'outils où un appel erroné est pire qu'un appel lent, tout cas où vous payez déjà un humain pour vérifier le résultat. Le chiffre de 5,86 $ par tâche d'indice n'est pas une raison de l'éviter ; c'est le prix du palier, et le palier existe pour une raison.

Choisissez MiMo-V2.6-Pro lorsque le volume est la contrainte, lorsque la charge de travail est intensive en contexte et répétitive, lorsque vous voulez les poids dans votre propre infrastructure — la licence MIT autorise le déploiement commercial, la modification et l’entraînement ultérieur — ou lorsque vous construisez quelque chose dont l’économie unitaire ne fonctionne qu’à un cinquième de cent par millier de jetons. Ses 134,3 jetons/seconde le rendent viable pour une utilisation interactive, ce que la plupart des modèles ouverts à un billion de paramètres ne sont pas.

Prenez les deux, si vous avez un routeur, car la réponse honnête à « lequel est meilleur » est qu’ils ne sont pas en concurrence pour les mêmes requêtes. Le mode de défaillance à éviter est celui qui coûte le plus cher : standardiser sur le modèle bon marché parce que le ratio affiché est de 21x, découvrir au troisième mois qu’une classe spécifique de requêtes nécessite le modèle coûteux, et n’avoir aucun chemin pour l’y router. Le deuxième mode de défaillance est l’image miroir — payer des tarifs Opus 5 pour une tâche de résumé qu’un modèle à indice 46 termine à l’identique. Ni l’un ni l’autre n’est un problème de modèle. Les deux sont des problèmes de configuration, et la configuration est la partie que vous pouvez modifier un mardi après-midi.