
Xiaomi MiMo-V2.6-Pro arrive en tête de l'index Open-Weights avec 46 — et publie la facture de l'entraînement
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro est désormais le modèle à poids ouverts le mieux classé de l'Artificial Analysis Intelligence Index, avec un score de 46 sur la v4.3.2 — un point devant GLM-5.3 et deux devant Kimi K3, et vingt points au-dessus du 26 que son prédécesseur MiMo-V2.5-Pro avait enregistré sur l'échelle précédente de l'indice. Ce chiffre a été produit par Artificial Analysis à l'aide de son propre banc d'essai, et non par Xiaomi, et c'est le fait le plus utile de cette annonce. Le deuxième fait le plus utile est le prix affiché juste à côté : 0,43 $ par million de jetons d'entrée, 0,87 $ par million de jetons de sortie, contre 5,00 $ et 25,00 $ pour Claude Opus 5 — un modèle qui se situe cinq points d'indice plus haut. Le troisième est celui que personne ne s'attendait à voir Xiaomi divulguer : un décompte public de ce qu'a réellement coûté la session d'apprentissage par renforcement qui a produit MiMo-V2.6-Pro.
Le score est une mesure, et non une affirmation.
Presque tout ce qui est publié sur le lancement d'un modèle chinois se présente comme un chiffre avancé par le fournisseur, et les lecteurs ont appris à le relativiser. Celui-ci est différent, et cette différence mérite qu'on la précise, car la couverture du lancement l'a déjà brouillée.
Artificial Analysis a évalué MiMo-V2.6-Pro lui-même, sur le composite v4.3.2 — dix évaluations couvrant le raisonnement, les connaissances, les mathématiques et le codage, notamment AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR v1.1. Le 46 est ce que cette suite a renvoyé. Artificial Analysis a également consigné les caractéristiques opérationnelles qui déterminent si un modèle est utilisable plutôt que simplement bon : 134,3 jetons de sortie par seconde, 2,15 secondes jusqu'au premier jeton, une remise de 99 % sur le cache, et un coût mesuré de 0,13 $ par tâche de l'Intelligence Index.
Deux d’entre eux méritent d’être soulignés. Les 134,3 tokens par seconde placent MiMo-V2.6-Pro à la onzième place sur 114 modèles en matière de vitesse — pour un modèle mixture-of-experts d’un billion de paramètres, c’est un résultat de serving, pas seulement un résultat d’entraînement. Et le 0,13 $ par tâche est le chiffre qui résiste au contact d’un budget : c’est ce que l’index a réellement coûté à exécuter sur ce modèle, mesuré de la même manière pour tous les modèles du classement, ce qui le rend comparable d’une façon que les tarifs par token mis en avant ne permettent pas.

Ce que l'indice couvre et ne couvre pas
La couronne des poids ouverts est bien réelle, mais plus étroite qu'il n'y paraît. À 46, MiMo-V2.6-Pro domine la catégorie des poids ouverts. Il ne domine pas l'indice. Le haut de la v4.3 est occupé par Claude Fable 5.1 en effort maximal avec repli par défaut et GPT-6 Astra en effort max, tous deux à 53, avec Claude Opus 5 à 51 et Claude Fable 5 à 50. Le cadrage honnête, c'est donc un écart de cinq points avec la frontière sur un composite qui récompense l'étendue, et une amélioration de vingt points par rapport à la génération précédente de Xiaomi elle-même.
• Leader des modèles à poids ouverts — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• En tête du même indice — Claude Fable 5.1 (max, repli) 53, GPT-6 Astra (max) 53, Claude Opus 5 (max) 51
• Vitesse — 134,3 jetons de sortie/seconde, onzième sur 114 modèles mesurés ; la médiane pour la classe de taille est de 77,9
• Temps jusqu’au premier token — 2,15 secondes, contre une médiane de 2,34 secondes
• Coût par tâche de l’Intelligence Index — 0,13 $, l’évaluation complète coûtant 206,66 $ à exécuter
• Tarif affiché — 0,43 $ par million de jetons d'entrée, 0,87 $ par million de jetons de sortie, une remise de 99 % sur le cache, et un coût mixte de 0,18 $ pour une répartition 7:2:1 entre accès au cache, entrée et sortie
Un chiffre sur la page d'Artificial Analysis est une véritable mise en garde plutôt qu'une vantardise : au moment de la rédaction, il ne comptait qu'un seul fournisseur d'API pour MiMo-V2.6-Pro. C'est là le goulot d'étranglement pratique de ce modèle en ce moment, et ce n'est pas un problème de qualité — c'est un problème de disponibilité. Un modèle accessible par une seule route ne dispose d'aucun mécanisme de basculement. Si cette route se dégrade, votre application se dégrade avec elle, et le basculement est précisément ce qu'un routeur a pour rôle d'assurer. L'observation pertinente pour quiconque planifie autour de cette sortie est que nous n'hébergeons pas MiMo-V2.6-Pro, et nous ne prétendrons pas le contraire ; la route vers ce modèle passe aujourd'hui par la plateforme de Xiaomi elle-même et par la poignée de catalogues tiers qui le référencent.

Les deux nombres qui ne doivent pas être mélangés
Xiaomi a également publié ses propres chiffres de référence, et ceux-ci sont d'une autre nature que le 46. Le tableau de bord de l'entreprise indique que MiMo-V2.6-Pro passe de 58,4 à 72,57 sur DeepSWE v1.1 tout au long de son exécution d'apprentissage par renforcement, évalué avec mini-swe-agent en moyenne sur trois. C'est le harnais de Xiaomi, l'évaluateur de Xiaomi, l'exécution hors ligne de Xiaomi. Il n'a pas été soumis au classement public DeepSWE et il n'a été reproduit par personne.
Lisez les deux côte à côte et la tentation est de traiter 72,57 comme un score au même niveau que le 74 % que le tableau public DeepSWE classe au premier rang. Ils ne sont pas sur la même échelle. Le chiffre du classement est une configuration soumise, Pass@1, avec un intervalle de confiance publié et un coût moyen par tâche ; le chiffre du fournisseur est une évaluation interne à laquelle rien de tout cela n'est attaché. Notre propre article du 21 septembre soulignait déjà ce point lorsque les chiffres n'étaient encore que des relevés de tableau de bord, et cela vaut toujours maintenant que les poids sont sortis. Un harnais de fournisseur peut être parfaitement honnête et ne pas constituer pour autant une entrée de classement, car une entrée de classement est une affirmation concernant une configuration spécifique dans des conditions spécifiques qu'un tiers peut réexécuter.
La même discipline s'applique aux dépenses d'entraînement. Xiaomi déclare environ 3 474 715 $ au total pour les exécutions Pro et Flash — 2 620 670 $ pour Pro, 854 044 $ pour Flash — chacune ayant comporté plus de trente étapes d'apprentissage par renforcement et environ 750 000 trajectoires, et ayant été réalisée en moins de six jours. Ce sont les propres chiffres de comptabilisation des calculs de l'entreprise. Ils sont intéressants parce que les laboratoires ne les publient presque jamais, et il ne s'agit pas d'un prix d'API, ni d'un coût que vous paierez, ni d'un chiffre qu'aucun tiers n'a audité.
Ce que Xiaomi a réellement commercialisé
La version publiée est un modèle à mélange d’experts clairsemé de 1,02 billion de paramètres au total, avec 42 milliards activés par jeton, une fenêtre de contexte d’1 million de jetons et une multimodalité native sur le texte, l’image, la vidéo et l’audio. Son homologue Xiaomi MiMo-V2.6-Flash repose sur la même architecture à plus petite échelle, avec 309 milliards de paramètres au total et 15 milliards actifs. Les poids publiés portent une étiquette de licence MIT, et le lot de publication comprend un rapport technique, des instructions de déploiement et — selon Xiaomi — les environnements d’entraînement par apprentissage par renforcement et le code nécessaires pour examiner et reproduire le post-entraînement.
Cette dernière information constitue la différence de fond entre ce lancement et une annonce d'API classique, et elle mérite d'être distinguée du marketing. Publier l'environnement RL revient à affirmer que le dispositif d'entraînement est examinable. Savoir si les environnements publiés suffisent à reproduire un score de 72,57 est une question distincte, qui sera tranchée par celles et ceux qui tenteront l'expérience, et non par les notes de version. Les propres notes d'entraînement de Xiaomi décrivent une exécution ayant mêlé en une seule passe des tâches de codage, d'agent généraliste, de vision et de cybersécurité, avec des évaluateurs qui classent les trajectoires réussies et redistribuent la récompense vers de meilleurs chemins — et elles consignent aussi des défaillances : un redémarrage pour saturation de la mémoire GPU provoqué par un déséquilibre de charge entre experts, une panne réseau entre le cluster d'entraînement et le déploiement de l'évaluateur, et un redémarrage de Flash après qu'une erreur d'infrastructure est passée inaperçue pendant environ trois heures. Publier les défaillances aux côtés des réussites, voilà ce qui rend crédible le reste de la divulgation.
Ce que coûte un appel, et où se situe la question du routage
À 0,43 $ et 0,87 $ par million de tokens, MiMo-V2.6-Pro est proposé au tarif d’un modèle de milieu de gamme, mais ses benchmarks sont ceux d’un modèle frontière à poids ouverts. Xiaomi a conservé la tarification standard de la génération précédente MiMo-V2.5 plutôt que de revoir à la hausse le prix du nouveau checkpoint, ce qui explique pourquoi le tarif paraît bas au regard du nombre de paramètres. Une remise de 99 % sur le cache signifie qu’une boucle d’agent à forte utilisation de cache lit son contexte pour quasiment rien, et c’est là que se concentre réellement la facture d’un agent à long horizon.
Il existe une version de cette opération qui s'achemine proprement et une version qui ne le fait pas. La version qui le fait : les modèles frontière auxquels vous compareriez MiMo-V2.6-Pro — Claude Opus 5 à 5,00 $/25,00 $, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — sont tous accessibles via une seule clé OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur sur l'un d'eux est effective de notre côté le jour même, et qu'une règle de routage peut envoyer une requête vers un second modèle lorsque le premier est lent ou indisponible. Cela compte plus que d'ordinaire ici, car le modèle qui obtient le meilleur score en poids ouverts est aussi celui dont la route est la plus ténue. Combiner les deux — une voie open-weights bon marché pour le gros du travail et une voie frontière pour la traîne exigeante — est une décision de routage, et c'est le genre de décision qui cesse d'être un pari dès l'instant où les deux voies se trouvent sur la même clé.
Un produit de plus à bien distinguer, car il est facile de le confondre avec le modèle : Xiaomi propose également MiMo-V2.6-Pro-UltraSpeed, un niveau de service hébergé construit à partir du même checkpoint. La documentation de Xiaomi elle-même annonce jusqu'à vingt fois la vitesse de sortie du service Pro standard, à qualité égale ; des fiches de catalogues tiers décrivent environ dix fois. Ce sont deux chiffres différents pour décrire le même niveau de service, personne n'a publié de distributions de latence par requête qui permettent de les concilier, et ce niveau s'accompagne d'un tarif sensiblement plus élevé. Rien dans UltraSpeed ne change ce que les poids peuvent faire — il change la vitesse à laquelle les serveurs d'un tiers les exécuteront.
Qu’est-ce qui changerait cette image ?
Trois choses, par ordre de l'importance qu'elles auraient.
Une deuxième et une troisième route de service. Le décompte à un seul fournisseur sur Artificial Analysis est la contrainte qui pèse sur tout le reste. Davantage de routes, c’est du basculement, de la concurrence sur les prix au niveau de la couche de service, et la possibilité de mettre le modèle dans un chemin de production plutôt que dans une expérience.
Reproduction indépendante des chiffres de DeepSWE. Le 46 est déjà indépendant ; le 72,57 ne l'est pas. Si des exécutions externes aboutissent près de ce chiffre, la position du modèle s'en trouve considérablement renforcée. Si elles aboutissent nettement en dessous, le chiffre d'Artificial Analysis reste celui auquel se fier, et le chiffre du fournisseur rejoint la longue liste des promesses de lancement qui n'ont pas survécu au contact.

Ventilations par évaluation. Le composite est un composite. Savoir lesquelles des dix évaluations MiMo-V2.6-Pro réussit et lesquelles il échoue fait la différence entre un modèle que l’on déploie pour le codage agentique et un modèle que l’on déploie pour la réponse à des questions à forte composante de recherche documentaire, et l’indice seul ne vous le dit pas. C’est ce détail qu’il faut surveiller ensuite, et c’est ce dont une configuration de routage a besoin avant qu’elle vaille la peine d’être écrite.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
