Carte de titre principale pour l'article « MiMo-V2.6 : ce que le document sur le RL montre », avec le surtitre « RAPPORT TECHNIQUE » et le sous-titre « Le rapport de RL mixte de Xiaomi, lu pour ce qu'il vérifie et ce qu'il ne vérifie pas ». Quatre pastilles arrondies affichent « Routeur MoE gelé », « Coût du grader 12,7 % », « DeepSWE 58,4 à 72,6 » et « AA Index 46 ». Une ligne de pied de page indique « Chiffres DeepSWE déclarés par le fournisseur ; AA Index 46 mesuré par Artificial Analysis. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

MiMo-V2.6 : ce que l'article de Xiaomi sur l'apprentissage par renforcement montre réellement, et ce qu'il laisse non vérifié

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La plupart des articles de modèles publiés ce mois-ci sont des articles d'architecture. Le rapport technique derrière Xiaomi MiMo-V2.6-Pro et Xiaomi MiMo-V2.6-Flash ne l'est pas. Intitulé MiMo-V2.6 : mettre à l'échelle l'apprentissage par renforcement vers l'auto-amélioration, soumis le 21 septembre 2026 et attribué à LLM-Core Xiaomi, il ne consacre presque rien de sa longueur à l'architecture dorsale à mélange d'experts creux et presque tout à une seule question : que se passe-t-il lorsque l'intégralité du budget de post-entraînement est investie dans une unique exécution d'apprentissage par renforcement mixte. Le rapport de DeepSeek-V4.1-Flash, en revanche, est un document sur la mémoire — sa longueur est consacrée à l'attention creuse compressée, à la réutilisation des KV entre couches et au stockage FP4. Mettez les deux côte à côte et vous obtenez des arguments sur l'origine des capacités, et ils ne sont pas d'accord.

Le rapport vaut la peine d’être lu pour ce qu’il est, mais il vaut la peine d’être lu attentivement, car c’est un auto-rapport du laboratoire qui a mené l’expérience. Il nomme ses mécanismes, montre ses ablations, publie ses échecs et, du même souffle, rapporte des chiffres qui ne peuvent pas être vérifiés de l’extérieur. Séparer ces deux choses constitue l’essentiel du travail. C’est ce que fait cet article, et il est écrit le 23 septembre 2026 — deux jours après la mise en ligne des checkpoints, alors que l’article est ce qu’il y a de plus récent et de moins corroboré à leur sujet.

Pourquoi la date sur le papier compte plus que d'habitude

Les checkpoints MiMo-V2.6-Pro et MiMo-V2.6-Flash de Xiaomi sont arrivés sur le hub de modèles le 21 septembre 2026, sous licence MIT et sans restriction d'accès. Le rapport est daté du même jour et a atteint le sommet de la liste des tendances sur le site de prépublication où il a été publié. Ce timing est la raison pour laquelle il s'agit d'un article d'actualité plutôt que d'une rétrospective : l'article n'est pas une explication ultérieure d'un modèle que tout le monde a déjà évalué. Il arrive en même temps que les poids, avant que quiconque en dehors de Xiaomi n'ait publié une exécution indépendante.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Cet ordre est aussi la principale faiblesse de l’article en tant que preuve. Tout ce qui en découle — la courbe DeepSWE, les gains de taux de réussite, la défense contre le reward hacking — est une affirmation concernant un processus d’entraînement qui a eu lieu une seule fois, dans un seul laboratoire, sur un seul cluster, et que personne d’autre n’a reproduit. Le fil qui a signalé le rapport considère que c’est là la partie intéressante : il s’agit d’un article de données et d’expériences, non d’un article d’architecture, et les expériences sont exactement le type de résultat qui se reproduit ou non.

Trois axes de mise à l'échelle, et un seul d'entre eux est un problème matériel.

Le cadrage du rapport est que la puissance de calcul de l'apprentissage par renforcement a été mise à l'échelle simultanément selon trois axes, et c'est le troisième qui change votre façon de concevoir la méthode.

• Lot et débit — 1 568 échantillons par mise à jour, étendus à seize rollouts chacun, soit environ 25 000 trajectoires par étape, consommant 2,7 à 3,7 milliards de tokens par étape à des longueurs de contexte allant jusqu’à un million de tokens. L’architecture de rollout est entièrement asynchrone, ce qui rend cette taille de lot tout simplement viable.

• Environnements — une seule exécution mixte sur des tâches de code, d’agent généraliste, visuelles et cyber, sous plusieurs harnais d’agent à la fois, plutôt que des exécutions RL séparées par domaine. La formule abrégée propre à Xiaomi pour cela est « You Only RL Once ». L’argument en faveur du mélange est que les gains dans une capacité renforcent les autres ; le risque est qu’un type de tâche lent souffre de famine, ce que le rapport indique gérer au moyen d’une planification adaptative.

• Calcul de notation — l'axe qui ne concerne pas les GPU au sens habituel. Un binaire réussite/échec ne peut pas classer deux solutions qui réussissent toutes les deux, donc le signal de récompense lui-même devient ce que l'on met à l'échelle. Un évaluateur agentique compare conjointement les seize tentatives pour une tâche et produit un signal gradué au lieu d'un bit.

Ce troisième axe est celui où l’expression « auto-amélioration » du titre mérite sa place, et où le rapport est le plus exposé. Un modèle qui évalue ses propres rollouts constitue une surface de reward hacking, et le rapport la traite comme telle.

Les deux mécanismes qu’il vaut vraiment la peine de comprendre

Redistribution de l'avantage Groupwise

Après chaque étape, la politique produit seize tentatives par tâche et toutes sont placées dans un espace de travail partagé afin qu'un modèle évaluateur puisse les examiner ensemble plutôt qu'une par une. Les correctifs validés sont ensuite notés selon cinq axes : si l'approche convient au problème, si l'implémentation est précise sans solutions de repli inutiles, si la modification est minimale, si elle modifie quoi que ce soit hors périmètre, et si elle correspond au style de code environnant. Les correctifs validés les moins bien classés reçoivent moins de renforcement positif. Un correctif confirmé comme un bidouillage est remis à zéro et traité comme un échec.

La conséquence est un signal d’entraînement qui pousse vers des solutions plus courtes et moins coûteuses plutôt que simplement correctes — le rapport présente cela comme une orientation vers moins de jetons par tâche. C’est la partie à retenir, car les résultats phares plus loin dans l’article vont dans l’autre sens.

Synthèse de récompense par groupe

La moitié hors ligne de la même idée. Plutôt que de tirer la qualité purement d’un évaluateur en direct, l’équipe précalcule des rubriques propres à chaque tâche et multiplie la récompense binaire du test par des scores de qualité et de comportement issus de ces rubriques. Le rapport décrit cela comme la construction des rubriques à partir de rollouts contrastés — c’est-à-dire de cas où le résultat a différé, là où se trouve l’information.

L'évaluation n'est pas gratuite. Le rapport estime le coût des évaluateurs à environ 12,7 % du coût total d'apprentissage par renforcement de MiMo-V2.6-Pro. Ce seul chiffre est l'élément le plus utile de l'article pour quiconque envisage de copier la méthode, car il fait passer « mettez vos évaluateurs à l'échelle » du statut d'idée à celui de ligne budgétaire.

Le routeur gelé est le résultat que la plupart des équipes copieront en premier

La section sur la stabilité du rapport contient un constat qui se suffit à lui-même, indépendant de MiMo-V2.6 et indépendant de la performance du modèle.

Avec des routeurs de mélange d'experts entraînables, la charge des experts a fortement dérivé sur vingt étapes. Le coefficient de variation entre les experts est passé de 0,78 à 2,0. La charge de pointe sur l'expert le plus sollicité est passée de six fois la moyenne à seize fois. La proportion d'experts froids — ceux recevant presque aucun trafic — est passée de 0,5 % à 22 %. La restauration des poids du routeur à leurs valeurs initiales à l'étape 20 a immédiatement rétabli l'équilibre.

La réponse de Xiaomi a été de geler le routeur MoE pour l’exécution. Le raisonnement n’est pas subtil : à cette échelle de lots, l’instabilité du routage est un problème de dynamique d’entraînement que l’on peut simplement choisir de ne pas avoir, et le routeur n’est pas là où l’apprentissage par renforcement fait son travail. La question de savoir si le gel coûte quoi que ce soit en qualité finale n’est pas tranchée par une ablation dans le matériel publié, et c’est une chose légitime à vouloir.

Ce que le constat ne dit pas, c'est tout ce qui concerne le serving. L'équilibrage de charge du routeur pendant une exécution d'entraînement et l'utilisation des experts sous le trafic de production sont des questions différentes, et le rapport n'aborde que la première.

Les nombres, avec leurs étiquettes attachées

Les résultats phares du rapport sont nets dans leur forme et désordonnés dans le détail, et ce désordre n’est pas un scandale — il s’agit de trois mesures différentes de trois objets différents qui partagent un nom.

• DeepSWE v1.1, tenu à l'écart — MiMo-V2.6-Pro est passé de 58,4 à 72,6 au cours de l'exécution ; MiMo-V2.6-Flash de 48,7 à 65,7. Le benchmark comprend 113 tâches d'ingénierie de dépôt à long horizon, jugées par des vérificateurs fonctionnels dans cinq langages de programmation, et la métrique est average@3 — le taux de réussite moyen des vérificateurs sur trois tentatives échantillonnées, ce qui n'est pas la même chose que la réussite de l'une des trois tentatives. Interpréter avg@3 comme pass@3 surestime tous les chiffres de la page.

• Le même benchmark, mesuré ailleurs — les fiches de modèle publiées affichent 71,9 pour Pro et 67,9 pour Flash. Le tableau de bord public d’entraînement de Xiaomi affichait 72,57 et 65,68. Il y a donc trois chiffres publiés par modèle, dont deux provenant de Xiaomi, et le sens de l’écart diffère pour chaque modèle frère. Aucun n’est faux ; ils décrivent un instantané de tableau de bord, une entrée de fiche et une ligne de rapport, à des moments différents et peut-être avec des harnais différents.

• Distillation — MiMo-V2.6-Distill-Qwen-9B, affiné à partir de Qwen3.5-9B sur des démonstrations générées par MiMo, a fait passer SWE-bench Verified de 61,1 à 66,2. C’est le chiffre le plus transférable de l’article, car un étudiant de 9B est une taille que la plupart des équipes peuvent réellement faire tourner.

• Un mini-benchmark interne de cybersécurité — 31,3 à 47,0. Interne veut dire interne : les tâches ne sont pas publiées, donc le delta ne peut pas être reproduit, même en principe.

• L'Artificial Analysis Intelligence Index — 46 pour MiMo-V2.6-Pro. Celui-ci est d'une autre nature. Il a été produit par Artificial Analysis exécutant son propre harnais sur le checkpoint publié, et non par Xiaomi, ce qui en fait le seul chiffre phare de cette publication qu'un lecteur peut considérer comme mesuré plutôt que rapporté. C'est aussi le nombre à comparer avec GLM-5.3, Kimi K3 et la frontière fermée, et il se situe cinq points en dessous de Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

Le rapport est honnête sur les limites de son propre tableau, et voici la phrase à citer en retour à quiconque ne l’est pas : les comparaisons mélangent des benchmarks publics et internes et n’isolent pas la contribution de l’apprentissage par renforcement de celle de l’architecture ou du pré-entraînement. Un modèle qui est meilleur après l’apprentissage par renforcement n’est pas la preuve que c’est l’apprentissage par renforcement qui en est la cause.

Il y a une deuxième mise en garde, et c'est celle qui va à l'encontre du cadrage. Les gains rapportés accompagnent généralement une hausse de l'usage des jetons. Le rapport présente cela comme une amélioration soutenue des capacités plutôt que comme un gain d'efficacité, et il a raison de le faire. Mais GAR a été explicitement conçu pour orienter vers des chemins plus courts et moins de jetons par tâche, et le résultat agrégé ne montre pas que la charge de travail devient moins coûteuse. Les capacités ont augmenté ; le coût par tâche n'a pas baissé. Si vous interprétez « auto-amélioration » comme « le modèle aura besoin de moins de mon argent le trimestre prochain », l'article ne soutient pas cette interprétation.

Ce que le rapport laisse non vérifié

Au 23 septembre 2026, aucun tiers n’a publié de reproduction indépendante des colonnes DeepSWE, Terminal Bench ou CyberGym. La distinction qui compte est entre le point d’indice et tout le reste : 46 est une mesure réalisée par quelqu’un d’autre, et 72,6 est une affirmation concernant une exécution d’entraînement que personne ne peut réexécuter, car cette exécution a coûté, selon les informations rapportées, 2,6 millions de dollars pour Pro et 0,9 million de dollars pour Flash, et n’aura pas lieu deux fois.

Ce que Xiaomi a publié, et que la plupart des laboratoires ne publient pas, ce sont les dynamiques d’entraînement, le cadre d’apprentissage par renforcement et les environnements de tâches — plus de 7 000 environnements évalués couvrant l’ingénierie logicielle, la reproduction de vulnérabilités, le travail intellectuel et la conception web. C’est l’artefact qui se conserve le plus longtemps. Les poids vous disent ce que l’exécution a produit ; les environnements vous disent comment mener l’expérience vous-même, ce qui est la seule façon de trancher un jour les affirmations sur l’apprentissage par renforcement.

La défense contre le détournement de la récompense mérite une mise en garde spécifique. Elle est décrite comme à plusieurs niveaux — conception de la récompense, évaluation adversariale, détection d’anomalies et vérification croisée entre vérificateurs — et elle est décrite entièrement par la partie qui serait embarrassée par son échec. Une défense contre un modèle qui exploite un évaluateur fondé sur un modèle n’est pas le genre de chose qu’une auto-déclaration peut clore. Le mécanisme est nommé et le mode de défaillance est reconnu, ce que ne font pas la plupart des articles, et cela reste une question ouverte.

Ce que vous pouvez réellement faire avec ceci aujourd’hui

Les deux checkpoints sont téléchargeables, sans restriction, sous une étiquette de licence MIT : Xiaomi MiMo-V2.6-Pro-RL et Xiaomi MiMo-V2.6-Flash-RL, omnimodaux, avec un contexte d'un million de tokens, l'indice Flash rapportant 172,9 Go de données de poids réparties sur 65 shards en FP8. Xiaomi n'a pas publié de grille tarifaire par token pour la génération V2.6, le choix qui s'offre aujourd'hui est donc l'auto-hébergement face à un modèle hébergé que vous payez déjà.

C'est dans cette comparaison que réside la valeur concrète de l'article, et elle n'est pas flatteuse pour l'article, d'une manière utile. L'affirmation mise à l'épreuve n'est pas « MiMo-V2.6-Pro est-il bon » — les 46 y répondent. C'est « l'apprentissage par renforcement sur des tâches agentiques mixtes produit-il un raisonnement qui se transfère à ma charge de travail », et la seule façon honnête d'y répondre est d'exécuter les deux et de comparer, ce qui est un problème de routage avant d'être un problème de recherche. DeepSeek-V4.1-Flash n'est qu'à une clé API, à 0,15 $ et 0,60 $ par million de tokens, Qwen3.8-Flash et GLM-5.3-Flash se trouvent sur la même clé, et si vous voulez placer un checkpoint MiMo auto-hébergé derrière le même point de terminaison pendant une semaine et voir si la courbe DeepSWE apparaît dans vos propres évaluations, il s'agit d'un changement de configuration plutôt que d'une migration. OrcaRouter n'héberge pas les modèles de Xiaomi, et rien ici ne doit être interprété comme affirmant le contraire — mais les modèles auxquels vous les compareriez sont tous accessibles via une seule clé API OrcaRouter, au prix catalogue du fournisseur, avec 0 % de marge, avec un basculement automatique si un checkpoint que vous testez s'avère instable sous charge.

Le cas du modèle non éprouvé est celui pour lequel le basculement a été conçu. Un checkpoint publié il y a deux jours, avec une évaluation réalisée par le fournisseur et sans réexécution indépendante, est exactement ce que vous voulez essayer sans mettre un chemin de production derrière.

Qui devrait lire l’article ?

Si vous faites du post-entraînement, lisez-le pour le résultat sur le routeur et le chiffre du coût du correcteur. Les deux sont transposables, les deux sont peu coûteux à tester, et aucun des deux ne dépend du fait de croire quoi que ce soit au sujet du tableau de référence de MiMo-V2.6. Le résultat du routeur gelé en particulier est le genre de chose dont l’essai coûte un après-midi et fait économiser une exécution.

Si vous choisissez un modèle, lisez le point de l’indice et ignorez le reste. Artificial Analysis a mesuré 46 sur l’artefact publié ; c’est le seul chiffre de cette publication qui ne provient pas du fournisseur, et il place MiMo-V2.6-Pro au sommet du domaine des modèles à poids ouverts et à cinq points derrière Claude Opus 5. Tout le reste du rapport décrit comment Xiaomi y est parvenu, et la manière dont Xiaomi y est parvenu ne s’achète pas.

Et si vous lisez la couverture médiatique plutôt que l’article, ce qu’il faut surveiller, c’est le mot « auto-amélioration ». Les résultats du rapport lui-même montrent que la capacité augmente en parallèle de l’utilisation de tokens, ce qui constitue un constat réel et reproductible sur la mise à l’échelle de l’apprentissage par renforcement. Ce n’est pas une affirmation selon laquelle le modèle serait devenu moins cher à faire tourner, et les articles qui suivent celui-ci sont ceux qui vous diront s’il finit par le devenir.