
Xiaomi MiMo-V2.6-Pro : un score DeepSWE de 72,57, un run qui s'est arrêté, et toujours pas de date de sortie
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro a arrêté son exécution d'apprentissage par renforcement diffusée publiquement le 20 septembre, avec un score DeepSWE v1.1 de 72,57 affiché sur le tableau de bord propre à Xiaomi — soit 1,4 point sous les 74 % que GPT-6 Astra, Gemini 3.8 Flash et Claude Opus 5 se partagent en tête du même classement. Xiaomi MiMo-V2.6-Flash, le modèle plus petit entraîné en parallèle, s'est arrêté le 19 septembre à 65,68. Les deux exécutions se sont terminées à l'étape 30, et la facture combinée que Xiaomi a publiée en même temps s'élevait à 3 474 715 $ lorsque nous avons capturé la page ce matin.
C'est là toute la bonne nouvelle, et elle est véritablement bonne. Le reste de l'histoire est un fossé entre un chiffre et un produit. Ni Xiaomi MiMo-V2.6-Pro ni Xiaomi MiMo-V2.6-Flash n'a de date de sortie, de fiche modèle, d'identifiant API, de prix publié ni de poids téléchargeables. Il n'y a aucun point de terminaison à appeler. Ce qui existe, c'est un tableau de bord d'entraînement que tout le monde peut consulter, un chiffre de benchmark produit par le propre banc d'évaluation de Xiaomi, et une communauté qui a passé six jours à lire une page de télémétrie comme on lisait autrefois les feuilles de thé.
Donc, il s’agit d’un article de type « ce que l’on sait à ce stade », et sa version honnête distingue trois choses que la couverture de la semaine dernière a discrètement amalgamées : ce que Xiaomi a déclaré officiellement, ce qu’un unique observateur a rapporté à ce sujet, et ce que tout cela signifie pour quelqu’un qui choisit aujourd’hui un modèle de codage.
Ce que Xiaomi a réellement mis en ligne
Le 16 septembre, l'équipe MiMo, dirigée par Luo Fuli, a ouvert une page en direct sur le domaine de Xiaomi montrant en temps réel le post-entraînement de deux modèles non encore publiés : nombre de pas, courbes de récompense, débit de tokens, nombre de bacs à sable, notifications de défaillance GPU et un compteur de coût qui s'incrémente sous vos yeux. D'après la couverture médiatique, la façon dont Xiaomi présente les choses est qu'elle a passé environ six mois à travailler sur une seule question — jusqu'où l'apprentissage par renforcement peut être mis à l'échelle — et qu'elle a décidé de mener cette expérience en public plutôt que d'annoncer un résultat.
Le tableau de bord est d'une franchise inhabituelle pour un artefact de fournisseur. Il énumère ses propres défaillances dans un fil de notifications : un redémarrage de Pro à l'étape 17 causé par une erreur de mémoire insuffisante du GPU due à un déséquilibre de charge entre experts, que l'équipe dit avoir corrigé en ajustant sa stratégie de parallélisme d'entraînement ; une panne de connectivité réseau entre le cluster d'entraînement Pro et le déploiement d'évaluation, qui a forcé un redémarrage et la décision de retirer le jeu de données cyber de la prochaine exécution de Pro après « des motifs problématiques dans les journaux de déploiement » ; un redémarrage de Flash depuis l'étape 15 après qu'une classe d'erreur d'infrastructure est restée non détectée pendant environ trois heures ; et un redémarrage de Pro dû à une panne de VRAM sur un seul nœud. Il note également que les tâches jugées « relativement faciles pour le modèle pro actuel » ont été filtrées — un aveu que la plupart des rapports post-entraînement passent sous silence.

Les deux fiches d’exécution sont la partie qui compte pour quiconque suit le timing. Les deux modèles sont étiquetés arrêtés : MiMo-V2.6-Pro après 5 jours et 7 heures de temps écoulé, MiMo-V2.6-Flash après 3 jours 11 heures, chacun à l’étape 30, le 20 septembre et le 19 septembre respectivement. Pro a consommé 75 Md de tokens et 753 000 échantillons pour un coût de 2,62 M$ ; Flash a consommé 81,4 Md de tokens pour 854 000 $. Chaque étape tire un lot de 1 568 prompts avec 16 rollouts par prompt — 25 088 trajectoires par étape, exécutées entièrement de manière asynchrone.
Il faut le dire clairement : Xiaomi n’a pas précisé si « stopped » signifie que l’exécution est terminée, mise en pause ou checkpointée. Une carte arrêtée n’est pas une notification d’achèvement, et personne en dehors de l’équipe ne sait de quel cas il s’agit.
Ce qui est confirmé, et ce qui ne l'est pas
Le 72,57 n'est pas une rumeur. Il est imprimé sur le tableau de bord de Xiaomi, dans un graphique intitulé DeepSWE v1.1, mini-swe-agent, avg@3, à côté de la courbe orange de l'exécution Pro. Le 65,68 du modèle Flash figure sur le même graphique. Ce chiffre apparaît aussi — sous la forme de 62,24 puis de 65,97 — dans des captures antérieures du même panneau, ce qui donne à la courbe sa forme : une montée régulière sur 30 étapes plutôt qu'une seule évaluation chanceuse.
Ce qui n'est que rapporté constitue le point de départ. L'affirmation qui circule sur X le 21 septembre, provenant du compte @nrehiew_, est que le modèle Pro est passé « de 58,41 à 72,57 » sur DeepSWE et que les exécutions sont terminées. Le point d'arrivée correspond exactement au tableau de bord du fournisseur. La référence de 58,41 est la lecture que fait ce compte du point où la courbe commence — le point Pro le plus à gauche du graphique se situe bien dans la cinquantaine haute — et Xiaomi n'a pas publié de chiffre pour l'étape 1. L'affirmation d'achèvement est elle aussi une interprétation de deux cartes marquées comme arrêtées, ce qui est une lecture raisonnable et non une déclaration de Xiaomi. Considérez l'amélioration de 14 points comme solide sur le plan directionnel et approximative sur le plan numérique.

Il existe une distinction supplémentaire que la couverture a omise, et c’est celle qui détermine combien vaut réellement le chiffre. Les panneaux de benchmark du tableau de bord sont les propres évaluations de Xiaomi : l’entreprise a exécuté le harnais sur ses propres checkpoints et publié les résultats. Le harnais est le même que celui utilisé par le classement public — mini-swe-agent, DeepSWE v1.1 — ce qui rend le chiffre plus comparable qu’un benchmark maison d’un fournisseur ne le serait. Mais une évaluation réalisée par l’entreprise elle-même n’est pas une entrée de classement, et 72.57 n’apparaît pas sur le tableau de Datacurve, parce que personne n’a soumis ce résultat.
Le plafond de 74 % est plus serré que ne le suggère le titre principal.
Ce qui met la comparaison en relief. Le classement DeepSWE v1.1 de Datacurve, mis à jour pour la dernière fois le 3 septembre 2026, recense 113 tâches réparties sur 91 dépôts dans cinq langages, et ses trois meilleures configurations sont à égalité à 74 % de Pass@1 : GPT-6 Astra avec un effort de raisonnement xhigh, Gemini 3.8 Flash en high, et Claude Opus 5 en max. Ce sont les chiffres affichés à côté de ces scores qui sont intéressants.
• Confiance — GPT-6 Astra 74 % ±3, Gemini 3.8 Flash 74 % ±1, Claude Opus 5 74 % ±4. Sur le même classement, GPT-5.6 Sol se situe à 73 % ±3 et GLM-5.3 ainsi que Kimi K3 à 69 %. Les intervalles se chevauchent bien au-delà de la deuxième décimale.
• Coût par tâche — Gemini 3.8 Flash affiche une moyenne de 2,36 $, GPT-6 Astra de 6,52 $, Claude Opus 5 de 11,84 $. Le graphique du classement lui-même désigne Gemini 3.8 Flash comme la configuration la plus efficace du tableau, et l'écart entre ces trois est d'environ cinq pour un pour un taux de réussite que le benchmark ne peut pas distinguer.
• Étapes — Gemini 3.8 Flash nécessitait en moyenne 166 étapes d’agent par tâche, Claude Opus 5 99, GPT-6 Astra 29. Le score à égalité masque trois styles de travail très différents, et le moins cher est celui qui travaille le plus dur.

Ainsi, lorsque le 72,57 rapporté est décrit comme « s'approchant du sommet du classement », la version exacte est plus nuancée et moins spectaculaire. Il se situe à environ un point et demi d'une égalité à trois dont les membres ne peuvent être départagés par les propres barres d'erreur du benchmark. C'est un résultat solide pour un modèle encore en post-entraînement, produit par le fournisseur plutôt que par les mainteneurs du benchmark, sur un classement auquel le modèle n'a pas été soumis. La dernière mise à jour du classement est entièrement antérieure à l'exécution de Xiaomi, c'est pourquoi rien de MiMo n'y apparaît encore.
Pourquoi Xiaomi s'entraîne en public
La transparence n’est pas anodine. La dernière publication de modèles à poids ouverts de Xiaomi était Xiaomi MiMo-V2.5 et Xiaomi MiMo-V2.5-Pro fin avril, tous deux sous licence MIT — utilisables à des fins commerciales, affinables, redistribuables. MiMo-V2.5-Pro est un modèle à mélange d’experts de 1,02 billion de paramètres, avec 42 milliards de paramètres actifs, une architecture à attention hybride et une fenêtre de contexte de 1 million de tokens, et sa documentation de lancement rendait explicites les revendications agentiques : un compilateur écrit de zéro en Rust au fil de centaines d’appels d’outils, une application de bureau de huit mille lignes construite en onze heures de travail d’agent.
Diffuser en continu le post-entraînement de la prochaine génération est une autre forme de revendication. Un laboratoire qui publie en temps réel ses courbes de récompense, ses comptages de sandbox et ses pannes de GPU demande à être jugé sur le processus plutôt que sur une présentation de lancement, et il annonce un calendrier. Luo Fuli a déclaré que les détails techniques du travail de RL seront publiés en open source pièce par pièce au cours des prochaines semaines. C'est ce qui ressemble le plus à un calendrier que quiconque ait proposé : la méthodologie d'abord, le modèle ensuite.
Cela correspond aussi à un schéma que Xiaomi a déjà utilisé, où un modèle apparaît en public sous un autre nom avant que l’entreprise ne le revendique. Les habitudes de l’entreprise sont d’entraîner discrètement, de tester ouvertement, puis de publier avec les poids.
Ce que vous pouvez exécuter aujourd'hui
Rien dans la famille MiMo-V2.6. Si vous voulez un modèle Xiaomi MiMo dès maintenant, c’est la génération V2.5 qui existe — poids ouverts via les canaux propres de Xiaomi et plusieurs plateformes tierces, avec des fiches et des tarifs publiés. Il n’y a pas d’API MiMo-V2.6, pas d’identifiant de modèle et pas de liste de prix, et toute page citant un identifiant MiMo-V2.6 ou un tarif par token comble un vide que Xiaomi a laissé. Les chaînes `mimo-v2.6-pro` et `mimo-v2.6-flash` sur le tableau de bord sont des noms de tâches d’entraînement, et non des points de terminaison publiés.
L'autre conséquence pratique, c'est ce qu'il faut faire en attendant. Si la raison pour laquelle MiMo-V2.6-Pro vous intéresse est qu'il pourrait être un moyen moins coûteux d'atteindre des performances de codage de niveau frontière, les configurations auxquelles il est comparé sont déjà disponibles, et le classement indique que l'option bon marché est compétitive : Gemini 3.8 Flash égale le meilleur taux de réussite à 2,36 $ par tâche et est signalé comme la configuration la plus efficace du classement. Gemini 3.8 Flash, Claude Opus 5 et GPT-6 Astra sont tous accessibles via une seule clé API OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge répercutée — ainsi, une modification tarifaire d'un fournisseur est effective de notre côté le jour même plutôt qu'au cycle de facturation suivant — avec un basculement configuré par modèle plutôt que par fournisseur. Et quand un laboratoire ouvre effectivement un modèle comme celui-ci, le router derrière la même clé est la façon la moins engageante de l'évaluer : vous pouvez le placer devant du trafic réel sans parier un chemin de production sur un checkpoint que personne n'a caractérisé.
Qu’est-ce qui changerait réellement cette histoire ?
Quatre signaux, à peu près par ordre de ce qu’ils permettraient de trancher :
• Poids sur Hugging Face sous une licence déclarée, ce qui correspond à l’arrivée de la génération V2.5 et constitue la preuve la plus solide que le run RL a produit un modèle livrable plutôt qu’une expérience qui a pris fin.
• Une fiche de modèle avec le nombre de paramètres, la longueur de contexte et l’architecture — aucun des chiffres de la V2.6 n’est public, et le tableau de bord ne les affiche pas. Supposer que V2.6-Pro hérite de la forme 1,02T/42B de V2.5-Pro serait une conjecture.
• Un identifiant d'API et une grille tarifaire, c'est le moment où le chiffre de DeepSWE devient une décision d'achat plutôt qu'un sport de spectateur.
• Une soumission au tableau de classement DeepSWE de Datacurve, qui placerait MiMo-V2.6-Pro dans le même tableau et sous les mêmes barres d’erreur que les modèles auxquels il est comparé. Une évaluation réalisée par le fournisseur et une soumission à un classement ne constituent pas la même affirmation, et l’écart entre les deux correspond exactement à une ligne de ce tableau.
D'ici là, le résumé honnête est que Xiaomi a montré la phase de post-entraînement la plus transparente jamais publiée par un grand laboratoire, sur deux modèles que la marque n'a pas commercialisés, avec un score de benchmark auto-déclaré qui arrive près de — mais ne rejoint pas — le sommet du classement. Le document détaillant la méthodologie est promis dans les semaines à venir. La date de sortie n'est pas promise du tout.
