Carte hero du radar de modèles OrcaRouter intitulée « MiMo-V2.6-Flash vs MiMo-V2.6 », sous-titrée « Une série, deux checkpoints, et un nom qui joue un double rôle », avec un panneau de gauche pour MiMo-V2.6-Flash indiquant 309B au total / 15B actifs, 172,9 Go de poids FP8 et checkpoint Efficiency, un panneau de droite pour MiMo-V2.6-Pro indiquant 1,02T au total / 42B actifs, « le nom que les gens utilisent pour le modèle phare » et Même licence MIT, et trois badges en dessous indiquant Publié le 21 sept. 2026, affirmation d'un contexte de 1M de tokens et Aucun endpoint Xiaomi à appeler.
Guides & Insights

MiMo-V2.6-Flash vs MiMo-V2.6 : une série, deux checkpoints, et un nom qui remplit une double fonction

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Demandez à deux personnes ce qu'est MiMo-V2.6 et vous obtiendrez deux modèles différents. La sortie de Xiaomi de septembre 2026 est une série avec deux checkpoints publiés — MiMo-V2.6-Flash à 309 milliards de paramètres et MiMo-V2.6-Pro à 1 020 milliards — et le nom seul MiMo-V2.6 sert à la fois pour la famille et, dans la plupart des articles, pour le haut de gamme de la génération. Ainsi, une page intitulée « MiMo-V2.6-Flash vs MiMo-V2.6 » oppose en réalité le checkpoint d'efficacité au nom que les gens écrivent lorsqu'ils veulent parler du modèle phare. Les deux checkpoints sont apparus sur Hugging Face à dix-huit secondes d'intervalle le 21 septembre 2026, les deux sont sous licence MIT, et tous deux sont avant tout des téléchargements — il n'y a aucun endpoint Xiaomi à appeler. Presque rien d'autre à leur sujet n'est identique.

Cela compte davantage qu’une simple querelle de dénomination ne le ferait d’ordinaire, parce que les deux ne forment pas une échelle de tailles que l’on peut gravir plus tard. Ce sont des entraînements distincts, avec des tableaux de référence distincts, des empreintes mémoire distinctes et — comme le montrent les chiffres publiés — quelques points où le plus petit l’emporte carrément.

Deux points de contrôle, un procès-verbal publié

Les dépôts sont XiaomiMiMo/MiMo-V2.6-Flash-RL, créés à 15:39:51 UTC, et XiaomiMiMo/MiMo-V2.6-Pro-RL, créés à 15:39:33 UTC. Aucun des deux n’est à accès restreint. Tous deux joignent un rapport technique et une fiche de modèle, et tous deux sont décrits par Xiaomi comme le produit d’une seule exécution d’apprentissage par renforcement mixte qui a intégré des tâches de codage, d’agent généraliste, de vision et de cybersécurité en une seule passe d’entraînement plutôt que des exécutions distinctes par domaine.

• Paramètres — MiMo-V2.6-Flash : 309 B au total, 15 B activés par token. MiMo-V2.6-Pro : 1,02 T au total, 42 B activés. Tous deux reposent sur un mélange d'experts creux.

• Backbone — Flash compte 48 couches, 39 en fenêtre glissante et 9 en attention complète, une taille cachée de 4096, 256 experts routés avec 8 activés, une fenêtre glissante de 128 tokens et aucun expert partagé. Pro applique la même idée d’attention hybride à une largeur bien plus grande.

• Modalité — les deux sont nativement omnimodaux, intégrant texte, image, vidéo et audio dans un seul modèle plutôt que trois pipelines assemblés à la va-vite. Flash embarque un transformeur de vision de 681 M de paramètres, un tokeniseur audio de 308 M et un encodeur de patchs audio de 127 M.

• Contexte — 1 M de tokens, revendiqué pour les deux, avec la configuration qui prend en charge un embedding de position maximale de 1 048 576 tokens.

• Licence — MIT dans les deux cas, sans seuil de revenus, sans condition d’usage acceptable au-delà des habituelles, et sans clause de recherche. Le déploiement commercial, la modification et la redistribution sont tous autorisés.

• Fichiers de poids — Flash publie 172,9 Go de données de poids FP8 réparties sur 65 fragments. Pro compte environ trois fois plus de paramètres, donc son téléchargement atteint l’ordre du demi-téraoctet avant toute quantification que vous appliquez vous-même.

• Où ils sont servis — Hugging Face, la plateforme API propre à Xiaomi, AI Studio, MiMo Code et l'application de bureau MiMo. La fiche précise qu'aucun des deux checkpoints n'est actuellement déployé par un fournisseur d'inférence tiers sur le Hub lui-même.

La collision qui coûte du matériel aux gens

La confusion dans cette paire ne se situe pas vraiment entre Flash et Pro. Elle se situe entre MiMo-V2.6-Flash et le modèle qui l'a précédé.

MiMo-V2-Flash est sorti en décembre 2025, et l'article de blog de Xiaomi annonçant sa sortie décrit un modèle à mélange d'experts avec 309 milliards de paramètres au total, 15 milliards actifs, un schéma d'attention hybride entrelaçant l'attention à fenêtre glissante et l'attention complète, et une fenêtre glissante agressive de 128 tokens. Comparez cela à la liste à puces ci-dessus. Le checkpoint 2026 et le checkpoint 2025 présentent la même forme de chiffres clés, la même taille de fenêtre glissante et le même budget d'activation — à neuf mois d'écart, issus de runs d'entraînement différents, avec des capacités différentes et un tableau de benchmarks différent.

Ainsi, une recherche de « MiMo V2.6 Flash » vous renverra allègrement des pages sur MiMo-V2-Flash, avec, en prime, une taille de contexte de 256K et un prix d'un dixième de dollar par million de jetons d'entrée qui appartient au modèle plus ancien. Si vous dimensionnez un nœud, ce n'est pas une erreur cosmétique. L'ancien checkpoint et le nouveau sont des téléchargements différents, avec des recettes de service différentes, et le nouveau revendique quatre fois la taille de contexte.

Il y a un second piège, plus discret, dans le nommage. Les deux dépôts se terminent par -RL, ce qui se lit comme un adaptateur d'apprentissage par renforcement posé au-dessus d'un autre modèle de base. Ce ne sont pas des adaptateurs. Le suffixe marque la lignée post-entraînement : ce sont les checkpoints complets issus du run RL streamé. L'index des poids le confirme — des dizaines de milliers de tenseurs couvrant tout le backbone, l'encodeur visuel, la pile audio et le drafteur spéculatif.

Ce que dit le propre tableau du fournisseur

Chaque chiffre de cette section provient des tableaux d’évaluation de Xiaomi dans les deux fiches de modèle. Xiaomi a exécuté les harnais sur ses propres checkpoints. Rien de tout cela n’a été reproduit en dehors du laboratoire, rien n’apparaît sur un classement public, et les colonnes de comparaison correspondent aux exécutions du fournisseur lui-même des mêmes harnais face aux modèles d’autres entreprises. Considérez le classement comme informatif et les décimales comme décoratives.

• Agent de code — DeepSWE v1.1 : Flash 67,9, Pro 71,9. Terminal Bench 2.1 : Flash 87,6, Pro 89,9. ProgramBench : Flash 26,0. MiMo Code Bench : Flash 61,2.

• Agent général — AutomationBench v1.0.6 : Flash 52,3, Pro 53,1. Toolathlon-Verified : Flash 73,6, Pro 76,9. OSWorld-Verified : Flash 80,8, Pro 82,0. Agents' Last Exam : Flash 27,6. Terminal Bench 4.0 : Flash 28,8.

• Cybersécurité — la seule colonne où le modèle plus petit est en tête. CyberGym : Flash 95,1 contre les 94,0 de Pro. MiMo Cyber Bench : Flash 77,2. Puis le plancher s’effondre : ExploitGym 6,0, ExploitBench 25,3, SEC Bench Pro 47,5.

• Agent visuel — MiMo VisualCoding : Flash 71,5, Pro 72,3.

En parcourant ces puces, le résumé honnête est que Pro est en avance presque partout, avec de petits écarts, et que ces écarts sont assez faibles pour se situer dans le bruit d’un banc d’essai auto-géré. Sur DeepSWE, les deux sont séparés de quatre points sur une échelle où le même checkpoint a bougé de deux points entre deux des propres évaluations de Xiaomi.

Ce dernier point mérite son propre paragraphe, car c'est l'élément le plus utile dans l'une ou l'autre fiche. Le tableau de bord RL public de Xiaomi, qui a diffusé les deux entraînements jusqu'en septembre, a publié Flash à 65,68 sur DeepSWE v1.1 avec un harnais mini-swe-agent en moyenne sur trois. La fiche finale indique 67,9 pour les poids publiés. Pendant ce temps, le chiffre du tableau de bord de Pro était de 72,57 et sa fiche indique 71,9 — il a baissé. Deux points de contrôle de la même exécution, évalués deux fois, et l'écart entre les deux évaluations est de la même taille que l'écart entre les deux modèles. Si vous citez des chiffres du tableau de bord depuis la semaine dernière, ils décrivent des instantanés d'entraînement, pas les artefacts que vous téléchargeriez aujourd'hui.

Scoreboard card headed 'MiMo-V2.6-Flash vs MiMo-V2.6-Pro', with paired rows for parameters (309B total / 15B active against 1.02T total / 42B active), weights on disk (172.9 GB FP8 across 65 shards against about three times Flash), DeepSWE v1.1 (67.9 against 71.9, with the RL dashboard's earlier 65.68 and 72.57 noted), CyberGym (95.1 against 94.0), independent score (None published against an Artificial Analysis Index of 46 at 134.3 output tokens per second) and price, plus a sourcing footer stating that every benchmark is Xiaomi's own run except the Pro index score.

Aucun des deux n’est sur un routeur

Voici la partie qui décide de la plupart des évaluations réelles. Xiaomi ne vend aucun des deux checkpoints : aucun prix par token n’est publié pour la génération MiMo-V2.6 sur son propre site, et aucun identifiant de modèle appelable n’a été annoncé pour l’un comme pour l’autre. Ce qui existe à la place, c’est un téléchargement, plus — pour Pro uniquement — un unique fournisseur d’API qu’Artificial Analysis recense comme le proposant à $0.435 par million de tokens d’entrée et $0.87 par million de tokens de sortie. Il s’agit d’une fiche de fournisseur plutôt que d’une grille tarifaire officielle du vendeur, et il n’existe absolument rien de comparable pour Flash. Les chiffres qui circulent sur les pages de catalogue de tiers doivent être lus de la même manière.

Ainsi, le choix entre Flash et Pro n’est pas un choix entre deux points de terminaison aux compteurs différents. C’est un choix entre deux factures de GPU, et la plus petite représente environ un tiers de la plus grande. Tout l’argument commercial en faveur de Flash est là, et il est plus fort que ne le suggère le tableau des benchmarks, car les deux modèles se tiennent à quelques points d’écart sur les tâches pour lesquelles la plupart des gens achètent.

Ce qui reste, c’est le traditionnel choix à trois options. Louer l’état de l’art, posséder un petit modèle, ou posséder un grand modèle. La colonne frontière est celle que Xiaomi utilise comme référence dans ses propres tableaux — Claude Opus 5, GPT-5.6 Sol et Claude Fable 5 se situent tous quelques points au-dessus de Pro sur DeepSWE dans la comparaison du fournisseur lui-même, et tous les trois sont appelables dès aujourd’hui via une seule clé API sur OrcaRouter au prix catalogue du fournisseur, avec 0 % de majoration répercutée. Cela compte pour la décision précise qui se présente à vous : une modification tarifaire du fournisseur vous est répercutée le jour même plutôt qu’au prochain renouvellement de contrat, de sorte que le calcul location-possession reste honnête à mesure que les prix des services hébergés évoluent. Le basculement automatique signifie aussi qu’un modèle que vous êtes encore en train d’évaluer n’a jamais à rester seul sur un chemin de production pendant que vous décidez.

Ce que vous ne pouvez pas faire sur n'importe quel routeur aujourd'hui — y compris le nôtre — c'est appeler MiMo-V2.6-Flash ou MiMo-V2.6-Pro. Nous ne routons aucun modèle Xiaomi, et la ligne de disponibilité sur la propre fiche de Xiaomi pointer vers les canaux propres de Xiaomi : la plateforme API MiMo, AI Studio, MiMo Code et l'application de bureau.

Quel point de contrôle, et quand ?

Prenez MiMo-V2.6-Flash si vous voulez la génération MiMo-V2.6 et que le matériel est la contrainte déterminante. Vous abandonnez environ quatre points DeepSWE et un ou deux points sur la plupart des benchmarks d’agents face au modèle phare. Vous obtenez un checkpoint qui représente environ un tiers de la mémoire, qui devance Pro sur CyberGym dans le propre tableau de Xiaomi, et qui partage la même licence, la même revendication de contexte de 1M de tokens et la même multimodalité. Pour une équipe qui effectue des travaux d’évaluation en cybersécurité, cette colonne CyberGym n’est pas un simple détail d’arrondi.

Prenez MiMo-V2.6-Pro si la charge de travail est du codage ou du travail agentique à long horizon et que le nœud est déjà payé. C’est le meilleur modèle sur presque toutes les colonnes, c’est celui qu’Artificial Analysis a réellement mesuré — un indice d’intelligence de 46 sur l’échelle v4.3 recalibrée, premier des 114 modèles de sa catégorie à poids ouverts, 134,3 jetons de sortie par seconde, et affiché à 0,435 $ par million de jetons d’entrée et 0,87 $ par million de jetons de sortie — et une mesure indépendante vaut plus qu’un tableau de fournisseur lorsque vous planifiez une mise en production.

Ne prenez ni l'un ni l'autre avant d'avoir lu les fichiers de configuration plutôt que les résumés. La fiche Flash décrit un modèle de draft spéculatif à cinq couches qui prédit sept tokens par passe ; le config.json du même dépôt définit num_nextn_predict_layers à 3. Le résumé de la fiche n'est pas ce que lit le runtime. Et le bloc Safetensors sur la page du dépôt indique 159 B de paramètres pour Flash et 524 B pour Pro, dont aucun ne correspond au total ni au nombre de paramètres actifs dans l'une ou l'autre fiche de modèle. Xiaomi n'a pas expliqué cette divergence. Dimensionnez plutôt à partir des données de poids publiées, car c'est le nombre que vous payez en VRAM, quelle que soit la façon dont les paramètres sont comptés.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence and multimodal tags, the model card heading 'Scaling Reinforcement Learning Toward Self-Improvement', a Safetensors block reporting a 159B model size, and an inference-providers panel stating that the model is not deployed by any inference provider.

Qu'est-ce qui réglerait ça ?

Trois choses, dans un ordre d’utilité approximatif. Une exécution par un tiers sur les mêmes harnais — DeepSWE ou Terminal Bench, soumise plutôt qu’auto-déclarée — vous dirait si l’écart de quatre points entre Flash et Pro est une position réelle ou une configuration favorable. Une grille tarifaire publiée transformerait toute la comparaison d’un projet matériel en une ligne budgétaire que vous pouvez mettre en regard de la frontière hébergée. Et les environnements RL — dont Xiaomi a annoncé la publication en open source — sont l’artefact que la plupart des équipes voudraient réellement, car ce sont eux dont vous auriez besoin pour reproduire la boucle sur vos propres traces.

D’ici là, la lecture pratique reste étroite. MiMo-V2.6 correspond à deux checkpoints, pas un seul, et le nom seul désigne généralement le plus cher. Si vous devez choisir au sein de la série aujourd’hui, le choix par défaut honnête est Flash, sauf si une colonne de benchmark à laquelle vous accordez une importance particulière indique le contraire — et si vous n’êtes pas prêt à acheter un nœud, aucun des deux n’est encore la bonne réponse.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing an Intelligence Index of 46 on the updated scale, ranked first of 114, output speed of 134.3 tokens per second, a price of $0.435 per million input tokens and $0.87 per million output with a 99% cache discount and $0.13 cost per Intelligence Index task, a 1M-token context window, and 1.02T total with 42B active parameters under the MIT licence with weights on Hugging Face.