Carte principale intitulée « MiMo-V2.6-Pro vs MiMo-V2.6-Flash », avec le sous-titre « Un écart de prix de 3x, et ce qui ne l'explique pas », et deux panneaux : un panneau de gauche intitulé « MiMo-V2.6-Pro » affichant « 0,435 $ / 0,87 $ par 1M » et « 42B de paramètres actifs », et un panneau de droite intitulé « MiMo-V2.6-Flash » affichant « 0,14 $ / 0,28 $ par 1M » et « 15B de paramètres actifs », au-dessus d'un pied de page indiquant « Les deux sous licence MIT · les deux avec un contexte de 1M · index publié pour Pro uniquement ».
Guides & Insights

MiMo-V2.6-Pro vs MiMo-V2.6-Flash : un écart de prix de 3x que deux benchmarks n'expliquent pas

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Dans les propres tableaux d’évaluation de Xiaomi, MiMo-V2.6-Flash surpasse MiMo-V2.6-Pro. La ligne est CyberGym, et l’écart est de 95,1 à 94,0. C’est une ligne sur quinze, et c’est la raison pour laquelle il faut lire attentivement le reste de cette comparaison plutôt que de supposer que le modèle phare est toujours la réponse — car MiMo-V2.6-Flash coûte environ un tiers de ce que coûte MiMo-V2.6-Pro, et sur la plupart des lignes, les deux se situent à quelques points l’un de l’autre.

Les deux modèles ont été publiés en tant que dépôts Hugging Face le 21 septembre 2026, sous licence MIT, à dix-huit secondes d’intervalle, en tant qu’entraînements distincts plutôt que comme les échelons d’une même échelle. Xiaomi MiMo-V2.6-Pro est le palier des mille milliards de paramètres. MiMo-V2.6-Flash est le palier de l’efficacité. La question à laquelle cette page répond est de savoir lequel des deux a sa place sur votre chemin de production, et la réponse honnête dépend d’un chiffre qui n’existe dans aucune des deux versions.

Ce que chacun est

• Paramètres — Xiaomi MiMo-V2.6-Pro 1,02 T au total avec 42 B actifs par token, contre Xiaomi MiMo-V2.6-Flash à environ 309 B au total avec 15 B actifs
• Architecture — les deux sont des mélanges d’experts clairsemés avec entrée omnimodale native ; Flash est documenté à 48 couches, 39 à fenêtre glissante et 9 en attention complète, taille cachée 4096, 256 experts routés avec 8 actifs et aucun expert partagé, aux côtés d’un transformeur de vision de 681 M, d’un tokeniseur audio de 308 M et d’un encodeur de patchs audio de 127 M
• Contexte — 1 M de tokens sur les deux, avec jusqu’à 128 000 tokens de sortie sur les deux
• Licence — MIT sur les deux, poids en accès libre sur les deux
• Prix — 0,435 $ en entrée et 0,87 $ en sortie par million de tokens pour Pro, contre 0,14 $ et 0,28 $ pour Flash : un écart de 3,1x des deux côtés de la carte
• Entrée avec cache-hit — 0,0036 $ par million sur Pro, 0,0028 $ sur Flash
• Dépenses d’entraînement — Xiaomi rapporte environ 2,62 M$ pour la phase RL de Pro et 854 K$ pour Flash, chacun achevé en moins de six jours sur 30 étapes d’apprentissage par renforcement et environ 750 000 trajectoires
• Score d’index indépendant — 46 pour Xiaomi MiMo-V2.6-Pro sur l’Artificial Analysis Intelligence Index v4.3.2 ; aucun publié pour MiMo-V2.6-Flash

Cette dernière ligne est celle à retenir. Tout ce qui précède, excepté le score Pro, est déclaré par Xiaomi.

Là où trois fois le prix n'achète presque rien

Le tableau 3 de Xiaomi met les deux côte à côte sur les harnais sur lesquels la série a été entraînée, et pour le travail agentique à long horizon, les marges sont minces :

• DeepSWE v1.1 — Pro 71.9, Flash 67.9
• MiMo Code Bench — Pro 63.2, Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1, Flash 52.3
• Toolathlon-Verified — Pro 76.9, Flash 73.6
• Terminal Bench 2.1 — Pro 89.9, Flash 87.6
• OSWorld-Verified — Pro 82.0, Flash 80.8
• JobBench — Pro 62.0, Flash 61.2
• MiMo Visual Coding — Pro 72.3, Flash 71.5
• CyberGym — Pro 94.0, Flash 95.1
• MiMo Cyber Bench — Pro 80.2, Flash 77.2

Parcourez cette colonne : l'avantage du modèle phare se situe le plus souvent entre un et quatre points, avec une ligne perdue purement et simplement. Dans un flux de travail où la différence entre 67,9 et 71,9 correspond à la différence entre une tâche qui aboutit et une tâche qui échoue, un prix trois fois plus élevé est bon marché. Dans un flux de travail où ce n'est que la différence entre deux réponses acceptables, il ne l'est pas. Les tableaux de fournisseurs avec des décimales comme celles-ci induisent une fausse précision — personne en dehors de Xiaomi ne les a fait tourner, et un écart de deux points sur un harnais d'évaluation interne se situe bien à l'intérieur de la plage qu'un évaluateur différent ou une politique de réessai différente peut faire varier.

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

Où il achète beaucoup

Il existe un groupe de lignes où l’écart cesse de relever d’un simple arrondi. Chacune d’elles relève de la sécurité :

• ExploitGym — Pro 17.8, Flash 6.0
• ExploitBench — Pro 47.9, Flash 25.3
• SEC Bench Pro — Pro 66.3, Flash 47.5
• Agents' Last Exam — Pro 31.6, Flash 27.6
• Terminal Bench 4.0 — Pro 34.9, Flash 28.8

Sur ExploitGym, le modèle phare fait trois fois mieux que le modèle moins cher, soit le même facteur que le prix, et sur SEC Bench Pro, c’est 1,4x. Ce schéma est celui auquel on s’attendrait de la part d’un modèle à 42B de paramètres actifs face à un modèle à 15B : une tâche qui nécessite une longue chaîne de raisonnement sans crédit partiel est le genre de tâche où la capacité supplémentaire se manifeste, et CyberGym se situant dans l’autre sens est l’exception qui prouve que les deux entraînements ont appris des choses différentes plutôt que la même chose à des tailles différentes.

Ainsi, le découpage correspond à une véritable frontière de charge de travail, et non à une frontière marketing. Le travail d’agent à fort volume avec un critère de réussite indulgent — récupération, classification, modifications courantes, appels qu’une nouvelle tentative peut rattraper — relève du territoire de Flash. Les tâches où une mauvaise réponse coûte cher et où une réponse partielle ne vaut rien — développement d’exploits, revue de sécurité, sessions de terminal avec un état multi-étapes — sont celles où le niveau Pro justifie le surcoût.

Le nombre qui n'existe pas

MiMo-V2.6-Flash n'a pas de page de modèle Artificial Analysis. Son frère en a une. Cette asymétrie est l'élément le plus important de cette page, car elle signifie que le seul chiffre mesuré de façon indépendante dans toute la série MiMo-V2.6 est le 46 à côté de Xiaomi MiMo-V2.6-Pro. Tous les chiffres de Flash ci-dessus — y compris la ligne CyberGym qu'il remporte — proviennent d'un harnais Xiaomi, d'un évaluateur Xiaomi et d'une exécution hors ligne Xiaomi.

On peut raisonnablement soutenir que c’est temporaire : le modèle n’a qu’un jour au moment où nous écrivons ces lignes, et l’évaluation par des tiers prend du temps. On peut aussi raisonnablement soutenir que c’est structurel, car Flash est la gamme de volume et les gammes de volume attirent moins l’attention des benchmarks. Dans un cas comme dans l’autre, la conséquence pratique aujourd’hui est que vous ne pouvez pas comparer Flash à quoi que ce soit en dehors de sa propre famille avec la même confiance que vous pouvez comparer Pro. Si vous choisissez entre Flash et un modèle non-Xiaomi sur des critères de rapport prix/qualité, vous comparez un chiffre fourni par un vendeur à une mesure faite par quelqu’un d’autre.

Les deux fiches de modèle portent la même deuxième mise en garde. Aucun des deux dépôts n’est déployé par un fournisseur d’inférence — Hugging Face le dit explicitement sur chaque page, et Artificial Analysis n’a compté qu’un seul fournisseur d’API pour Pro. Nous n’hébergeons ni l’un ni l’autre des checkpoints, donc aucun des deux n’est routable via nous. La voie d’accès aux deux passe par la propre plateforme de Xiaomi et les catalogues tiers qui les référencent.

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

Le prix que vous payez en matériel, pas en jetons

Le prix par token ne représente que la moitié de ce que vous coûte un checkpoint, et les deux diffèrent bien plus fortement sur le disque que sur la grille tarifaire. MiMo-V2.6-Flash publie 172,9 Go de poids FP8 répartis sur 65 shards. Xiaomi MiMo-V2.6-Pro porte environ trois fois plus de paramètres, ce qui situe son téléchargement brut dans la fourchette du demi-téraoctet avant toute quantification — et son propre dépôt indique une taille de modèle Safetensors de 524 B de paramètres, un chiffre qui ne concorde ni avec le total de 1,02 T ni avec le nombre de paramètres actifs de 42 B.

Cet écart change la nature de la décision. Flash, à 172,9 GB, est un modèle qu’une petite équipe peut auto-héberger sur de la capacité louée et traiter comme une ressource banalisée. Pro, à environ trois fois cette taille, relève d’une décision de cluster — la couverture autour du lancement a estimé les deux entraînements à environ 4 000 et 8 000 GPU équivalents H200, respectivement. Si votre raison d’examiner les poids ouverts est que vous voulez avoir la possibilité de cesser de payer au token, les deux checkpoints offrent cette option à des échelles d’engagement très différentes.

Choisir entre eux

La règle qui subsiste malgré les réserves ci-dessus est de choisir en fonction de la classe de charge de travail plutôt que de la moyenne des benchmarks. Flash pour tout ce que vous seriez à l'aise de relancer ; Pro pour tout ce qu'une nouvelle tentative ne sauverait pas. Ensuite, mesurez, car aucun des deux modèles n'a de score indépendant sur les benchmarks qui vous importent réellement.

Comparer deux checkpoints côte à côte, c'est là qu'un routeur fait ce qu'un contrat par modèle ne peut pas faire. Placer un palier bon marché sur l'essentiel de votre trafic et ne faire monter que les cas difficiles vers le palier coûteux correspond à la même décision que celle décrite sur cette page, exprimée sous forme de configuration plutôt que de réécriture — et cette composition est exactement la raison d'être de la couche de routage. Cela compte aussi pour le prix lui-même : nous répercutons le prix catalogue du fournisseur avec 0 % de marge, donc si Xiaomi baisse le tarif sur l'un ou l'autre des checkpoints, le chiffre de notre côté évolue le jour même, et non à la prochaine renégociation de contrat. Cela vaut pour les modèles que nous proposons. Pour la paire MiMo-V2.6 en particulier, aujourd'hui, vous achetez toujours directement auprès de Xiaomi.

Qu'est-ce qui réglerait ça ?

Deux choses feraient passer cela d’une appréciation subjective à un calcul arithmétique. Une page Artificial Analysis pour MiMo-V2.6-Flash placerait les deux checkpoints sur le même axe coût-par-tâche que celui qui situe actuellement Pro à 0,133 $ par tâche de l’Intelligence Index, et la comparaison se résoudrait d’elle-même. Une réplication par un tiers du cluster de sécurité — ExploitGym, ExploitBench, SEC Bench Pro — confirmerait si l’écart de 3x sur ces lignes est une propriété du modèle ou une propriété du correcteur.

D'ici là, la position défendable est que Xiaomi MiMo-V2.6-Flash est le meilleur achat pour la plupart des équipes la plupart du temps, et que Xiaomi MiMo-V2.6-Pro est le meilleur achat pour la catégorie étroite de travaux où l'échec coûte cher. La seule ligne où Flash l'emporte ne remet pas cela en cause — mais c'est un rappel utile que le supplément du modèle phare est une affirmation sur une charge de travail, non sur un modèle.

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.