
Xiaomi MiMo-V2.6-Pro-UltraSpeed vs Xiaomi MiMo-V2.6 : un seul checkpoint, dix fois le prix
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed et Xiaomi MiMo-V2.6-Pro ne sont pas deux modèles. C'est un seul et même modèle vendu de deux manières. Tous deux sont servis à partir du même point de contrôle MiMo-V2.6 de mille milliards de paramètres que Xiaomi a publié en septembre 2026 — le niveau Pro de la série Xiaomi MiMo-V2.6, dont le petit frère est Xiaomi MiMo-V2.6-Flash. La différence entre les deux offres Pro réside entièrement dans la vitesse à laquelle les tokens sortent et dans le prix que vous payez pour ceux-ci. Le niveau standard demande 0,435 $ par million de tokens d'entrée et 0,87 $ par million de tokens de sortie. Le niveau UltraSpeed demande 4,35 $ et 8,70 $. C'est un rapport net de dix pour un de part et d'autre du compteur, et cela achète une promesse d'une vitesse de sortie environ dix fois supérieure — une affirmation que Xiaomi fait au sujet de sa propre pile de service, et pour laquelle aucun benchmark indépendant n'a encore publié de chiffre.
Donc, la question intéressante n’est pas de savoir quel modèle est meilleur. C’est de savoir si un multiple de dix est le juste prix pour dix fois la vitesse, et il s’avère que cela a un précédent qui mérite d’être lu avant d’y engager une voie de production.
Le palier rapide est une décision de service, non une décision de modèle
La présentation officielle de Xiaomi pour la gamme UltraSpeed est qu'elle égale le modèle standard en qualité et ne diffère que par son débit de traitement. Cela compte plus qu'il n'y paraît, car cela supprime la raison habituelle d'hésiter devant un nouveau palier. Vous ne pariez pas sur la personnalité d'un checkpoint différent, sur son comportement de refus ou sur ses particularités de formatage. Vous pariez que les mêmes poids, exécutés via une configuration de service plus agressive, se comporteront de la même manière sur vos prompts. Si cela se vérifie, passer d'un palier à l'autre est un changement de configuration, pas une migration.
Ce qui se trouve à l'intérieur de cette configuration de service n'a pas été documenté pour cette génération. Le précédent palier UltraSpeed, construit sur le checkpoint MiMo-V2.5-Pro en juin 2026, a été décrit par Xiaomi comme utilisant une quantification FP4 uniquement sur les couches d'experts, un schéma de décodage spéculatif parallèle par blocs appelé DFlash, et un runtime appelé TileRT, et il tournait sur un seul nœud de huit GPU. Xiaomi n'a pas publié les détails équivalents pour le palier V2.6. Considérez la pile précédente comme un contexte sur la manière dont la vitesse est obtenue, et non comme une description de ce qui tourne actuellement.
La gamme dans laquelle il s'inscrit est courte. Aux côtés des deux niveaux Pro, on trouve MiMo-V2.6-Flash, le petit frère à 309 milliards de paramètres au total et 15 milliards actifs. Pro est le modèle phare à mélange d'experts clairsemé : Artificial Analysis l'inscrit à 1 000 milliards de paramètres au total, avec 42 milliards actifs par token, une fenêtre de contexte d'un million de tokens et une licence MIT avec les poids sur Hugging Face. Voilà les chiffres à retenir, car toute la comparaison repose sur eux.
Qu’est-ce qui est réellement vérifié, et qu’est-ce qui ne l’est pas ?

L’asymétrie entre les deux colonnes ci-dessus est la chose la plus importante de cet article. Presque tout ce qui est mesurable dans ce duo a été mesuré du lentcôté
Artificial Analysis a évalué MiMo-V2.6-Pro et publie pour ce modèle un Intelligence Index de 46 — le meilleur score de la classe de 114 modèles dans laquelle elle le classe. Elle mesure 134,3 tokens de sortie par seconde via l’API de Xiaomi, contre une médiane de classe de 77,9, et un temps jusqu’au premier chunk de 2,15 secondes contre une médiane de 2,34. Elle indique un coût par tâche de l’Intelligence Index de 0,13 $, une remise de cache de 99 % sur le prix des entrées, et une verbosité de sortie de 140 millions de tokens. Ce sont des chiffres indépendants sur une configuration nommée, et ils constituent le seul point d’ancrage solide en matière de débit pour cette comparaison.
Pour UltraSpeed, la liste vérifiée est bien plus courte :
• Vitesse de sortie — environ dix fois le niveau standard, affirmé par Xiaomi et repris par les plateformes qui le référencent. Aucun tiers n’a publié de mesure en tokens par seconde pour ce niveau spécifique.
• Prix — 4,35 $ par million de tokens d’entrée et 8,70 $ par million de tokens de sortie, soit dix fois le niveau standard pour les deux. Aucun niveau de cache n’est indiqué aux côtés de ces deux tarifs.
• Qualité — « correspond à l'original », là encore une déclaration d'un fournisseur. Aucune évaluation indépendante du point de terminaison UltraSpeed n'a été publiée, donc l'affirmation selon laquelle la qualité est inchangée n'est pas testée plutôt que réfutée.
• Contexte et modalité — 1 048 576 jetons et entrée native de texte, d’image, de vidéo et d’audio, héritée du point de contrôle de base.
Il y a aussi un benchmark de fournisseur qu'il vaut la peine de nommer précisément en raison de la façon dont il a circulé. Le tableau de bord public d'apprentissage par renforcement de Xiaomi, qui a diffusé les exécutions de post-entraînement V2.6 en septembre 2026, rapporte des scores DeepSWE v1.1 de 72,57 pour l'exécution Pro et de 65,68 pour Flash. Ceux-ci proviennent de l'évaluation hors ligne de Xiaomi elle-même, à l'aide d'un harnais mini-swe-agent avec une moyenne sur trois ; ils n'ont jamais été soumis au classement public et n'ont pas été reproduits en dehors du laboratoire. Si vous avez vu 72,57 cité comme un score de classement, c'est un chiffre de fournisseur qui porte les habits d'un score de classement.

Le précédent : la dernière fois, Xiaomi a facturé trois fois, pas dix
Ce n'est pas le premier palier de vitesse de Xiaomi, et le précédent est la comparaison la plus utile de toute l'histoire — parce que le multiplicateur a changé.
MiMo-V2.5-Pro-UltraSpeed est arrivé en juin 2026, construit sur le point de contrôle V2.5-Pro, et il était facturé à environ trois fois le tarif de sortie du modèle standard. Le discours de Xiaomi à l'époque était le même que celui tenu aujourd'hui : environ dix fois la vitesse de sortie. La couverture médiatique de l'époque rapportait un débit soutenu d'environ 1 000 jetons par seconde, avec des pics proches de 1 200, sur un seul nœud de huit GPU, même si la page du modèle elle-même indiquait une plage plus large de 500 à 1 000 — et rien de tout cela n'a été vérifié de façon indépendante. L'accès nécessitait un formulaire de candidature plutôt qu'une inscription ouverte.
Mettez les deux côte à côte et le décalage raconte l’histoire. Le facteur de vitesse est resté autour de dix. Le facteur de prix est passé de trois à dix. C’est une offre très différente pour le même type de mise à niveau, et Xiaomi n’a pas publié d’explication pour ce changement. Cela pourrait refléter un service réellement plus coûteux — un point de contrôle plus volumineux, une configuration de décodage plus agressive, ou une capacité plus restreinte au lancement. Cela pourrait refléter une tarification de fenêtre de lancement sur un palier disponible depuis une seule journée. Ce qui lui manque encore, c’est une justification publique que l’on peut vérifier.
Une différence pratique mérite d'être signalée pour quiconque a utilisé le palier V2.5 : celui-ci était un essai à accès restreint. Le palier V2.6 est annoncé comme généralement disponible via l'API propre à Xiaomi et plusieurs plateformes tierces, aux tarifs publiés, sans étape de candidature. Quels que soient les autres changements, les frictions pour l'essayer ont diminué.
Ce que coûte le facteur dix sur une charge de travail réelle
Les pourcentages masquent la forme de ce phénomène, voici donc l’arithmétique sur une exécution d’agent concrète — une qui lit 20 millions de tokens d’entrée et émet 2 millions de tokens de sortie au cours de sa durée de vie. C’est une charge de travail agentique lourde mais pas exotique, du genre où un modèle boucle sur des appels d’outils et relit son propre contexte.
• Niveau standard, entrée — 20 M de jetons à 0,435 $ par million : 8,70 $.
• Niveau Standard, sortie — 2 M de tokens à 0,87 $ par million : 1,74 $.
• Niveau standard, total — 10,44 $ par exécution.
• Palier UltraSpeed, entrée — 20 M de tokens à 4,35 $ par million : 87,00 $.
• Palier UltraSpeed, sortie — 2 M de tokens à 8,70 $ par million : 17,40 $.
• Niveau UltraSpeed, total — 104,40 $ par exécution.
La différence est de 93,96 $, et elle correspond exactement à dix fois la facture, et non à dix fois une seule de ses lignes, car les deux tarifs évoluent dans les mêmes proportions. Passons maintenant à l'autre volet du bilan. Au débit de 134,3 jetons de sortie par seconde qu'Artificial Analysis mesure pour le niveau standard, générer 2 millions de jetons de sortie prend un peu plus de quatre heures de temps de génération pur. À dix fois ce débit, cela prend environ vingt-cinq minutes. Les 94 $ supplémentaires permettent donc de récupérer environ trois heures et demie de temps d'horloge sur cette exécution — soit environ 27 $ par heure gagnée, si l'on veut présenter les choses ainsi.
La pertinence de cet arbitrage dépend entièrement de ce que le temps d'horloge vaut pour vous, et une subtilité vient contredire une lecture naïve. Le prix des entrées du palier standard bénéficie d'une remise de 99 % sur le cache sur la page d'Artificial Analysis, ce qui signifie que la part « entrée » de la facture peut tomber à presque rien pour les charges de travail qui relisent le même contexte. La fiche d'UltraSpeed affiche les deux tarifs phares et aucun palier de cache. Si votre charge de travail est gourmande en cache, le facteur multiplicateur effectif n'est pas de dix — il est bien pire, car vous perdez la remise du côté où vous ne payiez presque rien. Si votre charge de travail est gourmande en sortie et peu gourmande en cache, dix fois est proche du chiffre réel. Mesurez votre propre répartition avant de faire confiance à l'un ou l'autre de ces chiffres.
L'asymétrie des poids ouverts
Il existe une différence structurelle entre les deux niveaux qui n’a rien à voir avec le prix ou la vitesse, et elle pourrait compter plus que l’un ou l’autre.
MiMo-V2.6-Pro est distribué sous licence MIT, avec les poids publiés sur Hugging Face. Cela autorise le déploiement commercial, la modification et l'entraînement ultérieur, et cela signifie que le modèle standard a un prix plancher qu'aucun fournisseur ne peut relever : si le tarif hébergé cesse d'être intéressant, vous pouvez servir le checkpoint vous-même. Vous n'atteindrez pas le débit de Xiaomi sur votre propre matériel, et vous devrez payer les GPU, mais l'option existe et elle plafonne ce que l'offre hébergée peut facturer.
UltraSpeed n’a pas un tel plancher. Il n’existe pas de poids UltraSpeed, car ce niveau correspond à la pile de service plutôt qu’au modèle — le checkpoint est le même que celui déjà public, et ce que vous louez, c’est la capacité de Xiaomi à l’exécuter rapidement. C’est une chose légitime à vendre, et cela ressemble à tous les autres niveaux de vitesse du marché. Cela signifie que le tarif multiplié par dix n’a aucun contrepoids concurrentiel, hormis d’autres fournisseurs exécutant les mêmes poids ouverts, et aucune échappatoire d’auto-hébergement si le prix bouge encore.

À mettre en regard de la situation de disponibilité. Le checkpoint standard est accessible via les canaux propres à Xiaomi et plusieurs plateformes tierces, et il est aussi téléchargeable. Le palier UltraSpeed est accessible via l’API propre à Xiaomi et plusieurs plateformes tierces, et c’est le seul moyen de se le procurer. Pour quiconque envisage une dépendance de longue durée, cette différence quant aux options disponibles mérite d’être prise en compte au même titre que le tarif par token.
Qui devrait prendre lequel
La décision se partage nettement selon la proportion de votre coût attribuable aux tokens de sortie et la proportion de votre budget de latence consacrée à la génération plutôt qu’à la mise en file d’attente.
• Utilisez UltraSpeed lorsque la charge de travail produit beaucoup de sortie, sollicite peu le cache et est interactive — génération de textes longs, boucles d’agents où le modèle écrit beaucoup de raisonnement entre les appels d’outils, ou tout cas où un humain attend à l’autre bout de la requête.
• Choisissez le niveau standard lorsque la charge de travail est gourmande en cache, tolérante au traitement par lots ou sensible aux coûts à la marge — classification en masse, réponse augmentée par récupération sur un corpus fixe, exécutions d'évaluation nocturnes, tout ce pour quoi quatre heures de génération conviennent, puisque personne ne surveille.
• Choisissez l’offre standard lorsque vous voulez pouvoir l’auto-héberger. Si votre posture de conformité exige des poids que vous pouvez détenir, UltraSpeed ne vous est pas accessible, à aucun prix.
• Ne prenez ni l’un ni l’autre avant d’avoir mesuré. L’affirmation d’un facteur dix est le chiffre déterminant ici, et elle est actuellement déclarée par le fournisseur. Un seul après-midi passé à faire passer vos propres prompts dans les deux niveaux vous en apprend plus que n’importe lequel des chiffres publiés, car le seul débit que quiconque ait vérifié de manière indépendante appartient au côté lent de la comparaison.
Sur ce dernier point, la mécanique de test d'un palier de service est la même que celle du test d'un modèle, et c'est là qu'une couche de routage justifie sa place. OrcaRouter regroupe plus de 200 modèles derrière une seule clé API, au prix catalogue du fournisseur, avec une marge de 0 % répercutée, de sorte que un changement de prix chez un fournisseur est répercuté de votre côté le jour même plutôt qu'à la prochaine reconduction de contrat. Le basculement automatique en cas de défaillance garantit qu'un palier que vous évaluez encore ne repose jamais seul sur un chemin de production, et le DSL de routage vous permet d'envoyer une classe de requêtes vers le point de terminaison rapide et tout le reste vers celui standard, sans maintenir deux intégrations. Rien de tout cela ne requiert spécifiquement les modèles de Xiaomi — l'important est que des décisions au niveau des paliers comme celle-ci sont faciles à annuler lorsque les paliers se trouvent derrière une seule clé.
Qu'est-ce qui réglerait cela ?
L'état honnête de la question MiMo-V2.6-Pro-UltraSpeed versus MiMo-V2.6-Pro, c'est que la moitié est mesurée et l'autre moitié est affirmée. Le palier standard dispose d'un Intelligence Index indépendant, d'un chiffre de débit indépendant et de poids ouverts publiés. Le palier rapide a un prix, une fenêtre de contexte et une promesse du fournisseur selon laquelle il s'agit du même modèle en version plus rapide.
Trois choses permettraient de combler l’écart. Une mesure indépendante du débit sur le point de terminaison UltraSpeed — Artificial Analysis a mesuré le palier standard via l’API de Xiaomi, donc le même traitement est possible et n’a tout simplement pas encore eu lieu. Une politique de cache pour le palier rapide, puisque son absence est ce qui transforme une facture dix fois plus élevée en quelque chose de pire sur les charges de travail gourmandes en cache. Et le moindre détail publié sur la pile de service V2.6, à la manière dont Xiaomi a documenté les experts FP4, DFlash et TileRT pour la génération V2.5.
D’ici là, le prix dix fois moindre est réel et la vitesse dix fois supérieure reste une affirmation. Si votre charge de travail est gourmande en sortie et que quelqu’un attend, cette affirmation mérite d’être testée sur vos propres prompts — et mérite d’être testée derrière une couche qui vous permet de revenir en arrière l’après-midi même si elle ne tient pas.
