
Xiaomi MiMo-V2.6-Flash est disponible : un modèle ouvert de 309B que vous hébergez vous-même
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiMo-V2.6-Flash a cessé d'être une tâche d'entraînement le 21 septembre 2026 à 15:39 UTC, lorsque l'équipe MiMo de Xiaomi a publié le checkpoint sous le nom XiaomiMiMo/MiMo-V2.6-Flash-RL sur Hugging Face — sans restriction d'accès, sous licence MIT, rapport technique joint, 65 fragments de poids dans l'index. XiaomiMiMo/MiMo-V2.6-Pro-RL a suivi dix-huit secondes plus tard. Une semaine auparavant, les deux modèles n'étaient que deux cartes marquées « stopped » sur un tableau de bord d'entraînement public, et la formule largement reprise à leur sujet était qu'aucun poids n'existait. Désormais, ce sont des fichiers que chacun peut télécharger et servir. C'est un véritable changement dans ce que l'on peut faire avec le modèle, ce qui est différent d'une annonce à son sujet.
Commencez par l’horodatage, car la sortie est arrivée sans la chorégraphie habituelle des fournisseurs. Le blog de Xiaomi lui-même, consulté le 22 septembre, présente encore le lancement de MiMo-V2-Flash en décembre 2025 comme son article le plus récent. Il n’y a pas d’article de lancement pour V2.6, pas de grille tarifaire publiée pour la nouvelle génération, et aucun identifiant de modèle appelable que Xiaomi ait annoncé pour l’un ou l’autre des checkpoints. Ce qui existe, c’est un dépôt, un rapport technique, des recettes de déploiement et un ensemble de tableaux de benchmark produits par le fournisseur — plus un petit détail hostile dans la fiche du modèle qui n’importe qu’aux personnes qui comptent réellement charger la chose.
Les deux cartes que vous pouvez tenir
Les deux checkpoints sont nativement omnimodaux avec un contexte annoncé de 1 M de tokens, et tous deux sont sous licence MIT — utilisables commercialement, affinables, redistribuables, sans seuil de revenus ni clause de recherche. La fiche présente Flash comme le « checkpoint équilibré en efficacité » de la série et Pro comme le modèle phare ; ce qui est intéressant, c’est la manière dont les deux diffèrent dès qu’on regarde les configurations plutôt que la phrase marketing.
• Nombre de paramètres — MiMo-V2.6-Flash : 309 B au total, avec 15 B activés par jeton ; MiMo-V2.6-Pro : 1,02 T au total, avec 42 B activés. Tous deux sont des mélanges d’experts creux.
• Backbone — Flash compte 48 couches (39 à fenêtre glissante, 9 à attention globale), une taille cachée de 4096, 256 experts routés avec 8 activés, une fenêtre glissante de 128 tokens, aucun expert partagé. Le premier bloc est une attention globale avec un réseau feed-forward dense ; tout ce qui suit alterne.
• Encodeurs — un MiMo ViT de 681 M de paramètres (28 couches, 24 à fenêtre glissante plus 4 complètes), un tokeniseur audio de 308 M et un encodeur de patches audio de 127 M, afin que le texte, l'image, la vidéo et l'audio entrent tous dans le même modèle plutôt que dans trois pipelines assemblés tant bien que mal.
• Décodage spéculatif — un drafter de prédiction multi-jetons à cinq couches, de style DFlash, décrit dans la fiche comme prédisant sept jetons à l’avance par passe avant pour une vérification parallèle.
• Stockage — l'index publié rapporte 172,9 Go de données de poids réparties sur 65 shards, en FP8 (e4m3) avec un schéma d'activation dynamique. Interprétez cela comme environ neuf octets par paramètre : Xiaomi a livré le grand modèle, et non une quantification de celui-ci à l'échelle d'un ordinateur portable.
Trois chiffres qui ne concordent pas
Cela mérite d’être dit clairement, car ces trois éléments influent sur une décision de déploiement plutôt que sur un argument de benchmark, et aucun d’entre eux n’a rien de sinistre — ils ressemblent à une dérive documentaire entre le compte rendu, la page du dépôt et les fichiers livrés.
Le premier est le décodeur spéculatif. Le résumé du modèle indique que la tête MTP est un drafter à cinq couches qui prédit sept jetons par passe. Le config.json dans le même dépôt définit num_nextn_predict_layers à 3. Les deux nombres ne peuvent pas décrire le même artefact, et c’est la configuration que le runtime lira. Si vous dimensionnez la mémoire pour le décodage spéculatif, fiez-vous à la configuration et vérifiez après le chargement.
Le second est plus subtil et n'est pas du tout une erreur, mais plutôt une convention de nommage qui ressemble à une erreur. Le dépôt s'appelle MiMo-V2.6-Flash-RL, ce qui invite à supposer qu'il s'agit d'un adaptateur d'apprentissage par renforcement plutôt que d'un modèle. C'est le modèle. Le -RL suffixe marque la lignée de post-entraînement — ce checkpoint est la sortie de l'exécution RL mixte que Xiaomi a diffusée en streaming, et non un LoRA posé sur une autre base. L'index des poids le confirme : des dizaines de milliers de tenseurs couvrant l'intégralité du backbone, l'encodeur de vision, la pile audio et le drafter.
Le troisième est celui que l'on rencontre en premier si l'on dimensionne le matériel à partir de la page du dépôt plutôt que de la fiche. Le bloc Safetensors de cette page indique 159 milliards de paramètres. Ce n'est ni l'un ni l'autre des deux chiffres de la fiche — ni le total de 309 milliards, ni les 15 milliards actifs — et c'est le chiffre qu'un planificateur de capacité est le plus susceptible de copier, car il se trouve à côté du bouton de téléchargement. Xiaomi n'a pas expliqué la différence et nous ne pouvons pas la trancher de l'extérieur ; l'interprétation la plus probable est une convention de comptage sur des tenseurs quantifiés plutôt qu'un modèle différent. La solution sûre est plutôt de dimensionner à partir des données de poids publiées : 172,9 Go de FP8 répartis sur 65 fragments est un nombre qu'il faut payer en VRAM, quelle que soit la façon dont les paramètres sont comptés.
Ce que disent les benchmarks, et qui les a exécutés
Chaque chiffre ci-dessous provient des propres tableaux d'évaluation de Xiaomi figurant dans la fiche du modèle. Aucun n'a été reproduit de manière indépendante, aucun n'apparaît sur un classement public, et les colonnes de comparaison correspondent aux propres exécutions du fournisseur des mêmes bancs d'essai face aux modèles d'autres entreprises. Considérez la forme des résultats comme informative et les décimales comme un simple ornement.
• Agent de code — DeepSWE v1.1 : Flash 67,9, Pro 71,9, contre Claude Opus 5 à 74,0, GPT-5.6 Sol à 73,0 et Claude Fable 5 à 70,0. Sur Terminal Bench 2.1, Flash atteint 87,6 face aux 89,1 d'Opus 5 — un écart si faible que c'est peut-être le harnais, et non le modèle, qui tranche.
• Agent généraliste — AutomationBench v1.0.6 place Flash à 52,3, devant à la fois GPT-5.6 Sol (45,8) et Claude Opus 5 (50,3) lors de l’exécution de Xiaomi. Toolathlon-Verified : Flash 73,6, Pro 76,9, Opus 5 80,6.
• Cybersécurité — la colonne la plus déséquilibrée du tableau. CyberGym : Flash 95,1, au-dessus de son propre grand frère à 94,0, avec MiMo-V2.5-Pro à 40,0. Puis le plancher s'effondre : ExploitGym 6,0 pour Flash contre 22,1 pour Opus 5, ExploitBench 25,3 contre 70,0, SEC Bench Pro 47,5 contre 79,1 pour GPT-5.6 Sol.
• Agent visuel — MiMo VisualCoding : Flash 71,5, Pro 72,3, Opus 5 70,0.
Un chiffre mérite d’être isolé, car c’est le genre de chose qu’un billet de lancement cache généralement. Le tableau de bord RL de Xiaomi a publié Flash à 65,68 sur DeepSWE v1.1 — et la fiche du modèle affiche désormais 67,9 pour le même benchmark sur le checkpoint final. Ce ne sont pas les mêmes mesures. Le chiffre du tableau de bord était étiqueté mini-swe-agent, avg@3, sur un instantané d’entraînement ; le tableau de la fiche correspond à l’évaluation hors ligne des poids publiés par le fournisseur. L’écart de deux points correspond au gain de la dernière partie de l’exécution, plus tout ce qui a changé dans le protocole d’évaluation, et personne en dehors de Xiaomi ne peut actuellement distinguer les deux. Si vous citez 65,68 depuis la semaine dernière, il s’agit désormais d’un chiffre obsolète pour un artefact différent.

Ce que cela coûte réellement de le faire tourner
Des poids ouverts sont une licence, pas une facture, et c'est ici que la publication devient moins réjouissante. La section de déploiement de la fiche elle-même recommande SGLang (parallélisme tensoriel 16, parallélisme de données 2, avec le chemin spéculatif multicouche de type EAGLE activé) ou une recette vLLM en parallélisme tensoriel 8, et note que la version stable de vLLM peut être en retard sur l'architecture. C'est une tâche de service multi-nœuds pour un modèle de 309 B dont les poids occupent environ 173 GB avant d'ajouter le cache KV pour un contexte de 1 M de jetons. L'échantillonnage recommandé est temperature 1.0, top_p 0.95.
Ainsi, la présentation honnête de « l’open source » ici est la suivante : Xiaomi a supprimé la barrière de la licence et a laissé la barrière matérielle exactement là où elle était. Le fine-tuning de Flash sur vos propres traces est désormais légal et possible ; le faire sur quoi que ce soit de plus petit qu’un nœud GPU sérieux ne l’est pas. C’est une offre réelle et différente de celle d’un point de terminaison hébergé, et c’est pourquoi les deux façons d’utiliser cette génération ne sont pas en concurrence — elles couvrent des budgets différents.
Si vous voulez la capacité sans le nœud, les modèles auxquels Xiaomi se compare dans ce tableau constituent l'alternative pratique : GPT-5.6 Sol, Claude Opus 5 et Claude Fable 5 sont tous appelables dès aujourd'hui, et ils sont accessibles avec une seule clé API au prix catalogue du fournisseur, avec 0 % de marge ajoutée sur OrcaRouter ; la décision que vous prenez réellement est donc « acheter un nœud » ou « payer les appels à l'usage ». Si vous voulez voir comment l'offre appelable se compare sur les mêmes tâches de codage avant de vous engager dans un sens ou dans l'autre, le tableau de codage se lit plus vite que le tableau du fournisseur. Ce que vous ne pouvez pas faire sur aucun routeur aujourd'hui, c'est appeler MiMo-V2.6-Flash lui-même — nous ne routons aucun modèle Xiaomi, et la ligne de disponibilité sur la fiche de Xiaomi renvoie aux canaux propres à Xiaomi : la plateforme MiMo API, AI Studio, MiMo Code et l'application de bureau.

La question du prix reste ouverte
Xiaomi n’a pas publié de tarif par token pour MiMo-V2.6-Flash. Les articles sur le lancement indiquent que la série conservera la tarification API de MiMo-V2.5, et il s’agit d’une affirmation de presse plutôt que d’une grille tarifaire du fournisseur — les tarifs publiés à l’étranger de la génération V2.5 étaient d’environ un dixième de dollar par million de tokens d’entrée, l’entrée mise en cache étant environ dix fois moins chère, mais rien sur le site de Xiaomi ne confirme que les nouveaux checkpoints en héritent. Tant qu’une liste de prix n’apparaît pas, tout chiffre que vous voyez pour un point de terminaison MiMo-V2.6 est une inférence de quelqu’un.
Deux autres choses manquent encore, et toutes deux figurent sur la liste de tâches de Xiaomi elle-même plutôt que sur celle de quiconque d'autre. La déclaration de Luo Fuli lors du livestream sur le RL était que les environnements d'entraînement et le code RL seraient mis en open source, et le support de lancement répète cet engagement ; les dépôts fournissent actuellement les poids, un rapport technique et des instructions de déploiement, pas la pile d'entraînement. Et il n'y a pas d'évaluation indépendante : aucune soumission à un classement, aucune réexécution par un tiers des colonnes DeepSWE ou CyberGym. C'est l'écart qui importe le plus pour quiconque doit décider si un modèle de 309B avec un budget actif de 15B vaut la peine qu'on lui consacre un nœud.
Qu'est-ce qui changerait la donne
Trois signaux méritent d'être surveillés, à peu près par ordre d'impact sur une décision. Une grille tarifaire publiée fait passer ce projet d'auto-hébergement au statut de poste budgétaire que l'on peut comparer à l'offre hébergée de pointe. Une évaluation tierce sur les mêmes bancs d'essai — DeepSWE ou Terminal Bench, soumise plutôt qu'autodéclarée — permettrait de trancher si le 67,9 correspond à une position réelle ou à une configuration favorable. Et les environnements RL, s'ils voient le jour, seraient l'artefact le plus intéressant pour la plupart des équipes, car c'est ce dont vous auriez besoin pour reproduire la boucle d'auto-amélioration sur vos propres données.
D’ici là, la lecture pratique de cette version est restreinte et claire. MiMo-V2.6-Flash est un modèle d’agent omnimodal légitime, à poids ouverts et sous licence MIT, d’une taille qui suppose un cluster — et c’est le premier checkpoint de la génération MiMo-V2.6 que l’on peut tenir entre ses mains, ce qui est plus qu’on ne pouvait en dire la semaine dernière.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
