Carte principale du radar de modèles OrcaRouter pour la comparaison entre MiMo-V2.6-Pro et DeepSeek V4 Pro, sous-titrée « Deux modèles phares ouverts, dix points d'indice d'écart. », avec un panneau par modèle et un pied de page précisant que les deux sont sous licence MIT avec une fenêtre de contexte d'un million de tokens et que les scores sont en v4.3.2 et ne sont pas comparables aux versions antérieures de l'indice.
Guides & Insights

MiMo-V2.6-Pro vs DeepSeek V4 Pro : deux fleurons ouverts, à dix points d'indice d'écart

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Xiaomi MiMo-V2.6-Pro et DeepSeek V4 Pro sont le même genre d'objet — des fleurons chinois de type mixture-of-experts à l'échelle du billion de paramètres, sous licence MIT, avec un contexte d'un million de tokens et des poids ouverts que vous pouvez télécharger dès aujourd'hui — et ils sont séparés par dix points sur l'Artificial Analysis Intelligence Index v4.3.2, 46 contre 36. Ils ne sont pas non plus d'accord sur la vocation d'un modèle phare. DeepSeek V4 Pro, publié le 13 août 2026, est un modèle de raisonnement purement textuel : 1,6 billion de paramètres dont 49 milliards actifs, et aucune entrée visuelle, audio ou vidéo nulle part dans sa surface publiée. Xiaomi MiMo-V2.6-Pro, publié le 21 septembre 2026, compte 1,02 billion de paramètres dont 42 milliards actifs et accepte le texte, l'image, la vidéo et l'audio. Cette différence départage plus de déploiements que ne le font les dix points, et c'est la première chose à trancher avant de comparer quoi que ce soit d'autre.

Même licence, différentes machines

Commencez par ce qui est véritablement identique, car il y en a plus qu’on ne l’attendrait entre deux laboratoires concurrents. Tous deux sont distribués sous une étiquette de licence MIT sur des dépôts publics, ce qui signifie le déploiement commercial, la modification et l’entraînement ultérieur sans seuil de chiffre d’affaires ni clause de domaine d’utilisation. Tous deux revendiquent une fenêtre de contexte de 1M jetons. Tous deux sont des conceptions de type mélange d’experts clairsemé — l’architecture est devenue la norme à cette échelle, et non un facteur de différenciation. Et tous deux ont été entraînés par des laboratoires qui publient moins que ne le font les laboratoires de pointe occidentaux sur la méthode.

• Paramètres — MiMo-V2.6-Pro 1,02 T au total / 42 Md actifs ; DeepSeek V4 Pro 1,6 T au total / 49 Md actifs

• Modalité d’entrée — MiMo-V2.6-Pro : texte, image, vidéo, audio ; DeepSeek V4 Pro : texte uniquement

• Contexte — 1M de jetons pour les deux ; DeepSeek V4 Pro plafonne la sortie à 384K jetons

• Score de l'indice — MiMo-V2.6-Pro 46 sur Intelligence Index v4.3.2 ; DeepSeek V4 Pro 36 sur la même version

• Coût par tâche Index — MiMo-V2.6-Pro 0,13 $; DeepSeek V4 Pro 0,67 $

Tarif affiché — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million de tokens ; DeepSeek V4 Pro 1,32 $ / 3,96 $ tel que répertorié par Artificial Analysis, avant le propre barème heures pleines/heures creuses de DeepSeek

• Vitesse — MiMo-V2.6-Pro 134,3 jetons de sortie/seconde ; DeepSeek V4 Pro 97,4

• Délai jusqu'au premier token — MiMo-V2.6-Pro 2,15 s ; DeepSeek V4 Pro 1,62 s

Lisez cette liste deux fois, car deux lignes sont contre-intuitives. Le modèle plus petit obtient dix points de plus — 42 milliards de paramètres actifs qui battent 49 milliards n'est pas une différence d'arrondi, c'est un résultat de post-entraînement, et c'est le signal le plus clair de cette comparaison que la qualité de l'apprentissage par renforcement a dépassé l'échelle brute comme levier. Et le modèle moins cher est aussi le plus rapide, tant en débit qu'en coût par tâche, ce qui est l'inverse du compromis habituel. Xiaomi ne vous vend pas une réduction en échange de patience. L'avantage de DeepSeek réside dans le temps jusqu'au premier token, 1,62 seconde contre 2,15 — réel, mais c'est la seule catégorie où V4 Pro est en tête.

Two-column scoreboard card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the scoreboard'. The Xiaomi MiMo-V2.6-Pro column lists 1.02T total and 42B active parameters, text, image, video and audio input, a 1M-token context window, Intelligence Index v4.3.2 score 46, a listed rate of $0.43 / $0.87 per million tokens, $0.13 per index task, 134.3 tokens per second with 2.15 seconds to first token, and a release date of 21 September 2026. The DeepSeek V4 Pro column lists 1.6T total and 49B active parameters, text-only input, a 1M-token context window with output capped at 384K, index score 36, a listed rate of $1.32 / $3.96, $0.67 per index task, 97.4 tokens per second with 1.62 seconds to first token, and a release date of 13 August 2026.

Pourquoi la même version d'index est importante ici

Comparer des modèles à poids ouverts d’une révision d’indice à l’autre est la façon dont la plupart des comparaisons publiées tournent mal, donc le numéro de version n’est pas une note de bas de page. Artificial Analysis a reconstruit l’Intelligence Index en v4.3 en septembre 2026, et les scores ont sensiblement changé de part et d’autre de cette limite — Claude Opus 5 a perdu trois points entre la v4.2 et la v4.3, et le classement des modèles à poids ouverts a été rebattu. Les deux chiffres ci-dessus sont en v4.3.2, ce qui signifie que le 46 et le 36 sont directement comparables entre eux. Ils ne sont pas comparables aux chiffres plus anciens que vous trouverez cités ailleurs pour l’un ou l’autre modèle.

Ce n’est pas une hypothèse. DeepSeek V4 Pro a été largement rapporté à 53 sur une échelle d’indice antérieure en août 2026, et notre propre couverture de cette période le mentionnait. Sur la v4.3.2, le même modèle affiche 36. Rien n’a changé dans le modèle ; c’est l’étalon qui a changé. Si vous avez un tableur avec 53 à côté d’un 46 pour MiMo-V2.6-Pro, vous avez une comparaison qui vous orientera vers le mauvais modèle. Le bon appariement est 46 contre 36, et la bonne conclusion est que le modèle publié cinq semaines plus tard, avec deux tiers du nombre de paramètres, est nettement en avance.

L'écart de reporting entre les deux laboratoires

Il existe une deuxième différence, plus subtile, et elle porte sur ce que chaque laboratoire est prêt à faire vérifier.

Le 46 de MiMo-V2.6-Pro est une mesure d’Artificial Analysis. Le cabinet d’évaluation a exécuté sa propre suite — dix évaluations portant sur le raisonnement, les connaissances, les mathématiques et le codage — sur le modèle publié, puis a publié le résultat, accompagné des chiffres d’exploitation : 134,3 tokens/seconde, 2,15 secondes jusqu’au premier token, une remise de 99 % sur le cache, 0,13 $ par tâche d’indexation et un coût total d’évaluation de 206,66 $. C’est le chiffre d’un tiers concernant le modèle de Xiaomi.

Les chiffres phares de DeepSeek V4 Pro en matière d’agents sont ceux de DeepSeek lui-même, et l’écart entre ceux-ci et les chiffres indépendants a été documenté. Le matériel de lancement de l’entreprise rapporte Terminal-Bench 2.1 à 87,9, DeepSWE à 62,7, CyberGym à 83,3 et SWE-bench Verified à 80,6. Des exécutions indépendantes situent Terminal-Bench 2.1 à 78,7 — soit environ neuf points en dessous du chiffre du fournisseur — et l’Artificial Analysis Coding Index à 68,8. Aucun de ces chiffres du fournisseur n’a été reproduit, et l’ampleur de l’écart sur Terminal-Bench justifie de considérer le reste de l’ensemble comme des affirmations plutôt que des mesures.

Xiaomi a sa propre version du même problème. Son tableau de bord indique que MiMo-V2.6-Pro passe de 58,4 à 72,57 sur DeepSWE v1.1 au cours de sa campagne d’apprentissage par renforcement, évalué sur le propre harnais de Xiaomi avec mini-swe-agent, en moyenne sur trois. Il ne s’agit pas d’une soumission à un classement, et aucune partie extérieure ne l’a réexécuté. Ainsi, aucun des deux modèles n’arrive avec un bilan de santé irréprochable sur les benchmarks des fournisseurs. La différence est que MiMo-V2.6-Pro arrive aussi avec un score composite indépendant que le lancement de DeepSeek n’avait pas au moment équivalent — et si vous choisissez entre eux sur la base des preuves plutôt que du marketing, c’est cette asymétrie qui devrait peser.

Screenshot of the Artificial Analysis model page for DeepSeek V4 Pro, showing the Intelligence Index score of 36 on version 4.3.2, an open-weights model under the MIT licence, text-only input, 1.6 trillion total and 49 billion active parameters, a 1M-token context window, a listed price of $1.32 per million input tokens and $3.96 per million output tokens, output speed of 97.4 tokens per second and time to first token of 1.62 seconds.

À quoi cela ressemble en production

La différence de modalité constitue le point de divergence concret, et elle tourne à l’avantage de DeepSeek moins souvent que ne le suggère l’écart de dix points. Si votre pipeline ingère des captures d’écran, des PDF rendus sous forme d’images, des images vidéo ou de l’audio, MiMo-V2.6-Pro les gère nativement dans un seul modèle, tandis que DeepSeek V4 Pro ne peut pas les gérer du tout — il vous faudrait un modèle de vision distinct en amont, ce qui implique un second contrat, un second mode de défaillance et une seconde facture. Si votre charge de travail se limite à du raisonnement textuel, la modalité supplémentaire est un poids mort pour lequel vous ne payez rien.

Le coût par tâche d’indexation est l’autre chiffre à retenir. 0,13 $ contre 0,67 $ représente un écart de cinq pour un sur un ensemble de tâches contrôlé et identique, mesuré de la même manière pour les deux. DeepSeek applique un barème de facturation en heures pleines/heures creuses qui peut réduire sensiblement son tarif effectif selon le moment où vous appelez, de sorte que le ratio réel se resserre aux heures creuses et s’élargit aux heures pleines — un détail qui compte si votre trafic est en rafales et que vous ne pouvez pas choisir le moment où il arrive.

C'est ici que le camp DeepSeek dispose d'un véritable avantage qui n'a rien à voir avec le modèle : il est sur notre plateforme. DeepSeek V4 Pro est accessible en tant que deepseek/deepseek-v4-pro via une clé OrcaRouter au prix catalogue du fournisseur, avec 0 % de marge, avec un basculement automatique entre fournisseurs et le DSL de routage disponible par-dessus — ainsi, l'arithmétique heures pleines/heures creuses, l'écart entre fournisseurs et le chemin de repli sont des choses que vous configurez plutôt que des choses que vous construisez. MiMo-V2.6-Pro n'est pas sur notre plateforme, et nous le dirons clairement : y accéder aujourd'hui signifie passer par la plateforme de Xiaomi elle-même ou par l'un des catalogues tiers qui le référencent, et Artificial Analysis n'a compté qu'un seul fournisseur d'API pour ce modèle au moment de la capture. Une seule route n'est pas une route de production, ce qui constitue l'argument le plus fort pour traiter MiMo-V2.6-Pro comme un modèle à évaluer dès maintenant et vers lequel router avec prudence, avec autre chose derrière.

Lequel, et quand

Choisissez DeepSeek V4 Pro si votre travail est uniquement textuel, si vous avez besoin du plafond de sortie de 384K, si vous voulez le temps jusqu'au premier token le plus rapide des deux, ou si vous êtes déjà sur notre plateforme et souhaitez une voie open-weights à mille milliards de paramètres avec basculement et sans nouvelle intégration. S'il est la référence, ce n'est pas un hasard, et avoir cinq semaines de plus a signifié cinq semaines d'outillage, de quantification et de recettes de service qu'un modèle de septembre n'a pas encore accumulées.

Choisissez MiMo-V2.6-Pro si la tâche est multimodale, si le coût par tâche domine votre économie unitaire, si le débit compte plus qu'une demi-seconde de latence, ou si vous voulez le leader actuel des poids ouverts sur un indice mesuré de manière indépendante. La licence MIT sur les deux signifie que la question des poids est réglée dans tous les cas — vous pouvez exécuter l'un ou l'autre sur votre propre matériel, l'affiner et le commercialiser.

La configuration qui mérite d’être envisagée n’est pas un choix du tout. Un routeur vous permet de conserver la voie DeepSeek pour le raisonnement textuel uniquement à des tarifs hors pointe et d’ajouter une voie MiMo pour les requêtes multimodales, avec une solution de repli en amont de la route la plus étroite. Ce n’est pas de la couverture ; c’est faire correspondre chaque requête au modèle qui la traite réellement, ce qui est une réponse moins coûteuse et plus durable que de choisir un gagnant et d’espérer que la charge de travail ne change jamais de forme.

Decision card headed 'MiMo-V2.6-Pro vs DeepSeek V4 Pro — the decision', with two columns. 'Choose MiMo-V2.6-Pro when' lists a multimodal task with screenshots, rendered PDFs, video frames or audio in the same request; cost per task dominating unit economics at $0.13 against $0.67 on an identical task set; throughput mattering more than latency at 134.3 against 97.4 tokens per second; and wanting the current open-weights leader on an independently measured index at 46 against 36. 'Choose DeepSeek V4 Pro when' lists text-only reasoning work; needing the 384K output ceiling; first-token latency being the binding constraint at 1.62s against 2.15s; and wanting a route with failover behind it.

La question à laquelle cette comparaison ne peut pas encore répondre

Les benchmarks les plus cités des deux modèles sont réalisés par leurs fournisseurs et non reproduits. Pour DeepSeek V4 Pro, cet écart persiste depuis août et explique pourquoi ses scores indépendants apparaissent inférieurs aux chiffres annoncés à son lancement. Pour MiMo-V2.6-Pro, le score composite indépendant existe, mais pas la ventilation des performances agentiques — Artificial Analysis publie un 46, et non la répartition par évaluation qui le sous-tend, le détail qui indique si un modèle a sa place dans une boucle d’agent ou dans un pipeline de questions-réponses.

Tant que cet écart n'est pas publié et que quelqu'un ne relance pas le harnais DeepSWE de Xiaomi, la position défendable est plus étroite que le marketing de l'un ou l'autre des laboratoires : MiMo-V2.6-Pro arrive en tête sur un composite indépendant et sur le coût mesuré par tâche, DeepSeek V4 Pro arrive en tête pour la maturité, la longueur de sortie, la latence du premier token et le fait d'être joignable par une route qui a de la redondance derrière elle. Cinq semaines représentent une courte avance, et c'est la seule que DeepSeek possède.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement