Une carte de titre générée comparant Xiaomi MiMo-V2.6-Pro et Kimi K3 à effort maximal. La carte de gauche indique Intelligence Index v4.3.2 : 46, 1,02 T de paramètres au total, 206,66 $ pour exécuter l’indice, et 134,3 tokens par seconde ; la carte de droite indique Intelligence Index v4.3.2 : 44, 2,8 T de paramètres au total, 3 658,07 $ pour exécuter l’indice, et 42,8 tokens par seconde. Un pied de page indique : Les deux scores de l’Artificial Analysis Intelligence Index v4.3.2, relevés le 22 septembre 2026. Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

MiMo-V2.6-Pro vs Kimi K3 : deux modèles à poids ouverts de mille milliards de paramètres, quatorze fois d'écart sur le coût par tâche

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tous deux sont des modèles mixture-of-experts à poids ouverts issus de laboratoires chinois, avec une fenêtre de contexte de 1 M de jetons. Tous deux sont téléchargeables. Sur l’Artificial Analysis Intelligence Index v4.3.2, consulté le 22 septembre 2026, Kimi K3 de MoonshotAI obtient un score de 44 et MiMo-V2.6-Pro de Xiaomi obtient un score de 46. Deux points d’écart. Le coût mesuré de l’exécution de cette même suite d’évaluation pour chacun s’élève à 3 658,07 $ pour Kimi K3 et à 206,66 $ pour MiMo-V2.6-Pro — un facteur dix-sept. Si vous avez déjà décidé de vouloir des poids ouverts dans cette catégorie, c’est ce ratio, et non les deux points, qui doit dicter la décision.

Kimi K3 est le modèle établi de ce duo : publié le 16 juillet 2026, avec les poids complets qui ont suivi le 27 juillet, et des mois d’évaluation indépendante derrière lui. Xiaomi MiMo-V2.6-Pro est passé en disponibilité générale le 22 septembre 2026, ses dépôts de checkpoints d’apprentissage par renforcement étant apparus la veille. La comparaison oppose donc un modèle ouvert éprouvé à tarif premium et un tout nouveau à tarif de commodité, et ce qui est intéressant, c’est l’étroitesse de l’écart de capacité mesuré.

Ce qu'est réellement chaque modèle

Kimi K3 est un modèle de raisonnement multimodal à poids ouverts de 2,8 billions de paramètres, décrit lors de sa sortie comme le premier modèle ouvert de la classe des trois billions. Il active 16 experts sur 896 par token — environ 104 milliards de paramètres actifs — et utilise Kimi Delta Attention et Attention Residuals pour gérer efficacement un contexte de 1 M de tokens, avec une sortie pouvant atteindre 1 M de tokens par requête. Il fonctionne en raisonnement toujours actif avec vision native. L’API first-party de Moonshot facture 3,00 $ par million de tokens d’entrée, 0,30 $ par million de tokens d’entrée mis en cache et 15,00 $ par million de tokens de sortie, à tarif unique, sans tarification par paliers selon la longueur du contexte, et Artificial Analysis rapporte une remise de 90 % sur le cache et un tarif mixte de 2,31 $. Il a été mesuré à 42,8 tokens de sortie par seconde — nettement lent par rapport à une médiane de 77,9 pour des modèles de taille comparable — et à 3,93 secondes jusqu’au premier token.

Xiaomi MiMo-V2.6-Pro est un modèle à mélange d'experts clairsemé comptant 1,02 billion de paramètres au total et 42 milliards activés par token, avec une fenêtre de contexte de 1 M de tokens et une multimodalité native sur le texte, l'image, la vidéo et l'audio. Ses poids portent une étiquette de licence MIT. Xiaomi a conservé la tarification de la génération précédente plutôt que de réviser à la hausse le prix du nouveau checkpoint, c'est pourquoi il est affiché à 0,43 $ par million de tokens d'entrée et à 0,87 $ par million de tokens de sortie, avec une remise de cache de 99 % et un coût mixte de 0,18 $. Il a mesuré 134,3 tokens de sortie par seconde — onzième sur 114 modèles en vitesse — et 2,15 secondes jusqu'au premier token.

• Paramètres actifs — MiMo-V2.6-Pro 42B par token ; Kimi K3 environ 104B, activant 16 experts sur 896

• Paramètres totaux — MiMo-V2.6-Pro 1,02 T ; Kimi K3 2,8 T

• Score de l’indice — MiMo-V2.6-Pro 46 ; Kimi K3 44, tous deux Artificial Analysis v4.3.2

• Prix catalogue — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million ; Kimi K3 3,00 $ / 15,00 $, entrée mise en cache 0,30 $

• Tarif mixte — MiMo-V2.6-Pro 0,18 $ par million ; Kimi K3 2,31 $

• Coût d'exécution de l'index — MiMo-V2.6-Pro 206,66 $ ; Kimi K3 3 658,07 $

• Vitesse — MiMo-V2.6-Pro 134,3 tokens de sortie/seconde ; Kimi K3 42,8, contre une médiane de 77,9 pour la classe de taille

• Temps jusqu'au premier token — MiMo-V2.6-Pro 2,15 secondes ; Kimi K3 3,93 secondes

• Contexte — 1 M de tokens dans les deux cas ; Kimi K3 publie une sortie allant jusqu’à 1 M de tokens par requête

• Poids — tous deux téléchargeables ; MiMo-V2.6-Pro porte une étiquette MIT

A two-column scoreboard titled MiMo-V2.6-Pro vs Kimi K3, subtitled Two open-weight MoEs tied on the only index both were run against. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; total parameters 1.02T; list price $0.43 / $0.87 per 1M; cost to run the index $206.66; speed 134.3 tokens per second; time to first token 2.15 s. The right column, Kimi K3 (max), reads Intelligence Index v4.3.2 44; total parameters 2.8T; list price $3.00 / $15.00 per 1M; cost to run the index $3,658.07; speed 42.8 tokens per second; time to first token 3.93 s. A footer notes both models are open-weights, that MiMo-V2.6-Pro carries an MIT licence tag, and that blended rates per 1M tokens are $0.18 and $2.31. The OrcaRouter logo is composited in the bottom-right corner.

La vitesse est la différence que l'index dissimule

L’écart composite de deux points est le chiffre le moins intéressant ici, et le 134,3 contre 42,8 tokens par seconde est le plus intéressant. Un modèle qui génère trois fois plus vite n’est pas trois fois meilleur, mais c’est la différence entre une classe d’applications qui fonctionne et une qui ne fonctionne pas — et la page Artificial Analysis de Kimi K3 elle-même le signale comme notablement lent pour sa catégorie de taille. Pour une boucle d’agent à long horizon qui effectue des dizaines d’appels séquentiels, le débit se cumule comme la latence : une différence d’un facteur trois par appel n’est pas une différence de bout en bout d’un facteur trois, mais c’est la différence entre une session que l’utilisateur attend jusqu’au bout et une qu’il abandonne.

L’avantage de Kimi K3 se situe du côté des entrées. Son temps de 3,93 secondes jusqu’au premier token est plus lent que les 2,15 de MiMo-V2.6-Pro, mais pas de l’ordre de grandeur qui sépare l’un ou l’autre d’un modèle de raisonnement de pointe à effort maximal. C’est dans la génération que K3 paie pour sa taille, et c’est la génération qui vous est facturée.

Les numéros de fournisseur, et celui qui est mal lu

Les deux laboratoires ont publié des chiffres de DeepSWE v1.1 issus de leurs propres harnais, et les deux circulent comme s’ils étaient comparables. Ils ne le sont pas, et c’est pour cette paire que cette erreur fait le plus de dégâts, car les chiffres paraissent si proches l’un de l’autre.

Xiaomi rapporte que MiMo-V2.6-Pro passe de 58,4 à 72,57 sur DeepSWE v1.1 au cours de sa campagne d'apprentissage par renforcement, évaluée avec mini-swe-agent selon une moyenne de trois essais sur l'évaluateur propre à Xiaomi. Cette campagne est documentée comme comptant 30 étapes et environ 750 000 trajectoires par modèle, réalisée en moins de six jours pour une dépense publiée d'environ 2,62 million de dollars pour le modèle Pro et de 854 044 dollars pour le plus petit Flash. Une lecture largement diffusée de cette campagne place Kimi K3 à 68,51 sur le même benchmark, ce qui ferait du modèle Xiaomi le vainqueur avec quatre points d'avance. Cette lecture est un chiffre issu de la communauté, et non un chiffre de Moonshot, et les deux mesures utilisent des métriques différentes — une moyenne de trois essais face à un taux de réussite — si bien que les soustraire revient à faire de l'arithmétique sur des échelles qui ne correspondent pas. Aucun des deux fournisseurs n'a soumis de configuration au tableau public de Datacurve pour ces modèles.

Le chiffre qui est réellement comparable est l’indice, parce qu’Artificial Analysis a exécuté les deux lui-même : 46 pour MiMo-V2.6-Pro et 44 pour Kimi K3, sur la v4.3.2, sans que la ventilation par évaluation soit publiée pour aucun des deux. Cet écart de deux points est suffisamment faible pour se situer dans le bruit d’un composite de dix évaluations, et la conclusion honnête est qu’en termes de capacité mesurée, ces deux modèles sont pratiquement à égalité.

Ce que le premium de Kimi K3 vous apporte

Il serait erroné de lire l’écart de coût comme une pure marge. Kimi K3 est un modèle de 2,8 billions de paramètres contre 1,02 billion pour Xiaomi, et il active environ deux fois et demie plus de paramètres par token. Il a été le premier modèle ouvert de sa classe de taille, et il détient un ensemble de résultats indépendants que MiMo-V2.6-Pro n’a tout simplement pas eu le temps d’accumuler : selon les propres rapports d’Artificial Analysis, il s’est classé troisième à l’Intelligence Index, derrière Claude Fable 5 et GPT-5.6 Sol, au moment de sa sortie, avec GDPval-AA v2 à l’Elo 1668, première place sur AutomationBench-AA avec 53 %, deuxième sur AA-Briefcase à l’Elo 1547, et premier sur la Frontend Code Arena avec 1679. Ce sont des mesures indépendantes, et non des affirmations de lancement, et elles décrivent un modèle dont l’étendue échappe à une marge composite de deux points.

Il y a aussi une question de capacité. La demande pour Kimi K3 aurait submergé la capacité de service lors du lancement, provoquant des suspensions temporaires des abonnements API et des limites de capacité en amont sur certaines passerelles. Un modèle difficile à obtenir est un modèle sur lequel il est difficile de bâtir, et il s’agit d’un problème de disponibilité plutôt que de qualité.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Un seul endpoint, et une réponse franche sur ce que nous routons

Kimi K3 est sur OrcaRouter sous kimi/kimi-k3 — une seule clé compatible avec OpenAI, le prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'un changement de prix chez Moonshot est appliqué de notre côté le jour même, et le basculement automatique entre fournisseurs couvre les limites de capacité qui ont handicapé ce modèle depuis son lancement. Xiaomi MiMo-V2.6-Pro n'est pas sur OrcaRouter. Aucun modèle Xiaomi ne l'est, et la voie d'accès aujourd'hui est la plateforme propre de Xiaomi ou l'un des catalogues tiers qui le proposent. Cela mérite d'être dit sans détour plutôt que de laisser une page de modèle sous-entendre le contraire.

Ce qui fait de ce duo un bon exemple de ce à quoi sert la couche de routage. Deux modèles ouverts, à égalité sur la seule mesure indépendante à laquelle tous deux ont été soumis, séparés d'un facteur dix-sept sur le coût mesuré par tâche — ce n'est pas un choix, c'est une configuration à deux voies. Placez l'essentiel de votre trafic sur la voie bon marché et routez la queue vers l'autre selon un prédicat que vous définissez, ou basculez en cas de défaillance lorsqu'une route se dégrade. Avec les modèles derrière une seule clé, l'expérience qui vous indique quelle part chacun doit prendre est un changement de configuration sur vos propres prompts plutôt qu'une conversation d'approvisionnement — et si Xiaomi revoit le tarif de MiMo-V2.6-Pro une fois la fenêtre de lancement close, ou si Moonshot réduit les tarifs de K3 en réponse à la concurrence, les deux mouvements arrivent de notre côté le jour même plutôt qu'au prochain cycle de facturation.

Screenshot of the OrcaRouter model page for Kimi K3, captured 22 September 2026, showing the breadcrumb Home > Models > MoonshotAI > Kimi K3, the model id kimi/kimi-k3 dated 2026-07-15, the Vision, Tools, JSON and Reasoning capability badges, and the opening of the model description, which calls Kimi K3 MoonshotAI's flagship and most capable release to date and a 2.8-trillion-parameter mixture-of-experts model. The rate card sits below the visible area of the capture.

Lequel choisir

Choisissez Kimi K3 lorsque vous avez besoin de l'étendue qui accompagne un modèle de cette taille et mesuré de manière indépendante — vision, codage sur de longs horizons dans de grands dépôts, utilisation d'outils agentiques — ou lorsque vous l'utilisez déjà et que le coût de migration est réel. C'est le modèle le plus finement caractérisé des deux, et son plafond de sortie de 1 M de tokens est inhabituel. Prévoyez la vitesse de génération : à 42,8 tokens par seconde, il s'agit, en termes interactifs, d'un modèle pour le traitement par lots et les charges de travail hors ligne, quelle que soit la qualité de raisonnement qu'il laisse présager.

Choisissez MiMo-V2.6-Pro lorsque le débit et l'économie unitaire sont la contrainte, lorsque la boucle est riche en contexte et répétitive, lorsque la latence du premier token compte, ou lorsque vous voulez les poids sur votre propre matériel sous une licence permissive. C'est le rare cas d'un modèle bon marché qui est aussi le rapide, et sur le seul score indépendant que les deux modèles partagent, il est en avance d'une marge suffisamment faible pour qu'il s'agisse d'une égalité.

Prenez les deux si vous disposez d’un routeur. Le mode de défaillance à éviter, c’est de standardiser sur l’un ou l’autre à cause d’un ratio mis en avant : payer des tarifs Kimi K3 pour une tâche de résumé qu’un modèle 46-index termine de façon identique, ou découvrir qu’une tâche de codage à l’échelle d’un dépôt nécessite le modèle 2.8T après avoir tout basculé vers la voie bon marché. Ni l’un ni l’autre n’est un problème de modèle, et les deux relèvent de la configuration.

OrcaRouter met plus de 200 modèles derrière un seul point d’accès compatible OpenAI au prix catalogue du fournisseur, avec 0 % de marge : ainsi, toute modification tarifaire d’un fournisseur est effective le jour même.