
MiMo-V2.6-Pro vs Grok 4.6 : les deux fournisseurs ont publié des chiffres DeepSWE, et aucun des deux ne figure au classement
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Deux fournisseurs, un seul benchmark, deux nombres qui ne peuvent pas être soustraits. La documentation de lancement de SpaceXAI pour Grok 4.6 rapporte 65,9 % sur DeepSWE v1.1. La documentation de Xiaomi pour MiMo-V2.6-Pro rapporte 72,57 sur DeepSWE v1.1. Lus ensemble, ils suggèrent que le modèle à poids ouverts moins cher dépasse le modèle propriétaire de pointe de près de sept points. Lus attentivement, ils ne disent presque rien, car l’un est un pourcentage de présentation de lancement obtenu sur le harnais de test propre au fournisseur et l’autre est une moyenne sur trois issue d’une exécution d’apprentissage par renforcement sur l’évaluateur propre à Xiaomi, et aucun des deux n’a été soumis au tableau public DeepSWE. La comparaison entre MiMo-V2.6-Pro et Grok 4.6 qui résiste à l’examen figure sur l’indice indépendant, et là, la réponse est l’inverse des chiffres des fournisseurs : 46 contre 44, en faveur de Xiaomi, soit deux points d’écart.
Grok 4.6 a été publié le 12 août 2026 par SpaceXAI et fait figure de titulaire ici — un modèle de pointe livré et largement déployé, doté d'une grille tarifaire documentée et de plusieurs mois de mesures indépendantes à son actif. Xiaomi MiMo-V2.6-Pro est devenu généralement disponible le 22 septembre 2026, ses dépôts de points de contrôle d'apprentissage par renforcement étant apparus la veille, et il est le nouveau venu. Tous deux sont capables de raisonnement, tous deux sont conçus pour un travail agentique de longue durée, et l'écart de prix entre eux est suffisamment important pour que la seule chose qui freine la comparaison soit l'inexpérience du nouveau venu.
Ce qu'est réellement chaque modèle
Grok 4.6 est propriétaire, accepte des entrées texte et image et renvoie du texte, et sa date de coupure des connaissances est le 1er février 2026. Sa fenêtre de contexte est de 500 000 tokens, soit la moitié de celle de ses principaux concurrents et la spécification la plus déterminante de sa fiche technique. Ses tarifs catalogue sont de 2,00 $ par million de tokens d'entrée, 0,50 $ par million de tokens d'entrée mis en cache et 6,00 $ par million de tokens de sortie en dessous de 200 000 tokens de prompt, avec un effet de falaise à ce seuil : à 200 K ou au-delà, les tarifs passent à 4,00 $, 1,00 $ et 12,00 $, et le palier supérieur facture l'intégralité de la requête plutôt que la partie dépassant le seuil. Le traitement prioritaire double le tarif standard. Artificial Analysis a mesuré 63,0 tokens de sortie par seconde et 42,79 secondes jusqu'au premier token en effort maximal, ainsi que 2 351,83 $ pour exécuter l'indice complet.
Xiaomi MiMo-V2.6-Pro est un modèle à mélange d’experts clairsemé comptant 1 020 milliards de paramètres au total et 42 milliards activés par token, avec une fenêtre de contexte de 1 million de tokens et une multimodalité native sur le texte, l’image, la vidéo et l’audio. Il est sous licence MIT avec des poids téléchargeables, et Xiaomi a conservé la tarification de la génération précédente plutôt que de revoir à la hausse le prix du nouveau checkpoint — 0,43 $ par million de tokens d’entrée et 0,87 $ par million de tokens de sortie, une remise de 99 % sur le cache, et un coût mixte de 0,18 $ pour une répartition 7:2:1 entre succès de cache/entrée/sortie. Artificial Analysis a mesuré 134,3 tokens de sortie par seconde, 2,15 secondes jusqu’au premier token et 206,66 $ pour exécuter l’indice — 0,13 $ par tâche.
• Poids — MiMo-V2.6-Pro sous licence MIT et téléchargeable ; Grok 4.6 propriétaire, API uniquement
• Paramètres — MiMo-V2.6-Pro 1,02 T au total / 42 B actifs ; Grok 4.6 non divulgué
• Contexte — MiMo-V2.6-Pro 1M tokens ; Grok 4.6 500K, avec une falaise tarifaire à 200K de tokens d'entrée
• Modalité — MiMo-V2.6-Pro prend en charge le texte, l'image, la vidéo et l'audio ; la surface d'entrée publiée de Grok 4.6 est le texte et l'image
• Score de l’indice — MiMo-V2.6-Pro 46 ; Grok 4.6 44, tous deux Artificial Analysis v4.3.2
• Prix catalogue — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million ; Grok 4.6 2,00 $ / 6,00 $, doublés au-delà de 200 K en entrée
• Tarif mixte — MiMo-V2.6-Pro 0,18 $ par million ; Grok 4.6 1,35 $
• Coût d’exécution de l’index — MiMo-V2.6-Pro 206,66 $ ; Grok 4.6 2 351,83 $
• Vitesse — MiMo-V2.6-Pro 134,3 jetons de sortie/seconde ; Grok 4.6 63,0
• Temps jusqu'au premier token — MiMo-V2.6-Pro 2,15 secondes ; Grok 4.6 42,79 secondes
• Date limite de connaissances — MiMo-V2.6-Pro non publié ; Grok 4.6 1er février 2026

Le benchmark exécuté par les deux fournisseurs, et pourquoi il n’est pas comparable
DeepSWE v1.1 est une évaluation d'agents de codage réelle, publique et tierce, menée par Datacurve, et c'est la seule famille de tâches sur laquelle les deux entreprises ont choisi de publier des résultats. Cela la rend tentante. Elle ne devrait pas être utilisée pour une comparaison directe, et la raison n'est pas que l'un ou l'autre fournisseur mente : c'est que les deux chiffres décrivent des mesures différentes d'un même nom de tâche.
Le 72,57 de Xiaomi est une moyenne sur trois exécutions sur son propre harnais avec mini-swe-agent, produite lors d'une exécution d'apprentissage par renforcement plutôt qu'à partir d'une version candidate figée, et rapportée aux côtés d'un chiffre de départ de 58,4. L'exécution est documentée comme comptant 30 étapes et environ 750 000 trajectoires par modèle, achevée en moins de six jours pour une dépense publiée d'environ 2,62 million de dollars pour le modèle Pro. Il n'a pas été soumis au classement de Datacurve. Les 65,9 % de SpaceXAI pour Grok 4.6 sont un chiffre de présentation de lancement issu du propre ensemble d'évaluation du fournisseur, rapporté à côté de gains de 11,9 points par rapport à Grok 4.5 sur le même benchmark — et le classement public comporte une configuration Grok 4.6 soumise à environ 67 %, ce qui est suffisamment proche du chiffre du fournisseur pour suggérer que le harnais est au moins à peu près aligné. Ce n'est pas le cas du chiffre de Xiaomi, qui n'a aucun équivalent public.
Donc, l’affirmation honnête est la suivante : sur le classement public, Grok 4.6 est présent et MiMo-V2.6-Pro est absent. Sur le composite indépendant, les deux ont en réalité été testés par le même évaluateur ; le modèle de Xiaomi devance de deux points. Ces deux faits ne sont pas en contradiction. Ils mesurent simplement des choses différentes, et c’est le second qu’il faut citer.
Le contexte de 500K est la spécification qui décide des charges de travail réelles
Un demi-million de tokens constitue une grande fenêtre de contexte selon n'importe quel standard normal, et une petite pour 2026. Les modèles auxquels MiMo-V2.6-Pro est associé affichent tous 1 M, et la conséquence pratique se manifeste précisément dans les charges de travail pour lesquelles Grok 4.6 est commercialisé. Un agent de codage de longue durée qui conserve un dépôt, une transcription d'outils et un plan accumulé franchira les 200 000 tokens de prompt au cours d'une session — et à ce seuil, les tarifs de Grok 4.6 doublent et s'appliquent rétroactivement à l'ensemble de la requête. La même session sur MiMo-V2.6-Pro atteint un million de tokens sans changement de palier.
C'est à la fois une différence de spécifications et une différence de structure tarifaire, et la seconde est facile à manquer lorsqu'on compare les tarifs affichés. Un tarif mixte de 1,35 $ pour Grok 4.6 contre 0,18 $ pour MiMo-V2.6-Pro représente un écart de 7,5x. Sur un prompt qui dépasse 200K, il s'élargit pour approcher 15x, car le tarif de Grok double et celui de Xiaomi ne bouge pas.
Le contre-argument figure lui aussi au dossier, et il mérite d’y figurer. La thèse de lancement de Grok 4.6 était l’efficacité en nombre de tours plutôt que le contexte brut : dans l’évaluation agentique où il a été mesuré face à Claude Opus 5 sur des tâches identiques, il a terminé en environ 53 tours et environ 500 millions de jetons d’entrée, contre environ 103 tours et deux milliards de jetons pour l’autre modèle, à un coût estimé de 0,84 $ par tâche — le chiffre le plus bas parmi les modèles de pointe de cette comparaison. Un modèle qui parcourt la boucle deux fois moins de fois n’a pas besoin d’autant de contexte, et il ne consomme pas autant de jetons. C’est un véritable avantage architectural, et c’est l’argument le plus fort en faveur de Grok 4.6 face à toute alternative moins chère au jeton, y compris celle-ci.

Se rendre à chacun d'entre eux
Grok 4.6 est disponible sur OrcaRouter sous le nom de grok/grok-4.6, accessible via un unique point de terminaison compatible OpenAI, au prix catalogue du fournisseur avec 0 % de marge — ainsi, tout changement de prix de SpaceXAI, y compris une modification de ce palier de 200K, est effectif de notre côté le jour même. Xiaomi MiMo-V2.6-Pro n'est pas disponible sur OrcaRouter. Aucun modèle Xiaomi ne l'est, et la voie d'accès aujourd'hui est la plateforme de Xiaomi elle-même ou l'un des catalogues tiers qui le référencent. Il est plus utile de le dire clairement que de laisser une page de modèle sous-entendre le contraire.
Ce que cette asymétrie vaut en pratique se mesure par une expérience peu coûteuse. Grok 4.6 est le modèle que vous payez peut-être déjà. MiMo-V2.6-Pro apporte une amélioration de deux points d’indice pour une fraction du tarif, lancé cette semaine, avec une seule route de service derrière lui. La question à laquelle il vaut la peine de répondre n’est pas de savoir lequel est meilleur dans l’abstrait, mais quelle part de votre trafic Grok le modèle de Xiaomi peut absorber sur vos propres prompts — et y répondre en ouvrant un second contrat, une seconde clé et une seconde relation de facturation constitue la friction qui empêche le test d’avoir lieu. Avec un seul point de terminaison et un basculement automatique entre fournisseurs, la comparaison se résume à un changement de configuration, et le volet basculement compte plus que d’habitude ici : un modèle lancé cette semaine et référencé par un seul fournisseur d’API au moment où Artificial Analysis l’a relevé n’est pas à mettre dans un chemin de production sans voie de repli.

Lequel choisir
Choisissez Grok 4.6 lorsque l'efficacité par tour est ce que vous optimisez — de longues boucles d'agents où la capacité du modèle à terminer en deux fois moins d'étapes vaut plus que son tarif par token — ou lorsque vous voulez un modèle avec des mois de mesures indépendantes derrière lui plutôt qu'une semaine. Ses 63 tokens par seconde et son temps jusqu'au premier token de 42,79 secondes en font, en termes interactifs, un modèle pour le traitement par lots et les charges de travail hors ligne, et sa fenêtre de contexte de 500K avec une falaise tarifaire à 200K incite à garder les prompts courts.
Choisissez MiMo-V2.6-Pro lorsque vous exécutez des boucles répétitives et gourmandes en contexte qui franchiraient le seuil des 200K de Grok, lorsque vous avez besoin d'une latence du premier token suffisamment faible pour qu'un humain accepte d'attendre, lorsque vous voulez les poids dans votre propre infrastructure, ou lorsque le volume fait de l'écart de tarif pondéré de 7,5x le chiffre décisif. Son avance de deux points sur l'indice est trop faible pour être à elle seule la raison ; le coût de 206,66 $ contre 2 351,83 $ pour exécuter la même suite d'évaluation en est une meilleure.
Ce qui trancherait la question ouverte, c’est une configuration DeepSWE soumise pour MiMo-V2.6-Pro. Grok 4.6 en a déjà une. Dès que le modèle de Xiaomi apparaît sur le tableau public avec un harnais déclaré, un intervalle de confiance et un coût par tâche, le 72,57 cesse d’être un chiffre de fournisseur et la comparaison ci-dessus devient une véritable comparaison — et vu l’écart de deux points sur l’indice, cela pourrait basculer dans un sens comme dans l’autre.
OrcaRouter met plus de 200 modèles derrière un seul point d’accès compatible OpenAI au prix catalogue du fournisseur, avec 0 % de marge : ainsi, toute modification tarifaire d’un fournisseur est effective le jour même.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
