Une carte de titre générée affichant MiMo-V2.6-Pro vs Grok 4.7, avec le sous-titre 29 fois moins cher par tâche, et plus lent des deux côtés en dessous, ainsi que trois icônes linéaires plates au-dessus du titre suggérant des piles de pièces comparées, un cadran de vitesse et un cadenas ouvert. Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Xiaomi MiMo-V2.6-Pro vs Grok 4.7 : 30× moins cher par tâche, et aucun des deux n'est rapide

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Xiaomi MiMo-V2.6-Pro et Grok 4.7 sont tous deux sortis le 21 septembre 2026, tous deux obtiennent 46 sur l’Artificial Analysis Intelligence Index v4.3.2, et tous deux sont qualifiés de lents par la page qui les a mesurés — 43,6 jetons de sortie par seconde pour MiMo-V2.6-Pro contre une médiane de 67,1, 40 pour Grok 4.7 à un effort xhigh. Ce qui les distingue, c’est ce que coûte une réponse. Le chiffre par tâche de l’évaluateur est de 0,13 $ pour le checkpoint ouvert chinois et de 3,74 $ pour le modèle Grok 4.7, soit un facteur d’environ 29. Il ne s’agit pas d’une différence de tarif, ou pas seulement : le tarif de sortie de Grok 4.7 est de 6,00 $ par million de jetons contre 0,87 $, soit un facteur sept, et le reste du multiple vient du nombre de jetons que chaque modèle consomme pour arriver à une réponse.

Deux modèles le même mois, sur le même indice, au même score, avec un prix comme s’ils appartenaient à des décennies différentes du marché. La question intéressante n’est pas de savoir lequel gagne. C’est de savoir quelle partie de ce 29× vous pouvez réellement contourner — car dans ce duo, exactement l’un des deux est une voie que vous pouvez acheter aujourd’hui, et c’est celui qui est cher.

Même jour, même score, animaux différents

Grok 4.7 est sorti le 21 septembre 2026 à 2,00 $ par million de jetons d’entrée et 6,00 $ par million de jetons de sortie, avec une fenêtre de contexte de 500 000 jetons, une date limite de connaissances de mai 2026, une remise de 75 % sur le cache, et une entrée texte et image pour une sortie texte. Il a obtenu 46 sur l’indice avec un effort xhigh, 56 sur le Coding Agent Index dans le harnais Grok Build, et 1 657 Elo sur AA-Briefcase — quatrième de ce classement, derrière trois entrées d’Anthropic, pour environ la moitié du coût par tâche de Claude Opus 5.

Xiaomi MiMo-V2.6-Pro est un checkpoint à mélange d’experts à grande échelle, comptant 1 milliard de paramètres au total dont 42 milliards actifs, sous licence MIT, avec un contexte d’un million de jetons, une prise en charge en entrée d’images, de parole et de vidéo, à 0,43 $ et 0,87 $ par million de jetons, avec une remise de 99 % sur le cache qui fait chuter le tarif effectif des entrées à quasiment rien sur un prompt chaud. Artificial Analysis le classe premier sur 114 modèles à poids ouverts au classement de l’indice et douzième sur 114 en termes de coût. Il est accessible via trois fournisseurs d’API. Il ne figure pas sur nos routes, et nous ne référençons pas un modèle avant qu’un fournisseur ne l’ait intégré.

La seule ligne qui en décide

• Coût par tâche d'indexation — MiMo-V2.6-Pro 0,13 $ ; Grok 4.7 3,74 $ — 29× • Tarif de sortie — MiMo-V2.6-Pro 0,87 $ / 1M ; Grok 4.7 6,00 $ / 1M — 6× • Tokens de sortie sur l'exécution d'index — MiMo-V2.6-Pro 140M ; Grok 4.7 240M, contre une médiane de 88M • Vitesse de sortie — MiMo-V2.6-Pro 43,6 t/s ; Grok 4.7 40 t/s — toutes deux inférieures à la médiane • Poids — MiMo-V2.6-Pro sous licence MIT et Grok 4.7, API uniquement

Lisez les deux premières puces ensemble, et la forme de l’écart devient évidente. Au prix catalogue, les deux sont séparés d’un facteur 6,9 en sortie. Sur l’exécution de l’indice, ils sont séparés d’un facteur 29 sur ce que coûte une réponse. Le facteur multiplicateur entre les deux est la verbosité : Grok 4.7 a généré 240 millions de jetons de sortie contre une médiane de 88 millions pour sa catégorie, et MiMo-V2.6-Pro en a généré 140 millions. Cela représente une pénalité de 1,71× en jetons qui s’ajoute à la pénalité de 6,9× sur le tarif, et 1,71 × 6,9 = 11,8 — le reste de la distance jusqu’à 29 vient du côté entrée, où la remise de 99 % sur le cache et le tarif d’entrée de 0,43 $ de MiMo-V2.6-Pro font le gros du travail sur une charge de travail comportant un quelconque préfixe répété.

A two-column scoreboard titled MiMo-V2.6-Pro vs Grok 4.7 - the scoreboard, subtitled Same index score, same month, 29x apart per task. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; cost per index task $0.13; list price $0.43 / $0.87 per 1M; output speed 43.6 tokens per second; 140M output tokens on the index run; 1M context; weights downloadable, and carries a tag reading Open weights - MIT. The right column, Grok 4.7 (xhigh), reads Intelligence Index v4.3.2 46; cost per index task $3.74; list price $2.00 / $6.00 per 1M; output speed 40 tokens per second; 240M output tokens; 500K context; weights not released, and carries a tag reading Proprietary - API only. A footer line reads that index scores, per-task cost, speed and token counts are per Artificial Analysis Intelligence Index v4.3.2, read 25 September 2026, and that both models shipped 21 September 2026. The OrcaRouter logo is composited in the bottom-right corner.

La verbosité est le nombre que les gens laissent de côté dans l'estimation

Les modèles de coûts sont généralement construits à partir d'une grille tarifaire et d'un nombre de tokens supposé. Ces deux éléments sont erronés ici. La grille tarifaire est erronée parce que la remise liée au cache n'est pas une note de bas de page — 99 % contre 75 %, c'est la différence entre une invite système qui vous coûte de l'argent à chaque appel et une qui ne vous coûte presque rien. Le nombre de tokens est erroné parce que les deux modèles n'émettent pas le même nombre de tokens pour le même travail, et l'évaluateur a mesuré la différence : 240 millions contre 140 millions, soit un écart de 1,71× sur un benchmark identique.

Ni l’un ni l’autre n’est un indicateur que l’on peut relever sur une fiche technique. Le rang de verbosité de Grok 4.7 est le n°94 sur 210 modèles de sa catégorie ; le rang de coût de MiMo-V2.6-Pro est le n°12 sur 114 dans la sienne. Une équipe qui cite la grille tarifaire de Grok 4.7 et suppose une charge de travail neutre en tokens prévoira environ un quart de ce que l’indice a réellement dépensé par tâche. La correction ne consiste pas non plus à utiliser le coût de l’indice comme estimation — celui-ci mesure la forme d’un seul benchmark. Elle consiste à mesurer vos propres nombres de tokens des deux côtés avant de vous engager, car l’écart entre les deux modèles est de 6,9× sur le papier et de 29× en pratique, et un seul de ces chiffres est réel pour votre trafic.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 25 September 2026. The header shows Intelligence rank 21 of 210, Speed 159 of 210, Cost 210 of 210, Verbosity 94 of 210, 46 on the Artificial Analysis Intelligence Index, $2.00 input and $6.00 output per 1M tokens with a 75% cache discount, $3.74 per task to evaluate on the Intelligence Index, and 500K context; the summary paragraph calls the model notably slow and very verbose, and the verbosity line shows 240M output tokens generated on the index run against a median of 88M.

Les deux sont lents, et ce n'est pas une égalité.

Artificial Analysis a mesuré Grok 4.7 à 40 jetons de sortie par seconde et le qualifie de « parmi les plus lents » ; MiMo-V2.6-Pro à 43,6, et le qualifie de « notablement lent ». Ces deux relevés sont assez proches pour que la vitesse ne soit pas le critère décisif entre eux. Mais les médianes sous-jacentes, elles, ne le sont pas : 67,1 pour la catégorie des modèles à poids ouverts à laquelle appartient MiMo-V2.6-Pro. Les deux modèles sont bien en deçà, et MiMo-V2.6-Pro présente en outre un temps jusqu’au premier jeton de 3,17 secondes, contre une médiane de 2,31 secondes, le chiffre qui fait mal dans une boucle interactive plutôt qu’en traitement par lots.

Donc, pour résumer honnêtement le volet latence : être 29× moins cher ne vous achète pas un produit plus rapide, cela vous achète un produit plus lent qui coûte moins — et si vos utilisateurs regardent un curseur, l’attente de 3,17 secondes peut coûter plus que les jetons économisés. Pour le travail par lots pendant la nuit, l’évaluation hors ligne, ou tout pipeline où l’horloge se mesure en heures, le compromis est simple et le 29× est presque gratuit.

Ce qu’un routeur peut et ne peut pas faire avec cet appairage

C'est l'appariement où notre propre catalogue est véritablement à sens unique, et il vaut la peine d'être clair à ce sujet. Grok 4.7 est en ligne sur OrcaRouter en tant que grok/grok-4.7 au tarif propre du fournisseur de 2,00 $ / 6,00 $, avec une sortie maximale de 450K et un point de terminaison compatible avec l'OpenAI-SDK à https://api.orcarouter.ai/v1 — donc si la comparaison vous donne envie du modèle xAI derrière la même clé que tout le reste, cette route existe dès aujourd'hui. Xiaomi MiMo-V2.6-Pro ne figure pas sur nos routes ; pour ce côté-là, l'API du fournisseur lui-même ou l'un de ses trois fournisseurs listés que vous utilisez déjà est la réponse, et nous ne prétendrons pas le contraire.

Là où un routeur mérite sa place dans une comparaison comme celle-ci, c'est sur les aspects qui ne relèvent pas du modèle. Une seule clé pour 200+ modèles au prix catalogue de chaque fournisseur avec 0 % de marge signifie qu'une baisse de prix d'un fournisseur se répercute sur votre facture le jour même plutôt qu'au prochain renouvellement de contrat. Le basculement automatique signifie que la dégradation d'une route à 40 t/s n'emporte pas votre pipeline avec elle. Le DSL de routage permet de faire la répartition sur le coût publié par tâche plutôt que sur la fidélité à une marque — un modèle bon marché pour les gros volumes, un modèle puissant pour les appels difficiles, décidé à chaque requête. Et pour les charges de travail où aucun des deux modèles ne convient tout à fait, la fusion de modèles peut en exécuter plusieurs derrière un seul appel.

Screenshot of the OrcaRouter model page for Grok 4.7, captured 25 September 2026. The page shows the model id grok/grok-4.7, a maximum output of 450K, output text, public benchmarks by grok dated 2026-09-21, a price of $2.00 per 1M input and $6.00 per 1M output, and an OpenAI-SDK-compatible code sample whose base URL is https://api.orcarouter.ai/v1 and whose model field is grok/grok-4.7.

Questions que cette comparaison soulève habituellement

Le 29× tient-il pour ma charge de travail ? Uniquement si votre mélange de tokens ressemble à celui du run d’index. Si vos sorties sont courtes et vos prompts longs et mis en cache, le multiple se réduit vers l’écart de tarif de 6,9× en sortie et s’élargit en entrée, où la remise de 99 % de MiMo-V2.6-Pro est le terme décisif. Si vos sorties sont de longues traces de raisonnement, il s’élargit au-delà de 29×, car la pénalité de verbosité de Grok 4.7 est proportionnelle à la longueur des sorties.

Le 46 de chaque côté est-il le même 46 ? Il s'agit du même indice, de la même version et de la même échelle — les sous-scores sous-jacents étaient de 46,32 et 46,45, soit un écart de 0,13 point, et l'indice arrondit les deux à 46. Artificial Analysis ne publie pas de ventilation par évaluation pour aucun des deux modèles, donc le composite est le niveau de détail le plus fin disponible et une différence de 0,13 point ne doit pas être interprétée comme un classement des capacités.

Lequel choisir par défaut pour un nouveau projet ? Si la charge de travail est par lots, tolérante à la latence et sensible aux coûts, MiMo-V2.6-Pro à 0,13 $ par tâche est le choix par défaut, et les poids ouverts signifient que vous n’êtes pas exposé à la tarification d’un seul fournisseur. Si vous avez spécifiquement besoin du modèle xAI — les résultats du harness Grok Build, le placement dans AA-Briefcase, le contexte de 500 K avec une date limite de mai 2026 —, Grok 4.7 est une route active sur OrcaRouter aujourd’hui et le surcoût par tâche est le prix de cette capacité précise. Aucun modèle ici ne l’emporte sur les deux tableaux.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement