
MiMo-V2.6-Pro vs GPT-5.6 Sol : un point d'indice coûte quinze fois plus cher par tâche
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 36 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 181 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Sur l’Artificial Analysis Intelligence Index v4.3.2, consulté le 25 septembre 2026, GPT-5.6 Sol en effort maximal obtient un score de 47 et le MiMo-V2.6-Pro de Xiaomi obtient 46. Un point. Le chiffre qui les sépare réellement n’est pas le score, et ce n’est pas non plus le tarif par token : c’est le coût d’une seule tâche de l’index, qu’Artificial Analysis publie à 1,99 $ pour GPT-5.6 Sol et à 0,13 $ pour MiMo-V2.6-Pro. Quinze fois plus d’argent pour un point. Et à la date de cette consultation, la page de l’évaluateur consacrée à ce modèle affiche un avis de dépréciation, car GPT-6 Sol l’a remplacé.
Xiaomi a publié les poids et le rapport technique de MiMo-V2.6-Pro le 21 septembre 2026, quatre jours avant cette lecture ; OpenAI a livré GPT-5.6 Sol le 9 juillet 2026. Ces deux faits sont nouveaux depuis la dernière rédaction de ce comparatif, et ils tirent dans des directions opposées. L'avis de dépréciation indique que la comparaison porte sur un modèle qu'OpenAI a déjà dépassé. Le chiffre par tâche indique que ce qui ressemblait à une erreur d'arrondi lorsque les deux modèles étaient annoncés au prix catalogue représente, sur une charge de travail réelle, toute la décision. Lequel des deux compte dépend de si vous achetez un modèle ou si vous en remplacez un.
Ce que disent maintenant les deux pages
GPT-5.6 Sol est sorti le 9 juillet 2026 en tant que modèle phare de la famille GPT-5.6. Son prix catalogue est de 4,00 $ par million de jetons d’entrée et de 20,00 $ par million de jetons de sortie sur l’API propriétaire d’OpenAI, avec une remise de 90 % sur le cache, et la page enregistre 90 millions de jetons de sortie générés sur l’ensemble de l’exécution de l’index, contre une médiane de 88 millions. Il a mesuré 73 jetons de sortie par seconde, ce que la même page qualifie de plus rapide que la moyenne, contre une médiane de 72 j/s. Son entrée d’index se situe au 19e rang sur 210 modèles de sa catégorie.
Xiaomi MiMo-V2.6-Pro est un point de contrôle à mélange d’experts clairsemé de 1,02 billion de paramètres au total et 42 milliards d’actifs, sous licence MIT, avec une fenêtre de contexte de 1 M de tokens et une entrée texte, image, parole et vidéo pour une sortie texte. Il est affiché à 0,43 $ et 0,87 $ par million de tokens avec une remise de cache de 99 % — un dixième du tarif d’entrée de Sol et un vingt-troisième de son tarif de sortie. Il a généré 140 millions de tokens de sortie lors de l’exécution de l’index, et il a mesuré 43,6 tokens de sortie par seconde, ce que sa page décrit comme particulièrement lent par rapport à une médiane de 67,1 t/s.
• Coût de la tâche d'index — MiMo-V2.6-Pro 0,13 $ ; GPT-5.6 Sol 1,99 $ — l'écart est de 15× • Prix catalogue — MiMo-V2.6-Pro 0,43 $ / 0,87 $ par 1 M ; GPT-5.6 Sol 4,00 $ / 20,00 $ • Remise sur le cache — MiMo-V2.6-Pro 99 % ; GPT-5.6 Sol 90 % • Tokens de sortie lors de l'exécution d'index — MiMo-V2.6-Pro 140 M ; GPT-5.6 Sol 90 M • Vitesse de sortie — MiMo-V2.6-Pro 43,6 t/s, contre une médiane de 67,1 ; GPT-5.6 Sol 73 t/s, contre une médiane de 72 • Contexte et poids — MiMo-V2.6-Pro 1 M et sous licence MIT ; GPT-5.6 Sol 1 M et propriétaire

L’avis de dépréciation est la ligne la plus lourde de conséquences.
Artificial Analysis ouvre désormais la page GPT-5.6 Sol avec un encadré : « Ce modèle est obsolète. Nous poursuivons uniquement le benchmarking des performances pour la charge de travail par défaut de 10k jetons d’entrée », suivi de la phrase indiquant qu’OpenAI a lancé un modèle plus récent, GPT-6 Sol (max), et qu’il convient de le considérer à la place. Le 47 de l’indice est donc une mesure d’un modèle qui n’est plus ce qu’il faut acheter. Cela ne rend pas la mesure erronée — elle a été mesurée sur le même indice, le même jour, avec le même réglage d’effort que le 46 — mais cela change ce à quoi sert la comparaison. Il ne s’agit plus de « quel modèle phare dois-je utiliser ». Il s’agit de « combien coûte le sommet du classement des modèles propriétaires, au moment où il était au sommet ».
Ce recadrage compte plus qu’il n’y paraît, car les avis de dépréciation sur les pages d’évaluation sont l’un des rares endroits où le rythme de sortie des produits d’un fournisseur se manifeste sous forme de changement de données plutôt que de communiqué de presse. Le score est figé ; le modèle n’est pas proposé. Tout ce que vous construisez par rapport au 47 repose sur un instantané.

Pourquoi le nombre par tâche est celui par rapport auquel il faut modéliser
Les tarifs par token flattent les modèles bon marché et induisent en erreur sur les charges de travail qui ne sont pas neutres en tokens. Le coût par tâche de l’indice est une mesure différente : c’est ce que l’évaluateur a réellement dépensé pour obtenir une réponse de chaque modèle, ce qui intègre à la fois le tarif et le nombre de tokens que le modèle a choisi d’émettre. MiMo-V2.6-Pro émet plus de tokens que Sol lors de l’exécution de l’indice — 140 millions contre 90 millions, environ 1,6 fois plus — et coûte toujours 0,13 $ par tâche contre 1,99 $. L’avantage de tarif est d’environ vingt-trois fois sur la sortie ; la pénalité de verbosité est de 1,6 × ; le produit est l’écart par tâche de quinze fois.
C’est l’arithmétique sur laquelle un modèle de coûts devrait être bâti, et c’est l’arithmétique qui est invisible si vous comparez 0,87 $ à 20,00 $ et vous arrêtez là. Elle vous dit aussi ce qui invaliderait la conclusion. Si votre charge de travail est dominée par des sorties très courtes, le nombre de tokens de Sol s’effondre vers le vôtre et l’écart de tarif de vingt-trois fois fait l’essentiel du travail, si bien que le multiple réel se rapproche de l’écart de tarif plutôt que de s’en éloigner. Si votre charge de travail est dominée par de longues traces de raisonnement, la verbosité de 1,6× de MiMo-V2.6-Pro se cumule et 0,13 $ devient le plafond plutôt que l’estimation. Le chiffre publié est une mesure de la forme d’un benchmark, pas un devis que vous pouvez transmettre aux finances.
La ligne de latence est le contrepoids honnête.
À 43,6 jetons de sortie par seconde, MiMo-V2.6-Pro est plus lent que GPT-5.6 Sol mesuré le même jour à 73 — et plus lent que les modèles auxquels sa propre page le compare, dont la médiane est de 67,1. Sa page le dit sans détour : « nettement lent ». Pour un pipeline par lots, c’est un coût de débit que vous pouvez chiffrer. Pour un agent interactif, c’est une décision produit, et être quinze fois moins cher par tâche ne rend pas un modèle lent rapide. Si votre contrainte est un budget par tour plutôt qu’une facture mensuelle, le ratio qui compte est 43,6 contre 73, et MiMo-V2.6-Pro le perd.
Où cela aboutit sur un routeur
L'intérêt de ce duo ne réside pas dans le fait de « choisir l'un ou l'autre ». Il réside dans le fait que les deux modèles répondent au même index et que l'évaluateur publie un coût par tâche pour chacun, de sorte que la répartition peut se faire sur la base du coût mesuré plutôt que des paliers du fournisseur. Sur OrcaRouter, le catalogue compte plus de 200 modèles accessibles derrière une seule clé, au prix catalogue de chaque fournisseur, avec 0 % de marge — une baisse de prix d'un fournisseur se répercute sur votre facture le jour même, sans second contrat à renégocier — et le DSL de routage permet à une charge de travail d'envoyer les appels bon marché et volumineux vers un modèle et les plus difficiles vers un autre, par tâche plutôt que par marque. Le basculement automatique couvre le cas où la route la moins chère est dégradée. Xiaomi MiMo-V2.6-Pro ne figure pas sur nos routes — nous ne référençons pas un modèle avant que le fournisseur ne l'ait intégré — donc pour ce volet de la comparaison, la réponse honnête est l'API du fournisseur lui-même ou la plateforme hébergée avec laquelle vous avez déjà une relation.

Que faire de cela d’ici la semaine prochaine ?
Deux choses ont changé le 25 septembre 2026, et une seule concerne le prix. GPT-5.6 Sol porte un avis de dépréciation sur l’indice où il a été mesuré à 47, ce qui le disqualifie comme choix d’achat et le laisse comme référence de benchmark. MiMo-V2.6-Pro est mesuré à 0,13 $ par tâche d’indice contre 1,99 $ pour Sol, soit quinze fois le prix pour un point d’indice — et il tourne à 43,6 jetons par seconde, ce qui est plus lent que le modèle auquel il est comparé et plus lent que la médiane de sa propre catégorie. Confrontez les deux chiffres à votre propre trafic avant que l’un ou l’autre ne devienne une décision : le coût par tâche est une mesure, pas un tarif, et la latence est une mesure, pas une opinion. Si vos sorties sont courtes et non interactives, l’argument en faveur du checkpoint ouvert est plus fort que ne le suggère l’écart d’indice. Si vos sorties sont longues ou que vos utilisateurs attendent, l’économie de quinze fois vous achète un produit plus lent, et c’est un arbitrage que seule votre charge de travail peut chiffrer.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
