
Claude Haiku 5.5 vs Xiaomi MiMo-V2.6-Flash : quand la grille tarifaire et la facture mesurée ne concordent pas
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
En prenant les deux grilles tarifaires au pied de la lettre, Claude Haiku 5.5 face à Xiaomi MiMo-V2.6-Flash ressemble à une victoire écrasante du modèle Xiaomi : 0,14 $ et 0,28 $ par million de tokens contre 0,10 $ et 0,50 $, un avantage de 1,8x sur la sortie à tarif fixe plutôt qu'à un tarif qui augmente au-delà de 100 000 tokens. Puis regardez ce que coûtent réellement les exécutions de tâches indépendantes, et le classement s'inverse — MiMo-V2.6-Flash revient à 0,06231 $ pour terminer une tâche que le Haiku termine pour 0,2128 $, et pourtant le Haiku obtient un score supérieur de quinze pour cent sur le même classement et termine la tâche en un tiers du temps d'horloge. Aucune de ces quatre affirmations n'est fausse ; elles mesurent des choses différentes. Cet article porte sur celle qui prédit votre facture, et sur le moment où chacune cesse d'être utile.
Les deux grilles tarifaires
Commencez par les chiffres que chaque fournisseur publie, car ce sont ceux qui sont comparés et, pour la plupart, ce ne sont pas ceux qui comptent :
• Prix — Claude Haiku 5.5 0,10 $ / 0,50 $ par million en dessous de 100K tokens, 0,50 $ / 2,50 $ au-dessus (liste A{{1}}nthropic) ; X{{1}}iaomi MiMo-V2.6-Flash 0,14 $ / 0,28 $ forfaitaire (liste du fournisseur)
• Fenêtre de contexte — 1 000 000 de jetons pour Claude Haiku 5.5, 1 000 000 pour MiMo-V2.6-Flash, tous deux publiés par le fournisseur
• Sortie maximale — 128 000 tokens sur le Haiku (300 000 sur Batch) ; non annoncée comme un plafond distinct pour MiMo-V2.6-Flash
• Architecture — non divulguée pour le Haiku ; 309 B de paramètres au total dont 15 B actifs, Mixture-of-Experts, pour MiMo-V2.6-Flash (publié par le fournisseur)
• Licence — propriétaire et accessible uniquement via API pour le Haiku ; MIT pour MiMo-V2.6-Flash (publiée par le fournisseur)
• Indice indépendant — 43,395 pour Claude Haiku 5.5 contre 37,884 pour MiMo-V2.6-Flash (Artificial Analysis)
Trois de ces lignes déterminent la plupart des achats réels, et elles pointent dans trois directions différentes. Sur le prix de sortie, le modèle Xiaomi est moins cher — 0,28 $ contre 0,50 $ en contexte court. Sur le prix d'entrée, le Haiku est moins cher en dessous de 100 000 tokens et bien plus cher au-dessus. Sur la fenêtre de contexte, le modèle Xiaomi revendique deux fois plus de place. Un seul de ces trois — le dernier — est même une affirmation de capacité, et le palier à tarif fixe du Haiku à 100 000 tokens signifie que la comparaison des prix comporte une discontinuité qu'une seule paire de chiffres masque.

Le projet de loi mesuré
Les grilles tarifaires fixent le prix des tokens. Le travail coûte de l’argent. Artificial Analysis fait passer les deux modèles par la même suite de tâches et publie ce que chaque tâche a réellement coûté à réaliser, une grandeur différente du prix par token et souvent un classement différent :
• Coût par tâche — MiMo-V2.6-Flash 0,06231 $ vs Claude Haiku 5.5 0,2128 $
• Jetons de sortie par tâche — MiMo-V2.6-Flash 77 792 vs Claude Haiku 5.5 162 164
• Temps réel par tâche — MiMo-V2.6-Flash 1 320,08 s vs Claude Haiku 5.5 426,26 s
• Indice d'intelligence — Claude Haiku 5.5 43,395 vs MiMo-V2.6-Flash 37,884
• Terminal-Bench Hard — Claude Haiku 5.5 0,329 vs MiMo-V2.6-Flash 0,227
Les cinq chiffres proviennent d'Artificial Analysis, extraits des propres pages de modèles du classement au début du mois d'octobre 2026, et ce sont les chiffres à utiliser lorsqu'une décision doit survivre à la vérification de quelqu'un.
L'écart de coût par tâche est plus important que ne le suggère la grille tarifaire, et la raison en est la deuxième ligne. Claude Haiku 5.5 dépense 162 164 jetons de sortie pour accomplir une tâche que MiMo-V2.6-Flash termine en 77 792 — soit environ 2,1 fois plus de jetons, en grande partie parce qu'il raisonne longuement par défaut. Un modèle qui est 1,8 fois moins cher par jeton de sortie et qui en émet moins de la moitié par tâche ne finit pas 1,8 fois moins cher ; il finit presque un ordre de grandeur moins cher sur cette suite particulière. C'est la chose la plus importante de cette page, et aucune grille tarifaire, où que ce soit, ne la publie.
La courbe du temps réel va dans l'autre sens, et il vaut mieux être honnête à ce sujet. MiMo-V2.6-Flash a mis 1 320 secondes par tâche, contre 426 pour le Haiku — trois fois plus longtemps, malgré une vitesse de sortie mesurée plus élevée de 56,69 tokens par seconde, car le raisonnement du Haiku n'est pas le goulot d'étranglement sur cette suite comme le débit brut de tokens le laisserait prévoir. Si une charge de travail est limitée par la latence plutôt que par le coût, le modèle bon marché n'est pas automatiquement le bon, et le classement indépendant est le seul endroit où ces deux chiffres existent.

Où se trouvent réellement les quinze points
43,395 contre 37,884 représente un écart de quinze pour cent sur l'Intelligence Index, et c'est l'argument le plus fort en faveur du Haiku dans cette confrontation. Son importance dépend entièrement de la tâche. Sur Terminal-Bench Hard, les deux sont à 0,329 et 0,227 — un écart relatif plus large, et qui se situe du côté agentique et multi-étapes du tableau, où un écart de quinze pour cent sur l'indice tend à se transformer en une différence bien plus grande dans la réalisation des tâches. Sur les sous-benchmarks de raisonnement général et de connaissances, les deux sont plus proches que ne le laisse entendre l'indice principal, et MiMo-V2.6-Flash est en tête sur plusieurs d'entre eux.
La lecture pratique : au bas de la courbe de difficulté, les deux modèles sont interchangeables et la différence de coût devrait décider. Au sommet — agents à long horizon, bases de code, tout ce où une tâche échouée doit être relancée — les quinze points de Haiku font la différence entre une tâche qui se termine et une tâche qui coûte deux fois la même somme, et l’avantage de coût par tâche du modèle bon marché peut s’inverser d’une manière que la moyenne du classement ne peut pas vous montrer. C’est le cas où vous devez lancer votre propre évaluation plutôt que lire l’indice de quelqu’un d’autre, car aucune moyenne publiée ne le résout.
Ce que vaut la licence MIT
MiMo-V2.6-Flash est distribué sous licence MIT — la moins restrictive des licences ouvertes, sans plafond d'utilisation commerciale ni clause de partage à l'identique. C'est une concession plus large que la licence communautaire Qwen, et cela signifie que les poids MoE 309B/15B peuvent être auto-hébergés, affinés et redistribués par quiconque le souhaite. Pour une équipe dont la contrainte est que l'inférence s'exécute sur son propre matériel, ou dont le volume est assez élevé pour que posséder des GPU soit plus avantageux que louer des jetons, ce n'est pas une note de bas de page — c'est la seule ligne de la comparaison qui compte, car Claude Haiku 5.5 ne peut pas être exécuté par vous, tout simplement.
Cela change aussi le profil de défaillance. Un modèle fermé servi par un seul fournisseur et les partenaires cloud de ce fournisseur tombe en panne lorsque ceux-ci tombent ; un modèle sous licence MIT avec plusieurs hébergeurs indépendants peut être basculé de l'un à l'autre, à condition que quelque chose effectue ce basculement. Aucun des deux n'est une raison de choisir MiMo-V2.6-Flash pour une équipe qui veut une API et rien d'autre. Les deux sont décisifs pour une équipe qui n'est pas dans ce cas.
Affirmations de fournisseurs à vérifier vous-même
La gamme MiMo est celle de Xiaomi, et Xiaomi rapporte ses propres chiffres de vitesse et de qualité dans les documents de lancement. Ce sont des chiffres de fournisseur, non reproduits au moment de la rédaction, et le classement indépendant mesure actuellement le modèle en dessous de là où la présentation du fournisseur le situerait — 37,884 sur l'indice, et 0,227 sur Terminal-Bench Hard contre 0,329 pour le Haiku. Ce n'est en rien une accusation ; c'est l'écart normal entre le banc d'essai d'un fournisseur et celui d'un tiers, et c'est la raison pour laquelle il faut préciser lequel est lequel chaque fois qu'un chiffre est répété.
Le contrôle qui vaut la peine d’être fait sur votre propre trafic coûte un après-midi et tranche la question mieux que n’importe quel indice. Faites passer les mêmes vingt tâches dans les deux modèles avec vos propres prompts, consignez les tokens d’entrée, les tokens de sortie et le temps réel par tâche pour chacun, puis multipliez par les tarifs ci-dessus. Les quatre chiffres qui tranchent sont tous des choses que vous pouvez mesurer : les tokens en entrée, les tokens en sortie, les secondes, et la réussite ou non de la tâche. Le chiffre de coût par tâche du tableau indépendant correspond à une suite générique ; le vôtre différera, et l’écart entre les deux tient généralement à la verbosité, ce que la grille tarifaire masque précisément. Si le raisonnement par défaut de Haiku vous achète des tâches menées à bien que vous devriez sinon payer pour réessayer, il est bon marché à 3,4 fois le prix par tâche. Sinon, vous payez pour des tokens qui n’ont pas changé la réponse.
Obtenir les deux via un seul endpoint
Ni Claude Haiku 5.5 ni Xiaomi MiMo-V2.6-Flash ne sont servis par OrcaRouter — pour ceux-là, il faut passer par l’API du fournisseur lui-même et par plusieurs plateformes tierces. Ce que nous faisons tourner, c’est la distribution d’accompagnement : qwen/qwen3.8-flash à 0,15 $ et 0,47 $ par million et z-ai/glm-5.3-flash à 0,15 $ et 0,50 $, tous deux au prix catalogue du fournisseur, sur la même clé et la même facture qu’un catalogue de plus de 200 modèles avec une tarification sans majoration et un basculement automatique.
Ce point compte pour ce comparatif d’une manière bien précise : lorsque les deux modèles entre lesquels vous choisissez sont ceux que vous ne pouvez pas router, le départage se fait généralement en les exécutant côte à côte sur du trafic réel — ce qui suppose de les garder disponibles aux côtés des modèles que vous routez, sans qu’il faille un second contrat ni un second SDK pour l’un ou l’autre. Mettez le candidat sur le chemin de production avec un modèle opérationnel derrière lui comme solution de repli, laissez la requête aller vers celui que choisit la couche de routage, et laissez vos propres journaux de tokens produire le coût par tâche que les grilles tarifaires ont refusé de vous donner. La suite du comité indépendant est un proxy ; votre charge de travail est la mesure.

L'appel
Si la charge de travail se caractérise par un volume élevé, des sorties courtes et une tolérance aux tentatives occasionnelles, Xiaomi MiMo-V2.6-Flash est le modèle le moins cher, avec un écart plus large que ne l’annonce sa grille tarifaire — 0,06231 $ par tâche contre 0,2128 $ — et la licence MIT vous offre une porte de sortie que le Haiku n’a pas. Si la charge de travail est à long horizon et agentique, les quinze points d’indice de Claude Haiku 5.5 et son exécution des tâches trois fois plus rapide justifient ce multiple, et l’écart de coût se réduit ou s’inverse une fois les réessais pris en compte.
La seule chose à ne pas faire est de choisir sur la seule base de la grille tarifaire. Deux modèles ici ont des prix par token qui diffèrent d’au plus un facteur deux, mais aboutissent à un écart d’un ordre de grandeur par tâche terminée, et un seul de ces chiffres figure sur la page que le fournisseur vous montre.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
