Carte héro du radar de modèles OrcaRouter intitulée « MiMo-V2.6-Flash vs Qwen 3.8 », sous-titrée « Un téléchargement contre un compteur, et un seul côté dispose d'un score tiers », avec un panneau de gauche pour MiMo-V2.6-Flash indiquant 309B au total / 15B actifs, licence MIT, sans restriction d'accès et aucun score indépendant, un panneau de droite pour Qwen3.8-Max indiquant 2,4T au total / 95B actifs, 2,00 $ en entrée / 6,00 $ en sortie par 1 M et AA Index 45, échelle actuelle, et trois badges en dessous indiquant Flash : publié le 21 sept. 2026, Qwen : facturé au compteur depuis le 3 août 2026 et Acheminable : Qwen3.8-Max uniquement.
Guides & Insights

MiMo-V2.6-Flash vs Qwen3.8-Max : un téléchargement contre un compteur, et un seul des deux a un score

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un seul chiffre décide de la manière dont cette comparaison est habituellement rédigée, et ce n'est pas un benchmark. Qwen3.8-Max est un modèle hébergé qu'Artificial Analysis mesure en continu, de sorte qu'il affiche un indice d'intelligence actuel de 45 sur l'échelle recalibrée v4.3, une vitesse de sortie de 39,2 jetons par seconde, et un prix catalogue de 2,00 $ par million de jetons d'entrée et de 6,00 $ par million de jetons de sortie. MiMo-V2.6-Flash, que Xiaomi a publié sous forme de poids téléchargeables le 21 septembre 2026, ne présente rien de tout cela : pas de grille tarifaire de fournisseur, pas d'identifiant de modèle annoncé par Xiaomi, et aucune page Artificial Analysis du tout. Tout ce qui a été publié sur les capacités de MiMo-V2.6-Flash provient des propres tableaux d'évaluation de Xiaomi dans sa fiche de modèle. Pas un seul chiffre n'a été revérifié par quelqu'un qui ne travaille pas pour Xiaomi.

Cette asymétrie n’est pas un point négatif à l’égard du modèle. C’est un fait concernant le type d’achat que représente chacun, et cela change ce que vous pouvez réellement conclure d’une comparaison directe. Le reste de cet article porte sur les trois choses que vous pouvez véritablement comparer — la forme de l’allégation, le coût d’un jeton et la licence — ainsi que sur un chiffre qui est réel, mesuré indépendamment et n’appartient à aucun des deux modèles mentionnés en titre.

D'abord, quel Qwen 3.8, et quel MiMo

Les deux noms de ce titre sont des familles qui se font passer pour des points de contrôle, et ces substitutions ne sont pas anodines.

• Qwen3.8-Max — le produit phare hébergé d'Alibaba, dévoilé le 3 août 2026. Un modèle à mélange d'experts creux de 2,4 billions de paramètres, avec environ 95 milliards de paramètres actifs par jeton, un contexte de 1 M de jetons et une entrée texte, image et vidéo. C'est le modèle que le reste de cet article considère comme l'adversaire.

• Qwen3.8-Max (0902) — l’instantané daté du 2 septembre du même modèle, proposé comme entrée à part entière avec la même tarification de 2,00 $ et 6,00 $ et un plafond de sortie de 131 072 jetons. La page actuelle d’Artificial Analysis concerne cette version, ce qui importe lorsque vous citez un score d’indice.

• Qwen3.8-2.4T-A95B — le point de contrôle à poids ouverts du même cœur, téléchargeable depuis le 12 août 2026 sous la licence Qwen3.8-Max. Il est uniquement textuel, la réflexion est toujours activée, et son contexte natif est de 262 K plutôt qu’un million. Ce n’est pas le modèle dont il est question dans le titre.

• MiMo-V2.6-Flash — checkpoint à mélange d’experts clairsemé de Xiaomi, totalisant 309 B et 15 B actifs, sans restriction d’accès sur Hugging Face sous licence MIT, nativement omnimodal, avec une fenêtre de contexte revendiquée de 1 M de tokens. C’est le modèle axé sur l’efficacité d’une version à deux checkpoints, dont le modèle phare est MiMo-V2.6-Pro, à 1,02 T au total et 42 B actifs.

• MiMo-V2-Flash — le modèle de décembre 2025. Même total de 309B, mêmes 15B actifs, même fenêtre glissante de 128 tokens. Un run d'entraînement différent, un tableau de benchmarks différent, et un contexte de 256K. Toute page qui classe « MiMo-V2-Flash » face à un modèle Qwen compare la mauvaise génération, et la fiche technique seule ne vous le dira pas.

La collision MiMo est la plus aiguë des deux, car les nombres qui identifient le modèle se trouvent aussi être les nombres identiques entre les checkpoints 2025 et 2026. La collision Qwen est plus bénigne, mais elle a un prix : les poids ouverts de 2,4 T et l’API hébergée sont des artefacts différents, soumis à des conditions différentes, et une comparaison qui les intervertit se trompera à la fois sur la capacité et sur la licence.

L’index a été reconstruit, et le numéro que la plupart des pages impriment encore a disparu.

Voici le mode de défaillance à surveiller avant qu’un score n’apparaisse.

Artificial Analysis a recalibré son Intelligence Index en v4.3 le 7 septembre 2026. Les scores antérieurs à cette date ne sont pas comparables aux scores postérieurs à celle-ci, et la page Qwen3.8-Max en ligne porte un badge Actualisé signalant un résultat retraité. Le chiffre de 58 largement diffusé pour Qwen3.8-Max appartient à l'ancienne échelle. Le Qwen3.8-Max actuel (0902) affiche 45, classé 19e sur les 202 modèles qu'Artificial Analysis classe dans cette catégorie.

Ce n'est pas de la pédanterie. Un 58 à côté d'un 46 se lit comme un écart de douze points. Les deux mêmes modèles sur la même échelle actuelle ne sont qu'à un point d'écart — et le 46 n'est même pas le modèle dont traite cet article :

• Qwen3.8-Max (0902), mesuré indépendamment — indice d'intelligence de 45 sur la v4.3. Vitesse de génération de 39,2 jetons par seconde, classé 151e sur 202, ce que la page elle-même signale comme lent. Coût par tâche de l'indice d'intelligence : 5,41 $. Jetons de sortie générés pour terminer l'indice : 190 M.

• MiMo-V2.6-Pro, mesuré indépendamment — Intelligence Index 46, classé premier des 114 modèles de la catégorie open-weights. Vitesse de sortie : 134,3 tokens par seconde. Coût par tâche de l’Intelligence Index : 0,13 $. Tokens de sortie pour compléter l’index : 140 M.

• MiMo-V2.6-Flash, le véritable sujet — aucune page Artificial Analysis n’existe. Rien à citer.

Lisez ces trois ensemble, et le résumé honnête est inconfortable pour les deux fournisseurs. Le point de comparaison que tout le monde veut — Flash face à Qwen3.8-Max sur une échelle neutre — n'existe pas et ne peut pas être construit à partir des tableaux des fournisseurs, car les deux fournisseurs ont utilisé différents harnais sur différents checkpoints à différents moments, puis se sont comparés à des modèles d'autres entreprises qu'ils ont aussi exécutés. Ce qui existe, c'est un écart d'un point entre le Qwen phare et le plus grand checkpoint de Xiaomi, à environ un quarantième du coût par tâche d'indice. C'est le nombre réel le plus intéressant de cette confrontation, et il concerne un modèle qu'aucun des deux camps cités dans le titre ne nomme.

Scoreboard card headed 'MiMo-V2.6-Flash vs Qwen3.8-Max', with paired rows for parameters (309B total / 15B active against 2.4T total / 95B active), licence (MIT, ungated, no revenue trigger, against a hosted API whose open 2.4T sibling uses the Qwen3.8-Max License), price per 1M (no vendor rate card against $2.00 in and $6.00 out with an 88% cache discount), independent score (None published, no Artificial Analysis page, against AA Index 45 on the v4.3 scale, 19th of 202 in class), DeepSWE v1.1 (67.9 on Xiaomi's own harness against Not published) and routability (No - nowhere, including OrcaRouter, against Yes - on OrcaRouter, base tier and the 0902 snapshot).

Ce que les tableaux des fournisseurs vous diront et ne vous diront pas

Les deux fournisseurs publient des chiffres. Ce ne sont pas le même genre de chiffres, et les aligner colonne par colonne produit un graphique plutôt qu’une conclusion — mais la forme des affirmations mérite quand même d’être lue, car elle vous dit ce que chaque laboratoire a cherché à optimiser.

• Agent de code — Xiaomi rapporte MiMo-V2.6-Flash à 67,9 sur DeepSWE v1.1, 87,6 sur Terminal Bench 2.1, 26,0 sur ProgramBench et 61,2 sur MiMo Code Bench. Alibaba rapporte Qwen3.8-Max à 67,7 sur SWE-bench Pro et 86,6 sur Terminal-Bench 2.1. Les chiffres de Terminal-Bench sont suffisamment proches pour que ce soit vraisemblablement le harnais, et non le modèle, qui détermine l’ordre.

• Agent général — Xiaomi rapporte pour Flash AutomationBench v1.0.6 52,3, Toolathlon-Verified 73,6, OSWorld-Verified 80,8 et Agents' Last Exam 27,6. Alibaba rapporte pour Qwen3.8-Max OSWorld-Verified 86,1, WideSearch 81,9 et Agent's Last Exam 52,4. Sur les deux benchmarks que les deux laboratoires ont exécutés, les chiffres annoncés par Qwen sont en tête — sur le harnais propre à Alibaba.

• Connaissances et sécurité — Xiaomi fait tourner CyberGym (Flash 95.1), MiMo Cyber Bench (77.2), ExploitGym (6.0), ExploitBench (25.3) et SEC Bench Pro (47.5). Alibaba fait tourner GPQA Diamond (92.6), Humanity's Last Exam (43.6) et PaperBench (93.0). Presque aucun chevauchement, donc presque rien à comparer.

La seule chose réellement utile qu'un tableau de fournisseur puisse montrer, c'est une incohérence interne, et celui de Xiaomi en présente une. Son tableau de bord RL public, qui a diffusé le run d'entraînement jusqu'en septembre, a publié MiMo-V2.6-Flash à 65.68 sur DeepSWE v1.1 à l'aide d'un harnais mini-swe-agent en moyenne sur trois. La fiche de modèle finalisée affiche 67.9 pour les poids publiés. Ces chiffres décrivent respectivement un instantané d'entraînement et un artefact publié, et l'écart de deux points est de la même ampleur que celui entre les deux checkpoints de Xiaomi. Si vous citez le chiffre du tableau de bord depuis la semaine dernière, il est périmé.

La facture, c'est là que les deux modèles cessent d'être comparables.

C'est la section qui décide des déploiements, et ce n'est pas serré.

• Qwen3.8-Max est facturé à l'usage. 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie sur la grille tarifaire internationale d'Alibaba, avec une remise de cache qu'Artificial Analysis mesure à 88 % et un coût de 5,41 $ par tâche de l'Intelligence Index. La documentation d'Alibaba pour la région Chine indique 12 CNY et 36 CNY par million pour la même paire. Vous pouvez l'appeler cet après-midi et recevoir une facture.

• MiMo-V2.6-Flash est un téléchargement. Xiaomi ne publie aucun tarif par token pour la génération MiMo-V2.6 sur son propre site et n’a annoncé aucun identifiant appelable pour l’un ou l’autre des checkpoints, donc il n’y a rien à mesurer. Ce qu’il y a à la place, ce sont 172,9 Go de données de poids FP8 réparties sur 65 shards, avant le cache KV pour un contexte de 1 M de tokens, et une section de déploiement recommandant SGLang en tensor parallel 16 avec un facteur de parallélisme de données de 2, ou une recette vLLM en tensor parallel 8 — une tâche de service multi-nœuds.

• Les annonces de tiers ne constituent pas une grille tarifaire. Les pages de catalogue comportent bien des chiffres pour la série MiMo-V2.6, et Artificial Analysis compte un seul fournisseur d'API proposant MiMo-V2.6-Pro à 0,435 $ et 0,87 $ par million. Il s'agit de l'annonce d'un fournisseur pour le plus grand checkpoint, et non d'un prix Xiaomi, et elle n'existe pas du tout pour Flash.

Ainsi, le calcul est un poste facturé à l’usage face à une décision d’investissement. À quelques centaines de millions de tokens par mois, Qwen3.8-Max est une facture que vous pouvez prévoir, et Flash est un nœud que vous achèteriez pour servir un modèle que personne en dehors de Xiaomi n’a mesuré. À des milliards de tokens par mois, la voie ouverte commence à l’emporter sur le coût, et c’est le point où la licence cesse d’être une note de bas de page juridique pour devenir une donnée d’entrée de l’approvisionnement.

Les licences ne sont pas la même permission

MIT est à peu près aussi permissive qu'on peut l'être avec des poids ouverts. La licence Qwen3.8-Max n'est pas MIT, et la différence a du mordant.

MiMo-V2.6-Flash est distribué sous licence MIT, sans seuil de chiffre d'affaires, sans déclencheur lié au nombre d'utilisateurs, sans accord commercial distinct et sans clause de recherche. Le déploiement commercial, la modification, la redistribution et l'entraînement ultérieur sont tous autorisés, et le dépôt est en accès libre.

La licence Qwen3.8-Max autorise l'utilisation, la modification, la distribution, l'octroi de sous-licences, la vente, le déploiement, l'hébergement et le fine-tuning, sous deux conditions. Un produit ou un service dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars US de chiffre d'affaires mensuel doit afficher le nom du modèle de manière bien visible dans son interface. Et une activité de modèle en tant que service ou d'assistant de travail par IA dont le chiffre d'affaires cumulé dépasse 50 millions de dollars US sur douze mois consécutifs quelconques nécessite une licence distincte d'Alibaba avant toute utilisation commerciale. L'usage interne est exempté, à condition que le modèle ou ses capacités ne soient pas exposés à des tiers.

Pour la plupart des équipes, aucune des deux conditions ne lie. Pour une activité de plateforme qui réussit, l’une d’elles le fait — et elle lie précisément au moment où le modèle est devenu porteur. Notez également que ces conditions portent sur les poids 2,4T téléchargeables, et non sur l’API hébergée, où ce sont les conditions du fournisseur qui s’appliquent à la place. Les deux voies ont des obligations différentes, ce qui est une raison supplémentaire de ne pas comparer le checkpoint ouvert à celui hébergé comme s’il s’agissait du même produit.

Là où OrcaRouter est pertinent, et là où il ne l'est pas

Qwen3.8-Max est routable sur OrcaRouter, à la fois sur l'entrée de base et sur l'instantané daté 0902, via une seule clé API au prix catalogue du fournisseur, avec 0 % de marge ajoutée. Cela compte spécifiquement ici pour deux raisons. Premièrement, la version 0902 est une entrée distincte plutôt qu'un remplacement silencieux, de sorte que le DSL de routage peut épingler le trafic sensible à la reproductibilité sur l'instantané daté tandis que tout le reste suit le niveau de base — pas de seconde intégration, pas de modification de code. Deuxièmement, comme le prix catalogue est répercuté plutôt que majoré, une modification de la grille tarifaire d'Alibaba arrive de votre côté le jour même au lieu du prochain renouvellement de contrat, ce qui permet de maintenir l'honnêteté de l'arithmétique mesuré-par-nœud ci-dessus à mesure que les prix évoluent. Les charges de travail gourmandes en cache conservent également la remise de cache du fournisseur plutôt que d'en perdre une partie au profit de la marge d'un revendeur.

Screenshot of the OrcaRouter model page for Qwen3.8 Max, marked FEATURED, giving the model id qwen/qwen3.8-max, a 1M-token context, text, image and video input with text output, an input price of $2.00 and output price of $6.00 per 1M tokens, a p50 time to first token of 3.33 seconds, and seven-day traffic of 30.8M tokens.

MiMo-V2.6-Flash n’est routable nulle part, y compris chez nous. Nous ne routons aucun modèle Xiaomi, et la ligne de disponibilité dans la fiche de Xiaomi elle-même pointe vers les canaux propres à Xiaomi : la plateforme API MiMo, AI Studio, MiMo Code et l’application de bureau. Si vous voulez ce checkpoint, vous téléchargez 172,9 Go et trouvez un nœud.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), showing an Intelligence Index of 45 on the updated v4.3 scale ranked 19th of 202, output speed of 39.2 tokens per second ranked 151st of 202, a price of $2.00 per million input tokens and $6.00 per million output with an 88% cache discount and a $5.41 cost per Intelligence Index task, 190M output tokens generated on the index, and a 984k-token context window.

Lequel, et quand

Prenez Qwen3.8-Max si vous voulez de la capacité sans matériel, si votre volume est incertain, ou si vous voulez l’option d’un chiffre indépendant avant de vous engager. Acceptez que 45 sur l’indice actuel soit une position au milieu du peloton de tête plutôt qu’en haut, que 39,2 jetons par seconde soit assez lent pour compter dans une boucle d’agent, et que 190 M de jetons de sortie pour terminer l’Intelligence Index représente environ le double de la médiane — la verbosité coûte de l’argent du côté de la facturation à la sortie du compteur.

Prenez MiMo-V2.6-Flash si la contrainte est la licence, le chemin de données ou une facture sur le long terme que vous pouvez amortir — et si vous disposez du nœud. Les termes MIT sans condition de revenus constituent réellement une autorisation différente d’une licence avec un seuil de MAU et un déclencheur de partage des revenus, et pour une entreprise qui s’attend à devenir grande, c’est la raison de le choisir. Prévoyez un budget pour un service multi-nœuds, dimensionnez à partir des données de poids publiées plutôt que de la page du dépôt, et considérez chaque chiffre de la fiche de Xiaomi comme déclaré par le fournisseur jusqu’à ce que quelqu’un extérieur au laboratoire le reproduise.

Et si vous choisissez aujourd’hui plutôt que le trimestre prochain, commencez par l’option à l’usage. Un mois de Qwen3.8-Max vous indique ce dont votre charge de travail a réellement besoin. Un nœud ne vous dit que ce que vous espériez qu’il vous dise.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement