
MiMo-V2.6-Pro vs Qwen3.8-Max : un point d'indice, six fois le prix
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Qwen3.8-Max est un modèle de 2,4 billions de paramètres qui en active 95 milliards par token et tourne chez un seul fournisseur. Xiaomi MiMo-V2.6-Pro est un modèle de 1,02 billion de paramètres qui en active 42 milliards par token, obtient un point de plus sur le même indice indépendant et coûte environ six fois moins cher par appel. Ces faits cohabitent mal, et la manière dont vous les conciliez constitue tout l’enjeu du choix entre les deux. En bref : sur Artificial Analysis Intelligence Index v4.3.2, Xiaomi MiMo-V2.6-Pro obtient 46 et Qwen3.8-Max obtient 45 — une égalité dans le bruit — tandis que la grille tarifaire affiche 0,43 $ et 0,87 $ par million de tokens, contre 2,00 $ et 6,00 $.
Ce qu'est réellement chaque modèle
Qwen3.8-Max est le modèle phare d'Alibaba, en disponibilité générale depuis le 3 août 2026, et il était le plus grand modèle que la gamme Qwen avait livré au moment de son lancement. Il s'agit d'un mélange d'experts clairsemé construit sur l'architecture Qwen 3.5, avec 2,4 billions de paramètres au total et environ 95 milliards de paramètres actifs par token, une fenêtre de contexte d'un million de tokens, jusqu'à 131 000 tokens en sortie, et une entrée multimodale couvrant texte, image et vidéo. Alibaba a réduit le tarif international à 2,00 $ par million de tokens d'entrée et 6,00 $ par million de tokens de sortie, avec l'entrée mise en cache à 0,25 $, et a présenté cela comme environ 40 % du prix d'entrée de Claude Opus 5. Une mise à jour ponctuelle, Qwen3.8-Max-0902, a suivi le 2 septembre 2026 et c'est ce qu'Artificial Analysis évalue actuellement à 45.
Xiaomi MiMo-V2.6-Pro a atteint la disponibilité générale le 22 septembre 2026, trois jours avant la rédaction de cette comparaison, ses dépôts de checkpoints d’apprentissage par renforcement étant apparus la veille. Il s’agit d’un mélange d’experts creux de 1,02 billion de paramètres au total et de 42 milliards de paramètres actifs par token, avec la même fenêtre de contexte de 1 million de tokens, une multimodalité native pour le texte, l’image, la vidéo et l’audio, et des poids publiés sous licence MIT. Xiaomi a maintenu la tarification de la génération précédente plutôt que de revoir à la hausse le prix du nouveau checkpoint, c’est pourquoi il est proposé à 0,43 $ et 0,87 $ avec une remise de cache de 99 % et un prix mixte de 0,18 $.
• Calcul actif par token — Qwen3.8-Max 95B ; Xiaomi MiMo-V2.6-Pro 42B, soit moins de la moitié
• Nombre total de paramètres — Qwen3.8-Max 2,4 T ; Xiaomi MiMo-V2.6-Pro 1,02 T
• Score de l'indice — Xiaomi MiMo-V2.6-Pro 46 ; Qwen3.8-Max 45, tous deux sur Artificial Analysis v4.3.2
• Vitesse de sortie — Xiaomi MiMo-V2.6-Pro 134,3 tokens/seconde ; Qwen3.8-Max 39,2, par rapport à une médiane de catégorie de 72,5
• Temps jusqu'au premier token — Xiaomi MiMo-V2.6-Pro 2,15 secondes ; Qwen3.8-Max 2,93
• Prix catalogue — Xiaomi MiMo-V2.6-Pro 0,43 $ / 0,87 $ par million ; Qwen3.8-Max 2,00 $ / 6,00 $
• Tarif mixte — Xiaomi MiMo-V2.6-Pro 0,18 $ par million selon une répartition 7:2:1 succès de cache/entrée/sortie ; Qwen3.8-Max 1,18 $
• Poids — Xiaomi MiMo-V2.6-Pro sous licence MIT et téléchargeable ; Qwen3.8-Max était proposé comme point de terminaison propriétaire, avec une version open-weight texte uniquement qui abandonne le contexte de 1 M et l’entrée visuelle
• Accessibilité — un fournisseur d'API comptabilisé pour chacun sur Artificial Analysis
Le score est à égalité. La vitesse ne l'est pas.
Un point sur un composite de dix évaluations n’est pas une différence sur laquelle il faudrait agir, et le signal le plus utile est ce qui s’est produit en dessous. Le modèle avec moins de la moitié des paramètres actifs par token a obtenu un score légèrement supérieur et a généré sa sortie trois fois et demie plus vite — 134,3 tokens par seconde contre 39,2, alors que la médiane pour les modèles de raisonnement comparables est de 72,5. Qwen3.8-Max est le plus lent des modèles de classe frontière mesurés sur cette page, et c’est une conséquence de conception liée à l’activation de 95 milliards de paramètres par token, plutôt qu’un accident de serving.
La latence raconte une histoire opposée à celle que suggèrent les nombres de paramètres. Qwen3.8-Max atteint son premier token en 2,93 secondes, contre 2,15 pour Xiaomi, et l'écart est bien plus faible que celui du débit — Qwen3.8-Max est lent une fois qu'il commence à écrire, pas lent à démarrer. Pour une interface de chat où la réponse est courte, cette différence se manifeste à peine. Pour une boucle d'agent générant des dizaines de milliers de tokens de sortie, le débit constitue tout le temps d'horloge, et un écart de 3,4× se cumule à chaque tour de l'exécution.

Là où les tableaux des fournisseurs divergent, et pourquoi ce n’est pas une contradiction
Alibaba a publié un vaste tableau pour Qwen3.8-Max, et il est vraiment solide : Terminal-Bench 2.1 à 86,6, SWE-bench Pro à 67,7, PaperBench à 93,0, GPQA Diamond à 92,6, IFBench à 82,8, OSWorld-Verified à 86,1 et Humanity's Last Exam à 43,6. Ce sont des chiffres obtenus par le fournisseur sur les propres harnais d'Alibaba, et pour certains sur les propres benchmarks d'Alibaba ; ce sont donc des affirmations plutôt que des mesures — mais ce sont des affirmations sur des benchmarks largement utilisés, ce qui les rend plus comparables entre laboratoires qu'un résultat issu d'un harnais sur mesure.
Le chiffre phare de Xiaomi est de 72,57 sur DeepSWE v1.1, contre une base de référence de 58,4, mesuré avec mini-swe-agent, en moyenne sur trois exécutions, à l'aide de l'évaluateur maison de Xiaomi, sur une session d'apprentissage par renforcement que Xiaomi documente comme trente étapes et environ 750 000 trajectoires, pour une dépense publiée d'environ 2,62 millions de dollars. Il n'a pas été soumis au classement public DeepSWE et aucun tiers ne l'a reproduit. Opposer 72,57 aux 67,7 de Qwen sur SWE-bench Pro et déclarer une victoire de Xiaomi de cinq points reviendrait à croiser deux benchmarks différents, deux harnais différents et deux conventions de notation différentes. Il n'existe qu'un seul instrument de mesure auquel les deux modèles ont été soumis par quelqu'un d'autre que leur créateur, et il indique 46 à 45.
Deux des chiffres les plus lourds de conséquences de Qwen3.8-Max ne sont pas du tout des scores. Alibaba a annoncé que les poids seraient publiés en open source aux côtés de Qwen3.8-27B, et le checkpoint livré est texte uniquement : il ne comporte ni le contexte complet de 1M de tokens ni l’entrée visuelle dont dispose le point de terminaison Max en service. Ainsi, « Qwen3.8-Max est à poids ouverts » et « Qwen3.8-Max est un point de terminaison multimodal à contexte de 1M » sont deux affirmations vraies au sujet d’artefacts différents, et un plan de déploiement bâti sur la première tout en tablant sur la seconde ne survivra pas au contact. La version ponctuelle 0902, quant à elle, a propulsé le modèle au sommet d’une arène publique de développement web sans changer de numéro de version — rappel que le modèle que vous avez évalué en août n’est pas nécessairement celui qui répond à vos requêtes en septembre.
Les poids ouverts signifient-ils que vous pouvez auto-héberger l'un ou l'autre ?
Pour Xiaomi MiMo-V2.6-Pro, en principe oui : licence MIT, aucun accord commercial nécessaire. En pratique, un checkpoint de 1,02 T de paramètres dont 42 B actifs nécessite un cluster de service multi-nœuds, ce qui représente un tout autre niveau d’engagement que d’appeler une API. Publier les poids rend l’auto-hébergement légal, pas bon marché.
Pour Qwen3.8-Max, la réponse est plus restrictive que ne le suggère sa réputation. La version ouverte est uniquement textuelle et sans la fenêtre de contexte complète, donc l’auto-héberger vous donne un modèle nettement plus petit que celui sur lequel le 45 a été mesuré. Si ce que vous voulez, c’est la configuration de référence, le point de terminaison servi est le produit, et le point de terminaison est propriétaire.
Appeler l’un ou l’autre, et l’arithmétique qui en décide
Les deux modèles sont recensés chez un seul fournisseur d'API par Artificial Analysis, ce qui est inhabituel pour deux modèles phares et fait du basculement une question pratique plutôt qu'un simple agrément. Qwen3.8-Max est disponible sur OrcaRouter sous qwen/qwen3.8-max — un point de terminaison compatible OpenAI au prix catalogue d'Alibaba, avec 0 % de marge, de sorte que les 2,00 $ et 6,00 $ ci-dessus sont répercutés sans modification et qu'un changement de prix côté Alibaba est effectif chez nous le jour même. Nos propres mesures situent le p50 du point de terminaison autour de 3,3 secondes, ce qui est le chiffre sur lequel planifier plutôt que le meilleur cas théorique, et une chaîne de repli fait qu'une requête bloquée est retentée sur un autre amont avant que la réponse ne commence. Xiaomi MiMo-V2.6-Pro n'est pas sur OrcaRouter ; aucun modèle Xiaomi ne l'est, et la voie d'accès aujourd'hui passe par la plateforme de Xiaomi elle-même et par les catalogues tiers qui le référencent.
L'arithmétique des coûts est ce qui tranche réellement cette confrontation, et ce n'est pas l'arithmétique que suggèrent les tarifs affichés. Avec une répartition 7:2:1 succès de cache/entrée/sortie, les tarifs combinés sont de 0,18 $ et 1,18 $ par million — un écart de 6,6×, plus large que les écarts de 4,6× en entrée et de 6,9× en sortie, car la remise de 99 % sur le cache de Xiaomi est plus profonde que les 88 % d'Alibaba. Artificial Analysis enregistre également un coût de 0,13 $ par tâche de l'Intelligence Index pour Xiaomi MiMo-V2.6-Pro, mesuré de manière identique pour chaque modèle du classement. Faites tourner la même charge de travail sur les deux et le modèle le moins cher est celui qui a obtenu le meilleur score, ce qui est une chose inhabituelle que l'on puisse écrire et la raison pour laquelle cette comparaison n'est pas une formalité.

Qui devrait changer, et qui ne devrait pas
Si vous utilisez Qwen3.8-Max aujourd’hui et que cela fonctionne, il n’y a pas de raison urgente de migrer. L’écart d’indice est un point, le comportement en vision et en contexte long est prouvé dans votre charge de travail, et Alibaba continue de développer la gamme — la mise à jour 0902 le montre. L’argument en faveur d’une migration est le débit et le coût mixte, et ce n’est un argument solide que si votre trafic est à forte proportion de sortie ou à long horizon : agents, génération de code, tout ce qui écrit bien plus qu’il ne lit.
Si vous partez de zéro, le classement est difficile à contester au vu des preuves publiées. Le modèle Xiaomi est plus rapide, moins cher sur tous les axes, sous licence MIT, et légèrement en avance sur le seul composite exécuté indépendamment qui couvre les deux. Les contrepoids sont réels et précis : trois jours d’historique de production, une seule route de service, et aucune entrée publique dans un benchmark à examiner. Cette combinaison plaide pour l’évaluer dans une voie à côté d’une solution en place plutôt que de remplacer celle-ci — ce à quoi sert une configuration de routage, et pourquoi le geste utile est de placer le candidat et la solution en place derrière une même clé plutôt que de désigner un gagnant à partir d’un tableau de scores.

Qu’est-ce qui changerait cette réponse ?
Trois points. Un deuxième et un troisième fournisseur pour Xiaomi MiMo-V2.6-Pro lèveraient la seule objection structurelle qui lui reste et transformeraient l'écart de prix en une décision réelle plutôt qu'en une simple tentation. Une exécution indépendante de la configuration DeepSWE confirmerait le 72,57 ou le retirerait, et l'un ou l'autre résultat vaut plus que le chiffre lui-même. Et des ventilations par évaluation sur v4.3.2 montreraient lesquelles des dix évaluations chaque modèle remporte — le composite est un composite, et un modèle qui domine en codage agentique et un autre qui domine en questions-réponses à forte intensité de recherche d'information peuvent afficher le même score d'indice tout en étant inadaptés aux tâches de l'autre.
