
Qwen-Image 2.1 contre MAI-Image-2.5-Pro : 6 100 votes à l'aveugle contre zéro
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
L'un de ces deux modèles a été classé par environ 6 100 comparaisons humaines à l'aveugle. L'autre n'a été classé par personne en dehors de son propre laboratoire. MAI-Image-2.5-Pro, le modèle d'image haut de gamme de Microsoft, occupe la première place de l'arène d'édition d'images Artificial Analysis avec un Elo de 1 272 — le résultat le plus voté de la catégorie. Qwen-Image 2.1, que l'équipe Qwen-Image a publié en open source le 20 septembre 2026, n'a aucun score indépendant, et n'en aura pas avant que suffisamment de personnes ne l'exécutent en public pour générer des votes. Cet écart est le véritable sujet de cette comparaison, car c'est la seule différence entre les deux modèles qui ne soit pas une affirmation de fournisseur. Tout le reste — l'architecture, la résolution, le prix — est connaissable mais non prouvé, et les deux modèles sont suffisamment proches sur le papier pour que l'écart de mesure soit ce qui doit guider la décision.
Ce que les votes disent réellement, et ce qu’ils ne disent pas
Artificial Analysis réalise des comparaisons par paires à l’aveugle : deux modèles reçoivent la même invite, les votants choisissent la meilleure sortie, et le classement Elo découle des résultats. Ce n’est pas un instrument parfait, mais c’est ce qui s’approche le plus, dans cette catégorie, d’un tableau de scores partagé, et la taille de l’échantillon compte autant que le chiffre.
• MAI-Image-2.5-Pro — n°1 en édition d'image avec un Elo de 1 272 sur environ 6 100 comparaisons. En génération d'images à partir de texte, il se classe n°7 avec un Elo de 1 292, derrière GPT Image 2 (high) à 1 369, Reve 2.1 à 1 322, Nano Banana 2 à 1 320, GPT Image 1.5 (high) à 1 310 et MAI-Image-2.5 à 1 304.
• Qwen-Image 2.1 — aucune entrée sur l'un ou l'autre des tableaux. Pas un score faible ; aucun score. La sortie n'a qu'un jour au moment de la rédaction.
La forme de ces chiffres mérite d’être lue attentivement, car ce n’est pas la forme que le marketing laisse entendre. Le modèle de Microsoft est véritablement premier en édition et véritablement septième en génération. C’est une position précise et défendable — un spécialiste de l’édition qui mène sa catégorie — et c’est différent d’être le meilleur modèle d’image, ce qu’il n’est pas. Pendant ce temps, le modèle qui le bat en texte-image est GPT Image 2 (high), qui n’est pas non plus le modèle OpenAI le plus récent dans ce domaine. Les classements indépendants récompensent le modèle qui a été le plus mesuré, et dans cette confrontation, c’est sans ambiguïté celui de Microsoft.
La seule spécification où le modèle ouvert l'emporte haut la main
Il existe une différence concrète et non subjective entre ces deux, et c'est la résolution.
• Qwen-Image 2.1génère nativement en 2K, avec 2048×2048 comme valeur par défaut documentée à 40 étapes d'inférence, sept préréglages de format d'image, et une sortie RGBA avec un véritable canal alpha plutôt qu'un masque.
• MAI-Image-2.5-Pro plafonne la sortie à 1 048 576 pixels — soit environ un mégapixel. Ses chiffres de spécifications phares se trouvent ailleurs : 32 000 jetons d'entrée texte, une fenêtre de contexte de 131 k et 4 096 jetons de sortie, ce qui en dit long sur la quantité d'instructions qu'il peut absorber, et non sur la quantité d'image qu'il peut produire.
Pour la plupart des travaux destinés aux réseaux sociaux et aux produits, un plafond d’un mégapixel ne constitue pas une contrainte. Pour l’impression, pour la composition grand format, pour tout ce où un recadrage doit rester exploitable, c’est une contrainte. C’est la seule dimension de toute la comparaison où l’on peut pointer un chiffre et dire que le modèle ouvert a l’avantage — et noter qu’il s’agit d’un fait architectural issu de la fiche du modèle, et non d’une affirmation sur la qualité. Qwen-Image 2.1 effectuera un rendu en 2048×2048, que ce qu’il produit vaille ou non la peine d’être regardé.
Le prix, c’est là que la comparaison devient inconfortable.
MAI-Image-2.5-Pro est positionné comme un modèle premium, et les chiffres ne sont pas subtils : 5 $ par million de jetons d’entrée de texte, 8 $ par million de jetons d’entrée d’image et 106 $ par million de jetons de sortie d’image. Pour une sortie de 1024 pixels, cela revient à environ 108,50 $ les mille images. Pour situer l’échelle, cela représente environ 2,3 fois le coût de MAI-Image-2.5 et environ 5,4 fois celui de MAI-Image-2.5-Flash ; Microsoft a donc délibérément segmenté sa propre gamme plutôt que de tarifer le niveau Pro comme une mise à niveau incrémentielle.
Qwen-Image 2.1 n’a pas de tarif hébergé, car il n’existe pas de point de terminaison hébergé — c’est un téléchargement de poids sous licence de recherche. Son coût est votre temps GPU, et sa contrainte est que vous ne pouvez pas vendre légalement ce qu’il produit. Comparer 108,50 $ pour mille images à des « poids gratuits », c’est comparer un service à une machine, et la version honnête de cette comparaison est la suivante : le prix au compteur vous achète un modèle mesuré, pris en charge et sous licence commerciale, tandis que les poids vous achètent un téléchargement de 33 Go et un fichier de licence qui indique « non commercial uniquement ».
Cet arbitrage est exactement là où une couche de routage mérite sa place. OrcaRouter expose plus de 200 modèles derrière un point de terminaison unique compatible OpenAI, au prix catalogue du fournisseur et sans marge, avec basculement automatique entre fournisseurs — donc une équipe qui souhaite évaluer un modèle ouvert non mesuré n'a pas besoin de déplacer sa production dessus pour le faire, et comme le prix catalogue est répercuté, tout changement de prix d'un fournisseur sur un modèle routé retombe de notre côté le jour même plutôt qu'au prochain renouvellement de contrat. Ni MAI-Image-2.5-Pro ni Qwen-Image 2.1 ne font partie des modèles que nous routons aujourd'hui, et cet article ne va pas suggérer le contraire. La gamme d'images que nous exposons est la famille GPT-Image d'OpenAI, les paliers d'Imagen 4 de Google et les aperçus d'images Gemini, et le point de terminaison d'images Grok Imagine de xAI.

Où se situent les allégations du fournisseur, et quel poids leur accorder
Les deux fournisseurs publient des chiffres qu’aucun tiers n’a reproduits, et ils doivent être lus avec le même scepticisme dans les deux sens.
• Les affirmations de Microsoft — 96,8 % de précision de rendu du texte en anglais, chinois, japonais, coréen et espagnol ; 27 % de meilleure conformité aux invites que GPT-Image-1.5 ; 94 % de cohérence des personnages sur plusieurs images ; et jusqu'à 84–89 % de coût GPU en moins dans des scénarios internes spécifiques à Microsoft. La dernière est celle avec laquelle il faut être prudent : elle décrit la configuration de service de Microsoft elle-même, et non quelque chose qu'un client peut vérifier.
• Les affirmations d'Alibaba — l'article de blog consacré à Qwen-Image 2.1 comporte un graphique comparatif Qwen-Image-Bench, et les chiffres qu'il contient sont ceux du fournisseur lui-même. Un chiffre circule également dans des articles tiers, qui décrit le modèle comme un transformer à 20 couches, ce qui contredit le DiT à flux unique de 32 couches indiqué sur la fiche du modèle ; la fiche du modèle est la source primaire et c'est le chiffre de 32 couches qu'il faut retenir.
La différence entre les deux situations ne tient pas à l’honnêteté de l’un ou l’autre fournisseur. Elle tient au fait que le modèle de Microsoft a été mesuré de manière indépendante, contrairement à celui d’Alibaba ; les affirmations de Microsoft peuvent donc être vérifiées par rapport à quelque chose, tandis que celles d’Alibaba ne peuvent encore être vérifiées par rapport à quoi que ce soit.
À quoi sert chacun
Lus ensemble, ceux-ci ne sont pas en concurrence pour le même emplacement.
• MAI-Image-2.5-Pro est l'instrument d'édition. Il domine le classement de l'édition sur une vaste base de votes, il accepte une longue instruction (32 k jetons d'entrée de texte, 131 k de contexte), il est sous licence commerciale et il est dès maintenant disponible en aperçu public sur Microsoft Foundry et le MAI Playground. Si votre travail consiste à corriger des images de façon itérative et que vous devez savoir avant de vous engager qu'il est le meilleur disponible pour cette tâche, voici la réponse mesurée, et il coûte environ 108,50 $ pour mille images.
• Qwen-Image 2.1 est l'artefact de recherche ouvert. Il génère des images plus grandes, il est livré avec un checkpoint inspectable de réécriture de prompt aux côtés du modèle d'image, il accepte jusqu'à 10 images de référence avec des modifications locales par cercle, annotation peinte ou masque, et il est gratuit à télécharger et sa vente est illégale. Si votre travail consiste à évaluer, à faire des benchmarks ou à construire sur des poids que vous pouvez lire, c'est l'objet le plus intéressant — et vous faites ce travail sans classement pour vous dire s'il vaut quelque chose.
Il y a aussi une asymétrie de calendrier qui mérite d’être soulignée. MAI-Image-2.6 est entré en aperçu privé le 19 août 2026, ce qui signifie que le modèle en tête du classement d’édition a déjà une génération de retard sur ce que Microsoft s’apprête à livrer. Qwen-Image 2.1, en revanche, en est à son premier jour, avec un programme d’accès anticipé qui demandait à ses testeurs de publier avant le 29 septembre. Les deux classements de cette comparaison auront un tout autre aspect d’ici un mois.


Qu'est-ce qui réglerait ça ?
Une chose : Qwen-Image 2.1 apparaît dans un classement. Tout, dans cet article, qui n’est pas le plafond de résolution ou le prix est une affirmation de l’un ou l’autre laboratoire, et la seule raison pour laquelle MAI-Image-2.5-Pro peut être recommandé sans rire, c’est que 6 100 personnes qui ne travaillaient pas pour Microsoft ont regardé sa production à côté de quelque chose d’autre et l’ont préférée. C’est la norme que le modèle ouvert n’a pas atteinte, et la norme à laquelle il devrait être tenu.
D'ici là, la lecture pratique est simple. Si vous avez besoin aujourd'hui d'un modèle d'édition, sous licence commerciale, avec un tableau de scores derrière lui, la réponse est celle de Microsoft, et elle coûte environ 108,50 $ pour mille images. Si vous voulez savoir si un modèle open-weights de 7B avec une sortie native en 2K et un réécrivain de prompt inspectable est meilleur, vous devez faire la mesure vous-même — et la chose la plus utile que vous puissiez faire du résultat est de le publier, parce que toute la catégorie manque actuellement d'un point de données.
