En-tête de l'article de blog de la marque Qwen annonçant Qwen-Image-2.1, présentant le titre « Qwen-Image-2.1 : Compact, efficace et unifié pour la création d'images » au-dessus des mots « Poids désormais ouverts » et du logo Qwen, avec le sélecteur de langue de la page réglé sur EN
Guides & Insights

Qwen-Image-2.1 est le meilleur modèle d’image à poids ouverts sur les deux classements Artificial Analysis

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Aliba​ba's Qwe​n team released Qwen-Image-2.1 with open weights on 20 September 2026. Twelve days later, the independent scoreboards have caught up with it, and the result is more interesting than the launch. On the AA-Image-T2I v2.0 leaderboard, Qwen-Image-2.1 sits at rank 18 of 166 with an Elo of 1,034, from 5,286 blind comparisons. On AA-Image-Editing v2.0 it sits at rank 18 of 97 with an Elo of 1,074, from 5,536. Both of those rows are marked Open Weights on a board that marks every model individually. No other model carrying that marker on either board is placed above them. That is the whole finding: on the only two public image boards that score models by blind pairwise comparison, the released Qwen-Image-2.1 is the strongest set of downloadable weights in the field, and it is Qwen-Image-2.1 specifically, not a preview of it, that holds both positions.

Ce qui suit explique d’où viennent ces deux chiffres, à quoi ressemblent les lignes qui les entourent, et les trois détails du tableau que la majeure partie de la couverture du lancement a laissés de côté — en commençant par le fait que le tableau ne consigne aucune API, nulle part, pour le modèle.

Où se situent les deux rangées

Artificial Analysis construit ses deux classements à partir de comparaisons par paires à l’aveugle : deux modèles répondent à la même invite, un votant choisit la meilleure sortie, et un score Elo se dégage de l’agrégation. Les deux classements partagent un style maison et rien d’autre. Ils évaluent des tâches différentes, ont des populations différentes et leurs valeurs Elo ne sont pas comparables entre elles. Qwen-Image-2.1 se trouve par hasard au même rang dans les deux, ce qui est une coïncidence entre deux distributions différentes.

Text-to-image, 166 modèles au tableau :

• La première ligne du classement est occupée par GPT Image 2.5 Sunburst (max) à 1 107 Elo sur 14 023 apparitions — un modèle propriétaire dont l'échantillon représente plus du double de celui de Qwen-Image-2.1.

• Qwen-Image-2.1 occupe la 18e place avec 1 034 Elo et un intervalle de confiance à 95 % allant de 1 024 à 1 044, sur 5 286 apparitions.

• Lisez le nombre de lignes avant les rangs. Qwen-Image-2.1 occupe le rang 18 sur les deux classements, mais ces rangs proviennent de populations différentes — 166 modèles en texte-vers-image, 97 en édition — et les deux valeurs Elo appartiennent à deux échelles distinctes. Le rang identique relève de l'arithmétique, et non d'une preuve que les deux classements s'accordent sur quoi que ce soit.

• Aliba​ba's own two Pro-tier models are above it on this board: Qwen-Image-3.0-Pro at 1,089 Elo, rank 14, and Qwen-Image-3.0 at 1,075, rank 16. Neither carries the Open Weights marker. The board's September snapshot lists both as July 2026 releases, which is the version of the story where the newest Qwe​n image model is not the highest-scoring one — and on text-to-image it is not.

Édition d'images, 97 modèles au tableau :

• GPT Image 2.5 Sunburst (max) arrive également en tête de ce classement, avec 1 182 Elo pour 17 899 apparitions.

• Qwen-Image-2.1 occupe la 18e place avec 1 074 Elo, un intervalle de 1 065 à 1 083, sur 5 536 apparitions — un échantillon légèrement plus grand que sa ligne de génération d’images à partir de texte, ce qui est logique pour un modèle dont le volet édition a eu droit à une communication de lancement plus retentissante.

• Les lignes qui l'entourent sont serrées. grok-imagine-image se classe une place en dessous, à 1 071, et Luma UNI 1 Max à 1 069. La ligne à poids ouverts la plus proche en dessous dans ce classement est HunyuanImage 3.0 Instruct à 1 066 sur 5 221 apparitions — 8 points Elo d'écart. Sept lignes se situent dans un intervalle de dix-huit points Elo.

Lire honnêtement l'affirmation du « meilleur modèle à poids ouverts »

L’expression dans le titre joue un rôle précis, et elle mérite d’être vérifiée plutôt que répétée.

• Il s'agit d'un classement au sein d'un marqueur, et non d'un classement global. Qwen-Image-2.1 est 18e sur les deux tableaux au classement général. C'est le label Open Weights qui le place en tête de chacun, et le label est appliqué par modèle sous l'autorité propre du tableau — 47 lignes texte-vers-image portent le marqueur ; 36 lignes le portent sur le tableau d'édition, qui en répertorie 97.

• The marker describes weights, not terms. Qwen-Image-2.1 ships under the Qwe​n Research License Agreement dated 20 September 2026, which grants rights for non-commercial purposes only. The board's Open Weights label is accurate about downloadability and silent about what you may do with the download. Anyone reading "top open-weights image model" as "free to use in a product" has read the label past its meaning.

• C'est un instantané, pas un classement définitif. Le classement évolue chaque jour à mesure que les votes s'accumulent. Les intervalles de confiance de Qwen-Image-2.1 sont de ±10 Elo sur la génération d'images à partir de texte et de ±9 sur l'édition ; les lignes situées en dessous se chevauchent. Considérez cette position comme actuelle plutôt que permanente.

Le détail que la couverture du lancement n'avait pas : pas d'API

Les deux lignes Qwen-Image-2.1 portent une mention explicite Aucune API disponible. Cela représente un coût réel pour le classement, et cela vous dit quelque chose sur qui a généré les 5 286 et 5 536 votes — s'il n'existe aucun point de terminaison vers lequel diriger une invite, les comparaisons proviennent de personnes qui exécutent elles-mêmes les poids et soumettent le résultat. Un Elo indépendant pour un modèle uniquement auto-hébergé est une mesure réellement plus difficile qu'un Elo pour quelque chose que n'importe qui peut appeler, et c'est pourquoi les échantillons ici font un tiers de la taille des lignes du haut.

Pour un développeur, la situation est familière : le modèle d'image téléchargeable le plus puissant du domaine n'est pas celui que vous pouvez appeler aujourd'hui. Concrètement, cela divise le travail. Soit vous hébergez vous-même Qwen-Image-2.1 sur votre propre matériel, soit vous appelez l'un des modèles qui l'entourent sur ce tableau. La seconde option est là où le routage justifie son intérêt — une API unique sur plus de 200 modèles, avec le prix catalogue du fournisseur répercuté sans marge, basculement automatique en cas de dégradation d'un fournisseur, et un DSL de routage pour composer plusieurs modèles en un seul appel. OrcaRouter ne sert pas Qwen-Image-2.1 aujourd'hui ; les gammes d'images sur la plateforme sont les paliers Imagen de Google et les aperçus d'images Gemini, le point de terminaison d'images Grok Imagine de xAI et la famille GPT-Image d'OpenAI. Sur ce tableau, c'est la ligne GPT Image 2.5 Sunburst tout en haut, et c'est une réponse légitime à « je veux le meilleur score et je veux pouvoir l'appeler cet après-midi ».

Screenshot of the Artificial Analysis text-to-image leaderboard, AA-Image-T2I v2.0, captured in English, listing GPT Image 2.5 Sunburst (max) first at 1,107 Elo from 14,023 samples, the Qwen-Image-3.0-Pro row at rank 14 with 1,089 Elo and 6,353 samples, and the Qwen-Image-2.1 row at rank 18 with 1,034 Elo from 5,286 samples

Quoi surveiller au tableau

Trois choses feront avancer cette histoire, et toutes les trois sont déjà visibles sur les tableaux.

The first is whether an API appears. If Aliba​ba or a serving partner puts Qwen-Image-2.1 behind an endpoint, the No API available note disappears, vote volume should climb toward the size of the neighbouring rows, and the confidence interval tightens. A tighter interval on a 1,034 or a 1,074 is a much stronger claim than the current one.

The second is Aliba​ba's own stack. Qwen-Image-3.0-Pro at 1,089 and Qwen-Image-3.0 at 1,075 both outrank Qwen-Image-2.1 on text-to-image while carrying no Open Weights marker. If Qwen-Image-2.1 is meant to be the downloadable counterpart to that line rather than its successor, the interesting question is whether the gap narrows — and on the editing board it already has, where Qwen-Image-3.0-Pro leads Qwen-Image-2.1 by two Elo points.

Le troisième, c'est la licence. Chaque ligne Open Weights sur les deux tableaux est tout aussi éligible au label, et les licences qui les sous-tendent ne sont pas du tout égales. Le tableau ne vous le dira jamais. C'est la seule colonne que le tableau des scores n'a pas.

Generated summary card for Qwen-Image-2.1 on the Artificial Analysis boards, listing text-to-image rank 18 of 166 at 1,034 Elo from 5,286 votes, editing rank 18 of 97 at 1,074 Elo from 5,536 votes, the note that it is the top Open Weights row on both boards, and the sourcing line that the figures are per Artificial Analysis

FAQ

Qwen-Image-2.1 est-il le meilleur modèle d’image à poids ouverts ?

Sur ces deux classements, oui — c’est la ligne à l’Elo le plus élevé portant le marqueur Open Weights sur les deux, à 1 034 en text-to-image et 1 074 en editing. Au global, elle se classe 18e sur chacun — et le 18 est un rang au sein de 166 lignes sur un classement et au sein de 97 sur l’autre, représentant deux échelles Elo qui ne peuvent pas être comparées l’une à l’autre. L’affirmation ne tient que si les deux qualificatifs restent attachés.

Pourquoi les deux classements affichent-ils des valeurs Elo différentes pour le même modèle ?

Ils évaluent des tâches différentes par rapport à des populations de modèles différentes. Un Elo de génération d’images à partir de texte et un Elo d’édition sont deux échelles distinctes ; comparer 1 034 à 1 074 mesure les classements, pas le modèle.

Puis-je appeler Qwen-Image-2.1 via une API ?

Both board rows record No API available. The weights are downloadable from Aliba​ba's repositories, so the model runs — it just does not have a hosted endpoint that the board has credited with serving it.

Si vous voulez un chiffre aujourd’hui plutôt qu’un téléchargement, le sommet des deux classements est accessible via les API propres des fournisseurs, et la gamme GPT-Image, les paliers Imagen de Google et Grok Imagine de xAI sont les modèles d’image qu’OrcaRouter expose directement. Gardez le fichier de poids pour l’expérience et le point de terminaison pour l’échéance.