Carte hero générée pour l'article Qwen-Image-2.1 versus Hy Image3.5, avec le titre Qwen-Image-2.1 vs Hy Image3.5, le sous-titre Les classements les placent dans des ordres opposés, les pastilles indiquant Édition : Hy Image3.5 mène 1 088 à 1 074 et Texte-vers-image : Qwen-Image-2.1 mène 1 034 à 975, et le pied de page Les deux modèles ont été évalués selon Artificial Analysis, septembre 2026, avec le logo OrcaRouter incrusté en bas à droite
Guides & Insights

Qwen-Image-2.1 vs Hy Image3.5 : les classements indépendants les classent dans des ordres opposés

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez Qwen-Image-2.1 et Hy Image3.5 face à face sur les deux classements d'images d'Artificial Analysis, et les classements ne sont pas d'accord sur lequel est le meilleur. En text-to-image, Qwen-Image-2.1 devance Hy Image3.5 de 59 Elo — 1 034 contre 975, rang 18 contre rang 66. En édition d'image, les deux mêmes modèles échangent leurs places : Hy Image3.5 se situe à 1 088 Elo et au rang 14, Qwen-Image-2.1 à 1 074 et au rang 18. Un écart de 14 points dans l'autre sens. Les deux modèles sont devenus publics à deux jours d'intervalle — Qwen-Image-2.1 avec des poids ouverts le 20 septembre 2026, Hy Image3.5 en aperçu public le 22 septembre 2026 — et c'est la première fois que l'un ou l'autre obtient un score sur le même instrument, ce qui rend ce désaccord digne d'être lu plutôt que simplement rapporté.

Le réflexe évident est de dire que le comité de rédaction est bruyant et de passer à autre chose. C’est à moitié vrai. L’autre moitié, c’est que les deux lignes ne sont pas aussi solides l’une que l’autre, que le prix de l’une n’est pas le prix de l’autre, et que l’un de ces modèles détient les droits sur les poids, ce que l’autre n’aura jamais.

Deux tableaux, deux ordres

Artificial Analysis mène des comparaisons par paires en aveugle — le même prompt envoyé à deux modèles, un votant choisit le gagnant, l'Elo s'accumule — et publie un classement distinct par tâche. Le classement texte-vers-image comporte 166 lignes ; celui d'édition en comporte 97. Les deux lignes pour les deux modèles proviennent de l'instantané du même fournisseur, il ne s'agit donc pas d'un décalage de version.

• Génération d’images à partir de texte — Qwen-Image-2.1 à 1 034 Elo (intervalle de 1 024 à 1 044) sur 5 286 comparaisons, classé 18e sur 166. Hy Image3.5 à 975 Elo (intervalle de 966 à 984) sur 5 334 comparaisons, classé 66e sur 166. Les intervalles ne se chevauchent pas. Une séparation de 59 points sur des échantillons de taille similaire correspond à un classement réel, et non à un artefact d’arrondi.

• Édition d'images — Hy Image3.5 à 1 088 Elo (intervalle de 1 079 à 1 097) sur 5 550 comparaisons, rang 14 sur 97. Qwen-Image-2.1 à 1 074 Elo (intervalle de 1 065 à 1 083) sur 5 536 comparaisons, rang 18 sur 97. Ces intervalles se chevauchent sur une bande de quatre points, de 1 079 à 1 083. L'ordre est directionnel, non établi.

• Les tailles d’échantillon sont proches sur les deux classements — 5 286 contre 5 334 en text-to-image, 5 536 contre 5 550 en édition — donc l’écart de confiance ne s’explique pas par un déficit de votes pour un modèle.

• Le classement étiquette les modèles différemment, et cela a son importance : les lignes Qwen-Image-2.1 portent le marqueur Open Weights, celles de Hy Image3.5 non.

Donc la lecture honnête est asymétrique. Texte-vers-image : Qwen-Image-2.1 l’emporte nettement. Édition : Hy Image3.5 est probablement devant, d’une marge incluse dans le bruit de la mesure.

Où se situe l'asymétrie

La force d’édition de Hy Image3.5 n’est pas une surprise quand on voit ce avec quoi Tencent l’a livré. L’aperçu a été rendu public avec jusqu’à cinq images de référence par requête, la génération texte-vers-image et image-vers-image dans le même modèle, ainsi que l’édition multi-tours — c’est la partie édition qui a été mise en avant au lancement. Qwen-Image-2.1 a été conçu avec une pile unifiée de génération et d’édition qui gère aussi les images de référence, mais ses lignes de tableau montrent que le côté édition termine deux points Elo en dessous du propre Qwen-Image-3.0-Pro d’Alibaba, ce qui est un résultat plus serré que ne le laissait entendre la présentation du lancement.

L'affirmation de Tencent elle-même ne correspond pas non plus à ce que montre le classement. Le fournisseur annonce pour cet aperçu un taux de victoire d'environ 30 % en évaluation à l'aveugle face à Hy Image3.0. Ce chiffre n'a été reproduit par personne en dehors de Tencent, et le classement indépendant ne le corrobore pas sur le text-to-image — où l'aperçu de Hy Image3.5, à 975, est 20 Elo en dessous du modèle à poids ouverts HunyuanImage 3.0 Instruct, à 995. Sur l'édition, la même comparaison tourne à l'avantage du fournisseur : l'aperçu de Hy Image3.5, à 1 088, est 22 Elo au-dessus de HunyuanImage 3.0 Instruct, à 1 066. Une génération de progrès sur un classement, et un pas en arrière sur l'autre, dans la propre succession de Tencent.

Screenshot of the Artificial Analysis image editing leaderboard, AA-Image-Editing v2.0, captured in English and cropped from the top row down through the Ideogram 4.5 row, showing GPT Image 2.5 Sunburst (max) first at 1,182 Elo from 17,899 samples, the Hunyuanimage 3.5 (Preview) row at rank 14 with 1,088 Elo and 5,550 appearances, the Qwen-Image-2.1 row at rank 18 with 1,074 Elo and 5,536 appearances and a No API available note, and the Hunyuanimage 3.0 Instruct row at 1,066 with No API available

L'axe des prix, où les deux ne sont pas du tout comparables

Hy Image3.5 preview est une API facturée à l’usage. Tencent Cloud facture 0,15 ¥ pour une image 2K sur l’endpoint continental et 0,024 $ US sur l’endpoint international, la facturation ne portant que sur les images renvoyées par l’API. La colonne des prix d’Artificial Analysis indique 24,00 $ pour 1 000 images, soit le même chiffre dans les unités qu’utilise le classement — et face aux 210,70 $ que la ligne de tête du classement texte-image affiche pour ces mêmes mille images, cela représente moins d’un neuvième du prix.

Qwen-Image-2.1 n'a pas de ligne de prix, parce qu'il n'a pas d'endpoint. Ses deux lignes dans le tableau portent une mention explicite Aucune API disponible. Vous n'achetez pas ce modèle ; vous le téléchargez, et vous le payez en heures de GPU et en la question de licence ci-dessous. Les 5 286 et 5 536 votes sur ses lignes viennent de personnes qui font tourner les poids elles-mêmes. Ce fait apporte aussi au classement une mise en garde qu'il vaut la peine de conserver : un Elo indépendant pour un modèle uniquement auto-hébergé mesure une population différente de celle d'un Elo pour quelque chose que n'importe qui peut appeler.

Si le plan est d'intégrer l'un ou l'autre dans un produit, la répartition pratique est désormais claire, et c'est la même répartition que le prix implique : le modèle avec le meilleur score d'édition est celui que vous louez, et le modèle avec le meilleur score de texte-vers-image est celui que vous exécutez. OrcaRouter est le côté location de cela — une API sur plus de 200 modèles avec le prix catalogue du fournisseur répercuté sans marge, basculement automatique entre fournisseurs, et un DSL de routage pour composer plusieurs modèles en un seul appel. Nous ne routons pas Hy Image3.5 preview ni Qwen-Image-2.1 ; les lignes d'images sur la plateforme sont les niveaux Imagen de Google et les aperçus d'images Gemini, le point de terminaison d'images Grok Imagine de xAI et la famille GPT-Image d'OpenAI. Aucun de ces deux n'est un premier choix dans cette liste sur la seule force d'une ligne de tableau, ce qui est exactement pourquoi la question de licence ci-dessous est celle qui décide.

L'axe pour lequel aucun des deux tableaux n'a de colonne.

Generated comparison scoreboard for Qwen-Image-2.1 and Hy Image3.5, listing editing Elo 1,074 against 1,088 with ranks 18 and 14, editing intervals 1,065 to 1,083 against 1,079 to 1,097, text-to-image Elo 1,034 against 975 with ranks 18 and 66, and the board labels Open Weights, no API for Qwen-Image-2.1 against no Open Weights and $24.00 per 1,000 images for Hy Image3.5

Qwen-Image-2.1 est publié sous la Qwen Research License Agreement, datée du 20 septembre 2026, qui n'accorde de droits qu'à des fins non commerciales et exige une licence distincte du fournisseur pour une utilisation commerciale. Les dépôts Hugging Face indiquent la licence comme autre pour cette raison — ce n'est pas une licence OSI et elle ne doit pas être interprétée comme telle. Le marqueur Open Weights sur les deux lignes du tableau est exact et ne dit rien à ce sujet.

L’aperçu de Hy Image3.5 n’a aucun poids à concéder sous licence. Tencent ne les a pas publiés ; l’aperçu est servi depuis la plateforme de Tencent elle-même et il n’existe aucune version téléchargeable de cette génération. Ce que vous obtenez, c’est une grille tarifaire, une limite d’images de référence et un service que vous pouvez démarrer et arrêter. Rien à auditer, rien à héberger, rien à négocier — et rien que vous ne conservez si Tencent change le prix ou met fin à l’aperçu.

La comparaison qui tranche réellement la question des poids ouverts est le propre prédécesseur de Tencent, plutôt que le modèle de Qwen. HunyuanImage 3.0 Instruct figure dans les deux classements avec le marqueur Open Weights — 1 066 en édition, 995 en texte-image. Qwen-Image-2.1 le surpasse dans les deux. Donc, si l'exigence est « des poids téléchargeables que je peux exécuter sur mon propre matériel », la meilleure option dans cette confrontation est celle d'Alibaba, dans l'un ou l'autre classement, sous une licence qui interdit encore la vente du résultat.

Il n’existe aucune version de cela où la paperasse se règle d’elle-même. Vous pouvez avoir le meilleur score d’édition sans poids et une facturation à l’usage, ou le meilleur score texte-image avec des poids que vous ne pouvez pas commercialiser. Choisissez la contrainte avec laquelle vous pouvez vivre, puis allez mesurer les deux sur vos propres prompts — l’écart d’édition entre eux est de quatre points d’amplitude à l’intérieur d’intervalles qui se chevauchent, le genre de marge qu’un seul ensemble de prompts mis de côté peut effacer.