Une carte de présentation générée pour l'article « Qwen-Image 2.1 vs Qwen-Image 3.0 », montrant deux cartes de modèle aux coins arrondis intitulées « Qwen-Image 2.1 » et « Qwen-Image 3.0 », avec les repères de date 20 sept. 2026 et 21 juil. 2026, une icône de téléchargement sur l'une et une icône de nuage sur l'autre, ainsi qu'un ruban portant la mention « Le nombre le plus bas correspond au modèle le plus récent ».
Guides & Insights

Qwen-Image 2.1 vs Qwen-Image 3.0 : le numéro le plus bas est le modèle le plus récent

Auteur

Rowan Sterling

Date de publication

Retour à tous les articles

Commençons par ce qui trompe tout le monde. Qwen-Image 2.1 est plus récent que Qwen-Image 3.0. L'éditeur a publié Qwen-Image 3.0 le 21 juillet 2026 et l'a fait passer en disponibilité générale le 5 août. Il a publié Qwen-Image 2.1 le 20 septembre 2026 — sept semaines plus tard, et une version mineure inférieure. La numérotation n'est pas une séquence ; ce sont deux gammes de produits différentes qui partagent un nom, et le fait le plus utile à propos de l'une comme de l'autre est qu'elles adoptent des positions opposées sur la question qui détermine si vous pouvez bâtir sur elles. Qwen-Image 3.0 est fermé et hébergé, sans poids, sans licence ni rapport technique. Qwen-Image 2.1 est à poids ouverts, téléchargeable dès aujourd'hui, sous une licence de recherche qui n'autorise que l'usage non commercial.

Deux produits qui, par hasard, portent le même nom

La famille Qwen-Image a désormais pris trois positions de licence distinctes en quatorze mois, et les exposer dissipe l’essentiel de la confusion :

Qwen-Image 1.0 et 2.0 — Poids ouverts sous Apache 2.0 sur Hugging Face et ModelScope, rapports techniques le jour du lancement, auto-hébergeable, affinable, quantifiable.

Qwen-Image 3.0 — fermé. Aucun poids, aucune licence déclarée, aucune fiche modèle, aucun rapport technique, aucun tableau de référence publié. Accessible uniquement via une API hébergée, en éditions Pro et Standard.

Qwen-Image 2.1 — de nouveau des poids ouverts, mais sous l'accord de licence Qwen Research daté du 20 septembre 2026, qui accorde des droits « À DES FINS NON COMMERCIALES UNIQUEMENT » et renvoie l'utilisation commerciale à une licence négociée séparément.

Lisez cela comme un motif plutôt qu’une chronologie, et la silhouette est claire : Alibaba ne considère plus « open » comme un binaire. Qwen-Image 2.1 n’est ni la version permissive que 1.0 et 2.0 étaient, ni la version fermée que 3.0 a été. C’est une troisième position — des poids que l’on peut inspecter, exécuter et modifier, avec une condition commerciale vissée à l’entrée.

Ce qu'est réellement chaque modèle

Qwen-Image 2.1 — un modèle unifié de génération texte-image et d’édition d’image, avec 7 milliards de paramètres dans sa composante de génération visuelle, construit comme un DiT à flux unique de 32 couches. Un encodeur de texte Qwen3-VL 8B et un VAE RGBA à 64 canaux avec une compression spatiale 16× l’accompagnent ; le téléchargement complet fait environ 33 Go, l’encodeur de texte représentant plus de la moitié. Attention causale par blocs avec un masque causal au niveau des tokens pour le texte et un masque bidirectionnel au niveau des segments pour la génération d’images, plus la réutilisation du cache KV de préfixe pour l’édition multi-images. Natif 2K, par défaut 2048×2048 en 40 étapes, avec sept préréglages de rapport d’aspect.

Qwen-Image 3.0 — un modèle hébergé fermé en éditions Pro et Standard, assurant la génération et l'édition d'images via une seule API. La communication de lancement d'Alibaba annonce des prompts allant jusqu'à environ 4 500 tokens, un texte lisible jusqu'à environ 10 pixels, et une couverture de 12 langues sur plus de 20 polices, avec une sortie allant jusqu'à 2048×2048 et jusqu'à six images par appel. Aucun nombre de paramètres n'a été publié ; le chiffre d'environ 20B MMDiT largement répété est rapporté plutôt que confirmé.

La différence architecturale qui compte le plus en pratique n’est pas la taille — c’est l’endroit où le modèle s’exécute et ce que vous pouvez lui faire. Qwen-Image 2.1 arrive sous forme de fichiers que vous pouvez inspecter, quantifier, affiner sur des données privées et exécuter sur votre propre matériel, avec une pull request de prise en charge SGLang fusionnée trois jours avant même l’arrivée des poids. Qwen-Image 3.0 arrive sous forme de point de terminaison. Vous ne pouvez pas le quantifier, vous ne pouvez pas l’affiner, et vous ne pouvez pas l’exécuter ailleurs que là où Alibaba l’exécute.

C’est dans l’édition que les deux divergent le plus radicalement.

Les deux modèles assurent la génération et l’édition au sein d’un seul système, aussi la comparaison intéressante porte-t-elle sur les spécificités de l’édition — et ici, le modèle plus récent et plus petit est le plus capable sur le papier.

Images de référence — Qwen-Image 2.1 accepte jusqu'à 10 références en entrée. La documentation Pro de Qwen-Image 3.0 mentionne la prise en charge de 1 à 3 images en entrée.

Contrôle des modifications locales — Qwen-Image 2.1 prend en charge les cercles, les annotations peintes et un masque distinct fourni comme entrée à part, afin que l'image d'origine reste sans marquage. Le parcours d'édition documenté de Qwen-Image 3.0 couvre la réécriture locale, l'extension de contenu, le transfert de style et la génération multi-angles de caméra, sans flux de travail basé sur un masque publié.

Transparence — Qwen-Image 2.1 génère et modifie nativement des images RGBA, modifie le texte à l'intérieur d'un calque transparent et extrait un sujet d'une photographie RVB vers un calque transparent. L'annonce de Qwen-Image 3.0 ne mentionne aucune prise en charge de la transparence.

Réécriture de prompt — Qwen-Image 2.1 est livré avec deux checkpoints de réécriture dédiés, tous deux des modèles Qwen3.5-VL 9B affinés, l'un pour le texte-vers-image et l'autre pour l'édition, avec le code de réécriture et le prompt système publiés. La gestion des prompts de Qwen-Image 3.0 est une boîte noire derrière l'API.

Écosystème — Qwen-Image 2.1 bénéficie d'une prise en charge dès le premier jour dans Diffusers, ComfyUI, vLLM-Omni, SGLang et LightX2V, ainsi que de voies AMD ROCm et FlagOS. Qwen-Image 3.0 dispose d'une API.

Cette dernière ligne n'est pas une fioriture rhétorique. Pour une équipe dont le pipeline vit dans ComfyUI ou dont la pile d'inférence est vLLM, la différence entre un modèle avec une classe de pipeline fusionnée et un modèle avec un point de terminaison HTTP est la différence entre une tâche d'intégration et une réécriture.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs Qwen-Image 3.0 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Released: 20 Sep 2026; Licence: research, non-commercial; Access: 33 GB open download; Reference images: up to 10; Transparency: native RGBA; Published price: none. Right column 'Qwen-Image 3.0': rows reading Released: 21 Jul 2026, GA 5 Aug; Licence: not published; Access: closed hosted API; Reference images: 1 to 3; Transparency: none claimed; Published price: ~$0.04 Pro, $0.03 Std. Footer reads 'Qwen-Image 2.1 specs per vendor model card, unaudited; Qwen-Image 3.0 pricing is vendor list, unaudited.'

Le prix, et ce que le prix ne capture pas

Qwen-Image 3.0 est le seul des deux à avoir un prix publié : sur le cloud du fournisseur, Pro est affiché à environ 0,04 $ par image et Standard à environ 0,03 $, avec une tarification grand public locale à partir d'environ 0,18 ¥. Ce sont des chiffres de lancement et ils n'ont pas été audités de manière indépendante. Qwen-Image 2.1 n'a aucun tarif d'hébergement publié — c'est un téléchargement, et le coût correspond à ce que vous coûte votre propre temps de GPU.

Ces deux lignes ne sont pas comparables, et prétendre le contraire est l’erreur la plus courante dans cette comparaison. Un prix par image couvre le modèle, l’infrastructure de service, la mise à l’échelle et la disponibilité assurée par quelqu’un d’autre. Un téléchargement de poids ne couvre rien de tout cela. La bonne question n’est pas de savoir quel chiffre est le plus petit ; c’est de savoir si vous avez la capacité opérationnelle de faire tourner une pile de modèles de 33 Go, et si la licence de l’option bon marché autorise ce que vous prévoyez d’en faire.

Ce qui ramène la licence au centre de la comparaison, là où elle a sa place. Les conditions de Qwen-Image 3.0 ne sont pas publiées, ce qui pose problème en soi pour les travaux réglementés ou réalisés en agence — il n'y a aucun document à citer. Les conditions de Qwen-Image 2.1 sont publiées, et elles stipulent une utilisation non commerciale. Entre une licence peu claire et une licence clairement restrictive, c'est la restrictive qui est la plus facile à anticiper, car au moins on sait à quoi s'en tenir.

A screenshot of the Qwen vendor blog page for Qwen-Image 3.0, captured September 20 2026, showing the launch announcement, the Pro and Standard edition descriptions, the claimed prompt-length and text-rendering figures, and the per-image list pricing.

Lequel devriez-vous choisir

Vous avez besoin d'images de production riches en texte et vous préférez que quelqu'un d'autre s'en charge — Qwen-Image 3.0 est le choix qui convient, avec la réserve que ses chiffres phares en matière de rendu de texte sont des affirmations du fournisseur et que les tests indépendants existants indiquent que le texte en petite police reste encore brouillé dans certains cas.

Vous devez exécuter le modèle vous-même, l'affiner ou conserver les données sur votre propre matériel — Qwen-Image 2.1 est la seule option des deux, et la licence de recherche est le prix d'entrée.

Vous avez besoin de ressources transparentes, de détourages de produits ou de plus de trois images de référence — Qwen-Image 2.1, d'après les spécifications publiées, est l'outil le plus performant, et l'écart est loin d'être mince en matière de nombre de références.

Vous avez besoin de droits commerciaux et de licences permissives — aucun de ces deux n'est votre modèle. Qwen-Image 3.0 n'a absolument aucune condition publiée, et Qwen-Image 2.1 nécessite une licence commerciale négociée. Les versions Apache-2.0 de cette famille sont les précédentes Qwen-Image 1.0 et 2.0.

Cette dernière ligne est celle sur laquelle il vaut la peine de s’attarder, car elle décrit un ensemble qui se réduit. Une licence déjà accordée ne change pas rétroactivement, de sorte que les versions Qwen-Image sous Apache-2.0 restent utilisables selon leurs conditions d’origine. Mais si vous prévoyez un pipeline d’images commercial en partant de l’hypothèse que la plus récente version de Qwen-Image sera sous licence permissive, les trois dernières versions constituent des preuves allant à l’encontre de cette hypothèse.

Exécuter l'un ou l'autre sans miser tout le pipeline dessus

Ces deux modèles sont, pour des raisons différentes, difficiles à placer derrière un chemin de production aujourd'hui — l'un à cause d'une licence, l'autre à cause d'une boîte noire et d'un nombre de paramètres non publié. C'est précisément la situation pour laquelle une couche de routage est conçue. OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans marge, avec un basculement automatique entre fournisseurs et un DSL de routage qui vous permet de composer plusieurs modèles en un seul appel, de sorte qu'un modèle nouveau ou peu commode puisse se trouver à côté d'un modèle éprouvé plutôt que devant lui. La fusion de modèles pousse la même idée plus loin, en exécutant un panel de modèles ensemble et en vous permettant de les comparer sur vos propres prompts plutôt que sur un graphique de lancement.

Ni Qwen-Image 2.1 ni Qwen-Image 3.0 ne figurent parmi les modèles que nous routons aujourd’hui, et cet article ne laissera pas entendre le contraire. Les modèles d’image que nous routons — la gamme GPT-Image d’OpenAI, les paliers Imagen 4 de Google et les aperçus d’image Gemini, ainsi que le point de terminaison d’image Grok Imagine de xAI — sont ce à partir de quoi un chemin de basculement serait réellement construit pendant que vous évaluez le duo Qwen selon vos propres critères.

Ce qu’il faut surveiller est plus étroit qu’il n’y paraît. Alibaba a désormais démontré qu’il livrera des poids ouverts, des modèles fermés hébergés et des téléchargements sous licence de recherche au sein de la même famille et au cours du même trimestre. La prochaine version ne vous dira pas quelle formule l’a emporté. Le fichier de licence, si.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.