Carte hero générée pour l'article « Qwen-Image 2.1 publié discrètement », montrant une carte aux coins arrondis portant l'étiquette « Qwen-Image 2.1 » avec un marqueur de paramètres 7B, à côté de deux cartes plus petites intitulées « PE-T2I » et « PE-I2I », marquées 9B, ainsi qu'un ruban portant l'inscription « Publié discrètement, non sans annonce ».
Engineering & Research

Qwen-Image 2.1 est sorti discrètement : plongée dans Qwen/Qwen-Image-2.1-PE-I2I

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 20 septembre 2026, l'équipe Qwen-Image a mis Qwen-Image 2.1 sur Hugging Face et ModelScope — les poids, le fichier de licence, la fiche du modèle et un article de blog, tout le jour même, avec presque aucun délai de préparation en amont. Le chiffre phare est de 7 milliards de paramètres dans le composant de génération visuelle. La partie que presque personne n'a encore ouverte est Qwen/Qwen-Image-2.1-PE-I2I, l'un des deux checkpoints de réécriture de prompt livrés en même temps que le modèle d'image. Ce n'est pas le modèle d'image. C'est ce qui décide ce que signifie votre instruction avant même que le modèle d'image ne la voie — et dans cette version, c'est le composant qui définit silencieusement la langue dans laquelle votre sortie vous revient.

Ce que « livré discrètement » veut vraiment dire ici

Le choix des mots compte, car il est facile d’exagérer dans un sens comme dans l’autre. Qwen-Image 2.1 n’a pas fait l’objet d’une fuite, et il n’a pas été dévoilé sans annonce. Il existe un billet de blog du fournisseur daté du 20 septembre 2026, un dépôt GitHub avec une section actualités datée du même jour, et un téléchargement des poids accessible en ligne. Ce qu’il n’a pas eu, c’est une phase de préannonce : le seul signal préalable a été une note du 17 septembre proposant 50 places d’accès anticipé via ModelScope, les testeurs sélectionnés étant invités à publier un échantillon ou un avis avant le 29 septembre. Trois jours plus tard, les poids étaient publics. Aucune keynote, aucun embargo sur les benchmarks, aucun cycle médiatique.

C'est un type de publication bien particulier, et il vaut la peine de le nommer avec précision. L'éditeur l'a annoncé. L'éditeur ne l'a pas promu. Pour quiconque cherche à décider s'il doit construire dessus, la conséquence pratique est qu'il n'existe encore aucune évaluation indépendante sur laquelle s'appuyer — seulement les propres éléments de l'éditeur et ce que les testeurs en accès anticipé publieront au cours de la semaine à venir. Considérez chaque affirmation de qualité dans cet article comme provenant de la fiche du modèle et de l'article de blog, jusqu'à ce que quelqu'un d'extérieur à Alibaba l'exécute publiquement.

Pourquoi le checkpoint PE-I2I est celui qui est intéressant

La version Qwen-Image 2.1 contient trois éléments téléchargeables, et non un seul :

Qwen/Qwen-Image-2.1 — le modèle d'image lui-même. Un DiT mono-flux à 32 couches comptant 7 milliards de paramètres dans le composant de génération visuelle, un encodeur de texte Qwen3-VL 8B et un VAE RGBA à 64 canaux avec une compression spatiale de 16×. Environ 33 Go répartis sur les trois composants.

Qwen/Qwen-Image-2.1-PE-T2I — un réécrivain de prompts pour le texte-vers-image. Un Qwen3.5-VL 9B affiné, environ 18,8 GB.

Qwen/Qwen-Image-2.1-PE-I2I — un réécrivain de prompt pour l'édition image-à-image. Également un Qwen3.5-VL 9B affiné, également d'environ 18,8 Go, téléversé sur Hugging Face à 08:46 UTC le 20 septembre.

« PE » signifie amélioration de prompt. La variante I2I prend une instruction de modification vague ainsi qu'une ou plusieurs images d'entrée et la réécrit en une directive de modification précise et sans ambiguïté pour le modèle de diffusion en aval. La description du dépôt elle-même est sans détour sur la forme de l'entrée : une image d'entrée est toujours présente, il s'agit donc toujours d'une tâche d'édition d'image et jamais de texte-vers-image à partir de rien. Le code de réécriture se trouve dans un dossier prompt_rewrite/ qui dessert les deux checkpoints — --task t2i ou --task edit — avec un chemin transformers, un chemin vLLM, un serve.sh ainsi qu'un client.py pour un service permanent, et pe_core.py pour la logique partagée.

Voici pourquoi c’est plus important que ça en a l’air. Le modèle d’image n’a aucune idée de ce que vous vouliez dire. Il a une idée de ce que votre prompt dit littéralement, pondérée par ce que l’encodeur de texte en fait. Un réécrivain placé devant lui est l’endroit où l’ambiguïté est résolue — ou se résout mal, systématiquement, pour chaque image que vous générez. Dans un modèle unifié de génération et d’édition avec jusqu’à 10 images de référence, cette étape de résolution a plus d’occasions de se tromper que d’habitude.

Le prompt système est l'endroit où réside la décision linguistique.

Le dépôt PE-I2I fournit un system_prompt.txt en même temps que les poids, et il est étonnamment explicite sur un point : la langue. En le lisant directement, le réécrivain a pour instruction de prendre deux décisions linguistiques distinctes, et de les garder séparées.

La langue de description. La prose que le réécrivain rédige pour décrire la modification suit la langue de l'instruction de l'utilisateur — instruction en chinois, description en chinois ; instruction en anglais, description en anglais ; une instruction en japonais, en coréen, en français, en thaï ou dans toute autre langue donne lieu à une description en anglais.

La langue du texte rendu. Le texte qui sera réellement peint dans l'image de sortie, placé entre guillemets doubles, est déterminé par un ordre de priorité strict : premièrement, si l'utilisateur nomme le texte exact ou la langue cible, obéissez à cela littéralement ; deuxièmement, si l'image d'entrée contient déjà du texte, alignez-vous sur la langue dominante de ce texte existant — même lorsque l'instruction est rédigée dans une autre langue ; troisièmement, s'il n'y a pas de texte dans l'image et qu'aucune langue n'est nommée, utilisez la langue de l'instruction elle-même, et surtout ne la forcez pas en anglais.

L’invite renforce la deuxième règle avec un exemple concret — une image principalement en thaï, modifiée par une instruction en anglais qui ne nomme aucune langue, doit produire du texte thaï — et ajoute deux contraintes : le texte rendu doit être monolingue plutôt qu’une paire chinois/anglais, et un genre visuel « fiche technique » ou « storyboard » s’obtient par la mise en page et la typographie, jamais en passant les libellés rendus en anglais.

C'est un petit travail d'ingénierie avec un large rayon d'impact. Si vous générez des visuels de produits pour un marché où le texte de l'emballage compte, la différence entre « le réécriveur conserve la langue existante de l'étiquette » et « le réécriveur a la bonne idée de tout traduire en anglais » est la différence entre une ressource exploitable et une ressource rejetée. Et comme ce comportement est spécifié dans un prompt système livré dans le dépôt, vous pouvez le lire, en faire un diff et le surcharger — ce qui est plus que ce que l'on peut dire de la même étape dans un modèle hébergé fermé.

Ce qui est confirmé, et ce qui ne l'est pas

Être précis quant à la frontière, ici, est tout l’enjeu d’un article de type « ce que l’on sait ».

Confirmé à partir du dépôt et de la fiche du modèle — la valeur du DiT à flux unique de 7B / 32 couches ; l’encodeur de texte Qwen3-VL 8B ; le VAE RGBA à 64 canaux avec compression spatiale 16× ; l’attention causale par blocs avec un masque causal au niveau des tokens pour le texte et un masque bidirectionnel au niveau des chunks pour la génération d’images ; la réutilisation du cache KV de préfixe, que la fiche indique s’activer lorsque le checkpoint contient causal_condition: true (c’est le cas) ; le flow matching avec planification discrète d’Euler ; une sortie native 2K avec 2048×2048 par défaut à 40 étapes d’inférence ; sept préréglages de ratio d’aspect documentés ; la prise en charge de jusqu’à 10 images de référence ; l’édition locale par cercle, annotation peinte ou masque séparé ; et la génération RGBA, l’édition de calques transparents et l’extraction de sujet à partir de photos RVB.

C'est confirmé au sujet de la licence, et voici le point sensible — la version est régie par le Qwen Research License Agreement, daté du 20 septembre 2026, qui accorde des droits « FOR NON-COMMERCIAL PURPOSES ONLY » et précise que l'utilisation commerciale nécessite une licence distincte demandée au fournisseur. Il s'agit d'un changement substantiel par rapport à la précédente gamme Qwen-Image, distribuée sous Apache 2.0. Lisez le fichier de licence avant de bâtir un produit sur cette base, pas après.

Non confirmé — aucun score de référence indépendant n'existe encore. L'article de blog renvoie à un graphique comparatif Qwen-Image-Bench, mais les chiffres qu'il contient proviennent du fournisseur lui-même et n'avaient été reproduits par aucun tiers au moment de la rédaction. Aucun prix publié pour le point de terminaison hébergé de Qwen-Image 2.1, et aucune condition énoncée pour la licence commerciale. Et l'on ne sait pas encore si une variante sous licence permissive suivra.

Le seul point de données indépendant qui existe est un retour pratique en accès anticipé d’un testeur qui y avait accès via le programme Qwen Ambassador et a exécuté les poids de la version finale via une interface ModelScope Studio. Ce retour rapportait des temps de génération d’environ 10 à 15 secondes pour le texte-image et de 18 à 23 secondes pour l’édition, de bonnes performances sur les préréglages de position de caméra et l’attribution de rôles à plusieurs personnages, ainsi qu’un mode d’échec précis qu’il vaut la peine de connaître : la cohérence multi-références se dégradait à partir d’environ trois images d’entrée, le placement d’une queue-de-cheval sur le côté s’effondrant en une queue-de-cheval centrée sous des angles de profil. Il ne s’agit que d’un seul évaluateur, sur une interface d’accès anticipé, sans minuteur affiché. C’est un signal utile. Ce n’est pas un benchmark.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

{{1}}Prise en charge du framework dès le jour zéro{{/1}}, ce qui est la bonne nouvelle discrète

Là où un modèle atterrit le jour de son lancement en dit plus sur votre capacité réelle à l’utiliser que sa fiche de modèle, et Qwen-Image 2.1 a été largement déployé :

Diffusers — un QwenImage21Pipeline a été fusionné dès le premier jour, et le dépôt du modèle porte le tag diffusers:QwenImage21Pipeline.

ComfyUI — prise en charge native dès le jour zéro avec des modèles de workflow de génération d'images à partir de texte et d'édition d'images, ainsi qu'un dépôt de poids compatible Comfy distinct.

vLLM-Omni — exécution pas à pas, mise en cache KV des préfixes, décodage par CUDA Graph, quantification FP8 et parallélisme tensoriel/Ulysses.

SGLang — une pull request de support natif a été intégrée le 17 septembre, trois jours avant les poids, couvrant le DiT, le VAE RGBA, le conditionnement Qwen3-VL, plusieurs images de référence, et l'entrée/sortie RGBA, validée sur H200, B200, RTX PRO 6000, RTX 5090 et RTX 4090.

LightX2V — accélération dès le premier jour, ainsi que AMD Radeon via ROCm et prise en charge multi-puces via FlagOS.

La pull request SGLang de préversion est l’indice qui ne trompe pas. Une prise en charge du framework qui arrive avant les poids signifie que le chemin de service était testé contre le checkpoint, et non écrit à partir de la fiche modèle après coup. Pour un composant de 7B avec un encodeur de texte de 17,5 Go à côté, c’est la différence entre un week-end de yak-shaving et un après-midi.

Pour les GPU aux ressources limitées, la fiche du modèle recommande le délestage vers le CPU — pipe.enable_model_cpu_offload() — qui est la solution de secours standard plutôt qu'un correctif. Le téléchargement de 33 Go est dominé par l'encodeur de texte, et non par le DiT ; le transformateur de diffusion lui-même constitue la plus petite moitié de l'ensemble, avec environ 14 Go.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

La lecture pratique

Si vous voulez essayer Qwen-Image 2.1 aujourd'hui, la position honnête est que vous le pouvez, en local, sous une licence de recherche, sans benchmarks indépendants et sans droits commerciaux. C'est un compromis raisonnable pour l'évaluation et mauvais pour un pipeline de production, et l'écart entre les deux est exactement ce que décide le fichier de licence.

Pour les équipes qui évaluent des modèles d’image sans vouloir engager un chemin de production sur un checkpoint vieux de plusieurs jours, la couche de routage est l’endroit où ce risque est contenu. OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur sans marge, avec basculement automatique entre fournisseurs, de sorte qu’un modèle non éprouvé peut se trouver derrière une route aux côtés d’un modèle auquel vous faites déjà confiance plutôt que de le remplacer — et comme le prix catalogue est répercuté, une baisse de prix d’un fournisseur sur n’importe quel modèle routé est effective le jour même au lieu d’attendre une modification de contrat. Qwen-Image 2.1 ne fait pas partie des modèles que nous routons au moment de la rédaction, et cet article ne va pas laisser entendre le contraire. Ce que nous routons, c’est la gamme d’images environnante — la famille GPT-Image d’OpenAI, les niveaux Imagen 4 et les aperçus d’image Gemini de Google, et le point de terminaison d’image Grok Imagine de xAI — d’où proviendrait un chemin de basculement pendant que vous évaluez le nouveau venu sur votre propre matériel.

La question ouverte est celle à laquelle le dépôt ne peut pas répondre. Alibaba a livré un modèle d’image à poids ouverts de 7B sous une licence réservée à la recherche, la même année où il a livré Qwen-Image 3.0 comme modèle hébergé fermé, sans aucun poids. Deux versions, deux paris opposés, à quatre mois d’intervalle. Laquelle de ces deux directions le prochain modèle d’image Qwen prendra-t-il — et la licence de recherche finira-t-elle par se transformer en quelque chose qu’une entreprise peut utiliser — voilà ce qu’il faut surveiller. Les poids sont désormais sur Hugging Face, et n’importe qui peut lire le fichier de licence par lui-même.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.