Carte hero pour la comparaison entre Qwen-Image 2.1 et LLaDA-Image-Turbo, opposant la licence réservée à la recherche de Qwen à celle non déclarée de LLaDA-Image-Turbo, et un transformer de diffusion 7B à 40 étapes à un modèle distillé 6B à 4 étapes
Guides & Insights

Qwen-Image 2.1 vs LLaDA-Image-Turbo : deux modèles d'image ouverts, deux licences très différentes

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles d'image à poids ouverts sont sortis en l'espace des mêmes trois semaines. L'équipe Qwen-Image a publié Qwen-Image 2.1 le 20 septembre 2026 — les poids, le fichier de licence, la fiche du modèle et un billet de blog, tous le même jour, avec pratiquement aucune anticipation en amont. Seize jours plus tôt, le 4 septembre 2026, inclusionAI (le laboratoire de recherche d'Ant Group) publiait LLaDA-Image-Turbo sans article de lancement, sans communiqué de presse et sans aucune forme d'annonce. Les deux sont téléchargeables aujourd'hui. Ni l'un ni l'autre ne dispose du moindre score de benchmark indépendant. Et la différence qui décidera réellement lequel vous pouvez utiliser ne figure dans aucune des deux fiches de modèle — elle est dans la paperasse. Qwen-Image 2.1 est distribué sous une licence de recherche qui interdit purement et simplement l'usage commercial. LLaDA-Image-Turbo est distribué sans qu'aucune licence ne soit déclarée sur aucun de ses dépôts.

La question de la licence vient en premier, car c’est la seule qui appelle une réponse claire.

Commencez ici, car tout le reste dans cette comparaison est provisoire, et ceci ne l'est pas.

Qwen-Image 2.1 est publié sous le Contrat de licence Qwen Research, daté du 20 septembre 2026, qui accorde des droits « À DES FINS NON COMMERCIALES UNIQUEMENT » et précise que toute utilisation commerciale nécessite une licence distincte à demander auprès du fournisseur. Il s'agit d'un changement majeur par rapport à la précédente gamme Qwen-Image, qui était distribuée sous Apache 2.0. C'est sans ambiguïté : vous pouvez le lire, l'évaluer, le tester comparativement et écrire à son sujet. Vous ne pouvez pas l'intégrer dans un produit.

LLaDA-Image-Turbo ne déclare aucune licence du tout. Ni permissive, ni restrictive, ni même un simple espace réservé. Un dépôt sans licence n'est « libre d'utilisation » en aucun sens juridique — par défaut, tous droits sont réservés, ce qui est une position plus stricte que la licence de recherche de Qwen, et non plus souple. Si vous comptez vous appuyer dessus, c'est une question à poser au laboratoire, pas à un README.

L’ironie mérite d’être dite sans détour : le modèle arrivé avec une licence formelle et restrictive est celui autour duquel vous pouvez planifier dès aujourd’hui, parce que vous savez exactement où vous en êtes. Le modèle sans licence est celui autour duquel vous ne pouvez pas planifier.

Screenshot of the Qwen vendor blog page for Qwen-Image-2.1, captured in English, headlined 'Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation', dated 2026/09/20, with download links to GitHub, Hugging Face and ModelScope and the four headline improvements listed as compact and efficient, native transparency with unified creation and editing, versatile editing with up to 10 reference images, and realistic textures

Ce que sont réellement les deux modèles

Faites abstraction des licences : il s'agit de deux conceptions véritablement différentes, conçues pour des raisons différentes.

Architecture — Qwen-Image 2.1 est un transformateur de diffusion à flux unique de 32 couches, avec 7 milliards de paramètres dans le composant de génération visuelle, un encodeur de texte Qwen3-VL 8B et un VAE RGBA à 64 canaux offrant une compression spatiale de 16×, soit environ 33 Go pour l'ensemble. LLaDA-Image-Turbo est un modèle unifié de génération et d'édition de 6 milliards de paramètres — un seul ensemble de poids qui accomplit les deux tâches, plutôt qu'un modèle de base auquel s'ajoute un chemin d'édition distinct.

Étapes d'inférence — Qwen-Image 2.1 utilise par défaut une résolution de 2048×2048 à 40 étapes avec le flow matching et la planification discrète d'Euler. LLaDA-Image-Turbo est distillé via Twin-DMD jusqu'à 2–4 étapes, 4 étant recommandé, et fonctionne avec une échelle de guidage de 1,0 contre 5,0 pour le modèle Base.

Options de précision — Qwen-Image 2.1 publie la prise en charge de la quantification FP8 via son chemin vLLM-Omni. LLaDA-Image-Turbo fournit ses points de contrôle BF16 et FP8 sous forme de téléchargements distincts.

Conditionnement de référence — Qwen-Image 2.1 accepte jusqu'à 10 images de référence, prend en charge les retouches locales par cercle, annotation au pinceau ou masque distinct, et génère du RGBA natif avec édition de calques transparents. La fiche de LLaDA-Image-Turbo ne publie aucune limite d'images de référence.

Attention — Qwen-Image 2.1 utilise une attention causale par blocs : un masque causal au niveau des tokens pour le texte et un masque bidirectionnel au niveau des blocs pour la génération d'images, avec réutilisation du cache KV de préfixe lorsque le checkpoint comporte causal_condition: true. La fiche de LLaDA-Image-Turbo ne décrit pas son schéma de masquage avec autant de détails.

Licence — à des fins de recherche uniquement et explicite, par opposition à non déclarée.

Notez ce que signifient les nombres d’étapes, conjointement avec les nombres de paramètres. Qwen-Image 2.1 est un modèle plus grand exécuté sur dix fois plus d’étapes ; LLaDA-Image-Turbo est un modèle plus petit distillé jusqu’à une poignée d’étapes. Ce sont des paris opposés sur l’endroit où se situe le coût de la génération d’images, et la bonne réponse dépend entièrement de si votre goulot d’étranglement est les secondes-GPU par image ou le plafond de ce à quoi une image peut ressembler.

Économie de la vitesse : 40 étapes contre 4

Le nom Turbo n'est pas là pour rien ici. La distillation Twin-DMD réduit une trajectoire de diffusion à quelques grands sauts, ce qui explique pourquoi LLaDA-Image-Turbo peut être exécuté en 4 étapes là où son modèle Base réclame un calendrier conventionnel. À un guidage de 1,0, il saute aussi le guidage sans classifieur, qui double normalement le nombre de passes avant par étape — l'écart effectif est donc plus large que ne le suggère à lui seul le rapport 40 contre 4.

Ce que cela vous apporte, c'est du débit et de la prévisibilité. Un modèle 6B à quatre étapes est le genre de chose qui tient sur une seule carte grand public et produit une image d'ébauche assez vite pour s'intégrer dans une boucle interactive. Qwen-Image 2.1 à 40 étapes et en 2048×2048 est une configuration axée sur la qualité avant tout ; la recommandation de la fiche du modèle pour du matériel limité est le délestage CPU via pipe.enable_model_cpu_offload(), ce qui constitue une solution de secours plutôt qu'un correctif.

Le contrepoids, c'est que la distillation est une compression des capacités, et rien ici n'a été mesuré par quiconque en dehors des deux laboratoires. Le seul point de données indépendant qui existe pour l'un ou l'autre modèle est une évaluation pratique en accès anticipé de Qwen-Image 2.1 réalisée par un testeur du programme Qwen Ambassador, qui a exécuté les poids finaux via une interface ModelScope Studio et a rapporté environ 10 à 15 secondes pour la génération texte-vers-image et 18 à 23 secondes pour l'édition. Il s'agit d'un seul évaluateur, sur une interface en accès anticipé, sans chronomètre affiché — un signal utile, pas un benchmark. LLaDA-Image-Turbo ne dispose, lui, d'aucun rapport pratique comparable rendu public.

Two-column scoreboard for Qwen-Image 2.1 and LLaDA-Image-Turbo: Qwen rows read Release 20 Sept 2026 / Licence research-only, non-commercial / Architecture 32-layer DiT, 7B generation component / Steps 40 at 2048x2048 / Reference images up to 10 / Independent score none yet; LLaDA-Image-Turbo rows read Release 4 Sept 2026 / Licence undeclared on any repo / Architecture 6B unified gen+edit / Steps 2-4, recommended 4 / Reference images not published / Independent score none yet; footer reads 'Both sets of figures vendor-reported; neither model has an independent benchmark score.'

C’est dans l’édition que les deux designs divergent le plus.

Les deux modèles font de la génération d'images à partir de texte et de l'édition, mais ils y parviennent différemment, et la différence se manifeste dans la plomberie plutôt que dans le résultat.

Qwen-Image 2.1 traite le suivi d'instructions comme un composant distinct et inspectable. Aux côtés du modèle d'image, la version inclut deux checkpoints de réécriture de prompt — Qwen/Qwen-Image-2.1-PE-T2I et Qwen/Qwen-Image-2.1-PE-I2I, chacun étant un Qwen3.5-VL 9B affiné d'environ 18,8 Go — qui prennent une instruction vague et la réécrivent en une directive non ambiguë avant que le modèle de diffusion ne la voie. La variante I2I comporte toujours une image d'entrée ; il s'agit donc toujours d'une tâche d'édition et jamais d'une génération à partir de rien. Point crucial, le réécrivain est livré avec un system_prompt.txt que vous pouvez lire et surcharger, et il est particulièrement explicite concernant la langue : la langue de description suit votre instruction, tandis que la langue du texte peint dans l'image est déterminée par un ordre de priorité strict qui préserve la langue des libellés existants de l'image d'entrée, même lorsque vous formulez votre prompt dans une autre langue.

C'est un petit travail d'ingénierie aux vastes répercussions. Si vous produisez des visuels produits pour un marché où le texte de l'emballage compte, « le réécrivain préserve la langue existante de l'étiquette » et « le réécrivain traduit aimablement tout en anglais » font la différence entre un asset exploitable et un asset rejeté — et comme il réside dans un prompt système plutôt que dans une boîte noire hébergée, vous pouvez le comparer et le modifier.

LLaDA-Image-Turbo fait le compromis inverse : un seul modèle 6B, un seul jeu de poids, génération et édition qui partagent tout. Moins de pièces mobiles, moins de choses à configurer, et rien à inspecter ni à surcharger. Sa fiche cite des chiffres Qwen-Image-Bench de 53,53 en anglais et 53,38 en chinois avec une revendication de SOTA open source — rapportés par le fournisseur, non reproduits, et notez que le benchmark qu'il remporte porte le nom du modèle avec lequel il est implicitement en concurrence.

Sur quoi vous les exécuteriez effectivement

Le support de l’écosystème le jour du lancement est la partie la moins glamour d’une sortie, et celle qui décide si vous y passez un après-midi ou un week-end.

Qwen-Image 2.1 a été largement déployé : un QwenImage21Pipelinefusionné dans Diffusers dès le jour zéro ; prise en charge native de ComfyUI avec des modèles de workflows de génération d'images à partir de texte et d'édition d'images ; vLLM-Omni avec exécution par étapes, mise en cache KV par préfixe, décodage CUDA Graph, quantification FP8 et parallélisme tensoriel/Ulysses ; une pull request de prise en charge native de SGLang qui a abouti le 17 septembre — trois jours avant les poids — couvrant le DiT, le VAE RGBA, le conditionnement Qwen3-VL et l'entrée multi-référence, validé sur H200, B200, RTX PRO 6000, RTX 5090 et RTX 4090 ; et une accélération dès le jour zéro via LightX2V avec AMD Radeon via ROCm et une prise en charge multi-puces via FlagOS.

LLaDA-Image-Turbo a bénéficié du support de ComfyUI le 7 septembre 2026, trois jours après les poids, ainsi que d'une distribution Diffusers et Safetensors. C'est un vrai moyen de l'exécuter, mais c'est un moyen plus limité, et il n'y a pas de travail équivalent de serving en pré-version à citer.

La pull request SGLang en pré-version constitue l'indice révélateur pour Qwen-Image 2.1. Un support de framework qui arrive avant les poids signifie que quelqu'un testait le chemin de service contre le checkpoint, et non qu'il l'écrivait après coup à partir de la fiche du modèle.

Screenshot of the Hugging Face repository page for inclusionAI/LLaDA-Image-Turbo, showing the inclusionAI organisation, the model name and its Text-to-Image, Diffusers and Safetensors tags, and the opening of the model card describing LLaDA-Image as a unified model for high-quality image generation and editing

Le chemin hébergé que vous conservez parallèlement à l’expérience

Aucun de ces modèles n’est routable via OrcaRouter au moment de la rédaction, et cet article ne laissera pas entendre le contraire — les deux sont des propositions d’auto-hébergement, l’une sous une licence qui exclut la production et l’autre sans aucune licence. Ce qui compte pour une équipe qui les évalue, c’est que l’évaluation n’ait pas à se trouver sur le chemin critique.

OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans marge, avec bascule automatique entre fournisseurs et un DSL de routage qui vous permet de combiner plusieurs modèles en un seul appel. Concrètement, pour cette décision, cela prend la forme d'une route où le modèle auquel vous faites déjà confiance porte le trafic de production pendant qu'un checkpoint auto-hébergé est testé à côté — et comme le prix catalogue est répercuté tel quel, sans marge, tout changement de tarif d'un fournisseur sur un modèle routé est effectif de notre côté le jour même, au lieu d'attendre un avenant au contrat. Les modèles d'image que nous routons aujourd'hui sont la famille GPT-Image d'OpenAI, les paliers Imagen 4 et les aperçus d'image Gemini de Google, ainsi que le point de terminaison d'image Grok Imagine de xAI. Si vous comptez passer une semaine à monter un transformer de diffusion de 33 Go pour savoir s'il surpasse un modèle hébergé, le modèle hébergé est le groupe de contrôle, et il vaut la peine d'avoir déjà le groupe de contrôle sur une clé.

Qu'est-ce qui changerait cette comparaison

Trois choses, par ordre de l'importance qu'elles auraient.

Premièrement, un score de référence indépendant pour l’un ou l’autre des modèles. Ni l’un ni l’autre n’en a, et tant que cela ne changera pas, toute affirmation de qualité dans les deux camps revient à un laboratoire qui corrige ses propres copies. Deuxièmement, une licence : une variante permissive de Qwen-Image 2.1 en ferait le choix par défaut évident pour le travail ouvert sur l’image à 7B, et toute licence déclarée, quelle qu’elle soit, sur LLaDA-Image-Turbo le rendrait au moins planifiable. Troisièmement, les testeurs en accès anticipé du programme ModelScope de Qwen du 17 septembre ont été invités à publier des échantillons ou des avis avant le 29 septembre — soit dans huit jours. C’est alors que cela cessera d’être une comparaison entre deux fiches de modèle pour devenir une véritable comparaison. D’ici là, le résumé honnête est que Qwen-Image 2.1 est le modèle qui semble le plus capable, mais que vous ne pouvez pas commercialiser, LLaDA-Image-Turbo est le plus rapide, mais que vous ne pouvez pas du tout utiliser sans une conversation, et le fichier de licence est la seule partie de l’une ou l’autre version qui soit entièrement réglée.