
Ming-Image-0.1-Design vs Qwen-Image 2.1 : la licence est la vraie différence
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Deux modèles d'image ouverts sont sortis à trois jours d'intervalle en septembre 2026 et, à lire une fiche technique, ils ressemblent à un seul et même achat. Ming-Image-0.1-Design, développé par l'équipe inclusionAI d'Ant Group, a publié ses poids sur Hugging Face le 17 septembre sous licence MIT. Qwen-Image 2.1, de l'équipe Qwen d'Alibaba, a suivi le 20 septembre sous le Qwen Research License Agreement. Les deux produisent du RGBA natif, les deux revendiquent une sortie 2K, et les deux visent le même acheteur : une équipe qui veut une génération d'images qu'elle peut héberger, inspecter et modifier elle-même. Les deux choses qui les distinguent réellement sont précisément celles qu'une fiche technique montre le plus mal — ce que vous êtes légalement autorisé à faire du résultat, et la quantité de silicium nécessaire pour en produire un.
Ce n'est pas une formulation rhétorique. Pour l'un de ces modèles, la licence exclut catégoriquement l'usage commercial ; pour l'autre, c'est un non-sujet. Et le nombre de paramètres que chaque fournisseur imprime sur la boîte sous-estime la taille du téléchargement d'un facteur trois ou quatre. Ces deux faits déterminent l'achat bien avant que n'importe quel benchmark n'entre en jeu — et les benchmarks, d'ailleurs, ne peuvent pas du tout être comparés.
Ce que contient réellement chaque dépôt
Aucun des deux modèles n’est un réseau unique. Tous deux sont des pipelines, et c’est dans le pipeline que réside la taille :
• Générateur — Ming-Image-0.1-Design embarque un transformer de conception de 6,15 milliards de paramètres (12,31 GB en BF16) ; Qwen-Image 2.1 embarque un DiT à flux unique de 7,1 milliards de paramètres avec 32 couches, une attention causale par blocs et un nombre non divulgué de paramètres actifs (environ 14,2 GB).
• Côté texte — Ming-Image-0.1-Design associe son transformer à un LLM multimodal de 17,01 B (34,02 Go) et à un connecteur de 3,09 B (6,17 Go) ; Qwen-Image 2.1 utilise un encodeur de texte Qwen3-VL 8B (environ 17,5 Go).
• Paramètres totaux — 26,44 B pour Ming-Image-0.1-Design contre environ 15–16 B pour Qwen-Image 2.1. À noter que le chiffre phare d’aucun des deux fournisseurs ne représente le total : « 6B » et « 7B » ne décrivent tous les deux que le générateur.
• Taille du dépôt — 52,88 Go pour Ming-Image-0.1-Design (dont 49,25 Gio de poids) ; environ 33 Go pour Qwen-Image 2.1.
• Transparence — les deux produisent directement du RGBA natif à partir du modèle, plutôt que via une étape de matting a posteriori. Ming-Image-0.1-Design utilise son propre VAE RGBA ; Qwen-Image 2.1 utilise un VAE RGBA à 64 canaux avec une compression spatiale de 16×.
• Génération par défaut — Ming-Image-0.1-Design est validé en 2048×2048, 12 étapes, BF16, CFG 1.0 ; Qwen-Image 2.1 utilise par défaut 2048×2048 sur 40 étapes avec sept préréglages de rapport d'aspect.
• Licence — MIT pour Ming-Image-0.1-Design ; le Qwen Research License Agreement, non commercial, pour Qwen-Image 2.1.
L’étiquette « 6B » en fait beaucoup.
Le dépôt d'Ant Group a un titre qui annonce un modèle de 6 milliards de paramètres, et le transformer fait réellement 6,15 B. Mais les poids que vous téléchargez font 49,25 GiB, le dépôt fait 52,88 Go, et la configuration validée par le fournisseur — 2048×2048 en BF16 avec toute la pile de texte résidente — est spécifiée pour un GPU CUDA de 80 GiB. Ce n'est pas une erreur d'arrondi sur une carte de 48 Go ; c'est une carte que vous ne pouvez pas utiliser. Un accélérateur de 48 Go ne pourra pas contenir le pipeline, et deux d'entre eux ne le pourront pas non plus sans acrobaties de déport que le fournisseur ne documente pas.
Qwen-Image 2.1 est le téléchargement le plus accommodant, avec la réserve qu'Alibaba ne publie aucun chiffre officiel de VRAM. La seule indication de la fiche du modèle est d'activer le déchargement CPU sur les cartes plus modestes. Ce qui a été mesuré depuis le lancement est plus utile que ce qui a été publié : un pipeline int8 tourne autour de 16 Gio au total et tient entièrement en mémoire sur une carte de 24 Go, tandis qu'une exécution BF16 complète a été rapportée entre environ 17 Go avec déchargement CPU et environ 40 Gio en pointe à 1024×1024, selon la façon dont l'encodeur de texte est placé. La latence rapportée pour une image unique va de quelques secondes sur un B200 à moins de dix sur une carte de station de travail actuelle. Considérez chacun de ces chiffres comme une mesure de la communauté plutôt qu'une spécification — ils varient selon la stratégie de déchargement bien plus que les modèles ne diffèrent entre eux.
Le résumé pratique : Qwen-Image 2.1 est un modèle de classe 3090 si vous êtes prêt à faire de l’offloading ; Ming-Image-0.1-Design est un modèle de classe centre de données, sans configuration plus petite.
La licence est le carrefour.
C'est la partie qui arrêtera réellement un projet, et c'est celle que les deux versions traitent le plus différemment.
Ming-Image-0.1-Design est sous licence MIT. L'intégrer dans un produit payant, l'affiner, redistribuer les poids, garder vos modifications fermées — rien de tout cela ne nécessite de conversation avec Ant Group.
Qwen-Image 2.1 ne l'est pas. Il est régi par le Qwen Research License Agreement daté du 20 septembre 2026, qui concède les poids uniquement à des fins de recherche et d'évaluation. L'utilisation commerciale nécessite un accord distinct avec Alibaba, et aucun prix n'est publié pour cet accord. Les dérivés et les redistributions doivent comporter la licence, une mention « Built with Qwen » ou « Improved using Qwen » ainsi que la ligne de copyright de Hangzhou Tongyi Laboratory, et « Qwen » ne peut pas être le nom principal d'un modèle dérivé. La licence est régie par le droit chinois, avec compétence à Hangzhou.
Il y a un point qui clarifie réellement les choses dans le suivi du fournisseur lui-même : Alibaba a déclaré que les images générées ne font pas partie des « Matériaux » sous licence, donc vous conservez les droits sur ce que le modèle produit. La restriction s’applique aux poids et au modèle, pas à votre résultat. C’est une exception significative, et elle mérite d’être lue avec précision, car le résumé facile — « les images sont à vous, le modèle ne l’est pas » — est le bon.
C’est aussi un changement de direction. Les versions antérieures de Qwen-Image, y compris le Qwen-Image original ainsi que les versions 2511 et 2512, restent sous Apache 2.0 et commercialement permissives. Une équipe qui a choisi Qwen-Image l’an dernier pour sa licence et qui passe à la 2.1 ce mois-ci hérite d’une restriction réservée à la recherche qu’elle n’a jamais acceptée. Si des conditions permissives sont exigées, Qwen-Image 2.1 n’est pas la version plus récente de ce que vous aviez — c’est un accord différent.
Ce que chacun est conçu pour faire
Le clivage des licences reflète une différence d'intention, et c'est cette différence qui devrait guider le choix lorsque les deux sont des options légales pour vous.
Ming-Image-0.1-Design est un outil de conception. La pile de texte sert à transformer un court brief en un prompt structuré de 8K, et le fournisseur livre des « compétences » autour de cela — une Design Skill qui produit une ébauche visuelle en environ 15 secondes, et une PPT Skill visant une sortie au format diapositive. Son dépôt compagnon, Ming-Image-0.1-Design-Layer, prend une conception aplatie et la restitue sous forme de calques séparés, ce qui est la seule capacité ici que rien d'autre dans le domaine ouvert n'offre. inclusionAI rapporte que le modèle Layer est environ 4,3 fois plus rapide qu'un modèle open layer de 20B sur la même tâche (183 secondes contre 795) — rapporté par le fournisseur, non reproduit, et la cible de comparaison n'est pas nommée assez précisément pour être vérifiée.
Qwen-Image 2.1 est à la fois un générateur et un éditeur. Un seul checkpoint assure à la fois la génération texte-vers-image et l'édition par instruction, accepte jusqu'à 10 images de référence pour une seule édition, et prend en charge les retouches locales qui laissent le reste de l'image intact. Il est sorti avec un support dès le premier jour dans ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion et LightX2V — une offre de serving que Ming-Image-0.1-Design n'a pas encore, puisque son propre guide de serving renvoie à vLLM-Omni.
Interprétez cela comme une bifurcation plutôt qu'un classement. Si la tâche consiste à « produire une ressource de design en calques et modifiable à partir d'un brief », Ming-Image-0.1-Design est le seul des deux à le faire. Si la tâche consiste à « générer, puis modifier de manière itérative par rapport à des références », Qwen-Image 2.1 le fait dans un seul modèle et Ming-Image-0.1-Design ne le fait pas du tout.
Les benchmarks ne se comparent pas, et c’est la réponse honnête.
Les deux fournisseurs ont des chiffres. Aucun des deux chiffres ne peut être placé à côté de l’autre, et tout article qui le fait invente un résultat.
La preuve de Ming-Image-0.1-Design est un classement Artificial Analysis : première place sur le Text-to-Image Leaderboard filtré sur les poids ouverts pour le design UI/UX, avec un Elo de 1 082, devant Ideogram 4.0 Quality à 1 052, Ideogram 4.0 à 1 015, HunyuanImage 3.0 Instruct à 1 005 et FLUX.2 [dev] à 1 000. Le fournisseur rapporte également des taux de victoire de 67,4 % sur la mise en page, 67,0 % sur la composition complexe et 66,7 % sur le rendu de texte, ainsi qu'une première place sur 12 métriques sur Crello. Le classement est un instrument tiers, ce qui fait de l'Elo la plus solide des deux types de preuves ici ; les taux de victoire et la domination sur Crello sont rapportés par le fournisseur et doivent être considérés comme des allégations.

La preuve avancée par Qwen-Image 2.1 est Qwen-Image-Bench, un benchmark conçu par l’équipe Qwen, sur lequel il obtient 60,28 et occupe la première place du secteur open source, devant Nano Banana 2.0 à 59,82 et GPT Image 1.5 à 59,65. Le document source signale que le benchmark a été conçu par Qwen, et les trois premiers se tiennent à moins d’un point les uns des autres — un écart qui reste bien dans la marge de bruit d’un benchmark dont l’auteur est aussi un concurrent.
Donc : un Elo tiers sur un sous-ensemble de design UI/UX, face à un score général construit par le fournisseur. Des instruments différents, des tâches différentes, des juges différents. Personne n’a publié de comparatif direct de ces deux modèles l’un contre l’autre, et au vu des éléments disponibles, personne ne peut le faire. La lecture utile est étroite et mérite d’être énoncée clairement — Ming-Image-0.1-Design bénéficie d’une corroboration tierce sur le travail de design spécifiquement, Qwen-Image 2.1 a une force rapportée par son fournisseur sur la génération et l’édition générales, et le chevauchement entre ces deux affirmations est plus faible que ne le suggèrent les chiffres mis en avant.
Installer l’un ou l’autre sur un point de terminaison
Aucun des deux modèles ne figure aujourd'hui au catalogue d'OrcaRouter. Ming-Image-0.1-Design et Qwen-Image 2.1 sont, pour l'instant, tous deux des solutions à auto-héberger : les poids sont téléchargeables et les guides de déploiement sont bien réels, mais c'est vous qui montez le GPU, et dans le cas de Ming, ce GPU est un modèle de 80 GiB. Nous les listons ici en tant que versions à poids ouverts, et non en tant que routes.
Ce qu'il vaut la peine de savoir avant d'investir dans du matériel, c'est ce que la même charge de travail vous coûte sous forme d'appel. Nos modèles d'images routés incluent google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, les trois niveaux d'Imagen 4.0 (fast, standard et ultra), grok/grok-imagine-image et la famille GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 et openai/gpt-image-2. Faire tourner un brief de design sur l'un de ceux-ci pendant une semaine vous indique si la sortie par calques de Ming-Image-0.1-Design est une capacité dont vous avez réellement besoin, pour une fraction du coût de la carte de 80 GiB, et cela avant même que vous ne découvriez si la licence ou la VRAM allait être le point bloquant. Lorsque vous passez effectivement un modèle auto-hébergé dans un flux de production, c'est sur ce même endpoint que vit le routage — une seule clé pour plus de 200 modèles, un basculement automatique entre fournisseurs et 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur est effective chez nous le jour même de son annonce.

Qui devrait choisir lequel ?
Choisissez Ming-Image-0.1-Design si le livrable est une ressource de design et non une image : sortie en calques, expansion structurée du prompt, génération au format diapositive, et une licence qui vous permet de vendre tout ce que vous produisez avec. Prévoyez le budget pour une carte graphique sérieuse et acceptez que l’écosystème de service autour de lui soit plus restreint que du côté Qwen. C’est aussi le plus utile des deux si vous devez présenter un chiffre à un client, car sa preuve la plus solide est le seul chiffre provenant d’un tiers dans cette comparaison.
Choisissez Qwen-Image 2.1 si le flux de travail est de type générer-puis-modifier, si vous avez besoin d’un conditionnement par image de référence, ou si vous voulez l’exécuter sur du matériel que vous possédez déjà. Il est plus petit, mieux pris en charge dès le premier jour, et sa licence convient aux travaux de recherche et d’évaluation que la plupart des gens font réellement en premier. Il devient le mauvais choix dès que le résultat est commercial et que l’examen juridique est bien réel, car la seule voie vers une licence commerciale est un accord direct avec Alibaba et aucun prix publié ne permet de planifier.
Ne choisissez ni l’un ni l’autre, pour l’instant, si ce qu’il vous faut, c’est de la génération d’images en production ce mois-ci. Ces deux solutions sont des poids, et les poids constituent un engagement matériel et juridique avant d’être une capacité. La question de conception — une sortie en couches change-t-elle ce que mon équipe peut livrer — peut d’abord être tranchée sur un point de terminaison hébergé, et c’est cette réponse qui devrait déterminer si la carte de 80 GiB doit être achetée.
Que regarder
Trois choses feront bouger cette comparaison. Que Ming-Image-0.1-Design obtienne une voie de service au-delà de son propre guide vLLM-Omni, car c'est actuellement l'écart entre lui et la liste à cinq frameworks dès le jour zéro de Qwen-Image 2.1. Qu'Alibaba associe un prix à la licence Qwen commerciale, car un prix non fixé est la plus grande inconnue de ce duo. Et que quelqu'un — un laboratoire, un évaluateur indépendant ou un fournisseur n'ayant rien à perdre — confronte ces deux modèles l'un à l'autre sur les mêmes prompts. Tant que cela n'arrive pas, ce qui ressemble le plus à une comparaison équitable n'est pas un score du tout. C'est la ligne de licence, et Ming-Image-0.1-Design remporte celle-là haut la main.

