
Qwen-Image 2.1 vs Meta Muse Image : le modèle que vous pouvez appeler vs le modèle que vous pouvez garder
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Il existe une version de cette comparaison qui porte sur la qualité d'image, et elle ne peut pas encore être écrite — pas honnêtement. Qwen-Image 2.1, que l'équipe Qwen-Image a publié le 20 septembre 2026, ne dispose d'aucun score indépendant, quel qu'il soit. Meta Muse Image, lancé par Meta Superintelligence Labs le 7 juillet 2026 comme le premier modèle d'image développé en interne par Meta, a été évalué — il occupe la troisième place du classement d'édition d'images d'Artificial Analysis avec un Elo d'environ 1 105, figure parmi les cinq premiers pour la génération d'images à partir de texte, et se situe sur la frontière de Pareto qualité-prix à 10 $ par millier d'images. Mais la question la plus utile à propos de ces deux modèles n'est pas de savoir lequel est le meilleur. C'est ce que vous êtes autorisé à faire avec chacun d'eux, et ces réponses sont presque parfaitement inversées.
L’accès et l’inspectabilité sont deux choses différentes, et personne n’offre les deux.
Meta Muse Image est celui que vous pouvez appeler. Depuis août 2026, il est accessible via le Model API de Meta lui-même à un tarif forfaitaire de 0,01 $ par image — environ 10 $ les mille — via un point de terminaison compatible OpenAI, ce qui marque un vrai changement par rapport à la description du modèle lors de son lancement en juillet, alors qu'aucune voie d'accès développeur n'existait du tout. Ce tarif forfaitaire est inhabituel dans une catégorie où presque tout le reste est facturé en tokens, et il rend la prévision des coûts triviale : mille images, c'est dix dollars, qu'elles soient simples ou élaborées.
Qwen-Image 2.1 est celui que vous pouvez garder. Il s'agit d'un téléchargement de poids — environ 33 Go répartis entre le transformer de diffusion, l'encodeur de texte et le VAE — publié sous le Qwen Research License Agreement daté du 20 septembre 2026, qui accorde des droits « À DES FINS NON COMMERCIALES UNIQUEMENT » et exige une licence distincte pour un usage commercial. Il n'y a pas de point de terminaison hébergé. Il n'y a pas de forfait. Rien n'est caché non plus : vous pouvez lire l'architecture, lire le prompt système de réécriture des prompts, en faire un diff, le surcharger et faire tourner le tout sur votre propre matériel.
Donc le compromis n’oppose pas la qualité à la qualité. Il oppose un modèle mesuré, à l’usage comptabilisé et sous licence commerciale, que vous ne possédez pas, à un modèle gratuit, non mesuré et non commercial, que vous possédez entièrement. Très peu d’équipes peuvent choisir l’un ou l’autre camp sans renoncer à quelque chose.
Pourquoi Muse n'est pas tout à fait un modèle de diffusion au sens habituel
Ce qui rend Meta Muse Image inhabituel, c'est qu'il ne se contente pas de générer. Il fonctionne en boucle : il peut rechercher sur le web, écrire et exécuter du code, et passer en revue sa propre production avant de renvoyer une image. C'est la description qu'en donne Meta, et c'est pourquoi ce modèle est intéressant plutôt que simplement compétitif — c'est dans les étapes agentiques que l'ambiguïté des prompts se résout, et qu'une demande comme « fais-moi un graphique des chiffres de cette année » peut recevoir une vraie réponse plutôt qu'une approximation.
C'est aussi pourquoi son comportement est plus difficile à appréhender. Un modèle d'image conventionnel est une fonction allant du prompt aux pixels. Un modèle agentique a une trajectoire, et cette trajectoire n'est pas quelque chose qu'on peut lire sur une fiche de modèle. Les chiffres rapportés par le fournisseur — 94 % de cohérence des personnages multi-images, jusqu'à 10 images de référence, une sortie jusqu'à 1 600 pixels sur le côté le plus long — décrivent l'enveloppe, pas la boucle.
Qwen-Image 2.1 résout le même problème d'ambiguïté de manière opposée : explicitement, et au grand jour. Aux côtés du modèle d'image, la publication embarque deux points de contrôle de réécriture de prompt — Qwen/Qwen-Image-2.1-PE-T2I et Qwen/Qwen-Image-2.1-PE-I2I, chacun étant un Qwen3.5-VL 9B affiné d'environ 18,8 Go — qui prennent une instruction vague et la réécrivent en une directive précise avant que le modèle de diffusion ne la voie. La variante I2I dispose toujours d'une image d'entrée, il s'agit donc toujours d'une tâche d'édition. Et surtout, le comportement du réécrivain est spécifié dans un system_prompt.txt fourni dans le dépôt, ce qui signifie que l'étape qui décide de ce que votre prompt signifie est quelque chose que vous pouvez lire et modifier.
La boucle agentique de Meta et le réécrivain de prompt d'Alibaba sont tous deux des réponses à « le modèle ne sait pas ce que vous vouliez dire ». L'une est un service qui décide à votre place. L'autre est un fichier que vous pouvez modifier.
À quoi ressemblent les chiffres quand un seul côté en a
Meta Muse Image figure sur les deux classements d’images d’Artificial Analysis. Il est troisième en édition d’images avec environ 1 105 Elo, derrière MAI-Image-2.6 à 1 122 et GPT Image 2 (high) à 1 117, et il est dans le top cinq pour la génération d’images à partir de texte avec environ 1 116 Elo. À 10 $ les mille images, il se situe sur la frontière de Pareto qualité-prix, ce qui est la position utile : pas le meilleur modèle du classement, mais l’un des rares où payer plus vous en donne mesurablement plus.
Qwen-Image 2.1 n’a rien de tout cela. Il dispose d’un article de blog de fournisseur avec un graphique Qwen-Image-Bench qu’aucun tiers n’a reproduit, et d’un seul rapport pratique — un testeur en accès anticipé du programme Qwen Ambassador qui a exécuté les poids finaux via une interface ModelScope Studio et a rapporté environ 10 à 15 secondes pour la génération texte-image et 18 à 23 secondes pour l’édition, la cohérence multi-référence se dégradant à partir d’environ trois images d’entrée. Un seul évaluateur, aucun chronomètre, aucun jeu de prompts. C’est un signal utile et ce n’est pas un benchmark, et la manière honnête de l’interpréter est comme un indice sur l’endroit où le modèle pourrait se situer plutôt que comme une preuve de l’endroit où il se situe.
Là où Qwen-Image 2.1 est concrètement en avance, ce n'est pas sur la qualité, mais sur les capacités au niveau du pixel : une sortie 2K native en 2048×2048 par défaut, 40 étapes d'inférence, sept préréglages de ratio d'image, jusqu'à 10 images de référence, des retouches locales par cercle, annotation dessinée ou masque distinct, et une génération RGBA avec édition de calques transparents et extraction de sujet à partir de photos RGB. Le modèle de Meta plafonne à 1600 pixels et ses capacités en matière de transparence ne sont pas publiées. Si vous avez besoin d'un véritable canal alpha en natif, la décision est déjà prise pour vous.

Le tarif forfaitaire est la partie qui mérite réflexion.
Un centime fixe par image est une décision de tarification, pas une décision technique, et cela change la finalité du modèle. Une tarification des images au token pénalise la complexité : une instruction longue accompagnée de plusieurs images de référence coûte plus cher qu'une instruction courte, ce qui signifie que le coût d'une image est couplé à sa difficulté. Avec un tarif fixe, ce couplage disparaît, et le comportement rationnel change avec lui — vous cessez d'optimiser les prompts en fonction de leur longueur et commencez à utiliser le modèle comme il a été conçu pour être utilisé, la boucle agentique et les images de référence faisant leur travail.
C'est aussi le type de tarification que seule une entreprise servant son propre modèle peut offrir, ce qui mérite d'être mentionné lorsque vous choisissez un fournisseur. OrcaRouter place plus de 200 modèles derrière un seul point de terminaison compatible OpenAI au prix catalogue du fournisseur, sans marge, avec un basculement automatique entre fournisseurs et un DSL de routage qui compose plusieurs modèles en un seul appel. La propriété pertinente ici est la répercussion : comme nous facturons le prix catalogue du fournisseur plutôt qu'un prix majoré, un changement de tarification d'un fournisseur — l'apparition d'un tarif forfaitaire, la baisse d'un tarif par token — est effectif de notre côté le jour même au lieu d'attendre un contrat. Ni Meta Muse Image ni Qwen-Image 2.1 ne figurent parmi les modèles que nous routons aujourd'hui, et cet article ne va pas laisser entendre le contraire ; les modèles d'image que nous proposons sont la famille GPT-Image d'OpenAI, les niveaux Imagen 4 de Google et les aperçus d'image Gemini, ainsi que le point de terminaison d'image Grok Imagine de xAI.
Le contraste qui compte pour cette comparaison, c’est que l’un de ces deux modèles a un prix, tout court. Meta Muse Image coûte 0,01 $ par image, prix publié, sur une API que vous pouvez appeler cet après-midi. Qwen-Image 2.1 coûte un téléchargement de 33 Go, un GPU que vous possédez déjà, et un examen juridique d’une licence qui stipule « non commercial uniquement ».
Là où ils convergent accidentellement
Les deux modèles acceptent jusqu’à 10 images de référence. Ce n’est pas tant une coïncidence qu’une industrie qui s’accorde sur une réponse : dix suffit pour une fiche de personnage, un ensemble de produits ou un pack de références de style, et au-delà, le conditionnement cesse d’aider et commence à nuire. Meta publie un chiffre de cohérence de personnage multi-images de 94 % pour son modèle ; Alibaba ne publie aucun équivalent, et le seul rapport pratique indépendant suggère que la cohérence commence à se dégrader autour de la troisième image de référence. Deux modèles revendiquant la même enveloppe avec des preuves radicalement différentes derrière, c’est toute la comparaison en miniature.
Ils convergent aussi sur le problème qu’aucun des deux n’a résolu : aucun des deux ne vous donne les deux. Meta Muse Image ne peut être téléchargé, inspecté ou exécuté sur votre propre matériel, et sa boucle agentique est une boîte noire par construction. Qwen-Image 2.1 ne peut pas être vendu, ne peut pas être appelé et ne peut encore être évalué par rapport à quoi que ce soit. Si votre contrainte est une échéance, l’un des deux est utilisable dès aujourd’hui. Si votre contrainte est un examen de conformité ou le besoin de comprendre exactement ce que fait votre pipeline, c’est l’autre.


Choisissez en fonction de ce que vous devez faire ensuite, pas de ce qui est meilleur.
Si vous devez livrer de la génération d'images ce trimestre sous une licence commerciale, avec un modèle mesurable derrière, Meta Muse Image est la réponse, et 0,01 $ par image est un chiffre que vous pouvez inscrire dans un budget. Si vous devez comprendre un modèle d'image de bout en bout — le masquage de l'attention, le réécrivain de prompt, le VAE, la licence — Qwen-Image 2.1 est le seul des deux qui vous le permet, et il ne tient qu'à une licence de recherche d'être inutilisable pour tout autre usage. Aucun des deux choix n'est un compromis sur la qualité, car la question de la qualité reste ouverte d'un côté. Elle se refermera quand suffisamment de personnes exécuteront Qwen-Image 2.1 en public pour le faire figurer sur un tableau, et il a été demandé aux testeurs en accès anticipé de publier avant le 29 septembre. C'est à cette date que cette comparaison devient réellement pertinente.
