
Qwen-Image-2.1 vs Grok Imagine Image 2.0 : des poids gratuits face à un environnement payant
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
L'un ne coûte rien par image et s'accompagne d'une licence qui interdit la vente du résultat. L'autre coûte entre deux et six cents par image selon l'endroit où vous l'achetez, n'impose aucune restriction de ce type et figure dans les classements que vous pouvez réellement consulter. Qwen-Image-2.1 a été rendu public le 20 septembre 2026 sous forme de poids ouverts, sous une licence de recherche. Grok Imagine Image 2.0 est le point de terminaison d'images payant de l'éditeur, distribué via sa propre API et divers fournisseurs tiers. Le choix entre les deux ne relève pas de la qualité : il tient à ce que vous voulez posséder le modèle ou louer l'environnement qui l'entoure, et cet environnement fournit plus de travail que ne le laisse supposer le prix.
Ce que coûte une image de chaque côté
Le prix de Qwen-Image-2.1 est nul par image et non nul une seule fois. Vous téléchargez environ 33 Go — un transformer de diffusion à flux unique de 7B et 32 couches, d'environ 14 Go, plus un encodeur de texte Qwen3-VL 8B qui constitue l'essentiel du reste — et ensuite, le coût marginal d'une image se résume à l'électricité nécessaire pour la générer. Sur une carte aux ressources limitées, la fiche du modèle recommande le déchargement vers le CPU via pipe.enable_model_cpu_offload(), qui est la solution de repli standard et vous coûte de la vitesse plutôt que de l'argent.
Le prix de Grok Imagine Image 2.0 présente un profil inverse. La documentation officielle de xAI indique 0,04 $ par image générée pour le modèle phare, 0,02 $ pour le point de terminaison d'image Grok Imagine de base et 0,05 $ pour le niveau de qualité. Les fournisseurs tiers se situent dans une fourchette similaire, avec leurs propres paliers : l'un affiche des tarifs forfaitaires de 0,05 $ pour la génération d'images à partir de texte et de 0,06 $ pour l'édition, quelles que soient la résolution ou le réglage de qualité ; un autre annonce 0,045 $ forfaitaire en 1K comme en 2K pour son niveau de qualité ; et un troisième propose 0,025 $ pour la génération d'images à partir de texte ou l'édition par référence avec jusqu'à cinq images d'entrée. Sur l'ensemble du marché, cela se situe autour de 0,02 $ à 0,06 $ par image, l'accès grand public étant inclus dans X Premium et SuperGrok plutôt que facturé à l'image.
• Modèle de coût — Qwen-Image-2.1 représente un coût matériel et de téléchargement fixe, avec un coût marginal nul par image ; Grok Imagine Image 2.0 est purement marginal, évoluant linéairement avec le volume, indéfiniment.
• Seuil de rentabilité — le point de bascule est une question de volume que vous pouvez calculer, et il change chaque fois qu’un fournisseur modifie un tarif. À quelques milliers d’images par mois, la solution hébergée est bien moins chère que l’achat d’un GPU ; à volume élevé et soutenu, la solution locale gagne sur le coût et perd sur tous les autres axes.
• Ce que vous ne pouvez pas acheter du côté local — les limites de débit, la disponibilité et l’équipe d’exploitation de quelqu’un d’autre. Ce que vous ne pouvez pas acheter du côté hébergé, ce sont les poids.
Ce que les classements disent, et ce qu’ils ne disent pas
Grok Imagine Image 2.0 avance des revendications de classement public. Le matériel de lancement de xAI citait la deuxième place au classement général sur les tableaux Text-to-Image et Image Edit Arena en date du 7 août 2026, derrière GPT Image 2 — il s'agit d'un instantané daté, cité par le fournisseur, et il doit être lu comme tel. Les traqueurs tiers, dans les semaines qui ont suivi, l'ont situé autour de la deuxième place en édition d'image et de la troisième en text-to-image, là encore derrière GPT Image 2, avec des chiffres Elo dans les 1 300 bas et certains sites de suivi rapportant des valeurs plus proches de 1 173–1 175. L'écart entre ces chiffres est en soi la leçon : les positions dans les classements de cette catégorie évoluent d'une semaine à l'autre, et un rang sans date associée n'est pas une information.
Qwen-Image-2.1 n’a aucun classement du tout. Il était absent des classements d’images indépendants au moment de la rédaction. Son seul chiffre de qualité est le graphique Qwen-Image-Bench propre au fournisseur, où il affiche 60,28 contre Nano Banana 2.0 à 59,82 et GPT Image 1.5 à 59,65 — un document du fournisseur, non reproduit par un tiers. Le seul point de données véritablement indépendant est la vérification fonctionnelle publiée parallèlement aux travaux d’intégration SGLang : la sortie PNG transparente a été validée, la couche alpha a été conservée sur toute la plage 0–255, et le PSNR RGBA mesurait 60,69 dB sur un seul échantillon que les auteurs décrivent explicitement comme une vérification de correction plutôt qu’une garantie de qualité.
Donc, le tableau de bord honnête est le suivant : un modèle a un classement public qui bouge et une affirmation de fournisseur qui y est attachée, et l’autre a une fiche d’évaluation de fournisseur et un test d’intégration réussi. Ce n’est pas une comparaison, et aucun article qui prétend le contraire n’a exécuté les deux.

Alpha, et pourquoi c'est la seule asymétrie technique
La transparence de Qwen-Image-2.1 est intégrée au modèle. Un VAE RGBA à 64 canaux avec une compression spatiale de 16× signifie que le canal alpha fait partie de l'espace latent soumis au débruitage, ce qui vous offre trois choses à partir d'un seul mécanisme : la génération avec transparence, l'édition à l'intérieur d'une image déjà dotée de transparence sans devoir l'aplatir au préalable, et l'extraction de sujet à partir d'une photographie RVB ordinaire, qui renvoie un canal alpha plutôt qu'un masque binaire. Pas de nœud de suppression d'arrière-plan, pas de modèle de matting, pas de nettoyage des contours — c'est ce qu'affirme le fournisseur, et la vérification fonctionnelle SGLang est la seule preuve indépendante que ce canal est bien réel et non nominal.
Grok Imagine Image 2.0 n’a pas d’équivalent documenté. Son périmètre publié se limite à la génération d’images à partir de texte et à l’édition par référence, avec des paliers de résolution et de qualité, et jusqu’à cinq images d’entrée chez certains fournisseurs. Si votre asset nécessite un sujet détouré avec des bords semi-transparents propres — cheveux, verre, fumée —, vous ajoutez une étape de matte du côté de Grok et non du côté de Qwen. Savoir si cette étape coûte plus cher que le casse-tête de licence de l’autre côté est la véritable question d’ingénierie, et cela dépend de votre sujet.
Un environnement d'édition versus un point de contrôle
Les deux systèmes ne sont pas d’accord sur l’endroit où devrait résider l’intelligence d’édition.
Grok Imagine Image 2.0 le met en service. Vous envoyez une image de référence et une instruction, le fournisseur décide ce que cela signifie, et les paliers de résolution et de qualité sont choisis à chaque requête. Il n’y a rien à lire, rien à régler et rien à casser — ce qui constitue un véritable avantage pour une équipe qui ne souhaite pas gérer un pipeline diffusers. C’est aussi la raison pour laquelle le prix varie selon le fournisseur pour ce qui est censé être le même modèle : vous achetez un environnement, pas seulement des poids.
Qwen-Image-2.1 le place dans des checkpoints que vous pouvez inspecter. Aux côtés du modèle d'image, il embarque deux modèles de réécriture de prompts — PE-T2I et PE-I2I, chacun un Qwen3.5-VL 9B affiné d'environ 18,8 Go — avec le code de réécriture dans un prompt_rewrite/ dossier et un system_prompt.txt fourni qui précise, entre autres, comment est choisie la langue du texte rendu. C'est là un niveau d'inspectabilité qu'aucune API d'image hébergée n'offre. C'est aussi 37,6 Go de réécriture en plus du modèle, ce qui représente un coût réel en espace disque et en temps de chargement pour un composant que la plupart des pipelines considéreront comme facultatif.
• Surface d'édition — Qwen-Image-2.1 prend en charge les retouches locales par cercle, annotation au pinceau ou masque distinct, ainsi que l'édition par calque transparent et l'extraction de sujet ; l'édition documentée de Grok Imagine Image 2.0 repose sur une image de référence.
• Entrées de référence — Qwen-Image-2.1 accepte jusqu'à 10 images de référence, un évaluateur en accès anticipé signalant une dégradation de la cohérence multi-référence à partir d'environ trois images ; plusieurs fournisseurs de Grok documentent jusqu'à cinq images d'entrée.
• Résolution native — Qwen-Image-2.1 génère nativement en 2K, avec 2048×2048 comme valeur par défaut à 40 étapes sur sept préréglages de format ; la résolution de Grok Imagine Image 2.0 est un choix par requête facturé par le fournisseur.
Distribution et la licence
C'est ici que les deux divergent le plus nettement, et ce n'est pas du tout une différence technique.
Grok Imagine Image 2.0 est disponible via l'API de xAI et auprès de plusieurs fournisseurs tiers indépendants, ce qui implique une concurrence sur les prix, et donc un tarif que vous payez qui est un tarif du marché plutôt qu'un tarif catalogue. Il n'y a pas de téléchargement, pas de GPU, pas de fichier de licence à lire, et aucune restriction d'utilisation commerciale au-delà des conditions propres du fournisseur.
Qwen-Image-2.1 n'est disponible que d'une seule façon : le télécharger. Il est distribué sous le Qwen Research License Agreement daté du 20 septembre 2026, qui n'accorde de droits qu'à des fins non commerciales et indique que l'utilisation commerciale exige une licence distincte, à demander au fournisseur. C'est un durcissement par rapport à la précédente gamme Qwen-Image, qui était distribuée sous Apache 2.0, et c'est le seul fait qui détermine la plupart des décisions réelles entre ces deux. Un studio qui les compare sur la qualité des résultats répond à la mauvaise question ; le studio qui ne peut pas utiliser Qwen-Image-2.1 pour des missions clients ne les compare même pas.
OrcaRouter, c'est là que réside le versant loué de cet arrangement. Nous routons plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, au prix catalogue du fournisseur et sans aucune marge, avec bascule automatique entre fournisseurs, un DSL de routage et la fusion de modèles — ainsi une route d'image peut désigner un principal et un secours plutôt que de parier sur l'après-midi d'un seul fournisseur. Nous routons le point de terminaison d'image xAI Grok Imagine, mais attention à la version : notre catalogue contient grok/grok-imagine-image, et non Grok Imagine Image 2.0 ; le modèle plus récent n'est donc pas quelque chose que nous pouvons vous servir actuellement. Nous ne routons non plus aucun modèle Qwen-Image, quelle que soit la version, si bien que Qwen-Image-2.1 est réservé au local. La gamme d'images routées que nous proposons réellement comprend la famille GPT-Image d'OpenAI, les paliers Imagen 4 de Google et les aperçus d'image Gemini, ainsi que ce plus ancien point de terminaison d'image Grok Imagine ; comme le prix catalogue est répercuté sans marge, une baisse de prix d'un fournisseur sur l'un d'eux s'applique le jour même.

Qu’est-ce qui changerait cette réponse ?
Trois choses, et toutes les trois sont plausibles en l’espace d’un trimestre.
• Une licence commerciale pour Qwen-Image-2.1. Si le fournisseur publie des conditions à un prix qu'un studio acceptera de payer, l'avantage de transparence et le coût marginal nul deviennent tous deux exploitables dans un travail commercial, et cette comparaison change complètement de forme. Aujourd'hui, il n'existe ni prix publié ni conditions énoncées.
• Un benchmark indépendant de Qwen-Image-2.1. Un tiers qui reproduirait les chiffres de Qwen-Image-Bench du fournisseur, ou qui placerait le modèle sur un classement public d'images, transformerait la seule question encore ouverte — est-il réellement bon — en une question tranchée.
• Un mouvement tarifaire du côté de Grok. La concurrence entre fournisseurs a déjà produit un écart de 0,02 $ à 0,06 $ pour un modèle nominalement identique. Une baisse durable ferait de la voie hébergée l'option par défaut pour davantage de tranches de volume qu'elle ne l'est actuellement.
Jusqu’à ce que l’une de ces options se concrétise, ce qui départage n’est ni la qualité ni le prix. C’est de savoir si vous avez besoin de l’alpha et pouvez composer avec une licence non commerciale, auquel cas vous le téléchargez et payez en matériel ; ou si vous devez livrer et voulez que quelqu’un d’autre fasse tourner le modèle, auquel cas vous payez à l’image et ne pensez plus jamais à un VAE.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
