Carte héro affichant « Qwen-Image-2.1 vs GPT Image 2 » avec le sous-titre « Téléchargez-le gratuitement, ou louez celui qui est classé » et trois lignes : Qwen-Image-2.1 téléchargement de 33 Go non commercial, GPT Image 2 API uniquement facturée au token, Transparence : VAE RGBA vs un paramètre de requête, à côté d'une icône de flèche de téléchargement et de compteur.
Guides & Insights

Qwen-Image-2.1 vs GPT Image 2 : Téléchargez-le gratuitement, ou louez le meilleur

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen-Image-2.1 est un téléchargement de 33 Go que vous pouvez exécuter gratuitement et que vous ne pouvez pas vendre. GPT Image 2 est une API que vous ne pouvez pas télécharger du tout, facturée au token, quatre mois après sa mise en production et en tête des classements d'images indépendants. Ces deux faits constituent tout le compromis, et le plus intéressant, c'est que la fonctionnalité de transparence — ce qui fait que Qwen-Image-2.1 vaut le coup d'œil au départ — est arrivée sur les deux systèmes à un mois d'intervalle, par des voies totalement différentes. Qwen-Image-2.1 est sorti le 20 septembre 2026 avec l'alpha intégré à son espace latent. GPT Image 2 a gagné un background: "transparent" paramètre le 20 août 2026 en tant qu'indicateur d'API.

Deux voies vers la même fonctionnalité

La sortie transparente est la raison pour laquelle la plupart des gens finissent par comparer ces deux-là, alors commencez par là, car les implémentations ne sont pas équivalentes et la différence compte davantage que la sortie.

La transparence de Qwen-Image-2.1 est architecturale. Un VAE RGBA à 64 canaux avec une compression spatiale de 16× signifie que l'alpha fait partie de l'espace latent dans lequel le modèle effectue son débruitage. Le même mécanisme vous offre la génération avec transparence, l'édition à l'intérieur d'une image qui possède déjà de la transparence sans l'aplatir, et l'extraction de sujet à partir d'une photographie RVB ordinaire, qui renvoie un canal alpha plutôt qu'un masque binaire. Il s'agit d'une seule capacité aux trois usages, et selon la présentation du fournisseur lui-même, aucun nœud distinct de suppression d'arrière-plan, modèle de détourage ni passe de nettoyage des contours n'est nécessaire.

La transparence de GPT Image 2 est un paramètre de requête. L'ajout de background: "transparent" aux côtés de output_format: "png" renvoie une image avec un véritable canal alpha, et cela fonctionne pour la génération d'images à partir de texte, l'édition d'images et l'outil de génération d'images de la Responses API. L'inpainting basé sur un masque et les arrière-plans transparents peuvent être combinés. Il a été publié en Preview, donc les propres recommandations d'OpenAI indiquent que les résultats peuvent être instables — et l'édition avec transparence est décrite comme le fait de redessiner ou de supprimer un arrière-plan plutôt que comme un détourage précis des contours. Au moins deux sources secondaires affirment que le paramètre n'est pas disponible et que GPT Image 2 ne produit pas du tout de transparence ; celles-ci contredisent la couverture médiatique de l'annonce, les miroirs de la documentation de l'API et les tests tiers, donc considérez-les comme obsolètes ou erronées plutôt que comme un contre-signal. La transparence ne change pas le coût en tokens — pour une qualité et une taille données, une image transparente et une image opaque consomment le même nombre de tokens d'image.

Donc les deux produisent de l'alpha. L'un le fait parce que le modèle a été conçu ainsi ; l'autre parce qu'un paramètre le demande au service. Savoir lequel est meilleur dépend entièrement de si l'alpha doit survivre à une boucle d'édition, et cela se teste en un après-midi.

Ce que vous rapporte la longueur d'avance de GPT Image 2

Quatre mois en production n'est pas un argument marketing, c'est un écart de maturité, et cela se manifeste dans des endroits ennuyeux et décisifs.

Indépendance avérée — GPT Image 2 occupe le sommet des classements indépendants d'images et s'y maintient depuis assez longtemps pour qu'il s'agisse d'une position stable et non d'un pic de semaine de lancement. Qwen-Image-2.1 était totalement absent de ces classements au moment de la rédaction de ce document.
Modes de défaillance documentés — un modèle utilisé publiquement pendant quatre mois dispose d'un corpus de cas d'échec connus que vous pouvez consulter avant de les rencontrer. Un modèle rendu public hier n'a qu'une fiche d'évaluation du fournisseur et un seul test d'intégration.
Surface opérationnelle — des limites de débit par paliers exprimées à la fois en jetons par minute et en images par minute (de 100 000 TPM et 5 IPM au palier d'entrée jusqu'à 8 000 000 TPM et 250 IPM au palier le plus élevé), plus la prise en charge du point de terminaison par lots. C'est la différence entre une démo et une file d'attente que vous pouvez dimensionner.
Chiffres de qualité fournis par un tiers — la position dans le classement est mesurée de manière indépendante. Le seul chiffre de Qwen-Image-2.1 provient du graphique Qwen-Image-Bench du fournisseur lui-même, où il affiche 60,28 contre Nano Banana 2.0 à 59,82 et GPT Image 1.5 à 59,65. Source fournisseur, non reproduite.

Le seul point de données véritablement indépendant sur Qwen-Image-2.1 est la vérification fonctionnelle publiée avec l’intégration SGLang : la sortie PNG transparente a été validée, l’alpha a été conservé sur toute la plage 0–255, le PSNR RGBA mesuré était de 60,69 dB sur un seul échantillon, et les configurations FP8 ont réussi la génération de PNG transparents. Les auteurs de SGLang déclarent explicitement qu’il s’agit d’un contrôle de correction et non d’une garantie de qualité générale. C’est la preuve la plus solide disponible que le canal alpha est réel. Cela ne dit rien sur la qualité des images.

Le projet de loi, examiné en détail

GPT Image 2 est facturé au token, ce qui signifie que le coût d'un actif dépend du niveau de qualité et de la résolution d'une manière qu'un prix par image masque. Les tarifs catalogue publiés sont de 5,00 $ par million de tokens d'entrée de texte, 8,00 $ par million de tokens d'entrée d'image et 30,00 $ par million de tokens de sortie d'image, les tarifs des entrées mises en cache étant respectivement de 1,25 $ et 2,00 $. OpenAI ne publie pas de table statique des tokens de sortie pour ce modèle — l'ancien tableau couvrant les volumes de tokens Faible, Moyen et Élevé est explicitement signalé comme ne s'appliquant pas à GPT Image 2 — les chiffres ci-dessous sont donc des mesures tierces des tarifs catalogue en rapport d'aspect 1:1, en texte-vers-image :

Sortie 1K — qualité faible : 0,0059 $, qualité moyenne : 0,053 $, qualité élevée : 0,211 $ par image.
Sortie 2K — qualité faible : 0,012 $, qualité moyenne : 0,107 $, qualité élevée : 0,428 $.
Sortie 4K — qualité faible : 0,020 $, qualité moyenne : 0,178 $, qualité élevée : 0,712 $.

L'écart entre la qualité faible et la qualité élevée à résolution identique est d'un facteur d'environ trente-cinq. C'est la véritable décision au sein d'un pipeline GPT Image 2 : non pas quel modèle, mais quel niveau de qualité passe la revue au coût le plus bas. Et cela interagit avec l'édition d'une manière qui prend les gens au dépourvu — input_fidelityne peut pas être ajusté sur ce modèle, car il traite automatiquement chaque image d'entrée en haute fidélité, de sorte qu'une requête d'édition comportant des images de référence consomme plus de jetons d'entrée d'image que ce que vous estimeriez d'après la taille de la sortie. Les boucles générer-inspecter-éditer sont donc plus coûteuses ici que ne le suggèrent les chiffres par image.

En revanche, le coût marginal par image de Qwen-Image-2.1 est l’électricité. Le hic, ce sont le coût fixe et la licence. Trente-trois gigaoctets à télécharger, un DiT d’environ 14 Go, le reste revenant à l’encodeur de texte Qwen3-VL 8B, un déport CPU recommandé sur les cartes à ressources limitées, et le tout sous la Qwen Research License Agreement datée du 20 septembre 2026 — à usage non commercial uniquement, les droits commerciaux faisant l’objet d’un arrangement séparé, sans prix ni conditions publiés pour ceux-ci.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Où se situe l'option hébergée

Il existe une voie médiane qui évite à la fois la question du GPU et celle de la licence, et c'est celle que la plupart des équipes empruntent réellement. OrcaRouter route la famille GPT-Image d'OpenAI aux côtés des paliers d'Imagen 4 de Google, des aperçus d'images Gemini et du point de terminaison d'images Grok Imagine de xAI — plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, le prix catalogue du fournisseur répercuté sans marge, un basculement automatique entre fournisseurs, un DSL de routage et la fusion de modèles. Parce que le prix catalogue est répercuté plutôt que majoré, une baisse de prix d'un fournisseur sur n'importe quel modèle routé est effective le jour même, et parce que le basculement est automatique, un fournisseur qui passe un mauvais moment ne devient pas votre panne. Qwen-Image-2.1 ne fait pas partie des modèles que nous routons, et aucune autre version de Qwen-Image non plus — c'est une proposition purement locale — donc il ne s'agit pas d'un argumentaire pour le nouveau venu. C'est la réponse honnête à « qu'est-ce que j'utilise pendant que j'évalue le nouveau venu ? »

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

La décision, clairement énoncée

Choisissez GPT Image 2 si le résultat est à usage commercial, si vous avez besoin d’un seuil minimal de qualité mesuré indépendamment, si vous voulez des coûts par élément que vous pouvez prévoir et plafonner, ou s’il vous faut que cela fonctionne cette semaine sans acheter de matériel. Acceptez que vous louez, que vous ne pouvez pas le fine-tuner, que vous ne pouvez pas l’exécuter hors ligne et que le coût par image évolue linéairement avec le volume, pour toujours.

Choisissez Qwen-Image-2.1 si le rendu est destiné à la recherche, à l'évaluation ou à un usage personnel, si vous voulez spécifiquement un alpha qui survit à une boucle d'édition plutôt qu'un alpha qu'un paramètre a produit une seule fois, si vous voulez lire la logique de réécriture — les checkpoints PE-T2I et PE-I2I livrés sont des modèles Qwen3.5-VL 9B affinés, accompagnés d'un system_prompt.txt lisible, ce qui est bien plus que ce que vous offre n'importe quelle API d'image hébergée — ou si vous voulez simplement savoir ce qu'un modèle d'image 7B à poids ouverts peut faire en septembre 2026 sans payer à l'image pour le découvrir.

Ne choisissez ni l'un ni l'autre et acheminez-le si le livrable est commercial et que la date limite est réelle. Ce n'est pas une dérobade ; c'est l'option qui ne vous oblige pas à résoudre une question de licence pour laquelle vous ne pouvez pas encore obtenir de réponse.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.