Une carte héros générée avec pour titre Qwen-Image-2.1 vs GPT-Image-2.5, montrant une carte étiquetée Qwen-Image-2.1 avec une icône de téléchargement et le texte 33 GB de poids à côté d'une carte étiquetée GPT-Image-2.5 avec une icône de cadran gradué et le texte facturé au token, avec pour légende l'un que vous téléchargez, l'autre que vous mesurez.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5 : l’écart tient à un seul chiffre, et ce n’est pas la qualité

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Mettez Qwen-Image-2.1 et GPT-Image-2.5 côte à côte sur les fiches techniques et ils ressemblent à des jumeaux : tous deux des modèles d'image unifiés de génération et d'édition, tous deux avec sortie sur fond transparent, tous deux lancés au cours des cinq dernières semaines, tous deux capables de produire des images fixes de classe 2K. La différence qui départage le choix entre eux tient à un seul chiffre, et ce n'est pas un score de benchmark. Qwen-Image-2.1 est gratuit à télécharger et impossible à vendre. GPT-Image-2.5 est impossible à télécharger et trivial à vendre. Tout le reste — l'architecture, la latence, la mise en œuvre de la transparence — découle de cela. Qwen-Image-2.1 a été publié en open source le 20 septembre 2026 ; GPT-Image-2.5 a été annoncé avec ses modèles d'API en ligne le 8 septembre 2026.

Deux façons d’ajouter de la transparence, à un mois d’intervalle

Que les deux modèles aient acquis une sortie transparente à quelques semaines d'intervalle est une coïncidence qui mérite d'être comprise, car les deux implémentations ne sont pas équivalentes.

Qwen-Image-2.1 intègre l'alpha directement dans le modèle. Il débruite dans un espace latent RGBA à 64 canaux avec une compression spatiale de 16×, de sorte que le canal alpha est un composant à part entière de ce que produit l'échantillonneur. Il n'y a ni étape de segmentation ni passe de matting. À côté de cela se trouve un ajout inhabituel : parce que le modèle peut décider, pour chaque prompt, s'il doit générer une image RVB ou une image à canal alpha, il peut aussi extraire un sujet d'une photographie ordinaire et renvoyer une couche transparente plutôt qu'un masque binaire.

GPT-Image-2.5 opte pour la voie du paramètre. L'API d'OpenAI accepte un background réglage sur auto, opaque ou transparent, et le modèle réagit en conséquence. Il s'agit d'un interrupteur de capacité sur un point de terminaison hébergé plutôt que d'une propriété de l'espace latent, et il présente l'avantage de ne pas y penser : définissez l'indicateur, obtenez un découpage, passez à la suite. Le compromis, c'est que vous obtenez ce que le point de terminaison vous donne, à la résolution et au coût que le point de terminaison décide.

Lequel est le meilleur reste véritablement en suspens. Aucune comparaison publique des bords alpha de Qwen-Image-2.1 avec un modèle de détourage dédié n’existait au moment de la rédaction, et la seule vérification publiée du côté de Qwen est fonctionnelle — la sortie PNG transparente a été validée, l’alpha est conservé sur toute la plage 0–255, avec un PSNR RGBA de 60,69 dB sur un seul échantillon. C’est un contrôle de validité, pas un verdict de qualité. Cela vous dit que le canal est bien réel.

Ce que vous pouvez réellement mesurer

Paramètres — le composant de génération de Qwen-Image-2.1 est un transformer de diffusion à flux unique de 7B et 32 couches, associé à un encodeur de texte Qwen3-VL 8B ; environ 33 Go de poids au total, dont le DiT représente environ 14 Go. OpenAI ne publie aucun nombre de paramètres pour GPT-Image-2.5.
Résolution — Qwen-Image-2.1 produit nativement jusqu'à 2048×2048 en 40 étapes d'inférence avec sept préréglages de rapport d'aspect. GPT-Image-2.5 accepte des tailles allant jusqu'à 3840×2160 et 2160×3840, chaque côté étant plafonné à 3840 px et des multiples de 16 étant exigés.
Images de référence — Qwen-Image-2.1 en accepte jusqu'à 10 pour la composition multi-sujets et l'essayage virtuel. Les modèles d'image d'OpenAI acceptent des entrées de référence pour l'édition, mais la limite pratique et le comportement de fidélité diffèrent selon le modèle et le niveau de qualité.
Latence — SGLang-Diffusion publie 2,748 s pour une génération 1024×1024 en 40 étapes sur un seul B200, et 4,74 s sur une RTX 4090 de 24 Go avec Cache-DiT et des noyaux INT8, débruitage uniquement. OpenAI indique que la variante Flare de GPT-Image-2.5 affiche une latence jusqu'à 50 % inférieure à celle de GPT-Image-2, avec un partenaire de lancement ayant mesuré un facteur de 2–4× — des chiffres rapportés respectivement par le fournisseur et par le partenaire, et non une comparaison contrôlée.
Prix — Qwen-Image-2.1 n'a pas de prix hébergé car il n'existe pas de point de terminaison hébergé ; le coût correspond à votre propre temps de GPU. GPT-Image-2.5 facture aux mêmes tarifs de jetons que GPT-Image-2 : 8,00 $ par million de jetons d'entrée d'image, 30,00 $ par million de jetons de sortie d'image, 5,00 $ par million de jetons d'entrée de texte.
Licence — Qwen-Image-2.1 est distribué sous la Qwen Research License Agreement datée du 20 septembre 2026, à usage non commercial uniquement. GPT-Image-2.5 est une API commerciale avec provenance C2PA et un filigrane invisible sur les sorties.

Une ligne de cette liste est plus fragile qu’elle n’en a l’air. OpenAI ne publie pas de prix par image pour GPT-Image-2.5, seulement des tarifs par token, et la consommation de tokens d’image varie selon la résolution et le palier de qualité. Des mesures tierces situent la fourchette d’environ 0,0059 $ à 0,712 $ par image, pour du 1K, 2K et 4K en réglages faible, moyen et élevé avec un rapport d’aspect 1:1 — utile comme ordre de grandeur, pas comme devis. Si vous faites des prévisions, construisez l’estimation à partir du nombre de tokens et de votre propre distribution de prompts, pas à partir d’un chiffre par image mesuré par quelqu’un d’autre.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

Les deux coûts que personne ne met dans la même colonne

La raison pour laquelle cette comparaison ne se prête pas à une réponse simple, c’est que les deux modèles vous facturent dans des devises différentes, et le taux de change, c’est votre propre situation.

GPT-Image-2.5 facture au token, ce qui signifie que le compteur est visible, prévisible et évolue linéairement avec le volume. C'est un véritable avantage pour un produit dont le trafic est connu : on peut l'intégrer à un budget, et une baisse de prix consentie par le fournisseur fait bouger votre coût le jour même. C'est aussi une taxe sur l'exploration, car la dixième itération d'un prompt coûte autant que la première. Le comportement input_fidelity rend cela plus flagrant que ne le suggèrent les tarifs affichés — l'API peut appliquer automatiquement une haute fidélité aux images d'entrée, ce qui consomme plus de tokens d'entrée qu'une lecture rapide de la grille tarifaire ne le laisse supposer, si bien que les boucles d'édition coûtent plus cher que les montants par image que l'on cite.

Qwen-Image-2.1 inverse ces deux propriétés. Le coût marginal de la centième génération, c'est l'électricité. Cela en fait le meilleur instrument pour l'itération, pour les remplissages rétroactifs par lots, et pour tout ce pour quoi le prompt est encore en cours de découverte. Ce qu'il ne vous donne pas, c'est un chiffre pour le tableau financier — vous payez un GPU qu'il soit occupé ou inactif — et il ne vous donne pas le droit de vendre le résultat. Le Qwen Research License Agreement autorise la recherche et l'évaluation non commerciales, et indique que le déploiement commercial exige une licence distincte de Hangzhou Tongyi Laboratory Technology. Aucun prix n'est publié pour cette licence et aucune condition n'est stipulée. Ce n'est pas une note de bas de page ; pour un pipeline commercial, c'est toute la décision.

Exécuter les deux sans un deuxième contrat

La réponse réaliste pour la plupart des équipes n’est ni l’un ni l’autre : c’est les deux. GPT-Image-2.5 gère la voie de production, où le résultat est livré à un client et où le compteur par token constitue une ligne de facturation. Qwen-Image-2.1 gère la voie d’exploration, où vous avez besoin de deux cents variantes d’une photo de produit sur fond transparent et où aucun fournisseur ne vous vendra ce volume à un prix raisonnable.

La friction, c'est que les deux arrivent par des voies complètement différentes. L'une est une clé API. L'autre est un téléchargement de 33 Go, un environnement Python et un GPU que vous possédez. OrcaRouter couvre la moitié hébergée : plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, le prix catalogue du fournisseur répercuté sans aucune marge, le basculement automatique entre fournisseurs, un DSL de routage pour exprimer les solutions de repli, et la fusion de modèles pour combiner plusieurs modèles en un seul appel. Être précis à propos de ce modèle compte — nous ne routons pas GPT-Image-2.5 aujourd'hui ; nos routes d'images OpenAI sont GPT-Image-2, GPT-Image-1.5 et GPT-Image-1-mini, toutes au prix catalogue d'OpenAI, et le jour où un fournisseur en amont ajoute les identifiants gpt-image-2.5, la même clé les appelle sans modification de code. Nous ne routons non plus aucun modèle Qwen-Image, quelle qu'en soit la version, donc Qwen-Image-2.1 n'est pas du tout une route de notre côté. Ce que la tarification en pass-through vous apporte entre-temps, c'est que lorsqu'OpenAI modifie un tarif, le chiffre de notre côté suit au lieu d'accuser un retard.

Le verdict, énoncé comme une condition plutôt qu'un vainqueur

Si la sortie doit être vendue, il n'y a pas photo : GPT-Image-2.5 est le seul des deux que vous êtes autorisé à utiliser, et le compteur de tokens est le prix de ce choix. Si la sortie relève de la recherche, de l'outillage interne ou de l'évaluation, Qwen-Image-2.1 est l'instrument le plus solide — 2K natif, alpha en sortie de l'échantillonneur, dix images de référence, et un coût marginal nul une fois le matériel amorti. Si vous avez besoin des deux, faites tourner les deux, et considérez la licence comme la frontière qui détermine dans quel pipeline un travail donné doit être orienté.

Deux choses changeraient cela. Une fiche de conditions commerciales publiée pour Qwen-Image-2.1 ferait disparaître l’écart sur la ligne de licence, qui fait actuellement l’essentiel du travail dans cette comparaison. Et une entrée indépendante dans un classement d’images pour Qwen-Image-2.1 nous dirait si le résultat Qwen-Image-Bench du fournisseur — 60,28, devant Nano Banana 2.0 à 59,82 et GPT Image 1.5 à 59,65, premier parmi les modèles ouverts — tient en dehors du laboratoire qui l’a produit. Aucune des deux n’existe encore. Tant qu’elles n’existent pas, la recommandation honnête est de se baser sur la licence et le compteur, pas sur le tableau des scores.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.