Carte hero pour la comparaison entre Qwen-Image 2.1, un modèle à poids ouverts sous licence de recherche que vous hébergez vous-même, et Nano Banana 2, un modèle sous licence commerciale dont le prix par image est publié
Guides & Insights

Qwen-Image 2.1 vs Nano Banana 2 : ce que vous payez par image, et ce que vous payez pour le posséder

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un seul de ces deux modèles affiche un prix que vous pouvez mettre dans un tableur. Nano Banana 2 — le modèle Gemini 3.1 Flash Image, disponible en version générale depuis le 28 mai 2026 — coûte environ 0,067 $ par image en 1024×1024, 0,101 $ en 2048×2048, et à peu près 0,151 $ dans la version 4K, le mode par lots revenant à environ la moitié de ce prix, l'entrée de texte étant facturée séparément à 0,25 $ par million de tokens. Qwen-Image 2.1, publié en open source par l'équipe Qwen-Image le 20 septembre 2026, n'a aucun prix à l'image, tout simplement parce qu'il n'existe aucun point de terminaison hébergé auprès duquel l'acheter : c'est un téléchargement de poids de 33 Go sous une licence de recherche qui interdit toute utilisation commerciale. La première question dans cette confrontation n'est donc pas de savoir quel modèle est le meilleur. Elle est de savoir si vous achetez des images ou une machine qui les fabrique, et ces deux achats ne sont pas comparables de la manière dont une fiche technique le laisse entendre.

La prévisibilité est ce qu’un prix par image achète réellement.

La tarification de Google est inhabituelle dans la catégorie des images par la netteté avec laquelle elle se convertit. Le modèle facture 60 $ par million de tokens de sortie, et comme la sortie d’images est tokenisée de manière prévisible, cela se traduit par des chiffres par image que vous pouvez évaluer avant même de générer quoi que ce soit.

Nano Banana 2 — environ 0,067 $ pour 1024×1024, 0,101 $ pour 2048×2048, environ 0,151 $ en 4K, à peu près la moitié de ces montants en mode batch, plus 0,25 $ par million de tokens pour l’entrée de texte. Mille images en 2K coûtent environ 101 $, prévisible au dollar près.

Qwen-Image 2.1 — aucun prix publié. Le coût correspond à votre propre temps GPU sur un ensemble de 33 Go, et le conseil de la fiche du modèle pour le matériel aux ressources limitées est le délestage du CPU via pipe.enable_model_cpu_offload(), ce qui constitue une échappatoire plutôt qu'une solution.

Ce que le prix à l’usage permet d’obtenir, ce ne sont pas seulement les images. C’est la capacité de répondre à « combien nous coûte cette fonctionnalité à dix mille images par mois » sans avoir d’abord à évaluer les performances de votre propre matériel. C’est un réel avantage, et il est facile de le sous-estimer, car l’alternative — l’auto-hébergement — a un coût vraiment difficile à calculer : il dépend de votre taux d’utilisation, de votre carte, de votre électricité, et du fait que la machine serait ou non inactive par ailleurs. La comparaison honnête n’est pas 101 $ pour mille contre gratuit. C’est 101 $ pour mille contre un chiffre amorti que vous devez calculer vous-même, et la plupart des équipes qui font le calcul constatent que le prix à l’usage est compétitif jusqu’au moment où le taux d’utilisation devient très élevé.

La licence, c'est là où les « poids libres » cessent d'être libres.

C'est la différence la plus nette entre les deux modèles, et de loin.

Nano Banana 2 est un produit commercial avec des conditions commerciales. Vous payez à l’image et vous livrez ce que vous produisez. Qwen-Image 2.1 est distribué sous le Qwen Research License Agreement daté du 20 septembre 2026, qui accorde des droits « À DES FINS NON COMMERCIALES UNIQUEMENT » et stipule que toute utilisation commerciale nécessite une licence distincte à demander auprès du fournisseur. Cela change de la précédente gamme Qwen-Image, distribuée sous Apache 2.0 — ainsi, l’option ouverte dans cette comparaison est ouverte au sens où vous pouvez la lire et l’exécuter, pas au sens où vous pouvez bâtir une entreprise dessus.

Pour une équipe de recherche, un passionné ou quiconque fait des benchmarks, c'est une licence tout à fait correcte et le téléchargement est réellement gratuit. Pour une équipe produit, cela signifie que le modèle de cette confrontation qui n'a pas de prix par image n'a pas non plus de voie commerciale, ce qui fait totalement s'effondrer la comparaison des coûts : vous ne choisissez pas entre 101 $ et quelque chose de moins cher, vous choisissez entre un modèle dont vous pouvez vendre les sorties et un autre dont vous ne le pouvez pas.

Résolution et rapports d’aspect, là où le modèle ouvert a un véritable avantage

Mettons la licence de côté : Qwen-Image 2.1 fait quelque chose que Nano Banana 2 ne fait pas, d'une manière qui compte pour certains flux de travail.

Qwen-Image 2.1 — 2K natif avec 2048×2048 comme valeur par défaut documentée à 40 étapes d'inférence, sept préréglages de rapport d'aspect, jusqu'à 10 images de référence, et une sortie RGBA : un véritable canal alpha, l'édition de calques transparents et l'extraction de sujets à partir de photos RVB.

Nano Banana 2 — sortie 4K avec prise en charge de ratios inhabituels, notamment les extrêmes 1:4 et 1:8, ce qui va plus loin que ce que la plupart des modèles proposent dans un sens comme dans l'autre, et il annonce des chiffres de cohérence de cinq personnages et quatorze objets en une seule génération.

C'est le canal alpha qu'il faut remarquer. Le modèle de Google n'est pas documenté comme produisant de la transparence, et Qwen-Image 2.1 le fait nativement, ce qui signifie que l'étape de compositing qui, autrement, serait un travail manuel — découper le sujet, conserver les bords doux, le placer sur autre chose — se trouve à l'intérieur du modèle plutôt qu'après. Si vous produisez des assets en calques pour vivre, c'est une différence de flux de travail, et non une affirmation de qualité. Il convient aussi de dire clairement que les deux modèles produisent des rendus plus grands que ce dont la plupart des travaux ont besoin : 4K et 2048×2048 dépassent tous deux le point où la contrainte est le modèle plutôt que la destination.

Two-column scoreboard for Qwen-Image 2.1 and Nano Banana 2: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Output 2048x2048 native with RGBA transparency / Aspect ratios seven presets / Reference images up to 10 / Price self-host, no hosted endpoint; Nano Banana 2 rows read GA 28 May 2026 / Licence commercial / Output up to 4K plus 1:4 and 1:8 ratios / Consistency five characters, fourteen objects, Google-reported / Independent score AA top five, both boards / Price about $0.067 per 1K image, $0.101 per 2K; footer reads 'Nano Banana 2 figures per Google and Artificial Analysis; Qwen-Image 2.1 figures vendor-reported, no independent score yet.'

Un chiffre publié face à une promesse

Le modèle de Google figure sur les deux classements d’images d’Artificial Analysis depuis le printemps et se classe parmi les cinq premiers pour la génération d’images à partir de texte et l’édition d’images dans l’instantané de septembre, autour de 1 320 Elo en génération d’images à partir de texte. Ses chiffres de cohérence — cinq personnages, quatorze objets — sont ceux de Google, mais ils côtoient un classement indépendant, ce qui signifie qu’ils peuvent être vérifiés par rapport à la façon dont le modèle se comporte réellement lors de comparaisons à l’aveugle.

Qwen-Image 2.1 n’a pas de score indépendant. Il dispose d’un article de blog d’un fournisseur avec un graphique Qwen-Image-Bench qu’aucun tiers n’a reproduit, et d’un seul rapport pratique d’accès anticipé d’un testeur du programme Qwen Ambassador qui a exécuté les poids finaux via une interface ModelScope Studio : environ 10 à 15 secondes pour la génération texte-image, 18 à 23 secondes pour l’édition, une gestion solide de la position de caméra et des rôles multi-personnages, et une cohérence multi-référence se dégradant à partir d’environ trois images d’entrée. Un seul évaluateur, aucun chronomètre affiché, aucun ensemble d’invites publié. C’est la seule observation extérieure du modèle qui existe publiquement, et elle doit être lue comme un indice plutôt qu’une mesure.

Il y a également un chiffre qui circule dans des articles de tiers, décrivant Qwen-Image 2.1 comme un transformer à 20 couches. Cela contredit la fiche du modèle, qui documente un transformer de diffusion à flux unique de 32 couches avec 7 milliards de paramètres dans le composant de génération visuelle, un encodeur de texte Qwen3-VL 8B et un VAE RGBA à 64 canaux avec une compression spatiale de 16×. Utilisez la fiche du modèle.

La seule chose que vous pouvez faire avec les deux

C'est le seul article de cette série où l'adversaire est un modèle que nous routons réellement. Nano Banana 2 est disponible sur OrcaRouter en tant que google/gemini-3.1-flash-image-preview, aux côtés du reste de la gamme d'images — la famille GPT-Image d'OpenAI, les paliers d'Imagen 4 de Google, les autres aperçus d'images Gemini et le point de terminaison d'images Grok Imagine de xAI — le tout derrière un point de terminaison compatible OpenAI, au prix catalogue du fournisseur, sans aucune marge. Qwen-Image 2.1 ne fait pas partie des modèles que nous routons, et cet article ne va pas laisser entendre le contraire.

Ce que cela signifie concrètement pour cette décision est plus étroit qu'un argumentaire de vente et plus utile qu'un tel argumentaire. Si vous voulez comparer les deux modèles sur vos propres prompts, le côté Google vous coûte une clé API et environ un dixième de centime par image en 2K, et il se trouve sur le même endpoint que tout le reste de ce que vous appelez. Le côté Alibaba vous coûte un téléchargement de 33 Go, un GPU et un examen de licence de recherche avant de pouvoir faire quoi que ce soit de commercial avec le résultat. Le basculement automatique entre fournisseurs est l'autre élément qui compte ici : une route peut porter du trafic de production sur un modèle mesuré tandis qu'un modèle non mesuré est évalué à côté, de sorte que l'évaluation ne se trouve jamais sur le chemin critique.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing Nano Banana 2 inside the top group of hosted image models at around Elo 1,320 behind GPT Image 2 (high), MAI-Image-2.6 and Reve 2.1, with no Qwen-Image 2.1 entry on the boardScreenshot of the OrcaRouter model page for google/gemini-3.1-flash-image-preview, the route that serves Nano Banana 2, captured in English and showing the model listed on the platform's OpenAI-compatible endpoint

Lequel, pour qui

Choisissez Nano Banana 2 si vous êtes en phase de livraison. Il dispose d'une licence commerciale, d'un prix que vous pouvez prévoir au dollar près, d'un score indépendant parmi les cinq meilleurs sur les deux classements, d'une sortie en 4K et de la plage de ratios la plus large de cette comparaison. Le coût de mille images en 2K est d'environ 101 $ et vous pouvez commencer à les générer cet après-midi.

Choisissez Qwen-Image 2.1 si vous faites de la recherche. Il est gratuit à télécharger, l'architecture et le prompt système de réécriture de prompt sont entièrement inspectables, il génère nativement en 2048×2048 avec une vraie transparence, et il accepte jusqu'à 10 images de référence avec des modifications locales par cercle, annotation peinte ou masque. Vous ne pouvez pas vendre ce qu'il produit, et personne n'a mesuré s'il est bon.

L’écart entre ces deux paragraphes est l’écart entre les modèles, et ce n’est pas un écart de qualité — c’est un écart de maturité, et il se comble selon un calendrier. Les testeurs en accès anticipé de Qwen ont été invités à publier des exemples ou des évaluations avant le 29 septembre 2026. Quand ils seront publiés, le modèle ouvert cessera d’être une inconnue et deviendra comparable, et la seule question qui restera sera la licence. C’est le chiffre à surveiller, et c’est un fichier de licence plutôt qu’un benchmark.