
Qwen-Image-2.1 vs Nano Banana 2 Lite : 340 $ pour dix mille images, ou 13 heures de GPU
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dix mille images de 1024 pixels sur Nano Banana 2 Lite coûtent environ 340 $. Dix mille images produites par Qwen-Image-2.1 coûtent à peu près treize heures sur un GPU de 24 Go, plus une licence qui vous interdit d'en vendre la moindre. Voilà l'arbitrage en une phrase, et c'est la seule comparaison de cette famille où les deux modèles font réellement le même travail au même moment. Qwen-Image-2.1 est passé en open-weights le 20 septembre 2026. Nano Banana 2 Lite — l'identifiant du modèle chez le fournisseur google/gemini-3.1-flash-lite-image, officiellement Gemini 3.1 Flash-Lite Image — a été lancé le 30 juin 2026 et est le générateur d'images fixes le moins cher de la gamme Nano Banana.
Les deux candidats, au prix honnête
Nano Banana 2 Lite génère une image 1K en environ quatre secondes, soit environ 2,7× plus rapide que Gemini 3.1 Flash Image, et facture 0,034 $ forfaitaire par image 1K. Les tarifs de jetons de Google derrière ce chiffre sont de 0,25 $ par million de jetons d'entrée et de 30 $ par million de jetons de sortie d'image, ce qui équivaut à environ 0,0336 $ en 1K ; le mode batch divise ce montant par deux, à environ 0,0168 $. Il n'existe pas d'offre gratuite, et chaque sortie porte un filigrane SynthID invisible.
Qwen-Image-2.1 n’a pas de prix, car il n’y a rien à acheter. Il s’agit d’un téléchargement d’environ 33 Go — un transformer de diffusion à flux unique de 7B et 32 couches, associé à un encodeur de texte Qwen3-VL 8B — que vous servez vous-même. Ce qui se rapproche le plus d’une grille tarifaire, ce sont les latences mesurées de SGLang-Diffusion : 4,74 secondes pour la passe de débruitage sur une RTX 4090 de 24 Go avec Cache-DiT et des noyaux INT8, 8,23 secondes pour une génération complète en 1024×1024 à 40 étapes sur une RTX PRO 6000 Blackwell, avec une empreinte mémoire de pointe de 40,1 Gio, et 2,748 secondes sur un seul B200. Il s’agit de latences pour une requête unique, incluant les composants mentionnés, et non de chiffres de débit ; considérez donc les 13 heures pour dix mille images comme un ordre de grandeur plutôt que comme un benchmark.
Mettez-les côte à côte et le calcul n’est pas « 340 $ contre gratuit ». C’est 340 $ contre treize heures sur une carte que vous possédez déjà ou que vous louez, plus le temps d’ingénierie nécessaire pour monter une pile de service. Le volume de basculement est bien plus faible que ne le supposent la plupart des équipes — mais seulement si la carte ne reste pas inactive le reste du mois, et seulement si le résultat est quelque chose que vous êtes autorisé à produire.
Trois charges de travail, et quel modèle prend chacune
Le volume est le mauvais axe à lui seul. Le type de travail en décide plus vite.
• Ressources à l'écran à grand volume — recadrages pour les réseaux sociaux, miniatures, variantes A/B. Nano Banana 2 Lite l'emporte sur presque chaque composant. Quatre secondes par image, quatorze ratios d'aspect, dont 1:4 et 8:1, un prix forfaitaire par image que vous pouvez prévoir au centime près, et un mode par lots à moitié prix. Rien dans cette charge de travail n'exige d'alpha ni de 2K, et la licence commerciale avec filigrane est exactement ce que vous voulez lorsque les résultats sont livrés.
• Impression, composition grand format, ou tout ce que vous devrez recadrer fortement. Qwen-Image-2.1, et l'écart n'est pas serré. Du 2048×2048 natif à 40 étapes face à un modèle strictement plafonné à environ 1 mégapixel, sans mode 2K, sans mise à l'échelle, et sans paramètre d'API pour le relever — Google redirige à la place les travaux en 2K et 4K vers Nano Banana 2 ou Nano Banana Pro. Si vous devez recadrer un tiers du cadre et conserver malgré tout un élément exploitable, Lite ne peut pas y parvenir.
• Détourages transparents, icônes, sprites, compositions multicouches. Qwen-Image-2.1. Le canal alpha est une composante de l'espace latent RGBA à 64 canaux dans lequel l'échantillonneur effectue le débruitage, donc il n'y a ni passe de segmentation ni passe de matting ; le modèle peut aussi extraire un sujet d'une photographie ordinaire vers un calque transparent. Nano Banana 2 Lite n'a aucune sortie documentée sur fond transparent.
• Tout ce qui doit faire l'objet d'une licence commerciale. Nano Banana 2 Lite, sans réserve. Qwen-Image-2.1 est distribué sous le Qwen Research License Agreement daté du 20 septembre 2026 et n'autorise que la recherche et l'évaluation non commerciales ; un déploiement commercial nécessite une licence distincte de Hangzhou Tongyi Laboratory Technology, et aucun prix ni fiche de conditions n'est publié pour une telle licence.
Une ligne de plus mérite de figurer dans cette liste, et elle va à l’encontre du modèle ouvert. Nano Banana 2 Lite sait des choses — il est livré avec une date de coupure des connaissances à janvier 2025 et un profil de respect des instructions bâti sur le socle Gemini 3.1 Flash Lite, avec un fort rendu du texte dans l’image, y compris en chinois, japonais et coréen. Les preuves indépendantes de Qwen-Image-2.1 sur le suivi des instructions sont limitées et mitigées. Une comparaison d’arène avec juge IA qui a opposé Nano Banana 2 Lite à un modèle d’image Qwen — l’entrée ne fixe pas de version, donc à interpréter comme un signal sur la famille plutôt que sur la 2.1 spécifiquement — a donné la victoire à Lite sur les invites spatiales étranges (« astronaute à cheval », « chauffeur de taxi capybara ») et sur le rendu de texte, où la sortie de Qwen a rendu le titre d’une invitation d’Halloween sous la forme « Hallofarty Invitation ». Les points faibles documentés de Lite sont les petits visages, les détails textuels fins, les infographies denses et les éditions masquées complexes. Aucun des deux modèles n’est de manière fiable meilleur pour suivre une instruction étrange ; ils échouent à des endroits différents.

La question de l’image de référence, non résolue
L'édition multi-images est le point où un pipeline de volume cesse de pouvoir substituer un modèle à l'autre, et c'est aussi la ligne où les informations publiques se contredisent.
Qwen-Image-2.1 accepte jusqu’à 10 images de référence et prend en charge l’essayage virtuel, les portraits de groupe et la composition de garde-robe en plus de cela. Pour Nano Banana 2 Lite, les sources divergent fortement : la page modèle d’un fournisseur indique la prise en charge de jusqu’à 14 images de référence pour le transfert de style et l’édition multi-référence, tandis qu’une analyse comparative affirme l’inverse — que Lite accepte une seule image pour l’édition, et que la capacité de 14 références appartient au Nano Banana 2 complet, avec un maximum de cinq personnes plus six objets. Compte tenu du conflit, la position défendable est que Lite prend en charge l’entrée d’images et la composition multi-image, mais que sa capacité de référence est le différenciateur que Google utilise pour le séparer de Nano Banana 2. Si votre flux de travail dépend de six personnages cohérents à travers une série, vérifiez la limite par rapport à la fiche modèle de Google avant d’architecturer autour.
C'est aussi ici que les modèles cessent d'être interchangeables au sens large. Google positionne Nano Banana 2 Lite et Gemini Omni Flash comme une paire — le modèle d'image fixe et le modèle vidéo, conçus pour s'enchaîner. Qwen-Image-2.1 n'a pas d'équivalent vidéo, et son astuce d'animation est une séquence enchaînée de retouches de zones locales qui construit une simple boucle image par image, pas un modèle vidéo.
Quand une couche de routage mérite sa place
Aucun de ces modèles n'est disponible sur OrcaRouter. Nous ne routons aucun modèle Qwen-Image, quelle que soit sa version ; Qwen-Image-2.1 est donc soit auto-hébergé, soit inexistant. Nano Banana 2 Lite — l'identifiant gemini-3.1-flash-lite-image — ne figure pas non plus dans notre catalogue ; les routes d'images Google que nous proposons sont google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview et les trois niveaux d'Imagen 4, ainsi que GPT-Image-2, GPT-Image-1.5 et GPT-Image-1-mini d'OpenAI, et le point de terminaison d'images Grok Imagine de xAI.
Ce que cela apporte à un pipeline mixte, c'est précisément ce sur quoi cette comparaison ne cesse de buter : une décision qui change selon l'actif. Les actifs volumineux passent par une route hébergée bon marché, les détourages transparents passent sur votre propre carte, et une hausse tarifaire côté fournisseur hébergé est répercutée le jour même, parce que nous répercutons le prix catalogue du fournisseur à marge nulle au lieu de fixer nous-mêmes le prix. Ajoutez à cela un basculement automatique entre fournisseurs, un DSL de routage pour composer les solutions de repli, et une fusion de modèles pour les appels de type panel : la moitié hébergée cesse d'être une relation fournisseur que vous devez gérer modèle par modèle — plus de 200 modèles, un seul endpoint compatible OpenAI, une seule clé. La moitié auto-hébergée reste votre problème, ce qui est le coût honnête d'exploiter un checkpoint sous licence de recherche sur du matériel qui vous appartient.
Lequel choisir, et la condition qui le fait basculer
Si vous produisez en volume des ressources à l'écran pour un usage commercial, Nano Banana 2 Lite est la réponse et la question de la licence ne se pose jamais : 0,034 $ par image, quatre secondes, prévisible, vendable. Si vous avez besoin de 2K, d'une transparence native ou de dix images de référence, Qwen-Image-2.1 est le seul des deux à en proposer ne serait-ce qu'une, et vous en payez le prix en matériel, en temps d'ingénierie et en une licence non commerciale qui en fait un instrument de recherche plutôt qu'une dépendance de production.
Un seul fait suffirait à faire disparaître l’écart. Une feuille de conditions commerciales publiée pour Qwen-Image-2.1 — avec un prix et des conditions que l’on peut réellement signer — transforme une tâche GPU de 13 heures en un poste de dépense qui rivalise avec 340 $, et à partir de là, les avantages en résolution et en canal alpha commencent à s’adjuger des charges de travail qui reviennent actuellement à Lite par défaut. Tant que cela n’existe pas, la répartition est nette : Lite pour tout ce qui part en production, Qwen-Image-2.1 pour tout ce qui reste en interne, et une stack de serving pour le second, que vous maintenez vous-même.


Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
