Tarjeta principal para la comparación entre Qwen-Image 2.1, un modelo de pesos abiertos con licencia de investigación que alojas tú mismo, y Nano Banana 2, un modelo con licencia comercial y un precio por imagen publicado
Guides & Insights

Qwen-Image 2.1 vs Nano Banana 2: lo que pagas por imagen y lo que pagas por poseerlo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Solo uno de estos dos modelos tiene un precio que puedes poner en una hoja de cálculo. Nano Banana 2 — el modelo Gemini 3.1 Flash Image, disponible de forma general desde el 28 de mayo de 2026 — cuesta unos 0,067 $ por imagen de 1024×1024, 0,101 $ a 2048×2048 y aproximadamente 0,151 $ en el extremo de 4K, con el modo por lotes a cerca de la mitad y la entrada de texto facturada por separado a 0,25 $ por millón de tokens. Qwen-Image 2.1, publicado como código abierto por el equipo de Qwen-Image el 20 de septiembre de 2026, no tiene ningún precio por imagen, porque no hay ningún endpoint alojado del que comprar: es una descarga de pesos de 33 GB bajo una licencia de investigación que prohíbe el uso comercial. Así que la primera pregunta en esta comparación no es qué modelo es mejor. Es si estás comprando imágenes o comprando una máquina que las fabrica, y esas dos compras no son comparables de la forma en que lo sugiere una ficha de especificaciones.

La previsibilidad es lo que realmente compra un precio por imagen

El precio de Google es inusual en la categoría de imágenes por lo limpiamente que se convierte. El modelo cobra 60 $ por millón de tokens de salida y, como la salida de imágenes se tokeniza de forma predecible, eso se traduce en cifras por imagen sobre las que puedes razonar antes de generar nada.

Nano Banana 2 — alrededor de $0.067 para 1024×1024, $0.101 para 2048×2048, aproximadamente $0.151 en 4K, casi la mitad de esas cifras en modo por lotes, más $0.25 por millón de tokens para entrada de texto. Mil imágenes en 2K cuestan unos $101, pronosticable al dólar.

Qwen-Image 2.1 — sin precio publicado. El costo es tu propio tiempo de GPU frente a un paquete de 33 GB, y el consejo de la ficha del modelo para hardware con recursos limitados es la descarga a CPU mediante pipe.enable_model_cpu_offload(), que es una salida de emergencia más que una solución.

Lo que compra el precio por uso medido no son solo las imágenes. Es la capacidad de responder «cuánto nos cuesta esta función con diez mil imágenes al mes» sin hacer primero un benchmark de tu propio hardware. Es una ventaja real y es fácil infravalorarla, porque la alternativa —el autoalojamiento— tiene un coste que es genuinamente difícil de calcular: depende de tu utilización, tu tarjeta, tu electricidad y de si la máquina estaría inactiva de otro modo. La comparación honesta no es 101 $ por mil contra gratis. Es 101 $ por mil contra una cifra amortizada que tienes que calcular tú mismo, y la mayoría de los equipos que hacen las cuentas descubren que el precio por uso medido es competitivo justo hasta que la utilización se vuelve muy alta.

La licencia es donde las "pesas libres" dejan de ser gratis.

Esta es la diferencia más marcada entre los dos modelos, y no hay punto de comparación.

Nano Banana 2 es un producto comercial con términos comerciales. Pagas por imagen y distribuyes lo que creas. Qwen-Image 2.1 se distribuye bajo el Acuerdo de Licencia de Investigación de Qwen con fecha del 20 de septiembre de 2026, que otorga derechos «ÚNICAMENTE CON FINES NO COMERCIALES» y establece que el uso comercial requiere una licencia aparte solicitada al proveedor. Eso supone un cambio respecto a la línea anterior de Qwen-Image, que se distribuía bajo Apache 2.0, así que la opción abierta en esta comparación es abierta en el sentido de que puedes leerla y ejecutarla, no en el sentido de que puedas construir un negocio sobre ella.

Para un equipo de investigación, un aficionado o cualquiera que esté haciendo benchmarking, esa es una buena licencia y la descarga es genuinamente gratuita. Para un equipo de producto, significa que el modelo de esta comparación que no tiene precio por imagen tampoco tiene una vía comercial, lo que invalida por completo la comparación de costos: no estás eligiendo entre $101 y algo más barato, estás eligiendo entre un modelo con el que puedes vender resultados y otro con el que no.

Resolución y relaciones de aspecto, donde el modelo abierto tiene una ventaja real

Dejando de lado la licencia, Qwen-Image 2.1 hace algo que Nano Banana 2 no hace, y de una forma que importa para flujos de trabajo concretos.

Qwen-Image 2.1 — 2K nativo con 2048×2048 como valor predeterminado documentado en 40 pasos de inferencia, siete preajustes de relación de aspecto, hasta 10 imágenes de referencia y salida RGBA: un canal alfa real, edición de capas transparentes y extracción de sujetos a partir de fotos RGB.

Nano Banana 2 — salida en 4K con soporte para relaciones de aspecto poco habituales, incluidos los extremos 1:4 y 1:8, lo que supone un alcance mayor que el que ofrece la mayoría de los modelos en cualquiera de las dos direcciones, y publica cifras de consistencia de cinco personajes y catorce objetos en una sola generación.

El canal alfa es el que hay que tener en cuenta. El modelo de Google no está documentado como productor de transparencia, y Qwen-Image 2.1 lo hace de forma nativa, lo que significa que el paso de composición que, de otro modo, sería trabajo manual —recortar el sujeto, conservar los bordes suaves, colocarlo sobre otra cosa— está dentro del modelo en lugar de después de él. Si te ganas la vida creando recursos por capas, eso es una diferencia de flujo de trabajo y no una afirmación de calidad. También vale la pena decir sin rodeos que ambos modelos renderizan a resoluciones mayores de lo que necesita la mayoría de los trabajos: tanto 4K como 2048×2048 superan el punto en el que la limitación es el modelo y no el destino.

Two-column scoreboard for Qwen-Image 2.1 and Nano Banana 2: Qwen-Image 2.1 rows read Released 20 Sept 2026 / Licence research-only, non-commercial / Output 2048x2048 native with RGBA transparency / Aspect ratios seven presets / Reference images up to 10 / Price self-host, no hosted endpoint; Nano Banana 2 rows read GA 28 May 2026 / Licence commercial / Output up to 4K plus 1:4 and 1:8 ratios / Consistency five characters, fourteen objects, Google-reported / Independent score AA top five, both boards / Price about $0.067 per 1K image, $0.101 per 2K; footer reads 'Nano Banana 2 figures per Google and Artificial Analysis; Qwen-Image 2.1 figures vendor-reported, no independent score yet.'

Un número publicado frente a una promesa

El modelo de Google ha estado en ambos tableros de imágenes de Artificial Analysis desde la primavera y se sitúa entre los cinco primeros en texto a imagen y edición de imágenes en la instantánea de septiembre, con alrededor de 1.320 de Elo en texto a imagen. Sus cifras de consistencia —cinco personajes, catorce objetos— son de Google, pero se sitúan junto a una tabla de puntuación independiente, lo que significa que se pueden contrastar con el rendimiento real del modelo en comparaciones a ciegas.

Qwen-Image 2.1 no tiene una puntuación independiente. Tiene una publicación de blog del proveedor con un gráfico de Qwen-Image-Bench que ningún tercero ha reproducido, y un informe práctico de acceso anticipado de un evaluador del programa Qwen Ambassador que ejecutó los pesos finales a través de una interfaz de ModelScope Studio: aproximadamente 10–15 segundos para texto a imagen, 18–23 segundos para edición, un buen manejo de la posición de cámara y de roles con múltiples personajes, y una consistencia con múltiples referencias que se degrada a partir de unas tres imágenes de entrada. Un solo evaluador, sin cronómetro visible, sin conjunto de prompts publicado. Es la única observación externa del modelo que existe en público, y debería interpretarse como una pista más que como una medición.

También circula una cifra en la cobertura de terceros que describe Qwen-Image 2.1 como un transformer de 20 capas. Eso contradice la ficha del modelo, que documenta un transformer de difusión de flujo único de 32 capas con 7B de parámetros en el componente de generación visual, un codificador de texto Qwen3-VL 8B y un VAE RGBA de 64 canales con compresión espacial de 16×. Usa la ficha del modelo.

Lo único que puedes hacer con ambos

Este es el único artículo de este lote en el que el oponente es un modelo que realmente enrutamos. Nano Banana 2 está en OrcaRouter como google/gemini-3.1-flash-image-preview, junto con el resto de la línea de imágenes — la familia GPT-Image de OpenAI, los niveles de Imagen 4 de Google, las otras vistas previas de imágenes de Gemini y el endpoint de imágenes Grok Imagine de xAI — todo detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin margen de beneficio. Qwen-Image 2.1 no está entre los modelos que enrutamos, y este artículo no va a implicar que lo esté.

Lo que eso significa en la práctica para esta decisión es más acotado que un pitch y más útil que uno. Si quieres comparar los dos modelos con tus propios prompts, el lado de Google te cuesta una clave de API y alrededor de una décima de centavo por imagen en 2K, y está en el mismo endpoint que todo lo demás que llamas. El lado de Alibaba te cuesta una descarga de 33 GB, una GPU y una revisión de licencia de investigación antes de que puedas hacer cualquier cosa comercial con el resultado. La conmutación por error automática entre proveedores es la otra pieza que importa aquí: una ruta puede llevar tráfico de producción en un modelo medido mientras que uno sin medir se evalúa a su lado, de modo que la evaluación nunca queda en la ruta crítica.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026, showing Nano Banana 2 inside the top group of hosted image models at around Elo 1,320 behind GPT Image 2 (high), MAI-Image-2.6 and Reve 2.1, with no Qwen-Image 2.1 entry on the boardScreenshot of the OrcaRouter model page for google/gemini-3.1-flash-image-preview, the route that serves Nano Banana 2, captured in English and showing the model listed on the platform's OpenAI-compatible endpoint

¿Cuál, para quién?

Elige Nano Banana 2 si vas a lanzar a producción. Tiene licencia comercial, un precio que puedes prever al dólar, una puntuación independiente entre las cinco mejores en ambas clasificaciones, salida en 4K y el rango de proporciones más amplio de esta comparación. El coste de mil imágenes en 2K es de unos $101 y puedes estar generándolas esta misma tarde.

Elige Qwen-Image 2.1 si estás investigando. Es gratis descargarlo, la arquitectura y el prompt de sistema de reescritura de prompts son totalmente inspeccionables, renderiza de forma nativa a 2048×2048 con transparencia real, y admite hasta 10 imágenes de referencia con ediciones locales mediante círculo, anotación pintada o máscara. No puedes vender lo que produce, y nadie ha medido si es bueno o no.

La brecha entre esos dos párrafos es la brecha entre los modelos, y no es una brecha de calidad: es una brecha de madurez, y se está cerrando según un calendario. A los evaluadores de acceso anticipado de Qwen se les pidió que publicaran muestras o reseñas antes del 29 de septiembre de 2026. Cuando esas lleguen, el modelo abierto dejará de ser una incógnita y empezará a ser comparable, y la única pregunta que quedará será la licencia. Ese es el número que hay que vigilar, y es un archivo de licencia más que un benchmark.