
Qwen-Image-2.1 frente a Nano Banana 2 Lite: $340 por diez mil imágenes, o 13 horas de GPU
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Diez mil imágenes de 1024 píxeles en Nano Banana 2 Lite cuestan unos 340 $. Diez mil imágenes de Qwen-Image-2.1 cuestan aproximadamente trece horas de una GPU de 24 GB y una licencia que te prohíbe vender cualquiera de ellas. Ese es el intercambio en una sola línea, y es la única comparación dentro de esta familia en la que los dos modelos realmente hacen el mismo trabajo en el mismo momento. Qwen-Image-2.1 pasó a ser de pesos abiertos el 20 de septiembre de 2026. Nano Banana 2 Lite —el ID de modelo del proveedor google/gemini-3.1-flash-lite-image, oficialmente Gemini 3.1 Flash-Lite Image— se lanzó el 30 de junio de 2026 y es el generador de imágenes fijas más barato de la línea Nano Banana.
Los dos candidatos, con precios honestos
Nano Banana 2 Lite genera una imagen de 1K en aproximadamente cuatro segundos, unas 2,7× más rápido que Gemini 3.1 Flash Image, y cobra una tarifa fija de $0,034 por imagen de 1K. Las tarifas de tokens de Google que hay detrás de esa cifra son $0,25 por 1M de tokens de entrada y $30 por 1M de tokens de salida de imagen, lo que equivale a unos $0,0336 a 1K; el modo por lotes la reduce a la mitad, hasta aproximadamente $0,0168. No existe un nivel gratuito y cada resultado lleva una marca de agua invisible de SynthID.
Qwen-Image-2.1 no tiene un precio, porque no hay nada que comprar. Es una descarga de aproximadamente 33 GB —un transformer de difusión de flujo único de 7B y 32 capas emparejado con un codificador de texto Qwen3-VL 8B— que tú mismo sirves. Lo más parecido a una lista de tarifas es la latencia medida de SGLang-Diffusion: 4,74 segundos para la pasada de eliminación de ruido en una RTX 4090 de 24 GB usando Cache-DiT y kernels INT8, 8,23 segundos para una generación completa de 1024×1024 y 40 pasos en una RTX PRO 6000 Blackwell con una huella máxima de 40,1 GiB, y 2,748 segundos en una sola B200. Esas son latencias de solicitud única que incluyen los componentes indicados, no cifras de rendimiento, así que considera 13 horas para diez mil imágenes como un orden de magnitud, no como un benchmark.
Ponlos uno al lado del otro y la aritmética no es «$340 frente a gratis». Son $340 frente a trece horas de una tarjeta que ya tienes o alquilas, más el tiempo de ingeniería para montar un stack de servicio. El volumen de cruce es mucho menor de lo que supone la mayoría de los equipos —pero solo si la tarjeta no se queda inactiva el resto del mes, y solo si el resultado es algo que tienes permitido producir.
Tres cargas de trabajo, y qué modelo se encarga de cada una
El volumen por sí solo es el eje equivocado. El tipo de trabajo lo decide más rápido.
• Activos en pantalla de gran volumen: recortes para redes, miniaturas, variantes A/B. Nano Banana 2 Lite gana en casi todos los componentes. Cuatro segundos por imagen, catorce relaciones de aspecto, incluidas 1:4 y 8:1, un precio fijo por imagen que puedes prever al céntimo, y modo por lotes a mitad de precio. Nada de esta carga de trabajo necesita alfa ni 2K, y la licencia comercial con marca de agua es exactamente lo que quieres cuando el resultado se publica.
• Impresión, composición en gran formato o cualquier cosa que vayas a recortar a lo bruto. Qwen-Image-2.1, y no hay comparación posible. 2048×2048 nativos a 40 pasos frente a un modelo con un tope estricto de aproximadamente 1 megapíxel, sin modo 2K, sin reescalado y sin ningún parámetro de API para subirlo: Google dirige el trabajo en 2K y 4K a Nano Banana 2 o Nano Banana Pro. Si necesitas recortar un tercio del encuadre y aun así tener un recurso utilizable, Lite no puede llevarte hasta ahí.
• Recortes transparentes, iconos, sprites, composiciones por capas. Qwen-Image-2.1. El canal alfa es un componente del espacio latente RGBA de 64 canales en el que el muestreador aplica la eliminación de ruido, así que no hay pasada de segmentación ni pasada de matting; el modelo también puede extraer un sujeto de una fotografía corriente y convertirlo en una capa transparente. Nano Banana 2 Lite no tiene ninguna salida documentada con fondo transparente.
• Cualquier cosa que deba tener licencia comercial. Nano Banana 2 Lite, sin ningún pero. Qwen-Image-2.1 se distribuye bajo el Acuerdo de Licencia de Investigación de Qwen con fecha del 20 de septiembre de 2026 y solo permite investigación y evaluación no comerciales; el despliegue comercial requiere una licencia aparte de Hangzhou Tongyi Laboratory Technology, y no hay ningún precio ni hoja de condiciones publicados para obtenerla.
Una fila más debería estar en esa lista, y juega en contra del modelo abierto. Nano Banana 2 Lite sabe cosas: viene con un corte de conocimiento de enero de 2025 y un perfil de adherencia a los prompts construido sobre la base de Gemini 3.1 Flash Lite, con un sólido renderizado de texto en imágenes que incluye chino, japonés y coreano. La evidencia independiente de Qwen-Image-2.1 sobre el seguimiento de instrucciones es escasa y mixta. Una comparación de arena con jueces de IA que enfrentó a Nano Banana 2 Lite contra un modelo de imagen de Qwen —la entrada no fija una versión, así que léela como una señal sobre la familia y no sobre 2.1 en concreto— le dio la victoria a Lite en los extraños prompts espaciales ("astronauta montando a caballo", "capibara taxista") y en el renderizado de texto, donde la salida de Qwen renderizó el título de una invitación de Halloween como "Hallofarty Invitation". Los puntos débiles documentados de Lite son las caras pequeñas, el detalle fino del texto, las infografías densas y las ediciones enmascaradas complejas. Ninguno de los dos modelos es de manera fiable mejor siguiendo una instrucción extraña; fallan en distintos lugares.

La cuestión de la imagen de referencia, sin resolver
La edición de múltiples imágenes es donde una canalización de volumen deja de poder sustituir un modelo por otro, y también es la fila donde la información pública entra en conflicto.
Qwen-Image-2.1 acepta hasta 10 imágenes de referencia y, además, admite probador virtual, retratos grupales y composición de vestuario. En cuanto a Nano Banana 2 Lite, las fuentes discrepan radicalmente: la página del modelo de un proveedor indica compatibilidad con hasta 14 imágenes de referencia para transferencia de estilo y edición con múltiples referencias, mientras que un artículo comparativo afirma lo contrario: que Lite acepta una sola imagen para edición y que la capacidad de 14 referencias pertenece al Nano Banana 2 completo, con un máximo de cinco personas más seis objetos. Dado el conflicto, la postura defendible es que Lite admite entrada de imágenes y composición con múltiples imágenes, pero que su capacidad de referencia es el diferenciador que Google utiliza para separarlo de Nano Banana 2. Si tu flujo de trabajo depende de seis personajes consistentes a lo largo de una serie, verifica el límite en la propia tarjeta del modelo de Google antes de diseñar en torno a él.
Aquí es también donde los modelos dejan de ser intercambiables en un sentido más amplio. Google posiciona Nano Banana 2 Lite y Gemini Omni Flash como un par — el modelo de imágenes fijas y el modelo de video, diseñados para encadenarse. Qwen-Image-2.1 no tiene contraparte de video, y su truco de animación es una secuencia encadenada de ediciones de regiones locales que construye un simple bucle fotograma a fotograma, no un modelo de video.
Dónde una capa de enrutamiento se gana su lugar
Ninguno de estos modelos está en OrcaRouter. No enrutamos ningún modelo Qwen-Image de ninguna versión, así que Qwen-Image-2.1 es autoalojado o nada. Nano Banana 2 Lite — el gemini-3.1-flash-lite-image identificador — tampoco está en nuestro catálogo; las rutas de imágenes de Google que sí ofrecemos son google/gemini-3.1-flash-image-preview, google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview y los tres niveles de Imagen 4, además de GPT-Image-2, GPT-Image-1.5 y GPT-Image-1-mini de OpenAI, y el endpoint de imágenes Grok Imagine de xAI.
Lo que eso le aporta a un pipeline mixto es aquello con lo que esta comparación sigue topando: una decisión que cambia según el activo. Los activos de gran volumen van a una ruta alojada barata, los recortes transparentes van a tu propia tarjeta, y un movimiento de precio del proveedor en el lado alojado se aplica el mismo día porque trasladamos el precio de lista del proveedor sin ningún margen en lugar de fijarlo nosotros mismos. Añade conmutación automática por error entre proveedores, un DSL de enrutamiento para componer respaldos y fusión de modelos para llamadas tipo panel, y la mitad alojada deja de ser una relación con proveedores que tienes que gestionar modelo por modelo — más de 200 modelos, un endpoint compatible con OpenAI, una clave. La mitad autoalojada sigue siendo tu problema, que es el coste honesto de ejecutar un checkpoint con licencia para investigación en hardware que posees.
Cuál elegir, y la condición que lo invierte
Si produces recursos en pantalla en volumen para uso comercial, Nano Banana 2 Lite es la respuesta y la cuestión de la licencia ni se plantea: $0,034 por imagen, cuatro segundos, predecible, vendible. Si necesitas 2K, transparencia nativa o diez imágenes de referencia, Qwen-Image-2.1 es el único de los dos que tiene alguna de esas cosas, y eso lo pagas en hardware, tiempo de ingeniería y una licencia no comercial que lo convierte en un instrumento de investigación en lugar de una dependencia de producción.
Un solo hecho cerraría la brecha. Una hoja de términos comerciales publicada para Qwen-Image-2.1 —con un precio y unas condiciones que alguien pueda firmar de verdad— convierte un trabajo de GPU de 13 horas en una partida que compite con $340, y en ese momento las ventajas de resolución y alfa empiezan a ganar cargas de trabajo que actualmente van a Lite por defecto. Hasta que eso exista, la separación es nítida: Lite para todo lo que se lance, Qwen-Image-2.1 para todo lo que se quede dentro de la empresa, y un stack de servicio para el segundo que mantienes tú mismo.


