
Qwen-Image 2.1 vs Qwen-Image 3.0: el número más bajo es el modelo más nuevo
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Empecemos por lo que desconcierta a todo el mundo. Qwen-Image 2.1 es más reciente que Qwen-Image 3.0. El proveedor lanzó Qwen-Image 3.0 el 21 de julio de 2026 y lo llevó a disponibilidad general el 5 de agosto. Lanzó Qwen-Image 2.1 el 20 de septiembre de 2026 —siete semanas después, y una versión menor más baja. La numeración no es una secuencia; son dos líneas de producto distintas que comparten un nombre, y el dato más útil sobre cualquiera de las dos es que adoptan posiciones opuestas respecto a la cuestión que determina si puedes construir sobre ellas. Qwen-Image 3.0 es cerrado y alojado, sin pesos, sin licencia y sin informe técnico. Qwen-Image 2.1 es de pesos abiertos, descargable hoy, bajo una licencia de investigación que permite únicamente el uso no comercial.
Dos productos que casualmente comparten un nombre
La familia Qwen-Image ha adoptado ahora tres posturas de licenciamiento distintas en catorce meses, y exponerlas elimina la mayor parte de la confusión:
• Qwen-Image 1.0 and 2.0 — pesos abiertos con licencia Apache 2.0 en Hugging Face y ModelScope, informes técnicos el día del lanzamiento, autohospedable, ajustable y cuantizable.
• Qwen-Image 3.0 — cerrado. Sin pesos, sin licencia declarada, sin tarjeta de modelo, sin informe técnico, sin tabla de benchmarks publicada. Solo accesible a través de una API alojada, en ediciones Pro y Standard.
• Qwen-Image 2.1 — de nuevo con pesos abiertos, pero bajo el Acuerdo de Licencia de Investigación de Qwen con fecha del 20 de septiembre de 2026, que otorga derechos «ÚNICAMENTE CON FINES NO COMERCIALES» y remite el uso comercial a una licencia negociada por separado.
Lee eso como un patrón en lugar de una cronología y la forma queda clara: Alibaba ya no trata «abierto» como algo binario. Qwen-Image 2.1 no es ni la versión permisiva que fueron 1.0 y 2.0, ni la versión cerrada que fue 3.0. Es una tercera posición: pesos que puedes inspeccionar, ejecutar y modificar, con una barrera comercial atornillada al frente.
Lo que cada modelo realmente es
• Qwen-Image 2.1 — un modelo unificado de generación de texto a imagen y edición de imágenes con 7B de parámetros en su componente de generación visual, construido como un DiT de flujo único de 32 capas. Un codificador de texto Qwen3-VL 8B y un VAE RGBA de 64 canales con compresión espacial de 16× lo acompañan; la descarga completa es de aproximadamente 33 GB, y el codificador de texto representa más de la mitad. Atención causal por bloques con una máscara causal a nivel de token para texto y una máscara bidireccional a nivel de fragmento para la generación de imágenes, además de reutilización de caché KV de prefijo para la edición de múltiples imágenes. 2K nativo, por defecto 2048×2048 a 40 pasos, con siete preajustes de relación de aspecto.
• Qwen-Image 3.0 — un modelo alojado cerrado en ediciones Pro y Standard, que ofrece generación y edición de imágenes a través de una sola API. El material de lanzamiento de Alibaba afirma prompts de hasta unos 4500 tokens, texto legible hasta aproximadamente 10 píxeles y cobertura de 12 idiomas en más de 20 fuentes, con una salida de hasta 2048×2048 y hasta seis imágenes por llamada. No se publicó el número de parámetros; la cifra de ~20B MMDiT, ampliamente repetida, se reporta pero no se confirma.
La diferencia arquitectónica que más importa en la práctica no es el tamaño — es dónde se ejecuta el modelo y qué puedes hacer con él. Qwen-Image 2.1 llega como archivos que puedes inspeccionar, cuantizar, ajustar con datos privados y ejecutar en tu propio hardware, con un pull request de soporte de SGLang fusionado tres días antes de que los pesos siquiera llegaran. Qwen-Image 3.0 llega como un endpoint. No puedes cuantizarlo, no puedes ajustarlo y no puedes ejecutarlo en ningún otro lugar que donde Alibaba lo ejecuta.
La edición es donde los dos divergen más radicalmente.
Ambos modelos realizan generación y edición en un único sistema, así que la comparación interesante está en los detalles de la edición — y aquí el modelo más nuevo y pequeño es el más capaz sobre el papel.
• Imágenes de referencia — Qwen-Image 2.1 acepta hasta 10 referencias de entrada. La documentación de Qwen-Image 3.0 Pro describe compatibilidad con 1–3 imágenes de entrada.
• Control de edición local — Qwen-Image 2.1 admite círculos, anotaciones pintadas y una máscara independiente suministrada como su propia entrada, de modo que la imagen original permanece sin marcar. La ruta de edición documentada de Qwen-Image 3.0 abarca la reescritura local, la expansión de contenido, la transferencia de estilo y la generación desde múltiples ángulos de cámara, sin un flujo de trabajo basado en máscaras publicado.
• Transparencia — Qwen-Image 2.1 genera y edita imágenes RGBA de forma nativa, edita texto dentro de una capa transparente y extrae un sujeto de una fotografía RGB hacia una capa transparente. El anuncio de Qwen-Image 3.0 no incluye ninguna afirmación sobre transparencia.
• Reescritura de prompts — Qwen-Image 2.1 incluye dos checkpoints de reescritura dedicados, ambos modelos Qwen3.5-VL 9B ajustados, uno para texto a imagen y otro para edición, con el código de reescritura y el prompt del sistema publicados. El manejo de prompts de Qwen-Image 3.0 es una caja negra detrás de la API.
• Ecosistema — Qwen-Image 2.1 cuenta con soporte desde el primer día en Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V, además de rutas para AMD ROCm y FlagOS. Qwen-Image 3.0 dispone de una API.
Esa última línea no es una floritura retórica. Para un equipo cuyo pipeline vive en ComfyUI o cuya pila de inferencia es vLLM, la diferencia entre un modelo con una clase de pipeline fusionada y un modelo con un endpoint HTTP es la diferencia entre una tarea de integración y una reescritura.

El precio, y lo que el precio no captura
Qwen-Image 3.0 tiene el único precio publicado de los dos: en la nube del proveedor, Pro figura en torno a 0,04 $ por imagen y Standard alrededor de 0,03 $, con precios para consumidores nacionales que parten de unos 0,18 ¥. Son cifras de lanzamiento y no han sido auditadas de forma independiente. Qwen-Image 2.1 no tiene ninguna tarifa alojada publicada —es una descarga, y el costo es lo que cueste tu propio tiempo de GPU.
Esas dos cifras no son comparables, y pretender lo contrario es el error más común en esta comparativa. Un precio por imagen cubre el modelo, la infraestructura de servicio, el escalado y la disponibilidad de otra persona. Una descarga de pesos no cubre nada de eso. La pregunta correcta no es qué número es más pequeño; es si tienes la capacidad operativa para ejecutar una pila de modelo de 33 GB, y si la licencia del lado barato permite lo que planeas hacer con él.
Lo que devuelve la licencia al centro de la comparación, donde corresponde. Los términos de Qwen-Image 3.0 no están publicados, lo cual es un problema en sí mismo para el trabajo regulado o de agencias: no hay ningún documento que citar. Los términos de Qwen-Image 2.1 síestán publicados, y dicen no comercial. Entre una licencia poco clara y una claramente restrictiva, la claramente restrictiva es más fácil de planificar, porque al menos sabes qué conversación hay que tener.

Cuál deberías elegir
• Necesitas imágenes de producción con mucho texto y quieres que otra persona se encargue de gestionarlas — Qwen-Image 3.0 es la opción adecuada, con la advertencia de que sus cifras destacadas de renderizado de texto son afirmaciones del proveedor y las pruebas independientes que existen describen que el texto en fuentes pequeñas todavía se distorsiona en algunos casos.
• Necesitas ejecutar el modelo tú mismo, ajustarlo o mantener los datos en tu propio hardware — Qwen-Image 2.1 es la única opción de las dos, y la licencia de investigación es el precio de entrada.
• Necesitas recursos transparentes, recortes de productos o más de tres imágenes de referencia — Qwen-Image 2.1, según las especificaciones publicadas, es la herramienta más potente, y no está ni cerca en cuanto al número de referencias.
• Necesitas derechos comerciales y una licencia permisiva — ninguna de las dos se aplica a tu modelo. Qwen-Image 3.0 no tiene términos publicados en absoluto, y Qwen-Image 2.1 requiere una licencia comercial negociada. Las versiones publicadas bajo Apache-2.0 en esta familia son las anteriores Qwen-Image 1.0 y 2.0.
Esa última fila es la que merece una pausa, porque describe un conjunto que se reduce. Una licencia ya concedida no cambia retroactivamente, así que las versiones de Qwen-Image con Apache-2.0 siguen siendo utilizables en sus términos originales. Pero si estás planeando un pipeline comercial de imágenes basado en la suposición de que la versión más reciente de Qwen-Image tendrá una licencia permisiva, las últimas tres versiones son evidencia en contra de esa suposición.
Ejecutar cualquiera de los dos sin apostar la pipeline a ello
Ambos modelos son, por motivos distintos, incómodos de poner hoy detrás de una ruta de producción: uno por una licencia, otro por una caja negra y un número de parámetros no publicado. Esa es precisamente la situación para la que se crea una capa de enrutamiento. OrcaRouter pone más de 200 modelos al frente tras un único endpoint compatible con OpenAI al precio de lista del proveedor, sin recargo, con conmutación por error automática entre proveedores y un DSL de enrutamiento que te permite componer varios modelos en una sola llamada, de modo que un modelo nuevo o incómodo puede situarse junto a uno ya probado en lugar de delante de él. La fusión de modelos lleva esa misma idea más lejos, ejecutando un panel de modelos en conjunto y permitiéndote compararlos con tus propios prompts en lugar de con un gráfico de lanzamiento.
Ni Qwen-Image 2.1 ni Qwen-Image 3.0 están entre los modelos que enrutamos hoy, y este artículo no sugerirá lo contrario. Los modelos de imagen que sí enrutamos —la línea GPT-Image de OpenAI, los niveles de Imagen 4 de Google y las vistas previas de imágenes de Gemini, y el endpoint de imágenes Grok Imagine de xAI— son aquellos a partir de los cuales se construiría realmente una ruta de conmutación por error mientras evalúas la dupla Qwen según tus propios criterios.
Qué observar es más limitado de lo que parece. Alibaba ya ha demostrado que lanzará pesos abiertos, modelos cerrados alojados y descargas con licencia para investigación dentro de la misma familia en el mismo trimestre. El próximo lanzamiento no te dirá qué patrón ganó. El archivo de licencia sí.

