Una tarjeta principal generada para el artículo 'Qwen-Image 2.1 se lanzó en silencio' que muestra una tarjeta redondeada etiquetada 'Qwen-Image 2.1' con un marcador de parámetros de 7B, junto a dos tarjetas más pequeñas etiquetadas 'PE-T2I' y 'PE-I2I' marcadas con 9B, y una cinta que dice 'Lanzado discretamente, no sin anuncio'.
Engineering & Research

Qwen-Image 2.1 se lanzó en silencio: dentro de Qwen/Qwen-Image-2.1-PE-I2I

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El 20 de septiembre de 2026, el equipo de Qwen-Image publicó Qwen-Image 2.1 en Hugging Face y ModelScope — pesos, archivo de licencia, tarjeta del modelo y una publicación de blog, todo el mismo día, con casi ningún margen previo. La cifra destacada es 7B parámetros en el componente de generación visual. La parte que casi nadie ha abierto todavía es Qwen/Qwen-Image-2.1-PE-I2I, uno de los dos checkpoints de reescritura de prompts que se publicaron junto con el modelo de imagen. No es el modelo de imagen. Es lo que decide qué significa tu instrucción antes de que el modelo de imagen llegue siquiera a verla — y, en esta versión, es el componente que establece en silencio el idioma en el que se devuelve tu salida.

¿Qué significa realmente "shipped quietly" en este caso?

La redacción importa, porque es fácil exagerar en uno u otro sentido. Qwen-Image 2.1 no se filtró, y no fue un lanzamiento sin anuncio. Hay una entrada de blog del proveedor fechada el 20 de septiembre de 2026, un repositorio de GitHub con una sección de noticias fechada el mismo día, y una descarga de pesos ya disponible. Lo que no tuvo fue una fase de preparación: la única señal previa fue una nota del 17 de septiembre que ofrecía 50 plazas de acceso anticipado a través de ModelScope, en la que se pedía a los probadores seleccionados que publicaran una muestra o una reseña antes del 29 de septiembre. Tres días después, los pesos eran públicos. Ni keynote, ni embargo de benchmarks, ni ciclo de prensa.

Ese es un tipo de lanzamiento muy específico, y merece la pena nombrarlo con precisión. El proveedor lo anunció. El proveedor no lo promocionó. Para cualquiera que esté decidiendo si construir sobre él, la consecuencia práctica es que todavía no hay ninguna evaluación independiente en la que apoyarse — solo el material del propio proveedor y lo que publiquen los probadores de acceso anticipado durante la próxima semana. Trata cada afirmación sobre la calidad que aparece en este artículo como procedente de la ficha del modelo y de la entrada del blog hasta que alguien ajeno a Alibaba lo ejecute en público.

Por qué el checkpoint PE-I2I es el interesante

El lanzamiento de Qwen-Image 2.1 contiene tres piezas descargables, no una:

Qwen/Qwen-Image-2.1 — el modelo de imagen en sí. Un DiT de un solo flujo de 32 capas con 7B de parámetros en el componente de generación visual, un codificador de texto Qwen3-VL 8B y un VAE RGBA de 64 canales con compresión espacial de 16×. Aproximadamente 33 GB entre los tres componentes.

Qwen/Qwen-Image-2.1-PE-T2I — un reescritor de prompts para texto a imagen. Un Qwen3.5-VL 9B ajustado, unos 18,8 GB.

Qwen/Qwen-Image-2.1-PE-I2I — un reescritor de prompts para la edición de imagen a imagen. También un Qwen3.5-VL 9B con ajuste fino, también de unos 18,8 GB, subido a Hugging Face a las 08:46 UTC del 20 de septiembre.

"PE" es la mejora de prompt. La variante I2I toma una instrucción de edición vaga más una o varias imágenes de entrada y la reescribe en una directiva de edición precisa e inequívoca para el modelo de difusión posterior. La descripción del propio repositorio es contundente sobre la forma de la entrada: una imagen de entrada siempre está presente, por lo que siempre se trata de una tarea de edición de imágenes y nunca de texto a imagen desde cero. El código de reescritura se encuentra en una carpeta prompt_rewrite/ que sirve para ambos checkpoints — --task t2i o --task edit — con una ruta de transformers, una ruta de vLLM, un serve.sh más client.py para un servicio permanente, y pe_core.py para la lógica compartida.

He aquí por qué eso importa más de lo que parece. El modelo de imagen no tiene idea de lo que quisiste decir. Tiene una idea de lo que tu prompt dice literalmente, ponderada por lo que el codificador de texto haga con ello. Un reescritor situado delante de él es donde se resuelve la ambigüedad — o se resuelve mal, de forma consistente, en cada imagen que generes. En un modelo unificado de generación y edición con hasta 10 imágenes de referencia, ese paso de resolución tiene más margen para equivocarse de lo habitual.

El prompt del sistema es donde reside la decisión del idioma.

El repositorio PE-I2I incluye un system_prompt.txt junto con los pesos, y es inusualmente explícito sobre una cosa: el idioma. Al leerlo directamente, se instruye al rewriter a tomar dos decisiones lingüísticas distintas y a mantenerlas separadas.

El idioma de la descripción. La prosa que el reescritor escribe para describir la edición sigue el idioma de la instrucción del usuario: instrucción en chino, descripción en chino; instrucción en inglés, descripción en inglés; una instrucción en japonés, coreano, francés, tailandés o cualquier otro idioma recibe una descripción en inglés.

El idioma del texto renderizado. El texto que realmente se plasmará en la imagen de salida, contenido entre comillas dobles, se decide mediante un orden de prioridad estricto: primero, si el usuario indica el texto exacto o el idioma de destino, se obedece eso literalmente; segundo, si la imagen de entrada ya contiene texto, se iguala el idioma dominante de ese texto existente —incluso cuando la instrucción esté escrita en un idioma diferente—; tercero, si no hay texto en la imagen y no se indica ningún idioma, se usa el idioma de la propia instrucción y, específicamente, no se fuerza al inglés.

El prompt refuerza la segunda regla con un ejemplo práctico —una imagen que es mayormente tailandesa, editada con una instrucción en inglés que no nombra un idioma, debe renderizar texto tailandés— y añade dos restricciones: el texto renderizado debe ser monolingüe en lugar de un par chino/inglés, y un género visual de "hoja de especificaciones" o "storyboard" se logra mediante diseño y tipografía, nunca cambiando las etiquetas renderizadas al inglés.

Esta es una pequeña obra de ingeniería con un gran radio de impacto. Si estás generando imágenes de producto para un mercado donde el texto del envase importa, la diferencia entre «el reescritor conserva el idioma existente de la etiqueta» y «el reescritor, en su afán por ayudar, traduce todo al inglés» es la diferencia entre un recurso utilizable y uno rechazado. Y como este comportamiento se especifica en un prompt del sistema que se incluye en el repositorio, puedes leerlo, hacerle diff y sobrescribirlo, lo cual es más de lo que se puede decir del mismo paso dentro de un modelo alojado cerrado.

Qué está confirmado, y qué no

Ser preciso respecto al límite aquí es justamente el propósito de una pieza de «lo que sabemos».

Confirmado a partir del repositorio y la ficha del modelo — la cifra de 7B / 32 capas del DiT de flujo único; el codificador de texto Qwen3-VL 8B; el VAE RGBA de 64 canales con compresión espacial de 16×; atención block-causal con una máscara causal a nivel de token para el texto y una máscara bidireccional a nivel de fragmento para la generación de imágenes; reutilización de la caché KV de prefijo, que, según la ficha, se activa cuando el checkpoint incluye causal_condition: true (así es); flow matching con programación discreta de Euler; salida nativa en 2K con 2048×2048 como valor predeterminado en 40 pasos de inferencia; siete preajustes de relación de aspecto documentados; compatibilidad con hasta 10 imágenes de referencia; edición local mediante círculo, anotación pintada o una máscara independiente; y generación RGBA, edición de capas transparentes y extracción de sujetos a partir de fotos RGB.

Confirmado lo de la licencia, y aquí está el punto crítico — el lanzamiento está bajo el Acuerdo de Licencia Qwen Research, con fecha del 20 de septiembre de 2026, que otorga derechos "FOR NON-COMMERCIAL PURPOSES ONLY" y establece que el uso comercial requiere una licencia aparte solicitada al proveedor. Eso supone un cambio sustancial respecto a la línea anterior Qwen-Image, que se distribuía bajo Apache 2.0. Lee el archivo de la licencia antes de construir un producto sobre esto, no después.

Sin confirmar — todavía no existen resultados de referencia independientes. La entrada del blog hace referencia a un gráfico comparativo de Qwen-Image-Bench, pero las cifras que contiene son del propio proveedor y ninguna第三方 las había reproducido en el momento de escribir esto. No hay un precio publicado para el endpoint alojado de Qwen-Image 2.1, ni términos declarados para la licencia comercial. Y aún no se sabe si le seguirá una variante con licencia permisiva.

El único dato independiente que existe es una reseña práctica de acceso anticipado de un tester que tuvo acceso mediante el programa Qwen Ambassador y ejecutó los pesos de la versión final a través de una interfaz de ModelScope Studio. Esa reseña informó tiempos de generación de aproximadamente 10–15 segundos para texto a imagen y de 18–23 segundos para edición, un rendimiento sólido en ajustes predefinidos de posición de cámara y asignación de roles con múltiples personajes, y un modo de fallo específico que vale la pena conocer: la consistencia con múltiples referencias se degradaba a partir de unas tres imágenes de entrada en adelante, con la colocación de la coleta lateral colapsando en una coleta central en ángulos de perfil. Eso es un solo revisor, en una interfaz de acceso anticipado, sin temporizador visible. Es una señal útil. No es un benchmark.

A generated single-column spec scoreboard titled 'Qwen-Image 2.1 — the scoreboard' listing rows: Generation component 7B, 32-layer single-stream DiT; Text encoder Qwen3-VL 8B; Licence Qwen Research License, non-commercial only; Native output 2048 x 2048 at 40 steps; Reference images up to 10; Transparency native RGBA; Independent score none yet. Footer reads 'Figures per the Qwen vendor model card, unaudited; no third-party reproduction at the time of writing.'

Soporte de framework desde el día cero, que es la buena noticia silenciosa

El lugar donde aterriza un modelo el día de su lanzamiento te dice más sobre si realmente puedes usarlo que la ficha del propio modelo, y Qwen-Image 2.1 aterrizó en muchos sitios:

Diffusers — un QwenImage21Pipeline se fusionó el día cero, y el repositorio del modelo lleva la diffusers:QwenImage21Pipeline etiqueta.

ComfyUI — soporte nativo desde el primer día con plantillas de flujo de trabajo de texto a imagen y edición de imágenes, además de un repositorio de pesos independiente compatible con Comfy.

vLLM-Omni — ejecución paso a paso, caché KV de prefijos, decodificación con CUDA Graph, cuantización FP8 y paralelismo de tensores/Ulysses.

SGLang — una solicitud de incorporación de cambios de soporte nativo se fusionó el 17 de septiembre, tres días antes de los pesos, abarcando el DiT, el VAE RGBA, el condicionamiento de Qwen3-VL, múltiples imágenes de referencia y la entrada/salida RGBA, validada en H200, B200, RTX PRO 6000, RTX 5090 y RTX 4090.

LightX2V — aceleración desde el día cero, además de AMD Radeon mediante ROCm y compatibilidad multichip a través de FlagOS.

La pull request de SGLang previa al lanzamiento es la señal. Que el soporte del framework llegue antes que los pesos significa que la ruta de serving se estaba probando contra el checkpoint, no que se escribió después a partir de la model card. Para un componente de 7B con un codificador de texto de 17,5 GB justo al lado, esa es la diferencia entre un fin de semana de yak-shaving y una tarde.

Para GPUs con recursos limitados, la ficha del modelo recomienda la descarga a CPU (CPU offload) — pipe.enable_model_cpu_offload() — que es la válvula de escape estándar y no una solución. La descarga de 33 GB está dominada por el codificador de texto, no por el DiT; el propio transformer de difusión es la mitad más pequeña del paquete, con unos 14 GB.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

La lectura práctica

Si quieres probar Qwen-Image 2.1 hoy, la postura honesta es que puedes hacerlo, de forma local, bajo una licencia de investigación, sin benchmarks independientes y sin derechos comerciales. Ese es un intercambio razonable para una evaluación y malo para un pipeline de producción, y la brecha entre ambos es exactamente lo que decide el archivo de licencia.

Para los equipos que evalúan modelos de imagen sin querer comprometer una ruta de producción con un checkpoint de hace días, la capa de enrutamiento es donde se contiene ese riesgo. OrcaRouter pone más de 200 modelos al frente tras un único endpoint compatible con OpenAI, al precio de lista del proveedor y sin ningún recargo, con conmutación por error automática entre proveedores, de modo que un modelo no probado puede situarse detrás de una ruta junto a un modelo en el que ya confías, en lugar de sustituirlo; y, como el precio de lista se repercute tal cual, una rebaja de precio del proveedor en cualquier modelo enrutado está activa el mismo día, en vez de esperar a un cambio de contrato. Qwen-Image 2.1 no está entre los modelos que enrutamos en el momento de escribir esto, y este artículo no va a insinuar lo contrario. Lo que sí enrutamos es la línea de imagen que lo rodea —la familia GPT-Image de OpenAI, los niveles de Imagen 4 y las vistas previas de imagen de Gemini de Google, y el endpoint de imagen Grok Imagine de xAI—, que es de donde vendría una ruta de conmutación por error mientras evalúas al recién llegado en tu propio hardware.

La pregunta abierta es la que el repositorio no puede responder. Alibaba lanzó un modelo de imagen de pesos abiertos de 7B bajo una licencia solo para investigación, el mismo año en que lanzó Qwen-Image 3.0 como un modelo cerrado alojado y sin pesos en absoluto. Dos lanzamientos, dos apuestas opuestas, con cuatro meses de diferencia. Cuál de esas dos formas adoptará el próximo modelo de imagen Qwen —y si la licencia de investigación llegará a convertirse en algo que una empresa pueda usar— es lo que hay que observar. Los pesos ya están en Hugging Face, y cualquiera puede leer el archivo de licencia por sí mismo.

A screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured September 20 2026, showing the Like and Follow counts, the tags Text-to-Image, Diffusers, Safetensors, QwenImage21Pipeline, rgba, the qwen-research licence, 7B params, BF16 tensor type, and the notice that the model is not deployed by any inference provider.