Tarjeta principal que compara Qwen-Image-2.1-Turbo con Qwen-Image-2.1, mostrando 8 pasos de eliminación de ruido frente a 40, una arquitectura DiT idéntica de 7B y 32 capas, los mismos siete preajustes de resolución, la misma licencia Qwen Research no comercial y una programación de muestreo guardada que num_inference_steps no anula
Engineering & Research

Qwen-Image-2.1-Turbo vs. Qwen-Image-2.1: ¿Qué cambió realmente entre el checkpoint base y el acelerado?

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El mismo componente de generación visual de 7B. Las mismas 32 capas DiT de flujo único. Los mismos siete ajustes de resolución predefinidos, la misma superficie unificada de generación y edición, la misma licencia no comercial, la misma clase de pipeline para cargarlo. Qwen-Image-2.1-Turbo y Qwen-Image-2.1 no son dos modelos entre los que elegir según su capacidad — el checkpoint Turbo es un ajuste fino de la base, y el repositorio lo dice en sus propios metadatos. Lo que los separa es una única trayectoria de muestreo, y la forma en que se almacena esa trayectoria. Uno ejecuta cuarenta pasos. El otro ejecuta ocho, y se niega a que se le diga lo contrario en el momento de la llamada. Todo lo interesante de este par está en esa segunda frase.

Empieza por las partes que son idénticas

Antes de las diferencias, merece la pena cartografiar las similitudes, porque son más amplias de lo que sugiere la etiqueta «Turbo» y son lo que hace atractivo el cambio.

• La arquitectura. La ficha de Turbo afirma que «utiliza la misma arquitectura de generación visual de 7B» que Qwen-Image-2.1. El proyecto describe ese componente como 7B parámetros distribuidos en 32 capas DiT Single-Stream. Nada en el repositorio de Turbo anuncia una columna vertebral más pequeña, podada o rediseñada.

• Las capacidades. Ambos checkpoints se describen como capaces de realizar generación de texto a imagen y edición de imágenes. Turbo hereda la superficie del modelo base en lugar de repetirla: la ficha del modelo base documenta transparencia RGBA nativa, hasta 10 imágenes de referencia y ediciones locales especificadas mediante círculos, anotaciones pintadas o máscaras separadas, con preservación de la identidad para personas y productos.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1, captured in English, showing the Qwen organisation, 3.14k likes, the Text-to-image (diffusers), Diffusers, Safetensors and QwenImage21Pipeline tags, and the introduction text stating that Qwen-Image-2.1 is a unified text-to-image generation and image editing model with 7B parameters in its visual generation component and 32 Single-Stream DiT layers

• Las resoluciones.La ficha de Turbo dice que "use los mismos preajustes de resolución que Qwen-Image-2.1" y luego los enumera: 1:1 a 2048 × 2048, 4:3 a 2400 × 1792, 3:4 a 1792 × 2400, 3:2 a 2528 × 1696, 2:3 a 1696 × 2528, 16:9 a 2752 × 1536 y 9:16 a 1536 × 2752. La ficha del modelo base enumera la misma tabla. Ambas fichas usan el nivel de resolución de 2048 para sus ejemplos.

• La ruta de carga. Ambas se cargan mediante QwenImage21Pipeline en Diffusers. El inicio rápido de la tarjeta Turbo es el inicio rápido de la tarjeta base con el nombre del checkpoint cambiado y bfloat16 escrito como dtype en lugar de torch_dtype.

• El papeleo.Ambos están licenciados bajo el Qwen-Image-2.1 Research License Agreement, ambos llevan license: other con license_name: qwen-research, y ambos tienen un archivo LICENSE ubicado en el repositorio junto a los pesos.

Si ya tienes Qwen-Image-2.1 conectado y funcionando, la superficie de migración es realmente pequeña. Y eso es exactamente por lo que vale la pena detenerse en el único argumento que no se comporta como esperas.

La programación se trasladó fuera de tu código y al punto de control

En el modelo base, el número de pasos lo configuras tú. El ejemplo de texto a imagen de la tarjeta de Qwen-Image-2.1, su ejemplo de edición y su ejemplo de transparencia RGBA pasan todos num_inference_steps=40, y el número es un argumento en el momento de la llamada de la forma habitual en Diffusers. Nada en esa tarjeta te dice que el checkpoint tenga opiniones sobre el schedule.

En Turbo, el schedule son metadatos del checkpoint. La tarjeta indica que el checkpoint «incluye su schedule de muestreo recomendado, por lo que está listo para usarse sin configurar el scheduler manualmente», y luego, en la sección de muestreo, aclara qué significa eso en la práctica: «El schedule de muestreo recomendado de 8 pasos se guarda con el checkpoint y se carga automáticamente. Establecer num_inference_steps por sí solo no lo anula».

A continuación hay dos cosas, y es fácil equivocarse con ambas en sentidos opuestos.

El primero es que ocho no es un valor predeterminado que puedas ajustar al alza. Si quieres saber cómo se ve Turbo con doce pasos o veinte, la tarjeta te dice que la única ruta es un argumento sigmas explícito en el momento de la llamada, y luego cierra la puerta al experimento al señalar que otras programaciones "no han sido evaluadas para este checkpoint". Eso es un proveedor diciéndote que la configuración de ocho pasos es la que respaldan, y que cualquier otra cosa es territorio inexplorado en el que entras solo. Es una frase inusualmente honesta y debería leerse como un límite, no como una invitación.

La segunda es una trampa de reproducción sin mensaje de error asociado. Toma el ejemplo del modelo base, cambia la cadena del repositorio por la del checkpoint Turbo, deja num_inference_steps=40 tal cual, y el código se ejecutará. No te avisará. Producirá una imagen usando el calendario de ocho pasos guardado, y no será la salida que muestra la demostración de Turbo, porque el cuarenta nunca se leyó. Este es el modo de fallo en el que nada parece estar roto: el renderizado se completa, la imagen es plausible, y la única forma de enterarte es si vas a buscar una diferencia. Hay una segunda dependencia enterrada junto a esta: el checkpoint necesita una compilación de Diffusers que entienda las sigmas de muestreo configuradas en la pipeline, añadidas en el PR #14950, que en el momento de escribir esto está en el árbol de código fuente de Diffusers en lugar de en una versión etiquetada. La instalación indicada es una compilación de PyTorch compatible con CUDA más el código fuente de Diffusers, transformers>=5.17.0, accelerate y pillow.

¿Qué paga por los 32 pasos que no diste?

La tarjeta menciona dos mecanismos, y ambos merecen conocerse porque explican lo que el checkpoint Turbo asume acerca de cómo lo vas a invocar.

• CFG 1 de forma predeterminada. "La generación usa CFG=1 de forma predeterminada." Con una escala de guía libre de clasificador de uno, el modelo no ejecuta la segunda pasada incondicional que normalmente requiere CFG, lo cual es una gran parte de cómo se acorta una trayectoria sin simplemente truncarla. También significa que el hábito del modelo base de ajustar una escala de guía no se traslada; aquí no hay nada que ajustar, y la tarjeta no ofrece ninguna recomendación de guía a la que ajustar.

• Caché KV de prefijo.La ficha de Turbo dice que «el caché KV de prefijo reutiliza el contexto de texto e imagen de referencia entre los pasos de denoising». Esto es maquinaria heredada, no algo nuevo para el checkpoint acelerado: el anuncio de Qwen-Image-2.1 incluye la reutilización del caché KV de prefijo como una de las cuatro mejoras principales del modelo base, junto con la atención de granularidad mixta, y las integraciones de servicio desde el primer día para el modelo base —las entradas de vLLM-Omni y SGLang en la lista de noticias del proyecto— nombran el caché KV de prefijo explícitamente entre las funciones que admiten. En un bucle de cuarenta pasos, esa reutilización es una optimización. En un bucle de ocho pasos, importa proporcionalmente más, porque cada paso almacenado en caché representa una mayor proporción del trabajo total.

Lo que la ficha no menciona es ninguna técnica de destilación. La ficha del modelo base Qwen-Image-2.1 y el README del proyecto describen la arquitectura y las capacidades; la ficha de Turbo describe la mecánica. Si intentas razonar sobre lo que cuestan ocho pasos en términos de calidad, el repositorio no te ofrece ningún método sobre el que razonar, solo una programación y un conjunto de imágenes de muestra.

El número de pasos no es un punto de referencia

Esta es la parte de la comparación en la que la respuesta honesta es que no hay comparación posible, y vale la pena ser directo sobre el porqué.

• El checkpoint Turbo no tiene ninguna puntuación publicada. Su ficha no incluye ningún tipo de número de evaluación. No hay ningún resultado de Qwen-Image-Bench para Turbo, ni una comparación directa con el checkpoint base, ni un análisis de ablación sobre el número de pasos, ni una tabla que muestre en qué punto se estabiliza la calidad.

• La puntuación del checkpoint base la reporta el proveedor. La única cifra destacada de la línea Qwen-Image-2 es el resultado de Qwen-Image-Bench del modelo base, reportado por el proveedor para el checkpoint base. No es una medición del checkpoint Turbo y no debería transferírsele: la aceleración es exactamente lo que cabría esperar que alterara esa cifra, y el proveedor no ha dicho en cuánto.

• Ninguna de las dos fichas informa sobre el tiempo ni la memoria. No hay ninguna cifra de latencia, ninguna cifra de rendimiento ni huella de memoria para ninguno de los dos checkpoints, y ninguna de las dos fichas nombra el hardware en el que se ejecutaron sus ejemplos. La ficha del modelo base al menos documenta una sección de optimización de memoria; la ficha de Turbo documenta la instalación, la generación, la edición, el muestreo y las relaciones de aspecto, y ahí se detiene.

Así que el argumento a favor de Turbo frente al checkpoint base es actualmente una cuestión de intención de diseño, no de resultados medidos. Ocho pasos con la misma arquitectura y el mismo nivel de resolución de 2048 deberían costar sustancialmente menos por imagen. "Sustancialmente" está haciendo un trabajo real en esa frase, y la única forma de sustituirlo por un número es ejecutar ambos checkpoints con tu propia carga de trabajo, que también es la única forma de averiguar qué le hace la trayectoria acortada a las imágenes concretas que te importan.

Nada más se movió, incluida la licencia.

Dos cosas que un lector razonablemente podría esperar que hubieran cambiado, y que no cambiaron.

El primero es el ecosistema. Cuando se lanzó Qwen-Image-2.1 el 20 de septiembre de 2026, la lista de noticias del proyecto registró cinco integraciones de día cero separadas ese mismo día: soporte de Diffusers mediante el PR #14804, soporte nativo de ComfyUI con plantillas de flujo de trabajo publicadas para texto a imagen y edición, soporte de vLLM-Omni con ejecución paso a paso y decodificación con CUDA Graph y cuantización FP8 y paralelismo tensorial, soporte de SGLang con Cache-DiT y descarga de componentes, y aceleración del proyecto LightX2V. La entrada fechada el 9 de octubre de 2026 que cubre Qwen-Image-2.1-Turbo registra el propio checkpoint y una nota de que las API Pro y Turbo están activas en Alibaba Cloud Model Studio. No hay una lista de frameworks de día cero para Turbo, y cada entrada de framework en la lista de noticias todavía se refiere al modelo base. El checkpoint Turbo se carga mediante una clase de pipeline que ya existía; el soporte para su programación guardada es la única pieza nueva, y llega a través del código fuente de Diffusers en lugar de una versión etiquetada.

El segundo es la licencia. Turbo lleva el Qwen Research License Agreement, exactamente igual que el modelo base. La aceleración no vino con una excepción comercial, un nivel separado ni una relajación de los términos: la restricción no comercial aplica al ajuste fino tanto como al modelo base. Los metadatos del propio repositorio y el archivo de licencia junto a los pesos son la evidencia; la sección de licencia de la tarjeta es una sola frase que apunta al mismo acuerdo. Si la razón por la que ocho pasos te importan es que hacen que el modelo sea lo bastante barato como para ponerlo en un producto, la licencia se interpone directamente, y es el proveedor —no este repositorio— el que tiene que responder por ello.

Endpoints alojados, y dónde encaja OrcaRouter

OrcaRouter no enruta ni Qwen-Image-2.1-Turbo ni Qwen-Image-2.1. Ambos están ausentes de nuestro catálogo, y nada de lo que hay aquí constituye una oferta para servir a ninguno de los dos. Si los quieres, tus rutas son las API alojadas del propio proveedor, varias plataformas de terceros, o los pesos con una compilación de Diffusers lo bastante reciente como para manejar la programación de muestreo guardada del checkpoint Turbo.

Donde OrcaRouter es relevante para esta comparación en particular es en el cambio que haces cuando el autoalojamiento de un checkpoint deja de ser la respuesta correcta. Pasar de un modelo de pesos abiertos que ejecutas tú mismo a un endpoint de imágenes alojado no es solo un cambio de modelo, es un cambio de modos de fallo. Un proceso local falla de formas que puedes ver; un endpoint alojado falla de formas que dependen de qué proveedor respondió y de qué ocurre cuando uno de ellos se degrada a mitad de solicitud. OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI y pasa el precio de lista del proveedor sin margen de beneficio, por lo que un recorte de precio del proveedor se refleja de nuestro lado el mismo día en lugar de esperar a una pasada de reajuste de precios. Además, añade failover automático entre proveedores, un DSL de enrutamiento para especificar qué modelos y proveedores puede usar una solicitud, y fusión de modelos para componer varios modelos en una sola llamada. Los modelos de imágenes que sí ofrecemos son la familia OpenAI GPT-Image, los niveles de Imagen 4 de Google, incluidas las variantes fast y ultra, los endpoints de vista previa de imágenes de Gemini de Google, y el endpoint de imágenes de xAI Grok Imagine.

Concretamente: si estás eligiendo entre los dos checkpoints de Qwen, esa es una decisión de autohospedaje, y las razones para preferir uno sobre el otro son el comportamiento del schedule y el número de pasos. Si lo que realmente necesitas es una imagen en producción sin tener que poseer las GPUs, esa es la decisión con la que estamos en posición de ayudar, y es una decisión distinta.

La versión corta

• Elige Qwen-Image-2.1 si quieres el checkpoint cuyo comportamiento de muestreo coincide con su documentación, si necesitas variar el número de pasos o explorar planificaciones, o si quieres la versión que llegó con soporte desde el primer día en Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V.

• Elige Qwen-Image-2.1-Turbo si quieres la misma arquitectura y las mismas capacidades con una trayectoria drásticamente más corta y estás dispuesto a tratar ocho pasos como fijos, y a instalar Diffusers desde el código fuente para cargarlo.

Checklist card headed 'Identical across both checkpoints' listing the 7B visual generation component, 32 single-stream DiT layers, seven resolution presets, text-to-image and image editing, the QwenImage21Pipeline load path, and the non-commercial Qwen Research Licence, with a chip reading 'The only differences are the sampling schedule and the step count'

• La licencia es la misma en ambos casos, y no espere que se publique una cifra de calidad del checkpoint acelerado con la que compararlo con el modelo base. La reducción de pasos es real y está documentada. Cuánta calidad de imagen cuesta no está documentado en ninguna parte, y por mucho que lea las dos fichas no lo averiguará — esa respuesta solo existe en su propio hardware, con sus propios prompts.