
Qwen-Image 2.1 vs LLaDA-Image-Turbo: dos modelos de imagen abiertos, dos licencias muy diferentes
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dos modelos de imagen de pesos abiertos llegaron dentro del mismo periodo de tres semanas. El equipo de Qwen-Image publicó Qwen-Image 2.1 el 20 de septiembre de 2026 —los pesos, el archivo de licencia, la ficha del modelo y una entrada de blog, todo el mismo día y prácticamente sin antesala. Dieciséis días antes, el 4 de septiembre de 2026, inclusionAI (el laboratorio de investigación de Ant Group) publicó LLaDA-Image-Turbo sin publicación de lanzamiento, sin nota de prensa y sin ningún tipo de anuncio. Ambos se pueden descargar hoy. Ninguno tiene una sola puntuación de benchmark independiente. Y la diferencia que de verdad decidirá cuál de los dos puedes usar no está en la ficha de ninguno de los modelos: está en el papeleo. Qwen-Image 2.1 se distribuye bajo una licencia de investigación que prohíbe el uso comercial de forma tajante. LLaDA-Image-Turbo se distribuye sin ninguna licencia declarada en ninguno de sus repositorios.
La cuestión de la licencia va primero, porque es la única que tiene una respuesta clara
Empieza aquí, porque todo lo demás en esta comparación es provisional y esto no.
• Qwen-Image 2.1 se publica bajo el Acuerdo de Licencia de Investigación de Qwen, de fecha 20 de septiembre de 2026, que otorga derechos "ÚNICAMENTE CON FINES NO COMERCIALES" y establece que el uso comercial requiere una licencia aparte que debe solicitarse al proveedor. Se trata de un cambio sustancial respecto a la línea anterior de Qwen-Image, que se distribuía bajo Apache 2.0. No hay ambigüedad: puedes leerlo, evaluarlo, someterlo a pruebas comparativas y escribir sobre él. No puedes incluirlo en un producto.
• LLaDA-Image-Turbo no declara ninguna licencia en absoluto. Ni una permisiva, ni una restrictiva, ni un marcador de posición. Un repositorio sin licencia no es «de libre uso» en ningún sentido legal — por defecto, todos los derechos están reservados, lo cual es una postura más estricta que la licencia de investigación de Qwen, no una más laxa. Si tienes previsto construir sobre él, esa es una cuestión para el laboratorio, no para un README.
Vale la pena decir la ironía sin rodeos: el modelo que llegó con una licencia formal y restrictiva es aquel con el que puedes planificar hoy, porque sabes exactamente en qué posición estás. El modelo sin licencia es aquel con el que no puedes.

Qué son en realidad los dos modelos
Si dejamos de lado la licencia, estos son dos diseños genuinamente diferentes, creados por razones distintas.
• Arquitectura — Qwen-Image 2.1 es un transformer de difusión de flujo único de 32 capas con 7B de parámetros en el componente de generación visual, un codificador de texto Qwen3-VL 8B y un VAE RGBA de 64 canales con compresión espacial de 16×, aproximadamente 33 GB en todo el paquete. LLaDA-Image-Turbo es un modelo unificado de generación y edición de 6B — un único conjunto de pesos que desempeña ambas funciones en lugar de un modelo base más una ruta de edición independiente.
• Pasos de inferencia — Qwen-Image 2.1 usa por defecto 2048×2048 a 40 pasos con flow matching y programación discreta de Euler. LLaDA-Image-Turbo se destila mediante Twin-DMD a 2–4 pasos, con 4 recomendados, y se ejecuta con una escala de guía de 1.0 frente al 5.0 del modelo Base.
• Opciones de precisión — Qwen-Image 2.1 publica compatibilidad con la cuantización FP8 a través de su ruta vLLM-Omni. LLaDA-Image-Turbo ofrece checkpoints tanto en BF16 como en FP8 como descargas independientes.
• Condicionamiento por referencia — Qwen-Image 2.1 acepta hasta 10 imágenes de referencia, admite ediciones locales mediante un círculo, una anotación pintada o una máscara aparte, y genera RGBA nativo con edición de capas transparentes. La ficha de LLaDA-Image-Turbo no publica un límite de imágenes de referencia.
• Atención — Qwen-Image 2.1 utiliza atención block-causal: una máscara causal a nivel de token para el texto y una máscara bidireccional a nivel de chunk para la generación de imágenes, con reutilización de la caché KV de prefijo cuando el checkpoint incluye causal_condition: true. La ficha de LLaDA-Image-Turbo no describe su esquema de enmascaramiento con el mismo detalle.
• Licencia — solo para investigación y explícita, frente a no declarada.
Fíjate en lo que significan los recuentos de pasos junto con los recuentos de parámetros. Qwen-Image 2.1 es un modelo más grande ejecutado durante diez veces más pasos; LLaDA-Image-Turbo es un modelo más pequeño destilado hasta un puñado de pasos. Son apuestas opuestas sobre dónde reside el coste de la generación de imágenes, y la respuesta correcta depende enteramente de si tu cuello de botella son los segundos de GPU por imagen o el techo de lo que puede llegar a ser una imagen.
Economía de velocidad: 40 pasos frente a 4
El nombre Turbo tiene un peso real aquí. La destilación Twin-DMD colapsa una trayectoria de difusión en unos pocos saltos grandes, por lo que LLaDA-Image-Turbo puede ejecutarse con 4 pasos, mientras que su modelo Base necesita un esquema convencional. Con guidance 1.0, además omite la guía sin clasificador, que normalmente duplica el número de pasadas hacia delante por paso, así que la brecha efectiva es mayor de lo que sugiere por sí sola la comparación 40 frente a 4.
Lo que eso te aporta es rendimiento y previsibilidad. Un modelo de 6B en cuatro pasos es el tipo de cosa que cabe en una sola tarjeta gráfica de consumo y produce una imagen preliminar lo bastante rápida como para integrarse en un bucle interactivo. Qwen-Image 2.1 con 40 pasos y 2048×2048 es una configuración que prioriza la calidad; la propia recomendación de la ficha del modelo para hardware con recursos limitados es la descarga a CPU (CPU offload) mediante pipe.enable_model_cpu_offload(), que es una vía de escape más que una solución.
La contrapartida es que la destilación es una compresión de la capacidad, y nada de esto ha sido medido por nadie fuera de los dos laboratorios. El único dato independiente que existe para cualquiera de los dos modelos es una reseña práctica de acceso anticipado de Qwen-Image 2.1, hecha por un probador del programa Qwen Ambassador, que ejecutó los pesos finales a través de una interfaz de ModelScope Studio e informó aproximadamente 10–15 segundos para texto a imagen y 18–23 segundos para edición. Eso es un solo evaluador, en una UI de acceso anticipado, sin temporizador visible: una señal útil, no un benchmark. LLaDA-Image-Turbo no tiene ningún informe práctico comparable disponible públicamente en absoluto.

La edición es donde más divergen los dos diseños
Ambos modelos hacen texto a imagen y edición, pero llegan ahí de manera diferente, y la diferencia se nota en la fontanería más que en el resultado.
Qwen-Image 2.1 trata el seguimiento de instrucciones como un componente separado e inspeccionable. Junto con el modelo de imagen, la versión incluye dos checkpoints de reescritura de prompts — Qwen/Qwen-Image-2.1-PE-T2I y Qwen/Qwen-Image-2.1-PE-I2I, cada uno un Qwen3.5-VL 9B ajustado de aproximadamente 18.8 GB — que toma una instrucción vaga y la reescribe en una directiva inequívoca antes de que el modelo de difusión la vea. La variante I2I siempre tiene una imagen de entrada, por lo que siempre es una tarea de edición y nunca una generación desde cero. De manera crucial, el reescritor viene con un system_prompt.txt que puedes leer y sobrescribir, y es inusualmente explícito sobre el idioma: el idioma de la descripción sigue tu instrucción, mientras que el idioma del texto pintado en la imagen se decide por un orden de prioridad estricto que preserva el idioma de la etiqueta existente de la imagen de entrada incluso cuando escribes el prompt en un idioma diferente.
Eso es una pequeña pieza de ingeniería con un gran radio de impacto. Si estás produciendo imágenes de producto para un mercado donde el texto del packaging importa, «el rewriter conserva el idioma de la etiqueta existente» y «el rewriter traduce todo al inglés de forma servicial» son la diferencia entre un activo utilizable y uno rechazado — y, como vive en un prompt del sistema en lugar de dentro de una caja negra alojada, puedes hacerle diff y cambiarlo.
LLaDA-Image-Turbo hace la apuesta contraria: un solo modelo de 6B, un solo conjunto de pesos, generación y edición compartiendo todo. Menos piezas móviles, menos que configurar y nada que inspeccionar o anular. Su ficha cita cifras de Qwen-Image-Bench de 53.53 en inglés y 53.38 en chino con una afirmación de SOTA de código abierto — reportadas por el proveedor, no reproducidas, y nótese que el benchmark que está ganando lleva el nombre del modelo con el que compite implícitamente.
En qué los ejecutarías realmente
El soporte del ecosistema el día del lanzamiento es la parte menos glamorosa de un lanzamiento y la que decide si pasas una tarde o un fin de semana.
• Qwen-Image 2.1 se lanzó ampliamente: un QwenImage21Pipeline se fusionó en Diffusers el día cero; soporte nativo de ComfyUI con plantillas de flujo de trabajo de texto a imagen y edición de imágenes; vLLM-Omni con ejecución paso a paso, caché KV de prefijos, decodificación con CUDA Graph, cuantización FP8 y paralelismo de tensores/Ulysses; una pull request de soporte nativo para SGLang que llegó el 17 de septiembre — tres días antes de los pesos — cubriendo el DiT, el VAE RGBA, el condicionamiento Qwen3-VL y la entrada de múltiples referencias, con validación en H200, B200, RTX PRO 6000, RTX 5090 y RTX 4090; y aceleración desde el día cero mediante LightX2V con AMD Radeon a través de ROCm y soporte multichip mediante FlagOS.
• LLaDA-Image-Turbo obtuvo soporte para ComfyUI el 7 de septiembre de 2026, tres días después de los pesos, además de una distribución en Diffusers y Safetensors. Esa es una vía real para ejecutarlo, pero es más limitada, y no hay un trabajo equivalente de servicio en versión preliminar al que poder remitirse.
El pull request de SGLang previo al lanzamiento es la pista reveladora de Qwen-Image 2.1. Que el soporte del framework llegue antes que los pesos significa que alguien estaba probando la ruta de servicio contra el checkpoint, y no escribiéndola a partir de la ficha del modelo después.

La ruta alojada que mantienes junto al experimento
Ninguno de estos modelos se puede enrutar a través de OrcaRouter en el momento de escribir esto, y este artículo no va a insinuar lo contrario: ambos son propuestas de autoalojamiento, una bajo una licencia que excluye el uso en producción y otra sin licencia alguna. Lo que importa para un equipo que los evalúa es que la evaluación no tiene que situarse en la ruta crítica.
OrcaRouter pone más de 200 modelos por delante detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin ningún margen, con conmutación por error automática entre proveedores y un DSL de enrutamiento que te permite combinar varios modelos en una sola llamada. La forma práctica que esto adopta para esta decisión es una ruta en la que el modelo en el que ya confías asume el tráfico de producción mientras se prueba un checkpoint autoalojado junto a él; y, como el precio de lista se transmite tal cual en lugar de aplicar un margen, cualquier cambio de precio de un proveedor en cualquiera de los modelos enrutados está activo en nuestro lado el mismo día, en vez de esperar a una modificación del contrato. Los modelos de imagen que enrutamos hoy son la familia GPT-Image de OpenAI, los niveles de Imagen 4 y las vistas previas de imágenes de Gemini de Google, y el endpoint de imágenes Grok Imagine de xAI. Si vas a dedicar una semana a levantar un transformer de difusión de 33 GB para averiguar si supera a un modelo alojado, el modelo alojado es el grupo de control, y conviene tener el grupo de control ya en una clave.
¿Qué cambiaría esta comparación?
Tres cosas, en orden de cuánto importarían.
Primero, una puntuación de benchmark independiente para cualquiera de los dos modelos. Ninguno tiene una, y hasta que eso cambie, toda afirmación sobre la calidad por ambas partes es un laboratorio corrigiendo sus propios deberes. Segundo, una licencia: una variante permisiva de Qwen-Image 2.1 lo convertiría en la opción predeterminada obvia para el trabajo abierto con imágenes en 7B, y cualquier licencia declarada, por mínima que fuera, en LLaDA-Image-Turbo al menos lo haría planificable. Tercero, a los probadores con acceso anticipado del programa ModelScope de Qwen del 17 de septiembre se les pidió que publicaran muestras o reseñas antes del 29 de septiembre —dentro de ocho días. Ahí es cuando esto deja de ser una comparación de dos tarjetas de modelo y empieza a ser una de verdad. Hasta entonces, el resumen honesto es que Qwen-Image 2.1 es el modelo que parece más capaz y que no puedes comercializar, LLaDA-Image-Turbo es el más rápido que no puedes usar en absoluto sin una conversación, y el archivo de licencia es la única parte de cualquiera de los dos lanzamientos que está totalmente resuelta.
