Tarjeta de título para una comparación de Ming-Image-0.1-Design y Qwen-Image 2.1, con el subtítulo de que la licencia y la factura del hardware deciden la elección, con una tarjeta que dice licencia más flexible y la otra licencia más restrictiva.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 2.1: La licencia es la verdadera diferencia

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos modelos de imagen abiertos llegaron con tres días de diferencia en septiembre de 2026 y, vistos en una hoja de especificaciones, parecen la misma compra. Ming-Image-0.1-Design, creado por el equipo inclusionAI de Ant Group, publicó sus pesos en Hugging Face el 17 de septiembre bajo una licencia MIT. Qwen-Image 2.1, del equipo Qwen de Alibaba, le siguió el 20 de septiembre bajo el Qwen Research License Agreement. Ambos generan RGBA nativo, ambos afirman ofrecer salida 2K y ambos apuntan al mismo comprador: un equipo que quiere una generación de imágenes que pueda alojar, inspeccionar y modificar por sí mismo. Las dos cosas que en realidad los separan son las dos que una hoja de especificaciones muestra peor: qué te está permitido legalmente hacer con el resultado y cuánto silicio hace falta para producir una.

Eso no es un encuadre retórico. Para uno de estos modelos, la licencia es un impedimento absoluto para el uso comercial; para el otro, es un asunto irrelevante. Y el número de parámetros que cada proveedor imprime en la caja subestima la descarga por un factor de tres o cuatro. Esos dos hechos deciden la compra mucho antes que cualquier benchmark — y, de hecho, los benchmarks no se pueden comparar en absoluto.

Lo que realmente contiene cada repositorio

Ninguno de los dos modelos es una sola red. Ambos son pipelines, y el pipeline es donde reside el tamaño:

• Generador — Ming-Image-0.1-Design incluye un transformer de diseño de 6.15B de parámetros (12.31 GB en BF16); Qwen-Image 2.1 incluye un DiT de flujo único de 7.1B con 32 capas, atención causal por bloques y un número no revelado de parámetros activos (aproximadamente 14.2 GB).

• Lado de texto — Ming-Image-0.1-Design combina su transformer con un LLM multimodal de 17,01B (34,02 GB) y un conector de 3,09B (6,17 GB); Qwen-Image 2.1 utiliza un codificador de texto Qwen3-VL 8B (unos 17,5 GB).

• Parámetros totales — 26,44B para Ming-Image-0.1-Design frente a aproximadamente 15–16B para Qwen-Image 2.1. Ten en cuenta que la cifra destacada de ninguno de los dos proveedores es el total: tanto "6B" como "7B" describen únicamente el generador.

• Tamaño del repositorio — 52,88 GB para Ming-Image-0.1-Design (49,25 GiB de eso son pesos); aproximadamente 33 GB para Qwen-Image 2.1.

• Transparencia — ambos generan RGBA nativo directamente desde el modelo en lugar de mediante un paso de matting a posteriori. Ming-Image-0.1-Design utiliza su propio VAE RGBA; Qwen-Image 2.1 utiliza un VAE RGBA de 64 canales con compresión espacial de 16×.

• Generación predeterminada — Ming-Image-0.1-Design se valida a 2048×2048, 12 pasos, BF16, CFG 1.0; Qwen-Image 2.1 usa 2048×2048 de forma predeterminada en 40 pasos con siete preajustes de relación de aspecto.

• Licencia — MIT para Ming-Image-0.1-Design; el Acuerdo de Licencia de Investigación de Qwen, no comercial, para Qwen-Image 2.1.

La etiqueta «6B» está haciendo mucho trabajo

El repositorio de Ant Group se titula en torno a un modelo de 6 mil millones de parámetros, y el transformer realmente es de 6,15B. Pero los pesos que descargas son 49,25 GiB, el repositorio es de 52,88 GB, y la configuración que el proveedor validó — 2048×2048 en BF16 con la pila de texto completa residente — está especificada para una GPU CUDA de 80 GiB. Eso no es un error de redondeo en una tarjeta de 48 GB; es una tarjeta que no puedes usar. Un acelerador de 48 GB no albergará el pipeline, y tampoco lo harán dos de ellos sin las acrobacias de offload que el proveedor no documenta.

Qwen-Image 2.1 es la descarga más indulgente, con la salvedad de que Alibaba no publica ninguna cifra oficial de VRAM en absoluto. La única orientación de la ficha del modelo es habilitar la descarga a CPU en tarjetas más pequeñas. Lo que se ha medido desde el lanzamiento es más útil que lo que se ha publicado: una canalización int8 se ejecuta con alrededor de 16 GiB en total y entra completamente residente en una tarjeta de 24 GB, mientras que se ha reportado que una ejecución completa en BF16 va desde aproximadamente 17 GB con descarga a CPU hasta un pico de aproximadamente 40 GiB a 1024×1024, dependiendo de cómo se coloque el codificador de texto. La latencia reportada para una sola imagen varía desde unos pocos segundos en una B200 hasta menos de diez en una tarjeta de estación de trabajo actual. Trata cada uno de esos números como una medición de la comunidad y no como una especificación — varían con la estrategia de descarga más de lo que los modelos difieren entre sí.

El resumen práctico: Qwen-Image 2.1 es un modelo de clase 3090 si estás dispuesto a hacer offload; Ming-Image-0.1-Design es un modelo de clase centro de datos y no tiene una configuración más pequeña.

La licencia es la bifurcación del camino

Esta es la parte que realmente detendrá un proyecto, y es la parte que las dos versiones tratan de forma más diferente.

Ming-Image-0.1-Design tiene licencia MIT. Lánzalo en un producto de pago, afínalo, redistribuye los pesos, mantén tus cambios cerrados; nada de eso requiere una conversación con Ant Group.

Qwen-Image 2.1 no lo es. Se rige por el Acuerdo de Licencia de Qwen Research de fecha 20 de septiembre de 2026, que licencia los pesos únicamente para investigación y evaluación. El uso comercial requiere un acuerdo aparte con Alibaba, y no se publica ningún precio para dicho acuerdo. Las obras derivadas y las redistribuciones deben incluir la licencia, un aviso «Built with Qwen» o «Improved using Qwen» y la línea de copyright de Hangzhou Tongyi Laboratory, y «Qwen» no puede ser el nombre principal de un modelo derivado. La licencia se rige por la legislación china, con jurisdicción en Hangzhou.

Hay un punto verdaderamente esclarecedor en la propia respuesta de seguimiento del proveedor: Alibaba ha declarado que las imágenes generadas no forman parte de los “Materiales” licenciados, así que conservas los derechos sobre lo que produce el modelo. La restricción se aplica a los pesos y al modelo, no a tu resultado. Es una salvedad significativa y vale la pena leerla con precisión, porque el resumen fácil —“las imágenes son tuyas, el modelo no”— es el correcto.

También es un cambio de rumbo. Las versiones anteriores de Qwen-Image, incluidas la versión original de Qwen-Image y las compilaciones 2511 y 2512, siguen siendo Apache 2.0 y permisivas para uso comercial. Un equipo que eligió Qwen-Image el año pasado por su licencia y se actualiza a 2.1 este mes hereda una restricción exclusiva para investigación que nunca aceptó. Si los términos permisivos son el requisito, Qwen-Image 2.1 no es la versión más nueva de lo que ya tenía — es un acuerdo diferente.

Lo que cada uno está diseñado para hacer

La división de licencias refleja una diferencia de intención, y es esa diferencia la que debería guiar la elección cuando ambas son opciones legales para usted.

Ming-Image-0.1-Design es una herramienta de diseño. El stack de texto existe para expandir un brief corto en un prompt estructurado de 8K, y el proveedor distribuye "skills" en torno a él: una Design Skill que produce un borrador visual en unos 15 segundos, y una PPT Skill orientada a resultados con forma de diapositiva. Su repositorio complementario, Ming-Image-0.1-Design-Layer, toma un diseño aplanado y lo devuelve como capas separadas, que es la única capacidad aquí que nada más en el campo abierto ofrece. inclusionAI informa que el modelo Layer se ejecuta aproximadamente 4,3× más rápido que un modelo de capas abierto de 20B en la misma tarea (183 segundos frente a 795) —reportado por el proveedor, no reproducido, y el objetivo de comparación no se nombra con la precisión suficiente para verificarlo.

Qwen-Image 2.1 es un generador y editor. Un solo checkpoint hace tanto texto-a-imagen como edición basada en instrucciones, acepta hasta 10 imágenes de referencia para una sola edición y admite ediciones locales que dejan intacto el resto del fotograma. Se lanzó con soporte desde el primer día en ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion y LightX2V — una historia de servicio que Ming-Image-0.1-Design aún no tiene, ya que su propia guía de servicio apunta a vLLM-Omni.

Interpreta eso como una bifurcación y no como una clasificación. Si la tarea es «producir un recurso de diseño editable y por capas a partir de un brief», Ming-Image-0.1-Design es el único de los dos que lo hace. Si la tarea es «generar y luego editar de forma iterativa tomando referencias como base», Qwen-Image 2.1 lo hace en un solo modelo y Ming-Image-0.1-Design no lo hace en absoluto.

Los benchmarks no son comparables, y esa es la respuesta honesta.

Ambos proveedores tienen cifras. Ninguna de las dos cifras puede colocarse junto a la otra, y cualquier artículo que lo haga se está inventando un resultado.

La evidencia de Ming-Image-0.1-Design es una tabla de Artificial Analysis: el primer puesto en la Text-to-Image Leaderboard filtrada por pesos abiertos para Diseño UI/UX, con un Elo de 1.082, por delante de Ideogram 4.0 Quality con 1.052, Ideogram 4.0 con 1.015, HunyuanImage 3.0 Instruct con 1.005 y FLUX.2 [dev] con 1.000. El proveedor también reporta tasas de victoria del 67,4 % en maquetación, del 67,0 % en composición compleja y del 66,7 % en renderizado de texto, y el primer puesto en 12 métricas en Crello. La clasificación es un instrumento de terceros, lo que convierte al Elo en la más sólida de las dos clases de evidencia que hay aquí; las tasas de victoria y el barrido de Crello son reportados por el proveedor y deben leerse como afirmaciones.

Artificial Analysis Text-to-Image Leaderboard filtered to open weights on the UI/UX Design board, showing Ming-Image-0.1-Design first at Elo 1,082 above Ideogram 4.0 Quality at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and FLUX.2 dev at 1,000.

La evidencia de Qwen-Image 2.1 es Qwen-Image-Bench, un benchmark creado por el equipo de Qwen, en el que obtiene 60,28 y lidera el campo del código abierto por delante de Nano Banana 2.0, con 59,82, y de GPT Image 1.5, con 59,65. El material de origen señala que el benchmark fue creado por Qwen, y los tres primeros se sitúan a menos de un punto entre sí — una diferencia que queda muy dentro del ruido de un benchmark cuyo autor también compite en él.

Así que: un Elo de terceros sobre un subconjunto de diseño de UI/UX, frente a una puntuación general creada por el proveedor. Distintos instrumentos, distintas tareas, distintos jueces. Nadie ha publicado una comparación directa de estos dos modelos entre sí y, con las pruebas disponibles, nadie puede hacerlo. La lectura útil es limitada y vale la pena decirla sin rodeos: Ming-Image-0.1-Design cuenta con corroboración de terceros en trabajo de diseño específicamente, Qwen-Image 2.1 tiene una fortaleza reportada por el proveedor en generación y edición generales, y el solapamiento entre esas dos afirmaciones es menor de lo que sugieren las cifras titulares.

Llevar cualquiera de los dos a un endpoint

Ninguno de los dos modelos está hoy en el catálogo de OrcaRouter. Ming-Image-0.1-Design y Qwen-Image 2.1 son ahora mismo propuestas de autoalojamiento: los pesos se pueden descargar y las guías de servicio son reales, pero eres tú quien levanta la GPU, y en el caso de Ming esa GPU es una de 80 GiB. Los incluimos aquí como lanzamientos de pesos abiertos, no como rutas.

Lo que conviene saber antes de comprometerte con hardware es cuánto te cuesta esa misma carga de trabajo como llamada. Nuestros modelos de imagen enrutados incluyen google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, los tres niveles de Imagen 4.0 (fast, standard y ultra), grok/grok-imagine-image y la familia GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 y openai/gpt-image-2. Ejecutar un brief de diseño contra uno de ellos durante una semana te dice si la salida por capas de Ming-Image-0.1-Design es una capacidad que realmente necesitas, por una fracción del coste de la tarjeta de 80 GiB, y lo hace antes de que descubras si la licencia o la VRAM iban a ser el obstáculo. Cuando sí trasladas un modelo autoalojado a una ruta de producción, ese mismo endpoint es donde reside el enrutamiento — una sola clave para más de 200 modelos, conmutación automática por error entre proveedores y 0% de margen, de modo que un recorte de precios de un proveedor está activo en nuestro lado el mismo día en que se anuncia.

The OrcaRouter model page for openai/gpt-image-2, one of the image models actually routable, showing the OpenAI-compatible base URL, the /v1/images/generations endpoint and per-million-token input and output pricing.

¿Quién debería elegir cuál?

Elige Ming-Image-0.1-Design si el entregable es un recurso de diseño y no una imagen: salida por capas, expansión estructurada de prompts, generación con formato de diapositiva y una licencia que te permite vender lo que crees con él. Presupuesta para una tarjeta potente y acepta que el ecosistema de servicio que lo rodea es más limitado que el del lado de Qwen. También es el más útil de los dos si necesitas poner una cifra delante de un cliente, porque su evidencia más sólida es la única cifra de terceros en esta comparación.

Elige Qwen-Image 2.1 si el flujo de trabajo es generar y luego editar, si necesitas condicionamiento por imagen de referencia, o si quieres ejecutarlo en hardware que ya tienes. Es más pequeño, tiene mejor soporte desde el primer día, y su licencia es adecuada para el trabajo de investigación y evaluación que la mayoría de la gente hace primero en la práctica. Se convierte en la elección equivocada en el momento en que el resultado es comercial y la revisión legal es real, porque la única vía hacia una licencia comercial es un acuerdo directo con Alibaba y no hay un precio publicado con el que planificar.

No elijas ninguno, todavía, si lo que necesitas es generación de imágenes en producción este mes. Ambos son pesos, y los pesos son un compromiso de hardware y legal antes de ser una capacidad. La pregunta de diseño —¿cambia la salida en capas lo que mi equipo puede entregar?— se puede responder primero en un endpoint alojado, y esa respuesta es lo que debería decidir si se compra la tarjeta de 80 GiB.

Qué ver

Tres cosas moverán esta comparación. Que Ming-Image-0.1-Design consiga una ruta de servicio más allá de su propia guía de vLLM-Omni, porque esa es actualmente la brecha entre él y la lista de cinco frameworks desde el día cero de Qwen-Image 2.1. Que Alibaba le ponga un precio a la licencia comercial de Qwen, porque un precio sin fijar es la mayor incógnita de este emparejamiento. Y que alguien —un laboratorio, un evaluador independiente o un proveedor que no tenga nada que perder— enfrente a estos dos entre sí con los mismos prompts. Hasta que eso ocurra, lo más parecido a una comparación justa no es una puntuación en absoluto. Es la línea de la licencia, y Ming-Image-0.1-Design gana esa sin discusión.

Scoreboard comparing Ming-Image-0.1-Design and Qwen-Image 2.1 across weights release date, licence, generator size, total parameters, repository size, validated hardware, default generation, output format and headline benchmark, with a footer separating third-party from vendor-reported figures.