Tarjeta de título principal que dice 'Ming-Image-0.1-Design encabeza la tabla de clasificación de diseño de UI de pesos abiertos', subtítulo 'Modelo de pesos abiertos mejor valorado en la sección de Diseño UI/UX de Artificial Analysis, con 1,084 Elo', con una tarjeta de icono de trofeo etiquetada 'Modelo de pesos abiertos mejor valorado' y una tarjeta de icono de pantalla etiquetada 'Líder en Diseño UI/UX'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Ming-Image-0.1-Design lidera la tabla de diseño de UI de pesos abiertos — y el número cuadra

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La afirmación que circula junto con Ming-Image-0.1-Design es que el modelo de 6B de inclusionAI es el mejor modelo de texto a imagen de pesos abiertos para trabajo de UI y UX, situándose en el primer puesto de la vista de pesos abiertos de la clasificación de Diseño UI/UX de Artificial Analysis con 1.082 Elo. Las capturas de pantalla de clasificaciones de proveedores suelen ser el tipo de evidencia más débil, así que lo primero que conviene hacer es leer la tabla en vivo. A fecha de 24 de septiembre de 2026, se mantiene, con una salvedad importante que la captura no recoge: 1.082 es un subconjunto de caso de uso, no la tabla completa, y en la clasificación completa de Text to Image el mismo modelo ocupa el puesto 45 con un Elo de 995.

Ambos números son reales, provienen de la misma arena y describen los mismos pesos. Lo que los separa es en qué prompts se emitieron los votos.

Lo que realmente dice el tablero en vivo

Artificial Analysis ejecuta una arena ciega de comparación por pares y luego filtra el mismo conjunto de votos en segmentos por caso de uso. El segmento UI/UX Design es el que importa para un modelo creado para paneles de control, pantallas de aplicaciones, pósteres e infografías, y es donde Ming-Image-0.1-Design hace su mejor trabajo:

• Tabla general de Texto a Imagen — Ming-Image-0.1-Design en el n.º 45, Elo 995, IC del 95 % ±8, 21.342 muestras, registrado en septiembre de 2026, $30,00 por 1.000 imágenes, marcado como Open Weights

• Segmento de diseño de UI/UX — Ming-Image-0.1-Design en el n.º 16, Elo 1.084, 2.100 muestras en el segmento

• La entrada de pesos abiertos mejor posicionada en ese segmento — Ming-Image-0.1-Design; los siguientes modelos de pesos abiertos detrás de él son Ideogram 4.0 (Quality) en el n.º 22 y 1.047, Ideogram 4.0 en el n.º 31 y 1.018, y HunyuanImage 3.0 Instruct en el n.º 40 y 1.005

• Lo más alto del segmento de UI/UX — GPT Image 2.5 Flare (max) con 1.226, GPT Image 2.5 Sunburst (max) con 1.215, GPT Image 2 (high) con 1.204, Grok Imagine Image 2.0 con 1.183

• Frente a la propia captura de pantalla del proveedor — inclusionAI publicó 1.082 para Ming frente a Ideogram 4.0 (Quality) con 1.052 y FLUX.2 [dev] con 1.000; el segmento en vivo ahora marca 1.084, 1.047 y 1.000, respectivamente

Así que el titular es preciso en sus propios términos. Ming-Image-0.1-Design es el modelo de pesos abiertos mejor valorado en el segmento de Diseño UI/UX, y es el único modelo de pesos abiertos entre los veinte primeros de ese segmento. También está 142 puntos Elo por detrás del líder de ese segmento, y se sitúa en la mitad de la tabla cuando el prompt no es un prompt de diseño. Un modelo que gana en paneles y queda en 995 en la clasificación general es un especialista, no un todoterreno, y las dos cifras solo se contradicen si se lee una de ellas como si fuera toda la historia.

También vale la pena destacar las 21.342 muestras de la tabla completa por lo que no son. Esa es una gran cantidad de votos, por lo que el intervalo de confianza es estrecho: ±8 Elo. Pero la cantidad de muestras no es lo mismo que la independencia del método. La arena se basa en preferencia humana a ciegas, así que nadie en inclusionAI escribió la puntuación; esa parte es genuina. Lo que mide la puntuación es «cuál de estas dos imágenes prefirió un votante», y los votantes a los que se les pide juzgar una captura de pantalla de UI tienden a premiar el texto legible y el diseño coherente. Ese es precisamente el eje en el que se entrenó este modelo.

Screenshot of the Artificial Analysis Text to Image Leaderboard captured 24 September 2026, cropped to the lower rows. Ming-Image-0.1-Design is row 45, creator InclusionAI, with an Elo of 995, row range 39-50, 21,342 samples, a September 2026 release and $30.0 per 1k imgs, carrying the Open Weights badge. Neighbouring rows include P-Image-Ideogram (High) at 44 and 995, Cosmos3-Super-Text2Image (agentic) at 46 and 994, and Ideogram 4.0 at row 38 and 1,004, also Open Weights.

Qué es Ming-Image-0.1-Design

Ming-Image-0.1-Design es un modelo de texto a imagen de inclusionAI, el laboratorio de IA asociado con Ant Group, publicado bajo la licencia MIT, con los pesos publicados el 17 de septiembre de 2026 y el paquete de lanzamiento completo previsto para el 22 de septiembre. Genera a partir de un prompt únicamente —sin necesidad de una imagen de referencia— y está orientado al diseño gráfico con mucho texto más que a la fotografía: maquetas de UI, paneles de control, infografías, carteles y cualquier cosa en la que el texto renderizado deba seguir siendo legible al tamaño al que se leerá.

La configuración de inferencia documentada es específica e inusualmente económica por paso:

• Resolución — se recomienda 2048 x 2048, o 1024 x 1024 para una generación más rápida, con los tamaños intermedios ajustados a uno de esos dos grupos

• Pasos de muestreo — 12

• Guía — CFG scale 1.0

• Precisión — BF16

• Hardware — una GPU CUDA con 80 GiB de VRAM, descrita como la configuración validada

Doce pasos con una escala de guía de 1.0 es la firma de un muestreador destilado o sin guía. Eso es lo que hace que una salida de 2048 píxeles sea asequible en un número de pasos que la mayoría de los modelos de difusión no intentarían, y es la razón principal por la que este modelo es interesante para cualquiera que ejecute generación de imágenes en volumen en lugar de una imagen a la vez.

La otra característica estructural es la transparencia. Ming-Image-0.1-Design puede emitir RGBA nativo, por lo que un fondo transparente procede del muestreador en lugar de una pasada de matting, cuando el prompt comienza con una de las frases de transparencia documentadas. Un modelo complementario, Ming-Image-0.1-Design-Layer, va más allá: toma un diseño aplanado más un plan de capas y devuelve PNG RGBA separados —texto, tarjetas, sujeto principal, fondo— que se recomponen en el original. Esa es la diferencia entre un modelo de diseño y un modelo de imágenes. Un PNG plano es una imagen de una maquetación; las capas separadas son una maquetación que todavía puedes editar.

Screenshot of the inclusionAI/Ming-Image-0.1-Design model card on Hugging Face, captured 24 September 2026. The header shows 188 likes, 3,067 followers, tags including text-to-image, difusers, safetensors, image-generation, graphic-design, text-rendering and License: mit, and a safetensors panel reading Model size 6B params, Tensor type BF16. The card's UI/UX Design leaderboard image is embedded in the body, showing Ming-Image-0.1-Design first at 1,082 above Ideogram 4.0 (Quality) at 1,052 and FLUX.2 [dev] at 1,000. The right rail states 'This model isn't deployed by any Inference Provider', and the Quick Start block shows the infer.py command with --resolution 2048 and a note that prompt enhancement can use Ling-3.0-flash-VL or qwen3.8-27B.

La etiqueta de 6B y la descarga de 26B

"6B" es acertado en cuanto a la parte que la mayoría tiene en mente y engañoso en cuanto a la parte que determina si puedes ejecutarlo. El transformer de difusión tiene 6.15B parámetros. El paquete que realmente descargas es de aproximadamente 52.88 GB, porque el codificador de texto multimodal tiene 17.01B parámetros y el conector añade 3.09B — alrededor de 26B parámetros en BF16 en total. El transformer del modelo Layer es el doble que el del modelo base, con 12.31B, y su paquete es aún más grande, de aproximadamente 65.20 GB.

Esto importa por dos razones prácticas. Primero, el requisito de 80 GiB de VRAM no se debe al transformer de 6B; se debe a todo lo que tiene que estar residente junto a él. Segundo, cualquier comparación con un modelo descrito como «6B» debe verificar a qué 6B se refiere. Un transformer de difusión de 6B con un codificador de texto de 20B plantea un problema de despliegue muy distinto al de un modelo de 6B de principio a fin.

El manejo de prompts es la otra cosa que la ficha hace explícita en lugar de ocultar: la receta recomendada ejecuta primero un paso de reescritura, usando un modelo de visión-lenguaje para expandir un prompt corto en una descripción de diseño JSON estructurada al estilo Figma, con coordenadas, jerarquía, especificaciones de color y texto literal. Las fichas de modelo indican Ling-3.0-flash-VL o Qwen3.8-27B para esa tarea. En otras palabras, el pipeline que el proveedor evalúa con benchmarks es un pipeline de dos modelos. Si llamas a Ming-Image-0.1-Design con un prompt de una línea y sin paso de reescritura, no estás ejecutando la configuración que produjo 1.084 en el segmento de UI/UX.

En qué situación deja esto a un pipeline de diseño

El resumen honesto de Ming-Image-0.1-Design es que resuelve un problema específico y costoso —generar diseños densos en texto que sobrevivan a ser observados— y lo hace en la cima del campo de pesos abiertos en el único tablero que mide ese problema. No lidera el tablero general de imágenes, no elimina la necesidad de un VLM delante de él, y exige una GPU potente.

Lo que cambia es la parte intermedia de un flujo de trabajo de diseño. Si tu pipeline actualmente genera una imagen plana y luego paga a una persona o a un modelo de segmentación para que la recorte en partes, un modelo que emite RGBA de forma nativa y un compañero que emite de 2 a 9 capas con nombre eliminan una etapa. Eso vale más que una columna de Elo, y es la parte que ninguna tabla de clasificación mide.

Para los equipos que quieran probarlo sin asumir infraestructura, conviene ser precisos sobre esta distinción. Ming-Image-0.1-Design es una descarga con licencia MIT, así que se ejecuta en tu hardware o no se ejecuta en absoluto — OrcaRouter no enruta ningún modelo de inclusionAI de ninguna versión, y decir lo contrario sería una afirmación que no podemos respaldar. Lo que sí te aporta una capa de enrutamiento es la superficie que lo rodea: un endpoint compatible con OpenAI para más de 200 modelos, conmutación por error automática entre proveedores y el precio de lista del proveedor trasladado con un 0 % de recargo, de modo que un cambio de precio del proveedor en cualquier modelo que sí uses esté activo en nuestro lado el mismo día. Si estás poniendo en marcha un pipeline de diseño y quieres hacer una prueba A/B de este modelo contra uno alojado en el que ya confías, esa comparación se ejecuta con una sola clave en lugar de con dos contratos.

A rendered summary card headed 'The two numbers' and titled 'One model, two readings', listing five figures: Overall Text to Image board #45, Elo 995, 95% CI 8, 21,342 samples; UI/UX Design slice #16, Elo 1,084, 2,100 samples in the slice; open-weights standing in that slice #1, next is Ideogram 4.0 (Quality) at #22 and 1,047; leader of the same slice GPT Image 2.5 Flare (max), Elo 1,226, a 142-point gap; board-listed API pricing $30.00 per 1,000 images, flagged Open Weights.

¿Qué cambiaría el panorama?

Tres cosas llevarían a Ming-Image-0.1-Design de ser un sólido especialista de pesos abiertos a ser una opción predeterminada. Una primera reproducción independiente de las cifras de Crello del modelo Layer —la tarjeta informa un error RGB L1 de 0.0574 y un IoU suave alfa de 0.8923 a 1024, y ningún grupo externo las ha ejecutado. Un endpoint alojado que elimine el requisito de 80 GiB. Y una segunda porción de casos de uso en la que el modelo se posicione tan bien como lo hace en UI/UX Design, porque un modelo que solo gana en una porción de un tablero es un modelo cuya generalidad aún no está demostrada.

Hasta entonces, la frase exacta es la acotada: en el segmento de Diseño UI/UX de Artificial Analysis, leído el 24 de septiembre de 2026, Ming-Image-0.1-Design de inclusionAI es el modelo de texto a imagen con pesos abiertos mejor valorado, con 1.084 de Elo en 2.100 votos — y en la tabla completa de esa misma arena ocupa el puesto 45 con 995. Ambos son el modelo. Ninguno de ellos es una afirmación de lanzamiento, porque este modelo no tuvo un lanzamiento; tuvo un repositorio.