Una tarjeta de título principal para «Ming-Image-0.1-Design vs Qwen-Image 3.0» con el subtítulo «Quién te muestra cómo se dibuja el texto.», que contrasta Ming-Image-0.1-Design (6.15B parámetros, licencia MIT, pesos que puedes leer, publicado el 17 de septiembre de 2026) con Qwen-Image 3.0 (modelo alojado cerrado, número de parámetros no publicado, sin licencia ni informe, disponibilidad general el 5 de agosto de 2026), con el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Ming-Image-0.1-Design vs Qwen-Image 3.0: ¿Quién te muestra cómo se dibuja el texto?

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo más interesante de Ming-Image-0.1-Design no está en su ficha de modelo. Está en un commit a un framework de inferencia. En algún momento cercano a la subida silenciosa del modelo a Hugging Face el 17 de septiembre de 2026, vLLM-Omni fusionó un cambio titulado feat: añadir soporte de byte5 para Ming que conecta un codificador de glifos ByT5 en una nueva ming_flash_omni pipeline — un componente dedicado cuyo único trabajo es mirar los caracteres que pediste que se representaran, no la imagen que pediste. Ese es el tipo de detalle que solo se puede encontrar leyendo código, y es exactamente el detalle que Qwen-Image 3.0 — el modelo de imagen alojado y cerrado del proveedor, lanzado el 21 de julio de 2026 y llevado a disponibilidad general el 5 de agosto — no deja que nadie lea en absoluto. Ambos modelos están orientados al trabajo de diseño, donde el tipo legible es la parte difícil. Solo uno de ellos te dirá cómo lo hace.

Lo que cada uno de ellos dice sobre el texto

La historia de renderizado de texto de Qwen-Image 3.0 es enteramente una afirmación de lanzamiento, y es buena sobre el papel. El material de Alibaba describe prompts de hasta aproximadamente 4,500 tokens, texto legible a partir de aproximadamente 10 píxeles, cobertura de 12 idiomas en más de 20 fuentes, salida de hasta 2048×2048 y hasta seis imágenes por llamada, ofrecido en ediciones Pro y Standard a través de una API alojada. No hay publicación de pesos, ni licencia declarada, ni ficha de modelo, ni informe técnico, ni tabla de benchmarks publicada con la que verificar nada de esto. La cifra ampliamente repetida de ~20B parámetros de MMDiT se reporta en lugar de confirmarse.

La historia de Ming-Image-0.1-Design es un repositorio. 6.154.901.056 parámetros, licencia MIT, un diffusers tag de pipeline, todos los pesos en safetensors BF16, aproximadamente 71,5 GB repartidos en connector/, mllm/, mlp/, scheduler/, transformer/ y vae/. La inferencia recomendada es de 2048×2048 con 12 pasos de muestreo y una guía de 1,0 en una GPU CUDA de 80 GiB, o 1024 para mayor velocidad, con vLLM-Omni designado para el despliegue y un modelo de visión-lenguaje independiente designado para la mejora de prompts. La tarjeta lo describe como un modelo de texto a imagen para UI, infografías, pósteres y otros diseños visuales ricos en texto, con salida RGBA para fondos transparentes.

Esos dos párrafos no son el mismo tipo de afirmación, y vale la pena ser directo sobre por qué. Uno es una descripción de un producto escrita por quienes lo venden. El otro es una descripción de un artefacto que cualquiera puede descargar y comprobar.

El codificador de glifos es la parte que explica la categoría.

El renderizado de texto en los modelos de imagen suele fallar de una manera específica: el modelo genera algo que parece escritura sin ser escritura. Las formas de las letras son verosímiles y la palabra es incorrecta. La razón es arquitectónica antes que cualquier otra cosa — la mayoría de los modelos de imagen no tienen ningún componente que vea los caracteres como caracteres, así que la tipografía se reconstruye a partir de estadísticas visuales del mismo modo que la hierba.

El commit de vLLM-Omni es interesante precisamente porque apunta a eso. Los archivos añadidos — byte5_encoder.py, pipeline_ming.py, t5_block_mapper.py y un procesador de entrada de etapa — describen una ruta en la que un codificador a nivel de byte ByT5 lee el texto que debería aparecer en la imagen, el vocabulario del tokenizador se amplía con marcadores de fuente y color, y las características resultantes se anexan a lo largo de la dimensión de secuencia, mientras que el lado negativo recibe ceros. Ese último detalle es la señal de que se trata de una decisión de diseño real y no de una simple conexión: si la rama negativa llevara las mismas características de glifos, la guía sin clasificador se vería atraída hacia la representación del texto y alejada del prompt, por lo que los ceros existen para evitar que ambos objetivos entren en conflicto. El codificador solo se carga cuando el checkpoint contiene realmente una subcarpeta byte5/.

Dos notas de honestidad. Este es un commit de un framework de inferencia de terceros, no una declaración de Ant Group, y la interpretación de lo que significan esos archivos es nuestra, no la del proveedor. Y corrobora una intención de diseño, no un resultado: que haya un codificador de glifos es coherente con un buen renderizado de texto, y no es evidencia de que el renderizado de texto sea bueno. La única evidencia independiente de calidad es una única posición en la tabla de clasificación, que se comenta a continuación.

A pipeline diagram titled "How the glyph encoder enters the pipeline", showing prompt text passing through a tokenizer extended with font and colour markers into a ByT5 glyph encoder whose features are appended along the sequence dimension, with the negative branch receiving zeros so guidance is not pulled away from rendered text, and the result emerging as an RGBA image.

El contraste con Qwen-Image 3.0 no es que el modelo de Alibaba renderice texto mal —nadie fuera de Alibaba puede decir qué tan bien renderiza texto, y esa es la cuestión—. Es que la pregunta «cómo dibuja letras este modelo» tiene una respuesta para uno de estos modelos y una afirmación de marketing para el otro, y la brecha entre una respuesta y una afirmación de marketing es donde se toman las decisiones de ingeniería.

El único número, y el tablero en el que no está

Ming-Image-0.1-Design ocupa el primer puesto en la tabla de clasificación Text to Image de Artificial Analysis para diseño UI/UX, vista de pesos abiertos, con un Elo de 1.082 —por delante de Ideogram 4.0 (Quality) con 1.052, Ideogram 4.0 con 1.015, HunyuanImage 3.0 Instruct con 1.005, FLUX.2 [dev] con 1.000, FLUX.2 [dev] Flash con 999 y FLUX.2 [dev] Turbo con 994. La copia de esa tabla es la que se reproduce en la propia ficha del modelo, y lleva la marca de Artificial Analysis; nadie ha reproducido la puntuación de forma independiente.

The Artificial Analysis Text to Image Leaderboard for UI/UX Design, open-weights view, with Ming-Image-0.1-Design ranked first at an Elo of 1,082 ahead of Ideogram 4.0 (Quality) at 1,052, Ideogram 4.0 at 1,015, HunyuanImage 3.0 Instruct at 1,005 and the FLUX.2 [dev] variants below them.

Es una tabla de pesos abiertos, así que Qwen-Image 3.0 no tiene entrada y su ausencia no dice nada sobre su calidad. Lo que sí dice es estructural: una tabla de preferencias a ciegas solo puede clasificar modelos cuyos pesos sean públicos. Eso le da a un lanzamiento abierto una posición medible meses antes de que tenga un producto, y a un lanzamiento cerrado le da un número de marketing y nada más. Las afirmaciones de Qwen-Image 3.0 —legibilidad de 10 píxeles, prompts de 4500 tokens, más de 20 fuentes— no tienen ninguna medición independiente que las respalde.

A two-column scoreboard titled "Ming-Image-0.1-Design vs Qwen-Image 3.0 - the scoreboard". Left column Ming-Image-0.1-Design: Weights downloadable, 6.15B; Licence MIT; Text rendering glyph encoder visible; Independent score Elo 1,082; Price self-host; Internals readable. Right column Qwen-Image 3.0: Weights none; Licence not published; Text rendering 10px claim, vendor-reported; Independent score none; Price about $0.04 per image; Internals black box. Footer reads "Qwen-Image 3.0 claims vendor-reported; Ming score per the Artificial Analysis board on its model card.", with the OrcaRouter logo bottom-right.

Cómo probarías esto realmente y cuánto cuesta intentarlo

Si la tipografía legible es la razón por la que estás leyendo esto, la prueba no es una tabla de clasificación. Es tu propia tipografía, tu propio idioma y tus propias cadenas, pasadas por ambos candidatos y leídas por una persona. Esa prueba necesita que uno de estos modelos sea accesible y barato, y que el otro sea descargable, y sus precios se basan en principios opuestos.

• Qwen-Image 3.0 — alrededor de $0.04 por imagen en la edición Pro y alrededor de $0.03 en Standard, con precios domésticos para consumidores que comienzan cerca de ¥0.18 por imagen. Son cifras de lanzamiento y no han sido auditadas. Puedes ejecutar una matriz de prompts esta tarde y pagar por cada llamada.

• Ming-Image-0.1-Design — sin precio publicado, porque no hay un endpoint alojado. El costo es una descarga de 71,5 GB, una tarjeta de 80 GiB y tu propio tiempo, y el beneficio es que puedes dirigir la misma prueba a la ruta del codificador de glifos y ver si es el componente que hace el trabajo.

Esta es la situación para la que está diseñada una capa de enrutamiento, y conviene precisar qué parte de ella aplica. Ni Qwen-Image 3.0 ni Ming-Image-0.1-Design están en nuestra plataforma, así que una capa de enrutamiento no puede poner a ninguno de los dos detrás de una clave hoy. Lo que sí puede hacer es mantener la comparación honesta mientras la realizas: OrcaRouter ofrece más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin margen alguno, con conmutación automática por error entre proveedores, de modo que el modelo en el que ya confías pueda mantener la ruta de producción —y su costo permanezca vinculado al precio de lista del proveedor, de modo que un cambio de tarifa del proveedor recaiga en nuestro lado el mismo día—, mientras que un modelo de diseño sin medir se evalúa junto a él en lugar de delante de él.

Dos lanzamientos abiertos, uno cerrado y un patrón

Merece la pena señalar de qué es evidencia el lanzamiento de Ming, más allá de sí mismo. Ant Group publicó sin anuncio alguno un modelo de diseño de 6,15 mil millones de parámetros bajo una licencia MIT, junto con un segundo modelo para descomposición de capas bajo la misma licencia. Alibaba publicó un modelo alojado cerrado sin licencia, sin tarjeta y sin informe, orientado a la misma clase de trabajo, y lo tarifó por imagen.

Esas son dos apuestas diferentes sobre dónde reside el valor en los modelos de diseño. Una dice que el modelo es el producto y los pesos son el canal de distribución. La otra dice que el modelo es un servicio y los pesos son lo que conservas. Ambas apuestas pueden ser correctas en el mismo mercado, y producen respuestas muy diferentes a la única pregunta que importa a la hora de evaluar: ¿puedo averiguar cómo funciona esto antes de depender de ello?

• Si necesitas saber cómo se renderiza el texto, y por qué a veces no se renderiza — Ming-Image-0.1-Design es el único de los dos que te permite mirar, y la licencia MIT significa que puedes actuar en función de lo que descubras.

• Si necesitas hoy un endpoint de producción con un precio por imagen y sin infraestructura — Qwen-Image 3.0 es el único de los dos que lo ofrece, y sus componentes internos forman parte del precio.

• Si necesitas evidencia independiente antes de decidirte — ninguna de las dos tiene suficiente. Una tiene una sola posición no reproducida en una tabla de clasificación; la otra tiene una hoja de afirmaciones del proveedor sin cifras que la respalden.

Lo que hay que observar es si el patrón se mantiene. Un lanzamiento no anunciado bajo licencia MIT con un codificador de glifos incluido es una declaración sobre cómo esperan sus autores que se use el modelo: que se inspeccione, se ejecute localmente y se modifique. Si el próximo lanzamiento del mismo equipo se anuncia, se evalúa con benchmarks y se aloja, fue algo puntual. Si es otro repositorio discreto, la categoría de modelos de diseño cuenta con un segundo competidor abierto, y la mitad cerrada del mercado tiene un problema de precios que no tenía en julio.