Tarjeta de título principal que dice 'Ming-Image-0.1-Design vs GPT Image 2.5', subtítulo 'Una puntuación fue votada por desconocidos, la otra fue dibujada por el propio equipo del modelo', con dos tarjetas que dicen 'GPT Image 2.5: 1,227 Elo en el tablero de UI/UX Design, 1,287 votos ciegos, $210.72 por cada 1,000 imágenes' y 'Ming-Image-0.1-Design: 1,082 Elo en un tablero publicado dentro de su propio repositorio, 0 descargas'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

Ming-Image-0.1-Design vs GPT Image 2.5: El propio número de un laboratorio frente a los votos de un jurado de extraños

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Poner Ming-Image-0.1-Design y GPT Image 2.5 en la misma frase y la comparación obvia es la calidad. La comparación útil es la procedencia. GPT Image 2.5 ocupa el primer y el segundo puesto en el tablero en vivo de diseño UI/UX de Artificial Analysis, con 1.227 y 1.218 Elo, sobre 1.287 y 1.303 votos humanos a ciegas, respectivamente — es decir, una clasificación producida por personas que no construyeron el modelo y a las que no se les dijo qué resultado era de quién. Ming-Image-0.1-Design tiene exactamente una puntuación asociada, 1.082 Elo, y esa puntuación aparece en un gráfico de clasificación incluido dentro del propio repositorio de Hugging Face de inclusionAI, en un tablero que no pudimos encontrar en ningún otro lugar, para un modelo con cero descargas. Uno de estos números es evidencia. El otro es una afirmación con tipografía. Esa brecha, no los 145 Elo entre ellos, es lo que debería guiar una decisión sobre cualquiera de los dos modelos.

Los dos números lado a lado, y la trampa de compararlos

Los números están lo suficientemente cerca como para parecer comparables, y son lo suficientemente distintos en naturaleza como para no serlo. Este es el conjunto, enunciado con precisión.

GPT Image 2.5, en la tabla de clasificación en vivo: primer puesto con 1.227,0 Elo para la configuración Flare (max), segundo con 1.218,1 para Sunburst (max), con recuentos de muestras de 1.287 y 1.303 y un precio registrado de 210,72 USD por cada 1.000 imágenes. El modelo figuraba en esa tabla como publicado el 8 de septiembre de 2026.

• Ming-Image-0.1-Design, en su propia tarjeta — primer puesto con 1.082 Elo, por delante de Ideogram 4.0 (Quality) con 1.052 y de las variantes dev de FLUX.2 entre 994 y 1.000, en un gráfico titulado «Tabla de clasificación de texto a imagen: diseño UI/UX» con el pie de página «Puntuaciones Elo de votos de preferencia a ciegas en nuestra Image Arena». No se muestra el número de muestras. No se publica ninguna metodología. La tabla en sí no está en la web pública, hasta donde hemos podido encontrar.

• La trampa — el Elo se calcula por tabla. Una puntuación solo tiene sentido frente a las otras puntuaciones de la misma tabla, y por eso el mismo lanzamiento de FLUX.2 registra 1.026 en la tabla general de texto a imagen y 1.065 en la vista de la categoría UI/UX Design. Resta 1.082 de 1.227 y no habrás medido una brecha de calidad entre dos modelos. Habrás restado un número de un número distinto.

A two-column scoreboard comparing GPT Image 2.5 with Ming-Image-0.1-Design. The GPT Image 2.5 column reads: 1,227 Elo first place, 1,287 blind votes, released 8 Sep 2026, $210.72 per 1,000 images, independent board, callable. The Ming-Image-0.1-Design column reads: 1,082 Elo first place, no vote count published, weights 17 Sep 2026, no published price, vendor-published board, not callable. A footer notes the two Elo figures are not on the same scale.

¿Qué hace que un voto ciego sea un voto ciego?

Artificial Analysis publica suficiente de su método para que pueda verificarse. Su arena de imágenes empareja dos generaciones de modelos anónimos, pide a un votante que elija un ganador y convierte los resultados en una calificación Elo: los recuentos de muestras en el tablero son el número de tales comparaciones que cada modelo ha acumulado. Esa estructura es lo que hace que una puntuación sea resistente a los propios autores del modelo: las personas que entrenaron GPT Image 2.5 no aparecen en el circuito, y un modelo no puede clasificarse en primer lugar por ser el que prefiere su creador. No es un instrumento perfecto —el grupo de votantes se autoselecciona y los prompts no son un conjunto de pruebas de referencia controlado—, pero es un instrumento que sostiene alguien distinto del proveedor.

El gráfico dentro del repositorio Ming-Image-0.1-Design toma prestado ese formato sin las partes que lo hacen verificable. «Votos de preferencia a ciegas» es la afirmación. «Our Image Arena» es el operador, y el operador es inclusionAI. No hay un recuento de votos publicado, ni una distribución de prompts visible, ni forma de inspeccionar los emparejamientos. Es totalmente posible que la evaluación que respalda ese gráfico sea honesta y rigurosa —el equipo del modelo lo sabría—. También es totalmente imposible de verificar desde fuera, que es lo único que importa si eres quien decide si construir sobre ello.

Vale la pena añadirlo, porque va en contra de la narrativa fácil: Ming-Image-0.1-Design no está en el tablero en vivo de Artificial Analysis en absoluto. Ni en la categoría de Diseño UI/UX, ni en el tablero general de texto a imagen, ni en la vista de pesos abiertos. Su ausencia no es evidencia de que sea peor — un modelo con cero descargas y sin endpoint alojado no tiene forma de acumular votos. Es evidencia de que todavía no existe una cifra independiente, lo cual es una afirmación distinta.

El precio es la parte que no es ambigua

En cuanto al costo, los dos modelos no están ni cerca y no hay nada que discutir.

• GPT Image 2.5 es un endpoint comercial. Artificial Analysis lo registra en 210,72 $ por cada 1000 imágenes en la categoría UI/UX — aproximadamente 21 centavos por imagen, lo que lo sitúa en lo más alto del rango de precios del sector. Para ponerlo en contexto en el mismo tablero, Grok Imagine Image 2.0 se registra en 60 $ por cada 1000, MAI-Image-2.6 en 38,9 $ y Muse Image en 10 $.

• Ming-Image-0.1-Design no tiene precio porque no tiene endpoint. Los pesos tienen licencia MIT y se pueden descargar gratis; ejecutarlos cuesta lo que te cueste por hora una GPU CUDA de 80 GiB. La configuración validada de la tarjeta del modelo es una sola tarjeta de esa clase, a resolución de 2048 x 2048 y 12 pasos de muestreo.

• Ninguna de las dos cifras es estable. Ambos proveedores revisan sus tarifas, y una comparación por imagen escrita hoy tiene una vida útil que se mide en semanas. Este es el único punto en el que la economía de OrcaRouter merece enunciarse sin rodeos: trasladamos los precios de lista de los proveedores con un 0 % de margen, de modo que un cambio en la tarifa de un proveedor se refleja en nuestro lado el mismo día, y no después de un ciclo de reajuste de precios propio, lo cual importa cuando la diferencia entre dos candidatos es de 21 centavos frente a 6 centavos por imagen y ambos pueden moverse.

Lo que realmente puedes llamar hoy, y dónde nos situamos en ello

La disponibilidad es donde esta comparación deja de ser un experimento mental.

GPT Image 2.5 es un producto real con una API real detrás, vendido por OpenAI en sus propios términos. No es enrutable a través de OrcaRouter —nuestro catálogo no incluye ninguna entrada de GPT Image 2.5 a fecha del 23 de septiembre de 2026— y no vamos a describir una ruta que no tenemos. Lo que sí incluye el catálogo de esa misma línea es la generación anterior, openai/gpt-image-2 a 8,00 $ por millón de tokens de entrada y 30,00 $ por millón de tokens de salida, junto con openai/gpt-image-1.5, y esos están detrás de la misma clave que todo lo demás que enrutamos.

Ming-Image-0.1-Design no se puede enrutar en ningún sitio. El repositorio tiene la inferencia deshabilitada, Hugging Face informa de que no hay ningún despliegue de proveedor de inferencia, y el Inicio rápido apunta a un repositorio de GitHub complementario que devuelve 404. No hay ningún modelo de inclusionAI de ningún tipo en nuestro catálogo. La única forma de ejecutarlo es descargar los fragmentos y servirlos tú mismo.

Así que la forma de la elección es: una opción que puedes comprar hoy al precio máximo del mercado, y otra que puedes ejecutar hoy por el precio de una GPU y tu propio tiempo de ingeniería, sin evidencia independiente de que rinda. Cualquiera que te diga que Ming-Image-0.1-Design es una alternativa más barata a GPT Image 2.5 no ha calculado el costo de la segunda opción.

The Artificial Analysis text-to-image leaderboard's UI/UX Design category view, captured 23 September 2026, showing GPT Image 2.5 Flare (max) first at 1,227 Elo with 1,287 samples and $210.7 per 1,000 images, GPT Image 2.5 Sunburst (max) second at 1,218, GPT Image 2 (high) third at 1,206, and Grok Imagine Image 2.0 fourth at 1,182. No Ming-Image-0.1-Design row appears on the board.

Cómo mantener ambos sin apostar por ninguno

El consejo práctico aquí es más limitado que un veredicto, porque los dos modelos aún no son sustitutos entre sí.

Si necesitas generación de imágenes con calidad de interfaz o de diseño en producción, GPT Image 2.5 es la opción defendible, y el precio es lo que debes negociar contigo mismo, no la calidad: lidera el panel independiente por un margen lo bastante amplio como para que la clasificación no esté en duda. Si quieres saber si Ming-Image-0.1-Design es bueno, tienes dos opciones y solo una está libre de conjeturas: llevar los pesos MIT a una tarjeta de 80 GiB y ejecutar tu propio conjunto de evaluación, o esperar a que lo haga alguien más. Mientras tanto, no trates el 1,082 como un resultado. Y si tu verdadero requisito es la opcionalidad más que uno u otro modelo en concreto, la disciplina que rinde es mantener la llamada de generación detrás de una única interfaz — una clave para más de 200 modelos, un cambio de ID de modelo en lugar de una reescritura, conmutación automática por fallo cuando un endpoint se comporta mal —, de modo que, sea cual sea de estos dos el que publique primero una cifra independiente, adoptarlo te cueste una línea de configuración y no un sprint.

Una nota final sobre lo que cambiaría este artículo. Una fila de Ming-Image-0.1-Design que apareciera en el tablero Artificial Analysis UI/UX Design, con un recuento de muestras junto a ella, convertiría el 1.082 del proveedor de una afirmación en un punto de datos, y sería la primera vez que alguien fuera de inclusionAI dijera algo medible sobre el modelo. Ese es el evento al que hay que estar atento, y es algo más útil de monitorear que el contador de descargas.

The OrcaRouter models catalogue, captured 23 September 2026, showing the English-language model directory with its search box, the copy-the-model-ID instructions, and the filter panel for input modalities, context length, price, status and series.