
Qwen-Image 2.1 vs MAI-Image-2.5-Pro: 6.100 votos a ciegas contra cero
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Uno de estos dos modelos ha sido clasificado mediante aproximadamente 6.100 comparaciones humanas a ciegas. Al otro no lo ha clasificado nadie fuera de su propio laboratorio. MAI-Image-2.5-Pro, el modelo de imagen premium de Microsoft, ocupa el primer puesto en la arena de edición de imágenes de Artificial Analysis con un Elo de 1.272, el resultado con más votos de la categoría. Qwen-Image 2.1, que el equipo de Qwen-Image publicó como código abierto el 20 de septiembre de 2026, no tiene ninguna puntuación independiente, y no la tendrá hasta que suficientes personas lo ejecuten en público para generar votos. Esa brecha es el verdadero tema de esta comparación, porque es la única diferencia entre los dos modelos que no es una afirmación de un proveedor. Todo lo demás —la arquitectura, la resolución, el precio— se puede conocer, pero no está demostrado, y los dos modelos se parecen lo suficiente sobre el papel como para que la brecha de medición sea lo que debería impulsar la decisión.
Lo que los votos realmente dicen, y lo que no
Artificial Analysis realiza comparaciones por pares a ciegas: dos modelos reciben el mismo prompt, quienes votan eligen la mejor salida y el Elo surge de los resultados. No es un instrumento perfecto, pero es lo más parecido que tiene esta categoría a un marcador compartido, y el tamaño de la muestra importa tanto como la cifra.
• MAI-Image-2.5-Pro — n.º 1 en edición de imágenes con 1.272 de Elo en aproximadamente 6.100 comparaciones. En texto a imagen, ocupa el n.º 7 con 1.292 de Elo, por detrás de GPT Image 2 (high) con 1.369, Reve 2.1 con 1.322, Nano Banana 2 con 1.320, GPT Image 1.5 (high) con 1.310 y MAI-Image-2.5 con 1.304.
• Qwen-Image 2.1 — no aparece en ninguna de las dos clasificaciones. No es una puntuación baja; es que no hay puntuación. En el momento de escribir esto, la versión tiene un día de antigüedad.
La forma de esas cifras merece leerse con atención, porque no es la forma que sugiere el marketing. El modelo de Microsoft es genuinamente primero en edición y genuinamente séptimo en generación. Esa es una posición específica y defendible —un especialista en edición que lidera su categoría— y es algo distinto de ser el mejor modelo de imágenes, que no lo es. Mientras tanto, el modelo que le supera en texto a imagen es GPT Image 2 (high), que tampoco es el modelo más reciente de OpenAI en este campo. Las clasificaciones independientes recompensan al modelo que se midió más, y en esta comparativa ese es, sin ambigüedad, el de Microsoft.
La única especificación en la que el modelo abierto gana de forma contundente
Hay una diferencia concreta y no subjetiva entre estos dos, y es la resolución.
• Qwen-Image 2.1genera de forma nativa en 2K, con 2048×2048 como valor predeterminado documentado a 40 pasos de inferencia, siete preajustes de relación de aspecto y salida RGBA con un canal alfa real en lugar de un mate.
• MAI-Image-2.5-Pro limita la salida a 1.048.576 píxeles, alrededor de un megapíxel. Sus cifras más destacadas están en otra parte: 32.000 tokens de entrada de texto, una ventana de contexto de 131k y 4.096 tokens de salida, lo que indica cuánta instrucción puede absorber, no cuánta imagen puede emitir.
Para la mayoría del trabajo social y de producto, un límite de un megapíxel no supone una restricción. Para impresión, para composición en gran formato, para cualquier cosa en la que un recorte tenga que sobrevivir, sí lo es. Esta es la única dimensión de toda la comparación en la que puedes señalar un número y decir que el modelo abierto va por delante, y conviene señalar que es un hecho arquitectónico de la ficha del modelo, no una afirmación sobre su calidad. Qwen-Image 2.1 renderizará a 2048×2048 tanto si lo que renderiza merece la pena mirarse como si no.
El precio, que es donde la comparación se vuelve incómoda
MAI-Image-2.5-Pro tiene un precio de modelo premium y las cifras no son sutiles: $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen y $106 por millón de tokens de salida de imagen. Con una salida de 1024 píxeles, eso equivale a aproximadamente $108.50 por mil imágenes. Para ponerlo en perspectiva, eso es alrededor de 2.3× el costo de MAI-Image-2.5 y aproximadamente 5.4× el de MAI-Image-2.5-Flash, por lo que Microsoft ha segmentado deliberadamente su propia línea en lugar de fijar el precio del nivel Pro como una actualización incremental.
Qwen-Image 2.1 no tiene precio alojado, porque no hay endpoint alojado — es una descarga de pesos bajo una licencia de investigación. Su coste es tu tiempo de GPU, y su limitación es que no puedes vender legalmente lo que produce. Comparar $108.50 por mil imágenes con "pesos gratuitos" es comparar un servicio con una máquina, y la versión honesta de esa comparación es: el precio medido te compra un modelo medido, con soporte y con licencia comercial, y los pesos te compran una descarga de 33 GB y un archivo de licencia que dice solo no comercial.
Ese equilibrio es exactamente donde una capa de enrutamiento se gana su lugar. OrcaRouter pone más de 200 modelos al frente detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor y sin ningún margen añadido, con conmutación automática por error entre proveedores — de modo que un equipo que quiera evaluar un modelo abierto sin mediciones previas no tiene que trasladar a él su producción para lograrlo, y como el precio de lista se traslada tal cual, cualquier cambio de precio de un proveedor en un modelo enrutado recae sobre nuestro lado el mismo día en lugar de esperar a la siguiente renovación de contrato. Ni MAI-Image-2.5-Pro ni Qwen-Image 2.1 están entre los modelos que enrutamos hoy, y este artículo no va a sugerir lo contrario. La línea de imagen que sí ofrecemos es la familia GPT-Image de OpenAI, los niveles de Imagen 4 de Google y las vistas previas de imagen de Gemini, y el endpoint de imagen Grok Imagine de xAI.

Dónde se sitúan las afirmaciones del proveedor y cuánto peso darles
Ambos proveedores publican cifras que ningún tercero ha reproducido, y deben leerse con el mismo escepticismo en ambas direcciones.
• Las afirmaciones de Microsoft — 96,8 % de precisión de renderizado de texto en inglés, chino, japonés, coreano y español; 27 % mejor adherencia al prompt que GPT-Image-1.5; 94 % de consistencia de personajes en varias imágenes; y hasta un 84–89 % menos de coste de GPU en escenarios internos específicos de Microsoft. La última es con la que hay que tener cuidado: describe la propia configuración de servicio de Microsoft, no algo que un cliente pueda verificar.
• Las afirmaciones de Alibaba — la entrada de blog de Qwen-Image 2.1 incluye un gráfico comparativo de Qwen-Image-Bench, y las cifras que contiene son del propio proveedor. También circula en la cobertura de terceros una cifra que describe el modelo como un transformer de 20 capas, lo que contradice el DiT de flujo único de 32 capas de la ficha del modelo; la ficha del modelo es la fuente principal y la cifra de 32 capas es la que se debe usar.
La diferencia entre las dos situaciones no es la honestidad de ninguno de los proveedores. Es que el modelo de Microsoft ha sido medido de forma independiente y el de Alibaba no, por lo que las afirmaciones de Microsoft pueden contrastarse con algo y las de Alibaba aún no pueden contrastarse con nada.
Para qué sirve cada uno
Leídos en conjunto, no compiten por el mismo espacio.
• MAI-Image-2.5-Pro es el instrumento de edición. Lidera la tabla de edición sobre una gran base de votos, acepta una instrucción larga (32k tokens de entrada de texto, 131k de contexto), tiene licencia comercial y ya está disponible como vista previa pública en Microsoft Foundry y el MAI Playground. Si tu trabajo es la corrección iterativa de imágenes y necesitas saber antes de comprometerte que es el mejor disponible para esa tarea, esta es la respuesta basada en mediciones, y cuesta alrededor de $108.50 por cada mil imágenes.
• Qwen-Image 2.1 es el artefacto de investigación abierto. Renderiza a mayor tamaño, incluye un checkpoint de reescritura de prompts inspeccionable junto con el modelo de imagen, acepta hasta 10 imágenes de referencia con ediciones locales mediante círculo, anotación pintada o máscara, y es gratis descargarlo y es ilegal vender con él. Si tu trabajo es evaluación, benchmarking o construir sobre pesos que puedes leer, es el objeto más interesante — y estás haciendo ese trabajo sin una tabla de clasificación que te diga si es bueno.
También hay una asimetría temporal que vale la pena señalar. MAI-Image-2.6 entró en vista previa privada el 19 de agosto de 2026, lo que significa que el modelo que encabeza la tabla de edición ya está una generación por detrás de lo que Microsoft se prepara para lanzar. Qwen-Image 2.1, en cambio, está en su primer día, con un programa de acceso anticipado que pidió a sus probadores publicar antes del 29 de septiembre. Los dos tableros de puntuación de esta comparación se verán diferentes dentro de un mes.


¿Qué lo resolvería?
Una cosa: la aparición de Qwen-Image 2.1 en una tabla de clasificación. Todo en este artículo que no sea el límite de resolución o el precio es una afirmación de uno u otro laboratorio, y la única razón por la que se puede recomendar MAI-Image-2.5-Pro con cara seria es que 6.100 personas que no trabajaban para Microsoft miraron su resultado junto a otra cosa y lo prefirieron. Ese es el estándar que el modelo abierto no ha cumplido, y el estándar con el que se lo debería medir.
Hasta entonces, la interpretación práctica es sencilla. Si hoy necesitas un modelo de edición, con licencia comercial y con una tabla de resultados que lo respalde, la respuesta es la de Microsoft y cuesta unos 108,50 $ por cada mil imágenes. Si quieres averiguar si un modelo de pesos abiertos de 7B, con salida nativa en 2K y un reescritor de prompts inspeccionable, es mejor, tendrás que hacer la medición tú mismo, y lo más útil que puedes hacer con el resultado es publicarlo, porque actualmente a toda la categoría le falta un punto de datos.
