
MAI-Image-2.5-Pro vs Qwen-Image 3.0: Cuatro veces el precio por un tipo diferente de texto.
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
Pon MAI-Image-2.5-Pro y Qwen-Image 3.0 uno al lado del otro y lo primero que notas es el precio: aproximadamente $108.50 por 1.000 imágenes para el nivel premium de Microsoft, frente a aproximadamente $25–30 por 1.000 para el Qwen-Image 3.0 de Alibaba — la tarifa que cita la propia Alibaba ronda los $25, mientras que la tabla de clasificación de Artificial Analysis indica $30. Supone más del triple según cualquiera de las dos cifras. Lo que ese sobreprecio realmente compra es un tipo diferente de trabajo con texto. Qwen-Image 3.0, lanzado por el equipo Qwen de Alibaba el 21 de julio de 2026 y abierto a una API internacional el 4 de agosto, está pensado para ser el renderizador de texto de gran volumen: legible hasta ~10px en doce idiomas, con una ventana de prompt de 4.500 tokens para instrucciones densas. MAI-Image-2.5-Pro, en vista previa pública en Microsoft Foundry desde el 23 de julio, es el editor mejor valorado en una tabla de clasificación independiente, con una precisión de renderizado de texto declarada por el proveedor, pero con un límite estricto de salida de ~1 megapíxel. Ambos son modelos de imagen por API cuyo principal reclamo es el texto; compiten por el precio por trabajo, no por una única puntuación de calidad.
Dos historias de texto, ninguna totalmente verificada.
La batalla del texto es la razón por la que existen ambos modelos, y también es donde la evidencia es más escasa: cada cifra en esta sección es reportada por los proveedores y ninguna ha sido reproducida de forma independiente.
• Qwen-Image 3.0 — los materiales de lanzamiento de Alibaba afirman una renderización legible hasta aproximadamente 10px, soporte nativo para 12 idiomas con más de 20 fuentes y más de 100 estilos artísticos, notación matemática, subíndices, superíndices y fórmulas multilínea, además de familiaridad con interfaces web, de juegos y de software comunes. La ventana de prompt es de hasta 4.500 tokens de entrada — un salto de 4,5× con respecto a la generación anterior — que es lo que le permite absorber resúmenes densos como portadas de periódicos o una cuadrícula de conocimiento de nueve paneles en una sola llamada.
• MAI-Image-2.5-Pro — Microsoft afirma una precisión de renderizado de texto del 96.8% en chino, inglés, japonés, coreano y español, una adherencia a las instrucciones un 27% mejor que GPT-Image-1.5 en evaluaciones internas, y una consistencia de caracteres entre múltiples imágenes del 94%. La especificación de entrada es más amplia sobre el papel — hasta 32 000 tokens de texto de entrada con una ventana de contexto de 131k — y la salida está limitada a 1 048 576 píxeles, equivalente a 1024×1024.
Ambas afirmaciones no han sido reproducidas al momento de escribir esto. La diferencia está en la forma de las afirmaciones: la de Qwen se refiere al volumen y la legibilidad entre sistemas de escritura, mientras que la de Microsoft se refiere a la precisión y la coherencia en un conjunto definido de cinco idiomas. Ninguno de los dos proveedores ha publicado un punto de referencia que otro laboratorio pueda ejecutar y verificar.
La edición es donde vive lo premium
Lo que separa a los dos es la edición, y esta es la única dimensión con evidencia independiente. MAI-Image-2.5-Pro se sitúa en puesto n.º 1 en Artificial Analysis Image Editing Arena con Elo 1,272 (~6,100 votos ciegos), por delante de Reve 2.1, MAI-Image-2.5 y GPT Image 2. En el mismo ranking, el nuevo Qwen-Image-3.0-Pro está en 1,249 — una puntuación competitiva, 23 Elo por detrás, y notable para un modelo que solo llegó a la API internacional este mes.
Más allá del modelo base, el portafolio de edición de Alibaba es un conjunto de trucos especializados más que una única corona: restauración de pintura antigua, generación de panoramas, de boceto a presentación y guion gráfico multicámara. El de Microsoft es una apuesta más estrecha y profunda: ediciones precisas y quirúrgicas que mantienen el resto del encuadre coherente (reemplazo de objetos, cambios de diseño, actualización de texto dentro de la imagen, limpieza de desenfoque), la clase de edición donde los modelos más antiguos regeneran toda la escena y pierden el sujeto. Para un flujo de trabajo que consiste en «tomar este activo existente, cambiar una cosa y publicarlo», el #1 independiente del nivel Pro es la señal más fuerte; para una mezcla variada de formatos de edición creativa, la lista de Qwen es más amplia.

El contraste de especificaciones
• Precio: ~$108.50 por 1k imágenes (1024×1024, conversión AA) frente a ~$25–30 por 1k imágenes (cotización de Alibaba frente a tarifa publicada por AA)br />• Lanzamiento: 23 de julio de 2026 (vista previa pública, Foundry) frente a 21 de julio de 2026, API internacional el 4 de agostobr />• Entrada de texto: 32,000 tokens, contexto de 131k frente a ventana de prompt de 4,500 tokensbr />• Límite de salida: ~1,048,576 píxeles (~1K) frente a hasta 2048×2048br />• Imágenes por llamada: una sola salida por solicitud frente a hasta seis imágenes por llamadabr />• Posición en edición: N.º 1, Elo 1,272 (AA) frente a 1,249 para Qwen-Image-3.0-Pro en la misma tablabr />• Procedencia: afirmación de Microsoft de «sin destilación de modelos de terceros» frente a etiqueta de procedencia AIGC en las salidasbr />• Pesos: cerrados, solo API frente a cerrados, solo API
El techo de salida y el recuento por llamada importan más de lo que parecen. Qwen-Image 3.0 puede renderizar una imagen de 2048×2048 y puede devolver hasta seis imágenes por llamada, lo cual es una característica de economía de lotes; el nivel Pro alcanza un máximo cercano a 1K y devuelve una única salida por solicitud. Si tu resumen es "dame una variedad de seis tomas de producto", el modelo de Alibaba está hecho para eso y el de Microsoft no.

When the premium pays for itself
La regla de decisión se refiere al propósito de las imágenes, no a qué modelo es "mejor".
• Pague la prima por MAI-Image-2.5-Pro cuando el resultado sea un activo principal — una imagen de producto, un póster, un fotograma clave, una imagen que se envía a una campaña y no se regenerará cincuenta veces. El primer puesto en el ranking de edición y la afirmación de consistencia de personaje importan más cuando una edición debe ser correcta a la primera.
• Compra en volumen con Qwen-Image 3.0 cuando la salida sea desechable o de gran cantidad — variantes localizadas de anuncios, arte de relleno, presentaciones de boceto a PPT, fotogramas de storyboard, cualquier cosa en la que vayas a regenerar en lugar de refinar. A $25–30 por 1k, una generación fallida cuesta un error de redondeo; a $108.50 por 1k, no.
Hay un término medio que vale la pena nombrar: para el trabajo denso y multilingüe de texto en imagen — un mockup de página de aterrizaje con textos en japonés y español, una infografía con fórmulas — la legibilidad a 10px de Qwen y sus doce idiomas son la mejor opción sobre el papel, y a una cuarta parte del precio. El contraargumento del modelo de Microsoft es su afirmación de una precisión del 96,8 % en cinco idiomas, pero esa afirmación no está verificada, y un comprador que elige entre dos afirmaciones de texto no verificadas probablemente debería sopesar el precio.

La capa de enrutamiento, cuando corresponde
Ninguno de los dos modelos es accesible a través de OrcaRouter todavía: Qwen-Image 3.0 vive en la API propia de Alibaba (Alibaba Cloud Bailian y la plataforma Qwen) y en varias plataformas de terceros, y MAI-Image-2.5-Pro está en Microsoft Foundry, por lo que una comparación honesta dice claramente que ninguno está de nuestro lado hoy. Cuando cualquiera de los dos esté disponible a través de un proveedor alojado al que se pueda llamar, se aplica el modelo de traspaso: 0% de margen sobre el precio de lista del proveedor, por lo que pagas la tarifa del proveedor, y un descuento de lanzamiento o una rebaja de precio aparece en tu factura el mismo día en que se anuncia. El argumento de la conmutación por error es la otra mitad: Qwen-Image 3.0 es una API internacional de solo unas semanas, el tipo de modelo al que se enruta una parte del tráfico mientras un respaldo probado absorbe los casos límite, que es precisamente el escenario para el que está diseñada una capa de enrutamiento.
El veredicto
Qwen-Image 3.0 y MAI-Image-2.5-Pro no son el mismo producto a diferentes precios; son productos distintos que casualmente tienen precios distintos. El modelo de Microsoft gana la corona en edición, tiene una ventana de contexto más amplia y hace una afirmación no verificada de precisión en cinco idiomas — para activos destacados y ediciones quirúrgicas, la prima es defendible. El modelo de Alibaba representa más sistemas de escritura de forma legible, acepta briefs más densos por generación en sus propios términos, genera imágenes más grandes y en lotes de seis, y cuesta una cuarta parte — para trabajo de volumen y texto en imagen multilingüe, es la opción económicamente racional. Compre la versión premium donde la imagen es el producto; compre el volumen donde la imagen es inventario.
