
MAI-Image-2.5-Pro se lleva el puesto #1 en edición de imagen: lo que la victoria independiente de Microsoft realmente demuestra
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
MAI-Image-2.5-Pro es ahora el modelo de edición de imágenes mejor valorado en el leaderboard de Artificial Analysis — un panel independiente de votación ciega — aunque solo alcanza el séptimo puesto en generación simple de texto a imagen. Esa diferencia es la noticia: un modelo que lleva menos de un mes en vista previa pública, construido íntegramente por Microsoft AI, ha superado a GPT Image 2, Reve 2.1 y su propio hermano MAI-Image-2.5 en el panel de edición, pero va por detrás de la mayoría de ese mismo grupo cuando la instrucción es «dibújame algo de la nada». Si lees ambos números juntos obtienes una imagen precisa de lo que Microsoft lanzó: un especialista en modificar imágenes existentes, no un generador de propósito general.
Los dos números, lado a lado
Según la instantánea de agosto de 2026, el Image Editing Arena de Artificial Analysis sitúa a MAI-Image-2.5-Pro en n.º 1 con Elo 1,272, basado en aproximadamente 6,100 comparaciones ciegas de usuarios. El grupo perseguidor está apretado: Reve 2.1 con 1,262, luego MAI-Image-2.5 y GPT Image 2 (high) empatados con 1,256, GPT Image 1.5 (high) con 1,250, Qwen-Image-3.0-Pro con 1,249, y el Nano Banana 2 de Google con 1,249. En el Text-to-Image Arena se sitúa en n.º 7 con Elo 1,292, por detrás de GPT Image 2 (high) con 1,369, Reve 2.1 con 1,322, Nano Banana 2 con 1,320, GPT Image 1.5 (high) con 1,310, MAI-Image-2.5 con 1,304, y Nano Banana Pro con 1,296.
• Edición: No. 1 — 1,272 Elo, ~6,100 muestras
• Texto a imagen: No. 7 — 1,292 Elo, ~11,500 muestras
• Diferencia con el n.º 2 en edición: 10 Elo sobre Reve 2.1
• Distancia con el No. 1 en texto a imagen: 77 Elo detrás de GPT Image 2 (alto)
Lo que hace que el puesto en el ranking de edición valga más que un número decorativo es el mecanismo. El arena de Artificial Analysis es preferencia humana a ciegas: los votantes ven la misma imagen de entrada y la misma instrucción, obtienen dos resultados editados y eligen el más fuerte. Ningún script del proveedor escribe la puntuación. Así que un #1 allí es lo más cercano que tiene el mercado a "a la gente le gustó más el resultado de este editor" — y es un recienteascenso, no un destello del día del lanzamiento. Trata la dirección como sólida y el Elo exacto como provisional; los paneles con pocos votos se mueven.

El ranking de texto a imagen, capturado el mismo día, es el mismo modelo bajo una luz distinta: ya no lidera, pero sigue cómodamente entre los diez primeros de un campo que se agrupa entre 1.290 y 1.370 Elo.

Lo que realmente es MAI-Image-2.5-Pro
MAI-Image-2.5-Pro es el nivel de calidad de Microsoft AI dentro de la familia MAI-Image-2.5, anunciado el 23 de julio de 2026 junto con MAI-Voice-2-Flash y puesto en vista previa pública en Microsoft Foundry (Azure AI Foundry) y en el MAI Playground gratuito. Microsoft lo describe como su modelo de imagen de mayor fidelidad hasta la fecha, orientado a imágenes destacadas, edición detallada y renderizado preciso de texto dentro de la imagen. La familia ahora cubre toda la curva de costos: MAI-Image-2.5 para trabajo equilibrado, MAI-Image-2.5-Flash para alto volumen y el nivel Pro en el extremo de calidad, con un hermano más nuevo, MAI-Image-2.6, ya en vista previa privada a partir del 19 de agosto.
Las propias afirmaciones de Microsoft para el nivel Pro, todas reportadas por el proveedor y ninguna reproducida de forma independiente todavía:
• 96.8% de precisión de renderizado de texto — señalado como compatible con chino, inglés, japonés, coreano y español, aunque la misma documentación limita la salida a aproximadamente un megapíxel, por lo que la frase "8K" en la afirmación es mejor tratarla como marketing.
• 27% mejor adherencia a las instrucciones que GPT-Image-1.5 en las evaluaciones internas de Microsoft.
• 94% de consistencia de personaje multi-imagen entre generaciones.
• Hasta un 84–89% menor costo de GPU frente a los modelos GPT en escenarios específicos de Microsoft (PowerPoint, OneDrive), no un número general.
La hoja de especificaciones documentada es lo que respalda esas afirmaciones: entrada de texto de hasta 32 000 tokens, una ventana de contexto de 131k, 4 096 tokens de salida, entrada de imágenes JPEG/PNG y salida limitada a 1 048 576 píxeles (equivalente a 1024×1024). Ese último número es importante para los compradores: esto es un excelente editor, no un generador de resolución de impresión.
Donde se nota la calidad
La capacidad de edición que mide la tabla de clasificación coincide con lo que Microsoft enfatiza: ediciones precisas y quirúrgicas que mantienen el resto de la imagen coherente. Reemplazo selectivo de objetos, cambios de diseño, actualizaciones de texto dentro de la imagen y limpieza de artefactos como el desenfoque de movimiento — la clase de edición donde los modelos antiguos regeneran toda la escena y pierden al sujeto. Combina eso con la afirmación del 94% de consistencia de personajes y tienes un modelo diseñado para el flujo de trabajo que importa comercialmente: tomar un recurso existente, cambiar una cosa, publicarlo.
La posición #7 en el ranking de texto a imagen es el contrapeso honesto. Partiendo de un prompt vacío, MAI-Image-2.5-Pro es bueno, pero no el líder: estar 77 Elo por detrás de GPT Image 2 (alto) es una brecha real en una tabla ciega. Microsoft no está reclamando actualmente la corona del texto a imagen; está reclamando la corona de edición, y los datos respaldan la afirmación más limitada mucho mejor que la más amplia.
Lo que cuesta
MAI-Image-2.5-Pro se factura por tokens en Foundry: $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen, $106 por millón de tokens de salida de imagen. Microsoft no publica tokens por imagen, por lo que el costo por imagen es aritmético, no una cotización; usando la conversión de Artificial Analysis, una imagen de 1024×1024 se acerca a $108.50 por 1,000 imágenes. Eso es aproximadamente 2.3× la del modelo hermano MAI-Image-2.5 (~$48 por 1k) y 5.4× la del MAI-Image-2.5-Flash (~$20 por 1k) — el nivel Pro es un sobreprecio deliberado.
El precio de vista previa no es el precio de disponibilidad general; la tarjeta de tarifas de vista previa puede cambiar antes de la disponibilidad general. Cuando esto sucede, una capa de enrutamiento de pase directo es cómo un recorte de precio llega a tu factura el mismo día: en OrcaRouter, el precio de lista del proveedor se transmite con un margen del 0%, así que una vez que MAI-Image-2.5-Pro sea accesible a través de una API de terceros invocable, lo que Microsoft cobre es exactamente lo que pagas — sin renegociación, sin segundo contrato.

Por qué el #1 pertenece a la empresa Microsoft, no solo al modelo.
El resultado en la tabla de clasificación llega en un momento en que Microsoft está reemplazando visiblemente los modelos de imagen de terceros por los suyos propios. MAI-Image-2.5 ya es el motor predeterminado en Bing Image Creator y funciona en PowerPoint, OneDrive y Dynamics 365 Contact Center; el nivel Pro pertenece a la misma familia orientada a trabajos de mayor fidelidad. Microsoft ha dicho que los modelos MAI se entrenan con datos limpios y trazables «sin destilación de modelos de terceros» — una respuesta directa a la cuestión de la dependencia de OpenAI, y las afirmaciones sobre los costos (hasta un 84 % menos de costo de GPU en PowerPoint, según el proveedor y el escenario) forman parte de la misma historia: un modelo propio que es más barato por tarea que el modelo al que reemplaza.
Nada de eso sería demostrable ante un comprador escéptico sin la tabla de clasificación independiente, por lo que el #1 es estratégicamente significativo, no solo una puntuación. Es la primera evidencia independiente de que la línea de imágenes interna de Microsoft supera a la competencia en la tarea específica para la que está diseñada.
Qué ver a continuación
• ¿La ventaja de edición se mantiene a medida que se acumulan los votos? 1,272 Elo en ~6,100 muestras es una ventaja, no algo asegurado; Reve 2.1 está 10 puntos por detrás.
• Disponibilidad general y el tarifario final — el precio de la vista previa no es el precio de GA.
• El límite de resolución. Un límite de 1 megapíxel mantiene a Pro fuera del trabajo de impresión; si Microsoft lo elimina, la historia cambia.
• MAI-Image-2.6 (vista previa privada, 19 de agosto) — el siguiente paso de la familia, clasificado como n.º 2 en texto a imagen en la otra arena principal.
• Evaluaciones independientes de las afirmaciones del proveedor — la precisión del renderizado de texto y la consistencia de caracteres no están verificadas fuera de Microsoft.
La conclusión de la tabla de clasificación dividida no es "Microsoft ahora tiene el mejor modelo de imagen". Es algo más acotado y útil: Microsoft ahora tiene el editor de imágenes mejor valorado en una tabla de clasificación independiente, a un precio premium, en vista previa, con un tope de resolución estricto. Si tu trabajo consiste en modificar imágenes existentes — fotos principales, imágenes de producto, texto dentro de la imagen — ese es exactamente el modelo que hay que vigilar. Si tu trabajo es la generación desde un lienzo en blanco, el puesto #7 indica que la mejor opción sigue siendo GPT Image 2 — y esa es la lectura honesta que te dan ambos números.
