
MAI-Image-2.5-Pro vs Grok Imagine Image 2.0: dos apuestas que priorizan la edición en la generación de imágenes.
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
Dos de los modelos de imagen más interesantes del año coinciden en la gran idea: la edición es el futuro, la generación es el mínimo indispensable. MAI-Image-2.5-Pro (Microsoft, vista previa pública en Foundry desde el 23 de julio) y Grok Imagine Image 2.0 (xAI, lanzado el 7 de agosto como el "Modo de calidad" predeterminado en las aplicaciones Grok) ambos se venden a sí mismos como editores en primer lugar. Pero construyeron herramientas diferentes para demostrarlo. El modelo de Microsoft es un motor de calidad — ediciones quirúrgicas que preservan la coherencia, respaldadas por el puesto n.º 1 en el Artificial Analysis Image Editing Arena. El modelo de xAI es un entorno de edición — un conjunto de herramientas orientadas al usuario (Magic Wand, segmentación, eliminación de fondos, Smart Resize) alrededor de un generador que se ubica en los puestos n.º 2 a 3 en el otro gran ranking. Uno se mide por la fidelidad, el otro por el flujo de trabajo. Esa es la diferencia real entre ambos.
Los conjuntos de herramientas de edición no tienen la misma forma.
• MAI-Image-2.5-Pro — un motor, no una caja de herramientas. Tú aportas la instrucción y la imagen; él realiza ediciones precisas y quirúrgicas: reemplazo selectivo de objetos, cambios de diseño, actualización de texto dentro de la imagen, limpieza de artefactos — mientras mantiene la identidad del sujeto, la iluminación y la textura consistentes entre iteraciones. La afirmación de Microsoft del 94% de consistencia de personajes en múltiples imágenes (reportada por el proveedor) es toda la propuesta: cambia una cosa, conserva todo lo demás.
• Grok Imagine Image 2.0 — un entorno. Incluye Magic Wand (editar solo una región seleccionada), Segmentación (recolorear o reemplazar áreas precisas), eliminación de fondo, entrada de múltiples referencias (hasta 5 imágenes en las aplicaciones de consumo, 3 en la API), Smart Resize (recomponer una imagen en nueve proporciones de aspecto) y Plantillas para fotografía de productos, retratos, comercio electrónico, recursos de videojuegos y carteles de marketing.
Lee esa lista y el posicionamiento queda claro: MAI-Image-2.5-Pro es el modelo al que un desarrollador apunta con una API; Grok Imagine Image 2.0 es el modelo con el que una persona se sienta dentro de una interfaz y trabaja. xAI lo llamó un "entorno de edición" en su lanzamiento, y el conjunto de herramientas es exactamente eso.
Dónde se posiciona cada uno
• MAI-Image-2.5-Pro — N.º 1 en el Artificial Analysis Image Editing Arena (Elo 1,272, ~6,100 votos a ciegas); N.º 7 en texto a imagen (1,292 Elo). Puntuación independiente basada en preferencias a ciegas.
• Grok Imagine Image 2.0 — la afirmación de lanzamiento de xAI era que ocupaba el n.º 2 mundial en la tabla de clasificación de texto a imagen de Arena, por detrás de GPT Image 2; en la instantánea del 10 de agosto se situaba en el n.º 3 (Elo 1,316), por detrás de GPT Image 2 (1,381) y del más reciente MAI-Image-2.6 (1,336) de Microsoft. Ese puesto es independiente y preliminar, y el encuadre de xAI de «n.º 2 mundial» debería etiquetarse como lo que es: una afirmación de lanzamiento hecha por el proveedor que la tabla en vivo ha revisado desde entonces.
Ninguno de los modelos lidera en el terreno del otro, y ninguno ocupa la cima del tablero principal del otro. La forma más clara de leerlo: el modelo de Microsoft domina la puntuación de edición; el modelo de xAI domina las herramientas y se sitúa cerca de la cima en generación.

Renderizado de texto, la característica decisiva.
El texto dentro de la imagen es donde ambos divergen de forma más marcada, y donde la evidencia independiente es unilateral. Microsoft afirma una precisión del 96,8 % en el renderizado de texto para MAI-Image-2.5-Pro en inglés, chino, japonés, coreano y español — una cifra reportada por el proveedor, sin verificar, y acompañada de un límite de salida de un megapíxel, pero una capacidad real declarada con cobertura multilingüe. Los resultados de las pruebas independientes de Grok Imagine Image 2.0, publicados por la propia evaluación de OrcaRouter del modelo contra GPT Image 2, mostraron que renderiza texto CJK de forma poco fiable — en una prueba renderizó chino tradicional cuando se le pidió chino simplificado en un titular de póster de cine, un factor de descalificación contundente para trabajo publicitario localizado. Para cualquier flujo de trabajo con una palabra legible en la imagen, MAI-Image-2.5-Pro es la apuesta más segura sobre el papel; la calidad de texto de Grok necesita pasar una prueba con tu propio material antes de que confíes en ella.
Precio
• MAI-Image-2.5-Pro — con medición por tokens: $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen, $106 por millón de tokens de salida de imagen. La conversión de Artificial Analysis sitúa una imagen de 1024×1024 cerca de $108.50 por 1,000.
• Grok Imagine Image 2.0 — precio fijo por imagen, sin tokens: $0.05 por imagen a 1K o 2K para el nivel de calidad (`grok-imagine-image-quality`), $0.02 para el nivel estándar, y las ediciones facturan tanto la entrada como la salida. A 1K eso es $50 por 1,000 imágenes de calidad — aproximadamente la mitad de la cifra por 1K de MAI-Image-2.5-Pro, con un costo fijo que no varía según la longitud del prompt.
Los modelos de precios son filosóficamente diferentes. La medición por tokens de Microsoft penaliza las indicaciones largas y las salidas grandes; la tarifa plana por imagen de xAI es predecible e independiente de la longitud de la indicación. A un volumen serio, la tarifa plana es la más fácil de prever, y el precio del nivel de calidad es más barato que el de MAI-Image-2.5-Pro.

Disponibilidad y el ángulo de enrutamiento
Ambos son accesibles, pero a través de puertas distintas. MAI-Image-2.5-Pro es una vista previa de Microsoft Foundry y el MAI Playground: necesitas una cuenta de Microsoft y se aplica la tarifa de vista previa. Grok Imagine Image 2.0 se lanzó en las aplicaciones de consumo de xAI el 7 de agosto y su nivel de calidad se puede invocar a través de la API Imagine de xAI; también ha estado disponible en el endpoint compatible con OpenAI de OrcaRouter desde mediados de agosto, donde el nivel estándar y el nivel de calidad están detrás de una sola clave, con los precios del proveedor transmitidos con un margen del 0% y conmutación automática a un respaldo como GPT Image 2.
La diferencia práctica que esto supone: adoptar Grok Imagine Image 2.0 en un pipeline de producción es un cambio de cadena del modelo en un endpoint que quizás ya estés usando, con una tarifa plana económica y una alternativa integrada para los casos en los que falla — precisamente el modo de fallo que la capa de enrutamiento existe para detectar. Adoptar MAI-Image-2.5-Pro implica contratar directamente con Foundry por ahora, y la nota honesta sobre el enrutamiento es la misma que hace un mes: cuando la vista previa de Microsoft se pueda invocar ampliamente a través de una API de terceros, será entonces cuando se abra el mismo patrón de una sola clave para ella.

El veredicto
Elige MAI-Image-2.5-Pro cuando tu trabajo es una edición de alta fidelidad de una imagen existente y el resultado tiene que estar a la altura — es el editor independiente #1 en Artificial Analysis, presenta una afirmación real de renderizado de texto multilingüe, y su precio está a la altura. Elige Grok Imagine Image 2.0 cuando quieres un flujo de trabajo de edición con herramientas reales, un precio fijo fácil de pronosticar y de aproximadamente la mitad del costo por imagen, y un modelo que puedas enrutar hoy con un respaldo. El enfoque honesto no es "cuál es mejor" — es qué apuesta coincide con tu flujo de trabajo: Microsoft apuesta a que la fidelidad gana en la edición, y xAI apuesta a que el conjunto de herramientas gana al usuario. Ambas son defendibles; tus requisitos de calidad de salida y tu tolerancia al riesgo de renderizado de texto son lo que rompe el empate.
