
Grok Imagine Image 2.0: #4 en Artificial Analysis, a un tercio del precio
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Imagine Image 2.0 ha llegado al n.º 4 en la Text to Image Leaderboard de Artificial Analysis, y la cifra que importa no es el puesto — es el precio que aparece junto a él. El modelo se sitúa en 1.153,66 Elo, por detrás de tres entradas: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) y GPT Image 2 (high). Por delante del modelo de cualquier otro laboratorio, incluidos MAI-Image-2.6 de Microsoft y el modelo Nano Banana 2. Eso deja al modelo como el generador de imágenes mejor clasificado fuera de ese trío, y lo más barato de esos cuatro primeros por un amplio margen: Artificial Analysis lo valora en 60 $ por cada 1000 imágenes frente a aproximadamente 211 $ de las tres entradas por encima de él. El modelo en sí es del 7 de agosto de 2026 — lo que cambió es dónde lo sitúa la clasificación independiente, y qué efecto tiene eso sobre el enfoque de «n.º 2 del mundo» que usó el creador en el lanzamiento.
Lo que realmente mide el puesto #4
La tabla de clasificación de Texto a Imagen de Artificial Analysis es una arena ciega de preferencia humana: los votantes ven los resultados del mismo prompt sin etiquetas de modelo y eligen el mejor, y el Elo resultante se publica de forma independiente de cualquier proveedor. La entrada de Grok Imagine Image 2.0 aparece en el #4 con 1.153,66 Elo con un intervalo de confianza del 95% de 1.141,66 a 1.165,66. Nada de ese número proviene de xAI. (Un detalle de mantenimiento que conviene saber al leer la tabla: Artificial Analysis enumera al creador del modelo como SpaceXAI.)
La mitad de la historia relativa al precio es la mitad más interesante. La misma página representa la calidad frente al precio con una línea de Pareto que marca los modelos que ofrecen más Elo por dólar, y, según las propias cifras publicadas del ranking, Grok Imagine Image 2.0 es el modelo con la puntuación más alta con un precio inferior a $100 por cada 1.000 imágenes. El siguiente modelo por encima en calidad, GPT Image 2 (high), cuesta $211 por cada 1.000, aproximadamente tres veces y media más por unos 17 Elo más. Eso es una afirmación de relación precio-rendimiento, no una afirmación de ser el mejor modelo, y es la versión de la historia que los datos independientes realmente respaldan.
La posición de vanguardia es real, pero estrecha, y vale la pena decirlo sin rodeos. El MAI-Image-2.6 de Microsoft se sitúa un puesto por debajo, a 38,90 $ por cada 1.000, y Muse Image de Meta cuesta 10 $ por cada 1.000 con 1.111 Elo. Los intervalos de Elo en esta clasificación rondan los ±12 puntos, por lo que el #4 y el #5 —separados por 6,5 Elo— quedan dentro de las barras de error del otro. Considera la ubicación como «entre los cinco primeros», no como un puesto ya definido.
El ascenso de 14 puestos es la distancia hasta el nivel que reemplazó Grok Imagine Image 2.0. El anterior nivel de calidad de xAI, grok-imagine-image-quality, ocupa el puesto n.º 18 en la misma clasificación con 1.043,21 Elo, y el grok-imagine-image original está en el n.º 29 con 1.017,86. Eso representa aproximadamente 110 puntos de Elo y 14 puestos de diferencia entre el modelo que xAI ahora documenta como su opción predeterminada de imagen y el que deja atrás.
En qué punto se encuentra ahora la afirmación del "mundo #2"
En el lanzamiento, xAI citó un puesto n.º 2 tanto en las tablas de Arena de texto a imagen como de edición de imágenes, con aproximadamente 1.320 Elo y marcado como preliminar. Esas eran cifras que xAI destacó en su propio anuncio —no una evaluación independiente que encargara— y han cambiado desde entonces: la instantánea del 10 de agosto situó el modelo en el n.º 3 con 1.316 Elo, por detrás de MAI-Image-2.6 y GPT Image 2. El n.º 2 en edición de imágenes sigue siendo una cita del propio xAI.
Artificial Analysis es una tabla de clasificación distinta, con un método distinto y un conjunto distinto de votantes, y ahora sitúa el modelo en el puesto #4. En realidad, las dos no se contradicen: muestrean la preferencia humana de manera diferente, y ambas son instantáneas de tablas que cambian semana a semana. El resumen honesto de seis semanas de clasificaciones independientes es que Grok Imagine Image 2.0 está de forma consistente entre los cinco primeros y nunca llega a ser del todo el #2 que anunció xAI.
Qué incluye realmente Grok Imagine Image 2.0
xAI posiciona Grok Imagine Image 2.0 como un entorno de edición en lugar de otro generador de una sola vez. El conjunto de funciones:
• Varita mágica — ediciones a nivel de región que dejan el resto del fotograma intacto
• Segmentación — selección precisa de regiones para corrección de color, reemplazo o ajuste
• Eliminación de fondo — exportación del sujeto con fondo transparente
• Entrada de varias imágenes — hasta cinco imágenes de origen por edición; la documentación de xAI ahora indica cinco, frente a las tres que la API permitía como máximo en su lanzamiento
• Smart Resize — recompone una imagen en 9 proporciones (de 1:2 vertical a 2:1 horizontal), inventando nuevo contenido de encuadre en lugar de recortarla
• Plantillas — flujos de trabajo preestablecidos para fotografía de productos, retratos, listados de comercio electrónico, activos de videojuegos y carteles de marketing
La API expone controles que la app para el consumidor no muestra: relación de aspecto —incluidos 21:9 y 5:2, ambos nuevos con la 2.0—, resolución (1K por defecto, 2K opcional) y un parámetro de calidad que acepta low, medium o auto. Del lado del consumidor, el modelo se distribuye como el Quality Mode predeterminado en grok.com/imagine, iOS y Android, y desde el 13 de agosto también figura en la plataforma de Runway, donde se unió a los modelos de imagen y vídeo que Runway ya aloja. Esa inclusión es una declaración de proveedor y socio, más que una evaluación independiente, pero fue la primera señal de distribución por terceros tras el lanzamiento.
En la representación de texto de titulares, xAI dice que el modelo "planifica la tipografía y el diseño como lo haría un diseñador", manteniendo intactas las composiciones densas de múltiples partes y renderizando texto pequeño de forma nítida. También preserva la identidad y la configuración de un sujeto a través de ediciones iterativas de múltiples turnos.
Lo que encontró una primera prueba independiente
Una comparación de seis prompts, con una sola semilla y sin seleccionar los resultados que más convienen frente a gpt-image-2 encontró una división clara, y nada en la nueva posición de la tabla de clasificación la revierte.
Grok gana: fotorrealismo y retención de identidad. La anatomía de las manos en los retratos era correcta, con detalle de piel a nivel de poro, dispersión subsuperficial y reflejos de luz y luz de contorno naturales. En una tarea de rotación geométrica de 45 grados, Grok mantuvo la identidad facial por encima del umbral de 0.5 de ArcFace, mientras que gpt-image-2 se desvió más.
Grok pierde: áreas críticas de producción. Al pedirle un titular para un cartel de película en chino simplificado, generó caracteres de chino tradicional, algo calificado como "descalificación dura" para los flujos de localización y publicación. Una solicitud de fusión de estilo acuarela devolvió una imagen fotorrealista con solo una ligera capa de textura pictórica, una "descalificación a nivel de categoría". Las ediciones locales completaron las tres solicitudes, pero no preservaron la vista de la ventana y anclaron mal un resaltado.
Resumen: Grok Imagine Image 2.0 "lidera en fotorrealismo e identidad, y va a la zaga en fiabilidad de edición, texto multilingüe y transferencia de estilo real". Una tabla de clasificación promedia la preferencia entre miles de comparaciones ciegas; no puede decirte si el modelo acertará con tu titular en chino. Una prueba de seis prompts tampoco constituye un conjunto de evidencia — pero entre las dos, el fallo específico es la señal más accionable para un equipo que entrega recursos localizados.
La API y el cálculo de precios
La historia para desarrolladores ha cambiado desde el lanzamiento. grok-imagine-image-2.0 es ahora el modelo que xAI documenta para la generación de imágenes, la edición de una sola imagen y la edición de varias imágenes, y es el que la propia página de modelos de xAI recomienda para imágenes. La frase de la época del lanzamiento «acceso a la API para desarrolladores próximamente» ya no aparece en las páginas de modelos y precios del proveedor.
• grok-imagine-image-2.0: desde $0.04 por imagen, facturado según la calidad realmente servida
• grok-imagine-image (1.0): $0.02 por imagen, no afectado por el cambio a continuación
• grok-imagine-image-quality: $0.05 por imagen, se retira el 2 de noviembre de 2026
La calidad es la palanca sobre el costo. Auto —el valor predeterminado cuando se omite el parámetro— actualmente aplica low para generación y medium para edición, por lo que una solicitud de generación se factura a la tarifa low y una edición a la medium. Fijar low o medium hace que la factura sea predecible en lugar de depender de la ruta que elija el servicio.
Ese último punto conlleva una fecha límite. La guía de migración de xAI dice que el slug grok-imagine-image-quality se retira el 2 de noviembre de 2026, tras un aviso de 60 días que comenzó el 2 de septiembre. A partir de esa fecha, el slug sigue resolviéndose, pero las solicitudes las atiende grok-imagine-image-2.0 con quality establecido en low: una redirección de compatibilidad, no un apagado definitivo. Como el nivel low cuesta 0,01 $ menos por imagen que el antiguo nivel de calidad en todas las resoluciones, los equipos que no cambien nada verán una bajada de precio y un cambio silencioso en la calidad del resultado. Migrar de forma deliberada, nombrando grok-imagine-image-2.0 y fijando quality allí donde un resultado estable importa, es la versión que conviene. Esa fecha y el comportamiento de redirección proceden de la documentación de la propia xAI: son datos declarados por el proveedor, no probados de forma independiente.
Frente a las opciones de OpenAI, la comparación es tanto una diferencia de modelo de precios como una diferencia de precio. gpt-image-2 se factura por tokens —8 dólares por millón de tokens de entrada de imagen y 30 dólares por millón de tokens de salida de imagen según las tarifas publicadas de OpenAI—, por lo que el coste por imagen varía con la resolución y el nivel de detalle. La cifra representativa de Artificial Analysis de 211 dólares por cada 1000 imágenes para GPT Image 2 (high) frente a los 60 dólares de Grok es esa variación expresada en un solo número. Un precio fijo por imagen es mucho más fácil de prever a escala, y esa es en gran medida la razón por la que un modelo en cuarto lugar merece siquiera un vistazo.
Probarlo sin arriesgar el pipeline
La reacción razonable a Grok Imagine Image 2.0 sigue siendo «pruébalo, no te comprometas con él todavía». Su posición se sitúa dentro de intervalos de confianza superpuestos, una prueba independiente señaló debilidades reales en texto localizado y transferencia de estilo, y xAI retirará un slug que está por debajo de él en noviembre. Ese es exactamente el caso para enrutar en lugar de cablear una integración directa.
En OrcaRouter, grok-imagine-image — el modelo de imagen de xAI en nuestro catálogo — se encuentra en el mismo endpoint compatible con OpenAI que gpt-image-2, así que pasar de los modelos de imagen de xAI a los de OpenAI es solo un cambio en la cadena del modelo: sin un segundo contrato, sin un SDK nuevo. OrcaRouter traslada los precios de lista de los proveedores sin margen añadido, así que una bajada de precio de un proveedor se aplica aquí el mismo día, y la conmutación automática por error puede enviar errores, límites de velocidad o rechazos a un modelo de reserva en lugar de a tu ruta de producción. Una advertencia honesta, sin cambios respecto a la reseña original: el nivel de calidad más reciente de xAI es una entrada independiente del modelo de imagen Grok que ya está en nuestro catálogo, así que consulta la lista actual de modelos en lugar de dar por hecho que una variante de Grok determinada se puede enrutar hoy.
Qué ver a continuación
1. La migración del 2 de noviembre. Que los equipos se pasen a grok-imagine-image-2.0 de forma explícita o que acaben derivando hacia la redirección y su opción predeterminada de baja calidad es el mayor error que xAI todavía puede cometer con este modelo, y la redirección hace que ese error pase inadvertido a menos que leas el campo del modelo en tus respuestas.
2. Si el #4 se mantiene. La diferencia con MAI-Image-2.6 es de 6,5 Elo con intervalos de ±12 puntos, por lo que unos miles de votos más podrían reordenar la tabla en cualquier dirección. La ganancia de 110 Elo respecto al nivel anterior parece sólida; la posición exacta no.
3. Qué parte de la superficie orientada al consumidor llega a la API. La generación, la edición y la edición de varias imágenes están documentadas. Las plantillas y el flujo de trabajo con nombre Smart Resize siguen siendo funciones de la aplicación, y esa brecha es donde reside la advertencia restante de "solo para consumidores".
En resumen: Grok Imagine Image 2.0 es un modelo real y capaz que ahora ha sido clasificado de forma independiente: n.º 4 en la Text to Image Leaderboard de Artificial Analysis, la mejor entrada que no es de OpenAI en esa tabla, aproximadamente 110 Elo por delante del nivel que reemplazó, y en la frontera de precio-calidad de la tabla, con $60 por 1.000 imágenes frente a aproximadamente $211 para los modelos de OpenAI directamente por encima de él. El planteamiento de “n.º 2 del mundo” siempre fue la instantánea de lanzamiento de xAI, y las tablas independientes nunca han dicho exactamente eso. Sus dos debilidades independientes más claras —el cumplimiento del chino simplificado y la fiabilidad de la transferencia de estilo— residen en funciones que los equipos suelen necesitar más de una API de imágenes. Pruébalo de inmediato para trabajos fotorrealistas que preserven la identidad; espera antes de usarlo para pipelines que entregan texto localizado o recursos estilizados, y si ya estás llamando al slug de calidad que se retira, migra antes del 2 de noviembre.
