Tarjeta de título principal para MAI-Image-2.6, el modelo de texto a imagen n.º 2 de Microsoft en Arena, que muestra una puntuación de 1.336 en Arena, un puesto n.º 2 y una ganancia de +79 Elo frente a MAI-Image-2.5.
Guides & Insights

MAI-Image-2.6-Preview: #1 en Edición de Imágenes, #2 en Texto a Imagen

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El MAI-Image-2.6-Preview de Microsoft ya no es solo una entrada en la tabla de clasificación de Arena que no puedes tocar: ahora es un líder independiente de la tabla. El 25 de agosto, Artificial Analysis, la organización independiente de evaluaciones comparativas, clasificó la misma versión de vista previa en el puesto n.º 1 en su Image Editing Leaderboard y en el n.º 2 en Text to Image. El puesto n.º 1 en edición la sitúa por delante del propio MAI-Image-2.5-Pro de Microsoft (el anterior líder), Reve 2.1 y GPT Image 2 de OpenAI, otorgando a Microsoft las dos primeras posiciones en esa tabla. El modelo entró en vista previa privada en MAI Playground y Microsoft Foundry el 19 de agosto, según el anuncio de Microsoft: con acceso restringido por invitación, sin API pública todavía y sin lista de precios.

Lo sorprendente es la trayectoria, no solo el puesto. La entrada que alcanzó el n.º 2 en el ranking de texto a imagen de Arena se llama literalmente "mai-image-2.6-preview", obtuvo aproximadamente 3500 votos en esa instantánea y subió ocho puestos con una ganancia de +79 Elo con respecto a MAI-Image-2.5 en un solo paso. Desde entonces, el panorama se ha aclarado rápidamente: se abrió el acceso de vista previa privada en MAI Playground y Microsoft Foundry el 19 de agosto, el ranking de edición de imágenes de Arena subió la versión al n.º 3, y ahora Artificial Analysis la sitúa en el n.º 1 en edición de imágenes y en el n.º 2 en texto a imagen. Esto hace que esta sea la señal independiente más fuerte hasta la fecha de que el proyecto interno de imágenes de Microsoft ha cerrado la brecha con OpenAI, y la API pública todavía no está disponible de forma general.

Los números clave

• Posición en Arena text-to-image: No. 2 — puntuación 1,336±11, preliminar, ~3,488 votos

• Distancia al No. 1 (GPT Image 2 Medium): 45 Elo

• Ventaja sobre el n.º 3 (Grok Imagine Image 2.0): 20 Elo

• Supera a MAI-Image-2.5: +79 Elo en general, +91 Elo en renderizado de texto

• Posición del predecesor: MAI-Image-2.5 en el puesto 10 (1,256)

• Rango en edición de imágenes: No. 3 en "Single Image Edit" de Arena — 1,420 pts, subiendo desde el No. 5

• Clasificación de edición de imágenes de Artificial Analysis: n.º 1 — por delante de MAI-Image-2.5-Pro (el anterior n.º 1), Reve 2.1 y GPT Image 2; Microsoft ocupa los dos primeros puestos

• Ranking de texto a imagen de Artificial Analysis: No. 2 — solo por detrás de GPT Image 2; primera en 5 de los 19 tableros de categorías.

• Vista previa privada: anunciada el 19 de agosto en MAI Playground y Microsoft Foundry — según el proveedor, con acceso por invitación, sin tarjeta de precios aún

Scoreboard for MAI-Image-2.6: Arena T2I rank No. 2 (1,336 Elo, preliminary), gap to GPT Image 2 Medium -45 Elo, gain vs MAI-Image-2.5 +79 Elo, text rendering +91 Elo, best category 3D and modeling No. 1, API status expected next week. Footer notes Arena figures as of Aug 10, 2026 and that vendor claims are unreproduced.

Qué es MAI-Image-2.6

MAI-Image-2.6 es el modelo más reciente de la línea de generación de imágenes interna de Microsoft, desarrollado bajo Microsoft AI de Mustafa Suleyman. La familia ha avanzado rápido: MAI-Image-1 fue la base, MAI-Image-2 (marzo de 2026) marcó el salto en fotorrealismo y renderizado de texto, MAI-Image-2.5 (junio de 2026) incorporó salida y edición de nivel profesional, y se convirtió en el motor de Bing Image Creator, PowerPoint y OneDrive; MAI-Image-2.5-Pro (julio de 2026) añadió un nivel premium de 8K — y 2.6 llega ahora aproximadamente seis semanas después de su predecesor.

El ritmo importa tanto como el modelo. Microsoft está lanzando mejoras de imagen en un ciclo de seis a ocho semanas, más cerca de cómo los laboratorios de frontera lanzan modelos de texto que de cómo se ha movido históricamente el mercado de la imagen. Un debut No. 2 en Arena en el lanzamiento, y un puesto No. 3 en edición una semana después, es lo que parece ese ritmo una vez que se acumula.

Los resultados de la tabla de clasificación, léelos con atención.

Arena (la rebautizada LMArena) clasifica los modelos de imagen por preferencia humana ciega: los votantes ven dos imágenes generadas a partir del mismo prompt y eligen la más fuerte. Artificial Analysis ejecuta el mismo tipo de arena independiente de preferencia ciega con sus propias calificaciones Elo. Ambas son medidas independientes de lo que la gente realmente prefiere, más que puntos de referencia gestionados por los proveedores, lo que explica por qué un debut en el puesto número 2 tiene peso real, y por qué dos paneles separados que coinciden en el mismo modelo importan más que cualquiera de los números por separado. También es la razón por la que las cifras necesitan advertencias: la puntuación de Arena de 1,336 es preliminar, basada en unos 3,500 votos frente a más de 70,000 para el modelo en primer lugar, y la entrada está etiquetada como "preview". El Elo de los primeros votos se mueve; trate la dirección como sólida y la puntuación exacta como provisional.

The Arena text-to-image leaderboard as of August 10, 2026, showing MAI-Image-2.6 in second place at 1,336 Elo with 3,488 votes, behind gpt-image-2 (medium) at 1,381 and ahead of grok-imagine-image-2.0 at 1,316.

Dónde se concentran las ganancias es más interesante que la cifra principal. Arena clasificó a MAI-Image-2.6 primero en imagen y modelado 3D (subiendo desde el sexto puesto) y segundo en dibujos animados/anime/fantasía (subiendo desde el octavo), diseño de producto, branding y diseño comercial (subiendo desde el séptimo), renderizado de texto (subiendo desde el octavo, con la ganancia de +91 Elo), y arte (subiendo desde el cuarto). Microsoft afirma que mejoró en todas las categorías medidas. Esa dispersión — diseño comercial, 3D, texto y arte — es la firma de un modelo de imagen de propósito general en lugar de una especialidad de un solo truco.

Entonces llegaron dos puntos de datos más. El panel de edición de imágenes de Arena — la categoría 'Single Image Edit' — sitúa la misma versión mai-image-2.6-preview en el n.º 3 con 1.420 puntos, tras subir desde el n.º 5 y quedar 19 puntos por delante de MAI-Image-2.5, con el renderizado de texto como la mayor ganancia individual (+43 puntos). El 25 de agosto, Artificial Analysis fue más allá: su Image Editing Leaderboard coloca la versión preliminar en el n.º 1, arrebatando el primer puesto al propio MAI-Image-2.5-Pro de Microsoft (anteriormente n.º 1 con 1.272 Elo) y situándose por delante de Reve 2.1 y de GPT Image 2 de OpenAI — Microsoft ahora ocupa las dos primeras posiciones de edición en ese panel. El jefe de IA de Microsoft, Mustafa Suleyman, calificó a 2.6 como "el mejor modelo de edición de imágenes en AA" y afirmó que Microsoft ocupa tres de las cinco primeras posiciones — eso es el encuadre del proveedor; las clasificaciones subyacentes son de Artificial Analysis. La puntuación de edición de AA para la propia versión preliminar no se ha publicado, y ambos paneles son recientes y con pocos votos, así que hay que considerar la dirección como sólida y las cifras exactas como provisionales.

Qué hay de nuevo realmente (informado por el proveedor)

En cuanto a capacidades, las propias descripciones de Microsoft para MAI-Image-2.6 son:

• Mejor renderizado de texto, retratos e imágenes 3D

• Resultados comerciales y fotorrealistas más pulidos en casos de uso de producto, branding y cinematográficos

• Trabaja con múltiples imágenes de referencia en una sola generación

• Mayor fundamentación — mejor adherencia a los detalles específicos del prompt

• Mayor control sobre el razonamiento, el formato y la resolución

Cada uno de esos datos es reportado por el proveedor y aún no ha sido reproducido de forma independiente. La evidencia independiente es el par de tablas de clasificación: n.º 2 en texto a imagen tanto en Arena como en Artificial Analysis, n.º 3 en la tabla de edición de Arena, y n.º 1 en la tabla de edición de Artificial Analysis — todo preliminar. Hasta que MAI-Image-2.6 esté ampliamente disponible y terceros puedan ejecutar evaluaciones controladas, trata la lista de capacidades como una afirmación de Microsoft y las dos tablas de clasificación como la señal de referencia.

Cuando realmente puedes usarlo

MAI-Image-2.6 pasó de "solo Arena" a "Arena más una vista previa oficial" esta semana. El 19 de agosto, Microsoft anunció que el modelo está disponible en vista previa privada en MAI Playground y Microsoft Foundry. Esa es la declaración del propio proveedor, y el acceso a la vista previa es mediante invitación, no un registro público — por lo que todavía no hay lista de precios ni API de pago por token. La señal práctica a observar: cuando MAI-Image-2.5 se convirtió en el predeterminado en Bing Image Creator y se integró en PowerPoint y OneDrive, significó que Microsoft lo consideraba seguro para producción. Un despliegue similar de la 2.6 en esas superficies — o la eliminación de la etiqueta "vista previa" — será la señal de que está lista para cargas de trabajo de producción.

Microsoft's announcement that MAI-Image-2.6 launches at No. 2 on the Arena leaderboard ahead of Google, Meta and xAI, with category highlights for text rendering, 3D imaging and modeling, branding and commercial, portraits, and photorealistic and cinematic output.

Cuánto podría costar

No se ha publicado ningún precio para la 2.6 — la vista previa privada no tiene tarifa. El ancla es el resto de la familia, todo reportado por el proveedor:

• MAI-Image-2.5: $5 por millón de tokens de entrada de texto, $8 por entrada de imagen, $47 por salida de imagen

• MAI-Image-2.5-Flash: $1.75 / $1.75 / $19.50 — el nivel de alto volumen

• MAI-Image-2.5-Pro (julio de 2026): $5 / $8 / $106 — salida de 8K, 96.8% de precisión en representación de texto

Eso supone una diferencia de cinco veces entre las tarifas de salida de imágenes más económicas y las más caras que Microsoft ya vende, por lo que el coste de producción de 2.6 dependerá del nivel en el que se encuadre. Con la tarifa de salida de 47 dólares por millón de 2.5, una imagen que consume aproximadamente mil tokens de salida ronda los cinco centavos — pero Microsoft no publica el recuento de tokens por imagen, así que trátelo como aritmética, no como una cotización.

El precio también es donde una capa de enrutamiento demuestra su valor una vez que el modelo llega a una API pública. En OrcaRouter, lo que Microsoft cobre se traslada con un margen del 0% — precio de lista del proveedor, sin nada añadido — por lo que un descuento de lanzamiento o una reducción de precio posterior se refleja en tu factura el mismo día en que se anuncia. Sin renegociaciones ni segundo contrato; el modelo aparece con la misma clave que todo lo demás.

A dónde deja esto la carrera de modelos de imagen.

Lo más alto del ranking de texto a imagen de Arena en estos momentos: {{1}}GPT Image 2 (Medium) con 1,381{{/1}}, {{2}}MAI-Image-2.6 con 1,336{{/2}}, {{3}}Grok Imagine Image 2.0 con 1,316{{/3}}, {{4}}Reve 2.1 con 1,302{{/4}} y {{5}}Meta's Muse Image con 1,282{{/5}}. Cinco modelos dentro de aproximadamente 100 puntos de Elo en lo más alto. Artificial Analysis llega a la misma conclusión general — {{6}}N.º 2 en texto a imagen{{/6}}, {{7}}solo por detrás de GPT Image 2{{/7}} — y añade detalle por categorías: {{8}}la versión preliminar queda primera en 5 de sus 19 categorías de texto a imagen{{/8}} ({{9}}Material, Knowledge, Frontier, Retail & Ecommerce y Marketing & Advertising{{/9}}), con {{10}}GPT Image 2 liderando todas las demás{{/10}}. {{11}}Dos rankings independientes basados en preferencias que apuntan en la misma dirección es la lectura más sólida que se puede obtener de un modelo tan nuevo{{/11}}. {{12}}La brecha de calidad que solía separar al líder del resto se ha comprimido hasta el punto de que «mejor modelo de imagen» ya no es una pregunta útil{{/12}} — {{13}}la edición, el grounding, la velocidad y el precio lo son{{/13}}.

La apuesta de Microsoft es más amplia que cualquier corona en un ranking: un stack de modelos propio que abarca imagen, voz, código y razonamiento, distribuido a través de Copilot, Bing y Office. Los puestos en Arena son la prueba de trabajo; la distribución es el producto real.

Cómo probarlo sin arriesgar la producción

La vista previa de Arena es gratuita: úsala hoy para generar si quieres la señal en bruto. Si tienes acceso a la vista previa privada, los puntos de entrada de MAI Playground y Microsoft Foundry te permiten ejecutar cargas de trabajo reales antes de comprometerte. Para todos los demás, la forma sensata de adoptar un modelo completamente nuevo con una puntuación "preliminar" es enrutar una parte del tráfico hacia él y mantener tu modelo probado como respaldo. Ese es exactamente el modo de fallo para el que está diseñada una capa de enrutamiento: en OrcaRouter apuntarías un endpoint a MAI-Image-2.6 una vez que esté alojado en un proveedor upstream y dejarías que la conmutación automática por error capture los casos límite que una calificación de tabla de clasificación con pocos votos no puede ver. Una sola clave de API, más de 200 modelos, precios de proveedores sin recargo.

Qué ver a continuación

• Si el puesto No. 1 de edición en Artificial Analysis y el No. 3 en Arena se mantienen a medida que se acumulan los votos — ambas tablas están en una etapa temprana y con pocos votos.

• El precio de la API pública y en qué nivel se ubica — la vista previa privada aún no tiene tarifa

• Si Bing Image Creator y Copilot cambian su valor predeterminado de 2.5 a 2.6

• Evaluaciones comparativas independientes una vez que se abra la API.

• Si la etiqueta "preview" desaparece — la señal de que Microsoft tiene la suficiente confianza para venderlo

Preguntas frecuentes

¿Cuándo puedo usar realmente MAI-Image-2.6?

Ahora mismo a través de Arena, que es gratis. Desde el 19 de agosto también está en vista previa privada en MAI Playground y Microsoft Foundry — según el anuncio de la propia Microsoft, por lo que el acceso requiere invitación en lugar de un registro público. Todavía no hay una API pública de pago por token ni un precio publicado.

¿Qué tan fuerte es el resultado de la edición de imágenes?

En el leaderboard de edición de imágenes de Artificial Analysis, MAI-Image-2.6-Preview es el número 1, por delante de MAI-Image-2.5-Pro, Reve 2.1 y GPT Image 2 — Microsoft ocupa los dos primeros puestos. En el panel "Single Image Edit" de Arena, es el número 3 con 1,420 puntos, subiendo desde el número 5. Ambos son resultados independientes de preferencia a ciegas, pero tempranos y con pocos votos, y la puntuación de edición de AA para la versión preview no se ha publicado.

¿Qué tan cerca está de GPT Image 2 Medium?

45 Elo en la instantánea actual de Arena de texto a imagen — lo suficientemente cerca como para que la diferencia entre el No. 2 y el No. 1 se encuentre dentro de lo que el flujo de votos puede mover, y los cinco mejores modelos están todos dentro de aproximadamente 100 Elo.

¿Son fiables los rangos de Arena?

Son resultados independientes de preferencias humanas a ciegas, que es exactamente lo que los hace significativos — pero ambos son preliminares (unos 3.500 votos en el tablero de texto a imagen) y están asociados a un build de vista previa. Confía en la dirección, no en los decimales.

En resumen: MAI-Image-2.6-Preview es el primer modelo de imagen de Microsoft que realmente pertenece a la conversación de frontera — y llegó rápido: No. 2 en el ranking de texto a imagen de Arena en su debut, No. 1 en edición de imágenes en Artificial Analysis para el 25 de agosto, y vista previa privada en las plataformas propias de Microsoft antes de cualquier API pública. Dos rankings independientes convergen ahora en la misma lectura. Si el precio final se sitúa cerca del nivel Flash, se convierte en una de las propuestas de valor más interesantes en generación de imágenes este año. Los rankings de edición y la vista previa responden «¿es esto real?». La API pública y su precio responderán «¿vale la pena construir sobre esto?».