
MAI-Image-2.5-Pro vs Flux 3: Misma semana de lanzamiento, dos realidades diferentes
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
MAI-Image-2.5-Pro y Flux 3 se anunciaron la misma semana —el 23 de julio de 2026—. Un mes después, ocupan universos distintos. MAI-Image-2.5-Pro, el modelo de imagen de nivel de calidad de Microsoft, está en vista previa pública en Microsoft Foundry y ha subido al No. 1 en el Artificial Analysis Image Editing Arena (Elo 1.272 de ~6.100 votos ciegos). Flux 3, el modelo fundacional multimodal unificado de Black Forest Labs, ha lanzado exactamente uno de sus niveles —vídeo— y su nivel de imagen no tiene endpoint público, ni precio, ni benchmarks que se puedan ejecutar. Un lector que pregunte «qué modelo de imagen debería usar» no tiene aquí dos candidatos; tiene un producto y una promesa.
Lo que realmente es cada uno
• MAI-Image-2.5-Pro — un modelo propietario centrado en la generación y edición de imágenes, el nivel de máxima fidelidad de la familia interna MAI-Image-2.5 de Microsoft. Medido por tokens, alojado en Foundry, orientado a imágenes destacadas, edición detallada y renderizado de texto en imagen. Este es el modelo completo: imágenes.
• Flux 3 — un modelo fundacional multimodal unificado entrenado conjuntamente en imagen, vídeo y audio (además de predicción de acciones robóticas), construido sobre un método de emparejamiento de flujos que BFL denomina Self-Flow. Se anunciaron cinco variantes: Flux 3 Video, Flux 3 Image, Flux 3 Action, Flux-mimic para robótica y Flux 3 Dev (pesos abiertos previstos para finales de 2026). La imagen es una modalidad dentro de una apuesta mayor, no el producto en sí.
Esa diferencia estructural importa más que cualquier especificación. Un modelo de imagen enfocado pone toda su capacidad en imágenes fijas; un modelo multimodal reparte la capacidad entre medios. MAI-Image-2.5-Pro existe para ganar en edición de imágenes. Flux 3 existe para ser un modelo que lo hace todo, y su nivel de imagen es la parte de esa visión que aún no ha llegado.
Disponibilidad: la comparación completa
A mediados de agosto de 2026, la asimetría es absoluta:
• MAI-Image-2.5-Pro — vista previa pública en Azure AI Foundry en siete regiones globales, además del MAI Playground gratuito. Puedes usarlo hoy con una cuenta de Microsoft; ya es el nivel de calidad de una familia que impulsa Bing Image Creator, PowerPoint y OneDrive.
• Flux 3 Image — no publicado. La documentación de BFL no enumera ningún endpoint de imagen; la línea de imágenes invocable actual sigue siendo FLUX.2 (Pro, Dev, Flex, Klein). La página de Flux 3 muestra una etiqueta de «próximamente» con un formulario de solicitud en lugar de un botón de inicio. BFL dijo que el acceso anticipado a las imágenes se abriría «en las próximas semanas» tras el anuncio del 23 de julio; a día de hoy no hay ID de modelo, ni especificaciones de imagen, ni límite de prompts publicado. Solo Flux 3 Video alcanzó disponibilidad general (4 de agosto, facturado por segundo).
Entonces, la respuesta práctica a "sobre cuál puedo construir para la edición de imágenes hoy en día" contiene exactamente un nombre.
La evidencia que cada lado puede mostrar
La capacidad de edición de MAI-Image-2.5-Pro se mide de forma independiente. Además del Elo de edición n.º 1, su puesto de texto a imagen es el n.º 7 con 1.292 Elo — bueno, no el líder, que es la forma honesta de interpretar a un especialista. Microsoft también publica cifras reportadas por el proveedor: 96,8 % de precisión en el renderizado de texto (señalada como cobertura de cinco idiomas), 27 % mejor adherencia a las instrucciones que GPT Image 1.5 en evaluaciones internas, y 94 % de consistencia de personajes en múltiples imágenes. Etiqueta todas esas como cifras propias de Microsoft; la tabla de clasificación es la parte independiente.
Flux 3 Image no tiene evidencia pública alguna. No hay puntos de referencia de imagen, porque no hay un endpoint de imagen para probar. Los únicos números reportados por BFL en la familia son para Flux 3 Video: un Elo interno de 1,135 de texto a video y 1,051 de imagen a video que BFL afirma supera a Omni Flash, H3 y Seedance 2.0, y esos son reportados por el proveedor, no reproducidos, y de todos modos no se transfieren al nivel de imagen. Cualquier cosa que leas que "pruebe" la calidad de imagen de Flux 3 es una extrapolación de los números de video o de la línea anterior FLUX.2.


Lo que Flux 3 promete para las imágenes (hoja de ruta del proveedor, no especificación)
Las afirmaciones de la hoja de ruta de BFL para el nivel de imagen merecen la pena conocerse precisamente porque son afirmaciones:
• Síntesis y edición de imágenes en distintos estilos, relaciones de aspecto y resoluciones
• Mejora del manejo de prompts complejos y renderizado de texto multilingüe de alta precisión
• Transferencia de estilo zero-shot a partir de una imagen de referencia, con múltiples referencias de estilo combinadas en una sola pasada
Consistencia de personaje y marca a través de generaciones sin ajuste fino
• Edición no destructiva: conserva las texturas, el grano, la iluminación y el fondo para que las ediciones de múltiples turnos no degraden la calidad.
Esa última afirmación es interesante: es la misma propiedad de 'edición sin regenerar la escena' en la que el diseño de edición quirúrgica de MAI-Image-2.5-Pro ya está en producción y puntuando. Si Flux 3 Image cumple con ello, competirá directamente con lo que MAI-Image-2.5-Pro ya hace. 'Si' es la palabra clave: todo lo que hay en esa lista no está verificado hasta que exista el endpoint.
Costo
• MAI-Image-2.5-Pro — $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen, $106 por millón de tokens de salida de imagen. La conversión de Artificial Analysis sitúa una imagen de 1024×1024 cerca de $108.50 por 1,000. Precio preliminar; GA podría cambiarlo.
• Flux 3 Image — no existe un precio, porque no existe un endpoint. El único precio de Flux 3 publicado es para video: $0.17/segundo (HD) y $0.29/segundo (FHD) para renders completos. Como punto de referencia para la línea de imágenes FLUX.2 invocable, BFL cobra aproximadamente $0.04 por imagen para Flux Pro y $0.015 para Flux Dev — pero esa es la generación anterior, no una proyección.
No puedes comparar un precio contra una línea en blanco. La comparación de costos de hoy es la tarifa premium de MAI-Image-2.5-Pro contra nada en absoluto.

¿Sobre cuál construir?
Si tu entregable son imágenes en 2026, la respuesta es MAI-Image-2.5-Pro (o uno de los otros editores alojados — GPT Image 2 sigue liderando en texto a imagen y en el otro panel principal de edición). Es invocable, tiene una puntuación de edición independiente #1, y el límite de resolución de alrededor de un megapíxel es lo principal que debes verificar según tu caso de uso. Flux 3 es un elemento a vigilar: cuando llegue el nivel de imagen, sus promesas de edición no destructiva y consistencia de marca merecerán una prueba seria contra exactamente el modelo que Microsoft está puntuando como #1 en este momento.
También hay una forma de pensar la espera basada en el enrutamiento. Cuando Flux 3 Image finalmente tenga un endpoint, la forma de bajo riesgo de adoptar un modelo completamente nuevo y sin benchmarks es enrutar una parte del tráfico hacia él y mantener el modelo probado como failover automático — un único endpoint, precios de proveedor trasladados con un margen del 0%, y el modelo no probado ganándose su lugar en el tráfico real en lugar de una diapositiva de hoja de ruta. Ese es el patrón para el que existe OrcaRouter, y es el mismo patrón que hace que modelos de nivel preliminar, como MAI-Image-2.5-Pro, sean adoptables antes de alcanzar disponibilidad general.
El veredicto
Misma semana de lanzamiento, un mes después: MAI-Image-2.5-Pro es un editor medido como #1 al que puedes recurrir hoy, y Flux 3 es un modelo fundacional multimodal cuya capa de imagen sigue siendo una promesa con una hoja de ruta. Compararlos en calidad de imagen sería comparar a un boxeador con un peleador que aún no ha entrado al ring. Usa MAI-Image-2.5-Pro para trabajo de imagen ahora; mantén Flux 3 Image en la lista de cosas a reevaluar el día en que su endpoint realmente se lance.
