Tarjeta destacada para el enfrentamiento entre MAI-Image-2.5-Pro, un modelo de edición premium en la vista previa de Microsoft Foundry, y Bernini-Diffusers-v2, el pipeline de pesos abiertos Apache-2.0 de ByteDance.
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Un #1 Medido contra una Apuesta de Pesos Abiertos sin Medir

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Comparar MAI-Image-2.5-Pro con Bernini-Diffusers-v2 no es realmente comparar dos modelos de imagen. Es comparar dos respuestas diferentes a la misma pregunta — "¿cómo consigo una buena edición de una imagen existente?" — donde un lado tiene 6.100 votos humanos ciegos respaldando su puesto n.º 1 en edición y el otro tiene un README. MAI-Image-2.5-Pro, el modelo de imagen de gama alta de Microsoft, entró en vista previa pública en Microsoft Foundry el 23 de julio de 2026 y ahora encabeza la Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, el marco de generación unificada de segunda generación de ByteDance, llegó a Hugging Face el 13 de agosto de 2026 con pesos bajo licencia Apache-2.0, sin anuncio y sin ningún benchmark de calidad de imagen que nadie fuera de ByteDance haya ejecutado. Cada diferencia práctica en este enfrentamiento se deriva de esos dos hechos.

Uno para llamar, uno para ejecutar.

MAI-Image-2.5-Pro — un modelo de API alojado en vista previa pública en Azure AI Foundry y el MAI Playground. Propietario, medido por tokens, sin ajuste fino, sin autoalojamiento. Obtienes un endpoint y pagas por token; Microsoft gestiona la infraestructura.

Bernini-Diffusers-v2 — pesos Apache-2.0 que descargas de Hugging Face y ejecutas tú mismo. La pila es un planificador semántico Qwen2.5-VL-7B que impulsa un renderizador DiT basado en Wan2.2, y la recomendación de hardware del README es GPUs de clase Hopper (H100/H800/H200) con Python 3.11.2 / PyTorch 2.5.1+cu124. Tú aportas el clúster.

Esa es la regla de decisión en una línea: {{1}}si su organización quiere ser dueña del stack, Bernini es una opción; {{2}}si su organización quiere una factura y un SLA, solo MAI-Image-2.5-Pro está siquiera en la contienda.{{/2}} No son sustitutos entre sí.{{/1}}

La brecha de evidencia es el verdadero titular.

Los dos modelos se sitúan en lados opuestos del mayor problema de calidad en la IA de imágenes: medir el resultado. La habilidad de edición de MAI-Image-2.5-Pro se puntúa de forma independiente — N.º 1 en el Artificial Analysis Image Editing Arena con Elo 1,272 a partir de ~6,100 comparaciones a ciegas, por delante de Reve 2.1, GPT Image 2, y su propio hermano MAI-Image-2.5. Su puesto en texto a imagen es séptimo con 1,292 Elo, lo cual es el contrapeso honesto: es un editor especialista, no el líder en lienzo en blanco. Esas cifras son auditables por cualquiera con un navegador.

Bernini-Diffusers-v2 no tiene una puntuación pública equivalente. La ficha del modelo reporta EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 y VBench 84.46 — todas proporcionadas por el proveedor y todas métricas del lado de video. No hay nada en la ficha que un comprador de imágenes reconozca como un resultado de leaderboard de texto a imagen o edición de imágenes. La ficha afirma que Bernini alcanza "el primer nivel" de los modelos comerciales cerrados en el arena interna de comparación a ciegas por pares de ByteDance — que es exactamente el tipo de autoevaluación del proveedor que necesita una verificación independiente antes de significar algo.

MAI-Image-2.5-Pro:Elo de edición 1.272 (independiente, ~6.100 votos); Elo de texto a imagen 1.292 (independiente, ~11.500 votos)

Bernini-Diffusers-v2: sin benchmark público de imágenes; solo métricas de video, reportadas por el proveedor

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Dos teorías diferentes de edición

Ambos modelos están construidos en torno a la idea de que editar no debería significar regenerar la escena. Pero llegan a ello de manera diferente.

MAI-Image-2.5-Pro es la propuesta de Microsoft de "ediciones precisas y quirúrgicas con coherencia": cambiar un objeto, actualizar el texto dentro de la imagen, eliminar el desenfoque de movimiento y mantener todo lo demás (identidad del sujeto, iluminación, textura) estable. Esa coherencia es el mecanismo detrás de su afirmación del 94 % de coherencia de personajes en múltiples imágenes (reportada por el proveedor, no verificada). El objetivo del producto es un modelo que hace la edición específica y se detiene.

Bernini-Diffusers-v2 es un pipeline de planificación y renderizado: el planificador Qwen2.5-VL descompone una instrucción en pasos semánticos — cambiar el clima, intercambiar el estilo, insertar un objeto, mantener el sujeto — y el renderizador dibuja el resultado. El diseño está orientado a instrucciones complejas y de múltiples pasos, y los mismos pesos cubren tareas de texto-a-imagen, imagen-a-imagen y video (t2i, i2i, t2v, v2v, rv2v, r2v). Esa amplitud es la ventaja; el costo no medido es que un planificador de 7B es un verdadero cuello de botella para ediciones muy sutiles, y nadie fuera de ByteDance ha cuantificado cómo las maneja.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Renderizado de texto, el campo de batalla práctico

El texto dentro de la imagen es donde un editor de imágenes moderno justifica su precio, y aquí la asimetría es evidente. La capacidad principal de MAI-Image-2.5-Pro es el renderizado preciso de texto: Microsoft afirma una precisión del 96,8% en inglés, chino, japonés, coreano y español (según lo informado por el proveedor; los mismos documentos limitan la salida a cerca de un megapíxel, así que considere la cifra como orientativa). Bernini-Diffusers-v2 no ha publicado ninguna precisión de renderizado de texto en absoluto. Para un flujo de trabajo que produce anuncios localizados, empaques o cualquier cosa que contenga una palabra legible, un candidato ofrece una afirmación medible y el otro no ofrece nada.

Coste y forma de la factura.

MAI-Image-2.5-Pro — $5 por millón de tokens de entrada de texto, $8 por millón de tokens de entrada de imagen, $106 por millón de tokens de salida de imagen. El costo por imagen no se publica; la conversión de Artificial Analysis sitúa una imagen de 1024×1024 en cerca de $108.50 por cada 1,000. Precio de vista previa, sujeto a cambios en GA.

Bernini-Diffusers-v2 — los pesos son gratuitos, pero el autoalojamiento implica hardware de clase H100 (o alquiler en la nube), las operaciones para mantenerlo en funcionamiento y tu propio escalado. La economía invierte el modelo de API: caro para diez imágenes al día, barato a gran volumen.

Para la mayoría de los equipos, el enfoque honesto es: el costo total de propiedad de Bernini solo es favorable si ya operas una flota de GPU y la carga de trabajo es grande y constante. De lo contrario, una API medida a una tarifa premium es el fracaso más barato.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

Lo que un router puede y no puede hacer aquí

Ninguno de los dos modelos se puede enrutar a través de OrcaRouter hoy, por razones opuestas: MAI-Image-2.5-Pro está detrás de la vista previa directa de Microsoft Foundry, y Bernini-Diffusers-v2 no es un endpoint en absoluto — son pesos. Eso importa como principio para este enfrentamiento: el patrón de enrutador solo se aplica a la mitad de esta comparación que es una API invocable. Cuando MAI-Image-2.5-Pro llegue a una API de terceros invocable, la forma de adoptarlo sin apostar una ruta de producción a código en vista previa es enrutar una porción del tráfico hacia él con un modelo probado como conmutación por error automática — en OrcaRouter eso es un endpoint, precios de proveedor transmitidos con un 0% de margen, y un respaldo que detecta lo que la clasificación de pocos votos no pudo ver. El lado de pesos abiertos no tiene equivalente: o ejecutas la pila de Bernini tú mismo o no la usas.

El veredicto

MAI-Image-2.5-Pro es un editor premium, medible y alojado: #1 en un panel de edición independiente, una afirmación real de renderizado de texto y un precio acorde. Bernini-Diffusers-v2 es un pipeline gratuito, amplio, de pesos abiertos y no probado en imágenes, que también hace video: genuinamente interesante si lo alojas tú mismo, genuinamente no puntuable hasta que alguien ejecute una evaluación pública de imágenes. Si tu flujo de trabajo necesita una API invocable y un número que puedas defender, la elección es MAI-Image-2.5-Pro u otro de los editores alojados a los que supera. Si tu flujo de trabajo necesita propiedad y puedes ejecutar el hardware, Bernini-Diffusers-v2 merece la pena probarlo, pero cómpralo como una apuesta por potencial no medido, no como un competidor de un #1 medido.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube