Cartão de destaque para o confronto entre MAI-Image-2.5-Pro, um modelo premium de edição em preview do Microsoft Foundry, e Bernini-Diffusers-v2, o pipeline de pesos abertos Apache-2.0 da ByteDance.
Guides & Insights

MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: Um Nº 1 Medido Contra uma Aposta Não Medida de Pesos Abertos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Comparar MAI-Image-2.5-Pro com Bernini-Diffusers-v2 não é realmente comparar dois modelos de imagem. É comparar duas respostas diferentes para a mesma pergunta — "como faço uma boa edição de uma imagem existente?" — em que um lado tem 6.100 votos humanos cegos por trás de seu rank #1 de edição e o outro tem um README. MAI-Image-2.5-Pro, o modelo de imagem de alta qualidade da Microsoft, entrou em pré-visualização pública no Microsoft Foundry em 23 de julho de 2026 e agora lidera o Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, o framework unificado de geração de segunda geração da ByteDance, chegou ao Hugging Face em 13 de agosto de 2026 como pesos Apache-2.0, sem anúncio e sem benchmark de qualidade de imagem que alguém fora da ByteDance tenha executado. Toda diferença prática neste confronto decorre desses dois fatos.

Uma você chama, uma você executa

MAI-Image-2.5-Pro — um modelo de API hospedado em pré-visualização pública no Azure AI Foundry e no MAI Playground. Proprietário, medido por token, sem ajuste fino, sem auto-hospedagem. Você obtém um endpoint e paga por token; a Microsoft opera a infraestrutura.

Bernini-Diffusers-v2 — pesos Apache-2.0 que você baixa do Hugging Face e executa por conta própria. A stack é um planejador semântico Qwen2.5-VL-7B acionando um renderizador DiT baseado em Wan2.2, e a recomendação de hardware do README é GPUs classe Hopper (H100/H800/H200) com Python 3.11.2 / PyTorch 2.5.1+cu124. Você fornece o cluster.

Essa é a regra de decisão em uma linha: se a sua organização quer ser dona da stack, Bernini é uma opção; se a sua organização quer uma fatura e um SLA, só o MAI-Image-2.5-Pro está na disputa. Eles não são substitutos um do outro.

A lacuna de evidências é a verdadeira manchete.

Os dois modelos estão em lados opostos do maior problema de qualidade em IA de imagem: medir a saída. A habilidade de edição do MAI-Image-2.5-Pro é avaliada de forma independente — Nº 1 no Artificial Analysis Image Editing Arena com Elo 1,272 a partir de ~6,100 comparações cegas, à frente do Reve 2.1, do GPT Image 2 e do seu próprio irmão MAI-Image-2.5. Sua classificação em texto-para-imagem é a sétima com Elo 1,292, o que é o contrapeso honesto: é um editor especialista, não o líder de tela em branco. Esses números são auditáveis por qualquer pessoa com um navegador.

Bernini-Diffusers-v2 não tem pontuação pública equivalente. A ficha do modelo relata EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83 e VBench 84.46 — todas relatadas pelo fornecedor e todas métricas do lado do vídeo. Não há nada na ficha que um comprador de imagens reconheça como resultado de leaderboard de texto-para-imagem ou edição de imagem. A ficha afirma que a Bernini atinge "o primeiro escalão" dos modelos comerciais fechados no arena interna de comparação às cegas da ByteDance — exatamente o tipo de autoavaliação do fornecedor que precisa de verificação independente antes de significar qualquer coisa.

MAI-Image-2.5-Pro: Elo de edição 1.272 (independente, ~6.100 votos); Elo de texto para imagem 1.292 (independente, ~11.500 votos)

Bernini-Diffusers-v2: sem benchmark público de imagem; apenas métricas de vídeo, relatadas pelo fornecedor

Comparison scoreboard for MAI-Image-2.5-Pro and Bernini-Diffusers-v2: editing rank No. 1 at 1,272 Elo versus no public image benchmark; availability Foundry preview versus Apache-2.0 self-host; text rendering 96.8% claimed versus unpublished; price USD 108.50 per 1k versus free weights plus your own compute; editing approach surgical edits versus plan-then-render; scope image-only versus unified image and video

Duas teorias diferentes de edição

Ambos os modelos são construídos em torno da ideia de que editar não deve significar regenerar a cena. Mas eles chegam lá de maneiras diferentes.

MAI-Image-2.5-Pro é a proposta da Microsoft de "edições precisas e cirúrgicas com consistência": altere um objeto, atualize o texto na imagem, remova o desfoque de movimento e mantenha todo o resto — identidade do sujeito, iluminação, textura — estável. Essa consistência é o mecanismo por trás da afirmação de 94% de consistência de personagem em múltiplas imagens (relatada pelo fornecedor, não verificada). O objetivo do produto é um modelo que faça a edição restrita e pare.

Bernini-Diffusers-v2 é um pipeline que primeiro planeja e depois renderiza: o planejador Qwen2.5-VL decompõe uma instrução em etapas semânticas — mudar o clima, trocar o estilo, inserir um objeto, manter o sujeito — e o renderizador desenha o resultado. O design é voltado para instruções complexas e de múltiplas etapas, e os mesmos pesos cobrem tarefas de texto para imagem, imagem para imagem e vídeo (t2i, i2i, t2v, v2v, rv2v, r2v). Essa abrangência é o ponto positivo; o custo não medido é que um planejador de 7B é um verdadeiro gargalo para edições muito sutis, e ninguém fora da ByteDance quantificou como ele lida com elas.

Screenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the README, the Apache-2.0 license, and the benchmark table with video-side metrics

Renderização de texto, o campo de batalha prático

O texto em imagens é onde um editor de imagens moderno justifica seu preço, e aqui a assimetria é gritante. A principal capacidade do MAI-Image-2.5-Pro é a renderização precisa de texto — a Microsoft afirma 96,8% de precisão em inglês, chinês, japonês, coreano e espanhol (dados divulgados pela própria empresa; os mesmos documentos limitam a saída a quase um megapixel, então trate o número como uma referência). A Bernini-Diffusers-v2 não publicou nenhuma precisão de renderização de texto. Para um fluxo de trabalho que produz anúncios localizados, embalagens ou qualquer coisa com uma palavra legível, um dos candidatos oferece uma alegação mensurável e o outro não oferece nada.

Custo, e a forma da conta.

MAI-Image-2.5-Pro — $5 por milhão de tokens de entrada de texto, $8 por milhão de tokens de entrada de imagem, $106 por milhão de tokens de saída de imagem. O custo por imagem não é publicado; a conversão da Artificial Analysis coloca uma imagem de 1024×1024 perto de $108,50 por 1.000. Preço de pré-visualização, sujeito a alterações no GA.

Bernini-Diffusers-v2 — os pesos são gratuitos, mas a auto-hospedagem exige hardware da classe H100 (ou aluguel de nuvem), as operações para mantê-lo funcionando e seu próprio escalonamento. A economia inverte o modelo de API: caro para dez imagens por dia, barato em grande volume.

Para a maioria das equipes, a forma honesta de colocar é: o custo total de propriedade da Bernini só é favorável se você já opera uma frota de GPUs e a carga de trabalho é grande e constante. Caso contrário, uma API com medição por uso a uma taxa premium é a falha mais barata.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, the subject model's vendor page, showing the preview launch and family context

O que um roteador pode e não pode fazer aqui

Nenhum dos modelos pode ser roteado pelo OrcaRouter hoje, por razões opostas: o MAI-Image-2.5-Pro está atrás da prévia direta do Microsoft Foundry, e o Bernini-Diffusers-v2 não é um endpoint — são pesos. Isso importa como princípio para este confronto: o padrão de roteamento só se aplica à metade desta comparação que é uma API chamável. Quando o MAI-Image-2.5-Pro alcançar uma API de terceiros chamável, a forma de adotá-lo sem apostar um caminho de produção em código de prévia é rotear uma fatia do tráfego para ele com um modelo comprovado como failover automático — no OrcaRouter isso é um endpoint, preços de provedores repassados com margem de 0% e um fallback que captura o que o leaderboard de poucos votos não conseguiu ver. O lado dos pesos abertos não tem equivalente: ou você executa a stack do Bernini você mesmo, ou não a usa.

O veredito

MAI-Image-2.5-Pro é um editor hospedado premium e mensurável: nº 1 em um ranking de edição independente, uma verdadeira alegação de renderização de texto e um preço à altura. Bernini-Diffusers-v2 é um pipeline de pesos abertos gratuito, amplo e não comprovado em imagens, que também faz vídeo — genuinamente interessante se você fizer self-hosting, genuinamente impossível de pontuar até que alguém execute uma avaliação pública de imagens. Se o seu fluxo de trabalho precisa de uma API chamável e de um número que você possa defender, a escolha é MAI-Image-2.5-Pro ou um dos outros editores hospedados que ele supera. Se o seu fluxo de trabalho precisa de propriedade e você pode operar o hardware, Bernini-Diffusers-v2 vale a pena testar — mas compre como uma aposta em potencial não medido, não como um concorrente de um nº 1 medido.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube