Cartão hero para o confronto entre MAI-Image-2.5-Pro, em pré-visualização no Microsoft Foundry, e Flux 3, o modelo de fundação multimodal da Black Forest Labs cujo tier de imagem ainda não foi lançado.
Guides & Insights

MAI-Image-2.5-Pro vs Flux 3: Mesma Semana de Lançamento, Duas Realidades Diferentes

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MAI-Image-2.5-Pro e Flux 3 foram ambos anunciados na mesma semana — 23 de julho de 2026. Um mês depois, ocupam universos diferentes. O MAI-Image-2.5-Pro, o modelo de imagem de nível de qualidade da Microsoft, está em pré-visualização pública no Microsoft Foundry e subiu para nº 1 na Artificial Analysis Image Editing Arena (Elo 1.272 em ~6.100 votos cegos). O Flux 3, o modelo fundacional multimodal unificado da Black Forest Labs, lançou exatamente um de seus níveis — vídeo — e seu nível de imagem não tem endpoint público, nem preço, nem benchmarks que qualquer pessoa possa executar. Um leitor que pergunte "qual modelo de imagem devo usar" não tem dois candidatos aqui; tem um produto e uma promessa.

O que cada um realmente é

MAI-Image-2.5-Pro — um modelo proprietário e focado em geração e edição de imagens, o nível de maior fidelidade da família interna MAI-Image-2.5 da Microsoft. Com medição por tokens, hospedado no Foundry, voltado para imagens em destaque, edição detalhada e renderização de texto dentro da imagem. Este é o modelo completo: imagens.

Flux 3 — um modelo fundacional multimodal unificado, treinado conjuntamente em imagem, vídeo e áudio (além de previsão de ações de robôs), construído sobre um método de flow-matching que a BFL chama de Self-Flow. Cinco variantes foram anunciadas: Flux 3 Video, Flux 3 Image, Flux 3 Action, Flux-mimic para robótica e Flux 3 Dev (pesos abertos planejados para mais tarde em 2026). A imagem é uma modalidade dentro de uma aposta maior, não o produto em si.

Essa diferença estrutural importa mais do que qualquer especificação. Um modelo de imagem focado coloca toda a sua capacidade em imagens estáticas; um modelo multimodal distribui a capacidade entre mídias. O MAI-Image-2.5-Pro existe para vencer na edição de imagens. O Flux 3 existe para ser um único modelo que faz tudo, e sua camada de imagem é a parte dessa visão que ainda não chegou.

Disponibilidade: a comparação completa.

Desde meados de agosto de 2026, a assimetria é absoluta:

MAI-Image-2.5-Pro — prévia pública no Azure AI Foundry em sete regiões globais, além do MAI Playground gratuito. Você pode usá-lo hoje com uma conta Microsoft; já é o nível de qualidade de uma família que alimenta o Bing Image Creator, o PowerPoint e o OneDrive.

Flux 3 Image — não lançado. A documentação da BFL não lista endpoint de imagem; a linha de imagem atualmente acionável permanece FLUX.2 (Pro, Dev, Flex, Klein). A página do Flux 3 traz um rótulo "em breve" com um formulário de inscrição em vez de um botão de início. A BFL disse que o acesso antecipado a imagens seria aberto "nas próximas semanas" após o anúncio de 23 de julho; até agora não há ID de modelo, especificações de imagem ou limite de prompt publicados. Apenas o Flux 3 Video alcançou disponibilidade geral (4 de agosto, cobrado por segundo).

Então, a resposta prática para "em qual posso me basear para edição de imagens hoje" tem exatamente um nome.

As provas que cada lado pode apresentar

A força de edição do MAI-Image-2.5-Pro é medida de forma independente. Além do Elo de edição nº 1, sua classificação em texto-para-imagem é nº 7 com 1.292 de Elo — bom, mas não o líder, que é a forma honesta de ler um especialista. A Microsoft também publica alegações relatadas pelo fornecedor: 96,8% de precisão na renderização de texto (marcada como cobrindo cinco idiomas), aderência a instruções 27% melhor do que o GPT Image 1.5 em avaliações internas e 94% de consistência de personagens em múltiplas imagens. Rotule todas essas como números da própria Microsoft; o ranking é a parte independente.

Flux 3 Image não tem nenhuma evidência pública. Não há benchmarks de imagem, porque não há endpoint de imagem para testar. Os únicos números relatados pela BFL na família são para o Flux 3 Video — um Elo interno de 1,135 para texto-para-vídeo e 1,051 para imagem-para-vídeo que a BFL afirma superar Omni Flash, H3 e Seedance 2.0 — e esses são relatados pelo fornecedor, não reproduzidos e não se transferem para a camada de imagem de qualquer forma. Qualquer coisa que você ler que "benchmarka" a qualidade de imagem do Flux 3 está extrapolando dos números de vídeo ou da linha FLUX.2 mais antiga.

Screenshot of the Artificial Analysis Image Editing Leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2Comparison scoreboard for MAI-Image-2.5-Pro and Flux 3: availability in preview on Microsoft Foundry versus image tier unreleased; image editing rank No. 1 at 1,272 Elo versus no image benchmarks; scope focused image model versus unified multimodal; text rendering 96.8% claimed versus roadmap claim of multilingual accuracy; price USD 108.50 per 1k versus no image price published; callable today versus coming soon

O que o Flux 3 promete para imagens (roadmap do fornecedor, não especificação)

Vale a pena conhecer precisamente as alegações do roadmap da BFL para o nível de imagem porque são alegações:

• Síntese e edição de imagens em diversos estilos, proporções e resoluções

• Melhor tratamento de prompts complexos e renderização de texto multilíngue de alta precisão

• Transferência de estilo zero-shot a partir de uma imagem de referência, com múltiplas referências de estilo mescladas em uma única passagem

• Consistência de personagem e marca entre gerações sem ajuste fino

• Edição não destrutiva — preservando texturas, granulação, iluminação e fundo para que edições em várias etapas não degradem

Essa última é a afirmação interessante: é a mesma propriedade de "editar sem regenerar a cena" que o design de edição cirúrgica do MAI-Image-2.5-Pro já está entregando e pontuando. Se o Flux 3 Image cumprir isso, estará competindo diretamente com o que o MAI-Image-2.5-Pro já faz. "Se" é a palavra-chave — tudo nessa lista permanece não verificado até que o endpoint exista.

Custo

MAI-Image-2.5-Pro — US$ 5 por milhão de tokens de entrada de texto, US$ 8 por milhão de tokens de entrada de imagem, US$ 106 por milhão de tokens de saída de imagem. A conversão da Artificial Analysis coloca uma imagem de 1024×1024 perto de US$ 108,50 por 1.000. Preço de pré-visualização; a GA pode alterá-lo.

Flux 3 Image — não existe preço, porque não existe endpoint. O único preço publicado do Flux 3 é para vídeo: US$ 0,17/segundo (HD) e US$ 0,29/segundo (FHD) para renders completos. Para a linha de imagens FLUX.2 chamável como ponto de referência, a BFL cobra aproximadamente US$ 0,04 por imagem para o Flux Pro e US$ 0,015 para o Flux Dev — mas isso é a geração anterior, não uma previsão.

Não é possível comparar um preço com uma linha em branco. A comparação de custos de hoje é a taxa premium do MAI-Image-2.5-Pro contra absolutamente nada.

Screenshot of Microsoft's announcement of MAI-Image-2.5-Pro and MAI-Voice-2-Flash, showing the preview launch and positioning as Microsoft's highest-fidelity image model

Em qual basear-se

Se a sua entrega for imagens em 2026, a resposta é MAI-Image-2.5-Pro (ou um dos outros editores hospedados — o GPT Image 2 ainda lidera em texto-para-imagem e no outro quadro principal de edição). Ele é chamável, tem uma pontuação de edição #1 independente, e o limite de resolução em torno de um megapixel é o principal ponto a verificar no seu caso de uso. O Flux 3 é algo a observar: quando o nível de imagem chegar, suas afirmações de edição não destrutiva e consistência de marca merecerão um teste sério exatamente contra o modelo que a Microsoft está classificando como #1 no momento.

Há também uma abordagem de roteamento para pensar sobre a espera. Quando o Flux 3 Image finalmente tiver um endpoint, a maneira de baixo risco de adotar um modelo totalmente novo, sem benchmarks, é rotear uma fatia do tráfego para ele e manter o modelo comprovado como failover automático — um endpoint, preços do provedor repassados com margem de 0%, e o modelo não comprovado ganhando seu lugar no tráfego ao vivo em vez de um slide de roadmap. É para esse padrão que o OrcaRouter existe, e é o mesmo padrão que torna modelos de nível de pré-visualização como MAI-Image-2.5-Pro adotáveis antes de atingirem disponibilidade geral.

O veredito

Na mesma semana de lançamento, um mês depois: MAI-Image-2.5-Pro é um editor #1 comprovado que você pode chamar hoje, e Flux 3 é um modelo fundacional multimodal cuja camada de imagem ainda é uma promessa com um roteiro. Compará-los em qualidade de imagem seria comparar um boxeador a um lutador que ainda não entrou no ringue. Use MAI-Image-2.5-Pro para trabalho com imagens agora; mantenha Flux 3 Image na lista de coisas para reavaliar no dia em que seu endpoint realmente for lançado.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube