Cartão de destaque para o confronto entre MAI-Image-2.5-Pro a aproximadamente $108,50 por 1k imagens e Qwen-Image 3.0 a aproximadamente $25 por 1k imagens, dois modelos de imagem via API que ambos lideram em renderização de texto.
Guides & Insights

MAI-Image-2.5-Pro vs Qwen-Image 3.0: Quatro Vezes o Preço por um Tipo Diferente de Texto

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque MAI-Image-2.5-Pro e Qwen-Image 3.0 lado a lado e a primeira coisa que você nota é o preço: aproximadamente US$ 108,50 por 1.000 imagens para o nível premium da Microsoft contra aproximadamente US$ 25–30 por 1.000 para o Qwen-Image 3.0 da Alibaba — a taxa cotada pela própria Alibaba fica perto de US$ 25, enquanto o ranking da Artificial Analysis lista US$ 30. Mais de três vezes o valor em qualquer um dos números. O que esse prêmio realmente compra é um tipo diferente de trabalho de texto. O Qwen-Image 3.0, lançado pela equipe Qwen da Alibaba em 21 de julho de 2026 e aberto para uma API internacional em 4 de agosto, tem um preço para ser o renderizador de texto de alto volume — legível até ~10px em doze idiomas, com uma janela de prompt de 4.500 tokens para briefings densos. O MAI-Image-2.5-Pro, em pré-visualização pública no Microsoft Foundry desde 23 de julho, é o editor mais bem avaliado em um ranking independente, com precisão de renderização de texto declarada pelo fornecedor, mas com um limite rígido de saída de ~1 megapixel. Ambos são modelos de imagem via API cujos destaques são sobre texto; eles competem no preço por tarefa, não em uma única pontuação de qualidade.

Duas histórias de texto, nenhuma totalmente verificada

A batalha de texto é o motivo pelo qual ambos os modelos existem, e é também onde as evidências são mais escassas — todos os números nesta seção são fornecidos pelos fornecedores e nenhum foi reproduzido de forma independente.

Qwen-Image 3.0 — os materiais de divulgação da Alibaba afirmam renderização legível até aproximadamente 10px, suporte nativo para 12 idiomas com mais de 20 fontes e mais de 100 estilos artísticos, notação matemática, subscritos, sobrescritos e fórmulas de várias linhas, além de familiaridade com interfaces comuns da web, de jogos e de software. A janela de contexto aceita até 4.500 tokens de entrada — um salto de 4,5× em relação à geração anterior — o que permite absorver resumos densos como primeiras páginas de jornal ou uma grade de conhecimento de nove painéis em uma única chamada.

MAI-Image-2.5-Pro — a Microsoft afirma 96,8% de precisão na renderização de texto em chinês, inglês, japonês, coreano e espanhol, uma aderência ao prompt 27% melhor do que o GPT-Image-1.5 em avaliações internas, e 94% de consistência de personagens em múltiplas imagens. A especificação de entrada é mais ampla no papel — até 32.000 tokens de texto de entrada com uma janela de contexto de 131k — e a saída é limitada a 1.048.576 pixels, o equivalente a 1024×1024.

Ambas as alegações não foram reproduzidas até a presente data. A diferença está na forma das alegações: a da Q​wen é sobre volume e legibilidade entre sistemas de escrita, enquanto a da Microsoft é sobre precisão e consistência em um conjunto definido de cinco idiomas. Nenhum dos dois fornecedores publicou um benchmark que outro laboratório possa executar e verificar.

É na edição que mora o premium

O que separa os dois é a edição, e este é o único eixo com evidências independentes. O MAI-Image-2.5-Pro está em n.º 1 na Artificial Analysis Image Editing Arena com Elo 1.272 (~6.100 votos cegos), à frente de Reve 2.1, MAI-Image-2.5 e GPT Image 2. No mesmo ranking, o mais novo Qwen-Image-3.0-Pro está em 1.249 — uma pontuação competitiva, 23 Elo atrás, e notável para um modelo que só chegou à API internacional este mês.

Além do modelo base, o portfólio de edição da Alibaba é um conjunto de truques especializados em vez de uma única joia: restauração de pinturas antigas, geração de panoramas, esboço para PPT e storyboard de múltiplas tomadas. O da Microsoft é uma aposta mais restrita e profunda — edições precisas e cirúrgicas que mantêm o restante do quadro consistente (substituição de objetos, alterações de layout, atualizações de texto na imagem, limpeza de desfoque), a classe de edição em que modelos mais antigos regeneram a cena inteira e perdem o sujeito. Para um fluxo de trabalho que é “pegue este ativo existente, mude uma coisa, envie-o”, o nº 1 independente do nível Pro é o sinal mais forte; para um apanhado de formatos de edição criativa, a lista da Q​wen é mais ampla.

Screenshot of the Artificial Analysis Image Editing leaderboard showing MAI-Image-2.5-Pro at No. 1 with Elo 1,272 ahead of Reve 2.1, MAI-Image-2.5, and GPT Image 2

O contraste da especificação

• Preço — ~US$ 108,50 por 1 mil imagens (1024×1024, conversão AA) vs ~US$ 25–30 por 1 mil imagens (cotação da Alibaba vs tarifa listada pela AA)br />• Lançamento — 23 de julho de 2026 (pré-visualização pública, Foundry) vs 21 de julho de 2026, API internacional em 4 de ago.br />• Entrada de texto — 32.000 tokens, contexto de 131k vs janela de prompt de 4.500 tokensbr />• Teto de saída — ~1.048.576 pixels (~1K) vs até 2048×2048br />• Imagens por chamada — saída única por solicitação vs até seis imagens por chamadabr />• Ranking de edição — N.º 1, Elo 1.272 (AA) vs 1.249 para Qwen-Image-3.0-Pro no mesmo rankingbr />• Procedência — alegação da Microsoft de "sem destilação de modelos de terceiros" vs rótulo de procedência AIGC nas saídasbr />• Pesos — fechados, somente API vs fechados, somente API

O teto de saída e a contagem por chamada importam mais do que parecem. {{1}}Qwen-Image 3.0{{/1}} pode renderizar uma imagem de 2048×2048 e retornar até seis imagens por chamada, um recurso de economia em lote; o nível Pro chega perto de 1K e retorna uma única saída por solicitação. {{2}}Se o seu briefing é "me dê uma variedade de seis fotos de produto", o modelo da Alibaba é feito para isso e o modelo da Microsoft não é.{{/2}}

Two-column scoreboard for MAI-Image-2.5-Pro and Qwen-Image 3.0 comparing price per 1k images, output ceiling, images per call, prompt window, editing rank, and text-rendering claim

Quando o prêmio se paga por si só.

A regra de decisão é sobre para que servem as imagens, não sobre qual modelo é "melhor."

Pague o preço premium pelo MAI-Image-2.5-Pro quando a saída for um ativo hero — um visual de produto, um pôster, um keyframe, uma imagem que vai para uma campanha e não será regenerada cinquenta vezes. O ranking de edição nº 1 e a alegação de consistência de personagens importam mais quando uma edição precisa estar certa na primeira vez.

Compre em volume com Qwen-Image 3.0 quando a saída for descartável ou de alta contagem — variantes de anúncios localizadas, arte provisória, decks de rascunho para PPT, quadros de storyboard, qualquer coisa em que você vai regenerar em vez de refinar. A $25–30 por 1k, uma geração falha custa um erro de arredondamento; a $108.50 por 1k, não custa.

Existe um meio-termo que vale nomear: para trabalho denso e multilíngue de texto em imagem — um mock de landing page com conteúdo em japonês e espanhol, um infográfico com fórmulas — a legibilidade de 10px do Q​wen e seus doze idiomas são a melhor opção no papel, e por um quarto do preço. O contra-argumento do modelo da Microsoft é sua alegação de 96,8% de precisão em cinco idiomas, mas essa alegação não é verificada, e um comprador escolhendo entre duas alegações de texto não verificadas provavelmente deveria ponderar o preço.

Scoreboard for MAI-Image-2.5-Pro: image editing No. 1 at Elo 1,272, text-to-image No. 7 at 1,292, $108.50 per 1k images, 32k text input tokens, 131k context, ~1-megapixel output cap, public preview on Microsoft Foundry

A camada de roteamento, quando se aplica

Nenhum dos dois modelos está acessível pelo OrcaRouter ainda — o Qwen-Image 3.0 está na API da própria Alibaba (Alibaba Cloud Bailian e a plataforma Qwen) e em várias plataformas de terceiros, e o MAI-Image-2.5-Pro está no Microsoft Foundry — portanto, uma comparação honesta deixa claro que nenhum dos dois está disponível conosco hoje. Quando qualquer um deles se tornar disponível por meio de um provedor hospedado chamável, a lógica de repasse se aplica: margem de 0% sobre o preço de tabela do provedor, então a tabela de preços do fornecedor é o que você paga, e um desconto de lançamento ou redução de preço chega à sua fatura no mesmo dia em que é anunciado. O argumento do failover é a outra metade: o Qwen-Image 3.0 é uma API internacional lançada há poucas semanas, o tipo de modelo para o qual você roteia uma parcela do tráfego enquanto um fallback comprovado absorve os casos extremos — que é exatamente o cenário para o qual uma camada de roteamento foi projetada.

O veredito

Qwen-Image 3.0 e MAI-Image-2.5-Pro não são o mesmo produto com preços diferentes; são produtos diferentes que por acaso têm preços distintos. O modelo da Microsoft leva a coroa na edição, possui uma janela de contexto maior e faz uma alegação não verificada de precisão em cinco idiomas — para ativos de destaque e edições cirúrgicas, o preço premium é defensável. O modelo da Alibaba renderiza mais sistemas de escrita de forma legível, aceita briefings mais densos por geração em seus próprios termos, gera imagens maiores e em lotes de seis, e custa um quarto do preço — para trabalho em volume e texto-em-imagem multilíngue, é a escolha economicamente racional. Compre o premium onde a imagem é o produto; compre o volume onde a imagem é inventário.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube