
MAI-Image-2.5-Pro vs Qwen-Image 3.0: Quatro Vezes o Preço por um Tipo Diferente de Texto
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
Coloque MAI-Image-2.5-Pro e Qwen-Image 3.0 lado a lado e a primeira coisa que você nota é o preço: aproximadamente US$ 108,50 por 1.000 imagens para o nível premium da Microsoft contra aproximadamente US$ 25–30 por 1.000 para o Qwen-Image 3.0 da Alibaba — a taxa cotada pela própria Alibaba fica perto de US$ 25, enquanto o ranking da Artificial Analysis lista US$ 30. Mais de três vezes o valor em qualquer um dos números. O que esse prêmio realmente compra é um tipo diferente de trabalho de texto. O Qwen-Image 3.0, lançado pela equipe Qwen da Alibaba em 21 de julho de 2026 e aberto para uma API internacional em 4 de agosto, tem um preço para ser o renderizador de texto de alto volume — legível até ~10px em doze idiomas, com uma janela de prompt de 4.500 tokens para briefings densos. O MAI-Image-2.5-Pro, em pré-visualização pública no Microsoft Foundry desde 23 de julho, é o editor mais bem avaliado em um ranking independente, com precisão de renderização de texto declarada pelo fornecedor, mas com um limite rígido de saída de ~1 megapixel. Ambos são modelos de imagem via API cujos destaques são sobre texto; eles competem no preço por tarefa, não em uma única pontuação de qualidade.
Duas histórias de texto, nenhuma totalmente verificada
A batalha de texto é o motivo pelo qual ambos os modelos existem, e é também onde as evidências são mais escassas — todos os números nesta seção são fornecidos pelos fornecedores e nenhum foi reproduzido de forma independente.
• Qwen-Image 3.0 — os materiais de divulgação da Alibaba afirmam renderização legível até aproximadamente 10px, suporte nativo para 12 idiomas com mais de 20 fontes e mais de 100 estilos artísticos, notação matemática, subscritos, sobrescritos e fórmulas de várias linhas, além de familiaridade com interfaces comuns da web, de jogos e de software. A janela de contexto aceita até 4.500 tokens de entrada — um salto de 4,5× em relação à geração anterior — o que permite absorver resumos densos como primeiras páginas de jornal ou uma grade de conhecimento de nove painéis em uma única chamada.
• MAI-Image-2.5-Pro — a Microsoft afirma 96,8% de precisão na renderização de texto em chinês, inglês, japonês, coreano e espanhol, uma aderência ao prompt 27% melhor do que o GPT-Image-1.5 em avaliações internas, e 94% de consistência de personagens em múltiplas imagens. A especificação de entrada é mais ampla no papel — até 32.000 tokens de texto de entrada com uma janela de contexto de 131k — e a saída é limitada a 1.048.576 pixels, o equivalente a 1024×1024.
Ambas as alegações não foram reproduzidas até a presente data. A diferença está na forma das alegações: a da Qwen é sobre volume e legibilidade entre sistemas de escrita, enquanto a da Microsoft é sobre precisão e consistência em um conjunto definido de cinco idiomas. Nenhum dos dois fornecedores publicou um benchmark que outro laboratório possa executar e verificar.
É na edição que mora o premium
O que separa os dois é a edição, e este é o único eixo com evidências independentes. O MAI-Image-2.5-Pro está em n.º 1 na Artificial Analysis Image Editing Arena com Elo 1.272 (~6.100 votos cegos), à frente de Reve 2.1, MAI-Image-2.5 e GPT Image 2. No mesmo ranking, o mais novo Qwen-Image-3.0-Pro está em 1.249 — uma pontuação competitiva, 23 Elo atrás, e notável para um modelo que só chegou à API internacional este mês.
Além do modelo base, o portfólio de edição da Alibaba é um conjunto de truques especializados em vez de uma única joia: restauração de pinturas antigas, geração de panoramas, esboço para PPT e storyboard de múltiplas tomadas. O da Microsoft é uma aposta mais restrita e profunda — edições precisas e cirúrgicas que mantêm o restante do quadro consistente (substituição de objetos, alterações de layout, atualizações de texto na imagem, limpeza de desfoque), a classe de edição em que modelos mais antigos regeneram a cena inteira e perdem o sujeito. Para um fluxo de trabalho que é “pegue este ativo existente, mude uma coisa, envie-o”, o nº 1 independente do nível Pro é o sinal mais forte; para um apanhado de formatos de edição criativa, a lista da Qwen é mais ampla.

O contraste da especificação
• Preço — ~US$ 108,50 por 1 mil imagens (1024×1024, conversão AA) vs ~US$ 25–30 por 1 mil imagens (cotação da Alibaba vs tarifa listada pela AA)br />• Lançamento — 23 de julho de 2026 (pré-visualização pública, Foundry) vs 21 de julho de 2026, API internacional em 4 de ago.br />• Entrada de texto — 32.000 tokens, contexto de 131k vs janela de prompt de 4.500 tokensbr />• Teto de saída — ~1.048.576 pixels (~1K) vs até 2048×2048br />• Imagens por chamada — saída única por solicitação vs até seis imagens por chamadabr />• Ranking de edição — N.º 1, Elo 1.272 (AA) vs 1.249 para Qwen-Image-3.0-Pro no mesmo rankingbr />• Procedência — alegação da Microsoft de "sem destilação de modelos de terceiros" vs rótulo de procedência AIGC nas saídasbr />• Pesos — fechados, somente API vs fechados, somente API
O teto de saída e a contagem por chamada importam mais do que parecem. {{1}}Qwen-Image 3.0{{/1}} pode renderizar uma imagem de 2048×2048 e retornar até seis imagens por chamada, um recurso de economia em lote; o nível Pro chega perto de 1K e retorna uma única saída por solicitação. {{2}}Se o seu briefing é "me dê uma variedade de seis fotos de produto", o modelo da Alibaba é feito para isso e o modelo da Microsoft não é.{{/2}}

Quando o prêmio se paga por si só.
A regra de decisão é sobre para que servem as imagens, não sobre qual modelo é "melhor."
• Pague o preço premium pelo MAI-Image-2.5-Pro quando a saída for um ativo hero — um visual de produto, um pôster, um keyframe, uma imagem que vai para uma campanha e não será regenerada cinquenta vezes. O ranking de edição nº 1 e a alegação de consistência de personagens importam mais quando uma edição precisa estar certa na primeira vez.
• Compre em volume com Qwen-Image 3.0 quando a saída for descartável ou de alta contagem — variantes de anúncios localizadas, arte provisória, decks de rascunho para PPT, quadros de storyboard, qualquer coisa em que você vai regenerar em vez de refinar. A $25–30 por 1k, uma geração falha custa um erro de arredondamento; a $108.50 por 1k, não custa.
Existe um meio-termo que vale nomear: para trabalho denso e multilíngue de texto em imagem — um mock de landing page com conteúdo em japonês e espanhol, um infográfico com fórmulas — a legibilidade de 10px do Qwen e seus doze idiomas são a melhor opção no papel, e por um quarto do preço. O contra-argumento do modelo da Microsoft é sua alegação de 96,8% de precisão em cinco idiomas, mas essa alegação não é verificada, e um comprador escolhendo entre duas alegações de texto não verificadas provavelmente deveria ponderar o preço.

A camada de roteamento, quando se aplica
Nenhum dos dois modelos está acessível pelo OrcaRouter ainda — o Qwen-Image 3.0 está na API da própria Alibaba (Alibaba Cloud Bailian e a plataforma Qwen) e em várias plataformas de terceiros, e o MAI-Image-2.5-Pro está no Microsoft Foundry — portanto, uma comparação honesta deixa claro que nenhum dos dois está disponível conosco hoje. Quando qualquer um deles se tornar disponível por meio de um provedor hospedado chamável, a lógica de repasse se aplica: margem de 0% sobre o preço de tabela do provedor, então a tabela de preços do fornecedor é o que você paga, e um desconto de lançamento ou redução de preço chega à sua fatura no mesmo dia em que é anunciado. O argumento do failover é a outra metade: o Qwen-Image 3.0 é uma API internacional lançada há poucas semanas, o tipo de modelo para o qual você roteia uma parcela do tráfego enquanto um fallback comprovado absorve os casos extremos — que é exatamente o cenário para o qual uma camada de roteamento foi projetada.
O veredito
Qwen-Image 3.0 e MAI-Image-2.5-Pro não são o mesmo produto com preços diferentes; são produtos diferentes que por acaso têm preços distintos. O modelo da Microsoft leva a coroa na edição, possui uma janela de contexto maior e faz uma alegação não verificada de precisão em cinco idiomas — para ativos de destaque e edições cirúrgicas, o preço premium é defensável. O modelo da Alibaba renderiza mais sistemas de escrita de forma legível, aceita briefings mais densos por geração em seus próprios termos, gera imagens maiores e em lotes de seis, e custa um quarto do preço — para trabalho em volume e texto-em-imagem multilíngue, é a escolha economicamente racional. Compre o premium onde a imagem é o produto; compre o volume onde a imagem é inventário.
