
MAI-Image-2.5-Pro vs Grok Imagine Image 2.0: Duas apostas focadas em edição para geração de imagens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
Dois dos modelos de imagem mais interessantes do ano concordam com a grande ideia: edição é o futuro, geração é o pré-requisito. MAI-Image-2.5-Pro (Microsoft, em pré-visualização pública na Foundry desde 23 de julho) e Grok Imagine Image 2.0 (xAI, lançado em 7 de agosto como o "Quality Mode" padrão nos aplicativos Grok) ambos se apresentam primeiro como editores. Mas eles construíram ferramentas diferentes para provar isso. O modelo da Microsoft é um motor de qualidade — edições cirúrgicas, que preservam a consistência, respaldadas pelo 1º lugar no Artificial Analysis Image Editing Arena. O modelo da xAI é um ambiente de edição — um conjunto de ferramentas voltadas ao usuário (Magic Wand, segmentação, remoção de fundo, Smart Resize) montado em torno de um gerador que figura entre o 2º e o 3º lugar na outra grande arena. Um é medido pela fidelidade; o outro, pelo fluxo de trabalho. Essa é a diferença real entre eles.
Os conjuntos de ferramentas de edição não têm o mesmo formato.
• MAI-Image-2.5-Pro — um mecanismo, não uma caixa de ferramentas. Você fornece a instrução e a imagem; ele executa edições precisas e cirúrgicas — substituição direcionada de objetos, alterações de layout, atualizações de texto na imagem, limpeza de artefatos — mantendo a identidade do sujeito, a iluminação e a textura consistentes ao longo das iterações. A alegação da Microsoft de 94% de consistência de personagens em várias imagens (relatada pelo fornecedor) é toda a proposta: mude uma coisa, mantenha todo o resto.
• Grok Imagine Image 2.0 — um ambiente. Ele inclui Magic Wand (editar apenas uma região selecionada), Segmentation (recolorir ou substituir áreas precisas), remoção de fundo, entrada com múltiplas referências (até 5 imagens nos aplicativos para consumidores, 3 na API), Smart Resize (recompor uma imagem em nove proporções) e Templates para fotografia de produtos, retratos, e-commerce, ativos para jogos e pôsteres de marketing.
Leia essa lista e o posicionamento fica claro: MAI-Image-2.5-Pro é o modelo para o qual um desenvolvedor aponta uma API; Grok Imagine Image 2.0 é o modelo no qual uma pessoa trabalha dentro de uma UI. A xAI o chamou de "ambiente de edição" no lançamento, e o conjunto de ferramentas é exatamente isso.
Onde cada um se classifica
• MAI-Image-2.5-Pro — Nº 1 na Artificial Analysis Image Editing Arena (Elo 1.272, ~6.100 votos cegos); Nº 7 em texto-para-imagem (Elo 1.292). Pontuação independente baseada em preferência às cegas.
• Grok Imagine Image 2.0 — a alegação de lançamento da xAI era a de que era o nº 2 mundial no ranking de texto-para-imagem do Arena, atrás do GPT Image 2; no snapshot de 10 de agosto, ficou em 3º lugar (Elo 1.316), atrás do GPT Image 2 (1.381) e do mais recente MAI-Image-2.6 da Microsoft (1.336). Essa posição é independente e preliminar, e a alegação da xAI de "nº 2 mundial" deve ser rotulada pelo que é: uma afirmativa de lançamento feita pelo fornecedor, que o ranking ao vivo desde então revisou.
Nenhum modelo lidera no território do outro, e nenhum ocupa o topo do quadro principal do outro. A forma mais simples de interpretar: o modelo da Microsoft domina a pontuação de edição, o modelo da xAI domina as ferramentas e fica perto do topo em geração.

Renderização de texto, o recurso decisivo
O texto dentro da imagem é onde os dois mais divergem, e onde a evidência independente é unilateral. A Microsoft afirma 96,8% de precisão na renderização de texto para o MAI-Image-2.5-Pro em inglês, chinês, japonês, coreano e espanhol — relatado pelo fornecedor, não verificado e acompanhado de um limite de saída em megapixels, mas é uma capacidade real declarada com cobertura multilíngue. Os resultados de testes independentes do Grok Imagine Image 2.0, publicados pela própria avaliação da OrcaRouter do modelo contra o GPT Image 2, constataram que ele renderiza texto CJK de forma não confiável — em um teste, ele renderizou chinês tradicional quando solicitado o simplificado em um título de pôster de filme, um desqualificador definitivo para trabalhos de anúncios localizados. Para qualquer fluxo de trabalho com uma palavra legível na imagem, o MAI-Image-2.5-Pro é a aposta mais segura no papel; a qualidade de texto do Grok precisa ser testada no seu próprio material antes de você confiar nela.
Preço
• MAI-Image-2.5-Pro — token-metered: $5 per million text-input, $8 per million image-input, $106 per million image-output tokens. Artificial Analysis's conversion puts a 1024×1024 image near $108.50 per 1,000.
• Grok Imagine Image 2.0 — preço fixo por imagem, sem tokens: $0,05 por imagem em 1K ou 2K para o nível de qualidade (`grok-imagine-image-quality`), $0,02 para o nível padrão, com edições cobrando tanto a entrada quanto a saída. Em 1K, isso é $50 por 1.000 imagens de qualidade — aproximadamente metade do valor por 1k do MAI-Image-2.5-Pro, com um custo fixo que não varia com o tamanho do prompt.
Os modelos de preços são filosoficamente diferentes. A medição por tokens da Microsoft penaliza prompts longos e saídas grandes; a taxa fixa por imagem da xAI é previsível e independente do tamanho do prompt. Em volume significativo, a taxa fixa é mais fácil de prever, e o preço do nível de qualidade é mais barato que o do MAI-Image-2.5-Pro.

Disponibilidade e o ângulo de roteamento
Ambos são acessíveis, mas por portas diferentes. MAI-Image-2.5-Pro é uma prévia do Microsoft Foundry e também está disponível no MAI Playground — você precisa de uma conta Microsoft e a tabela de preços da prévia se aplica. O Grok Imagine Image 2.0 foi lançado nos aplicativos de consumo da xAI em 7 de agosto e seu nível de qualidade pode ser invocado através da Imagine API da xAI; ele também está disponível no endpoint compatível com OpenAI da OrcaRouter desde meados de agosto, onde o nível padrão e o nível de qualidade ficam atrás de uma única chave, com os preços do provedor repassados com margem de 0% e failover automático para um fallback como o GPT Image 2.
A diferença prática que isso faz: adotar o Grok Imagine Image 2.0 em um pipeline de produção é uma alteração na string do modelo em um endpoint que você talvez já use, com tarifa fixa barata e fallback integrado para os casos em que ele falha — exatamente o modo de falha que a camada de roteamento existe para capturar. Adotar o MAI-Image-2.5-Pro significa contratar diretamente com a Foundry por enquanto, e a nota honesta sobre o roteamento é a mesma de um mês atrás: quando a prévia da Microsoft puder ser amplamente chamada por meio de uma API de terceiros, é quando o mesmo padrão de chave única se abre para ele.

O veredito
Escolha o MAI-Image-2.5-Pro quando o seu trabalho for uma edição de alta fidelidade de uma imagem existente e o resultado tiver que se sustentar — é o editor independente #1 na Artificial Analysis, apresenta uma afirmação real de renderização de texto multilíngue e tem um preço à altura. Escolha o Grok Imagine Image 2.0 quando você quiser um fluxo de edição com ferramentas reais, um preço fixo fácil de prever e cerca de metade do custo por imagem, além de um modelo que você pode rotear hoje com um fallback. A leitura honesta não é "qual é melhor" — é qual aposta combina com o seu fluxo de trabalho: a Microsoft está apostando que a fidelidade vence na edição, e a xAI está apostando que o conjunto de ferramentas conquista o usuário. Ambas são defensáveis; os seus requisitos de qualidade de saída e a sua tolerância ao risco de renderização de texto são o que desempata.
