Cartão de título principal para o Grok Imagine Image 2.0 com os dizeres 'Grok Imagine Image 2.0 — #2 na Arena text-to-image, edição de precisão, agora disponível nos aplicativos Grok' com a linha de legenda 'Anunciado em 7 de agosto de 2026 pela xAI' e um ícone de edição plano de moldura com caneta.
Guides & Insights

Grok Imagine Image 2.0: #4 no Artificial Analysis, por um terço do preço

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Grok Imagine Image 2.0 chegou ao 4º lugar no Text to Image Leaderboard da Artificial Analysis, e o número que importa não é a posição — é o preço ao lado dela. O modelo está com 1.153,66 Elo, atrás de três entradas: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) e GPT Image 2 (high). À frente de todos os modelos dos outros laboratórios, incluindo o MAI-Image-2.6 da Microsoft e o modelo Nano Banana 2. Isso deixa o modelo como o gerador de imagens mais bem colocado fora desse trio, e o mais barato entre os quatro primeiros com grande folga: a Artificial Analysis o precifica em US$ 60 por 1.000 imagens, contra cerca de US$ 211 para as três entradas acima dele. O modelo em si é de 7 de agosto de 2026 — o que mudou é onde o painel independente o coloca, e o que isso faz com o enquadramento de "nº 2 do mundo" que o criador usou no lançamento.

O que a colocação #4 realmente mede

O Text to Image Leaderboard da Artificial Analysis é uma arena cega de preferência humana: os votantes veem resultados do mesmo prompt sem rótulos de modelo e escolhem o melhor, e o Elo resultante é publicado de forma independente de qualquer fornecedor. A entrada do Grok Imagine Image 2.0 aparece em #4 com 1.153,66 de Elo, com um intervalo de confiança de 95% de 1.141,66 a 1.165,66. Nada desse número vem da xAI. (Um detalhe administrativo que vale a pena saber quando você consulta o quadro: a Artificial Analysis lista o criador do modelo como SpaceXAI.)

A metade do preço da história é a metade mais interessante. A mesma página traça qualidade em função do preço com uma linha de Pareto que marca os modelos que oferecem o maior retorno de Elo por dólar e, segundo os próprios números publicados pelo ranking, o Grok Imagine Image 2.0 é o modelo de maior pontuação com preço abaixo de US$ 100 por 1.000 imagens. O próximo modelo acima dele em qualidade, GPT Image 2 (high), custa US$ 211 por 1.000 — cerca de três vezes e meia esse valor por aproximadamente 17 Elo a mais. Essa é uma alegação de preço-desempenho, não uma alegação de ser o melhor modelo, e é a versão da história que os dados independentes de fato sustentam.

A posição de fronteira é real, mas estreita, e vale a pena dizê-lo claramente. O MAI-Image-2.6 da Microsoft fica uma posição abaixo, a US$ 38,90 por 1.000, e o Muse Image da Meta custa US$ 10 por 1.000 com 1.111 de Elo. Os intervalos de Elo neste quadro variam cerca de ±12 pontos, então #4 e #5 — separados por 6,5 de Elo — estão dentro das barras de erro um do outro. Trate a colocação como "top five", não como uma posição consolidada.

A subida de 14 posições é a diferença para o nível que o Grok Imagine Image 2.0 substituiu. O nível de qualidade anterior da xAI, grok-imagine-image-quality, está em #18 no mesmo ranking, com 1.043,21 Elo, e o grok-imagine-image original está em #29, com 1.017,86. Isso representa aproximadamente 110 Elo e 14 posições de ranking entre o modelo que a xAI agora documenta como seu padrão de imagem e aquele que ele substitui.

Onde a alegação do "mundo #2" se encontra agora

No lançamento, a xAI citou um 2º lugar tanto no ranking de texto para imagem quanto no de edição de imagens da Arena, com cerca de 1.320 de Elo e marcado como Preliminar. Esses eram números que a xAI destacou em seu próprio anúncio — não uma avaliação independente que ela encomendou — e eles mudaram desde então: o snapshot de 10 de agosto colocou o modelo em 3º lugar, com 1.316 de Elo, atrás do MAI-Image-2.6 e do GPT Image 2. O 2º lugar em edição de imagens continua sendo uma citação da própria xAI.

Artificial Analysis é um ranking diferente, com um método diferente e um grupo diferente de votantes, e agora coloca o modelo em 4º lugar. Os dois não se contradizem de verdade — eles capturam a preferência humana de maneiras diferentes, e ambos são retratos momentâneos de rankings que mudam de semana para semana. O resumo honesto de seis semanas de classificação independente é que o Grok Imagine Image 2.0 está consistentemente entre os cinco primeiros e nunca chega a ser exatamente o 2º lugar anunciado pela xAI.

O que o Grok Imagine Image 2.0 realmente entrega

A xAI posiciona o Grok Imagine Image 2.0 como um ambiente de edição, e não como mais um gerador de uso único. O conjunto de recursos:

Magic Wand — edições em nível de região que deixam o restante do quadro intocado

Segmentação — seleção precisa de região para gradação de cor, substituição ou ajuste

Remoção de fundo — exportação do objeto com fundo transparente

Entrada com várias imagens — até cinco imagens de origem por edição; a documentação da xAI agora lista cinco, acima das três que a API limitava no lançamento

Smart Resize — recompõe uma imagem em 9 proporções de aspecto (de 1:2 na vertical a 2:1 na horizontal), criando novo conteúdo de quadro em vez de recortar

Modelos — fluxos de trabalho predefinidos para fotografia de produtos, retratos, anúncios de e-commerce, recursos para jogos e pôsteres de marketing

A API expõe controles que o app do consumidor não disponibiliza: proporção de aspecto — incluindo 21:9 e 5:2, ambos novos na 2.0 —, resolução (1K por padrão, 2K opcional) e um parâmetro de qualidade que aceita low, medium ou auto. Do lado do consumidor, o modelo vem como o Quality Mode padrão no grok.com/imagine, no iOS e no Android, e desde 13 de agosto também está listado na plataforma da Runway, onde se juntou aos modelos de imagem e vídeo que a Runway já hospeda. Essa listagem é uma declaração de fornecedor e parceiro, e não uma avaliação independente, mas foi o primeiro sinal de distribuição por terceiros após o lançamento.

Sobre a renderização de texto em títulos, a xAI diz que o modelo "planeja tipografia e layout como um designer faria", mantendo composições densas de várias partes intactas e renderizando texto pequeno com nitidez. Ele também preserva a identidade e as configurações de um sujeito em edições iterativas de múltiplas rodadas.

O que um primeiro teste independente constatou

Uma comparação de seis prompts, com uma única seed e sem escolher a dedo, contra o gpt-image-2, revelou uma divisão clara, e nada na nova posição no ranking a reverte.

Grok vence: fotorrealismo e retenção de identidade. A anatomia das mãos no retrato estava correta, com detalhes de pele em nível de poros, dispersão subsuperficial e catchlight e luz de contorno naturais. Em uma tarefa de rotação geométrica de 45 graus, o Grok manteve a identidade facial acima do limiar de 0,5 do ArcFace, enquanto o gpt-image-2 se desviou mais.

Grok perde: áreas críticas de produção. Quando solicitado a criar um título de pôster de filme em chinês simplificado, ele gerou caracteres do chinês tradicional — considerado um "desqualificador rígido" para pipelines de localização e publicação. Uma solicitação de fusão de estilo aquarela retornou uma imagem fotorrealista com apenas uma leve passada de textura pictórica — uma "desqualificação em nível de categoria". As edições locais concluíram as três solicitações, mas não preservaram a vista da janela e ancoraram incorretamente um destaque.

Resumo: Grok Imagine Image 2.0 "lidera em fotorrealismo e identidade, e fica atrás em confiabilidade de edição, texto multilíngue e transferência de estilo verdadeira." Uma tabela de classificação calcula a média de preferência em milhares de comparações cegas; ela não consegue dizer se o modelo acertará sua manchete em chinês. Um teste de seis prompts também não é um corpo de evidências — mas, entre os dois, a falha específica é o sinal mais acionável para uma equipe que entrega ativos localizados.

A API e a matemática de preços

A narrativa para desenvolvedores mudou desde o lançamento. O grok-imagine-image-2.0 é agora o modelo que a xAI documenta para geração de imagens, edição de imagem única e edição de várias imagens, e é o que a própria página de modelos da xAI recomenda para imagens. A frase "acesso à API para desenvolvedores em breve", da época do lançamento, desapareceu das páginas de modelos e de preços do fornecedor.

• grok-imagine-image-2.0: a partir de $0,04 por imagem, cobrado pela qualidade efetivamente entregue

• grok-imagine-image (1.0): $0.02 por imagem, não afetado pela alteração abaixo

• grok-imagine-image-quality: $0.05 por imagem, será descontinuado em 2 de novembro de 2026

A qualidade é a alavanca sobre o custo. O Auto — o padrão quando o parâmetro é omitido — atualmente atende low para geração e medium para edição, então uma solicitação de geração é cobrada na tarifa low e uma edição na medium. Fixar low ou medium torna a fatura previsível em vez de depender de qual caminho o serviço escolhe.

Esse último item traz um prazo. O guia de migração da xAI diz que o slug grok-imagine-image-quality é desativado em 2 de novembro de 2026, após um aviso de 60 dias que começou em 2 de setembro. A partir dessa data, o slug continua resolvendo, mas as solicitações são atendidas por grok-imagine-image-2.0 com quality definido como low — um redirecionamento de compatibilidade, não um desligamento definitivo. Como o nível low é US$ 0,01 por imagem mais barato do que o antigo nível de qualidade em todas as resoluções, equipes que não mudarem nada verão uma queda de preço e uma mudança silenciosa na qualidade da saída. Migrar deliberadamente, nomeando grok-imagine-image-2.0 e fixando quality onde a saída estável importa, é a versão que você quer. Essa data e o comportamento de redirecionamento constam na própria documentação da xAI — informado pelo fornecedor, não testado de forma independente.

Frente às opções da OpenAI, a comparação é tanto uma diferença de modelo de precificação quanto uma diferença de preço. O gpt-image-2 é precificado por token — $8 por milhão de tokens de entrada de imagem e $30 por milhão de tokens de saída de imagem, segundo as tarifas publicadas da OpenAI — portanto, o custo por imagem varia com a resolução e o detalhe. O número representativo da Artificial Analysis de $211 por 1.000 imagens para o GPT Image 2 (high) contra os $60 do Grok é essa variação se manifestando como um único número. O preço fixo por imagem é muito mais fácil de prever em escala, o que explica em grande parte por que um modelo em quarto lugar vale a pena ser considerado.

Testando isso sem apostar o pipeline

A reação razoável ao Grok Imagine Image 2.0 ainda é "experimente, mas não se comprometa ainda". Sua posição fica dentro de intervalos de confiança sobrepostos, um teste independente sinalizou fragilidades reais em texto localizado e transferência de estilo, e a xAI vai desativar um slug subjacente a ele em novembro. É exatamente esse o caso para roteamento em vez de conectar uma integração direta.

Na OrcaRouter, grok-imagine-image — o modelo de imagem da xAI no nosso catálogo — fica no mesmo endpoint compatível com OpenAI que o gpt-image-2, então alternar entre modelos de imagem da xAI e da OpenAI é só mudar a string do modelo: sem segundo contrato, sem SDK novo. A OrcaRouter repassa os preços de tabela dos provedores sem markup, então um corte de preço do fornecedor entra em vigor aqui no mesmo dia, e o failover automático pode enviar erros, limites de taxa ou recusas para um modelo de fallback em vez de para o seu caminho de produção. Uma ressalva honesta, inalterada desde a análise original: o nível de qualidade mais recente da xAI é uma entrada separada do modelo de imagem Grok que já está no nosso catálogo, então confira a lista atual de modelos em vez de presumir que uma determinada variante do Grok pode ser roteada hoje.

O que assistir em seguida

1. A migração de 2 de novembro.Quer as equipes migrem explicitamente para o grok-imagine-image-2.0, quer acabem derivando para o redirecionamento e seu padrão de baixa qualidade, esta é a maior coisa que a xAI ainda pode errar com este modelo — e o redirecionamento torna o erro invisível, a menos que você leia o campo do modelo nas suas respostas.

2. Se o #4 se mantém. A diferença para o MAI-Image-2.6 é de 6,5 Elo com intervalos de ±12 pontos, então alguns milhares de votos a mais poderiam reordenar a classificação em qualquer direção. O ganho de 110 Elo em relação ao nível anterior parece duradouro; a posição exata, não.

3. Quanto da superfície voltada ao consumidor chega à API. Geração, edição e edição com várias imagens estão documentadas. Templates e o fluxo de trabalho nomeado Smart Resize continuam sendo recursos do app, e é nessa lacuna que reside a ressalva restante de "exclusivo para consumidores".

Resumo: o Grok Imagine Image 2.0 é um modelo real e competente que agora foi posicionado de forma independente — nº 4 no Text to Image Leaderboard da Artificial Analysis, a melhor entrada que não é da OpenAI por lá, cerca de 110 Elo à frente do nível que substituiu, e na fronteira de preço-qualidade do ranking, a US$ 60 por 1.000 imagens, contra cerca de US$ 211 dos modelos da OpenAI diretamente acima dele. O enquadramento de "nº 2 do mundo" sempre foi o snapshot de lançamento da xAI, e os rankings independentes nunca chegaram a dizer isso. Suas duas fraquezas independentes mais evidentes — conformidade com chinês simplificado e confiabilidade de transferência de estilo — estão em recursos que as equipes mais frequentemente precisam que uma API de imagem ofereça. Teste-o imediatamente para trabalhos fotorrealistas com preservação de identidade; deixe para depois para pipelines que entregam texto localizado ou assets estilizados, e, se você já está chamando o slug de qualidade que está sendo descontinuado, migre antes de 2 de novembro.