
Ideogram 4.5 vs GPT Image 2.5: O próprio Ideogram escolheu essa briga
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 261 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A maioria das comparações de modelos é montada por quem as escreve. Esta foi montada pelo Ideogram. A página de lançamento do Ideogram 4.5, no ar desde 30 de setembro de 2026, traz uma demonstração de edição lado a lado e nomeia seus oponentes na legenda: "as mesmas edições no Ideogram 4.5 vs. GPT Image 2.5 Sunburst, Nano Banana Pro e Nano Banana 2." Em seguida, faz uma afirmação sobre o que o espectador verá — "as saídas do GPT Image e do Nano Banana se tornam inutilizáveis após algumas edições, enquanto o Ideogram 4.5 permanece limpo edição após edição."
Isso é incomumente direto. O fato de um fornecedor escolher o alvo do benchmark e lhe informar o resultado de antemão merece ser levado a sério em um sentido e encarado com ceticismo em outro. GPT Image 2.5 é o mais forte nos rankings independentes nas duas categorias de imagem, então é o oponente certo a ter escolhido. E é um lançamento com dois identificadores — Flare e Sunburst, ambos lançados em 8 de setembro de 2026 — com pontuações públicas na arena que o Ideogram 4.5 atualmente não iguala. A pergunta interessante não é quem vence a arena. É se a alegação do Ideogram está medindo algo que a arena não mede.
Onde os dois modelos se situam, com precisão
• Ideogram 2.0 — lançado em 30 de setembro de 2026. Modelo de edição precisa: geração e edição em quatro velocidades; 2K nativo; edições demonstradas em resolução de até 4.016 × 6.016 (24,2 MP). Texto para imagem: 34º de 167 com 1.014 ± 11 Elo (2.247 votos); edição de imagem: 23º com 1.064 ± 11 Elo (2.382 votos). US$ 0,03–US$ 0,22 por imagem, conforme a configuração de velocidade.
• GPT Image 2.5 Sunburst — lançado em 8 de setembro de 2026 como a metade com foco em precisão da atualização de imagem dividida da OpenAI, identificador de API gpt-image-2.5-sunburst. Texto para imagem N.º 1 com 1.197 ± 9 Elo (14.023 votos); edição de imagem N.º 1 com 1.182 ± 8 Elo (17.899 votos). Preço de US$ 210,70 por 1.000 imagens na conversão do ranking.
• GPT Image 2.5 Flare — a metade rápida do mesmo lançamento, identificador gpt-image-2.5-flare. Nº 2 nos dois rankings: 1.190 texto para imagem, 1.162 edição. Mesmos US$ 210,70 por 1.000.
Coloque os dois números de edição lado a lado e a diferença é de 118 Elo — 1.182 contra 1.064 — com intervalos de confiança de ±8 e ±11. Os intervalos não se sobrepõem. No ranking que mede a preferência por edição em disparo único, o Sunburst vence, e vence com cerca de sete vezes e meia o número de votos por trás.
O que a tabela de classificação mede e o que não mede
Esta é a parte que decide se a alegação do Ideogram resiste ao contato com as evidências.
A arena de edição da Artificial Analysis é preferência humana pareada cega: os votantes veem a mesma imagem de origem e a mesma instrução, recebem dois resultados editados sem rótulos e escolhem o melhor. É um método forte para "qual destas duas saídas parece mais com o que a instrução pediu".
Ele não consegue medir aquilo que a Ideogram está anunciando. Um votante que julga uma única edição não consegue ver se o modelo alterou discretamente o papel de parede, deslocou um rosto em dois milímetros ou renderizou novamente o grão no restante do quadro. A falha que a Ideogram afirma corrigir só se torna visível ao longo de uma sequência — rodada quatro, rodada sete, rodada dez — e nenhuma arena convencional apresenta sequências aos votantes. Uma pontuação Elo de 1.064 diz que as edições individuais da Ideogram são boas. Não diz absolutamente nada sobre se elas continuam boas.
Isso corta para os dois lados no caso da Ideogram, e a versão honesta é esta: o ranking não confirma a alegação de drift, e também não a refuta. O que ele refuta é a alegação implícita mais forte que um leitor poderia tirar da página de lançamento — de que o 4.5 é o melhor editor, ponto final. Em relação ao ranking, ele é o editor de classificação mais baixa por uma margem maior do que suas barras de erro.

O que cada um faz que o outro não faz
• Edição com resolução da fonte — A afirmação de engenharia que distingue o Ideia 4.5. A sua página mostra uma edição aplicada a uma fonte de 4.016 × 6.016 sem redução de escala, com a promessa de que o limite da edição é suficientemente preciso para voltar a unir o recorte ao original. Para trabalhos de impressão, essa é a diferença entre um resultado entregável e um compromisso.
• Amplitude da superfície de parâmetros — da GPT Image 2.5. A OpenAI adicionou xhigh e max à escala de qualidade e tornou os fundos transparentes um parâmetro de primeira classe, com background definido como transparent, opaque ou auto e saída em PNG ou WebP. A saída transparente era uma lacuna no GPT Image 2 e se tornou um recurso de destaque no par 2.5.
• Faixa rápida — O Flare existe especificamente para ser o padrão rápido. A OpenAI afirma ter até 50% menos latência que a geração anterior; o Sunburst é deliberadamente mais lento e voltado para edições que precisam resistir a escrutínio.
• Estrutura de preços — O Ideogram cobra por imagem com base na velocidade de renderização (US$ 0,03 a US$ 0,22). A OpenAI cobra por tokens, na mesma tabela de preços do GPT Image 2 — US$ 8 por milhão de tokens de entrada de imagem, US$ 30 por milhão de tokens de saída de imagem — e é por isso que a conversão independente por imagem fica próxima de US$ 0,21 para uma imagem de alta qualidade de 1024 × 1024.
As linhas de preço se cruzam em um ponto incômodo. Nas configurações Low e Medium do Ideogram 4.5, ele é drasticamente mais barato por imagem do que o par da OpenAI. No High — que é onde está a demonstração de drift, e onde você rodaria uma fonte de 24 megapixels — os dois ficam próximos do mesmo número. A comparação que a maioria dos compradores realmente fará é Ideogram 4.5 de alta qualidade contra Sunburst de alta qualidade, e, nessa comparação, o preço é praticamente um empate, com um déficit de 118 Elo no ranking medido.
O que é aceitável, se a alegação de deriva for real. É toda a aposta.


A diferença de acessibilidade que ninguém divulga
Uma assimetria prática corre na direção oposta à do placar. Os dois identificadores do GPT Image 2.5 são mais recentes do que qualquer coisa no catálogo do OrcaRouter — nossa linha de imagens da OpenAI hoje é o GPT-Image-1.5 a US$ 8/US$ 32 por milhão de tokens e o GPT-Image-2 a US$ 8/US$ 30, ambos a preço de tabela do provedor, sem margem acrescentada. O par 2.5 chegou à tabela de preços da OpenAI pelo mesmo US$ 8/US$ 30 do GPT-Image-2, o que significa que, no momento em que forem roteáveis, eles entram pelo mesmo preço de repasse, e não por um novo — e a questão de custo entre eles passa a ser sobre eficiência de tokens, e não sobre qual fornecedor você aciona.
O Ideogram 4.5 está na própria API da Ideogram e em plataformas parceiras. Não está no nosso catálogo. Isso importa para a comparação de uma forma trivial: um desses dois modelos é um substituto direto para um cliente compatível com a OpenAI, e o outro é uma nova integração. Se você já chama o GPT-Image-2 por um endpoint no formato da OpenAI, o custo de experimentar o Sunburst é uma mudança no ID do modelo; o custo de experimentar o Ideogram 4.5 é um segundo contrato e um segundo cliente, antes mesmo de você chegar a avaliar a qualidade.
Uma camada de roteamento não remove essa diferença — apenas remove a complexidade do lado que já é compatível e permite que você direcione uma fração do tráfego para um novo participante sem comprometer um caminho de produção com ele. O failover é mais importante do que o habitual aqui, porque aquilo que você estaria testando é um modelo cuja alegação central não tem verificação independente e cujos tamanhos de amostra são um quinto dos do seu concorrente.
Como resolvê-lo
Não faça esta comparação em imagens isoladas. Esse é o método da arena e é o instrumento errado — ele vai lhe dizer que o Sunburst vence, o que você já sabia.
Execute isso em sequências. Pegue cinco ou dez imagens do seu próprio trabalho, escreva a mesma cadeia de seis ou oito edições progressivas e execute a cadeia idêntica no Ideogram 4.5 (High) e no Sunburst (max). Em seguida, compare a primeira com a oitava rodada de cada modelo, nas regiões que você nunca pediu ao modelo para tocar. Conte os pixels que se moveram. Esse número — divergência em regiões não alteradas ao longo de uma sequência — é o que o Ideogram está alegando vencer e, pelo que eu saiba, ninguém publica isso para nenhum dos dois modelos.
Então, precifique ambas as execuções por sequência finalizada. Nesse ponto, você terá uma resposta que vale mais do que 118 Elo, porque ela será sobre as suas imagens, e não sobre as de um painel de votantes.
O que este confronto realmente é
O Ideogram 4.5 não entrou num concurso que vence nos rankings, e parece saber disso — é por isso que a página de lançamento demonstra um comportamento em vez de imprimir uma classificação. O comportamento que demonstra é real o suficiente para valer a pena testar e específico o suficiente para ser falsificável: ou as edições repetidas se mantêm coerentes, ou não, e um teste de dez turnos nos seus próprios ficheiros resolve a questão numa tarde.
A leitura razoável hoje é que o GPT Image 2.5 Sunburst é o melhor editor pela única medida independente que existe, por uma margem fora das barras de erro, com muito mais evidências por trás do número — e que o Ideogram 4.5 está vendendo uma propriedade mais estreita e não medida a um preço que é mais barato em configurações baixas e praticamente igual na configuração da qual sua alegação depende. Se a fidelidade multiturno é o seu gargalo de produção, o teste é barato e o modelo merece esse teste. Se não for, o placar já respondeu.
