Um cartão de título em destaque para a comparação {{1}}'GPT-Image-2.5 vs LLaDA-Image'{{/1}} com o subtítulo {{2}}'Uma API de US$ 30/M-token contra um modelo de difusão gratuito de 6B'{{/2}}, mostrando um cartão arredondado à esquerda rotulado como {{3}}'GPT-Image-2.5 · API FLAGSHIP FECHADA — medida por token, hospedada'{{/3}} e um cartão arredondado à direita rotulado como {{4}}'LLaDA-Image · PESOS ABERTOS — auto-hospedado, cartão Apache-2.0'{{/4}}, unidos por um ícone de balança; o logotipo da OrcaRouter fica no canto inferior direito.
Guides & Insights

GPT-Image-2.5 vs LLaDA-Image: Uma API de US$ 30/M-token contra um Modelo de Difusão Gratuito de 6B

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Pergunte quanto deve custar a geração de imagens e dois laboratórios construíram as duas respostas opostas com uma semana de diferença. Em 8 de setembro de 2026, a OpenAI lançou o GPT-Image-2.5 — o modelo por trás do ChatGPT Images 2.5, vendido via API como GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst — com preço definido em um card de tokens de US$ 8 por milhão de tokens de entrada de imagem e US$ 30 por milhão de tokens de saída de imagem. Cinco dias antes, em 4 de setembro, a inclusionAI (o laboratório apoiado pelo Ant Group por trás da família de linguagem LLaDA) lançou discretamente o LLaDA-Image, um gerador e editor de imagens diffusion-transformer de seis bilhões de parâmetros cujos pesos podem ser baixados gratuitamente. Um é o modelo de imagem comercialmente mais poderoso que a OpenAI já colocou atrás de um medidor de tokens; o outro é uma tentativa de provar que um modelo de imagem forte pode ser construído com uma receita de treinamento aberta e distribuído gratuitamente. Compará-los é menos um confronto direto do que uma decisão sobre qual definição de custo você está realmente pagando.

Quase todos os números do lado do GPT-Image-2.5 são relatados pelo fornecedor e nenhum deles tem verificação independente ainda: a OpenAI afirma que o Flare reduz a latência em até 50% em comparação com o GPT-Image-2 e que testes de terceiros realizados pela empresa de agentes Manus mediram geração de 2 a 4 vezes mais rápida, mas, em 9 de setembro de 2026, nenhum dos modelos GPT-Image-2.5 tem entrada nos leaderboards de imagens do Artificial Analysis. O número principal do LLaDA-Image é igualmente não reproduzido — a inclusionAI relata 53,53 em inglês / 53,38 em chinês no Qwen-Image-Bench, primeiro entre os modelos de pesos abertos no lançamento — e, como o modelo não tem API hospedada, ele não pode aparecer em leaderboards somente de API. Ambos os lados desta comparação estão baseados nas próprias afirmações de seus criadores, o que vale a pena ter em mente ao longo do restante deste artigo.

Dois modelos que mal compartilham uma categoria

GPT-Image-2.5 é um modelo de imagem fechado e hospedado na mesma linhagem do ChatGPT Images 2.0 de abril de 2026. É multimodal na entrada e produz imagens que a OpenAI afirma serem mais nítidas em detalhes finos, mais naturais em iluminação e textura, e mais estáveis em edições de várias etapas — o endpoint Sunburst existe especificamente para trabalhos de produção com muitas edições, onde a geração mais lenta é aceitável em troca de um controle de instrução mais rígido, enquanto o Flare é o padrão rápido para geração de alto volume. As saídas chegam a 2048×2048 e 3840×2160, fundos transparentes são suportados, e cada saída carrega metadados de proveniência C2PA além de uma marca d'água invisível.

LLaDA-Image é um lançamento aberto em estilo de pesquisa, construído sobre uma aposta completamente diferente. Enquanto o GPT-Image-2.5 é servido pela infraestrutura da OpenAI, o LLaDA-Image é um conjunto de pesos que você mesmo executa: um transformer de difusão (DiT) de 6 bilhões de parâmetros no lado da geração — a ficha do modelo registra cerca de 7B de parâmetros quando o lado da linguagem é contabilizado — emparelhado com o LLaDA 2.0-mini, um modelo de linguagem de difusão de mistura de especialistas com 16B totais / 1B ativos, como o lado de "compreensão" que converte prompts de texto ou instruções de edição no sinal que o DiT segue. A alegação incomum no relatório do arXiv (2609.03796) é a receita de treinamento: mais de 90% dos cerca de 220 milhões de amostras acumuladas de pré-treinamento e treinamento intermediário são apenas de imagens, com um modelo de visão-linguagem congelado extraindo semântica de imagens não rotuladas como um sinal de autocondicionamento, de modo que o modelo "aprende primeiro a desenhar, depois a obedecer". A resolução progressiva leva o treinamento de 256×256, passando por 512×512, até o ajuste fino em 1024×1024, seguido por treinamento misto de texto-para-imagem e edição, e uma destilação de poucos passos TwinFlow que produz a variante LLaDA-Image-Turbo.

No que cada um é realmente bom

A proposta do GPT-Image-2.5 é precisão e controle com qualidade comercial. O anúncio da OpenAI enfatiza a fidelidade de referência — manter uma pessoa, animal de estimação ou produto reconhecível ao mudar o cenário ou estilo — e edições que alteram apenas o que você pediu para alterar, mantidas ao longo de várias rodadas de edições em uma única conversa. A renderização de texto dentro de imagens é destacada especificamente, incluindo a eliminação dos caracteres chineses distorcidos que afetavam os modelos de imagem anteriores. Essas são exatamente as capacidades que uma equipe de produto, marca ou publicidade utiliza repetidamente.

A proposta da LLaDA-Image é um único conjunto de pesos que faz geração bilíngue e edição guiada por instruções com uma receita aberta. A inclusionAI relata renderização nativa de texto em chinês e inglês, um caminho de edição que injeta imagens de referência por meio de um design de caminho duplo para preservar o conteúdo não modificado e — no Qwen-Image-Bench — as melhores pontuações de pesos abertos no lançamento. As ressalvas honestas do lançamento são que a qualidade perceptual da edição ainda fica aquém dos editores especializados e a contagem de objetos continua fraca. É um modelo aberto generalista, não um produto comercial acabado.

A two-column comparison scoreboard for 'GPT-Image-2.5 vs LLaDA-Image': GPT-Image-2.5 rows read Access closed API (Flare + Sunburst) / Price $8 in · $30 out per M tokens / Quality evidence OpenAI-reported, no AA entry yet / Editing multi-turn, Sunburst precision / Max resolution 3840x2160 / Serving hosted, Flare faster; LLaDA-Image rows read Access open weights (Apache-2.0 card) / Price $0 weights, you run it / Quality evidence Qwen-Image-Bench 53.53 EN · 53.38 ZH / Editing native instruction editing / Max resolution 1024x1024 / Serving self-host, Base or Turbo; footer 'Both vendor-reported as of Sept 9 2026; no shared benchmark.'; the OrcaRouter logo is bottom-right.

O placar não é deliberadamente uma competição de qualidade de imagem — os dois modelos nunca foram submetidos à mesma avaliação. O que ele mostra é para onde fluem o dinheiro e o controle.

O preço de uma imagem é o número que nenhum dos lados lhe dará.

OpenAI publica uma tabela de preços por token para o GPT-Image-2.5 idêntica à do GPT-Image-2: US$ 8 por milhão de tokens de entrada de imagem, US$ 30 por milhão de tokens de saída de imagem, entrada de imagem em cache a US$ 2 e tokens de texto cobrados separadamente a US$ 5 por milhão. O que ela não publica é quantos tokens uma determinada imagem consome, o que significa que não há preço oficial por imagem nem calculadora de custos. Ao preço listado pela AA para o predecessor em seu ranking — cerca de US$ 211 por 1.000 imagens para o GPT Image 2 na qualidade "alta" — um carro-chefe medido por token é uma ferramenta cara em volume, mas esse número é do GPT-Image-2, não do 2.5, e o custo por imagem do novo modelo é genuinamente desconhecido fora da OpenAI.

LLaDA-Image tem o problema oposto de honestidade. Os pesos não custam nada e o card traz a tag Apache-2.0, mas o preço real é a infraestrutura: um transformer de difusão de 6B precisa de uma GPU séria para a variante Base de 50 passos, e os checkpoints FP8 (cerca de 49 GB em um layout diffusers) são a opção prática para a maioria dos usuários. A destilação de 2–4 passos do LLaDA-Image-Turbo é a concessão a essa realidade. As ferramentas da comunidade avançaram rápido — um pull request do SGLang adiciona suporte a text-to-image, edição, sequence-parallel e FP8, e um pacote de nós ComfyUI da RebelAI oferece suporte a inferência local quantizada em INT8 e GGUF — mas "modelo gratuito" ainda significa "você é o provedor de hospedagem." Para uma equipe que já opera capacidade de GPU, o custo marginal do LLaDA-Image se aproxima de zero; para todos os outros, o custo total de servir o modelo pode exceder as faturas de API medidas quando se inclui o tempo de engenharia.

O caminho honesto se você quiser ambos.

Essas opções não são mutuamente exclusivas para a maioria das equipes. Um pipeline de produção pode usar uma API hospedada, como a GPT-Image-2.5, para o trabalho voltado ao cliente, intensivo em edições e que não pode falhar, e manter um modelo aberto, como a LLaDA-Image, para experimentos, tarefas em lote offline e qualquer coisa que não possa enviar prompts a terceiros. Essa divisão é exatamente o tipo de problema que uma camada de roteamento resolve: uma única API que acessa os modelos hospedados que você realmente usa, com o preço de tabela do provedor repassado sem nenhum acréscimo, para que, mais tarde, testar um modelo de pesos abertos por uma rota hospedada custe o mesmo que ir diretamente ao provedor. Nenhum dos dois modelos está no catálogo do OrcaRouter em 9 de setembro de 2026: a GPT-Image-2.5 está disponível apenas via OpenAI API por enquanto (a geração anterior, a GPT-Image-2, é roteada), e a LLaDA-Image é apenas pesos, sem inferência hospedada. A intenção do design permanece independentemente do catálogo atual.

Screenshot of the Artificial Analysis text-to-image leaderboard captured September 9 2026: GPT Image 2 (high) is ranked first at Elo 1,178, followed by MAI-Image-2.6, Reve 2.1, Nano Banana 2 (Gemini 3.1 Flash Image) and Meta Muse Image; GPT-Image-2.5 has no entry on the board yet.

Em qual deles você deve construir?

Se o seu trabalho é geração de imagens comercial, em que uma edição fracassada custa um relacionamento com o cliente — fotos de produto, criativos de campanha, imagens consistentes com a referência, longas sessões de edição multi-turno — o GPT-Image-2.5 é o modelo cujo design inteiro é voltado para essa tarefa, e o endpoint Sunburst é o motivo para prestar atenção mesmo antes de existirem avaliações independentes. Os riscos são a opacidade do preço por imagem e o fato de que toda alegação de qualidade é da própria OpenAI. Se o seu trabalho é pesquisa, experimentação em alto volume, geração bilíngue chinês-inglês ou qualquer coisa que precise rodar no seu próprio ambiente ou nos seus próprios dados, o LLaDA-Image é o lançamento mais interessante — pesos genuinamente abertos com uma receita publicada, ao custo de ser a sua própria infraestrutura e conviver com pontuações não reproduzidas. Os modelos têm uma semana de diferença no lançamento e um mundo de diferença no modelo operacional; a escolha certa é aquela que corresponde ao custo que você realmente pode pagar.

Screenshot of the Hugging Face model page for inclusionAI/LLaDA-Image captured September 9 2026, showing the model header, the text-to-image and image-editing pipeline tags, the License: apache-2.0 tag, 'Model size 7B params', BF16, 57 likes, and the opening of the model card 'LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes'.