
GPT-Image-2.5 vs LLaDA-Image: Uma API de US$ 30/M-token contra um Modelo de Difusão Gratuito de 6B
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
Pergunte quanto deve custar a geração de imagens e dois laboratórios construíram as duas respostas opostas com uma semana de diferença. Em 8 de setembro de 2026, a OpenAI lançou o GPT-Image-2.5 — o modelo por trás do ChatGPT Images 2.5, vendido via API como GPT-Image-2.5 Flare e GPT-Image-2.5 Sunburst — com preço definido em um card de tokens de US$ 8 por milhão de tokens de entrada de imagem e US$ 30 por milhão de tokens de saída de imagem. Cinco dias antes, em 4 de setembro, a inclusionAI (o laboratório apoiado pelo Ant Group por trás da família de linguagem LLaDA) lançou discretamente o LLaDA-Image, um gerador e editor de imagens diffusion-transformer de seis bilhões de parâmetros cujos pesos podem ser baixados gratuitamente. Um é o modelo de imagem comercialmente mais poderoso que a OpenAI já colocou atrás de um medidor de tokens; o outro é uma tentativa de provar que um modelo de imagem forte pode ser construído com uma receita de treinamento aberta e distribuído gratuitamente. Compará-los é menos um confronto direto do que uma decisão sobre qual definição de custo você está realmente pagando.
Quase todos os números do lado do GPT-Image-2.5 são relatados pelo fornecedor e nenhum deles tem verificação independente ainda: a OpenAI afirma que o Flare reduz a latência em até 50% em comparação com o GPT-Image-2 e que testes de terceiros realizados pela empresa de agentes Manus mediram geração de 2 a 4 vezes mais rápida, mas, em 9 de setembro de 2026, nenhum dos modelos GPT-Image-2.5 tem entrada nos leaderboards de imagens do Artificial Analysis. O número principal do LLaDA-Image é igualmente não reproduzido — a inclusionAI relata 53,53 em inglês / 53,38 em chinês no Qwen-Image-Bench, primeiro entre os modelos de pesos abertos no lançamento — e, como o modelo não tem API hospedada, ele não pode aparecer em leaderboards somente de API. Ambos os lados desta comparação estão baseados nas próprias afirmações de seus criadores, o que vale a pena ter em mente ao longo do restante deste artigo.
Dois modelos que mal compartilham uma categoria
GPT-Image-2.5 é um modelo de imagem fechado e hospedado na mesma linhagem do ChatGPT Images 2.0 de abril de 2026. É multimodal na entrada e produz imagens que a OpenAI afirma serem mais nítidas em detalhes finos, mais naturais em iluminação e textura, e mais estáveis em edições de várias etapas — o endpoint Sunburst existe especificamente para trabalhos de produção com muitas edições, onde a geração mais lenta é aceitável em troca de um controle de instrução mais rígido, enquanto o Flare é o padrão rápido para geração de alto volume. As saídas chegam a 2048×2048 e 3840×2160, fundos transparentes são suportados, e cada saída carrega metadados de proveniência C2PA além de uma marca d'água invisível.
LLaDA-Image é um lançamento aberto em estilo de pesquisa, construído sobre uma aposta completamente diferente. Enquanto o GPT-Image-2.5 é servido pela infraestrutura da OpenAI, o LLaDA-Image é um conjunto de pesos que você mesmo executa: um transformer de difusão (DiT) de 6 bilhões de parâmetros no lado da geração — a ficha do modelo registra cerca de 7B de parâmetros quando o lado da linguagem é contabilizado — emparelhado com o LLaDA 2.0-mini, um modelo de linguagem de difusão de mistura de especialistas com 16B totais / 1B ativos, como o lado de "compreensão" que converte prompts de texto ou instruções de edição no sinal que o DiT segue. A alegação incomum no relatório do arXiv (2609.03796) é a receita de treinamento: mais de 90% dos cerca de 220 milhões de amostras acumuladas de pré-treinamento e treinamento intermediário são apenas de imagens, com um modelo de visão-linguagem congelado extraindo semântica de imagens não rotuladas como um sinal de autocondicionamento, de modo que o modelo "aprende primeiro a desenhar, depois a obedecer". A resolução progressiva leva o treinamento de 256×256, passando por 512×512, até o ajuste fino em 1024×1024, seguido por treinamento misto de texto-para-imagem e edição, e uma destilação de poucos passos TwinFlow que produz a variante LLaDA-Image-Turbo.
No que cada um é realmente bom
A proposta do GPT-Image-2.5 é precisão e controle com qualidade comercial. O anúncio da OpenAI enfatiza a fidelidade de referência — manter uma pessoa, animal de estimação ou produto reconhecível ao mudar o cenário ou estilo — e edições que alteram apenas o que você pediu para alterar, mantidas ao longo de várias rodadas de edições em uma única conversa. A renderização de texto dentro de imagens é destacada especificamente, incluindo a eliminação dos caracteres chineses distorcidos que afetavam os modelos de imagem anteriores. Essas são exatamente as capacidades que uma equipe de produto, marca ou publicidade utiliza repetidamente.
A proposta da LLaDA-Image é um único conjunto de pesos que faz geração bilíngue e edição guiada por instruções com uma receita aberta. A inclusionAI relata renderização nativa de texto em chinês e inglês, um caminho de edição que injeta imagens de referência por meio de um design de caminho duplo para preservar o conteúdo não modificado e — no Qwen-Image-Bench — as melhores pontuações de pesos abertos no lançamento. As ressalvas honestas do lançamento são que a qualidade perceptual da edição ainda fica aquém dos editores especializados e a contagem de objetos continua fraca. É um modelo aberto generalista, não um produto comercial acabado.

O placar não é deliberadamente uma competição de qualidade de imagem — os dois modelos nunca foram submetidos à mesma avaliação. O que ele mostra é para onde fluem o dinheiro e o controle.
O preço de uma imagem é o número que nenhum dos lados lhe dará.
OpenAI publica uma tabela de preços por token para o GPT-Image-2.5 idêntica à do GPT-Image-2: US$ 8 por milhão de tokens de entrada de imagem, US$ 30 por milhão de tokens de saída de imagem, entrada de imagem em cache a US$ 2 e tokens de texto cobrados separadamente a US$ 5 por milhão. O que ela não publica é quantos tokens uma determinada imagem consome, o que significa que não há preço oficial por imagem nem calculadora de custos. Ao preço listado pela AA para o predecessor em seu ranking — cerca de US$ 211 por 1.000 imagens para o GPT Image 2 na qualidade "alta" — um carro-chefe medido por token é uma ferramenta cara em volume, mas esse número é do GPT-Image-2, não do 2.5, e o custo por imagem do novo modelo é genuinamente desconhecido fora da OpenAI.
LLaDA-Image tem o problema oposto de honestidade. Os pesos não custam nada e o card traz a tag Apache-2.0, mas o preço real é a infraestrutura: um transformer de difusão de 6B precisa de uma GPU séria para a variante Base de 50 passos, e os checkpoints FP8 (cerca de 49 GB em um layout diffusers) são a opção prática para a maioria dos usuários. A destilação de 2–4 passos do LLaDA-Image-Turbo é a concessão a essa realidade. As ferramentas da comunidade avançaram rápido — um pull request do SGLang adiciona suporte a text-to-image, edição, sequence-parallel e FP8, e um pacote de nós ComfyUI da RebelAI oferece suporte a inferência local quantizada em INT8 e GGUF — mas "modelo gratuito" ainda significa "você é o provedor de hospedagem." Para uma equipe que já opera capacidade de GPU, o custo marginal do LLaDA-Image se aproxima de zero; para todos os outros, o custo total de servir o modelo pode exceder as faturas de API medidas quando se inclui o tempo de engenharia.
O caminho honesto se você quiser ambos.
Essas opções não são mutuamente exclusivas para a maioria das equipes. Um pipeline de produção pode usar uma API hospedada, como a GPT-Image-2.5, para o trabalho voltado ao cliente, intensivo em edições e que não pode falhar, e manter um modelo aberto, como a LLaDA-Image, para experimentos, tarefas em lote offline e qualquer coisa que não possa enviar prompts a terceiros. Essa divisão é exatamente o tipo de problema que uma camada de roteamento resolve: uma única API que acessa os modelos hospedados que você realmente usa, com o preço de tabela do provedor repassado sem nenhum acréscimo, para que, mais tarde, testar um modelo de pesos abertos por uma rota hospedada custe o mesmo que ir diretamente ao provedor. Nenhum dos dois modelos está no catálogo do OrcaRouter em 9 de setembro de 2026: a GPT-Image-2.5 está disponível apenas via OpenAI API por enquanto (a geração anterior, a GPT-Image-2, é roteada), e a LLaDA-Image é apenas pesos, sem inferência hospedada. A intenção do design permanece independentemente do catálogo atual.

Em qual deles você deve construir?
Se o seu trabalho é geração de imagens comercial, em que uma edição fracassada custa um relacionamento com o cliente — fotos de produto, criativos de campanha, imagens consistentes com a referência, longas sessões de edição multi-turno — o GPT-Image-2.5 é o modelo cujo design inteiro é voltado para essa tarefa, e o endpoint Sunburst é o motivo para prestar atenção mesmo antes de existirem avaliações independentes. Os riscos são a opacidade do preço por imagem e o fato de que toda alegação de qualidade é da própria OpenAI. Se o seu trabalho é pesquisa, experimentação em alto volume, geração bilíngue chinês-inglês ou qualquer coisa que precise rodar no seu próprio ambiente ou nos seus próprios dados, o LLaDA-Image é o lançamento mais interessante — pesos genuinamente abertos com uma receita publicada, ao custo de ser a sua própria infraestrutura e conviver com pontuações não reproduzidas. Os modelos têm uma semana de diferença no lançamento e um mundo de diferença no modelo operacional; a escolha certa é aquela que corresponde ao custo que você realmente pode pagar.

