
GPT-Image-2 vs Flux 3: Comparando um Modelo em Produção com um Roadmap
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Este não é um post normal de comparação entre modelos, porque GPT-Image-2 e Flux 3 não estão no mesmo estado de existência. O GPT-Image-2 foi lançado em 21 de abril de 2026, pode ser chamado através da API da OpenAI desde o início de maio e ganhou um novo recurso esta semana — geração de imagens com fundo transparente na API, anunciada em 20 de agosto e disponível agora. O Flux 3 é o modelo fundacional multimodal da Black Forest Labs, anunciado em 23 de julho de 2026, e o nível de imagem ainda não tem endpoint público, nem ID de modelo, nem tabela de preços até o momento em que escrevo. Um deles você pode chamar às 3 da manhã com uma chave válida; para o outro, você pode se inscrever para entrar na lista de espera. A comparação útil, então, não é "qual é melhor" — é o que o modelo lançado realmente faz hoje, o que o roadmap promete para o não lançado e como um desenvolvedor deve tratar um modelo prometido que continua atrasando enquanto um modelo ativo continua melhorando.
Um destes tem um endpoint.
Comece pela disponibilidade, porque é ela que decide todo o resto. A Black Forest Labs revelou o Flux 3 em 23 de julho como um modelo único treinado em conjunto para previsão de imagem, vídeo, áudio e ação robótica, construído sobre uma abordagem de flow-matching que o laboratório chama de Self-Flow. Mais de 95% do poder computacional desse treinamento, segundo relatos, foi direcionado à previsão de vídeo, o que fica evidente no que foi efetivamente lançado: apenas o Flux 3 Video alcançou disponibilidade geral, em 4 de agosto, com uma API paga. A página do modelo da versão de imagem ainda exibe um rótulo de "em breve" com um formulário de inscrição, e não um botão de "começar" — sem endpoint, sem parâmetros documentados, sem custo por imagem e sem nenhum benchmark que alguém possa executar.
O GPT-Image-2, em contraste, está em produção há quatro meses. A OpenAI abriu o acesso à API no início de maio, e o identificador do modelo, gpt-image-2, é estável o suficiente para que um snapshot fixado, gpt-image-2-2026-04-21, coexista com ele. É atualmente o modelo de texto-para-imagem número um em ambos os principais painéis independentes — 1.381 Elo no leaderboard de texto-para-imagem da Arena (a versão média) e 1.369 Elo para a versão alta na Artificial Analysis — e renderiza texto multilíngue, incluindo CJK, baseia a geração em pesquisa na web e produz saídas de até 4K. Quatro meses de tráfego de produção são a diferença entre uma promessa e um histórico comprovado.
A mudança recente no lado do GPT-Image-2
O evento que torna este confronto oportuno não tem nada a ver com o Flux 3. Em 20 de agosto, a OpenAI disponibilizou uma prévia com fundo transparente para o GPT-Image-2 na API de Imagens: defina o fundo como "transparent" e o endpoint retorna um PNG ou WebP com um canal alfa real, recortado e pronto para composição. Esse é um recurso voltado diretamente para o trabalho de produção que o roadmap de imagem do Flux 3 também está vendendo — fotos de produto, ícones, ativos de marketing — e ele chegou como um parâmetro em um endpoint já ativo, em vez de um novo modelo. Assim, enquanto o mundo espera por um endpoint de imagem do Flux 3 que ainda diz "coming soon", o atual líder acaba de fechar uma das lacunas que o mantinham fora dos pipelines de composição.
{{1}}O recurso é exclusivo da API — não há alternância no ChatGPT — e é um parâmetro, não um novo produto.{{/1}} {{2}}Ambos os endpoints da API de Imagens, geração e edição, aceitam um campo background com os valores "transparent", "opaque" e "auto" (o padrão, em que o modelo decide).{{/2}} {{3}}O canal alfa sobrevive apenas na saída PNG ou WebP, então a solicitação define explicitamente o formato de saída.{{/3}} {{4}}A referência da própria API da OpenAI ainda marca o suporte a transparência para gpt-image-2 e seu snapshot gpt-image-2-2026-04-21 como "em pré-visualização" — esse é o rótulo do fornecedor, não um anúncio de lançamento — e sua orientação é manter o prompt livre de qualquer cenário descrito para que o modelo realmente atenda à solicitação de transparência.{{/4}} {{5}}Nenhum novo endpoint, nenhum novo ID de modelo, nenhum cartão de preço separado: a mesma chamada gpt-image-2 que retornava um PNG opaco agora retorna um recorte.{{/5}}

O que a imagem Flux 3 promete, e o que está realmente sendo entregue
A ficha técnica do nível de imagem do Flux 3 é um roadmap do fornecedor, portanto, trate-a como tal. A Black Forest Labs prometeu síntese e edição de imagens em diferentes estilos e resoluções, tratamento aprimorado de prompts complexos, renderização de texto multilíngue de alta precisão, transferência de estilo zero-shot a partir de imagens de referência, consistência de personagens e marcas sem fine-tuning, e edição não destrutiva que preserva textura e iluminação. Essas são as coisas certas a prometer — são exatamente as funcionalidades pelas quais os atuais líderes de mercado competem — mas nenhuma delas é testável hoje porque nenhuma delas tem um endpoint.
O que é realmente chamável na BFL é o nível de vídeo e a linha de imagens FLUX mais antiga. O Flux 3 Video custa US$ 0,17 por segundo em HD e US$ 0,29 por segundo em FHD para renders completos, com um modo de rascunho de US$ 0,06 por segundo. Seus próprios números divulgados são 1.135 Elo para texto-para-vídeo e 1.051 para imagem-para-vídeo, e vitórias por preferência sobre Luma Ray 3.2, Runway Gen-4.5, Grok Imagine Video e Kling v3 Pro — tudo divulgado pelo fornecedor e não reproduzido, e nada disso se transfere para o nível de imagem de qualquer forma. Para imagens estáticas, a oferta atual da BFL continua sendo a linha FLUX.2, que fica em 1.226 Elo no mesmo painel Artificial Analysis onde GPT-Image-2 lidera com 1.369. Essa lacuna é o contexto prático para "a imagem Flux 3 está chegando": a API de imagem atual da BFL está cerca de 140 Elo atrás da OpenAI, e o modelo prometido é o que a BFL precisa para fechar essa diferença.

Preços: só existe um cartão de preço real.
Não há preço de imagem do Flux 3, porque não existe produto de imagem do Flux 3. Os únicos números publicados são as taxas de token do GPT-Image-2: US$ 5 por milhão de tokens de entrada de texto, US$ 8 por milhão de tokens de entrada de imagem e US$ 30 por milhão de tokens de saída de imagem, com a API Batch custando cerca de metade do valor para um prazo de até 24 horas. A OpenAI não publica tokens por imagem, portanto os valores por imagem são conversões, não cotações: cerca de US$ 0,006 para uma imagem 1024×1024 de baixa qualidade, cerca de US$ 0,05 para uma de média qualidade, cerca de US$ 0,21 em alta qualidade e até cerca de US$ 0,41 para uma renderização 4K de alta qualidade. Para efeito de comparação, esse é o lado do balanço que é real; a coluna de imagem do Flux 3 é uma célula vazia.

O que um construtor deve fazer com um modelo prometido
A postura sensata quando o modelo de um concorrente continua sendo adiado é construir sobre o que já existe e fazer do futuro uma mudança de configuração, e não uma re-arquitetura. O GPT-Image-2 pode ser roteado hoje por meio do OrcaRouter — uma chave de API, o preço de tabela da OpenAI repassado com 0% de markup, failover automático entre provedores — para que um pipeline que gera assets com ele possa depois apontar o mesmo endpoint para a API do Flux 3 image no dia em que um endpoint de fato existir, e direcionar uma fatia do tráfego para ele com o DSL de roteamento sem tocar no código que faz a chamada. Você tem o modelo já lançado agora, e quando o prometido chegar, você o avalia contra uma linha de base funcional em vez de contra um press release. A espera não custa nada; construir sobre o nada enquanto espera custa tudo.
O veredito é desequilibrado por design. Se você precisa de geração de imagens neste trimestre, GPT-Image-2 é a escolha e não há segunda questão — é o número um independente, acabou de adicionar saída com fundo transparente na API, e tem uma API pública e um preço estável. Flux 3 image é um motivo para ficar de olho na Black Forest Labs, não um motivo para segurar um projeto. Acompanhe a abertura do acesso antecipado e os primeiros benchmarks independentes; no momento em que um endpoint existir, a comparação neste post se torna um teste que você pode realmente executar.
