
FLUX 3 Image vs FLUX 3: Dois nomes, dois produtos, nove semanas de diferença
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Desde 1 de outubro de 2026, "FLUX 3" tem significado duas coisas diferentes, e o segundo significado é aquele que tem uma tabela de preços. FLUX 3 Image é o nível de imagem que entrou no ar naquele dia em api.bfl.ai/v1/flux-3-image, cobrado por imagem a partir de US$ 0,041. FLUX 3 é a coisa maior à qual ele pertence — o modelo multimodal unificado que a Black Forest Labs anunciou em 23 de julho de 2026 e que, desde então, foi lançado em partes, das quais vídeo e uma cabeça de ação para robótica são as partes que já estão rodando em produção. Isto não é uma comparação entre um carro-chefe e seu irmão menor. É uma comparação entre uma família inteira e uma de suas três partes funcionais.
É fácil perder essa distinção, e a própria nomenclatura da BFL não ajuda: a página da família, a documentação de vídeo, os termos de licença e a referência da API todos dizem FLUX 3 em pontos onde querem dizer algo mais restrito. Se você leu uma ficha técnica do FLUX 3 e ficou sem saber se ela descreve um modelo de imagem, um modelo de vídeo ou um programa de pesquisa, isso não é descuido seu. Ambos os nomes estão em uso ativo para subconjuntos sobrepostos do mesmo lançamento.
As duas datas que importam
• 23 de julho de 2026 — O FLUX 3 foi anunciado sob um banner de Acesso Antecipado. Uma única arquitetura Self-Flow que abrange geração de imagem, vídeo e áudio, além de previsão de ações. A divulgação dos recursos computacionais é a parte interessante: mais de 95% do poder computacional de treinamento foi destinado a vídeo, e menos de 0,5% dos tokens foram alocados para áudio.
• 1 de outubro de 2026 — o nível de imagem abre como um endpoint com medição. O que deixa uma lacuna de cerca de dez semanas entre o anúncio e a chegada da modalidade à qual a maioria das pessoas supunha que "FLUX 3" se referia.
Ler essa divisão de recursos computacionais revela o que a Black Forest Labs acreditava ser o problema difícil. Uma família de modelos que gasta quase todo o seu orçamento de treinamento em vídeo não está otimizando para imagens estáticas e tratando o movimento como uma extensão. É o contrário, e a camada de imagem herdou o que quer que o treinamento com foco em vídeo tenha produzido.

O que cada nível é, e quanto custa
Três das quatro modalidades anunciadas em julho já foram lançadas. O nível de imagem é o mais recente e é o único que se comporta como uma API paga convencional.
• FLUX 3 Image — um POST, um cabeçalho x-key e uma URL de polling de retorno. Preço por imagem conforme a faixa de resolução: $0,041 em 768sq, $0,048 em 1K (o padrão), $0,07 em 1,5K, $0,10 em 2K e $0,607 em 4K. Um desconto de lançamento de 50% é válido até as 15:00 UTC de 8 de outubro. Referências e comprimento do prompt estão incluídos; requisições falhas e moderadas não são cobradas. Aceita até dez imagens de referência entre 256×256 pixels e 16 megapixels cada.
• FLUX 3 Video — disponível para uso geral e cobrado por segundo, em vez de por imagem. Texto para vídeo e imagem para vídeo custam US$ 0,06/s em Draft HD, US$ 0,17/s HD, US$ 0,29/s FHD, US$ 0,40/s QHD e US$ 0,80/s UHD, com vídeo para vídeo mais caro em todas as modalidades. Os clipes vão até 20 segundos com áudio sincronizado nativo, e os modos incluem keyframe para vídeo e continuação. O modo Draft é somente HD. As saídas QHD e UHD chegaram em 10 de setembro de 2026.
• FLUX 3 Action — um modelo de mundo-ação de 7B, e a única parte do FLUX 3 cujos parâmetros você pode baixar. Três checkpoints surgiram no Hugging Face em 22 de setembro de 2026: um checkpoint base, uma variante do braço SO-101 e uma variante DROID. O acesso é liberado apenas para parceiros, em vez de aberto, com a manipulação robótica como uso demonstrado.
• O que ainda não foi lançado — uma base de pesos abertos do FLUX 3. As camadas de auto-hospedagem da BFL ainda cobrem apenas o FLUX.2 [klein] e o FLUX.2 [dev]. Especificamente para a camada de imagem, existem pesos comerciais sob uma licença negociada, e os pesos abertos públicos são descritos como estando a semanas de distância.
A comparação de custos que ninguém faz

Os preços por imagem e por segundo parecem incomparáveis, razão pela qual vale a pena fazer a conta uma vez.
Cinco segundos de texto para vídeo em HD padrão custam US$ 0,85. Cinco segundos em UHD custam US$ 4,00. Uma única imagem estática 4K do nível de imagem custa US$ 0,607 de tabela, ou US$ 0,3035 dentro da janela de lançamento — e, embora o "4K" do nível de imagem designe um orçamento de pixels em vez de um quadro fixo (a saída de exemplo da BFL é 5456 × 3072, cerca de 16,8 megapixels, contra os 8,3 do UHD 2160p), é a mesma ordem de resolução que o nível de vídeo cobra por segundo para mover.
A consequência é que gerar um keyframe UHD custa uma fração de gerar um segundo de vídeo UHD, e o keyframe é o que você geraria repetidamente ao iterar. Se o seu pipeline for “acertar o quadro e depois animá-lo”, a camada de imagem é a metade barata por mais de uma ordem de magnitude, e é a metade que está disponível há menos tempo.
Há uma ressalva do lado da imagem que o lado do vídeo não tem. Uma chamada de imagem 4K pode levar vários minutos, e a amostra retornada pode ser baixada por uma hora. Ser lento e recuperável por uma hora é um formato operacional diferente do de uma tarefa de vídeo, e é o tipo de detalhe que decide se um pipeline em lote precisa de uma fila.
As caixas delimitadoras existem em um destes dois nomes
As superfícies de controle não são compartilhadas entre os níveis, e esta é a diferença prática mais acentuada entre o nome e a família.
O nível de imagem recebe um array JSON anexado ao prompt, com coordenadas numa grelha de 0–1000 em ambos os eixos e cada caixa escrita como [top, left, bottom, right]. Passa-se uma tabela de elementos com um id, uma bbox e uma desc, e uma legenda global que cita esses ids — os exemplos da BFL usam nomes como animal_1. O mesmo sistema de coordenadas orienta a edição: manter uma região, mover uma região, gerar uma nova para uma caixa de destino ou remover uma caixa de origem. Várias operações vão num único pedido, com ref_image_0 a nomear a primeira entrada da lista de referências. Os píxeis fora das caixas editadas, diz a documentação, "normalmente mantêm-se idênticos" — uma ressalva que vale a pena ler à letra.
O grounding está ativado por predefinição no nível de imagem: é executada uma pesquisa na web e de imagens antes da geração. As dimensões de saída são arredondadas para múltiplos de 16 e o valor final é devolvido como output_mp.
Nada disso aparece nos parâmetros do nível de vídeo. O FLUX 3 Video tem sua própria história de controle — keyframes, continuação, condicionamento de primeiro e último quadro —, mas nenhuma linguagem de coordenadas. As partes compartilham uma arquitetura, não uma interface.
Lendo atentamente as próprias comparações do fornecedor
A Black Forest Labs publicou resultados de preferência para o FLUX 3 Video, e vale a pena citá-los com a respetiva proveniência anexada. As execuções são realizadas pelo fornecedor, preliminares, e avaliadas como taxas de vitória em resultados de 10 segundos a 720p:
• Contra o Luma Ray 3.2 — 93% de preferência por FLUX 3 Video.
• Contra Runway Gen-4.5 — 77%.
• Contra o Grok Imagine Video — 69%.
• Contra Kling v3 Pro — 60%.
• Contra Happy Horse v1 e v1.1 — 59% e 57%.
• Contra Seedance 2.0 e Gemini Omni Flash — cerca de 52% cada, o que é um empate estatístico em essência, mesmo que o número esteja acima da metade.
A amplitude de 93% a 52% nessa lista é mais informativa do que qualquer linha isolada. Ninguém fora da BFL fez essas comparações, e os resultados abaixo de 55% na parte inferior são os que mostram onde o modelo realmente está em disputa.
Não existe absolutamente nenhum número equivalente para o FLUX 3 Image. Os quadros de texto para imagem e de edição da Artificial Analysis foram verificados em 1º de outubro e novamente em 2 de outubro de 2026, e nenhum dos dois contém uma entrada do FLUX 3 Image. A linha FLUX.2 ainda é onde as pontuações publicadas da BFL param: FLUX.2 [max] com 1021 Elo no quadro de geração e 996 no quadro de edição, com FLUX.2 [dev] fixado como a âncora de 1000 em ambos. A categoria de imagem tem um dia de existência e ainda não foi medida.
![Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present](https://cms.orcarouter.ai/api/media/file/4-1496.png)
Escolhendo entre os nomes
A escolha não é tanto sobre qual modelo é melhor, mas sobre em qual das três camadas disponibilizadas o seu problema se encaixa.
Se você precisa de imagens estáticas com controle espacial, o FLUX 3 Image é o único nível com uma linguagem de coordenadas e, a US$ 0,048 por imagem em 1K, é barato o suficiente para avaliar de verdade em vez de discutir. Comece por aí, teste a alegação de que "normalmente permanecem idênticos" nos seus próprios quadros e observe o salto de 6,07× na lista de 2K para 4K quando você dimensionar seus lotes.
Se você precisa de movimento, o FLUX 3 Video é um produto maduro com medição, com níveis de resolução até UHD e clipes de 20 segundos com áudio sincronizado. Compare-o com os modelos que ele foi criado para substituir, e não com o nível de imagem — eles não são alternativas entre si.
Se você precisar dos pesos, a resposta hoje é FLUX 3 Action sob um acordo de parceria e, caso contrário, FLUX.2. Nem o nível de vídeo nem o de imagem podem ser baixados, e o lançamento aberto do nível de imagem é uma intenção declarada, sem data.
Nem o FLUX 3 nem o FLUX 3 Image estão no catálogo do OrcaRouter, então chamar qualquer um dos dois significa recorrer diretamente à Black Forest Labs. O que um roteador neutro em relação a fornecedores agrega a um pipeline construído em torno dessa família é a camada ao redor da chamada de geração: a etapa de reescrita de prompt, a verificação de visão que compara um render com o briefing, o classificador que separa as saídas em aprovadas e rejeitadas. Essas etapas mudam muito mais frequentemente do que o modelo de imagem muda, e trocar um provedor por trás de um único endpoint compatível com a OpenAI — com os preços de tabela dos provedores repassados sem markup, failover automático quando um backend degrada e uma DSL de roteamento quando você quer fixar ou fazer fallback de propósito — é a diferença entre um pipeline que acompanha o mercado e um que precisa ser reimplantado toda vez que um modelo é descontinuado.
O fechamento honesto é uma convenção de nomenclatura. Quando alguém diz FLUX 3 e lhe entrega uma tabela de tarifas, quer dizer o endpoint de imagem. Quando dizem isso e lhe entregam uma ficha técnica sobre alocação de tokens de áudio, querem dizer o anúncio de julho. A diferença entre esses dois documentos é de nove semanas e três níveis lançados, e ainda está aumentando.
