Cartela de título para FLUX 3 Image vs Bernini-Diffusers-v2, contrastando "FLUX 3 Image - no ar em 1º de outubro de 2026, $0.048 por imagem em 1K, em api.bfl.ai" com "Bernini-Diffusers-v2 - pesos Apache-2.0, somente auto-hospedado, sem API hospedada", e observando que o OrcaRouter não roteia nenhum dos dois. O logotipo do OrcaRouter fica no canto inferior direito.
Guides & Insights

FLUX 3 Image vs Bernini-Diffusers-v2: Um endpoint pago contra um repositório baixável

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

FLUX 3 Image e Bernini-Diffusers-v2 são ambos modelos de imagem que você pode obter na íntegra hoje, e nenhum deles é um produto que você pode alugar. FLUX 3 Image entrou no ar em 1º de outubro de 2026 em api.bfl.ai/v1/flux-3-image com uma tabela de preços publicada e nenhuma pontuação publicada. Bernini-Diffusers-v2 chegou ao Hugging Face em 13 de agosto de 2026 sob Apache-2.0 com pontuações publicadas e nenhuma forma de chamá-lo, a não ser com suas próprias GPUs. Um vem com uma fatura. O outro vem com um pin de versão do Python.

É essa divisão que constitui toda a comparação, e vale a pena ser preciso a respeito, porque o enquadramento habitual de “hospedado vs pesos abertos” não se aplica aqui. Bernini não é um modelo de pesos abertos que você possa simplesmente encaixar numa pilha de inferência existente. É um sistema de dois estágios — um planejador Qwen2.5-VL-7B à frente de um decodificador de difusão Wan2.2-T2V-A14B — e seu lançamento v2 é uma correção no cronograma de treinamento, não um novo nível de capacidade. FLUX 3 Image é um endpoint único com uma quantidade incomum de superfície de controle aparafusada a ele: ancoragem espacial, uma grade de coordenadas de 0–1000 e edição delimitada por caixas, em que você nomeia quais regiões sobrevivem. Formatos diferentes de coisa.

O que cada um realmente é

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — a stack de planejador e renderizador da ByteDance, publicada no Hugging Face em 13 de agosto de 2026 sem nenhum anúncio. O repositório está marcado com a tag image-text-to-video e depende de diffusers. Tarefas listadas: texto para imagem, imagem para imagem, texto para vídeo, vídeo para vídeo, referência para vídeo e referência para imagem. Não há inferência hospedada nem lista de preços — o caminho para começar é hf download e um aplicativo Gradio.

• A disparidade de distribuição — FLUX 3 Image é um serviço medido que você chama. Bernini é um repositório que você implanta. Antes que qualquer pergunta sobre qualidade valha a pena ser feita, um deles exige uma GPU da classe Hopper e o outro exige um cartão de crédito.

O licenciamento é onde esses dois mais divergem

Bernini-Diffusers-v2 é Apache-2.0 no nível do repositório. Para um pipeline auto-hospedado, isso importa enormemente: nenhum medidor por imagem, nenhum acordo comercial negociado, nenhum relatório de uso. Você paga por eletricidade e tempo de agendador, e o custo marginal da décima milésima imagem é o mesmo da primeira.

O FLUX 3 Image não tem pesos abertos, e a Black Forest Labs deixa explícito que isso é temporário. Pesos comerciais estão disponíveis hoje sob uma licença BFL negociada, e o lançamento público com pesos abertos é descrito como previsto para as próximas semanas. Essa é uma promessa com forma, mas sem data, e é a coisa mais importante desta página a se verificar novamente em vez de presumir. Se você está escolhendo uma stack de imagens para os próximos dois anos, a questão da licença provavelmente pesa mais do que a questão do Elo — mas só se você estiver preparado para operar você mesmo uma stack de difusão nativa de vídeo de dois estágios.

Superfície de controle: caixas delimitadoras versus aprimoramento de prompt

Esta é a parte do confronto que é genuinamente interessante, porque os dois modelos resolvem "fazer com que vá exatamente lá" de maneiras completamente diferentes.

O FLUX 3 Image recebe um array JSON anexado ao prompt. As coordenadas usam uma grade de 0 a 1000 em ambos os eixos, e cada caixa é escrita como [top, left, bottom, right]. Você fornece uma tabela de elementos, cada um com um id, uma bbox e uma desc, além de uma legenda global que cita esses ids por nome. No próprio exemplo da BFL, os ids são como animal_1 e silhouette_1; a legenda refere-se a eles diretamente. Acima da chamada de geração há grounding, ativado por padrão, que executa uma busca na web e de imagens antes de gerar.

FLUX 3 Image então estende o mesmo sistema de coordenadas para a edição. Em vez de enviar uma máscara, você envia um conjunto de operações com escopo de caixa: Manter (caixa de origem para a mesma caixa, com origem em ref_image_0), Mover (caixa de origem para uma nova caixa de destino), Novo (sem origem, caixa de destino gerada a partir de uma descrição — adicionar, substituir ou recolorir) e Remover (caixa de origem para um destino nulo). Várias operações vão em uma única solicitação.

A ressalva importa. A documentação da BFL diz que os pixels fora das caixas editadas "normalmente permanecem idênticos". Normalmente. É uma alegação de preservação com uma ressalva embutida na redação, que é a maneira honesta de lançar uma e também o motivo pelo qual você deve testar com seus próprios frames em vez de confiar em uma demonstração.

Bernini não tem uma linguagem de coordenadas equivalente voltada ao usuário. Sua edição guiada por referência melhorou na v2 por causa de uma mudança no treinamento — o módulo conector é aquecido por milhares de etapas antes de o co-treinamento começar — e a ByteDance relata que essa mudança se manifesta como melhor edição guiada por referência e melhor desempenho no OpenS2V. É uma correção de qualidade dentro de uma arquitetura existente, não uma nova interface de controle. Se o seu fluxo de trabalho depende de dizer ao modelo qual retângulo deixar intocado, apenas uma dessas duas responde à pergunta.

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

O que os números apoiam e não apoiam

A página do Bernini-Diffusers-v2 traz uma tabela de sete métricas comparando a v2 com a v1, e todos os números nela são informados pelo fornecedor. A direção é mista, o que vale dizer em voz alta:

• Aumento — OpenS2V 63,83 (de 62,30), VBench 84,46 (de 84,37), Bernini-rv2v 3,55 (de 3,48).

• Flat — EditVerse 8.02, inalterado, e Bernini-v2v 3.49, inalterado.

• Downgrade — OpenVE 3.96, de 4.03.

A página também afirma que o v2 está no primeiro escalão entre os principais modelos comerciais de código fechado em uma arena interna de avaliação humana às cegas aos pares. Isso é impossível de verificar de fora da ByteDance e deve ser lido como uma alegação de marketing, não como uma medição. Os três movimentos reais são os listados acima, e são autorrelatados em relação ao próprio v1 do mesmo laboratório.

O FLUX 3 Image ainda não possui número algum. O ranking de texto para imagem da Artificial Analysis e o ranking de edição dela foram ambos verificados em 1º de outubro e em 2026-10-02 e não incluem FLUX 3 Image — as entradas da BFL nesses rankings param na linha do FLUX.2, em que FLUX.2 [max] está em 1021 Elo no ranking de geração e em 996 no ranking de edição. FLUX.2 [dev] ancora ambos os rankings exatamente em 1000. Portanto, a afirmação honesta sobre a qualidade do FLUX 3 Image neste momento é que ninguém fora da Black Forest Labs publicou uma pontuação para ele, e o ponto de referência disponível mais próximo é a geração anterior.

Essa assimetria é a armadilha prática nesta comparação. Os números do Bernini são realizados pelo fornecedor, mas existem e são indicativos. Os do FLUX 3 Image estão ausentes. A ausência não é fracasso — o modelo tem apenas um dia —, mas significa que a única evidência para a alegação de edição do FLUX 3 Image atualmente vem da empresa que o vende.

O lado do preço, que não é nem um pouco simétrico

A FLUX 3 Image é cobrada por imagem por faixa de resolução, e a tabela de preços do fornecedor lista cinco delas:

• 768sq — $0.041 de tabela, $0.0205 durante a janela de lançamento.

• 1K (o padrão) — $0,048 de tabela, $0,024 em oferta.

• 1,5K — $0,07 de tabela, $0,035 em oferta.

• 2K — $0,10 de tabela, $0,05 em oferta.

• 4K — $0.607 de tabela, $0.3035 em oferta.

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

Imagens de referência e comprimento do prompt estão incluídos sem custo adicional, e solicitações rejeitadas, com falha ou moderadas não são cobradas — o que importa mais do que o normal aqui, porque uma chamada 4K é lenta e a tentação de abandonar uma solicitação é real. O preço de lançamento vai das 15:00 UTC de 1º de outubro às 15:00 UTC de 8 de outubro. O salto do preço de tabela de 2K para 4K é um fator de 6,07, muito mais acentuado que a proporção da contagem de pixels, então o nível de resolução que você escolher é a principal decisão de custo em toda a API.

Os níveis seguem um orçamento de pixels em vez de um quadro fixo. A saída de exemplo da BFL é 5456 × 3072, aproximadamente 16,8 megapixels, em comparação com UHD 2160p com 8,3 megapixels — portanto, "4K" aqui nomeia um orçamento, e as dimensões de saída são arredondadas para múltiplos de 16, com o valor real retornado como output_mp.

O preço do Bernini é zero por imagem e não nulo por hora. Oito GPUs para inferência em paralelismo de sequência, silício da classe Hopper recomendado, Python 3.11.2 com PyTorch 2.7.1 e CUDA 12.6. O ponto de equilíbrio em relação a US$ 0,048 por imagem em 1K fica em algum ponto na casa dos milhares de imagens por mês, dependendo inteiramente do que você paga por computação — e é um número real, não retórico. Se você já opera infraestrutura de inferência, a imagem marginal do Bernini é praticamente gratuita. Se não opera, o endpoint FLUX 3 Image é drasticamente mais barato do que montar uma pilha de difusão de dois estágios.

Encaminhamento: nenhum destes está no nosso catálogo.

Vale a pena dizer isso claramente, porque é o tipo de afirmação que fica obsoleta rapidamente. O OrcaRouter não roteia o FLUX 3 Image e não roteia o Bernini-Diffusers-v2. Chamar o FLUX 3 Image significa chamar a Black Forest Labs diretamente no próprio endpoint dela. Chamar o Bernini significa fazer o deploy dele você mesmo.

Em um pipeline como este, um roteador compatível com OpenAI serve, na verdade, para tudo o que está dos dois lados da chamada de imagem. Uma etapa de legendagem ou de reescrita de prompt, um modelo de visão conferindo o render em relação ao briefing, um modelo de vídeo animando a imagem estática aprovada, um pequeno modelo de texto classificando a saída — essas são as etapas em que poder trocar um provedor com uma única string, em uma única chave, e ter solicitações fazendo failover automaticamente quando um está degradado, elimina uma quantidade real de manutenção. O OrcaRouter repassa o preço de tabela do provedor sem markup, então, quando um fornecedor reduz uma tarifa, a mudança entra em vigor no mesmo dia, em vez de esperar que um revendedor reajuste o preço, e a DSL de roteamento permite fixar um modelo específico ou definir a ordem de fallback sem mexer no código da aplicação. Nada disso torna o FLUX 3 Image roteável. Isso só significa que o resto do pipeline não precisa se importar com qual modelo produziu a imagem estática.

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

Em qual basear-se

Três perguntas separam estas de forma clara, e elas não têm uma resposta comum.

Você precisa controlar onde as coisas vão? O FLUX 3 Image é o único dos dois com uma linguagem de coordenadas, e suas operações de edição com escopo de caixa — manter, mover, adicionar, remover — são uma interface genuinamente diferente da edição por instruções de texto. Se o seu trabalho é composição, layout ou imagens de produto em que as regiões precisam sobreviver, isso é decisivo, e a ressalva em "normalmente permanecem idênticas" é algo que você testa em vez de presumir.

Você precisa saber o quão bom ele é antes de se comprometer? O Bernini tem números, todos relatados pelo fornecedor, e uma trajetória mista. O FLUX 3 Image não tem nenhum. Se você não puder realizar sua própria avaliação, estará escolhendo entre um modelo medido e um não medido, e o medido é a arquitetura mais antiga.

Você consegue operar uma pilha de difusão de dois estágios? Esse é o verdadeiro obstáculo no Bernini. Um planejador Qwen2.5-VL-7B alimentando um decodificador Wan2.2-T2V-A14B, em GPUs Hopper, com um hook de aprimorador de prompt que aponta para um endpoint compatível com OpenAI. A licença é permissiva, mas a conta de computação não é. Se você não conseguir, a questão perde o sentido e US$ 0,048 por imagem é a resposta.

A única coisa que mudaria esta página mais rapidamente é a BFL abrir os pesos do FLUX 3 Image, algo que a empresa disse estar a poucas semanas de acontecer. Isso faz com que a assimetria de licenciamento passe de decisiva a ligeira e deixa a diferença na superfície de controlo como a comparação efetiva. Até então, o resumo exato é que estes são dois bons modelos com modelos de distribuição opostos, e a escolha é feita com base no licenciamento e no controlo muito antes de ser feita com base na qualidade.