Um cartão de destaque gerado para o artigo "Qwen-Image 2.1 vs FLUX 3", mostrando um gráfico de confronto em duas colunas com um ícone de cadeado entre dois cartões de modelo arredondados rotulados "Qwen-Image 2.1" e "FLUX 3", e uma faixa com os dizeres "Um você pode executar e não pode vender; um você poderia vender e não pode executar".
Guides & Insights

Qwen-Image 2.1 vs FLUX 3: Dois modelos de imagem que você não consegue bem usar

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen-Image 2.1 e FLUX 3 são os dois lançamentos de imagem mais interessantes do segundo semestre de 2026, e nenhum dos dois é utilizável de forma direta. Qwen-Image 2.1, que a equipe do Qwen-Image disponibilizou como código aberto em 20 de setembro de 2026, é um modelo unificado de geração e edição com 7 bilhões de parâmetros que você pode baixar hoje à tarde e não pode colocá-lo legalmente em um produto comercial. FLUX 3, que a Black Forest Labs anunciou em 23 de julho de 2026, é um modelo de base multimodal unificado cuja camada de imagem — a parte que você realmente compararia — ainda não tem endpoint público, nem ID de modelo, nem preço, nem benchmarks dois meses após o anúncio. A comparação, portanto, não é "qual dos dois é melhor", e sim qual dos dois obstáculos você consegue contornar.

Dois tipos diferentes de indisponível

É tentador arquivar os dois em "ainda não está pronto" e seguir em frente. Isso esconderia a única decisão que importa, porque os dois bloqueios têm formas opostas.

O bloqueio do Qwen-Image 2.1 é jurídico, e é uma linha em um arquivo que você pode ler antes de baixar qualquer coisa. Os pesos estão no Hugging Face e no ModelScope, o cartão do modelo está escrito, o código de inferência está publicado, e quatro frameworks de serving separados tiveram suporte mesclado antes ou no dia do lançamento. Nada técnico fica entre você e um modelo em execução. O que impede você de lançá-lo é o Qwen Research License Agreement, datado de 20 de setembro de 2026, cuja cláusula de concessão de direitos permite o uso "APENAS PARA FINALIDADES NÃO COMERCIAIS" e orienta quem quiser direitos comerciais a solicitar uma licença separada ao fornecedor.

O bloqueio do FLUX 3 é físico. Não há endpoint de imagem para chamar, nenhum identificador de modelo para passar e nenhuma tabela de preços para basear o orçamento. A própria página de preços da BFL abrange os níveis do FLUX 3 Video e a linha de imagens mais antiga, o FLUX.2; não abrange um nível de imagem do FLUX 3, porque não há nada a precificar. O acesso ao modelo de imagem é apenas por solicitação, em vez de um botão de começar a usar: a própria página do FLUX 3 da BFL lista o nível de imagem como "em breve", e é o nível de ação que carrega o rótulo de acesso antecipado.

Então, um destes é um modelo que você pode rodar hoje à noite e não pode vender, e o outro é um modelo que você poderia vender e não pode rodar. Qual deles é mais útil para você depende inteiramente de que lado dessa frase você está — uma equipe de pesquisa interna e uma equipe de produto comercial deveriam chegar a conclusões opostas a partir dos mesmos dois fatos.

A leitura dimensão por dimensão

Estado — pesos, licença e cartão de modelo do Qwen-Image 2.1 publicados a 20 de setembro de 2026, com um post no blog do fornecedor no mesmo dia. FLUX 3 anunciado a 23 de julho de 2026; apenas o nível de vídeo foi lançado, atingindo a disponibilidade geral a 4 de agosto de 2026.

O que você pode realmente chamar hoje — O Qwen-Image 2.1 roda localmente por meio do Diffusers, ComfyUI, vLLM-Omni, SGLang e LightX2V, ou pela própria API do fornecedor e várias plataformas de terceiros. O FLUX 3 lista seu nível de imagem como "em breve", sem endpoint para chamar, e oferece um endpoint de vídeo precificado e disponível de forma geral.

Arquitetura — O Qwen-Image 2.1 é um DiT de fluxo único de 32 camadas com 7B de parâmetros no componente de geração visual, um codificador de texto Qwen3-VL 8B e um VAE RGBA de 64 canais com compressão espacial de 16×. O FLUX 3 é um modelo de fluxo unificado único treinado conjuntamente em imagem, vídeo e áudio, construído sobre um método de correspondência de fluxo auto-supervisionado que a BFL chama de Self-Flow, com um nível de previsão de ações desenvolvido em conjunto com a Mimic Robotics.

Transparência nativa — O Qwen-Image 2.1 gera e edita imagens RGBA, edita texto dentro de camadas transparentes e extrai sujeitos de fotografias RGB para camadas transparentes, incorporando o recurso que a Alibaba lançou separadamente como Qwen-Image-Layered em dezembro de 2025. A BFL não publicou nenhuma alegação de transparência para o FLUX 3 Image.

Imagens de referência — O Qwen-Image 2.1 aceita até 10 referências de entrada, com edição local por círculo, anotação pintada ou uma máscara separada. Não existe nenhum número publicado para o FLUX 3 Image.

Resolução — O Qwen-Image 2.1 é nativo em 2K, com padrão de 2048×2048 em 40 etapas de inferência, e sete predefinições de proporção documentadas. As resoluções do FLUX 3 Image são descritas no anúncio apenas como "amplas", sem nada publicado.

Preço — não há preço publicado para nenhum dos dois. Qwen-Image 2.1 não tem tarifa de hospedagem listada no momento da redação; FLUX 3 Image não tem tabela de preços porque não tem endpoint. O único preço do FLUX 3 que existe é o de vídeo, a US$ 0,06 por segundo em rascunho, US$ 0,17 por segundo em HD e US$ 0,29 por segundo em FHD.

Licença — Contrato de Licença de Investigação Qwen, apenas para uso não comercial; o uso comercial requer pedido separado. Os termos de licença do FLUX 3 para o nível de imagem não foram publicados de forma alguma.

Uma assimetria merece uma linha própria, porque é a armadilha neste confronto. O FLUX 3 tem, sim, números de benchmark publicados — um Elo interno de 1.135 para texto para vídeo e taxas de vitória por preferência humana relatadas contra Grok Imagine Video, Seedance 2.0, Gemini Omni Flash, Runway Gen-4.5 e Luma Ray 3.2. Cada um desses números descreve o nível de vídeo. Nenhum deles se transfere para a geração de imagens, e a própria BFL não publicou benchmarks de imagem nem taxas de vitória. Citar um Elo de vídeo do FLUX 3 como evidência sobre a qualidade de imagem do FLUX 3 é o erro mais fácil de cometer nesta comparação.

A generated two-column comparison scoreboard titled 'Qwen-Image 2.1 vs FLUX 3 — the scoreboard'. Left column 'Qwen-Image 2.1': rows reading Status: released 20 Sep 2026; Callable today: local, five frameworks; Architecture: 7B, 32-layer DiT; Transparency: native RGBA; Reference images: up to 10; Price: none published; Licence: research, non-commercial. Right column 'FLUX 3': rows reading Status: announced 23 Jul 2026; Callable today: video only; Architecture: unified flow model; Transparency: none claimed; Reference images: not published; Price: video $0.06-$0.29 per second; Licence: not published for image. Footer reads 'Qwen-Image 2.1 figures per the vendor model card, unaudited; FLUX 3 image tier has published no figures at all.'

O que cada lado pode realmente mostrar

Coloque as evidências lado a lado e a assimetria se inverte em relação à seção anterior.

O FLUX 3 tem um produto lançado, com preço definido e disponibilidade geral — só que não é o que está no título deste artigo. O FLUX 3 Video gera clipes de até 20 segundos com áudio sincronizado numa única passagem, suporta texto para vídeo, imagem para vídeo, vídeo para vídeo, keyframe para vídeo e continuação generativa, e já está em fase de testes pela Canva, Burda, Magnific, Krea e Picsart. Esse é um sistema real, implementado, com uma lista real de clientes. A camada de imagem é a parte que ainda não chegou, e a indicação original da BFL de que viria "nas próximas semanas" já passou de dois meses completos sem um endpoint público.

Qwen-Image 2.1 tem o perfil oposto. As suas alegações de qualidade vêm do próprio gráfico de comparação Qwen-Image-Bench do fornecedor, e nenhum terceiro as reproduziu. Mas a coisa em si está nas suas mãos: 33 GB de pesos, uma estrutura de repositório ao estilo Apache com um ficheiro de licença que é honesto ao afirmar que é apenas para investigação, e um caminho de serviço desde o primeiro dia em cinco frameworks. Há também uma análise prática de acesso antecipado, de um testador que executou os pesos finais através de uma interface ModelScope Studio e relatou aproximadamente 10–15 segundos para texto-para-imagem e 18–23 segundos para edição, um forte comportamento de pré-definições de câmara e atribuição de funções multi-personagem, e consistência multi-referência a começar a degradar-se a partir de cerca de três imagens de entrada. Um revisor, sem cronómetro, sem conjunto de prompts publicado. Direcionalmente útil, formalmente não verificado.

O resumo honesto das evidências: o Qwen-Image 2.1 tem um modelo executável e nenhum dado independente de qualidade; o FLUX 3 Image tem alegações do fornecedor e nem um modelo executável nem qualquer dado de imagem. Se a sua pergunta é "em qual deles eu deveria planejar um pipeline?", a resposta hoje é nenhum dos dois, e o motivo é diferente.

A screenshot of the Black Forest Labs FLUX 3 model page, captured September 20 2026, showing the FLUX 3 family overview with the Video tier marked as generally available and the Image tier listed as coming soon, alongside the FLUX 3 Video per-second pricing tiers.

Onde a solução alternativa realmente está

Para uma equipe comercial, o impedimento do Qwen-Image 2.1 tem contornos que permitem planejar. A licença é explícita, o contato para licenciamento comercial está indicado no repositório, e o modelo é pequeno o suficiente — 7B no componente de geração — para que o custo de avaliá-lo no seu próprio hardware seja medido em uma tarde, não em um trimestre. Avalie primeiro, negocie depois e, nesse meio-tempo, mantenha a build de pesquisa fora de qualquer caminho voltado ao cliente. Isso é um problema normal de aquisição.

O bloqueio do FLUX 3 Image não é um problema de aquisição, porque não há nada para adquirir. Você pode entrar numa fila de acesso antecipado e pode ficar atento ao aparecimento do endpoint, e essa é toda a ação disponível. Se você precisa de geração de imagens da família FLUX em produção hoje, as opções disponíveis para chamada são as linhas mais antigas FLUX.2 e FLUX Pro/Dev, que estão precificadas e disponíveis — e que são uma geração de modelo diferente da que este artigo aborda.

Para uma equipe que quer testar os dois candidatos sem comprometer nenhum deles com um caminho de produção, é exatamente para isso que a camada de roteamento existe. O OrcaRouter coloca mais de 200 modelos atrás de um único endpoint compatível com a OpenAI, pelo preço de tabela do provedor e sem nenhuma margem, com failover automático entre provedores, de modo que um modelo não comprovado ou ainda não lançado fica atrás de uma rota ao lado de algo em que você já confia, em vez de substituí-lo — e, como o preço de tabela é repassado, qualquer mudança de preço do fornecedor em um modelo roteado entra em vigor no mesmo dia. Nem o Qwen-Image 2.1 nem o FLUX 3 Image são roteáveis no momento em que escrevemos, e não vamos fingir o contrário; o que roteamos é a linha de imagem em torno deles, incluindo a família GPT-Image da OpenAI, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, além do endpoint de imagem Grok Imagine da xAI. Esses são os modelos capazes de sustentar uma carga de trabalho enquanto esses dois se ajeitam.

Mais uma coisa que vale a pena observar especificamente no lado da Qwen. A Alibaba lançou o Qwen-Image 1.0 e o 2.0 como pesos abertos sob Apache-2.0, depois lançou o Qwen-Image 3.0 em julho de 2026 como um modelo hospedado totalmente fechado, sem pesos, sem licença e sem relatório técnico, e então lançou o Qwen-Image 2.1 em setembro como pesos abertos sob uma licença apenas para pesquisa. A direção do percurso não é uma linha reta, e os termos da licença na próxima versão são uma verdadeira questão em aberto, e não uma suposição segura em qualquer das direções.

A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 20 2026, showing the 2026/09/20 date, the headline 'Compact, Efficient, and Unified Image Creation', the 'Now open weights' hero banner, GitHub, Hugging Face and ModelScope buttons, and the 7B parameter figure.

O veredito, tal como é

Se você é um pesquisador ou uma equipe de avaliação interna, o Qwen-Image 2.1 é o mais útil dos dois neste momento, com ampla vantagem — ele pode ser baixado, tem documentação, tem suporte de frameworks e é transparente quanto aos seus termos. Se você é uma equipe comercial, ambos estão bloqueados, e os bloqueios não são equivalentes: um é um contrato sobre o qual você pode iniciar uma conversa; o outro é um produto que ainda não existe.

Se você precisa colocar a geração de imagens em produção este mês, nenhum dos dois é a resposta, e a pergunta útil é qual dos modelos que você pode chamar te leva mais perto. Isso é um exercício de benchmark, e vale a pena fazê-lo com seus próprios prompts, e não com o gráfico de lançamento de qualquer um — incluindo o do fornecedor e incluindo este.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente