
Qwen-Image 2.1 vs LLaDA-Image-Turbo: Dois Modelos de Imagem Abertos, Duas Licenças Muito Diferentes
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Dois modelos de imagem de pesos abertos surgiram dentro do mesmo período de três semanas. A equipe do Qwen-Image publicou Qwen-Image 2.1 em 20 de setembro de 2026 — pesos, arquivo de licença, ficha do modelo e um post de blog, tudo no mesmo dia, com quase nenhuma antecedência. Dezesseis dias antes, em 4 de setembro de 2026, a inclusionAI (o laboratório de pesquisa do Ant Group) publicou LLaDA-Image-Turbo sem post de lançamento, sem comunicado de imprensa e sem nenhum tipo de anúncio. Ambos podem ser baixados hoje. Nenhum dos dois tem uma única pontuação de benchmark independente. E a diferença que realmente vai decidir qual dos dois você pode usar não está em nenhuma das fichas de modelo — está na papelada. O Qwen-Image 2.1 é distribuído sob uma licença de pesquisa que proíbe terminantemente o uso comercial. O LLaDA-Image-Turbo é distribuído sem nenhuma licença declarada em nenhum de seus repositórios.
A questão da licença vem primeiro, porque é a única com uma resposta clara.
Comece por aqui, porque tudo o resto nesta comparação é provisório e isto não.
• Qwen-Image 2.1é lançado sob o Contrato de Licença de Pesquisa Qwen, datado de 20 de setembro de 2026, que concede direitos "APENAS PARA FINS NÃO COMERCIAIS" e afirma que o uso comercial exige uma licença separada solicitada ao fornecedor. Trata-se de uma alteração substancial em relação à linha anterior do Qwen-Image, que era distribuída sob a Apache 2.0. É inequívoco: você pode lê-lo, avaliá-lo, submetê-lo a benchmarks e escrever sobre ele. Você não pode colocá-lo em um produto.
• LLaDA-Image-Turbo não declara licença alguma. Não uma permissiva, nem uma restritiva, nem um placeholder. Um repositório sem licença não é "livre para usar" em nenhum sentido legal — todos os direitos são reservados por padrão, o que é uma posição mais restritiva do que a licença de pesquisa da Qwen, não mais permissiva. Se você planeja construir sobre ele, isso é uma questão para o laboratório, não para um README.
Vale a pena afirmar a ironia sem rodeios: o modelo que surgiu com uma licença formal e restritiva é aquele com o qual você pode planejar hoje, porque sabe exatamente onde está. O modelo sem licença é aquele com o qual você não pode.

O que os dois modelos realmente são
Deixando de lado o licenciamento, estes são dois designs genuinamente diferentes, criados por razões diferentes.
• Arquitetura — O Qwen-Image 2.1 é um transformer de difusão de fluxo único de 32 camadas com 7B de parâmetros no componente de geração visual, um codificador de texto Qwen3-VL 8B e um VAE RGBA de 64 canais com compressão espacial de 16×, totalizando cerca de 33 GB no pacote. O LLaDA-Image-Turbo é um modelo unificado de geração e edição de 6B — um único conjunto de pesos desempenhando ambas as funções, em vez de um modelo base mais um caminho de edição separado.
• Etapas de inferência — O Qwen-Image 2.1 usa 2048×2048 por padrão, com 40 etapas, flow matching e agendamento discreto de Euler. O LLaDA-Image-Turbo é destilado via Twin-DMD para 2–4 etapas, sendo 4 o valor recomendado, e opera com escala de orientação 1.0, em contraste com 5.0 do modelo Base.
• Opções de precisão — O Qwen-Image 2.1 disponibiliza suporte à quantização FP8 por meio de seu caminho vLLM-Omni. O LLaDA-Image-Turbo oferece checkpoints BF16 e FP8 como downloads separados.
• Condicionamento por referência — O Qwen-Image 2.1 aceita até 10 imagens de referência, oferece suporte a edições locais por círculo, anotação pintada ou uma máscara separada, e gera RGBA nativo com edição de camada transparente. O cartão do LLaDA-Image-Turbo não publica um limite de imagens de referência.
• Atenção — O Qwen-Image 2.1 usa atenção causal em blocos: uma máscara causal em nível de token para texto e uma máscara bidirecional em nível de chunk para geração de imagens, com reutilização do cache KV de prefixo quando o checkpoint contém causal_condition: true. O card do LLaDA-Image-Turbo não descreve seu esquema de mascaramento com o mesmo detalhe.
• Licença — apenas para pesquisa e explícita, versus não declarada.
Observe o que as contagens de passos significam em conjunto com as contagens de parâmetros. O Qwen-Image 2.1 é um modelo maior executado por dez vezes mais passos; o LLaDA-Image-Turbo é um modelo menor destilado até um punhado de passos. Essas são apostas opostas sobre onde reside o custo da geração de imagens, e a resposta certa depende inteiramente de seu gargalo ser segundos de GPU por imagem ou o teto do que uma imagem pode parecer.
Economia de velocidade: 40 etapas contra 4
O nome Turbo está fazendo um trabalho de verdade aqui. A destilação Twin-DMD colapsa uma trajetória de difusão em alguns grandes saltos, e é por isso que o LLaDA-Image-Turbo pode ser executado em 4 passos, enquanto seu modelo Base exige um cronograma convencional. Com guidance 1.0, ele também ignora a orientação sem classificador, que normalmente dobra o número de passagens diretas por passo — então a diferença efetiva é maior do que 40 versus 4 sugere por si só.
O que isso lhe proporciona é throughput e previsibilidade. Um modelo 6B em quatro passos é o tipo de coisa que cabe em uma única placa de consumidor e produz uma imagem de rascunho rápido o suficiente para se encaixar em um loop interativo. O Qwen-Image 2.1 com 40 passos e 2048×2048 é uma configuração com foco em qualidade; a recomendação do próprio model card para hardware limitado é o offload para CPU via pipe.enable_model_cpu_offload(), que é uma válvula de escape em vez de uma correção.
O contrapeso é que a destilação é uma compressão de capacidade, e nada aqui foi medido por ninguém fora dos dois laboratórios. O único dado independente que existe para qualquer um dos dois modelos é uma avaliação prática de acesso antecipado do Qwen-Image 2.1, feita por um testador do programa Qwen Ambassador, que executou os pesos finais por meio de uma interface do ModelScope Studio e relatou cerca de 10 a 15 segundos para texto para imagem e 18 a 23 segundos para edição. Trata-se de um único avaliador, em uma interface de acesso antecipado, sem cronômetro exibido — um sinal útil, não um benchmark. O LLaDA-Image-Turbo não tem nenhum relato prático comparável em público.

A edição é onde os dois designs mais divergem.
Os dois modelos fazem texto para imagem e edição, mas chegam lá de formas diferentes, e a diferença aparece na mecânica interna, e não no resultado.
O Qwen-Image 2.1 trata o cumprimento de instruções como um componente separado e inspecionável. Juntamente com o modelo de imagem, o lançamento inclui dois checkpoints de reescrita de prompt — Qwen/Qwen-Image-2.1-PE-T2I e Qwen/Qwen-Image-2.1-PE-I2I, cada um deles um Qwen3.5-VL 9B ajustado com cerca de 18,8 GB — que pegam uma instrução vaga e a reescrevem como uma diretiva inequívoca antes que o modelo de difusão a veja. A variante I2I sempre tem uma imagem de entrada, portanto é sempre uma tarefa de edição e nunca de geração a partir do nada. Fundamentalmente, o reescritor vem com um system_prompt.txt que você pode ler e sobrescrever, e ele é excepcionalmente explícito quanto ao idioma: o idioma da descrição segue a sua instrução, enquanto o idioma do texto pintado na imagem é decidido por uma ordem de prioridade estrita que preserva o idioma do rótulo existente da imagem de entrada mesmo quando você escreve o prompt em um idioma diferente.
Isso é uma pequena peça de engenharia com um grande raio de impacto. Se você está produzindo imagens de produto para um mercado onde o texto da embalagem importa, "o reescritor preserva o idioma existente do rótulo" e "o reescritor, prestativamente, traduz tudo para o inglês" são a diferença entre um ativo utilizável e um rejeitado — e, como ele vive em um prompt de sistema em vez de dentro de uma caixa-preta hospedada, você pode comparar as diferenças e alterá-lo.
LLaDA-Image-Turbo faz a troca oposta: um modelo de 6B, um conjunto de pesos, geração e edição compartilhando tudo. Menos peças móveis, menos para configurar e nada para inspecionar ou sobrescrever. A sua ficha cita números do Qwen-Image-Bench de 53,53 em inglês e 53,38 em chinês com uma alegação de SOTA de código aberto — relatado pelo fornecedor, não reproduzido, e observe que o benchmark que ele está vencendo tem o nome do modelo com o qual ele está implicitamente competindo.
Em que você realmente os executaria
O suporte ao ecossistema no dia do lançamento é a parte menos glamourosa de um lançamento e a parte que decide se você gasta uma tarde ou um fim de semana.
• Qwen-Image 2.1 foi lançado amplamente: um QwenImage21Pipeline foi integrado ao Diffusers no dia zero; suporte nativo ao ComfyUI com modelos de fluxo de trabalho de texto para imagem e edição de imagem; vLLM-Omni com execução passo a passo, cache KV de prefixo, decodificação com CUDA Graph, quantização FP8 e paralelismo tensor/Ulysses; um pull request de suporte nativo ao SGLang que chegou em 17 de setembro — três dias antes dos pesos — cobrindo o DiT, o VAE RGBA, o condicionamento Qwen3-VL e entrada de múltiplas referências, validado em H200, B200, RTX PRO 6000, RTX 5090 e RTX 4090; e aceleração no dia zero via LightX2V com AMD Radeon via ROCm e suporte multi-chip via FlagOS.
• LLaDA-Image-Turbo recebeu suporte ao ComfyUI em 7 de setembro de 2026, três dias depois dos pesos, além de uma distribuição Diffusers e Safetensors. Esse é um caminho real para executá-lo, mas é mais estreito, e não há trabalho equivalente de serving em pré-lançamento ao qual apontar.
O pull request de pré-lançamento do SGLang é o indício para o Qwen-Image 2.1. Suporte de framework que chega antes dos pesos significa que alguém estava testando o caminho de serving contra o checkpoint, não o escrevendo a partir do model card depois.

O caminho hospedado que você mantém junto ao experimento
Nenhum desses modelos é roteável pelo OrcaRouter no momento da redação, e este artigo não vai sugerir o contrário — ambos são propostas de auto-hospedagem, um sob uma licença que inviabiliza o uso em produção e outro sem licença alguma. O que importa para uma equipe que os avalia é que a avaliação não precisa ficar no caminho crítico.
O OrcaRouter coloca mais de 200 modelos por trás de um único endpoint compatível com OpenAI, pelo preço de lista do provedor e sem markup, com failover automático entre provedores e uma DSL de roteamento que permite compor vários modelos em uma única chamada. A forma prática disso para esta decisão é uma rota em que o modelo em que você já confia carrega o tráfego de produção enquanto um checkpoint auto-hospedado é testado ao lado dele — e, como o preço de lista é repassado em vez de receber markup, uma mudança de preço de um fornecedor em qualquer modelo roteado entra em vigor do nosso lado no mesmo dia, em vez de esperar por uma emenda contratual. Os modelos de imagem que roteamos hoje são a família GPT-Image da OpenAI, os níveis do Imagen 4 e as prévias de imagem do Gemini, do Google, e o endpoint de imagem Grok Imagine, da xAI. Se você vai passar uma semana montando um transformer de difusão de 33 GB para descobrir se ele supera um modelo hospedado, o modelo hospedado é o grupo de controle, e vale a pena ter o grupo de controle já disponível em uma chave.
O que mudaria esta comparação
Três coisas, em ordem de quanto importariam.
Primeiro, uma pontuação de benchmark independente para qualquer um dos modelos. Nenhum dos dois tem uma, e até que isso mude, toda alegação de qualidade de ambos os lados é um laboratório corrigindo o próprio dever de casa. Segundo, uma licença: uma variante permissiva do Qwen-Image 2.1 o tornaria o padrão óbvio para trabalho aberto com imagens em 7B, e qualquer licença declarada que seja no LLaDA-Image-Turbo ao menos o tornaria planejável. Terceiro, os testadores de acesso antecipado do programa ModelScope da Qwen de 17 de setembro foram solicitados a publicar amostras ou análises até 29 de setembro — daqui a oito dias. É aí que isso deixa de ser uma comparação de dois cartões de modelo e passa a ser uma de verdade. Até lá, o resumo honesto é que o Qwen-Image 2.1 é o modelo com aparência mais capaz que você não pode comercializar, o LLaDA-Image-Turbo é o mais rápido que você não pode usar de forma alguma sem uma conversa, e o arquivo de licença é a única parte de qualquer um dos lançamentos que está totalmente resolvida.
