
Qwen-Image 2.1 vs. Qwen-Image 3.0: o número menor é o modelo mais novo
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Comece pelo ponto que confunde todo mundo. Qwen-Image 2.1 é mais recente que Qwen-Image 3.0. O fornecedor lançou o Qwen-Image 3.0 em 21 de julho de 2026 e o disponibilizou para o público em geral em 5 de agosto. Lançou o Qwen-Image 2.1 em 20 de setembro de 2026 — sete semanas depois, e uma versão minor inferior. A numeração não é uma sequência; são duas linhas de produto diferentes que compartilham um nome, e o fato mais útil sobre qualquer uma delas é que assumem posições opostas na questão que decide se você pode construir sobre elas. O Qwen-Image 3.0 é fechado e hospedado, sem pesos, sem licença e sem relatório técnico. O Qwen-Image 2.1 tem pesos abertos, disponível para download hoje, sob uma licença de pesquisa que permite apenas uso não comercial.
Dois produtos que por acaso compartilham um nome
A família Qwen-Image assumiu agora três posições distintas de licenciamento em catorze meses, e enumerá-las elimina a maior parte da confusão:
• Qwen-Image 1.0 e 2.0 — pesos abertos Apache 2.0 no Hugging Face e no ModelScope, relatórios técnicos no dia do lançamento, auto-hospedável, ajustável com fine-tuning, quantizável.
• Qwen-Image 3.0 — fechado. Sem pesos, sem licença declarada, sem model card, sem relatório técnico, sem tabela de benchmarks publicada. Acessível apenas através de uma API hospedada, nas edições Pro e Standard.
• Qwen-Image 2.1 — pesos abertos novamente, mas sob o Acordo de Licença de Pesquisa Qwen datado de 20 de setembro de 2026, que concede direitos "APENAS PARA FINS NÃO COMERCIAIS" e encaminha o uso comercial para uma licença negociada separadamente.
Leia isso como um padrão em vez de uma linha do tempo e a forma fica clara: a Alibaba não trata mais "aberto" como um binário. O Qwen-Image 2.1 não é nem o lançamento permissivo que 1.0 e 2.0 foram, nem o lançamento fechado que 3.0 foi. É uma terceira posição — pesos que você pode inspecionar, executar e modificar, com um portão comercial parafusado na frente.
O que cada modelo realmente é
• Qwen-Image 2.1 — um modelo unificado de geração de imagem a partir de texto e edição de imagens, com 7B de parâmetros em seu componente de geração visual, construído como um DiT de fluxo único de 32 camadas. Um codificador de texto Qwen3-VL 8B e um VAE RGBA de 64 canais com compressão espacial de 16× ficam ao lado dele; o download completo tem cerca de 33 GB, com o codificador de texto respondendo por mais da metade. Atenção causal em blocos com máscara causal no nível de token para texto e máscara bidirecional no nível de chunk para geração de imagem, além de reutilização de cache KV de prefixo para edição de várias imagens. 2K nativo, com padrão de 2048×2048 em 40 etapas, com sete predefinições de proporção de aspecto.
• Qwen-Image 3.0 — um modelo hospedado fechado nas edições Pro e Standard, que oferece geração e edição de imagens por meio de uma única API. O material de lançamento da Alibaba afirma prompts de até cerca de 4.500 tokens, texto legível até aproximadamente 10 pixels e cobertura de 12 idiomas em mais de 20 fontes, com saída de até 2048×2048 e até seis imagens por chamada. Nenhuma contagem de parâmetros foi publicada; a cifra de ~20B MMDiT amplamente repetida é noticiada, não confirmada.
A diferença arquitetural que mais importa na prática não é o tamanho — é onde o modelo é executado e o que você pode fazer com ele. O Qwen-Image 2.1 chega como arquivos que você pode inspecionar, quantizar, ajustar com fine-tuning em dados privados e executar no seu próprio hardware, com um pull request de suporte ao SGLang mesclado três dias antes mesmo de os pesos chegarem. O Qwen-Image 3.0 chega como um endpoint. Você não pode quantizá-lo, não pode fazer fine-tuning nele e não pode executá-lo em nenhum outro lugar além de onde a Alibaba o executa.
A edição é onde os dois divergem de forma mais acentuada
Ambos os modelos fazem geração e edição em um único sistema, então a comparação interessante está nos detalhes da edição — e aqui o modelo mais novo e menor é o mais capaz no papel.
• Imagens de referência — O Qwen-Image 2.1 aceita até 10 referências de entrada. A documentação do Qwen-Image 3.0 Pro descreve suporte a 1–3 imagens de entrada.
• Controle de edição local — O Qwen-Image 2.1 oferece suporte a círculos, anotações pintadas e uma máscara separada fornecida como entrada própria, para que a imagem original permaneça sem marcações. O caminho de edição documentado do Qwen-Image 3.0 abrange reescrita local, expansão de conteúdo, transferência de estilo e geração com múltiplos ângulos de câmera, sem um fluxo de trabalho publicado baseado em máscara.
• Transparência — O Qwen-Image 2.1 gera e edita imagens RGBA nativamente, edita texto dentro de uma camada transparente e extrai um sujeito de uma fotografia RGB para uma camada transparente. O anúncio do Qwen-Image 3.0 não faz qualquer menção à transparência.
• Reescrita de prompt — O Qwen-Image 2.1 inclui dois checkpoints de reescrita dedicados, ambos modelos Qwen3.5-VL 9B com ajuste fino, um para texto para imagem e outro para edição, com o código de reescrita e o prompt de sistema publicados. O tratamento de prompt do Qwen-Image 3.0 é uma caixa-preta atrás da API.
• Ecossistema — O Qwen-Image 2.1 tem suporte desde o primeiro dia no Diffusers, ComfyUI, vLLM-Omni, SGLang e LightX2V, além de caminhos AMD ROCm e FlagOS. O Qwen-Image 3.0 tem uma API.
Essa última linha não é um floreio retórico. Para uma equipe cujo pipeline vive no ComfyUI ou cuja pilha de inferência é o vLLM, a diferença entre um modelo com uma classe de pipeline mesclada e um modelo com um endpoint HTTP é a diferença entre uma tarefa de integração e uma reescrita.

Preço, e aquilo que o preço não captura
O Qwen-Image 3.0 tem o único preço publicado entre os dois: na nuvem do fornecedor, o Pro está listado em cerca de US$ 0,04 por imagem e o Standard em cerca de US$ 0,03, com preços ao consumidor no mercado interno começando perto de ¥0,18. Esses são valores de lançamento e não foram auditados de forma independente. O Qwen-Image 2.1 não tem nenhuma tarifa hospedada publicada — é um download, e o custo é aquilo que o tempo da sua própria GPU custar.
Essas duas linhas não são comparáveis, e fingir o contrário é o erro mais comum neste confronto. Um preço por imagem cobre o modelo, a infraestrutura de serving, a escalabilidade e o uptime de outra pessoa. Um download de pesos não cobre nada disso. A pergunta certa não é qual número é menor; é se tem capacidade operacional para executar uma stack de modelos de 33 GB, e se a licença do lado mais barato permite aquilo que planeia fazer com o modelo.
O que traz a licença de volta ao centro da comparação, onde ela pertence. Os termos do Qwen-Image 3.0 não são publicados, o que é um problema em si para trabalhos regulados ou de agência — não há documento para citar. Os termos do Qwen-Image 2.1 estão publicados, e indicam uso não comercial. Entre uma licença pouco clara e uma claramente restritiva, a claramente restritiva é mais fácil de planejar, porque pelo menos você sabe qual conversa precisa ter.

Por qual deles você deve optar
• Você precisa de imagens de produção com muito texto e quer que outra pessoa cuide disso — o Qwen-Image 3.0 é a escolha certa, com a ressalva de que seus números de destaque para renderização de texto são alegações do fornecedor e os testes independentes existentes descrevem texto em fontes pequenas ainda saindo embaralhado em alguns casos.
• Você precisa executar o modelo por conta própria, ajustá-lo ou manter os dados no seu próprio hardware — o Qwen-Image 2.1 é a única opção entre as duas, e a licença de pesquisa é o preço de entrada.
• Você precisa de ativos transparentes, recortes de produtos ou mais de três imagens de referência — pelas especificações publicadas, o Qwen-Image 2.1 é a ferramenta mais forte, e não há comparação possível em relação ao número de referências.
• Você precisa de direitos comerciais e de licenciamento permissivo — nenhum dos dois se aplica ao seu modelo. O Qwen-Image 3.0 não tem termos publicados, e o Qwen-Image 2.1 exige uma licença comercial negociada. As versões sob Apache-2.0 nesta família são o Qwen-Image 1.0 e o 2.0, anteriores.
Essa última linha é a que merece uma pausa para reflexão, porque descreve um conjunto que está encolhendo. Uma licença já concedida não muda retroativamente, de modo que os lançamentos do Apache-2.0 Qwen-Image continuam utilizáveis nos seus termos originais. Mas, se você está planejando um pipeline comercial de imagens com base na suposição de que o Qwen-Image mais recente terá uma licença permissiva, os últimos três lançamentos são evidências contra essa suposição.
Executando qualquer um deles sem apostar o pipeline nisso
Ambos estes modelos são, por razões diferentes, incômodos de colocar atrás de um caminho de produção hoje — um por causa de uma licença, outro por causa de uma caixa-preta e de uma contagem de parâmetros não publicada. É precisamente para essa situação que uma camada de roteamento é construída. O OrcaRouter coloca mais de 200 modelos atrás de um único endpoint compatível com a OpenAI, ao preço de tabela do fornecedor e sem margem adicional, com failover automático entre fornecedores e uma DSL de roteamento que permite compor vários modelos em uma única chamada, para que um modelo novo ou incômodo possa ficar ao lado de um já comprovado, em vez de à frente dele. A fusão de modelos leva a mesma ideia mais longe, executando um painel de modelos em conjunto e permitindo que você os compare com seus próprios prompts, em vez de em um gráfico de lançamento.
Nem o Qwen-Image 2.1 nem o Qwen-Image 3.0 estão entre os modelos que roteamos hoje, e este artigo não sugerirá o contrário. Os modelos de imagem que roteamos — a linha GPT-Image da OpenAI, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI — são aquilo a partir do que um caminho de failover seria realmente construído enquanto você avalia o par Qwen conforme seus próprios critérios.
O que observar é mais restrito do que parece. A Alibaba já demonstrou que vai disponibilizar pesos abertos, modelos hospedados fechados e downloads licenciados para pesquisa dentro da mesma família no mesmo trimestre. O próximo lançamento não dirá qual padrão venceu. O arquivo de licença dirá.

