
Ming-Image-0.1-Design vs Qwen-Image 2.1: A Licença É a Verdadeira Diferença
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Dois modelos de imagem abertos chegaram com três dias de intervalo em setembro de 2026 e, quando lidos em uma ficha técnica, parecem a mesma compra. Ming-Image-0.1-Design, criado pela equipe inclusionAI do Ant Group, disponibilizou seus pesos no Hugging Face em 17 de setembro sob uma licença MIT. Qwen-Image 2.1, da equipe Qwen da Alibaba, veio depois, em 20 de setembro, sob o Qwen Research License Agreement. Ambos emitem RGBA nativo, ambos alegam saída 2K, e ambos são destinados ao mesmo comprador: uma equipe que quer geração de imagem que ela mesma possa hospedar, inspecionar e modificar. As duas coisas que realmente os separam são as duas que uma ficha técnica é pior em mostrar — o que você tem permissão legal de fazer com o resultado, e quanto poder computacional é necessário para produzir uma imagem.
Isso não é um enquadramento retórico. Para um desses modelos, a licença é um bloqueio total ao uso comercial; para o outro, não é problema algum. E a contagem de parâmetros que cada fornecedor imprime na caixa subestima o download por um fator de três ou quatro. Esses dois fatos decidem a compra muito antes de qualquer benchmark o fazer — e os benchmarks, por sinal, não podem ser comparados de modo algum.
O que cada repositório realmente contém
Nenhum dos modelos é uma única rede. Ambos são pipelines, e é no pipeline que está o tamanho:
• Gerador — Ming-Image-0.1-Design vem com um transformer de design de 6,15 bilhões de parâmetros (12,31 GB em BF16); Qwen-Image 2.1 vem com um DiT de fluxo único de 7,1 bilhões de parâmetros, com 32 camadas, atenção causal em bloco e um número não divulgado de parâmetros ativos (cerca de 14,2 GB).
• Lado do texto — O Ming-Image-0.1-Design combina seu transformer com um LLM multimodal de 17,01B (34,02 GB) e um conector de 3,09B (6,17 GB); o Qwen-Image 2.1 usa um codificador de texto Qwen3-VL 8B (cerca de 17,5 GB).
• Parâmetros totais — 26,44B para Ming-Image-0.1-Design em comparação com cerca de 15–16B para Qwen-Image 2.1. Observe que, para nenhum dos fornecedores, o número de destaque é o total: "6B" e "7B" descrevem apenas o gerador.
• Tamanho do repositório — 52,88 GB para Ming-Image-0.1-Design (49,25 GiB disso são pesos); cerca de 33 GB para Qwen-Image 2.1.
• Transparência — ambos geram RGBA nativo diretamente do modelo, em vez de por meio de uma etapa de matting posterior. Ming-Image-0.1-Design usa seu próprio VAE RGBA; Qwen-Image 2.1 usa um VAE RGBA de 64 canais com compressão espacial de 16×.
• Geração padrão — Ming-Image-0.1-Design é validado em 2048×2048, 12 passos, BF16, CFG 1.0; Qwen-Image 2.1 usa por padrão 2048×2048 em 40 passos com sete predefinições de proporção.
• Licença — MIT para Ming-Image-0.1-Design; o Qwen Research License Agreement, não comercial, para o Qwen-Image 2.1.
O rótulo "6B" está fazendo um trabalho e tanto
O repositório do Ant Group tem no título um modelo de 6 bilhões de parâmetros, e o transformer na verdade tem 6,15B. Mas os pesos que você baixa são 49,25 GiB, o repositório tem 52,88 GB, e a configuração validada pelo fornecedor — 2048×2048 em BF16 com o stack de texto completo residente — é especificada para uma GPU CUDA de 80 GiB. Isso não é um erro de arredondamento em uma placa de 48 GB; é uma placa que você não pode usar. Um acelerador de 48 GB não comportará o pipeline, e nem dois deles, sem malabarismos de offload que o fornecedor não documenta.
O Qwen-Image 2.1 é o download mais tolerante, com a ressalva de que a Alibaba não publica nenhum número oficial de VRAM. A única orientação do cartão do modelo é ativar o offload de CPU em placas menores. O que foi medido desde o lançamento é mais útil do que o que foi publicado: um pipeline int8 roda em torno de 16 GiB no total e cabe totalmente residente numa placa de 24 GB, enquanto uma execução completa em BF16 foi relatada desde cerca de 17 GB com offload de CPU até aproximadamente 40 GiB de pico em 1024×1024, dependendo de como o codificador de texto é posicionado. A latência relatada por imagem única varia de alguns segundos numa B200 a menos de dez numa placa de workstation atual. Trate cada um desses números como medição da comunidade, e não como especificação — eles variam com a estratégia de offload mais do que os modelos diferem entre si.
Resumo prático: o Qwen-Image 2.1 é um modelo de classe 3090 se você estiver disposto a fazer offload; o Ming-Image-0.1-Design é um modelo de classe datacenter sem configuração menor.
A licença é a bifurcação na estrada
Esta é a parte que realmente fará um projeto parar, e é a parte que as duas versões tratam de forma mais diferente.
Ming-Image-0.1-Design é MIT. Lance-o em um produto pago, faça ajuste fino nele, redistribua os pesos, mantenha suas alterações fechadas — nada disso exige uma conversa com a Ant Group.
Qwen-Image 2.1 não é. Ele traz o Acordo de Licença de Pesquisa Qwen, datado de 20 de setembro de 2026, que licencia os pesos apenas para pesquisa e avaliação. O uso comercial exige um acordo separado com a Alibaba, e nenhum preço para esse acordo é publicado. Derivados e redistribuições devem incluir a licença, um aviso "Built with Qwen" ou "Improved using Qwen" e a linha de direitos autorais do Hangzhou Tongyi Laboratory, e "Qwen" não pode ser o nome principal de um modelo derivado. A licença é regida pela lei chinesa, com jurisdição em Hangzhou.
Há um ponto genuinamente esclarecedor na própria mensagem de acompanhamento do fornecedor: a Alibaba declarou que as imagens geradas não fazem parte dos "Materiais" licenciados, portanto você mantém os direitos sobre o que o modelo produz. A restrição se aplica aos pesos e ao modelo, não ao seu resultado. Isso é uma exceção significativa e vale a pena lê-la com precisão, porque o resumo fácil — "as imagens são suas, o modelo não" — é o correto.
É também uma mudança de direção. Versões anteriores do Qwen-Image, incluindo o Qwen-Image original e as builds 2511 e 2512, permanecem Apache 2.0 e permissivas para uso comercial. Uma equipe que escolheu o Qwen-Image no ano passado por causa de sua licença e atualiza para a 2.1 este mês herda uma restrição de uso apenas para pesquisa com a qual nunca concordou. Se termos permissivos são o requisito, o Qwen-Image 2.1 não é a versão mais nova do que você tinha — é um acordo diferente.
O que cada um foi projetado para fazer
A divisão entre as licenças reflete uma diferença de intenção, e é essa diferença que deve orientar a escolha quando ambas são opções legais para você.
Ming-Image-0.1-Design é uma ferramenta de design. O text stack existe para expandir um briefing curto em um prompt estruturado de 8K, e o fornecedor distribui "skills" em torno dele — uma Design Skill que produz um rascunho visual em cerca de 15 segundos, e uma PPT Skill voltada para saída em formato de slides. Seu repositório complementar, Ming-Image-0.1-Design-Layer, pega um design achatado e o retorna como camadas separadas, que é a única capacidade aqui que nada mais no campo aberto oferece. A inclusionAI relata o modelo Layer rodando cerca de 4,3× mais rápido que um modelo aberto de camadas de 20B na mesma tarefa (183 segundos contra 795) — relatado pelo fornecedor, não reproduzido, e o alvo da comparação não é nomeado com precisão suficiente para verificação.
O Qwen-Image 2.1 é um gerador e editor. Um único checkpoint faz tanto texto para imagem quanto edição baseada em instruções, aceita até 10 imagens de referência para uma única edição e oferece suporte a edições locais que deixam o restante do quadro intacto. Ele foi lançado com suporte no dia zero no ComfyUI, Diffusers, vLLM-Omni, SGLang-Diffusion e LightX2V — um panorama de serving que o Ming-Image-0.1-Design ainda não tem, já que seu próprio guia de serving aponta para o vLLM-Omni.
Leia isso como uma bifurcação, e não como um ranking. Se a tarefa for "produzir um asset de design em camadas e editável a partir de um briefing", Ming-Image-0.1-Design é o único dos dois que faz isso. Se a tarefa for "gerar e depois editar iterativamente com base em referências", Qwen-Image 2.1 faz isso em um único modelo, e Ming-Image-0.1-Design não faz isso de forma alguma.
Os benchmarks não se comparam, e essa é a resposta honesta.
Ambos os fornecedores têm números. Nenhum dos números pode ser colocado ao lado do outro, e qualquer artigo que o faça está inventando um resultado.
A evidência do Ming-Image-0.1-Design é um painel da Artificial Analysis: primeiro lugar no Text-to-Image Leaderboard filtrado para pesos abertos para UI/UX Design, com um Elo de 1.082, à frente do Ideogram 4.0 Quality, com 1.052, do Ideogram 4.0, com 1.015, do HunyuanImage 3.0 Instruct, com 1.005, e do FLUX.2 [dev], com 1.000. O fornecedor também relata taxas de vitória de 67,4% em layout, 67,0% em composição complexa e 66,7% em renderização de texto, e primeiro lugar em 12 métricas no Crello. O leaderboard é um instrumento de terceiros, o que torna o Elo o mais forte dos dois tipos de evidência aqui; as taxas de vitória e o domínio no Crello são relatados pelo fornecedor e devem ser lidos como alegações.

A evidência do Qwen-Image 2.1 é o Qwen-Image-Bench, um benchmark criado pela própria equipe do Qwen, no qual ele alcança 60,28 e lidera o campo de código aberto, à frente do Nano Banana 2.0, com 59,82, e do GPT Image 1.5, com 59,65. O material de origem deixa claro que o benchmark foi criado pela Qwen, e os três primeiros colocados estão a menos de um ponto uns dos outros — uma diferença que está bem dentro da margem de ruído de um benchmark cujo autor também é concorrente nele.
Então: um Elo de terceiros em um subconjunto de design de UI/UX, contra uma pontuação geral criada pelo fornecedor. Instrumentos diferentes, tarefas diferentes, juízes diferentes. Ninguém publicou uma comparação direta desses dois modelos entre si e, com as evidências disponíveis, ninguém pode fazê-lo. A leitura útil é restrita e vale a pena dizer com clareza — o Ming-Image-0.1-Design tem corroboração de terceiros especificamente em trabalho de design, o Qwen-Image 2.1 tem força relatada pelo fornecedor em geração e edição gerais, e a sobreposição entre essas duas afirmações é menor do que os números de manchete sugerem.
Colocar qualquer um dos dois em um endpoint
Nenhum dos modelos está hoje no catálogo da OrcaRouter. Ming-Image-0.1-Design e Qwen-Image 2.1 são ambos propostas de auto-hospedagem neste momento: os pesos podem ser descarregados e os guias de serving são reais, mas é você mesmo que está a colocar a GPU em funcionamento e, no caso do Ming, essa GPU é uma de 80 GiB. Listamo-los aqui como lançamentos de pesos abertos, não como rotas.
O que vale a pena saber antes de você se comprometer com hardware é quanto a mesma carga de trabalho custa como uma chamada. Nossos modelos de imagem roteados incluem google/gemini-2.5-flash-image, google/gemini-3-pro-image-preview, google/gemini-3.1-flash-image-preview, os três níveis do Imagen 4.0 (fast, standard e ultra), grok/grok-imagine-image e a família GPT-Image — openai/gpt-image-1, openai/gpt-image-1-mini, openai/gpt-image-1.5 e openai/gpt-image-2. Rodar um briefing de design contra um deles por uma semana mostra se a saída de camadas do Ming-Image-0.1-Design é uma capacidade de que você realmente precisa, por uma fração do custo da placa de 80 GiB, e faz isso antes de você descobrir se a licença ou a VRAM seria o obstáculo. Quando você de fato leva um modelo auto-hospedado para um caminho de produção, o mesmo endpoint é onde fica o roteamento — uma chave para mais de 200 modelos, failover automático entre provedores e 0% de markup, então um corte de preço de fornecedor entra no ar do nosso lado no mesmo dia em que é anunciado.

Quem deve escolher qual
Escolha Ming-Image-0.1-Design se o entregável for um recurso de design e não uma imagem: saída em camadas, expansão estruturada de prompt, geração em formato de slides e uma licença que permite vender tudo o que você criar com ele. Reserve orçamento para uma placa robusta e aceite que o ecossistema de serving em torno dele é mais enxuto do que o lado do Qwen. Ele também é o mais útil dos dois se você precisar colocar um número diante de um cliente, porque sua evidência mais forte é o único número de terceiros nesta comparação.
Escolha o Qwen-Image 2.1 se o fluxo de trabalho for gerar e depois editar, se precisar de condicionamento por imagem de referência ou se quiser executar em hardware que já possui. É menor, tem melhor suporte desde o primeiro dia, e sua licença é adequada para o trabalho de pesquisa e avaliação que a maioria das pessoas realmente faz primeiro. Torna-se a escolha errada no momento em que o resultado é comercial e a revisão jurídica é real, porque a única via para uma licença comercial é um acordo direto com a Alibaba e não há preço publicado para planejar.
Não escolha nenhum dos dois, por enquanto, se o que você precisa é de geração de imagens em produção este mês. Ambos são pesos, e pesos são um compromisso de hardware e jurídico antes de serem uma capacidade. A questão de design — a saída em camadas muda o que minha equipe consegue entregar — pode ser respondida primeiro em um endpoint hospedado, e é essa resposta que deve decidir se o cartão de 80 GiB será comprado.
O que assistir
Três coisas mudarão esta comparação. Se Ming-Image-0.1-Design terá um caminho de serving além do seu próprio guia vLLM-Omni, porque essa é atualmente a lacuna entre ele e a lista de cinco frameworks no dia zero do Qwen-Image 2.1. Se a Alibaba associa um preço à licença comercial do Qwen, porque um preço em aberto é a maior incógnita isolada nesta dupla. E se alguém — um laboratório, um avaliador independente ou um fornecedor sem nada a perder — testa estes dois um contra o outro nos mesmos prompts. Até que isso aconteça, o mais próximo de uma comparação justa não é, de modo algum, uma pontuação. É a linha da licença, e Ming-Image-0.1-Design ganha essa de forma inequívoca.

