Cartão de destaque com o texto "Qwen-Image-2.1 vs Grok Imagine Image 2.0" e o subtítulo "Pesos gratuitos contra um ambiente pago" e três linhas: Qwen-Image-2.1 custo zero por imagem, não comercial, Grok Imagine Image 2.0 cerca de US$ 0,02 a US$ 0,06 por imagem, Máscaras de edição e alfa nativo vs imagens de referência, ao lado de um ícone de arquivo e etiqueta de preço.
Guides & Insights

Qwen-Image-2.1 vs Grok Imagine Image 2.0: Pesos Gratuitos Contra um Ambiente Pago

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um deles não custa nada por imagem e vem com uma licença que proíbe a venda do resultado. O outro custa entre dois e seis centavos por imagem, dependendo de onde você o compra, não traz essa restrição e é classificado nos rankings que você realmente pode consultar. Qwen-Image-2.1 tornou-se público em 20 de setembro de 2026 como pesos abertos sob uma licença de pesquisa. Grok Imagine Image 2.0 é o endpoint de imagem pago do fornecedor, distribuído por meio de sua própria API e de uma variedade de provedores terceiros. A escolha entre eles não é de qualidade — é se você quer possuir o modelo ou alugar o ambiente ao seu redor, e o ambiente está fazendo mais trabalho do que o preço sugere.

Quanto custa uma imagem de cada lado

O preço do Qwen-Image-2.1 é zero por imagem e diferente de zero uma única vez. Você baixa cerca de 33 GB — um transformer de difusão de fluxo único de 7B e 32 camadas com cerca de 14 GB, mais um codificador de texto Qwen3-VL 8B que responde pela maior parte do restante — e, depois disso, o custo marginal de uma imagem é a eletricidade para executá-la. Em uma placa com limitações, o model card recomenda o offload para CPU por meio de pipe.enable_model_cpu_offload(), que é a válvula de escape padrão e custa velocidade em vez de dinheiro.

O preço do Grok Imagine Image 2.0 tem o formato oposto. A própria documentação da xAI lista o modelo principal a US$ 0,04 por imagem gerada, com o endpoint base de imagem do Grok Imagine a US$ 0,02 e o nível de qualidade a US$ 0,05. Provedores terceiros ficam numa faixa semelhante, com seus próprios níveis — um lista tarifas fixas de US$ 0,05 para texto-para-imagem e US$ 0,06 para edição, independentemente da resolução ou da configuração de qualidade; outro cota US$ 0,045 fixos tanto em 1K quanto em 2K para seu nível de qualidade; e um terceiro anuncia US$ 0,025 para texto-para-imagem ou edição por referência com até cinco imagens de entrada. Em todo o mercado, isso se estabiliza em cerca de US$ 0,02 a US$ 0,06 por imagem, com o acesso do consumidor incluído no X Premium e no SuperGrok, em vez de cobrado por imagem.

Modelo de custo — O Qwen-Image-2.1 tem um custo fixo de hardware e download, com custo marginal zero por imagem; o Grok Imagine Image 2.0 é puramente marginal, escalando linearmente com o volume para sempre.
Ponto de equilíbrio — o ponto de virada é uma questão de volume que você pode calcular, e ele muda sempre que um provedor altera uma tarifa. Com alguns milhares de imagens por mês, a rota hospedada é trivialmente mais barata do que comprar uma GPU; em alto volume sustentado, a rota local vence em custo e perde em todos os outros eixos.
O que você não pode comprar do lado local — limites de taxa, tempo de atividade e a equipe de operações de outra pessoa. O que você não pode comprar do lado hospedado são os pesos.

O que as tabelas de classificação dizem, e o que não dizem

O Grok Imagine Image 2.0 tem alegações públicas de classificação. O material de lançamento da xAI citou o segundo lugar geral tanto nos rankings Text-to-Image quanto Image Edit Arena em 7 de agosto de 2026, atrás do GPT Image 2 — trata-se de um instantâneo datado e citado pelo fornecedor e deve ser lido como tal. Serviços de monitoramento de terceiros, nas semanas seguintes, o situaram em cerca de segundo em edição de imagens e terceiro em texto para imagem, novamente atrás do GPT Image 2, com valores de Elo na parte baixa da casa dos 1.300 e alguns sites de rastreamento relatando valores mais próximos de 1.173–1.175. A disparidade entre esses números é, por si só, a lição: posições em rankings nessa categoria mudam de semana para semana, e uma classificação sem data associada não é informação.

O Qwen-Image-2.1 não tem classificação alguma. Ele estava ausente dos rankings independentes de imagens quando isto foi escrito. Seu único número de qualidade é o gráfico Qwen-Image-Bench do próprio fornecedor, no qual aparece 60,28 contra Nano Banana 2.0 com 59,82 e GPT Image 1.5 com 59,65 — material do fornecedor, não reproduzido por terceiros. O único ponto de dados genuinamente independente é a verificação funcional publicada junto com o trabalho de integração com o SGLang: a saída PNG transparente passou, o alfa foi preservado em toda a faixa de 0–255, e o PSNR RGBA mediu 60,69 dB em uma única amostra que os autores descrevem explicitamente como uma verificação de correção, e não uma garantia de qualidade.

Então, o placar honesto é este: um modelo tem uma classificação pública que muda e uma alegação do fornecedor atrelada a ela, e o outro tem um scorecard de fornecedor e um teste de integração aprovado. Isso não é uma comparação, e nenhum artigo que afirme o contrário executou os dois.

A two-column board for Qwen-Image-2.1 and Grok Imagine Image 2.0 carrying both sides on one line per dimension: Price model, Licence, Transparency, Ranking evidence, Reference images and Distribution. Footer notes that rankings are time-stamped and move week to week, that the vendor claim is unaudited, and that no head-to-head evaluation of the two exists.

Alpha, e por que é a única assimetria técnica

A transparência do Qwen-Image-2.1 é incorporada ao modelo. Um VAE RGBA de 64 canais com compressão espacial de 16× significa que o canal alfa faz parte do espaço latente cujo ruído está sendo removido, o que lhe proporciona três coisas a partir de um único mecanismo: geração com transparência, edição dentro de uma imagem que já tem transparência sem achatá-la primeiro, e extração do sujeito a partir de uma fotografia RGB comum que retorna alfa em vez de uma máscara rígida. Sem nó de remoção de fundo, sem modelo de matting, sem limpeza de bordas — essa é a alegação do fornecedor, e a verificação funcional do SGLang é a única evidência independente de que o canal é real, e não nominal.

O Grok Imagine Image 2.0 não tem equivalente documentado. Sua superfície publicada é texto para imagem e edição baseada em referência, com níveis de resolução e qualidade e até cinco imagens de entrada em alguns provedores. Se o seu ativo precisa de um sujeito recortado com bordas semitransparentes limpas — cabelo, vidro, fumaça —, você está adicionando uma etapa de matting do lado do Grok e não do lado do Qwen. Se essa etapa custa mais do que a dor de cabeça com licenciamento do outro lado é a verdadeira questão de engenharia, e depende daquilo que você precisa retratar.

Um ambiente de edição versus um checkpoint

Os dois sistemas discordam sobre onde a inteligência de edição deveria residir.

O Grok Imagine Image 2.0 coloca isso como serviço. Você envia uma imagem de referência e uma instrução, o provedor decide o que isso significa, e os níveis de resolução e qualidade são escolhidos a cada solicitação. Não há nada para ler, nada para ajustar e nada para quebrar — o que é uma vantagem genuína para uma equipe que não quer possuir um pipeline de diffusers. É também a razão pela qual o preço varia por provedor para o que é nominalmente o mesmo modelo: você está comprando um ambiente, não apenas pesos.

O Qwen-Image-2.1 coloca isso em checkpoints que você pode inspecionar. Junto com o modelo de imagem, ele traz dois modelos de reescrita de prompt — PE-T2I e PE-I2I, cada um um Qwen3.5-VL 9B com ajuste fino, de cerca de 18,8 GB — com o código de reescrita em uma prompt_rewrite/ pasta e um system_prompt.txt incluído que especifica, entre outras coisas, como o idioma do texto renderizado é escolhido. Esse é um nível de inspecionabilidade que nenhuma API de imagem hospedada oferece. São também 37,6 GB de reescritor além do modelo, o que representa um custo real em disco e tempo de carregamento para um componente que a maioria dos pipelines tratará como opcional.

Superfície de edição — O Qwen-Image-2.1 oferece suporte a edições locais por círculo, anotação pintada ou uma máscara separada, além de edição de camada transparente e extração de sujeito; a edição documentada do Grok Imagine Image 2.0 é orientada por imagem de referência.
Entradas de referência — O Qwen-Image-2.1 aceita até 10 imagens de referência, com um revisor de acesso antecipado relatando que a consistência com múltiplas referências se degrada a partir de cerca de três imagens; vários provedores do Grok documentam até cinco imagens de entrada.
Resolução nativa — O Qwen-Image-2.1 gera nativamente em 2K, com 2048×2048 como padrão em 40 etapas em sete predefinições de proporção; a resolução do Grok Imagine Image 2.0 é uma escolha por solicitação com preço definido pelo provedor.

Distribuição e a licença

É aqui que os dois mais se divergem, e não se trata de uma diferença técnica de forma alguma.

Grok Imagine Image 2.0 está disponível através da API da xAI e através de vários fornecedores terceiros independentes, o que significa concorrência de preços, o que significa que o preço que paga é um preço de mercado e não um preço de tabela. Não é necessário fazer download, nem ter GPU, nem ler qualquer ficheiro de licença, e não há restrições à utilização comercial para além dos próprios termos do fornecedor.

O Qwen-Image-2.1 está disponível de uma única forma: baixá-lo. Ele é distribuído sob o Contrato de Licença de Pesquisa Qwen, datado de 20 de setembro de 2026, que concede direitos apenas para fins não comerciais e afirma que o uso comercial exige uma licença separada, solicitada ao fornecedor. Isso representa um endurecimento em relação à linha Qwen-Image anterior, que era distribuída sob Apache 2.0, e é o único fato que decide a maioria das decisões reais entre esses dois. Um estúdio que os compara pela qualidade da saída está respondendo à pergunta errada; o estúdio que não pode usar o Qwen-Image-2.1 para trabalho de clientes não está comparando os dois de forma alguma.

O OrcaRouter é onde reside o lado alugado desse arranjo. Roteamos mais de 200 modelos por trás de um único endpoint compatível com OpenAI, ao preço de tabela do provedor e sem nenhuma margem, com failover automático entre provedores, uma DSL de roteamento e fusão de modelos — para que uma rota de imagem possa indicar um primário e um fallback em vez de apostar na tarde de um único provedor. Roteamos o endpoint de imagem Grok Imagine da xAI, mas atenção à versão: nosso catálogo contém grok/grok-imagine-image, e não o Grok Imagine Image 2.0, portanto o modelo mais novo não é algo que possamos servir no momento. Também não roteamos nenhum modelo Qwen-Image de qualquer versão, então o Qwen-Image-2.1 é apenas local. A linha de imagens roteadas que oferecemos é a família GPT-Image da OpenAI, os níveis do Imagen 4 e as prévias de imagem do Gemini, do Google, e aquele endpoint de imagem Grok Imagine mais antigo; como o preço de tabela é repassado em vez de receber margem, um corte de preço do fornecedor em qualquer um deles entra em vigor no mesmo dia.

Decision card titled 'The tiebreak' with two panels: 'Own it - Qwen-Image-2.1', zero cost per image with native alpha, masks and local editing under a non-commercial licence, and 'Rent it - Grok Imagine Image 2.0', about $0.02 to $0.06 per image on commercial terms with no documented transparency path.

O que mudaria esta resposta

Três coisas, e todas as três são plausíveis dentro de um trimestre.

Uma licença comercial para o Qwen-Image-2.1. Se o fornecedor publicar termos a um preço que um estúdio esteja disposto a pagar, a vantagem da transparência e o custo marginal zero passarão ambos a ser utilizáveis em trabalho comercial, e esta comparação muda de forma por completo. Hoje não há preço publicado nem termos declarados.
Um benchmark independente do Qwen-Image-2.1. Um terceiro que reproduzisse os números do Qwen-Image-Bench do fornecedor, ou colocasse o modelo num mural público de imagens, transformaria a única questão em aberto — será que é realmente bom — numa questão resolvida.
Uma mudança de preço do lado do Grok. A concorrência entre fornecedores já produziu uma variação de US$ 0,02 a US$ 0,06 para o que é nominalmente o mesmo modelo. Um corte duradouro tornaria a rota hospedada o padrão para mais faixas de volume do que atualmente.

Até que uma dessas opções se concretize, o critério de desempate não é a qualidade nem o preço. É se você precisa de alpha e consegue conviver com uma licença não comercial, caso em que você faz o download e paga em hardware; ou se você precisa lançar e quer que outra pessoa execute o modelo, caso em que você paga por imagem e nunca mais pensa em um VAE.

Screenshot of the OrcaRouter catalogue page for the grok/grok-imagine-image endpoint, showing the model listing, the per-request price card, and the OpenAI-compatible code sample.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente