
Qwen-Image-2.1 vs Grok Imagine Image 2.0: Pesos Gratuitos Contra um Ambiente Pago
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Um deles não custa nada por imagem e vem com uma licença que proíbe a venda do resultado. O outro custa entre dois e seis centavos por imagem, dependendo de onde você o compra, não traz essa restrição e é classificado nos rankings que você realmente pode consultar. Qwen-Image-2.1 tornou-se público em 20 de setembro de 2026 como pesos abertos sob uma licença de pesquisa. Grok Imagine Image 2.0 é o endpoint de imagem pago do fornecedor, distribuído por meio de sua própria API e de uma variedade de provedores terceiros. A escolha entre eles não é de qualidade — é se você quer possuir o modelo ou alugar o ambiente ao seu redor, e o ambiente está fazendo mais trabalho do que o preço sugere.
Quanto custa uma imagem de cada lado
O preço do Qwen-Image-2.1 é zero por imagem e diferente de zero uma única vez. Você baixa cerca de 33 GB — um transformer de difusão de fluxo único de 7B e 32 camadas com cerca de 14 GB, mais um codificador de texto Qwen3-VL 8B que responde pela maior parte do restante — e, depois disso, o custo marginal de uma imagem é a eletricidade para executá-la. Em uma placa com limitações, o model card recomenda o offload para CPU por meio de pipe.enable_model_cpu_offload(), que é a válvula de escape padrão e custa velocidade em vez de dinheiro.
O preço do Grok Imagine Image 2.0 tem o formato oposto. A própria documentação da xAI lista o modelo principal a US$ 0,04 por imagem gerada, com o endpoint base de imagem do Grok Imagine a US$ 0,02 e o nível de qualidade a US$ 0,05. Provedores terceiros ficam numa faixa semelhante, com seus próprios níveis — um lista tarifas fixas de US$ 0,05 para texto-para-imagem e US$ 0,06 para edição, independentemente da resolução ou da configuração de qualidade; outro cota US$ 0,045 fixos tanto em 1K quanto em 2K para seu nível de qualidade; e um terceiro anuncia US$ 0,025 para texto-para-imagem ou edição por referência com até cinco imagens de entrada. Em todo o mercado, isso se estabiliza em cerca de US$ 0,02 a US$ 0,06 por imagem, com o acesso do consumidor incluído no X Premium e no SuperGrok, em vez de cobrado por imagem.
• Modelo de custo — O Qwen-Image-2.1 tem um custo fixo de hardware e download, com custo marginal zero por imagem; o Grok Imagine Image 2.0 é puramente marginal, escalando linearmente com o volume para sempre.
• Ponto de equilíbrio — o ponto de virada é uma questão de volume que você pode calcular, e ele muda sempre que um provedor altera uma tarifa. Com alguns milhares de imagens por mês, a rota hospedada é trivialmente mais barata do que comprar uma GPU; em alto volume sustentado, a rota local vence em custo e perde em todos os outros eixos.
• O que você não pode comprar do lado local — limites de taxa, tempo de atividade e a equipe de operações de outra pessoa. O que você não pode comprar do lado hospedado são os pesos.
O que as tabelas de classificação dizem, e o que não dizem
O Grok Imagine Image 2.0 tem alegações públicas de classificação. O material de lançamento da xAI citou o segundo lugar geral tanto nos rankings Text-to-Image quanto Image Edit Arena em 7 de agosto de 2026, atrás do GPT Image 2 — trata-se de um instantâneo datado e citado pelo fornecedor e deve ser lido como tal. Serviços de monitoramento de terceiros, nas semanas seguintes, o situaram em cerca de segundo em edição de imagens e terceiro em texto para imagem, novamente atrás do GPT Image 2, com valores de Elo na parte baixa da casa dos 1.300 e alguns sites de rastreamento relatando valores mais próximos de 1.173–1.175. A disparidade entre esses números é, por si só, a lição: posições em rankings nessa categoria mudam de semana para semana, e uma classificação sem data associada não é informação.
O Qwen-Image-2.1 não tem classificação alguma. Ele estava ausente dos rankings independentes de imagens quando isto foi escrito. Seu único número de qualidade é o gráfico Qwen-Image-Bench do próprio fornecedor, no qual aparece 60,28 contra Nano Banana 2.0 com 59,82 e GPT Image 1.5 com 59,65 — material do fornecedor, não reproduzido por terceiros. O único ponto de dados genuinamente independente é a verificação funcional publicada junto com o trabalho de integração com o SGLang: a saída PNG transparente passou, o alfa foi preservado em toda a faixa de 0–255, e o PSNR RGBA mediu 60,69 dB em uma única amostra que os autores descrevem explicitamente como uma verificação de correção, e não uma garantia de qualidade.
Então, o placar honesto é este: um modelo tem uma classificação pública que muda e uma alegação do fornecedor atrelada a ela, e o outro tem um scorecard de fornecedor e um teste de integração aprovado. Isso não é uma comparação, e nenhum artigo que afirme o contrário executou os dois.

Alpha, e por que é a única assimetria técnica
A transparência do Qwen-Image-2.1 é incorporada ao modelo. Um VAE RGBA de 64 canais com compressão espacial de 16× significa que o canal alfa faz parte do espaço latente cujo ruído está sendo removido, o que lhe proporciona três coisas a partir de um único mecanismo: geração com transparência, edição dentro de uma imagem que já tem transparência sem achatá-la primeiro, e extração do sujeito a partir de uma fotografia RGB comum que retorna alfa em vez de uma máscara rígida. Sem nó de remoção de fundo, sem modelo de matting, sem limpeza de bordas — essa é a alegação do fornecedor, e a verificação funcional do SGLang é a única evidência independente de que o canal é real, e não nominal.
O Grok Imagine Image 2.0 não tem equivalente documentado. Sua superfície publicada é texto para imagem e edição baseada em referência, com níveis de resolução e qualidade e até cinco imagens de entrada em alguns provedores. Se o seu ativo precisa de um sujeito recortado com bordas semitransparentes limpas — cabelo, vidro, fumaça —, você está adicionando uma etapa de matting do lado do Grok e não do lado do Qwen. Se essa etapa custa mais do que a dor de cabeça com licenciamento do outro lado é a verdadeira questão de engenharia, e depende daquilo que você precisa retratar.
Um ambiente de edição versus um checkpoint
Os dois sistemas discordam sobre onde a inteligência de edição deveria residir.
O Grok Imagine Image 2.0 coloca isso como serviço. Você envia uma imagem de referência e uma instrução, o provedor decide o que isso significa, e os níveis de resolução e qualidade são escolhidos a cada solicitação. Não há nada para ler, nada para ajustar e nada para quebrar — o que é uma vantagem genuína para uma equipe que não quer possuir um pipeline de diffusers. É também a razão pela qual o preço varia por provedor para o que é nominalmente o mesmo modelo: você está comprando um ambiente, não apenas pesos.
O Qwen-Image-2.1 coloca isso em checkpoints que você pode inspecionar. Junto com o modelo de imagem, ele traz dois modelos de reescrita de prompt — PE-T2I e PE-I2I, cada um um Qwen3.5-VL 9B com ajuste fino, de cerca de 18,8 GB — com o código de reescrita em uma prompt_rewrite/ pasta e um system_prompt.txt incluído que especifica, entre outras coisas, como o idioma do texto renderizado é escolhido. Esse é um nível de inspecionabilidade que nenhuma API de imagem hospedada oferece. São também 37,6 GB de reescritor além do modelo, o que representa um custo real em disco e tempo de carregamento para um componente que a maioria dos pipelines tratará como opcional.
• Superfície de edição — O Qwen-Image-2.1 oferece suporte a edições locais por círculo, anotação pintada ou uma máscara separada, além de edição de camada transparente e extração de sujeito; a edição documentada do Grok Imagine Image 2.0 é orientada por imagem de referência.
• Entradas de referência — O Qwen-Image-2.1 aceita até 10 imagens de referência, com um revisor de acesso antecipado relatando que a consistência com múltiplas referências se degrada a partir de cerca de três imagens; vários provedores do Grok documentam até cinco imagens de entrada.
• Resolução nativa — O Qwen-Image-2.1 gera nativamente em 2K, com 2048×2048 como padrão em 40 etapas em sete predefinições de proporção; a resolução do Grok Imagine Image 2.0 é uma escolha por solicitação com preço definido pelo provedor.
Distribuição e a licença
É aqui que os dois mais se divergem, e não se trata de uma diferença técnica de forma alguma.
Grok Imagine Image 2.0 está disponível através da API da xAI e através de vários fornecedores terceiros independentes, o que significa concorrência de preços, o que significa que o preço que paga é um preço de mercado e não um preço de tabela. Não é necessário fazer download, nem ter GPU, nem ler qualquer ficheiro de licença, e não há restrições à utilização comercial para além dos próprios termos do fornecedor.
O Qwen-Image-2.1 está disponível de uma única forma: baixá-lo. Ele é distribuído sob o Contrato de Licença de Pesquisa Qwen, datado de 20 de setembro de 2026, que concede direitos apenas para fins não comerciais e afirma que o uso comercial exige uma licença separada, solicitada ao fornecedor. Isso representa um endurecimento em relação à linha Qwen-Image anterior, que era distribuída sob Apache 2.0, e é o único fato que decide a maioria das decisões reais entre esses dois. Um estúdio que os compara pela qualidade da saída está respondendo à pergunta errada; o estúdio que não pode usar o Qwen-Image-2.1 para trabalho de clientes não está comparando os dois de forma alguma.
O OrcaRouter é onde reside o lado alugado desse arranjo. Roteamos mais de 200 modelos por trás de um único endpoint compatível com OpenAI, ao preço de tabela do provedor e sem nenhuma margem, com failover automático entre provedores, uma DSL de roteamento e fusão de modelos — para que uma rota de imagem possa indicar um primário e um fallback em vez de apostar na tarde de um único provedor. Roteamos o endpoint de imagem Grok Imagine da xAI, mas atenção à versão: nosso catálogo contém grok/grok-imagine-image, e não o Grok Imagine Image 2.0, portanto o modelo mais novo não é algo que possamos servir no momento. Também não roteamos nenhum modelo Qwen-Image de qualquer versão, então o Qwen-Image-2.1 é apenas local. A linha de imagens roteadas que oferecemos é a família GPT-Image da OpenAI, os níveis do Imagen 4 e as prévias de imagem do Gemini, do Google, e aquele endpoint de imagem Grok Imagine mais antigo; como o preço de tabela é repassado em vez de receber margem, um corte de preço do fornecedor em qualquer um deles entra em vigor no mesmo dia.

O que mudaria esta resposta
Três coisas, e todas as três são plausíveis dentro de um trimestre.
• Uma licença comercial para o Qwen-Image-2.1. Se o fornecedor publicar termos a um preço que um estúdio esteja disposto a pagar, a vantagem da transparência e o custo marginal zero passarão ambos a ser utilizáveis em trabalho comercial, e esta comparação muda de forma por completo. Hoje não há preço publicado nem termos declarados.
• Um benchmark independente do Qwen-Image-2.1. Um terceiro que reproduzisse os números do Qwen-Image-Bench do fornecedor, ou colocasse o modelo num mural público de imagens, transformaria a única questão em aberto — será que é realmente bom — numa questão resolvida.
• Uma mudança de preço do lado do Grok. A concorrência entre fornecedores já produziu uma variação de US$ 0,02 a US$ 0,06 para o que é nominalmente o mesmo modelo. Um corte duradouro tornaria a rota hospedada o padrão para mais faixas de volume do que atualmente.
Até que uma dessas opções se concretize, o critério de desempate não é a qualidade nem o preço. É se você precisa de alpha e consegue conviver com uma licença não comercial, caso em que você faz o download e paga em hardware; ou se você precisa lançar e quer que outra pessoa execute o modelo, caso em que você paga por imagem e nunca mais pensa em um VAE.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
