Cartão de destaque com o texto "Qwen-Image-2.1 vs GPT Image 2", com o subtítulo "Baixe grátis, ou alugue o ranqueado", e três linhas: Qwen-Image-2.1 download de 33 GB não comercial, GPT Image 2 somente API, cobrada por token, Transparência VAE RGBA vs um parâmetro de requisição, ao lado de um ícone de seta de download e de medidor.
Guides & Insights

Qwen-Image-2.1 vs GPT Image 2: Baixe grátis ou alugue o melhor

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen-Image-2.1 é um download de 33 GB que você pode executar de graça e não pode vender. GPT Image 2 é uma API que você não pode baixar de forma alguma, cobrada por token, há quatro meses em produção e no topo dos rankings independentes de imagens. Esses dois fatos são toda a transação, e a parte interessante é que o recurso de transparência — aquilo que faz o Qwen-Image-2.1 valer a pena em primeiro lugar — chegou aos dois sistemas com um mês de diferença por rotas completamente distintas. O Qwen-Image-2.1 foi lançado em 20 de setembro de 2026 com alfa embutido em seu espaço latente. O GPT Image 2 ganhou um background: "transparent" parâmetro em 20 de agosto de 2026 como um flag de API.

Duas rotas para a mesma funcionalidade

A saída transparente é a razão pela qual a maioria das pessoas acaba comparando estes dois, então comece por aí, porque as implementações não são equivalentes e a diferença importa mais do que a saída.

A transparência do Qwen-Image-2.1 é arquitetural. Um VAE RGBA de 64 canais com compressão espacial de 16× significa que o alfa faz parte do espaço latente no qual o modelo faz o denoising. O mesmo mecanismo permite gerar com transparência, editar dentro de uma imagem que já tem transparência sem achatá-la, e extrair o sujeito de uma fotografia RGB comum retornando alfa em vez de uma máscara binária. É uma única capacidade com três usos, e o próprio enquadramento do fornecedor é que nenhum nó separado de remoção de fundo, modelo de matting ou passe de limpeza de bordas é necessário.

A transparência do GPT Image 2 é um parâmetro de requisição. Adicionar background: "transparent" junto com output_format: "png" retorna uma imagem com um canal alfa real, e funciona em texto para imagem, edição de imagem e na ferramenta de geração de imagem da Responses API. O inpainting baseado em máscara e os fundos transparentes podem ser combinados. Foi lançado em Preview, então a própria orientação da OpenAI é de que os resultados podem ser instáveis — e a edição com transparência é descrita como redesenhar ou remover um fundo, em vez de um recorte preciso de contornos. Pelo menos duas fontes secundárias afirmam que o parâmetro não está disponível e que o GPT Image 2 não produz transparência de forma alguma; elas contradizem a cobertura do anúncio, os espelhos da documentação da API e os testes de terceiros, então trate-as como desatualizadas ou incorretas, e não como um contra-sinal. A transparência não altera o custo de tokens — em uma determinada qualidade e tamanho, uma imagem transparente e uma opaca consomem os mesmos tokens de imagem.

Então, ambos produzem alfa. Um faz isso porque o modelo foi construído dessa forma; o outro porque um parâmetro pede isso ao serviço. Qual é melhor depende inteiramente de se o alfa precisa sobreviver a um ciclo de edição, e isso é testável em uma tarde.

O que a vantagem inicial do GPT Image 2 lhe proporciona

Quatro meses em produção não é um argumento de marketing, é uma lacuna de maturidade, e isso aparece em lugares que são entediantes e decisivos.

Posição independente — O GPT Image 2 está no topo dos rankings independentes de imagens e permanece lá há tempo suficiente para que isso seja uma afirmação estável, e não um pico da semana de lançamento. O Qwen-Image-2.1 estava totalmente ausente dessas tabelas quando isto foi escrito.
Modos de falha documentados — um modelo com quatro meses de uso público tem um conjunto de casos de falha conhecidos que você pode ler antes de se deparar com eles. Um modelo que se tornou público ontem tem uma ficha de avaliação do fornecedor e um teste de integração.
Superfície operacional — limites de taxa em camadas expressos tanto em tokens por minuto quanto em imagens por minuto (de 100.000 TPM e 5 IPM na camada inicial até 8.000.000 TPM e 250 IPM na camada mais alta), além de suporte a endpoint em lote. Essa é a diferença entre uma demonstração e uma fila que você pode dimensionar.
Números de qualidade de terceiros — a posição no ranking é medida de forma independente. O único número do Qwen-Image-2.1 é o gráfico Qwen-Image-Bench do próprio fornecedor, onde ele registra 60,28 contra o Nano Banana 2.0 com 59,82 e o GPT Image 1.5 com 59,65. Material do fornecedor, não reproduzido.

O único ponto de dados genuinamente independente sobre o Qwen-Image-2.1 é a verificação funcional publicada com a integração do SGLang: a saída de PNG transparente passou, o canal alfa foi preservado em toda a faixa de 0–255, o PSNR de RGBA mediu 60,69 dB em uma única amostra, e configurações FP8 passaram na geração de PNG transparente. Os autores do SGLang dizem explicitamente que esta é uma verificação de correção e não uma garantia de qualidade geral. É a evidência mais forte disponível de que o canal alfa é real. Não diz nada sobre se as imagens são boas.

A fatura, processada.

O GPT Image 2 é faturado por tokens, o que significa que o custo de um recurso depende do nível de qualidade e da resolução de uma forma que um preço por imagem oculta. As tarifas de tabela publicadas são 5,00 $ por milhão de tokens de entrada de texto, 8,00 $ por milhão de tokens de entrada de imagem e 30,00 $ por milhão de tokens de saída de imagem, com tarifas em cache de 1,25 $ e 2,00 $, respectivamente. A OpenAI não publica uma tabela estática de tokens de saída para este modelo — a tabela mais antiga, que abrange as contagens de tokens baixas, médias e altas, está explicitamente marcada como não aplicável ao GPT Image 2 —, por isso os números abaixo são medições de terceiros dos preços de tabela numa proporção de 1:1, de texto para imagem:

Saída 1K — qualidade baixa $0.0059, média $0.053, alta $0.211 por imagem.
Saída 2K — $0.012 baixa, $0.107 média, $0.428 alta.
Saída 4K — $0.020 baixa, $0.178 média, $0.712 alta.

A diferença entre qualidade baixa e alta na mesma resolução é um fator de aproximadamente trinta e cinco. Essa é a decisão real dentro de um pipeline do GPT Image 2: não qual modelo, mas qual nível de qualidade sobrevive à revisão com o menor custo. E isso interage com a edição de uma forma que pega as pessoas de surpresa — input_fidelity não pode ser ajustado neste modelo porque ele processa toda entrada de imagem com alta fidelidade automaticamente, então uma solicitação de edição que carrega imagens de referência consome mais tokens de entrada de imagem do que você estimaria a partir do tamanho da saída. Portanto, os ciclos de gerar-inspecionar-editar são mais caros aqui do que os números por imagem sugerem.

Em contrapartida, o custo marginal por imagem do Qwen-Image-2.1 é a eletricidade. O senão é o custo fixo e a licença. Trinta e três gigabytes para baixar, um DiT de aproximadamente 14 GB, com o restante indo para o codificador de texto Qwen3-VL 8B, offload para CPU recomendado em placas com recursos limitados, e tudo sob o Contrato de Licença de Pesquisa Qwen datado de 20 de setembro de 2026 — apenas para uso não comercial, com direitos comerciais mediante acordo separado e sem preço ou termos publicados para eles.

A two-column board for Qwen-Image-2.1 and GPT Image 2 carrying both sides on one line per dimension: Weights, Licence, Transparency, Quality evidence, Pricing and Maturity. Footer separates vendor-reported figures from independently verified ones and notes that per-image API cost moves with quality tier and resolution.

Onde a opção hospedada se encontra

Há um caminho intermediário que evita tanto a GPU quanto a questão da licença, e é o que a maioria das equipes de fato adota. O OrcaRouter roteia a família GPT-Image da OpenAI junto com os níveis do Imagen 4 do Google, as prévias de imagem do Gemini e o endpoint de imagem Grok Imagine da xAI — mais de 200 modelos atrás de um único endpoint compatível com OpenAI, preço de tabela do provedor repassado sem markup, failover automático entre provedores, uma DSL de roteamento e fusão de modelos. Como o preço de tabela é repassado em vez de receber markup, um corte de preço do fornecedor em qualquer modelo roteado entra no ar no mesmo dia, e como o failover é automático, um provedor passando por um mau momento não se transforma na sua indisponibilidade. O Qwen-Image-2.1 não está entre os modelos que roteamos, e tampouco qualquer outra versão do Qwen-Image — é uma proposta exclusivamente local —, então isto não é um discurso de venda para o recém-chegado. É a resposta honesta para "o que eu uso enquanto avalio o recém-chegado".

Decision card titled 'The tiebreak' with two panels: 'Download it - Qwen-Image-2.1', free to run and non-commercial with alpha that is part of the latent space, and 'Rent it - GPT Image 2', independently ranked with a per-image cost from about $0.006 to $0.71 depending on tier and resolution.

A decisão, dita claramente

Escolha o GPT Image 2 se o resultado for comercial, se você precisar de um piso de qualidade medido de forma independente, se quiser custos por ativo que possa prever e limitar, ou se precisar que isso funcione esta semana sem comprar hardware. Aceite que você está alugando, que não pode fazer ajuste fino nele, que não pode executá-lo offline e que o custo por imagem escala linearmente com o volume para sempre.

Escolha o Qwen-Image-2.1 se a saída for pesquisa, avaliação ou trabalho pessoal, se você quiser especificamente um alpha que sobreviva a um ciclo de edição em vez de um alpha que um parâmetro produziu uma vez, se quiser ler a lógica de reescrita — os checkpoints PE-T2I e PE-I2I fornecidos são modelos Qwen3.5-VL 9B ajustados com um system_prompt.txtlegível, o que é mais do que você obtém de qualquer API de imagem hospedada — ou se você simplesmente quiser saber o que um modelo de imagem de pesos abertos de 7B pode fazer em setembro de 2026 sem pagar por imagem para descobrir.

Não escolha nenhum dos dois e encaminhe-o se o entregável for comercial e o prazo for real. Isso não é uma escapatória; é a opção que não exige que você resolva uma questão de licença à qual ainda não consegue obter resposta.

Screenshot of the OrcaRouter catalogue page for the openai/gpt-image-2 model, showing the model listing, the $8.00 per 1M token input and $30.00 per 1M token output pricing cards, and the LM Arena image-edit Elo figure quoted in the model description.