Um cartão hero gerado com o título Qwen-Image-2.1 vs GPT-Image-2.5, mostrando um cartão rotulado Qwen-Image-2.1 com um ícone de download e o texto 33 GB de pesos ao lado de um cartão rotulado GPT-Image-2.5 com um ícone de mostrador medidor e o texto cobrado por token, com a legenda um que você baixa, um que você mede.
Guides & Insights

Qwen-Image-2.1 vs GPT-Image-2.5: A diferença é um número, e não a qualidade

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Qwen-Image-2.1 e GPT-Image-2.5 lado a lado nas especificações e eles parecem irmãos: ambos são modelos de imagem unificados de geração e edição, ambos com saída de fundo transparente, ambos lançados nas últimas cinco semanas, ambos capazes de imagens estáticas de classe 2K. A diferença que decide a escolha entre eles é um único número, e não é uma pontuação de benchmark. O Qwen-Image-2.1 é gratuito para baixar e impossível de vender. O GPT-Image-2.5 é impossível de baixar e trivial de vender. Todo o resto — a arquitetura, a latência, a implementação da transparência — decorre disso. O Qwen-Image-2.1 foi disponibilizado como código aberto em 20 de setembro de 2026; o GPT-Image-2.5 foi anunciado com seus modelos de API já disponíveis em 8 de setembro de 2026.

Duas maneiras de adicionar transparência, com um mês de diferença

Que ambos os modelos tenham obtido saída transparente com poucas semanas de diferença é uma coincidência que vale a pena compreender, porque as duas implementações não são equivalentes.

O Qwen-Image-2.1 coloca o alfa dentro do modelo. Ele remove ruído em um espaço latente RGBA de 64 canais com compressão espacial de 16×, então o canal alfa é um componente de primeira classe daquilo que o sampler produz. Não há etapa de segmentação nem passe de matting. Ao lado disso, há um extra incomum: como o modelo pode decidir, por prompt, se emite RGB ou uma imagem com canal alfa, ele também consegue extrair um sujeito de uma fotografia comum e devolver uma camada transparente em vez de uma máscara binária.

O GPT-Image-2.5 segue o caminho do parâmetro. A API da OpenAI aceita uma configuração background com valor auto, opaque ou transparent, e o modelo responde de acordo. Trata-se de um interruptor de capacidade em um endpoint hospedado, e não de uma propriedade do espaço latente, e vem com a vantagem de que você não precisa pensar nisso: defina a flag, receba um recorte, siga em frente. O preço é que você recebe o que o endpoint entrega, na resolução e ao custo que o endpoint decide.

Qual deles é melhor é genuinamente indefinido. Não existia, no momento em que este texto foi escrito, nenhuma comparação pública das bordas alfa do Qwen-Image-2.1 com um modelo dedicado de matting, e a única verificação publicada do lado do Qwen é funcional — saída PNG transparente aprovada, alfa preservado em toda a faixa de 0–255, PSNR RGBA de 60,69 dB em uma única amostra. Isso é uma verificação de correção, não um veredito de qualidade. Ela indica que o canal é real.

O que você pode realmente medir

Parâmetros — O componente de geração do Qwen-Image-2.1 é um transformer de difusão de fluxo único de 7B e 32 camadas, emparelhado com um codificador de texto Qwen3-VL 8B; aproximadamente 33 GB de pesos no total, dos quais o DiT representa cerca de 14 GB. A OpenAI não publica qualquer contagem de parâmetros para o GPT-Image-2.5.
Resolução — O Qwen-Image-2.1 gera nativamente até 2048×2048 em 40 passos de inferência, com sete predefinições de proporção de aspeto. O GPT-Image-2.5 aceita tamanhos até 3840×2160 e 2160×3840, com cada lado limitado a 3840 px e múltiplos de 16 exigidos.
Imagens de referência — O Qwen-Image-2.1 aceita até 10 para composição com vários sujeitos e prova virtual. Os modelos de imagem da OpenAI aceitam entradas de referência para edição, mas o limite prático e o comportamento de fidelidade variam por modelo e por nível de qualidade.
Latência — O SGLang-Diffusion publica 2,748 s para uma geração 1024×1024, de 40 passos, numa única B200, e 4,74 s numa RTX 4090 de 24 GB com Cache-DiT e kernels INT8, apenas a remoção de ruído. A OpenAI relata que a variante Flare do GPT-Image-2.5 tem até 50% menos latência do que o GPT-Image-2, com um parceiro de lançamento a medir 2–4× — valores comunicados pelo fornecedor e pelo parceiro, respetivamente, não uma comparação controlada.
Preço — O Qwen-Image-2.1 não tem preço de serviço alojado porque não existe endpoint alojado; o custo é o seu próprio tempo de GPU. O GPT-Image-2.5 é cobrado às mesmas tarifas por token que o GPT-Image-2: $8,00 por 1M de tokens de entrada de imagem, $30,00 por 1M de tokens de saída de imagem, $5,00 por 1M de tokens de entrada de texto.
Licença — O Qwen-Image-2.1 é distribuído ao abrigo do Qwen Research License Agreement com data de 20 de setembro de 2026, apenas para uso não comercial. O GPT-Image-2.5 é uma API comercial com proveniência C2PA e uma marca de água invisível nas saídas.

Uma linha dessa lista é mais fina do que aparenta. A OpenAI não publica preços por imagem para o GPT-Image-2.5, apenas tarifas por token, e o consumo de tokens de imagem varia conforme a resolução e o nível de qualidade. Medições de terceiros situam a faixa entre aproximadamente $0.0059 e $0.712 por imagem em 1K, 2K e 4K, nos ajustes baixo, médio e alto, com proporção 1:1 — útil como ordem de magnitude, não como cotação. Se você estiver fazendo previsões, construa a estimativa a partir da contagem de tokens e da sua própria distribuição de prompts, não a partir de um número por imagem que outra pessoa mediu.

A generated two-column scoreboard titled Qwen-Image-2.1 vs GPT-Image-2.5 - the scoreboard. Left column Qwen-Image-2.1 rows: Generation component 7B DiT; Transparency native RGBA; Resolution 2048 x 2048 native; Reference images up to 10; Price self-hosted GPU time; Licence non-commercial research only. Right column GPT-Image-2.5 rows: Generation component undisclosed; Transparency API parameter; Resolution up to 3840 x 2160; Reference images per the editing API; Price 8 and 30 dollars per 1M tokens; Licence commercial, C2PA and watermark. Footer: Qwen figures per the vendor model card, unaudited; OpenAI figures per the vendor API reference.

Os dois custos que ninguém coloca na mesma coluna

A razão pela qual esta comparação não admite uma resposta simples é que os dois modelos cobram de você em moedas diferentes, e a taxa de câmbio é a sua própria situação.

O GPT-Image-2.5 cobra por token, o que significa que o medidor é visível, previsível e escala linearmente com o volume. Isso é uma vantagem genuína para um produto com tráfego conhecido: você pode colocá-lo em um orçamento, e um corte de preço do fornecedor reduz seu custo no mesmo dia. Também é um imposto sobre a exploração, porque a décima iteração de um prompt custa o mesmo que a primeira. O modo como o input_fidelity se comporta torna isso mais acentuado do que as tarifas anunciadas sugerem — a API pode aplicar alta fidelidade automaticamente em entradas de imagem, o que consome mais tokens de entrada do que uma leitura casual da tabela de preços sugere, de modo que os ciclos de edição custam mais do que os valores por imagem que as pessoas citam.

Qwen-Image-2.1 inverte ambas as propriedades. O custo marginal da centésima geração é eletricidade. Isso o torna o instrumento melhor para iteração, para backfills em lote e para qualquer coisa em que o prompt ainda está sendo descoberto. O que ele não oferece é um número para a planilha financeira — você paga por uma GPU esteja ela ocupada ou ociosa — e não lhe dá o direito de vender o resultado. O Qwen Research License Agreement permite pesquisa e avaliação não comerciais e afirma que a implantação comercial exige uma licença separada da Hangzhou Tongyi Laboratory Technology. Não há preço publicado para essa licença nem termos declarados. Isso não é uma nota de rodapé; para um pipeline comercial, é a decisão por inteiro.

Executando ambos sem um segundo contrato

A resposta realista para a maioria das equipes não é “um ou outro”; é os dois. O GPT-Image-2.5 cuida do caminho de produção, em que o resultado é enviado a um cliente e o medidor por token é um item de linha. O Qwen-Image-2.1 cuida do caminho de exploração, em que você precisa de duzentas variantes de uma foto de produto com fundo transparente e nenhum fornecedor venderá esse volume a um preço razoável.

O atrito é que os dois chegam por caminhos completamente diferentes. Um é uma chave de API. O outro é um download de 33 GB, um ambiente Python e uma GPU que você possui. O OrcaRouter cobre a metade hospedada: mais de 200 modelos por trás de um endpoint compatível com OpenAI, preço de tabela do provedor repassado sem markup, failover automático entre provedores, uma DSL de roteamento para expressar fallbacks e fusão de modelos para combinar vários modelos em uma única chamada. É importante ser preciso sobre este modelo — não roteamos o GPT-Image-2.5 hoje; nossas rotas de imagem da OpenAI são GPT-Image-2, GPT-Image-1.5 e GPT-Image-1-mini, todas pelo preço de tabela da OpenAI, e no dia em que um provedor upstream adicionar os identificadores gpt-image-2.5, a mesma chave os chamará sem nenhuma alteração de código. Também não roteamos nenhum modelo Qwen-Image de nenhuma versão, então Qwen-Image-2.1 não é uma rota do nosso lado de forma alguma. O que o preço de repasse lhe garante, nesse meio-tempo, é que, quando a OpenAI altera uma tarifa, o número do nosso lado muda junto, em vez de ficar defasado.

O veredito, enunciado como uma condição em vez de um vencedor

Se o resultado tiver de ser vendido, não há comparação: o GPT-Image-2.5 é o único dos dois que você tem licença para usar, e o medidor de tokens é o preço disso. Se o resultado for pesquisa, ferramentas internas ou avaliação, o Qwen-Image-2.1 é o instrumento mais forte — 2K nativo, alfa direto do sampler, dez imagens de referência e custo marginal zero depois que o hardware estiver pago. Se você precisar dos dois, rode os dois, e trate a licença como a fronteira que decide em qual pipeline cada trabalho entra.

Duas coisas mudariam isso. Um term sheet comercial publicado para o Qwen-Image-2.1 eliminaria a diferença na linha da licença, que atualmente faz a maior parte do trabalho nesta comparação. E uma entrada independente de ranking de imagens para o Qwen-Image-2.1 nos diria se o resultado do Qwen-Image-Bench do fornecedor — 60,28, à frente do Nano Banana 2.0 com 59,82 e do GPT Image 1.5 com 59,65, o primeiro entre modelos abertos — se sustenta fora do laboratório que o produziu. Nenhuma das duas existe ainda. Até que existam, a recomendação honesta é escolher com base na licença e no medidor, não no placar.

A screenshot of OrcaRouter's own model page for openai/gpt-image-2, captured September 21 2026, showing the model description as OpenAI's token-billed image model reached through the Images API, the /v1/images/generations endpoint, and the published list rates of $8.00 per 1M image input tokens and $30.00 per 1M image output tokens.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.