
Qwen-Image-2.1 vs GPT-Image-2.5: A diferença é um número, e não a qualidade
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Coloque Qwen-Image-2.1 e GPT-Image-2.5 lado a lado nas especificações e eles parecem irmãos: ambos são modelos de imagem unificados de geração e edição, ambos com saída de fundo transparente, ambos lançados nas últimas cinco semanas, ambos capazes de imagens estáticas de classe 2K. A diferença que decide a escolha entre eles é um único número, e não é uma pontuação de benchmark. O Qwen-Image-2.1 é gratuito para baixar e impossível de vender. O GPT-Image-2.5 é impossível de baixar e trivial de vender. Todo o resto — a arquitetura, a latência, a implementação da transparência — decorre disso. O Qwen-Image-2.1 foi disponibilizado como código aberto em 20 de setembro de 2026; o GPT-Image-2.5 foi anunciado com seus modelos de API já disponíveis em 8 de setembro de 2026.
Duas maneiras de adicionar transparência, com um mês de diferença
Que ambos os modelos tenham obtido saída transparente com poucas semanas de diferença é uma coincidência que vale a pena compreender, porque as duas implementações não são equivalentes.
O Qwen-Image-2.1 coloca o alfa dentro do modelo. Ele remove ruído em um espaço latente RGBA de 64 canais com compressão espacial de 16×, então o canal alfa é um componente de primeira classe daquilo que o sampler produz. Não há etapa de segmentação nem passe de matting. Ao lado disso, há um extra incomum: como o modelo pode decidir, por prompt, se emite RGB ou uma imagem com canal alfa, ele também consegue extrair um sujeito de uma fotografia comum e devolver uma camada transparente em vez de uma máscara binária.
O GPT-Image-2.5 segue o caminho do parâmetro. A API da OpenAI aceita uma configuração background com valor auto, opaque ou transparent, e o modelo responde de acordo. Trata-se de um interruptor de capacidade em um endpoint hospedado, e não de uma propriedade do espaço latente, e vem com a vantagem de que você não precisa pensar nisso: defina a flag, receba um recorte, siga em frente. O preço é que você recebe o que o endpoint entrega, na resolução e ao custo que o endpoint decide.
Qual deles é melhor é genuinamente indefinido. Não existia, no momento em que este texto foi escrito, nenhuma comparação pública das bordas alfa do Qwen-Image-2.1 com um modelo dedicado de matting, e a única verificação publicada do lado do Qwen é funcional — saída PNG transparente aprovada, alfa preservado em toda a faixa de 0–255, PSNR RGBA de 60,69 dB em uma única amostra. Isso é uma verificação de correção, não um veredito de qualidade. Ela indica que o canal é real.
O que você pode realmente medir
• Parâmetros — O componente de geração do Qwen-Image-2.1 é um transformer de difusão de fluxo único de 7B e 32 camadas, emparelhado com um codificador de texto Qwen3-VL 8B; aproximadamente 33 GB de pesos no total, dos quais o DiT representa cerca de 14 GB. A OpenAI não publica qualquer contagem de parâmetros para o GPT-Image-2.5.
• Resolução — O Qwen-Image-2.1 gera nativamente até 2048×2048 em 40 passos de inferência, com sete predefinições de proporção de aspeto. O GPT-Image-2.5 aceita tamanhos até 3840×2160 e 2160×3840, com cada lado limitado a 3840 px e múltiplos de 16 exigidos.
• Imagens de referência — O Qwen-Image-2.1 aceita até 10 para composição com vários sujeitos e prova virtual. Os modelos de imagem da OpenAI aceitam entradas de referência para edição, mas o limite prático e o comportamento de fidelidade variam por modelo e por nível de qualidade.
• Latência — O SGLang-Diffusion publica 2,748 s para uma geração 1024×1024, de 40 passos, numa única B200, e 4,74 s numa RTX 4090 de 24 GB com Cache-DiT e kernels INT8, apenas a remoção de ruído. A OpenAI relata que a variante Flare do GPT-Image-2.5 tem até 50% menos latência do que o GPT-Image-2, com um parceiro de lançamento a medir 2–4× — valores comunicados pelo fornecedor e pelo parceiro, respetivamente, não uma comparação controlada.
• Preço — O Qwen-Image-2.1 não tem preço de serviço alojado porque não existe endpoint alojado; o custo é o seu próprio tempo de GPU. O GPT-Image-2.5 é cobrado às mesmas tarifas por token que o GPT-Image-2: $8,00 por 1M de tokens de entrada de imagem, $30,00 por 1M de tokens de saída de imagem, $5,00 por 1M de tokens de entrada de texto.
• Licença — O Qwen-Image-2.1 é distribuído ao abrigo do Qwen Research License Agreement com data de 20 de setembro de 2026, apenas para uso não comercial. O GPT-Image-2.5 é uma API comercial com proveniência C2PA e uma marca de água invisível nas saídas.
Uma linha dessa lista é mais fina do que aparenta. A OpenAI não publica preços por imagem para o GPT-Image-2.5, apenas tarifas por token, e o consumo de tokens de imagem varia conforme a resolução e o nível de qualidade. Medições de terceiros situam a faixa entre aproximadamente $0.0059 e $0.712 por imagem em 1K, 2K e 4K, nos ajustes baixo, médio e alto, com proporção 1:1 — útil como ordem de magnitude, não como cotação. Se você estiver fazendo previsões, construa a estimativa a partir da contagem de tokens e da sua própria distribuição de prompts, não a partir de um número por imagem que outra pessoa mediu.

Os dois custos que ninguém coloca na mesma coluna
A razão pela qual esta comparação não admite uma resposta simples é que os dois modelos cobram de você em moedas diferentes, e a taxa de câmbio é a sua própria situação.
O GPT-Image-2.5 cobra por token, o que significa que o medidor é visível, previsível e escala linearmente com o volume. Isso é uma vantagem genuína para um produto com tráfego conhecido: você pode colocá-lo em um orçamento, e um corte de preço do fornecedor reduz seu custo no mesmo dia. Também é um imposto sobre a exploração, porque a décima iteração de um prompt custa o mesmo que a primeira. O modo como o input_fidelity se comporta torna isso mais acentuado do que as tarifas anunciadas sugerem — a API pode aplicar alta fidelidade automaticamente em entradas de imagem, o que consome mais tokens de entrada do que uma leitura casual da tabela de preços sugere, de modo que os ciclos de edição custam mais do que os valores por imagem que as pessoas citam.
Qwen-Image-2.1 inverte ambas as propriedades. O custo marginal da centésima geração é eletricidade. Isso o torna o instrumento melhor para iteração, para backfills em lote e para qualquer coisa em que o prompt ainda está sendo descoberto. O que ele não oferece é um número para a planilha financeira — você paga por uma GPU esteja ela ocupada ou ociosa — e não lhe dá o direito de vender o resultado. O Qwen Research License Agreement permite pesquisa e avaliação não comerciais e afirma que a implantação comercial exige uma licença separada da Hangzhou Tongyi Laboratory Technology. Não há preço publicado para essa licença nem termos declarados. Isso não é uma nota de rodapé; para um pipeline comercial, é a decisão por inteiro.
Executando ambos sem um segundo contrato
A resposta realista para a maioria das equipes não é “um ou outro”; é os dois. O GPT-Image-2.5 cuida do caminho de produção, em que o resultado é enviado a um cliente e o medidor por token é um item de linha. O Qwen-Image-2.1 cuida do caminho de exploração, em que você precisa de duzentas variantes de uma foto de produto com fundo transparente e nenhum fornecedor venderá esse volume a um preço razoável.
O atrito é que os dois chegam por caminhos completamente diferentes. Um é uma chave de API. O outro é um download de 33 GB, um ambiente Python e uma GPU que você possui. O OrcaRouter cobre a metade hospedada: mais de 200 modelos por trás de um endpoint compatível com OpenAI, preço de tabela do provedor repassado sem markup, failover automático entre provedores, uma DSL de roteamento para expressar fallbacks e fusão de modelos para combinar vários modelos em uma única chamada. É importante ser preciso sobre este modelo — não roteamos o GPT-Image-2.5 hoje; nossas rotas de imagem da OpenAI são GPT-Image-2, GPT-Image-1.5 e GPT-Image-1-mini, todas pelo preço de tabela da OpenAI, e no dia em que um provedor upstream adicionar os identificadores gpt-image-2.5, a mesma chave os chamará sem nenhuma alteração de código. Também não roteamos nenhum modelo Qwen-Image de nenhuma versão, então Qwen-Image-2.1 não é uma rota do nosso lado de forma alguma. O que o preço de repasse lhe garante, nesse meio-tempo, é que, quando a OpenAI altera uma tarifa, o número do nosso lado muda junto, em vez de ficar defasado.
O veredito, enunciado como uma condição em vez de um vencedor
Se o resultado tiver de ser vendido, não há comparação: o GPT-Image-2.5 é o único dos dois que você tem licença para usar, e o medidor de tokens é o preço disso. Se o resultado for pesquisa, ferramentas internas ou avaliação, o Qwen-Image-2.1 é o instrumento mais forte — 2K nativo, alfa direto do sampler, dez imagens de referência e custo marginal zero depois que o hardware estiver pago. Se você precisar dos dois, rode os dois, e trate a licença como a fronteira que decide em qual pipeline cada trabalho entra.
Duas coisas mudariam isso. Um term sheet comercial publicado para o Qwen-Image-2.1 eliminaria a diferença na linha da licença, que atualmente faz a maior parte do trabalho nesta comparação. E uma entrada independente de ranking de imagens para o Qwen-Image-2.1 nos diria se o resultado do Qwen-Image-Bench do fornecedor — 60,28, à frente do Nano Banana 2.0 com 59,82 e do GPT Image 1.5 com 59,65, o primeiro entre modelos abertos — se sustenta fora do laboratório que o produziu. Nenhuma das duas existe ainda. Até que existam, a recomendação honesta é escolher com base na licença e no medidor, não no placar.


