Um cartão de destaque gerado com o título Qwen-Image-2.1 vs Gemini Omni 1.1 Flash, mostrando um cartão rotulado Qwen-Image-2.1 com um ícone de moldura e um xadrez de transparência ao lado de um cartão rotulado Gemini Omni 1.1 Flash com um ícone de tira de filme, com a legenda um retorna um arquivo, o outro retorna um clipe.
Guides & Insights

Qwen-Image-2.1 vs Gemini Omni 1.1 Flash: Um retorna um PNG, o outro não consegue

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coisa mais útil a saber sobre Qwen-Image-2.1 e Gemini Omni 1.1 Flash é que eles não competem. Peça uma imagem estática ao Gemini Omni 1.1 Flash e você recebe um erro: a própria documentação do fornecedor lista geração de imagens, edição de imagens e saída intercalada de imagem e texto como capacidades não suportadas pelo modelo. Peça um vídeo ao Qwen-Image-2.1 e você recebe uma imagem estática 2048×2048 com canal alfa. Qualquer tabela de comparação que os coloque em duas colunas está comparando uma câmera a um projetor. A verdadeira questão — a que de fato custa dinheiro — é o que acontece quando você os encadeia, e se a cadeia sobrevive ao contato com a tabela de preços. Qwen-Image-2.1 foi lançado publicamente em 20 de setembro de 2026; Gemini Omni 1.1 Flash está em disponibilidade geral desde 27 de agosto de 2026.

O que cada modelo retorna fisicamente

Esta é toda a comparação, e todo o resto decorre dela.

Formato de saída — Qwen-Image-2.1 retorna uma imagem estática, nativamente até 2048×2048 com 40 etapas de inferência, opcionalmente com um canal alfa real; Gemini Omni 1.1 Flash retorna vídeo, de até 40 segundos, montado a partir de chamadas de geração e extensão de 10 segundos, sem nenhum modo de imagem estática.
Transparência — Qwen-Image-2.1 faz denoising em um espaço latente RGBA de 64 canais, então o alfa sai do amostrador; Gemini Omni 1.1 Flash não tem saída com fundo transparente, e solicitar uma resulta em erro.
Entrada de referência — Qwen-Image-2.1 aceita até 10 imagens de referência para composição com vários sujeitos; Gemini Omni 1.1 Flash aceita até 10 imagens por prompt como *entrada* e até três clipes de vídeo de referência de 3 segundos.
Limite de resolução — Qwen-Image-2.1 é 2K nativo; Gemini Omni 1.1 Flash oferece 360p, 720p, 1080p e 4K, mas 1080p e 4K são upscales de uma renderização 720p nativa, e não gerações nativas.
Quanto custa — Qwen-Image-2.1 não tem preço de hospedagem porque não há endpoint hospedado, então o custo é o tempo da sua própria GPU; Gemini Omni 1.1 Flash cobra US$ 0,10 por segundo em 720p, com um nível de rascunho 360p em torno de US$ 0,03 por segundo.
Licença — Qwen-Image-2.1 é distribuído sob o Qwen Research License Agreement datado de 20 de setembro de 2026, somente para uso não comercial; Gemini Omni 1.1 Flash é uma API comercial cuja saída traz proveniência SynthID e C2PA por padrão.

A última linha é aquela que as pessoas ignoram ao passar os olhos. De um lado, você tem um modelo que pode baixar e não pode vender. Do outro, um modelo que você não pode baixar e pode vender livremente — com uma marca d'água invisível em cada quadro.

Por que o enquadramento de "versus" continua aparecendo mesmo assim

Pesquise os dois nomes juntos e você encontrará páginas que os classificam frente a frente. A razão é que a pergunta subjacente é real mesmo quando o enquadramento está errado: ambos os modelos estão no mesmo pipeline criativo, e ambos são a coisa mais nova nele. O que as pessoas estão realmente tentando decidir é onde a imagem estática termina e o movimento começa.

O Gemini Omni 1.1 Flash conquistou o seu lugar nessa questão com números independentes, e não de fornecedores. No Artificial Analysis, ocupou o primeiro lugar tanto na arena de texto para vídeo como na de imagem para vídeo na categoria sem áudio, em 2 de setembro de 2026, com Elo 1324 e 1364. Com áudio ativado, cai para Elo 1237 e 1180 — segundo e quarto lugares. Essa lacuna de áudio é o tipo de detalhe que uma ficha técnica esconde e um ranking expõe.

As evidências do Qwen-Image-2.1 são mais frágeis e de um tipo diferente. O próprio Qwen-Image-Bench do fornecedor o coloca em 60,28, à frente do Nano Banana 2.0, com 59,82, e do GPT Image 1.5, com 59,65, e em primeiro lugar entre os modelos abertos — mas esse é um benchmark executado pelo fornecedor, com margens inferiores a um ponto, e não é uma reprodução por terceiros. Os testes independentes até agora consistem em uma rodada do GenAI Showdown pontuada por humanos com 7/15, um avanço em relação aos 4/15 do Qwen-Image original e atrás do 8/15 do Ideogram 4. O modelo não tinha entrada nos rankings de imagens da Artificial Analysis no momento da redação. Não é uma pontuação baixa — é nenhuma pontuação.

A generated two-column scoreboard titled Qwen-Image-2.1 vs Gemini Omni 1.1 Flash - the scoreboard. Left column Qwen-Image-2.1 rows: Output still image, 2048 x 2048; Transparency native RGBA; Reference input up to 10 images; Resolution native 2K; Price self-hosted only; Licence non-commercial research only. Right column Gemini Omni 1.1 Flash rows: Output video, up to 40 seconds; Transparency none; Reference input 10 images plus 3 clips; Resolution native 720p, upscaled; Price 0.10 dollars per second at 720p; Licence commercial, SynthID and C2PA. Footer: Qwen figures per the vendor model card, unaudited; Gemini figures per Google documentation and Artificial Analysis.A screenshot of the Qwen vendor blog page for Qwen-Image 2.1, captured September 21 2026, showing the 2026/09/20 publication date, the headline Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation, the Now open weights banner, and the GitHub, Hugging Face and ModelScope buttons.

A transferência, e o que ela realmente custa

Se você está construindo algo que precisa tanto de uma imagem estática quanto de um clipe, o pipeline funciona em uma única direção: Qwen-Image-2.1 cria o quadro, e Gemini Omni 1.1 Flash o anima. O inverso não existe.

A aritmética não perdoa depois que você faz as contas. Um clipe de 10 segundos em 720p no Gemini Omni 1.1 Flash custa cerca de US$ 1,00. No nível de rascunho em 360p, os mesmos 10 segundos saem por aproximadamente US$ 0,30, e uma cena completa de 40 segundos em 720p — uma geração mais três chamadas de extensão — chega perto de US$ 4,00. Enquanto isso, a imagem estática que dá origem a tudo isso não custa nada além da eletricidade na sua própria placa. O que significa que a decisão de custo interessante não é "qual modelo", mas "quantas tentativas". Uma imagem estática você pode iterar de graça; um vídeo, não. As equipes que orçam a geração de vídeo por ativo, e não por tentativa, são as que se surpreendem, porque o primeiro quadro é grátis e as repetições não.

Há também uma armadilha de qualidade na transferência. O Gemini Omni 1.1 Flash renderiza nativamente em 720p e faz upscale para 1080p e 4K. Se a sua imagem estática for um quadro Qwen-Image-2.1 de 2048×2048 com um canal alfa limpo, inseri-la em um caminho de vídeo que renderiza em 720p e faz upscale descarta a maior parte do que o modelo de imagem forneceu a você — e o canal alfa é totalmente descartado, porque não existe saída de vídeo transparente. A transparência sobrevive no compositor, não na cadeia de modelos. Planeje a composição depois que o clipe voltar, não antes.

Onde a camada de roteamento se encaixa

A parte incômoda deste emparelhamento é que nenhum dos dois modelos é acessível da forma como o resto da sua stack provavelmente é. O Gemini Omni 1.1 Flash é uma API de fornecedor, com chave própria e medição por segundo própria. O Qwen-Image-2.1 é um download de cerca de 33 GB — um transformer de difusão de 7B mais um codificador de texto Qwen3-VL 8B — que você mesmo hospeda, sob uma licença que permite apenas uso não comercial. Dois modelos de cobrança, dois caminhos de acesso, um projeto.

O OrcaRouter existe exatamente para a superfície que o cerca: um endpoint compatível com OpenAI em mais de 200 modelos, preço de tabela do provedor repassado sem margem, failover automático entre provedores, uma DSL de roteamento para compor fallbacks e fusão de modelos para chamadas em estilo painel. Ser preciso sobre o que isso abrange aqui é importante. Não roteamos nenhum modelo Qwen-Image de qualquer versão, portanto o Qwen-Image-2.1 não é uma rota que você possa chamar do nosso lado — ele roda no seu hardware ou não roda de forma alguma. Também não roteamos o Gemini Omni 1.1 Flash. O que oferecemos no lado de movimento é a linha de vídeo da Kling, incluindo kling-v3, kling-v3-omni e kling-video-o1, além do MiniMax H3 — então a metade de animação deste pipeline tem uma rota hospedada que não exige um segundo contrato com fornecedor, e no lado de imagem oferecemos a família OpenAI GPT-Image, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI. Como o preço de tabela é repassado em vez de receber margem, um corte de preço do fornecedor em qualquer um deles entra no ar aqui no mesmo dia.

Qual você realmente precisa

Você precisa de recursos, não de filmagens — Qwen-Image-2.1, e o canal alfa é o motivo. Recortes transparentes de produtos, ícones, sprites e composições em camadas são onde um amostrador que emite RGBA economiza todo um pipeline de matting.
Você precisa de movimento e precisa que ele seja mensurado — Gemini Omni 1.1 Flash. É o único dos dois com resultados independentes de arena no topo de um ranking, e o único com um preço por segundo publicado que você pode colocar em uma previsão.
Você precisa dos dois — orçe a metade de vídeo por tentativa, não por recurso, e não presuma que o canal alfa sobrevive.
Você precisa vender o resultado — Gemini Omni 1.1 Flash, e somente Gemini Omni 1.1 Flash, até que a Qwen publique termos comerciais para o Qwen-Image-2.1. Não há preço publicado nem term sheet para essa licença hoje.

O resumo honesto é que a comparação que os classifica é o artefato errado. O que vale a pena observar em seguida é se a Qwen vincula termos comerciais ao Qwen-Image-2.1 e se o Google fecha a lacuna de áudio nos leaderboards do Omni — são esses dois fatos, e não mais um placar, que decidem qual metade deste pipeline recebe o orçamento.

A screenshot of the Google Gemini API documentation models index, captured September 21 2026, showing the left navigation listing Nano Banana, Veo and Gemini Omni Flash under the models section, and the main panel opening with the Gemini 3 family of stable models.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente