
Qwen-Image-2.1 vs Gemini Omni 1.1 Flash: Um retorna um PNG, o outro não consegue
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A coisa mais útil a saber sobre Qwen-Image-2.1 e Gemini Omni 1.1 Flash é que eles não competem. Peça uma imagem estática ao Gemini Omni 1.1 Flash e você recebe um erro: a própria documentação do fornecedor lista geração de imagens, edição de imagens e saída intercalada de imagem e texto como capacidades não suportadas pelo modelo. Peça um vídeo ao Qwen-Image-2.1 e você recebe uma imagem estática 2048×2048 com canal alfa. Qualquer tabela de comparação que os coloque em duas colunas está comparando uma câmera a um projetor. A verdadeira questão — a que de fato custa dinheiro — é o que acontece quando você os encadeia, e se a cadeia sobrevive ao contato com a tabela de preços. Qwen-Image-2.1 foi lançado publicamente em 20 de setembro de 2026; Gemini Omni 1.1 Flash está em disponibilidade geral desde 27 de agosto de 2026.
O que cada modelo retorna fisicamente
Esta é toda a comparação, e todo o resto decorre dela.
• Formato de saída — Qwen-Image-2.1 retorna uma imagem estática, nativamente até 2048×2048 com 40 etapas de inferência, opcionalmente com um canal alfa real; Gemini Omni 1.1 Flash retorna vídeo, de até 40 segundos, montado a partir de chamadas de geração e extensão de 10 segundos, sem nenhum modo de imagem estática.
• Transparência — Qwen-Image-2.1 faz denoising em um espaço latente RGBA de 64 canais, então o alfa sai do amostrador; Gemini Omni 1.1 Flash não tem saída com fundo transparente, e solicitar uma resulta em erro.
• Entrada de referência — Qwen-Image-2.1 aceita até 10 imagens de referência para composição com vários sujeitos; Gemini Omni 1.1 Flash aceita até 10 imagens por prompt como *entrada* e até três clipes de vídeo de referência de 3 segundos.
• Limite de resolução — Qwen-Image-2.1 é 2K nativo; Gemini Omni 1.1 Flash oferece 360p, 720p, 1080p e 4K, mas 1080p e 4K são upscales de uma renderização 720p nativa, e não gerações nativas.
• Quanto custa — Qwen-Image-2.1 não tem preço de hospedagem porque não há endpoint hospedado, então o custo é o tempo da sua própria GPU; Gemini Omni 1.1 Flash cobra US$ 0,10 por segundo em 720p, com um nível de rascunho 360p em torno de US$ 0,03 por segundo.
• Licença — Qwen-Image-2.1 é distribuído sob o Qwen Research License Agreement datado de 20 de setembro de 2026, somente para uso não comercial; Gemini Omni 1.1 Flash é uma API comercial cuja saída traz proveniência SynthID e C2PA por padrão.
A última linha é aquela que as pessoas ignoram ao passar os olhos. De um lado, você tem um modelo que pode baixar e não pode vender. Do outro, um modelo que você não pode baixar e pode vender livremente — com uma marca d'água invisível em cada quadro.
Por que o enquadramento de "versus" continua aparecendo mesmo assim
Pesquise os dois nomes juntos e você encontrará páginas que os classificam frente a frente. A razão é que a pergunta subjacente é real mesmo quando o enquadramento está errado: ambos os modelos estão no mesmo pipeline criativo, e ambos são a coisa mais nova nele. O que as pessoas estão realmente tentando decidir é onde a imagem estática termina e o movimento começa.
O Gemini Omni 1.1 Flash conquistou o seu lugar nessa questão com números independentes, e não de fornecedores. No Artificial Analysis, ocupou o primeiro lugar tanto na arena de texto para vídeo como na de imagem para vídeo na categoria sem áudio, em 2 de setembro de 2026, com Elo 1324 e 1364. Com áudio ativado, cai para Elo 1237 e 1180 — segundo e quarto lugares. Essa lacuna de áudio é o tipo de detalhe que uma ficha técnica esconde e um ranking expõe.
As evidências do Qwen-Image-2.1 são mais frágeis e de um tipo diferente. O próprio Qwen-Image-Bench do fornecedor o coloca em 60,28, à frente do Nano Banana 2.0, com 59,82, e do GPT Image 1.5, com 59,65, e em primeiro lugar entre os modelos abertos — mas esse é um benchmark executado pelo fornecedor, com margens inferiores a um ponto, e não é uma reprodução por terceiros. Os testes independentes até agora consistem em uma rodada do GenAI Showdown pontuada por humanos com 7/15, um avanço em relação aos 4/15 do Qwen-Image original e atrás do 8/15 do Ideogram 4. O modelo não tinha entrada nos rankings de imagens da Artificial Analysis no momento da redação. Não é uma pontuação baixa — é nenhuma pontuação.


A transferência, e o que ela realmente custa
Se você está construindo algo que precisa tanto de uma imagem estática quanto de um clipe, o pipeline funciona em uma única direção: Qwen-Image-2.1 cria o quadro, e Gemini Omni 1.1 Flash o anima. O inverso não existe.
A aritmética não perdoa depois que você faz as contas. Um clipe de 10 segundos em 720p no Gemini Omni 1.1 Flash custa cerca de US$ 1,00. No nível de rascunho em 360p, os mesmos 10 segundos saem por aproximadamente US$ 0,30, e uma cena completa de 40 segundos em 720p — uma geração mais três chamadas de extensão — chega perto de US$ 4,00. Enquanto isso, a imagem estática que dá origem a tudo isso não custa nada além da eletricidade na sua própria placa. O que significa que a decisão de custo interessante não é "qual modelo", mas "quantas tentativas". Uma imagem estática você pode iterar de graça; um vídeo, não. As equipes que orçam a geração de vídeo por ativo, e não por tentativa, são as que se surpreendem, porque o primeiro quadro é grátis e as repetições não.
Há também uma armadilha de qualidade na transferência. O Gemini Omni 1.1 Flash renderiza nativamente em 720p e faz upscale para 1080p e 4K. Se a sua imagem estática for um quadro Qwen-Image-2.1 de 2048×2048 com um canal alfa limpo, inseri-la em um caminho de vídeo que renderiza em 720p e faz upscale descarta a maior parte do que o modelo de imagem forneceu a você — e o canal alfa é totalmente descartado, porque não existe saída de vídeo transparente. A transparência sobrevive no compositor, não na cadeia de modelos. Planeje a composição depois que o clipe voltar, não antes.
Onde a camada de roteamento se encaixa
A parte incômoda deste emparelhamento é que nenhum dos dois modelos é acessível da forma como o resto da sua stack provavelmente é. O Gemini Omni 1.1 Flash é uma API de fornecedor, com chave própria e medição por segundo própria. O Qwen-Image-2.1 é um download de cerca de 33 GB — um transformer de difusão de 7B mais um codificador de texto Qwen3-VL 8B — que você mesmo hospeda, sob uma licença que permite apenas uso não comercial. Dois modelos de cobrança, dois caminhos de acesso, um projeto.
O OrcaRouter existe exatamente para a superfície que o cerca: um endpoint compatível com OpenAI em mais de 200 modelos, preço de tabela do provedor repassado sem margem, failover automático entre provedores, uma DSL de roteamento para compor fallbacks e fusão de modelos para chamadas em estilo painel. Ser preciso sobre o que isso abrange aqui é importante. Não roteamos nenhum modelo Qwen-Image de qualquer versão, portanto o Qwen-Image-2.1 não é uma rota que você possa chamar do nosso lado — ele roda no seu hardware ou não roda de forma alguma. Também não roteamos o Gemini Omni 1.1 Flash. O que oferecemos no lado de movimento é a linha de vídeo da Kling, incluindo kling-v3, kling-v3-omni e kling-video-o1, além do MiniMax H3 — então a metade de animação deste pipeline tem uma rota hospedada que não exige um segundo contrato com fornecedor, e no lado de imagem oferecemos a família OpenAI GPT-Image, os níveis do Imagen 4 do Google e as prévias de imagem do Gemini, e o endpoint de imagem Grok Imagine da xAI. Como o preço de tabela é repassado em vez de receber margem, um corte de preço do fornecedor em qualquer um deles entra no ar aqui no mesmo dia.
Qual você realmente precisa
• Você precisa de recursos, não de filmagens — Qwen-Image-2.1, e o canal alfa é o motivo. Recortes transparentes de produtos, ícones, sprites e composições em camadas são onde um amostrador que emite RGBA economiza todo um pipeline de matting.
• Você precisa de movimento e precisa que ele seja mensurado — Gemini Omni 1.1 Flash. É o único dos dois com resultados independentes de arena no topo de um ranking, e o único com um preço por segundo publicado que você pode colocar em uma previsão.
• Você precisa dos dois — orçe a metade de vídeo por tentativa, não por recurso, e não presuma que o canal alfa sobrevive.
• Você precisa vender o resultado — Gemini Omni 1.1 Flash, e somente Gemini Omni 1.1 Flash, até que a Qwen publique termos comerciais para o Qwen-Image-2.1. Não há preço publicado nem term sheet para essa licença hoje.
O resumo honesto é que a comparação que os classifica é o artefato errado. O que vale a pena observar em seguida é se a Qwen vincula termos comerciais ao Qwen-Image-2.1 e se o Google fecha a lacuna de áudio nos leaderboards do Omni — são esses dois fatos, e não mais um placar, que decidem qual metade deste pipeline recebe o orçamento.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
