Um cartão hero gerado com o título 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash' sob o antetítulo 'Frente a frente - dois trabalhos diferentes', com o subtítulo 'Um lê uma hora de filmagem. O outro gera quarenta segundos dela.' e quatro chips: 'Sobreposição: compreensão de vídeo', 'Entrada: áudio + vídeo vs prompt', 'Saída: texto vs vídeo', 'Roteável aqui: nenhum dos dois'. O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash: Um assiste ao vídeo, o outro o cria

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Resposta curta: esses dois não são substitutos, e a comparação só faz sentido quando você deixa de tratar "omni" como uma categoria. Qwen3.8-Omni-Flash, que o fornecedor abriu para clientes de API em 18 de setembro de 2026, recebe texto, imagem, áudio e vídeo e devolve texto — é um modelo para ler uma hora de reunião ou de filmagem e dizer o que aconteceu. Gemini Omni 1.1 Flash, que o fornecedor lançou em 27 de agosto de 2026, recebe um prompt de texto ou imagem e devolve vídeo com áudio sincronizado — é um modelo para produzir a filmagem. Um consome mídia, o outro a produz. Se o seu pipeline precisa dos dois, você precisa dos dois, e a pergunta honesta não é qual vence, mas de qual deles você está realmente carente.

Nenhum dos modelos tem pesos abertos, nenhum é roteável através do OrcaRouter, e ambos são precificados em eixos que não podem ser convertidos entre si — tokens de um lado, segundos de vídeo gerado do outro. Onde eles genuinamente se sobrepõem é mais estreito do que o enquadramento "omni vs omni" sugere, e vale a pena definir essa sobreposição antes da aritmética de preços, porque é na aritmética de preços que os dois são comparados erroneamente com mais frequência.

O erro de categoria que vale a pena esclarecer primeiro.

Os materiais de lançamento da Alibaba comparam oQwen3.8-Omni-Flash com oGemini 3.8 Flash, e boa parte da cobertura que se seguiu resumiu isso como "supera o Gemini". Esse é um modelo do Google diferente doGemini Omni 1.1 Flash, e os dois não são pontos de referência intercambiáveis: o Gemini 3.8 Flash é o modelo multimodal de uso geral, e o Gemini Omni 1.1 Flash é o modelo de geração de vídeo, com uma tabela de preços própria e uma superfície de API própria. Todos os números de Qwen versus Gemini que circulam desde o lançamento — WildClawBench-MM 71,0 contra 58,9, SpotSoundBench 67,2 contra 39,7, AgenticVBench 36,8 contra 45,0 — são contra o Gemini 3.8 Flash, e não contra o modelo de vídeo Omni, e, de todo modo, nenhum deles é independente. Se você chegou aqui com um placar que coloca os dois modelos deste artigo no mesmo eixo, é quase certamente o modelo errado do Google na coluna da direita.

O que cada um realmente faz

• O que aceita como entrada — o Qwen3.8-Omni-Flash aceita texto, imagem, áudio e vídeo, incluindo áudio estéreo e espacial de quatro canais; o Gemini Omni 1.1 Flash aceita prompts de texto e imagem, além de até três segundos de vídeo de referência.

• O que ele retorna — Qwen3.8-Omni-Flash retorna apenas texto; Gemini Omni 1.1 Flash retorna vídeo com áudio sincronizado nativamente, em cenas extensíveis até 40 segundos, em incrementos de dez segundos.

• Superfície de controle — Qwen3.8-Omni-Flash expõe contexto, amostragem e um modo agêntico que decide por si mesmo o que olhar; Gemini Omni 1.1 Flash expõe controle de primeiro quadro e último quadro, uma retrospectiva de dez segundos para continuidade, e um nível de rascunho em 360p que o Google descreve como aproximadamente um terço do custo e cerca de 60% mais rápido.

• Resolução e finalização — Qwen3.8-Omni-Flash não tem resolução de saída porque não produz mídia; Gemini Omni 1.1 Flash gera saída em 720p, 1080p e 4K.

• Contexto e duração — Qwen3.8-Omni-Flash carrega um milhão de tokens e até uma hora de áudio-vídeo contínuo em uma única chamada; Gemini Omni 1.1 Flash é limitado pelo clipe que está gerando, não por uma janela de entrada.

• Como você paga — Qwen3.8-Omni-Flash é cobrado por token: US$ 0,15 por milhão de entrada, US$ 0,016 em cache, US$ 0,47 de saída na tabela internacional; Gemini Omni 1.1 Flash é cobrado por segundo de vídeo gerado, com a tarifa publicada do Google de US$ 0,10 por segundo para 720p.

• Abertura — fechado de ambos os lados. Não há pesos para nenhum dos modelos, e nenhum dos dois está disponível para roteamento pela nossa API hoje.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs Gemini Omni 1.1 Flash - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Input: text, image, audio, video', 'Output: text only', 'Context: 1M tokens', 'Max media: 1 hour per call', 'Billing: per token', 'Price: $0.15 / $0.47 per M'; right column Gemini Omni 1.1 Flash: 'Input: text and image prompts', 'Output: video with audio', 'Context: clip-bound', 'Max media: 40s scenes', 'Billing: per second', 'Price: $0.10 per second at 720p'. The footer reads 'Qwen figures vendor-reported; Google rates per its published list.' The OrcaRouter logo is composited in the bottom-right corner.

A sobreposição é a compreensão de vídeo, e é assimétrica.

O único lugar em que um comprador poderia razoavelmente colocá-los lado a lado é um pipeline que precise tanto entender o material gravado quanto produzi-lo — digamos, um assistente de edição que lê uma gravação longa, encontra os momentos que vale a pena manter e gera um corte. Na parte de compreensão, Qwen3.8-Omni-Flashfoi criado exatamente para isso: uma hora de áudio e vídeo contínuos por chamada, separação de falantes e um modo agêntico que eleva a precisão no OmniVideoBench do fornecedor de 63,4 para 67,8, ao mesmo tempo que reduz os tokens por consulta de 145.736 para 79.117. Na parte de produção, Gemini Omni 1.1 Flashé o que consegue gerar o clipe resultante com áudio sincronizado, e o modelo da Qwen não consegue produzir um único quadro de vídeo.

A assimetria também funciona na direção oposta, e é mais fácil de passar despercebida. O domínio de compreensão de um modelo de geração de vídeo é instrumental — ele precisa de suficiente de uma cena para manter um plano consistente ao longo de uma extensão de dez segundos, o que é um requisito diferente de responder a uma pergunta sobre o que foi dito na terceira hora de uma reunião. O modelo do Google tem o histórico mais longo em qualidade de geração e o mais curto em análise de formato longo; o da Alibaba tem o inverso. Se a sua tarefa é "encontrar os três minutos que importam nesta gravação", o modelo de geração não é a ferramenta. Se a sua tarefa é "produzir um clipe de trinta segundos que corresponda a este briefing", o modelo de compreensão também não é a ferramenta.

Por que a comparação de preços continua dando errado

Uma tarifa por segundo e uma tarifa por token não se convertem, e a tentativa de convertê-las produz os dois erros que dominam esta comparação. O primeiro é comparar um clipe gerado inteiro com uma tarifa de entrada por token e concluir que o modelo de vídeo é centenas de vezes mais caro — o que é verdadeiro e sem sentido, porque não estão vendendo a mesma coisa. O segundo é comparar apenas os preços de entrada e ignorar que o corte de 98% no áudio da Alibaba se aplica a horas de áudio de entrada, enquanto a tarifa do Google se aplica a segundos de vídeo de saída, de modo que os dois "cortes" nem sequer estão do mesmo lado do medidor.

O que se pode dizer com honestidade é isto. Segundo a metodologia da própria Alibaba — uma amostra de dois minutos multiplicada por trinta, vídeo em 720p e um quadro por segundo —, uma hora de entrada combinada de áudio e vídeo no Qwen3.8-Omni-Flash está cotada em cerca de US$ 0,20, contra US$ 3,27 em relação à geração anterior. Gerar quarenta segundos de vídeo em 720p com o Gemini Omni 1.1 Flash ao preço publicado pelo Google de US$ 0,10 por segundo custa US$ 4,00, e rascunhar os mesmos quarenta segundos em 360p fica perto de US$ 1,20 segundo o enquadramento de um terço do custo do Google. Os dois conjuntos de números são reportados pelos fornecedores e nenhum deles foi reproduzido de forma independente. A conclusão útil não é qual número é menor, mas sim que analisar uma hora de filmagem e gerar quarenta segundos dela estão na mesma ordem de grandeza — que é a verdadeira razão pela qual um pipeline de produção que faz as duas coisas precisa de um modelo de custos, e não de um vencedor.

Esse também é o argumento para manter os dois em uma única chave em vez de dois contratos. Nenhum dos modelos omni é roteável pelo OrcaRouter hoje: Qwen3.8-Omni-Flash roda apenas nas próprias plataformas da Alibaba, e o Google não abriu a API de vídeo Omni para roteamento por terceiros, então não hospedamos nenhum dos dois e não vamos fingir que hospedamos. O que está ativo em nosso catálogo é o irmão de cada família — Qwen3.8-Flash e Gemini 3.8 Flash — ambos chamáveis hoje por meio de um único endpoint ao preço de tabela do provedor com 0% de margem, o que faz com que um teste A/B em relação aos números do próprio fornecedor seja uma questão de mudança de configuração, e não de uma segunda integração.

A headless screenshot of the OrcaRouter model page for Gemini 3.8 Flash at www.orcarouter.ai/models/google/gemini-3.8-flash, showing the model header, the input-modality and capability row (text, image, video, audio, tools, JSON, reasoning), the published pricing and the p50 TTFT figure.

Onde cada um se destaca, dito sem rodeios

Qwen3.8-Omni-Flash vence em tudo o que é medido em horas de entrada: transcrição e diarização de reuniões, sumarização de gravações longas, uso agêntico de ferramentas com muito áudio e custo por hora de mídia processada. Os resultados de áudio relatados pelo fornecedor são fortes, e a sua fraqueza está onde o modelo nunca foi apontado — os painéis com muito raciocínio, onde as primeiras execuções de terceiros o colocam no 28.º percentil em raciocínio, com uma métrica de velocidade no 21.º, numa amostra suficientemente pequena para que os números devam ser encarados como um incentivo a testar, e não como um veredicto.

Gemini Omni 1.1 Flash vence na saída: geração de planos com áudio sincronizado, continuidade em cenas prolongadas, controlo ao nível do frame e o acabamento em 4K que um pipeline de entrega pode simplesmente exigir. A sua vantagem não é uma pontuação de benchmark — é que o outro modelo não consegue fazer o trabalho de todo. Onde é mais fraco é em tudo o que exige manter uma hora de contexto, porque não foi concebido para isso.

A decisão, e o que observar

Se você está escolhendo entre eles, a questão é qual metade do pipeline está sem atendimento. Uma equipe que já gera vídeo e precisa entender gravações longas deveria testar Qwen3.8-Omni-Flash com seu próprio áudio esta semana; uma equipe que analisa mídia e precisa produzi-la deveria testar Gemini Omni 1.1 Flash. Uma equipe que precisa dos dois está diante de dois fornecedores, dois modelos de cobrança e duas integrações, que é justamente a situação em que uma única camada de roteamento deixa de ser uma conveniência e passa a ser o que mantém o modelo de custos legível.

Duas coisas mudariam esta leitura. Uma avaliação independente do Qwen3.8-Omni-Flash substituiria cada número de fornecedor acima por um comparável — nenhuma existe ainda, e sua ausência é a maior lacuna individual desta comparação. E um preço publicado para saída em 1080p e 4K do Google tornaria a aritmética de ponta verificável; hoje esses números circulam apenas como estimativas de mercado, e não como a lista do próprio Google.

A headless screenshot of Google's Gemini API documentation page for Gemini Omni Flash at ai.google.dev/gemini-api/docs/omni, showing the docs navigation, the model identifier gemini-omni-1.1-flash, and the description of its native multimodality and conversational editing.

Uma nota final sobre enquadramento. "Omni" deixou de significar algo preciso — agora abrange tanto um modelo que lê uma hora de áudio de reunião quanto um que renderiza um clipe de quarenta segundos com som, e tratar a palavra como uma categoria é como os compradores acabam comparando uma taxa por token com uma taxa por segundo e tirando uma conclusão disso. Os modelos são complementares, com uma sobreposição estreita, e a postura correta em relação a ambos, cinco dias e quatro semanas após seus respectivos lançamentos, é a mesma: avaliá-los com seu próprio material e manter um segundo caminho aberto.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente