Um cartão de título hero para o Qwen3.8-Omni-Flash, com a linha de apoio "Alibaba - Qwen - 18 de setembro de 2026", o subtítulo "o modelo omni-modal nativo do Qwen - texto, imagem, áudio e vídeo na entrada, um milhão de tokens de contexto, até uma hora de áudio e vídeo contínuos por chamada", e três chips de estatísticas com os dizeres "Preço por milhão de tokens: $0,15 de entrada / $0,47 de saída", "Custo de áudio vs. geração anterior: 98% menor" e "Modalidade de saída: apenas texto".
Guides & Insights

Qwen3.8-Omni-Flash Chegou: Contexto de 1M de Tokens, Áudio 98% Mais Barato, Apenas Saída de Texto

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O lançamento abriu Qwen3.8-Omni-Flash aos clientes da API hoje, 18 de setembro de 2026, e o número com que se apresentou é uma fatura e não uma pontuação. Por hora de entrada de áudio, a Qwen afirma que o novo modelo custa 98% menos do que o seu antecessor Qwen3.5-Omni-Plus; por hora de áudio e vídeo combinados, 93% menos. Tudo o resto no anúncio decorre desse enquadramento. Qwen3.8-Omni-Flash é um modelo omni-modal nativo — texto, imagem, áudio e vídeo como entrada, um milhão de tokens de contexto, até uma hora completa de áudio e vídeo contínuos numa única chamada — e a Alibaba está a vendê-lo não como um melhor descritor de media, mas como o primeiro modelo Qwen criado para agir sobre eles. O slogan é "Omni Senses. Agentic Delivery." O senão, declarado sem rodeios nos mesmos materiais, é que o modelo responde apenas em texto: ouve e observa, mas não fala.

Nada abaixo foi reproduzido de forma independente. O modelo tem apenas algumas horas de vida, ainda não existe nenhuma avaliação dele por terceiros, e todos os números de benchmark e de preço nos materiais de lançamento são da própria Alibaba. Quando um número é informado pelo fornecedor, este artigo diz isso na frase que o contém; quando uma leitura vem de um crítico e não do fornecedor, ela é atribuída. A única coisa que é verificável de forma independente hoje — que o modelo está disponível nas plataformas da Alibaba e não no catálogo de mais ninguém — é justamente aquilo sobre o que o lançamento menos quer falar.

O que realmente foi lançado

A ficha técnica é excepcionalmente limpa para um lançamento omni-modal, o que já é, por si só, a história: a geração anterior de modelos omni desta família era montada a partir de codificadores de percepção separados acoplados a um LLM de texto, e este é construído diretamente sobre a Qwen3.8-Flash, linha arquitetural, com as modalidades tratadas nativamente em vez de enxertadas.

• Entrada — texto, imagem, áudio e vídeo, com áudio espacial estéreo e de quatro canais aceito; a saída é apenas texto.

• Contexto — um milhão de tokens, com entrada máxima em cerca de 991K (cerca de 983K no modo de raciocínio), saída máxima em 131K e um orçamento de raciocínio que chega a 262K.

• Duração — até uma hora de áudio ou áudio-vídeo contínuo por chamada, que é o número que torna possíveis os casos de uso de reuniões e vídeos longos sem fragmentação.

• Cobertura de fala — reconhecimento em 74 idiomas e geração de fala em 29 nas ferramentas relacionadas; um relato em chinês sobre o lançamento afirma 113 idiomas e dialetos para entrada de áudio.

• Disponibilidade — a plataforma de IA Qianwen e o Alibaba Cloud Model Studio (Bailian), sob o id de API qwen3-8-omni-flash. Os pesos não estão sendo divulgados. Uma variante Realtime é descrita como o primeiro modelo omni-modal com localização de fonte sonora.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

Os 98% são uma alegação de custo, e a aritmética por trás disso vale a pena ser vista

Uma redução de 98% no custo de uma hora de áudio é um número muito maior do que uma redução de 98% no preço de um token, e é na diferença entre essas duas coisas que o anúncio faz seu trabalho. O valor por hora é obtido calculando o preço de uma amostra de dois minutos e multiplicando por trinta, com o vídeo amostrado em 720p e um quadro por segundo. Essa é uma forma legítima de orçar uma carga de trabalho de produção, e também é uma descrição daquilo que se pede que o modelo examine: um quadro por segundo é suficiente para saber o que foi dito e, aproximadamente, o que aconteceu na tela, e está muito longe de ser suficiente para inspecionar operações em nível de quadro, avaliar a qualidade da edição ou detectar um artefato de um único quadro. Duas mudanças estão sendo multiplicadas — um corte real no preço unitário e uma política de amostragem muito mais agressiva — e apenas a primeira é uma melhoria do modelo.

Os próprios preços unitários são concretos. O preço internacional é cotado a $0,15 por milhão de tokens de entrada, $0,016 por milhão de tokens de entrada em cache e $0,47 por milhão de tokens de saída. O preço doméstico do Bailian é cotado a ¥0,8 por milhão para entrada multimodal, uma queda em relação a cerca de ¥18. Observe que os sistemas de cobrança internacional e continental são separados e os valores não são intercambiáveis; quem os comparar diretamente obterá uma resposta errada.

Esta é a parte do lançamento em que o roteamento importa mais do que o habitual. A OrcaRouter repassa o preço de tabela do provedor com 0% de margem, então um corte de preço de fornecedor como este chega aos nossos clientes no dia em que acontece, e não na próxima renovação de contrato. Uma comparação genuinamente verificável já está no nosso próprio catálogo: Qwen3.8-Flash, o modelo multimodal com o qual este é desenvolvido em paralelo, está roteável hoje a $0,15 por milhão de tokens de entrada e $0,47 por milhão de saída — o mesmo preço de tabela que a Alibaba está anunciando para o novo modelo omni — e transportou 2,47 bilhões de tokens de tráfego pela nossa API nos sete dias anteriores à escrita deste texto, o que é uma medida justa do apetite que essa categoria já tem. O próprio modelo omni ainda não está no nosso catálogo, e enquanto não estiver, ele roda nas próprias plataformas da Alibaba e em nenhum outro lugar. Não vamos fingir o contrário.

Todos os benchmarks do lançamento comparam uma única coisa

O destaque é uma melhoria média de mais de 26% em cerca de 30 avaliações — e cada uma dessas avaliações é feita em comparação com o Qwen3.5-Omni-Plus. Essa é a linha de base correta para um lançamento, e uma linha de base restrita: ela mostra que a família avançou, não onde ela chegou em relação a qualquer coisa que você talvez já esteja pagando.

Os números individuais, todos informados pelos fornecedores: WildClawBench-MM 71.0, um aumento de 36.5 pontos e a maior variação isolada do conjunto; UniClawBench 69.6; AgenticVBench subiu 22.3 pontos, chegando a 36.8; LongAudioSpan 82.7, alta de 8.3; OmniVideoBench 63.4, alta de 9.6; OmniCap-IF 28.2. O par mais impressionante é a diarização de falantes no AliMeeting, em que a taxa de erro cai de 88.11 para 3.35 e o cpWER, de 89.61 para 17.18 — um salto grande o bastante para merecer escrutínio em vez de aplausos. Uma análise técnica chinesa do lançamento defende exatamente isso, atribuindo a melhoria, em grande parte, à engenharia de front-end e de diarização que envolve o modelo, e não ao raciocínio do próprio modelo, e advertindo que o sistema se apresenta como especializado em audição, com raciocínio profundo de vídeo comparativamente mais fraco. Essa é a leitura de um crítico, não uma replicação medida, mas o tamanho do delta é o motivo para mantê-la em mente.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

O outro número que vale a pena guardar não é, de modo algum, uma pontuação. Naquilo que a Alibaba chama de modo Agentic Understanding, o modelo decide por si mesmo o que observar e ouvir, em vez de processar cada quadro, reunindo evidências em etapas progressivas, do mais grosseiro ao mais fino. No OmniVideoBench, esse modo eleva a acurácia de 63,4 para 67,8 enquanto reduz tokens por consulta de 145.736 para 79.117 — uma redução de 45,7%. Acurácia em alta e custo em queda simultaneamente é a alegação mais forte do lançamento, e é a que sustenta mais diretamente o argumento de venda agêntico.

A comparação do Gemini é mais restrita do que a cobertura sugere.

O posicionamento da Alibaba é de que a capacidade de áudio e vídeo "se aproxima" do Gemini 3.8 Flash, enquanto o desempenho geral em áudio o supera. Deixando de lado o enquadramento, as comparações divulgadas pelo fornecedor ficam assim. WildClawBench-MM: 71,0 contra 58,9. SpotSoundBench: 67,2 contra 39,7. MMAU: 81,8 contra 76,9. DailyOmni: 85,1 contra 84,0.Essas são lacunas reais em áudio e no uso de ferramentas centradas em áudio. Também são seletivas. No AgenticVBench, o quadro puramente de raciocínio de vídeo, a ordem se inverte — Gemini com 45,0 contra 36,8 do Qwen — e a própria Alibaba reconhece que o Gemini ainda lidera vários testes de compreensão de vídeo. Um resumo razoável é que o Qwen ficou com a metade de áudio do omni e continua atrás na metade de vídeo, o que é uma afirmação diferente daquela que as manchetes veicularam.

"O primeiro modelo omnimodal do Qwen" precisa de um qualificador

A ideia de que o Qwen3.8-Omni-Flash é o primeiro modelo omni-modal da Qwen circulou amplamente hoje e vale a pena ser preciso a respeito, porque a família tem uma entrada anterior com uma reivindicação legítima ao título. Qwen2.5-Omni, um modelo de pesos abertos de 7B lançado em março de 2025 sob uma arquitetura Thinker-Talker, também recebia texto, imagem, áudio e vídeo como entrada — e gerava fala, além de texto. O que é genuinamente inédito aqui é a nativa omni-modalidade: um modelo construído sobre a base Qwen3.8-Flash, em vez de um LLM de texto com codificadores de percepção acoplados, além de um escopo de design voltado em primeiro lugar para agentes. Ambas as afirmações são verdadeiras; apenas uma delas foi a que se repetiu. Se você está avaliando o modelo partindo do pressuposto de que nenhum modelo omni da Qwen existia antes desta semana, vai precificar mal o caminho de upgrade a partir do Qwen2.5-Omni, que é uma comparação que escrevemos separadamente.

É no ferramental que a alegação agêntica de fato reside.

Duas coisas foram lançadas junto com o modelo, e importam mais do que o cartão do modelo sugere, porque são o que transforma percepção em entrega. Qwen-MM-Plugins é um conjunto de plugins multimodais para harnesses de agentes que oferece a um agente externo compreensão de imagens, áudio, vídeo e documentos, além de memória de vídeos longos e edição de vídeo; ele anuncia suporte para Codex, Claude Code, Qwen Code, Gemini CLI e vários outros, e inclui ferramentas nomeadas, incluindo o Video2Note, que transforma horas de vídeo em notas PDF ilustradas. Qwen-Live Harness é um runtime de código aberto para interação omnimodal contínua em tempo real, atuando como uma camada de agendamento em que um usuário conversa ao vivo e delega trabalho mais pesado a agentes em segundo plano. Uma ressalva da cobertura do dia do lançamento: a página do Qwen-Live Harness no GitHub estava retornando um 404 quando a Gigazine a verificou, então trate o conjunto de ferramentas como anunciado, e não verificado, até que os repositórios sejam acessíveis.

A frase que o lançamento enterra: ela não fala

Para um modelo cujo antecessor gerava fala, o fato de Qwen3.8-Omni-Flash ter entrada multimodal e saída de texto é a linha mais consequente da especificação, e aparece nos materiais em grande parte como uma nota de rodapé. Isso significa que o modelo não pode ser inserido sozinho num produto de fala para fala. Qualquer dublagem, agente de voz ou conversa em tempo real construída sobre ele precisa de um estágio externo de texto para fala e, para vídeo, de um renderizador externo — e é exatamente por isso que existem o conjunto de plugins e o harness ao vivo. A consequência prática é um pipeline com mais peças móveis do que "um único modelo omni", e uma latência que precisa ser orçamentada ao longo de todas elas.

Há uma demonstração elegante da lacuna, e daquilo para que o modelo é bom, enterrada no lançamento. Num experimento de "modelo otimizando modelo", Qwen3.8-Omni-Flash melhorou autonomamente o reconhecimento do dialeto de Sichuan de Qwen2.5-Omni-3B, reduzindo a taxa de erro de caracteres de 25,79% para 15,30% em doze horas e construindo 3.413 amostras de treinamento ao longo de quatro rodadas. Um modelo que consegue diagnosticar e corrigir o tratamento de dialeto de um irmão menor está fazendo algo que uma API de transcrição não consegue. Isso, e não a tabela de benchmark, é o argumento mais claro para o que "agêntico" deve significar aqui.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

O que mudaria nossa leitura

O estado real das coisas é que este é um lançamento bem especificado, com uma história de preço convincente, nenhuma avaliação independente e pelo menos uma limitação estrutural que o anúncio atenua. Três coisas resolveriam a questão. Uma entrada no Artificial Analysis ou no LMArena transformaria os números dos fornecedores em números comparáveis, e ainda não existe nenhuma. Um teste independente da redução de 45,7% de tokens — a alegação de que a precisão sobe enquanto o custo cai — confirmaria o resultado mais útil e menos glamouroso do comunicado. E uma medição independente da diarização do AliMeeting mostraria se a queda de 88 pontos pertence ao modelo ou ao pipeline que o rodeia.

Até lá, a postura sensata é a que se aplica a qualquer modelo no seu primeiro dia: vale a pena testar, não vale a pena apostar um caminho de produção nele. Se já está a encaminhar através do OrcaRouter, a medida prática é manter a carga de trabalho nos modelos que já mediu e tratar o Qwen3.8-Omni-Flash como um candidato a testar em comparação com esses modelos, com o seu próprio áudio e vídeo, em vez de o fazer com base na tabela de referência de qualquer dos fornecedores. Se o seu caso de utilização for análise de reuniões ou de media de formato longo em chinês e inglês, a economia de tokens aqui é suficientemente forte para justificar o teste agora.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente