
Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 meses depois, a atualização perdeu a voz
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Eis o facto que torna esta comparação mais interessante do que uma simples renovação geracional. O modelo mais antigo consegue falar e o mais recente não. Qwen2.5-Omni, lançado em março de 2025, recebia texto, imagens, áudio e vídeo como entrada e respondia em texto ou em fala natural em streaming, num único modelo ponta a ponta que podias descarregar. Qwen3.8-Omni-Flash, lançado a 18 de setembro de 2026, recebe as mesmas quatro modalidades através de uma janela de contexto trinta vezes maior, processa uma hora de áudio-vídeo contínuo onde o seu antecessor lidava com segundos, e devolve apenas texto. Dezoito meses de trabalho compraram uma capacidade de entrada vastamente maior e abdicaram do canal de saída. Se isso é progresso ou uma troca depende inteiramente daquilo para que usavas o modelo antigo — e a resposta divide-se claramente em duas.
Os números do Qwen2.5-Omni são do próprio fornecedor, provenientes de seus materiais de lançamento de março de 2025, e dezoito meses de ampla implantação os validaram em parte. Os números do Qwen3.8-Omni-Flash também são da Alibaba, provenientes de materiais de lançamento publicados poucas horas antes da redação deste texto, e nada neles foi reproduzido de forma independente. Quando uma afirmação vem de um crítico e não do fornecedor, ela é atribuída como tal. O único fato estrutural que dispensa verificação é também o mais significativo: Qwen2.5-Omni é de pesos abertos e pode ser baixado, e o Qwen3.8-Omni-Flash não é.
O que era o Qwen2.5-Omni e por que ele importava
Quando foi lançado em 26 de março de 2025, Qwen2.5-Omni foi o primeiro modelo omnimodal ponta a ponta da família — o lançamento o apresentou como a resposta ao problema do "zoológico de especialistas", em que transcrição, visão e voz precisavam cada uma de um modelo separado e de uma camada de integração separada. O modelo 7B lidava com todas as quatro modalidades de entrada e com saída tanto de texto quanto de fala, afirmava ter resultados de última geração no benchmark de fusão OmniBench, à frente do Gemini-1.5-Pro, e relatava uma pontuação de qualidade de geração de fala de 4,51 que a Alibaba descreveu como de nível humano. Uma variante 3B seguiu a mesma arquitetura.
A engenharia que fez isso funcionar merece ser nomeada, porque o novo modelo não a utiliza. Thinker-Talker dividiu o trabalho em dois: um transformer Thinker fundiu os codificadores de áudio e imagem e produziu semântica e texto, enquanto um Talker transmitia tokens de fala em fluxo a partir dos estados ocultos do Thinker, compartilhando todo o histórico da conversa. O RoPE multimodal alinhado temporalmente (TMRoPE) intercalava posições de vídeo e áudio para que os dois fluxos permanecessem sincronizados. O streaming em blocos permitiu que os codificadores fizessem a percepção enquanto o modelo de linguagem lidava com sequências longas, o que tornou possíveis respostas faladas de baixa latência. Duas vozes fixas foram lançadas com ele, Chelsie e Ethan.
As restrições eram igualmente reais. O contexto era de 32.768 tokens. A memória era o fator limitante muito mais do que o poder de computação: as próprias tabelas da Alibaba colocam a inferência BF16 com FlashAttention-2 em cerca de 31 GB de memória de GPU para um vídeo de 15 segundos, 42 GB para 30 segundos e 60 GB para um minuto inteiro. Um minuto de vídeo, em um modelo de 7B, em uma das maiores GPUs individuais que se podia alugar. Esse número é o que se deve ter em mente, porque é o número que o modelo de 2026 foi criado para destruir.
O que é o Qwen3.8-Omni-Flash
O novo modelo é nativamente omni-modal, em vez de montado — construído diretamente sobre a Qwen3.8-Flash linha de arquitetura, e não como um LLM de texto com codificadores de percepção acoplados, o que é uma diferença estrutural e não apenas um rótulo de geração. Ele aceita texto, imagem, áudio e vídeo, incluindo áudio estéreo e espacial de quatro canais, e retorna texto em um contexto de um milhão de tokens, com cerca de 991K de entrada máxima, 131K de saída máxima e um orçamento de raciocínio de 262K. Ele processa até uma hora de áudio-vídeo contínuo por chamada. O reconhecimento de fala abrange 74 idiomas, com a geração de fala em 29 deles sendo tratada pelas ferramentas ao redor, e não pelo modelo. Está disponível na plataforma Qianwen AI e no Alibaba Cloud Model Studio sob o id qwen3-8-omni-flash, a $0.15 por milhão de tokens de entrada e $0.47 por milhão de saída, com entrada em cache a $0.016.

Dezoito meses, dimensão por dimensão
• Contexto — Qwen2.5-Omni com 32.768 tokens contra Qwen3.8-Omni-Flash com um milhão, aproximadamente um aumento de trinta vezes.
• Duração da mídia — segundos de vídeo, limitados pela memória da GPU, em comparação com uma hora de áudio e vídeo contínuos em uma única chamada hospedada.
• Saída — texto mais fala natural em streaming no modelo antigo; apenas texto no novo.
• Implantação — O Qwen2.5-Omni tem pesos abertos sob a licença Apache-2.0, disponível para download no Hugging Face e no ModelScope; o Qwen3.8-Omni-Flash é somente via API, sem lançamento de pesos anunciado.
• Hardware — 7B parâmetros que exigem até ~60 GB de memória de GPU para um minuto de vídeo, em contraste com um endpoint hospedado que você não provisiona de forma alguma.
• Preço — o modelo antigo custa uma GPU; o novo custa US$ 0,15 por milhão de tokens de entrada, e a Alibaba afirma que a entrada de áudio por hora é 98% mais barata do que a geração Qwen3.5-Omni-Plus que ele substitui.
• Geração de fala — duas vozes fixas em 2025, contra 29 idiomas de geração de fala nas ferramentas de 2026, nada disso produzido pelo próprio modelo.
O ofício que ninguém anunciou
Leia as duas fichas técnicas em conjunto e a forma dos últimos dezoito meses fica clara. A Alibaba passou o intervalo resolvendo absorção — quanta mídia um modelo consegue absorver, com que baixo custo, e quanto da decisão ele consegue tomar sozinho. Qwen3.8-Omni-Flash é um triunfo nesse eixo. O modo Agentic Understanding, no qual o modelo escolhe o que amostrar em vez de processar cada quadro, reduz os tokens por consulta de 145.736 para 79.117, ao mesmo tempo que eleva a precisão do OmniVideoBench de 63,4 para 67,8, e o fornecedor relata que o erro de diarização de falantes no AliMeeting cai de 88,11 para 3,35.
O que o intervalo não priorizou foi a saída. O truque característico do modelo de 2025 — um modelo que ouve você e responde em voz alta, de ponta a ponta, sem um sintetizador de fala separado — não tem sucessor aqui. Se você criou um agente de voz, um pipeline de dublagem ou uma ferramenta de acessibilidade no Talker do Qwen2.5-Omni, o modelo de 2026 não é uma atualização dele; é um componente ao qual você teria de acoplar um novo estágio de conversão de texto em fala, adicionando latência e um fornecedor a um pipeline que antes não tinha nenhum dos dois. Os materiais de lançamento são honestos quanto a isso se você ler a linha de modalidade com atenção, mas esse não é o destaque, e qualquer pessoa que migrar com a suposição de que "omni" significa a mesma coisa nas duas versões descobrirá a diferença em produção.

Por que o modelo de 2025 ainda tem um emprego
Três razões, e nenhuma delas é nostalgia. A primeira é a voz, como acima. A segunda são os pesos abertos: 32K de contexto e uma pegada de 7B rodam em hardware que você controla, offline, sem nenhum dado saindo do prédio e sem medidor por token — a única opção se o seu áudio estiver sujeito a uma regra de residência ou se o seu orçamento de latência proibir uma ida e volta. A terceira é o custo em volume muito baixo. Uma GPU que você já possui é gratuita na margem; os US$ 0,15 por milhão de tokens do modelo hospedado são baratos, mas não zero, e o custo fixo de provisionar capacidade para ele é real para uma carga de trabalho que roda duas vezes por semana.
O contra-argumento é que as restrições do modelo antigo apertam mais a cada ano. Um minuto de vídeo, 32K de contexto e nenhuma chamada de ferramenta ou saída estruturada num mundo em que os agentes são o formato de implantação padrão é um envelope estreito. Para um pipeline que precisa ingerir reuniões gravadas, Qwen3.8-Omni-Flash não é apenas melhor — é a diferença entre ser possível e não ser, porque o modelo de 2025 fisicamente não consegue comportar a entrada.
Vale a pena ser concreto sobre quanta vida resta nos pesos antigos, porque "legado" subestima-os. O Qwen2.5-Omni-7B repositório registrou 343.676 downloads no último mês quando o verificamos em 18 de setembro de 2026, com cerca de cem Spaces da comunidade e dezenas de fine-tunes, adaptadores e quantizações construídos por cima. Independentemente do que o modelo principal faça, uma grande população de pessoas ainda está publicando com o modelo de 2025 — e, notavelmente, a Hugging Face não listou nenhum provedor de inferência implantando-o, o que significa que quase todo esse uso é auto-hospedado.
O novo modelo melhora o antigo.
O detalhe mais estranho e mais persuasivo do lançamento está enterrado perto do final dos materiais. Em um experimento que a Alibaba descreve como um modelo otimizando um modelo, Qwen3.8-Omni-Flash melhorou autonomamente o reconhecimento de fala em dialeto de Sichuan do Qwen2.5-Omni-3B — o irmão menor do modelo que ele nominalmente substitui — reduzindo a taxa de erro de caracteres de 25,79% para 15,30% em doze horas e criando 3.413 amostras de treinamento ao longo de quatro rodadas.
Esse é um argumento melhor em favor do modelo mais recente do que qualquer benchmark do lançamento, e reformula a relação entre os dois. O modelo de 2026 não é apenas um substituto para o de 2025; é uma ferramenta que torna os pesos de 2025 melhores. Se você está executando o Qwen2.5-Omni em produção para um idioma ou dialeto que ele lida mal, o caminho prático pode ser manter a implantação e usar o novo modelo para construir os dados de treinamento, em vez de migrar a carga de trabalho. Observe, porém, que esta é uma demonstração relatada pelo fornecedor, sem metodologia publicada, e deve ser tratada como uma anedota encorajadora, e não como uma receita reproduzível.

Se você estiver migrando
A decisão raramente se resume a um único modelo. Uma equipa que está a deixar um modelo omni auto-hospedado escolhe entre três formas: manter-se em pesos abertos e continuar a provisionar, passar para uma API de fornecedor e abdicar do controlo, ou dividir a carga de trabalho para que apenas a parte que precisa de uma ingestão de um milhão de tokens vá para o modelo alojado. Essa terceira opção é geralmente a certa e é também a que as pessoas ignoram, porque parece dar mais trabalho do que realmente dá — o ajuste fino de dialeto em que passou um mês não tem de ser deitado fora porque a fase de resumo de reuniões mudou.
Onde o encaminhamento ajuda é nas costuras. O OrcaRouter dá-lhe uma única chave para mais de 200 modelos, com 0% de margem sobre o preço de tabela do fornecedor e failover automático se um endpoint se degradar, o que significa que a metade alojada de um pipeline dividido não precisa do seu próprio contrato, do seu próprio código de cliente e da sua própria monitorização antes de saber se a carga de trabalho justifica algo disto. Para deixar claro o que não fazemos: nenhum dos modelos omni está no nosso catálogo — ambos são executados nas plataformas da Alibaba ou no seu próprio hardware —, pelo que esta é uma decisão de encaminhamento que toma em torno dos modelos, e não através de nós.
Quem deve se mover, e quem não deve
Mude se a sua carga de trabalho for áudio ou vídeo de longa duração, se 32K de contexto for o que impede um pipeline de existir, se precisar de comportamento agêntico sobre mídia, ou se a diarização de falantes em escala for o problema que você tem. Fique se precisar que o modelo fale, se o seu áudio não puder sair da sua infraestrutura, se depender dos pesos específicos do Qwen2.5-Omni que você já ajustou, ou se o seu volume de chamadas for baixo o suficiente para que uma GPU que você possui supere um medidor de uso.
O resumo incômodo é que isto é menos uma substituição do que uma bifurcação na linha de produtos. A Alibaba passou dezoito meses construindo o melhor modelo de entrada que consegue e não construiu um sucessor para a metade de saída. Se o seu trabalho está do lado da entrada, a atualização é quase obrigatória. Se está do lado da saída, o modelo de 2025 ainda é a coisa mais recente que faz o que você precisa — e vale a pena saber disso antes de planejar uma migração que apagaria silenciosamente uma capacidade da qual você depende.
