
Qwen3.8-Omni-Flash Cinco Dias Depois: Uma Porta, Sem Pesos e as Primeiras Pontuações Que Não São da Alibaba
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cinco dias após o fornecedor abrir Qwen3.8-Omni-Flash para clientes de API, o modelo ainda tem exatamente um único lugar. Ele roda na própria plataforma Qianwen do fornecedor e em seu serviço de nuvem Bailian; as listagens de terceiros que surgiram desde o lançamento são proxies diante desses mesmos endpoints, não um segundo lugar onde o modelo reside. Nenhum peso foi liberado. Os números do dia do lançamento — redução de 98% no custo de uma hora de áudio, ganho médio de 26% sobre Qwen3.5-Omni-Plus, um milhão de tokens de contexto, saída somente de texto — continuam sendo do próprio fornecedor e não reproduzidos. O que de fato mudou em cinco dias não é o modelo, mas o terreno ao redor dele: uma fina camada de pontuações de terceiros surgiu, o suporte a frameworks chegou no dia zero, e a comparação que todos estão buscando é com Gemini 3.8 Flash em vez do Qwen3.8-Flash com o qual este modelo foi desenvolvido lado a lado. Cada um deles merece um olhar mais atento do que a cobertura do lançamento lhe deu.
A porta é uma boa porta, e é a única.
A disponibilidade se ampliou sem se tornar plural. O modelo responde inalterado a uma requisição no formato OpenAI, o que significa que o código de cliente existente em grande parte funciona; o que quebra é o endpoint, porque os hosts internacional e da China continental são serviços separados com cobrança separada. Código apontado para o padrão ou falhará ou será cobrado na moeda errada, e o argumento de preço por hora só se sustenta no lado internacional. Bibliotecas de cliente de código aberto trouxeram suporte ao modelo desde o primeiro dia, o que é genuinamente útil e também não é um segundo provedor: uma biblioteca que fala com o Bailian é um wrapper de conveniência em torno da mesma única fonte de fornecimento.
Esse é o risco estrutural que vale a pena nomear. Um modelo de fonte única não tem caminho de failover. Se o endpoint aplicar limites de taxa, se degradar ou se uma região ficar indisponível, não há para onde ir, e nenhum nível de suporte de biblioteca de cliente muda isso. É também por isso que declaramos a nossa posição de forma clara em vez de insinuar o contrário: Qwen3.8-Omni-Flash não está no nosso catálogo. Não o alojamos, e um leitor que se registe à espera de o encaminhar ficaria enganado. O que é encaminhável é o resto da família — Qwen3.8-Flash e Qwen3.8-Max estão ambos ativos na nossa API — e a OrcaRouter repassa o preço de lista dos fornecedores com 0% de margem, por isso, quando os preços omni da Alibaba mudarem, ou no dia em que o modelo omni ficar disponível para encaminhamento, a alteração chega aos clientes no mesmo dia em vez de na próxima renovação de contrato.

As primeiras pontuações que não são da Alibaba são escassas e nada lisonjeiras.
Não existe nada no Artificial Analysis para este modelo, e essa ausência é a manchete honesta cinco dias depois: os rankings que todos citam para modelos adjacentes ainda não têm uma linha para o omni. A lacuna foi preenchida por outra coisa. Uma plataforma de avaliação de terceiros começou a publicar execuções contra o modelo, e seu resumo vale a pena ser lido justamente por quanto ele não diz. Ele relata classificação de e-mails com 99,0% de precisão (86º percentil), ética com 95,0% (23º percentil) e raciocínio com 56,0%, que coloca no 28º percentil e chama de fraqueza notável; a velocidade fica no 21º percentil, o custo no 58º, com uma taxa de sucesso geral de 89%.
Trate esses dados com muita cautela, e não apenas porque a amostra é pequena. A mesma página data o lançamento do modelo em 20 de setembro, dois dias depois de a Alibaba o ter disponibilizado, não indica datas de execução para nenhum dos resultados e exibe uma tabela de benchmark vazia sob um resumo que descreve números que a tabela não contém. Esse é o perfil de um arcabouço inicial, com pouca supervisão, e não de uma avaliação medida, e a leitura honesta é que estes são os primeiros pontos de dados que não vêm do fornecedor, e não os primeiros confiáveis. Eles são um motivo para testar o modelo por conta própria, não um motivo para concluir coisa alguma. A direção, porém, é consistente com o que os próprios materiais do fornecedor sugerem por omissão: este é um modelo de percepção e de mídia longa, e os painéis com forte ênfase em raciocínio não são onde ele foi direcionado.
Há também uma armadilha nos resultados de busca que vai pegar pessoas pelas próximas semanas. Qwen 3.8, o modelo de texto, tem um Artificial Analysis Intelligence Index na casa dos quarenta, e esse número foi citado em mais de um resumo como se descrevesse o modelo omni. Não descreve. São modelos diferentes com funções diferentes, e o modelo omni ainda não tem índice algum.

A tabela de benchmark ainda é um fornecedor comparando consigo mesmo
O número do lançamento — uma melhoria média superior a 26% em cerca de trinta avaliações — é medido inteiramente em relação ao Qwen3.5-Omni-Plus. Isso mostra que a família avançou. Não mostra onde o modelo se posiciona diante de qualquer coisa pela qual você já possa estar pagando, e as comparações seletivas que circularam junto com ele também não fecham essa lacuna. O quadro relatado pelo fornecedor em relação ao Gemini 3.8 Flash é uma vitória genuína nos testes de áudio e uma derrota naqueles que medem trabalho agêntico com vídeo: WildClawBench-MM 71,0 contra 58,9 e SpotSoundBench 67,2 contra 39,7 de um lado, AgenticVBench 36,8 contra 45,0 e OmniGAIA 74,0 contra 78,6 do outro. A própria linguagem de resumo da Alibaba — desempenho de áudio e vídeo "se aproximando" do Gemini, desempenho geral de áudio superando-o — é mais cautelosa do que as manchetes que gerou, e a versão cautelosa é a precisa.
• Contexto — 1M tokens, com aproximadamente 991K de entrada máxima (cerca de 983K no modo de pensamento) e 131K de saída máxima.
• Modalidade — texto, imagem, áudio e vídeo na entrada; apenas texto na saída. Sem geração de fala no modelo base.
• Duração — até uma hora de áudio ou áudio-vídeo contínuo por chamada, o que torna possível o trabalho com reuniões e mídias longas sem divisão em blocos.
• Cobertura linguística — reconhecimento em 74 idiomas, além de 39 dialetos chineses nos materiais de lançamento, com números mais amplos (113 idiomas e dialetos) citados em outros lugares para entrada de áudio.
• Detalhe de entrada — áudio espacial estéreo e de quatro canais aceito, com a variante Realtime descrita como o primeiro modelo omnimodal capaz de localizar um alvo pelo som.
• Preço — US$ 0,15 por milhão de tokens de entrada, US$ 0,016 em cache, US$ 0,47 de saída no lado internacional, e uma lista de preços separada para a China continental que não é comparável.
Os 98% são reais, e isso não é a sua conta.
Segundo a própria metodologia da Alibaba — uma amostra de dois minutos multiplicada por trinta, vídeo amostrado em 720p e um quadro por segundo —, uma hora de entrada de áudio cai de US$ 0,28 para menos de US$ 0,01, e uma hora de áudio e vídeo combinados, de US$ 3,27 para US$ 0,20. Essas são reduções grandes, específicas e relatadas pelo fornecedor, e são reduções em um único item de linha. A aritmética que importa é qual fatia da sua carga de trabalho esse item de linha representa. Um pipeline que gasta a maior parte de seus tokens em saída, em contexto em cache ou em quadros de vídeo amostrados com mais densidade que um por segundo verá uma variação percentual muito menor na fatura do que a manchete promete, e a manchete é sobre áudio de entrada, não sobre o total. Acrescente a saída apenas de texto e a lacuna aumenta de novo: qualquer coisa que precise falar de volta precisa de um segundo modelo, e esse modelo é cobrado separadamente.
Esta é a parte do cenário em que o roteamento se paga. O valor de um roteador pass-through não é um desconto — é que a própria tabela de preços do fornecedor é o que você paga, e que uma carga de trabalho pode ser distribuída por vários modelos, de modo que um modelo de fonte única seja um componente, e não uma dependência. Um modelo omni que é a única coisa que você pode chamar é um ponto único de falha tanto na camada de disponibilidade quanto na de preços.

O que cinco dias de produção realmente lhe diriam
Três coisas resolveriam as questões em aberto. Uma medição independente do resultado de diarização do AliMeeting — uma taxa de erro a descer de 88,11 para 3,35 e cpWER de 89,61 para 17,18 — mostraria se isso pertence ao modelo ou à engenharia de diarização e de front-end que o envolve, à qual pelo menos uma análise técnica chinesa atribui a maior parte do ganho. Um teste reproduzido da redução de tokens do modo agêntico, no qual a precisão subiu de 63,4 para 67,8 no OmniVideoBench enquanto os tokens por consulta caíram de 145.736 para 79.117, confirmaria a afirmação mais útil de todas do lançamento: a de que o modelo pode tornar-se melhor e mais barato ao mesmo tempo. E uma linha da Artificial Analysis ou de uma arena transformaria cada número de fornecedor acima em algo comparável, que é a condição prévia para o modelo ser escolhido em vez de apenas testado.
Até lá, a postura que faz sentido é a que se aplica a qualquer modelo com cinco dias de vida, um único host e nenhuma avaliação independente: vale a pena medi-lo com o seu próprio áudio e vídeo, mas não vale a pena torná-lo o único caminho do seu pipeline. Se a sua carga de trabalho for análise de reuniões ou de mídia de formato longo em chinês ou inglês e os seus custos forem dominados por horas de entrada em vez de tokens de saída, a economia aqui é forte o suficiente para justificar um teste esta semana. Se a sua carga de trabalho precisar de fala de volta, ou precisar de um fallback quando um provedor se degrada, o modelo como está hoje não pode ser a resposta completa — e nenhuma quantidade de suporte de framework no dia zero muda isso.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
