
Qwen3.8-Omni-Flash vs Qwen 3.8: um especialista Bill vs um de ponta
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Se você quer a versão curta: Qwen3.8-Omni-Flash é aproximadamente treze vezes mais barato por token do que Qwen 3.8 e é o único dos dois construído para lidar com uma hora de áudio-vídeo sem engasgar — enquanto Qwen 3.8, o núcleo aberto de 2,4 trilhões de parâmetros no topo da linha Qwen3.8, é o que você usa quando a resposta precisa ser certa em vez de barata, e o único dos dois cujos pesos você pode baixar. Eles compartilham um comprimento de contexto, um nome de família e uma janela de lançamento de agosto a setembro. Eles não são substitutos, e todo o valor desta comparação está em saber qual pergunta você está realmente fazendo.
Para ser preciso quanto aos nomes, porque a família é numerosa. Qwen 3.8 aqui significa o núcleo aberto de mistura de especialistas 2.4T-A95B — o modelo por trás do endpoint Qwen3.8-Max, que a Alibaba apresentou em 3 de agosto de 2026 e cujos pesos publicou em 12 de agosto, e que a Artificial Analysis indexa em 40 no seu Índice de Inteligência. Qwen3.8-Omni-Flash é o modelo omni-modal nativo que a Alibaba colocou em serviço de API em 18 de setembro de 2026, construído sobre a linha de arquitetura Qwen3.8-Flash, recebendo texto, imagem, áudio e vídeo e devolvendo texto. Tudo sobre o modelo principal é reportado pelo fornecedor ou indexado de forma independente, conforme indicado; tudo sobre o modelo omni é apenas reportado pelo fornecedor, porque tem apenas algumas horas e ninguém fora da Alibaba o mediu.
Dois modelos, uma família, briefings de design opostos
A tentação é ler isto como um modelo grande e um modelo pequeno da mesma geração, tal como se leria o Qwen3.8-Max em comparação com o Qwen3.8-Flash. Essa leitura está errada de uma forma que custa dinheiro. O Qwen 3.8 núcleo é um motor de raciocínio que, por acaso, aceita imagens e vídeo; o seu débito é medido em tokens por segundo em problemas difíceis, o seu preço é definido para refletir o custo de computação de uma passagem direta com 95 mil milhões de parâmetros ativos, e a sua folha de avaliação é uma lista de quadros de raciocínio e programação. Qwen3.8-Omni-Flash é um motor de perceção e ação que, por acaso, raciocina; o seu preço é definido em função do custo de ingerir horas de conteúdos multimédia, e a sua folha de avaliação é uma lista de quadros de áudio, vídeo e chamadas de ferramentas. Um está otimizado para profundidade por token. O outro está otimizado para tokens por hora de conteúdo.
Essa diferença aparece de forma mais acentuada num ponto que o marketing não menciona. Ambos os modelos aceitam cerca de um milhão de tokens e ambos aceitam vídeo. Mas Qwen3.8-Omni-Flash foi explicitamente projetado em torno do problema da duração — até uma hora de áudio e vídeo contínuos numa única chamada, com um modo Agentic Understanding no qual o modelo escolhe o que amostrar em vez de processar cada quadro, reduzindo os tokens por consulta de 145.736 para 79.117 e, ao mesmo tempo, aumentando a precisão no OmniVideoBench de 63,4 para 67,8. Qwen 3.8 não tem nenhum mecanismo publicado equivalente. Alimentá-lo com duas horas de vídeo é possível no papel; fazê-lo a um preço que sobreviva ao contato com uma equipe financeira é uma questão diferente, e é a pergunta que o modelo omni foi criado para responder.
As dimensões que realmente decidem isso
• Preço — Qwen3.8-Omni-Flash: $0,15 por milhão de tokens de entrada e $0,47 por milhão de tokens de saída, contra o Qwen 3.8 a $2,00 e $6,00. Leitura de cache: $0,016 contra $0,25.
• Pesos abertos — Qwen 3.8 publicou os pesos em 12 de agosto de 2026 sob uma licença personalizada; o Qwen3.8-Omni-Flash é somente API e a Alibaba não disse que ele será lançado.
• Contexto — um milhão de tokens em ambos os lados; 991K de entrada máxima no modelo omni, com 131K de saída máxima e um orçamento de raciocínio de 262K.
• Duração da mídia — até uma hora de áudio e vídeo contínuos em uma única chamada omni; o carro-chefe está documentado para entrada de vídeo, sem qualquer informação de custo por hora associada.
• Modalidade de saída — texto em ambos os lados. Nenhum dos dois gera fala, apesar da linhagem do modelo omni.
• Pontuação independente — Qwen 3.8 está em 40 no Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash ainda não tem nenhuma pontuação independente de qualquer tipo.

Por que as tabelas de benchmark não conseguem resolver isso
Não existe um quadro comparativo direto, e não vai haver um tão cedo. Os materiais de lançamento da Alibaba para Qwen3.8-Omni-Flashcomparam-no exclusivamente com o Qwen3.5-Omni-Plus, seu antecessor direto, e com o Gemini 3.8 Flash; os números do carro-chefe vêm de um conjunto totalmente diferente de avaliações de raciocínio e programação. As duas planilhas não compartilham uma única linha. Qualquer pessoa que publique uma tabela que os coloque lado a lado em um mesmo eixo construiu esse eixo por conta própria.
O que pode ser dito com honestidade é direcional. Segundo os próprios números do fornecedor, o modelo omni representa um grande salto em relação à linha omni que substitui — um ganho médio superior a 26% em aproximadamente trinta avaliações, com WildClawBench-MM em 71,0, UniClawBench em 69,6, LongAudioSpan em 82,7 — e um avanço genuíno, mas parcial, em relação ao Gemini 3.8 Flash, onde lidera em rankings centrados em áudio, como SpotSoundBench (67,2 contra 39,7) e MMAU (81,8 contra 76,9), e fica atrás no AgenticVBench, que é puramente de raciocínio de vídeo (36,8 contra 45,0). No lado dos modelos de ponta, a pontuação de 40 do Qwen 3.8 no Index é uma medição independente e vale mais do que qualquer uma das citadas acima. Esses são tipos diferentes de evidência e não devem ser combinados numa única média.

Uma comparação de custos detalhada, com a premissa declarada
Considere um trabalho de análise de documentos longos e vídeos: 300.000 tokens de entrada e 20.000 tokens de saída, um formato plausível para uma reunião gravada de noventa minutos com slides. Em Qwen3.8-Omni-Flash isso é 300.000 × US$ 0,15 por milhão = US$ 0,045 de entrada e 20.000 × US$ 0,47 por milhão = US$ 0,0094 de saída, então cerca de 5,4 centavos. Em Qwen 3.8 a mesma chamada é 300.000 × US$ 2,00 por milhão = US$ 0,60 e 20.000 × US$ 6,00 por milhão = US$ 0,12, ou cerca de 72 centavos. Um pouco mais de treze vezes o custo para a mesma contagem de tokens.
O número que muda a decisão não é a proporção, mas o volume. Com cem trabalhos desses por dia, isso é cerca de US$ 5 por dia contra cerca de US$ 72 por dia — a diferença entre um recurso que você lança e um recurso que você reduz o escopo. Mas se a tarefa for uma extração difícil de um contrato de 300 mil tokens, em que uma resposta errada custa uma hora de revisão humana, o prêmio de 13x é irrelevante e o modelo de raciocínio mais forte vence no primeiro erro que não comete. Defina a premissa antes de olhar para a linha de preço, não depois.
Onde cada um realmente se destaca
Qwen3.8-Omni-Flash vence em tudo o que é medido em horas. Transcrição de reuniões com diarização e extração de tarefas de acompanhamento, sumarização de vídeos longos, relatórios de pesquisa audiovisual, pipelines de legendagem e qualquer agente que tenha de decidir por si qual minuto de uma gravação importa. A melhoria de diarização relatada pelo fornecedor — a taxa de erro de locutor do AliMeeting caindo de 88,11 para 3,35 — é o tipo de delta que transforma um pipeline com revisão manual num pipeline automatizado, embora uma análise técnica chinesa do lançamento argumente que grande parte desse ganho vem de engenharia de front-end e de diarização em torno do modelo, e não do próprio modelo, por isso faça o benchmark com o seu próprio áudio antes de dispensar a etapa de revisão humana. O modelo omni também vence claramente no preço para qualquer carga de trabalho de texto de alto volume em que a qualidade do seu texto seja adequada, que a Alibaba afirma ser comparável à de modelos apenas de texto do mesmo tamanho — uma alegação não reproduzida, e que vale a pena testar em vez de presumir.
Qwen 3.8 vence sempre que o resultado é julgado em vez de contado: raciocínio complexo, trabalho agêntico de longo horizonte, trabalho de código em larga escala, análise de documentos de um milhão de tokens em que a síntese é o produto. Também vence numa dimensão que nada tem a ver com benchmarks — ele é open-weight. Se a sua restrição é residência de dados, implantação on-premise, ajuste fino ou simplesmente não querer um fornecedor no caminho da inferência, o modelo omni não é candidato de forma alguma, e nenhuma vantagem de preço fecha essa lacuna. Essa única restrição decide mais implantações reais do que todos os números acima.
Executando-os sem dois contratos
A fricção prática em uma comparação como esta raramente é a escolha do modelo; é que você acaba integrando dois fornecedores, duas relações de cobrança e dois conjuntos de código de cliente para descobrir qual deles você queria. O Qwen3.8-Max — o endpoint que carrega o núcleo aberto de 2,4 trilhões de parâmetros — está ativo no OrcaRouter sob o id de modelo qwen/qwen3.8-max, a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de saída, com um contexto de um milhão de tokens e entrada de texto, imagem e vídeo, ao lado de mais de 200 outros modelos em uma única chave pelo preço de tabela do provedor, com 0% de markup e failover automático entre provedores se um endpoint degradar. Qwen3.8-Omni-Flash não está nesse catálogo — ele roda nas plataformas próprias da Alibaba — então a configuração honesta hoje é o modelo principal na nossa rota e o modelo omni chamado diretamente, com a camada de roteamento dando a você um lugar para colocar o perdedor do teste depois de executá-lo.

O veredito
Escolha Qwen3.8-Omni-Flash quando a entrada é longa, a saída é curta e o volume faz do preço unitário a restrição vinculante. Escolha Qwen 3.8 quando a entrada é densa, a saída é o produto, e a correção ou o controle de implantação é inegociável. A zona de sobreposição — compreensão de vídeo — é o único lugar onde existe um confronto direto genuíno, e nessa zona o modelo omni detém o argumento de custo e duração, enquanto o modelo principal detém o argumento de raciocínio e pesos abertos. Rode os dois com seus próprios dados antes de se comprometer; o modelo omni ainda não tem avaliação independente, e uma vantagem de preço no dia do lançamento é exatamente o tipo de coisa que vale a pena confirmar em uma fatura, e não em um anúncio.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
