Conheça o Qwen3.8-Flash — um MoE multimodal de pesos abertos que antevê a arquitetura Qwen4. Ilustração regenerada.
Guides & Insights

Conheça o Qwen3.8-Flash: um MoE multimodal de pesos abertos que antecipa a arquitetura Qwen4 — US$ 0,15/US$ 0,47 por 1M de tokens no QwenCloud

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 26 de agosto de 2026, a equipe Qw​en disponibilizou como open source os pesos do Qwen3.8-Flash — lançados no Hugging Face e no ModelScope sob o nome Qwen3.8-Flash-Next — e lançou o modelo de produção que carrega o nome Qwen3.8-Flash na API QwenCloud, confirmando seu preço oficial no dia seguinte. O destaque — oficialmente confirmado no anúncio da própria Alibaba em 28 de agosto — é um mixture-of-experts multimodal de 125 bilhões de parâmetros que ativa apenas cerca de 6 bilhões de parâmetros por token, uma esparsidade de aproximadamente 95%, construído sobre uma arquitetura que a Alibaba descreve explicitamente como uma prévia inicial da geração Qwen4. A API de produção está disponível na QwenCloud por $0,15 por milhão de tokens de entrada, $0,47 por milhão de tokens de saída e $0,016 por milhão em cache hits — a forma mais barata de executar algo estruturalmente descendente do próximo carro-chefe da Alibaba, e a primeira vez que o laboratório lançou uma prévia de arquitetura como pesos abertos públicos antes de a família completa de modelos existir.

Um número tem mais peso do que o resto da ficha técnica: 6B. O Qwen3.8-Flash não obtém sua capacidade pelo tamanho bruto — ele a obtém de onde coloca o poder computacional. Um corpo MoE de 125B, uma tabela de embeddings N-gram de 51B e um pequeno módulo de previsão multi-token armazenam cerca de 180B de parâmetros no disco, mas cada token percorre apenas 6B deles. Essa é a aposta em que todo este lançamento se sustenta, e é a razão pela qual a conta do treinamento caiu tanto.

O que realmente foi lançado

Qwen3.8-Flash, sem o sufixo, é o modelo em produção agora disponível na API QwenCloud e dentro do produto Qwen Office da Alibaba; ele vem com um contexto padrão de 1 milhão de tokens e ferramentas integradas, a US$ 0,15/US$ 0,47 por milhão de tokens, com cache hits a US$ 0,016. Em 28 de agosto, a lista de disponibilidade se ampliou: de acordo com o anúncio da Alibaba, o Qwen3.8-Flash agora também pode ser acessado por meio do OpenCode Go, a assinatura de tarifa fixa do agente de codificação de terminal de código aberto — a própria lista de modelos do OpenCode o apresenta como qwen3.8-flash às mesmas tarifas de US$ 0,15/US$ 0,47 por milhão.

A screenshot of the official Qwen Studio blog post 'Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency' (captured August 27, 2026), showing the Qwen Studio navigation bar, the article headline, and the 'Now Open Weights' announcement banner.

O anúncio oficial do Qw​en Studio enquadra o lançamento dos pesos abertos como um convite ao ecossistema: enviar as mudanças estruturais cedo para que a comunidade e as pilhas de inferência possam se adaptar antes que a linha completa do Qwen4 seja construída. O primeiro sinal de que isso funcionou é o SGLang — o mecanismo de inferência apoiado pela LMSYS — publicando suporte no dia zero para o Qwen3.8-Flash-Next no mesmo dia, com o modelo também configurado para Transformers, vLLM e TokenSpeed.

A arquitetura é a história

This is not a Qw​en 3.8-generation model scaled down. Qwen3.8-Flash introduces four changes the team says the Qwen4 family will inherit, and each one targets a different bottleneck.

• Atenção — Gated DeltaNet mais Qwen Sparse Attention. A Gated DeltaNet (GDN) comprime o histórico em estados de tamanho fixo em três de cada quatro camadas, para que o modelo não releia tudo a cada etapa; a QSA então trata o contexto longo como um problema de busca — um indexador leve agrega a sequência em microblocos, pontua a importância em nível de bloco e direciona a atenção para as regiões mais relevantes. Nas medições da Alibaba, o kernel de atenção da QSA chega a ser até 7,6× mais rápido no prefill e 4,9× mais rápido no decode em contexto de 1M de tokens (relatado pelo fornecedor).

• Residual — Residual com Gating. O único fluxo residual torna-se quatro ramos paralelos com gating elemento a elemento, permitindo que a rede decida por token quanto ler e escrever em cada ramo; um ramo se estabelece como um canal de longa distância conectando camadas de atenção iniciais a camadas profundas. Os estados residuais são armazenados em FP8 para reduzir a largura de banda da memória.

• Embedding — Embeddings de n-gramas. Uma tabela de consulta com 51 bilhões de parâmetros, indexada pelo token atual e vários anteriores. Ela adiciona capacidade sem adicionar computação por token e, como a tabela pode residir na memória do host e ser pré-carregada assincronamente, ela não ocupa permanentemente a memória da GPU.

• Otimizador — Muon. Grandes parâmetros lineares 2D (atenção, GDN, especialistas MoE) são treinados com Muon, enquanto embeddings, o roteador e as partes de baixo posto do Gated Residual continuam com AdamW; a equipe reajustou a lei de escalonamento para a nova arquitetura em torno da mistura.

A single-column spec-sheet scoreboard titled 'Qwen3.8-Flash — the scoreboard' with the subtitle 'The 6B-active MoE that previews Qwen4', six rows reading 'Params: 125B MoE + 51B N-gram (~180B stored)', 'Active per token: ~6B (<5% activation)', 'Architecture: Qwen4 preview (QSA + GDN, gated residual, Muon)', 'Context: 262K native / 1M via YaRN', 'Price: $0.16 / $0.47 per 1M tokens', 'Open weights: Qwen3.8-Flash-Next (FP8 build available)', and a footer 'Benchmark figures vendor-reported; pricing as announced by Alibaba'; the OrcaRouter logo is composited in the bottom-right corner.

Para um desenvolvedor, dois desses aspectos importam imediatamente: a stack de atenção é o motivo pelo qual o contexto de 1M de tokens pode ser um padrão em vez de uma meta ambiciosa, e a tabela de N-gramas é o motivo pelo qual um modelo de 125B ainda pode ser servido de forma enxuta. O restante é material de prévia para o Qwen4 — que é exatamente como a Alibaba está posicionando.

A planilha de benchmark, honestamente rotulada

Cada número nesta seção é uma avaliação da própria Alibaba, com apenas um dia de existência e não reproduzida por nenhum laboratório independente no momento da redação. Trate-os como indicadores direcionais, não como resultados definitivos. Na suíte de benchmarks da Alibaba, o Qwen3.8-Flash-Next (6B ativo) registra SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 e MathVision 95.7, com uma pontuação JobBench de 55.7 — e a variante base, Qwen3.8-Flash-Next-Base, é relatada como o melhor modelo aberto em 8 de 14 benchmarks em uma comparação direta, incluindo MMLU-Pro, SuperGPQA, BBH e MMMU.

As alegações de posicionamento de família da Alibaba devem ser rotuladas como o que são — alegações. A empresa diz que o Qwen3.8-Flash supera o Claude Opus 4.6 por 9.1 pontos no SWE-bench Pro e cerca de 20 pontos no JobBench, e fica a um passo do Claude Opus 4.8. Tudo relatado pelo fornecedor, tudo não reproduzido. O que é verificável de forma independente hoje é mais limitado: os pesos estão disponíveis, a pilha de inferência já os executa, e o SGLang lançou suporte no mesmo dia. A reprodução independente da planilha de benchmarks está a dias de distância, não a semanas.

Quanto custa

O preço é a parte mais fácil de verificar, porque é um preço publicado e não um benchmark — e em 27 de agosto a Alibaba confirmou oficialmente a tarifa de produção do QwenCloud: US$ 0,15 por milhão de tokens de entrada, US$ 0,47 por milhão de tokens de saída e US$ 0,016 por milhão em cache hits, com a tarifa doméstica na China em ¥0,8/¥2,7/¥0,1. O número de cache hits é o que importa para workloads agênticos: um agente de contexto longo que relê um histórico grande a cada turno paga centavos em leituras repetidas, que é exatamente o workload que o stack de atenção do Qwen4-preview visa. A imprensa chinesa imediatamente comparou o preço principal com o dos concorrentes — cerca de um terço do que o DeepSeek-V4-Flash cobra, e um erro de arredondamento diante dos modelos fechados de fronteira. Na contabilidade da própria Alibaba, o custo do treinamento foi cerca de um nono do Qwen3.7-Plus, e essa alavancagem estrutural é o que permite que o preço da API fique onde está.

Junto ao restante da família Qw​en 3.8, a diferença é gritante: o principal Qwen3.8-Max custa US$ 2,00 e US$ 6,00 por milhão de tokens, e já está disponível no OrcaRouter pelo preço de tabela do provedor, sem nenhum acréscimo. Agora que a API de produção Qwen3.8-Flash está aberta, o mesmo repasse se aplica à taxa oficial de US$ 0,15/US$ 0,47 e à taxa de cache-hit de US$ 0,016 — uma camada de roteamento é a diferença entre ler sobre uma redução de preço e tê-la em uma configuração. Ambos os modelos atrás de uma única chave, com failover entre eles, sem segundo contrato.

O que significa "prévia do Qwen4"?

Leia o anúncio ao pé da letra e o que está em jogo fica claro: isso não é um novo nível do Qw​en 3.8 — é a arquitetura do Qwen4 lançada antecipadamente, sob a marca protetora de um modelo menor e mais barato. As razões para fazer isso são sólidas: frameworks, quantização e padrões de implantação precisam de tempo para amadurecer, e um modelo com 6B ativos é uma forma barata de a comunidade fazer um teste de estresse do GDN + QSA em escala antes de a Alibaba construir a coisa cara por cima disso. O outro lado da moeda é que o Qwen3.8-Flash de produção é uma API construída sobre uma arquitetura que o ecossistema mais amplo ainda está auditando. Os primeiros adotantes são, por construção, o conjunto de teste.

O caminho rápido para experimentá-lo

Hoje você tem quatro opções realistas. Hospede você mesmo os pesos abertos por meio de vLLM, SGLang, Transformers ou TokenSpeed — a versão FP8 é o primeiro passo sensato em qualquer coisa aquém de um nó completo. Chame a API do QwenCloud, agora disponível com a tarifa oficial de US$ 0,15/US$ 0,47 e acertos de cache a US$ 0,016. Use-a no OpenCode Go, a assinatura com tarifa fixa do agente de codificação de terminal open source, que adicionou o Qwen3.8-Flash esta semana (anunciado pela Alibaba em 28 de agosto, confirmado na lista de modelos do próprio OpenCode). Ou chame o Flash de produção por meio de um roteador, da mesma forma que você já chama o Qwen3.8-Max, com a tarifa oficial repassada sem nenhum markup — sem integração personalizada para manter.

A screenshot of the Hugging Face model card for Qwen/Qwen3.8-Flash-Next (captured August 27, 2026), showing the Image-Text-to-Text tag, the qwen4_exp library tag, the model description stating the artifacts are compatible with Hugging Face Transformers, vLLM, SGLang, and TokenSpeed, and that Qwen3.8-Flash is the official production version with 1M context by default and built-in tools, plus License 'qwen-community-1.0', Model size 180B params, Tensor type BF16, and 2,551 downloads last month.

A pergunta em aberto é a honesta: um modelo que ativa 6 bilhões de seus parâmetros consegue se sustentar em produção em uma ampla gama de cargas de trabalho, ou a folha de benchmarks que hoje parece de um dia continuará parecendo assim daqui a um mês? Isso não é motivo para esperar — é motivo para colocá-lo atrás de failover, e não na frente de toda a sua stack. Os pesos estão disponíveis, o preço está definido e a arquitetura é a direção declarada da Alibaba. As próximas semanas decidem se 6B foi suficiente.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube