
Conheça o Qwen3.8-Flash: um MoE multimodal de pesos abertos que antecipa a arquitetura Qwen4 — US$ 0,15/US$ 0,47 por 1M de tokens no QwenCloud
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Em 26 de agosto de 2026, a equipe Qwen disponibilizou como open source os pesos do Qwen3.8-Flash — lançados no Hugging Face e no ModelScope sob o nome Qwen3.8-Flash-Next — e lançou o modelo de produção que carrega o nome Qwen3.8-Flash na API QwenCloud, confirmando seu preço oficial no dia seguinte. O destaque — oficialmente confirmado no anúncio da própria Alibaba em 28 de agosto — é um mixture-of-experts multimodal de 125 bilhões de parâmetros que ativa apenas cerca de 6 bilhões de parâmetros por token, uma esparsidade de aproximadamente 95%, construído sobre uma arquitetura que a Alibaba descreve explicitamente como uma prévia inicial da geração Qwen4. A API de produção está disponível na QwenCloud por $0,15 por milhão de tokens de entrada, $0,47 por milhão de tokens de saída e $0,016 por milhão em cache hits — a forma mais barata de executar algo estruturalmente descendente do próximo carro-chefe da Alibaba, e a primeira vez que o laboratório lançou uma prévia de arquitetura como pesos abertos públicos antes de a família completa de modelos existir.
Um número tem mais peso do que o resto da ficha técnica: 6B. O Qwen3.8-Flash não obtém sua capacidade pelo tamanho bruto — ele a obtém de onde coloca o poder computacional. Um corpo MoE de 125B, uma tabela de embeddings N-gram de 51B e um pequeno módulo de previsão multi-token armazenam cerca de 180B de parâmetros no disco, mas cada token percorre apenas 6B deles. Essa é a aposta em que todo este lançamento se sustenta, e é a razão pela qual a conta do treinamento caiu tanto.
O que realmente foi lançado
Qwen3.8-Flash, sem o sufixo, é o modelo em produção agora disponível na API QwenCloud e dentro do produto Qwen Office da Alibaba; ele vem com um contexto padrão de 1 milhão de tokens e ferramentas integradas, a US$ 0,15/US$ 0,47 por milhão de tokens, com cache hits a US$ 0,016. Em 28 de agosto, a lista de disponibilidade se ampliou: de acordo com o anúncio da Alibaba, o Qwen3.8-Flash agora também pode ser acessado por meio do OpenCode Go, a assinatura de tarifa fixa do agente de codificação de terminal de código aberto — a própria lista de modelos do OpenCode o apresenta como qwen3.8-flash às mesmas tarifas de US$ 0,15/US$ 0,47 por milhão.

O anúncio oficial do Qwen Studio enquadra o lançamento dos pesos abertos como um convite ao ecossistema: enviar as mudanças estruturais cedo para que a comunidade e as pilhas de inferência possam se adaptar antes que a linha completa do Qwen4 seja construída. O primeiro sinal de que isso funcionou é o SGLang — o mecanismo de inferência apoiado pela LMSYS — publicando suporte no dia zero para o Qwen3.8-Flash-Next no mesmo dia, com o modelo também configurado para Transformers, vLLM e TokenSpeed.
A arquitetura é a história
This is not a Qwen 3.8-generation model scaled down. Qwen3.8-Flash introduces four changes the team says the Qwen4 family will inherit, and each one targets a different bottleneck.
• Atenção — Gated DeltaNet mais Qwen Sparse Attention. A Gated DeltaNet (GDN) comprime o histórico em estados de tamanho fixo em três de cada quatro camadas, para que o modelo não releia tudo a cada etapa; a QSA então trata o contexto longo como um problema de busca — um indexador leve agrega a sequência em microblocos, pontua a importância em nível de bloco e direciona a atenção para as regiões mais relevantes. Nas medições da Alibaba, o kernel de atenção da QSA chega a ser até 7,6× mais rápido no prefill e 4,9× mais rápido no decode em contexto de 1M de tokens (relatado pelo fornecedor).
• Residual — Residual com Gating. O único fluxo residual torna-se quatro ramos paralelos com gating elemento a elemento, permitindo que a rede decida por token quanto ler e escrever em cada ramo; um ramo se estabelece como um canal de longa distância conectando camadas de atenção iniciais a camadas profundas. Os estados residuais são armazenados em FP8 para reduzir a largura de banda da memória.
• Embedding — Embeddings de n-gramas. Uma tabela de consulta com 51 bilhões de parâmetros, indexada pelo token atual e vários anteriores. Ela adiciona capacidade sem adicionar computação por token e, como a tabela pode residir na memória do host e ser pré-carregada assincronamente, ela não ocupa permanentemente a memória da GPU.
• Otimizador — Muon. Grandes parâmetros lineares 2D (atenção, GDN, especialistas MoE) são treinados com Muon, enquanto embeddings, o roteador e as partes de baixo posto do Gated Residual continuam com AdamW; a equipe reajustou a lei de escalonamento para a nova arquitetura em torno da mistura.

Para um desenvolvedor, dois desses aspectos importam imediatamente: a stack de atenção é o motivo pelo qual o contexto de 1M de tokens pode ser um padrão em vez de uma meta ambiciosa, e a tabela de N-gramas é o motivo pelo qual um modelo de 125B ainda pode ser servido de forma enxuta. O restante é material de prévia para o Qwen4 — que é exatamente como a Alibaba está posicionando.
A planilha de benchmark, honestamente rotulada
Cada número nesta seção é uma avaliação da própria Alibaba, com apenas um dia de existência e não reproduzida por nenhum laboratório independente no momento da redação. Trate-os como indicadores direcionais, não como resultados definitivos. Na suíte de benchmarks da Alibaba, o Qwen3.8-Flash-Next (6B ativo) registra SWE-bench Pro 62.5, DeepSWE 1.1 58.7, CoWorkBench 73.9, AndroidWorld 84.5 e MathVision 95.7, com uma pontuação JobBench de 55.7 — e a variante base, Qwen3.8-Flash-Next-Base, é relatada como o melhor modelo aberto em 8 de 14 benchmarks em uma comparação direta, incluindo MMLU-Pro, SuperGPQA, BBH e MMMU.
As alegações de posicionamento de família da Alibaba devem ser rotuladas como o que são — alegações. A empresa diz que o Qwen3.8-Flash supera o Claude Opus 4.6 por 9.1 pontos no SWE-bench Pro e cerca de 20 pontos no JobBench, e fica a um passo do Claude Opus 4.8. Tudo relatado pelo fornecedor, tudo não reproduzido. O que é verificável de forma independente hoje é mais limitado: os pesos estão disponíveis, a pilha de inferência já os executa, e o SGLang lançou suporte no mesmo dia. A reprodução independente da planilha de benchmarks está a dias de distância, não a semanas.
Quanto custa
O preço é a parte mais fácil de verificar, porque é um preço publicado e não um benchmark — e em 27 de agosto a Alibaba confirmou oficialmente a tarifa de produção do QwenCloud: US$ 0,15 por milhão de tokens de entrada, US$ 0,47 por milhão de tokens de saída e US$ 0,016 por milhão em cache hits, com a tarifa doméstica na China em ¥0,8/¥2,7/¥0,1. O número de cache hits é o que importa para workloads agênticos: um agente de contexto longo que relê um histórico grande a cada turno paga centavos em leituras repetidas, que é exatamente o workload que o stack de atenção do Qwen4-preview visa. A imprensa chinesa imediatamente comparou o preço principal com o dos concorrentes — cerca de um terço do que o DeepSeek-V4-Flash cobra, e um erro de arredondamento diante dos modelos fechados de fronteira. Na contabilidade da própria Alibaba, o custo do treinamento foi cerca de um nono do Qwen3.7-Plus, e essa alavancagem estrutural é o que permite que o preço da API fique onde está.
Junto ao restante da família Qwen 3.8, a diferença é gritante: o principal Qwen3.8-Max custa US$ 2,00 e US$ 6,00 por milhão de tokens, e já está disponível no OrcaRouter pelo preço de tabela do provedor, sem nenhum acréscimo. Agora que a API de produção Qwen3.8-Flash está aberta, o mesmo repasse se aplica à taxa oficial de US$ 0,15/US$ 0,47 e à taxa de cache-hit de US$ 0,016 — uma camada de roteamento é a diferença entre ler sobre uma redução de preço e tê-la em uma configuração. Ambos os modelos atrás de uma única chave, com failover entre eles, sem segundo contrato.
O que significa "prévia do Qwen4"?
Leia o anúncio ao pé da letra e o que está em jogo fica claro: isso não é um novo nível do Qwen 3.8 — é a arquitetura do Qwen4 lançada antecipadamente, sob a marca protetora de um modelo menor e mais barato. As razões para fazer isso são sólidas: frameworks, quantização e padrões de implantação precisam de tempo para amadurecer, e um modelo com 6B ativos é uma forma barata de a comunidade fazer um teste de estresse do GDN + QSA em escala antes de a Alibaba construir a coisa cara por cima disso. O outro lado da moeda é que o Qwen3.8-Flash de produção é uma API construída sobre uma arquitetura que o ecossistema mais amplo ainda está auditando. Os primeiros adotantes são, por construção, o conjunto de teste.
O caminho rápido para experimentá-lo
Hoje você tem quatro opções realistas. Hospede você mesmo os pesos abertos por meio de vLLM, SGLang, Transformers ou TokenSpeed — a versão FP8 é o primeiro passo sensato em qualquer coisa aquém de um nó completo. Chame a API do QwenCloud, agora disponível com a tarifa oficial de US$ 0,15/US$ 0,47 e acertos de cache a US$ 0,016. Use-a no OpenCode Go, a assinatura com tarifa fixa do agente de codificação de terminal open source, que adicionou o Qwen3.8-Flash esta semana (anunciado pela Alibaba em 28 de agosto, confirmado na lista de modelos do próprio OpenCode). Ou chame o Flash de produção por meio de um roteador, da mesma forma que você já chama o Qwen3.8-Max, com a tarifa oficial repassada sem nenhum markup — sem integração personalizada para manter.

A pergunta em aberto é a honesta: um modelo que ativa 6 bilhões de seus parâmetros consegue se sustentar em produção em uma ampla gama de cargas de trabalho, ou a folha de benchmarks que hoje parece de um dia continuará parecendo assim daqui a um mês? Isso não é motivo para esperar — é motivo para colocá-lo atrás de failover, e não na frente de toda a sua stack. Os pesos estão disponíveis, o preço está definido e a arquitetura é a direção declarada da Alibaba. As próximas semanas decidem se 6B foi suficiente.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
