
Lançamento do Qwen3.8-Flash-Next: Por dentro da prévia da arquitetura Qwen4 da Alibaba
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
O documento mais útil que a Alibaba publicou em 26 de agosto de 2026 não foi o kit de imprensa — foi um relatório técnico. O Qwen3.8-Flash-Next, o modelo multimodal de mistura de especialistas de pesos abertos lançado naquele dia, chegou acompanhado de um artigo intitulado "Sobre o Design da Arquitetura Qwen3.8-Next: Avaliação, Eficiência e Estabilidade de Treinamento", e o relatório é a história. Ele faz o que os lançamentos de fornecedores quase nunca fazem: publica as ablações, os resultados negativos e os experimentos de receita de treinamento, e então traça uma linha de cada descoberta até a arquitetura da família Qwen4 que este modelo pretende antecipar.
O que realmente foi lançado em 26 de agosto
O modelo em si é modesto para os padrões de 2026 da Qwen, e isso é deliberado. O Qwen3.8-Flash-Next armazena 125B de parâmetros do modelo principal, mais uma tabela separada de embeddings n-gram de 51B — aproximadamente 176B antes de um módulo de previsão multi-token de 4B — mas ativa apenas 6B por token. É um modelo mixture-of-experts com 512 especialistas, roteamento top-10 e 48 camadas, com contexto nativo de 262.144 tokens e extensível a 1M via YaRN. Ele aceita texto, imagem e vídeo como entrada e gera texto. Os pesos estão no Hugging Face e no ModelScope sob a licença qwen-community-1.0, e o próprio blog da Alibaba o chama de "uma prévia experimental da arquitetura que servirá de base para o Qwen4" — o mesmo papel que o Qwen3-Next desempenhou para a linha Qwen3.5, um canário que voa antes do carro-chefe.
No mesmo dia, a Alibaba ativou a contraparte comercial: uma build servida chamada Qwen3.8-Flash na API QwenCloud a US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de saída. É fácil confundir os dois, e vale a pena distingui-los. O Qwen3.8-Flash-Next é a prévia de pesos abertos que o relatório técnico analisa; o Qwen3.8-Flash é a build de API de produção, com preço definido, contexto padrão de 1M de tokens e formatos de requisição compatíveis com OpenAI e Anthropic. O preço, os benchmarks e os argumentos de arquitetura derivam todos da mesma engenharia.

As quatro apostas de arquitetura no relatório técnico
A espinha dorsal do artigo são quatro apostas sobre como deve ser um modelo de fronteira de baixo custo e contexto longo, cada uma com respaldo experimental.
• Atenção — híbrido de GDN + QSA. Três de cada quatro camadas usam Gated DeltaNet, uma camada de atenção linear que comprime o histórico em um estado recorrente de tamanho fixo, em vez de um cache KV que cresce com o comprimento da sequência. A camada restante é o Qwen Sparse Attention, que agrega a sequência em micro-blocos, pontua-os de forma barata e executa atenção completa apenas nas regiões relevantes. A Alibaba relata acelerações de até 7,6× no prefill e 4,9× no decode no contexto de 1M; o benchmark de dia 0 do próprio SGLang mediu valores ainda maiores, de 10,2× e 6,6×. Com uma taxa de acerto do cache de prefixo de 90%, a taxa de transferência de prefill chega a 8,6× a do Qwen3.7-Plus. Esses números são fornecidos pelo fornecedor e por parceiros, não auditados de forma independente.
• Fluxo residual — Gated Residual. O único caminho residual é ampliado para quatro ramos paralelos com portas dinâmicas elemento a elemento, um design de múltiplos ramos no estilo Hyper-Connection com controle no estilo GatedNorm. A porta regula leituras e escritas por ramo, o que, segundo o artigo, suprime valores atípicos de ativação e, na prática, permite que os estados residuais sejam armazenados em FP8.
• Embedding — a tabela de n-gramas de 51B. Em vez de um embedding por token, o modelo indexa uma tabela de consulta no token atual mais os anteriores, armazenando frases inteiras e padrões locais. É quase gratuito por token e, como os endereços de consulta são conhecidos antecipadamente, ela pode viver na memória do host e ser pré-buscada assincronamente, mantida completamente fora da memória da GPU. Esse é o truque que permite que um checkpoint armazenado de 176B rode em máquinas da classe de 75GB, e remonta aos embeddings por camada do Gemma 3n e ao Engram do DeepSeek.
• Otimização — Muon, ajustado. O treinamento usa o otimizador Muon, um método de momento baseado em ortogonalização, aplicado a mapas lineares bidimensionais (atenção, GDN e pesos dos especialistas MoE), enquanto o AdamW é mantido para embeddings, o roteador e parâmetros de baixo posto. O artigo também relata um resultado negativo que vale a pena ler: o aquecimento do tamanho do lote foi descartado depois que se descobriu que custava 18,8% mais etapas do otimizador sem melhorar nada.
A tabela de benchmark, leia com atenção.
Todos os números de destaque aqui são da própria Qwen, publicados no cartão do modelo e no relatório, e nenhum deles foi reproduzido de forma independente — o modelo tem um dia de vida e nenhum terceiro o auditou ainda. Lido dessa forma, ainda assim é impressionante, porque o Qwen3.8-Flash-Next está trocando golpes com o DeepSeek-V4-Flash-0731, um modelo muito maior e estabelecido, com 6B de parâmetros ativos.
• DeepSWE 1.1 — 58,7 vs 54,4 (relatado pelo fornecedor).
• SWE-bench Pro — 62.5 vs 56.0 (relatado pelo fornecedor).
• Toolathlon Verificado — 73.5 vs 70.3 (relatado pelo fornecedor).
• LiveCodeBench v6 — 91.9 vs 90.6 (relatado pelo fornecedor).
• GPQA Diamond — 91.7 vs 90.8 (relatado pelo fornecedor).
• IFBench — 81.3 vs 79.2 (relatado pelo fornecedor).
Depois, a falha que o relatório revela publicamente: NL2Repo-Bench, 48,1 contra os 54,2 do DeepSeek-V4-Flash-0731 — um déficit real na geração de código em nível de repositório, a única dimensão de codificação agêntica em que o modelo menor não consegue acompanhar. Agents' Last Exam é um empate em 24,3 a 25,2. Em automação de escritório, a Qwen registra 73,9 no CoWorkBench — mas esse é um benchmark interno, e a Alibaba o mantém fora do gráfico principal.

Na parte de visão, a tabela autorrelatada mostra AndroidWorld com 84,5 contra 62,0 para o Claude Opus 4.6 Max e RealWorldQA com 88,5 contra 73,9. O Humanity's Last Exam é o único destaque em que o Qwen perde para o Claude Opus 4.6 Max de forma direta — e a avaliação dessa pontuação foi, ela própria, realizada pelo GPT-4o, então até essa comparação não é limpa.
O preço: um duodécimo do carro-chefe
{{1}}Então, o número que importa para os orçamentos.{{/1}} {{2}}A build do Qwen3.8-Flash oferecida custa US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída no QwenCloud.{{/2}} {{3}}Isso é cerca de um doze avos do preço do carro-chefe da própria Alibaba, o Qwen3.8-Max, que custa US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída — em um modelo que, segundo o relatório, foi treinado com aproximadamente um nono do poder computacional do Qwen3.7-Plus.{{/3}} {{4}}Os fornecedores chineses de modelos passaram o verão cortando os preços da camada flash, e este lançamento é a parte da Qwen nessa campanha, chegando com uma justificativa de arquitetura em vez de apenas um desconto.{{/4}}
Para quem compara dentro da categoria, a matemática é mais fácil quando todos os provedores mostram o mesmo número. A OrcaRouter roteia o restante da família Qwen — Qwen3.8-Max, Qwen3.8-27B e Qwen3.8 — pelo preço de tabela do provedor, com 0% de margem, então um corte de preço do fornecedor fica ativo do nosso lado no dia em que é anunciado. O Qwen3.8-Flash-Next ainda não está no nosso catálogo; quando ele chegar a um runtime que roteamos, ele se encaixa nessa mesma configuração de chave única e preço de tabela, sem um segundo contrato.
O que você pode fazer com isso hoje
O suporte de serving no dia zero é excepcionalmente amplo. O SGLang oferece uma página de cookbook e uma imagem dedicada (lmsysorg/sglang:qwen38flashnext); o vLLM tem vllm/vllm-openai:qwen38-flash-next; a NVIDIA valida ambos, além do TensorRT LLM, em um rack GB300 NVL72 com mais de 16.000 tokens por segundo por GPU em FP8, e o NeMo cobre o fine-tuning. Abaixo da escala de data center, o modelo executa em clusters DGX Spark e estações de trabalho 4×RTX PRO 6000, e a leva de quantizações comunitárias do mesmo dia — os GGUFs do Unsloth e uma build de 1 bit que cabe em 75GB de RAM com cerca de 80% da precisão total — significa que o checkpoint armazenado de 176B é genuinamente executável em hardware que uma equipe pequena possui. Equipes que preferem chamá-lo a executá-lo podem acessar a API do Qwen3.8-Flash por meio do QwenCloud da própria Alibaba e de várias plataformas terceirizadas, embora os pesos abertos sejam o que a maioria dos primeiros adotantes escolherá primeiro.

A matemática de VRAM por trás dessa lista é a tabela de n-gramas, e é para onde as stacks de serving estão convergindo a seguir. O embedding por camada que o tech report mantém fora da memória da GPU é uma estrutura de lookup pura — para cada token gerado, o modelo acessa apenas cerca de 16 das suas 320 milhões de linhas — o que torna o offloading dela barato. O vLLM serve o Qwen3.8-Flash-Next a partir de uma dev image dedicada enquanto o pull request de suporte à arquitetura ainda está aberto, e a peça mais recente desse trabalho, um draft PR do mesmo autor do vLLM (vllm-project/vllm#54371, não mergeado), adiciona um caminho de serving PLE-Offload que mantém a tabela na memória do host e a lê via CUDA unified virtual addressing em vez de reservar VRAM. Em FP8, a tabela representa cerca de 48GB dos ~173GB do checkpoint, então fazer o offload dela é a diferença entre uma GPU de data center e uma única placa de 96GB — uma RTX PRO 6000, ou o pool de memória unificada de um DGX Spark. Ainda é cedo, então trate isso como direção e não como opção suportada hoje; mas é o runtime alcançando o que o tech report já afirmava, e o ponto a observar se o número de VRAM é o que tem te impedido.
Uma prévia de um dia com números não reproduzidos é o caso clássico de não apostar um caminho de produção nela, e é exatamente para isso que serve o failover. Se um runtime carrega Qwen3.8-Flash-Next e você aponta um endpoint para ele com failover automático para um modelo em que você já confia, você obtém o benefício da nova arquitetura no tráfego não crítico e um fallback limpo quando ela falha — sem reconfiguração, porque isso é uma regra de roteamento, não uma mudança de código.
O que esta prévia diz sobre Qwen4
Alibaba já fez essa jogada antes. O Qwen3-Next pré-visualizou o Gated DeltaNet no final de 2025 com documentação enxuta, e a arquitetura só foi totalmente especificada quando a série Qwen3.5 a adotou em escala. O padrão está se repetindo: o Qwen3.8-Flash-Next é o canário, e o relatório é a especificação por experimento. Os pontos concretos a observar são se o carro-chefe Qwen4 adota a proporção de três para um entre GDN e QSA, se o embedding de n-gramas sobrevive ao contato com a produção em escala do carro-chefe e, acima de tudo, se avaliações independentes confirmam a vantagem de 6B ativos sobre modelos maiores. Se a tese de eficiência se confirmar, o carro-chefe Qwen4 pode ser lançado com custos de inferência drasticamente menores do que a geração anterior.
Perguntas Frequentes
Qwen3.8-Flash-Next e Qwen3.8-Flash — o mesmo modelo?
Não, e a distinção importa. O Qwen3.8-Flash-Next é a prévia da arquitetura de pesos abertos que o relatório técnico analisa; o Qwen3.8-Flash é a versão da API de produção que a Alibaba oferece no QwenCloud a US$ 0,16/US$ 0,47 por milhão de tokens, com um contexto padrão de 1M. Mesma linhagem de engenharia, artefatos diferentes — um é para auto-hospedagem e inspeção, o outro é um serviço gerenciado com preço.
As cargas de trabalho de produção deveriam migrar para ela hoje?
Não sem uma segunda opinião. Cada benchmark é relatado pelo fornecedor e não foi reproduzido; a arquitetura é nova o bastante para que as stacks de serving ainda estejam convergindo — o suporte do próprio vLLM ainda está chegando por meio de pull requests abertos — e a única lacuna de codificação agêntica (NL2Repo) está exatamente no tipo de tarefa que os desenvolvedores de produção enfrentam. Os pesos abertos tornam barato avaliar por conta própria, e o suporte de SGLang e vLLM desde o primeiro dia torna um piloto viável ainda esta semana — mas começar com um piloto protegido por failover é o caminho honesto, não um cutover.
Quando o Qwen4 real será lançado?
A Alibaba não disse. O único sinal de cronograma neste lançamento é histórico: o último canário, Qwen3-Next, voou cerca de uma temporada antes de a série Qwen3.5 adotar sua arquitetura. Nesse ritmo, os carros-chefe do Qwen4 estão mais próximos do que parecem — mas o relatório é explicitamente sobre arquitetura, não sobre um roteiro.
O resultado final
Qwen3.8-Flash-Next é o lançamento raro em que o artigo é o produto. Sobre o próprio modelo, o placar honesto diz: 6B de parâmetros ativos equiparando-se a modelos muito maiores na maioria dos benchmarks compartilhados, uma lacuna nomeada em código de nível de repositório, um preço servido de um duodécimo do carro-chefe, e uma arquitetura que é a resposta da Qwen para como um modelo de fronteira fica barato. O relatório técnico diz para que serve o Qwen3.8-Flash-Next — e não é o modelo. Ele é a evidência da arquitetura que será o Qwen4, e vale a pena ler antes de o Qwen4 ser lançado, porque a decisão que ele muda é aquela que você tomará quando o Qwen4 chegar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
