Lançamento do Qwen3.8-Flash-Next — Por dentro da prévia da arquitetura Qwen4 da Alibaba. Ilustração regenerada.
Guides & Insights

Lançamento do Qwen3.8-Flash-Next: Por dentro da prévia da arquitetura Qwen4 da Alibaba

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O documento mais útil que a Ali​baba publicou em 26 de agosto de 2026 não foi o kit de imprensa — foi um relatório técnico. O Qwen3.8-Flash-Next, o modelo multimodal de mistura de especialistas de pesos abertos lançado naquele dia, chegou acompanhado de um artigo intitulado "Sobre o Design da Arquitetura Qwen3.8-Next: Avaliação, Eficiência e Estabilidade de Treinamento", e o relatório é a história. Ele faz o que os lançamentos de fornecedores quase nunca fazem: publica as ablações, os resultados negativos e os experimentos de receita de treinamento, e então traça uma linha de cada descoberta até a arquitetura da família Qwen4 que este modelo pretende antecipar.

O que realmente foi lançado em 26 de agosto

O modelo em si é modesto para os padrões de 2026 da Qw​en, e isso é deliberado. O Qwen3.8-Flash-Next armazena 125B de parâmetros do modelo principal, mais uma tabela separada de embeddings n-gram de 51B — aproximadamente 176B antes de um módulo de previsão multi-token de 4B — mas ativa apenas 6B por token. É um modelo mixture-of-experts com 512 especialistas, roteamento top-10 e 48 camadas, com contexto nativo de 262.144 tokens e extensível a 1M via YaRN. Ele aceita texto, imagem e vídeo como entrada e gera texto. Os pesos estão no Hugging Face e no ModelScope sob a licença qwen-community-1.0, e o próprio blog da Ali​baba o chama de "uma prévia experimental da arquitetura que servirá de base para o Qwen4" — o mesmo papel que o Qwen3-Next desempenhou para a linha Qw​en3.5, um canário que voa antes do carro-chefe.

No mesmo dia, a Ali​baba ativou a contraparte comercial: uma build servida chamada Qwen3.8-Flash na API QwenCloud a US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de saída. É fácil confundir os dois, e vale a pena distingui-los. O Qwen3.8-Flash-Next é a prévia de pesos abertos que o relatório técnico analisa; o Qwen3.8-Flash é a build de API de produção, com preço definido, contexto padrão de 1M de tokens e formatos de requisição compatíveis com Open​AI e Anthropic. O preço, os benchmarks e os argumentos de arquitetura derivam todos da mesma engenharia.

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

As quatro apostas de arquitetura no relatório técnico

A espinha dorsal do artigo são quatro apostas sobre como deve ser um modelo de fronteira de baixo custo e contexto longo, cada uma com respaldo experimental.

• Atenção — híbrido de GDN + QSA. Três de cada quatro camadas usam Gated DeltaNet, uma camada de atenção linear que comprime o histórico em um estado recorrente de tamanho fixo, em vez de um cache KV que cresce com o comprimento da sequência. A camada restante é o Qwen Sparse Attention, que agrega a sequência em micro-blocos, pontua-os de forma barata e executa atenção completa apenas nas regiões relevantes. A Alibaba relata acelerações de até 7,6× no prefill e 4,9× no decode no contexto de 1M; o benchmark de dia 0 do próprio SGLang mediu valores ainda maiores, de 10,2× e 6,6×. Com uma taxa de acerto do cache de prefixo de 90%, a taxa de transferência de prefill chega a 8,6× a do Qwen3.7-Plus. Esses números são fornecidos pelo fornecedor e por parceiros, não auditados de forma independente.

• Fluxo residual — Gated Residual. O único caminho residual é ampliado para quatro ramos paralelos com portas dinâmicas elemento a elemento, um design de múltiplos ramos no estilo Hyper-Connection com controle no estilo GatedNorm. A porta regula leituras e escritas por ramo, o que, segundo o artigo, suprime valores atípicos de ativação e, na prática, permite que os estados residuais sejam armazenados em FP8.

• Embedding — a tabela de n-gramas de 51B. Em vez de um embedding por token, o modelo indexa uma tabela de consulta no token atual mais os anteriores, armazenando frases inteiras e padrões locais. É quase gratuito por token e, como os endereços de consulta são conhecidos antecipadamente, ela pode viver na memória do host e ser pré-buscada assincronamente, mantida completamente fora da memória da GPU. Esse é o truque que permite que um checkpoint armazenado de 176B rode em máquinas da classe de 75GB, e remonta aos embeddings por camada do Gemma 3n e ao Engram do Deep​Seek.

• Otimização — Muon, ajustado. O treinamento usa o otimizador Muon, um método de momento baseado em ortogonalização, aplicado a mapas lineares bidimensionais (atenção, GDN e pesos dos especialistas MoE), enquanto o AdamW é mantido para embeddings, o roteador e parâmetros de baixo posto. O artigo também relata um resultado negativo que vale a pena ler: o aquecimento do tamanho do lote foi descartado depois que se descobriu que custava 18,8% mais etapas do otimizador sem melhorar nada.

A tabela de benchmark, leia com atenção.

Todos os números de destaque aqui são da própria Qwen, publicados no cartão do modelo e no relatório, e nenhum deles foi reproduzido de forma independente — o modelo tem um dia de vida e nenhum terceiro o auditou ainda. Lido dessa forma, ainda assim é impressionante, porque o Qwen3.8-Flash-Next está trocando golpes com o DeepSeek-V4-Flash-0731, um modelo muito maior e estabelecido, com 6B de parâmetros ativos.

• DeepSWE 1.1 — 58,7 vs 54,4 (relatado pelo fornecedor).

• SWE-bench Pro — 62.5 vs 56.0 (relatado pelo fornecedor).

• Toolathlon Verificado — 73.5 vs 70.3 (relatado pelo fornecedor).

• LiveCodeBench v6 — 91.9 vs 90.6 (relatado pelo fornecedor).

• GPQA Diamond — 91.7 vs 90.8 (relatado pelo fornecedor).

• IFBench — 81.3 vs 79.2 (relatado pelo fornecedor).

Depois, a falha que o relatório revela publicamente: NL2Repo-Bench, 48,1 contra os 54,2 do DeepSeek-V4-Flash-0731 — um déficit real na geração de código em nível de repositório, a única dimensão de codificação agêntica em que o modelo menor não consegue acompanhar. Agents' Last Exam é um empate em 24,3 a 25,2. Em automação de escritório, a Qw​en registra 73,9 no CoWorkBench — mas esse é um benchmark interno, e a Ali​baba o mantém fora do gráfico principal.

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

Na parte de visão, a tabela autorrelatada mostra AndroidWorld com 84,5 contra 62,0 para o Claude Opus 4.6 Max e RealWorldQA com 88,5 contra 73,9. O Humanity's Last Exam é o único destaque em que o Qw​en perde para o Claude Opus 4.6 Max de forma direta — e a avaliação dessa pontuação foi, ela própria, realizada pelo GPT-4o, então até essa comparação não é limpa.

O preço: um duodécimo do carro-chefe

{{1}}Então, o número que importa para os orçamentos.{{/1}} {{2}}A build do Qwen3.8-Flash oferecida custa US$ 0,16 por milhão de tokens de entrada e US$ 0,47 por milhão de tokens de saída no QwenCloud.{{/2}} {{3}}Isso é cerca de um doze avos do preço do carro-chefe da própria Alibaba, o Qwen3.8-Max, que custa US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída — em um modelo que, segundo o relatório, foi treinado com aproximadamente um nono do poder computacional do Qwen3.7-Plus.{{/3}} {{4}}Os fornecedores chineses de modelos passaram o verão cortando os preços da camada flash, e este lançamento é a parte da Qwen nessa campanha, chegando com uma justificativa de arquitetura em vez de apenas um desconto.{{/4}}

Para quem compara dentro da categoria, a matemática é mais fácil quando todos os provedores mostram o mesmo número. A OrcaRouter roteia o restante da família Qw​en — Qwen3.8-Max, Qwen3.8-27B e Qwen3.8 — pelo preço de tabela do provedor, com 0% de margem, então um corte de preço do fornecedor fica ativo do nosso lado no dia em que é anunciado. O Qwen3.8-Flash-Next ainda não está no nosso catálogo; quando ele chegar a um runtime que roteamos, ele se encaixa nessa mesma configuração de chave única e preço de tabela, sem um segundo contrato.

O que você pode fazer com isso hoje

O suporte de serving no dia zero é excepcionalmente amplo. O SGLang oferece uma página de cookbook e uma imagem dedicada (lmsysorg/sglang:qwen38flashnext); o vLLM tem vllm/vllm-openai:qwen38-flash-next; a NVIDIA valida ambos, além do TensorRT LLM, em um rack GB300 NVL72 com mais de 16.000 tokens por segundo por GPU em FP8, e o NeMo cobre o fine-tuning. Abaixo da escala de data center, o modelo executa em clusters DGX Spark e estações de trabalho 4×RTX PRO 6000, e a leva de quantizações comunitárias do mesmo dia — os GGUFs do Unsloth e uma build de 1 bit que cabe em 75GB de RAM com cerca de 80% da precisão total — significa que o checkpoint armazenado de 176B é genuinamente executável em hardware que uma equipe pequena possui. Equipes que preferem chamá-lo a executá-lo podem acessar a API do Qwen3.8-Flash por meio do QwenCloud da própria Alibaba e de várias plataformas terceirizadas, embora os pesos abertos sejam o que a maioria dos primeiros adotantes escolherá primeiro.

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

A matemática de VRAM por trás dessa lista é a tabela de n-gramas, e é para onde as stacks de serving estão convergindo a seguir. O embedding por camada que o tech report mantém fora da memória da GPU é uma estrutura de lookup pura — para cada token gerado, o modelo acessa apenas cerca de 16 das suas 320 milhões de linhas — o que torna o offloading dela barato. O vLLM serve o Qwen3.8-Flash-Next a partir de uma dev image dedicada enquanto o pull request de suporte à arquitetura ainda está aberto, e a peça mais recente desse trabalho, um draft PR do mesmo autor do vLLM (vllm-project/vllm#54371, não mergeado), adiciona um caminho de serving PLE-Offload que mantém a tabela na memória do host e a lê via CUDA unified virtual addressing em vez de reservar VRAM. Em FP8, a tabela representa cerca de 48GB dos ~173GB do checkpoint, então fazer o offload dela é a diferença entre uma GPU de data center e uma única placa de 96GB — uma RTX PRO 6000, ou o pool de memória unificada de um DGX Spark. Ainda é cedo, então trate isso como direção e não como opção suportada hoje; mas é o runtime alcançando o que o tech report já afirmava, e o ponto a observar se o número de VRAM é o que tem te impedido.

Uma prévia de um dia com números não reproduzidos é o caso clássico de não apostar um caminho de produção nela, e é exatamente para isso que serve o failover. Se um runtime carrega Qwen3.8-Flash-Next e você aponta um endpoint para ele com failover automático para um modelo em que você já confia, você obtém o benefício da nova arquitetura no tráfego não crítico e um fallback limpo quando ela falha — sem reconfiguração, porque isso é uma regra de roteamento, não uma mudança de código.

O que esta prévia diz sobre Qwen4

Ali​baba já fez essa jogada antes. O Qwen3-Next pré-visualizou o Gated DeltaNet no final de 2025 com documentação enxuta, e a arquitetura só foi totalmente especificada quando a série Qw​en3.5 a adotou em escala. O padrão está se repetindo: o Qwen3.8-Flash-Next é o canário, e o relatório é a especificação por experimento. Os pontos concretos a observar são se o carro-chefe Qwen4 adota a proporção de três para um entre GDN e QSA, se o embedding de n-gramas sobrevive ao contato com a produção em escala do carro-chefe e, acima de tudo, se avaliações independentes confirmam a vantagem de 6B ativos sobre modelos maiores. Se a tese de eficiência se confirmar, o carro-chefe Qwen4 pode ser lançado com custos de inferência drasticamente menores do que a geração anterior.

Perguntas Frequentes

Qwen3.8-Flash-Next e Qwen3.8-Flash — o mesmo modelo?

Não, e a distinção importa. O Qwen3.8-Flash-Next é a prévia da arquitetura de pesos abertos que o relatório técnico analisa; o Qwen3.8-Flash é a versão da API de produção que a Ali​baba oferece no QwenCloud a US$ 0,16/US$ 0,47 por milhão de tokens, com um contexto padrão de 1M. Mesma linhagem de engenharia, artefatos diferentes — um é para auto-hospedagem e inspeção, o outro é um serviço gerenciado com preço.

As cargas de trabalho de produção deveriam migrar para ela hoje?

Não sem uma segunda opinião. Cada benchmark é relatado pelo fornecedor e não foi reproduzido; a arquitetura é nova o bastante para que as stacks de serving ainda estejam convergindo — o suporte do próprio vLLM ainda está chegando por meio de pull requests abertos — e a única lacuna de codificação agêntica (NL2Repo) está exatamente no tipo de tarefa que os desenvolvedores de produção enfrentam. Os pesos abertos tornam barato avaliar por conta própria, e o suporte de SGLang e vLLM desde o primeiro dia torna um piloto viável ainda esta semana — mas começar com um piloto protegido por failover é o caminho honesto, não um cutover.

Quando o Qwen4 real será lançado?

A Ali​baba não disse. O único sinal de cronograma neste lançamento é histórico: o último canário, Qwen3-Next, voou cerca de uma temporada antes de a série Qw​en3.5 adotar sua arquitetura. Nesse ritmo, os carros-chefe do Qwen4 estão mais próximos do que parecem — mas o relatório é explicitamente sobre arquitetura, não sobre um roteiro.

O resultado final

Qwen3.8-Flash-Next é o lançamento raro em que o artigo é o produto. Sobre o próprio modelo, o placar honesto diz: 6B de parâmetros ativos equiparando-se a modelos muito maiores na maioria dos benchmarks compartilhados, uma lacuna nomeada em código de nível de repositório, um preço servido de um duodécimo do carro-chefe, e uma arquitetura que é a resposta da Qw​en para como um modelo de fronteira fica barato. O relatório técnico diz para que serve o Qwen3.8-Flash-Next — e não é o modelo. Ele é a evidência da arquitetura que será o Qwen4, e vale a pena ler antes de o Qwen4 ser lançado, porque a decisão que ele muda é aquela que você tomará quando o Qwen4 chegar.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube