Cartão de título principal do artigo 'Qwen3.8-Flash-Next — RELATÓRIO DE VAZAMENTO' com o selo 'NÃO VERIFICADO — PRÉVIA DA ARQUITETURA QWEN4', o subtítulo 'A Alibaba entrega a arquitetura Qwen4 antes do modelo', três chips com os textos 'Fonte: @kimmonismus', '25 de agosto de 2026' e 'Lançamento: 26 de agosto, 23:00 UTC+08', um cartão à esquerda com 'A alegação: um MoE multimodal de pesos abertos que apresenta prévia da arquitetura Qwen4' e um cartão à direita com 'Status: pesos não lançados, ~24h para o lançamento'. O logotipo do OrcaRouter é inserido no canto inferior direito.
Guides & Insights

Qwen3.8-Flash-Next: Alibaba antevê a arquitetura Qwen4 antes de o Qwen4 existir.

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A Alibaba {{1}}está prestes a publicar a arquitetura Qwen4 antes de publicar um modelo Qwen4{{/1}}. {{2}}O Qwen3.8-Flash-Next — um modelo multimodal de mistura de especialistas com pesos abertos, construído sobre a arquitetura de próxima geração que impulsionará a família Qwen4 — está programado para ser disponibilizado publicamente no ModelScope às 23:00, horário de Pequim, em 26 de agosto de 2026{{/2}}. A Alibaba está enquadrando o lançamento como uma prévia de tecnologia: {{3}}os desenvolvedores recebem a arquitetura antecipadamente, e a família completa Qwen4 virá depois{{/3}}. No momento em que este texto foi escrito, {{4}}a contagem de parâmetros, a licença e o preço não foram confirmados, então esta é uma matéria do tipo "o que sabemos até agora" — cada detalhe abaixo está rotulado de acordo com o seu nível de confirmação{{/4}}.

Se você não tem acompanhado o ritmo da Alibaba este mês, a âncora é a Qwen3.8-Max — o carro-chefe de 2,4 trilhões de parâmetros lançado em 3 de agosto e disponibilizado como código aberto como Qwen3.8-2.4T-A95B menos de duas semanas depois. A Qwen3.8-Flash-Next chega menos de um mês depois disso. O mesmo laboratório que lançou um modelo de pesos abertos com 2,4 trilhões de parâmetros agora está distribuindo a arquitetura para a geração seguinte, antes mesmo de o carro-chefe dessa geração ser nomeado.

O que foi anunciado

O sinal chegou à arena pelos canais habituais. Uma página teaser da ModelScope para o Qwen3.8-Flash-Next foi ao ar em 25 de agosto com um selo "Upcoming Open-Release", o slogan "Onward to the Next-Gen — Lightning-Fast" e um cronômetro de lançamento apontando para 2026-08-26 23:00 (UTC+08:00). A equipe Qw​en da Alibaba publicou no X no mesmo dia — "A próxima onda Qw​en está chegando". A postagem de @kimmonismus no X, que nos encaminhou esta matéria, descreveu a mesma coisa com palavras um pouco diferentes: um MoE multimodal de pesos abertos na arquitetura de próxima geração, acesso antecipado para que a comunidade possa se preparar para a família Qwen4.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

A parte que vale a pena reler é o próprio enquadramento da Alibaba. O modelo é descrito como construído sobre a arquitetura de próxima geração "que alimentará a próxima família Qwen4" — e explicitamente não como o próprio Qwen4. A razão declarada da Alibaba é que as mudanças arquiteturais devem estar nas mãos da comunidade antes da chegada da família, para que runtimes, quantizações e aplicações estejam prontos quando o produto real for lançado. Isso é uma posição de marketing, mas também é um compromisso técnico: antecipar a parte difícil primeiro, levando a comunidade junto.

O que está confirmado hoje, e o que não está:

• Confirmado, de acordo com o teaser e a declaração da Qw​en: Qwen3.8-Flash-Next é um modelo de pesos abertos, multimodal e MoE na arquitetura Qwen4.

• Confirmado, conforme a declaração da Qw​en: ela introduz duas mudanças arquitetônicas de destaque — a arquitetura híbrida GDN e a Atenção Sparse Qw​en (QSA).

• Confirmado, conforme o teaser: o horário de lançamento, 2026-08-26 23:00 (UTC+08:00), no ModelScope.

• Não confirmado: parâmetros totais ou ativos, termos de licença, tamanho do contexto, disponibilidade ou preço da API e todas as pontuações de benchmark. Ainda não existe nenhuma avaliação independente porque os pesos não foram divulgados.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

O que a arquitetura Qwen4 realmente é

Dois mecanismos conduzem a história. O primeiro, GDN — Gated Delta Network — é a camada de atenção linear da Alibaba. Enquanto um transformer padrão mantém um cache de chave-valor que cresce com o comprimento da sequência, uma camada GDN mantém um estado recorrente de tamanho fixo e o atualiza com uma regra de gating aprendida; a linhagem passa por DeltaNet e Mamba-2. O benefício é o que tem impulsionado silenciosamente a linha Qwen desde o Qwen3-Next: contextos longos permanecem baratos porque o estado não cresce, enquanto uma minoria de camadas de atenção plena permanece na mistura para fazer a recuperação precisa em que a atenção linear é ruim. Na geração atual, essa mistura opera com aproximadamente três camadas GDN para cada camada de atenção plena — a análise da comunidade do checkpoint Qwen3.8-2.4T-A95B conta 69 camadas GDN contra 23 camadas de atenção. O Qwen3.8-Flash-Next é descrito como a "GDN hybrid architecture" exatamente nessa linhagem.

O segundo, QSA — Qw​en Sparse Attention — é a peça genuinamente nova, e ainda não existe uma descrição técnica pública dela: apenas o nome, e sua apresentação como uma das duas mudanças principais da prévia. Essa ausência de detalhes é, por si só, parte do padrão. A prévia do Qwen3-Next no final de 2025 introduziu o {{1}}Gated DeltaNet{{/1}} com a mesma escassez de documentação, e a arquitetura só foi totalmente especificada quando a série Qw​en3.5 a adotou. Para o leitor, a conclusão prática é a mesma nas duas vezes: o {{2}}canary{{/2}} da arquitetura aparece primeiro; a documentação e os modelos de produção aparecem depois.

O manual que já funcionou uma vez.

A Alibaba já executou exatamente essa jogada antes, e funcionou. No final de 2025, o Qwen3-Next antecipou o Gated DeltaNet e um híbrido de atenção linear e completa. Quando a série Qw​en3.5 foi lançada, adotou esse modelo em escala — e o híbrido seguiu presente na geração Qw​en3.8 desde então, incluindo o carro-chefe de 2,4T. O motivo pelo qual esse precedente importa aqui é o timing que ele implica. A família completa Qwen4 deve ser esperada do outro lado desta prévia, não dentro dela; se o intervalo do Qwen3-Next servir de referência, a distância entre "aqui está a arquitetura" e "aqui está a família" é medida em meses. Nada no teaser confirma isso — é uma inferência a partir de um padrão que a Alibaba já executou duas vezes.

O que ainda não sabemos

As incógnitas são o ponto de uma prévia, e elas são reais:

• Parâmetros. O teaser não revela nenhum. A especulação da comunidade no X e no Reddit — sem respaldo oficial — aponta para uma configuração de aproximadamente 125B no total / 6B ativos, com uma grande tabela de consulta de embeddings n-gram. Trate como boato.

• O nível "Flash". Na geração Qw​en3.5, o Qwen3.5-Flash, exclusivo para nuvem, era uma variante aprimorada do Qwen3.5-35B-A3B de pesos abertos. Não se sabe se o Qwen3.8-Flash-Next é a contraparte de pesos abertos de um modelo Qw​en3.8 de tamanho semelhante; ele pode ser, em vez disso, o modelo da classe 125B-A6B. Ambas as interpretações são suposições.

• Licença. Os recentes lançamentos Qw​en da Alibaba abrangem desde a Apache-2.0 (Qw​en3.8-27B) até a licença Qwen3.8-Max, com restrição de receita. Onde Flash-Next se enquadra determina se ele pode ser usado comercialmente e em que termos.

• Benchmarks. A declaração da Qw​en destaca codificação agêntica, tarefas de longo horizonte e inteligência multimodal, mas nenhum número é fornecido e não há avaliação independente até que os pesos sejam divulgados.

Uma família iterando em um ciclo de duas semanas.

O ritmo ao redor é uma história por si só. O Qwen3.8-Max, carro-chefe de 2,4 trilhões de parâmetros, foi lançado em 3 de agosto; o Qwen3.8-2.4T-A95B de pesos abertos seguiu em 12–13 de agosto; o gratuito Qw​en3.8-27B sob licença Apache-2.0 chegou dias depois; e agora, antes do fim do mês, a arquitetura da próxima geração está sendo apresentada em prévia. Nenhum outro laboratório está iterando nesse ritmo atualmente. Para um leitor que escolhe modelos, a consequência prática é que {{1}}"o melhor Qw​en" é um alvo móvel{{/1}} — e {{2}}a diferença entre gerações está chegando mais rápido do que o ecossistema ao redor geralmente se adapta{{/2}}. Comprar uma decisão em vez de um modelo é cada vez mais a jogada defensável.

O que um desenvolvedor deve fazer agora

Planeje a arquitetura, não apenas o modelo. O Qwen3.8-Flash-Next será uma prévia não comprovada desde o primeiro dia: sem benchmarks independentes, um ecossistema de runtime ainda em evolução, e apenas alegações do fornecedor sobre as capacidades agênticas e de longo horizonte que importam para as cargas de trabalho que o usariam. A maneira segura de avaliá-lo não é integrá-lo a um caminho de produção — é encaminhar uma cópia de baixo risco de uma carga de trabalho para ele, comparar a saída com o modelo atual e deixar o failover automático absorver os momentos em que o provedor que serve um modelo open-weight totalmente novo se comporta mal. No OrcaRouter, isso é o mesmo endpoint e a mesma chave que você já usa: o Qwen3.8-Flash-Next e seu modelo atual ficam atrás de uma única API, e o DSL de roteamento pode fazer um teste A/B da prévia contra o modelo atual com o mesmo prompt antes que qualquer coisa seja oficializada.

O preço, quando existe, deve ser lido da mesma forma. A Alibaba ainda não anunciou um preço de API para o Flash-Next, e os pesos não lançados não podem ser roteados em lugar nenhum. Quando um provedor o expõe, o OrcaRouter repassa o preço de tabela do provedor direto, com margem de 0% — então, qualquer que seja o número da Alibaba, ele aparece inalterado no mesmo dia. A referência mais próxima que você pode consultar hoje é o Qwen3.8-Max (qwen/qwen3.8-max), o carro-chefe sob o qual esta arquitetura acabará se posicionando: uma janela de contexto de 1.000.000 de tokens a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com repasse ao preço de tabela. Guarde esse número na cabeça quando o preço do Flash-Next for divulgado; é o custo que a próxima geração precisa superar.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

O que assistir no lançamento

Quatro coisas importam no momento em que o cronômetro de liberação se esgota:

• A contagem de parâmetros e o nível de parâmetros ativos — se este é o modelo da classe 125B-A6B que os rumores descrevem ou um modelo menor.

• A licença — permissiva como Qwen3.8-27B, ou restrita como a licença Max.

Se as primeiras avaliações independentes reproduzem as alegações do fornecedor sobre codificação por agentes e tarefas de longo horizonte — os números em que confiar, não o discurso de marketing.

• Quanto tempo a Alibaba espera antes que a família Qwen4 completa siga a prévia.

Nada disso é conhecível daqui. O que é conhecível hoje é a forma da decisão que a Alibaba tomou: ela está apostando que vale a pena entregar a próxima geração de sua arquitetura antes do carro-chefe. Essa aposta é a história — e os pesos são lançados amanhã.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube