
Qwen3.8-Flash-Next: Alibaba antevê a arquitetura Qwen4 antes de o Qwen4 existir.
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
A Alibaba {{1}}está prestes a publicar a arquitetura Qwen4 antes de publicar um modelo Qwen4{{/1}}. {{2}}O Qwen3.8-Flash-Next — um modelo multimodal de mistura de especialistas com pesos abertos, construído sobre a arquitetura de próxima geração que impulsionará a família Qwen4 — está programado para ser disponibilizado publicamente no ModelScope às 23:00, horário de Pequim, em 26 de agosto de 2026{{/2}}. A Alibaba está enquadrando o lançamento como uma prévia de tecnologia: {{3}}os desenvolvedores recebem a arquitetura antecipadamente, e a família completa Qwen4 virá depois{{/3}}. No momento em que este texto foi escrito, {{4}}a contagem de parâmetros, a licença e o preço não foram confirmados, então esta é uma matéria do tipo "o que sabemos até agora" — cada detalhe abaixo está rotulado de acordo com o seu nível de confirmação{{/4}}.
Se você não tem acompanhado o ritmo da Alibaba este mês, a âncora é a Qwen3.8-Max — o carro-chefe de 2,4 trilhões de parâmetros lançado em 3 de agosto e disponibilizado como código aberto como Qwen3.8-2.4T-A95B menos de duas semanas depois. A Qwen3.8-Flash-Next chega menos de um mês depois disso. O mesmo laboratório que lançou um modelo de pesos abertos com 2,4 trilhões de parâmetros agora está distribuindo a arquitetura para a geração seguinte, antes mesmo de o carro-chefe dessa geração ser nomeado.
O que foi anunciado
O sinal chegou à arena pelos canais habituais. Uma página teaser da ModelScope para o Qwen3.8-Flash-Next foi ao ar em 25 de agosto com um selo "Upcoming Open-Release", o slogan "Onward to the Next-Gen — Lightning-Fast" e um cronômetro de lançamento apontando para 2026-08-26 23:00 (UTC+08:00). A equipe Qwen da Alibaba publicou no X no mesmo dia — "A próxima onda Qwen está chegando". A postagem de @kimmonismus no X, que nos encaminhou esta matéria, descreveu a mesma coisa com palavras um pouco diferentes: um MoE multimodal de pesos abertos na arquitetura de próxima geração, acesso antecipado para que a comunidade possa se preparar para a família Qwen4.

A parte que vale a pena reler é o próprio enquadramento da Alibaba. O modelo é descrito como construído sobre a arquitetura de próxima geração "que alimentará a próxima família Qwen4" — e explicitamente não como o próprio Qwen4. A razão declarada da Alibaba é que as mudanças arquiteturais devem estar nas mãos da comunidade antes da chegada da família, para que runtimes, quantizações e aplicações estejam prontos quando o produto real for lançado. Isso é uma posição de marketing, mas também é um compromisso técnico: antecipar a parte difícil primeiro, levando a comunidade junto.
O que está confirmado hoje, e o que não está:
• Confirmado, de acordo com o teaser e a declaração da Qwen: Qwen3.8-Flash-Next é um modelo de pesos abertos, multimodal e MoE na arquitetura Qwen4.
• Confirmado, conforme a declaração da Qwen: ela introduz duas mudanças arquitetônicas de destaque — a arquitetura híbrida GDN e a Atenção Sparse Qwen (QSA).
• Confirmado, conforme o teaser: o horário de lançamento, 2026-08-26 23:00 (UTC+08:00), no ModelScope.
• Não confirmado: parâmetros totais ou ativos, termos de licença, tamanho do contexto, disponibilidade ou preço da API e todas as pontuações de benchmark. Ainda não existe nenhuma avaliação independente porque os pesos não foram divulgados.

O que a arquitetura Qwen4 realmente é
Dois mecanismos conduzem a história. O primeiro, GDN — Gated Delta Network — é a camada de atenção linear da Alibaba. Enquanto um transformer padrão mantém um cache de chave-valor que cresce com o comprimento da sequência, uma camada GDN mantém um estado recorrente de tamanho fixo e o atualiza com uma regra de gating aprendida; a linhagem passa por DeltaNet e Mamba-2. O benefício é o que tem impulsionado silenciosamente a linha Qwen desde o Qwen3-Next: contextos longos permanecem baratos porque o estado não cresce, enquanto uma minoria de camadas de atenção plena permanece na mistura para fazer a recuperação precisa em que a atenção linear é ruim. Na geração atual, essa mistura opera com aproximadamente três camadas GDN para cada camada de atenção plena — a análise da comunidade do checkpoint Qwen3.8-2.4T-A95B conta 69 camadas GDN contra 23 camadas de atenção. O Qwen3.8-Flash-Next é descrito como a "GDN hybrid architecture" exatamente nessa linhagem.
O segundo, QSA — Qwen Sparse Attention — é a peça genuinamente nova, e ainda não existe uma descrição técnica pública dela: apenas o nome, e sua apresentação como uma das duas mudanças principais da prévia. Essa ausência de detalhes é, por si só, parte do padrão. A prévia do Qwen3-Next no final de 2025 introduziu o {{1}}Gated DeltaNet{{/1}} com a mesma escassez de documentação, e a arquitetura só foi totalmente especificada quando a série Qwen3.5 a adotou. Para o leitor, a conclusão prática é a mesma nas duas vezes: o {{2}}canary{{/2}} da arquitetura aparece primeiro; a documentação e os modelos de produção aparecem depois.
O manual que já funcionou uma vez.
A Alibaba já executou exatamente essa jogada antes, e funcionou. No final de 2025, o Qwen3-Next antecipou o Gated DeltaNet e um híbrido de atenção linear e completa. Quando a série Qwen3.5 foi lançada, adotou esse modelo em escala — e o híbrido seguiu presente na geração Qwen3.8 desde então, incluindo o carro-chefe de 2,4T. O motivo pelo qual esse precedente importa aqui é o timing que ele implica. A família completa Qwen4 deve ser esperada do outro lado desta prévia, não dentro dela; se o intervalo do Qwen3-Next servir de referência, a distância entre "aqui está a arquitetura" e "aqui está a família" é medida em meses. Nada no teaser confirma isso — é uma inferência a partir de um padrão que a Alibaba já executou duas vezes.
O que ainda não sabemos
As incógnitas são o ponto de uma prévia, e elas são reais:
• Parâmetros. O teaser não revela nenhum. A especulação da comunidade no X e no Reddit — sem respaldo oficial — aponta para uma configuração de aproximadamente 125B no total / 6B ativos, com uma grande tabela de consulta de embeddings n-gram. Trate como boato.
• O nível "Flash". Na geração Qwen3.5, o Qwen3.5-Flash, exclusivo para nuvem, era uma variante aprimorada do Qwen3.5-35B-A3B de pesos abertos. Não se sabe se o Qwen3.8-Flash-Next é a contraparte de pesos abertos de um modelo Qwen3.8 de tamanho semelhante; ele pode ser, em vez disso, o modelo da classe 125B-A6B. Ambas as interpretações são suposições.
• Licença. Os recentes lançamentos Qwen da Alibaba abrangem desde a Apache-2.0 (Qwen3.8-27B) até a licença Qwen3.8-Max, com restrição de receita. Onde Flash-Next se enquadra determina se ele pode ser usado comercialmente e em que termos.
• Benchmarks. A declaração da Qwen destaca codificação agêntica, tarefas de longo horizonte e inteligência multimodal, mas nenhum número é fornecido e não há avaliação independente até que os pesos sejam divulgados.
Uma família iterando em um ciclo de duas semanas.
O ritmo ao redor é uma história por si só. O Qwen3.8-Max, carro-chefe de 2,4 trilhões de parâmetros, foi lançado em 3 de agosto; o Qwen3.8-2.4T-A95B de pesos abertos seguiu em 12–13 de agosto; o gratuito Qwen3.8-27B sob licença Apache-2.0 chegou dias depois; e agora, antes do fim do mês, a arquitetura da próxima geração está sendo apresentada em prévia. Nenhum outro laboratório está iterando nesse ritmo atualmente. Para um leitor que escolhe modelos, a consequência prática é que {{1}}"o melhor Qwen" é um alvo móvel{{/1}} — e {{2}}a diferença entre gerações está chegando mais rápido do que o ecossistema ao redor geralmente se adapta{{/2}}. Comprar uma decisão em vez de um modelo é cada vez mais a jogada defensável.
O que um desenvolvedor deve fazer agora
Planeje a arquitetura, não apenas o modelo. O Qwen3.8-Flash-Next será uma prévia não comprovada desde o primeiro dia: sem benchmarks independentes, um ecossistema de runtime ainda em evolução, e apenas alegações do fornecedor sobre as capacidades agênticas e de longo horizonte que importam para as cargas de trabalho que o usariam. A maneira segura de avaliá-lo não é integrá-lo a um caminho de produção — é encaminhar uma cópia de baixo risco de uma carga de trabalho para ele, comparar a saída com o modelo atual e deixar o failover automático absorver os momentos em que o provedor que serve um modelo open-weight totalmente novo se comporta mal. No OrcaRouter, isso é o mesmo endpoint e a mesma chave que você já usa: o Qwen3.8-Flash-Next e seu modelo atual ficam atrás de uma única API, e o DSL de roteamento pode fazer um teste A/B da prévia contra o modelo atual com o mesmo prompt antes que qualquer coisa seja oficializada.
O preço, quando existe, deve ser lido da mesma forma. A Alibaba ainda não anunciou um preço de API para o Flash-Next, e os pesos não lançados não podem ser roteados em lugar nenhum. Quando um provedor o expõe, o OrcaRouter repassa o preço de tabela do provedor direto, com margem de 0% — então, qualquer que seja o número da Alibaba, ele aparece inalterado no mesmo dia. A referência mais próxima que você pode consultar hoje é o Qwen3.8-Max (qwen/qwen3.8-max), o carro-chefe sob o qual esta arquitetura acabará se posicionando: uma janela de contexto de 1.000.000 de tokens a US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, com repasse ao preço de tabela. Guarde esse número na cabeça quando o preço do Flash-Next for divulgado; é o custo que a próxima geração precisa superar.

O que assistir no lançamento
Quatro coisas importam no momento em que o cronômetro de liberação se esgota:
• A contagem de parâmetros e o nível de parâmetros ativos — se este é o modelo da classe 125B-A6B que os rumores descrevem ou um modelo menor.
• A licença — permissiva como Qwen3.8-27B, ou restrita como a licença Max.
Se as primeiras avaliações independentes reproduzem as alegações do fornecedor sobre codificação por agentes e tarefas de longo horizonte — os números em que confiar, não o discurso de marketing.
• Quanto tempo a Alibaba espera antes que a família Qwen4 completa siga a prévia.
Nada disso é conhecível daqui. O que é conhecível hoje é a forma da decisão que a Alibaba tomou: ela está apostando que vale a pena entregar a próxima geração de sua arquitetura antes do carro-chefe. Essa aposta é a história — e os pesos são lançados amanhã.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
