Cartão de título principal do artigo 'Qwen3.8-Flash-Next — RELATÓRIO DE VAZAMENTO' com o selo 'NÃO VERIFICADO — PRÉVIA DA ARQUITETURA QWEN4', o subtítulo 'A Alibaba entrega a arquitetura Qwen4 antes do modelo', três chips com os textos 'Fonte: @kimmonismus', '25 de agosto de 2026' e 'Lançamento: 26 de agosto, 23:00 UTC+08', um cartão à esquerda com 'A alegação: um MoE multimodal de pesos abertos que apresenta prévia da arquitetura Qwen4' e um cartão à direita com 'Status: pesos não lançados, ~24h para o lançamento'. O logotipo do OrcaRouter é inserido no canto inferior direito.
Guides & Insights

Qwen3.8-Flash-Next Chegou: Alibaba Lança a Arquitetura do Qwen4 Antes de o Qwen4 Existir

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8-Flash-Next finalmente tem números que a Alibaba não produziu — e eles não dizem o que a versão mais estridente da história diz. No Índice de Inteligência da Artificial Analysis, reformulado para a v4.3 em 7 de setembro, o preview de pesos abertos da Alibaba marca 40 pontos e ocupa a quinta posição entre os 113 modelos de sua classe de comparação. O DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — o modelo com o qual ele vive sendo comparado — marca 35 pontos e ocupa a nona posição. Isso não é paridade; é uma vantagem de cinco pontos para o modelo menor. É também o primeiro placar amplo e independente a chegar a um modelo cujos únicos números publicados, até este mês, eram os do próprio fornecedor. O modelo em si não é novo: os pesos foram disponibilizados no Hugging Face em 24 de agosto, e o lançamento formal no ModelScope saiu em 26 de agosto. O que mudou neste mês é que agora um leitor pode conferir as alegações em vez de simplesmente aceitá-las.

A provocação para revisitar este post veio de @teortaxesTex no X, que perguntou se a preview está silenciosamente subestimada: supostamente no mesmo nível do Artificial Analysis que o DeepSeek V4 Flash 0731, "quase 4x menor", com "quase 3x menos parâmetros ativos". Duas dessas três afirmações não resistem ao contato com os dados publicados — e a correção favorece o modelo, porque, nos números que importam, a preview está à frente da sua comparação, e não em pé de igualdade com ela.

Comece pelo tamanho, onde os números são inequívocos. O Qwen3.8-Flash-Next armazena aproximadamente 180B de parâmetros — um corpo de mistura de especialistas de 125B, uma tabela de embeddings de n-gramas separada de 51B e cerca de 4B de camadas de previsão de múltiplos tokens — e ativa 6B deles por token. O DeepSeek V4 Flash 0731 armazena 284B e ativa 13B. Esses são os números no model card do Qwen e na documentação do DeepSeek, e são os números que a Artificial Analysis apresenta nas duas páginas dos modelos. As proporções que eles produzem são 1,6x em parâmetros armazenados e 2,2x em parâmetros ativos. Isso é um caso genuíno de eficiência, e é a razão pela qual esta arquitetura importa — mas não é 4x nem 3x. Não conseguimos encontrar nenhum número publicado em lugar algum que sustente os multiplicadores maiores. Se a intenção era a pegada de memória em serviço em vez da contagem de parâmetros, esse número também não está publicado.

O que foi anunciado

Aliba​ba publicou a arquitetura Qwen4 antes de publicar um modelo Qwen4. O Qwen3.8-Flash-Next — um modelo de pesos abertos, multimodal de mistura de especialistas, construído sobre a arquitetura de próxima geração que alimentará a família Qwen4 — foi lançado em duas etapas: o repositório oficial Qw​en/Qwen3.8-Flash-Next entrou no ar no Hugging Face em 24 de agosto, dois dias antes do lançamento no ModelScope para o qual o cronômetro do teaser apontava. O lançamento formal no ModelScope aconteceu em 26 de agosto às 23:00 UTC+08:00, com a variante Qwen3.8-Flash disponibilizada com preço definido no mesmo momento. A alegação principal do card, que vem circulando desde então, é que um modelo que ativa 6B parâmetros por token supera o Claude Opus 4.6 Max em 8 de 9 benchmarks comparáveis na própria tabela da Aliba​ba. A família Qwen4 completa, a Aliba​ba continua dizendo, vem depois.

Se você não vem acompanhando a cadência da Alibaba neste mês, o ponto de referência é o Qwen3.8-Max — o carro-chefe de 2,4 trilhões de parâmetros lançado em 3 de agosto e disponibilizado em código aberto como Qwen3.8-2.4T-A95B menos de duas semanas depois. Os pesos do Qwen3.8-Flash-Next saem menos de um mês depois disso. O mesmo laboratório que lançou um modelo de pesos abertos de 2,4 trilhões de parâmetros agora está distribuindo a arquitetura da geração seguinte, antes mesmo de o carro-chefe dessa geração ser nomeado.

A screenshot of the ModelScope teaser page for Qwen3.8-Flash-Next (captured August 25, 2026), showing an 'Upcoming Open-Release' badge, the model name Qwen3.8-Flash-Next with the tagline 'Onward to the Next-Gen — Lightning-Fast', a release countdown, an 'Estimated Release Time: 2026-08-26 23:00 (UTC+08:00)' line, and a 'Like and Get-Notified' button.

A parte que vale a pena reler é o próprio enquadramento da Alibaba. O modelo é descrito como construído sobre a arquitetura de próxima geração "que impulsionará a próxima família Qwen4" — e explicitamente não como o próprio Qwen4. A razão declarada pela Alibaba é que as mudanças arquiteturais deveriam estar nas mãos da comunidade antes de a família chegar, para que runtimes, quantizações e aplicações estejam prontos quando o produto real for lançado. Isso é uma posição de marketing, mas também é um compromisso técnico: dar uma prévia da parte difícil primeiro, levar a comunidade junto.

O que o cartão do modelo resolve, e o que não resolve:

• Confirmado, conforme a ficha técnica oficial: o Qwen3.8-Flash-Next é um modelo de pesos abertos, multimodal e de mistura de especialistas (MoE) na arquitetura Qwen4 — a ficha o chama de "uma prévia experimental da arquitetura que servirá de base para o Qwen4."

• Confirmado, conforme o model card e a configuração: duas mudanças arquitetônicas principais — Gated Delta Network (GDN) e Qw​en Sparse Attention (QSA) — dentro de um híbrido de 48 camadas que executa 36 camadas de atenção linear contra 12 camadas de atenção total.

• Confirmado no repositório: 125B de parâmetros totais com 6B ativados por token (512 especialistas, 10 roteados mais um compartilhado) — o Artificial Analysis lista 180B quando a tabela de embeddings n-gram de 51B separada e as camadas MTP são contabilizadas — com um contexto nativo de 262.144 tokens, extensível a 1.000.000 sob a Qwen Community License 1.0.

• Já não está por confirmar: o modelo agora foi avaliado de forma independente, duas vezes. A tabela da Alibaba continua sendo do próprio fornecedor e ainda não foi reproduzida, mas já não é a única evidência em jogo.

As primeiras pontuações independentes chegaram — e dizem "à frente", não "empatado".

A Artificial Analysis lançou o Intelligence Index v4.3 em 7 de setembro, e a reavaliação é a razão pela qual isto é minimamente comparável. A atualização v4.3 substituiu o Terminal-Bench v2.1 pelo muito mais difícil Terminal-Bench v4.0 e trocou o τ³-Banking pelo AutomationBench-AA, um benchmark de fluxo de trabalho agêntico criado com o Zapier sobre um conjunto de teste privado reservado de 657 tarefas. A ponderação do conjunto privado reservado subiu para 45%. O objetivo declarado era impedir que a fronteira manipulassem o índice, e o efeito nas pontuações foi grande: GPT-6 Astra e Claude Fable 5.1, os dois líderes, ambos ficaram em 53, tendo sido pontuados na casa dos sessenta na escala antiga.

Isso importa quando você lê os números da comunidade. Os números de "56 versus 52" que circularam para o Qwen3.8-Flash-Next e o DeepSeek V4 Flash 0731 no início de setembro foram calculados no índice pré-v4.3; sob a v4.3, o par fica em 40 e 35. Citar qualquer um dos conjuntos em comparação com o outro é comparar dois exames diferentes.

No índice atual, aqui está como os dois modelos realmente se comparam nas próprias avaliações da Artificial Analysis:

• Índice de Inteligência — Qwen3.8-Flash-Next 40 (5.º de 113 na classe) vs. DeepSeek V4 Flash 0731 (Raciocínio, Esforço Máximo) 35 (9.º de 113).

• Trabalho de conhecimento agêntico — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.

• Terminal e programação — Terminal-Bench v4.0 25% vs 12%; SciCode 51% vs 50%.

• Raciocínio geral e científico — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.

• Recordação factual versus confabulação — AA-Omniscience −10 vs −14, uma vantagem de quatro pontos para a prévia do Qw​en.

• Preço — $0,15 por milhão de entrada / $0,47 por milhão de saída vs $0,44 / $1,32; combinado $0,0882 por milhão de tokens vs $0,2298. Custo por tarefa do Intelligence Index: $0,37 vs $0,22.

• Velocidade e latência — 53 tokens de saída por segundo vs 210; tempo até o primeiro token 2,80 s vs 0,98 s; resposta ponta a ponta 49,76 s vs 12,88 s; tempo por tarefa 1.572,60 s vs 221,65 s.

• Uso de tokens — 108 mil tokens de saída por tarefa vs 62 mil, dos quais 72 mil são tokens de raciocínio vs 45 mil. A Artificial Analysis chama a prévia de "muito verbosa" e "mais lenta que a média".

• Contexto e tamanho — 256k tokens vs 1.000k; 180B no total / 6B ativos vs 284B / 13B.

Lidos em conjunto, isso é uma resposta mais incisiva do que "mesmo patamar". O Qwen3.8-Flash-Next vence o argumento de acurácia e eficiência em quase todos os eixos que a Artificial Analysis mede — é o modelo com pontuação mais alta, é menor e custa cerca de um terço do valor por token. O DeepSeek V4 Flash 0731 vence de forma absoluta o argumento de produção: quatro vezes a vazão, um quarto da latência ponta a ponta, sete vezes menos tempo de relógio por tarefa concluída e quatro vezes a janela de contexto. E no custo por tarefa concluída — o número que sobrevive à verbosidade dos tokens — o DeepSeek é o modelo mais barato, a US$ 0,22 contra US$ 0,37, apesar do preço de tabela mais alto. Se "pouco badalado" significa "melhor do que sua reputação em qualidade por parâmetro", o rótulo é justo. Se isso significa "você deveria estar executando este em vez disso", as colunas de velocidade e latência dizem o contrário.

A single-column infographic titled 'Qwen3.8-Flash-Next — the leak board' with rows reading 'Status: upcoming open release', 'Release: 2026-08-26 23:00 (UTC+08)', 'Architecture: Qwen4 preview — GDN + QSA', 'Type: multimodal MoE, open-weight', 'Params: undisclosed (rumor ~125B-A6B)', 'License: undisclosed'. A small footer line reads 'From the teaser + community analysis; nothing independently verified.' The OrcaRouter logo is composited in the bottom-right corner.

Há também evidências independentes fora da Artificial Analysis. Um harness de terceiros, smf-bench, publicou uma execução “Official A” em 5 de setembro: o Qwen3.8-Flash-Next na quantização NVFP4 da NVIDIA em um único DGX Spark, com o modo de raciocínio desativado, marcou 137 de 157 (87,3%), com 30 de 30 sem erros na sua seção de programação, contra 117 de 157 de uma execução do DeepSeek V4 Flash Vision-Exp em dois Sparks no mesmo harness de 157 testes. Isso é um harness em uma única classe de máquina, e não substitui uma avaliação ampla — mas é um segundo ponto de dados apontando na mesma direção, e vem de alguém sem vínculo com qualquer um dos dois fornecedores.

O que a arquitetura Qwen4 realmente é

Dois mecanismos sustentam a narrativa. O primeiro, GDN — Gated Delta Network —, é a camada de atenção linear da Alibaba. Enquanto um transformer padrão mantém um cache de chave-valor que cresce com o comprimento da sequência, uma camada GDN mantém um estado recorrente de tamanho fixo e o atualiza com uma regra de gating aprendida; a linhagem passa por DeltaNet e Mamba-2. O ganho é o que vem alimentando discretamente a linha Qwen desde o Qwen3-Next: contextos longos continuam baratos porque o estado não cresce, enquanto uma minoria de camadas de atenção completa permanece na mistura para fazer a recuperação precisa em que a atenção linear é ruim. Na geração atual, essa mistura opera em aproximadamente três camadas GDN para cada camada de atenção completa — a análise da comunidade do checkpoint Qwen3.8-2.4T-A95B conta 69 camadas GDN contra 23 camadas de atenção. O Qwen3.8-Flash-Next mostra a mesma proporção de três para um: 36 camadas de atenção linear contra 12 camadas de atenção completa.

O segundo, QSA — Qw​en Sparse Attention — é a peça genuinamente nova, e a descrição pública dele ainda é escassa: o model card acrescenta que ele opera em nível de microbloco com um orçamento de 512 blocos / 2048 tokens, mas ainda não existe um documento técnico completo. Essa escassez de detalhes é, por si só, parte do padrão. A prévia do Qwen3-Next no final de 2025 introduziu o Gated DeltaNet com a mesma documentação escassa, e a arquitetura só foi totalmente especificada quando a série Qwe​n3.5 a adotou. Para o leitor, a conclusão prática é a mesma nas duas vezes: o canário da arquitetura aparece primeiro, a documentação e os modelos de produção aparecem depois.

O manual que já funcionou uma vez.

A Aliba​ba já executou exatamente essa jogada antes, e funcionou. No final de 2025, o Qwen3-Next apresentou uma prévia do Gated DeltaNet e de um híbrido de atenção linear e completa. Quando a série Qwe​n3.5 foi lançada, ela adotou esse plano em larga escala — e o híbrido tem se mantido ao longo da geração Qwen3.8 desde então, incluindo o carro-chefe de 2,4T. A razão pela qual o precedente importa aqui é o momento que ele implica. Deve-se esperar a família completa Qwen4 do outro lado desta prévia, não dentro dela; se o intervalo do Qwen3-Next servir de guia, a distância entre "aqui está a arquitetura" e "aqui está a família" é medida em meses. Nada na ficha do modelo confirma isso — é uma inferência a partir de um padrão que a Aliba​ba já executou duas vezes.

O que ainda não sabemos

As incógnitas diminuíram, mas não desapareceram:

• A tabela de benchmarks do fornecedor continua sendo do próprio fornecedor. A Artificial Analysis agora avaliou o modelo de forma independente, o que resolve a maior lacuna na cobertura do lançamento — mas a principal alegação da própria Alibaba, de que o modelo supera o Claude Opus 4.6 Max em 8 de 9 benchmarks comparáveis, baseia-se nas avaliações internas da própria Alibaba (CoWorkBench, JobBench, AndroidWorld) juntamente com as públicas, e nenhuma delas foi reproduzida por terceiros.

• Se a prévia é o mesmo modelo que o disponibilizado. A ficha posiciona o Qwen3.8-Flash-Next como a prévia experimental de pesos abertos, enquanto a variante disponibilizada em produção — o Qwen3.8-Flash do Qwen Cloud — acrescenta um contexto padrão de 1.000.000 de tokens e ferramentas integradas. Ainda não foi declarado se esse modelo disponibilizado é a mesma arquitetura sob uma janela de contexto maior, e as pontuações independentes acima referem-se à prévia de pesos abertos, não ao modelo de API disponibilizado.

• A licença é conhecida e é uma licença real: a Qwen Community License 1.0 permite uso comercial, incluindo a venda de obras derivadas, mas exige um acordo comercial separado com a Alibaba se você operar um negócio de Model-as-a-Service ou de assistente de trabalho com IA acima de um limite definido de receita e de usuários ativos mensais. Ela não é igual à licença Qwen3.8-Max condicionada por receita, mas vale a pena lê-la antes de desenvolver com base nos pesos.

• Um relato de campo que vale destacar: um texto de 6 de setembro sobre uma build comunitária de NVFP4 registra uma falha de chamada de ferramentas com restrição gramatical quando thinking e a previsão multi-token estão ambos habilitados, atribuída ao caminho de decodificação restrita do xgrammar. Trata-se de um bug de runtime em uma build comunitária quantizada, e não de uma propriedade do modelo — mas, se seu harness de avaliação depende de chamadas de ferramentas com restrição gramatical, é a primeira coisa a testar.

Uma família iterando em um ciclo de duas semanas.

A cadência ao redor é uma história à parte. Qwen3.8-Max, o carro-chefe de 2,4 trilhões de parâmetros, lançado em 3 de agosto; o Qwen3.8-2.4T-A95B de pesos abertos veio em seguida, em 12–13 de agosto; o Qwen3.8-27B gratuito sob Apache-2.0 chegou dias depois; e agora, antes que o mês termine, a arquitetura da próxima geração está sendo pré-visualizada — e avaliada de forma independente uma semana depois. Nenhum outro laboratório está, no momento, iterando nesse ritmo. Para o leitor que escolhe modelos, a consequência prática é que "o melhor Qwen" é um alvo móvel — e o delta entre gerações chega mais rápido do que o ecossistema ao redor costuma se adaptar. Comprar uma decisão em vez de um modelo é, cada vez mais, a escolha defensável.

O que um desenvolvedor deve fazer agora

Os números de eficiência alteram o cálculo do serviço local mais do que o próprio lançamento. Um modelo com 6B ativos que pontua 40 no índice atual é compressível: a quantização NVFP4 oficial da NVIDIA é a que a execução do smf-bench de 5 de setembro usou, e builds NVFP4 e FP8 da comunidade além dela já estão em circulação, o que é justamente o que torna minimamente plausível uma implantação de classe de GPU única de um modelo armazenado de 180B. A ressalva permanece a mesma — esta é uma prévia não comprovada, a tabela do fornecedor não foi reproduzida, e o perfil das pontuações independentes (forte em trabalho de conhecimento e tarefas de terminal, mais fraco em geração de repositórios de horizonte longo e taxas de aprovação de agentes em uma única tentativa) significa que as fraquezas do modelo aparecem exatamente onde residem as mudanças de código de produção. Execute uma cópia de baixo risco de uma carga de trabalho real nele antes que ele toque em qualquer coisa que importe, e deixe o failover automático absorver os momentos em que uma prévia se comporta mal.

Em termos de preço, o quadro que estava nebuloso no lançamento agora é concreto. A Artificial Analysis lista a tarifa servida da preview em US$ 0,15 por milhão de tokens de entrada e US$ 0,47 por milhão de saída, contra US$ 0,44 e US$ 1,32 do DeepSeek V4 Flash 0731 — a mesma ordem de magnitude da variante Qwen3.8-Flash servida, que a Qwën Cloud lista a ¥1 e ¥3 (aproximadamente US$ 0,16 e US$ 0,47). A variante de produção é a que você pode de fato chamar hoje: ela é roteada aqui como qwen/qwen3.8-flash, e o OrcaRouter repassa o preço de tabela do fornecedor com 0% de margem, então quando a Aliba̠ba altera esse número, o endpoint muda junto no mesmo dia. O mesmo vale para o modelo de comparação deste artigo — o DeepSeek V4 Flash 0731 é roteado como deepseek/deepseek-v4-flash-0731 pelo preço de tabela do provedor, o que torna a metade de custo por token da comparação acima testável com o seu próprio tráfego, em vez de com as contagens de tokens de um benchmark. O que não é roteado aqui é a própria preview Flash-Next de pesos abertos: para usá-la hoje, você baixa os pesos e os serve por conta própria, e é exatamente por isso que a história de quantização acima importa mais do que o preço de tabela. O teto que esta geração precisa superar ainda está visível no mesmo endpoint: o Qwen3.8-Max (qwen/qwen3.8-max) fica em US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, também repassados pelo preço de tabela do fornecedor.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), showing the model id, the Vision, Tools, JSON and Reasoning capability chips, a p50 time-to-first-token of 5.15 seconds, a $2.00 per 1M input and $6.00 per 1M output price passed through at list price, and a 1,000,000-token context window.

O sequenciamento prático não mudou muito, mas a confiança por trás dele sim. Se você quer a variante de produção servida sem baixar 100GB de pesos, o Qwen3.8-Flash já pode ser chamado ao preço de tabela. Se você quer a arquitetura — GDN, QSA, a tabela de n-gramas, os truques de offload —, os pesos estão disponíveis para download e os runtimes estão prontos: o vLLM o serve desde o primeiro dia com um caminho de offload que mantém a tabela de embeddings de n-gramas de 51 bilhões de parâmetros na memória do host em vez da VRAM permanente, o SGLang e o TensorRT-LLM estão na lista Day 0 da NVIDIA, e a biblioteca do Ollama traz um build MLX que você pode baixar no Apple Silicon. A única coisa que você precisa parar de fazer é tratar o modelo como uma incógnita em termos de qualidade. Ele já foi medido agora, e teve um bom desempenho.

O que assistir em seguida

• Se os números independentes se mantêm à medida que o índice amadurece. O 40 do Qwen3.8-Flash-Next vem com uma conta de tokens excepcionalmente alta — ele consumiu 245M tokens na execução do índice contra uma mediana de 140M — e a própria nota da Artificial Analysis o chama de "muito verboso". Uma pontuação produzida por raciocinar por mais tempo ainda é uma pontuação, mas é o tipo de coisa que muda quando a avaliação muda. A próxima revisão do índice é o teste real para saber se 40 era um patamar ou um máximo local.

• Se o Qwen3.8-Flash disponibilizado é pontuado separadamente. Todos os números independentes neste artigo referem-se à prévia de pesos abertos. A variante de produção com contexto de 1M e ferramentas integradas não tem pontuação independente própria e, se for a mesma arquitetura sob um contexto mais longo, essa é uma avaliação barata que alguém deveria publicar.

• Como o suporte a serving em day-0 se sustenta na prática — os números de throughput do GB300 declarados pelo fornecedor continuam sendo apenas declarações do fornecedor, e as configurações de paralelismo de especialistas TP4 e de offload de KV ainda são novas o suficiente para serem frágeis.

• Quanto tempo a Aliba​ba espera antes que a família completa do Qwen4 siga a prévia.

A parte do "o que sabemos até agora" desta história agora está em grande parte encerrada. A ficha técnica é pública, os pesos são baixáveis, a arquitetura está confirmada, a variante Qwen3.8-Flash disponibilizada está ativa em APIs hospedadas ao preço de tabela, e o modelo foi avaliado de forma independente por duas partes distintas — com o modelo menor vencendo no quesito qualidade e o maior vencendo no quesito vazão. O que permanece em aberto é se uma prévia com 6B ativos generaliza além dos benchmarks para os quais foi ajustada, e quanto tempo a Aliba​ba espera antes que a família Qwen4 completa venha em seguida. Essa última pergunta ainda é a que o lançamento deixa sem resposta, e ainda é a que mais importará.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente