Uma cartela de título gerada intitulada 'Qwen 4.5 e Qwen 5: 5 a 10 trilhões de parâmetros', com o subtítulo 'Uma faixa de roadmap, não uma especificação', e três cartões com os dizeres 'Meta do roadmap / 5-10T parâmetros', 'Carro-chefe disponível / Qwen3.8-Max 2.4T' e 'Data de lançamento / não anunciada'. Uma linha de rodapé diz 'Conforme o comunicado à imprensa da Alibaba de 22 de setembro de 2026; nenhum cartão de modelo foi publicado.' Estilo editorial vetorial plano sobre fundo branco, com uma camada de gradiente de azul para ciano e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Qwen 4.5 e Qwen 5 miram de 5 a 10 trilhões de parâmetros: o que a Alibaba disse e não disse

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em sua Apsara Conference em Hangzhou, em 22 de setembro de 2026, a empresa atribuiu um tamanho à geração seguinte à próxima. A linha Qwen 4.5 e Qwen 5 está "projetada para escalar até 5 a 10 trilhões de parâmetros", nas palavras do próprio comunicado à imprensa em inglês da empresa — uma linha de roadmap, não uma especificação. Nenhum dos modelos tem data de lançamento, cartão de modelo, identificador de API, preço ou pontuação de benchmark publicada, o que significa que nada de nenhum dos dois é invocável hoje. O carro-chefe que você pode realmente comprar é Qwen3.8-Max, com disponibilidade geral desde 3 de agosto de 2026, com 2,4 trilhões de parâmetros. Nos dias que se seguiram à conferência, essa frase de roadmap foi reduzida, em muitas reportagens, à alegação de que um modelo de 10 trilhões de parâmetros está chegando — uma alegação mais forte e mais simples do que a que a empresa fez. A distância entre essas duas frases é de aproximadamente um ano de planejamento.

A alegação, e a versão dela que se espalhou

Duas coisas foram ditas no palco, e vale a pena separá-las porque carregam quantidades muito diferentes de informação. A primeira é uma atualização de status: o Qwen 4 está em treinamento, em uma nova arquitetura. A segunda é um roadmap: as séries Qwen 4.5 e Qwen 5 têm projeção de alcançar uma faixa de parâmetros de 5 a 10 trilhões.

O comunicado de imprensa em inglês da Alibaba atribui ambos à empresa, e não a um executivo nomeado. A cobertura da conferência que vai mais longe atribui o roteiro a Liu Da Yiheng, que dirige o projeto de modelo de linguagem de grande porte Qwen no Alibaba Token Hub, e relata sua formulação de que a escala é um caminho fundamental rumo à superinteligência artificial. Essa formulação é o contexto em que o número de parâmetros foi apresentado, e explica por que o número é uma faixa, e não uma meta.

O que circulou, então, foi o topo da faixa. As manchetes em inglês que se seguiram incluem pelo menos uma descrevendo um modelo insinuado de 10 trilhões de parâmetros, e várias descrevendo um plano para um modelo de 5 a 10 trilhões de parâmetros. Ambas são leituras defensáveis de um slide. Nenhuma delas é uma especificação, e a diferença importa para quem precisa se planejar com base nela.

5 trilhões é a meta de uma geração e 10 trilhões é a de outra

O ponto mais útil a acertar sobre este anúncio é que 5 a 10 trilhões é uma faixa que abrange duas gerações, não um único modelo com uma tolerância ampla. A frase da própria Alibaba associa a faixa às “próximas séries de modelos Qwen 4.5 e Qwen 5” — as séries, no plural, tomadas em conjunto.

A reportagem em língua chinesa da mesma conferência volta a ser precisa numa direção diferente, com manchetes que descrevem modelos posteriores ao Qwen 4.5 a expandirem-se para o intervalo dos 5 aos 10 biliões. Essa leitura situa também o extremo dos 10 biliões para lá do Qwen 4.5. A única afirmação em que todas as fontes concordam é que a faixa abrange o intervalo entre o Qwen 4.5 e o Qwen 5. A atribuição dos 10 biliões especificamente ao Qwen 5 é uma inferência que se tornou manchete, não uma citação.

Para dar uma ideia da escala — e estes são os únicos números nesta matéria que são publicados, e não projetados:

• 5 a 10 trilhões — a faixa de parâmetros que o comunicado à imprensa da Alibaba atribui às séries Qwen 4.5 e Qwen 5

• 2,4 trilhões — parâmetros totais do Qwen3.8-Max, o carro-chefe já lançado, de acordo com sua ficha oficial do modelo

• 95 bilhões — os parâmetros ativos do Qwen3.8-Max por token, o número que determina quanto custa servir um token

• 10 trilhões — o topo da faixa, e a única parte dela que chegou à maioria das manchetes em inglês

• 0 — o número de especificações publicadas, datas de lançamento, preços, janelas de contexto ou pontuações de benchmark para o Qwen 4.5 ou Qwen 5

A generated scoreboard titled 'Shipped vs projected - the scoreboard'. Left column 'Qwen3.8-Max (shipping)' reads GA August 3, 2026; 2.4 trillion total parameters; 95 billion active parameters; 1,000,000-token context window; $2.00 in / $6.00 out; benchmarks vendor table plus AA Index 45. Right column 'Qwen 4.5 / Qwen 5 (roadmap)' reads release none given; 5 to 10 trillion series; active parameters not published; context window not published; price not published; benchmarks none published. Footer reads 'Qwen3.8-Max specs per its model card; AA Index per Artificial Analysis; Qwen 4.5 and Qwen 5 per Alibaba's September 22, 2026 roadmap.'

O número do parâmetro que importa é aquele que ninguém publicou.

Os parâmetros totais são o número que um laboratório escolhe dizer. Os parâmetros ativos são o número de que um comprador precisa, e o roteiro não inclui nenhum.

O Qwen3.8-Max é um modelo de mistura de especialistas com 2,4 trilhões de parâmetros no total e 95 bilhões ativos por token. Essa é uma taxa de ativação de aproximadamente 4%: o modelo armazena uma grande quantidade de conhecimento em pesos que não lê em um dado token e paga computação por uma pequena parte deles. Os parâmetros totais dizem quanta memória a coisa ocupa e de que tamanho de máquina você precisa. Os parâmetros ativos dizem quanto você paga a cada vez que ele responde.

Projete essa proporção para frente e a forma do problema fica visível. Um modelo de 10 trilhões de parâmetros construído com a mesma ativação de 4 por cento ativaria algo da ordem de 400 bilhões de parâmetros por token — mais de quatro vezes o que o Qwen3.8-Max ativa hoje. Isso é aritmética sobre uma premissa declarada, não uma afirmação sobre o Qwen 5: aumente a esparsidade e a contagem de ativos cai; diminua-a e ela sobe. Mas é essa aritmética que decide se um modelo de 10 trilhões de parâmetros é um produto servido ou um artefato de pesquisa, e é o cálculo que a manchete de 5 a 10 trilhões convida a fazer e depois deixa por fazer.

É também aqui que a economia de roteamento deixa de ser abstrata. Na OrcaRouter, o preço de tabela do provedor é repassado com 0% de markup, então um corte de preço de um fornecedor em um nível Qwen entra em vigor na sua chave no mesmo dia, em vez de apenas na renovação. Uma geração cujo custo de serving é genuinamente incerto é exatamente o caso em que esse repasse vale mais do que um desconto negociado de antemão com base em um número que ninguém publicou.

O anúncio do chip é a linha do tempo real

A Alibaba anunciou o roadmap do modelo e um novo acelerador no mesmo comunicado à imprensa, e os dois estão mais conectados do que o comunicado diz.

O Zhenwu V900 da T-Head é um processador de treinamento e inferência com 216 GB de memória e 1.200 GB/s de largura de banda entre chips, suporte nativo para FP8 e FP4 e um desempenho reivindicado três vezes superior ao de seu antecessor, o Zhenwu M890, lançado em maio. A produção em massa e o lançamento comercial estão previstos para o primeiro trimestre de 2027. Um servidor supernó complementar suporta clusters de até 500.000 placas, e a T-Head afirma que a linha Zhenwu já atendeu mais de 650 clientes.

Leia os dois anúncios em conjunto e a sequência fica legível. Treinar e servir um modelo de mistura de especialistas na escala de 10 trilhões é um problema de interconexão antes de ser um problema de computação, porque o paralelismo de especialistas significa mover ativações entre chips constantemente, e 1.200 GB/s de largura de banda entre chips é o número que decide se isso é viável. O silício nesse cronograma coloca a janela plausível mais precoce para uma execução de escala de fronteira desse tipo bem no decorrer de 2027 — e, mesmo assim, o envio de um chip não diz nada sobre a conclusão de um treinamento. A Alibaba conectou os dois assuntos ao colocá-los em um único lançamento; a conexão em si é a nossa leitura, e está rotulada como tal.

O próprio horizonte temporal da empresa é consistente com isso. O diretor executivo Eddie Wu estabeleceu a meta de mais de 20 gigawatts de capacidade global de data centers do Alibaba Cloud até 2032 — uma meta de capacidade, não capacidade implantada, e um horizonte de mais de cinco anos, e não de próximo trimestre.

As alegações de autoaperfeiçoamento que sustentam o roadmap

A razão pela qual um plano de 5 a 10 trilhões é sequer discutível, e não apenas caro, é o autoaperfeiçoamento recursivo: se o pipeline de treinamento melhora a si mesmo, a computação necessária por geração diminui, e a fronteira se aproxima do que é acessível. Essa é a afirmação que sustenta o roteiro, e também é a coisa menos verificável que a Alibaba disse.

O que a empresa relatou: o Qwen3.8-Max completou 33 ciclos iterativos ao longo de aproximadamente um mês de trabalho totalmente automatizado, abrangendo projeto de pipeline, validação de dados e diagnóstico de erros, e elevou sua pontuação no Artificial Analysis de 40 para 45. Em um experimento de projeto de chip, o modelo dedicou mais de 60 horas de autoaperfeiçoamento ao longo de um ciclo de vida de projeto, fez mais de 10.000 chamadas de ferramentas de automação de projeto eletrônico e reduziu a área do chip em 42% sem perda de desempenho. Um relatório da conferência também apresenta uma melhoria de 96% na vazão de inferência a partir do ajuste autônomo de uma nova GPU T-Head.

Estes são relatos de fornecedores e não foram replicados de forma independente. Isso não é uma tecnicalidade — um loop autônomo que avalia seus próprios experimentos está se medindo com base em seu próprio avaliador, e o mundo exterior não tem como verificar a rubrica. A cobertura da conferência em geral tem dito isso, e os leitores devem partir desse pressuposto.

Há uma segunda armadilha na mesma alegação, e ela diz respeito a rótulos, não à honestidade. A Alibaba não disse em relação a qual revisão do Artificial Analysis Intelligence Index seu movimento de 40 para 45 é medido, e esse índice foi reconstruído desde o lançamento deste modelo. A página atual do Artificial Analysis para o Qwen3.8 Max (0902) traz 45 — um número independente, na revisão em vigor hoje. A leitura registrada para o mesmo modelo em meados de agosto, sob a revisão então em vigor, era 56. Um 45 e um 56 não são a mesma medição nas mesmas unidades, e subtrair um do outro produz um número que não significa nada. O que a página não traz é o 40 a partir do qual a Alibaba diz ter melhorado: o ponto de partida desse delta é da própria empresa, e só o ponto final por acaso se situa onde a leitura independente está agora. Leia o movimento como uma direção, não como uma medição.

A screenshot of the Artificial Analysis model page for Qwen3.8 Max (0902), captured September 23 2026, showing an Artificial Analysis Intelligence Index of 45 (ranked 24 of 212, badge 'Updated'), speed of 39.2 output tokens per second (159 of 212), $2.00 per 1M input and $6.00 per 1M output tokens with an 88% cache discount and $5.41 cost per Intelligence Index task (90 of 212), verbosity of 190M output tokens (88 of 212), and a technical specification listing a 984k context window with reasoning enabled.

O que a Alibaba de fato lançou na mesma conferência

Tirando o roadmap, a conferência ainda continha lançamentos reais, todos eles multimodais:

• Qwen3.8-LiveTranslate — interpretação simultânea, com latência (LAAL) reduzida em quase 20 por cento, de 2,8 segundos para 2,3 segundos

• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS e Qwen-Audio-3.1-Realtime — uma suíte de fala renovada

• Qwen-Audio-3.1-TTS-Next — paisagens sonoras cinematográficas que combinam diálogo e ambiência a partir de um roteiro de texto, voltadas para audiolivros, cinema e televisão, podcasts e jogos

• Qwen-Image 3.1 — geração de imagens ajustada para design criativo e marketing de comércio eletrónico, prevista para o final deste ano, com geração nativa de fundo transparente

• Qwen Intelligence — uma plataforma agêntica full-stack voltada para fabricantes de smartphones

Cada item dessa lista é um produto com uma janela de entrega. A alegação de escala de fronteira é o único item da pauta sem data associada, e o contraste não é por acaso: entregar a camada multimodal é o que financia um ano de roadmap, e o roadmap é o que faz a próxima rodada de financiamento ou o próximo contrato de nuvem ser uma história em vez de uma planilha. As duas coisas são reais. Só uma delas é algo que você pode chamar de produto.

O que é chamável hoje, e o que precisa mudar para que isso mude

A geração Qwen 3.8 continua sendo toda a linha disponível para compra. O Qwen3.8-Max está disponível para uso geral desde 3 de agosto de 2026 por US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, fixos ao longo de todo o contexto de 1.000.000 de tokens, sem sobretaxa para prompts longos. Seus pesos foram publicados em 12 de agosto de 2026 como Qwen3.8-2.4T-A95B em BF16 e FP8 sob uma licença Qwen personalizada. Sua tabela de benchmarks do fornecedor é forte e não auditada — Terminal-Bench 2.1 com 86,6, GPQA Diamond com 92,6, OSWorld-Verified com 86,1, todos números da própria Alibaba — O panorama independente é menos favorável do que o do fornecedor: a Artificial Analysis coloca o Qwen3.8 Max (0902) com um Intelligence Index de 45, 24º de 212 modelos, a US$ 5,41 de custo medido por tarefa do Intelligence Index e 39,2 tokens de saída por segundo — 159º de 212, perto da extremidade mais lenta do conjunto. A mesma página lista a janela de contexto como 984k, contra 1.000.000 em nossa própria página do modelo, uma diferença que vale a pena conhecer antes de dimensionar uma tarefa de contexto longo. Pontuação de classe frontier, velocidade mediana: esse é o resumo honesto do carro-chefe em produção, e é a linha de base que qualquer Qwen 4.5 tem de superar nos dois eixos ao mesmo tempo.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max), captured September 23 2026, showing the model id, 1M-token context, text image and video input with text output, vision tools JSON and reasoning badges, a dated snapshot label of 2026-08-03, input at $2.00 and output at $6.00 per 1M tokens, p50 TTFT 3.09s and p95 TTFT 10.00s, trailing-7-day traffic of 29.4M tokens, and a Python code sample posting to the OpenAI-compatible base_url https://api.orcarouter.ai/v1.

O OrcaRouter inclui a família Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash e qwen3.8-27b — em um único endpoint compatível com OpenAI, ao lado de mais de 200 outros modelos, o que significa que um nível Qwen 4.5 seria uma mudança de ID de modelo em uma chave existente, e não um novo contrato com fornecedor, uma nova fatura e um novo SDK. Quando um deles for lançado, é nesse catálogo que ele apareceria. Hoje, nem o Qwen 4.5 nem o Qwen 5 estão nele, porque nenhum dos dois foi lançado — e nenhuma quantidade de divulgação de roadmap muda isso.

A utilidade prática de um roadmap como este é o oposto de um plano de migração. Se um nível do Qwen 4.5 eventualmente parecer plausível para sua carga de trabalho, a forma barata de descobrir é encaminhar uma fração do tráfego real para ele por trás de um fallback automático, de modo que um modelo que se revele lento, caro ou pior que o incumbente custe a você uma porcentagem de uma carga de trabalho em vez de um quarto. É para isso que serve o failover, e um modelo de fronteira não comprovado, com apenas alguns dias, é o caso mais claro para usá-lo.

O que observar, e no que ainda não acreditar

Uma linha de roadmap torna-se um lançamento quando surge um pequeno conjunto de coisas concretas. Um cartão de modelo com uma contagem total de parâmetros, uma contagem de parâmetros ativos e uma janela de contexto. Um identificador de API que pode ser passado num pedido. Pesos num hub de modelos. Uma entrada num leaderboard independente com uma data associada. Um preço. Qualquer uma delas é um sinal; a maioria delas em conjunto é um lançamento.

Coisas que não são um release, por mais técnicas que pareçam: uma menção em conferência; um pull request de um framework de serving que adiciona um branch de arquitetura para um build experimental do Qwen, o que é trabalho de engine no stack de inferência de alguém, e não um modelo que você pode chamar; um id de snapshot datado para uma geração que já foi lançada; e um post em rede social parafraseando um comentário de palco. O sinal que produziu este artigo foi o último desses, e o motivo de valer a pena escrevê-lo é que a alegação subjacente pode ser verificada no próprio comunicado à imprensa da Alibaba — que é de onde vêm a faixa de 5 a 10 trilhões, o status do Qwen 4 e os números de RSI. O sinal apontava para a história; ele não é a história.

A questão de curto prazo é mais restrita do que as manchetes sugerem. A Alibaba afirmou que o Qwen 4 está em treinamento, o que coloca o Qwen 4 à frente tanto do 4.5 quanto do 5 na sequência — portanto, a próxima coisa que vale a pena acompanhar não é um modelo de 10 trilhões de parâmetros, mas se o Qwen 4 chega com um model card, um preço e um endpoint, e quando. Até que algo nessa cadeia se concretize, a posição honesta sobre a faixa de 5 a 10 trilhões de parâmetros é que ela é uma direção de evolução, declarada oficialmente, sem qualquer especificação associada e sem data. Planeje para o Qwen3.8-Max, acompanhe a faixa 4.5 e 5 como uma tese de escalonamento em vez de um produto, e trate qualquer número de parâmetros que você vir para um modelo sem model card como uma previsão.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente