
Qwen 4.5 e Qwen 5 miram de 5 a 10 trilhões de parâmetros: o que a Alibaba disse e não disse
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Em sua Apsara Conference em Hangzhou, em 22 de setembro de 2026, a empresa atribuiu um tamanho à geração seguinte à próxima. A linha Qwen 4.5 e Qwen 5 está "projetada para escalar até 5 a 10 trilhões de parâmetros", nas palavras do próprio comunicado à imprensa em inglês da empresa — uma linha de roadmap, não uma especificação. Nenhum dos modelos tem data de lançamento, cartão de modelo, identificador de API, preço ou pontuação de benchmark publicada, o que significa que nada de nenhum dos dois é invocável hoje. O carro-chefe que você pode realmente comprar é Qwen3.8-Max, com disponibilidade geral desde 3 de agosto de 2026, com 2,4 trilhões de parâmetros. Nos dias que se seguiram à conferência, essa frase de roadmap foi reduzida, em muitas reportagens, à alegação de que um modelo de 10 trilhões de parâmetros está chegando — uma alegação mais forte e mais simples do que a que a empresa fez. A distância entre essas duas frases é de aproximadamente um ano de planejamento.
A alegação, e a versão dela que se espalhou
Duas coisas foram ditas no palco, e vale a pena separá-las porque carregam quantidades muito diferentes de informação. A primeira é uma atualização de status: o Qwen 4 está em treinamento, em uma nova arquitetura. A segunda é um roadmap: as séries Qwen 4.5 e Qwen 5 têm projeção de alcançar uma faixa de parâmetros de 5 a 10 trilhões.
O comunicado de imprensa em inglês da Alibaba atribui ambos à empresa, e não a um executivo nomeado. A cobertura da conferência que vai mais longe atribui o roteiro a Liu Da Yiheng, que dirige o projeto de modelo de linguagem de grande porte Qwen no Alibaba Token Hub, e relata sua formulação de que a escala é um caminho fundamental rumo à superinteligência artificial. Essa formulação é o contexto em que o número de parâmetros foi apresentado, e explica por que o número é uma faixa, e não uma meta.
O que circulou, então, foi o topo da faixa. As manchetes em inglês que se seguiram incluem pelo menos uma descrevendo um modelo insinuado de 10 trilhões de parâmetros, e várias descrevendo um plano para um modelo de 5 a 10 trilhões de parâmetros. Ambas são leituras defensáveis de um slide. Nenhuma delas é uma especificação, e a diferença importa para quem precisa se planejar com base nela.
5 trilhões é a meta de uma geração e 10 trilhões é a de outra
O ponto mais útil a acertar sobre este anúncio é que 5 a 10 trilhões é uma faixa que abrange duas gerações, não um único modelo com uma tolerância ampla. A frase da própria Alibaba associa a faixa às “próximas séries de modelos Qwen 4.5 e Qwen 5” — as séries, no plural, tomadas em conjunto.
A reportagem em língua chinesa da mesma conferência volta a ser precisa numa direção diferente, com manchetes que descrevem modelos posteriores ao Qwen 4.5 a expandirem-se para o intervalo dos 5 aos 10 biliões. Essa leitura situa também o extremo dos 10 biliões para lá do Qwen 4.5. A única afirmação em que todas as fontes concordam é que a faixa abrange o intervalo entre o Qwen 4.5 e o Qwen 5. A atribuição dos 10 biliões especificamente ao Qwen 5 é uma inferência que se tornou manchete, não uma citação.
Para dar uma ideia da escala — e estes são os únicos números nesta matéria que são publicados, e não projetados:
• 5 a 10 trilhões — a faixa de parâmetros que o comunicado à imprensa da Alibaba atribui às séries Qwen 4.5 e Qwen 5
• 2,4 trilhões — parâmetros totais do Qwen3.8-Max, o carro-chefe já lançado, de acordo com sua ficha oficial do modelo
• 95 bilhões — os parâmetros ativos do Qwen3.8-Max por token, o número que determina quanto custa servir um token
• 10 trilhões — o topo da faixa, e a única parte dela que chegou à maioria das manchetes em inglês
• 0 — o número de especificações publicadas, datas de lançamento, preços, janelas de contexto ou pontuações de benchmark para o Qwen 4.5 ou Qwen 5

O número do parâmetro que importa é aquele que ninguém publicou.
Os parâmetros totais são o número que um laboratório escolhe dizer. Os parâmetros ativos são o número de que um comprador precisa, e o roteiro não inclui nenhum.
O Qwen3.8-Max é um modelo de mistura de especialistas com 2,4 trilhões de parâmetros no total e 95 bilhões ativos por token. Essa é uma taxa de ativação de aproximadamente 4%: o modelo armazena uma grande quantidade de conhecimento em pesos que não lê em um dado token e paga computação por uma pequena parte deles. Os parâmetros totais dizem quanta memória a coisa ocupa e de que tamanho de máquina você precisa. Os parâmetros ativos dizem quanto você paga a cada vez que ele responde.
Projete essa proporção para frente e a forma do problema fica visível. Um modelo de 10 trilhões de parâmetros construído com a mesma ativação de 4 por cento ativaria algo da ordem de 400 bilhões de parâmetros por token — mais de quatro vezes o que o Qwen3.8-Max ativa hoje. Isso é aritmética sobre uma premissa declarada, não uma afirmação sobre o Qwen 5: aumente a esparsidade e a contagem de ativos cai; diminua-a e ela sobe. Mas é essa aritmética que decide se um modelo de 10 trilhões de parâmetros é um produto servido ou um artefato de pesquisa, e é o cálculo que a manchete de 5 a 10 trilhões convida a fazer e depois deixa por fazer.
É também aqui que a economia de roteamento deixa de ser abstrata. Na OrcaRouter, o preço de tabela do provedor é repassado com 0% de markup, então um corte de preço de um fornecedor em um nível Qwen entra em vigor na sua chave no mesmo dia, em vez de apenas na renovação. Uma geração cujo custo de serving é genuinamente incerto é exatamente o caso em que esse repasse vale mais do que um desconto negociado de antemão com base em um número que ninguém publicou.
O anúncio do chip é a linha do tempo real
A Alibaba anunciou o roadmap do modelo e um novo acelerador no mesmo comunicado à imprensa, e os dois estão mais conectados do que o comunicado diz.
O Zhenwu V900 da T-Head é um processador de treinamento e inferência com 216 GB de memória e 1.200 GB/s de largura de banda entre chips, suporte nativo para FP8 e FP4 e um desempenho reivindicado três vezes superior ao de seu antecessor, o Zhenwu M890, lançado em maio. A produção em massa e o lançamento comercial estão previstos para o primeiro trimestre de 2027. Um servidor supernó complementar suporta clusters de até 500.000 placas, e a T-Head afirma que a linha Zhenwu já atendeu mais de 650 clientes.
Leia os dois anúncios em conjunto e a sequência fica legível. Treinar e servir um modelo de mistura de especialistas na escala de 10 trilhões é um problema de interconexão antes de ser um problema de computação, porque o paralelismo de especialistas significa mover ativações entre chips constantemente, e 1.200 GB/s de largura de banda entre chips é o número que decide se isso é viável. O silício nesse cronograma coloca a janela plausível mais precoce para uma execução de escala de fronteira desse tipo bem no decorrer de 2027 — e, mesmo assim, o envio de um chip não diz nada sobre a conclusão de um treinamento. A Alibaba conectou os dois assuntos ao colocá-los em um único lançamento; a conexão em si é a nossa leitura, e está rotulada como tal.
O próprio horizonte temporal da empresa é consistente com isso. O diretor executivo Eddie Wu estabeleceu a meta de mais de 20 gigawatts de capacidade global de data centers do Alibaba Cloud até 2032 — uma meta de capacidade, não capacidade implantada, e um horizonte de mais de cinco anos, e não de próximo trimestre.
As alegações de autoaperfeiçoamento que sustentam o roadmap
A razão pela qual um plano de 5 a 10 trilhões é sequer discutível, e não apenas caro, é o autoaperfeiçoamento recursivo: se o pipeline de treinamento melhora a si mesmo, a computação necessária por geração diminui, e a fronteira se aproxima do que é acessível. Essa é a afirmação que sustenta o roteiro, e também é a coisa menos verificável que a Alibaba disse.
O que a empresa relatou: o Qwen3.8-Max completou 33 ciclos iterativos ao longo de aproximadamente um mês de trabalho totalmente automatizado, abrangendo projeto de pipeline, validação de dados e diagnóstico de erros, e elevou sua pontuação no Artificial Analysis de 40 para 45. Em um experimento de projeto de chip, o modelo dedicou mais de 60 horas de autoaperfeiçoamento ao longo de um ciclo de vida de projeto, fez mais de 10.000 chamadas de ferramentas de automação de projeto eletrônico e reduziu a área do chip em 42% sem perda de desempenho. Um relatório da conferência também apresenta uma melhoria de 96% na vazão de inferência a partir do ajuste autônomo de uma nova GPU T-Head.
Estes são relatos de fornecedores e não foram replicados de forma independente. Isso não é uma tecnicalidade — um loop autônomo que avalia seus próprios experimentos está se medindo com base em seu próprio avaliador, e o mundo exterior não tem como verificar a rubrica. A cobertura da conferência em geral tem dito isso, e os leitores devem partir desse pressuposto.
Há uma segunda armadilha na mesma alegação, e ela diz respeito a rótulos, não à honestidade. A Alibaba não disse em relação a qual revisão do Artificial Analysis Intelligence Index seu movimento de 40 para 45 é medido, e esse índice foi reconstruído desde o lançamento deste modelo. A página atual do Artificial Analysis para o Qwen3.8 Max (0902) traz 45 — um número independente, na revisão em vigor hoje. A leitura registrada para o mesmo modelo em meados de agosto, sob a revisão então em vigor, era 56. Um 45 e um 56 não são a mesma medição nas mesmas unidades, e subtrair um do outro produz um número que não significa nada. O que a página não traz é o 40 a partir do qual a Alibaba diz ter melhorado: o ponto de partida desse delta é da própria empresa, e só o ponto final por acaso se situa onde a leitura independente está agora. Leia o movimento como uma direção, não como uma medição.

O que a Alibaba de fato lançou na mesma conferência
Tirando o roadmap, a conferência ainda continha lançamentos reais, todos eles multimodais:
• Qwen3.8-LiveTranslate — interpretação simultânea, com latência (LAAL) reduzida em quase 20 por cento, de 2,8 segundos para 2,3 segundos
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-TTS e Qwen-Audio-3.1-Realtime — uma suíte de fala renovada
• Qwen-Audio-3.1-TTS-Next — paisagens sonoras cinematográficas que combinam diálogo e ambiência a partir de um roteiro de texto, voltadas para audiolivros, cinema e televisão, podcasts e jogos
• Qwen-Image 3.1 — geração de imagens ajustada para design criativo e marketing de comércio eletrónico, prevista para o final deste ano, com geração nativa de fundo transparente
• Qwen Intelligence — uma plataforma agêntica full-stack voltada para fabricantes de smartphones
Cada item dessa lista é um produto com uma janela de entrega. A alegação de escala de fronteira é o único item da pauta sem data associada, e o contraste não é por acaso: entregar a camada multimodal é o que financia um ano de roadmap, e o roadmap é o que faz a próxima rodada de financiamento ou o próximo contrato de nuvem ser uma história em vez de uma planilha. As duas coisas são reais. Só uma delas é algo que você pode chamar de produto.
O que é chamável hoje, e o que precisa mudar para que isso mude
A geração Qwen 3.8 continua sendo toda a linha disponível para compra. O Qwen3.8-Max está disponível para uso geral desde 3 de agosto de 2026 por US$ 2,00 por milhão de tokens de entrada e US$ 6,00 por milhão de tokens de saída, fixos ao longo de todo o contexto de 1.000.000 de tokens, sem sobretaxa para prompts longos. Seus pesos foram publicados em 12 de agosto de 2026 como Qwen3.8-2.4T-A95B em BF16 e FP8 sob uma licença Qwen personalizada. Sua tabela de benchmarks do fornecedor é forte e não auditada — Terminal-Bench 2.1 com 86,6, GPQA Diamond com 92,6, OSWorld-Verified com 86,1, todos números da própria Alibaba — O panorama independente é menos favorável do que o do fornecedor: a Artificial Analysis coloca o Qwen3.8 Max (0902) com um Intelligence Index de 45, 24º de 212 modelos, a US$ 5,41 de custo medido por tarefa do Intelligence Index e 39,2 tokens de saída por segundo — 159º de 212, perto da extremidade mais lenta do conjunto. A mesma página lista a janela de contexto como 984k, contra 1.000.000 em nossa própria página do modelo, uma diferença que vale a pena conhecer antes de dimensionar uma tarefa de contexto longo. Pontuação de classe frontier, velocidade mediana: esse é o resumo honesto do carro-chefe em produção, e é a linha de base que qualquer Qwen 4.5 tem de superar nos dois eixos ao mesmo tempo.

O OrcaRouter inclui a família Qwen 3.8 — qwen/qwen3.8-max, qwen3.8-flash e qwen3.8-27b — em um único endpoint compatível com OpenAI, ao lado de mais de 200 outros modelos, o que significa que um nível Qwen 4.5 seria uma mudança de ID de modelo em uma chave existente, e não um novo contrato com fornecedor, uma nova fatura e um novo SDK. Quando um deles for lançado, é nesse catálogo que ele apareceria. Hoje, nem o Qwen 4.5 nem o Qwen 5 estão nele, porque nenhum dos dois foi lançado — e nenhuma quantidade de divulgação de roadmap muda isso.
A utilidade prática de um roadmap como este é o oposto de um plano de migração. Se um nível do Qwen 4.5 eventualmente parecer plausível para sua carga de trabalho, a forma barata de descobrir é encaminhar uma fração do tráfego real para ele por trás de um fallback automático, de modo que um modelo que se revele lento, caro ou pior que o incumbente custe a você uma porcentagem de uma carga de trabalho em vez de um quarto. É para isso que serve o failover, e um modelo de fronteira não comprovado, com apenas alguns dias, é o caso mais claro para usá-lo.
O que observar, e no que ainda não acreditar
Uma linha de roadmap torna-se um lançamento quando surge um pequeno conjunto de coisas concretas. Um cartão de modelo com uma contagem total de parâmetros, uma contagem de parâmetros ativos e uma janela de contexto. Um identificador de API que pode ser passado num pedido. Pesos num hub de modelos. Uma entrada num leaderboard independente com uma data associada. Um preço. Qualquer uma delas é um sinal; a maioria delas em conjunto é um lançamento.
Coisas que não são um release, por mais técnicas que pareçam: uma menção em conferência; um pull request de um framework de serving que adiciona um branch de arquitetura para um build experimental do Qwen, o que é trabalho de engine no stack de inferência de alguém, e não um modelo que você pode chamar; um id de snapshot datado para uma geração que já foi lançada; e um post em rede social parafraseando um comentário de palco. O sinal que produziu este artigo foi o último desses, e o motivo de valer a pena escrevê-lo é que a alegação subjacente pode ser verificada no próprio comunicado à imprensa da Alibaba — que é de onde vêm a faixa de 5 a 10 trilhões, o status do Qwen 4 e os números de RSI. O sinal apontava para a história; ele não é a história.
A questão de curto prazo é mais restrita do que as manchetes sugerem. A Alibaba afirmou que o Qwen 4 está em treinamento, o que coloca o Qwen 4 à frente tanto do 4.5 quanto do 5 na sequência — portanto, a próxima coisa que vale a pena acompanhar não é um modelo de 10 trilhões de parâmetros, mas se o Qwen 4 chega com um model card, um preço e um endpoint, e quando. Até que algo nessa cadeia se concretize, a posição honesta sobre a faixa de 5 a 10 trilhões de parâmetros é que ela é uma direção de evolução, declarada oficialmente, sem qualquer especificação associada e sem data. Planeje para o Qwen3.8-Max, acompanhe a faixa 4.5 e 5 como uma tese de escalonamento em vez de um produto, e trate qualquer número de parâmetros que você vir para um modelo sem model card como uma previsão.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
