
Qwen 3.8 vs GLM-5.2: O Primeiro Benchmark Onde Eles Realmente se Sobrepoem
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Estes dois modelos são a expressão mais clara de apostas opostas na IA chinesa de pesos abertos. A ZhipuGLM-5.2 é enxuto e comprovado: 753B de parâmetros totais com apenas 40B ativos, um Índice Artificial Analysis Intelligence auditado de 51, pesos disponíveis para download desde junho de 2026 e um preço publicado de $0,95 / $3,00. A AlibabaQwen3.8-Max é a aposta maximalista: ~2,4T de parâmetros, contagem de parâmetros ativos não divulgada e — até recentemente — nenhum número.
A disponibilidade geral em 3 de agosto de 2026 deu a este confronto algo que nenhum outro artigo desta série tem: um benchmark no qual ambos os modelos possuem pontuação. A Alibaba reporta Terminal-Bench 2.1 em 86,6; a Artificial Analysis tem o GLM-5.2 auditado em 82,7 nesse mesmo teste. Pela primeira vez, a afirmação da Qwen pode ser comparada a um número de concorrente medido de forma independente em terreno idêntico — com a importante ressalva de que apenas um dos dois foi produzido por um árbitro.
Uma nota para os desenvolvedores — a maneira mais rápida de resolver isso é rodar ambos nos seus próprios prompts. O OrcaRouter disponibiliza 200+ modelos atrás de um único endpoint compatível com OpenAI, então você pode colocar o Qwen 3.8 Max contra o GLM-5.2 na mesma tarefa sem precisar conectar dois SDKs.
Veredito TL;DR. No único benchmark compartilhado, o Qwen afirma uma vantagem de 3,9 pontos no Terminal-Bench 2.1 (86,6 contra 82,7) — um resultado real se for replicado, embora o número do Qwen seja auto-relatado e o do GLM seja auditado. Em todo o resto, o GLM-5.2 mantém as vantagens práticas: ele é ~2× mais barato a US$ 0,95 / US$ 3,00 contra US$ 2 / US$ 6 do Qwen, seus pesos estão disponíveis para download hoje, seus 40B de parâmetros ativos o tornam genuinamente implantável, e ele possui uma pontuação independente de 51 no índice, onde o Qwen não tem nenhuma. O Qwen responde com um contexto de 1M de tokens com tarifa fixa, multimodalidade nativa que o GLM não tem, e um teto potencial mais alto. O enxuto e comprovado ainda vence o grande e não verificado para produção — mas a diferença diminuiu em 3 de agosto.
Principais conclusões
• Primeira sobreposição direta de benchmark na série: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (relatado pela Alibaba) contra GLM-5.2 82.7 (Artificial Analysis, auditado). A Qwen lidera por 3.9 pontos, mas os dois números não são igualmente confiáveis.
• GLM-5.2 custa aproximadamente metade do preço: $0,95 / $3,00 por 1M (AA combinado ~$0,90), enquanto o Qwen3.8-Max custa $2 / $6.
• Os parâmetros ativos são a verdadeira história arquitetural: GLM-5.2 executa 40B ativos de 753B totais. A Alibaba ainda não divulgou a contagem de parâmetros ativos do Qwen, o que torna seu custo de serviço não modelável.
• Os pesos do GLM estão disponíveis para download hoje;Os da Qwen são prometidos para esta semana, ainda sem licença ou repositório.
• GLM-5.2 tem um índice auditado de 51. Qwen3.8-Max continua sem pontuação — embora seu antecessor Qwen3.7-Max tenha obtido 46, abaixo do GLM.
• As ofertas exclusivas da Qwen: uma janela de 1M de tokens com cobrança fixa e sem sobretaxa para prompts longos, além de entrada nativa de texto, imagem e vídeo e OmniDocBench 1.5 92.1. O GLM-5.2 é focado em texto.
Nota de precisão: todos os números de qualidade do Qwen3.8-Max são relatados pela Alibaba e não verificados por terceiros. Os números do GLM-5.2 vêm da Artificial Analysis. Comparar uma pontuação autorrelatada com uma auditada no mesmo benchmark é informativo, mas não conclusivo — os harnesses do fornecedor e os harnesses de avaliação diferem. O preço do Qwen é a tabela de preços GA e substitui o desconto de prévia de julho.
Especificações e preço, lado a lado
Aqui estão os dados concretos, cada número atribuído à sua fonte.
• Fabricante / status — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); GLM-5.2: Zhipu; lançado em junho de 2026
• Arquitetura — Qwen3.8-Max: ~2,4T total, MoE esparso; GLM-5.2: 753B total, MoE esparso (Artificial Analysis)
• Parâmetros ativos — Qwen3.8-Max: Ainda não divulgados pela Alibaba; GLM-5.2: 40B ativos (Artificial Analysis)
• Janela de contexto — Qwen3.8-Max: 1M tokens, tarifa fixa (983,616 com pensamento; saída máx. 131,072); GLM-5.2: 1M tokens (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86,6 (relatado pela Alibaba); GLM-5.2: 82,7 (Artificial Analysis, auditado)
• AA Intelligence Index — Qwen3.8-Max: Ainda sem pontuação; GLM-5.2: 51 (Artificial Analysis)
• Outras pontuações relatadas pelo fornecedor — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (relatado pela Alibaba); GLM-5.2: posição medida por terceiros
• Modalidades — Qwen3.8-Max: Texto, imagem, vídeo → texto; GLM-5.2: focado em texto
• Preços (entrada / saída) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fixo; entrada em cache $0.25; GLM-5.2: $0.95 / $3.00 por 1M (AA combinado ~$0.90)
• Pesos abertos — Qwen3.8-Max: Prometido para esta semana (sem licença ainda); GLM-5.2: Sim — disponível para download hoje
Duas coisas enquadram esta comparação, e a primeira é o ponto de dados mais útil de toda a série.
Primeiro, a sobreposição do Terminal-Bench é genuinamente informativa. O Terminal-Bench 2.1 mede se um modelo pode operar um shell real até a conclusão — executar comandos, ler a saída, recuperar-se de erros. É o proxy disponível mais próximo de "isso pode funcionar como um agente de codificação em vez de um sugeridor de código", e é o benchmark que ambos os fornecedores escolheram divulgar. O 86,6 da Qwen contra os 82,7 auditados da GLM é uma vantagem de 3,9 pontos a favor da Qwen.
A ressalva importa, mas não deve ser exagerada. Os harnesses dos fornecedores e os harnesses dos avaliadores diferem em scaffolding, política de nova tentativa e construção de prompts, e essas escolhas podem alterar uma pontuação do Terminal-Bench em mais de quatro pontos. Portanto, isso não é prova de que a Qwen é o melhor modelo agêntico. O que isso estabelece é que a afirmação autorrelatada da Qwen se situa na mesma faixa competitiva de um modelo de fronteira open-weight auditado, em vez de em território implausível. Essa é uma posição significativamente mais forte do que "sem pontuação".
Em segundo lugar, a comparação de arquiteturas é onde o GLM vence silenciosamente. O GLM-5.2 ativa 40B parâmetros de um total de 753B. Esse único número informa o custo de servir, o perfil de latência e que uma equipe bem equipada pode de fato executá-lo. A Alibaba ainda não divulgou a contagem de parâmetros ativos do Qwen — o que significa que, apesar de tudo o que o título de 2,4T transmite, ninguém fora da Alibaba pode estimar quanto custa servir o Qwen3.8-Max ou como ele se comportaria em auto-hospedagem. Em uma comparação de Mixture-of-Experts, isso não é uma nota de rodapé; é o número ausente mais importante.

Enxuto e comprovado vs grande e não verificado
O caso da GLM-5.2 baseia-se numa posição de engenharia coerente: fazer mais com menos, publicar os números, disponibilizar os pesos. Um modelo com 40B ativos é barato de servir, rápido por construção e implantável por uma equipe com um orçamento de GPU sério, mas não absurdo. Seu índice auditado de 51 e Terminal-Bench auditado de 82,7 significam que o comprador não está aceitando nada por confiança. E a US$ 0,95 / US$ 3,00, custa aproximadamente metade do preço da Qwen.
O caso do Qwen3.8-Max é a aposta oposta: construa o maior modelo que puder e deixe que a capacidade justifique o custo. A GA tornou esse argumento muito mais forte do que era, porque finalmente há números associados — GPQA Diamond 92,6 em ciência de pós-graduação, OSWorld-Verified 86,1 em operação de GUI, FrontierSWE 73,5 contra os 40,7 de um antecessor, e o Terminal-Bench 86,6 discutido acima. Esses são números com formato de fronteira, e a quase duplicação no FrontierSWE é o tipo de salto geracional difícil de forjar por completo.
Mas duas lacunas persistem, e são as mesmas duas que importaram em julho. Não há pontuação independente — Artificial Analysis e LMArena permanecem sem pontuação no Qwen3.8-Max, então toda afirmação de qualidade é da própria Alibaba. E não há licença, então a promessa de pesos abertos ainda não pode ser avaliada comercialmente.
A âncora histórica joga contra o Qwen aqui mais do que na maioria dos confrontos: o predecessor Qwen3.7-Max pontuou 46 no índice AA, abaixo dos 51 do GLM-5.2. Portanto, a alegação implícita da Alibaba não é apenas que o Qwen3.8-Max é bom, mas que saltou de abaixo do GLM para bem acima dele em uma única geração. A melhoria no FrontierSWE dá alguma credibilidade a isso. Uma pontuação independente resolveria a questão.

Custo na prática: onde 2× cai
Considere um pipeline de codificação agêntica: 180.000 tokens de contexto do repositório, 10.000 tokens de saída por execução.
• GLM-5.2: 0,18M × $0,95 = $0,171, mais 0,01M × $3,00 = $0,03. ≈ $0,20 por execução.
• Qwen3.8-Max: 0,18M × $2 = $0,36, mais 0,01M × $6 = $0,06. ≈ $0,42 por execução.
• Com 3.000 execuções/dia: GLM ≈ US$ 603/dia; Qwen ≈ US$ 1.260/dia — aproximadamente US$ 20.000 de diferença por mês.
• Com a entrada em cache do Qwen a $0,25/1M em um repositório estável, seu custo de execução cai para ≈ $0,11, o que na verdade fica abaixo do custo sem cache da GLM.
Essa última linha é o item mais útil na prática nesta comparação. O preço anunciado da Qwen é o dobro do da GLM, mas sua taxa de acerto de cache de US$ 0,25 por 1M é agressiva o suficiente para que um pipeline bem cacheado possa inverter a classificação. Se o seu agente relê um contexto quase inalterado a cada turno — o que descreve a maioria dos agentes de codificação — a Qwen pode ser a opção mais barata na prática, apesar da tabela de preços pior. Equipes que não configuram cache pagarão o dobro por nada.
Ambos os modelos cobram tokens de raciocínio como saída, portanto configurações com uso intensivo de raciocínio custam mais do que essas estimativas em ambos os lados.
Implantabilidade: o eixo que a GLM possui
Ambos são modelos MoE chineses de pesos abertos com alegações de contexto de 1M de tokens, o que torna a implantabilidade a divisão prática mais acentuada.
Os pesos do GLM-5.2 estão disponíveis para download desde junho e, com 40B ativos, é um alvo realista para auto-hospedagem — quantizável, executável em um número razoável de GPUs e já testado pela comunidade.
Os pesos do Qwen3.8-Max são prometidos para esta semana, mas o modelo principal não é um alvo realista para ninguém: aproximadamente 1.2TB em 4 bits contra cerca de 141GB por H200 significa oito ou mais aceleradores de ponta, e a contagem não divulgada de parâmetros ativos torna o throughput resultante impossível de prever. Some a isso a licença ausente e, por enquanto, hospedar o modelo principal por conta própria não é um plano.
Anunciado simultaneamente, o Qwen3.8-27B é a resposta genuína da Alibaba neste eixo. Também com pesos abertos e, segundo relatos, rodando em cerca de 17GB de VRAM — uma única placa de alto desempenho, bem abaixo da pegada do GLM-5.2 — compete diretamente em capacidade de implantação. Se o seu interesse em qualquer um dos modelos é executá-lo você mesmo, a comparação Qwen 27B versus GLM-5.2 é a que realmente importará, e é uma disputa muito mais acirrada do que 2.4T versus 753B.
Perguntas Frequentes
O Qwen 3.8 é melhor que o GLM-5.2?
No único benchmark que compartilham, a Qwen afirma uma vantagem — Terminal-Bench 2.1 86,6 contra os 82,7 auditados da GLM. Mas o número da Qwen é autorrelatado e o da GLM foi medido pela Artificial Analysis, e diferenças de harness podem superar uma margem de quatro pontos. A GLM-5.2 também possui um índice auditado de 51, enquanto a Qwen não possui nenhuma pontuação independente. A GLM é a escolha mais segura; a Qwen tem o teto mais alto não verificado.
Como eles se comparam no Terminal-Bench 2.1?
A Qwen3.8-Max reporta 86,6; a Artificial Analysis mediu a GLM-5.2 em 82,7. Isso representa uma vantagem nominal de 3,9 pontos para a Qwen e a primeira sobreposição entre elas no mesmo benchmark. Interprete isso como evidência de que a Qwen é competitiva nessa faixa, e não como prova de que está à frente, já que apenas o número da GLM foi produzido de forma independente.
Qual é mais barato?
GLM-5.2 na tabela de preços — $0,95 / $3,00 por 1M (AA combinado ~$0,90) versus os $2 / $6 da Qwen, aproximadamente metade. Mas a entrada em cache da Qwen a $0,25 por 1M é agressiva o suficiente para que um pipeline com muito cache acabe custando menos na Qwen do que no GLM sem cache.
Quantos parâmetros ativos o Qwen 3.8 Max usa?
A Alibaba nunca publicou o número, nem mesmo na disponibilidade geral. Esse é o número que determina o custo de servição e a latência em um modelo Mixture-of-Experts, então sua ausência é uma lacuna real. O GLM-5.2, por outro lado, é documentado com 40B de parâmetros ativos em um total de 753B.
Qual posso realmente hospedar por conta própria?
GLM-5.2 hoje — os pesos estão disponíveis e 40B ativos o tornam viável. Os pesos do Qwen3.8-Max são prometidos para esta semana, mas o modelo principal precisa de oito ou mais GPUs da classe H200, com ~1,2TB em 4 bits, sem licença publicada ainda. O Qwen3.8-27B, anunciado simultaneamente, com ~17GB de VRAM, é a opção Qwen implantável e a que mais se aproxima do nicho do GLM.
O Qwen 3.8 Max saiu do preview?
Sim, em 3 de agosto de 2026, com uma tabela de preços publicada e um endpoint compatível com OpenAI e DashScope. A campanha de créditos Qoder com 90% de desconto de julho não descreve mais como é vendido.
O que a Qwen oferece que o GLM-5.2 não oferece?
Multimodalidade nativa — entrada de imagem e vídeo, com OmniDocBench 92.1 auto-relatado para parsing de documentos — e um contexto de 1M de tokens cobrado a uma taxa fixa, sem sobretaxa para prompts longos. O GLM-5.2 é focado em texto, então para pipelines de documentos, capturas de tela ou vídeos, o Qwen não está competindo tanto com ele, mas sim fazendo algo diferente.
Conclusão
Qwen 3.8 vs GLM-5.2 é o duelo em que a disponibilidade geral trouxe a informação genuinamente mais nova. Pela primeira vez, a Qwen tem uma pontuação em um benchmark que um avaliador independente também executou, e ela fica acima da GLM: Terminal-Bench 2.1 86.6 contra 82.7. Isso leva a Qwen de "sem pontuação" para "plausivelmente competitiva em terreno medido", o que é um progresso real mesmo considerando a ressalva de autorrelato.
Mas o GLM-5.2 mantém a coroa prática, e o faz com pontos fortes nada glamorosos: metade do preço, um índice auditado de 51, 40B de parâmetros ativos que tornam sua economia previsível e sua implantação viável, e pesos que você pode baixar agora mesmo. As respostas da Qwen — um contexto de um milhão de tokens a preço fixo, multimodalidade nativa e um teto mais alto — são significativas, mas condicionais, e suas duas lacunas de julho permanecem inalteradas: nenhuma pontuação independente e nenhuma licença. Fique de olho em três coisas: a primeira pontuação independente do Intelligence Index para o Qwen3.8-Max, se algum avaliador reproduz o número 86.6 do Terminal-Bench, e o lançamento do Qwen3.8-27B, que é onde essas duas filosofias realmente vão colidir. Até lá, o GLM-5.2 é o que você coloca em produção e o Qwen3.8-Max é o que você avalia — com cache ativado.

Comparados neste artigo3
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
