Qwen 3.8 vs GLM-5.2: Escala Bruta vs o Modelo Aberto Enxuto e Auditado
Guides & Insights

Qwen 3.8 vs GLM-5.2: Escala Bruta vs o Modelo Aberto Enxuto e Auditado

Autor

jinhao song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois dos modelos chineses mais comentados de 2026 são ambos sistemas esparsos de Mistura de Especialistas, ambos prometem pesos abertos e ambos subcotam a fronteira ocidental em preço — no entanto, dificilmente poderiam ser mais diferentes em filosofia. O Qwen3.8-Maxda Alibaba, apresentado na World AI Conference em Xangai em 19 de julho de 2026, aposta na escala pura: cerca de 2,4 trilhões de parâmetros e uma minúcia obsessiva que os primeiros testadores adoraram. O GLM-5.2 da Zhipu aposta no oposto — um design enxuto de 40 bilhões de parâmetros ativos que a Artificial Analysis já avaliou, com um resultado agentivo excepcional e pesos que você pode obter hoje. Isto é eficiência versus tamanho bruto, e os dois modelos tornam a disputa excepcionalmente clara.

O ponto crucial que molda tudo abaixo: o GLM-5.2 mostra todas as suas cartas, enquanto o Qwen 3.8 mantém a maioria de suas cartas viradas para baixo. Um aviso para construtores — a maneira honesta de decidir qual deles se encaixa na sua stack é executar ambos com seus próprios prompts. O OrcaRouter oferece mais de 200 modelos por trás de um endpoint compatível com OpenAI, para que você possa confrontar Qwen 3.8 contra o GLM-5.2 na mesma tarefa sem configurar dois SDKs.

Veredito TL;DR. GLM-5.2 é a escolha pragmática de pesos abertos agêntica que você pode realmente usar agora. De acordo com a Artificial Analysis, ela possui um Índice de Inteligência auditado de 51, um forte Terminal-Bench 2.1 de 82,7, barato $0,95 / $3,00 preços, um contexto de 1M e — crucialmente — pesos abertos já lançados em apenas 40B de parâmetros ativos. Qwen 3.8 Max é a aposta maior: ~2,4T de parâmetros totais e qualidade prática de primeira linha, mas esconde sua contagem de parâmetros ativos, tem nenhum benchmark independente, foi o modelo mais lento que os testadores executaram, e seus pesos ainda estão "em breve". GLM prova que eficiência funciona; Qwen pede que você confie na escala.

Principais conclusões

GLM-5.2 (Zhipu) é um 753B-total / 40B-active MoE com um Índice de Inteligência AA auditado de 51 e uma pontuação de Terminal-Bench 2.1 de 82.7 (fonte: Artificial Analysis); Qwen 3.8 Max é um ~2.4T MoE preview cujo número de parâmetros ativos não foi divulgado e que tem nenhuma pontuação auditada.

• Os pesos do GLM-5.2 estão abertos e disponíveis para download hoje (lançado em junho de 2026); os do Qwen 3.8 são prometidos "em breve", mas ainda não lançados (~1.2TB, 8+ GPUs H200 para auto-hospedagem).

•  Preço favorece GLM: $0.95 / $3.00 por 1 milhão de tokens (AA blended ~$0.90). A prévia do Qwen 3.8 está com grande desconto (~90% de desconto), mas tem nenhum preço de API por token publicado e o desconto é temporário.

• Em trabalho agente/terminal, o GLM-5.2 tem o 82.7 Terminal-Bench como uma força concreta e referendada; a vantagem do Qwen 3.8 é a minúcia e one-shots criativos — impressionante em testes práticos, mas não auditado e lento.

• Ambos são modelos MoE chineses de peso aberto com alegações de contexto de 1M de tokens; a verdadeira divisão é enxuto e comprovado (GLM) versus grande e não comprovado (Qwen).

Os números do Qwen 3.8 são alegações de fornecedores ou impressões iniciais e não controladas — não auditadas de forma independente. Os números do GLM-5.2 são da Artificial Analysis e podem diferir dos relatórios da própria Zhipu. O preço promocional do Qwen 3.8 é um desconto temporário; verifique a taxa por token antes de fazer o orçamento. Observe que o Qwen possui barreiras de conteúdo alinhadas ao CCP em tópicos politicamente sensíveis.

Especificações e preço, lado a lado

Aqui estão os dados concretos, cada valor do GLM-5.2 atribuído à sua fonte.

• Fabricante / status — Qwen 3.8 Max: Alibaba; prévia (19 de julho de 2026); GLM-5.2: Zhipu; lançado em junho de 2026

• Arquitetura — Qwen 3.8 Max: ~2,4T total, MoE esparso; GLM-5.2: 753B total, MoE esparso (Artificial Analysis)

• Parâmetros ativos — Qwen 3.8 Max: Não divulgado pela Alibaba; GLM-5.2: 40B ativos (Artificial Analysis)

• Janela de contexto — Qwen 3.8 Max: Reportado ~1M tokens (não confirmado formalmente); GLM-5.2: 1M tokens (Artificial Analysis)

• AA Intelligence Index — Qwen 3.8 Max: Nenhum ainda — sem pontuação; GLM-5.2: 51 (Artificial Analysis)

•  Terminal-Bench 2.1 — Qwen 3.8 Max: Nenhum valor publicado; GLM-5.2: 82.7 (Artificial Analysis)

• Preço (entrada / saída) — Qwen 3.8 Max: Apenas pré-visualização (~90% de desconto; API por token não publicada); GLM-5.2: $0.95 / $3.00 por 1M (AA combinado ~$0.90)

•  Pesos abertos — Qwen 3.8 Max: Prometido "em breve" (não lançado); GLM-5.2: Sim — lançado, disponível para download hoje

•  Velocidade — Qwen 3.8 Max: Modelo mais lento testado (prático); GLM-5.2: Lean 40B ativo — eficiente por design

Duas coisas enquadram este confronto. Primeiro, a linha "parâmetros ativos" é onde as duas filosofias colidem. O GLM-5.2 realiza seu trabalho de agente de fronteira — uma pontuação de 82.7 no Terminal-Bench 2.1 é um resultado sério — com apenas 40B parâmetros ativos, um número público e verificável. O Qwen 3.8 possui aproximadamente 2,4T parâmetros totais, mas não revela quantos estão ativos, então você não pode julgar sua eficiência de forma alguma. Um modelo prova que é eficiente; o outro pede que você assuma isso.

Em segundo lugar, toda coluna que decide a adoção real no momento favorece a GLM. Ela tem um índice auditado (51) onde a Qwen tem um espaço em branco; tem um preço publicado e durável ($0,95 / $3,00) onde a Qwen tem um desconto temporário e nenhuma taxa de API; e seus pesos já estão na mesa, enquanto os da Qwen são uma promessa. O contrapeso do Qwen 3.8 é a escala bruta e a abrangência que essa escala parece comprar — uma vantagem real em trabalhos focados em qualidade, mas ainda não confirmada por um placar neutro.

Eficiência vs escala bruta

O cerne desta comparação é uma questão que o campo não para de discutir: será que o trabalho de nível de fronteira precisa de parâmetros de escala de fronteira? O GLM-5.2 é o argumento recente mais forte de que não precisa. Realizando 40B de computação ativa por token, ele obtém 82.7 no Terminal-Bench 2.1 — um dos melhores resultados em agentes/terminal atualmente, segundo a Artificial Analysis — e alcança um índice geral auditado de 51. É um modelo enxuto e focado que bate muito acima do seu peso de parâmetros ativos, e é de pesos abertos, então uma equipe pode baixá-lo, inspecioná-lo e executá-lo em hardware muito menos exigente do que um gigante de 2.4T demanda.

Qwen 3.8 segue o outro caminho. Ele se baseia no puro tamanho, e em testes práticos essa escala se manifestou como exaustividade, não velocidade. Em uma tarefa de compreensão de arquitetura, um revisor (Trilogy AI) executou Qwen 3.8 contra Kimi K3: o Qwen obteve 80/100 para os 83 do Kimi, mas foi notavelmente mais exaustivo — 354 citações de repositório contra 274, zero chamadas de ferramenta falhadas contra duas do Kimi — ao custo de maior latência e mais tokens no total. Um revisor separado (thomas-wiegold.com) o chamou de "muito bom e muito lento", o modelo mais lento que já usaram, embora ainda o colocasse no nível mais alto de capacidade. Essa é a aposta Qwen em miniatura: aprofundar-se mais, citar mais, errar menos — mas pagar por isso em tempo, tokens e (por enquanto) alegações não verificáveis.

Para qualquer coisa agentiva — loops de terminal, pipelines com muitas ferramentas, implantações auto-hospedadas — a combinação do GLM-5.2 de um concreto 82.7 Terminal-Bench, uma pequena pegada ativa e pesos liberados é difícil de contestar hoje. A minuciosidade do Qwen 3.8 é genuinamente valiosa para pesquisa e codificação profundas e focadas em qualidade, onde você pode absorver a latência, mas você está comprando isso na fé: sem pontuação auditada, parâmetros ativos ocultos, pesos ainda pendentes e guardrails alinhados ao CCP em tópicos sensíveis. Eficiência que você pode medir supera escala que você não pode.

Perguntas Frequentes

O Qwen 3.8 é melhor que o GLM-5.2?

Com base nas evidências existentes hoje, o GLM-5.2 é a aposta mais segura. Ele possui um Índice de Inteligência de Análise Artificial auditado de 51 e um forte Terminal-Bench 2.1 de 82,7, além de pesos abertos que você pode executar agora. O Qwen 3.8 pode igualar ou superá-lo em tarefas profundas e focadas em qualidade — os testadores iniciais avaliam sua meticulosidade como alta — mas não possui pontuação independente, oculta sua contagem de parâmetros ativos e foi o modelo mais lento em testes práticos. Potencial teórico versus comprovado e disponível: o GLM vence no presente.

Posso baixar e auto-hospedar qualquer um deles?

Os pesos do GLM-5.2 são abertos e já foram lançados (junho de 2026), e com 40B parâmetros ativos é muito mais prático para auto-hospedagem do que um modelo de 2,4T. Os pesos abertos do Qwen 3.8 são prometidos "em breve", mas ainda não foram lançados; mesmo quando lançados, um modelo de ~2,4T ocupa cerca de 1,2 TB em 4 bits e precisa de 8 ou mais GPUs H200, o que está fora do alcance da maioria das equipes. Se a auto-hospedagem é importante hoje, o GLM é a única opção real aqui.

Qual é mais barato?

O GLM-5.2 tem um preço claro e durável: $0,95 / $3,00 por 1M tokens, com uma taxa média da Artificial Analysis em torno de $0,90. A prévia do Qwen 3.8 está com grande desconto (~90% de desconto, até ~98% durante a noite), mas não tem um preço de API por token publicado e o desconto é temporário — então você pode fazer um orçamento com confiança em torno do GLM, mas ainda não em torno do Qwen.

Qual é melhor para trabalho agentivo e terminal?

GLM-5.2, com base nas evidências atuais. Seus 82.7 no Terminal-Bench 2.1 (por Artificial Analysis) é um resultado agêntico concreto e avaliado, e sua pequena pegada ativa mais os pesos liberados facilitam a implantação em loops com muitas ferramentas. O Qwen 3.8 mostra forte uso de ferramentas em testes práticos (zero chamadas de ferramenta falhadas em uma análise) mas não possui pontuação agêntica auditada comparável.

Qual devo usar hoje?

GLM-5.2 para pipelines agentivos, autohospedagem, produção sensível a custos e qualquer situação em que você precise de um modelo comprovado e baixável agora mesmo. Qwen 3.8 para pesquisa profunda e focada em qualidade ou codificação onde sua minuciosidade compensa e você pode tolerar execuções lentas — e para manter uma opção aberta para quando seus pesos e primeira pontuação independente chegarem.

Conclusão

Qwen 3.8 vs GLM-5.2é eficiência versus escala bruta, e agora a eficiência está ganhando por pontos. GLM-5.2 mostra todas as suas cartas — 40B parâmetros ativos realizando trabalho agentivo de fronteira, um índice auditado de 51, um Terminal-Bench de 82.7, preços baratos e estáveis, e pesos abertos que você pode baixar hoje. Qwen 3.8 se apoia em 2.4T de puro tamanho e uma minuciosidade que os testadores realmente admiram, mas mantém sua contagem de parâmetros ativos oculta, não tem pontuação independente, é entregue mais lentamente do que qualquer coisa que os revisores já tenham usado, e seus pesos ainda são uma promessa. GLM-5.2 é a escolha pragmática de agente de pesos abertos disponível agora; Qwen 3.8 é a aposta maior que ainda precisa de seus pesos e uma pontuação real para se justificar. Fique de olho em ambos — até que cheguem, execute os dois lado a lado com seus próprios prompts e deixe que os resultados, não as contagens de parâmetros, decidam.


© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube