Cartão de título hero para a comparação entre GLM-5.3 e GLM-5.2, com o subtítulo 'Mesmo cérebro, benchmarks dobrados', com dois cartões de modelo que compartilham um único bloco base MoE conectado de 743B e uma seta curva de upgrade rotulada 'apenas pós-treinamento' apontando de GLM-5.2 para GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Mesmo cérebro, benchmarks dobrados

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

{{1}}O próprio enquadramento da Zhipu AI para a atualização do GLM-5.2 para o G​LM-5.3 é o mais honesto{{/1}}: {{2}}o livro didático não mudou, apenas o treinamento do aluno mudou{{/2}}. {{3}}O G​LM-5.3, lançado em 14 de agosto de 2026, é construído sobre exatamente a mesma base MoE de 743 bilhões de parâmetros do GLM-5.2{{/3}}, {{4}}que coroou o campo dos pesos abertos no Artificial Analysis Intelligence Index em junho{{/4}}. {{5}}A arquitetura não mudou, a pegada não mudou, o preço de US$ 1,40 / US$ 4,40 por milhão não mudou{{/5}} — {{6}}e, no entanto, a Z.ai relata que o modelo retreinado dobra ou supera seu predecessor em vários dos benchmarks de codificação e segurança que ambas as versões publicam{{/6}}. {{7}}Se isso torna o G​LM-5.3 uma atualização obrigatória ou um esperar para ver depende de quanto você confia em um modelo que melhorou tanto sem mudar sua própria arquitetura{{/7}}, {{8}}e se sua capacidade cibernética recém-surgida é um recurso que você quer manter atrás de uma janela de segurança de duas semanas{{/8}}.

O mesmo cérebro, retreinado

Tudo o que tornou o GLM-5.2 um servidor prático continua valendo: o MoE de 743B com cerca de 40B de parâmetros ativos, a atenção esparsa IndexShare que reduziu os FLOPs em contexto de 1M, a licença MIT, a janela de contexto de 1M e o throughput enxuto de tokens que mediu ~145–168 tokens/s em observação independente. O G​LM-5.3 difere em apenas uma dimensão — o pós-treinamento. A Z.ai escalou o estágio de aprendizado por reforço com os frameworks IndexShare, SAO e Slime, adicionou dezenas de vezes mais ambientes de tarefas de horizonte longo e os estendeu da depuração de código para a descoberta de vulnerabilidades de segurança e engenharia de sistemas. O resultado é um modelo que se comporta de forma diferente no mesmo hardware, e é exatamente por isso que a pergunta sobre atualização não é "preciso de novas GPUs", mas "preciso de um novo comportamento".

O delta do benchmark, em ambas as direções.

Lido como um antes e depois dos números publicados pela Z.ai, o salto é o maior da história dos pesos abertos. Terminal-Bench 3.0 — a versão mais difícil, em que ambos foram avaliados — vai de 4,6 para 28,3, um salto de seis vezes. O DeepSWE v1.1 vai de 46,2 para 66,9, o que é a diferença entre "bom modelo aberto" e "competitivo com os líderes de código fechado". O subconjunto CLI do Agents' Last Exam vai de 23,8 para 28,5. A descoberta de vulnerabilidades no CyberGym sobe de 77,2 para 84,5. O ExploitBench mais que dobra, de 24,4 para 54,4, e o throughput do ExploitGym vai de 29 e 39 tarefas concluídas (em duas e seis horas, respectivamente) para 105 e 130. A Z.ai resume como uma melhoria de codificação de cerca de 50%, e o perfil dos ganhos — concentrado em codificação de longo horizonte, automação de terminal e segurança — é consistente com um modelo que recebeu apenas pós-treinamento: o conhecimento bruto é o mesmo, mas a capacidade de realmente fazer trabalho multi-etapas foi o que ficou mais forte.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs G​LM-5.3 66.9

• Último Exame dos Agentes (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5

• CyberGym descoberta de vulnerabilidades — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

A capacidade que ninguém agendou

Os ganhos de segurança merecem um parágrafo próprio porque a Z.ai afirma que eles não faziam parte do plano. A equipe de pós-treinamento adicionou ambientes de descoberta de vulnerabilidades esperando uma melhoria modesta; o modelo, em vez disso, começou a encadear explorações completas — um comportamento emergente que forçou a Z.ai a reter os pesos por cerca de duas semanas para endurecimento de segurança. Em testes no mundo real com equipes de segurança, o G​LM-5.3 contribuiu para a descoberta de 2.436 vulnerabilidades em 269 projetos, 1.097 delas de risco médio ou alto, incluindo falhas que permaneceram indetectadas por décadas em softwares amplamente implantados. O GLM-5.2 tinha capacidade de segurança no sentido comum — conseguia ler código em busca de bugs. O G​LM-5.3 a tem em um sentido diferente: é aquilo a que a janela de segurança diz respeito. Isso é uma mudança de natureza, não de grau, e é a razão mais forte para tratar os dois modelos como produtos diferentes, apesar da base compartilhada.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

A ressalva de consistência

O contrapeso para cada número acima é que os primeiros testes de terceiros descrevem o G​LM-5.3 como inconsistente de uma forma que o G​LM-5.2 não era. Revisores independentes relatam o mesmo modelo com desempenho de um engenheiro terceirizado que passa raspando em algumas tarefas e entregando resultados de nível profissional em outras, com a diferença acompanhando o quão claramente os requisitos foram especificados. Esse é exatamente o perfil de falha que você preveria de um modelo cujos ganhos vieram inteiramente de pós-treinamento com forte ênfase em ambiente: ele generaliza a partir dos formatos de tarefa nos quais foi treinado, e prompts mal especificados ficam fora deles. Nenhum dos resultados independentes é tão limpo quanto as tabelas publicadas pela Z.ai, e nenhum dos números da Z.ai foi ainda reproduzido de forma independente. Para produção, isso argumenta a favor de uma avaliação explícita na sua própria carga de trabalho antes da migração — a mesma ressalva que o G​LM-5.2 justificava, agora com uma dispersão maior entre o melhor e o pior caso.

Preço, acesso e a questão da espera

Os preços são idênticos, o que elimina o atrito comum de upgrade: ambos os modelos custam US$ 1,40 / US$ 4,40 por milhão de tokens, sendo que o G​LM-5.3 exige o modo de raciocínio habilitado. A diferença real é o acesso. O GLM-5.2 está disponível para download hoje sob a licença MIT, pode ser auto-hospedado em um footprint FP8 sub-terabyte e chamado via OrcaRouter pelo preço de tabela, sem markup — o modelo para o qual você pode rotear agora mesmo, estável e com avaliação independente. O G​LM-5.3 pode ser usado agora por meio do ZCode / AutoClaw da Z.ai e do G​LM Coding Plan, mas tanto a API pública quanto os pesos estão com acesso restrito durante a janela de segurança, e todos os seus números de benchmark são informados pelo fornecedor, aguardando reexecução por terceiros. Então, a resposta honesta para "devo esperar" tem duas partes: para tráfego de produção que não pode regredir, o GLM-5.2 continua sendo a aposta segura em pesos abertos hoje, e no momento em que a API do G​LM-5.3 abrir e as execuções independentes forem validadas, a mudança é uma troca de rota, não uma reescrita — você mantém a mesma configuração de uma chave e troca a faixa. Para trabalho exploratório e de avaliação de segurança, vale a pena experimentar o G​LM-5.3 agora por meio das ferramentas da Z.ai, com a ressalva de que sua vantagem divulgada ainda não foi verificada e seu comportamento é mais variável do que o do modelo que ele substitui.

O veredicto honesto

O G​LM-5.3 é o melhor modelo nos próprios números da Z.ai — dramaticamente melhor em codificação de longo horizonte e categoricamente diferente em segurança — e não custa nada ao seu fluxo de trabalho porque a base, a pegada e o preço permanecem inalterados. Mas "melhor nas avaliações do fornecedor" e "melhor no seu pipeline" estão separados pelas duas coisas que o GLM-5.2 já tem e o G​LM-5.3 ainda não: reprodução independente e pesos de distribuição. Se você já executa o GLM-5.2, o caminho de atualização é o mais barato da história dos pesos abertos — mesmo hardware, mesmo preço, mesma superfície de API e uma espera de duas semanas pelos pesos. A decisão é menos sobre se o G​LM-5.3 é melhor que o GLM-5.2 e mais sobre se você está disposto a apostar a produção em um modelo cujas melhorias, e cuja capacidade de segurança recém-surgida, ainda não foram confirmadas por ninguém fora da Z.ai.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube