
GLM-5.3 vs GLM-5.2: Mesmo cérebro, benchmarks dobrados
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
{{1}}O próprio enquadramento da Zhipu AI para a atualização do GLM-5.2 para o GLM-5.3 é o mais honesto{{/1}}: {{2}}o livro didático não mudou, apenas o treinamento do aluno mudou{{/2}}. {{3}}O GLM-5.3, lançado em 14 de agosto de 2026, é construído sobre exatamente a mesma base MoE de 743 bilhões de parâmetros do GLM-5.2{{/3}}, {{4}}que coroou o campo dos pesos abertos no Artificial Analysis Intelligence Index em junho{{/4}}. {{5}}A arquitetura não mudou, a pegada não mudou, o preço de US$ 1,40 / US$ 4,40 por milhão não mudou{{/5}} — {{6}}e, no entanto, a Z.ai relata que o modelo retreinado dobra ou supera seu predecessor em vários dos benchmarks de codificação e segurança que ambas as versões publicam{{/6}}. {{7}}Se isso torna o GLM-5.3 uma atualização obrigatória ou um esperar para ver depende de quanto você confia em um modelo que melhorou tanto sem mudar sua própria arquitetura{{/7}}, {{8}}e se sua capacidade cibernética recém-surgida é um recurso que você quer manter atrás de uma janela de segurança de duas semanas{{/8}}.
O mesmo cérebro, retreinado
Tudo o que tornou o GLM-5.2 um servidor prático continua valendo: o MoE de 743B com cerca de 40B de parâmetros ativos, a atenção esparsa IndexShare que reduziu os FLOPs em contexto de 1M, a licença MIT, a janela de contexto de 1M e o throughput enxuto de tokens que mediu ~145–168 tokens/s em observação independente. O GLM-5.3 difere em apenas uma dimensão — o pós-treinamento. A Z.ai escalou o estágio de aprendizado por reforço com os frameworks IndexShare, SAO e Slime, adicionou dezenas de vezes mais ambientes de tarefas de horizonte longo e os estendeu da depuração de código para a descoberta de vulnerabilidades de segurança e engenharia de sistemas. O resultado é um modelo que se comporta de forma diferente no mesmo hardware, e é exatamente por isso que a pergunta sobre atualização não é "preciso de novas GPUs", mas "preciso de um novo comportamento".
O delta do benchmark, em ambas as direções.
Lido como um antes e depois dos números publicados pela Z.ai, o salto é o maior da história dos pesos abertos. Terminal-Bench 3.0 — a versão mais difícil, em que ambos foram avaliados — vai de 4,6 para 28,3, um salto de seis vezes. O DeepSWE v1.1 vai de 46,2 para 66,9, o que é a diferença entre "bom modelo aberto" e "competitivo com os líderes de código fechado". O subconjunto CLI do Agents' Last Exam vai de 23,8 para 28,5. A descoberta de vulnerabilidades no CyberGym sobe de 77,2 para 84,5. O ExploitBench mais que dobra, de 24,4 para 54,4, e o throughput do ExploitGym vai de 29 e 39 tarefas concluídas (em duas e seis horas, respectivamente) para 105 e 130. A Z.ai resume como uma melhoria de codificação de cerca de 50%, e o perfil dos ganhos — concentrado em codificação de longo horizonte, automação de terminal e segurança — é consistente com um modelo que recebeu apenas pós-treinamento: o conhecimento bruto é o mesmo, mas a capacidade de realmente fazer trabalho multi-etapas foi o que ficou mais forte.
• Terminal-Bench 3.0 — GLM-5.2 4.6 vs GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9
• Último Exame dos Agentes (CLI) — GLM-5.2 23.8 vs GLM-5.3 28.5
• CyberGym descoberta de vulnerabilidades — GLM-5.2 77.2 vs GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 vs GLM-5.3 54.4


A capacidade que ninguém agendou
Os ganhos de segurança merecem um parágrafo próprio porque a Z.ai afirma que eles não faziam parte do plano. A equipe de pós-treinamento adicionou ambientes de descoberta de vulnerabilidades esperando uma melhoria modesta; o modelo, em vez disso, começou a encadear explorações completas — um comportamento emergente que forçou a Z.ai a reter os pesos por cerca de duas semanas para endurecimento de segurança. Em testes no mundo real com equipes de segurança, o GLM-5.3 contribuiu para a descoberta de 2.436 vulnerabilidades em 269 projetos, 1.097 delas de risco médio ou alto, incluindo falhas que permaneceram indetectadas por décadas em softwares amplamente implantados. O GLM-5.2 tinha capacidade de segurança no sentido comum — conseguia ler código em busca de bugs. O GLM-5.3 a tem em um sentido diferente: é aquilo a que a janela de segurança diz respeito. Isso é uma mudança de natureza, não de grau, e é a razão mais forte para tratar os dois modelos como produtos diferentes, apesar da base compartilhada.

A ressalva de consistência
O contrapeso para cada número acima é que os primeiros testes de terceiros descrevem o GLM-5.3 como inconsistente de uma forma que o GLM-5.2 não era. Revisores independentes relatam o mesmo modelo com desempenho de um engenheiro terceirizado que passa raspando em algumas tarefas e entregando resultados de nível profissional em outras, com a diferença acompanhando o quão claramente os requisitos foram especificados. Esse é exatamente o perfil de falha que você preveria de um modelo cujos ganhos vieram inteiramente de pós-treinamento com forte ênfase em ambiente: ele generaliza a partir dos formatos de tarefa nos quais foi treinado, e prompts mal especificados ficam fora deles. Nenhum dos resultados independentes é tão limpo quanto as tabelas publicadas pela Z.ai, e nenhum dos números da Z.ai foi ainda reproduzido de forma independente. Para produção, isso argumenta a favor de uma avaliação explícita na sua própria carga de trabalho antes da migração — a mesma ressalva que o GLM-5.2 justificava, agora com uma dispersão maior entre o melhor e o pior caso.
Preço, acesso e a questão da espera
Os preços são idênticos, o que elimina o atrito comum de upgrade: ambos os modelos custam US$ 1,40 / US$ 4,40 por milhão de tokens, sendo que o GLM-5.3 exige o modo de raciocínio habilitado. A diferença real é o acesso. O GLM-5.2 está disponível para download hoje sob a licença MIT, pode ser auto-hospedado em um footprint FP8 sub-terabyte e chamado via OrcaRouter pelo preço de tabela, sem markup — o modelo para o qual você pode rotear agora mesmo, estável e com avaliação independente. O GLM-5.3 pode ser usado agora por meio do ZCode / AutoClaw da Z.ai e do GLM Coding Plan, mas tanto a API pública quanto os pesos estão com acesso restrito durante a janela de segurança, e todos os seus números de benchmark são informados pelo fornecedor, aguardando reexecução por terceiros. Então, a resposta honesta para "devo esperar" tem duas partes: para tráfego de produção que não pode regredir, o GLM-5.2 continua sendo a aposta segura em pesos abertos hoje, e no momento em que a API do GLM-5.3 abrir e as execuções independentes forem validadas, a mudança é uma troca de rota, não uma reescrita — você mantém a mesma configuração de uma chave e troca a faixa. Para trabalho exploratório e de avaliação de segurança, vale a pena experimentar o GLM-5.3 agora por meio das ferramentas da Z.ai, com a ressalva de que sua vantagem divulgada ainda não foi verificada e seu comportamento é mais variável do que o do modelo que ele substitui.
O veredicto honesto
O GLM-5.3 é o melhor modelo nos próprios números da Z.ai — dramaticamente melhor em codificação de longo horizonte e categoricamente diferente em segurança — e não custa nada ao seu fluxo de trabalho porque a base, a pegada e o preço permanecem inalterados. Mas "melhor nas avaliações do fornecedor" e "melhor no seu pipeline" estão separados pelas duas coisas que o GLM-5.2 já tem e o GLM-5.3 ainda não: reprodução independente e pesos de distribuição. Se você já executa o GLM-5.2, o caminho de atualização é o mais barato da história dos pesos abertos — mesmo hardware, mesmo preço, mesma superfície de API e uma espera de duas semanas pelos pesos. A decisão é menos sobre se o GLM-5.3 é melhor que o GLM-5.2 e mais sobre se você está disposto a apostar a produção em um modelo cujas melhorias, e cuja capacidade de segurança recém-surgida, ainda não foram confirmadas por ninguém fora da Z.ai.
