Cartão de destaque para o explicador do GLM-5.2, mostrando um cartão exibindo 753B de parâmetros totais, uma faixa de contexto larga exibindo contexto de 1M tokens, e um selo exibindo pesos abertos MIT, com um rodapé exibindo GLM-5.2 - lançado em 16 de junho de 2026 - Z.ai.
Guides & Insights

O que é o GLM-5.2? O carro-chefe de pesos abertos com contexto de 1M da Z.ai, duas versões depois

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O GLM-5.2 é um modelo de linguagem de grande porte, apenas texto e de pesos abertos, da Z.ai, o laboratório de Pequim anteriormente conhecido como Zhipu AI, lançado em 16 de junho de 2026 sob a licença MIT. É um modelo de mistura de especialistas com 753 bilhões de parâmetros e uma janela de contexto de um milhão de tokens e, por cerca de dois meses, foi o modelo de codificação de pesos abertos mais forte que qualquer pessoa podia baixar. Ele não ocupa mais essa posição, porque a Z.ai lançou desde então dois sucessores em cima dele — que é justamente a parte que a maioria das páginas sobre o GLM-5.2 deixa de fora, e a parte que decide se você ainda deve se importar.

Quarenta e três artigos no arquivo deste blog mencionam o GLM-5.2. Até agora, nenhum deles era sobre ele: o modelo aparece como o oponente em comparação após comparação, o ponto de referência fixo pelo qual modelos mais novos são medidos. Esse é um papel estranho para um modelo que o próprio criador já deixou para trás, e é a razão pela qual esta página existe — uma descrição direta do que o GLM-5.2 realmente é, quanto custa, no que é bom e quem ainda deveria escolhê-lo.

Onde o GLM-5.2 se posiciona na própria linha da Z.ai

Z.ai publica um registro de lançamentos datado, e é a fonte mais clara para isso. Leia-o em ordem e a forma da família fica óbvia:

Z.ai's public release-notes page, listing dated model entries in reverse chronological order: 2026-08-26 GLM-5.3-Flash, 2026-08-18 GLM-5.3, 2026-06-16 GLM-5.2 and 2026-04-07 GLM-5.1, each with its own summary bullet points.

GLM-5 — 12 de fevereiro de 2026. O primeiro GLM-5, voltado para engenharia de sistemas complexos e tarefas de agente de longo alcance.
GLM-5.1 — 7 de abril de 2026. Trabalho de horizonte longo, capaz de operar sozinho por até oito horas em uma única execução.
• GLM-5.2 — 16 de junho de 2026. O carro-chefe de contexto de 1M para tarefas de horizonte longo; o log da Z.ai descreve-o como "contexto de 1M sem perdas, melhorando significativamente as capacidades de tarefas de horizonte longo".
GLM-5.3 — 18 de agosto de 2026. Mesmo modelo base do GLM-5.2, com os ganhos vindos do pós-treinamento. A Z.ai relata um ganho de 50% sobre o GLM-5.2 em seu Code Bench interno e estado da arte de código aberto no Terminal Bench 3.0.
GLM-5.3-Flash — 26 de agosto de 2026. Um modelo diferente e menor, construído sobre uma base recém-treinada (320B no total, 18B ativos), o primeiro GLM-5 nativamente multimodal.

A linha importante é a entrada do GLM-5.3. O GLM-5.3 não é um GLM-5.2 maior — são os mesmos pesos base levados mais longe com pós-treinamento. Isso faz do GLM-5.2 o último modelo da linha cuja capacidade veio da arquitetura, e faz do GLM-5.3 o atual principal modelo de texto. Se você está escolhendo um modelo da Z.ai hoje apenas pela qualidade, o GLM-5.3 é a resposta e o GLM-5.2 não.

O GLM-5.3-Flash é um ramo separado, e não um GLM-5.3 mais barato: um modelo menor e nativamente multimodal (texto, imagem e vídeo), com preço uma ordem de magnitude abaixo dos flagships de texto. Se você precisa de visão, o GLM-5.2 não é o modelo que você quer em nenhum dos casos.

A ficha técnica

• Parâmetros — 753B no total, segundo a ficha do modelo em zai-org/GLM-5.2-FP8. A Z.ai não informa a contagem de parâmetros ativos nessa ficha; listagens de terceiros indicam cerca de 40B por token, e não conseguimos confirmar esse número em uma fonte primária.
• Janela de contexto — 1M de tokens, descrita na ficha como "um contexto sólido de 1M de tokens que sustenta de forma estável trabalho de longo horizonte".
• Saída máxima — 128K tokens.
• Modalidade — texto entra, texto sai. Sem entrada de imagem, sem áudio. Nossa própria entrada de catálogo para o modelo afirma que ele "suporta apenas entrada de texto".
• Licença — MIT, sem limites regionais. Os pesos são publicados pela organização zai-org no Hugging Face nas variantes BF16 e FP8.
• Controle de raciocínio — um modo híbrido de pensamento acionado por um parâmetro reasoning_effort com as configurações high e max, cujo padrão é max. Chamada nativa de ferramentas e saída estruturada são suportadas.
• Arquitetura — IndexShare, que reutiliza um único indexador leve a cada quatro camadas de atenção esparsa e, segundo a ficha do modelo, reduz os FLOPs por token em 2,9× no contexto completo; além de uma camada aprimorada de previsão de múltiplos tokens que aumenta o comprimento de aceitação da decodificação especulativa em até 20%.
• Hardware de treinamento — a cobertura da imprensa sobre o lançamento afirma que o modelo foi treinado em aceleradores Huawei Ascend, sem hardware Nvidia. Essa é uma alegação de reportagem jornalística, não da ficha do modelo, e estamos repassando-a como tal.

A scoreboard card for GLM-5.2 with six rows: released 16 June 2026, 753B total parameters MoE, 1M-token context with 128K output, MIT licence text only, price $1.40 and $4.40 per million tokens, and an Artificial Analysis Intelligence Index of 34, 11th of 114. The footer reads that vendor benchmarks are from Z.ai and the index is per Artificial Analysis v4.3.2.

No que o GLM-5.2 é mensuravelmente bom

Quase tudo em que o GLM-5.2 se sai bem é uma métrica de programação ou de agentes, e os números abaixo são relatados pelo fornecedor — eles vêm da tabela de benchmark no próprio model card da Z.ai, não de uma reprodução independente.

• Terminal Bench 2.1 (Terminus-2) — 81,0, contra 63,5 do GLM-5.1. Esse é o maior salto geracional isolado da tabela.
• SWE-bench Pro — 62,1, contra 58,4 do GLM-5.1.
• FrontierSWE (Dominance) — 74,4, contra 30,5 do GLM-5.1 e 72,6 do GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Ambos confortavelmente competitivos com a fronteira fechada na própria tabela da Z.ai.
• MCP-Atlas (conjunto público) — 76,8, praticamente empatado com o 77,8 do Claude Opus 4.8 na mesma tabela.
• Recall de contexto longo — 78,3, que é o número que mais importa para a janela de 1M de tokens. A janela só é útil se o recall se mantiver em profundidade, e o próprio número da Z.ai indica que, em grande parte, sim.

O panorama independente é mais escasso, mas é real. A Artificial Analysis atribui ao GLM-5.2 uma pontuação de 34 no Intelligence Index, na sua versão Intelligence Index v4.3.2, colocando-o em 11.º de 114 modelos na sua classe. Há duas ressalvas associadas a esse número, e a própria Artificial Analysis declara ambas: o modelo está marcado como obsoleto na página deles, e eles «apenas continuam a avaliação comparativa de desempenho para a carga de trabalho predefinida de 10k tokens de entrada» — os resultados para outras cargas de trabalho são históricos e já não são atualizados. A nossa própria entrada no catálogo para o modelo contém um instantâneo de avaliação mais antigo, de 25 de junho de 2026, com uma pontuação de inteligência de 33.7, que não corresponde à mesma revisão do índice que o valor atual e não deve ser lido como uma alteração no modelo.

No que ele é mensuravelmente ruim

Três coisas, e vale a pena ser franco sobre elas.

• É apenas texto. Sem entrada de imagem, sem entrada de áudio. O GLM-5.3-Flash é o modelo multimodal desta família, e se a sua carga de trabalho envolve capturas de tela, PDFs ou vídeo, o GLM-5.2 é totalmente o ramo errado.
• Ele perde feio nas medições de engenharia de software mais difíceis e de horizonte mais longo. No SWE-Marathon, obtém 13,0 contra 26,0 do Claude Opus 4.8. No DeepSWE, obtém 46,2 contra 58 do Claude Opus 4.8 e 70 do GPT-5.5. No NL2Repo, obtém 48,9 contra 69,7 do Opus 4.8. Todos estes são números divulgados pelos fornecedores, da mesma tabela que mostra o GLM-5.2 vencendo em outros pontos, e é isso que os torna credíveis: a Z.ai os publicou ao lado de suas próprias vitórias.
• Ele foi superado nas medições que o tornaram famoso. O GLM-5.3 usa a mesma base e o supera no Code Bench da própria Z.ai em 50%, no Terminal Bench 3.0 e no Agents' Last Exam. O GLM-5.2 também está marcado como obsoleto na Artificial Analysis.

Um dado que não conseguimos obter: não conseguimos confirmar uma medição independente e atual de throughput ou latência para o GLM-5.2 a partir de uma fonte que conseguimos abrir, por isso esta página não declara nenhum, em vez de repetir um número que não pudemos verificar.

Preço e onde executá-lo

A tabela de preços da própria Z.ai, consultada hoje, lista o GLM-5.2 em:

• Entrada — $1,40 por milhão de tokens
• Entrada em cache — $0,26 por milhão de tokens
• Saída — $4,40 por milhão de tokens

O armazenamento de entrada em cache está listado como gratuito por tempo limitado. Note que o GLM-5.3 tem exatamente as mesmas três tarifas, portanto o modelo mais novo não é mais caro na lista da Z.ai — o que elimina o motivo habitual para permanecer no modelo mais antigo.

Sobre a disponibilidade: o modelo é servido pelo próprio endpoint compatível com OpenAI da Z.ai em api.z.ai/api/paas/v4/chat/completions, com SDKs oficiais para Python e Java, e os pesos podem ser baixados do Hugging Face para auto-hospedagem sob MIT. Além disso, está disponível por meio de várias plataformas de inferência de terceiros. Nós o roteamos: o OrcaRouter disponibiliza o GLM-5.2 em sua página de modelo à tarifa do provedor Z.ai sem markup, então os $1.40 / $4.40 acima são o que você paga por meio de nós, em vez de uma cópia com markup. A mesma chave também alcança o restante do catálogo, o que importa aqui por um motivo específico — veja abaixo.

The OrcaRouter model page for z-ai/glm-5.2, showing a Featured badge, a 1M-token context, 128K maximum output, text-only input and output, and rate cards reading $1.40 per million input tokens and $4.40 per million output tokens, alongside measured latency and a seven-day traffic figure.

Quem deve escolher o GLM-5.2, e quem deve escolher outra opção?

Escolha o GLM-5.2 se você estiver hospedando por conta própria e a janela de 1M de tokens for o requisito, e não as pontuações de benchmark. A licença MIT sem restrições regionais, os pesos FP8 publicados e o design de atenção IndexShare fazem dele algo genuinamente prático de executar em contexto longo, e o número de recall em profundidade é o valor que justifica a janela. Também é uma escolha razoável se você já tiver um pipeline ajustado ao seu reasoning_effort comportamento e o custo de revalidar prompts contra o GLM-5.3 exceder o ganho.

Escolha o GLM-5.3 em vez disso se você estiver comprando tokens em vez de pesos e a qualidade for o único critério. É o mesmo modelo base, com pós-treinamento melhor, a preços de tabela idênticos. Não há argumento de preço a favor do modelo mais antigo na própria tabela de preços da Z.ai.

Escolha o GLM-5.3-Flash em vez disso se você precisa de recursos visuais, ou se precisa da opção mais barata que seja capaz: ele lida com texto, imagem e vídeo e custa muito menos que ambos os principais modelos de texto.

Escolha algo totalmente diferente se o seu trabalho está no extremo difícil da engenharia de software de horizonte longo. Na própria tabela publicada da Z.ai, Claude Opus 4.8 supera o GLM-5.2 em SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench e Tool-Decathlon; GPT-5.5 supera-o em DeepSWE e ProgramBench. As vitórias do GLM-5.2 são reais, mas estão concentradas em codificação e raciocínio agênticos no estilo terminal, não nas tarefas de maratona. Se a sua avaliação se parece com uma execução de agente de duas horas contra um repositório grande e desconhecido, a vantagem de preço dos pesos abertos não fecha essa lacuna nesses números.

O resumo prático

GLM-5.2 é um modelo MoE somente texto, com 753 bilhões de parâmetros, licenciado sob MIT e contexto de 1M, lançado em 16 de junho de 2026 a US$ 1,40 / US$ 4,40 por milhão de tokens, com Terminal Bench 2.1 de 81,0 relatado pelo fornecedor, SWE-bench Pro de 62,1 e um Artificial Analysis Intelligence Index independente de 34. É o último modelo principal da GLM cuja capacidade veio da arquitetura em vez do pós-treinamento, já foi superado duas vezes pelo seu próprio criador e está marcado como obsoleto no índice independente que o avaliou.

Nada disso o torna um modelo ruim. Torna-o um modelo consolidado: a pergunta interessante sobre o GLM-5.2 em setembro de 2026 não é se ele é bom, mas se a coisa específica de que você precisa — um modelo de programação de contexto longo, auto-hospedável e com licença MIT — vale mais para você do que os três pontos que o GLM-5.3 acrescenta sobre os mesmos pesos. Para a maioria dos compradores de tokens, a resposta é não. Para quem baixa os pesos, ainda é.

Se você quiser testar isso por conta própria sem comprometer um caminho de produção para isso, a camada de roteamento é a forma barata de fazer isso: aponte a mesma requisição para GLM-5.2 e GLM-5.3 por meio de um único endpoint, compare usando seus próprios prompts e deixe o failover automático lidar com o caso em que o endpoint do modelo mais antigo é o que fica indisponível.

Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente