
O que é o GLM-5.2? O carro-chefe de pesos abertos com contexto de 1M da Z.ai, duas versões depois
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O GLM-5.2 é um modelo de linguagem de grande porte, apenas texto e de pesos abertos, da Z.ai, o laboratório de Pequim anteriormente conhecido como Zhipu AI, lançado em 16 de junho de 2026 sob a licença MIT. É um modelo de mistura de especialistas com 753 bilhões de parâmetros e uma janela de contexto de um milhão de tokens e, por cerca de dois meses, foi o modelo de codificação de pesos abertos mais forte que qualquer pessoa podia baixar. Ele não ocupa mais essa posição, porque a Z.ai lançou desde então dois sucessores em cima dele — que é justamente a parte que a maioria das páginas sobre o GLM-5.2 deixa de fora, e a parte que decide se você ainda deve se importar.
Quarenta e três artigos no arquivo deste blog mencionam o GLM-5.2. Até agora, nenhum deles era sobre ele: o modelo aparece como o oponente em comparação após comparação, o ponto de referência fixo pelo qual modelos mais novos são medidos. Esse é um papel estranho para um modelo que o próprio criador já deixou para trás, e é a razão pela qual esta página existe — uma descrição direta do que o GLM-5.2 realmente é, quanto custa, no que é bom e quem ainda deveria escolhê-lo.
Onde o GLM-5.2 se posiciona na própria linha da Z.ai
Z.ai publica um registro de lançamentos datado, e é a fonte mais clara para isso. Leia-o em ordem e a forma da família fica óbvia:

• GLM-5 — 12 de fevereiro de 2026. O primeiro GLM-5, voltado para engenharia de sistemas complexos e tarefas de agente de longo alcance.
• GLM-5.1 — 7 de abril de 2026. Trabalho de horizonte longo, capaz de operar sozinho por até oito horas em uma única execução.
• GLM-5.2 — 16 de junho de 2026. O carro-chefe de contexto de 1M para tarefas de horizonte longo; o log da Z.ai descreve-o como "contexto de 1M sem perdas, melhorando significativamente as capacidades de tarefas de horizonte longo".
• GLM-5.3 — 18 de agosto de 2026. Mesmo modelo base do GLM-5.2, com os ganhos vindos do pós-treinamento. A Z.ai relata um ganho de 50% sobre o GLM-5.2 em seu Code Bench interno e estado da arte de código aberto no Terminal Bench 3.0.
• GLM-5.3-Flash — 26 de agosto de 2026. Um modelo diferente e menor, construído sobre uma base recém-treinada (320B no total, 18B ativos), o primeiro GLM-5 nativamente multimodal.
A linha importante é a entrada do GLM-5.3. O GLM-5.3 não é um GLM-5.2 maior — são os mesmos pesos base levados mais longe com pós-treinamento. Isso faz do GLM-5.2 o último modelo da linha cuja capacidade veio da arquitetura, e faz do GLM-5.3 o atual principal modelo de texto. Se você está escolhendo um modelo da Z.ai hoje apenas pela qualidade, o GLM-5.3 é a resposta e o GLM-5.2 não.
O GLM-5.3-Flash é um ramo separado, e não um GLM-5.3 mais barato: um modelo menor e nativamente multimodal (texto, imagem e vídeo), com preço uma ordem de magnitude abaixo dos flagships de texto. Se você precisa de visão, o GLM-5.2 não é o modelo que você quer em nenhum dos casos.
A ficha técnica
• Parâmetros — 753B no total, segundo a ficha do modelo em zai-org/GLM-5.2-FP8. A Z.ai não informa a contagem de parâmetros ativos nessa ficha; listagens de terceiros indicam cerca de 40B por token, e não conseguimos confirmar esse número em uma fonte primária.
• Janela de contexto — 1M de tokens, descrita na ficha como "um contexto sólido de 1M de tokens que sustenta de forma estável trabalho de longo horizonte".
• Saída máxima — 128K tokens.
• Modalidade — texto entra, texto sai. Sem entrada de imagem, sem áudio. Nossa própria entrada de catálogo para o modelo afirma que ele "suporta apenas entrada de texto".
• Licença — MIT, sem limites regionais. Os pesos são publicados pela organização zai-org no Hugging Face nas variantes BF16 e FP8.
• Controle de raciocínio — um modo híbrido de pensamento acionado por um parâmetro reasoning_effort com as configurações high e max, cujo padrão é max. Chamada nativa de ferramentas e saída estruturada são suportadas.
• Arquitetura — IndexShare, que reutiliza um único indexador leve a cada quatro camadas de atenção esparsa e, segundo a ficha do modelo, reduz os FLOPs por token em 2,9× no contexto completo; além de uma camada aprimorada de previsão de múltiplos tokens que aumenta o comprimento de aceitação da decodificação especulativa em até 20%.
• Hardware de treinamento — a cobertura da imprensa sobre o lançamento afirma que o modelo foi treinado em aceleradores Huawei Ascend, sem hardware Nvidia. Essa é uma alegação de reportagem jornalística, não da ficha do modelo, e estamos repassando-a como tal.

No que o GLM-5.2 é mensuravelmente bom
Quase tudo em que o GLM-5.2 se sai bem é uma métrica de programação ou de agentes, e os números abaixo são relatados pelo fornecedor — eles vêm da tabela de benchmark no próprio model card da Z.ai, não de uma reprodução independente.
• Terminal Bench 2.1 (Terminus-2) — 81,0, contra 63,5 do GLM-5.1. Esse é o maior salto geracional isolado da tabela.
• SWE-bench Pro — 62,1, contra 58,4 do GLM-5.1.
• FrontierSWE (Dominance) — 74,4, contra 30,5 do GLM-5.1 e 72,6 do GPT-5.5.
• AIME 2026 — 99,2. GPQA-Diamond — 91,2. Ambos confortavelmente competitivos com a fronteira fechada na própria tabela da Z.ai.
• MCP-Atlas (conjunto público) — 76,8, praticamente empatado com o 77,8 do Claude Opus 4.8 na mesma tabela.
• Recall de contexto longo — 78,3, que é o número que mais importa para a janela de 1M de tokens. A janela só é útil se o recall se mantiver em profundidade, e o próprio número da Z.ai indica que, em grande parte, sim.
O panorama independente é mais escasso, mas é real. A Artificial Analysis atribui ao GLM-5.2 uma pontuação de 34 no Intelligence Index, na sua versão Intelligence Index v4.3.2, colocando-o em 11.º de 114 modelos na sua classe. Há duas ressalvas associadas a esse número, e a própria Artificial Analysis declara ambas: o modelo está marcado como obsoleto na página deles, e eles «apenas continuam a avaliação comparativa de desempenho para a carga de trabalho predefinida de 10k tokens de entrada» — os resultados para outras cargas de trabalho são históricos e já não são atualizados. A nossa própria entrada no catálogo para o modelo contém um instantâneo de avaliação mais antigo, de 25 de junho de 2026, com uma pontuação de inteligência de 33.7, que não corresponde à mesma revisão do índice que o valor atual e não deve ser lido como uma alteração no modelo.
No que ele é mensuravelmente ruim
Três coisas, e vale a pena ser franco sobre elas.
• É apenas texto. Sem entrada de imagem, sem entrada de áudio. O GLM-5.3-Flash é o modelo multimodal desta família, e se a sua carga de trabalho envolve capturas de tela, PDFs ou vídeo, o GLM-5.2 é totalmente o ramo errado.
• Ele perde feio nas medições de engenharia de software mais difíceis e de horizonte mais longo. No SWE-Marathon, obtém 13,0 contra 26,0 do Claude Opus 4.8. No DeepSWE, obtém 46,2 contra 58 do Claude Opus 4.8 e 70 do GPT-5.5. No NL2Repo, obtém 48,9 contra 69,7 do Opus 4.8. Todos estes são números divulgados pelos fornecedores, da mesma tabela que mostra o GLM-5.2 vencendo em outros pontos, e é isso que os torna credíveis: a Z.ai os publicou ao lado de suas próprias vitórias.
• Ele foi superado nas medições que o tornaram famoso. O GLM-5.3 usa a mesma base e o supera no Code Bench da própria Z.ai em 50%, no Terminal Bench 3.0 e no Agents' Last Exam. O GLM-5.2 também está marcado como obsoleto na Artificial Analysis.
Um dado que não conseguimos obter: não conseguimos confirmar uma medição independente e atual de throughput ou latência para o GLM-5.2 a partir de uma fonte que conseguimos abrir, por isso esta página não declara nenhum, em vez de repetir um número que não pudemos verificar.
Preço e onde executá-lo
A tabela de preços da própria Z.ai, consultada hoje, lista o GLM-5.2 em:
• Entrada — $1,40 por milhão de tokens
• Entrada em cache — $0,26 por milhão de tokens
• Saída — $4,40 por milhão de tokens
O armazenamento de entrada em cache está listado como gratuito por tempo limitado. Note que o GLM-5.3 tem exatamente as mesmas três tarifas, portanto o modelo mais novo não é mais caro na lista da Z.ai — o que elimina o motivo habitual para permanecer no modelo mais antigo.
Sobre a disponibilidade: o modelo é servido pelo próprio endpoint compatível com OpenAI da Z.ai em api.z.ai/api/paas/v4/chat/completions, com SDKs oficiais para Python e Java, e os pesos podem ser baixados do Hugging Face para auto-hospedagem sob MIT. Além disso, está disponível por meio de várias plataformas de inferência de terceiros. Nós o roteamos: o OrcaRouter disponibiliza o GLM-5.2 em sua página de modelo à tarifa do provedor Z.ai sem markup, então os $1.40 / $4.40 acima são o que você paga por meio de nós, em vez de uma cópia com markup. A mesma chave também alcança o restante do catálogo, o que importa aqui por um motivo específico — veja abaixo.

Quem deve escolher o GLM-5.2, e quem deve escolher outra opção?
Escolha o GLM-5.2 se você estiver hospedando por conta própria e a janela de 1M de tokens for o requisito, e não as pontuações de benchmark. A licença MIT sem restrições regionais, os pesos FP8 publicados e o design de atenção IndexShare fazem dele algo genuinamente prático de executar em contexto longo, e o número de recall em profundidade é o valor que justifica a janela. Também é uma escolha razoável se você já tiver um pipeline ajustado ao seu reasoning_effort comportamento e o custo de revalidar prompts contra o GLM-5.3 exceder o ganho.
Escolha o GLM-5.3 em vez disso se você estiver comprando tokens em vez de pesos e a qualidade for o único critério. É o mesmo modelo base, com pós-treinamento melhor, a preços de tabela idênticos. Não há argumento de preço a favor do modelo mais antigo na própria tabela de preços da Z.ai.
Escolha o GLM-5.3-Flash em vez disso se você precisa de recursos visuais, ou se precisa da opção mais barata que seja capaz: ele lida com texto, imagem e vídeo e custa muito menos que ambos os principais modelos de texto.
Escolha algo totalmente diferente se o seu trabalho está no extremo difícil da engenharia de software de horizonte longo. Na própria tabela publicada da Z.ai, Claude Opus 4.8 supera o GLM-5.2 em SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench e Tool-Decathlon; GPT-5.5 supera-o em DeepSWE e ProgramBench. As vitórias do GLM-5.2 são reais, mas estão concentradas em codificação e raciocínio agênticos no estilo terminal, não nas tarefas de maratona. Se a sua avaliação se parece com uma execução de agente de duas horas contra um repositório grande e desconhecido, a vantagem de preço dos pesos abertos não fecha essa lacuna nesses números.
O resumo prático
GLM-5.2 é um modelo MoE somente texto, com 753 bilhões de parâmetros, licenciado sob MIT e contexto de 1M, lançado em 16 de junho de 2026 a US$ 1,40 / US$ 4,40 por milhão de tokens, com Terminal Bench 2.1 de 81,0 relatado pelo fornecedor, SWE-bench Pro de 62,1 e um Artificial Analysis Intelligence Index independente de 34. É o último modelo principal da GLM cuja capacidade veio da arquitetura em vez do pós-treinamento, já foi superado duas vezes pelo seu próprio criador e está marcado como obsoleto no índice independente que o avaliou.
Nada disso o torna um modelo ruim. Torna-o um modelo consolidado: a pergunta interessante sobre o GLM-5.2 em setembro de 2026 não é se ele é bom, mas se a coisa específica de que você precisa — um modelo de programação de contexto longo, auto-hospedável e com licença MIT — vale mais para você do que os três pontos que o GLM-5.3 acrescenta sobre os mesmos pesos. Para a maioria dos compradores de tokens, a resposta é não. Para quem baixa os pesos, ainda é.
Se você quiser testar isso por conta própria sem comprometer um caminho de produção para isso, a camada de roteamento é a forma barata de fazer isso: aponte a mesma requisição para GLM-5.2 e GLM-5.3 por meio de um único endpoint, compare usando seus próprios prompts e deixe o failover automático lidar com o caso em que o endpoint do modelo mais antigo é o que fica indisponível.
Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
