
Nex-N2.5 Pro vs GLM-5.2: Os mesmos 82,7 no Terminal-Bench, duas procedências muito diferentes
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligência49Código
Dois modelos agênticos de pesos abertos, uma coincidência suspeita: Nex-N2.5 Pro e GLM-5.2 aparecem ambos com 82,7 no Terminal-Bench 2.1. A Nex-AGI imprime 82,7 para o Nex-N2.5 Pro em sua própria ficha do modelo, medido no harness NexCUA da própria aliança, que o público não viu. O melhor número divulgado pela Z.ai para o GLM-5.2 na mesma suíte também é 82,7 — e quando um harness independente executou o modelo novamente, ele ficou em 77,9, cerca de cinco pontos abaixo do número do próprio fornecedor. Um empate perfeito entre um número que ninguém pode verificar e um número que já encolheu depois de verificado não é empate algum. É a demonstração mais clara possível de por que a diferença entre "pesos abertos" e "pesos que existirão eventualmente" decide essa disputa antes que uma única linha de benchmark seja lida.
Ambos os modelos situam-se no mesmo bairro comercial e não poderiam ser mais diferentes em essência. O Nex-N2.5 Pro, anunciado em 8 de setembro de 2026, é um modelo multimodal de uso de computador — 397 bilhões de parâmetros totais, com cerca de 17 bilhões ativos, construído a partir da linhagem Qwen3.5, arquitetado para ler uma tela e conduzir uma sessão de navegador ou desktop com um ciclo de feedback visual. O GLM-5.2 é o carro-chefe da Z.ai (Zhipu AI) com licença MIT para raciocínio de longo horizonte e codificação — aproximadamente 743 bilhões de parâmetros totais, com cerca de 40 bilhões ativos, somente texto, disponível desde 16 de junho de 2026, e o modelo que tem ancorado as pontuações independentes da camada de pesos abertos por meses. Um enxerga o mundo por meio de pixels e age sobre ele. O outro pensa em texto e entrega código. A licença de ambos permite construir um negócio sobre eles; a diferença é que, em um deles, essa licença é atualmente uma promessa.
O mesmo número, duas proveniências diferentes
Comecemos pelo empate, porque ele já ensina tudo sobre o confronto. A ficha da Nex-AGI lista Terminal-Bench 2.1 com 82,7 para o Nex-N2.5 Pro, além de OSWorld-2 com 56,4, SWE-Bench Pro com 61,2 e BrowseComp com 89,7 — todos esses números foram obtidos por meio do harness NexCUA, e nenhum foi reproduzido de forma independente nos primeiros dias de vida do modelo, pela simples razão de que os pesos não estão disponíveis para download. O número de 82,7 da Z.ai para o GLM-5.2 no Terminal-Bench 2.1 é o melhor resultado divulgado pela própria fornecedora, mas se refere a um modelo que qualquer pessoa pode baixar do Hugging Face e executar novamente ainda hoje à tarde; a medição independente com harness de 77,9 já existe e fica cerca de cinco pontos abaixo da alegação da Z.ai. Quando o número de uma fornecedora encolhe sob testes independentes, isso não é um escândalo — é o tributo normal da automedição. Quando o número de uma fornecedora concorrente não pode sequer ser testado, a ausência do tributo é o problema, não um sinal de que o número seja puro.

Leia as linhas ao redor da mesma forma. O GLM-5.2 detém a leitura de índice independente mais alta que o nível aberto já produziu — os 50 baixos no Índice de Inteligência atual da Artificial Analysis — e é por isso que tem sido o modelo aberto de referência há meses, apesar de não ser o lançamento mais chamativo. O Nex-N2.5 Pro não tem nenhuma entrada de índice independente. Nas linhas em que ambas as empresas divulgam números, o verificável é o da já estabelecida; nas linhas em que apenas a Nex-AGI publicou, os números não foram reproduzidos. Isso não é um veredito sobre qual modelo é mais inteligente. É um veredito sobre qual modelo você tem permissão de verificar.
As fichas técnicas concordam mais do que você esperaria.
Tirando os benchmarks, os dois modelos se alinham de perto nos fundamentos:
• Lançado — Nex-N2.5 Pro: 8 de setembro de 2026 (endpoints hospedados no ar, pesos pendentes). GLM-5.2: GA em 16 de junho de 2026, pesos disponíveis.
• Licença — Nex-N2.5 Pro: Apache-2.0, pesos disponíveis em breve. GLM-5.2: MIT, já disponível para download.
• Escala — Nex-N2.5 Pro: 397B no total / ~17B ativos. GLM-5.2: ~743B no total / ~40B ativos.
• Modalidade — Nex-N2.5 Pro: entrada de texto e imagem, saída de texto, ciclo de visão para uso em computador. GLM-5.2: modelo de raciocínio somente com texto.
• Contexto / saída — Nex-N2.5 Pro: contexto de 262.144 tokens. GLM-5.2: contexto de 1M de tokens, limite de saída de 128K.
• Controle de raciocínio — Nex-N2.5 Pro: nenhum / médio (adaptativo, padrão) / alto. GLM-5.2: controles de esforço de raciocínio na mesma string do modelo.
• Preço por 1M de tokens — Nex-N2.5 Pro: camada hospedada gratuita, sem preço de tabela. GLM-5.2: $1,40 de entrada / $4,40 de saída, $0,26 de entrada em cache.
Os envelopes diferem nas formas como os trabalhos dos dois modelos diferem: o GLM-5.2 traz um contexto de texto de um milhão completo de tokens e um teto de saída de 128K para longas sessões de engenharia, enquanto o Nex-N2.5 Pro troca o tamanho do contexto por um canal de visão e uma janela menor de 262K voltada para cargas de trabalho em escala de tela. Nenhuma especificação está errada; eles são especificados para tarefas diferentes.
Pesos abertos, dois significados diferentes

É aqui que a comparação deixa de ser sobre números por completo. O GLM-5.2 é aberto da forma como se lança um produto para se construir um negócio em cima: licença MIT, pesos no Hugging Face, sem restrição de uso comercial, sem cláusula de compartilhamento de dados, sem fornecedor olhando por cima do seu ombro. Você pode baixá-lo, fazer fine-tuning, servi-lo dentro do seu próprio perímetro de conformidade ou levá-lo para qualquer hospedagem que quiser — e, como os pesos estão disponíveis, o preço dele tem um piso que nenhum fornecedor consegue elevar. Já o Nex-N2.5 Pro vem prometido sob a Apache-2.0, uma licença igualmente permissiva, mas o banner na ficha dele no Hugging Face diz que os pesos chegam em breve, e nenhuma data está associada. Para uma equipe sujeita a regras de governança de dados, ou que queira escapar totalmente da precificação por token em escala, essa diferença é a própria decisão: o GLM-5.2 é um modelo que você pode possuir hoje, e o Nex-N2.5 Pro é um modelo que lhe foi prometido. A matemática da auto-hospedagem também favorece o recém-chegado quando os pesos finalmente chegarem — 17B de parâmetros ativos em um nó com oito H100 é uma configuração muito mais acessível do que a máquina de ~40B ativos do GLM-5.2 — mas “quando os pesos chegarem” está carregando muito peso nessa frase.
As famílias estão se movendo em direções opostas
Ambos os modelos fazem parte de famílias em rápida evolução, e as trajetórias apontam em direções diferentes. A linhagem do GLM-5.2 é transparente e iterativa: a Z.ai lançou o GLM-5.3 em agosto como uma atualização pós-treinamento da mesma base 5.2 e o GLM-5.3 Flash no início de setembro; portanto, os pesos 5.2 sobre os quais você desenvolve hoje são a fundação que a família continua aprimorando — seu conhecimento de arquitetura e seus fine-tunes são levados adiante. A família da Nex-AGI é uma aposta em uma geração totalmente nova: Nex-N2.5 Mini com 35B, Nex-N2.5 Pro com 397B e um Nex-N2.5 Max somente de texto com 1.6T, cuja própria base é a DeepSeek-V4-Pro-Base — com os pesos do Pro, que permitiriam a qualquer pessoa validar as alegações da família, ainda não publicados. Uma equipe que escolhe uma plataforma para desenvolver está escolhendo entre uma linhagem com um roadmap publicado de atualizações e um primeiro lançamento cujo segundo ato ainda não chegou.
Qual deles merece um lugar no seu build?
Se o seu requisito é "o modelo precisa ser nosso" — para governança de dados, para auditoria, para um produto sobre o qual você não quer que um único fornecedor tenha controle — então o GLM-5.2 não é a melhor escolha neste confronto; é a única escolha, porque é o único modelo nesse confronto que você pode baixar. Ele também é o único com uma pontuação independente, e seu preço na tabela da Z.ai é US$ 1,40 por milhão de entradas e US$ 4,40 por milhão de saídas. Se o seu requisito é um agente multimodal de uso de computador que possa vir a subcotar os líderes fechados, o Nex-N2.5 Pro é a tese de longo prazo mais interessante — um operador de visão com 17B ativos, de uma aliança que claramente sabe o que quer construir —, mas uma tese não é uma dependência, e um endpoint hospedado gratuito não é uma base.

A forma prática de agir sobre tudo isso é construir sobre o que já existe e medir a promessa quando ela se concretizar. O GLM-5.2 está no OrcaRouter pelo preço de tabela da Z.ai — os mesmos US$ 1,40 / US$ 4,40, repassados sem margem — e, por ter pesos abertos, também pode ser auto-hospedado se você quiser incluir sua própria stack de inferência na medição. Ele é o ponto de referência para rodar sua carga de trabalho agêntica real hoje, com o DSL de roteamento fazendo as vezes até o dia em que o Nex-N2.5 Pro aparecer em um provedor ao preço de tabela: quando isso acontecer, trocar a comparação é uma regra de roteamento, não uma migração. Até que os shards caiam e um harness de avaliação independente confirme — ou corrija — esse 82,7, o confronto Nex-N2.5 Pro vs GLM-5.2 é uma disputa entre um modelo que você pode verificar e um número que você não pode.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
