
Nex-N2.5 Pro frente a GLM-5.2: El mismo 82.7 en Terminal-Bench, dos procedencias muy diferentes
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencia49Código
Dos modelos agentivos de pesos abiertos, una coincidencia sospechosa: Nex-N2.5 Pro y GLM-5.2 aparecen ambos con 82.7 en Terminal-Bench 2.1. Nex-AGI registra 82.7 para Nex-N2.5 Pro en su propia ficha del modelo, medido con el entorno de pruebas NexCUA de la alianza, que el público no ha visto. La mejor cifra reportada por Z.ai para GLM-5.2 en la misma suite también es 82.7 — y cuando un entorno de pruebas independiente volvió a ejecutar el modelo, este se situó en 77.9, unos cinco puntos por debajo de la cifra del proveedor. Un empate perfecto entre una cifra que nadie puede comprobar y una cifra que ya se redujo una vez comprobada no es un empate en absoluto. Es la demostración más clara posible de por qué la diferencia entre "pesos abiertos" y "pesos que existirán eventualmente" decide este enfrentamiento antes de que se lea una sola fila de resultados del benchmark.
Ambos modelos se encuentran en el mismo barrio comercial y no podrían ser más distintos en cuanto a su naturaleza. Nex-N2.5 Pro, anunciado el 8 de septiembre de 2026, es un modelo multimodal de uso de computadoras: 397 mil millones de parámetros en total, con unos 17 mil millones activos, construido a partir del linaje Qwen3.5, diseñado para leer una pantalla y manejar una sesión de navegador o de escritorio con un bucle de retroalimentación visual. GLM-5.2 es el buque insignia de Z.ai (Zhipu AI), con licencia MIT, para razonamiento y codificación de horizonte largo: alrededor de 743 mil millones de parámetros en total, con unos 40 mil millones activos, solo texto, en disponibilidad general desde el 16 de junio de 2026, y el modelo que ha anclado las puntuaciones independientes del nivel de pesos abiertos durante meses. Uno mira el mundo a través de píxeles y actúa sobre él. El otro piensa en texto y produce código. La licencia de ambos dice que puedes construir un negocio sobre ellos; la diferencia es que, en uno de ellos, esa licencia es actualmente una promesa.
El mismo número, dos procedencias diferentes
Empieza por el empate, porque enseña todo el enfrentamiento. La ficha de Nex-AGI lista Terminal-Bench 2.1 con 82.7 para Nex-N2.5 Pro, junto con OSWorld-2 con 56.4, SWE-Bench Pro con 61.2 y BrowseComp con 89.7 — todos producidos a través del banco de pruebas NexCUA y ninguno reproducido de forma independiente en los primeros días de vida del modelo, por la sencilla razón de que los pesos no se pueden descargar. La cifra de Z.ai de 82.7 para GLM-5.2 en Terminal-Bench 2.1 es el mejor número reportado por el propio proveedor, pero se asienta en un modelo que cualquiera puede descargar de Hugging Face y volver a ejecutar esta misma tarde; la medición independiente con el banco de pruebas de 77.9 ya existe, y está aproximadamente cinco puntos por debajo de lo que afirma Z.ai. Cuando un número de un proveedor se reduce bajo pruebas independientes, eso no es un escándalo: es el impuesto normal a la autoevaluación. Cuando un número de un proveedor competidor ni siquiera se puede probar, la ausencia de ese impuesto es el problema, no una señal de que el número esté intacto.

Lea las filas circundantes de la misma manera. GLM-5.2 ostenta la cifra más alta en el índice independiente entre todas las que ha producido la categoría abierta —los cincuenta y pocos en el actual Intelligence Index de Artificial Analysis—, razón por la que lleva meses siendo el modelo abierto de referencia pese a no ser el nuevo lanzamiento más llamativo. Nex-N2.5 Pro no tiene entrada alguna en el índice independiente. En las filas donde ambos proveedores declaran cifras, la verificable es la del proveedor establecido; en las filas donde solo Nex-AGI ha publicado, las cifras no han sido reproducidas. Eso no es un veredicto sobre qué modelo es más inteligente. Es un veredicto sobre qué modelo se le permite verificar.
Las fichas técnicas coinciden más de lo que esperarías.
Si eliminamos los benchmarks, ambos modelos coinciden estrechamente en lo fundamental:
• Publicado — Nex-N2.5 Pro: 8 de septiembre de 2026 (endpoints alojados activos, pesos pendientes). GLM-5.2: GA 16 de junio de 2026, pesos disponibles.
• Licencia — Nex-N2.5 Pro: Apache-2.0, pesos disponibles próximamente. GLM-5.2: MIT, descargable ahora.
• Escala — Nex-N2.5 Pro: 397B en total / ~17B activos. GLM-5.2: ~743B en total / ~40B activos.
• Modalidad — Nex-N2.5 Pro: entrada de texto e imagen, salida de texto, bucle de visión para uso de computadora. GLM-5.2: modelo de razonamiento de solo texto.
• Contexto / salida — Nex-N2.5 Pro: contexto de 262,144 tokens. GLM-5.2: contexto de 1M de tokens, límite de salida de 128K.
• Control de razonamiento — Nex-N2.5 Pro: ninguno / medio (adaptativo, predeterminado) / alto. GLM-5.2: controles de esfuerzo de razonamiento en la misma cadena del modelo.
• Precio por 1M de tokens — Nex-N2.5 Pro: nivel gratuito alojado, sin precio de lista. GLM-5.2: $1.40 de entrada / $4.40 de salida, $0.26 de entrada en caché.
Los límites difieren en la misma medida en que difieren las tareas de los dos modelos: GLM-5.2 aporta un millón completo de tokens de contexto de texto y un tope de salida de 128K a sesiones largas de ingeniería, mientras que Nex-N2.5 Pro cambia el tamaño del contexto por un canal de visión y una ventana más pequeña de 262K orientada a cargas de trabajo del tamaño de una pantalla. Ninguna especificación es incorrecta: están pensadas para tareas distintas.
Pesos abiertos, dos significados diferentes.

Aquí es donde la comparación deja de ser cuestión de números por completo. GLM-5.2 es abierto como se distribuye un producto sobre el que puedes construir un negocio: licencia MIT, pesos en Hugging Face, sin restricción de uso comercial, sin cláusula de intercambio de datos, sin un proveedor vigilando por encima de tu hombro. Puedes descargarlo, ajustarlo, servirlo dentro de tu propio perímetro de cumplimiento o llevarlo al host que quieras; y, como los pesos están publicados, su precio tiene un suelo que ningún proveedor puede subir por sí solo. Nex-N2.5 Pro se promete bajo Apache-2.0, una licencia igual de permisiva, pero el banner de su ficha en Hugging Face dice que los pesos llegarán pronto, y no se indica ninguna fecha. Para un equipo sujeto a reglas de gobernanza de datos, o que quiera escapar por completo del precio por token a escala, esa diferencia es toda la decisión: GLM-5.2 es un modelo que puedes poseer hoy, y Nex-N2.5 Pro es un modelo que te han prometido. Las cuentas del autoalojamiento también favorecen al recién llegado cuando los pesos por fin lleguen — 17B de parámetros activos en un nodo de ocho H100 es una huella mucho más accesible que la caja de ~40B activos de GLM-5.2 —, pero el «cuando los pesos lleguen» hace mucho trabajo en esa frase.
Las familias se están moviendo en direcciones opuestas
Ambos modelos forman parte de familias en rápida evolución, y sus trayectorias tiran en direcciones distintas. El linaje de GLM-5.2 es transparente e iterativo: Z.ai lanzó GLM-5.3 en agosto como una actualización posterior al entrenamiento de la misma base 5.2, y GLM-5.3 Flash a principios de septiembre; así, los pesos 5.2 sobre los que construyes hoy son el fundamento que la familia sigue mejorando: tu conocimiento de la arquitectura y tus ajustes finos se trasladan a las nuevas versiones. La familia de Nex-AGI es una apuesta por una generación totalmente nueva: Nex-N2.5 Mini con 35B de parámetros, Nex-N2.5 Pro con 397B y un Nex-N2.5 Max solo de texto con 1.6T, cuya propia base es DeepSeek-V4-Pro-Base, mientras que los pesos Pro que permitirían a cualquiera validar las afirmaciones de la familia siguen sin publicarse. Un equipo que elige una plataforma sobre la cual construir está decidiendo entre un linaje con una hoja de ruta publicada de actualizaciones y un primer lanzamiento cuyo segundo acto aún no ha llegado.
¿Cuál se gana un lugar en tu build?
Si tu requisito es «el modelo debe ser nuestro» —por gobernanza de datos, por auditoría, por un producto que no quieres que controle un único proveedor—, entonces GLM-5.2 no es la mejor opción en esta comparativa: es la única opción, porque es el único de los dos que puedes descargar. Además, es el único con una puntuación independiente, y está disponible al precio de la lista de Z.ai: 1,40 $ por millón de tokens de entrada y 4,40 $ por millón de tokens de salida. Si tu requisito es un agente multimodal de uso de computadora que con el tiempo pueda socavar la posición de los líderes de los modelos cerrados, Nex-N2.5 Pro es la tesis más interesante a largo plazo —un operador de visión con 17 000 millones de parámetros activos de una alianza que sabe claramente lo que quiere construir—, pero una tesis no es una dependencia, y un endpoint gratuito alojado no es una base.

La forma práctica de actuar sobre todo esto es construir sobre lo que ya existe y medir la promesa cuando aterrice. GLM-5.2 está en OrcaRouter al precio de lista de Z.ai—los mismos $1.40 / $4.40, traspasados sin recargo—y, al ser de pesos abiertos, también puedes autoalojarlo si quieres que la medición incluya tu propio stack de serving. Es el punto de referencia contra el que ejecutar hoy tu carga de trabajo agéntica real, con el DSL de enrutamiento sirviendo de sustituto hasta el día en que Nex-N2.5 Pro aparezca en un proveedor a precio de lista: cuando eso ocurra, cambiar la comparación será una regla de enrutamiento, no una migración. Hasta que caigan los shards y un harness independiente confirme—o corrija—que ese 82.7, Nex-N2.5 Pro vs GLM-5.2, es un duelo entre un modelo que puedes verificar y un número que no puedes.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
