Tarjeta de título principal para la comparación de GLM-5.3 y GLM-5.2, subtitulada 'Mismo cerebro, el doble de benchmarks', con dos tarjetas de modelo que comparten un único bloque base MoE de 743B conectado y una flecha curva de actualización etiquetada como 'solo post-entrenamiento' que apunta de GLM-5.2 a GLM-5.3.
Guides & Insights

GLM-5.3 vs GLM-5.2: Mismo cerebro, benchmarks duplicados

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La propia perspectiva de Zhipu AI sobre la actualización de GLM-5.2 a G​LM-5.3 es la honesta: el libro de texto no cambió, solo lo hizo el entrenamiento del estudiante. G​LM-5.3, lanzado el 14 de agosto de 2026, está construido sobre la misma base MoE de 743 mil millones de parámetros que GLM-5.2, que coronó el campo de pesos abiertos en el Artificial Analysis Intelligence Index en junio. La arquitectura no cambia, la huella no cambia, el precio de $1.40 / $4.40 por millón no cambia — y sin embargo, Z.ai informa que el modelo reentrenado duplica o supera a su predecesor en varios de los benchmarks de codificación y seguridad que publican ambas versiones. Si eso convierte a G​LM-5.3 en una actualización obligatoria o en un esperar y ver depende de cuánto confíes en un modelo que mejoró tanto sin cambiar su propia arquitectura, y de si su nueva capacidad cibernética es una función que quieres tener restringida tras una ventana de seguridad de dos semanas.

El mismo cerebro, reentrenado.

Todo lo que hizo de GLM-5.2 un servidor práctico se mantiene: {{1}}el MoE de 743B con aproximadamente 40B de parámetros activos{{/1}}, la atención dispersa IndexShare que redujo los FLOPs en contexto de 1M, la licencia MIT, la ventana de contexto de 1M y el eficiente rendimiento de tokens que midió {{2}}~145–168 tokens/seg{{/2}} en observación independiente. G​LM-5.3 difiere en una sola dimensión: el post-entrenamiento. Z.ai escaló la etapa de aprendizaje por refuerzo con los frameworks IndexShare, SAO y Slime, añadió docenas de veces más entornos de tareas de horizonte largo y los extendió desde la depuración de código hasta el descubrimiento de vulnerabilidades de seguridad y la ingeniería de sistemas. El resultado es un modelo que se comporta de manera diferente en el mismo hardware, que es precisamente por qué la pregunta de actualización no es "¿necesito GPUs nuevas?" sino "¿necesito un comportamiento nuevo?".

El delta de referencia, en ambas direcciones.

Leído como un antes y después en las cifras publicadas por Z.ai, el salto es el más grande en la historia de los pesos abiertos. Terminal-Bench 3.0 — la revisión más difícil, donde ambos fueron evaluados — pasa de 4,6 a 28,3, un salto de seis veces. DeepSWE v1.1 pasa de 46,2 a 66,9, que es la diferencia entre "buen modelo abierto" y "competitivo con los líderes cerrados". El subconjunto CLI de Agents' Last Exam pasa de 23,8 a 28,5. El descubrimiento de vulnerabilidades de CyberGym sube de 77,2 a 84,5. ExploitBench más que duplica su resultado, de 24,4 a 54,4, y el rendimiento de ExploitGym pasa de 29 y 39 tareas completadas (dos y seis horas) a 105 y 130. Z.ai lo resume como una mejora de codificación de aproximadamente el 50%, y la forma de las ganancias — concentradas en codificación de horizonte largo, automatización de terminal y seguridad — es consistente con un modelo únicamente de post-entrenamiento: el conocimiento bruto es el mismo, pero la capacidad de realizar realmente trabajo de varios pasos es lo que se fortaleció.

• Terminal-Bench 3.0 — GLM-5.2 4.6 vs G​LM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 vs GLM-5.3 66.9

• Agents' Last Exam (CLI) — G​LM-5.2 23.8 vs G​LM-5.3 28.5

• Descubrimiento de vulnerabilidades en CyberGym — GLM-5.2 77.2 vs G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 vs G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

La capacidad que nadie programó

Las ganancias de seguridad merecen un párrafo propio porque Z.ai afirma que no eran el plan. El equipo de post-entrenamiento añadió entornos de descubrimiento de vulnerabilidades esperando una mejora modesta; el modelo, en cambio, comenzó a encadenar exploits completos, un comportamiento emergente que obligó a Z.ai a retener los pesos durante aproximadamente dos semanas para el endurecimiento de seguridad. En pruebas del mundo real con equipos de seguridad, G​LM-5.3 contribuyó a encontrar 2,436 vulnerabilidades en 269 proyectos, 1,097 de ellas de riesgo medio o alto, incluidos fallos que habían permanecido sin detectar durante décadas en software ampliamente implementado. GLM-5.2 tenía capacidad de seguridad en el sentido ordinario: podía leer código en busca de errores. G​LM-5.3 la tiene en un sentido diferente: es aquello de lo que trata la ventana de seguridad. Eso es un cambio de tipo, no de grado, y es la razón más fuerte para tratar a los dos modelos como productos diferentes a pesar de la base compartida.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

La advertencia sobre la consistencia

El contrapeso a cada cifra anterior es que las primeras pruebas de terceros describen a G​LM-5.3 como inconsistente de una manera que no ocurría con GLM-5.2. Los revisores independientes reportan que el mismo modelo se desempeña como un ingeniero subcontratado que apenas aprueba en algunas tareas y entrega resultados de nivel profesional en otras, y la diferencia se correlaciona con cuán claramente se especificaron los requisitos. Ese es exactamente el perfil de fallo que cabría predecir en un modelo cuyas mejoras provinieron enteramente de un post-entrenamiento con fuerte énfasis en el entorno: generaliza a partir de las estructuras de tarea con las que se entrenó, y los prompts mal especificados quedan fuera de ellas. Ninguno de los resultados independientes es tan limpio como las tablas publicadas por Z.ai, y ninguna de las cifras de Z.ai ha sido aún reproducida de forma independiente. Para producción, eso aboga por una evaluación explícita sobre tu propia carga de trabajo antes de la migración — la misma advertencia que ya ameritaba GLM-5.2, ahora con una brecha más amplia entre el mejor y el peor caso.

Precio, acceso y la cuestión de la espera.

El precio es idéntico, lo que elimina la fricción habitual de la actualización: ambos modelos cuestan $1.40 / $4.40 por millón de tokens, y G​LM-5.3 requiere el modo de razonamiento activado. El acceso es la diferencia real. GLM-5.2 se puede descargar hoy bajo MIT, se puede autoalojar en un footprint FP8 de menos de un terabyte, y se puede invocar a través de OrcaRouter al precio de lista sin margen adicional: el modelo al que puedes enrutar ahora mismo, estable y con evaluación independiente. G​LM-5.3 está disponible ahora a través de ZCode / AutoClaw de Z.ai y del G​LM Coding Plan, pero la API pública y los pesos están ambos restringidos por la ventana de seguridad, y sus cifras de referencia son todas reportadas por el proveedor, pendientes de repetición por terceros. Así que la respuesta honesta a «¿debería esperar?» tiene dos partes: para tráfico de producción que no debe sufrir regresiones, GLM-5.2 sigue siendo la apuesta segura con pesos abiertos hoy, y en cuanto se abra la API de G​LM-5.3 y las ejecuciones independientes lo confirmen, la migración es un cambio de ruta, no una reescritura: conservas la misma configuración de una sola clave y cambias de carril. Para trabajo exploratorio y de evaluación de seguridad, vale la pena probar G​LM-5.3 ahora a través de las herramientas de Z.ai, con el entendimiento de que su ventaja publicada no está verificada y su comportamiento es más variable que el del modelo al que reemplaza.

El veredicto sincero

G​LM-5.3 es el mejor modelo según los propios números de Z.ai — dramáticamente mejor en codificación de horizonte largo y categóricamente diferente en seguridad — y es gratuito para tu flujo de trabajo porque la base, la huella y el precio no cambian. Pero «mejor en las evaluaciones del proveedor» y «mejor en tu pipeline» están separados por las dos cosas que GLM-5.2 ya tiene y G​LM-5.3 aún no: la reproducción independiente y los pesos de distribución. Si ya ejecutas GLM-5.2, la ruta de actualización es la más barata en la historia de los pesos abiertos — el mismo hardware, el mismo precio, la misma superficie de API y una espera de dos semanas por los pesos. La decisión no es tanto si G​LM-5.3 es mejor que GLM-5.2, sino si estás dispuesto a apostar la producción por un modelo cuyas mejoras, y cuya capacidad de seguridad recién surgida, aún no han sido confirmadas por nadie fuera de Z.ai.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube