
¿Qué es GLM-5.2? El buque insignia de pesos abiertos con contexto de 1M de Z.ai, dos versiones después
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 es un modelo de lenguaje grande de pesos abiertos y solo texto de Z.ai, el laboratorio de Pekín antes conocido como Zhipu AI, publicado el 16 de junio de 2026 bajo la licencia MIT. Es un modelo de mezcla de expertos de 753 mil millones de parámetros con una ventana de contexto de un millón de tokens y, durante aproximadamente dos meses, fue el modelo de programación de pesos abiertos más potente que cualquiera podía descargar. Ya no ocupa esa posición, porque Z.ai ha lanzado desde entonces dos sucesores sobre él, que es la parte que la mayoría de las páginas sobre GLM-5.2 omite, y la parte que decide si todavía deberías interesarte.
Cuarenta y tres artículos en el archivo de este blog mencionan GLM-5.2. Hasta ahora, ninguno de ellos trataba sobre él: el modelo aparece como el rival en comparación tras comparación, el punto de referencia fijo contra el que se mide a los modelos más nuevos. Ese es un papel extraño para un modelo que su propio creador ya ha dejado atrás, y es la razón de que exista esta página: una descripción directa de qué es realmente GLM-5.2, cuánto cuesta, en qué es bueno y quién debería seguir eligiéndolo.
Dónde se ubica GLM-5.2 dentro de la propia línea de Z.ai
Z.ai publica un registro de lanzamientos con fechas, y es la fuente más clara para esto. Léelo en orden y la forma de la familia es obvia:

• GLM-5 — 12 de febrero de 2026. El primer GLM-5, orientado a la ingeniería de sistemas complejos y a tareas de agentes de largo alcance.
• GLM-5.1 — 7 de abril de 2026. Trabajo de largo horizonte, capaz de operar en solitario hasta ocho horas en una sola ejecución.
• GLM-5.2 — 16 de junio de 2026. El buque insignia de contexto de 1M para tareas de largo horizonte; el registro de Z.ai lo describe como "contexto sin pérdidas de 1M, lo que mejora significativamente las capacidades para tareas de largo horizonte".
• GLM-5.3 — 18 de agosto de 2026. El mismo modelo base que GLM-5.2, con las mejoras provenientes del post-entrenamiento. Z.ai informa de una mejora del 50% sobre GLM-5.2 en su Code Bench interno y del estado del arte de código abierto en Terminal Bench 3.0.
• GLM-5.3-Flash — 26 de agosto de 2026. Un modelo distinto y más pequeño, construido sobre una base recién entrenada (320B en total, 18B activos), el primer GLM-5 nativamente multimodal.
La entrada importante en la línea es GLM-5.3. GLM-5.3 no es un GLM-5.2 más grande — son los mismos pesos base llevados más lejos con post-entrenamiento. Eso convierte a GLM-5.2 en el último modelo de la línea cuya capacidad provino de la arquitectura, y convierte a GLM-5.3 en el actual buque insignia de texto. Si hoy vas a elegir un modelo de Z.ai solo por calidad, la respuesta es GLM-5.3 y no GLM-5.2.
GLM-5.3-Flash es una rama separada en lugar de un GLM-5.3 más barato: un modelo más pequeño y nativamente multimodal (texto, imagen y vídeo) con un precio un orden de magnitud por debajo de los modelos insignia de texto. Si necesitas visión, GLM-5.2 no es el modelo que quieres en ninguno de los dos casos.
La ficha técnica
• Parámetros — 753B en total, según la ficha del modelo en zai-org/GLM-5.2-FP8. Z.ai no indica en esa ficha el número de parámetros activos; los listados de terceros lo sitúan cerca de 40B por token, y no pudimos confirmar esa cifra a partir de una fuente primaria.
• Ventana de contexto — 1M de tokens, descrito en la ficha como "un sólido contexto de 1M de tokens que sostiene de forma estable trabajo de horizonte largo".
• Salida máxima — 128K tokens.
• Modalidad — texto de entrada, texto de salida. Sin entrada de imágenes, sin audio. Nuestra propia entrada de catálogo para el modelo afirma que "solo admite entrada de texto".
• Licencia — MIT, sin límites regionales. Los pesos se publican a través de la organización zai-org en Hugging Face en variantes BF16 y FP8.
• Control de razonamiento — un modo de pensamiento híbrido impulsado por un parámetro reasoning_effort con ajustes high y max, con valor predeterminado max. Se admiten el llamamiento nativo de herramientas y la salida estructurada.
• Arquitectura — IndexShare, que reutiliza un único indexador ligero en cada cuatro capas de atención dispersa y, según la ficha del modelo, reduce los FLOPs por token en 2,9× a contexto completo; además, una capa mejorada de predicción multi-token que eleva hasta un 20% la longitud de aceptación de la decodificación especulativa.
• Hardware de entrenamiento — la cobertura de prensa del lanzamiento afirma que el modelo se entrenó con aceleradores Huawei Ascend, sin hardware de Nvidia. Es una afirmación procedente de reportes periodísticos, no de la ficha del modelo, y la transmitimos como tal.

En qué es mediblemente bueno GLM-5.2
Casi todo aquello en lo que GLM-5.2 es bueno es una medición de codificación o de agentes, y las cifras a continuación son reportadas por el proveedor: provienen de la tabla de benchmarks de la propia ficha del modelo de Z.ai, no de una reproducción independiente.
• Terminal Bench 2.1 (Terminus-2) — 81.0, frente a 63.5 de GLM-5.1. Ese es el mayor salto generacional de la tabla.
• SWE-bench Pro — 62.1, frente a 58.4 de GLM-5.1.
• FrontierSWE (Dominancia) — 74.4, frente a 30.5 de GLM-5.1 y 72.6 de GPT-5.5.
• AIME 2026 — 99.2. GPQA-Diamond — 91.2. Ambos son cómodamente competitivos con la frontera cerrada en la propia tabla de Z.ai.
• MCP-Atlas (conjunto público) — 76.8, prácticamente a la par del 77.8 de Claude Opus 4.8 en la misma tabla.
• Recuperación de contexto largo — 78.3, que es la cifra que más importa para la ventana de 1M de tokens. La ventana solo es útil si la recuperación se mantiene en profundidad, y la propia cifra de Z.ai dice que en su mayor parte así es.
El panorama independiente es más limitado, pero real. Artificial Analysis incluye a GLM-5.2 con una puntuación de 34 en el Intelligence Index en su Intelligence Index v4.3.2, lo que lo sitúa en el puesto 11 de 114 modelos de su clase. Esa cifra conlleva dos salvedades, y Artificial Analysis señala ambas: el modelo está marcado como obsoleto en su página, y «solo continúan la evaluación comparativa de rendimiento para la carga de trabajo predeterminada de 10k tokens de entrada» —los resultados para otras cargas de trabajo son históricos y ya no se actualizan. Nuestra propia entrada de catálogo para el modelo contiene una instantánea de evaluación anterior del 25 de junio de 2026 con una puntuación de inteligencia de 33,7, que no corresponde a la misma revisión del índice que la cifra en vivo y no debe interpretarse como un cambio en el modelo.
En qué es mediblemente malo
Tres cosas, y vale la pena ser franco al respecto.
• Es solo texto. Sin entrada de imágenes, sin entrada de audio. GLM-5.3-Flash es el modelo multimodal de esta familia, y si tu carga de trabajo incluye capturas de pantalla, PDF o vídeo, GLM-5.2 es la rama equivocada por completo.
• Pierde gravemente en las mediciones de ingeniería de software más difíciles y de mayor horizonte. En SWE-Marathon obtiene 13.0 frente a 26.0 de Claude Opus 4.8. En DeepSWE obtiene 46.2 frente a 58 de Claude Opus 4.8 y 70 de GPT-5.5. En NL2Repo obtiene 48.9 frente a 69.7 de Opus 4.8. Todas son cifras reportadas por el proveedor de la misma tabla que muestra a GLM-5.2 ganando en otros aspectos, lo que las hace creíbles: Z.ai las publicó junto a sus propias victorias.
• Ha sido superado en las mediciones que lo hicieron famoso. GLM-5.3 utiliza la misma base y lo supera en el Code Bench propio de Z.ai por un 50%, en Terminal Bench 3.0 y en Agents' Last Exam. GLM-5.2 también está marcado como obsoleto en Artificial Analysis.
Una cifra que no pudimos obtener: no pudimos confirmar una medición actual e independiente de rendimiento o latencia para GLM-5.2 a partir de una fuente que pudiéramos abrir, por lo que esta página no indica ninguna en lugar de repetir un número que no pudimos verificar.
Precio y dónde ejecutarlo
La propia lista de tarifas de Z.ai, consultada hoy, incluye GLM-5.2 a:
• Entrada — $1.40 por millón de tokens
• Entrada en caché — $0.26 por millón de tokens
• Salida — $4.40 por millón de tokens
El almacenamiento de entrada en caché figura como gratuito por tiempo limitado. Ten en cuenta que GLM-5.3 tiene exactamente las mismas tres tarifas, por lo que el modelo más nuevo no es más caro en la lista de Z.ai — lo que elimina la razón habitual para quedarse con el modelo anterior.
Sobre la disponibilidad: el modelo se sirve a través del propio endpoint compatible con OpenAI de Z.ai en api.z.ai/api/paas/v4/chat/completions, con SDK oficiales para Python y Java, y los pesos se pueden descargar desde Hugging Face para autoalojamiento bajo licencia MIT. Más allá de eso, está disponible a través de varias plataformas de inferencia de terceros. Nosotros lo enrutamos: OrcaRouter incluye GLM-5.2 en su página de modelos a la tarifa del proveedor Z.ai, sin ningún recargo, de modo que los 1,40 $ / 4,40 $ anteriores son lo que usted paga a través de nosotros y no una copia con recargo. La misma clave también da acceso al resto del catálogo, lo cual importa aquí por una razón concreta: véase a continuación.

¿Quién debería elegir GLM-5.2 y quién debería elegir otra cosa?
Elige GLM-5.2 si estás haciendo self-hosting y la ventana de 1M tokens es el requisito en lugar de las puntuaciones de benchmark. La licencia MIT sin restricciones regionales, los pesos FP8 publicados y el diseño de atención IndexShare lo convierten en algo genuinamente práctico de ejecutar en contexto largo, y la cifra de recall en profundidad es el número que justifica la ventana. También es una elección razonable si tienes un pipeline ya ajustado a su reasoning_effort comportamiento y el coste de revalidar prompts contra GLM-5.3 supera la ganancia.
Elige GLM-5.3 en su lugar si compras tokens en lugar de pesos y la calidad es el único eje. Es el mismo modelo base, mejor postentrenado, a precios de lista idénticos. No hay ningún argumento de precio a favor del modelo anterior en la propia tabla de tarifas de Z.ai.
Elige GLM-5.3-Flash en su lugar si necesitas visión, o si necesitas la opción capaz más económica: maneja texto, imagen y video, y su precio es muy inferior al de ambos modelos insignia de texto.
Elige algo completamente distinto si tu trabajo está en el extremo más exigente de la ingeniería de software de horizonte largo. En la propia tabla publicada de Z.ai, Claude Opus 4.8 supera a GLM-5.2 en SWE-Marathon, DeepSWE, NL2Repo, SWE-bench Pro, ProgramBench y Tool-Decathlon; GPT-5.5 lo supera en DeepSWE y ProgramBench. Las victorias de GLM-5.2 son reales, pero se concentran en la codificación agéntica y el razonamiento de estilo terminal, no en las tareas de maratón. Si tu evaluación se parece a una ejecución de agente de dos horas contra un repositorio grande y desconocido, la ventaja de precio de los modelos de pesos abiertos no cierra esa brecha con estas cifras.
El resumen práctico
GLM-5.2 es un modelo MoE de solo texto, con 753B de parámetros, licencia MIT y 1M de contexto, publicado el 16 de junio de 2026 a $1,40 / $4,40 por millón de tokens, con un Terminal Bench 2.1 reportado por el proveedor de 81,0, un SWE-bench Pro de 62,1 y un Índice de Inteligencia de Artificial Analysis independiente de 34. Es el último buque insignia de GLM cuya capacidad provino de la arquitectura en lugar del post-entrenamiento, ha sido superado dos veces por su propio fabricante, y está marcado como obsoleto en el índice independiente que lo puntuó.
Nada de eso lo convierte en un mal modelo. Lo convierte en uno asentado: la pregunta interesante sobre GLM-5.2 en septiembre de 2026 no es si es bueno, sino si eso específico que necesitas —un modelo de programación de contexto largo, autoalojable y con licencia MIT— vale más para ti que los tres puntos que GLM-5.3 añade sobre los mismos pesos. Para la mayoría de los compradores de tokens, la respuesta es no. Para cualquiera que descargue pesos, sigue siendo sí.
Si quieres probarlo por tu cuenta sin comprometer una ruta de producción, la capa de enrutamiento es la forma económica de hacerlo: dirige la misma solicitud a GLM-5.2 y GLM-5.3 a través de un único endpoint, compara con tus propios prompts y deja que la conmutación automática por error se encargue del caso en el que el endpoint del modelo más antiguo sea el que se cae.
Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
