Tarjeta principal del artículo que dice '¿GLM 5.5 o GLM 5.3-Vision?' con el subtítulo 'Acaba de aparecer un modelo anónimo que coincide con la huella de Z.ai' y la insignia 'LEAK — no verificado', sobre un suave degradado de blanco y azul con un sutil motivo de red neuronal y un elemento de signo de interrogación.
Guides & Insights

GLM 5.5 o GLM 5.3-Vision? Un modelo anónimo que coincide con la huella de Z.ai acaba de aparecer

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Un modelo no identificado cuyo perfil de servicio — velocidad, tiempo hasta el primer token, tasa de acierto de caché — coincide con la pila G​LM de Z.ai ha empezado a atraer la atención de los analistas de capacidad, y la conjetura provisional es que podría llamarse GLM 5.3-Vision o GLM 5.5. El 20 de agosto, el analista de cómputo y capacidad teortaxesTex publicó que un modelo anónimo que está rastreando es "claramente no Dee​pSeek, al menos", que "no hay nada que descarte a G​LM hasta ahora", y que "la velocidad, el ttft y la tasa de acierto de caché también coinciden con G​LM". Su lectura: espera que se llame GLM 5.3-Vision o 5.5, con una puntuación aproximada de 61 en el Artificial Analysis Intelligence Index, un punto por encima de donde se sitúa hoy el GLM-5.3 lanzado. Nada de esto está confirmado. No hay tarjeta de modelo, ni anuncio de Z.ai, ni API, y esta página trata el avistamiento como lo que es: una señal temprana de filtración no replicada, digna de seguimiento precisamente porque GLM-5.5 ha sido el buque insignia esperado de Z.ai durante todo el mes y no ha aparecido. Cinco días después de esa publicación, llegó un segundo dato, esta vez totalmente verificable: el 25 de agosto, vLLM — el runtime de inferencia detrás del servicio de modelos a gran escala — abrió una pull request Do-Not-Merge que habilita el soporte del kernel masked-MHA para las dimensiones de cabezas de G​LM-5. No nombra ninguna variante ni prueba ningún lanzamiento; es trabajo de base de la pila de servicio, el tipo de actividad de fondo que deja un modelo nuevo.

Lo que la señal realmente dice

La fuente es una única publicación de X de teortaxesTex, con fecha del 20 de agosto — la misma cuenta cuya señal de tiempo de "aproximadamente una semana" sobre el lanzamiento de GLM-5.3 se cumplió al día, de vuelta en agosto. El planteamiento es explícito sobre el nivel de evidencia: "evidencia sólida (aún no replicada)". El analista descarta a Dee​pSeek, no encuentra nada que contradiga a G​LM, y cita tres medidas a nivel de servicio — rendimiento, tiempo hasta el primer token y tasa de acierto de caché — como coincidentes con el stack de Z.ai. Luego, los dos nombres candidatos y una puntuación proyectada: "Actualmente espero que se llame GLM 5.3-Vision o 5.5, y que obtenga aproximadamente 61 en AA".

Toma cada pieza por separado. Las afirmaciones de identidad (no Dee​pSeek, coincide con G​LM) son inferencias de huella digital basadas en cómo se sirve el modelo, no una ficha del modelo. La puntuación es una expectativa, no una medición. Los nombres son conjeturas. Lo que hace que la señal valga más que el ruido es que es direccionalmente consistente con todo lo demás que sabemos sobre la hoja de ruta de Z.ai de este mes: GLM-5.3 se lanzó solo con texto, la petición más fuerte de la comunidad fue la visión, y GLM-5.5 ha sido reportado por múltiples medios (a través de JPMorgan, Reuters, CGTN y una nota de Goldman del 18 de agosto) como algo que llegará "dentro de agosto" — el final del mes es ahora.

Por qué importa la huella de servicio

El tiempo hasta el primer token y la tasa de aciertos de caché son firmas a nivel de infraestructura. Vienen determinadas por cómo un proveedor construye su stack de inferencia — el planificador, la disposición de la caché, la política de lotes —, no por el nombre del modelo al que llama un prompt. Cuando un analista dice que el TTFT y la tasa de aciertos de caché de un modelo anónimo coinciden con los de G​LM, está diciendo que el stack de servicio que hay detrás se comporta como el de Z.ai, que es lo más parecido a una huella digital que se puede obtener sin pesos ni tarjeta de modelo. No es una prueba. Otro proveedor podría reproducir el mismo stack, o Z.ai podría servir un modelo para un socio. Pero es una afirmación concreta y verificable, y la salvedad de "no lo han replicado" indica que el analista no lo está presentando como algo concluyente.

La exclusión de Dee​pSeek también importa. DeepSeek V4 Pro salió a disponibilidad general el 13 de agosto y su compilación Flash ha sido el otro lanzamiento chino de peso abierto de alta velocidad este mes. Un modelo anónimo que descarta a Dee​pSeek pero apunta a G​LM reduce el campo al pipeline de Z.ai — y el pipeline de Z.ai tiene dos ocupantes plausibles, que es exactamente la bifurcación que la señal nombra.

Una segunda señal: el stack de servicio se está construyendo para la atención de GLM-5.

El 25 de agosto llegó un segundo dato — este totalmente comprobable. vLLM, el runtime de inferencia detrás del servicio de modelos a gran escala, recibió el pull request #53785, titulado "[Do Not Merge][Attention] Enable masked MHA for GLM-5 head dimensions." Verificado contra el repositorio, habilita la ruta de prefill de MHA enmascarada para la geometría de atención de G​LM-5: 64 cabezas, un rango de KV de 512, dimensión de cabeza QK 192+64, y dimensión de cabeza V 256 — un diseño QK/V de 256/256, según la descripción del PR. Depende de un cambio en FlashAttention para el soporte de máscara con dimensión de cabeza 256, fija temporalmente FlashAttention a un commit de un fork (que es para lo que sirve la marca Do Not Merge), y añade umbrales de enrutamiento evaluados para la nueva ruta: límites de prefill puro de FlashMLA de 8K / 20K / 48K / 112K tokens en TP 1/2/4/8, y un límite redondeado de 64K para FlashInfer en TP8. El autor señala que ningún otro PR abierto cubría el soporte de MHA enmascarada de G​LM-5.

Léelo como lo que es: trabajo preliminar de la pila de serving, no un anuncio. El PR no menciona GLM 5.5 ni GLM 5.3-Vision — dice "GLM-5" — y habilitar una ruta de prefill de MHA enmascarada para las dimensiones de las cabezas de G​LM-5 es trabajo de infraestructura sobre una familia que el ecosistema vLLM ya ejecuta mediante la ruta de sparse-MLA (el propio linaje de GLM-5.3 se sirve allí hoy). Tampoco es algo aislado: los PRs hermanos de este mes abordaron comprobaciones de dimensiones de MLA en FlashInfer para GLM-5, un fallback de sparse-MLA en Triton para modelos de la clase GLM-5, y el soporte de dimensiones informado por FlashAttention. Dos detalles lo mantienen en el radar de un rastreador de filtraciones. Primero, la geometría a la que apunta — 64 cabezas, rango KV 512, 256/256 QK/V — es distinta de la 192/128 de Dee​pSeek, lo cual es la misma separación de "no Dee​pSeek, coincide con G​LM" que traza la huella del modelo anónimo, ahora visible a nivel del kernel de atención. Segundo, el momento: el PR se abrió el 25 de agosto, dentro de la misma ventana de agosto en la que se ha esperado GLM-5.5 durante todo el mes. Nada de eso prueba que el modelo anónimo sea un G​LM de próxima generación — podría ser igualmente ingeniería sobre el modelo que ya se lanzó — pero es el tipo de actividad de fondo que el ecosistema de serving realiza antes de un modelo, y es verificable como no lo es ninguna publicación en X.

Dos nombres, una bifurcación: GLM 5.3-Vision vs GLM 5.5

Las dos identidades candidatas son productos genuinamente diferentes, y la filtración no resuelve cuál de ellas está en la placa.

• GLM 5.3-Vision sería una variante con capacidad de visión del modelo que se lanzó el 14 de agosto. GLM-5.3 es solo de entrada de texto — Artificial Analysis lo lista como entrada de texto, salida de texto, sin soporte de imágenes — y esa brecha es la queja más fuerte de la comunidad. Cuando Tang Jie de Z.ai llevó a cabo una campaña global de comentarios, las respuestas fueron prácticamente unánimes a favor de la visión, y Z.ai ya tiene los componentes básicos (el modelo multimodal GLM-5V-Turbo y el codificador CogVLM) que aún no ha integrado en la línea insignia. Una variante 5.3-Vision sería la forma más rápida de cerrar esa brecha.

• GLM 5.5 es el buque insignia en sí mismo. Las especificaciones reportadas pero no confirmadas apuntan a una base de más de un billón de parámetros (frente a los 743B de GLM-5.3), un contexto de 1M de tokens que se conserva, pesos abiertos y un mayor enfoque en agentes y codificación. Todas las notas de analistas de este mes tratan a 5.5 como el gran lanzamiento — el vehículo que el cofundador de Z.ai, Tang Jie, ha insinuado que cerrará la brecha con los modelos cerrados de clase Fable. Se espera para agosto y no se ha lanzado al momento de escribir esto.

La misma huella digital no puede decirte cuál de los dos es — un 5.3 ajustado para visión y un buque insignia nuevo podrían usar el mismo stack de servicio. Esa ambigüedad es el estado honesto de la señal, y los dos nombres en la publicación del analista la reflejan en lugar de resolverla.

Un marcador comparativo de dos columnas titulado 'GLM 5.5 vs GLM-5.3 — el marcador'. Columna izquierda GLM 5.5 (filtrado): 'Índice AA ~61 (proyectado, no verificado)', 'Estado: no publicado', 'Tamaño >1T de parámetros (rumoreado)', 'Visión: esperada', 'Contexto: 1M (esperado)', 'Precio: por determinar'. Columna derecha GLM-5.3 (lanzado): 'Índice AA 60', 'Estado: API activa desde el 19 de agosto', 'Tamaño 743B MoE / 40B activos', 'Visión: solo texto', 'Contexto: 1M', 'Precio: $1.40 / $4.40'. El pie de página dice: 'Las cifras de GLM 5.5 son proyecciones no verificadas; GLM-5.3 según Artificial Analysis.'

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

Qué significaría un ~61 en el Índice de Inteligencia AA

La puntuación proyectada es el dato más contundente de la filtración. El Artificial Analysis Intelligence Index (v4.1.1) sitúa actualmente a {{1}}GLM-5.3 en 60{{/1}}, empatado con {{2}}Kimi K3{{/2}} por la puntuación más alta de pesos abiertos, y 7 puntos por delante del {{3}}53 de GLM-5.2{{/3}}. Un punto por encima, en 61, estaría el territorio de {{4}}GPT-5.6 Sol{{/4}}, con {{5}}Claude Fable 5{{/5}} en 62 y {{6}}Claude Opus 5{{/6}} en 63. En términos sencillos: un modelo de la {{7}}familia G​LM{{/7}} con una puntuación de 61 sería la puntuación de pesos abiertos más alta del índice, por sí solo por encima de {{8}}Kimi K3{{/8}} y {{9}}GLM-5.3{{/9}}, y efectivamente en la línea de la frontera cerrada.

Vale la pena subrayar lo que 61 no es. Es la expectativa de teortaxesTex sobre lo que devolverá una evaluación independiente, no una puntuación publicada de Artificial Analysis ni un número de proveedor. Una proyección puede fallar en cualquier dirección: una variante de visión podría intercambiar uno o dos puntos en el índice centrado en texto, y un buque insignia de >1T podría situarse más arriba o más abajo dependiendo de cómo se comporte su post-entrenamiento. El valor del número es la afirmación que codifica: quienquiera que resulte ser este modelo anónimo, se espera que supere al actual líder de pesos abiertos en lugar de simplemente igualarlo.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

Qué está confirmado, y qué no

Mantén el registro limpio, porque una pieza filtrada vive o muere por eso.

• Confirmado: GLM-5.3 es real, se lanzó el 14 de agosto, la API está disponible desde el 18/19 de agosto, obtuvo 60 en el Índice de Inteligencia AA (medido de forma independiente por Artificial Analysis), con un precio de $1,40 / $4,40 por 1 millón de tokens, solo entrada de texto, y con pesos abiertos confirmados para el viernes 28 de agosto. Esos hechos no dependen de la filtración.

• Confirmado: GLM-5.5 aún no se ha lanzado. Al momento de escribir esto, no hay ficha del modelo, ni precios, ni disponibilidad; la ventana de agosto y la cifra de >1T de parámetros son reportes de analistas, no compromisos de Z.ai.

• Sin confirmar: que el modelo anónimo exista como producto separado, que sea G​LM, que su nombre sea GLM 5.3-Vision o 5.5, y que obtenga una puntuación de 61. Las cuatro afirmaciones se basan en una publicación no replicada de un analista.

• También sin confirmar: si este modelo anónimo es siquiera distinto del propio GLM-5.3. Un endpoint en vivo de GLM-5.3 bajo un alias sin etiquetar produciría la misma huella de servicio. Hasta que un nombre, una tarjeta de modelo o una publicación de pesos lo resuelva, la interpretación de "modelo nuevo" es el prior fuerte pero no un hecho.

Qué ver a continuación

• Viernes, 28 de agosto — los pesos de GLM-5.3. Si el modelo anónimo es en realidad un 5.3 renombrado o un 5.3-Vision, la liberación de los pesos y la ficha del modelo lo resolverán rápidamente.

Un segundo avistamiento que lo corrobora. La huella de un analista es una hipótesis; una segunda lectura independiente de la misma entrada anónima, o un listado de Artificial Analysis que la nombre, la eleva a evidencia.

• Cualquier declaración de Z.ai. Se ha informado que GLM-5.5 llegará en la ventana de agosto, y el mes está casi terminando. Un nombre oficial, una página de precios o una entrada en el registro de cambios de la API es el evento que convierte esta filtración en una historia de lanzamiento.

• Si la puntuación AA se materializa en 61. Si el modelo anónimo es real y de la familia G​LM, una puntuación de índice independiente cercana a 61 sería el primer número de pesos abiertos en superar 60.

• Si el trabajo de atención de vLLM recibe un nombre de modelo adjunto. El PR #53785 apunta a las dimensiones de cabeza de «GLM-5» sin nombrar 5.3-Vision ni 5.5; una fusión, una entrada en modelos compatibles o una tarjeta de modelo que asocie esa geometría con un nombre específico sería la señal más contundente hasta ahora.

Cómo actuar ante una filtración como esta

Una filtración es una razón para prepararse, no para cambiar de plataforma. Si el próximo modelo de la familia G​LM llega a la cima o cerca de la cima del ranking de pesos abiertos, la pregunta práctica es si enrutar tráfico real hacia él — y un modelo no probado con afirmaciones del proveedor y la proyección de un solo analista es exactamente el caso donde quieres una red de seguridad en lugar de una apuesta. El GLM-5.3 que se lanzó la semana pasada ya está activo en OrcaRouter — la página del modelo lo muestra a $1.26 / $3.96 por 1M de tokens, un 10% de descuento de lanzamiento sobre el precio de lista del proveedor de $1.40 / $4.40, trasladado sin margen — y la configuración de enrutamiento es la que heredaría un 5.5 o 5.3-Vision el día que se lance. Apunta una porción de tráfico al nuevo modelo a través del router con conmutación por error automática a un modelo probado — GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol — y obtienes una señal de calidad sobre tu propia carga de trabajo en lugar de una presentación de diapositivas. Si la proyección de la filtración es correcta, te enteras primero; si es errónea, la conmutación por error lo absorbe y nada sale roto. La misma clave, sin segundo contrato, y sin necesidad de elegir entre los dos nombres candidatos hasta que Z.ai lo haga.

El próximo G​LM está en camino — la única pregunta abierta es qué nombre lleva. GLM 5.3-Vision sería Z.ai cerrando su brecha más criticada en el modelo que acaba de lanzar; GLM 5.5 sería el modelo insignia de un billón de parámetros al que todo el mes ha estado apuntando. La entrada anónima teortaxesTex, cuya huella se registró el 20 de agosto, es el primer objeto concreto que se parece a cualquiera de los dos, y su puntuación proyectada de 61 en el AA Intelligence Index lo situaría por delante de todos los modelos de pesos abiertos actualmente en el ranking. Cinco días después de esa huella, el stack de inferencia también se movió: el trabajo de atención G​LM-5 de vLLM es exactamente el tipo de trabajo preliminar que deja tras de sí un nuevo modelo, aunque no mencione ninguna variante. Nada de eso está confirmado, y esta página se actualizará en el momento en que el nombre, la ficha o los pesos lo resuelvan. Hasta entonces, la jugada de bajo riesgo es tener el enrutamiento listo — no apostar todo el stack por una huella.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario