
GLM-5.3-Flash, cinco semanas después: un 42 independiente, una ejecución de exploit de nivel Mythos y el agente GLM que reconstruyó su propio stack de servicio
- OrcaNUEVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 87 tok/s
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
GLM-5.3-Flash lleva cinco semanas sirviendo tráfico de producción y, el 17 de septiembre de 2026, Zhipu AI dijo algo sobre dónde: la empresa reveló que cada solicitud de producción de GLM-5.3-Flash ahora se ejecuta en una flota de más de 100.000 aceleradores de IA chinos de fabricación nacional, que pasó del primer arranque en ese hardware a soportar toda su carga de trabajo en vivo en menos de dos semanas, y que el rendimiento de extremo a extremo aumentó 3,2 veces en ese mismo periodo. Lo que llegó más lejos es quién hizo el trabajo. Gran parte no la hizo el equipo de infraestructura, sino un agente impulsado por el propio GLM-5.3, que leía cuellos de botella, proponía soluciones y escribía código del sistema de inferencia, mientras los ingenieros fijaban objetivos, construían el entorno de retroalimentación y revisaban todo lo que tocara la semántica numérica, la concurrencia o el riesgo de producción. GLM-5.3-Flash es el modelo multimodal de 320.000 millones de parámetros totales y 18.000 millones activos (320B-A18B) que Zhipu lanzó y publicó como código abierto el 26 de agosto de 2026 —el anónimo «Ox Alpha» que la empresa reveló ese día—, y su hermano mayor, GLM-5.3, es el buque insignia de 743B frente al cual se estableció su precio. Ninguno de los tres números de la revelación de hoy proviene de nosotros ni de nadie más: son de la propia Zhipu. Además, el buque insignia ya no es la única comparación que importa: en ExploitBench, una evaluación independiente de hasta dónde llega un modelo en una escalera real de exploits de Chrome, GLM-5.3-Flash ahora se ha medido al mismo nivel que Claude Mythos Preview, el modelo frontera cerrado que su desarrollador solo publicó para defensores verificados, a una fracción del coste por intento.
Esas son las buenas noticias, y son reales, pero las da el propio fabricante. Otras tres cosas han cambiado desde que esta entrada se publicó por primera vez el día del lanzamiento, y dos de ellas van en sentido contrario. Artificial Analysis ha publicado ahora su propia medición del modelo, y su cifra no es la de Zhipu. El descuento de lanzamiento que lo convertía en el modelo capaz más barato del mercado venció, según lo previsto, el 9 de septiembre y no se prorrogó. Y una entidad de evaluación independiente, Generality Labs, ha publicado su propia ejecución de ExploitBench en la que GLM-5.3-Flash obtuvo una puntuación superior a la media de tres ejecuciones de Claude Mythos Preview en la misma escala, por unos seis centavos por dólar. Para cualquiera que se guardara este modelo a finales de agosto como «el barato», hoy las cuentas no son las mismas que entonces, y el titular honesto es mixto: la economía del servicio mejoró de verdad, el precio subió porque terminó una promoción, la cifra de inteligencia que tanto se cita no sobrevivió al primer contacto con un arnés independiente, y la comparación de capacidades que sí favoreció al modelo es una única ejecución sin revisión por pares cuyos propios autores dicen que no debería interpretarse en exceso.
Zhipu es la única fuente del tamaño del clúster, el cronograma de dos semanas y el 3.2x — no hay una auditoría independiente de ninguno de ellos, y la propia compañía dice que no ha logrado la automejora recursiva, describiendo el resultado como un bucle de escala mínima en lugar de lo real. Lo que se puede verificar, lo verificamos: el único artefacto concreto en el informe que vive fuera de los muros de Zhipu — una corrección de precisión en un kernel de Flash Linear Attention — está genuinamente fusionado en el upstream, y lo confirmamos. Cuando una cifra a continuación proviene de Zhipu, lo dice. Cuando proviene de Artificial Analysis, dice eso en su lugar. Cuando proviene de Generality Labs — el equipo de evaluación de seguridad detrás de las cifras de exploit en este artículo — dice eso, junto con las salvedades que sus autores adjuntaron ellos mismos: una ejecución, 41 errores, un método autopublicado, ninguna reproducción por terceros, y una cuestión de contaminación que plantean por iniciativa propia. Cuando una cifra es de Anthropic — las únicas cifras aquí que provienen de un laboratorio con un interés competitivo en la respuesta — el cuerpo dice qué modelo midió realmente, porque no todas provienen de este.
Lo que realmente se envió
GLM-5.3-Flash es un modelo de mezcla de expertos de 320B totales / 18B activos con 45 capas, lo que sitúa su huella activa un poco por encima de la mitad de los aproximadamente 32B de GLM-5.2. Su capacidad más destacada es la modalidad: acepta de forma nativa entradas de texto, imagen y vídeo —el primer modelo GLM-5 en hacerlo— en lugar de canalizar la visión a través de un adaptador independiente. El contexto llega hasta 1 millón de tokens, y Zhipu afirma que el coste de servicio con contexto largo se sitúa en aproximadamente un tercio del de GLM-5.3.
En cuanto a la arquitectura, Zhipu lo describe como el primer modelo de frontera de código abierto que combina atención híbrida dispersa más lineal con Manifold-Constrained Hyper-Connections (mHC) para el escalado y un mecanismo IndexPool que comprime cuatro vectores de clave del indexador en un único pool ponderado para reducir la latencia en contextos largos. El preentrenamiento se realizó sobre un corpus multimodal de 30 billones de tokens. Nada de eso ha sido auditado de forma independiente —es Zhipu describiendo su propio modelo—, pero las afirmaciones sobre eficiencia de servicio son lo bastante específicas como para probarlas ahora que los pesos están frente a la pila de inferencia de código abierto, y el informe del 17 de septiembre añade la primera imagen detallada de cómo se construyó realmente el lado del servicio.
La hoja de especificaciones del día de lanzamiento, de un vistazo:
• Parámetros — 320B en total / 18B activos, 45 capas, MoE.
• Modalidad — entrada nativa de texto, imagen y vídeo; salida de texto.
• Ventana de contexto — hasta 1,000,000 de tokens.
• Licencia — MIT, pesos abiertos en Hugging Face desde el día del lanzamiento.
• Precio — $0.15 / $0.50 por millón de tokens (entrada / salida), $0.03 por millón de entrada en caché.

Esa tarjeta es una instantánea del día del lanzamiento, y dos de sus filas han cambiado desde el 26 de agosto. La cifra del AA Index sigue siendo una afirmación propia de Zhipu y ahora la contradice una medición independiente; más sobre eso abajo. El precio con descuento que muestra ya no está; la promoción terminó el 9 de septiembre. Los recuentos de parámetros, la ventana de contexto, la licencia y la modalidad son hechos actuales sin cambios, y son para lo que sirve principalmente la imagen.
La semana de Ox Alpha, y lo que realmente estaba poniendo a prueba el sorteo gratuito
La revelación puso fin a una semana de especulación. El 20 de agosto, un modelo anónimo apareció en una plataforma de API de IA de terceros con una ventana de contexto de 1 millón de tokens, entrada de texto/imagen/vídeo y un precio de cero, y pronto se convirtió en el modelo más invocado de las listas semanales de esa plataforma. La comunidad logró identificar mediante huella digital que pertenecía a la familia GLM de Zhipu en un plazo de 48 horas —el mismo patrón de anonimato seguido de reivindicación que ya había permitido identificar modelos de otros laboratorios chinos—, y los analistas conjeturaron en general que se trataba de una variante Flash de GLM-5.3. El anuncio del 26 de agosto confirmó la conjetura: la semana gratuita fue una prueba intencional, y la empresa afirma que la ejecución anónima movió más de 62 billones de tokens en seis días en las plataformas de programación donde se ofreció, todo ello servido desde chips chinos de fabricación nacional.
Esa última cláusula parecía una nota al pie en aquel momento. Resultó ser lo esencial. La semana gratuita no era principalmente un truco de marketing ni siquiera una prueba de carga del modelo; era una prueba de carga de la flota de aceleradores que lo sustentaba, ejecutada a una escala en la que un fallo habría sido público y gratuito. Tres semanas después, Zhipu describe esa misma flota como la que soporta el 100 % del tráfico de producción del modelo.

La lógica de precios de esa semana sigue en pie, con una corrección. Un modelo que se regaló a $0 durante una semana y luego se lanzó a una décima parte de la tarifa del buque insignia con un 50 % de descuento adicional fue un movimiento deliberado de creación de mercado en la gama económica, y el calificativo "por tiempo limitado" siempre fue la parte a vigilar. Lo señalamos como algo que podía revertirse. Se revirtió según lo previsto, lo cual vale la pena decir sin rodeos, porque el vencimiento del descuento es el único cambio de esta historia que aparece en una factura.
La pila de servicio que reconstruyó un agente
El informe técnico del 17 de septiembre de Zhipu es la primera descripción detallada de cómo se sirve GLM-5.3-Flash sobre silicio chino, y su afirmación central es que un modelo ayudó a optimizar el sistema que lo ejecuta. La empresa llama a este mecanismo retroalimentación densa: las pruebas de corrección, los registros de ejecución, las trazas, los microbenchmarks y las métricas de extremo a extremo se conectaron para que un agente pudiera validar una hipótesis localmente en lugar de esperar un despliegue completo y una prueba de carga después de cada cambio. Para que eso funcionara, Zhipu afirma que la retroalimentación tenía que ser local, barata y comprobable objetivamente —vinculada a un kernel o una ruta de código específicos, lo suficientemente rápida para iterar sobre ella, y verdadera o falsa sin un humano en el bucle.
Con ese bucle implementado, el agente encontró y corrigió tres cosas que la empresa ha descrito en detalle:
• Una ruta paralela de contexto en el kernel KDA estaba perdiendo precisión a medida que las secuencias crecían, porque tl.dot usaba TF32 de forma predeterminada a pesar de tener entradas FP32, lo que agravaba el error de redondeo con la longitud del contexto. La corrección fija la precisión de entrada en tf32x3, con una alternativa a ieee en plataformas sin soporte para TF32. Esta es la más interesante de las tres, porque es la única afirmación del informe que sale de la propia infraestructura de Zhipu: el cambio está fusionado en el upstream de Flash Linear Attention como PR #1180, que comprobamos y confirmamos como fusionado el 27 de agosto de 2026.
• La transferencia KV no se solapaba con la planificación de DeepEP. Ni el dispatch intranodo ni el combine intranodo liberaban el GIL de Python en la versión de DeepEP que se estaba usando, lo que dejaba atascado el hilo de transferencia detrás de ellos; los relatos en inglés y en chino del mismo informe situaban la sobrecarga resultante por encima del 20 % y del 30 %, respectivamente. Tras la corrección, Zhipu afirma que la brecha frente a su línea base de solo prefill cayó por debajo del 1 %.
• Un kernel de decodificación recalculaba la misma normalización FP32 y el mismo gating cuatro veces, una por cada tile de la dimensión V. Dividir el trabajo de la división redujo el tiempo del kernel un 9,6 %, y fusionar los tiles en un único bloque de hilos —de modo que la normalización se ejecuta una sola vez— produjo una aceleración de 1,71x.
Alrededor de esas correcciones están los cambios estructurales: ReplaySSM, que intercambia cómputo por memoria en chip porque los aceleradores tienen menos de esta que las GPU para las que se escribió originalmente la pila; paralelismo tensorial intra-nodo para aliviar la misma presión; almacenamiento en caché mixto INT8, FP8 y BF16 para ampliar la capacidad; y una arquitectura desagregada Encode-Prefill-Decode que programa las tres etapas de inferencia por separado en lugar de como una sola canalización. Zhipu también nombra las limitaciones con honestidad —memoria en chip y ancho de banda de interconexión limitados, software inmaduro, cobertura incompleta de kernels y documentación escasa— y afirma que no ha logrado la automejora recursiva, y describe el resultado como un bucle a escala mínima.
Lee el relato con escepticismo, porque los incentivos son obvios. Zhipu no dirá qué parte del trabajo la hizo el agente y qué parte los ingenieros, y no hay una auditoría externa de la cifra de rendimiento, el cronograma de dos semanas ni el tamaño del clúster. La formulación de retroalimentación densa también es interesada de una forma concreta: hace que la afirmación que más impresionante suena («nuestro modelo se mejoró a sí mismo») se apoye en la evidencia menos verificable (un bucle interno que nadie puede inspeccionar). Lo que impide que la historia sea puro marketing es que su afirmación más concreta es falsable y resulta ser cierta: la corrección del kernel tf32x3 realmente está en el repositorio upstream, fechada el 27 de agosto, tres semanas antes del ciclo de prensa en torno a ella.
Lo que cuesta, en dólares reales
La tarifa es de Zhipu y es simple: $0,15 por millón de tokens de entrada, $0,50 por millón de tokens de salida y $0,03 por millón de tokens de entrada en caché. Ese es el precio de lista a fecha de hoy. La promoción de lanzamiento con un 50 % de descuento estuvo vigente hasta el 9 de septiembre de 2026 y no se prorrogó, por lo que las cifras de $0,075 / $0,25 / $0,015 que circularon ampliamente a finales de agosto ya no están disponibles en la propia API del proveedor. Frente a los $1,40 / $4,40 publicados de GLM-5.3, el Flash sigue situándose en aproximadamente una décima parte del precio de lista: el descuento era un extra añadido a un precio que ya era lo esencial, no el precio en sí. Artificial Analysis calcula una tarifa combinada de aproximadamente $0,10 por millón de tokens con una mezcla 7:2:1 de aciertos de caché/entrada/salida, y registra una velocidad de salida de aproximadamente 117 tokens por segundo, que describe como notablemente rápida, aunque AA señala que las cifras de velocidad describen la API propia del modelo en lugar de una prueba realizada por AA.
La historia de costos más amplia de Zhipu es la razón por la que el precio puede mantenerse ahí. En sus resultados semestrales, publicados el 31 de agosto, la compañía dijo que el costo de inferencia por token unitario en su flota nacional de 100,000 aceleradores había caído 80% desde principios de 2026, y que el margen bruto de API pasó de -0.4% a 24.6% como resultado de la escala, los precios y un servicio más barato. Son cifras de una compañía que reporta a sus accionistas y no están auditadas por nosotros; trátelas como claramente orientativas, no como precisas. La explicación del servicio anterior es el mecanismo detrás de la afirmación —menos pases redundantes de kernel, menos presión de memoria, mejor superposición—, lo cual es una historia más creíble que un porcentaje a secas, aunque el porcentaje sea el que se citará.
Las afirmaciones de eficiencia frente al modelo insignia no han cambiado: el cómputo de atención se reduce 3,0x y la caché KV 4,4x en comparación con GLM-5.3, según el proveedor, y Zhipu admite que su caché KV sigue siendo ligeramente mayor que la de DeepSeek V4 Flash y la de Kimi K3. La afirmación hecha en el lanzamiento sobre una mejora de 3x en el servicio de extremo a extremo con chips nacionales ahora se presenta como 3,2x, medida desde el primer arranque hasta el tráfico de producción pleno. Ambas cifras son de Zhipu, y los dos recuentos que las contienen están separados por tres semanas: nada de esto se ha reproducido fuera de la empresa.
Por qué importa la revelación — y adónde fue a parar la cifra principal
Esta es la corrección que más importa a cualquiera que haya leído la cobertura del lanzamiento y se haya quedado con la cifra. Los materiales de Zhipu sitúan a GLM-5.3-Flash en 57 en el Artificial Analysis Intelligence Index, a la par de Claude Opus 4.8. Desde entonces, Artificial Analysis ha publicado su propia medición del modelo en Intelligence Index v4.3, y esta arroja 42 — frente a 47 de GPT-5.6 Sol (max) en la misma versión. El 57 nunca fue una cifra independiente; era de Zhipu, y la medición independiente sitúa al modelo unos cinco puntos por debajo de la banda cercana a la frontera y muy por debajo de la cifra titular del proveedor. En el mismo índice actual, GLM-5.3 mide 45, por lo que la cifra de 60 para el buque insignia que apareció en nuestra cobertura del lanzamiento ya no coincide con lo que Artificial Analysis publica hoy. La brecha de 15 puntos entre la afirmación y la medición no es una diferencia de redondeo, y es lo más útil que un lector puede extraer de esta actualización — con una salvedad que añade la sección siguiente, porque la segunda medición independiente de este artículo apunta en sentido contrario.
Lo que sobrevive a esa corrección es más limitado, pero sigue siendo real. GLM-5.3-Flash es un modelo multimodal de pesos abiertos con 1M de contexto y entrada nativa de imagen y vídeo a aproximadamente una décima parte del precio de lista de su hermano insignia —una combinación sin equivalente directo entre los laboratorios de frontera de EE. UU., cuyos modelos multimodales comparables cuestan bastante más y se lanzan como cerrados. El propio planteamiento de Zhipu, «inteligencia de frontera, coste flash», es la parte que se llevó el golpe: con una puntuación medida de 42, es un modelo económico sólido, no uno de frontera con descuento. Las mediciones independientes también lo sitúan cómodamente por encima de la mediana de los modelos de pesos abiertos de tamaño similar, lo cual es un logro real para un modelo de 18B activos con una décima parte del coste de inferencia; simplemente es un logro distinto del que daba a entender la cobertura del lanzamiento.
El otro número independiente — y salió a favor del modelo
Si el resultado de Artificial Analysis hizo bajar un escalón a GLM-5.3-Flash, este va en la dirección opuesta, y es el hecho más extraño de la historia. ExploitBench, desarrollado en Carnegie Mellon, no pregunta si un modelo puede hacer caer un objetivo. Puntúa el ascenso: llegar al código vulnerable, desencadenar el bug, construir primitivas reutilizables y, por último, el secuestro completo del flujo de control con ejecución de código arbitrario, evaluado mecánicamente contra V8 de producción con el sandbox de seguridad activado. Generality Labs ejecutó GLM-5.3-Flash en 41 bugs con un presupuesto de mil millones de tokens por bug en lugar del límite habitual de 300 turnos del benchmark, con el argumento de que los turnos son un mal proxy de lo que un comprador gasta en realidad y que los dólares son la restricción honesta. GLM-5.3-Flash alcanzó ejecución de código arbitrario completa en 13 de los 41, y una puntuación media de capacidad del 64,8 % del máximo de la escala. Las tres ejecuciones publicadas de Claude Mythos Preview obtuvieron 9, 10 y 11 en la misma escala: una media de 10, o 62,2 %. El propio planteamiento de Generality, impreso bajo el gráfico, es que GLM-5.3-Flash «puede estar al nivel de Mythos en ciberseguridad» en esta medición. La propia ejecución de ExploitBench de Anthropic, publicada el 29 de septiembre, informa del mismo orden con tasas absolutas mucho más bajas —aunque sobre el GLM-5.3 insignia, no sobre el Flash: cuenta exploits de extremo a extremo por intento en lugar de progreso en la escala, y sitúa a GLM-5.3 en 50 de 410 frente a los 56 de 410 de Mythos Preview. Distinta regla de conteo, orden similar —que es exactamente por lo que una cifra de ExploitBench nunca debería citarse sin la regla adjunta.
La razón por la que importa es el denominador que subyace. La ejecución valoró los tokens de salida de GLM-5.3-Flash en $0.25 por millón —su tarifa de lanzamiento con un 50 % de descuento, que ya expiró— frente a los $125 por millón históricos de Claude Mythos Preview, una brecha de 500 veces. En paridad de costos, la ejecución gastó $16.81 por vulnerabilidad frente a los $297.17 de Mythos, que es de donde surge la cifra de aproximadamente el 6 %. Lea la afirmación con atención, porque la versión que circula es la incorrecta. No se trata de que GLM-5.3-Flash sea un mejor desarrollador de exploits que Claude Mythos Preview. Se trata de que un dólar de tokens de GLM-5.3-Flash compra aproximadamente lo mismo que compra un dólar de tokens de Mythos en esta tarea específica, y de que usted puede permitirse muchos más dólares del primero.
Las propias salvedades de Generality valen más que el titular. Dicen claramente que una sola ejecución no establece paridad en todo el ámbito ciber, que la contaminación es una cuestión abierta —puede que se haya entrenado contra ExploitBench de alguna manera— y que cuatro de las 41 muestras dieron error y se puntuaron arrastrando el último resultado observado, lo que, si acaso, subestima el modelo. También publicaron un seguimiento el 28 de septiembre que complica toda la comparación. Al ejecutar GLM-5.3-Flash en siete harness de agentes distintos con un presupuesto de 250 millones de tokens, en diez muestras seleccionadas para abarcar el rango de dificultad, los mismos pesos obtuvieron 10.6 con el harness Codex —por encima de la referencia de 10.02 de Claude Mythos Preview— y 6.2 con el harness Claude Code, por debajo incluso de la configuración original limitada por turnos del benchmark, con 6.4. El harness movió la puntuación más de lo que lo hizo la comparación de modelos, y los autores dicen que el subconjunto de diez muestras probablemente no sea representativo. Que el gráfico circulara ampliamente el 2 de octubre con el argumento de que el escalado de cómputo en tiempo de prueba está borrando las diferencias entre niveles de modelos es una afirmación sobre la industria, no un hallazgo de la evaluación: lo que encontró la evaluación es que un modelo abierto y barato, al que se le da presupuesto en lugar de un límite de turnos, puede alcanzar al especialista en exploits de un laboratorio de frontera en una misma clasificación.
Ya no es la historia de un solo laboratorio. La propia evaluación del Frontier Red Team de Anthropic, publicada el 29 de septiembre, ejecutó GLM-5.3-Flash —el hermano menor— en una sesión con intervención humana: tras entregarle detalles públicos de una vulnerabilidad de Chrome ya parcheada más otra, sin instrucciones significativas, el modelo las encadenó hasta formar un exploit fiable de ARM64 que eludió el endurecimiento de la autenticación de punteros, en 20 minutos de atención humana y ocho horas de trabajo del modelo —20,40 USD a las tarifas de API de Zhipu. Esa misma evaluación es la fuente de la cifra de 50 de 410 de ExploitBench mencionada arriba, y esa parte midió GLM-5.3, el modelo insignia de 743B, no el Flash —una distinción que la cobertura del informe ha difuminado en gran medida. Dos partes independientes, arneses distintos, presupuestos distintos, la misma dirección. Ambas son además ejecuciones de un solo laboratorio y ninguna es un resultado reproducido, y solo la ejecución de Generality reporta una cifra en dólares para el Flash en lugar de para el modelo insignia. La lectura práctica es la que Anthropic declara sin rodeos: los pesos son descargables, la abliteración de GLM-5.3-Flash tomó aproximadamente 600 horas de GPU, y un modelo que cuesta menos de un dólar por hora de ejecución es un tipo distinto de problema de disponibilidad que uno detrás de un programa de verificación.
Pruébalo, y cómo encaja la capa de enrutamiento
El acceso es sencillo. La propia API de Zhipu lo sirve a la tarifa de lista indicada arriba; los pesos con licencia MIT están en Hugging Face, en zai-org/GLM-5.3-Flash, en FP8 y BF16; y los productos de codificación de Zhipu —ZCode y el GLM Coding Plan— lo incluyen. Para el autoalojamiento, tanto vLLM como SGLang lo admiten. Dos notas prácticas si optas por esa vía: el recetario de SGLang incluye una advertencia sobre un cambio abierto según la cual la entrada de visión puede descartarse silenciosamente en compilaciones de transformers anteriores a la 5.13, lo cual no generará ningún error y simplemente te dará una lectura solo de texto de una solicitud de imagen; y la ruta de AMD todavía no es una receta. El pull request original de habilitación de gfx950 para el día del lanzamiento (sgl-project/sglang #37653) se cerró sin fusionarse el 6 de septiembre y fue reemplazado por un conjunto más amplio de pull requests de día cero para gfx950 —mHC a través de AITER, el indexador DSA de k-pool, y el servicio de FP8 y MXFP4—, varios de los cuales seguían abiertos el 17 de septiembre. La habilitación en hardware de la clase MI350X está en curso, no disponible, y todavía no existe ninguna cifra independiente de rendimiento de AMD.
En lo que respecta al enrutamiento, la situación ha cambiado desde el lanzamiento: GLM-5.3-Flash ya forma parte del catálogo de OrcaRouter, junto con el resto de la línea GLM. Nosotros trasladamos el precio de lista del proveedor con un 0 % de margen y sin recargo del enrutador, que es exactamente el mecanismo que importa para un modelo cuyo precio acaba de cambiar: el descuento que vence del lado de Zhipu es el precio que pagas aquí, el mismo día, sin un segundo contrato que renegociar y sin cambios en el código. Ese traspaso directo corta en ambos sentidos, y merece la pena decirlo con claridad: una promoción vencida es un aumento real del precio en tu factura, y ocurre aquí en el mismo momento en que ocurre en origen. Si estás sopesando el Flash frente a GLM-5.3 u otro modelo económico, ambos están detrás de una sola clave con conmutación por error automática entre proveedores, que es la forma barata de probar un modelo cuyas puntuaciones independientes aún se están asentando sin apostar por él una ruta de producción. También es la forma adecuada para el resultado anterior, y por una razón más contundente que la conveniencia: los mismos pesos obtuvieron 10.6 o 6.2 en el mismo benchmark según qué arnés de agente los impulsara, así que lo que un comprador prueba en realidad es una combinación de andamiaje más modelo, y cambiar el modelo detrás de un andamiaje fijo bajo una sola clave es más barato que comprometerse con cualquiera de los dos.

Qué ver a continuación
Cuatro cosas definen el resto de esta historia. Primero, si el 42 se mueve: el modelo ha estado en amplio uso público desde agosto, así que si la evaluación interna de Zhipu y el arnés de AA discrepan por una razón estructural —contabilidad de tokens de razonamiento, verbosidad, una evaluación que el proveedor ponderó mucho—, eso debería aparecer a medida que se revise el índice en lugar de como una brecha puntual. Segundo, si el resultado del exploit se reproduce. Generality Labs ejecutó 41 bugs una vez, con su propio arnés, y lo dice; el seguimiento del arnés muestra que los mismos pesos se mueven cuatro puntos solo por la elección de arnés, así que el número que lo resolvería es que un segundo equipo vuelva a ejecutar los 41 con el presupuesto fijado en dólares y el arnés mantenido constante. Tercero, si el relato del silicio nacional consigue una segunda fuente. Zhipu es la única parte capaz de afirmar el tamaño del clúster, el cronograma de dos semanas y el 3,2x, y la única afirmación verificable de forma independiente que contiene —la corrección del kernel fusionado— es pequeña. Cuarto, el precio: el descuento se acabó, y la pregunta interesante es si vuelve como promoción cuando Zhipu necesite volumen, o si la tarifa de lista es ahora el piso.
El hilo conductor es que a GLM-5.3-Flash se le pide demostrar dos cosas distintas a la vez —que un modelo barato puede ser lo bastante bueno y que los aceleradores chinos pueden servirlo a escala—, y la divulgación del 17 de septiembre es la respuesta de Zhipu a la segunda pregunta, entregada por un modelo que ayudó a escribirla. La primera pregunta ahora tiene dos cifras independientes asociadas y apuntan en direcciones opuestas: un 42 en el índice de inteligencia, muy por debajo del dato destacado del proveedor, y una ejecución de exploit que queda al mismo nivel que el especialista de un laboratorio de frontera a una vigésima parte del costo. Ambas pueden ser ciertas a la vez, y la brecha entre ellas —no una u otra cifra— es donde en realidad se toman las decisiones.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
