
GLM-5.3-Flash Revelado: El Anónimo "Ox Alpha" Era el Modelo Multimodal de Frontera Abierto de Zhipu Todo el Tiempo
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
El modelo que pasó una semana en lo más alto de las tablas de uso de plataformas de codificación de terceros por fin tiene nombre y precio. El 26 de agosto de 2026, Zhipu AI confirmó que el modelo gratuito "Ox Alpha" que los desarrolladores habían estado usando intensamente desde el 20 de agosto es GLM-5.3-Flash — un modelo de mezcla de expertos de 320 mil millones totales y 18 mil millones activos (320B-A18B), el primer lanzamiento nativamente multimodal de la serie GLM-5, y uno de los modelos de nivel frontera más económicos en cualquier tarifario en su lanzamiento. Zhipu está fijando el precio de GLM-5.3-Flash en una décima parte de la tarifa API de su buque insignia GLM-5.3, o una vigésima parte durante un descuento por tiempo limitado, y los pesos abiertos — con licencia MIT — llegaron a Hugging Face el mismo día. A diferencia de GLM-5.3, cuyos pesos aún se esperan para fin de mes, este modelo es algo que puedes alojar por tu cuenta esta semana, no la próxima.
Esta es la versión corta: Zhipu publicó en código abierto su modelo grande más económico hasta la fecha; supera a su propio GLM-5.2 en los benchmarks a pesar de ejecutar solo una fracción de los parámetros activos, y el proveedor sitúa su puntuación en el Artificial Analysis Intelligence Index en 57, lo que iguala a Claude Opus 4.8, según los materiales de lanzamiento de Zhipu. Cada cifra de benchmark asociada a este lanzamiento es reportada por el proveedor y no ha sido reproducida de forma independiente al momento de escribir esto; los precios y los recuentos de parámetros son hechos actuales.
Lo que realmente se envió
GLM-5.3-Flash es un MoE de 320B en total / 18B activos con 45 capas, lo que sitúa su huella activa en un poco más de la mitad de los ~32B parámetros activos de GLM-5.2. La capacidad principal es la multimodalidad: acepta nativamente entrada de texto, imagen y video — el primer modelo GLM-5 en hacerlo — en lugar de enrutar la visión a través de un adaptador separado. El contexto llega a 1 millón de tokens, y Zhipu afirma que el costo de servicio de contexto largo se sitúa en aproximadamente un tercio del de GLM-5.3.
En el aspecto de la arquitectura, Zhipu lo describe como el primer modelo frontera de código abierto en utilizar un diseño híbrido de atención dispersa más atención lineal, junto con Conexiones Hiperrestrictivas con Restricción de Variedad (mHC) para el escalado y un mecanismo IndexPool que comprime cuatro vectores de clave de indexador en un grupo ponderado para reducir la latencia de contexto largo. El preentrenamiento se realizó sobre un corpus multimodal de 30 billones de tokens. Nada de esto está auditado de forma independiente todavía — es la descripción de Zhipu de su propio modelo — pero las afirmaciones sobre eficiencia de servicio son lo suficientemente específicas como para probarlas una vez que los pesos estén frente a la pila de inferencia de código abierto.
La hoja de especificaciones del día de lanzamiento, de un vistazo:
• Parámetros — 320B en total / 18B activos, 45 capas, MoE.
• Modalidad — entrada nativa de texto, imagen y video; salida de texto.
• Ventana de contexto — hasta 1,000,000 de tokens.
• Licencia — MIT, pesos abiertos disponibles en Hugging Face en el lanzamiento.
• Precio: $0,15 / $0,50 por millón de tokens (entrada / salida), $0,03 por millón de entrada almacenada en caché; una promoción con 50% de descuento hasta el 9 de septiembre de 2026 lo reduce a $0,075 / $0,25 / $0,015. A precio de lista, eso es aproximadamente una décima parte de los $1,40 / $4,40 de GLM-5.3.

La semana Ox Alpha
La revelación cierra una semana de especulación. El 20 de agosto, un modelo anónimo apareció en una plataforma de API de IA de terceros con una ventana de contexto de 1 millón de tokens, entrada de texto/imagen/video y un precio de cero, y rápidamente se convirtió en el modelo con más llamadas en las listas semanales de la plataforma. La comunidad lo identificó como parte de la familia GLM de Zhipu en 48 horas — el mismo patrón de anónimo-y-luego-reclamado que había identificado previamente a modelos de otros laboratorios chinos — y los analistas especularon ampliamente que se trataba de un GLM-5.3 variante Flash. El anuncio del 26 de agosto confirmó la suposición y añadió el detalle de que la semana gratuita fue una prueba intencional: Zhipu afirma que la ejecución anónima batió récords de volumen de llamadas en las plataformas de codificación donde se ofreció, con todo el tráfico servido desde chips chinos domésticos.
Ese contexto de semana gratuita importa para las expectativas de precios. Un modelo regalado a $0 durante una semana, y luego lanzado a una décima parte de la tarifa del modelo insignia con un descuento temporal de una vigésima parte del precio, es un movimiento deliberado de creación de mercado en el segmento económico — y el calificador de "tiempo limitado" es la parte a observar. El descuento es una decisión de precios que puede revertirse; los pesos abiertos MIT no.

Lo que cuesta, en dólares reales
La tarifa de Zhipu ya está disponible en dólares reales, no solo en ratios: $0.15 por millón de tokens de entrada, $0.50 por millón de tokens de salida y $0.03 por millón de tokens de entrada en caché. Frente a los $1.40 / $4.40 publicados de GLM-5.3, eso supone aproximadamente una décima parte al precio de lista, y una promoción de lanzamiento con un 50% de descuento vigente hasta el 9 de septiembre de 2026 la reduce a $0.075 / $0.25 / $0.015, aproximadamente una veinteava parte. Zhipu también sitúa el coste del modelo por tarea del AA Intelligence Index en unos $0.045, según datos del proveedor, que es la cifra que respalda el encuadre de "1/40 de Opus 4.8". Para un modelo que puntúa en la misma franja que modelos con un precio 10–40 veces superior, las cifras principales son reales; la letra pequeña es que el descuento de lanzamiento es temporal y el coste por tarea depende de lo verboso que resulte el modelo en producción.
{{1}}La historia de la eficiencia es de donde Zhipu afirma que proviene la ventaja de costos.{{/1}} {{2}}Frente a GLM-5.3, el proveedor reporta un cómputo de atención 3,0 veces menor y una caché KV 4,4 veces menor, y afirma tener el cómputo de atención más bajo entre los modelos de gama económica comparados (GLM-5.3, DeepSeek V4 Flash y Kimi K3), aunque admite que su caché KV sigue siendo ligeramente mayor que la de DeepSeek V4 Flash y la de Kimi K3.{{/2}} {{3}}En el lado del servicio, Zhipu reporta una mejora de 3 veces en el rendimiento de servicio de extremo a extremo sobre la línea base en chips chinos domésticos, alcanzando un costo por token que califica de comparable al de las GPU NVIDIA convencionales.{{/3}} {{4}}Todos esos datos provienen del proveedor y ninguno ha sido reproducido de forma independiente todavía; son los números correctos para contrastar con los pesos abiertos.{{/4}}
Por qué importa la revelación
Dejando de lado los benchmarks, el lanzamiento sigue cambiando el panorama de los modelos abiertos de dos maneras. Primero, es un modelo multimodal de pesos abiertos en la gama frontera a un precio asequible: la combinación de licencia MIT, contexto de 1M, entrada nativa de imagen/video y un costo de céntimos de un solo dígito por tarea no tiene equivalente directo en los laboratorios frontera de EE. UU., cuyos modelos multimodales equivalentes cuestan un orden de magnitud más y se distribuyen cerrados. Segundo, socava al propio buque insignia de Zhipu: GLM-5.3 es el modelo de 743B que obtuvo una puntuación de 60 medida de forma independiente en el AA Intelligence Index este mes, y GLM-5.3-Flash se posiciona como "inteligencia fronteriza, costo flash" frente a esa misma familia. La narrativa de Zhipu es que un modelo más pequeño y barato puede capturar la mayor parte de la capacidad del buque insignia, lo cual, si las afirmaciones del proveedor sobre codificación y capacidades de agente se sostienen, es el mismo argumento de la economía post-entrenamiento que la industria ha estado dando vueltas todo el año.
Una salvedad mantiene esto en perspectiva. La puntuación de 57 en el índice AA de GLM-5.3-Flash proviene de los materiales de lanzamiento de Zhipu, aún no del leaderboard de Artificial Analysis, y la comparación de codificación con Claude Opus 4.8 proviene de la evaluación interna de Zhipu mediante su Z.ai Code Bench. Trata el 57 y la paridad de codificación como afirmaciones hasta que llegue una medición independiente: el modelo fue ampliamente probado de forma anónima, por lo que los datos de terceros deberían llegar rápidamente.
Pruébalo, y cómo encaja la capa de enrutamiento
El acceso desde el primer día se realiza a través de la API propia de Zhipu, los pesos abiertos en Hugging Face (zai-org/GLM-5.3-Flash, MIT) y los productos de codificación de Zhipu: ZCode y el GLM Coding Plan, que incluye un lote de tarjetas de experiencia diarias. Para el autoalojamiento, la licencia MIT junto con el soporte de vLLM y SGLang hace que las afirmaciones sobre la eficiencia de servicio mencionadas anteriormente se puedan verificar directamente.
En el lado del enrutamiento, GLM-5.3-Flash todavía no está en la lista de OrcaRouter a partir de esta actualización. El resto de la familia GLM sí lo está: GLM-5.3 se activó en nuestro lado el mismo día en que se abrió la API de Zhipu, al precio de lista de Zhipu con un margen del 0% trasladado. Ese traslado es exactamente el mecanismo que importa para un lanzamiento como este: un cambio de precio del proveedor, ya sea que el descuento se mantenga o que la tabla de tarifas se ajuste más tarde, se refleja en nuestro lado el mismo día, sin renegociación. Si quieres ejecutar Flash junto con el resto de la línea GLM con una sola clave cuando esté disponible, esa es la configuración; hasta entonces, los pesos en Hugging Face son la forma más rápida de probarlo por ti mismo.

Qué ver a continuación
Tres cosas definirán la verdadera historia en las próximas dos semanas. Primero, una medición independiente de Artificial Analysis del 57: el modelo ya estaba en producción como Ox Alpha, por lo que la tabla de clasificación debería ponerse al día rápidamente. Segundo, si la promoción del 50% de descuento —actualmente programada para terminar el 9 de septiembre de 2026— se extiende más allá de esa fecha, ya que eso decide el costo de estado estable del Flash. Tercero, los pesos de GLM-5.3, aún prometidos para alrededor del 28 de agosto, la misma semana en que se publicaron los pesos MIT del Flash, lo que daría a la comunidad de pesos abiertos dos niveles de la misma familia para comparar a la vez.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
