
Ox Alpha: La hoja de especificaciones completa del modelo encubierto que ahora se distribuye como GLM-5.3-Flash
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 316 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Ox Alpha es el nombre anónimo con el que GLM-5.3-Flash se previsualizó, se reveló el 26 de agosto de 2026, y no es un modelo que puedas invocar hoy. El listado de vista previa que llevaba el nombre Ox Alpha ya no lo sirve; el modelo subyacente tiene una página del proveedor, pesos con licencia MIT, una tarifa publicada y una superficie de API documentada, todo ello de Z.ai. Esta página es la referencia de ese modelo — la envolvente, las modalidades, la tarifa, la superficie de endpoints, cada cifra de benchmark publicada con la revisión o el arnés asociados, y, como el alias todavía devuelve un resultado de búsqueda escaso y confuso, una declaración clara de lo que no está documentado en ninguna parte. Todo lo que aparece a continuación se leyó el 28 de septiembre de 2026 en la propia documentación del modelo y la página de precios de Z.ai, en la ficha del modelo de Z.ai en Hugging Face, en Artificial Analysis y en nuestro propio catálogo; las cifras que publica el proveedor y las que mide un tercero independiente se etiquetan por separado, y nada de lo aquí expuesto se infiere de una semejanza.
A qué se refiere hoy el nombre Ox Alpha
El alias está retirado, y el proveedor es quien lo retiró. La propia documentación de Z.ai para GLM-5.3-Flash indica que el modelo se probó de forma anónima bajo el nombre ox-alpha antes de su lanzamiento, para recopilar comentarios de los usuarios, y que la prueba anónima se convirtió en el modelo más popular de esa semana. Los anclajes fechables son breves y específicos: el listado encubierto mostraba a Ox Alpha como lanzado el 20 de agosto de 2026, y la revelación llegó el 26 de agosto —la misma fecha que figura en la página de documentación de Z.ai y la misma fecha de lanzamiento que nuestro propio catálogo registra para z-ai/glm-5.3-flash.
De eso se desprenden dos cosas, y ambas importan a un lector que buscó el nombre.
• El alias no es una ruta. Nuestro catálogo devuelve «model not found» para una búsqueda de stealth/ox-alpha, consultado el 2026-09-28. No hay nada que llamar bajo ese nombre, porque el producto del proveedor lleva el nombre del proveedor.
• Tampoco hay ningún repositorio de pesos propiedad del proveedor bajo ese alias. Buscar ox-alpha en Hugging Face devuelve subidas de la comunidad creadas durante el periodo de sigilo de finales de agosto de 2026, además de un repositorio solo de tarjeta del 27 de septiembre de 2026 que no contiene pesos y apunta a la versión oficial de Z.ai. El nombre de un repositorio es una etiqueta que eligió quien lo subió; no es documentación de nada. La propia organización de Z.ai publica el modelo como zai-org/GLM-5.3-Flash, con el repositorio creado el 2026-08-25 en UTC.
La pregunta sobre el proveedor que dominó la semana anónima está cerrada, y se cerró de la manera habitual: un laboratorio dio un paso al frente y puso su nombre en el modelo. Lo que queda es una especificación, que es lo que cubre esta página. La historia del descubrimiento —la identificación mediante huellas que precedió a la revelación, el linaje de modelos anónimos al que pertenece y la divulgación del hardware de servicio que la acompañó— está en nuestro artículo anterior sobre la investigación de Ox Alpha, y esta página no vuelve a discutir nada de eso.
El sobre, tal como lo documenta el proveedor.

Estas son cifras reportadas por Z.ai, leídas de la propia página de documentación del proveedor el 28 de septiembre de 2026, y tres de las cuatro dimensiones de la envolvente están corroboradas de forma independiente: el registro del modelo de Artificial Analysis incluye los mismos 320B totales, 18B activos, contexto de 1.000.000 de tokens y licencia MIT, y nuestra propia ficha de catálogo incluye los límites de contexto y salida.
• Ventana de contexto — 1,000,000 tokens (documentación de Z.ai; Artificial Analysis; nuestra propia ficha de catálogo, que indica 1,000,000)
• Salida máxima — 128K tokens (documentación de Z.ai); nuestra ficha registra 128.000
• Entrada — texto, imagen, video y archivo (documentación de Z.ai, consultada el 2026-09-28); nuestra tarjeta incluye texto, imagen y video, y no afirma admitir entrada de archivos
• Salida — solo texto, en cada fuente
• Parámetros — 320B en total con 18B activados por token (documentación y ficha del modelo de Z.ai; Artificial Analysis registra de forma independiente 320B y 18B)
• Licencia — MIT, con pesos publicados en Hugging Face (ficha del modelo del proveedor; Artificial Analysis clasifica el modelo como de pesos abiertos bajo una licencia permisiva)
• Arquitectura — un híbrido de atención dispersa y lineal, que Z.ai describe como el primer modelo frontera de código abierto en combinar ambas, lo que reduce el cómputo de atención en 3,01× y la caché KV en 4,44× frente a GLM-5.3, además de un paso IndexPool que comprime cuatro vectores de clave del indexador en uno en contexto largo, y Manifold-Constrained Hyper-Connections para la eficiencia de escalado. Todo según el proveedor; no hay una auditoría arquitectónica independiente que citar.
• Preentrenamiento — un corpus multimodal de 30 billones de tokens (indicado por Z.ai). El proveedor no publica ninguna cifra total de cómputo de entrenamiento ni un desglose de parámetros por capa más allá del titular de 320B/18B.
Una afirmación de alcance se ha reducido desde el lanzamiento, y la documentación actual es la que hay que citar. La divulgación sobre el hardware de servicio que circuló en agosto situaba la capacidad de la semana anónima en aproximadamente 100.000 chips chinos de fabricación nacional. La documentación de Z.ai, tal como se lee hoy, dice que el modelo se sirvió «en decenas de miles de aceleradores desarrollados a nivel nacional», con una mejora del servicio de extremo a extremo de 3× respecto a la línea base del propio proveedor en el mismo hardware y un coste por token que el proveedor describe como comparable al de las GPU NVIDIA convencionales. Decenas de miles es lo que dice la página ahora; la cifra mayor es la de la época del lanzamiento. Ambas son afirmaciones de la compañía, ninguna ha sido auditada de forma independiente, y la dirección de la revisión es a la baja.
El tarifario, y por qué el número servido es el que importa
La página de precios de Z.ai incluye GLM-5.3-Flash a $0.15 por millón de tokens de entrada, $0.03 por millón de tokens de entrada en caché y $0.50 por millón de tokens de salida, y el nivel hermano FlashX a $0.37 / $0.075 / $1.25. Ese es el precio de lista del proveedor, leído de la propia página del proveedor el 2026-09-28.
La tarifa que realmente se sirve hoy en nuestra ruta es más baja, y este es el punto práctico de la sección. Consultado el 2026-09-28, la ficha de OrcaRouter para z-ai/glm-5.3-flash fija el precio de entrada en $0.075 por millón de tokens, la salida en $0.25 por millón y las lecturas de caché en $0.0173 por millón. Eso es la mitad de la tarifa de lista del proveedor, en el mismo modelo, el mismo día — la cifra con descuento en lugar del precio destacado, sin etiqueta promocional en la ficha. Nuestra cobertura anterior de este modelo señaló la misma discrepancia después de que se cerrara la ventana promocional indicada; la observación sigue vigente hoy, y seguimos sin poder determinar la razón, así que informamos la cifra servida y dejamos abierta la causa.
La entrada en caché es donde las tres fuentes discrepan visiblemente, lo cual es un recordatorio útil de que un «$0.03» en una tabla no es necesariamente un precio que alguien pague. La página del proveedor dice $0.03 por millón de tokens de entrada en caché; el registro del modelo de Artificial Analysis tiene un precio de acierto de caché de $0.026; nuestra ruta sirve lecturas de caché a $0.0173. Los tres se leyeron el 2026-09-28 o poco antes, los tres reportados por el proveedor o la plataforma. Citamos la cifra de lista del proveedor como la cifra de lista y la cifra servida como lo que realmente se le factura a quien llama.
Haz el cálculo para una tarea representativa de un agente: 100.000 tokens de entrada y 10.000 tokens de salida, sin aciertos de caché:
• A la tarifa de lista del proveedor — 100,000 tokens × $0.15/1M = $0.015, más 10,000 × $0.50/1M = $0.005, así que $0.020 por llamada
• A la tarifa que nuestra ruta ofrece hoy — $0.0075 más $0.0025, es decir, $0.010 por llamada, exactamente la mitad
Esa es la razón principal para verificar el precio servido en lugar del precio de lista antes de dimensionar una carga de trabajo: en un agente de horizonte largo que ejecuta miles de llamadas al día, la diferencia entre esos dos números es la diferencia entre dos presupuestos. OrcaRouter transmite el precio de lista del proveedor con un 0% de margen, y por eso el descuento que está aplicando el vendedor aparece en nuestra tarjeta en lugar de absorberse en algún punto intermedio.
Modalidades y superficie de endpoints
El proveedor documenta una forma de interfaz y dos códigos de modelo: glm-5.3-flash y glm-5.3-flashx, ambos servidos a través de la API de Chat Completion. Las imágenes se introducen como un bloque de contenido con tipo image_url en el array de contenido del mensaje, y toman ya sea una URL —que el proveedor recomienda— o una URL de datos en base64, y se pueden enviar varios bloques de imagen en un solo mensaje. Se admite el streaming, y Z.ai recomienda habilitar stream y tool_stream juntos para las solicitudes de streaming. El llamado a herramientas, el almacenamiento en caché de contexto y la salida JSON estructurada son capacidades documentadas; el razonamiento (thinking) es compatible pero, como explica la siguiente sección, no es opcional.
FlashX es un nivel de servicio separado del mismo modelo, no una capacidad separada: Z.ai lo documenta a 200 tokens por segundo y afirma que aún no está disponible en el GLM Coding Plan. No es el nivel que ofrece nuestro catálogo, ni es lo que describen las cifras de esta página.
En nuestra ruta, la superficie de endpoints es más estrecha y merece indicarse con exactitud. La ficha de z-ai/glm-5.3-flash expone POST /v1/chat/completions —solo chat completions, sin un segundo endpoint de protocolo— y acepta reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens y stop. Los chips de capacidades de la ficha son visión, herramientas, JSON y razonamiento. El contexto es de 1.000.000 de tokens y la salida máxima de 128.000, coincidiendo con la documentación del proveedor.
Esfuerzo y pensamiento: los ajustes que fijan cada número de benchmark
Esta es la parte de la especificación que más cambia cómo interpretas las puntuaciones, y el proveedor la documenta con precisión. GLM-5.3-Flash acepta un reasoning_effort como parámetro con tres niveles —low, high y max— y su valor predeterminado es max si no se pasa nada, o si se pasa cualquier valor que no sea low o high. El pensamiento no se puede desactivar: el proveedor afirma que thinking.type solo admite enabled. El flag clear_thinking de la plantilla de chat tiene como valor predeterminado false, y Z.ai recomienda pasarlo explícitamente como true para escenarios de chat. Los ajustes de muestreo recomendados por el proveedor son temperature 1 y top_p 0.95, y afirma sin rodeos que la reproducción de benchmarks y tablas de clasificación debe mantener el esfuerzo máximo predeterminado.
Lee esos dos hechos en conjunto y la consecuencia para cualquiera que compare números es inevitable: una puntuación citada sin un nivel de esfuerzo no es una medición completa, porque los ajustes bajo, alto y máximo son puntos de operación distintos del mismo modelo, y el predeterminado es el más costoso de los tres. Nuestra tarjeta expone reasoning y reasoning_effort entre sus parámetros compatibles, así que el ajuste es accesible a través de la ruta, no solo a través del proveedor.
La hoja de referencia, con la revisión adjunta
Z.ai publica una tabla de benchmarks para GLM-5.3-Flash, y está totalmente reportada por el proveedor: el registro independiente de Artificial Analysis no reproduce estas filas. Las cifras destacadas del proveedor en programación y agentes son DeepSWE v1.1 con 63,4 frente a 46,2 de GLM-5.2, y AutomationBench v1.0.6 con 48,8 frente a 26,2 de GLM-5.2. El resto de la tabla, tal como la recoge nuestro propio catálogo con Z.ai como fuente nombrada: Humanity's Last Exam con herramientas 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography con herramientas 78, CharXiv razonamiento con herramientas 89,4, y en el apartado de visión MMVU 80,5, MVBench 77,8 y BabyVision 53,4.
Dos filas de proveedores merecen que sus notas al pie se incorporen a la frase, porque son las que un lector tiene más probabilidades de citar sin ellas. La evaluación de codificación interna de Z.ai, Z.ai Code Bench v1.0, sitúa a GLM-5.3-Flash en 29.0 con esfuerzo máximo frente a Claude Opus 4.8 en 29.5 — un casi empate en el propio harness del proveedor, ejecutado en Claude Code 2.1.207, según lo reportado por el proveedor. Eso no es una comparación independiente y no es una comparación de esfuerzo equiparado ejecutada por un tercero; es Z.ai evaluando su modelo contra un competidor en su propia evaluación. Y el proveedor cita un Artificial Analysis Intelligence Index de 57 a $0.045 por tarea, indicando que la revisión es v4.1.1.
Esa última cifra debe separarse de lo que Artificial Analysis publica hoy, porque las dos no pueden ponerse una junto a la otra como si se tratara de un movimiento. La propia página de Artificial Analysis para GLM-5.3-Flash, leída el 2026-09-28, informa un Intelligence Index de 41.8 en el Index v4.3.2, registrado con esfuerzo máximo. v4.3.2 incorpora diez evaluaciones —AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1—, y v4.1.1 no lo hacía. Dos revisiones del índice, dos conjuntos de tareas, dos números. Ninguno es incorrecto; no son la misma medición, y citar el 57 junto al 41.8 como si el modelo se hubiera movido sería un error en cualquiera de las dos direcciones.
Lo que el registro independiente sí corrobora es el conjunto de especificaciones más que las puntuaciones: Artificial Analysis registra de forma independiente 320B de parámetros totales, 18B activados, una ventana de contexto de 1.000.000 de tokens, licencia MIT, pesos abiertos y una fecha de lanzamiento del 26 de agosto de 2026, y enumera los precios del proveedor de 0,15 $ de entrada y 0,50 $ de salida por millón de tokens, con un precio de acierto de caché de 0,026 $. Cuando el proveedor publica una puntuación y la parte independiente no lo hace, lo decimos; cuando la parte independiente confirma una especificación, esa es la clase de dato más sólida de esta página.
Aquí no hay una comparación directa en igualdad de condiciones, y decirlo es más útil que fabricar una. Nadie ha publicado una ejecución de GLM-5.3-Flash contra Claude Opus 4.8, GPT-6 Sol o Grok 4.7 con un esfuerzo declarado en un mismo entorno de pruebas —la propia comparación de Z.ai está en su propio banco de pruebas, a esfuerzo máximo, contra la configuración predeterminada de un competidor. Hasta que eso cambie, la comparación honesta entre este modelo y cualquier otro es en precio, envolvente y superficie de endpoints, que son las tres cosas de esta página que todo el mundo puede leer a partir de los mismos números.
Lo que no está documentado, dicho sin rodeos
Una página de referencia para un modelo con una superficie de información limitada solo es útil si es honesta sobre las lagunas, y esta tiene varias.
• Sin fecha límite de conocimiento por parte del proveedor. La documentación de Z.ai y la tarjeta del modelo en Hugging Face no indican ninguna, y el registro de Artificial Analysis deja el campo como nulo. Las estimaciones de la ventana sigilosa son trabajo de la comunidad, no una cifra del proveedor, y esta página no repite ninguna como si lo fuera.
• Sin notas al pie sobre el harness para la mayor parte de la hoja de benchmarks. La ficha del modelo sí incluye notas al pie para la ejecución de HLE con herramientas —temperatura 1.0, top_p 0.95, una longitud máxima de generación de 163.840 tokens, evaluación con un contexto de hasta 300.000 tokens con una estrategia de gestión de contexto, y GPT-5.6 Luna con esfuerzo medio como modelo juez— y para NL2Repo y DeepSWE, que, según el proveedor, se ejecutaron con el harness mini-swe-agent. Las filas restantes son porcentajes escuetos, sin harness ni esfuerzo asociados.
• Ninguna explicación de la diferencia de precio del input en caché. Tres cifras para la misma cantidad en el mismo modelo, y ninguna fuente indica por qué difieren.
• Ningún benchmark independiente del período de servicio anónimo. El listado encubierto ya no existe; lo que sea que midió no se puede volver a medir, y ningún tercero publicó una ejecución contra el alias mientras estuvo activo.
• Ninguna comparación con terceros con esfuerzo equiparable, por la razón expuesta anteriormente.
• Ninguna confirmación del proveedor sobre la cantidad de chips de la época del lanzamiento. La documentación indica decenas de miles de aceleradores nacionales; la cifra de 100.000 no figura en la página.
Lo confirmo: lo que ofrece nuestro catálogo, verificado hoy

El modelo que hay detrás de Ox Alpha está disponible en nuestro catálogo con su propio nombre, verificado hoy en lugar de darlo por supuesto. Una lectura de la API de modelos de OrcaRouter para z-ai/glm-5.3-flash el 2026-09-28 devolvió la ficha completa: contexto de 1.000.000 de tokens, salida máxima de 128.000, entrada de texto, imagen y vídeo con salida de texto, las etiquetas de capacidad vision, tools, JSON y reasoning, una fecha de lanzamiento del 2026-08-26, no obsoleto ni retirado del catálogo, con un precio de $0,075 por millón de tokens de entrada, $0,25 por millón de tokens de salida y $0,0173 por millón de tokens de entrada en caché, a través del único endpoint POST /v1/chat/completions.
Nuestra propia medición de siete días en el playground en esa tarjeta, para el mismo período, indica 61.8 tokens de salida por segundo, un tiempo hasta el primer token p50 de 7.39 segundos y una tasa de error de 1.47%. Esas son cifras propias sobre nuestro servicio, no cifras de proveedores ni benchmarks independientes, y son las únicas cifras de velocidad en esta página por esa razón.
El alias en sí no está en la ruta. Si has llegado aquí después de buscar Ox Alpha, el modelo al que debes llamar es z-ai/glm-5.3-flash, y la forma de la solicitud es la descrita arriba. Se encuentra en la misma clave que todo lo demás del catálogo — una sola API para más de 200 modelos, el precio del proveedor se traslada sin ningún recargo adicional, y conmutación automática si un proveedor se bloquea, así que un modelo que estás probando no tiene por qué ser un modelo del que dependa tu ruta de producción.

Una aclaración sobre qué es esta página, pues un lector que llega desde el propio nombre del modelo merece encontrarla. Esta es una página de referencia de un modelo que ya está en el catálogo, no un informe de lanzamiento: GLM-5.3-Flash es del 26 de agosto de 2026, y su lugar aquí se sustenta en el hecho de que el nombre Ox Alpha sigue siendo objeto de búsquedas sin una página dedicada en la que aterrizar, no en la novedad del lanzamiento. La fecha anterior se usa para fechar el modelo, no como noticia. Lo que cambiaría esta página es una de cuatro cosas: una ejecución independiente de benchmark con un esfuerzo declarado, un corte de conocimiento indicado por el proveedor, un cambio en la tarifa servida, o una decisión de Z.ai de declarar cuál fue realmente el recuento de chips de la época del lanzamiento. Hasta que ocurra una de esas cosas, la especificación anterior es todo lo que documenta el proveedor, y las lagunas enumeradas en la sección anterior son una parte tan importante de la respuesta como los números.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
