
GLM-5.3-FlashX se lanza a 2.5 veces el precio del modelo en el que se ejecuta
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El número que hay que notar no es 200. Es 2,5. El 18 de septiembre de 2026, Z.ai puso GLM-5.3-FlashX en su API a hasta 200 tokens de salida por segundo — y le puso un precio de 2,5× lo que cobra por GLM-5.3-Flash, el modelo de pesos abiertos del que está construido. Nada del modelo en sí cambió. Los mismos pesos, la misma arquitectura troncal de mezcla de expertos de 320B-A18B, el mismo contexto de 1M de tokens, el mismo manejo nativo de texto, imágenes, video y archivos. Lo que cambió es la pila de servicio que lo sustenta, y lo que Z.ai ahora cobra por el privilegio de estar más cerca del frente de la cola.
Eso convierte a FlashX en algo poco común en el mercado de modelos: un lanzamiento sin ningún benchmark asociado. Z.ai no ha publicado ninguna evaluación específica de FlashX, porque no hay un modelo nuevo que evaluar. Todas las cifras de capacidades que se aplican a GLM-5.3-Flash se aplican aquí, incluidas las que son menos halagadoras de lo que sugería la cobertura del lanzamiento.
Todo el delta, en una sola pasada
• Velocidad — GLM-5.3-FlashX alcanza hasta 200 tok/s (máximo reportado por el proveedor) frente a GLM-5.3-Flash con 98 tok/s según las mediciones de Artificial Analysis en la propia API de Z.aibr> • Precio — 0,37 $ por 1 M de tokens de entrada / 1,25 $ por 1 M de tokens de salida frente a 0,15 $ / 0,50 $ de tarifa oficialbr> • Entrada en caché — 0,075 $ por 1 M frente a 0,03 $ por 1 Mbr> • Inteligencia — idéntica; FlashX hereda las puntuaciones del modelo basebr> • Contexto — 1 M de tokens en ambosbr> • Pesos — GLM-5.3-Flash tiene pesos abiertos con licencia MIT; FlashX es un nivel alojado y no tiene pesos propios
El 200 y el 98 no son el mismo tipo de número, y vale la pena decirlo sin rodeos. Uno es un techo que el proveedor afirma que el servicio puede alcanzar. El otro es lo que un laboratorio independiente midió en solicitudes reales. Un usuario que esté decidiendo si pagar 2,5× debería tratar el 200 como publicidad e ir a medir su propia carga de trabajo.

Lo que Z.ai dice que está haciendo el trabajo
La aceleración es infraestructura, no matemáticas. Z.ai describe FlashX como ejecutándose en un clúster de aproximadamente 100.000 aceleradores nacionales chinos con una pila de servicio diseñada específicamente: un motor de inferencia basado en SGLang, cuantización W8A8, cuantización de caché mixta INT8/FP8/BF16, y una arquitectura desagregada de codificación–prellenado–decodificación que separa la etapa de codificación multimodal de las etapas de generación de tokens, de modo que ninguna bloquea a la otra. La empresa informa de un rendimiento del servicio de extremo a extremo aproximadamente 3× superior a su línea base inicial en el mismo hardware, y afirma que un agente de infraestructura impulsado por GLM-5.3 ayudó a optimizar la pila.
Todo eso lo reporta el proveedor y, hasta ahora, nadie fuera de Z.ai lo ha reproducido. También es la parte más plausible de la historia: los lanzamientos de nivel de servicio como este suelen ser logros de ingeniería, y las decisiones de arquitectura descritas son el conjunto de herramientas estándar para exactamente este tipo de mejora. Lo que no son es una garantía. Una cifra de 200 tok/s es un pico, y los picos se alcanzan con salidas cortas, cachés calientes y un clúster sin congestión. Las solicitudes multimodales de contexto largo —la carga de trabajo para la que FlashX está pensado explícitamente— son las que tienen menos probabilidades de alcanzarlo.
El precio es la verdadera decisión del producto.
A precio de lista, GLM-5.3-FlashX cuesta $0.37 por millón de tokens de entrada y $1.25 por millón de tokens de salida, con la entrada en caché a $0.075 y el almacenamiento de caché gratis por tiempo limitado. En el precio doméstico de Z.ai, eso es ¥2 de entrada y ¥7 de salida, frente a ¥0.8 y ¥2.8 del Flash base — la misma proporción de 2.5×, expresada en la moneda en la que Z.ai vende en su país.

La aritmética se vuelve incómoda rápidamente en la dirección que la gente rara vez revisa. Los tokens de salida son donde el multiplicador muerde con más fuerza, porque la salida es el lado caro en todos los modelos de esta familia: la salida de FlashX es 2,5× la salida de Flash, y la salida ya es ~3,4× el precio de la entrada en ambos. Un trabajo por lotes que genera un millón de tokens de salida al día pasa de $0,50 a $1,25 —una diferencia de $274 al año para una carga de trabajo que, por definición, nadie está esperando.
Donde compensa es en la latencia que puedes amortizar. Un bucle de agente que hace diez llamadas secuenciales ahorra diez veces la diferencia por llamada, y si esa diferencia es de dos o tres segundos, has recuperado medio minuto de tiempo real por tarea. Para el autocompletado de código interactivo, el diálogo en tiempo real o cualquier pipeline en el que una persona o un servicio upstream esté bloqueado esperando el siguiente token, esa compensación suele ser correcta. Z.ai también deja claro que el modelo no forma parte actualmente de su GLM Coding Plan, así que los usuarios de suscripción no obtienen FlashX incluido; pagan por token por él.
Si tu stack ya se comunica con más de un proveedor, el cambio consiste únicamente en modificar la cadena del modelo y nada más. Esa es la razón práctica por la que el enrutamiento existe como capa: en OrcaRouter el precio de lista del proveedor se traslada tal cual, con un 0 % de recargo, así que un cambio de precio de Z.ai o una rebaja promocional se aplican el mismo día en que ocurren en el origen, y un único endpoint frente a más de 200 modelos significa que evaluar FlashX frente a Flash es una edición de configuración en lugar de un proyecto de integración. La conmutación por error también importa aquí: un nivel de servicio completamente nuevo en un clúster completamente nuevo es exactamente el tipo de dependencia que conviene tener respaldada por un fallback.
Lo que no ha cambiado, y por qué importa más
FlashX hereda el perfil de capacidades de GLM-5.3-Flash en su totalidad, y ese perfil es más limitado de lo que implicaba la cobertura de lanzamiento. Los materiales de Z.ai sitúan el modelo base al nivel de Claude Opus 4.8 en el Artificial Analysis Intelligence Index. Artificial Analysis misma actualmente lista a GLM-5.3-Flash con 42 en ese índice, medido en la propia API de Z.ai —una puntuación sólida, muy por encima de la mediana para modelos de pesos abiertos de su clase, y muy lejos del nivel de frontera que sugiere la comparación del proveedor. Ambas afirmaciones son ciertas; simplemente no son la misma afirmación, y la brecha entre ellas es la razón por la que este blog etiqueta las cifras de los proveedores como cifras de proveedores.
El modelo base es genuinamente capaz y genuinamente abierto. GLM-5.3-Flash se lanzó el 26 de agosto de 2026 bajo la licencia MIT, con los pesos en Hugging Face, y su diseño de atención híbrida lineal y dispersa —compresión IndexPool, hiperconexiones restringidas a la variedad— reduce el cómputo de atención aproximadamente 3× y la caché KV aproximadamente 4,4× frente a GLM-5.3, que es lo que hace que un modelo de 320B con 18B de parámetros activos sea lo bastante barato como para poder servirse siquiera. La salida está limitada a 131.072 tokens. Es rápido para su precio, no rápido para su clase: Artificial Analysis midió 98 tokens por segundo frente a una mediana de sus pares por encima de 70 pero por debajo de los modelos más rápidos de la tabla.
FlashX no cambia nada de eso. Cambia cuánto tiempo esperas por ello.
La lectura honesta
Compra FlashX si tu carga de trabajo está limitada por la latencia y ya has decidido que GLM-5.3-Flash es el modelo correcto — un agente que encadena llamadas, un editor que completa en línea, una interfaz de voz o de chat donde la pausa es el producto. Quédate con GLM-5.3-Flash, o con los pesos abiertos que puedas alojar tú mismo, si tu trabajo es por lotes, sin conexión o está limitado por el rendimiento más que por la latencia. La inteligencia por la que pagas 2,5× es la inteligencia que ya tenías.
La pregunta abierta es qué dice una medición independiente sobre el 200. Nadie fuera de Z.ai ha publicado todavía cifras de rendimiento de FlashX, y hasta que alguien lo haga, la postura honesta es que FlashX es un nivel de servicio prometedor vendido con una cifra pico. También es, notablemente, una prueba comercial: un laboratorio que pasó un año regalando un modelo casi de frontera a una décima parte del precio de su buque insignia ahora pregunta si los desarrolladores pagarán por la velocidad por sí sola. La respuesta determinará cómo se fijará el precio del siguiente nivel.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
