
GLM-5.3-FlashX vs GLM-5.3-Flash: los mismos pesos, 2,5 veces el precio, un número diferente
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
No puedes comprar GLM-5.3-FlashX y obtener un modelo mejor. Eso no es una crítica — es toda la premisa. GLM-5.3-FlashX, lanzado en la API de Z.ai el 18 de septiembre de 2026, ejecuta los mismos pesos que GLM-5.3-Flash: la misma arquitectura de mezcla de expertos de 320B totales y 18B activos, el mismo contexto de 1M de tokens, la misma entrada nativa de texto, imagen, video y archivos, el mismo límite de salida de 131,072 tokens. Z.ai no ha publicado ningún benchmark de FlashX porque no hay nada nuevo que medir. Lo que difiere es la velocidad con la que salen los tokens y cuánto cuestan, y esos dos números son lo único sobre lo que un comprador tiene que razonar.
Esa es una decisión más limpia que la mayoría de las comparaciones de modelos, y también más difícil, porque no hay una historia de capacidades tras la que esconderse. O la latencia vale 2,5 veces para ti, o no.
Un modelo, dos precios
• Qué es FlashX: un nivel de servicio, no el lanzamiento de un modelo; los mismos pesos, las mismas puntuaciones, los mismos límitesbr> • Precio de entrada: $0.37 por 1M de tokens en FlashX frente a $0.15 por 1M en Flash a precio de listabr> • Precio de salida: $1.25 por 1M frente a $0.50 por 1M, el multiplicador que realmente mueve una facturabr> • Entrada en caché: $0.075 por 1M frente a $0.03 por 1Mbr> • Velocidad: hasta 200 tokens de salida por segundo (pico reportado por el proveedor) frente a 98 tok/s medidos de forma independiente por Artificial Analysisbr> • Acceso por suscripción: GLM-5.3-Flash está incluido en el GLM Coding Plan de Z.ai con 3× de cuota; FlashX no está incluidobr> • Autoalojamiento: GLM-5.3-Flash son pesos abiertos con licencia MIT en Hugging Face; FlashX no tiene pesos que descargar

En el mercado local de Z.ai, la misma proporción se declara sin ambages: ¥2 de entrada y ¥7 de salida para FlashX frente a ¥0,8 y ¥2,8 para Flash. Varios medios chinos describen el lanzamiento de la misma manera —5× la velocidad a 2,5× el precio— y todos ellos señalan que la inteligencia no ha cambiado.
La latencia es una partida, y no se tarifica por token.
La razón por la que el 2,5× no es automáticamente un mal negocio es que el precio por token y el costo de la tarea son cantidades distintas. Un trabajo por lotes que genera un millón de tokens de salida durante la noche paga $0,50 en Flash y $1,25 en FlashX solo por la salida, y no recibe nada a cambio por los $0,75 extra porque nadie está esperando. Un bucle de agente que hace diez llamadas secuenciales paga la misma prima por token, pero cada llamada responde más rápido, y el ahorro se refleja en el tiempo real y no en la factura. Si FlashX realmente responde en una fracción del tiempo, diez turnos pueden devolver decenas de segundos de latencia por tarea, y si esa tarea está bloqueando a una persona o a un servicio ascendente, esos segundos valen más que los tokens.
El propio posicionamiento de Z.ai sigue exactamente esta línea. Orienta FlashX hacia la programación de alta concurrencia, las llamadas a agentes de varios pasos, el diálogo en tiempo real, el autocompletado de código y el trabajo multimodal de contexto largo, y redirige las cargas de trabajo sensibles al precio e insensibles a la latencia —procesamiento por lotes offline, generación masiva, todo lo que esté programado— de vuelta al Flash base. Esa es la división correcta, y vale la pena señalar que es el proveedor quien la establece.
Donde el razonamiento se desmorona es en el apartado del rendimiento. Los 200 tokens por segundo de FlashX son un pico que reporta el proveedor; los 98 del modelo base son una mediana que midió un laboratorio independiente. Los picos se alcanzan con salidas cortas, cachés precalentadas y un clúster inactivo. Una solicitud multimodal de contexto largo —justo la carga de trabajo a la que se orienta FlashX— es la que menos probabilidades tiene de acercarse a esa cifra, y nadie fuera de Z.ai ha publicado datos que resuelvan la cuestión. Si su carga de trabajo está limitada por el rendimiento y no por la latencia, una cifra máxima le dice muy poco sobre lo que realmente obtendrá.
La vía de escape que FlashX no tiene
Existe una tercera opción en esta comparación, y solo existe porque el modelo base es abierto. GLM-5.3-Flash se lanzó el 26 de agosto de 2026 bajo la licencia MIT, con pesos en Hugging Face y ModelScope, y hoy lo sirven stacks de inferencia que incluyen SGLang, vLLM, TokenSpeed y KTransformers. Si tu volumen es lo bastante alto como para justificar el hardware, la comparación honesta no es Flash frente a FlashX — es el $1.25 por millón de tokens de salida de FlashX frente a tu propio costo amortizado por token en tus propios aceleradores.

Esa opción tiene un verdadero precio de entrada. La versión FP8 necesita del orden de 328 GB de memoria de GPU para servirse, lo que representa un despliegue multinodo para la mayoría de los equipos y algo inviable para el resto. Pero vale la pena decirlo porque es la asimetría lo que hace que los precios de FlashX sean una prueba deliberada en lugar de una inevitabilidad: Z.ai cobra un sobreprecio por una configuración de servicio que, para el modelo base, los clientes pueden en principio construir por sí mismos. El sobreprecio es por comodidad, no por capacidad, y la comodidad tiene una tarifa de mercado que disminuye con el tiempo.
De qué se trata realmente el cambio de precio
La economía detrás del lanzamiento es inusualmente clara. GLM-5.3-Flash se lanzó a una décima parte del precio de GLM-5.3 —la mitad de eso durante una promoción de lanzamiento— y se usó intensamente, incluido un período de pruebas anónimas previas al lanzamiento que Z.ai ha confirmado desde entonces. FlashX es la primera vez que esta familia se mueve en la dirección opuesta: el mismo modelo, con un precio superior. Los analistas citados en la prensa financiera china lo interpretan como una prueba comercial deliberada de si los desarrolladores pagarán por la velocidad en sí misma, tras un año de comprar cuota de mercado con capacidades cercanas a la frontera a precios de mercancía.
Dos detalles respaldan esa interpretación. FlashX queda excluido del GLM Coding Plan, mientras que el Flash básico sí se incluye con triple cuota, de modo que los usuarios de suscripción no pueden absorber el nuevo nivel dentro de un compromiso ya existente: pagan por token. Y el precio es plano, sin descuento fuera de horas punta, a diferencia de la estructura por franjas horarias que algunos competidores usan para llenar capacidad ociosa. Un 2,5× plano sobre un nivel de velocidad es un precio para quienes no pueden esperar, y Z.ai está averiguando cuántos de esos hay.
Elegir entre ellos
Elige FlashX si un humano o un servicio está bloqueado en el siguiente token y el modelo en sí ya es la elección correcta — autocompletado en línea, agentes interactivos, chat en tiempo real, cualquier cosa donde la pausa sea el producto. Elige GLM-5.3-Flash para trabajo por lotes, offline y masivo, para cualquier cosa que puedas programar, y para cualquier carga de trabajo en la que pagues por volumen de salida en lugar de por latencia de salida. Si tu volumen es grande y tu equipo puede ejecutar aceleradores, calcula el costo de los pesos base autoalojados antes de calcular el de FlashX; la comparación es más favorable de lo que sugieren las tarifas por token.
Elijas el camino que elijas, trata los dos como intercambiables en el punto de llamada. Aceptan los mismos prompts, devuelven el mismo formato y producen la misma calidad; lo único que cambia es una cadena de modelo, que es el tipo de test A/B más barato de ejecutar. En OrcaRouter el precio de lista del proveedor se traslada con un 0 % de margen, así que un cambio de precios de Z.ai o una promoción se aplica el mismo día en que se publica upstream, y ambos niveles están detrás de un único endpoint frente a más de 200 modelos. Para una decisión que depende por completo de la latencia medida, poder alternar entre ambos a mitad del experimento sin tocar tu integración es la mayor parte del trabajo.
El veredicto es más limitado que una comparación habitual de modelos, y esa es la cuestión. FlashX no es un modelo mejor y no pretende serlo. Es el mismo modelo con una cola más corta, vendido a un precio que solo tiene sentido si la cola era tu problema. Mide tu propio tiempo hasta el primer token en ambos antes de decidirte: el 200 del proveedor es un techo, tu carga de trabajo es el único punto de referencia que importa, y la diferencia entre los dos niveles está a un cambio de configuración de distancia.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
