Una tarjeta de título principal para GLM-5.3-FlashX vs GLM-5.3-Flash, con el subtítulo «Mismos pesos, dos etiquetas de precio», con chips que dicen «200 vs 98 tok/s», «$0.37 / $1.25 vs $0.15 / $0.50» y «Inteligencia idéntica», y una línea al pie «GLM-5.3-FlashX se lanzó el 18 de septiembre de 2026».
Guides & Insights

GLM-5.3-FlashX vs GLM-5.3-Flash: los mismos pesos, 2,5 veces el precio, un número diferente

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

No puedes comprar GLM-5.3-FlashX y obtener un modelo mejor. Eso no es una crítica — es toda la premisa. GLM-5.3-FlashX, lanzado en la API de Z.ai el 18 de septiembre de 2026, ejecuta los mismos pesos que GLM-5.3-Flash: la misma arquitectura de mezcla de expertos de 320B totales y 18B activos, el mismo contexto de 1M de tokens, la misma entrada nativa de texto, imagen, video y archivos, el mismo límite de salida de 131,072 tokens. Z.ai no ha publicado ningún benchmark de FlashX porque no hay nada nuevo que medir. Lo que difiere es la velocidad con la que salen los tokens y cuánto cuestan, y esos dos números son lo único sobre lo que un comprador tiene que razonar.

Esa es una decisión más limpia que la mayoría de las comparaciones de modelos, y también más difícil, porque no hay una historia de capacidades tras la que esconderse. O la latencia vale 2,5 veces para ti, o no.

Un modelo, dos precios

• Qué es FlashX: un nivel de servicio, no el lanzamiento de un modelo; los mismos pesos, las mismas puntuaciones, los mismos límitesbr> • Precio de entrada: $0.37 por 1M de tokens en FlashX frente a $0.15 por 1M en Flash a precio de listabr> • Precio de salida: $1.25 por 1M frente a $0.50 por 1M, el multiplicador que realmente mueve una facturabr> • Entrada en caché: $0.075 por 1M frente a $0.03 por 1Mbr> • Velocidad: hasta 200 tokens de salida por segundo (pico reportado por el proveedor) frente a 98 tok/s medidos de forma independiente por Artificial Analysisbr> • Acceso por suscripción: GLM-5.3-Flash está incluido en el GLM Coding Plan de Z.ai con 3× de cuota; FlashX no está incluidobr> • Autoalojamiento: GLM-5.3-Flash son pesos abiertos con licencia MIT en Hugging Face; FlashX no tiene pesos que descargar

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

En el mercado local de Z.ai, la misma proporción se declara sin ambages: ¥2 de entrada y ¥7 de salida para FlashX frente a ¥0,8 y ¥2,8 para Flash. Varios medios chinos describen el lanzamiento de la misma manera —5× la velocidad a 2,5× el precio— y todos ellos señalan que la inteligencia no ha cambiado.

La latencia es una partida, y no se tarifica por token.

La razón por la que el 2,5× no es automáticamente un mal negocio es que el precio por token y el costo de la tarea son cantidades distintas. Un trabajo por lotes que genera un millón de tokens de salida durante la noche paga $0,50 en Flash y $1,25 en FlashX solo por la salida, y no recibe nada a cambio por los $0,75 extra porque nadie está esperando. Un bucle de agente que hace diez llamadas secuenciales paga la misma prima por token, pero cada llamada responde más rápido, y el ahorro se refleja en el tiempo real y no en la factura. Si FlashX realmente responde en una fracción del tiempo, diez turnos pueden devolver decenas de segundos de latencia por tarea, y si esa tarea está bloqueando a una persona o a un servicio ascendente, esos segundos valen más que los tokens.

El propio posicionamiento de Z.ai sigue exactamente esta línea. Orienta FlashX hacia la programación de alta concurrencia, las llamadas a agentes de varios pasos, el diálogo en tiempo real, el autocompletado de código y el trabajo multimodal de contexto largo, y redirige las cargas de trabajo sensibles al precio e insensibles a la latencia —procesamiento por lotes offline, generación masiva, todo lo que esté programado— de vuelta al Flash base. Esa es la división correcta, y vale la pena señalar que es el proveedor quien la establece.

Donde el razonamiento se desmorona es en el apartado del rendimiento. Los 200 tokens por segundo de FlashX son un pico que reporta el proveedor; los 98 del modelo base son una mediana que midió un laboratorio independiente. Los picos se alcanzan con salidas cortas, cachés precalentadas y un clúster inactivo. Una solicitud multimodal de contexto largo —justo la carga de trabajo a la que se orienta FlashX— es la que menos probabilidades tiene de acercarse a esa cifra, y nadie fuera de Z.ai ha publicado datos que resuelvan la cuestión. Si su carga de trabajo está limitada por el rendimiento y no por la latencia, una cifra máxima le dice muy poco sobre lo que realmente obtendrá.

La vía de escape que FlashX no tiene

Existe una tercera opción en esta comparación, y solo existe porque el modelo base es abierto. GLM-5.3-Flash se lanzó el 26 de agosto de 2026 bajo la licencia MIT, con pesos en Hugging Face y ModelScope, y hoy lo sirven stacks de inferencia que incluyen SGLang, vLLM, TokenSpeed y KTransformers. Si tu volumen es lo bastante alto como para justificar el hardware, la comparación honesta no es Flash frente a FlashX — es el $1.25 por millón de tokens de salida de FlashX frente a tu propio costo amortizado por token en tus propios aceleradores.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

Esa opción tiene un verdadero precio de entrada. La versión FP8 necesita del orden de 328 GB de memoria de GPU para servirse, lo que representa un despliegue multinodo para la mayoría de los equipos y algo inviable para el resto. Pero vale la pena decirlo porque es la asimetría lo que hace que los precios de FlashX sean una prueba deliberada en lugar de una inevitabilidad: Z.ai cobra un sobreprecio por una configuración de servicio que, para el modelo base, los clientes pueden en principio construir por sí mismos. El sobreprecio es por comodidad, no por capacidad, y la comodidad tiene una tarifa de mercado que disminuye con el tiempo.

De qué se trata realmente el cambio de precio

La economía detrás del lanzamiento es inusualmente clara. GLM-5.3-Flash se lanzó a una décima parte del precio de GLM-5.3 —la mitad de eso durante una promoción de lanzamiento— y se usó intensamente, incluido un período de pruebas anónimas previas al lanzamiento que Z.ai ha confirmado desde entonces. FlashX es la primera vez que esta familia se mueve en la dirección opuesta: el mismo modelo, con un precio superior. Los analistas citados en la prensa financiera china lo interpretan como una prueba comercial deliberada de si los desarrolladores pagarán por la velocidad en sí misma, tras un año de comprar cuota de mercado con capacidades cercanas a la frontera a precios de mercancía.

Dos detalles respaldan esa interpretación. FlashX queda excluido del GLM Coding Plan, mientras que el Flash básico sí se incluye con triple cuota, de modo que los usuarios de suscripción no pueden absorber el nuevo nivel dentro de un compromiso ya existente: pagan por token. Y el precio es plano, sin descuento fuera de horas punta, a diferencia de la estructura por franjas horarias que algunos competidores usan para llenar capacidad ociosa. Un 2,5× plano sobre un nivel de velocidad es un precio para quienes no pueden esperar, y Z.ai está averiguando cuántos de esos hay.

Elegir entre ellos

Elige FlashX si un humano o un servicio está bloqueado en el siguiente token y el modelo en sí ya es la elección correcta — autocompletado en línea, agentes interactivos, chat en tiempo real, cualquier cosa donde la pausa sea el producto. Elige GLM-5.3-Flash para trabajo por lotes, offline y masivo, para cualquier cosa que puedas programar, y para cualquier carga de trabajo en la que pagues por volumen de salida en lugar de por latencia de salida. Si tu volumen es grande y tu equipo puede ejecutar aceleradores, calcula el costo de los pesos base autoalojados antes de calcular el de FlashX; la comparación es más favorable de lo que sugieren las tarifas por token.

Elijas el camino que elijas, trata los dos como intercambiables en el punto de llamada. Aceptan los mismos prompts, devuelven el mismo formato y producen la misma calidad; lo único que cambia es una cadena de modelo, que es el tipo de test A/B más barato de ejecutar. En OrcaRouter el precio de lista del proveedor se traslada con un 0 % de margen, así que un cambio de precios de Z.ai o una promoción se aplica el mismo día en que se publica upstream, y ambos niveles están detrás de un único endpoint frente a más de 200 modelos. Para una decisión que depende por completo de la latencia medida, poder alternar entre ambos a mitad del experimento sin tocar tu integración es la mayor parte del trabajo.

El veredicto es más limitado que una comparación habitual de modelos, y esa es la cuestión. FlashX no es un modelo mejor y no pretende serlo. Es el mismo modelo con una cola más corta, vendido a un precio que solo tiene sentido si la cola era tu problema. Mide tu propio tiempo hasta el primer token en ambos antes de decidirte: el 200 del proveedor es un techo, tu carga de trabajo es el único punto de referencia que importa, y la diferencia entre los dos niveles está a un cambio de configuración de distancia.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario