Una tarjeta de título principal para GLM-5.3-FlashX vs DeepSeek V4.1 Flash, con el subtítulo «El nivel de velocidad que es más lento que el modelo barato», con chips que dicen «200 vs 214.7 tok/s», «$0.37 / $1.25 vs $0.15 / $0.60» y «AA 42 vs 40», y una línea al pie: «GLM-5.3-FlashX se lanzó el 18 de septiembre de 2026».
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: el nivel de velocidad que es más lento que el modelo económico

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El nivel de velocidad premium de Z.ai tiene un problema, y se llama DeepSeek V4.1 Flash. Cuando Z.ai lanzó GLM-5.3-FlashX el 18 de septiembre de 2026, vendió el nuevo nivel con una sola cifra: hasta 200 tokens de salida por segundo, aproximadamente cinco veces el rendimiento de GLM-5.3-Flash, del que deriva, por 2,5 veces el precio. Las mediciones independientes ya sitúan el modelo económico de DeepSeek en 214,7 tokens por segundo con un tiempo hasta el primer token de 1,15 segundos —más rápido en ambos aspectos que el techo que Z.ai anuncia, y a un precio al que FlashX no se acerca. Si compras velocidad, el mercado se movió antes de que llegara FlashX.

Ese planteamiento es injusto con FlashX en un aspecto concreto, y justo en todos los demás. Ambos modelos son derivados de pesos abiertos con contexto de 1M que se diseñaron para abaratar costes, y ambos son realmente buenos en aquello para lo que fueron creados. Pero se crearon para mitades diferentes del mismo problema, y la brecha de precio entre ellos es ahora lo bastante amplia como para que «cuál es mejor» tenga una respuesta de una sola línea para la mayoría de las cargas de trabajo.

En qué aspectos cada uno está realmente por delante

• Precio, lista — GLM-5.3-FlashX $0.37 / $1.25 por 1M de entrada/salida frente a DeepSeek V4.1 Flash $0.15 / $0.60 fuera de hora punta, $0.30 / $1.20 en hora puntabr> • Entrada en caché — FlashX $0.075 por 1M frente a DeepSeek $0.003 fuera de hora punta, una brecha de 25× que se acumula con fuerza en los bucles de agentesbr> • Rendimiento medido — FlashX hasta 200 tok/s (pico del proveedor, sin cifra independiente publicada) frente a DeepSeek 214,7 tok/s (Artificial Analysis, en la API de DeepSeek)br> • Tiempo hasta el primer token — no publicado para FlashX frente a 1,15 s medidos para DeepSeek V4.1 Flashbr> • Inteligencia independiente — FlashX hereda el 42 de GLM-5.3-Flash en el Artificial Analysis Intelligence Index frente al 40 de DeepSeek V4.1 Flashbr> • Arquitectura — MoE de 320B totales / 18B activos frente a 552B totales con aproximadamente 8B activos en prefill y 16B en decodebr> • Modalidad de entrada — texto, imagen, vídeo y archivos frente a texto e imagenbr> • Límite de salida — 131.072 tokens frente a aproximadamente 384.000br> • Pesos abiertos — GLM-5.3-Flash tiene licencia MIT; FlashX es un nivel alojado sin pesos propios, y DeepSeek V4.1 Flash tiene licencia MIT

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

Lee esa lista dos veces, porque su forma es la historia. FlashX gana exactamente dos filas, y ambas son por un margen estrecho: una ventaja de dos puntos en un índice de inteligencia independiente, y entrada de vídeo. DeepSeek gana en precio, precio en caché, velocidad medida, longitud de salida y amplitud de modalidades en el sentido que importa: acepta imágenes y produce respuestas largas. La diferencia de dos puntos en el índice está dentro del ruido de una sola ejecución de benchmark y no debería ser lo que decida tu arquitectura.

El nivel de velocidad que es más lento que el modelo barato

Esta es la parte en la que vale la pena detenerse. Z.ai creó FlashX para resolver un problema real: GLM-5.3-Flash es lento. Artificial Analysis lo midió en 98 tokens de salida por segundo, lo que está por encima de la mediana de sus pares para modelos de pesos abiertos de su tamaño, pero lejos de ser interactivo. La solución de la empresa fue una reconstrucción de la pila de servicio —aproximadamente 100.000 aceleradores nacionales, un motor basado en SGLang, cuantización W8A8, caché KV de precisión mixta y una arquitectura desagregada de codificación–prefill–decodificación—, y reporta alrededor de 3× de rendimiento de extremo a extremo sobre su línea base en el mismo hardware.

DeepSeek resolvió el mismo problema en la capa de arquitectura, y llegó primero. La división Causal Encoder–Decoder de V4.1 Flash activa unos 8B parámetros en prefill y 16B en decode en lugar de una cifra uniforme, y Compressed Sparse Attention 2 con caché KV en FP4 reduce la caché global a 890 bytes por token — aproximadamente un cuarto de la HBM y un octavo del almacenamiento SSD que necesitaba su predecesor. El resultado es un modelo que se ejecuta a 214.7 tokens por segundo según las mediciones de un laboratorio neutral, en la misma API propia, sin necesidad de un nivel premium.

El 200 de Z.ai es un pico del proveedor y el 214,7 de DeepSeek es una mediana independiente, que es la comparación menos favorable posible para Z.ai y la razón para tomarlo con reservas. Es perfectamente posible que FlashX supere a DeepSeek en una solicitud en caliente, de salida corta y sin congestión. No es posible saberlo, porque nadie fuera de Z.ai ha publicado cifras de rendimiento de FlashX. Lo que sí se puede saber hoy es que los dos modelos están en la misma banda de velocidad, y uno de ellos cuesta un tercio de lo que cuesta el otro.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

Dónde la ventaja de precios de DeepSeek se vuelve estructural

DeepSeek V4.1 Flash cobra $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida fuera de las horas punta, y se duplica a $0.30 y $1.20 durante dos franjas horarias entre semana (01:00–04:00 y 06:00–10:00 UTC). FlashX cuesta $0.37 y $1.25 con tarifa plana. Si se comparan, la tarifa plana que parece una ventaja es en realidad la estructura más cara para cualquiera que pueda programar el trabajo.

La línea de entrada en caché es la que decide las cargas de trabajo de los agentes. DeepSeek cobra $0.003 por millón de tokens de entrada en caché fuera de horas punta; FlashX cobra $0.075, veinticinco veces más. Un agente que reenvía un prompt de sistema largo y un esquema de herramientas en cada paso paga esa diferencia en cada paso, y es el rubro individual con más probabilidades de dominar una factura real. Z.ai indica que el almacenamiento de caché es gratuito por tiempo limitado, lo que es un descuento en el almacenamiento y no en las lecturas que realmente se acumulan.

Hay un contrapeso, y es la honestidad sobre lo que cuestan los propios números de DeepSeek. Las evaluaciones ejecutadas por el proveedor que respaldan las puntuaciones destacadas de V4.1 Flash se produjeron con el máximo esfuerzo de razonamiento, y DeepSeek documenta que pasar del esfuerzo 25 al esfuerzo 100 eleva DeepSWE v1.1 de 66,0 a 74,2 mientras consume aproximadamente 2,5× los tokens de salida. Con 2,5× los tokens, el costo efectivo de la configuración de alto esfuerzo está mucho más cerca de FlashX de lo que sugiere el precio de etiqueta — y el modelo está documentado como muy verboso, ya que genera 250M tokens de salida en el Intelligence Index frente a una mediana de 130M. Una tarifa baja por token en un modelo charlatán no es lo mismo que una tarea barata. Cualquiera que compare estos dos por precio debería comparar el costo por tarea completada, no el costo por millón de tokens, y debería esperar medir en lugar de estimar.

Cómo decidir, concretamente

Si tu carga de trabajo es un agente de larga ejecución con un prefijo estable, DeepSeek V4.1 Flash es la elección, y la ratio de entrada en caché por sí sola lo decide. Si necesitas comprensión de vídeo o entrada de archivos en la misma llamada, FlashX es el único de los dos que los admite; eso es una diferencia real de capacidades, no de hoja de especificaciones. Si necesitas salidas generadas largas, el límite de salida de aproximadamente 384K de DeepSeek frente a los 131,072 de FlashX importa para la generación de informes, archivos de código largos y cualquier cosa que sintetice en lugar de responder. Si necesitas la puntuación independiente más alta en un único índice de referencia, el 42 de FlashX frente al 40 es real, pero demasiado pequeña para basarse en ella.

Ambos modelos son accesibles desde un solo endpoint si tu stack ya está enrutado, que es la forma más económica de resolver esto. En OrcaRouter el precio de lista del proveedor se transfiere con un 0 % de margen, por lo que el descuento fuera de horas punta de DeepSeek y cualquier futuro movimiento de precios de Z.ai se aplican el mismo día en que ocurren, y cambiar entre los dos es una cadena de modelo en lugar de una integración. La conmutación por error automática vale la pena tenerla específicamente para FlashX: es un nivel de servicio que lleva tres semanas en un nuevo clúster, y el modo de fallo contra el que te estás protegiendo es un techo de capacidad, no un modelo que deja de funcionar.

El resumen sin rodeos: DeepSeek V4.1 Flash es la mejor opción predeterminada para la mayoría del trabajo de producción — más barato por token, más barato por token en caché, medido como más rápido y capaz de generar salidas más largas. GLM-5.3-FlashX es la elección correcta en una banda más estrecha donde necesitas entrada de video o archivos y quieres un índice independiente marginalmente superior que lo respalde. Z.ai puso un precio premium a un nivel de velocidad y lo lanzó a un mercado donde el modelo rápido y barato ya existía. Esa es toda la comparación.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario