
GLM-5.3-FlashX vs DeepSeek V4.1 Flash: el nivel de velocidad que es más lento que el modelo económico
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
El nivel de velocidad premium de Z.ai tiene un problema, y se llama DeepSeek V4.1 Flash. Cuando Z.ai lanzó GLM-5.3-FlashX el 18 de septiembre de 2026, vendió el nuevo nivel con una sola cifra: hasta 200 tokens de salida por segundo, aproximadamente cinco veces el rendimiento de GLM-5.3-Flash, del que deriva, por 2,5 veces el precio. Las mediciones independientes ya sitúan el modelo económico de DeepSeek en 214,7 tokens por segundo con un tiempo hasta el primer token de 1,15 segundos —más rápido en ambos aspectos que el techo que Z.ai anuncia, y a un precio al que FlashX no se acerca. Si compras velocidad, el mercado se movió antes de que llegara FlashX.
Ese planteamiento es injusto con FlashX en un aspecto concreto, y justo en todos los demás. Ambos modelos son derivados de pesos abiertos con contexto de 1M que se diseñaron para abaratar costes, y ambos son realmente buenos en aquello para lo que fueron creados. Pero se crearon para mitades diferentes del mismo problema, y la brecha de precio entre ellos es ahora lo bastante amplia como para que «cuál es mejor» tenga una respuesta de una sola línea para la mayoría de las cargas de trabajo.
En qué aspectos cada uno está realmente por delante
• Precio, lista — GLM-5.3-FlashX $0.37 / $1.25 por 1M de entrada/salida frente a DeepSeek V4.1 Flash $0.15 / $0.60 fuera de hora punta, $0.30 / $1.20 en hora puntabr> • Entrada en caché — FlashX $0.075 por 1M frente a DeepSeek $0.003 fuera de hora punta, una brecha de 25× que se acumula con fuerza en los bucles de agentesbr> • Rendimiento medido — FlashX hasta 200 tok/s (pico del proveedor, sin cifra independiente publicada) frente a DeepSeek 214,7 tok/s (Artificial Analysis, en la API de DeepSeek)br> • Tiempo hasta el primer token — no publicado para FlashX frente a 1,15 s medidos para DeepSeek V4.1 Flashbr> • Inteligencia independiente — FlashX hereda el 42 de GLM-5.3-Flash en el Artificial Analysis Intelligence Index frente al 40 de DeepSeek V4.1 Flashbr> • Arquitectura — MoE de 320B totales / 18B activos frente a 552B totales con aproximadamente 8B activos en prefill y 16B en decodebr> • Modalidad de entrada — texto, imagen, vídeo y archivos frente a texto e imagenbr> • Límite de salida — 131.072 tokens frente a aproximadamente 384.000br> • Pesos abiertos — GLM-5.3-Flash tiene licencia MIT; FlashX es un nivel alojado sin pesos propios, y DeepSeek V4.1 Flash tiene licencia MIT

Lee esa lista dos veces, porque su forma es la historia. FlashX gana exactamente dos filas, y ambas son por un margen estrecho: una ventaja de dos puntos en un índice de inteligencia independiente, y entrada de vídeo. DeepSeek gana en precio, precio en caché, velocidad medida, longitud de salida y amplitud de modalidades en el sentido que importa: acepta imágenes y produce respuestas largas. La diferencia de dos puntos en el índice está dentro del ruido de una sola ejecución de benchmark y no debería ser lo que decida tu arquitectura.
El nivel de velocidad que es más lento que el modelo barato
Esta es la parte en la que vale la pena detenerse. Z.ai creó FlashX para resolver un problema real: GLM-5.3-Flash es lento. Artificial Analysis lo midió en 98 tokens de salida por segundo, lo que está por encima de la mediana de sus pares para modelos de pesos abiertos de su tamaño, pero lejos de ser interactivo. La solución de la empresa fue una reconstrucción de la pila de servicio —aproximadamente 100.000 aceleradores nacionales, un motor basado en SGLang, cuantización W8A8, caché KV de precisión mixta y una arquitectura desagregada de codificación–prefill–decodificación—, y reporta alrededor de 3× de rendimiento de extremo a extremo sobre su línea base en el mismo hardware.
DeepSeek resolvió el mismo problema en la capa de arquitectura, y llegó primero. La división Causal Encoder–Decoder de V4.1 Flash activa unos 8B parámetros en prefill y 16B en decode en lugar de una cifra uniforme, y Compressed Sparse Attention 2 con caché KV en FP4 reduce la caché global a 890 bytes por token — aproximadamente un cuarto de la HBM y un octavo del almacenamiento SSD que necesitaba su predecesor. El resultado es un modelo que se ejecuta a 214.7 tokens por segundo según las mediciones de un laboratorio neutral, en la misma API propia, sin necesidad de un nivel premium.
El 200 de Z.ai es un pico del proveedor y el 214,7 de DeepSeek es una mediana independiente, que es la comparación menos favorable posible para Z.ai y la razón para tomarlo con reservas. Es perfectamente posible que FlashX supere a DeepSeek en una solicitud en caliente, de salida corta y sin congestión. No es posible saberlo, porque nadie fuera de Z.ai ha publicado cifras de rendimiento de FlashX. Lo que sí se puede saber hoy es que los dos modelos están en la misma banda de velocidad, y uno de ellos cuesta un tercio de lo que cuesta el otro.

Dónde la ventaja de precios de DeepSeek se vuelve estructural
DeepSeek V4.1 Flash cobra $0.15 por millón de tokens de entrada y $0.60 por millón de tokens de salida fuera de las horas punta, y se duplica a $0.30 y $1.20 durante dos franjas horarias entre semana (01:00–04:00 y 06:00–10:00 UTC). FlashX cuesta $0.37 y $1.25 con tarifa plana. Si se comparan, la tarifa plana que parece una ventaja es en realidad la estructura más cara para cualquiera que pueda programar el trabajo.
La línea de entrada en caché es la que decide las cargas de trabajo de los agentes. DeepSeek cobra $0.003 por millón de tokens de entrada en caché fuera de horas punta; FlashX cobra $0.075, veinticinco veces más. Un agente que reenvía un prompt de sistema largo y un esquema de herramientas en cada paso paga esa diferencia en cada paso, y es el rubro individual con más probabilidades de dominar una factura real. Z.ai indica que el almacenamiento de caché es gratuito por tiempo limitado, lo que es un descuento en el almacenamiento y no en las lecturas que realmente se acumulan.
Hay un contrapeso, y es la honestidad sobre lo que cuestan los propios números de DeepSeek. Las evaluaciones ejecutadas por el proveedor que respaldan las puntuaciones destacadas de V4.1 Flash se produjeron con el máximo esfuerzo de razonamiento, y DeepSeek documenta que pasar del esfuerzo 25 al esfuerzo 100 eleva DeepSWE v1.1 de 66,0 a 74,2 mientras consume aproximadamente 2,5× los tokens de salida. Con 2,5× los tokens, el costo efectivo de la configuración de alto esfuerzo está mucho más cerca de FlashX de lo que sugiere el precio de etiqueta — y el modelo está documentado como muy verboso, ya que genera 250M tokens de salida en el Intelligence Index frente a una mediana de 130M. Una tarifa baja por token en un modelo charlatán no es lo mismo que una tarea barata. Cualquiera que compare estos dos por precio debería comparar el costo por tarea completada, no el costo por millón de tokens, y debería esperar medir en lugar de estimar.
Cómo decidir, concretamente
Si tu carga de trabajo es un agente de larga ejecución con un prefijo estable, DeepSeek V4.1 Flash es la elección, y la ratio de entrada en caché por sí sola lo decide. Si necesitas comprensión de vídeo o entrada de archivos en la misma llamada, FlashX es el único de los dos que los admite; eso es una diferencia real de capacidades, no de hoja de especificaciones. Si necesitas salidas generadas largas, el límite de salida de aproximadamente 384K de DeepSeek frente a los 131,072 de FlashX importa para la generación de informes, archivos de código largos y cualquier cosa que sintetice en lugar de responder. Si necesitas la puntuación independiente más alta en un único índice de referencia, el 42 de FlashX frente al 40 es real, pero demasiado pequeña para basarse en ella.
Ambos modelos son accesibles desde un solo endpoint si tu stack ya está enrutado, que es la forma más económica de resolver esto. En OrcaRouter el precio de lista del proveedor se transfiere con un 0 % de margen, por lo que el descuento fuera de horas punta de DeepSeek y cualquier futuro movimiento de precios de Z.ai se aplican el mismo día en que ocurren, y cambiar entre los dos es una cadena de modelo en lugar de una integración. La conmutación por error automática vale la pena tenerla específicamente para FlashX: es un nivel de servicio que lleva tres semanas en un nuevo clúster, y el modo de fallo contra el que te estás protegiendo es un techo de capacidad, no un modelo que deja de funcionar.
El resumen sin rodeos: DeepSeek V4.1 Flash es la mejor opción predeterminada para la mayoría del trabajo de producción — más barato por token, más barato por token en caché, medido como más rápido y capaz de generar salidas más largas. GLM-5.3-FlashX es la elección correcta en una banda más estrecha donde necesitas entrada de video o archivos y quieres un índice independiente marginalmente superior que lo respalde. Z.ai puso un precio premium a un nivel de velocidad y lo lanzó a un mercado donde el modelo rápido y barato ya existía. Esa es toda la comparación.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
