Tarjeta de título principal: DeepSeek V4.1 Flash vs GLM-5.2 — dos modelos del MIT, una respuesta aburrida
Guides & Insights

DeepSeek V4.1 Flash vs GLM-5.2: dos modelos MIT, una respuesta aburrida

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

DeepSeek V4.1 Flash y GLM-5.2 son el mismo tipo de objeto, y esa es la parte que la mayoría de las comparaciones omite. Ambos son modelos de mezcla de expertos, ambos se distribuyen bajo MIT con pesos descargables, ambos admiten un millón de tokens de contexto, y ambos están disponibles mediante una API alojada por un proveedor que no los entrenó. GLM-5.2 llegó primero y, en el momento de su lanzamiento, era el modelo de pesos abiertos con la puntuación más alta en el índice Artificial Analysis, con 51. DeepSeek V4.1 Flash llegó el 10 de septiembre de 2026 como el modelo más pequeño, más nuevo y más barato de la nueva familia de arquitecturas de DeepSeek. La comparación que importa entre ellos no es cuál es más inteligente. Es cuál puedes ejecutar, y a qué costo, para el trabajo que realmente tienes.

Lo que tienen en común, que es la mayor parte.

Empieza por lo que tienen en común, porque elimina la mayoría de los criterios de decisión habituales. Si estás eligiendo entre un modelo abierto y uno cerrado, sopesas la dependencia del proveedor, sopesas la capacidad de ajuste fino, sopesas si el proveedor puede cambiarte las condiciones. Nada de eso aplica aquí. Tanto DeepSeek V4.1 Flash como GLM-5.2 tienen licencia MIT con pesos que puedes descargar y servir tú mismo. Ambos aceptan 1M de tokens de entrada. Ambos son arquitecturas MoE, lo que significa que ambos son baratos de ejecutar en relación con su número total de parámetros, porque solo una fracción de los pesos se activa por token.

Así que la comparación no es abierto frente a cerrado, y no es contexto largo frente a corto. Es un conjunto de cuatro o cinco números, y los números apuntan en una dirección en cuanto a costo y en la otra en cuanto a madurez.

Dónde divergen realmente

• Precio por 1M de tokens — DeepSeek V4.1 Flash $0.15 de entrada / $0.60 de salida fuera de horario punta vs GLM-5.2 $1.40 de entrada / $4.40 de salida. Eso es un poco más de 9 veces el precio de entrada y un poco más de 7 veces el precio de salida.

• Entrada en caché — V4.1 Flash $0.003 por 1M en horario valle frente a GLM-5.2 $0.26 por 1M. Casi 90 veces más, en la partida que domina la factura de un bucle de agente.

• Parámetros — V4.1 Flash 552B en total con 8B activos en la entrada y 16B en la salida frente a GLM-5.2 aproximadamente 745B en total con alrededor de 40B activos. GLM-5.2 activa aproximadamente dos veces y media más parámetros por token.

• Salida máxima — V4.1 Flash 384K tokens vs GLM-5.2 128K tokens. El triple del límite.

• Ventana de contexto — 1M tokens cada una. Nivel.

• Puntuación independiente en el índice — GLM-5.2 obtiene 51 en el Artificial Analysis Index, la más alta de cualquier modelo de pesos abiertos en su lanzamiento. DeepSeek V4.1 Flash aún no tiene una cifra publicada en el índice.

• Latencia observada hasta el primer token — V4.1 Flash 2.63 s en p50 y 9.05 s en p95 frente a GLM-5.2 2.36 s en p50 y 10.00 s en p95, según la telemetría propia de OrcaRouter de 7 días. Las medianas están a la par. Las colas, no.

La dirección del precio y la dirección de la madurez son opuestas. GLM-5.2 es el modelo con la puntuación independiente y el historial más largo. DeepSeek V4.1 Flash es el modelo con los tokens más baratos, un noveno del precio de entrada y el triple del límite de salida. No hay ninguna lectura de esta lista en la que un modelo simplemente domine.

Two-column scoreboard: DeepSeek V4.1 Flash vs GLM-5.2 — price per 1M tokens $0.15 input and $0.60 output vs $1.40 and $4.40, cached input $0.003 vs $0.26, total parameters 552B vs about 745B, active parameters 8B input and 16B output vs about 40B, context window 1M tokens on both, max output 384K tokens vs 128K tokens, Artificial Analysis Index score not yet published vs 51, both MIT-licensed, and a p50 time to first token of 2.63 s vs 2.36 s

La cola es la línea subestimada

La mayoría de las comparaciones de modelos de pesos abiertos empiezan por la puntuación del índice. La telemetría de latencia merece atención en su lugar, pero no por el motivo que cabría esperar: las medianas están igualadas. El tiempo p50 hasta el primer token de GLM-5.2 es de 2,36 s frente a los 2,63 s de V4.1 Flash, lo cual no es una diferencia, sino ruido en una red compartida. Quien cite una ventaja en el primer token para el modelo más barato está leyendo el percentil equivocado.

El p95 es donde los dos se separan, y la dirección es la inversa de lo que sugeriría la diferencia de precio. La espera en el peor caso de GLM-5.2 es de 10,00 s; la de V4.1 Flash es de 9,05 s. Eso importa más que una mediana, porque las solicitudes que un usuario nota son las lentas. Una herramienta que suele ser instantánea y que de vez en cuando se atasca durante diez segundos se percibe como poco fiable de un modo en que no lo hace una herramienta uniformemente de tres segundos, y en un bucle de agente que distribuye diez llamadas por turno, el p95 es el número que decide si el turno se completa dentro de la paciencia de una persona. La cola de GLM-5.2 no es un defecto; es un modelo más grande que activa aproximadamente 40 mil millones de parámetros por token y cuesta lo que cuesta. Pero es la razón por la que el modelo encaja mejor en el trabajo asíncrono —una cola, un trabajo por lotes, un agente en segundo plano que nadie está mirando— que en una interfaz de solicitud-respuesta.

Ninguno de los dos modelos publica una cifra de rendimiento en las páginas que podemos ver, lo cual vale la pena decir con claridad en lugar de rellenarlo. El tiempo hasta el primer token es la única dimensión de latencia en la que estos dos pueden compararse con datos comunes y, en esa dimensión, la lectura honesta es que están a la par en la mediana y cerca en la cola.

Qué resuelve y qué no resuelve una puntuación de índice

El 51 de GLM-5.2 en el Artificial Analysis Index es una cifra real, producida de forma independiente, y es el argumento individual más fuerte a favor del modelo. También es un compuesto: un único número que agrega varios conjuntos de evaluación, lo que lo convierte en un buen resumen de la capacidad general y en un mal predictor del rendimiento en cualquier tarea específica. Un modelo que obtiene 51 y un modelo sin puntuación publicada no son lo mismo que un modelo que obtiene 51 y un modelo que obtiene 40.

La postura honesta sobre DeepSeek V4.1 Flash es que su historial independiente es escaso, y la razón es su juventud. Lleva doce días disponible de forma general. La única evaluación reciente de terceros en la que aparece —la tabla de codificación agéntica Agents on Rails, publicada el 21 de septiembre de 2026— lo situó en un 17 % con esfuerzo máximo, a mitad de tabla, por encima de GLM-5.3 Flash con un 15 % y por debajo de Gemini 3.8 Flash con un 23 %. Esa es una sola tabla que mide un único aspecto concreto, y no sustituye a una puntuación del Index. Cualquiera que afirme que V4.1 Flash supera a GLM-5.2 en capacidad ahora mismo está extrapolando a partir de la arquitectura y el precio, no está reportando una medición.

El argumento a favor de cada uno, expuesto con claridad

DeepSeek V4.1 Flash es el modelo al que hay que recurrir cuando la carga de trabajo es de gran volumen, sensible a la latencia o intensiva en salida. Un noveno del precio de entrada y aproximadamente un noventavo del precio de lectura de caché constituyen una ventaja estructural en un bucle de agente que relee el contexto en cada turno, y un límite de salida de 384K es una categoría de artefacto distinta a la de 128K. Si tu tarea es clasificación, extracción, generación estructurada larga o el ejecutor de gran volumen dentro de una canalización de agentes, la diferencia de coste no es marginal: es la diferencia entre una canalización viable y una inviable.

GLM-5.2 es el modelo al que recurrir cuando necesitas una cifra de capacidad publicada y verificada de forma independiente para justificar una decisión, o cuando el trabajo es asíncrono y una espera de diez segundos en el peor de los casos resulta invisible. Es la opción madura: la puntuación existe, el comportamiento está documentado, el modelo lleva el tiempo suficiente en producción como para que otras personas hayan encontrado sus límites. Eso tiene un valor real, y no queda reflejado en una columna de precios.

Cuando ninguna de las dos es obviamente la correcta —un asistente de propósito general que gestiona tráfico mixto—, lo útil no es elegir. Es enviar la mayor parte del tráfico al modelo barato y reservar el caro para las solicitudes que lo necesitan.

Ejecutando ambos como un solo sistema

Como ambos modelos son de pesos abiertos y ambos están alojados, el patrón de división y enrutamiento resulta inusualmente barato de configurar aquí, y es donde la capa de enrutamiento de OrcaRouter se gana su sitio en vez de ser un argumento de venta añadido a la fuerza. Ambos modelos están detrás de una única clave, por lo que la decisión de enrutamiento es configuración en lugar de una segunda integración: una regla que envía solicitudes cortas y de alto volumen a DeepSeek V4.1 Flash y trabajos asíncronos largos a GLM-5.2 requiere unas pocas líneas en lugar de una bifurcación en el código de tu aplicación.

Dos propiedades de la plataforma importan específicamente para este emparejamiento. OrcaRouter transfiere los precios de lista de los proveedores con un 0 % de margen, por lo que las cifras anteriores son las tarifas propias de los proveedores y el calendario de horas punta de DeepSeek se aplica exactamente como DeepSeek lo define —las horas punta son de 01:00 a 04:00 y de 06:00 a 10:00 UTC de lunes a viernes, con los fines de semana totalmente fuera de las horas punta, lo cual es una decisión de programación que conviene tomar explícitamente con un modelo tan económico. Y el DSL de enrutamiento puede componer varios modelos en una sola llamada, que es la forma natural de usar dos modelos de pesos abiertos cuyas fortalezas no se solapan: el económico produce, el más fuerte revisa, y quien llama ve una única respuesta. La conmutación por error automática está detrás de ambas rutas, lo que importa cuando uno de los dos modelos tiene doce días de antigüedad y aún no se conoce su comportamiento con tus datos.

La razón de que esta sea la forma correcta y no un compromiso es que los dos modelos difieren en ejes que no compiten. Uno es rápido y barato; el otro tiene puntuación y es lento. Un pipeline que usa ambos no es una cobertura: está emparejando instrumentos con tareas.

Screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model id, 1M-token context, 128K max output, text input and text output, $1.40 input and $4.40 output per 1M tokens, and observed time to first token of 2.36 s at p50 and 10.00 s at p95

Qué ver

• Una cifra publicada del Artificial Analysis Index para DeepSeek V4.1 Flash. Hasta que exista, la comparación de capacidades entre estos dos modelos es un argumento, no una medición — y es la única pieza de evidencia que lo zanjaría.

• Si el perfil de latencia de GLM-5.2 mejora. Su p95 de 10,00 s es la cifra con más probabilidades de cambiar a medida que los proveedores de alojamiento optimicen, y actualmente es la mayor diferencia única medida entre los dos modelos —una espera de cola, no un precio.

• Si cambia el horario de horas pico de DeepSeek. En un modelo a $0.15 por millón de tokens de entrada, el multiplicador de horas pico es la variable individual más importante del modelo de costos.

Hasta que llegue el primero de esos, el resumen preciso es: DeepSeek V4.1 Flash es aproximadamente nueve veces más barato en entrada y casi noventa veces más barato en entrada en caché que GLM-5.2, y su techo de salida es tres veces mayor; GLM-5.2 es el modelo con la puntuación independiente y el historial más largo, y su mediana de primer token está a la par de la del modelo más barato, aunque su peor caso no lo está. Ambos son MIT. Ambos están a una clave de distancia. Elige según la carga de trabajo, no según el ganador.

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id with a Featured badge, 1M-token context, 384K max output, text and image input, $0.15 input and $0.60 output per 1M tokens, a cache read rate of $0.003, and a p50 time to first token of 2.63 s

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario