
GLM-5.3-Flash vs DeepSeek V4 Flash: ¿A qué modelo frontera económico deberías llamar?
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0166Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
La inteligencia de nivel frontera solía empezar en cinco dólares por millón de tokens de entrada; hoy dos modelos la ofrecen por una miseria, y están lado a lado en el mismo nivel de presupuesto. GLM-5.3-Flash, el modelo multimodal de 18B activos de Zhipu AI que se volvió de código abierto el 26 de agosto, y DeepSeek V4 Flash, el codificador agéntico de ~13B activos que DeepSeek llevó a producción a finales de julio, son los dos argumentos más sólidos de que "casi frontera por centavos" es ahora una categoría de producto real. Difieren más de lo que sugieren sus precios: uno es un generalista nativamente multimodal con pesos MIT; el otro, un especialista probado en codificación y agentes, con puntajes de referencia independientes que lo respaldan.
La respuesta corta para la mayoría de los equipos: si quieres un modelo multimodal económico y abierto sobre el que construir, GLM-5.3-Flash; si quieres un modelo de codificación con cifras agénticas medidas de forma independiente que puedas defender en una reunión, DeepSeek V4 Flash. El resto de esta página contiene el razonamiento, el marcador por dimensión y las advertencias, empezando por una honesta: una buena parte de las afirmaciones de GLM-5.3-Flash provienen de informes del proveedor, mientras que las puntuaciones principales de DeepSeek V4 Flash se miden de forma independiente.
El enfrentamiento de un vistazo
Ambos modelos son diseños de mezcla de expertos con aproximadamente 300 mil millones de parámetros totales y menos de 20 mil millones activos por token, ambos admiten una ventana de contexto de 1 millón de tokens y ambos son de pesos abiertos. Ahí es donde terminan las similitudes. GLM-5.3-Flash es el primer modelo multimodal nativo de la línea GLM-5 de Zhipu: texto, imagen y video de entrada, y se lanzó con licencia MIT, lo que significa que puedes autoalojarlo hoy mismo. DeepSeek V4 Flash es la versión de producción del modelo que DeepSeek ha estado iterando desde abril; su versión principal es de texto y código, su arquitectura está ajustada para el uso de herramientas agénticas, y la visión se distribuye por separado en una versión experimental, no de forma nativa. En el índice de inteligencia, Zhipu afirma 57 para Flash frente a los 50 medidos de forma independiente de DeepSeek V4 Flash: una brecha significativa si se mantiene, y el dato a observar para la confirmación por terceros.

Inteligencia y benchmarks
Esta es la sección donde la disciplina en el manejo de fuentes importa, porque los dos modelos tienen bases de evidencia muy diferentes.
• AA Intelligence Index — GLM-5.3-Flash 57, según los materiales de lanzamiento de Zhipu (no reproducidos), frente a DeepSeek V4 Flash 50, medido de forma independiente por Artificial Analysis. A modo de referencia, Claude Opus 4.8 se sitúa cerca de 57 y Kimi K3 en 57 en el mismo índice.
• SWE-bench Verified — aún no se ha publicado una cifra de GLM-5.3-Flash, frente al 79.0% de DeepSeek V4 Flash (independiente).
• LiveCodeBench — aún no se ha publicado una cifra de GLM-5.3-Flash, frente al 91,6 % de DeepSeek V4 Flash (independiente).
• Agents' Last Exam — aún no se ha publicado cifra de GLM-5.3-Flash, frente a DeepSeek V4 Flash 25.2 (independiente).
• Afirmación de paridad en codificación — Zhipu informa que el rendimiento de codificación de GLM-5.3-Flash en su Z.ai Code Bench interno es comparable al de Claude Opus 4.8 (reportado por el proveedor, no reproducido).
• Contexto familiar: GLM-5.3, el hermano mayor de Flash, obtiene 60 en el índice AA de forma independiente; en Terminal-Bench 2.1, la propia línea GLM-5.3 de Zhipu varía entre 83.1 y 88.2 en ejecuciones de la comunidad. El Terminal-Bench 2.1 de DeepSeek V4 Flash es 82.7 (independiente).
La asimetría es el punto: las cifras de codificación y de agente de DeepSeek V4 Flash han sido reproducidas por terceros desde su lanzamiento en julio, mientras que las de GLM-5.3-Flash son afirmaciones del proveedor desde el día uno. El 57 de Flash es siete puntos más alto que el 50 de DeepSeek si Zhipu tiene razón, pero el modelo fue ampliamente probado de forma anónima antes del lanzamiento, por lo que las puntuaciones independientes deberían llegar pronto.
Codificación y agentes: la diferenciación real
Si estás comprando un modelo económico para una carga de trabajo de codificación agéntica, la base de evidencia importa más que el delta bruto del índice. DeepSeek V4 Flash fue reentrenado posteriormente específicamente para capacidad agéntica en su compilación de producción, y sus números medidos de forma independiente — 79.0 SWE-bench Verified, 91.6 LiveCodeBench, 82.7 Terminal-Bench 2.1 — son contra los que ahora se miden los competidores en el nivel económico. La afirmación de codificación de Zhipu para GLM-5.3-Flash es de fuerza comparable a Claude Opus 4.8 en su propio benchmark interno, lo cual es una declaración contundente pero aún no independiente.
También hay una diferencia de comportamiento que vale la pena conocer. Los informes de la comunidad sobre DeepSeek V4 Flash describen un pensamiento comparativamente moderado: aproximadamente el 25–45 % de los tokens de salida son tokens de pensamiento, con un factor de expansión de salida de alrededor de 1,3–1,5×, lo que mantiene bajo su costo por tarea. Zhipu no ha publicado datos de verbosidad comparables para GLM-5.3-Flash, y la verbosidad es la variable que convierte una tarifa barata en una tarea costosa. Hasta que se mida la expansión real de tokens de Flash, la brecha de costo efectivo por tarea entre ambos es más amplia que la brecha por token.
Multimodal, o todavía no
Este es el diferenciador más claro. GLM-5.3-Flash acepta de forma nativa imágenes y video junto con texto — el primer modelo GLM-5 en hacerlo — y Zhipu afirma que su costo de servicio de contexto largo es aproximadamente un tercio del de GLM-5.3. La versión de producción de DeepSeek V4 Flash es texto y código; la capacidad multimodal de DeepSeek reside en una compilación de visión experimental separada, lo que significa que una carga de trabajo de visión del lado de DeepSeek implica un endpoint de modelo diferente y un historial de evaluación diferente. Si tu pipeline necesita comprensión de imágenes o video de un modelo de bajo costo hoy, GLM-5.3-Flash es el único de los dos que lo incluye de forma nativa.
Precio: las cifras reales
Ambos modelos subcotizan a todo lo demás en su banda de capacidades, pero en diferentes calendarios.
• GLM-5.3-Flash — Zhipu lo fija en una décima parte de los $1.40 / $4.40 por millón de tokens de GLM-5.3, lo que equivale a aproximadamente $0.14 / $0.44, o $0.07 / $0.22 durante el descuento de lanzamiento por tiempo limitado. Zhipu también afirma ~$0.045 por tarea en el AA Intelligence Index. Las cifras en dólares se derivan de las proporciones declaradas por Zhipu; la proporción en sí es un hecho actual.
DeepSeek V4 Flash — $0.14 por millón de entrada, $0.28 por millón de salida, la tarifa oficial publicada por DeepSeek, con entrada con acierto de caché a un precio mucho más bajo. Las estimaciones independientes de costo por prueba lo sitúan en alrededor de $0.03 por prueba de referencia: el modelo importante más barato del panorama.
• Contexto largo — GLM-5.3-Flash a aproximadamente un tercio del costo de contexto largo de GLM-5.3 (afirmación del proveedor) frente a los 1M de contexto de DeepSeek V4 Flash a $0.14 / $0.28 con una salida máxima de ~393K.
Sobre el papel, los dos precios de lista casi coinciden, y el descuento hace que GLM-5.3-Flash sea más barato por token por ahora. El problema es que el precio por token de DeepSeek V4 Flash es estable y su verbosidad está medida, mientras que el precio de Flash es un descuento temporal y su verbosidad aún no lo está — así que la predicción honesta es que la brecha de costo efectivo es menor que la brecha de precios, e incluso podría invertirse una vez que ambos se midan en el mismo conjunto de tareas.

Velocidad y costo de servicio
Zhipu afirma que GLM-5.3-Flash tiene el menor cómputo de atención entre los modelos de gama económica comparados — GLM-5.3, DeepSeek V4 Flash y Kimi K3 — con un cómputo de atención 3.0x menor y una caché KV 4.4x menor frente a GLM-5.3, aunque admite que su caché KV sigue siendo ligeramente mayor que la de DeepSeek V4 Flash. En el apartado del servicio, Zhipu reporta una mejora de 3x en el rendimiento de servicio de extremo a extremo en chips chinos domésticos, con un costo por token que califica de comparable al de las GPU NVIDIA convencionales. Todo según el proveedor. La economía de servicio de DeepSeek V4 Flash, en cambio, está consolidada: lleva en producción desde el 31 de julio, es uno de los modelos más baratos de ejecutar por prueba y los proveedores externos lo han estado sirviendo en volumen durante un mes. Para una vía de producción, el servicio probado supera al servicio prometedor.
¿A cuál deberías llamar?
La guía de decisión, en términos sencillos:
Quieres multimodal abierto ahora — GLM-5.3-Flash es el único de los dos con entrada nativa de imagen/video, y sus pesos MIT están hoy en Hugging Face.
• Quieres un modelo de codificación/agente con cifras independientes — DeepSeek V4 Flash obtiene 79.0 en SWE-bench Verified y 82.7 en Terminal-Bench 2.1, ambos verificados por terceros; las afirmaciones de codificación de GLM-5.3-Flash aún no lo están.
Quieres el costo mínimo absoluto por token: el descuento de lanzamiento de Flash lo supera por ahora, pero trata ese descuento como temporal.
• Te importa una tasa de producción estable: los $0.14 / $0.28 de DeepSeek V4 Flash se han mantenido estables desde julio; la tarjeta de tarifas de Flash tiene solo unos días.
• Estás indeciso y quieres probar ambos sin un segundo contrato — DeepSeek V4 Flash está disponible hoy en OrcaRouter al precio de lista de DeepSeek con un margen del 0%, y el lado GLM de esta familia (GLM-5.3, el hermano mayor de Flash) también está disponible allí, así que una vez que el propio Flash llegue a la lista, ambos lados de este enfrentamiento quedarán detrás de una sola clave. Hasta entonces, los pesos MIT de Flash en Hugging Face son la forma más barata de probarlo tú mismo, y la conmutación automática por error a un modelo probado es cómo pruebas el nuevo sin apostar una ruta de producción en él.

El resultado final
GLM-5.3-Flash es el modelo más interesante — multimodal nativo, con licencia MIT, una puntuación de índice reivindicada que iguala a modelos mucho más caros — pero también es el menos probado, y sus mejores cifras son las reportadas por el proveedor en el día del lanzamiento. DeepSeek V4 Flash es la opción económica más segura para trabajo de codificación y agéntico: puntuación de inteligencia independiente más baja, pero medida, reproducible y estable a $0.14 / $0.28. Compra el Flash por lo que ofrece de manera única — multimodal abierto a este precio — y compra DeepSeek V4 Flash para cualquier cosa en la que necesites las pruebas de los benchmarks. La pregunta realmente abierta, que las próximas dos semanas responderán, es si el 57 del Flash sobrevive a la medición independiente.
Comparados en este artículo4
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
