
Lanzamiento oficial de DeepSeek V4 Flash: el modelo agéntico de contexto de 1M, económico y rápido, explicado
- qwenNUEVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 224 tok/s
- orcaNUEVOOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleNUEVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleNUEVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
- anthropicAnthropic: Claude Fable 52026-06-0960Inteligencia77Código
- qwenQwen: Qwen3.7 Plus2026-06-0139Inteligencia56Código59Matemáticas
El modelo de eficiencia de DeepSeek, V4 Flash, ha pasado de la vista previa a una versión beta pública oficial — la compilación code>-0731/code> se publicó el 31 de julio de 2026. La arquitectura no cambió (sigue siendo un modelo de mezcla de expertos de 284 mil millones de parámetros con un contexto de 1 millón de tokens), pero una ronda de posentrenamiento adicional mejoró notablemente sus capacidades de agente, de codificación y de llamada a herramientas, y ahora admite de forma nativa la API de Responses con adaptaciones específicas para agentes de estilo Codex. Esta guía explica qué es V4 Flash, qué mejoró realmente la versión oficial, cómo se leen sus benchmarks (reportados por DeepSeek), cuánto cuesta y cómo usarlo — cada cifra etiquetada según su fuente.
Nota de precisión: los detalles del lanzamiento y las puntuaciones de benchmark a continuación provienen del registro de cambios oficial de la API de DeepSeek (con fecha 2026-07-31); la arquitectura, el contexto y los precios se contrastan con la página del modelo de OrcaRouter; los agregados de Artificial Analysis son independientes. Los benchmarks reportados por DeepSeek utilizan su propia configuración de pruebas: trátalos como cifras del proveedor y ejecuta tus propias evaluaciones. Las especificaciones y los precios cambian; verifica antes de construir.
TL;DR. V4 Flash es el hermano rentable del gigante DeepSeek V4 Pro: un MoE de 284B / 13B-activos con contexto de 1M de tokens y hasta 384K de salida, optimizado para trabajo agéntico de alto volumen y baja latencia. El lanzamiento oficial del 31 de julio es una actualización post-entrenamiento — mismo tamaño, agentes y codificación materialmente mejores — que también añade soporte nativo para Responses-API y Codex. DeepSeek reporta fuertes puntuaciones en agéntico/codificación (p. ej., Terminal-Bench 2.1 82.7, Toolathlon 70.3), y cuesta alrededor de $0.15 / $0.29 por millón de tokens de entrada/salida, aproximadamente un tercio del precio de V4 Pro. Solo se actualizó la API Flash; V4 Pro y la app/web de DeepSeek no cambiaron. En OrcaRouter lo obtienes con un margen del 0% a través de un endpoint compatible con OpenAI.
Conclusiones clave
• Versión oficial (compilación -0731, 31 de julio de 2026): una actualización posterior al entrenamiento de la vista previa — misma arquitectura, agentes mucho más potentes, programación y uso de herramientas.
• Arquitectura sin cambios: 284B en total / 13B activos (MoE), contexto de 1M tokens (1.048.576), salida de hasta 384K, entrada solo de texto, con razonamiento, herramientas y JSON.
• Nuevo: soporte nativo de la API Responses además de una adaptación específica para Codex; continúa admitiendo las interfaces de estilo OpenAI ChatCompletions y Anthropic. ID del modelo code>deepseek-v4-flash/code>.
Avances agénticos/de codificación reportados por DeepSeek: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7.
• Muy barato: alrededor de $0.15 / $0.29 por 1M de tokens de entrada/salida con ~$0.02 de lecturas de caché (OrcaRouter, 0% de margen) — aproximadamente un tercio de los $0.44 / $0.88 de V4 Pro. Solo cambió la API Flash; Pro y app/web siguen igual.
Lo que la versión oficial realmente actualizó
V4 Flash apareció por primera vez como vista previa el 24 de abril de 2026. El lanzamiento oficial del 31 de julio de 2026 (la code>-0731/code> compilación, según el registro de cambios de la API de DeepSeek) es, explícitamente, no una nueva arquitectura: los parámetros totales y activos (284B / 13B) y el contexto de 1M no cambian. Lo que cambió es el post-entrenamiento — un ajuste fino adicional que, según DeepSeek, mejoró significativamente las capacidades principales de agente, codificación y llamada a herramientas. Dos adiciones prácticas importan: V4 Flash ahora es compatible de forma nativa con la API Responses y está específicamente adaptado para agentes de codificación estilo Codex, mientras sigue siendo compatible con interfaces estilo OpenAI ChatCompletions y Anthropic. Es importante destacar que solo se actualizó la API Flash en esta versión; V4 Pro y las experiencias de aplicación/web de DeepSeek no cambian. Para los equipos, eso significa una mejora inmediata para cargas de trabajo de agentes al mismo precio, sin migración.

Arquitectura: un MoE de activación reducida diseñado para rendimiento
V4 Flash es un modelo de mezcla de expertos con aproximadamente 284 mil millones de parámetros totales, pero solo unos 13 mil millones activos por token. Esa baja cantidad de parámetros activos es el punto clave: mantiene la inferencia rápida y económica, mientras que un amplio grupo de expertos preserva la calidad. La ventana de contexto es de 1 048 576 tokens completos (alrededor de 1M), con un máximo de salida muy grande de 384K, y el modelo admite razonamiento (pensamiento extendido), llamada de herramientas y JSON estructurado. La entrada es solo texto. El objetivo de diseño —trabajo agéntico de alto volumen y baja latencia— se refleja en las cifras de servicio: un p50 de tiempo hasta el primer token de alrededor de 394 milisegundos y una salida de aproximadamente 184 tokens por segundo en las mediciones de OrcaRouter.
Benchmarks: lo que dicen los números oficiales
El lanzamiento oficial se apoya fuertemente en evaluaciones de agentes y codificación, ejecutadas con el propio harness de DeepSeek (configuraciones de modo mínimo / esfuerzo máximo). Así es como se deben leer los resultados principales, todos reportados por DeepSeek:
• Terminal-Bench 2.1: 82.7 — tareas agénticas de línea de comandos/software en una terminal real. Una puntuación alta aquí indica que el modelo puede manejar herramientas y shells de verdad, no solo responder preguntas.
• Toolathlon (verificado): 70.3 y Automation Bench (público): 25.1 — amplitud y fiabilidad del uso de herramientas y automatización de extremo a extremo. La fiabilidad de la llamada a herramientas es el factor decisivo para los agentes.
• Cybergym: 76.7 — resolución de problemas agénticos estilo seguridad/CTF.
• DeepSWE: 54.4, NL2Repo: 54.2, DSBench-FullStack: 68.7, DSBench-Hard: 59.6 — ingeniería de software y codificación full-stack, desde generación a nivel de repositorio hasta tareas complejas de ciencia de datos. El fuerte resultado en DSBench-FullStack (68.7) apunta a una competencia práctica en codificación multiarchivo.
• Agent Last Exam: 25.2 — un desafío de razonamiento agéntico deliberadamente difícil en el que incluso los mejores modelos obtienen puntuaciones bajas; útil como señal relativa, no absoluta.
Para contexto independiente, Artificial Analysis (evaluado el 2026-06-25, compilación preliminar) situó a V4 Flash en torno a 56.2 AA Coding, 40.3 AA Intelligence y 50.0 AA Math — un generalista con inclinación a la programación, por encima de la mediana de los modelos abiertos. El ajuste posterior al entrenamiento oficial apunta directamente al eje agéntico/programación, así que cabe esperar que la compilación más reciente se sienta más fuerte precisamente en esas tareas. Como siempre, los números de los entornos de evaluación de los proveedores resultan optimistas; valida con tus propias cargas de trabajo.
Precios: el número que cambia los presupuestos
En OrcaRouter, que transmite los precios del proveedor con un margen del 0%, V4 Flash cuesta alrededor de $0.15 por millón de tokens de entrada y $0.29 por millón de tokens de salida, con lecturas de caché en torno a $0.02 — y DeepSeek mantuvo precios bajos en esta versión (sin aumento por la actualización). Eso es aproximadamente un tercio de los $0.44 / $0.88 de DeepSeek V4 Pro. En términos reales: 10 millones de tokens al mes con una división de 70% entrada / 30% salida cuesta del orden de un par de dólares en V4 Flash; escala a mil millones de tokens y la diferencia frente a un modelo insignia se convierte en una partida que finanzas nota. El almacenamiento en caché de prompts lo reduce aún más para agentes y chats con un prompt de sistema estable, ya que la entrada en caché se factura a aproximadamente una décima parte de la entrada nueva. Capacidad agéntica más barata al mismo precio bajo es toda la propuesta de esta versión.
Dónde encaja V4 Flash: la escalera de DeepSeek V4
La línea V4 de DeepSeek es una escalera. V4 Pro es el buque insignia: un modelo de razonamiento y codificación mucho más grande y de primer nivel. V4 Flash es el nivel de eficiencia: mucha menos computación activa, una fracción del precio y, tras esta actualización de post-entrenamiento, una capacidad de agencia y codificación genuinamente sólida. El hecho de que DeepSeek haya invertido en hacer de Flash un mejor agente(Responses API, adaptación de Codex, benchmarks de uso de herramientas) te dice dónde espera que se ejecute el volumen: tráfico cotidiano de agencia y codificación en Flash, el razonamiento más difícil reservado para Pro. Eso refleja el patrón de toda la industria de opción económica por defecto más buque insignia premium — y es por eso que enrutar por dificultad supera a usar por defecto el modelo más grande.

Tres escenarios del mundo real
1. Agentes de codificación y flujos de trabajo estilo Codex
La compilación -0731 incluye soporte nativo para Responses-API y Codex, además de sus puntuaciones en Terminal-Bench (82.7) y DSBench-FullStack (68.7), lo que convierte a V4 Flash en un motor potente y económico para agentes de codificación autónomos: corrección de problemas, refactorizaciones, generación de pruebas y uso de herramientas en múltiples pasos.
2. Agentes que utilizan herramientas a gran escala
Primeros tokens rápidos (~394 ms), alto rendimiento (~184 tok/s), un contexto de 1M y una sólida fiabilidad en Toolathlon (70.3) se adaptan a agentes de producción que invocan herramientas a escala — recuperación, automatización y orquestación.
3. Procesamiento de documentos largos con un presupuesto limitado
El contexto completo de 1M de tokens y la salida de 384K manejan el resumen, análisis o transformación de entradas muy grandes — registros, bases de código, informes largos — en una sola pasada, de forma económica.
Cómo acceder a V4 Flash
Puedes llamar a V4 Flash directamente en la API de DeepSeek (ID del modelo code>deepseek-v4-flash/code>; admite la Responses API, OpenAI ChatCompletions e interfaces de estilo Anthropic), o mediante un endpoint independiente del proveedor. a href="https://www.orcarouter.ai/">OrcaRouter/a> expone V4 Flash con un margen del 0 % a través de un único endpoint compatible con OpenAI (code>deepseek/deepseek-v4-flash/code>) junto a otros 185+ modelos — para que puedas compararlo con GPT-5.6 Luna, Gemini 3.6 Flash, GLM-5.2, Qwen 3.8 y Kimi K3 en un solo lugar, y enrutar cada solicitud a la opción más económica para la tarea. Como es compatible con OpenAI, adoptar V4 Flash —o dejar de usarlo— es un cambio de configuración, no una reintegración.

Limitaciones y salvedades honestas
V4 Flash es un modelo de eficiencia, no un buque insignia: en el razonamiento más difícil va por detrás de V4 Pro y de los mejores modelos occidentales. La entrada es solo texto (sin entrada de imagen nativa). Las puntuaciones de referencia aquí son las que DeepSeek reporta utilizando su propio banco de pruebas, así que trate los números exactos como orientativos y espere que las evaluaciones independientes den resultados algo más bajos. Y «barato por token» no es «barato por tarea» si deja que los bucles de razonamiento o de agentes se ejecuten durante mucho tiempo: limite el esfuerzo de razonamiento y las iteraciones de herramientas en llamadas simples. Valide con su propia carga de trabajo antes de comprometer tráfico de producción.
Preguntas frecuentes
¿Qué es DeepSeek V4 Flash?
El modelo de eficiencia de DeepSeek en la línea V4: un modelo de mezcla de expertos con 284B / 13B activos, con un contexto de 1M de tokens, hasta 384K de salida, optimizado para trabajo rápido, de alto volumen, agéntico y de codificación. Su lanzamiento oficial (compilación -0731) se publicó el 31 de julio de 2026.
¿Qué cambió en la versión oficial?
La arquitectura no cambia; es una mejora post-entrenamiento que mejora significativamente la capacidad agéntica, de codificación y de invocación de herramientas, y añade soporte nativo de Responses-API con adaptación de Codex. Solo se actualizó la API Flash: V4 Pro y la app/web siguen igual.
¿Cuánto cuesta V4 Flash?
Aproximadamente {{1}}$0.15 por millón de tokens de entrada{{/1}} y {{2}}$0.29 por millón de tokens de salida{{/2}} en OrcaRouter (margen del 0%), con ~{{3}}$0.02 en lecturas de caché{{/3}} — aproximadamente un tercio de los {{4}}$0.44 / $0.88{{/4}} de V4 Pro. {{5}}Los precios se mantuvieron bajos en esta versión.{{/5}}
¿Qué tan bueno es V4 Flash en tareas de agente y de codificación?
DeepSeek informa puntuaciones sólidas: Terminal-Bench 2.1 82.7, Toolathlon (verificado) 70.3, Cybergym 76.7, DeepSWE 54.4, DSBench-FullStack 68.7 — todas cifras del harness del proveedor, así que verifícalas en tus propias tareas.
¿Cómo se compara V4 Flash con V4 Pro?
Pro es el buque insignia mucho más grande para el razonamiento y la codificación más difíciles; Flash es el nivel de eficiencia a ~1/3 del precio con una fuerte capacidad agéntica/de codificación. Enruta las tareas difíciles a Pro, todo lo demás a Flash.
¿Cuál es la ventana de contexto?
Un total de 1.048.576 tokens (aproximadamente 1M), con hasta 384K tokens de salida.
¿Es V4 Flash multimodal?
No — la entrada es solo texto. Admite razonamiento, llamada de herramientas y salida JSON.
¿Funciona V4 Flash con la API de Responses y Codex?
Sí: la versión -0731 añade soporte nativo para la API de Responses y una adaptación específica para Codex, junto con interfaces de estilo OpenAI ChatCompletions y Anthropic.
¿Cómo uso V4 Flash?
Directamente a través de la API de DeepSeek, o mediante el endpoint compatible con OpenAI de OrcaRouter con un margen de beneficio del 0% (code>deepseek/deepseek-v4-flash/code>), donde también puedes comparar y enrutar entre modelos rivales.
En resumen
El lanzamiento oficial de DeepSeek V4 Flash mantiene la receta barata y rápida y lo convierte en un agente mucho mejor: mismo MoE de 284B / 13B activos y contexto de 1M, pero con post-entrenamiento para una codificación y uso de herramientas más sólidos, con soporte nativo de Responses-API y Codex — al mismo precio de ~0,15 $ / 0,29 $. No es un modelo insignia ni multimodal, pero para la gran mayoría de trabajos de agentes, codificación y documentos largos, es una de las mejores opciones de valor por token en 2026. Pruébalo a través de un endpoint compatible con OpenAI y sin recargo (margen del 0%), como OrcaRouter, y enruta la minoría de solicitudes más difíciles a un modelo insignia: esa combinación es difícil de superar en costo.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
