DeepSeek V4 Flash vs V4 Pro: la gama de eficiencia frente al buque insignia, comparados
Guides & Insights

DeepSeek V4 Flash vs V4 Pro: la gama de eficiencia frente al buque insignia, comparados

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La línea V4 de DeepSeek es una escalera de dos peldaños: V4 Flash, el modelo de eficiencia barato y rápido — ahora en su versión oficial -0731 con agentes mucho más potentes — y V4 Pro, el gran buque insignia para el razonamiento y la codificación más difíciles, que pasó a su compilación GA oficial (0813) el 12 de agosto de 2026. Lo interesante es lo poco que los separa en el trabajo práctico y lo mucho que los separa en el precio. Esta guía compara ambos en capacidad, costo, velocidad y adecuación, con cada cifra etiquetada según su fuente.

Nota de precisión: las puntuaciones de agente/código de V4 Flash son reportadas por DeepSeek (registro de cambios oficial, 2026-07-31, harness de DeepSeek); las puntuaciones de GA (0813) de V4 Pro también son reportadas por DeepSeek con el mismo harness, y aún no se ha publicado ninguna evaluación independiente de la build 0813. Los precios están vigentes al 12 de agosto de 2026; la reducción de precio de GA se traslada a través de OrcaRouter con un margen del 0%. Las cifras del harness del proveedor tienden a ser optimistas: verifícalo en tus propias tareas.

TL;DR. V4 Flash es un MoE de 284B / 13B activos a $0.08 / $0.18 por millón de tokens; V4 Pro es el buque insignia mucho más grande, ahora en su compilación GA oficial (0813) a $0.435 / $0.87 — unas cinco veces el precio de Flash, frente a las aproximadamente catorce veces anteriores al recorte de precios de agosto. En codificación práctica, Flash se queda a pocos puntos de Pro (p. ej., SWE-bench Verified ~79% frente a ~80.6%, según lo reportado por agregadores), y la actualización de post-entrenamiento -0731 convierte a Flash en un agente sólido por derecho propio. Use Pro para el razonamiento más difícil y la codificación multiarchivo más exigente; use Flash para la mayoría de gran volumen — y enrute por dificultad para obtener gran parte de la calidad de Pro a aproximadamente una quinta parte del costo.

Conclusiones clave

• Tamaño y precio: Flash es 284B / 13B activos a $0.08 / $0.18; Pro es el buque insignia mucho más grande a $0.435 / $0.87 — Flash cuesta aproximadamente una quinta parte, y el recorte de precio de GA de Pro redujo la antigua brecha de ~14x a aproximadamente 5x.

• La brecha de codificación es pequeña: el agregador SWE-bench Verified reporta ~79 % (Flash) frente a ~80,6 % (Pro, de la era de vista previa; la versión GA aún no tiene puntuaciones independientes); en la plataforma de DeepSeek, el Pro GA obtiene 87,9 en Terminal-Bench 2.1 frente a los 82,7 de Flash.

• Ambos comparten el contexto de 1M de tokens y la salida de 384K; ambos son solo texto, con razonamiento, herramientas y JSON.

Flash es más rápido y más económico de servir (p50 TTFT ~394 ms, ~184 tok/s); Pro sacrifica velocidad por capacidad máxima.

• Mejor práctica: enrutar por dificultad — Flash para el volumen, Pro para la minoría difícil.

Qué es cada modelo

V4 Flash es el nivel de eficiencia: un modelo de mezcla de expertos con 284B en total, pero solo ~13B de parámetros activos, un contexto de 1M de tokens, salida de hasta 384K, optimizado para trabajo agéntico de alto volumen y baja latencia. Su -0731 lanzamiento oficial (31 de julio de 2026) es una mejora de post-entrenamiento que afinó los agentes, la programación y el uso de herramientas, y añadió soporte nativo para Responses API y Codex. V4 Pro es el buque insignia de DeepSeek: un modelo mucho más grande, diseñado para el razonamiento y la programación más exigentes, donde la máxima capacidad importa más que el costo. Estuvo disponible como vista previa desde abril y luego pasó a su versión GA oficial el 12 de agosto de 2026, con un precio mucho más bajo. Ambos pertenecen a la misma familia V4 y comparten el contexto de 1M, la entrada de solo texto y el soporte de razonamiento, herramientas y JSON.

Capacidad: ¿qué tan cerca está Flash de Pro?

Más cerca de lo que sugiere la diferencia de precio, al menos en codificación práctica. Las evaluaciones agregadas sitúan a V4 Flash (Max) en torno al 79,0% en SWE-bench Verified —resolviendo problemas reales de GitHub— frente a aproximadamente el 80,6% de V4 Pro según las pruebas de su era de vista previa. La versión GA (0813) es demasiado nueva para obtener puntuaciones independientes —aún no se ha publicado ninguna—, por lo que la mejor comparación disponible para Pro es el propio entorno de pruebas de DeepSeek, donde la versión GA registra 87,9 en Terminal-Bench 2.1 y 62,7 en DeepSWE, frente a las cifras de Flash -0731 de 82,7 y 54,4 (todas reportadas por DeepSeek). Donde Pro se destaca es en el extremo más difícil: el razonamiento multi-paso más complejo, la codificación multi-archivo más complicada y las tareas donde un presupuesto mayor de parámetros activos realmente ayuda. Si la mayor parte de tu trabajo es «difícil pero no de frontera», Flash lo cubre; reserva Pro para la minoría realmente de frontera.

Precio y velocidad: la ventaja decisiva de Flash

Aquí es donde los dos divergen más — y donde las matemáticas acaban de cambiar. Flash está a $0.08 / $0.18 por millón de tokens de entrada/salida; la versión GA oficial de V4 Pro (0813) está a $0.435 / $0.87 — unas cinco veces el precio de Flash. Eso sigue siendo una prima real, pero una fracción de la brecha de ~14x anterior al recorte de precios: la antigua listing de deepseek-v4-pro se situaba en $1.168 / $2.336, así que la versión GA es aproximadamente un 63% más barata. En un mes de 10 millones de tokens con un 70% de entrada, Flash cuesta alrededor de $1.10 y Pro unos $5.66 — la proporción se mantiene a medida que escalas a miles de millones de tokens. Flash también está diseñado para rendimiento (p50 TTFT ~394 ms, ~184 tok/s), por lo que es la mejor opción para agentes de alto volumen sensibles a la latencia. La prima de Pro compra capacidad máxima, no velocidad ni ahorro — pero con la brecha en ~5x en lugar de ~14x, el precio de ese margen de gama alta ha bajado muchísimo.

El patrón correcto: enrutar por dificultad

No tienes que elegir uno. La configuración económica de alta calidad envía la mayoría de las solicitudes fáciles o moderadas a Flash y solo escala las más difíciles a Pro. Como ambos son de la misma familia, con el mismo contexto e interfaces, ese enrutamiento es fluido; y la actualización -0731 hace que Flash ahora cubra más del nivel intermedio antes de que tengas que escalar. Si se hace bien, el enrutamiento por dificultad ofrece la mayor parte de la calidad de Pro a un coste cercano al de Flash, y el recorte de precio de GA hace que la escalada ocasional a Pro sea notablemente más barata que durante la vista previa.

¿Cuál deberías elegir?

Elige V4 Flash si…

Ejecutas cargas de trabajo agénticas, de codificación o de documentos largos de alto volumen donde el costo y la velocidad importan, y la calidad "casi de gama alta" es suficiente, lo que, tras la actualización -0731, cubre mucho terreno.

Elige V4 Pro si…

Necesitas la máxima capacidad para el razonamiento más difícil y la codificación multiarchivo más exigente, y estás dispuesto a pagar unas 5 veces el precio de Flash por ese margen de gama alta: una petición mucho más fácil que la prima de ~14x que conllevaba el precio de la era de vista previa.

Usa ambos a través de un único endpoint.

Ambos están disponibles en OrcaRouter con un margen del 0% a través de un endpoint compatible con OpenAI — Flash como deepseek/deepseek-v4-flash-0731 y Pro como la versión oficial deepseek/deepseek-v4-pro-0813 GA build — para que puedas implementar el enrutamiento por dificultad como una opción de configuración, comparar ambos con tus propias tareas y cambiar el tráfico sin reintegrar. Esa es la forma más sencilla de aprovechar los ahorros de Flash mientras mantienes Pro disponible para la minoría difícil.

Preguntas frecuentes

¿Es V4 Flash tan bueno como V4 Pro?

En la codificación práctica, casi a la par — el agregado SWE-bench Verified es ~79% frente a ~80.6% (era de vista previa para Pro; la versión GA aún no tiene puntajes independientes). En el razonamiento más difícil y la codificación más compleja, Pro lidera. Para la mayoría de las cargas de trabajo, Flash es suficiente después de la actualización -0731.

¿Cuánto más barato es V4 Flash?

Flash cuesta aproximadamente la quinta parte del precio de Pro: $0.08 / $0.18 por millón de tokens frente a los $0.435 / $0.87 de GA Pro. Antes del recorte de precios de Pro en agosto, la diferencia era de ~14x; ahora es de aproximadamente 5x.

¿Comparten la misma ventana de contexto?

Sí — ambos ofrecen un contexto de 1M de tokens (1,048,576) y hasta 384K de salida.

¿Cuál es más rápido?

Flash, por diseño — p50 tiempo hasta el primer token de alrededor de 394 ms y ~184 tokens/segundo, optimizado para uso de alto volumen y baja latencia.

¿Puedo usar ambos juntos?

Sí — enruta por dificultad a través del endpoint único de OrcaRouter: Flash para el volumen, Pro para las tareas más difíciles.

En resumen

V4 Flash vs V4 Pro es eficiencia frente a capacidad máxima. Flash te da la mayor parte de la capacidad práctica de codificación de Pro, además de un agente genuinamente fuerte tras la actualización -0731, a aproximadamente una quinta parte del precio y con mayor velocidad; la compilación GA oficial de Pro es la insignia para los trabajos más difíciles, y su recorte de precio —hasta $0.435 / $0.87, unas cinco veces Flash en lugar de las antiguas catorce— hace que ese nivel superior sea más asequible que nunca. La jugada inteligente no es uno u otro — es enrutar por dificultad a través de un solo endpoint como OrcaRouter, de modo que el volumen se ejecute barato en Flash y solo la minoría difícil pague por Pro.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube