
Reseña de DeepSeek V4: ¿Los modelos serios de 1 millón de tokens más baratos en IA?
- anthropicNUEVOAnthropic: Claude Opus 52026-07-2461Inteligencia78Código
- googleNUEVOGoogle: Gemini 3.6 Flash2026-07-2150Inteligencia69Código
- googleNUEVOGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaNUEVOMeta: Muse Spark 1.12026-07-1651Inteligencia71Código
- kimiNUEVOMoonshotAI: Kimi K32026-07-1557Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Inteligencia77Código
- grokxAI: Grok 4.52026-07-0854Inteligencia72Código
- tencentTencent: Hy32026-07-0641Inteligencia59Código
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencia42Código
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencia39Código
- anthropicAnthropic: Claude Sonnet 52026-06-3053Inteligencia72Código
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencia52Código57Matemáticas
- z-aiZ.ai: GLM 5.22026-06-1651Inteligencia69Código60Matemáticas
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Inteligencia61Código61Matemáticas
- anthropicAnthropic: Claude Fable 52026-06-0960Inteligencia77Código
- qwenQwen: Qwen3.7 Plus2026-06-0139Inteligencia56Código59Matemáticas
- minimaxMiniMax: MiniMax M32026-05-3144Inteligencia59Código59Matemáticas
- AnthropicAnthropic: Claude Opus 4.82026-05-2856Inteligencia74Código68Matemáticas
DeepSeek lanzó la familia V4 el 24 de abril de 2026 — dos modelos, V4-Pro y V4-Flash, disponibles en la API y de código abierto desde el primer día — y silenciosamente redefinió el estándar de lo que cuesta una capacidad seria de IA. Ambos modelos tienen una ventana de contexto de 1 millón de tokens por defecto, ambos ofrecen modos de pensamiento y no pensamiento, y el buque insignia V4-Pro alcanza un máximo de $0,87 por millón de tokens de salida: un precio que subcotiza a todos los modelos comparables con contexto de 1M en el mercado, sean abiertos o cerrados.
Y julio es el mes de las decisiones. En un aviso con fecha del 29 de junio, DeepSeek confirmó que la versión oficial de V4 llegará a mediados de julio de 2026, prometiendo mejoras en funciones y rendimiento, e introduciendo tarifas de hora punta que duplican los precios durante las ventanas comerciales de Pekín. Diez días después, el 24 de julio, los nombres de los modelos heredados `deepseek-chat` y `deepseek-reasoner` se retirarán definitivamente. Esta reseña cubre qué es realmente V4, cuánto cuesta hoy y después del lanzamiento oficial, dónde gana, dónde claramente no, y qué hacer antes de los plazos.
Veredicto rápido
Considera DeepSeek V4 si tú…
- Ejecute cargas de trabajo de alto volumen de producción donde el costo unitario decide lo que es viable — el precio de V4 está en una clase aparte
- Necesita contexto largo de manera económica: 1M tokens estándar, hasta 384K tokens de salida por respuesta, con descuentos agresivos de almacenamiento en caché de contexto
- Quiere integración directa — la API habla tanto en formatos de OpenAI ChatCompletions como de Anthropic, por lo que las herramientas existentes funcionan en su mayoría
- Valorar las opciones de pesos abiertos y autoalojamiento, especialmente el V4-Flash más pequeño.
Aplaza (o desvía a otro lugar) si tú…
- Ejecutar agentes autónomos de horizonte largo — en la tabla de modelos cruzados publicada por Z.ai, V4-Pro queda muy por detrás tanto de GLM-5.2 como de la frontera cerrada en los puntos de referencia de estilo maratón.
- Necesita entrada de imagen: V4 es solo texto
Confíe en tarifas planas las 24 horas del día — desde el lanzamiento oficial a mediados de julio de 2026, las tarifas de hora punta se duplican durante los horarios comerciales de Pekín (las horas valle mantienen las tarifas actuales).
¿Qué es DeepSeek V4?
V4 es la familia de modelos de cuarta generación de DeepSeek, lanzada como dos modelos Mixture-of-Experts. DeepSeek-V4-Pro es el modelo insignia: 1,6 billones de parámetros totales con 49 mil millones activos por token. DeepSeek-V4-Flash es el nivel de eficiencia: 284 mil millones totales, 13 mil millones activos. Ambos ejecutan una ventana de contexto de 1M de tokens por defecto en los servicios oficiales de DeepSeek, y ambos exponen dos modos — pensamiento para problemas difíciles, no pensamiento para velocidad — bajo los IDs de modelo deepseek-v4-pro y `deepseek-v4-flash`.
Dos detalles de posicionamiento importan. Primero, V4 se lanzó como un avance que DeepSeek trata como utilizable en producción — y según el aviso de la compañía del 29 de junio, la versión oficial llegará a mediados de julio de 2026 con "optimizaciones de características y mejoras de rendimiento". Segundo, se lanzó de código abierto, continuando el patrón de DeepSeek de publicar pesos públicamente — lo que mantiene en juego el autoalojamiento y el ajuste fino, de manera realista para el 284B Flash más que para el 1.6T Pro.
¿Qué hay de nuevo en DeepSeek V4?

Un contexto de 1M-token como predeterminado, no una mejora de pago.Cada servicio oficial de DeepSeek ahora ejecuta la ventana completa de un millón de tokens como estándar — sin SKU de contexto largo separado, sin tarifa premium.
Enorme margen de salida. Ambos modelos admiten hasta 384K tokens de salida por respuesta — el triple de lo que permiten la mayoría de los rivales con contexto de 1M — lo cual es importante para la generación de código de archivo completo, extracciones estructuradas largas y redacción de informes.
Modos duales en un solo endpoint.Modo de pensamiento para problemas difíciles, modo sin pensamiento para llamadas rápidas y económicas, cambiable por solicitud en lugar de por modelo.
Dos niveles con una forma de API. Pro para capacidad, Flash para volumen — mismo contexto, mismos modos, misma integración.
Compatibilidad de API dual.V4 habla de forma nativa tanto los formatos OpenAI ChatCompletions como Anthropic API, por lo que la mayoría de las herramientas de agentes existentes se conectan sin necesidad de reescritura.
Precios: lo que realmente cuesta

Esta es la sección que hace famoso a V4.V4-Pro cuesta $0.435 por millón de tokens de entrada y $0.87 por millón de salida. V4-Flash cuesta $0.14 y $0.28.Los aciertos de caché en contexto repetido se enumeran a menos de un centavo por millón de tokens — efectivamente gratis para bucles de agente que releen el mismo estado del proyecto.
A modo de referencia: GLM-5.2, considerado la opción con mejor relación calidad-precio del verano, lista $1.40 / $4.40. Claude Sonnet 5 lista $3 / $15, Claude Opus 4.8 $5 / $25. El precio de salida de V4-Pro es una quinta parte del de GLM-5.2 y aproximadamente el 3 % del de Opus 4.8. Incluso si V4-Pro pierde algunos enfrentamientos directos de calidad — y así es — la economía cambia qué preguntas vale la pena hacerle a un modelo.
Un cambio llegará con el lanzamiento oficial. Según el aviso de DeepSeek del 29 de junio, desde mediados de julio todos los precios de los tokens se duplican durante las ventanas pico — 09:00–12:00 y 14:00–18:00 hora de Beijing — mientras que las horas de menor actividad mantienen las tarifas actuales. Incluso duplicado, el precio de salida pico de V4-Pro (alrededor de $1.74 por millón) sigue siendo inferior a la tarifa estándar de GLM-5.2, pero la era de precio fijo termina con la vista previa: si su tráfico alcanza su punto máximo durante el horario comercial chino, modele el cambio — o programe y enrute alrededor de él.
Puntuación de reseña
Las puntuaciones a continuación son nuestra evaluación editorial basada en la documentación oficial de DeepSeek y la tabla de referencia cruzada de modelos publicada por Z.ai; trate los números entre proveedores como contexto de terceros en lugar de afirmaciones propias de DeepSeek.

- Codificación: 8/10 — capaz en ingeniería cotidiana; no es el líder de peso abierto.
- Uso agentivo / de herramientas: 7/10 — buena orquestación de herramientas, débil en autonomía de larga duración (tipo maratón)
- Razonamiento: 8/10 — puntuaciones sólidas en matemáticas y ciencias para la clase de precio
- Eficiencia de costos: 10/10 — nada comparable se le acerca
- Contexto y documentos largos: 9/10 — 1M de entrada, 384K de salida, aciertos de caché casi gratuitos
- Velocidad: 8/10 — recuentos de parámetros activos reducidos, más un modo sin pensamiento para rutas rápidas
General: ~8.3/10 — el rey de la relación precio-rendimiento de mediados de 2026, con un asterisco a largo plazo.
Ventajas
- Precios que reinician la curva: $0.14–$0.87 por millón de tokens en toda la familia.
- Estándar de contexto de 1M con 384K de salida — el techo de salida más grande en su clase
- Modos de pensamiento y no pensamiento en un único punto final, intercambiables por solicitud
- La compatibilidad con las API de OpenAI y Anthropic significa una fricción de migración casi nula.
- Los pesos de código abierto mantienen el autoalojamiento y el ajuste fino sobre la mesa.
Contras
- El trabajo agéntico de largo plazo es la clara debilidad — en la tabla publicada de Z.ai, V4-Pro obtiene 29.0 en FrontierSWE mientras que GLM-5.2 alcanza 74.4 y Claude Opus 4.8 75.1
Solo texto: sin entrada de imágenes en la API V4
- El precio por hora punta llega con el lanzamiento oficial de mediados de julio — las tarifas se duplican durante las ventanas comerciales de Beijing, por lo que los presupuestos dejan de ser planos.
Todavía es una vista previa hasta mediados de julio, por lo que el comportamiento puede cambiar con la versión oficial.
- La retirada del 24 de julio de 2026 de deepseek-chat y deepseek-reasoner obliga a los usuarios heredados a migrar según el cronograma de DeepSeek.
- Autoalojar el Pro de 1,6 billones de parámetros es poco práctico para casi todo el mundo (Flash, con 284B, es el objetivo realista)
Cómo se compara DeepSeek V4

V4-Pro vs V4-Flash.Mismo contexto, mismos modos, misma API — la división es calidad versus rendimiento con una brecha de precio de 3x. Una opción predeterminada sensata: Flash para resúmenes, extracción, clasificación y chat; Pro para código, análisis y cualquier cosa que un humano revise.
vs GLM-5.2.La batalla de pesos abiertos del verano, y está genuinamente reñida en valor. GLM-5.2 es el codificador más potente — en la tabla publicada de Z.ai lidera a V4-Pro 81.0 a 64.0 en Terminal-Bench 2.1 y domina el trabajo de largo plazo (74.4 vs 29.0 en FrontierSWE) — mientras que V4 contraataca con precios 3–5x más bajos y el triple del techo de salida. Los pipelines de volumen se inclinan hacia V4; los agentes de codificación se inclinan hacia GLM-5.2.
frente a la frontera cerrada.Claude Opus 4.8 y GPT-5.5 siguen siendo modelos claramente más fuertes en benchmarks difíciles. Pero con una brecha de precio de salida de 30–60x frente a Opus 4.8, V4 no está tratando de ganar esa pelea — está tratando de hacer que el 90 % de tu tráfico sea demasiado barato como para justificar enviarlo a cualquier otro lado.
El plazo del 24 de julio: migración desde nombres heredados

Si su integración todavía llama a `deepseek-chat` o `deepseek-reasoner`, esos nombres dejarán de funcionar después del 24 de julio de 2026, 15:59 UTC. Actualmente, se enrutan a V4-Flash, lo que significa que su tráfico ya está funcionando con la economía de V4 — pero después del corte, las solicitudes fallan directamente. La migración en sí es una línea (`model: "deepseek-v4-pro"` o `"deepseek-v4-flash"`), así que el trabajo real es volver a probar los prompts con el comportamiento de V4 y decidir, endpoint por endpoint, qué nivel merece cada carga de trabajo — o poner un enrutador delante para que la próxima obsolescencia sea un cambio de configuración en lugar de un cambio de código.
¿Quién debería usar DeepSeek V4?
Productos de alto volumen — soporte, resumen, extracción, clasificación — donde los precios de V4 convierten características marginales en rentables
Cargas de trabajo de documentos largos y con mucho RAG que llenan ventanas de 1M de tokens diariamente y se benefician de aciertos de caché casi gratuitos
Equipos que generan resultados largos: bases de código, informes, datos estructurados — 384K de salida es el techo de la clase.
Constructores conscientes del costo que quieren un valor predeterminado capaz y están felices de escalar el difícil 10% en otro lugar
¿Quién debería buscar en otra parte?
Equipos cuya carga de trabajo principal son agentes autónomos de larga duración — GLM-5.2 o un buque insignia cerrado es el camino más seguro.
Flujos de trabajo dependientes de la visión (V4 no toma imágenes)
Cualquier persona que necesite hoy una etiqueta contractual 'estable' en lugar de una vista previa.
¿Vale la pena DeepSeek V4?
Por el precio, enfáticamente sí — como un carril, no una religión. V4 no supera al mejor codificador de peso abierto (GLM-5.2) ni a los buques insignia de frontera en calidad, y sus números de agente de horizonte largo son genuinamente débiles. Lo que hace es que enormes franjas del trabajo cotidiano de IA — los resúmenes, extracciones, borradores y turnos de chat que dominan las facturas reales de tokens — cuesten casi nada. El patrón ganador es V4 como el piso de volumen, con carriles de escalada por encima.
Veredicto final
DeepSeek V4 es el referente de precio-rendimiento contra el que ahora se mide cualquier otro modelo — nuestra puntuación: ~8,3/10. Usa Flash donde el volumen manda, Pro donde la calidad importa pero los presupuestos son reales, y deriva el trabajo de primer nivel a un modelo más potente. Recalcula tus costes cuando lleguen los precios máximos a mediados de julio — lo barato sigue siendo barato, pero deja de ser plano. Y si todavía usas deepseek-chat o deepseek-reasoner: tienes hasta el 24 de julio. Muévete.
Usando DeepSeek V4 a través de OrcaRouter
Una estrategia de tres carriles — V4 para volumen, un modelo abierto o cerrado más fuerte para tareas difíciles, un respaldo para fiabilidad — es exactamente la configuración que es tediosa de manejar a mano y trivial detrás de una puerta de enlace. OrcaRouter sirve DeepSeek V4 junto con GLM-5.2, Claude, GPT, Gemini y más de 200 modelos adicionales a través de un único punto final compatible con OpenAI, a precios de lista del proveedor sin recargo por token: el enrutamiento inteligente selecciona el carril por solicitud, la conmutación por error automática cubre los contratiempos de la era de vista previa, y la observabilidad por modelo muestra lo que cada carril realmente cuesta por tarea completada. También neutraliza cambios del lado del proveedor, como la retirada del nombre del 24 de julio o los precios de hora punta de mediados de julio — cuando un nombre de modelo desaparece o se abre una ventana de precio, actualizas una regla de enrutamiento, no tu base de código.


Preguntas frecuentes
¿Está disponible DeepSeek V4 ahora?
Sí — V4-Pro y V4-Flash están disponibles en la API de DeepSeek desde el 24 de abril de 2026, bajo los ID de modelo deepseek-v4-pro y deepseek-v4-flash, con pesos de código abierto. Oficialmente es una vista previa; el aviso del 29 de junio de DeepSeek sitúa la versión oficial a mediados de julio de 2026.
¿Cuál es el precio por horas punta de DeepSeek?
Anunciado para el lanzamiento oficial: a partir de mediados de julio de 2026, todos los precios de los tokens se duplican durante las ventanas de negocio de Pekín (09:00-12:00 y 14:00-18:00 hora de Pekín), mientras que las horas de menor actividad mantienen las tarifas actuales. El tráfico que alcanza su punto máximo fuera del horario laboral chino (la mayoría de las cargas de trabajo occidentales) evita en gran medida el recargo.
¿Qué sucede con deepseek-chat y deepseek-reasoner?
Actualmente se enrutan automáticamente a V4-Flash, pero después del 24 de julio de 2026 (15:59 UTC) ambos nombres están completamente retirados y las solicitudes fallarán. Actualice el parámetro del modelo explícitamente antes de la fecha límite.
¿Debería usar V4-Pro o V4-Flash?
Flash para trabajo de volumen que un humano nunca revisa línea por línea — resúmenes, extracción, clasificación, chat. Pro para código, análisis y redacción, a aproximadamente 3 veces el precio de Flash pero aún muy por debajo de cualquier modelo comparable.
¿Es DeepSeek V4 mejor que GLM-5.2?
Más barato, no mejor. En la tabla publicada de Z.ai, GLM-5.2 lidera claramente en codificación y domina el trabajo de agentes de largo plazo; V4 contrarresta con precios 3–5 veces más bajos, un límite de salida de 384K y aciertos de caché casi gratuitos. Muchos equipos usan ambos: V4 para volumen, GLM-5.2 para agentes de codificación.
¿Puede DeepSeek V4 manejar imágenes?
No — la API V4 es solo texto. Enrute las tareas de visión (capturas de pantalla, PDF como píxeles, gráficos) a un modelo multimodal como Claude o Gemini en su lugar.
¿Puedo auto-alojar DeepSeek V4?
Los pesos son de código abierto, pero sé realista sobre la escala: V4-Pro es un MoE de 1.6T parámetros — territorio de centro de datos — mientras que el V4-Flash de 284B es el objetivo práctico de autoalojamiento para equipos con buenos recursos.
¿Funciona V4 con mis herramientas existentes de OpenAI o Claude?
Mayoritariamente sí: la API es compatible de forma nativa tanto con los formatos OpenAI ChatCompletions como Anthropic, por lo que los frameworks de agentes y SDKs construidos para cualquiera de ellos suelen conectarse con un cambio de URL base y nombre de modelo.
¿Puedo usar DeepSeek V4 a través de OrcaRouter?
Sí: los modelos DeepSeek están disponibles en OrcaRouter a los precios de lista del proveedor sin margen de beneficio, junto a GLM, Claude, GPT y Gemini, para que pueda ejecutar la división de volumen y escalada detrás de un único endpoint.
¿Listo para hacer que tu factura de tokens sea aburrida? Crea tu cuenta de OrcaRouter, apunta tu cliente compatible con OpenAI a un endpoint y enruta el volumen hacia DeepSeek V4 mientras que los modelos más fuertes manejan la cumbre — sin margen de beneficio en tokens y una integración a prueba del 24 de julio.
