Tarjeta de título principal que dice 'DeepSeek V4.1 Flash vs DeepSeek V4 Pro' con el subtítulo 'El relevo programado, cancelado el 2026-09-11', dos tarjetas que dicen 'DeepSeek V4.1 Flash — Índice AA 40, $0.15 / $0.60' y 'DeepSeek V4 Pro 0813 — Índice AA 36, $0.66 / $1.98', y un pie de página que dice 'Índice AA según Artificial Analysis; precios según DeepSeek, fuera de horas pico, por 1M de tokens.'
Guides & Insights

DeepSeek V4.1 Flash vs DeepSeek V4 Pro: La transferencia que DeepSeek programó y luego canceló

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

DeepSeek V4.1 Flash se lanzó el 10/09/2026, y se suponía que DeepSeek V4 Pro ya habría desaparecido a estas alturas. El plan, anunciado dos días antes del lanzamiento de Flash y confirmado el día del lanzamiento, era que el 14/09/2026 a las 12:00, hora de Pekín, toda solicitud a deepseek-v4-pro se redirigiera silenciosamente al más nuevo y más barato deepseek-flash y se facturara a las tarifas de Flash. DeepSeek lo canceló el 11/09/2026 después de que los desarrolladores se opusieran, y el 14/09/2026 la fecha límite pasó con V4 Pro aún activo y su facturación sin cambios. Así que esto no es una comparación de lanzamientos —el modelo de la izquierda tiene ocho días de antigüedad y el de la derecha es un buque insignia de un año en su cuarto mes de disponibilidad general. Es una comparación de dos modelos cuyo creador publicó benchmarks que decían que el barato ganaba, y luego descubrió que sus usuarios no estaban de acuerdo y dio marcha atrás. Esa secuencia es lo más útil que alguien ha publicado sobre cualquiera de los dos modelos este mes, porque es exactamente la decisión que estás a punto de tomar tú mismo.

Lo que realmente sucedió, en orden.

La cronología importa más que cualquier punto de referencia individual aquí, porque el revés es la historia y el anuncio fue deliberadamente discreto.

2026-09-09 — DeepSeek comunica a los usuarios que, antes de que llegue V4.1 Pro, las solicitudes de V4 Pro se redirigirán a V4.1 Flash y se facturarán a las tarifas de Flash. El mensaje es que Flash ha superado de forma integral a Pro en rendimiento, costo, velocidad y tiempo de finalización de tareas.

2026-09-10 — DeepSeek V4.1 Flash alcanza la disponibilidad general (GA) en la app, la web y la API. Los pesos se publican en Hugging Face bajo licencia MIT. El nombre del modelo de la API pasa a ser deepseek-flash. La generación anterior deepseek-v4-flash y deepseek-v4-flash-vision-exp se retiran por completo, y sus ID heredados se redirigen temporalmente a V4.1 Flash. El apagado de Pro se pospone al 2026-09-14, 12:00 hora de Pekín (04:00 UTC).

11 de septiembre de 2026 — DeepSeek da marcha atrás. En respuesta a la demanda de los usuarios, afirma que el servicio de API de V4 Pro continuará después del 14 de septiembre de 2026 con la facturación sin cambios, y se cancela el cambio automático a V4.1 Flash.

2026-09-14 — el plazo vence. V4 Pro sigue operando a $0.66 / $1.98 por millón de tokens fuera de horas punta.

La asimetría en esa secuencia es todo el artículo. Los usuarios de Flash fueron migrados, les gustara o no: el antiguo ID de V4 Flash ahora responde con un modelo diferente. Los usuarios de Pro recibieron una prórroga, y la razón no es que V4 Pro obtenga mejores resultados en los benchmarks. Es que los sistemas de producción se habían ajustado a él: prompts, andamiajes de agentes, arneses de evaluación y supuestos de reproducibilidad que un cambio de backend invalida sin ningún cambio de código por parte de quien llama. La página de comparación de DeepSeek sigue enumerando ambos modelos hoy, uno al lado del otro, lo que indica que la empresa tiene la intención de servir a ambos.

Lado a lado: los dos SKUs

Todo lo que aparece a continuación es la especificación publicada por el propio DeepSeek, a menos que se indique una fuente. Los precios son por millón de tokens, en horario valle, con la tarifa de hora punta entre paréntesis — DeepSeek tiene horas punta entre las 01:00 y las 04:00 y de nuevo entre las 06:00 y las 10:00 UTC, de lunes a viernes, y todas las demás horas son de horario valle a la mitad de la tarifa de hora punta.

Nombre del modelo de APIdeepseek-flash (DeepSeek-V4.1-Flash) vs deepseek-v4-pro (DeepSeek-V4-Pro-0813).

Entrada, fallo de caché — $0.15 ($0.30) frente a $0.66 ($1.32).

Entrada, acierto en caché — $0.003 ($0.006) vs $0.022 ($0.044).

Salida — $0.60 ($1.20) vs $1.98 ($3.96).

Contexto / salida máxima — 1M tokens / 384K en ambos. Idéntico.

Entrada de imagen — compatible de forma nativa en Flash; figura como no compatible en V4 Pro.

Límite de concurrencia — 2,500 en Flash frente a 500 en V4 Pro.

Parámetros reportados — Flash: 552B en total, cifra del proveedor, con una impugnación creíble por parte de la comunidad (más sobre esto abajo). V4 Pro: 1.6T en total, ~49B activos, que Artificial Analysis también incluye y la página de receta de vLLM confirma.

Presupuesto activo por token — Flash activa aproximadamente 8B en prefill y 16B en decode por diseño, que es precisamente el objetivo de su arquitectura; Pro activa ~49B por token.

Licencia — MIT, pesos abiertos en ambos.

Fecha de disponibilidad general — Flash 2026-09-10; V4 Pro 0813 2026-08-13, tras una vista previa de abril.

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

La diferencia de precio es todo el argumento

La entrada es 4,4× más cara en Pro. La salida es 3,3×. Los aciertos de caché —el nivel que domina una ejecución larga de agente con un prompt de sistema estable— son 7,3×. Como el pico se duplica en todos los niveles en ambos lados, la proporción es idéntica en el pico; la brecha no es un artefacto de descuento.

Ponle una carga de trabajo. Toma un agente de programación que consume 10 M de tokens de entrada al mes con una tasa de aciertos de caché del 70 % y 2 M de tokens de salida. Con V4.1 Flash en horario de menor demanda, eso supone $0.45 de entrada nueva, $0.021 de entrada en caché y $1.20 de salida: $1.67. Con V4 Pro en horario de menor demanda, son $1.98, $0.154 y $3.96: $6.09. Aproximadamente 3.6×, en una carga de trabajo deliberadamente poco llamativa.

Esa es la lista propia de DeepSeek, y es el precio que realmente pagas aquí: OrcaRouter transmite las tarifas de lista del proveedor con un 0 % de margen, así que un movimiento de precios de DeepSeek llega a nuestro lado el mismo día en lugar de ser reempaquetado. Ambos modelos están en la misma clave, lo que importa para la sección de más abajo — la que trata sobre probar una migración que ya no tienes que hacer.

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

Dónde gana de verdad DeepSeek V4.1 Flash

La evidencia más sólida a favor de Flash no es la tabla de benchmarks de DeepSeek. Es Artificial Analysis, que es independiente y se consulta directamente en sus páginas de modelos.

Intelligence Index — Flash (Razonamiento, Esfuerzo máximo) obtiene una puntuación de 40 y se clasifica en el puesto n.º 6 de 113 modelos. V4 Pro 0813 (Razonamiento, Esfuerzo máximo) obtiene una puntuación de 36 y se clasifica en el puesto n.º 7. Mismo índice, misma configuración de esfuerzo, cuatro puntos de diferencia, con el modelo más económico por delante.

Velocidad de salida — 214,4 tokens/s frente a 94,4 tokens/s. Eso es 2,3×, y está medido, no prometido.

Tiempo hasta el primer token — 1,21 s frente a 1,74 s.

DeepSWE v1.1 — 74,2 para Flash en la clasificación monitoreada, primer puesto, por delante de GPT-6 Astra con 74,10, Claude Opus 5 con 74,00 y Gemini 3.8 Flash con 73,70. El 62,7 de V4 Pro 0813 en el mismo benchmark es la propia cifra de DeepSeek. El margen en la cima es de 0,2 puntos, lo que es un empate, no una victoria, pero una diferencia de 11,5 puntos sobre Pro no es un empate.

Eficiencia de servicio — El decodificador de Flash deriva su KV global del estado oculto final del codificador en lugar de recalcularlo por capa, que es lo que produce la activación asimétrica de prefill de 8B / decode de 16B. El perfil InferenceX de SemiAnalysis sitúa la caché KV en aproximadamente 890 bytes por token — alrededor de un cuarto de la de V4 Flash — con almacenamiento KV persistente reducido a aproximadamente un octavo. Esa es la razón por la que el precio es el que es, y también por la que el modelo está disponible con 2.500 de concurrencia cuando Pro tiene un tope de 500.

Visión en la API servida — no solo en los pesos. La propia página de precios de DeepSeek indica que la entrada de imágenes es compatible con Flash y no es compatible con V4 Pro, y DeepSeek lo describe como su primer modelo insignia con comprensión multimodal nativa. Este es el primer modelo insignia de DeepSeek en el que leer una captura de pantalla no requiere un endpoint aparte.

Todas las demás cifras destacadas que verá citadas —Terminal-Bench 2.1 en 90,6, GPQA Diamond en 90,9, Codeforces 3471— son de DeepSeek, no reproducidas por nosotros, y deben leerse teniendo eso en cuenta.

Cuándo DeepSeek V4 Pro sigue siendo la opción correcta

Sería fácil descartar el V4 Pro después de una semana así. La deprecación revertida dice lo contrario, y la ficha técnica también dice lo contrario.

Pro tiene 1.6T de parámetros totales y activa ~49B por token, frente a los 16B de Flash en decodificación. Sin importar lo que diga el índice, la capacidad por token es un recurso real, y las cargas de trabajo donde se manifiesta son las de horizonte largo: ejecuciones de agentes de varias horas, refactorizaciones grandes, tareas donde un giro equivocado temprano cuesta toda la trayectoria. Una brecha de cuatro puntos en el índice mide el promedio de diez evaluaciones, no la cola de tu distribución.

Pro también es un valor conocido. Ha estado disponible de forma general desde 2026-08-13, tras una vista previa en abril, y la compilación 0813 obtuvo su rendimiento del postentrenamiento en lugar de la arquitectura: mismo número de parámetros, misma forma que la vista previa, comportamiento distinto. Eso representa cuatro meses de herramientas comunitarias, arneses de agentes publicados, patrones de prompt y modos de fallo. Flash lleva ocho días disponible de forma general, y el ecosistema a su alrededor es correspondientemente escaso. Si la fiabilidad de tu equipo proviene de saber exactamente cómo falla un modelo, Pro es donde vive ese conocimiento.

Y el servicio no se detuvo. El compromiso de DeepSeek es explícito y su facturación no ha cambiado, los pesos son MIT, y V4 Pro sigue en nuestro catálogo con la misma tarifa de lista. La deprecación cancelada no es una suspensión de la ejecución — es una declaración de que DeepSeek tiene la intención de seguir sirviendo al nivel.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

Tres cosas que reprochar a ambos modelos

Salvaguardas, porque equivocarse en esta decisión es costoso.

El número de parámetros está en disputa. 552B es la cifra de DeepSeek. Un análisis comunitario creíble sostiene que el checkpoint publicado es de 748B: la columna vertebral transformer de 552B más la tabla de memoria condicional Engram de ~196B, que es una estructura de búsqueda que se consulta en dos puntos de la red en lugar de una capa por la que fluye la señal. La descarga publicada es de 510,3 GB repartidos en 48 fragmentos de safetensors de pesos densos FP8 con expertos enrutados FP4. Ambos números pueden ser correctos a la vez, dependiendo de si se cuenta la recuperación por separado del cómputo. Considera 552B como reportado por el proveedor y comprueba la huella en disco antes de planificar un despliegue.

Una puntuación en la tabla de clasificación es una pantalla, no un contrato. El 74,2 de DeepSWE v1.1 es un benchmark del harness. Una auditoría autopublicada por EyesTech Systems Lab afirma que estas puntuaciones de la clase Flash se desploman cuando se trasladan a repositorios multifichero aislados del mundo real, lo que sitúa a DeepSeek V4.1 Flash en un 31,4 % en SWE-bench Pro frente al 74,2 % del titular, una caída mayor que la de los modelos de frontera en su propia comparación. Esa auditoría no es independiente —el autor vende una herramienta para detectar exactamente la explotación del harness que describe— y no hemos visto ninguna replicación de ella. Aun así, es la postura correcta: verifica en tus propios repositorios antes de migrar.

La verbosidad es una línea de costo.Artificial Analysis midió que V4.1 Flash genera 250M tokens de salida a lo largo de su ejecución del Intelligence Index, frente a una mediana de 140M para modelos comparables de pesos abiertos, y lo califica de muy verboso. La salida es la dirección costosa en esta tabla de precios, así que un modelo que piensa en voz alta se come sus propios ahorros. En una carga de trabajo con mucho razonamiento, presupuesta el recuento de tokens, no solo el precio por token.

Una cosa más, dicha sin rodeos para que nadie haga planes en torno a un rumor: DeepSeek V4.1 Pro no ha sido lanzado. La migración cancelada se planteó como una solución provisional «antes del lanzamiento de V4.1 Pro», y nada de eso ha cambiado.

Elige DeepSeek V4.1 Flash si

• Su carga de trabajo es de gran volumen, sensible a la latencia o con límites de coste — clasificación, extracción, enrutamiento, generación de resúmenes, chat, la mayoría de codegen.

• Necesitas entrada de imágenes en el mismo endpoint que el texto. Este es el primer modelo insignia de DeepSeek en el que eso es una única llamada en lugar de un segundo modelo.

• Tus prompts se pueden cachear. Con 7,3× en aciertos de caché, la brecha es más amplia justo donde vive el tráfico de agentes, y un prompt de sistema estable es la mayor parte de la entrada de una ejecución larga.

• Esta semana empiezas desde cero y no tienes ningún arnés ajustado a las peculiaridades de un modelo concreto. No hay nada que proteger.

• Quieres el techo de concurrencia más alto. 2.500 frente a 500 es una diferencia de cinco veces en la cantidad que puedes procesar antes de que empieces a hacer cola.

Elige DeepSeek V4 Pro si

• Ya tienes producción ajustada en su contra. La reversión significa que tienes tiempo: úsalo para probar en lugar de para evitar la pregunta.

• Tus tareas son de horizonte largo y costosas si fallan, y has medido que ~49B de parámetros activos por token te aportan algo que los 16B de Flash no, en tus datos en lugar de en una tabla de clasificación.

• Necesita un comportamiento predecible, solo de texto, sin ninguna ruta de visión que analizar, o tiene líneas base de evaluación que un cambio de modelo invalidaría a mitad del estudio.

• Tu patrón de acceso es de bajo volumen y alto riesgo, donde 3,6× en una factura pequeña no es el término decisivo.

Si ya construiste sobre DeepSeek V4 Pro

Lo útil que cambió el 11 de septiembre de 2026 es que tu migración dejó de ser una fecha límite y se convirtió en una decisión. Eso es estrictamente mejor para ti y estrictamente peor para tu bandeja de entrada, porque la decisión todavía tiene que tomarse y ahora nadie la está tomando por ti.

Empieza por calcular su precio. La diferencia de 3,3–4,4× es la cifra que estás dejando sobre la mesa, y el ejemplo desarrollado de arriba la convierte en una cifra mensual en aproximadamente un minuto. Luego pruébalo de la única forma que cuenta: replica una porción del tráfico de producción hacia Flash, mantén Pro en la ruta principal y compara las salidas en tus propias tareas. Como ambos modelos responden con la misma clave al precio de lista del proveedor con conmutación por error automática, esa ejecución en la sombra es un cambio de enrutamiento en lugar de una segunda integración, y el enrutador puede devolver una solicitud a Pro sin que tengas que escribir el fallback. Los equipos que queman tokens en una migración que no pidieron son la razón por la que existe la capa de enrutamiento en primer lugar.

No asumas que Flash es un reemplazo directo. Es una arquitectura diferente —un codificador–decodificador causal de 40 capas con activación asimétrica— y es más verboso al razonar. El comportamiento a nivel de prompt no se portará limpiamente en ninguna dirección, así que mide la migración por las salidas, no por el índice.

Qué ver

Tres cosas deciden cómo se verá este emparejamiento dentro de un mes. Primera, si V4.1 Pro llega al mercado y restaura un auténtico nivel Pro — toda la migración cancelada era explícitamente un paliativo para ello, así que la hoja de ruta de DeepSeek todavía tiene un hueco con forma de buque insignia. Segunda, si la prórroga sobrevive al próximo movimiento de precios de DeepSeek; una empresa dispuesta a programar una redirección silenciosa una vez ha aprendido que no puede, no que no debería. Tercera, si alguien fuera de DeepSeek reproduce las cifras del benchmark de Flash en repositorios sin modificar, que es el único resultado que zanjaría el debate entre eficiencia y capacidad del que depende toda esta comparación. Hasta entonces, la postura honesta es la que la propia reversión implica: Flash es el mejor valor por defecto para todo lo nuevo, Pro es la mejor apuesta para todo lo que ya está construido, y DeepSeek acaba de decirte que dará servicio a ambos mientras averiguas cuál de los dos eres.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario