
DeepSeek V4.1 Flash vs. DeepSeek V4 Pro: mismo proveedor, diferentes generaciones
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Lo interesante de poner a DeepSeek V4.1 Flash contra DeepSeek V4 Pro es que el modelo más nuevo no es el más grande. DeepSeek V4 Pro es un modelo de mezcla de expertos de 1,6 billones de parámetros con 49 mil millones de parámetros activos, y sigue en servicio. DeepSeek V4.1 Flash es un MoE de 552 mil millones de parámetros con 8 mil millones activos en entrada y 16 mil millones activos en salida, y es el modelo que DeepSeek creó para reemplazarlo. Ambos están en la lista de precios del mismo proveedor, ambos admiten un millón de tokens de contexto y ambos se distribuyen bajo MIT. Elegir entre ellos no es una cuestión de tamaño. Es una cuestión de por qué arquitectura quieres pagar, y la respuesta cambió el 10 de septiembre de 2026.
Qué difiere realmente, en comparación directa
• Parámetros — V4.1 Flash: 552B en total / 8B activos en la entrada y 16B en la salida, frente a V4 Pro: 1.6T en total / 49B activos. V4 Pro tiene aproximadamente tres veces los parámetros totales y seis veces el número de activos en la entrada.
• Arquitectura: V4.1 Flash es un Codificador-Decodificador Causal, una nueva arquitectura base frente al diseño anterior de V4 Pro. Esta es la diferencia sustancial entre ambos y la razón por la que el ".1" no es una versión de mantenimiento.
• Precio por 1M de tokens — V4.1 Flash $0.15 entrada / $0.60 salida en horas valle frente a V4 Pro $0.66 entrada / $1.98 salida, según los listados de OrcaRouter.
• Entrada en caché — V4.1 Flash $0.003 por 1M vs V4 Pro $0.024 por 1M.
• Caché KV por token — V4.1 Flash: 890 bytes frente a la mayor huella de V4 Pro. Con un millón de tokens de contexto, esta es la partida que decide si un historial largo de agente permanece residente.
• Contexto y salida — 1M de contexto y 384K de salida máxima en ambos. Nivel.
• Latencia observada hasta el primer token — V4.1 Flash 2.63 s p50 frente a V4 Pro 3.58 s p50, según la telemetría de 7 días de OrcaRouter, con p95 en 10.00 s para V4 Pro.
• Modalidades de entrada — V4.1 Flash acepta texto e imágenes, mientras que V4 Pro solo admite entrada y salida de texto, en los mismos listados. El modelo más nuevo es el más amplio de los dos en cuanto a entrada, además de ser el más económico en costo.
Lee la lista sin el encuadre del proveedor y el patrón es inusual. El sucesor es más barato en cada línea, más rápido hasta el primer token, más amplio en la entrada y más pequeño en cada línea. Eso es lo que parece un cambio de arquitectura genuino cuando llega, y es la razón por la que "cuál es mejor" tiene aquí una respuesta corta y otra más larga por debajo.

La cronología del V4 Pro, porque es importante para cualquiera que todavía lo siga usando.
DeepSeek V4 Pro estaba programado para su retirada. La API debía desactivarse el 14 de septiembre de 2026 a las 12:00 hora de Pekín, con el tráfico redirigido a V4.1 Flash. Eso no sucedió. El 11 de septiembre, el proveedor revirtió la decisión, declarando que "En respuesta a la demanda de los usuarios, hemos decidido continuar proporcionando servicios de API para DeepSeek V4 Pro después del 14 de septiembre de 2026, con el método de facturación sin cambios".
De eso se desprenden dos cosas, y conviene ser preciso con ambas porque la situación invita a sobreinterpretar.
Lo primero es que V4 Pro no está obsoleto. Es un modelo con soporte y con un precio sin cambios, y es aquel al que el propio aviso de DeepSeek dirige el tráfico existente de V4 Pro. Si tienes una ruta de producción fijada a él, no se ha eliminado nada.
Lo segundo es que DeepSeek V4.1 Pro no existe. El aviso de retirada se refería a que el tráfico de V4 Pro sería atendido por V4.1 Flash "hasta que se lance V4.1-Pro", lo que ha dado lugar a cierta especulación sobre un hermano de mayor tamaño. A 22 de septiembre de 2026, no hay API de V4.1 Pro, ni ficha de modelo, ni pesos, ni anuncio. Un informe del 21 de septiembre de 2026 sugería un modelo de dos billones de parámetros previsto para mediados o finales de octubre, lo cual es una afirmación de una única fuente sobre un producto no anunciado y debe tratarse como tal. Cualquiera que planifique capacidad en torno al lanzamiento de V4.1 Pro está planificando en torno a un rumor.
¿A cuál llamar realmente?
El caso de migración es directo, y es el que la propia DeepSeek hizo al enrutar el tráfico de V4 Pro hacia el nuevo modelo. Según los números anteriores, V4.1 Flash es más económico, más rápido hasta el primer token y más rápido en estado estable, con una caché KV más pequeña por token. Si tu carga de trabajo es una carga de V4 Pro que no está haciendo algo que solo 49B parámetros activos pueden hacer, el modelo más nuevo es el mejor instrumento en coste y latencia, y no hay ninguna disyuntiva que sopesar.
El argumento a favor de permanecer en V4 Pro tiene que ver con lo que te aporta una cantidad mucho mayor de parámetros activos en el razonamiento difícil y en el trabajo agéntico de horizonte largo, y es un argumento que tienes que sostener con tus propias evaluaciones en lugar de con una ficha técnica. La razón es que los dos modelos no se comparan en un tablero público común de una manera que los aísle: DeepSeek V4.1 Flash aparece en el barrido de Agents on Rails del 21 de septiembre de 2026 con un 17 % en esfuerzo máximo, mientras que V4 Pro no está en ese tablero. No hay una cifra de enfrentamiento directo a la que señalar. Lo que existe es un argumento plausible desde la arquitectura —seis veces más parámetros activos es mucha capacidad a la que renunciar— y es un argumento, no una medición.
Dos notas prácticas para cualquiera que mueva tráfico entre ellos. Primero, el horario de horas pico se aplica a ambos modelos, así que una comparación de costos realizada a la hora equivocada del día será errónea por un factor de dos; las horas pico son de 01:00 a 04:00 y de 06:00 a 10:00 UTC entre semana, y los fines de semana están totalmente fuera de pico. Segundo, los dos modelos comparten una ventana de contexto y un límite de salida, por lo que una migración no cambia tu presupuesto de prompt, lo que hace que el cambio sea inusualmente poco riesgoso del lado de la aplicación.
Ejecutando ambos a través de un solo endpoint
La situación en la que de verdad quieres ambos es el periodo de transición, y es más común de lo que parece: un equipo que quiere pasar a V4.1 Flash pero tiene un pipeline cuyo comportamiento en la nueva arquitectura aún no está verificado. Ejecutar los dos en paralelo a través de proveedores distintos significa dos contratos y dos conjuntos de claves para lo que, a nivel de modelo, es un único proveedor.
Ambos están en OrcaRouter bajo una única clave, lo que reduce todo eso a una decisión de enrutamiento. OrcaRouter traslada el precio de lista del proveedor con un 0 % de recargo, así que las cifras anteriores son las tarifas propias de DeepSeek y no las nuestras, y el calendario de horas pico y horas valle de DeepSeek se aplica exactamente como DeepSeek lo define —incluido un cambio de precio a mitad de la transición, que está activo en nuestro lado el mismo día. Puedes enviar una fracción del tráfico al nuevo modelo y comparar los resultados, o enrutar por tipo de tarea, y colocar una conmutación por error automática detrás de la nueva ruta para que, si V4.1 Flash hace algo inesperado con tus datos, la solicitud llegue a V4 Pro en lugar de a una página de error.
Dado que el proveedor ya cambió de opinión una vez sobre cuál de estos modelos va a desaparecer, mantener ambos accesibles mediante una única integración es la opción que no requiere que predigas la próxima reversión.

Qué ver
• Si el precio o el estado de retirada de V4 Pro vuelven a cambiar. La reversión de septiembre fue explícita en que la facturación se mantendría sin cambios, y ese es el compromiso que hay que hacer valer ante el proveedor.
• Si V4.1 Pro se hace realidad. Hasta que exista una ficha del modelo o una publicación de pesos, la historia de los 2T de parámetros es un rumor con una sola fuente.
• Una evaluación independiente que ejecute ambos modelos en la misma placa. Hasta que exista una, la comparación honesta entre estos dos es coste, latencia y arquitectura, que son medibles, más una conjetura razonada sobre la capacidad, que no lo es.
Hasta que llegue el tercero de ellos, el resumen preciso es: DeepSeek V4.1 Flash es el sucesor más barato y más rápido de DeepSeek V4 Pro, V4 Pro sigue contando con soporte a un precio sin cambios, y la pregunta de si la arquitectura más reciente sacrifica capacidad es una que ningún benchmark público responde actualmente.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
