
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: Misma tarjeta de tarifas Flash, un modelo reentrenado
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencia49Código
La semana en que DeepSeek V4.1 Flash pasó de ser un sucesor rumoreado al modelo Flash que se distribuye ha sido corta y ruidosa. El 8 de septiembre, el modelo apareció como una prueba de API de dos días bajo el id de modelo deepseek-v4.1-flash-expires-on-0910, una versión que la propia DeepSeek calificó de «versión intermedia». El 9 de septiembre, su plataforma abierta indicó que el lanzamiento formal, DeepSeek V4.1 Flash, llegaría alrededor del 10 de septiembre y que «supera de forma integral» a DeepSeek V4 Pro en capacidad, costo, velocidad y tiempo de extremo a extremo. El 10 de septiembre, el aviso de lanzamiento llegó con una nueva tarjeta de tarifas de la serie Flash, efectiva a las 12:00 hora de Pekín, algo que DeepSeek V4 Flash no veía desde una subida de precios en agosto. Sea como fuere, DeepSeek V4 Flash, el caballo de batalla del texto, ya no es la forma más nueva de ejecutar una carga de trabajo Flash, y este artículo trata sobre qué cambia eso en realidad para la aplicación que ejecutas hoy.
Las comparaciones tan tempranas son desiguales, y vale la pena decirlo antes de que comiencen los números. DeepSeek V4 Flash tiene una tarjeta de especificaciones publicada, un mes de tráfico de producción respaldando la actualización DeepSeek-V4-Flash-0731, pesos abiertos y mediciones independientes de Artificial Analysis. DeepSeek V4.1 Flash tiene un anuncio oficial, dos días de pruebas de velocidad de la comunidad, y aún no tiene tarjeta publicada, ni informe técnico, ni puntuación de terceros. Las afirmaciones del proveedor están etiquetadas como afirmaciones del proveedor más abajo; las cifras de la comunidad están etiquetadas como medidas por la comunidad.
El nivel Flash acaba de restablecerse: tres cambios, una semana.
DeepSeek V4 Flash, el modelo de mezcla de expertos de 284B parámetros con 13B activos, ha sido la opción sensata de bajo costo y alto rendimiento para una gran parte del tráfico de texto en producción desde su actualización del 31 de julio. Tres anuncios en tres días movieron el terreno bajo sus pies:
• 8 de septiembre — DeepSeek abrió una versión beta limitada en el tiempo de V4.1 Flash para cualquier cuenta de API, con un máximo de 20 solicitudes concurrentes y programada para expirar el 10 de septiembre, bajo un nombre de modelo que llevaba su propia fecha de expiración.
• 9 de septiembre: la plataforma abierta anunció el lanzamiento oficial de DeepSeek V4.1 Flash para alrededor del 10 de septiembre, describiendo una nueva estructura de modelo con soporte multimodal nativo, y afirmando que supera a DeepSeek V4 Pro en rendimiento, costo, velocidad y tiempo total de finalización.
• 10 de septiembre — el lanzamiento oficial trae una nueva lista de precios de la serie Flash, vigente a las 12:00 hora de Pekín, recortando las tarifas que DeepSeek V4 Flash ha cobrado desde un aumento del 17 de agosto que provocó fuertes críticas de los desarrolladores.
El último de esos merece su propio apartado porque es la rara reducción de precio que en realidad es una reducción de precio. En la nueva lista, la entrada fuera de las horas punta con acierto de caché baja de ¥0,05 a ¥0,02 por millón de tokens — un recorte del 60% — mientras que la entrada con fallo de caché pasa de ¥1,5 a ¥1 y la salida de ¥4,5 a ¥4. Las tarifas en horas punta son el doble de las cifras fuera de las horas punta. En términos redondeados en dólares estadounidenses, eso es aproximadamente $0,003 por millón de entrada con acierto de caché, $0,14 de entrada con fallo de caché y $0,56 de salida fuera de las horas punta, el doble en horas punta. La brecha de 24 días entre el aumento de agosto y este recorte no fue un accidente de programación; el reajuste de precios forma parte del lanzamiento de V4.1 Flash.
Mismo nivel, diferente modelo
La lectura sencilla es que V4.1 Flash es V4 Flash con el dial de velocidad subido. No lo es. La actualización 0731 fue una actualización posterior al entrenamiento sobre la base existente de DeepSeek V4 Flash: misma arquitectura, misma configuración de mezcla de expertos de 284B en total / 13B activos. La descripción de DeepSeek de V4.1 Flash apunta a algo más grande: una nueva estructura de modelo, que varios medios interpretan como una nueva ejecución de preentrenamiento en lugar de un ajuste fino. La distinción importa porque un modelo reentrenado no hereda el comportamiento del modelo anterior de la misma manera que lo hace una actualización: el prompting, la llamada a herramientas y el estilo de salida pueden cambiar incluso cuando la capacidad no lo hace.
• Arquitectura — DeepSeek V4.1 Flash: nueva estructura de modelo, descrita por DeepSeek como una construcción nueva con entrada multimodal nativa. DeepSeek V4 Flash: la actualización post-entrenamiento V4-Flash-0731 de un MoE de 284B en total / 13B activos.
• Entrada — V4.1 Flash admite entrada de texto e imágenes de forma nativa en el modelo base; DeepSeek V4 Flash es solo texto, y las imágenes requieren la compilación complementaria separada DeepSeek-V4-Flash-Vision-Exp.
• Contexto y salida — DeepSeek V4 Flash publica 1M de contexto y 384K de salida máxima; los materiales de lanzamiento de DeepSeek dicen que V4.1 Flash mantiene la ventana de contexto a escala de millón de tokens, pero no se ha publicado ninguna ficha técnica formal.
• Concurrencia — DeepSeek V4 Flash indica un límite máximo de 2500 concurrentes; la versión beta de V4.1 Flash tenía un tope de 20, y la afirmación de DeepSeek de "alta concurrencia" para la versión definitiva aún no estaba respaldada por una cifra publicada al momento de escribir este texto.
• Pesos — DeepSeek V4 Flash es de pesos abiertos bajo licencia MIT; no se ha anunciado nada para V4.1 Flash.
• Posición independiente — DeepSeek V4 Flash ha sido medido por Artificial Analysis; DeepSeek V4.1 Flash aún no tiene puntuación de terceros.
El punto de texto versus multimodal merece una oración extra incluso en una comparación de texto, porque decide para quién es V4.1 Flash. Si tu pipeline estaba usando DeepSeek V4 Flash para texto y DeepSeek-V4-Flash-Vision-Exp para imágenes, V4.1 Flash es la primera versión de DeepSeek que cubre ambos caminos en un solo modelo: un único endpoint que mantener, sin encoder añadido al costado.

Donde realmente divergen: el rendimiento y lo que cuesta una tarea terminada
A precios equivalentes, los dos modelos se separan por velocidad, y la velocidad es donde las cifras alcanzan su punto más alto. Artificial Analysis mide DeepSeek V4 Flash 0731 en aproximadamente 120–140 tokens por segundo en la API propia de DeepSeek, según la configuración y la ventana de medición. Los probadores del primer día de V4.1 Flash informaron una generación sostenida de entre aproximadamente 280 y 500 tokens por segundo según la tarea, con picos superiores a 500 en ejecuciones de concurrencia ligera; las cifras más altas son medidas por la comunidad, no publicadas por el proveedor, y los tokens por segundo nunca son una propiedad intrínseca de un modelo. Aun así, la tendencia es coherente en todos los informes del primer día, y la propia afirmación de DeepSeek de una generación más rápida y un menor tiempo total de finalización apunta en la misma dirección.
Esa diferencia de velocidad cambia la economía incluso con ambos modelos en la misma tarifa, porque pagas por token y los tokens llegan más rápido. Una tarea de recuperación de contexto largo o generación de código que tardaba un minuto en V4 Flash puede terminar en una fracción del tiempo en V4.1 Flash al mismo precio por token — varios evaluadores del primer día reportaron que el proceso completo era de cinco a seis veces más rápido exactamente en ese tipo de tareas. Las quejas iniciales de la beta de que "gasta dinero más rápido" eran la otra cara de la misma moneda: con un precio por token sin cambios, un modelo que emite tokens dos o tres veces más rápido vacía un saldo más rápido por minuto. Si la factura por tarea realmente baja depende de si el nuevo modelo termina con menos tokens y menos reintentos, que es precisamente lo que nadie puede demostrar todavía.
En la propia tarjeta de precios, los dos modelos aparecen lado a lado. Por millón de tokens fuera de horas punta en la lista del 10 de septiembre: ¥0,02 de entrada con acierto de caché, ¥1 de entrada con fallo de caché y ¥4 de salida; en horas punta, el doble — la misma lista que se aplicaba al nivel Flash antes del recorte había sido ¥0,05, ¥1,5 y ¥4,5. Para una carga de trabajo con mucho uso de caché, el recorte es lo más destacado: ¥0,02 frente a ¥0,05 supone una reducción del 60% en los tokens que componen la mayor parte de un flujo de entrada de autocompletado o de bucle de agente. Para un trabajo de ingesta nueva que no acierta la caché, el ahorro se acerca a un tercio. Nada de eso hace que V4.1 Flash sea más barato por token que V4 Flash — comparten tarjeta — pero el mayor rendimiento de la arquitectura es el factor diferenciador, y no cuesta nada extra.

Los recibos son para V4 Flash; las reclamaciones son para V4.1 Flash.
El dato comparativo más importante sobre este enfrentamiento ahora mismo es que no hay ningún benchmark para el nuevo modelo. La afirmación principal de DeepSeek V4.1 Flash —de que supera ampliamente a DeepSeek V4 Pro en capacidad, coste y velocidad— proviene del fabricante y no ha sido reproducida. No se ha publicado ningún recuento de parámetros, ninguna tabla de evaluación ni ningún informe técnico, y Artificial Analysis no lo había medido al momento de redactar esto. Frente a una familia de modelos cuyo último lanzamiento insignia atrajo un escrutinio independiente, "confía en nosotros, supera al Pro" es una afirmación que el lector debería tomar con cautela hasta que un tercero la verifique.
DeepSeek V4 Flash, por el contrario, tiene un rastro documental real. Artificial Analysis sitúa la versión de razonamiento 0731 entre los modelos líderes de su clase, la puntúa muy por encima de la mediana en comparación con modelos de peso abierto equivalentes, y mide su rendimiento de salida en la propia API de DeepSeek en el rango de ~120–140 tokens por segundo citado anteriormente. Esos son los números con los que se medirá a V4.1 Flash cuando se publique su propia puntuación, y establecen un listón más alto de lo que implica la etiqueta de "Flash barato y rápido". El modelo al que sustituye la nueva versión no es débil; es un caballo de batalla de peso abierto genuinamente sólido. Eso es lo que hace que la decisión de actualizar sea real y no meramente ceremonial.
El enrutamiento está haciendo el trabajo pesado — dentro de DeepSeek, y para ti.
La parte menos reportada de este lanzamiento es que DeepSeek está enrutando tráfico entre sus propios modelos. Su anuncio es explícito: una vez que V4.1 Flash esté disponible y hasta que llegue V4.1 Pro, todas las solicitudes de API dirigidas a deepseek-v4-pro serán atendidas por DeepSeek V4.1 Flash y facturadas al precio del nivel Flash. Los usuarios de V4 Pro obtienen la nueva arquitectura y una fracción del costo por token sin cambiar una línea de código. Nota lo que no se enruta: las llamadas a deepseek-v4-flash. El antiguo modelo Flash sigue sirviendo a quien todavía lo apunte, que es exactamente la razón por la que existe esta comparación: si estás en V4 Pro, el cambio ocurre por ti, y si estás en V4 Flash, es una decisión que debes tomar tú mismo.
Que un proveedor decida en silencio que un modelo más barato atienda las llamadas dirigidas a su modelo premium es un respaldo contundente a V4.1 Flash — y también es la misma lógica que una capa de enrutamiento aplica entre proveedores. Ese es el vacío que llena una plataforma como OrcaRouter: una API para más de 200 modelos, con los precios de lista de los proveedores trasladados sin margen, de modo que el recorte de precios de Flash de DeepSeek del 10 de septiembre esté activo en nuestra plataforma el mismo día. DeepSeek V4 Flash en OrcaRouter sigue siendo invocable con la misma clave que cualquier otro modelo que ejecutes, lo que hace que la forma segura de adoptar un modelo recién lanzado sea realmente barata: apunta una porción del tráfico a DeepSeek V4.1 Flash en la propia API de DeepSeek, mantén DeepSeek V4 Flash como respaldo automático en la misma regla de enrutamiento y deja que la conmutación por error capture los casos límite mientras la nueva arquitectura demuestra su valía.
DeepSeek V4.1 Flash vs DeepSeek V4 Flash: ¿a cuál deberías llamar?
Si la respuesta honesta fuera cualquiera de los dos modelos para todos, no habría artículo. Los dos ahora se ajustan a diferentes perfiles de riesgo, y la división es inusualmente clara.

Pásate a DeepSeek V4.1 Flash si hoy empiezas una nueva carga de trabajo Flash, si la latencia y el rendimiento son la restricción vinculante, si quieres entrada de imágenes sin mantener un segundo modelo, o si te alegra dejar que el enrutamiento propio de DeepSeek reduzca el riesgo de la afirmación Pro. El modelo está en la API de primera parte de DeepSeek con el nombre deepseek-v4.1-flash, con el mismo precio de la tarjeta Flash que el modelo al que reemplaza, y cada señal desde el primer día indica que es sustancialmente más rápido.
Quédese con DeepSeek V4 Flash si está sirviendo tráfico de producción en el techo publicado de 2500 concurrencias, si depende de sus pesos abiertos para autoalojamiento o cumplimiento normativo, o si sus prompts, evaluaciones y lógica de llamada a herramientas se ajustaron al comportamiento de 0731 y no pueden absorber las peculiaridades de un modelo reentrenado desde el primer día. Una nueva ejecución de preentrenamiento es un cambio de comportamiento, no solo un cambio de velocidad, y la compilación 0731 es la versión con las pruebas del mes.
Para la mayoría de los equipos, el camino intermedio es la opción defendible por defecto: tratar DeepSeek V4.1 Flash como la opción predeterminada para cargas de trabajo nuevas, mantener DeepSeek V4 Flash como respaldo para la carga de trabajo que paga las facturas, y dejar que el primer cuadro de mando independiente — junto con una ficha de especificaciones publicada y un número de concurrencia — resuelva el debate que ninguna beta de dos días puede resolver. El nivel Flash acaba de recibir un nuevo motor; el antiguo no está obsoleto, es el punto de referencia.
¿Sientes curiosidad por saber cómo se ve el tráfico de clase Pro mientras DeepSeek lo enruta a V4.1 Flash a precios de Flash? DeepSeek V4 Pro en OrcaRouter — ambos con una sola clave, facturados al precio de lista de DeepSeek.
Comparados en este artículo4
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
