
DeepSeek V4.1 Flash: Un modelo base completamente nuevo que lleva un número de versión menor.
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligencia49Código
DeepSeek V4.1 Flash se lanzó el 10 de septiembre de 2026: pesos abiertos bajo licencia MIT, un contexto de un millón de tokens, una arquitectura Causal Encoder-Decoder completamente nueva y una base de mezcla de expertos de 552 mil millones de parámetros que la propia ficha técnica del modelo de DeepSeek clasifica dentro de lo que la empresa denomina su "nueva familia de arquitecturas". También es, si el rastreador que señaló la nomenclatura tiene razón, la primera vez que DeepSeek ha asignado un número de versión .1 a un modelo base completamente nuevo, una etiqueta que normalmente indica un ajuste, no una reconstrucción. DeepSeek V4.1 Pro, el buque insignia que ese número ahora implica, todavía no existe.
Esa discrepancia vale más que una cuestión de nomenclatura. Cualquiera que compare las generaciones de DeepSeek por número de versión leerá «V4 Flash a V4.1 Flash» como un paso de parche y ajustará su atención en consecuencia. La arquitectura subyacente dice lo contrario, y la propia decisión de la compañía de retirar un buque insignia de 1,6 billones de parámetros en favor de un modelo Flash lo dice aún más alto.

Lo que realmente se lanzó el 10 de septiembre
Esto no es una filtración ni una beta. La prueba de API de dos días que comenzó el 8 de septiembre bajo el ID de modelo deepseek-v4.1-flash-expires-on-0910 terminó como lo indicaba su sufijo, y el lanzamiento real llegó hoy a la aplicación web, la aplicación móvil y la API de primera parte de DeepSeek, con los pesos y un informe técnico publicados en Hugging Face bajo deepseek-ai/DeepSeek-V4.1-Flash.
Los detalles prácticos importan más que la ceremonia:
• Nombre del modelo: llámelo deepseek-flash. Los nombres heredados deepseek-v4-flash y deepseek-v4-flash-vision-exp todavía se aceptan, pero ya no se resuelven a los modelos que solían: ambos están retirados, y las solicitudes que los nombran son atendidas por DeepSeek V4.1 Flash y se facturan a la tarifa Flash.
Qué incluye: parámetros de backbone de 552B, una ventana de contexto de 1M de tokens, salida máxima de 384K, salida JSON, llamada de funciones y un modo de razonamiento activado por defecto con ajustes de esfuerzo bajo, alto y máximo.
• Licencia — MIT, pesos incluidos, con una carpeta de inferencia y un módulo de codificación separado en el repositorio. DeepSeek invita explícitamente a la comunidad de código abierto a crear soporte de inferencia, lo cual es la señal estándar de que la disponibilidad desde el día cero en los principales runtimes es cuestión de días, no de semanas.
El .1 que no es una versión de punto
La afirmación que dio inicio a este artículo provino de teortaxesTex, un observador de DeepSeek seudónimo pero muy seguido, en una publicación del 10 de septiembre: que esta es "la primera vez que DeepSeek etiqueta un modelo base completamente nuevo con una versión de lanzamiento .1", que V4.1 es "más diferente de V4 que, digamos, LLaMA 3 de LLaMA 1", y que DeepSeek "no siente que esto merezca aún V5" — sin que el autor pudiera explicar por qué no.
Trate la parte causal como inferencia y la parte estructural como comprobable. La inferencia — por qué DeepSeek eligió .1 en lugar de V5 — es la lectura de un observador y nada más; nadie fuera de la empresa ha explicado la decisión, y los propios materiales de DeepSeek nunca la abordan. La parte comprobable es la arquitectura, y no parece una versión menor. El registro de cambios de DeepSeek describe V4.1 Flash como "el modelo más pequeño de nuestra nueva familia de arquitecturas", lo cual es una frase extraña para escribir sobre un aumento de versión: un aumento de versión extiende una familia, no funda una.
Hay un costo real en la ambigüedad, y recae sobre los compradores, no sobre DeepSeek. Los números de versión son la señal más barata que tiene un desarrollador para saber "¿es esta una nueva generación o un reajuste, y cuánto de mi presupuesto de evaluación merece?" DeepSeek ha hecho que esa señal no sea confiable en una dirección: un modelo que funda una familia de arquitecturas está a un decimal de distancia de uno que cambió su receta de post-entrenamiento. La empresa puede mantener su marcador V5 en reserva. Todos los que hacen una evaluación de migración pagan por la confusión.
Qué significa "nueva arquitectura" en los pesos
La tarjeta del modelo es inusualmente específica, lo que hace que la afirmación generacional sea fácil de probar sin un solo benchmark. Cuatro cosas destacan.

• Activación asimétrica: la división Causal Encoder-Decoder es un transformador de 40 capas organizado como un codificador causal de 20 capas seguido de un decodificador de 20 capas, donde la caché KV global del decodificador se proyecta desde los estados ocultos finales del codificador, en lugar de derivarse de los propios de cada capa del decodificador. El objetivo de este diseño es que el modelo active solo 8 mil millones de parámetros por token durante el prefill y 16 mil millones durante la decodificación. Las cargas de trabajo de agente con mucha entrada (documentos largos, rastros de herramientas largos) obtienen la mitad económica del modelo; la generación obtiene la mitad costosa.
• Compresión de la caché KV, medida por token — DeepSeek-V4.1-Flash ejecuta el almacenamiento en caché KV principal FP4 a 890 bytes por token, lo que la tarjeta sitúa en aproximadamente una cuarta parte de DeepSeek V4 Flash. La cobertura china fue más allá y enmarcó la compresión frente al modelo V4 de primera generación como una reducción de 437×; esa cifra mayor es aritmética procedente del proveedor sobre una base diferente, así que trátala como una afirmación más que como una medición.
• SWA Bounded Replay — la atención de ventana deslizante normalmente te obliga a persistir el estado KV en SSD para reconstruir el contexto. Esto reconstruye los estados KV de SWA faltantes reproduciendo solo la ventana más reciente de tokens, reduciendo la huella de KV persistente a aproximadamente un octavo de la de DeepSeek V4 Flash.
• Compressed Sparse Attention 2 — cada capa de atención se ejecuta en uno de tres modos estáticos (Full, Reindex o Reuse), compartiendo el estado de KV y del indexador entre capas, con un indexador disperso jerárquico que acota el costo de las capas más profundas independientemente de la longitud del contexto.
Lee esos cuatro juntos y la imagen estratégica es legible: esta es una arquitectura de dispersión y eficiencia de caché primero, dimensionada para que la misma estructura pueda ampliarse más adelante. La mención de una "nueva familia de arquitecturas" está haciendo un trabajo real: es una declaración de que hay más por venir.
Los benchmarks: reportados por el proveedor, y aún no refutados.
DeepSeek publicó un conjunto de benchmarks con el lanzamiento. Según las propias cifras de la empresa, V4.1 Flash obtiene 90,9 en GPQA Diamond, un rating de Codeforces de 3471, 65,6 en MathArena Apex, 90,6 en Terminal-Bench 2.1, 74,2 en DeepSWE v1.1 y 63,9 en HLE con herramientas — el último con una nota al pie que restringe la cifra base de 36,8 al subconjunto de texto puro de ese benchmark.
Etiquétalos por lo que son. Son cifras reportadas por el proveedor, publicadas sin una evaluación independiente que las acompañe, y son los números que DeepSeek usó para justificar la retirada de su propio buque insignia, lo que los convierte en los números que más vale la pena verificar. A fecha del lanzamiento del 10 de septiembre, Artificial Analysis no había publicado una medición de DeepSeek V4.1 Flash, y la propia página del modelo en Hugging Face aún mantenía la nota de que el modelo «no está desplegado por ningún proveedor de inferencia». La afirmación central de este lanzamiento —que un modelo de nivel Flash supera de forma integral a un buque insignia de 1,6 billones de parámetros en rendimiento, coste, velocidad y tiempo total de procesamiento— es actualmente una afirmación del proveedor sin auditoría externa.
Hay una advertencia honesta también en el otro lado. El mismo informe del proveedor muestra que V4.1 Flash gana 13 de 16 comparaciones contra Kimi K3 y 11 de 13 contra GLM-5.3, aunque todavía va por detrás de GPT-5.6 Sol y Claude Opus 5 en las tareas más nuevas de Terminal-Bench 3.0 y 4.0 y en ProgramBench. Es una forma coherente: más fuerte en el trabajo de codificación, terminal y automatización de agentes para el que esta arquitectura está optimizada, más débil en tareas de razonamiento fronterizo, y es la forma que tendría un verdadero salto generacional.
El precio, y el conmutador de enrutamiento que vale la pena agendar.
Los nuevos precios entraron en vigor con el lanzamiento, y es la misma tarifa Flash de antes, no un recorte: en deepseek-flash, el input con acierto de caché cuesta $0.003 por millón de tokens fuera de horas punta y $0.006 en horas punta, el input con fallo de caché $0.15 y $0.30, y la salida $0.60 y $1.20. La tarifa punta es exactamente el doble que la tarifa valle y se aplica de 01:00 a 04:00 y de 06:00 a 10:00 UTC los días laborables.
El recorte recae en el tráfico Pro en su lugar. DeepSeek V4 Pro tiene un precio de $0.022 y $0.044 por entrada con acierto de caché, $0.66 y $1.32 por entrada con fallo de caché, y $1.98 y $3.96 por salida — por lo que enrutar las solicitudes con nombre Pro a V4.1 Flash reduce su costo de salida en aproximadamente un 70% mientras que, según DeepSeek, aumenta la capacidad que las responde.

Ese redireccionamiento está programado, no es hipotético. Después de las 12:00 hora de Pekín del 14 de septiembre de 2026, las solicitudes que mencionan deepseek-v4-proirán a V4.1 Flash y se facturarán al precio de Flash, y permanecerán allí hasta que DeepSeek V4.1 Pro esté disponible. Si su integración tiene codificado el nombre del modelo Pro, nada se rompe: obtiene un modelo diferente a aproximadamente un tercio del precio de salida, sin cambio de código y sin más aviso que una entrada en el registro de cambios. Si enruta por nivel de capacidad en lugar de por nombre de modelo, el 14 de septiembre es la fecha para volver a probar.
Qué significa esto si llamas a DeepSeek hoy
OrcaRouter aún no incorpora DeepSeek V4.1 Flash; a día de hoy, la página del modelo para deepseek-v4.1-flash devuelve "model not found", y preferimos decirlo claramente antes que dar a entender lo contrario. De ello se derivan dos cosas. Primero, el redireccionamiento que DeepSeek anunció es un comportamiento de la API de primera parte, por lo que el cambio del 14 de septiembre ocurre en el propio endpoint de DeepSeek, independientemente de cómo se acceda a él. Segundo, si quieres la nueva arquitectura hoy, estás llamando directamente al proveedor.
Lo que hacemos es enrutar el resto de la línea de DeepSeek con una sola clave: DeepSeek V4 Flash y DeepSeek V4 Pro, junto a otros 200+ modelos. Los precios allí son los precios de lista del proveedor de DeepSeek transmitidos con un margen del 0%, que es lo que importa para un lanzamiento como este — cuando un proveedor reduce una tarifa, la reducción se aplica en nuestro lado el mismo día, en lugar de después de un ciclo de reajuste de precios. Y cuando V4.1 Flash llegue al catálogo, la tarifa reducida a la mitad fuera de horas punta mencionada arriba es la tarifa, no un descuento que negociamos.
El argumento de enrutamiento para un modelo tan nuevo no trata realmente sobre el precio. Se trata de cuánto de tu ruta de producción apuestas a una arquitectura de primera semana sin punto de referencia independiente ni servicio de terceros. Mantener el nuevo modelo detrás de un nivel que puedas cambiar — o probarlo en una clave que no sea tu clave de producción — es la diferencia entre una evaluación y un incidente.
¿Qué zanjaría la cuestión del nombre?
Tres cosas, en orden ascendente de cuánto te dirían.
Una evaluación independiente de DeepSeek V4.1 Flash pondría a prueba la afirmación sobre la arquitectura en un banco de pruebas ajeno. Esa es la única medición que convierte una tabla del proveedor en un hecho, y es la siguiente noticia más probable.
DeepSeek V4.1 Pro pondría a prueba la afirmación de la familia. El aviso de enrutamiento lo nombró como el punto final de la ventana Pro-to-Flash, lo que lo convierte en el modelo en torno al cual se estructura todo este lanzamiento — y sigue siendo el que DeepSeek ha confirmado menos: sin tarjeta, sin recuento de parámetros, sin fecha, sin pesos, sin precio.
Y lo útil, aunque poco glamoroso: si DeepSeek vuelve a hacerlo. Una segunda etiqueta .1 en otro nuevo modelo base convertiría una anomalía en una convención, y una convención es algo en torno a lo cual un desarrollador puede planificar. Un modelo es una curiosidad. La nomenclatura solo se vuelve engañosa de manera útil una vez que hay un patrón.
Por ahora, la lectura práctica se separa claramente según quién seas. Si usas DeepSeek V4 Pro, anota el 14 de septiembre en el calendario y vuelve a ejecutar tus evaluaciones antes de esa fecha, porque el modelo detrás de ese nombre está cambiando lo pidas o no. Si estás en DeepSeek V4 Flash, ya te están migrando, al mismo precio, a una arquitectura que DeepSeek construyó para escalar. Y si esperabas la V5, la respuesta honesta es que DeepSeek parece haber lanzado la generación y haberse negado a nombrarla — algo que solo puedes hacer una vez antes de que la gente deje de confiar en el número.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
