Tarjeta de título principal: DeepSeek V4.1 Flash Benchmarks — lo que 74.2 demuestra y lo que no, con fecha de publicación 2026-09-10 y una nota que dice: seis días de resultados independientes.
Guides & Insights

Benchmarks de DeepSeek V4.1 Flash: qué demuestra 74.2 y qué no

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

DeepSeek V4.1 Flash obtuvo 74,2 en DeepSWE v1.1, una décima de punto por encima de GPT-6 Astra, medio punto por encima de Gemini 3.8 Flash y Claude Opus 5, y durante toda la semana se ha citado esa cifra como un cambio de guardia. Vale la pena ser precisos sobre qué es en realidad. El modelo en sí no es nuevo —DeepSeek V4.1 Flash pasó a disponibilidad general el 2026-09-10, hace seis días—, así que nada de esto es un lanzamiento. Lo que llegó dentro de esa ventana es la capa de medición: las primeras entradas independientes en índices, el primer resultado independiente de arena, soporte de servicio desde el día 0 en tres stacks y la decisión de un proveedor de retirar su propio buque insignia en favor de este. Esta página es un resumen de lo que realmente se ha medido, con la fuente indicada para cada cifra, y una declaración clara de lo que nadie ha establecido todavía.

El número de DeepSWE, y los cuatro modelos a menos de medio punto de él

DeepSWE v1.1 es un benchmark de ingeniería de software de horizonte largo de Datacurve — 113 tareas originales en 91 repositorios de código abierto y cinco lenguajes de programación, construido en torno a cambios en múltiples archivos y la corrección del comportamiento. En la propia tarjeta del modelo de DeepSeek, la tabla reportada por el proveedor dice: DeepSeek V4.1 Flash 74.2, Claude Opus 5 74.0, GPT-5.6 Sol 73.0, Kimi K3 67.5, GLM-5.3 66.9, DeepSeek V4-Pro-0813 62.7, DeepSeek V4-Flash 54.4.

La tabla de clasificación independiente para el mismo benchmark no reproduce ese orden, y las diferencias importan más que el titular. La tabla de clasificación DeepSWE v1.1 Pass@1 de Datacurve coloca a Muse Spark 1.3 (FAIR) en primer lugar con 75.40, por delante de DeepSeek V4.1 Flash con 74.20. Detrás de ella: GPT-6 Astra con 74.12 (extra alto) y 74.10 (máx), Gemini 3.8 Flash con 73.83 (alto), Claude Opus 5 con 73.65 (máx).

Así que el 74.2 es una entrada real en una tabla de clasificación real de terceros, y está en segundo lugar, no en primero. La afirmación que circuló el día del lanzamiento — que esto es lo más avanzado en DeepSWE — no resiste el contacto con la tabla de clasificación que contiene la puntuación. Muse Spark 1.3 lleva 1,2 puntos de ventaja.

Ahora, la parte que se pasa por alto. Cuatro modelos de frontera se sitúan dentro de 0,55 puntos entre sí en este benchmark: 74,20, 74,12, 73,83, 73,65. Esa es una banda más estrecha que el ruido de medición. La variación publicada de una ejecución a otra en DeepSWE es del orden de 1,4 a 3,2 puntos —entre tres y seis veces el tamaño de toda la dispersión de los cuatro primeros—. Una ventaja de 0,2 puntos sobre GPT-6 Astra no es un hallazgo; es el aspecto que tiene un empate cuando se imprime con dos decimales.

La sensibilidad al andamiaje es la segunda razón para tomar el número con reservas, y aquí la propia documentación del proveedor aporta la evidencia. DeepSeek informa DeepSWE en ocho andamiajes en los mismos materiales de lanzamiento. El 74,2 se alcanzó en mini-SWE. El mismo modelo obtuvo 72,6 en DSH Minimal, 70,5 en DSH Standard, 69,8 en Claude Code, 67,6 en DSH PTC, 66,2 en Pi, 65,6 en Codex y 65,5 en OpenCode. Eso es una diferencia de 8,7 puntos en un solo modelo y un solo benchmark, impulsada puramente por el arnés que lo envuelve. Cualquiera que compare un número de DeepSeek producido en mini-SWE con el número de un rival producido en un bucle de agente diferente está comparando andamiajes, no modelos.

Donde realmente lo sitúa el índice independiente

Artificial Analysis ejecuta una suite fija con los ajustes de esfuerzo declarados, lo que convierte su Intelligence Index en la comprobación externa más limpia disponible. En la página del modelo DeepSeek V4.1 Flash, con el esfuerzo de razonamiento al máximo, el índice marca 40 — puesto #6 de 113 modelos de esa clase, frente a una mediana de clase de 18. Los rivales cerrados se sitúan por encima: Claude Opus 5 (max) 51, GPT-5.6 Sol (max) 47, GLM-5.3 (max) 45, Kimi K3 (max) 44, Gemini 3.8 Flash (high) 41. El anterior buque insignia de DeepSeek, V4-Pro-0813, se sitúa por debajo, con 36.

Lee los dos cuadros de puntuación lado a lado y el desacuerdo es estructural, no un error. En el benchmark elegido por DeepSeek, con el andamiaje adecuado, el modelo iguala a la frontera. En una suite externa fija promediada en razonamiento, programación, matemáticas y trabajo agéntico, está once puntos por detrás de Claude Opus 5 y un punto por detrás de Gemini 3.8 Flash. Ambas cosas pueden ser ciertas. Una tabla de proveedor es un argumento; un índice es un promedio.

La página del índice también incluye dos cifras que importan para una decisión de enrutamiento y rara vez aparecen en los titulares. DeepSeek V4.1 Flash funciona a 214,4 tokens de salida por segundo con el máximo esfuerzo —rápido. También generó 250 M de tokens de salida al completar el Intelligence Index, frente a una mediana de 140 M, lo que Artificial Analysis señala como marcadamente verboso. La verbosidad no es un problema de calidad; es una factura. Un modelo que piensa con un 79 % más de tokens que sus pares cede parte de su ventaja de precio en cada llamada larga de razonamiento.

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench: una puntuación de un solo modelo y una puntuación multiagente no son la misma medición

Este es el número con más probabilidades de leerse mal, así que conviene separarlo con cuidado.

• Modelo único, configuración estándar — DeepSeek V4.1 Flash obtiene 20,3 en ProgramBench (Almost@1), según la propia ficha del modelo de DeepSeek. Eso está por debajo de GPT-5.6 Sol con 23,0 y muy por debajo de Claude Opus 5 con 37,0, y solo ligeramente por encima de GLM-5.3 con 19,0 y Kimi K3 con 17,5. Reportado por el proveedor, y no favorece al modelo.

• Configuración de equipo multiagente — El informe técnico de DeepSeek, DeepSeek-V4.1-Flash: llevando al límite la compresión de la caché KV, describe una receta preliminar de RL de Agent Swarm en la que un agente líder coordina a los compañeros de equipo a través de un tablero de tareas compartido. En un subconjunto de ProgramBench de 172 tareas de alta confianza —tareas en las que la solución de referencia aprueba con un 95 % o más—, la configuración multiagente asciende del 13,59 % con un plazo de una hora a un máximo del 30,04 % a las ocho horas, mientras que la línea base de un solo agente pasa del 12,79 % al 20,39 %.

El 30,04 % es la fuente de la afirmación del «30 %», y no es una puntuación de un solo modelo. Es un equipo de agentes al que se le dieron ocho horas, medido en un subconjunto filtrado, en la propia evaluación preliminar del proveedor. La comparación que invita —«muy por encima de un solo Sol, casi 2x Kimi K3»— es aritméticamente justa frente al 23,0 de Sol y el 17,5 de K3, y también es una comparación entre una configuración multiagente y líneas base de un solo modelo en un conjunto de tareas diferente. El mismo informe muestra el efecto en FrontierSWE v2: el multiagente alcanza el 32,90 % a las veinte horas frente al 28,20 % del agente único. La brecha es real, se estrecha a medida que se amplía el plazo, y el coste en tokens de obtenerla no es pequeño: un informe práctico señala más de 10x los tokens y tiempos de ejecución que se acercan a las cuatro horas.

La cantidad de parámetros no está definida, así que trata toda comparación de tamaño como provisional

Las notas de la versión de DeepSeek describen un «MoE de 552B parámetros». Esa es la cifra del proveedor, y es lo que repite la mayoría de la cobertura. Tampoco es el artefacto completo.

La propia tarjeta del modelo de DeepSeek documenta un segundo componente junto a la columna vertebral del transformer: "memoria condicional Engram (196B parámetros, a la que se accede de forma dispersa mediante búsqueda basada en tokens)". Suma los dos y obtienes 748B. Esa es la aritmética detrás de la interpretación de la comunidad que circuló en r/LocalLLaMA a las pocas horas del lanzamiento, y el propio índice de safetensors de la tarjeta del modelo enumera 763B parámetros entre sus tipos de tensores. La cifra de aproximadamente 510 GB en FP8 proviene de la misma línea de análisis: lo que realmente descargas y mantienes en memoria.

La conciliación es que estos cuentan cosas diferentes. 552B es la columna vertebral computacional: los parámetros por los que fluye un token. 196B es una tabla de búsqueda que se consulta en capas específicas y que devuelve información almacenada en lugar de calcular sobre ella. 8B y 16B, las cifras de activación que cita DeepSeek, son las porciones por token activas durante prefill y decode, respectivamente. Los cuatro números describen el mismo modelo.

Nada de eso hace que la comparación sea segura. Toda afirmación de la forma «este modelo iguala a un modelo de frontera con una fracción del tamaño» se apoya en un titular de proveedor que excluye una quinta parte del artefacto. Hasta que alguien publique una contabilidad de parámetros reproducible, los argumentos basados en el tamaño deberían incluir la advertencia en el propio texto.

ARC-AGI: sin resultados para este modelo

No existe una puntuación de ARC-AGI-2 ni de ARC-AGI-1 para DeepSeek V4.1 Flash. La página de resultados verificados de ARC Prize no incluye ninguna entrada para este checkpoint, y la propia tabla de benchmarks de DeepSeek no tiene ninguna fila de ARC. El único resultado de DeepSeek verificado por ARC Prize corresponde al checkpoint más antiguo V4 Flash 0731: 61,4 % en ARC-AGI-2 semiprivado con el máximo esfuerzo de razonamiento y 89,0 % en ARC-AGI-1, a 0,04 $ y 0,02 $ por tarea, respectivamente. Esas son las cifras del predecesor en un modelo diferente, y citarlas como resultados de V4.1 Flash sería un error. Si ARC-AGI es relevante para tu evaluación, actualmente este modelo no tiene puntuación.

¿Qué más aterrizó dentro de la ventana?

Tres cosas cambiaron para un lector que decide si probar este modelo, y ninguna de ellas es el lanzamiento del propio modelo.

• Resultado independiente de la arena. OpenDesign Arena evaluó trece modelos con tareas de diseño idénticas: aplicaciones web, paneles, pantallas móviles y páginas de destino. DeepSeek V4.1 Flash obtuvo 81,2 sobre 100 frente a 82,7 de GPT-6 Astra, a $0,023 por diseño terminado frente a $1,61, y terminó en 5,3 minutos frente a 11,1. La tasa de entrega —resultados utilizables sin revisión— fue del 57,7 % frente al 60 % de Astra. Esta es una de las primeras mediciones genuinamente independientes del modelo, y mide específicamente los resultados de diseño, no el razonamiento general ni la programación.

• Soporte de serving Day-0 en tres stacks. vLLM publicó una imagen day-0 (2026-09-09) validada en hardware de NVIDIA y AMD. SGLang y Miles publicaron soporte de inferencia y RL day-0 el 2026-09-10, incluyendo una ruta de offload de host de Engram que elevó la capacidad de caché KV un 36% en 4x GB300 y una optimización de reproducción acotada que aumentó el rendimiento de prefill 1.56x en 8x H200. Cambricon anunció la adaptación Day-0 en el stack de vLLM el mismo día. Para un modelo cuyo argumento de venta es la compresión agresiva de caché KV — un cuarto de la huella de HBM de la generación anterior, un octavo de su SSD — ser ejecutable en stacks estándar desde el primer día es la diferencia entre un resultado de laboratorio y algo que puedes desplegar.

• El proveedor retiró su propio buque insignia. DeepSeek está eliminando gradualmente V4-Pro. A partir de las 04:00 UTC del 2026-09-14, cualquier solicitud que incluya “deepseek-v4-pro” se redirige a V4.1 Flash y se factura a las tarifas de Flash, y así continuará hasta que se lance un V4.1 Pro. DeepSeek V4.1 Pro no se ha lanzado — es un modelo futuro, y la redirección es una solución provisional que evita que las integraciones fijadas se rompan. También retirados: “deepseek-v4-flash” y “deepseek-v4-flash-vision-exp”, ambos redirigidos temporalmente a V4.1 Flash por compatibilidad. Si tiene un ID de modelo fijado en producción, esa redirección es el único hecho operativo de esta página que no puede ignorar.

Qué le hace el precio a la decisión

El precio es donde este modelo deja de ser una historia de benchmarks. Según las propias tarifas publicadas de DeepSeek, con efecto a partir de las 04:00 UTC del 2026-09-10, con las horas pico definidas como 01:00–04:00 y 06:00–10:00 UTC en días laborables y todo lo demás fuera de las horas pico.

• Fuera de horas punta, por millón de tokens — $0.003 acierto de caché, $0.15 fallo de caché, $0.60 de salida.

• Pico, por millón de tokens — $0.006 por acierto de caché, $0.30 por fallo de caché, $1,20 de salida.

• Entrada en caché, en comparación con un modelo cerrado de frontera — tres décimas de centavo por millón frente a unos cincuenta centavos. Para un agente que itera sobre el mismo repositorio, ese nivel concentra la mayor parte de los tokens.

• Medido en nuestro propio catálogo — $0.15 de entrada y $0.60 de salida por millón, 784 ms de tiempo medio hasta el primer token, 211 tokens por segundo durante los últimos siete días.

Artificial Analysis enumera el mismo modelo a $0.30 de entrada y $1.20 de salida, con un 98% de descuento de caché y un combinado de $0.18 por millón; ese es el nivel pico, y las dos cifras son el mismo precio en distintas horas del día. Vale la pena interiorizar esta distinción antes de comparar proveedores: un modelo con un reloj de dos niveles no se puede comparar con una única tarifa principal.

Por eso también aquí los precios de traspaso importan más de lo habitual. OrcaRouter enruta DeepSeek V4.1 Flash junto con el resto de su catálogo con 0% de margen — el precio de lista del proveedor, sin cambios, de modo que los tramos de tarifa pico y valle de DeepSeek llegan a nuestro lado exactamente como DeepSeek los publica, y un cambio de precio del proveedor se aplica el mismo día. En un modelo cuya tarifa se duplica durante cuatro horas cada mañana de día hábil, una plataforma que aplana los tramos te está ocultando el único número que necesitabas.

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

Lo que nadie ha establecido

La brecha en esta historia no es un benchmark faltante. Es que no existe una comparación directa creíble entre DeepSeek V4.1 Flash y sus rivales nombrados en un mismo entorno de pruebas, realizada por alguien sin interés en el resultado. Cada número de esta página es una de tres cosas: reportado por el proveedor, producido por un tercero con una configuración diferente, o un promedio sobre una suite fija que no fue diseñada para aislar este enfrentamiento. No hay ninguna ejecución en la que DeepSeek V4.1 Flash y GPT-6 Astra se evaluaran en las mismas tareas, el mismo andamiaje y la misma configuración de esfuerzo, y que se publicara con varianza.

Tres cosas concretas cambiarían el panorama, y ninguna de ellas existe hoy.

• Una comparación de DeepSWE controlada por el andamiaje. La diferencia de 8,7 puntos entre los propios andamiajes de DeepSeek es mayor que cualquier brecha entre los cuatro mejores modelos de la tabla de clasificación. Hasta que la frontera no se mida con un único arnés, el orden en la parte superior de esa tabla carece de significado.

• Una reproducción independiente del resultado del equipo de agentes de ProgramBench. El 30,04 % procede del informe técnico del proveedor sobre un subconjunto filtrado de 172 tareas, en una configuración preliminar, con un coste en tokens que no se ha caracterizado para presupuestos de producción.

• ARC-AGI. No existe ninguna puntuación para este punto de control.

La consecuencia práctica es una afirmación más limitada de lo que respaldan los titulares. DeepSeek V4.1 Flash está, de forma medible, dentro del ruido de la frontera en un benchmark de programación de horizonte largo, es verdaderamente competitivo en tareas de diseño independientes a aproximadamente el 1,4 % del coste, y está unos diez puntos por detrás en un índice agregado. Eso basta para justificar ejecutarlo con tu propia carga de trabajo y dejar que tu evaluación resuelva la cuestión. No basta para justificar reescribir una tabla de enrutamiento de producción con base en 0,2 puntos, y el hecho de que ambas afirmaciones sean ciertas es todo el hallazgo.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario