Tarjeta de título principal para el artículo 'DeepSeek V4 Pro Benchmarks': un marcador con un indicador grande, titular 'DeepSeek V4 Pro: la tabla de puntuaciones de referencia', subtítulo 'Puntuaciones oficiales 0813, verificaciones independientes y lo que aún no se ha reproducido', y chips que dicen 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

DeepSeek V4 Pro Benchmarks: La tabla de resultados completa de 0813, cada verificación independiente y lo que nadie ha verificado todavía

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La respuesta en una línea: DeepSeek V4 Pro presenta una ficha de resultados agénticos genuinamente sólida según los propios números de Deep​Seek — Terminal-Bench 2.1 con 87.9, DeepSWE con 62.7, CyberGym con 83.3 —, pero casi todas las cifras principales las reporta el propio proveedor, y el panorama independiente es más frío. Artificial Analysis sitúa la compilación oficial 0813 en 53 en su Intelligence Index, a la par de GLM 5.2, cuatro puntos por detrás de GPT-5.6 Terra y siete por detrás de Kimi K3; Vals AI la clasifica en el puesto 12, por debajo del GPT-5.5 de la generación anterior. Este artículo es la agregación completa que nadie más ha escrito: la ficha completa de la 0813, el conjunto de codificación ampliado del informe técnico, todas las verificaciones independientes que existen y un balance honesto de qué cifras se han reproducido y cuáles siguen siendo solo la palabra de Deep​Seek. Una semana después de la ficha, el panorama del despliegue también ha empezado a completarse: el 19 de agosto de 2026, LMSYS y Ant Group publicaron una pila de servicio H20 que alcanza 271 tokens/s de salida con tamaño de lote 1, tratada en su propia sección más abajo y consignada, como todo lo del lado del proveedor en esta página, como autodeclarada hasta que alguien la reproduzca.

La tarjeta de puntuación oficial 0813 — los propios números de Deep​Seek, todos ellos.

El anuncio oficial de Deep​Seek (documentación de API, news260813, 13 de agosto de 2026) informa sobre la compilación de producción frente a la vista previa de abril. Cada cifra en esta sección es reportada por el proveedor; ninguna ha sido reproducida de forma independiente al 16 de agosto de 2026:

• Terminal-Bench 2.1 — 87.9 (vista previa: 72.1).

• DeepSWE — 62.7 (vista previa: 12.8) — un salto de aproximadamente 5 veces que es la afirmación más llamativa de la tarjeta.

• CyberGym — 83.3 (vista previa: 52.7).

• Humanity's Last Exam — 42.7 sin herramientas, 60.0 con herramientas (vista previa: 37.7 / 48.2).

• Toolathlon-Verified — 74.1 (vista previa: 55.9).

• AutomationBench (público) — 31.8 (vista previa: 12.8).

• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (preliminar: 41.8 / 31.1).

• NL2Repo — 61.5 (vista previa: 38.5).

• Agents' Last Exam — 25.7 (vista previa: 16.5).

El patrón que conviene notar es dónde se concentran las ganancias: en los benchmarks de agentes y de ciberseguridad. Ese es exactamente el tipo de tarjeta de resultados que produce un laboratorio cuando quiere publicitar un modelo de agente — y exactamente el tipo que necesita una repetición neutral antes de que gastes dinero de producción en él.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

El conjunto de codificación extendido del informe técnico de DeepSeek

Además de la tarjeta agéntica, el informe técnico de Deep​Seek (agregado por BenchLM el 16 de agosto de 2026) añade un conjunto más amplio de codificación y contexto largo. También reportado por el proveedor, y etiquetado como "Provider exact" por BenchLM — sin prueba independiente:

• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.

• LiveCodeBench Pass@1-CoT — 93.5% — lo mejor verificado en el catálogo de BenchLM.

• Rating de Codeforces — 3206 — también el mejor verificado en el catálogo.

• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos son los mejores del catálogo en recuperación de 1M de tokens, lo que importa para un modelo que anuncia una ventana de contexto de 1M de tokens.

• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listado en la página del modelo de OrcaRouter).

Qué miden realmente los evaluadores independientes

Tres fuentes independientes han ejecutado DeepSeek V4 Pro, y sus veredictos se agrupan por debajo de la ficha del proveedor:

• Artificial Analysis Intelligence Index — 53 (Reportaje de SCMP, agosto de 2026; la página del modelo de OrcaRouter muestra 53.2, clasificado en el puesto 20 de 132). A la par con GLM 5.2, cuatro puntos por detrás de GPT-5.6 Terra, siete por detrás de Kimi K3.

• Artificial Analysis Coding — 68.8, clasificado en el puesto 24 de 130 (según la página del modelo de OrcaRouter).

• Vals AI Index — 12.º, por detrás del GPT-5.5 de generación anterior y muy por detrás de Kimi K3 y Claude Opus 5 (SCMP). Las propias pruebas de Vals AI señalaron dos puntos débiles concretos: completar tareas en un entorno de terminal aislado y crear modelos financieros complejos en hojas de cálculo de Excel.

• Vibe Code Bench v1.1 — 49.93 (Vals AI, la única ejecución independiente "Benchmark exact" del conjunto).

El registro honesto — lo que se ha reproducido vs lo que sigue siendo solo la palabra de Deep​Seek.

Esta es la sección que un artículo de referencia existe para proporcionar, y la razón para marcar esta página como favorito en lugar de la cobertura del lanzamiento. Divide cada puntuación en uno de dos grupos:

• De fuente independiente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI puesto 12, Vibe Code Bench 49.93 — y una ejecución de Terminal-Bench 2.1 de fuente independiente de 78.7 que aparece junto al 87.9 de Deep​Seek en la página del modelo de OrcaRouter. Esa brecha de nueve puntos entre el número del proveedor y una ejecución independiente es el dato más importante de esta página: es la brecha de reproducción, cuantificada.

• Reportado únicamente por el proveedor, no reproducido de forma independiente: todas las cifras en la tarjeta oficial 0813 de arriba (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) y todo el conjunto extendido de codificación (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Los propios documentos de Deep​Seek etiquetan la cifra de Terminal-Bench 2.1 como "provider run".

Leído así, la historia es coherente: DeepSeek V4 Pro es un modelo fronterizo real de nivel medio — AA 53, clasificado entre los puestos diez y veinte — con una tarjeta de resultados del proveedor que afirma un rendimiento casi superior en tareas agénticas y de codificación. Ambas afirmaciones son verdaderas y no están en conflicto; una se mide, la otra se afirma.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Lo que cuesta la tarjeta de puntuación

DeepSeek V4 Pro es el buque insignia MoE de 1.6T totales / 49B activos, con una ventana de contexto de 1M de tokens y una salida máxima de 384K. En OrcaRouter se ofrece al precio de lista de Deep​Seek sin recargo alguno: $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida (lectura de caché $0.060 por millón), según el directorio consultado el 15 de agosto de 2026 y confirmado en la página del modelo en vivo. A ese precio, el cálculo de precio por punto es el argumento más sólido a favor del modelo: cuesta aproximadamente una décima parte del precio de salida de los modelos con puntuaciones cercanas en el índice independiente, por lo que estás pagando precios de gama media por una puntuación que, si las afirmaciones del proveedor se cumplen, está cerca de la cima. Una advertencia: Deep​Seek ha anunciado un esquema de precios punta/valle (el valle al 50 % del punta) efectivo a partir del 17 de agosto, hora de Pekín, por lo que la tarifa puede variar — las cifras aquí son el precio de lista vigente a la fecha de este artículo.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Sirviendo DeepSeek V4 Pro: 271 tokens de salida/s en H20

Los benchmarks califican lo que sabe el modelo; los números de servicio califican cuán barato resulta hacerlo pensar. El 19 de agosto de 2026, LMSYS — la organización detrás de Chatbot Arena — y el equipo de código abierto de Ant Group publicaron el primer trabajo serio de servicio sobre la compilación 0813: un "stack de servicio específico para escenarios" construido sobre SGLang, el motor de código abierto que mantiene LMSYS. La cifra principal es 271 tokens de salida/s con tamaño de lote 1 en una NVIDIA H20, que el equipo sitúa en 1.42× respecto a una B300 — alcanzada en un chip con cero Tensor Cores FP4 nativos. Estas son mediciones propias de LMSYS y Ant Group, anunciadas en su blog y en X; ninguna ha sido reproducida de forma independiente.

El resto de los números del stack, todos autoinformados por LMSYS y Ant Group en su propio stack:

• Latencia de decodificación — un componente "DSpark optimizado" reduce el tiempo por token de salida (TPOT) entre un 74,8 % y un 78,0 % con un tamaño de lote de 1.

• Prefill — un prefill de 1 millón de tokens se completa en 43,7 segundos, una ganancia del 36,5 % en el rendimiento medio geométrico del prefill.

• KV cache — un esquema que el equipo denomina "Humming MXFP4AFP8 + Online C128" expande la capacidad de caché KV de tokens completos 10.14×, la palanca que hace prácticas las cargas de trabajo de agentes de 1M de tokens en esta clase de silicio.

• Decodificación por GPU — en un contexto de 4K, el rendimiento de decodificación por GPU aumenta de 319.9 a 703.2 tokens/s/GPU, una mejora de 2.20×.

Lee las advertencias antes de dimensionar una flota basándote en ello. El tamaño de lote 1 es el régimen de una sola secuencia — lo que encuentra un agente interactivo o un chat, no una API de alta concurrencia — y la comparación de 1,42× con B300 es una proporción que LMSYS indica sin publicar los tokens/s absolutos de B300, por lo que la diferencia se afirma, no se puede verificar. El resultado también mide la pila, no el chip: estas ganancias provienen de la optimización a nivel de SGLang en hardware que, de otro modo, parecería insuficiente para un MoE de 1,6T en total. Para contextualizar, la página de modelo en vivo de OrcaRouter mide DeepSeek V4 Pro en 80,8 tokens de salida por segundo a través de un endpoint de API compartido — la cifra del H20 es un benchmark de una sola secuencia en una pila dedicada, un número diferente con un significado diferente.

Si tu carga de trabajo se sirve a través de una API, nada de esto cambia la forma en que llamas al modelo: DeepSeek V4 Pro es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación por error automática si el proveedor se estanca. Los números de H20 importan más si eres el equipo que está sopesando una flota de H20 autoalojada frente a pagar por la API: la brecha que cierra el trabajo de LMSYS y Ant Group es una decisión de compra de hardware, no de selección de modelo.

Cuando esta recomendación es incorrecta

Los casos honestos en los que DeepSeek V4 Pro no debería ser tu elección:

• Necesitas razonamiento de frontera confirmado de forma independiente.AA Index 53 está en la mitad del grupo — Kimi K3 (60) y GPT-5.6 Terra (57) están por delante y verificados. Si tu decisión depende del techo medido, la ficha del proveedor no lo cambia.

• Estás apostando la producción a DeepSWE 62.7 antes de que alguien lo vuelva a ejecutar. Un salto de 12.8→62.7 en una sola versión es una afirmación, no un hecho. Espera a una reproducción neutral: la brecha de 87.9-vs-78.7 en Terminal-Bench muestra lo que uno podría encontrar.

• Tu carga de trabajo es automatización de terminales en sandbox o modelado financiero en Excel. Vals AI dice que estos son exactamente los puntos donde el modelo tiene dificultades, independientemente de la puntuación de cualquier proveedor.

• Estás tomando una decisión de ciberseguridad sobre CyberGym 83.3. Eso es Deep​Seek probando su propio modelo en su propio benchmark: un proveedor de seguridad que compra basándose en esta cifra está comprando datos no auditados.

• Estás comprando H20s solo por la cifra de 271 tokens/s. Esa cifra es un benchmark autoreportado de un solo stack con tamaño de lote 1 — prometedor, no reproducido, y un punto en una curva de costos que también incluye utilización, consumo de energía y cualquier stack de inferencia que realmente ejecutarías.

En resumen

DeepSeek V4 Pro 0813 es un modelo de frontera genuino con una tarjeta de resultados del proveedor que supera su registro independiente. El lanzamiento 0813 convirtió una vista previa de texto en un serio contendiente agéntico — cubrimos el lanzamiento en sí por separado — y si quieres evaluarlo hoy, es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación por error automática si el proveedor se detiene. Simplemente lee la tarjeta de resultados como este artículo la divide: las comprobaciones independientes (AA 53, Vals 12.º, la ejecución de 78.7 en Terminal-Bench) son en lo que puedes confiar hoy; los 87.9 y 62.7 son lo que debes verificar antes de construir sobre ellos. La misma disciplina ahora se extiende al servicio: los 271 tokens/s de salida en H20 de LMSYS y Ant Group son la mejor imagen de rendimiento que tenemos, y sigue siendo su palabra hasta que una ejecución neutral lo confirme. Cómpralo por su relación precio-rendimiento y contexto de 1M de tokens, no por los números destacados no reproducidos.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario