Tarjeta de título principal para el artículo 'DeepSeek V4 Pro Benchmarks': un marcador con un indicador grande, titular 'DeepSeek V4 Pro: la tabla de puntuaciones de referencia', subtítulo 'Puntuaciones oficiales 0813, verificaciones independientes y lo que aún no se ha reproducido', y chips que dicen 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

DeepSeek V4 Pro Benchmarks: La tabla de resultados completa de 0813, cada verificación independiente y lo que nadie ha verificado todavía

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La respuesta en una línea: DeepSeek V4 Pro presenta una tarjeta de resultados agéntica realmente sólida según los propios números de DeepSeek — Terminal-Bench 2.1 con 87,9, DeepSWE con 62,7, CyberGym con 83,3 — pero casi todas las cifras principales provienen del proveedor, y el panorama independiente es más frío.Artificial Analysis sitúa la versión oficial 0813 en 53 en su Intelligence Index, a la par con GLM-5.2, cuatro puntos por detrás de GPT-5.6 Terra y siete por detrás de Kimi K3; Vals AI la clasifica en el puesto 12, por debajo del GPT-5.5 de la generación anterior. Este artículo es la agregación completa que nadie más ha escrito: la tarjeta de resultados completa de la versión 0813, el conjunto ampliado de codificación del informe técnico, todas las verificaciones independientes que existen y un registro honesto de qué cifras se han reproducido y cuáles siguen siendo solo la palabra de DeepSeek.

La tarjeta de resultados oficial 0813: los propios números de DeepSeek, todos ellos.

El anuncio oficial de DeepSeek (documentación de API, news260813, 13 de agosto de 2026) informa de la compilación de producción frente a la vista previa de abril. Cada cifra de esta sección proviene del proveedor; ninguna ha sido reproducida de forma independiente al 16 de agosto de 2026:

Terminal-Bench 2.1 — 87.9 (vista previa: 72.1).

DeepSWE — 62.7 (vista previa: 12.8) — un salto de aproximadamente 5 veces que es la afirmación más llamativa de la tarjeta.

CyberGym — 83.3 (vista previa: 52.7).

Humanity's Last Exam — 42.7 sin herramientas, 60.0 con herramientas (vista previa: 37.7 / 48.2).

Toolathlon-Verified — 74.1 (vista previa: 55.9).

AutomationBench (público) — 31.8 (vista previa: 12.8).

DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (preliminar: 41.8 / 31.1).

NL2Repo — 61.5 (vista previa: 38.5).

Agents' Last Exam — 25.7 (vista previa: 16.5).

El patrón que conviene notar es dónde se concentran las ganancias: en los benchmarks de agentes y de ciberseguridad. Ese es exactamente el tipo de tarjeta de resultados que produce un laboratorio cuando quiere publicitar un modelo de agente — y exactamente el tipo que necesita una repetición neutral antes de que gastes dinero de producción en él.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

El conjunto de codificación extendido del informe técnico de DeepSeek.

Más allá de la tarjeta de agente, el informe técnico de DeepSeek (agregado por BenchLM el 16 de agosto de 2026) añade un conjunto más amplio de codificación y contexto largo. También reportado por el proveedor, y etiquetado como "Provider exact" por BenchLM — sin prueba independiente:

SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.

LiveCodeBench Pass@1-CoT — 93.5% — lo mejor verificado en el catálogo de BenchLM.

Rating de Codeforces — 3206 — también el mejor verificado en el catálogo.

BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos son los mejores del catálogo en recuperación de 1M de tokens, lo que importa para un modelo que anuncia una ventana de contexto de 1M de tokens.

GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listado en la página del modelo de OrcaRouter).

Qué miden realmente los evaluadores independientes

Tres fuentes independientes han ejecutado DeepSeek V4 Pro, y sus veredictos se agrupan por debajo de la ficha del proveedor:

Artificial Analysis Intelligence Index — 53 (Información de SCMP, agosto de 2026; la página del modelo de OrcaRouter muestra 53,2, clasificado en el puesto 20 de 132). A la par de GLM-5.2, cuatro puntos por detrás de GPT-5.6 Terra, siete por detrás de Kimi K3.

Artificial Analysis Coding — 68.8, clasificado en el puesto 24 de 130 (según la página del modelo de OrcaRouter).

Vals AI Index — 12.º, por detrás del GPT-5.5 de generación anterior y muy por detrás de Kimi K3 y Claude Opus 5 (SCMP). Las propias pruebas de Vals AI señalaron dos puntos débiles concretos: completar tareas en un entorno de terminal aislado y crear modelos financieros complejos en hojas de cálculo de Excel.

Vibe Code Bench v1.1 — 49.93 (Vals AI, la única ejecución independiente "Benchmark exact" del conjunto).

El registro honesto — lo que se ha reproducido frente a lo que sigue siendo solo la palabra de DeepSeek

Esta es la sección que un artículo de referencia existe para proporcionar, y la razón para marcar esta página como favorito en lugar de la cobertura del lanzamiento. Divide cada puntuación en uno de dos grupos:

Fuente independiente:AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI en el puesto 12, Vibe Code Bench 49.93 — y una ejecución independiente de Terminal-Bench 2.1 de 78.7 que se sitúa junto al 87.9 de DeepSeek en la página del modelo de OrcaRouter. Esa brecha de nueve puntos entre el número del proveedor y una ejecución independiente es el dato más importante de esta página: es el gap de reproducción, cuantificado.

Solo informado por el proveedor, no reproducido de forma independiente: cada cifra de la tarjeta oficial 0813 anterior (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) y todo el conjunto extendido de codificación (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). La propia documentación de DeepSeek etiqueta la cifra de Terminal-Bench 2.1 como "provider run".

Leído así, la historia es coherente: DeepSeek V4 Pro es un modelo fronterizo real de nivel medio — AA 53, clasificado entre los puestos diez y veinte — con una tarjeta de resultados del proveedor que afirma un rendimiento casi superior en tareas agénticas y de codificación. Ambas afirmaciones son verdaderas y no están en conflicto; una se mide, la otra se afirma.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Lo que cuesta la tarjeta de puntuación

DeepSeek V4 Pro es el buque insignia MoE de 1,6 T en total / 49 B activos, con una ventana de contexto de 1 M de tokens y un máximo de salida de 384 K. En OrcaRouter tiene el precio de lista de DeepSeek sin margen adicional: $0,435 por millón de tokens de entrada y $0,87 por millón de salida (lectura de caché: $0,060 por millón), según el directorio consultado el 15 de agosto de 2026 y confirmado en la página del modelo en vivo. Con esa tarifa, el cálculo de precio por punto es el argumento más fuerte a favor del modelo: cuesta aproximadamente una décima parte del precio de salida de los modelos que puntúan cerca de él en el índice independiente, así que pagas precios de gama media por una tarjeta de puntuación que, si las afirmaciones del proveedor se cumplen, está cerca de la cima. Una advertencia: DeepSeek ha anunciado un esquema de precios punta/valle (fuera de punta al 50 % de la punta) que entra en vigor el 17 de agosto, hora de Pekín, por lo que la tarifa puede variar; las cifras aquí son el precio de lista vigente a la fecha de este artículo.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Cuando esta recomendación es incorrecta

Los casos honestos en los que DeepSeek V4 Pro no debería ser tu elección:

Necesitas razonamiento de frontera confirmado de forma independiente.AA Index 53 está en la mitad del grupo — Kimi K3 (60) y GPT-5.6 Terra (57) están por delante y verificados. Si tu decisión depende del techo medido, la ficha del proveedor no lo cambia.

Estás apostando la producción a DeepSWE 62.7 antes de que alguien lo vuelva a ejecutar. Un salto de 12.8→62.7 en una sola versión es una afirmación, no un hecho. Espera a una reproducción neutral: la brecha de 87.9-vs-78.7 en Terminal-Bench muestra lo que uno podría encontrar.

Tu carga de trabajo es automatización de terminales en sandbox o modelado financiero en Excel. Vals AI dice que estos son exactamente los puntos donde el modelo tiene dificultades, independientemente de la puntuación de cualquier proveedor.

Estás tomando una decisión de ciberseguridad en CyberGym 83.3. Eso es DeepSeek probando su propio modelo en su propio benchmark — un proveedor de seguridad que compra basándose en este número está comprando datos no auditados.

En resumen

DeepSeek V4 Pro 0813 es un auténtico modelo de frontera con una tabla de puntuaciones del proveedor que supera su registro independiente. El lanzamiento 0813 convirtió una vista previa de texto en un serio contendiente agéntico — cubrimos el lanzamiento en sí por separado — y si quieres evaluarlo hoy, es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación automática por error si el proveedor se estanca. Solo lee la tabla de puntuaciones tal como la divide este artículo: las verificaciones independientes (AA 53, Vals 12.º, la ejecución de 78.7 en Terminal-Bench) son en lo que puedes confiar hoy; los 87.9 y 62.7 son lo que deberías verificar antes de construir sobre ellos. Cómpralo por su relación precio-rendimiento y su contexto de 1M de tokens, no por las cifras destacadas no reproducidas.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube