
DeepSeek V4 Pro Benchmarks: La tabla de resultados completa de 0813, cada verificación independiente y lo que nadie ha verificado todavía
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaNUEVOMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
- grokxAI: Grok 4.52026-07-0856Inteligencia72Código
La respuesta en una línea: DeepSeek V4 Pro presenta una tarjeta de resultados agéntica realmente sólida según los propios números de DeepSeek — Terminal-Bench 2.1 con 87,9, DeepSWE con 62,7, CyberGym con 83,3 — pero casi todas las cifras principales provienen del proveedor, y el panorama independiente es más frío.Artificial Analysis sitúa la versión oficial 0813 en 53 en su Intelligence Index, a la par con GLM-5.2, cuatro puntos por detrás de GPT-5.6 Terra y siete por detrás de Kimi K3; Vals AI la clasifica en el puesto 12, por debajo del GPT-5.5 de la generación anterior. Este artículo es la agregación completa que nadie más ha escrito: la tarjeta de resultados completa de la versión 0813, el conjunto ampliado de codificación del informe técnico, todas las verificaciones independientes que existen y un registro honesto de qué cifras se han reproducido y cuáles siguen siendo solo la palabra de DeepSeek.
La tarjeta de resultados oficial 0813: los propios números de DeepSeek, todos ellos.
El anuncio oficial de DeepSeek (documentación de API, news260813, 13 de agosto de 2026) informa de la compilación de producción frente a la vista previa de abril. Cada cifra de esta sección proviene del proveedor; ninguna ha sido reproducida de forma independiente al 16 de agosto de 2026:
• Terminal-Bench 2.1 — 87.9 (vista previa: 72.1).
• DeepSWE — 62.7 (vista previa: 12.8) — un salto de aproximadamente 5 veces que es la afirmación más llamativa de la tarjeta.
• CyberGym — 83.3 (vista previa: 52.7).
• Humanity's Last Exam — 42.7 sin herramientas, 60.0 con herramientas (vista previa: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (vista previa: 55.9).
• AutomationBench (público) — 31.8 (vista previa: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (preliminar: 41.8 / 31.1).
• NL2Repo — 61.5 (vista previa: 38.5).
• Agents' Last Exam — 25.7 (vista previa: 16.5).
El patrón que conviene notar es dónde se concentran las ganancias: en los benchmarks de agentes y de ciberseguridad. Ese es exactamente el tipo de tarjeta de resultados que produce un laboratorio cuando quiere publicitar un modelo de agente — y exactamente el tipo que necesita una repetición neutral antes de que gastes dinero de producción en él.

El conjunto de codificación extendido del informe técnico de DeepSeek.
Más allá de la tarjeta de agente, el informe técnico de DeepSeek (agregado por BenchLM el 16 de agosto de 2026) añade un conjunto más amplio de codificación y contexto largo. También reportado por el proveedor, y etiquetado como "Provider exact" por BenchLM — sin prueba independiente:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — lo mejor verificado en el catálogo de BenchLM.
• Rating de Codeforces — 3206 — también el mejor verificado en el catálogo.
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos son los mejores del catálogo en recuperación de 1M de tokens, lo que importa para un modelo que anuncia una ventana de contexto de 1M de tokens.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listado en la página del modelo de OrcaRouter).
Qué miden realmente los evaluadores independientes
Tres fuentes independientes han ejecutado DeepSeek V4 Pro, y sus veredictos se agrupan por debajo de la ficha del proveedor:
• Artificial Analysis Intelligence Index — 53 (Información de SCMP, agosto de 2026; la página del modelo de OrcaRouter muestra 53,2, clasificado en el puesto 20 de 132). A la par de GLM-5.2, cuatro puntos por detrás de GPT-5.6 Terra, siete por detrás de Kimi K3.
• Artificial Analysis Coding — 68.8, clasificado en el puesto 24 de 130 (según la página del modelo de OrcaRouter).
• Vals AI Index — 12.º, por detrás del GPT-5.5 de generación anterior y muy por detrás de Kimi K3 y Claude Opus 5 (SCMP). Las propias pruebas de Vals AI señalaron dos puntos débiles concretos: completar tareas en un entorno de terminal aislado y crear modelos financieros complejos en hojas de cálculo de Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, la única ejecución independiente "Benchmark exact" del conjunto).
El registro honesto — lo que se ha reproducido frente a lo que sigue siendo solo la palabra de DeepSeek
Esta es la sección que un artículo de referencia existe para proporcionar, y la razón para marcar esta página como favorito en lugar de la cobertura del lanzamiento. Divide cada puntuación en uno de dos grupos:
• Fuente independiente:AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI en el puesto 12, Vibe Code Bench 49.93 — y una ejecución independiente de Terminal-Bench 2.1 de 78.7 que se sitúa junto al 87.9 de DeepSeek en la página del modelo de OrcaRouter. Esa brecha de nueve puntos entre el número del proveedor y una ejecución independiente es el dato más importante de esta página: es el gap de reproducción, cuantificado.
• Solo informado por el proveedor, no reproducido de forma independiente: cada cifra de la tarjeta oficial 0813 anterior (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) y todo el conjunto extendido de codificación (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). La propia documentación de DeepSeek etiqueta la cifra de Terminal-Bench 2.1 como "provider run".
Leído así, la historia es coherente: DeepSeek V4 Pro es un modelo fronterizo real de nivel medio — AA 53, clasificado entre los puestos diez y veinte — con una tarjeta de resultados del proveedor que afirma un rendimiento casi superior en tareas agénticas y de codificación. Ambas afirmaciones son verdaderas y no están en conflicto; una se mide, la otra se afirma.

Lo que cuesta la tarjeta de puntuación
DeepSeek V4 Pro es el buque insignia MoE de 1,6 T en total / 49 B activos, con una ventana de contexto de 1 M de tokens y un máximo de salida de 384 K. En OrcaRouter tiene el precio de lista de DeepSeek sin margen adicional: $0,435 por millón de tokens de entrada y $0,87 por millón de salida (lectura de caché: $0,060 por millón), según el directorio consultado el 15 de agosto de 2026 y confirmado en la página del modelo en vivo. Con esa tarifa, el cálculo de precio por punto es el argumento más fuerte a favor del modelo: cuesta aproximadamente una décima parte del precio de salida de los modelos que puntúan cerca de él en el índice independiente, así que pagas precios de gama media por una tarjeta de puntuación que, si las afirmaciones del proveedor se cumplen, está cerca de la cima. Una advertencia: DeepSeek ha anunciado un esquema de precios punta/valle (fuera de punta al 50 % de la punta) que entra en vigor el 17 de agosto, hora de Pekín, por lo que la tarifa puede variar; las cifras aquí son el precio de lista vigente a la fecha de este artículo.

Cuando esta recomendación es incorrecta
Los casos honestos en los que DeepSeek V4 Pro no debería ser tu elección:
• Necesitas razonamiento de frontera confirmado de forma independiente.AA Index 53 está en la mitad del grupo — Kimi K3 (60) y GPT-5.6 Terra (57) están por delante y verificados. Si tu decisión depende del techo medido, la ficha del proveedor no lo cambia.
• Estás apostando la producción a DeepSWE 62.7 antes de que alguien lo vuelva a ejecutar. Un salto de 12.8→62.7 en una sola versión es una afirmación, no un hecho. Espera a una reproducción neutral: la brecha de 87.9-vs-78.7 en Terminal-Bench muestra lo que uno podría encontrar.
• Tu carga de trabajo es automatización de terminales en sandbox o modelado financiero en Excel. Vals AI dice que estos son exactamente los puntos donde el modelo tiene dificultades, independientemente de la puntuación de cualquier proveedor.
• Estás tomando una decisión de ciberseguridad en CyberGym 83.3. Eso es DeepSeek probando su propio modelo en su propio benchmark — un proveedor de seguridad que compra basándose en este número está comprando datos no auditados.
En resumen
DeepSeek V4 Pro 0813 es un auténtico modelo de frontera con una tabla de puntuaciones del proveedor que supera su registro independiente. El lanzamiento 0813 convirtió una vista previa de texto en un serio contendiente agéntico — cubrimos el lanzamiento en sí por separado — y si quieres evaluarlo hoy, es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación automática por error si el proveedor se estanca. Solo lee la tabla de puntuaciones tal como la divide este artículo: las verificaciones independientes (AA 53, Vals 12.º, la ejecución de 78.7 en Terminal-Bench) son en lo que puedes confiar hoy; los 87.9 y 62.7 son lo que deberías verificar antes de construir sobre ellos. Cómpralo por su relación precio-rendimiento y su contexto de 1M de tokens, no por las cifras destacadas no reproducidas.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
