
DeepSeek V4 Pro Benchmarks: La tabla de resultados completa de 0813, cada verificación independiente y lo que nadie ha verificado todavía
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 143 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La respuesta en una línea: DeepSeek V4 Pro presenta una ficha de resultados agénticos genuinamente sólida según los propios números de DeepSeek — Terminal-Bench 2.1 con 87.9, DeepSWE con 62.7, CyberGym con 83.3 —, pero casi todas las cifras principales las reporta el propio proveedor, y el panorama independiente es más frío. Artificial Analysis sitúa la compilación oficial 0813 en 53 en su Intelligence Index, a la par de GLM 5.2, cuatro puntos por detrás de GPT-5.6 Terra y siete por detrás de Kimi K3; Vals AI la clasifica en el puesto 12, por debajo del GPT-5.5 de la generación anterior. Este artículo es la agregación completa que nadie más ha escrito: la ficha completa de la 0813, el conjunto de codificación ampliado del informe técnico, todas las verificaciones independientes que existen y un balance honesto de qué cifras se han reproducido y cuáles siguen siendo solo la palabra de DeepSeek. Una semana después de la ficha, el panorama del despliegue también ha empezado a completarse: el 19 de agosto de 2026, LMSYS y Ant Group publicaron una pila de servicio H20 que alcanza 271 tokens/s de salida con tamaño de lote 1, tratada en su propia sección más abajo y consignada, como todo lo del lado del proveedor en esta página, como autodeclarada hasta que alguien la reproduzca.
La tarjeta de puntuación oficial 0813 — los propios números de DeepSeek, todos ellos.
El anuncio oficial de DeepSeek (documentación de API, news260813, 13 de agosto de 2026) informa sobre la compilación de producción frente a la vista previa de abril. Cada cifra en esta sección es reportada por el proveedor; ninguna ha sido reproducida de forma independiente al 16 de agosto de 2026:
• Terminal-Bench 2.1 — 87.9 (vista previa: 72.1).
• DeepSWE — 62.7 (vista previa: 12.8) — un salto de aproximadamente 5 veces que es la afirmación más llamativa de la tarjeta.
• CyberGym — 83.3 (vista previa: 52.7).
• Humanity's Last Exam — 42.7 sin herramientas, 60.0 con herramientas (vista previa: 37.7 / 48.2).
• Toolathlon-Verified — 74.1 (vista previa: 55.9).
• AutomationBench (público) — 31.8 (vista previa: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (preliminar: 41.8 / 31.1).
• NL2Repo — 61.5 (vista previa: 38.5).
• Agents' Last Exam — 25.7 (vista previa: 16.5).
El patrón que conviene notar es dónde se concentran las ganancias: en los benchmarks de agentes y de ciberseguridad. Ese es exactamente el tipo de tarjeta de resultados que produce un laboratorio cuando quiere publicitar un modelo de agente — y exactamente el tipo que necesita una repetición neutral antes de que gastes dinero de producción en él.

El conjunto de codificación extendido del informe técnico de DeepSeek
Además de la tarjeta agéntica, el informe técnico de DeepSeek (agregado por BenchLM el 16 de agosto de 2026) añade un conjunto más amplio de codificación y contexto largo. También reportado por el proveedor, y etiquetado como "Provider exact" por BenchLM — sin prueba independiente:
• SWE-bench Verified — 80,6%; SWE-bench Pro — 55,4%.
• LiveCodeBench Pass@1-CoT — 93.5% — lo mejor verificado en el catálogo de BenchLM.
• Rating de Codeforces — 3206 — también el mejor verificado en el catálogo.
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos son los mejores del catálogo en recuperación de 1M de tokens, lo que importa para un modelo que anuncia una ventana de contexto de 1M de tokens.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listado en la página del modelo de OrcaRouter).
Qué miden realmente los evaluadores independientes
Tres fuentes independientes han ejecutado DeepSeek V4 Pro, y sus veredictos se agrupan por debajo de la ficha del proveedor:
• Artificial Analysis Intelligence Index — 53 (Reportaje de SCMP, agosto de 2026; la página del modelo de OrcaRouter muestra 53.2, clasificado en el puesto 20 de 132). A la par con GLM 5.2, cuatro puntos por detrás de GPT-5.6 Terra, siete por detrás de Kimi K3.
• Artificial Analysis Coding — 68.8, clasificado en el puesto 24 de 130 (según la página del modelo de OrcaRouter).
• Vals AI Index — 12.º, por detrás del GPT-5.5 de generación anterior y muy por detrás de Kimi K3 y Claude Opus 5 (SCMP). Las propias pruebas de Vals AI señalaron dos puntos débiles concretos: completar tareas en un entorno de terminal aislado y crear modelos financieros complejos en hojas de cálculo de Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, la única ejecución independiente "Benchmark exact" del conjunto).
El registro honesto — lo que se ha reproducido vs lo que sigue siendo solo la palabra de DeepSeek.
Esta es la sección que un artículo de referencia existe para proporcionar, y la razón para marcar esta página como favorito en lugar de la cobertura del lanzamiento. Divide cada puntuación en uno de dos grupos:
• De fuente independiente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI puesto 12, Vibe Code Bench 49.93 — y una ejecución de Terminal-Bench 2.1 de fuente independiente de 78.7 que aparece junto al 87.9 de DeepSeek en la página del modelo de OrcaRouter. Esa brecha de nueve puntos entre el número del proveedor y una ejecución independiente es el dato más importante de esta página: es la brecha de reproducción, cuantificada.
• Reportado únicamente por el proveedor, no reproducido de forma independiente: todas las cifras en la tarjeta oficial 0813 de arriba (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) y todo el conjunto extendido de codificación (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). Los propios documentos de DeepSeek etiquetan la cifra de Terminal-Bench 2.1 como "provider run".
Leído así, la historia es coherente: DeepSeek V4 Pro es un modelo fronterizo real de nivel medio — AA 53, clasificado entre los puestos diez y veinte — con una tarjeta de resultados del proveedor que afirma un rendimiento casi superior en tareas agénticas y de codificación. Ambas afirmaciones son verdaderas y no están en conflicto; una se mide, la otra se afirma.

Lo que cuesta la tarjeta de puntuación
DeepSeek V4 Pro es el buque insignia MoE de 1.6T totales / 49B activos, con una ventana de contexto de 1M de tokens y una salida máxima de 384K. En OrcaRouter se ofrece al precio de lista de DeepSeek sin recargo alguno: $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida (lectura de caché $0.060 por millón), según el directorio consultado el 15 de agosto de 2026 y confirmado en la página del modelo en vivo. A ese precio, el cálculo de precio por punto es el argumento más sólido a favor del modelo: cuesta aproximadamente una décima parte del precio de salida de los modelos con puntuaciones cercanas en el índice independiente, por lo que estás pagando precios de gama media por una puntuación que, si las afirmaciones del proveedor se cumplen, está cerca de la cima. Una advertencia: DeepSeek ha anunciado un esquema de precios punta/valle (el valle al 50 % del punta) efectivo a partir del 17 de agosto, hora de Pekín, por lo que la tarifa puede variar — las cifras aquí son el precio de lista vigente a la fecha de este artículo.

Sirviendo DeepSeek V4 Pro: 271 tokens de salida/s en H20
Los benchmarks califican lo que sabe el modelo; los números de servicio califican cuán barato resulta hacerlo pensar. El 19 de agosto de 2026, LMSYS — la organización detrás de Chatbot Arena — y el equipo de código abierto de Ant Group publicaron el primer trabajo serio de servicio sobre la compilación 0813: un "stack de servicio específico para escenarios" construido sobre SGLang, el motor de código abierto que mantiene LMSYS. La cifra principal es 271 tokens de salida/s con tamaño de lote 1 en una NVIDIA H20, que el equipo sitúa en 1.42× respecto a una B300 — alcanzada en un chip con cero Tensor Cores FP4 nativos. Estas son mediciones propias de LMSYS y Ant Group, anunciadas en su blog y en X; ninguna ha sido reproducida de forma independiente.
El resto de los números del stack, todos autoinformados por LMSYS y Ant Group en su propio stack:
• Latencia de decodificación — un componente "DSpark optimizado" reduce el tiempo por token de salida (TPOT) entre un 74,8 % y un 78,0 % con un tamaño de lote de 1.
• Prefill — un prefill de 1 millón de tokens se completa en 43,7 segundos, una ganancia del 36,5 % en el rendimiento medio geométrico del prefill.
• KV cache — un esquema que el equipo denomina "Humming MXFP4AFP8 + Online C128" expande la capacidad de caché KV de tokens completos 10.14×, la palanca que hace prácticas las cargas de trabajo de agentes de 1M de tokens en esta clase de silicio.
• Decodificación por GPU — en un contexto de 4K, el rendimiento de decodificación por GPU aumenta de 319.9 a 703.2 tokens/s/GPU, una mejora de 2.20×.
Lee las advertencias antes de dimensionar una flota basándote en ello. El tamaño de lote 1 es el régimen de una sola secuencia — lo que encuentra un agente interactivo o un chat, no una API de alta concurrencia — y la comparación de 1,42× con B300 es una proporción que LMSYS indica sin publicar los tokens/s absolutos de B300, por lo que la diferencia se afirma, no se puede verificar. El resultado también mide la pila, no el chip: estas ganancias provienen de la optimización a nivel de SGLang en hardware que, de otro modo, parecería insuficiente para un MoE de 1,6T en total. Para contextualizar, la página de modelo en vivo de OrcaRouter mide DeepSeek V4 Pro en 80,8 tokens de salida por segundo a través de un endpoint de API compartido — la cifra del H20 es un benchmark de una sola secuencia en una pila dedicada, un número diferente con un significado diferente.
Si tu carga de trabajo se sirve a través de una API, nada de esto cambia la forma en que llamas al modelo: DeepSeek V4 Pro es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación por error automática si el proveedor se estanca. Los números de H20 importan más si eres el equipo que está sopesando una flota de H20 autoalojada frente a pagar por la API: la brecha que cierra el trabajo de LMSYS y Ant Group es una decisión de compra de hardware, no de selección de modelo.
Cuando esta recomendación es incorrecta
Los casos honestos en los que DeepSeek V4 Pro no debería ser tu elección:
• Necesitas razonamiento de frontera confirmado de forma independiente.AA Index 53 está en la mitad del grupo — Kimi K3 (60) y GPT-5.6 Terra (57) están por delante y verificados. Si tu decisión depende del techo medido, la ficha del proveedor no lo cambia.
• Estás apostando la producción a DeepSWE 62.7 antes de que alguien lo vuelva a ejecutar. Un salto de 12.8→62.7 en una sola versión es una afirmación, no un hecho. Espera a una reproducción neutral: la brecha de 87.9-vs-78.7 en Terminal-Bench muestra lo que uno podría encontrar.
• Tu carga de trabajo es automatización de terminales en sandbox o modelado financiero en Excel. Vals AI dice que estos son exactamente los puntos donde el modelo tiene dificultades, independientemente de la puntuación de cualquier proveedor.
• Estás tomando una decisión de ciberseguridad sobre CyberGym 83.3. Eso es DeepSeek probando su propio modelo en su propio benchmark: un proveedor de seguridad que compra basándose en esta cifra está comprando datos no auditados.
• Estás comprando H20s solo por la cifra de 271 tokens/s. Esa cifra es un benchmark autoreportado de un solo stack con tamaño de lote 1 — prometedor, no reproducido, y un punto en una curva de costos que también incluye utilización, consumo de energía y cualquier stack de inferencia que realmente ejecutarías.
En resumen
DeepSeek V4 Pro 0813 es un modelo de frontera genuino con una tarjeta de resultados del proveedor que supera su registro independiente. El lanzamiento 0813 convirtió una vista previa de texto en un serio contendiente agéntico — cubrimos el lanzamiento en sí por separado — y si quieres evaluarlo hoy, es una clave compatible con OpenAI en OrcaRouter al precio de lista de DeepSeek, con conmutación por error automática si el proveedor se detiene. Simplemente lee la tarjeta de resultados como este artículo la divide: las comprobaciones independientes (AA 53, Vals 12.º, la ejecución de 78.7 en Terminal-Bench) son en lo que puedes confiar hoy; los 87.9 y 62.7 son lo que debes verificar antes de construir sobre ellos. La misma disciplina ahora se extiende al servicio: los 271 tokens/s de salida en H20 de LMSYS y Ant Group son la mejor imagen de rendimiento que tenemos, y sigue siendo su palabra hasta que una ejecución neutral lo confirme. Cómpralo por su relación precio-rendimiento y contexto de 1M de tokens, no por los números destacados no reproducidos.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
