Cartão de título hero para o artigo 'DeepSeek V4 Pro Benchmarks': um placar com um medidor grande, título 'DeepSeek V4 Pro — o placar de benchmarks', subtítulo 'Pontuações oficiais de 0813, verificações independentes e o que ainda não foi reproduzido', e chips mostrando 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'. Logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

Benchmarks do DeepSeek V4 Pro: O Placar Completo 0813, Cada Verificação Independente e o que Ninguém Verificou Ainda

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A resposta em uma linha: o DeepSeek V4 Pro apresenta um scorecard agêntico genuinamente forte nos números da própria DeepSeek — Terminal-Bench 2.1 com 87,9, DeepSWE com 62,7, CyberGym com 83,3 — mas quase todos os números de destaque são relatados pelo fornecedor, e o quadro independente é mais frio. A Artificial Analysis coloca a build oficial 0813 em 53 no seu Intelligence Index, no mesmo nível do GLM-5.2, quatro pontos atrás do GPT-5.6 Terra e sete atrás do Kimi K3; a Vals AI a classifica em 12º, abaixo do GPT-5.5 da geração anterior. Este artigo é a agregação completa que ninguém mais escreveu: o scorecard completo do 0813, o conjunto estendido de codificação do relatório técnico, todas as verificações independentes que existem e um registro honesto de quais números foram reproduzidos e quais ainda são apenas a palavra da DeepSeek.

O scorecard oficial 0813 — os números da própria DeepSeek, todos eles.

O anúncio oficial da DeepSeek (documentação da API, news260813, 13 de agosto de 2026) relata a build de produção em relação à prévia de abril. Todos os números nesta seção são reportados pelo fornecedor — nenhum foi reproduzido de forma independente até 16 de agosto de 2026:

Terminal-Bench 2.1 — 87.9 (prévia: 72.1).

DeepSWE — 62.7 (prévia: 12.8) — um salto de aproximadamente 5x que é de longe a afirmação mais impressionante do cartão.

CyberGym — 83.3 (prévia: 52.7).

Humanity's Last Exam — 42.7 sem ferramentas, 60.0 com ferramentas (prévia: 37.7 / 48.2).

Toolathlon-Verificado — 74,1 (prévia: 55,9).

AutomationBench (público) — 31.8 (prévia: 12.8).

DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (prévia: 41,8 / 31,1).

NL2Repo — 61.5 (prévia: 38.5).

Agents' Last Exam — 25.7 (prévia: 16.5).

O padrão a observar é onde os ganhos se concentram: benchmarks de agentes e de cibersegurança. Esse é exatamente o tipo de placar que um laboratório produz quando quer anunciar um modelo de agente — e exatamente o tipo que precisa de uma reexecução neutra antes de você gastar dinheiro de produção com ele.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

O conjunto de codificação estendido do relatório técnico da DeepSeek.

Além do cartão de agente, o relatório técnico do DeepSeek (conforme agregado pela BenchLM em 16 de agosto de 2026) adiciona um conjunto mais amplo de codificação e contexto longo. Também relatado pelo fornecedor, e rotulado como "Provider exact" pela BenchLM — sem teste independente:

SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

LiveCodeBench Pass@1-CoT — 93,5% — o melhor verificado no catálogo do BenchLM.

Rating no Codeforces — 3206 — também o melhor verificado no catálogo.

BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos os melhores do catálogo em recuperação de 1M de tokens, o que é importante para um modelo que anuncia uma janela de contexto de 1M de tokens.

GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listados na página do modelo OrcaRouter).

O que os avaliadores independentes realmente medem

Três fontes independentes executaram o DeepSeek V4 Pro, e seus vereditos se agrupam abaixo do cartão do fornecedor:

Artificial Analysis Intelligence Index — 53 (Reportagem da SCMP, agosto de 2026; a página do modelo OrcaRouter mostra 53.2, classificado em 20º entre 132). No mesmo nível do GLM-5.2, quatro pontos atrás do GPT-5.6 Terra, sete pontos atrás do Kimi K3.

Artificial Analysis Coding — 68.8, classificada em 24º lugar entre 130 (conforme a página do modelo OrcaRouter).

Vals AI Index — 12º, ficando atrás do GPT-5.5, da geração anterior, e bem atrás do Kimi K3 e do Claude Opus 5 (SCMP). Os testes da própria Vals AI apontaram dois pontos fracos concretos: concluir tarefas dentro de um ambiente de terminal em sandbox e criar modelos financeiros complexos em planilhas do Excel.

Vibe Code Bench v1.1 — 49.93 (Vals AI, a única execução independente "Benchmark exact" no conjunto).

O balanço honesto — o que foi reproduzido vs o que ainda é apenas a palavra da DeepSeek

Esta é a seção que um artigo de benchmark existe para fornecer, e o motivo para salvar esta página nos favoritos em vez da cobertura do lançamento. Divida cada pontuação em um de dois grupos:

De fonte independente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI em 12º lugar, Vibe Code Bench 49.93 — e uma execução de fonte separada do Terminal-Bench 2.1 de 78.7 que está ao lado do 87.9 da DeepSeek na página do modelo do OrcaRouter. Essa diferença de nove pontos entre o número do fornecedor e uma execução independente é o dado mais importante desta página: é a lacuna de reprodução, quantificada.

Apenas relatado pelo fornecedor, não reproduzido de forma independente: todos os números no cartão oficial 0813 acima (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) e todo o conjunto estendido de codificação (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). A própria documentação da DeepSeek rotula o número do Terminal-Bench 2.1 como "execução do provedor".

Lida dessa forma, a história é coerente: o DeepSeek V4 Pro é um modelo de fronteira de meio de tabela — AA 53, classificado entre as posições 10 e 29 — com uma ficha de avaliação do fornecedor que afirma desempenho quase no topo em tarefas de agente e codificação. Ambas as afirmações são verdadeiras e não estão em conflito; uma é medida, a outra é afirmada.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

Quanto custa o scorecard

O DeepSeek V4 Pro é o principal modelo MoE de 1,6T totais / 49B ativos, com janela de contexto de 1M de tokens e saída máxima de 384K. No OrcaRouter, ele é precificado pelo preço de tabela da DeepSeek, sem nenhum acréscimo: US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída(leitura de cache a US$ 0,060 por milhão), de acordo com o diretório consultado em 15 de agosto de 2026 e confirmado na página ao vivo do modelo. Nessa taxa, o cálculo de preço por ponto é o argumento mais forte a favor do modelo: é cerca de um décimo do preço de saída dos modelos com pontuação próxima no índice independente, então você paga preços de nível médio por um placar que, se as afirmações do fornecedor se confirmarem, está perto do topo. Um aviso: a DeepSeek anunciou um cronograma de preços de pico/fora de pico (fora de pico a 50% do pico) com vigência em 17 de agosto, horário de Pequim, então a tarifa pode mudar — os números aqui são o preço de tabela vigente na data deste artigo.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

Quando esta recomendação está errada

Os casos honestos em que o DeepSeek V4 Pro não deveria ser a sua escolha:

Você precisa de raciocínio de fronteira confirmado de forma independente. O AA Index 53 está no meio do grupo — Kimi K3 (60) e GPT-5.6 Terra (57) estão à frente e verificados. Se a sua decisão depender do teto medido, o cartão do fornecedor não muda isso.

Você está apostando a produção no DeepSWE 62.7 antes que alguém o rode novamente. Um salto de 12.8→62.7 em um único lançamento é uma afirmação, não um fato. Espere por uma reprodução neutra — a diferença de 87.9-vs-78.7 no Terminal-Bench mostra o que se pode encontrar.

Sua carga de trabalho é automação de terminal em sandbox ou modelagem financeira em Excel. A Vals AI afirma que esses são exatamente os pontos onde o modelo tem dificuldades, independentemente de qualquer pontuação de fornecedor.

Você está tomando uma decisão de segurança cibernética com base no CyberGym 83.3. Isso é a DeepSeek testando seu próprio modelo em seu próprio benchmark — um fornecedor de segurança que compra com base nesse número está comprando dados não auditados.

Conclusão

O DeepSeek V4 Pro 0813 é um modelo de fronteira genuíno, com um scorecard do fornecedor que supera seu histórico independente. O lançamento 0813 transformou uma prévia de texto em um sério concorrente agêntico — cobrimos o lançamento em si separadamente — e, se você quiser avaliá-lo hoje, é uma chave compatível com OpenAI no OrcaRouter pelo preço de tabela da DeepSeek, com failover automático caso o provedor pare. Basta ler o scorecard da forma como este artigo o divide: as verificações independentes (AA 53, Vals em 12º, a execução de 78,7 no Terminal-Bench) são o que você pode confiar hoje; os 87,9 e 62,7 são o que você deve verificar antes de construir sobre eles. Compre-o pela relação preço-desempenho e pelo contexto de 1 milhão de tokens, não pelos números de manchete não reproduzidos.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube