
Benchmarks do DeepSeek V4 Pro: O Placar Completo 0813, Cada Verificação Independente e o que Ninguém Verificou Ainda
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 143 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A resposta em uma linha: o DeepSeek V4 Pro apresenta um scorecard agêntico genuinamente forte nos próprios números da DeepSeek — Terminal-Bench 2.1 com 87,9, DeepSWE com 62,7, CyberGym com 83,3 — mas quase todos os números de destaque são reportados pelo fornecedor, e o panorama independente é mais frio.A Artificial Analysis coloca o build oficial 0813 em 53 no seu Intelligence Index, empatado com o GLM 5.2, quatro pontos atrás do GPT-5.6 Terra e sete atrás do Kimi K3; a Vals AI o classifica em 12º, abaixo do GPT-5.5 da geração anterior. Este artigo é a agregação completa que ninguém mais escreveu: o scorecard 0813 completo, o conjunto estendido de codificação do relatório técnico, todas as verificações independentes que existem e um balanço honesto de quais números foram reproduzidos e quais ainda se baseiam apenas na palavra da DeepSeek. Uma semana após o scorecard, o panorama de serving também começou a ganhar forma — em 19 de agosto de 2026, a LMSYS e o Ant Group publicaram uma stack de serving H20 que atinge 271 tokens/s de saída com batch size 1, abordada em sua própria seção abaixo e, como tudo do lado do fornecedor nesta página, tratada como auto-reportada até que alguém a reproduza.
O scorecard oficial 0813 — os próprios números da DeepSeek, todos eles.
O anúncio oficial da DeepSeek (documentação da API, news260813, 13 de agosto de 2026) relata a compilação de produção em relação à prévia de abril. Todos os números nesta seção são fornecidos pelo fornecedor — nenhum foi reproduzido de forma independente até 16 de agosto de 2026:
• Terminal-Bench 2.1 — 87.9 (prévia: 72.1).
• DeepSWE — 62.7 (prévia: 12.8) — um salto de aproximadamente 5x que é de longe a afirmação mais impressionante do cartão.
• CyberGym — 83.3 (prévia: 52.7).
• Humanity's Last Exam — 42.7 sem ferramentas, 60.0 com ferramentas (prévia: 37.7 / 48.2).
• Toolathlon-Verificado — 74,1 (prévia: 55,9).
• AutomationBench (público) — 31.8 (prévia: 12.8).
• DSBench-FullStack — 71,1; DSBench-Hard — 67,2 (prévia: 41,8 / 31,1).
• NL2Repo — 61.5 (prévia: 38.5).
• Agents' Last Exam — 25.7 (prévia: 16.5).
O padrão a observar é onde os ganhos se concentram: benchmarks de agentes e de cibersegurança. Esse é exatamente o tipo de placar que um laboratório produz quando quer anunciar um modelo de agente — e exatamente o tipo que precisa de uma reexecução neutra antes de você gastar dinheiro de produção com ele.

O conjunto de codificação estendido do relatório técnico da DeepSeek
Além do cartão de agente, o relatório técnico da DeepSeek (conforme agregado pela BenchLM em 16 de agosto de 2026) adiciona um conjunto mais amplo de codificação e de contexto longo. Também relatado pelo fornecedor, e rotulado como "Provider exact" pela BenchLM — sem teste independente:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93,5% — o melhor verificado no catálogo do BenchLM.
• Rating no Codeforces — 3206 — também o melhor verificado no catálogo.
• BrowseComp — 83,4%; Terminal-Bench 2.0 — 67,9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — ambos os melhores do catálogo em recuperação de 1M de tokens, o que é importante para um modelo que anuncia uma janela de contexto de 1M de tokens.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (listados na página do modelo OrcaRouter).
O que os avaliadores independentes realmente medem
Três fontes independentes executaram o DeepSeek V4 Pro, e seus vereditos se agrupam abaixo do cartão do fornecedor:
• Artificial Analysis Intelligence Index — 53 (Reportagem da SCMP, agosto de 2026; a página do modelo OrcaRouter mostra 53,2, classificado em 20.º de 132). Em paridade com GLM 5.2, quatro pontos atrás do GPT-5.6 Terra, sete atrás do Kimi K3.
• Artificial Analysis Coding — 68.8, classificada em 24º lugar entre 130 (conforme a página do modelo OrcaRouter).
• Vals AI Index — 12º, ficando atrás do GPT-5.5, da geração anterior, e bem atrás do Kimi K3 e do Claude Opus 5 (SCMP). Os testes da própria Vals AI apontaram dois pontos fracos concretos: concluir tarefas dentro de um ambiente de terminal em sandbox e criar modelos financeiros complexos em planilhas do Excel.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, a única execução independente "Benchmark exact" no conjunto).
O livro-razão honesto — o que foi reproduzido vs o que ainda é apenas a palavra da DeepSeek
Esta é a seção que um artigo de benchmark existe para fornecer, e o motivo para salvar esta página nos favoritos em vez da cobertura do lançamento. Divida cada pontuação em um de dois grupos:
• De fonte independente: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI em 12º lugar, Vibe Code Bench 49.93 — e uma execução do Terminal-Bench 2.1 de outra fonte com 78.7 que fica ao lado do 87.9 da DeepSeek na página de modelos do OrcaRouter. Essa diferença de nove pontos entre o número do fornecedor e uma execução independente é o dado mais importante desta página: é a lacuna de reprodução, quantificada.
• Apenas relatado pelo fornecedor, não reproduzido de forma independente: cada figura no cartão oficial 0813 acima (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) e todo o conjunto estendido de codificação (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). A própria documentação da DeepSeek rotula a figura do Terminal-Bench 2.1 como uma "execução do provedor."
Lida dessa forma, a história é coerente: o DeepSeek V4 Pro é um modelo de fronteira de meio de tabela — AA 53, classificado entre as posições 10 e 29 — com uma ficha de avaliação do fornecedor que afirma desempenho quase no topo em tarefas de agente e codificação. Ambas as afirmações são verdadeiras e não estão em conflito; uma é medida, a outra é afirmada.

Quanto custa o scorecard
O DeepSeek V4 Pro é o carro-chefe MoE com 1,6T total / 49B ativos, com janela de contexto de 1M de tokens e saída máxima de 384K. Na OrcaRouter, ele é precificado pelo preço de tabela da DeepSeek sem nenhum markup: $0,435 por milhão de tokens de entrada e $0,87 por milhão de tokens de saída (leitura de cache $0,060 por milhão), conforme o diretório consultado em 15 de agosto de 2026 e confirmado na página do modelo ao vivo. Com esse preço, a matemática de preço por ponto é o argumento mais forte para o modelo: é aproximadamente um décimo do preço de saída dos modelos que pontuam perto dele no índice independente, portanto você está pagando preços de nível médio por um placar que, se as afirmações do fornecedor se confirmarem, está perto do topo. Um alerta: a DeepSeek anunciou uma tabela de preços de pico/fora de pico (fora de pico a 50% do pico) com vigência a partir de 17 de agosto, horário de Pequim, então o preço pode mudar — os números aqui são o preço de tabela vigente na data de publicação deste artigo.

Servindo DeepSeek V4 Pro: 271 tokens de saída por segundo no H20
Benchmarks medem o que o modelo sabe; números de serving medem quão barato é fazê-lo pensar. Em 19 de agosto de 2026, a LMSYS — a organização por trás do Chatbot Arena — e o time de código aberto da Ant Group publicaram o primeiro trabalho sério de serving na build 0813: uma "stack de serving específica para cenários" construída sobre o SGLang, o motor de código aberto mantido pela LMSYS. O número de destaque é 271 tokens de saída/s com batch size 1 em uma NVIDIA H20, que a equipe estima em 1,42× em relação a uma B300 — alcançado em um chip com sem Tensor Cores FP4 nativos. Essas são medições da própria LMSYS e da Ant Group, anunciadas em seu blog e no X; nenhuma foi reproduzida de forma independente.
Os demais números da stack, todos auto-reportados pela LMSYS e pela Ant Group na sua própria stack:
• Latência de decodificação — um componente "optimized DSpark" reduz o tempo por token de saída (TPOT) em 74.8–78.0% com tamanho de lote 1.
• Prefill — um prefill de 1 milhão de tokens é concluído em 43,7 segundos, um ganho de 36,5% na média geométrica do throughput de prefill.
• cache KV — um esquema que a equipe chama de "Humming MXFP4AFP8 + Online C128" expande a capacidade do cache KV de token completo em 10,14×, a alavanca que torna práticas as cargas de trabalho de agentes com 1M de tokens nesta classe de silício.
• Decodificação por GPU — com contexto de 4K, a vazão de decodificação por GPU sobe de 319,9 para 703,2 tokens/s/GPU, uma melhoria de 2,20×.
Leia as ressalvas antes de dimensionar uma frota com base nisso. O tamanho de lote 1 é o regime de fluxo único — o que um agente interativo ou um chat encontra, não uma API de alta concorrência — e a comparação de 1,42× em relação ao B300 é uma proporção que a LMSYS informa sem publicar os tokens/s absolutos do B300; portanto, a diferença é afirmada, não verificável. O resultado também mede a pilha, não o chip: esses ganhos vêm de otimização no nível do SGLang em hardware que, de outra forma, pareceria subdimensionado para um MoE de 1,6T no total. Para contexto, a página de modelo ao vivo do OrcaRouter mede o DeepSeek V4 Pro em 80,8 tokens/s de saída por meio de um endpoint de API compartilhado — o número do H20 é um benchmark de fluxo único em uma pilha dedicada, um número diferente com um significado diferente.
Se a sua carga de trabalho é fornecida por meio de uma API, nada disso muda a forma como você chama o modelo: o DeepSeek V4 Pro é uma chave compatível com OpenAI no OrcaRouter pelo preço de tabela da DeepSeek, com failover automático caso o provedor trave. Os números do H20 são mais importantes se você é da equipe que está avaliando uma frota de H20 auto-hospedada contra pagar pela API — a lacuna que o trabalho da LMSYS e do Ant Group fecha é uma decisão de compra de hardware, não uma decisão de seleção de modelo.
Quando esta recomendação estiver errada
Os casos honestos em que o DeepSeek V4 Pro não deveria ser a sua escolha:
• Você precisa de raciocínio de fronteira confirmado de forma independente. O AA Index 53 está no meio do grupo — Kimi K3 (60) e GPT-5.6 Terra (57) estão à frente e verificados. Se a sua decisão depender do teto medido, o cartão do fornecedor não muda isso.
• Você está apostando a produção no DeepSWE 62.7 antes que alguém o rode novamente. Um salto de 12.8→62.7 em um único lançamento é uma afirmação, não um fato. Espere por uma reprodução neutra — a diferença de 87.9-vs-78.7 no Terminal-Bench mostra o que se pode encontrar.
• Sua carga de trabalho é automação de terminal em sandbox ou modelagem financeira em Excel. A Vals AI afirma que esses são exatamente os pontos onde o modelo tem dificuldades, independentemente de qualquer pontuação de fornecedor.
• Você está tomando uma decisão de cibersegurança sobre o CyberGym 83.3. Isso é a DeepSeek testando seu próprio modelo em seu próprio benchmark — um fornecedor de segurança que compra com base nesse número está comprando dados não auditados.
• Você está comprando H20s apenas com base no número de 271 tokens/s. Esse número é um benchmark de pilha única, autorrelatado, com tamanho de lote 1 — promissor, não reproduzido, e apenas um ponto em uma curva de custo que também inclui utilização, energia e qualquer stack de servidor que você realmente executaria.
Conclusão
O DeepSeek V4 Pro 0813 é um modelo de fronteira genuíno, com um scorecard do fornecedor que supera seu histórico independente. O lançamento 0813 transformou uma prévia de texto em um sério concorrente agêntico — cobrimos o lançamento em si separadamente — e, se você quiser avaliá-lo hoje, ele é uma chave compatível com OpenAI no OrcaRouter pelo preço de tabela da DeepSeek, com failover automático se o provedor parar de responder. Basta ler o scorecard da forma como este artigo o divide: as verificações independentes (AA 53, 12º no Vals, a pontuação de 78,7 no Terminal-Bench) são no que você pode confiar hoje; os 87,9 e 62,7 são o que você deve verificar antes de construir sobre eles. A mesma disciplina agora se estende ao serving: os 271 tokens de saída/s no H20 da LMSYS e do Ant Group são o melhor panorama de throughput que temos, e é apenas a palavra deles até que uma execução neutra o confirme. Compre pelo custo-benefício e pelo contexto de 1M de tokens, não pelos números de manchete ainda não reproduzidos.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
