기사 'DeepSeek V4 Pro 벤치마크'의 히어로 타이틀 카드: 대형 게이지가 있는 스코어보드, 헤드라인 'DeepSeek V4 Pro — 벤치마크 스코어카드', 부제 '공식 0813 점수, 독립 검증, 아직 재현되지 않은 결과', 그리고 'TERMINAL-BENCH 2.1: 87.9', 'DEEPSWE: 62.7', 'AA INDEX: 53', '1M CONTEXT'라고 표시된 칩. OrcaRouter 로고는 오른쪽 하단에 합성됨.
Guides & Insights

DeepSeek V4 Pro 벤치마크: 0813 전체 스코어카드, 모든 독립 검증, 그리고 아직 아무도 검증하지 않은 것

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

한 줄 요약: DeepSeek V4 ProDeepSeek 자체 수치에서 확실히 강력한 에이전틱 스코어카드를 기록했다 — Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3 — 그러나 거의 모든 주요 수치는 벤더가 보고한 것이며, 독립적인 평가는 더 냉담하다. Artificial Analysis는 공식 0813 빌드를 인텔리전스 지수 53점으로 평가했으며, GLM-5.2와 동급이고 GPT-5.6 Terra보다 4점, Kimi K3보다 7점 뒤처진다; Vals AI는 이를 12위로 평가하여 이전 세대인 GPT-5.5보다 낮게 매겼다. 이 글은 다른 누구도 작성하지 않은 완전한 종합 자료다: 전체 0813 스코어카드, 기술 보고서의 확장된 코딩 세트, 존재하는 모든 독립적 검증, 그리고 어떤 수치가 재현되었고 어떤 수치가 여전히 DeepSeek의 말뿐인지에 대한 정직한 기록.

공식 0813 스코어카드 — DeepSeek의 자체 수치, 전부

DeepSeek의 공식 발표(API 문서, news260813, 2026년 8월 13일)는 4월 프리뷰에 대한 프로덕션 빌드를 보고합니다. 이 섹션의 모든 수치는 공급업체가 보고한 것이며, 2026년 8월 16일 현재 독립적으로 재현된 것은 없습니다:

Terminal-Bench 2.1 — 87.9 (미리보기: 72.1).

DeepSWE — 62.7 (프리뷰: 12.8) — 카드에서 단연 가장 눈에 띄는 주장인 약 5배 점프이다.

CyberGym — 83.3 (미리보기: 52.7).

Humanity's Last Exam — 도구 없이 42.7, 도구 사용 시 60.0 (미리보기: 37.7 / 48.2).

Toolathlon 검증 — 74.1 (미리보기: 55.9).

AutomationBench (공개) — 31.8 (미리보기: 12.8).

DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (미리보기: 41.8 / 31.1).

NL2Repo — 61.5 (프리뷰: 38.5).

Agents' Last Exam — 25.7 (미리보기: 16.5).

주목해야 할 패턴은 성과가 집중되는 곳, 즉 에이전틱 및 사이버보안 벤치마크입니다. 이것은 연구소가 에이전트 모델을 광고하려 할 때 만드는 바로 그런 스코어카드이며, 프로덕션 비용을 투자하기 전에 중립적인 재실행이 필요한 바로 그런 종류입니다.

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

DeepSeek의 기술 보고서의 확장 코딩 세트

에이전틱 카드 외에도, DeepSeek 기술 보고서(BenchLM이 2026년 8월 16일에 집계)는 더 넓은 코딩 및 롱컨텍스트 세트를 추가합니다. 또한 벤더가 보고한 것이며 BenchLM이 "Provider exact"로 표시했습니다 — 독립적인 테스트는 아닙니다:

SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.

LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 카탈로그에서 검증된 최고의 결과입니다.

Codeforces 레이팅 — 3206 — 또한 카탈로그에서 검증된 최고입니다.

BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — 둘 다 1M-토큰 검색에서 카탈로그 최고 기록이며, 1M-토큰 컨텍스트 창을 내세우는 모델에게 중요한 부분입니다.

GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (OrcaRouter의 모델 페이지에 나열됨).

독립 평가 기관들이 실제로 측정하는 것

세 곳의 독립된 소스가 DeepSeek V4 Pro를 실행했으며, 그들의 평가는 벤더 카드 수치 아래에 집중되어 있습니다:

Artificial Analysis Intelligence Index — 53 (SCMP의 보도, 2026년 8월; OrcaRouter의 모델 페이지에는 53.2로 표시되며, 132개 중 20위). GLM-5.2와 동급이며, GPT-5.6 Terra보다 4점, Kimi K3보다 7점 뒤처집니다.

Artificial Analysis Coding — 68.8, 130개 중 24위 (OrcaRouter의 모델 페이지 기준).

Vals AI Index는 12위로, 이전 세대 GPT-5.5에 뒤처지고 Kimi K3와 Claude Opus 5 (SCMP)보다 한참 뒤에 있습니다. Vals AI의 자체 테스트에서는 샌드박스 터미널 환경에서 작업을 완료하는 것과 Excel 스프레드시트에서 복잡한 재무 모델을 구축하는 것, 이 두 가지 구체적인 약점이 지적되었습니다.

Vibe Code Bench v1.1 — 49.93 (Vals AI, 세트에서 "Benchmark exact"로 표시된 유일한 독립 실행).

정직한 장부 — 재현된 것 vs 아직 DeepSeek의 말뿐인 것

이것은 벤치마크 기사가 제공하기 위해 존재하는 섹션이며, 출시 보도보다 이 페이지를 북마크하는 이유입니다. 모든 점수를 두 개의 버킷 중 하나로 나누세요:

독립 출처: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI 12위, Vibe Code Bench 49.93 — 그리고 별도 출처의 Terminal-Bench 2.1 실행 결과인 78.7은 OrcaRouter 모델 페이지에서 DeepSeek의 87.9와 나란히 위치합니다. 이 9점 차이는 벤더의 수치와 독립 실행 결과 사이의 간격으로, 이 페이지에서 가장 중요한 단일 데이터이며, 재현 격차를 정량화한 것입니다.

벤더 제공 수치일 뿐이며, 독립적으로 재현되지는 않았습니다: 위 공식 0813 카드의 모든 수치(Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7)와 전체 확장 코딩 세트(SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8)를 말합니다. DeepSeek의 자체 문서는 Terminal-Bench 2.1 수치를 "provider run"으로 표시합니다.

그렇게 읽으면 이야기는 일관적입니다: DeepSeek V4 Pro는 확실한 중간급 프론티어 모델로 — AA 53, 10위에서 20위 사이에 랭크됨 — 에이전트 및 코딩 성능이 최상위권에 가깝다고 주장하는 벤더 스코어카드를 갖추고 있습니다. 두 진술 모두 사실이며, 서로 충돌하지 않습니다. 하나는 측정된 것이고, 다른 하나는 주장된 것입니다.

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

스코어카드 비용

DeepSeek V4 Pro는 총 1.6T(1조 6천억) / 활성 49B(490억) 매개변수 기반 MoE 플래그십 모델로, 1M 토큰 컨텍스트 창과 384K 최대 출력을 지원합니다. OrcaRouter에서는 DeepSeek의 공식 가격에 마크업 없이 제공됩니다: 입력 토큰 100만 개당 $0.435, 출력 토큰 100만 개당 $0.87 (캐시 읽기 $0.060/100만), 2026년 8월 15일 기준 디렉터리에서 확인했고 라이브 모델 페이지에서도 확인된 가격입니다. 그 요율에서 가격 대비 점수 산정이 이 모델을 선택하는 가장 강력한 이유입니다: 독립 지수에서 비슷한 점수를 받은 모델들의 출력 가격의 약 10분의 1 수준이므로, 업체의 주장이 사실이라면 상위권에 가까운 성적표를 중간 수준 가격으로 얻는 셈입니다. 한 가지 유의점: DeepSeek는 베이징 시간 기준 8월 17일부터 피크/오프피크 요금제(오프피크는 피크의 50%)를 시행한다고 발표했으므로 요율이 변동될 수 있습니다 — 여기 제시된 수치는 이 글 작성 시점의 라이브 정가입니다.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

이 추천이 잘못된 경우

솔직히 DeepSeek V4 Pro를 선택하지 말아야 하는 경우:

독립적으로 확인된 최첨단 추론이 필요합니다. AA Index 53은 중간권입니다 — Kimi K3 (60)와 GPT-5.6 Terra (57)가 앞서 있으며 검증되었습니다. 측정된 상한선이 결정의 기준이라면, 벤더 카드는 그것을 바꾸지 않습니다.

누군가 재실행하기 전에 프로덕션을 DeepSWE 62.7에 걸고 있습니다. 한 번의 릴리스에서 12.8→62.7로 오른 것은 사실이 아니라 주장입니다. 중립적인 재현을 기다리세요 — 87.9-vs-78.7 Terminal-Bench 격차는 실제로 무엇을 발견할 수 있는지 보여줍니다.

워크로드는 샌드박스 터미널 자동화 또는 Excel 재무 모델링입니다. Vals AI는 이것이 벤더 점수와 무관하게 모델이 어려움을 겪는 정확한 지점이라고 말합니다.

당신은 CyberGym 83.3을 기반으로 사이버 보안 결정을 내리고 있습니다. 이것은 DeepSeek가 자체 벤치마크에서 자체 모델을 테스트하는 것입니다 — 이 숫자에 기반하여 구매하는 보안 공급업체는 검증되지 않은 데이터를 구매하는 것입니다.

결론

DeepSeek V4 Pro 0813은 독립 평가 기록을 앞지르는 공급업체 스코어카드를 가진 진정한 프론티어 모델입니다. 0813 릴리스는 텍스트 미리보기를 진지한 에이전트 경쟁자로 탈바꿈시켰으며, 릴리스 자체에 대해서는 별도로 다루었습니다. 오늘 평가해 보려면 OrcaRouter에서 DeepSeek의 정가로 제공되는 OpenAI 호환 키 하나면 되고, 공급자가 지연되면 자동 장애 조치가 이루어집니다. 이 기사가 나누는 방식대로 스코어카드를 읽으세요. 독립 검증 결과(AA 53, Vals 12위, Terminal-Bench 78.7 실행)는 오늘 신뢰할 수 있는 부분이고, 87.9와 62.7은 이를 기반으로 구축하기 전에 검증해야 할 수치입니다. 재현되지 않은 헤드라인 수치 때문이 아니라 가격 대비 성능과 1M 토큰 컨텍스트 때문에 구매하세요.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube