
DeepSeek V4 Pro 벤치마크: 0813 전체 스코어카드, 모든 독립 검증, 그리고 아직 아무도 검증하지 않은 것
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 143 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
한 줄 요약: DeepSeek V4 Pro는 DeepSeek 자체 수치 기준으로 진정으로 강력한 에이전트 스코어카드를 제시한다 — Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3 — 하지만 눈에 띄는 거의 모든 수치는 공급업체가 보고한 것이며, 독립적으로 확인된 상황은 더 냉담하다.Artificial Analysis는 공식 0813 빌드를 자체 Intelligence Index에서 53점으로 평가하며, GLM 5.2와 동급이고 GPT-5.6 Terra보다 4점, Kimi K3보다 7점 낮다. Vals AI는 이를 이전 세대 GPT-5.5 아래인 12위로 평가한다. 이 기사는 다른 누구도 작성하지 않은 완전한 집계다: 완전한 0813 스코어카드, 기술 보고서의 확장 코딩 세트, 현존하는 모든 독립 검증, 그리고 어떤 수치가 재현되었고 어떤 수치가 여전히 DeepSeek의 말뿐인지에 대한 정직한 장부다. 스코어카드 발표 일주일 뒤, 서빙 성능 그림도 채워지기 시작했다 — 2026년 8월 19일, LMSYS와 Ant Group은 배치 크기 1에서 초당 271 출력 토큰을 달성하는 H20 서빙 스택을 발표했다. 이 내용은 아래 자체 섹션에서 다루며, 이 페이지의 공급업체 측 모든 것과 마찬가지로 누군가 재현할 때까지 자체 보고로 분류된다.
공식 0813 스코어카드 — DeepSeek의 자체 수치, 그 전부
DeepSeek의 공식 발표(API 문서, news260813, 2026년 8월 13일)는 April 프리뷰를 기준으로 한 프로덕션 빌드를 보고합니다. 이 섹션의 모든 수치는 벤더가 보고한 수치이며, 2026년 8월 16일 현재 독립적으로 재현된 것은 없습니다:
• Terminal-Bench 2.1 — 87.9 (미리보기: 72.1).
• DeepSWE — 62.7 (프리뷰: 12.8) — 카드에서 단연 가장 눈에 띄는 주장인 약 5배 점프이다.
• CyberGym — 83.3 (미리보기: 52.7).
• Humanity's Last Exam — 도구 없이 42.7, 도구 사용 시 60.0 (미리보기: 37.7 / 48.2).
• Toolathlon 검증 — 74.1 (미리보기: 55.9).
• AutomationBench (공개) — 31.8 (미리보기: 12.8).
• DSBench-FullStack — 71.1; DSBench-Hard — 67.2 (미리보기: 41.8 / 31.1).
• NL2Repo — 61.5 (프리뷰: 38.5).
• Agents' Last Exam — 25.7 (미리보기: 16.5).
주목해야 할 패턴은 성과가 집중되는 곳, 즉 에이전틱 및 사이버보안 벤치마크입니다. 이것은 연구소가 에이전트 모델을 광고하려 할 때 만드는 바로 그런 스코어카드이며, 프로덕션 비용을 투자하기 전에 중립적인 재실행이 필요한 바로 그런 종류입니다.

DeepSeek 기술 보고서의 확장된 코딩 세트
에이전트 카드 외에도, DeepSeek 기술 보고서(2026년 8월 16일에 BenchLM이 집계한 바와 같이)는 더 광범위한 코딩 및 긴 컨텍스트 세트를 추가합니다. 또한 벤더가 보고한 것이며, BenchLM이 "Provider exact"라고 표시했습니다 — 독립적인 테스트가 아닙니다:
• SWE-bench Verified — 80.6%; SWE-bench Pro — 55.4%.
• LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 카탈로그에서 검증된 최고의 결과입니다.
• Codeforces 레이팅 — 3206 — 또한 카탈로그에서 검증된 최고입니다.
• BrowseComp — 83.4%; Terminal-Bench 2.0 — 67.9%.
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — 둘 다 1M-토큰 검색에서 카탈로그 최고 기록이며, 1M-토큰 컨텍스트 창을 내세우는 모델에게 중요한 부분입니다.
• GPQA Diamond — 92.8, SciCode — 49.2, Long-Context Recall — 75.3 (OrcaRouter의 모델 페이지에 나열됨).
독립 평가 기관들이 실제로 측정하는 것
세 곳의 독립된 소스가 DeepSeek V4 Pro를 실행했으며, 그들의 평가는 벤더 카드 수치 아래에 집중되어 있습니다:
• Artificial Analysis Intelligence Index — 53 (SCMP의 보도, 2026년 8월; OrcaRouter의 모델 페이지에는 53.2로 표시되며, 132개 중 20위). GLM 5.2와 동급이며, GPT-5.6 Terra보다 4포인트, Kimi K3보다 7포인트 뒤처집니다.
• Artificial Analysis Coding — 68.8, 130개 중 24위 (OrcaRouter의 모델 페이지 기준).
• Vals AI Index는 12위로, 이전 세대 GPT-5.5에 뒤처지고 Kimi K3와 Claude Opus 5 (SCMP)보다 한참 뒤에 있습니다. Vals AI의 자체 테스트에서는 샌드박스 터미널 환경에서 작업을 완료하는 것과 Excel 스프레드시트에서 복잡한 재무 모델을 구축하는 것, 이 두 가지 구체적인 약점이 지적되었습니다.
• Vibe Code Bench v1.1 — 49.93 (Vals AI, 세트에서 "Benchmark exact"로 표시된 유일한 독립 실행).
정직한 기록 — 재현된 것과 여전히 DeepSeek의 말뿐인 것
이것은 벤치마크 기사가 제공하기 위해 존재하는 섹션이며, 출시 보도보다 이 페이지를 북마크하는 이유입니다. 모든 점수를 두 개의 버킷 중 하나로 나누세요:
• 독립 출처의 수치: AA Intelligence Index 53 / 53.2, AA Coding 68.8, Vals AI 12위, Vibe Code Bench 49.93 — 그리고 별도 출처의 Terminal-Bench 2.1 실행 결과 78.7은 OrcaRouter 모델 페이지에서 DeepSeek의 87.9와 나란히 있다. 공급업체 수치와 독립 실행 결과 간의 9포인트 차이는 이 페이지에서 가장 중요한 데이터로, 바로 재현 격차를 수량화한 것이다.
• 벤더 보고 수치만 해당되며, 독립적으로 재현된 것은 아닙니다: 위 공식 0813 카드의 모든 수치 (Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7) 및 전체 확장 코딩 세트 (SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8). DeepSeek 자체 문서에서도 Terminal-Bench 2.1 수치를 "공급업체 실행"으로 표시합니다.
그렇게 읽으면 이야기는 일관적입니다: DeepSeek V4 Pro는 확실한 중간급 프론티어 모델로 — AA 53, 10위에서 20위 사이에 랭크됨 — 에이전트 및 코딩 성능이 최상위권에 가깝다고 주장하는 벤더 스코어카드를 갖추고 있습니다. 두 진술 모두 사실이며, 서로 충돌하지 않습니다. 하나는 측정된 것이고, 다른 하나는 주장된 것입니다.

스코어카드 비용
DeepSeek V4 Pro는 총 1.6T / 활성 49B MoE 플래그십으로, 1M 토큰 컨텍스트 윈도우와 384K 최대 출력을 갖추고 있습니다. OrcaRouter에서는 DeepSeek의 공식 가격으로, 마크업 없이 책정됩니다: 입력 토큰 100만 개당 $0.435, 출력 100만 개당 $0.87 (캐시 읽기 100만 개당 $0.060), 2026년 8월 15일에 확인되고 라이브 모델 페이지에서 확인된 디렉터리 기준입니다. 그 요금에서 점수당 가격 계산은 이 모델의 가장 강력한 장점입니다: 독립 지수에서 근접한 점수를 받은 모델들의 출력 가격의 약 10분의 1 수준이므로, 벤더의 주장이 사실이라면 상위권에 해당하는 스코어카드를 중간 가격대에 지불하는 셈입니다. 한 가지 주의점: DeepSeek는 8월 17일 베이징 시간 기준으로 피크/오프피크 요금제(오프피크는 피크의 50%)를 발표했으므로 요금이 변동될 수 있습니다 — 여기 숫자는 이 글 기준의 실시간 공식 가격입니다.

DeepSeek V4 Pro 서빙: H20에서 초당 271 출력 토큰
벤치마크는 모델이 무엇을 아는지를 평가하고, 서빙 수치는 모델을 얼마나 저렴하게 생각하게 할 수 있는지를 평가합니다. 2026년 8월 19일, Chatbot Arena를 운영하는 조직인 LMSYS와 Ant Group의 오픈소스 팀은 0813 빌드에 대한 첫 번째 본격적인 서빙 작업을 발표했습니다: LMSYS가 유지보수하는 오픈소스 엔진인 SGLang을 기반으로 한 "시나리오 특화 서빙 스택"입니다. 주요 수치는 NVIDIA H20에서 배치 크기 1로 271 출력 토큰/초이며, 팀은 이를 B300 대비 1.42배 — 칩에서 달성되었으며, 그 칩에는 네이티브 FP4 텐서 코어가 없습니다. 이는 LMSYS와 Ant Group의 자체 측정값이며, 그들의 블로그와 X에 공지되었고, 아직 독립적으로 재현되지 않았습니다.
나머지 스택의 수치들은 모두 LMSYS와 Ant Group이 자체 스택에서 직접 보고한 것입니다:
• 디코드 지연 시간 — "최적화된 DSpark" 구성 요소는 배치 크기 1에서 출력 토큰당 시간(TPOT)을 74.8–78.0% 줄입니다.
• 프리필 — 100만 토큰 프리필이 43.7초 만에 완료되며, 프리필 처리량이 기하 평균 36.5% 향상됩니다.
• KV 캐시 — 팀이 "Humming MXFP4AFP8 + Online C128"이라 부르는 방식은 전체 토큰 KV 캐시 용량을 10.14배 확장하며, 이 등급의 실리콘에서 1M 토큰 에이전트 워크로드를 실용적으로 만드는 핵심 요소입니다.
• GPU당 디코딩 — 4K 컨텍스트에서 GPU당 디코딩 처리량은 319.9에서 703.2 tokens/s/GPU로 상승하여 2.20배 향상되었습니다.
그 수치를 기준으로 함대 규모를 산정하기 전에 주의사항을 읽어야 한다. 배치 크기 1은 단일 스트림 방식으로, 대화형 에이전트나 채팅이 접하는 환경이지 고동시성 API가 아니다. 또한 B300 대비 1.42배 비교는 LMSYS가 B300의 절대 토큰/초를 공개하지 않은 채 제시한 비율이므로, 그 격차는 주장된 것이지 검증 가능한 것이 아니다. 이 결과는 칩이 아니라 스택을 측정한 것이기도 하다. 이러한 이득은 총 1.6T 규모의 MoE에 비해 성능이 부족해 보였을 하드웨어에서 SGLang 수준의 최적화를 통해 얻어진 것이다. 참고로 OrcaRouter의 실시간 모델 페이지는 공유 API 엔드포인트를 통해 DeepSeek V4 Pro를 80.8 출력 토큰/초로 측정한다. H20 수치는 전용 스택에서의 단일 스트림 벤치마크로, 다른 의미를 지닌 다른 수치다.
워크로드가 API를 통해 제공된다면, 이 중 어떤 것도 모델 호출 방식을 바꾸지 않습니다. DeepSeek V4 Pro는 DeepSeek의 정가에 OrcaRouter에서 제공되는 하나의 OpenAI 호환 키이며, 공급자가 응답을 멈추면 자동 장애 조치(failover)됩니다. H20 수치는 자체 호스팅 H20 플릿(fleet)과 API 비용 지불을 비교 검토하는 팀에게 가장 중요합니다. LMSYS와 Ant Group의 작업이 좁히는 격차는 하드웨어 구매 결정이지 모델 선택 결정이 아닙니다.
이 추천이 잘못된 경우
솔직히 DeepSeek V4 Pro를 선택하지 말아야 하는 경우:
• 독립적으로 확인된 최첨단 추론이 필요합니다. AA Index 53은 중간권입니다 — Kimi K3 (60)와 GPT-5.6 Terra (57)가 앞서 있으며 검증되었습니다. 측정된 상한선이 결정의 기준이라면, 벤더 카드는 그것을 바꾸지 않습니다.
• 누군가 재실행하기 전에 프로덕션을 DeepSWE 62.7에 걸고 있습니다. 한 번의 릴리스에서 12.8→62.7로 오른 것은 사실이 아니라 주장입니다. 중립적인 재현을 기다리세요 — 87.9-vs-78.7 Terminal-Bench 격차는 실제로 무엇을 발견할 수 있는지 보여줍니다.
• 워크로드는 샌드박스 터미널 자동화 또는 Excel 재무 모델링입니다. Vals AI는 이것이 벤더 점수와 무관하게 모델이 어려움을 겪는 정확한 지점이라고 말합니다.
• 귀하는 CyberGym 83.3에 대한 사이버보안 결정을 내리고 있습니다. 이는 DeepSeek가 자체 벤치마크에서 자체 모델을 테스트하는 것입니다 — 이 숫자를 근거로 구매하는 보안 공급업체는 검증되지 않은 데이터를 구매하는 것입니다.
• 271 tokens/s라는 수치만으로 H20s를 구매하고 있습니다.그 수치는 batch size 1에서의 단일 스택, 자체 보고 벤치마크로, 유망하지만 재현되지 않았으며, 활용률, 전력, 그리고 실제로 실행할 서빙 스택까지 포함하는 비용 곡선의 한 지점일 뿐입니다.
결론
DeepSeek V4 Pro 0813은 벤더 스코어카드가 독립 평가 기록을 앞서는 진정한 프론티어 모델입니다. 0813 릴리스는 텍스트 프리뷰를 본격적인 에이전틱 경쟁자로 탈바꿈시켰습니다(릴리스 자체에 대해서는 별도로 다루었습니다). 오늘 바로 평가해보고 싶다면, OrcaRouter에서 DeepSeek의 공시 가격으로 제공되는 OpenAI 호환 키 하나면 충분하며, 제공자가 지연되면 자동 페일오버가 이루어집니다. 이 기사가 구분하는 방식대로 스코어카드를 읽으세요. 독립 검증 결과(AA 53, Vals 12위, Terminal-Bench 78.7 실행)는 오늘 신뢰할 수 있는 수치이고, 87.9와 62.7 수치는 그 위에 구축하기 전에 검증해야 할 수치입니다. 이러한 원칙은 이제 서빙에도 적용됩니다. H20에서 LMSYS와 Ant Group이 기록한 초당 271개 출력 토큰은 우리가 가진 최상의 처리량 데이터이며, 중립적인 실행이 확인하기 전까지는 여전히 그들의 말일 뿐입니다. 가격 대비 성능과 1M 토큰 컨텍스트 때문에 구매하세요. 재현되지 않은 헤드라인 수치 때문이 아닙니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
