文章《DeepSeek V4 Pro Benchmarks》的主标题卡:一个带大型仪表盘的记分板,大标题“DeepSeek V4 Pro —— 基准测试记分卡”,副标题“官方 0813 分数、独立核查,以及尚未复现的结果”,另有显示“TERMINAL-BENCH 2.1: 87.9”“DEEPSWE: 62.7”“AA INDEX: 53”“1M CONTEXT”的标签。OrcaRouter 标志合成在右下角。
Guides & Insights

DeepSeek V4 Pro 基准测试:完整的 0813 评分卡、全部独立检查,以及尚未有人验证的部分

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

一句话回答:按照 DeepSeek 自己的数据,DeepSeek V4 Pro 交出了一份确实亮眼的智能体成绩单——Terminal-Bench 2.1 为 87.9,DeepSWE 为 62.7,CyberGym 为 83.3——但几乎每个头条数字都来自厂商自报,独立视角下的图景则冷静得多。 Artificial Analysis 在智能指数上给官方 0813 版本打出 53 分,与 GLM-5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分;Vals AI 将其排在第 12 位,低于上一代 GPT-5.5。本文是此前无人写过的完整汇总:完整的 0813 成绩单、技术报告中的扩展编码测试集、目前已有的全部独立验证,以及一份诚实的账目,标明哪些数字已被复现、哪些仍只是 DeepSeek 的单方说法。

官方0813成绩单——全部都是DeepSeek自己的数据

DeepSeek 的官方公告(API 文档,news260813,2026年8月13日)报告了针对四月预览版的生产构建。本节中的所有数据均为供应商报告——截至2026年8月16日,尚未有任何数据被独立复现:

Terminal-Bench 2.1 — 87.9(预览:72.1)。

DeepSWE — 62.7(预览版:12.8)——约 5 倍的跃升,这是该卡上最引人注目的说法。

CyberGym — 83.3(预览版:52.7)。

Humanity's Last Exam——无工具时42.7,有工具时60.0(预览:37.7 / 48.2)。

Toolathlon-Verified — 74.1(预览:55.9)。

AutomationBench(公开版)— 31.8(预览版:12.8)。

DSBench-FullStack — 71.1;DSBench-Hard — 67.2(预览:41.8 / 31.1)。

NL2Repo — 61.5(预览版:38.5)。

Agents' Last Exam — 25.7(预览:16.5)。

值得注意的模式在于收益集中之处:智能体与网络安全基准测试。那正是实验室在推广智能体模型时会拿出的成绩单——也正是你在投入生产资金之前需要中立复测的那一种。

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

DeepSeek技术报告中的扩展编码集

除了智能体卡片之外,DeepSeek 技术报告(由 BenchLM 于 2026 年 8 月 16 日汇总)还增加了更广泛的编码和长上下文数据集。同样由供应商报告,并被 BenchLM 标记为“Provider exact”——没有独立测试:

SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。

LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 目录中经过验证的最佳成绩。

Codeforces 积分 — 3206——也是目录中已验证的最佳成绩。

BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。

MRCR 1M — 83.5%;CorpusQA 1M — 62.0%——这两项均为1M token检索上的目录最佳成绩,对于宣称拥有1M token上下文窗口的模型来说至关重要。

GPQA Diamond — 92.8,SciCode — 49.2,Long-Context Recall — 75.3(列于 OrcaRouter 的模型页面)。

独立评估者实际衡量什么

三个独立信源对DeepSeek V4 Pro进行了实测,其结论均低于厂商标称。

Artificial Analysis Intelligence Index — 53(SCMP 2026年8月报道;OrcaRouter 的模型页面显示为 53.2,在 132 个中排名第 20)。与 GLM-5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分。

Artificial Analysis Coding — 68.8,在130个中排名第24(据OrcaRouter的模型页面)。

Vals AI 指数排名第 12,落后于上一代 GPT-5.5,也远远落后于 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自身的测试指出了两个具体的弱点:在沙盒终端环境中完成任务,以及在 Excel 电子表格中构建复杂的财务模型。

Vibe Code Bench v1.1 — 49.93(Vals AI,该组中唯一一次“Benchmark exact”独立运行)。

诚实的账本——哪些已被复现,哪些仍只是 DeepSeek 的一面之词

这正是基准测试文章所要提供的部分,也是相较于发布报道,您应为此页面添加书签的原因。将每个分数归入以下两个类别之一:

独立来源:AA Intelligence Index 53 / 53.2,AA Coding 68.8,Vals AI 排名第12位,Vibe Code Bench 49.93 —— 以及另一个独立来源的 Terminal-Bench 2.1 运行结果 78.7,该结果与 DeepSeek 的 87.9 并排显示在 OrcaRouter 的模型页面上。厂商数据与独立运行结果之间这九分的差距,是本页最重要的一项数据:这就是可复现性差距的量化体现。

仅厂商报告,未经独立复现:上述官方 0813 卡片中的每一项数据(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整个扩展编码集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek 自己的文档将 Terminal-Bench 2.1 的这项数据标记为“provider run”。

这样解读的话,故事是自洽的:DeepSeek V4 Pro 确实是一款处于中游的前沿模型——AA 53,排名在十几到二十几名——其厂商评分卡声称在智能体和编码性能上接近顶尖水平。这两种说法都属实,而且并不冲突;一个是实测的,另一个是宣称的。

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

记分卡的费用

DeepSeek V4 Pro 是总参数 1.6T、激活参数 49B 的 MoE 旗舰模型,支持 100 万 token 上下文窗口和 384K 最大输出。在 OrcaRouter 上,它按 DeepSeek 官方标价出售,零加价:每百万输入 token $0.435,每百万输出 $0.87(缓存读取每百万 $0.060)。以上价格依据 2026 年 8 月 15 日查核的目录,并已在实时模型页面上确认。以这个价格计算,单点性价比是该模型最有力的论据:它大约只有独立指数上相近得分模型输出价格的十分之一,因此你以中端价格买到的是一份——如果厂商宣称属实——接近顶级的成绩单。有一点需要注意:DeepSeek 已宣布自北京时间 8 月 17 日起实行峰谷定价方案(谷时价格为峰时的 50%),因此价格可能会变动——本文中的数字是截至本文发布时的实时挂牌价。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

当此推荐有误时。

以下这些真实情况下,你不应选择 DeepSeek V4 Pro:

您需要经独立确认的前沿推理能力。 AA Index 53 处于中游水平——Kimi K3(60)和 GPT-5.6 Terra(57)领先且已验证。如果您的决策取决于实测上限,供应商卡片不会改变这一点。

在有人重新运行 DeepSWE 62.7 之前,你就把生产押注在它上面。 一次发布中 12.8→62.7 的跃升是断言,而非事实。等待中立的复现——87.9 与 78.7 的 Terminal-Bench 差距就显示了可能发现的情形。

你的工作负载是沙盒化的终端自动化或 Excel 财务建模。 Vals AI 表示,这些正是模型难以应对之处,与任何供应商评分无关。

你正基于 CyberGym 83.3 做出网络安全决策。这是 DeepSeek 在自己的基准上测试自己的模型——安全厂商依据这个数字采购,买到的只是未经审计的数据。

底线

DeepSeek V4 Pro 0813 是一款真正的前沿模型,其厂商评分卡表现优于独立评测记录。0813 版本将文本预览变成了一个严肃的智能体竞争者——我们已单独报道过该版本本身——如果你今天想评估它,只需在 OrcaRouter 上使用一个兼容 OpenAI 的密钥,按 DeepSeek 的标价即可,若供应商停滞则会自动故障转移。只需按照本文拆分评分卡的方式来解读:独立检查(AA 53、Vals 第 12 名、Terminal-Bench 78.7 分)是今天可以信赖的;87.9 和 62.7 这些分数则是你在基于它们构建之前需要验证的。购买它是为了性价比和 100 万 token 的上下文,而不是那些未被复现的头条数字。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube