文章《DeepSeek V4 Pro Benchmarks》的主标题卡:一个带大型仪表盘的记分板,大标题“DeepSeek V4 Pro —— 基准测试记分卡”,副标题“官方 0813 分数、独立核查,以及尚未复现的结果”,另有显示“TERMINAL-BENCH 2.1: 87.9”“DEEPSWE: 62.7”“AA INDEX: 53”“1M CONTEXT”的标签。OrcaRouter 标志合成在右下角。
Guides & Insights

DeepSeek V4 Pro 基准测试:完整的 0813 评分卡、全部独立检查,以及尚未有人验证的部分

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

一句话回答:DeepSeek V4 Pro 在 Deep​Seek 自己的数据上确实交出了一份强劲的智能体成绩单——Terminal-Bench 2.1 为 87.9,DeepSWE 为 62.7,CyberGym 为 83.3——但几乎所有头条数字均出自厂商自报,独立的图景则更为冷静。Artificial Analysis 将官方 0813 版本在其 Intelligence Index 上评为 53 分,与 GLM 5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分;Vals AI 将其排在第 12 位,低于上一代 GPT-5.5。本文是其他人尚未写出的完整汇总:完整的 0813 成绩单、技术报告中的扩展编码测试集、所有已有的独立验证,以及一份诚实的账目,列明哪些数字已被复现、哪些仍只是 Deep​Seek 的一家之言。成绩单发布一周后,服务端的情况也开始逐渐明晰——2026 年 8 月 19 日,LMSYS 与蚂蚁集团发布了一套 H20 服务栈,在 batch size 为 1 时输出速度可达每秒 271 个 token,详见下方专门章节;与本页所有厂商侧内容一样,在有人复现之前,这些数据均标注为自行报告。

官方0813记分卡——Deep​Seek自己的数字,全部都是

Deep​Seek官方公告(API文档、news260813,2026年8月13日)报告了针对四月预览版的生产构建。本节中的每个数字均由供应商提供——截至2026年8月16日,尚未有任何独立复现结果:

• Terminal-Bench 2.1 — 87.9(预览:72.1)。

• DeepSWE — 62.7(预览版:12.8)——约 5 倍的跃升,这是该卡上最引人注目的说法。

• CyberGym — 83.3(预览版:52.7)。

• Humanity's Last Exam——无工具时42.7,有工具时60.0(预览:37.7 / 48.2)。

• Toolathlon-Verified — 74.1(预览:55.9)。

• AutomationBench(公开版)— 31.8(预览版:12.8)。

• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(预览:41.8 / 31.1)。

• NL2Repo — 61.5(预览版:38.5)。

• Agents' Last Exam — 25.7(预览:16.5)。

值得注意的模式在于收益集中之处:智能体与网络安全基准测试。那正是实验室在推广智能体模型时会拿出的成绩单——也正是你在投入生产资金之前需要中立复测的那一种。

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

来自DeepSeek技术报告的扩展编码集

除了智能体卡片之外,Deep​Seek 技术报告(由 BenchLM 于 2026 年 8 月 16 日汇总)增加了更广泛的编码和长上下文测试集。同样为供应商报告,并被 BenchLM 标记为"Provider exact"——没有独立测试:

• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。

• LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 目录中经过验证的最佳成绩。

• Codeforces 积分 — 3206——也是目录中已验证的最佳成绩。

• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。

• MRCR 1M — 83.5%;CorpusQA 1M — 62.0%——这两项均为1M token检索上的目录最佳成绩,对于宣称拥有1M token上下文窗口的模型来说至关重要。

• GPQA Diamond — 92.8,SciCode — 49.2,Long-Context Recall — 75.3(列于 OrcaRouter 的模型页面)。

独立评估者实际衡量什么

三个独立信源对DeepSeek V4 Pro进行了实测,其结论均低于厂商标称。

• Artificial Analysis 智能指数 — 53(据 SCMP 2026 年 8 月报道;OrcaRouter 的模型页面显示为 53.2,在 132 个模型中排名第 20)。与 GLM 5.2 持平,落后 GPT-5.6 Terra 四分,落后 Kimi K3 七分。

• Artificial Analysis Coding — 68.8,在130个中排名第24(据OrcaRouter的模型页面)。

• Vals AI 指数排名第 12,落后于上一代 GPT-5.5,也远远落后于 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自身的测试指出了两个具体的弱点:在沙盒终端环境中完成任务,以及在 Excel 电子表格中构建复杂的财务模型。

• Vibe Code Bench v1.1 — 49.93(Vals AI,该组中唯一一次“Benchmark exact”独立运行)。

诚实的记录——哪些已经复现,哪些仍只是Deep​Seek的一面之词

这正是基准测试文章所要提供的部分,也是相较于发布报道,您应为此页面添加书签的原因。将每个分数归入以下两个类别之一:

• 独立来源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12、Vibe Code Bench 49.93——以及一项独立来源的 Terminal-Bench 2.1 运行结果为78.7,该结果与 Deep​Seek 的 87.9 并列显示在 OrcaRouter 的模型页面上。供应商数据与独立运行结果之间的这九分差距,是本页最关键的一个数据点:这就是可复现性差距的量化体现。

• 仅厂商报告,未独立复现:上述官方 0813 卡片中的每一个数字(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整个扩展编码集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。Deep​Seek 自己的文档将 Terminal-Bench 2.1 的数字标注为“provider run”。

这样解读的话,故事是自洽的:DeepSeek V4 Pro 确实是一款处于中游的前沿模型——AA 53,排名在十几到二十几名——其厂商评分卡声称在智能体和编码性能上接近顶尖水平。这两种说法都属实,而且并不冲突;一个是实测的,另一个是宣称的。

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

记分卡的费用

DeepSeek V4 Pro 是基于 MoE 架构的旗舰模型,总参数量 1.6T、激活参数 49B,支持 1M token 的上下文窗口和最大 384K 输出。在 OrcaRouter 上,它按 DeepSeek 官方列表价格出售,零加价:每百万输入 token 0.435 美元,每百万输出 token 0.87 美元(缓存读取每百万 0.060 美元),以上价格依据 2026 年 8 月 15 日查询的目录,并在实时模型页面上确认。按该价格计算,单位得分的成本是支持该模型的最强论据:其输出价格大约仅为独立指数中得分接近它的模型的十分之一,也就是说,你相当于以中档价格购买了一份——如果供应商的说法属实——接近顶尖水平的成绩单。有一点需要注意:DeepSeek 已宣布实施高峰/低谷定价方案(低谷价格为高峰的 50%),自北京时间 8 月 17 日起生效,因此费率可能会变动——本文中的数字为撰写本文时的实时列表价格。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

在 H20 上运行 DeepSeek V4 Pro:271 输出 tokens/秒

基准测试衡量模型知道什么;服务指标衡量你以多低的成本让它思考。2026年8月19日,LMSYS——Chatbot Arena背后的组织——与Ant Group的开源团队发布了针对0813版本的首个严肃服务化工作:一个基于SGLang(LMSYS维护的开源引擎)构建的“场景专用服务栈”。最引人注目的数字是在NVIDIA H20上、批大小为1时达到271输出tokens/秒,团队称其达到B300的1.42×——这是在没有原生FP4 Tensor Cores的芯片上实现的。这些是LMSYS和Ant Group自己的测量结果,发布在他们的博客和X上;尚未被独立复现。

堆栈的其余数字,均由 LMSYS 和蚂蚁集团在其自身堆栈上自行报告:

• 解码延迟——一个“优化的 DSpark”组件将批量大小为 1 时的输出每个令牌的时间(TPOT)缩短了 74.8–78.0%。

• 预填充——100万token的预填充在43.7秒内完成,预填充吞吐量几何平均提升36.5%。

• KV cache——团队称之为“Humming MXFP4AFP8 + Online C128”的方案,将全token KV cache容量扩展了10.14倍,这是使1M-token智能体工作负载在这类芯片上切实可行的关键。

• 每GPU解码——在4K上下文下,每GPU解码吞吐量从319.9提升至703.2 tokens/s/GPU,提升了2.20倍。

在据此规划机群规模之前,请先阅读这些注意事项。batch size 为 1 属于单流(single-stream)场景——这是交互式 agent 或聊天应用会遇到的负载形态,而非高并发 API——而“相比 B300 为 1.42×”的对比只是 LMSYS 给出的一个比率,LMSYS 并未公布 B300 的绝对 tokens/s 数值,因此这一差距只是论断,无法核实。此外,该结果衡量的是整个技术栈,而非芯片本身:这些提升来自 SGLang 级别的优化,而所用硬件若不经过这类优化,对于总参数量 1.6T 的 MoE 来说会显得算力不足。作为参照,OrcaRouter 的实时模型页面测得 DeepSeek V4 Pro 通过共享 API 端点的输出速度为 80.8 tokens/s——H20 的数字则是专用技术栈上的单流基准测试结果,两者数值不同,含义也不同。

如果你的工作负载是通过 API 提供的,那么这一切都不会改变你调用模型的方式:DeepSeek V4 Pro 就是 OrcaRouter 上的一个 OpenAI 兼容密钥,按 Deep​Seek 的官方标价收费,如果服务商出现停滞,会自动进行故障转移。H20 的数据对正在权衡自建 H20 集群与付费使用 API 的团队最为重要——LMSYS 和蚂蚁集团的工作所弥合的差距是一个硬件采购决策,而不是模型选型决策。

当这个推荐有误时

以下这些真实情况下,你不应选择 DeepSeek V4 Pro:

• 您需要经独立确认的前沿推理能力。 AA Index 53 处于中游水平——Kimi K3(60)和 GPT-5.6 Terra(57)领先且已验证。如果您的决策取决于实测上限,供应商卡片不会改变这一点。

• 在有人重新运行 DeepSWE 62.7 之前,你就把生产押注在它上面。 一次发布中 12.8→62.7 的跃升是断言,而非事实。等待中立的复现——87.9 与 78.7 的 Terminal-Bench 差距就显示了可能发现的情形。

• 你的工作负载是沙盒化的终端自动化或 Excel 财务建模。 Vals AI 表示,这些正是模型难以应对之处,与任何供应商评分无关。

• 你正在基于 CyberGym 83.3 做出网络安全决策。这就是 Deep​Seek 在用自己的基准测试自己的模型——安全厂商若依据这个数字采购,买到的就是未经审计的数据。

• 你光凭 271 tokens/s 这个数字就要买 H20。那个数字是单技术栈、批量大小为 1 的自报基准——很有前景,但尚未复现,而且只是成本曲线上的一个点,该曲线还包含利用率、功耗以及你实际要运行的任何服务技术栈。

最重要的一点

DeepSeek V4 Pro 0813 是一款真正的顶尖模型,其厂商评分卡表现超越了它的独立评测记录。0813 版本将文本预览变成了一个严肃的智能体竞争者——我们已单独报道过该版本的发布——如果你想今天就评估它,它可以在 OrcaRouter 上以 DeepSeek 的标价提供一个兼容 OpenAI 的密钥,如果服务商卡顿则自动故障转移。只需按照本文拆分评分卡的方式来解读:独立检查(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 运行)是今天你可以信赖的;87.9 和 62.7 则是你在依赖它们之前应该验证的。同样的严谨态度现在延伸到了服务层面:LMSYS 和蚂蚁集团在 H20 上实现的 271 输出 tokens/秒是我们拥有的最佳吞吐量数据,但在中立机构运行确认之前,这仍然是他们单方面的说法。购买它的理由是性价比和 100 万 token 的上下文长度,而不是那些无法复现的头条数字。

本文中的对比3

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新