
DeepSeek V4 Pro 基准测试:完整的 0813 评分卡、全部独立检查,以及尚未有人验证的部分
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 143 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
一句话回答:DeepSeek V4 Pro 在 DeepSeek 自己的数据上确实交出了一份强劲的智能体成绩单——Terminal-Bench 2.1 为 87.9,DeepSWE 为 62.7,CyberGym 为 83.3——但几乎所有头条数字均出自厂商自报,独立的图景则更为冷静。Artificial Analysis 将官方 0813 版本在其 Intelligence Index 上评为 53 分,与 GLM 5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分;Vals AI 将其排在第 12 位,低于上一代 GPT-5.5。本文是其他人尚未写出的完整汇总:完整的 0813 成绩单、技术报告中的扩展编码测试集、所有已有的独立验证,以及一份诚实的账目,列明哪些数字已被复现、哪些仍只是 DeepSeek 的一家之言。成绩单发布一周后,服务端的情况也开始逐渐明晰——2026 年 8 月 19 日,LMSYS 与蚂蚁集团发布了一套 H20 服务栈,在 batch size 为 1 时输出速度可达每秒 271 个 token,详见下方专门章节;与本页所有厂商侧内容一样,在有人复现之前,这些数据均标注为自行报告。
官方0813记分卡——DeepSeek自己的数字,全部都是
DeepSeek官方公告(API文档、news260813,2026年8月13日)报告了针对四月预览版的生产构建。本节中的每个数字均由供应商提供——截至2026年8月16日,尚未有任何独立复现结果:
• Terminal-Bench 2.1 — 87.9(预览:72.1)。
• DeepSWE — 62.7(预览版:12.8)——约 5 倍的跃升,这是该卡上最引人注目的说法。
• CyberGym — 83.3(预览版:52.7)。
• Humanity's Last Exam——无工具时42.7,有工具时60.0(预览:37.7 / 48.2)。
• Toolathlon-Verified — 74.1(预览:55.9)。
• AutomationBench(公开版)— 31.8(预览版:12.8)。
• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(预览:41.8 / 31.1)。
• NL2Repo — 61.5(预览版:38.5)。
• Agents' Last Exam — 25.7(预览:16.5)。
值得注意的模式在于收益集中之处:智能体与网络安全基准测试。那正是实验室在推广智能体模型时会拿出的成绩单——也正是你在投入生产资金之前需要中立复测的那一种。

来自DeepSeek技术报告的扩展编码集
除了智能体卡片之外,DeepSeek 技术报告(由 BenchLM 于 2026 年 8 月 16 日汇总)增加了更广泛的编码和长上下文测试集。同样为供应商报告,并被 BenchLM 标记为"Provider exact"——没有独立测试:
• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。
• LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 目录中经过验证的最佳成绩。
• Codeforces 积分 — 3206——也是目录中已验证的最佳成绩。
• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。
• MRCR 1M — 83.5%;CorpusQA 1M — 62.0%——这两项均为1M token检索上的目录最佳成绩,对于宣称拥有1M token上下文窗口的模型来说至关重要。
• GPQA Diamond — 92.8,SciCode — 49.2,Long-Context Recall — 75.3(列于 OrcaRouter 的模型页面)。
独立评估者实际衡量什么
三个独立信源对DeepSeek V4 Pro进行了实测,其结论均低于厂商标称。
• Artificial Analysis 智能指数 — 53(据 SCMP 2026 年 8 月报道;OrcaRouter 的模型页面显示为 53.2,在 132 个模型中排名第 20)。与 GLM 5.2 持平,落后 GPT-5.6 Terra 四分,落后 Kimi K3 七分。
• Artificial Analysis Coding — 68.8,在130个中排名第24(据OrcaRouter的模型页面)。
• Vals AI 指数排名第 12,落后于上一代 GPT-5.5,也远远落后于 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自身的测试指出了两个具体的弱点:在沙盒终端环境中完成任务,以及在 Excel 电子表格中构建复杂的财务模型。
• Vibe Code Bench v1.1 — 49.93(Vals AI,该组中唯一一次“Benchmark exact”独立运行)。
诚实的记录——哪些已经复现,哪些仍只是DeepSeek的一面之词
这正是基准测试文章所要提供的部分,也是相较于发布报道,您应为此页面添加书签的原因。将每个分数归入以下两个类别之一:
• 独立来源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12、Vibe Code Bench 49.93——以及一项独立来源的 Terminal-Bench 2.1 运行结果为78.7,该结果与 DeepSeek 的 87.9 并列显示在 OrcaRouter 的模型页面上。供应商数据与独立运行结果之间的这九分差距,是本页最关键的一个数据点:这就是可复现性差距的量化体现。
• 仅厂商报告,未独立复现:上述官方 0813 卡片中的每一个数字(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整个扩展编码集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek 自己的文档将 Terminal-Bench 2.1 的数字标注为“provider run”。
这样解读的话,故事是自洽的:DeepSeek V4 Pro 确实是一款处于中游的前沿模型——AA 53,排名在十几到二十几名——其厂商评分卡声称在智能体和编码性能上接近顶尖水平。这两种说法都属实,而且并不冲突;一个是实测的,另一个是宣称的。

记分卡的费用
DeepSeek V4 Pro 是基于 MoE 架构的旗舰模型,总参数量 1.6T、激活参数 49B,支持 1M token 的上下文窗口和最大 384K 输出。在 OrcaRouter 上,它按 DeepSeek 官方列表价格出售,零加价:每百万输入 token 0.435 美元,每百万输出 token 0.87 美元(缓存读取每百万 0.060 美元),以上价格依据 2026 年 8 月 15 日查询的目录,并在实时模型页面上确认。按该价格计算,单位得分的成本是支持该模型的最强论据:其输出价格大约仅为独立指数中得分接近它的模型的十分之一,也就是说,你相当于以中档价格购买了一份——如果供应商的说法属实——接近顶尖水平的成绩单。有一点需要注意:DeepSeek 已宣布实施高峰/低谷定价方案(低谷价格为高峰的 50%),自北京时间 8 月 17 日起生效,因此费率可能会变动——本文中的数字为撰写本文时的实时列表价格。

在 H20 上运行 DeepSeek V4 Pro:271 输出 tokens/秒
基准测试衡量模型知道什么;服务指标衡量你以多低的成本让它思考。2026年8月19日,LMSYS——Chatbot Arena背后的组织——与Ant Group的开源团队发布了针对0813版本的首个严肃服务化工作:一个基于SGLang(LMSYS维护的开源引擎)构建的“场景专用服务栈”。最引人注目的数字是在NVIDIA H20上、批大小为1时达到271输出tokens/秒,团队称其达到B300的1.42×——这是在没有原生FP4 Tensor Cores的芯片上实现的。这些是LMSYS和Ant Group自己的测量结果,发布在他们的博客和X上;尚未被独立复现。
堆栈的其余数字,均由 LMSYS 和蚂蚁集团在其自身堆栈上自行报告:
• 解码延迟——一个“优化的 DSpark”组件将批量大小为 1 时的输出每个令牌的时间(TPOT)缩短了 74.8–78.0%。
• 预填充——100万token的预填充在43.7秒内完成,预填充吞吐量几何平均提升36.5%。
• KV cache——团队称之为“Humming MXFP4AFP8 + Online C128”的方案,将全token KV cache容量扩展了10.14倍,这是使1M-token智能体工作负载在这类芯片上切实可行的关键。
• 每GPU解码——在4K上下文下,每GPU解码吞吐量从319.9提升至703.2 tokens/s/GPU,提升了2.20倍。
在据此规划机群规模之前,请先阅读这些注意事项。batch size 为 1 属于单流(single-stream)场景——这是交互式 agent 或聊天应用会遇到的负载形态,而非高并发 API——而“相比 B300 为 1.42×”的对比只是 LMSYS 给出的一个比率,LMSYS 并未公布 B300 的绝对 tokens/s 数值,因此这一差距只是论断,无法核实。此外,该结果衡量的是整个技术栈,而非芯片本身:这些提升来自 SGLang 级别的优化,而所用硬件若不经过这类优化,对于总参数量 1.6T 的 MoE 来说会显得算力不足。作为参照,OrcaRouter 的实时模型页面测得 DeepSeek V4 Pro 通过共享 API 端点的输出速度为 80.8 tokens/s——H20 的数字则是专用技术栈上的单流基准测试结果,两者数值不同,含义也不同。
如果你的工作负载是通过 API 提供的,那么这一切都不会改变你调用模型的方式:DeepSeek V4 Pro 就是 OrcaRouter 上的一个 OpenAI 兼容密钥,按 DeepSeek 的官方标价收费,如果服务商出现停滞,会自动进行故障转移。H20 的数据对正在权衡自建 H20 集群与付费使用 API 的团队最为重要——LMSYS 和蚂蚁集团的工作所弥合的差距是一个硬件采购决策,而不是模型选型决策。
当这个推荐有误时
以下这些真实情况下,你不应选择 DeepSeek V4 Pro:
• 您需要经独立确认的前沿推理能力。 AA Index 53 处于中游水平——Kimi K3(60)和 GPT-5.6 Terra(57)领先且已验证。如果您的决策取决于实测上限,供应商卡片不会改变这一点。
• 在有人重新运行 DeepSWE 62.7 之前,你就把生产押注在它上面。 一次发布中 12.8→62.7 的跃升是断言,而非事实。等待中立的复现——87.9 与 78.7 的 Terminal-Bench 差距就显示了可能发现的情形。
• 你的工作负载是沙盒化的终端自动化或 Excel 财务建模。 Vals AI 表示,这些正是模型难以应对之处,与任何供应商评分无关。
• 你正在基于 CyberGym 83.3 做出网络安全决策。这就是 DeepSeek 在用自己的基准测试自己的模型——安全厂商若依据这个数字采购,买到的就是未经审计的数据。
• 你光凭 271 tokens/s 这个数字就要买 H20。那个数字是单技术栈、批量大小为 1 的自报基准——很有前景,但尚未复现,而且只是成本曲线上的一个点,该曲线还包含利用率、功耗以及你实际要运行的任何服务技术栈。
最重要的一点
DeepSeek V4 Pro 0813 是一款真正的顶尖模型,其厂商评分卡表现超越了它的独立评测记录。0813 版本将文本预览变成了一个严肃的智能体竞争者——我们已单独报道过该版本的发布——如果你想今天就评估它,它可以在 OrcaRouter 上以 DeepSeek 的标价提供一个兼容 OpenAI 的密钥,如果服务商卡顿则自动故障转移。只需按照本文拆分评分卡的方式来解读:独立检查(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 运行)是今天你可以信赖的;87.9 和 62.7 则是你在依赖它们之前应该验证的。同样的严谨态度现在延伸到了服务层面:LMSYS 和蚂蚁集团在 H20 上实现的 271 输出 tokens/秒是我们拥有的最佳吞吐量数据,但在中立机构运行确认之前,这仍然是他们单方面的说法。购买它的理由是性价比和 100 万 token 的上下文长度,而不是那些无法复现的头条数字。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
