
DeepSeek V4 Pro 基准测试:完整的 0813 评分卡、全部独立检查,以及尚未有人验证的部分
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
一句话回答:按照 DeepSeek 自己的数据,DeepSeek V4 Pro 交出了一份确实亮眼的智能体成绩单——Terminal-Bench 2.1 为 87.9,DeepSWE 为 62.7,CyberGym 为 83.3——但几乎每个头条数字都来自厂商自报,独立视角下的图景则冷静得多。 Artificial Analysis 在智能指数上给官方 0813 版本打出 53 分,与 GLM-5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分;Vals AI 将其排在第 12 位,低于上一代 GPT-5.5。本文是此前无人写过的完整汇总:完整的 0813 成绩单、技术报告中的扩展编码测试集、目前已有的全部独立验证,以及一份诚实的账目,标明哪些数字已被复现、哪些仍只是 DeepSeek 的单方说法。
官方0813成绩单——全部都是DeepSeek自己的数据
DeepSeek 的官方公告(API 文档,news260813,2026年8月13日)报告了针对四月预览版的生产构建。本节中的所有数据均为供应商报告——截至2026年8月16日,尚未有任何数据被独立复现:
• Terminal-Bench 2.1 — 87.9(预览:72.1)。
• DeepSWE — 62.7(预览版:12.8)——约 5 倍的跃升,这是该卡上最引人注目的说法。
• CyberGym — 83.3(预览版:52.7)。
• Humanity's Last Exam——无工具时42.7,有工具时60.0(预览:37.7 / 48.2)。
• Toolathlon-Verified — 74.1(预览:55.9)。
• AutomationBench(公开版)— 31.8(预览版:12.8)。
• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(预览:41.8 / 31.1)。
• NL2Repo — 61.5(预览版:38.5)。
• Agents' Last Exam — 25.7(预览:16.5)。
值得注意的模式在于收益集中之处:智能体与网络安全基准测试。那正是实验室在推广智能体模型时会拿出的成绩单——也正是你在投入生产资金之前需要中立复测的那一种。

DeepSeek技术报告中的扩展编码集
除了智能体卡片之外,DeepSeek 技术报告(由 BenchLM 于 2026 年 8 月 16 日汇总)还增加了更广泛的编码和长上下文数据集。同样由供应商报告,并被 BenchLM 标记为“Provider exact”——没有独立测试:
• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。
• LiveCodeBench Pass@1-CoT — 93.5% — BenchLM 目录中经过验证的最佳成绩。
• Codeforces 积分 — 3206——也是目录中已验证的最佳成绩。
• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。
• MRCR 1M — 83.5%;CorpusQA 1M — 62.0%——这两项均为1M token检索上的目录最佳成绩,对于宣称拥有1M token上下文窗口的模型来说至关重要。
• GPQA Diamond — 92.8,SciCode — 49.2,Long-Context Recall — 75.3(列于 OrcaRouter 的模型页面)。
独立评估者实际衡量什么
三个独立信源对DeepSeek V4 Pro进行了实测,其结论均低于厂商标称。
• Artificial Analysis Intelligence Index — 53(SCMP 2026年8月报道;OrcaRouter 的模型页面显示为 53.2,在 132 个中排名第 20)。与 GLM-5.2 持平,落后 GPT-5.6 Terra 4 分,落后 Kimi K3 7 分。
• Artificial Analysis Coding — 68.8,在130个中排名第24(据OrcaRouter的模型页面)。
• Vals AI 指数排名第 12,落后于上一代 GPT-5.5,也远远落后于 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自身的测试指出了两个具体的弱点:在沙盒终端环境中完成任务,以及在 Excel 电子表格中构建复杂的财务模型。
• Vibe Code Bench v1.1 — 49.93(Vals AI,该组中唯一一次“Benchmark exact”独立运行)。
诚实的账本——哪些已被复现,哪些仍只是 DeepSeek 的一面之词
这正是基准测试文章所要提供的部分,也是相较于发布报道,您应为此页面添加书签的原因。将每个分数归入以下两个类别之一:
• 独立来源:AA Intelligence Index 53 / 53.2,AA Coding 68.8,Vals AI 排名第12位,Vibe Code Bench 49.93 —— 以及另一个独立来源的 Terminal-Bench 2.1 运行结果 78.7,该结果与 DeepSeek 的 87.9 并排显示在 OrcaRouter 的模型页面上。厂商数据与独立运行结果之间这九分的差距,是本页最重要的一项数据:这就是可复现性差距的量化体现。
• 仅厂商报告,未经独立复现:上述官方 0813 卡片中的每一项数据(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整个扩展编码集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek 自己的文档将 Terminal-Bench 2.1 的这项数据标记为“provider run”。
这样解读的话,故事是自洽的:DeepSeek V4 Pro 确实是一款处于中游的前沿模型——AA 53,排名在十几到二十几名——其厂商评分卡声称在智能体和编码性能上接近顶尖水平。这两种说法都属实,而且并不冲突;一个是实测的,另一个是宣称的。

记分卡的费用
DeepSeek V4 Pro 是总参数 1.6T、激活参数 49B 的 MoE 旗舰模型,支持 100 万 token 上下文窗口和 384K 最大输出。在 OrcaRouter 上,它按 DeepSeek 官方标价出售,零加价:每百万输入 token $0.435,每百万输出 $0.87(缓存读取每百万 $0.060)。以上价格依据 2026 年 8 月 15 日查核的目录,并已在实时模型页面上确认。以这个价格计算,单点性价比是该模型最有力的论据:它大约只有独立指数上相近得分模型输出价格的十分之一,因此你以中端价格买到的是一份——如果厂商宣称属实——接近顶级的成绩单。有一点需要注意:DeepSeek 已宣布自北京时间 8 月 17 日起实行峰谷定价方案(谷时价格为峰时的 50%),因此价格可能会变动——本文中的数字是截至本文发布时的实时挂牌价。

当此推荐有误时。
以下这些真实情况下,你不应选择 DeepSeek V4 Pro:
• 您需要经独立确认的前沿推理能力。 AA Index 53 处于中游水平——Kimi K3(60)和 GPT-5.6 Terra(57)领先且已验证。如果您的决策取决于实测上限,供应商卡片不会改变这一点。
• 在有人重新运行 DeepSWE 62.7 之前,你就把生产押注在它上面。 一次发布中 12.8→62.7 的跃升是断言,而非事实。等待中立的复现——87.9 与 78.7 的 Terminal-Bench 差距就显示了可能发现的情形。
• 你的工作负载是沙盒化的终端自动化或 Excel 财务建模。 Vals AI 表示,这些正是模型难以应对之处,与任何供应商评分无关。
• 你正基于 CyberGym 83.3 做出网络安全决策。这是 DeepSeek 在自己的基准上测试自己的模型——安全厂商依据这个数字采购,买到的只是未经审计的数据。
底线
DeepSeek V4 Pro 0813 是一款真正的前沿模型,其厂商评分卡表现优于独立评测记录。0813 版本将文本预览变成了一个严肃的智能体竞争者——我们已单独报道过该版本本身——如果你今天想评估它,只需在 OrcaRouter 上使用一个兼容 OpenAI 的密钥,按 DeepSeek 的标价即可,若供应商停滞则会自动故障转移。只需按照本文拆分评分卡的方式来解读:独立检查(AA 53、Vals 第 12 名、Terminal-Bench 78.7 分)是今天可以信赖的;87.9 和 62.7 这些分数则是你在基于它们构建之前需要验证的。购买它是为了性价比和 100 万 token 的上下文,而不是那些未被复现的头条数字。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
