文章「DeepSeek V4 Pro 基準測試」的主視覺標題卡:一個帶有大型儀表的記分板,標題為「DeepSeek V4 Pro — 基準測試記分卡」,副標題為「官方 0813 分數、獨立驗證,以及尚未重現的結果」,以及顯示「TERMINAL-BENCH 2.1: 87.9」、「DEEPSWE: 62.7」、「AA INDEX: 53」、「1M CONTEXT」的標籤。OrcaRouter 標誌合成於右下角。
Guides & Insights

DeepSeek V4 Pro 基準測試:完整 0813 成績單、每一項獨立檢查,以及尚無人驗證的真相

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

一句話回答:DeepSeek V4 ProDeepSeek 自家的數據上確實展現出亮眼的智能體(agentic)成績——Terminal-Bench 2.1 為 87.9、DeepSWE 為 62.7、CyberGym 為 83.3——但幾乎每一個頭條數字都是廠商自行呈報,獨立驗證的畫面則冷淡得多。 Artificial Analysis 將官方 0813 版本在其 Intelligence Index 上評為 53 分,與 GLM-5.2 持平,落後 GPT-5.6 Terra 四分、落後 Kimi K3 七分;Vals AI 則將其排在第 12 名,低於前一代的 GPT-5.5。本文是別人尚未寫過的完整彙整:完整的 0813 成績單、技術報告中的延伸程式碼評測集、所有現存的獨立檢驗,以及一份誠實的帳目,清楚列出哪些數字已被重現、哪些仍只是 DeepSeek 的一家之言。

官方0813成績單 — DeepSeek自己的數字,全部都是

DeepSeek的官方公告(API文件,news260813,2026年8月13日)報告了針對四月預覽版的生產版本。本節中的所有數據均為廠商報告——截至2026年8月16日,尚無任何數據被獨立重現:

Terminal-Bench 2.1 — 87.9(預覽:72.1)。

DeepSWE — 62.7(預覽:12.8)——約 5 倍的躍升,是這張規格表上最驚人的一項數據。

CyberGym — 83.3(預覽:52.7)。

Humanity's Last Exam — 未使用工具時 42.7,使用工具時 60.0(預覽:37.7 / 48.2)。

Toolathlon 認證 — 74.1(預覽:55.9)。

AutomationBench(公開)— 31.8(預覽:12.8)。

DSBench-FullStack — 71.1;DSBench-Hard — 67.2(預覽:41.8 / 31.1)。

NL2Repo — 61.5(預覽:38.5)。

Agents' Last Exam — 25.7(預覽:16.5)。

值得注意的模式在於效益集中的地方:代理型與網路安全基準測試。這正是實驗室想要宣傳代理模型時會產出的成績單——也正是你在投入生產經費之前,需要中立複測的那種成績單。

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

DeepSeek 技術報告中的擴展編碼集

除了 agentic 卡片,DeepSeek 技術報告(由 BenchLM 於 2026 年 8 月 16 日彙總)還增加了更廣泛的編碼與長上下文測試集。同樣由供應商報告,並被 BenchLM 標記為「供應商精確」——沒有獨立測試:

SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。

LiveCodeBench Pass@1-CoT — 93.5%——是BenchLM目錄中驗證過的最佳結果。

Codeforces 積分 — 3206 — 也是目錄中驗證過的最佳記錄。

BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。

MRCR 1M — 83.5%; CorpusQA 1M — 62.0% —— 兩者在 1M token 檢索上均為目錄最佳,這對一款主打 1M token 上下文視窗的模型來說至關重要。

GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(列於 OrcaRouter 的模型頁面)。

獨立評估者實際衡量的內容

三個獨立來源已對 DeepSeek V4 Pro 進行了測試,其評價集中低於廠商規格表:

Artificial Analysis Intelligence Index — 53(SCMP的報導,2026年8月;OrcaRouter的模型頁面顯示53.2,在132個模型中排名第20)。與GLM-5.2持平,落後GPT-5.6 Terra四分,落後Kimi K3七分。

Artificial Analysis Coding — 68.8,在130個中排名第24(根據OrcaRouter的模型頁面)。

Vals AI Index — 第12名,落後於前一代的 GPT-5.5,且遠遜於 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自己的測試指出了兩個具體的弱點:在沙盒終端環境中完成任務,以及在 Excel 試算表中建立複雜的財務模型。

Vibe Code Bench v1.1 — 49.93(Vals AI,該集合中唯一「Benchmark exact」的獨立執行)。

誠實的帳本 — 哪些已被複現,哪些仍只是DeepSeek的一面之詞

這是基準測試文章存在所要提供的部分,也是您應將此頁面加入書籤而非發佈報導的原因。將每個分數歸入兩個類別之一:

獨立來源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12 位、Vibe Code Bench 49.93——以及另一獨立來源的 Terminal-Bench 2.1 測試結果為78.7,與 DeepSeek 的 87.9 並列於 OrcaRouter 的模型頁面。廠商數字與獨立測試結果之間的九分差距,是本頁最重要的一項數據:它正是可複現性差距的量化呈現。

僅廠商回報,未經獨立重現:上述官方 0813 卡片中的每一項數據(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整個擴展編碼集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek 自己的文件將 Terminal-Bench 2.1 的數據標示為「供應商執行」。

照這樣讀,故事就前後一致:DeepSeek V4 Pro 是真正的中段班前沿模型——AA 53,排名在十幾到二十幾名——而供應商評分卡宣稱其代理與程式編寫效能接近頂尖。兩項陳述皆為真,且並不衝突;一項是實測,另一項是宣稱。

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

計分卡的費用是多少

DeepSeek V4 Pro 是總參數量 1.6T、活躍參數量 49B 的 MoE 旗艦模型,具備 1M token 的上下文視窗與 384K 的最大輸出長度。在 OrcaRouter 上,它按 DeepSeek 的官方牌價販售,零加價:每百萬輸入 token 0.435 美元,每百萬輸出 token 0.87 美元(快取讀取每百萬 token 0.060 美元),以上價格係根據 2026 年 8 月 15 日查閱的目錄,並已在即時模型頁面上確認。以該費率計算,每分價格的算式是支持此模型最有力的論據:其輸出價格大約只有獨立指數上分數相近之模型的十分之一,因此你付出的是中階價格,拿到的成績單——若廠商的宣稱屬實——卻接近頂尖。一個提醒:DeepSeek 已宣布自 8 月 17 日(北京時間)起實施尖峰/離峰定價方案(離峰價格為尖峰的 50%),因此費率可能變動——本文所列數字為撰稿當時的即時牌價。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

當此建議有誤時

老實說,這些情況下你不應該選擇 DeepSeek V4 Pro:

你需要經獨立確認的前沿推理。 AA Index 53 屬於中段班——Kimi K3(60)和 GPT-5.6 Terra(57)領先且已得到驗證。如果你的決策取決於測得的天花板,供應商卡片並不會改變這一點。

你在別人重新驗證之前,就把生產賭在 DeepSWE 62.7 上。 單一版本從 12.8 跳到 62.7 是宣稱,不是事實。等待中立的複現——Terminal-Bench 的 87.9 對 78.7 差距,正說明了可能發現的情況。

您的工作負載是沙盒化的終端自動化或 Excel 財務建模。 Vals AI 表示,這些正是模型會遇到困難的地方,且與任何廠商評分無關。

你正在針對 CyberGym 83.3 做出網路安全決策。這代表 DeepSeek 用自己的基準測試自己的模型——安全廠商若依據這個數字採購,等於是在購買未經稽核的數據。

底線

DeepSeek V4 Pro 0813 是一款真正的頂尖模型,其廠商評分卡上的成績超越了獨立評測紀錄。0813 版本把一個文字預覽版變成了認真的代理型競爭者——我們已另行報導過該版本本身——如果你今天想評估它,它就是 OrcaRouter 上的一個 OpenAI 相容金鑰,按 DeepSeek 的牌價計費,若供應商回應停滯便會自動故障轉移。只要按照本文拆分評分卡的方式來解讀:獨立檢核(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 成績)是你今天可以信賴的;那 87.9 和 62.7 則是你應該在據以建置之前先行驗證的數字。買它是為了性價比和 100 萬 token 的上下文長度,而不是為了那些未經複現的標題數字。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube