文章「DeepSeek V4 Pro 基準測試」的主視覺標題卡:一個帶有大型儀表的記分板,標題為「DeepSeek V4 Pro — 基準測試記分卡」,副標題為「官方 0813 分數、獨立驗證,以及尚未重現的結果」,以及顯示「TERMINAL-BENCH 2.1: 87.9」、「DEEPSWE: 62.7」、「AA INDEX: 53」、「1M CONTEXT」的標籤。OrcaRouter 標誌合成於右下角。
Guides & Insights

DeepSeek V4 Pro 基準測試:完整 0813 成績單、每一項獨立檢查,以及尚無人驗證的真相

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一句話總結:DeepSeek V4 Pro 在 Deep​Seek 自家數據上繳出了一張確實亮眼的代理能力評分卡——Terminal-Bench 2.1 為 87.9、DeepSWE 為 62.7、CyberGym 為 83.3——但幾乎每個頭條數字都出自廠商自報,獨立檢驗的圖景則平淡得多。 Artificial Analysis 在其 Intelligence Index 上將官方 0813 版評為 53 分,與 GLM 5.2 持平,落後 GPT-5.6 Terra 4 分、落後 Kimi K3 7 分;Vals AI 則將其排在第 12 名,低於上一代 GPT-5.5。本文就是那份尚無人寫過的完整彙整:完整的 0813 評分卡、技術報告中的延伸程式碼測試集、所有現存的獨立檢驗,以及一份誠實的帳目,列出哪些數字已被重現、哪些仍然只是 Deep​Seek 的一面之詞。評分卡公布一週後,服務端的樣貌也開始成形——2026 年 8 月 19 日,LMSYS 與 Ant Group 發表了一套 H20 伺服堆疊,在 batch size 為 1 時可達每秒 271 個輸出 token;這部分在下方有專節介紹,並與本頁所有廠商端數據一樣,在有人重現之前一概列為廠商自報。

官方 0813 成績單 — Deep​Seek 自己的數據,全部

Deep​Seek 官方公告(API 文件、news260813,2026 年 8 月 13 日)報告了生產版本與 4 月預覽版的對比結果。本節中的所有數據均為廠商回報——截至 2026 年 8 月 16 日,尚無任何數據經獨立重現:

• Terminal-Bench 2.1 — 87.9(預覽:72.1)。

• DeepSWE — 62.7(預覽:12.8)——約 5 倍的躍升,是這張規格表上最驚人的一項數據。

• CyberGym — 83.3(預覽:52.7)。

• Humanity's Last Exam — 未使用工具時 42.7,使用工具時 60.0(預覽:37.7 / 48.2)。

• Toolathlon 認證 — 74.1(預覽:55.9)。

• AutomationBench(公開)— 31.8(預覽:12.8)。

• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(預覽:41.8 / 31.1)。

• NL2Repo — 61.5(預覽:38.5)。

• Agents' Last Exam — 25.7(預覽:16.5)。

值得注意的模式在於效益集中的地方:代理型與網路安全基準測試。這正是實驗室想要宣傳代理模型時會產出的成績單——也正是你在投入生產經費之前,需要中立複測的那種成績單。

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

DeepSeek 技術報告中的擴展編碼集

除了代理式卡片之外,Deep​Seek 技術報告(由 BenchLM 於 2026 年 8 月 16 日彙整)還增加了更廣泛的程式碼與長上下文測試集。同樣為廠商回報,且被 BenchLM 標記為「Provider exact」——並無獨立測試:

• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。

• LiveCodeBench Pass@1-CoT — 93.5%——是BenchLM目錄中驗證過的最佳結果。

• Codeforces 積分 — 3206 — 也是目錄中驗證過的最佳記錄。

• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% —— 兩者在 1M token 檢索上均為目錄最佳,這對一款主打 1M token 上下文視窗的模型來說至關重要。

• GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(列於 OrcaRouter 的模型頁面)。

獨立評估者實際衡量的內容

三個獨立來源已對 DeepSeek V4 Pro 進行了測試,其評價集中低於廠商規格表:

• Artificial Analysis Intelligence Index — 53(SCMP 的報導,2026 年 8 月;OrcaRouter 的模型頁面顯示 53.2,在 132 個中排名第 20)。與 GLM 5.2 相當,落後 GPT-5.6 Terra 四分,落後 Kimi K3 七分。

• Artificial Analysis Coding — 68.8,在130個中排名第24(根據OrcaRouter的模型頁面)。

• Vals AI Index — 第12名,落後於前一代的 GPT-5.5,且遠遜於 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自己的測試指出了兩個具體的弱點:在沙盒終端環境中完成任務,以及在 Excel 試算表中建立複雜的財務模型。

• Vibe Code Bench v1.1 — 49.93(Vals AI,該集合中唯一「Benchmark exact」的獨立執行)。

誠實的帳本 — 已重現的內容 vs 仍只是 DeepSeek 的片面之詞

這是基準測試文章存在所要提供的部分,也是您應將此頁面加入書籤而非發佈報導的原因。將每個分數歸入兩個類別之一:

• 獨立來源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12、Vibe Code Bench 49.93——以及一次另行來源的 Terminal-Bench 2.1 執行結果為 78.7,與 Deep​Seek 在 OrcaRouter 的模型頁面上的 87.9 並列。供應商的數字與獨立執行結果之間的九分差距,是此頁面上最重要的一項數據:這就是量化後的可重現性差距。

• 僅由供應商回報,未經獨立重現:上述官方 0813 卡片中的每一項數字(Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7)以及整個擴展編碼集(SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8)。Deep​Seek 自己的文件將 Terminal-Bench 2.1 的數字標示為「供應商執行」。

照這樣讀,故事就前後一致:DeepSeek V4 Pro 是真正的中段班前沿模型——AA 53,排名在十幾到二十幾名——而供應商評分卡宣稱其代理與程式編寫效能接近頂尖。兩項陳述皆為真,且並不衝突;一項是實測,另一項是宣稱。

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

計分卡的費用是多少

DeepSeek V4 Pro 是總參數 1.6T/活躍參數 49B 的 MoE 旗艦模型,具備 100 萬 token 的上下文視窗與 384K 最大輸出。在 OrcaRouter 上,以 Deep​Seek 的官方定價販售、零加價:每百萬輸入 token 0.435 美元,每百萬輸出 token 0.87 美元(快取讀取每百萬 0.060 美元),此價格依據 2026 年 8 月 15 日查閱的目錄,並已在模型即時頁面上確認。以該費率計算,每分價格的數學表現是這款模型最有力的論點:其輸出價格大約是獨立指數中與其得分相近模型的十分之一,因此你等於是用中階價格換取一份——若廠商的宣稱屬實——接近頂尖的成績單。一個需要留意的警示:Deep​Seek 已宣布自北京時間 8 月 17 日起實施尖峰/離峰定價方案(離峰價格為尖峰的 50%),因此費率可能會變動——本文中的數字為截至撰文當下的即時牌價。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

在 H20 上服務 DeepSeek V4 Pro:每秒 271 個輸出 tokens

基準測試評量的是模型知道什麼;服務數字評量的則是你以多低的成本就能讓它思考。2026年8月19日,LMSYS——Chatbot Arena背後的組織——與螞蟻集團的開源團隊發布了針對0813版本的第一份嚴肅服務工作:一套建構在SGLang(LMSYS維護的開源引擎)之上的「情境特定服務堆疊」。最引人注目的數字是在NVIDIA H20上、批次大小為1時的271個輸出token/秒,團隊表示這約為B300的1.42倍——而這是在一款沒有原生FP4 Tensor Core的晶片上達成的。這些都是LMSYS與螞蟻集團自行測量的結果,發布在他們的部落格與X上;其中沒有任何一項經獨立重現。

堆疊其餘的數字,全部由 LMSYS 和 Ant Group 在各自的堆疊上自行申報:

• 解碼延遲 — 一個「最佳化的 DSpark」元件在批次大小為 1 時,可將每個輸出 token 的產生時間(TPOT)降低 74.8%–78.0%。

• 預填充——100萬個token的預填充在43.7秒內完成,預填充吞吐量幾何平均提升36.5%。

• KV cache — 團隊稱此方案為「Humming MXFP4AFP8 + Online C128」,可將全量 token 的 KV cache 容量擴展 10.14 倍,正是讓 1M token 的代理工作負載在此類矽晶片上得以實際應用的關鍵。

• 每GPU解碼——在4K上下文環境下,每GPU解碼吞吐量從319.9提升至703.2 tokens/s/GPU,提升了2.20倍。

在據此估算機群規模之前,請先閱讀這些注意事項。批次大小 1 屬於單串流(single-stream)模式——這是互動式代理或聊天會遭遇的情境,而不是高併發 API——而 1.42×-off-B300 的比較是 LMSYS 提出的比率,卻未公布 B300 的絕對 tokens/s,因此這個差距只是宣稱,無法驗證。這項結果衡量的也是整個軟體堆疊,而非晶片本身:這些增益來自 SGLang 層級的優化;若無此優化,該硬體對於總參數量 1.6T 的 MoE 模型來說會顯得效能不足。作為對照,OrcaRouter 的即時模型頁面透過共享 API 端點測得 DeepSeek V4 Pro 的輸出速度為 80.8 tokens/s——而 H20 的數字則是在專用堆疊上的單串流基準測試,兩者數字不同,代表的意義也不同。

如果您的負載是透過 API 提供服務的,這些都不會改變您呼叫模型的方式:DeepSeek V4 Pro 是 OrcaRouter 上的一個 OpenAI 相容金鑰,以 Deep​Seek 的定價計費,並在供應商停滯時自動容錯移轉。H20 的數字對正在權衡自架 H20 機群與付費使用 API 的團隊最為重要——LMSYS 與 Ant Group 的工作所填補的差距是硬體採購決策,而非模型選擇決策。

當這項推薦錯誤時

老實說,這些情況下你不應該選擇 DeepSeek V4 Pro:

• 你需要經獨立確認的前沿推理。 AA Index 53 屬於中段班——Kimi K3(60)和 GPT-5.6 Terra(57)領先且已得到驗證。如果你的決策取決於測得的天花板,供應商卡片並不會改變這一點。

• 你在別人重新驗證之前,就把生產賭在 DeepSWE 62.7 上。 單一版本從 12.8 跳到 62.7 是宣稱,不是事實。等待中立的複現——Terminal-Bench 的 87.9 對 78.7 差距,正說明了可能發現的情況。

• 您的工作負載是沙盒化的終端自動化或 Excel 財務建模。 Vals AI 表示,這些正是模型會遇到困難的地方,且與任何廠商評分無關。

• 你正在依據 CyberGym 83.3 做出網路安全決策。這是 Deep​Seek 在自己的基準測試自己的模型——資安廠商依據這個數字採購,等於購買未經審計的數據。

• 你光憑 271 tokens/s 這個數字就要買 H20。那個數字是單一堆疊、自我報告的基準測試結果,批次大小為 1——前景可期,但未被重現,而且只是成本曲線上的一個點;這條曲線還包括利用率、功耗,以及任何你實際會運行的服務堆疊。

底線

DeepSeek V4 Pro 0813 是真正的尖端模型,其廠商評分卡表現勝過其獨立評測紀錄。0813 版本將文字預覽轉變為具實力的代理型競爭者——我們已另行報導該版本的發布——如果您今天想評估它,它在 OrcaRouter 上以 DeepSeek 的牌價提供一個 OpenAI 相容的金鑰,若供應商停滯則自動故障轉移。只需按照本文拆分評分卡的方式閱讀:獨立檢查(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 成績)是您今天可以信賴的;87.9 和 62.7 的數據則應在您依賴它們建構之前先行驗證。同樣的嚴謹態度現在延伸至服務端:LMSYS 和螞蟻集團在 H20 上達到的 271 tokens/s 輸出是我們目前最佳的吞吐量數據,但在中立測試確認之前,這仍是他們的說法。您應基於性價比和 1M token 的上下文來購買它,而不是那些未經複現的頭條數字。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新