
DeepSeek V4 Pro 基準測試:完整 0813 成績單、每一項獨立檢查,以及尚無人驗證的真相
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 143 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 50 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
一句話總結:DeepSeek V4 Pro 在 DeepSeek 自家數據上繳出了一張確實亮眼的代理能力評分卡——Terminal-Bench 2.1 為 87.9、DeepSWE 為 62.7、CyberGym 為 83.3——但幾乎每個頭條數字都出自廠商自報,獨立檢驗的圖景則平淡得多。 Artificial Analysis 在其 Intelligence Index 上將官方 0813 版評為 53 分,與 GLM 5.2 持平,落後 GPT-5.6 Terra 4 分、落後 Kimi K3 7 分;Vals AI 則將其排在第 12 名,低於上一代 GPT-5.5。本文就是那份尚無人寫過的完整彙整:完整的 0813 評分卡、技術報告中的延伸程式碼測試集、所有現存的獨立檢驗,以及一份誠實的帳目,列出哪些數字已被重現、哪些仍然只是 DeepSeek 的一面之詞。評分卡公布一週後,服務端的樣貌也開始成形——2026 年 8 月 19 日,LMSYS 與 Ant Group 發表了一套 H20 伺服堆疊,在 batch size 為 1 時可達每秒 271 個輸出 token;這部分在下方有專節介紹,並與本頁所有廠商端數據一樣,在有人重現之前一概列為廠商自報。
官方 0813 成績單 — DeepSeek 自己的數據,全部
DeepSeek 官方公告(API 文件、news260813,2026 年 8 月 13 日)報告了生產版本與 4 月預覽版的對比結果。本節中的所有數據均為廠商回報——截至 2026 年 8 月 16 日,尚無任何數據經獨立重現:
• Terminal-Bench 2.1 — 87.9(預覽:72.1)。
• DeepSWE — 62.7(預覽:12.8)——約 5 倍的躍升,是這張規格表上最驚人的一項數據。
• CyberGym — 83.3(預覽:52.7)。
• Humanity's Last Exam — 未使用工具時 42.7,使用工具時 60.0(預覽:37.7 / 48.2)。
• Toolathlon 認證 — 74.1(預覽:55.9)。
• AutomationBench(公開)— 31.8(預覽:12.8)。
• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(預覽:41.8 / 31.1)。
• NL2Repo — 61.5(預覽:38.5)。
• Agents' Last Exam — 25.7(預覽:16.5)。
值得注意的模式在於效益集中的地方:代理型與網路安全基準測試。這正是實驗室想要宣傳代理模型時會產出的成績單——也正是你在投入生產經費之前,需要中立複測的那種成績單。

DeepSeek 技術報告中的擴展編碼集
除了代理式卡片之外,DeepSeek 技術報告(由 BenchLM 於 2026 年 8 月 16 日彙整)還增加了更廣泛的程式碼與長上下文測試集。同樣為廠商回報,且被 BenchLM 標記為「Provider exact」——並無獨立測試:
• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。
• LiveCodeBench Pass@1-CoT — 93.5%——是BenchLM目錄中驗證過的最佳結果。
• Codeforces 積分 — 3206 — 也是目錄中驗證過的最佳記錄。
• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% —— 兩者在 1M token 檢索上均為目錄最佳,這對一款主打 1M token 上下文視窗的模型來說至關重要。
• GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(列於 OrcaRouter 的模型頁面)。
獨立評估者實際衡量的內容
三個獨立來源已對 DeepSeek V4 Pro 進行了測試,其評價集中低於廠商規格表:
• Artificial Analysis Intelligence Index — 53(SCMP 的報導,2026 年 8 月;OrcaRouter 的模型頁面顯示 53.2,在 132 個中排名第 20)。與 GLM 5.2 相當,落後 GPT-5.6 Terra 四分,落後 Kimi K3 七分。
• Artificial Analysis Coding — 68.8,在130個中排名第24(根據OrcaRouter的模型頁面)。
• Vals AI Index — 第12名,落後於前一代的 GPT-5.5,且遠遜於 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自己的測試指出了兩個具體的弱點:在沙盒終端環境中完成任務,以及在 Excel 試算表中建立複雜的財務模型。
• Vibe Code Bench v1.1 — 49.93(Vals AI,該集合中唯一「Benchmark exact」的獨立執行)。
誠實的帳本 — 已重現的內容 vs 仍只是 DeepSeek 的片面之詞
這是基準測試文章存在所要提供的部分,也是您應將此頁面加入書籤而非發佈報導的原因。將每個分數歸入兩個類別之一:
• 獨立來源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12、Vibe Code Bench 49.93——以及一次另行來源的 Terminal-Bench 2.1 執行結果為 78.7,與 DeepSeek 在 OrcaRouter 的模型頁面上的 87.9 並列。供應商的數字與獨立執行結果之間的九分差距,是此頁面上最重要的一項數據:這就是量化後的可重現性差距。
• 僅由供應商回報,未經獨立重現:上述官方 0813 卡片中的每一項數字(Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, HLE 42.7/60.0, Toolathlon 74.1, AutomationBench 31.8, DSBench 71.1/67.2, NL2Repo 61.5, Agents' Last Exam 25.7)以及整個擴展編碼集(SWE-bench Verified 80.6, LiveCodeBench 93.5, Codeforces 3206, BrowseComp 83.4, MRCR 83.5, CorpusQA 62.0, GPQA Diamond 92.8)。DeepSeek 自己的文件將 Terminal-Bench 2.1 的數字標示為「供應商執行」。
照這樣讀,故事就前後一致:DeepSeek V4 Pro 是真正的中段班前沿模型——AA 53,排名在十幾到二十幾名——而供應商評分卡宣稱其代理與程式編寫效能接近頂尖。兩項陳述皆為真,且並不衝突;一項是實測,另一項是宣稱。

計分卡的費用是多少
DeepSeek V4 Pro 是總參數 1.6T/活躍參數 49B 的 MoE 旗艦模型,具備 100 萬 token 的上下文視窗與 384K 最大輸出。在 OrcaRouter 上,以 DeepSeek 的官方定價販售、零加價:每百萬輸入 token 0.435 美元,每百萬輸出 token 0.87 美元(快取讀取每百萬 0.060 美元),此價格依據 2026 年 8 月 15 日查閱的目錄,並已在模型即時頁面上確認。以該費率計算,每分價格的數學表現是這款模型最有力的論點:其輸出價格大約是獨立指數中與其得分相近模型的十分之一,因此你等於是用中階價格換取一份——若廠商的宣稱屬實——接近頂尖的成績單。一個需要留意的警示:DeepSeek 已宣布自北京時間 8 月 17 日起實施尖峰/離峰定價方案(離峰價格為尖峰的 50%),因此費率可能會變動——本文中的數字為截至撰文當下的即時牌價。

在 H20 上服務 DeepSeek V4 Pro:每秒 271 個輸出 tokens
基準測試評量的是模型知道什麼;服務數字評量的則是你以多低的成本就能讓它思考。2026年8月19日,LMSYS——Chatbot Arena背後的組織——與螞蟻集團的開源團隊發布了針對0813版本的第一份嚴肅服務工作:一套建構在SGLang(LMSYS維護的開源引擎)之上的「情境特定服務堆疊」。最引人注目的數字是在NVIDIA H20上、批次大小為1時的271個輸出token/秒,團隊表示這約為B300的1.42倍——而這是在一款沒有原生FP4 Tensor Core的晶片上達成的。這些都是LMSYS與螞蟻集團自行測量的結果,發布在他們的部落格與X上;其中沒有任何一項經獨立重現。
堆疊其餘的數字,全部由 LMSYS 和 Ant Group 在各自的堆疊上自行申報:
• 解碼延遲 — 一個「最佳化的 DSpark」元件在批次大小為 1 時,可將每個輸出 token 的產生時間(TPOT)降低 74.8%–78.0%。
• 預填充——100萬個token的預填充在43.7秒內完成,預填充吞吐量幾何平均提升36.5%。
• KV cache — 團隊稱此方案為「Humming MXFP4AFP8 + Online C128」,可將全量 token 的 KV cache 容量擴展 10.14 倍,正是讓 1M token 的代理工作負載在此類矽晶片上得以實際應用的關鍵。
• 每GPU解碼——在4K上下文環境下,每GPU解碼吞吐量從319.9提升至703.2 tokens/s/GPU,提升了2.20倍。
在據此估算機群規模之前,請先閱讀這些注意事項。批次大小 1 屬於單串流(single-stream)模式——這是互動式代理或聊天會遭遇的情境,而不是高併發 API——而 1.42×-off-B300 的比較是 LMSYS 提出的比率,卻未公布 B300 的絕對 tokens/s,因此這個差距只是宣稱,無法驗證。這項結果衡量的也是整個軟體堆疊,而非晶片本身:這些增益來自 SGLang 層級的優化;若無此優化,該硬體對於總參數量 1.6T 的 MoE 模型來說會顯得效能不足。作為對照,OrcaRouter 的即時模型頁面透過共享 API 端點測得 DeepSeek V4 Pro 的輸出速度為 80.8 tokens/s——而 H20 的數字則是在專用堆疊上的單串流基準測試,兩者數字不同,代表的意義也不同。
如果您的負載是透過 API 提供服務的,這些都不會改變您呼叫模型的方式:DeepSeek V4 Pro 是 OrcaRouter 上的一個 OpenAI 相容金鑰,以 DeepSeek 的定價計費,並在供應商停滯時自動容錯移轉。H20 的數字對正在權衡自架 H20 機群與付費使用 API 的團隊最為重要——LMSYS 與 Ant Group 的工作所填補的差距是硬體採購決策,而非模型選擇決策。
當這項推薦錯誤時
老實說,這些情況下你不應該選擇 DeepSeek V4 Pro:
• 你需要經獨立確認的前沿推理。 AA Index 53 屬於中段班——Kimi K3(60)和 GPT-5.6 Terra(57)領先且已得到驗證。如果你的決策取決於測得的天花板,供應商卡片並不會改變這一點。
• 你在別人重新驗證之前,就把生產賭在 DeepSWE 62.7 上。 單一版本從 12.8 跳到 62.7 是宣稱,不是事實。等待中立的複現——Terminal-Bench 的 87.9 對 78.7 差距,正說明了可能發現的情況。
• 您的工作負載是沙盒化的終端自動化或 Excel 財務建模。 Vals AI 表示,這些正是模型會遇到困難的地方,且與任何廠商評分無關。
• 你正在依據 CyberGym 83.3 做出網路安全決策。這是 DeepSeek 在自己的基準測試自己的模型——資安廠商依據這個數字採購,等於購買未經審計的數據。
• 你光憑 271 tokens/s 這個數字就要買 H20。那個數字是單一堆疊、自我報告的基準測試結果,批次大小為 1——前景可期,但未被重現,而且只是成本曲線上的一個點;這條曲線還包括利用率、功耗,以及任何你實際會運行的服務堆疊。
底線
DeepSeek V4 Pro 0813 是真正的尖端模型,其廠商評分卡表現勝過其獨立評測紀錄。0813 版本將文字預覽轉變為具實力的代理型競爭者——我們已另行報導該版本的發布——如果您今天想評估它,它在 OrcaRouter 上以 DeepSeek 的牌價提供一個 OpenAI 相容的金鑰,若供應商停滯則自動故障轉移。只需按照本文拆分評分卡的方式閱讀:獨立檢查(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 成績)是您今天可以信賴的;87.9 和 62.7 的數據則應在您依賴它們建構之前先行驗證。同樣的嚴謹態度現在延伸至服務端:LMSYS 和螞蟻集團在 H20 上達到的 271 tokens/s 輸出是我們目前最佳的吞吐量數據,但在中立測試確認之前,這仍是他們的說法。您應基於性價比和 1M token 的上下文來購買它,而不是那些未經複現的頭條數字。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
