
DeepSeek V4 Pro 基準測試:完整 0813 成績單、每一項獨立檢查,以及尚無人驗證的真相
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
一句話回答:DeepSeek V4 Pro 在 DeepSeek 自家的數據上確實展現出亮眼的智能體(agentic)成績——Terminal-Bench 2.1 為 87.9、DeepSWE 為 62.7、CyberGym 為 83.3——但幾乎每一個頭條數字都是廠商自行呈報,獨立驗證的畫面則冷淡得多。 Artificial Analysis 將官方 0813 版本在其 Intelligence Index 上評為 53 分,與 GLM-5.2 持平,落後 GPT-5.6 Terra 四分、落後 Kimi K3 七分;Vals AI 則將其排在第 12 名,低於前一代的 GPT-5.5。本文是別人尚未寫過的完整彙整:完整的 0813 成績單、技術報告中的延伸程式碼評測集、所有現存的獨立檢驗,以及一份誠實的帳目,清楚列出哪些數字已被重現、哪些仍只是 DeepSeek 的一家之言。
官方0813成績單 — DeepSeek自己的數字,全部都是
DeepSeek的官方公告(API文件,news260813,2026年8月13日)報告了針對四月預覽版的生產版本。本節中的所有數據均為廠商報告——截至2026年8月16日,尚無任何數據被獨立重現:
• Terminal-Bench 2.1 — 87.9(預覽:72.1)。
• DeepSWE — 62.7(預覽:12.8)——約 5 倍的躍升,是這張規格表上最驚人的一項數據。
• CyberGym — 83.3(預覽:52.7)。
• Humanity's Last Exam — 未使用工具時 42.7,使用工具時 60.0(預覽:37.7 / 48.2)。
• Toolathlon 認證 — 74.1(預覽:55.9)。
• AutomationBench(公開)— 31.8(預覽:12.8)。
• DSBench-FullStack — 71.1;DSBench-Hard — 67.2(預覽:41.8 / 31.1)。
• NL2Repo — 61.5(預覽:38.5)。
• Agents' Last Exam — 25.7(預覽:16.5)。
值得注意的模式在於效益集中的地方:代理型與網路安全基準測試。這正是實驗室想要宣傳代理模型時會產出的成績單——也正是你在投入生產經費之前,需要中立複測的那種成績單。

DeepSeek 技術報告中的擴展編碼集
除了 agentic 卡片,DeepSeek 技術報告(由 BenchLM 於 2026 年 8 月 16 日彙總)還增加了更廣泛的編碼與長上下文測試集。同樣由供應商報告,並被 BenchLM 標記為「供應商精確」——沒有獨立測試:
• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。
• LiveCodeBench Pass@1-CoT — 93.5%——是BenchLM目錄中驗證過的最佳結果。
• Codeforces 積分 — 3206 — 也是目錄中驗證過的最佳記錄。
• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% —— 兩者在 1M token 檢索上均為目錄最佳,這對一款主打 1M token 上下文視窗的模型來說至關重要。
• GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(列於 OrcaRouter 的模型頁面)。
獨立評估者實際衡量的內容
三個獨立來源已對 DeepSeek V4 Pro 進行了測試,其評價集中低於廠商規格表:
• Artificial Analysis Intelligence Index — 53(SCMP的報導,2026年8月;OrcaRouter的模型頁面顯示53.2,在132個模型中排名第20)。與GLM-5.2持平,落後GPT-5.6 Terra四分,落後Kimi K3七分。
• Artificial Analysis Coding — 68.8,在130個中排名第24(根據OrcaRouter的模型頁面)。
• Vals AI Index — 第12名,落後於前一代的 GPT-5.5,且遠遜於 Kimi K3 和 Claude Opus 5(SCMP)。Vals AI 自己的測試指出了兩個具體的弱點:在沙盒終端環境中完成任務,以及在 Excel 試算表中建立複雜的財務模型。
• Vibe Code Bench v1.1 — 49.93(Vals AI,該集合中唯一「Benchmark exact」的獨立執行)。
誠實的帳本 — 哪些已被複現,哪些仍只是DeepSeek的一面之詞
這是基準測試文章存在所要提供的部分,也是您應將此頁面加入書籤而非發佈報導的原因。將每個分數歸入兩個類別之一:
• 獨立來源:AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI 排名第 12 位、Vibe Code Bench 49.93——以及另一獨立來源的 Terminal-Bench 2.1 測試結果為78.7,與 DeepSeek 的 87.9 並列於 OrcaRouter 的模型頁面。廠商數字與獨立測試結果之間的九分差距,是本頁最重要的一項數據:它正是可複現性差距的量化呈現。
• 僅廠商回報,未經獨立重現:上述官方 0813 卡片中的每一項數據(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)以及整個擴展編碼集(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek 自己的文件將 Terminal-Bench 2.1 的數據標示為「供應商執行」。
照這樣讀,故事就前後一致:DeepSeek V4 Pro 是真正的中段班前沿模型——AA 53,排名在十幾到二十幾名——而供應商評分卡宣稱其代理與程式編寫效能接近頂尖。兩項陳述皆為真,且並不衝突;一項是實測,另一項是宣稱。

計分卡的費用是多少
DeepSeek V4 Pro 是總參數量 1.6T、活躍參數量 49B 的 MoE 旗艦模型,具備 1M token 的上下文視窗與 384K 的最大輸出長度。在 OrcaRouter 上,它按 DeepSeek 的官方牌價販售,零加價:每百萬輸入 token 0.435 美元,每百萬輸出 token 0.87 美元(快取讀取每百萬 token 0.060 美元),以上價格係根據 2026 年 8 月 15 日查閱的目錄,並已在即時模型頁面上確認。以該費率計算,每分價格的算式是支持此模型最有力的論據:其輸出價格大約只有獨立指數上分數相近之模型的十分之一,因此你付出的是中階價格,拿到的成績單——若廠商的宣稱屬實——卻接近頂尖。一個提醒:DeepSeek 已宣布自 8 月 17 日(北京時間)起實施尖峰/離峰定價方案(離峰價格為尖峰的 50%),因此費率可能變動——本文所列數字為撰稿當時的即時牌價。

當此建議有誤時
老實說,這些情況下你不應該選擇 DeepSeek V4 Pro:
• 你需要經獨立確認的前沿推理。 AA Index 53 屬於中段班——Kimi K3(60)和 GPT-5.6 Terra(57)領先且已得到驗證。如果你的決策取決於測得的天花板,供應商卡片並不會改變這一點。
• 你在別人重新驗證之前,就把生產賭在 DeepSWE 62.7 上。 單一版本從 12.8 跳到 62.7 是宣稱,不是事實。等待中立的複現——Terminal-Bench 的 87.9 對 78.7 差距,正說明了可能發現的情況。
• 您的工作負載是沙盒化的終端自動化或 Excel 財務建模。 Vals AI 表示,這些正是模型會遇到困難的地方,且與任何廠商評分無關。
• 你正在針對 CyberGym 83.3 做出網路安全決策。這代表 DeepSeek 用自己的基準測試自己的模型——安全廠商若依據這個數字採購,等於是在購買未經稽核的數據。
底線
DeepSeek V4 Pro 0813 是一款真正的頂尖模型,其廠商評分卡上的成績超越了獨立評測紀錄。0813 版本把一個文字預覽版變成了認真的代理型競爭者——我們已另行報導過該版本本身——如果你今天想評估它,它就是 OrcaRouter 上的一個 OpenAI 相容金鑰,按 DeepSeek 的牌價計費,若供應商回應停滯便會自動故障轉移。只要按照本文拆分評分卡的方式來解讀:獨立檢核(AA 53、Vals 第 12 名、78.7 的 Terminal-Bench 成績)是你今天可以信賴的;那 87.9 和 62.7 則是你應該在據以建置之前先行驗證的數字。買它是為了性價比和 100 萬 token 的上下文長度,而不是為了那些未經複現的標題數字。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
