主視覺標題卡:DeepSeek V4.1 Flash 基準測試——74.2 證明了什麼、又沒證明什麼,日期為 2026-09-10 發布,並附註「六天的獨立結果」。
Guides & Insights

DeepSeek V4.1 Flash 基準測試:74.2 證明了什麼、又沒證明什麼

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 在 DeepSWE v1.1 上拿下 74.2 分,比 GPT-6 Astra 高出十分之一分,比 Gemini 3.8 Flash 與 Claude Opus 5 高出半分,而這個數字整個星期都被引用為世代交替的象徵。值得精確說明它究竟是什麼。模型本身並不新——DeepSeek V4.1 Flash 於 2026-09-10、也就是六天前正式全面開放——所以這裡沒有什麼算是發布。在這段期間內真正出現的是量測層:首批獨立指數條目、首個獨立競技場結果、橫跨三套技術堆疊的零日上線支援,以及某家廠商決定讓自家旗艦退役、改以這款模型取而代之。本頁彙整了實際被量測到的內容,每一項數字都註明來源,並直白說明至今尚無人確立的事項。

DeepSWE 分數,以及與它相差不到半分的四個模型

DeepSWE v1.1 是 Datacurve 推出的長時程軟體工程基準測試——涵蓋 91 個開源儲存庫、五種程式語言的 113 項原創任務,聚焦於多檔案變更與行為正確性。在 DeepSeek 自家的模型卡上,廠商報告的表格顯示:DeepSeek V4.1 Flash 74.2、Claude Opus 5 74.0、GPT-5.6 Sol 73.0、Kimi K3 67.5、GLM-5.3 66.9、DeepSeek V4-Pro-0813 62.7、DeepSeek V4-Flash 54.4。

同一基準測試的獨立排行榜並未重現那樣的排序,而其中的差異比頭條數字更為重要。Datacurve 的 DeepSWE v1.1 Pass@1 排行榜將 Muse Spark 1.3(FAIR)以 75.40 排在首位,領先 DeepSeek V4.1 Flash 的 74.20。其後依序是:GPT-6 Astra 的 74.12(extra high)與 74.10(max)、Gemini 3.8 Flash 的 73.83(high)、Claude Opus 5 的 73.65(max)。

所以這個 74.2 是真實第三方排行榜上的一個真實條目,而且它是第二名,不是第一名。發布當天流傳的說法——也就是這在 DeepSWE 上是頂尖的——在刊載該分數的排行榜面前站不住腳。Muse Spark 1.3 領先 1.2 分。

現在來講被跳過的部分。四個前沿模型在這個基準測試中彼此差距在 0.55 分以內:74.20、74.12、73.83、73.65。這比測量雜訊的範圍還窄。DeepSWE 上已發表的逐次執行變異大約在 1.4 到 3.2 分之間——是前四名整體差距的三到六倍。對 GPT-6 Astra 領先 0.2 分並不是什麼發現;那只是把平手結果印到小數點後兩位時的樣子。

支架敏感度是第二個不應把這個數字看得太死的原因,而這裡供應商自家的文件正好提供了證據。DeepSeek 在同一批發布資料中報告了 DeepSWE 在八種支架上的表現。74.2 是在 mini-SWE 上達成的。同一個模型在 DSH Minimal 上得分 72.6,在 DSH Standard 上 70.5,在 Claude Code 上 69.8,在 DSH PTC 上 67.6,在 Pi 上 66.2,在 Codex 上 65.6,在 OpenCode 上 65.5。這是在同一個模型、同一個基準測試上出現 8.7 分的差距,而這完全是由包裝在它外面的測試框架所驅動。任何人拿在 mini-SWE 上產生的 DeepSeek 數字,去跟競爭對手在不同代理迴圈上產生的數字相比,其實是在比較支架,而不是比較模型。

獨立指數實際上將其置於何處

Artificial Analysis 在宣告的 effort 設定下執行一套固定測試,這使其 Intelligence Index 成為現有最純粹的外部檢驗。在 DeepSeek V4.1 Flash 的模型頁面上,於 reasoning max effort 下,該指數讀數為 40——在該類別 113 個模型中排名第 6,而該類別中位數為 18。封閉陣營的競爭對手位居其上:Claude Opus 5(max)51、GPT-5.6 Sol(max)47、GLM-5.3(max)45、Kimi K3(max)44、Gemini 3.8 Flash(high)41。DeepSeek 自家先前的旗艦 V4-Pro-0813 則以 36 位居其下。

並排閱讀這兩份計分板,會發現分歧是結構性的,而非錯誤。在 DeepSeek 選擇的基準測試上,只要搭配正確的輔助框架,該模型便能與前沿並駕齊驅。在一套固定的外部測試套件上,取推理、程式設計、數學與代理式工作的平均表現,它則落後 Claude Opus 5 十一分,並落後 Gemini 3.8 Flash 一分。兩者可以同時成立。廠商表格是一種論證;指數則是一項平均。

索引頁面上還帶著兩個對路由決策至關重要、卻鮮少登上頭條的數字。DeepSeek V4.1 Flash 在 max effort 模式下以每秒 214.4 個輸出 token 的速度運行——很快。它在完成 Intelligence Index 時也產生了 2.5 億個輸出 token,而中位數為 1.4 億,Artificial Analysis 將其標記為明顯冗長。冗長不是品質問題;它是一筆帳單。一個思考時所用的 token 比同儕多出 79% 的模型,在每一次長時間推理呼叫中,都會吐回一部分價格優勢。

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench:單一模型分數與多代理分數並非同一種測量

這是最容易看錯的數字,因此值得仔細分隔開來。

• 單一模型、標準配置——根據 DeepSeek 自家的模型卡,DeepSeek V4.1 Flash 在 ProgramBench(Almost@1)上得分 20.3。這成績低於 GPT-5.6 Sol 的 23.0,也遠低於 Claude Opus 5 的 37.0,僅略高於 GLM-5.3 的 19.0 和 Kimi K3 的 17.5。這是廠商自行提報的數據,而且對該模型並不美化。

• 多智能體團隊配置 — DeepSeek 的技術報告,DeepSeek-V4.1-Flash:突破 KV 快取壓縮的極限,描述了一套初期的 Agent Swarm RL 配方,其中由主導代理在共享任務看板上協調隊友。在一個高置信度的 172 項任務 ProgramBench 子集上——即參考解答以 95% 或更佳成績通過的任務——多智能體配置從一小時截止時的 13.59% 攀升至八小時時的高峰 30.04%,而單一智能體基準則從 12.79% 提升至 20.39%。

30.04% 是「30%」這個說法的來源,而它並非單一模型的分數。它是一組代理團隊獲得八小時,在篩選過的子集上測量,且出自廠商自家的初步評估。它所引發的比較——「遠高於單一 Sol,幾乎是 Kimi K3 的兩倍」——相對於 Sol 的 23.0 與 K3 的 17.5 在算術上站得住腳,但這同時也是多代理配置與單一模型基線在不同任務集上的比較。同一份報告顯示了在 FrontierSWE v2 上的效果:多代理在二十小時達到 32.90%,而單代理為 28.20%。差距確實存在,且隨著截止期限延長而縮小,而取得它所付出的 token 成本並不小——一篇實作報告指出 token 用量超過 10 倍,執行時間更逼近四小時。

參數數量尚未確定,因此請將所有尺寸比較視為暫定的

DeepSeek 的發布說明描述了一個「552B 參數的 MoE」。那是廠商提供的數字,也是大多數報導一再引用的數字。但它也不是完整的產物。

DeepSeek 自家的模型卡記載了 transformer 主幹之外的第二個元件:「Engram 條件式記憶(196B 參數,透過基於 token 的查找以稀疏方式存取)。」把兩者相加,就會得到 748B。這正是發布後數小時內在 r/LocalLLaMA 上流傳的社群解讀背後的算術,而模型卡自身的 safetensors 索引列出其各種張量類型共 763B 參數。大約 510 GB 的 FP8 數字來自同一脈絡的分析:你實際上會下載並保存在記憶體中的內容。

要調和這些說法,關鍵在於它們各自計入的是不同東西。552B 是運算主幹——也就是 token 流經的參數。196B 則是一張在特定層查詢的查找表,它回傳已儲存的資訊,而不是在其上進行運算。8B 和 16B 是 DeepSeek 引用的活化值數字,分別是在 prefill 與 decode 期間啟用的每個 token 切片。這四個數字描述的都是同一個模型。

上述任何一點都不足以讓這項比較站得住腳。每一則「這個模型以一小部分的規模,就能媲美前沿模型」這類說法,都建立在一則排除了產物五分之一內容的廠商標題宣傳上。除非有人發表可重現的參數核算,否則以規模為依據的論點都應該在內文附帶這項但書。

ARC-AGI:此模型沒有結果

DeepSeek V4.1 Flash 沒有 ARC-AGI-2 或 ARC-AGI-1 分數。ARC Prize 的已驗證結果頁面沒有這個檢查點的條目,而 DeepSeek 自己的基準測試表也沒有 ARC 這一列。唯一經 ARC Prize 驗證的 DeepSeek 結果,是屬於較舊的 V4 Flash 0731 檢查點——在最大推理努力下,ARC-AGI-2 semi-private 為 61.4%,ARC-AGI-1 為 89.0%,每項任務分別為 $0.04 和 $0.02。那些是前代模型在不同模型上的數字,將它們當作 V4.1 Flash 的結果來引用會是錯誤的。如果 ARC-AGI 對你的評估很重要,這個模型目前尚未評分。

還有什麼落在視窗內

對於正在決定是否要試用這個模型的讀者來說,有三件事出現了變化,而這三件事都不是這個模型本身的發布。

• 獨立競技場結果。OpenDesign Arena 讓十三個模型執行完全相同的設計任務——網頁應用程式、儀表板、行動裝置畫面、登陸頁面。DeepSeek V4.1 Flash 拿下滿分 100 分中的 81.2 分,GPT-6 Astra 則為 82.7 分;每件完成的設計成本為 $0.023,對手則是 $1.61,且完成時間為 5.3 分鐘,對手則為 11.1 分鐘。交付率——無需修改即可使用的輸出比例——為 57.7%,Astra 則為 60%。這是首批真正獨立測量該模型的評測之一,而且它專門測量設計產出,而非一般推理或程式編寫能力。

• 在三個堆疊上提供 Day-0 服務支援。vLLM 發布了 Day-0 映像檔(2026-09-09),並在 NVIDIA 與 AMD 硬體上通過驗證。SGLang 與 Miles 於 2026-09-10 發布 Day-0 推論與 RL 支援,其中包括一條 Engram 主機卸載路徑,在 4 張 GB300 上將 KV 快取容量提升了 36%,以及一項有界重放最佳化,在 8 張 H200 上將預填吞吐量提升至 1.56 倍。寒武紀同日宣布在 vLLM 堆疊上完成 Day-0 適配。對於一款以激進的 KV 快取壓縮為賣點的模型——HBM 佔用量僅前一代的四分之一、SSD 佔用量僅其八分之一——能夠從第一天起就在標準堆疊上運行,正是實驗室成果與可實際部署之間的分野。

• 該廠商已讓自家旗艦型號退役。DeepSeek 正逐步淘汰 V4-Pro。自 2026-09-14 04:00 UTC 起,任何指定「deepseek-v4-pro」的請求都會路由至 V4.1 Flash,並依 Flash 費率計費,此情況將持續至 V4.1 Pro 推出為止。DeepSeek V4.1 Pro 尚未發布——它是未來的模型,而這項重新導向只是權宜之計,用以避免已固定的整合失效。同樣退役的還有「deepseek-v4-flash」與「deepseek-v4-flash-vision-exp」,兩者皆為相容性而暫時路由至 V4.1 Flash。若你在正式環境中固定了某個模型 ID,那麼這項重新導向就是本頁唯一不容忽視的營運事實。

價格對決策的影響

定價才是這款模型不再只是基準測試故事的地方。根據 DeepSeek 自己公布的費率,自 2026-09-10 04:00 UTC 起生效,其中尖峰時段定義為平日的 01:00–04:00 與 06:00–10:00 UTC,其餘時段則為離峰時段。

• 離峰時段,每百萬個詞元 — 快取命中 $0.003、快取未命中 $0.15、輸出 $0.60。

• 峰值,每百萬個 Token — $0.006 快取命中,$0.30 快取未命中,$1.20 輸出。

• 快取輸入,與前沿閉源模型相比——每百萬個 token 只要十分之三美分,而大約是五十美分。對於在同一個儲存庫上反覆迴圈的代理來說,該層級承載了大部分的 token。

• 以我們自家型錄實測——每百萬 token 輸入 $0.15、輸出 $0.60,首個 token 的中位延遲為 784 毫秒,過去七天每秒可處理 211 個 token。

Artificial Analysis 將同一款模型列為輸入 $0.30、輸出 $1.20,並提供 98% 的快取折扣,混合後為每百萬 $0.18——那是尖峰時段的層級,而這兩個數字其實是同一價格在不同時段的呈現。在比較各家供應商之前,這個區別值得內化:採用兩段式時鐘計價的模型,無法只用單一招牌費率來比較。

這也是為什麼直通式定價在此處比平常更為重要。OrcaRouter 將 DeepSeek V4.1 Flash 與其目錄中的其他模型一併提供路由,以0% 加價——供應商標價,維持不變,因此 DeepSeek 的尖峰與離峰價格層級會完全依照 DeepSeek 所公布的原貌送達我們這一端,而供應商的價格變動當天即時生效。對於一個每個平日早上費率會翻倍四小時的模型來說,一個把價格層級抹平的平台,正是在隱藏你唯一需要的那個數字。

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

沒有人確立的事

這則報導中的缺口並不是缺少基準測試。而是 DeepSeek V4.1 Flash 與其點名的競爭對手之間,並不存在由與結果無利害關係的人士在共用測試框架上進行的可信正面對決。本頁上的每一個數字都是以下三種情況之一:由供應商報告、由第三方在不同配置上產生,或是在並非為隔離此對決而設計的固定測試套件上的平均值。沒有任何一次運行是 DeepSeek V4.1 Flash 和 GPT-6 Astra 在相同任務、相同鷹架、相同努力設定下進行評估,並公佈變異數的。

有三件具體的事情會改變局面,而這些事情今天都不存在。

• 受 scaffold 控制的 DeepSWE 比較。DeepSeek 自家 scaffold 之間的 8.7 分差距,大於排行榜上前四名模型之間的任何差距。在前沿模型以同一套 harness 衡量之前,該表最頂端的排名並不具意義。

• 對 ProgramBench 代理團隊結果的獨立重現。這 30.04% 的數字來自廠商針對經過篩選的 172 項任務子集所發布的技術報告,屬於初步配置,其 token 成本尚未針對正式生產預算進行評估。

• ARC-AGI.此檢查點完全沒有分數。

實務上的結論是,這項主張比新聞頭條所能支持的要狹隘。DeepSeek V4.1 Flash 在一項長程編碼基準測試上,可量測地落在前沿的雜訊範圍內;在獨立設計任務上,以約 1.4% 的成本展現真正競爭力;而在綜合指數上則落後約十個百分點。這足以讓人用它來跑你自己的負載,並讓你的評估來定奪。但這不足以單憑 0.2 分就改寫生產路由表——而這兩種說法同時成立,正是整項發現的重點。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新