
DSH 0.2 與 DeepSeek V4.1 Pro:傳聞中的雙重發布,以 DeepSeek 自家程式碼進行測試
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 301 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
週一早晨在北京,DeepSeek 觀察者 @teortaxesTex發文表示,「如果 DeepSeek 在週一同時發布 DSH 0.2 與針對 DSH 和代理團隊進一步訓練的 V4.1 Pro,那就太酷了」,隨即又在同一句話裡語帶保留:「我認為至少到(下)週四前都非常有可能。」這是一個附帶時程的願望,而非一則報導。其核心是DeepSeek V4.1 Pro,它至今仍沒有模型卡、沒有權重檔案、沒有價格,也沒有端點——而這個願望的另一半,一款0.2版的DeepSeek Harness,則從未在任何管道發布過。今天任何人真正能呼叫的兩個 DeepSeek 模型,是DeepSeek V4.1 Flash,即 9 月 10 日發布的 552B 開放權重版本,以及DeepSeek V4 Pro,這款 1.6T 旗艦模型;DeepSeek 的更新日誌指出,它會持續到 9 月 14 日之後,且計費維持不變。這兩者都不是那則推文所指的對象。
所以,面對這樣一句話,有用的做法不是爭論日期。而是要把可以查證的部分,與出於猜測的部分分開——而這個特定的說法包含了三項各自獨立的斷言,其中兩項各約十分鐘就能被否證,第三項則確實有趣,因為它指向 DeepSeek 已經發表的實際工作。以下就是它們,按照可以測試的順序排列。
以證據術語來說,訊號是什麼
這則推文是來自一個密切關注 DeepSeek、過去也曾搶先掌握消息的帳號的一段文字。它發佈於 2026 年 9 月 28 日星期一 UTC 02:36,也就是北京時間 10:36——正是它預測會發布的那個上午。它背後沒有 DeepSeek 文件,沒有第二個消息來源,沒有開發者預覽連結,而且就算說錯,作者也無須付出任何代價。這個帳號並不是在描述它親眼看過的東西;它是在描述它認為 DeepSeek 的時程所具有的某種形狀。
其中堆疊了三個斷言,而它們會各自獨立地失敗或存活:
• 版本號。那就是該測試框架的下一個版本編號為 0.2——這是小幅版本號提升,而非 DeepSeek 六週來每天持續發布的 0.1.x 發布候選版本。
• 一款模型。DeepSeek V4.1 Pro 竟然真的以產品形式推出,而且讀者將能夠實際呼叫它。
• 聯合登場。測試框架升級與模型一同到位,就選在週一,因為這個模型「針對 DSH 與代理團隊做了進一步訓練」。
第一項可以對照套件註冊表來查證。第二項可以對照 DeepSeek 自家的更新日誌、價格表與 Hugging Face 組織來查證。第三項是唯一需要任何判斷的一項,也是推文作者唯一指出真實事物的一項。
DeepSeek Harness 中沒有 0.2
DeepSeek Harness 以 MIT 授權開源,發佈於 GitHub 與 npm,而這兩個管道都不需要帳號即可閱覽——這使得它成為這項說法中最容易查證的部分。
• npm — @deepseek-ai/dsh 已發佈 27 個版本。最高的是 0.1.7-rc.2。登錄檔中完全沒有 0.2.x,且 dist-tags 顯示為 latest: 0.1.7-rc.2、next: 0.1.7-rc.2、alpha: 0.1.7-alpha.2。
• GitHub — 已發布 22 個版本,每一個都標記為預發行版。最新的是 dsh-v0.1.7-rc.2,於 2026 年 9 月 24 日 14:10 UTC 發布。該儲存庫本身的根 manifest 也帶有相同版本。
• 桌面版本 — DeepSeek 透過自家下載主機發布封裝好的 Windows 與 Apple 晶片用戶端,而其兩個正式更新來源皆回報版本 0.1.7-rc.2,發布日期為 9 月 24 日。
• 這個節奏——自八月中旬以來,0.1 分支大約每隔一到三天就會推進一批 alpha 與候選發布版本:9 月 15 日的 0.1.6-alpha.1、17 日的 0.1.6-alpha.2、22 日的 0.1.7-alpha.1 與 alpha.2、23 日的 rc.1、24 日的 rc.2。這樣的節奏完全不是在朝 0.2 標籤推進;它是在朝 0.1.7 穩定版推進。
這裡有一個讀者可以據以行動的改變,它很小但真實:npm 的 latest 標籤現在解析為 0.1.7-rc.2,所以 npx @deepseek-ai/dsh web 會安裝一個比幾天前更新的候選版本,當時預設仍指向 0.1.5-rc.3,而桌面應用程式已經在 0.1.7-rc.2。桌面版建置與 npm 預設值終於趨於一致。那是一個打包事件——如果你這週要安裝,它很有用;但作為關於模型的證據,則無關緊要。
在 DeepSeek 寫下的任何內容中,都沒有 V4.1 Pro。

這是影響更大的那一半,因為關於測試框架版本的傳言不會讓任何人付出任何代價,而關於旗艦層級的傳言,卻是團隊會圍繞它規劃一整個季度的那種事。DeepSeek 維護著四個已發布模型會出現的位置,而這個名稱在四處全都缺席。
• 更新日誌——DeepSeek 自家的 API 文件列出了 21 筆附有日期的條目,從 2024 年 9 月的 DeepSeek V2.5 到目前為止。最新的是 2026 年 9 月 10 日,DeepSeek-V4.1-Flash 的發布。之後沒有任何條目的日期晚於它,而且「V4.1 Pro」未出現在任何條目中。
• 價目表 — DeepSeek 的定價頁面目前僅列出兩個模型名稱:deepseek-flash(版本 DeepSeek-V4.1-Flash)以及 deepseek-v4-pro(版本 DeepSeek-V4-Pro-0813),併發上限分別為 2,500 與 500。讀者所能呼叫的後繼層級必須在此有一行,但目前沒有這一行。
• Hugging Face — deepseek-ai 組織最新的儲存庫是 DeepSeek-V4.1-Flash,建立於 2026 年 9 月 10 日 02:17 UTC,下載次數已超過 650,000。其後的項目分別來自 8 月 31 日與 8 月 13 日。沒有更新的項目,而 4.1 世代中也沒有任何名稱含有 Pro 的項目。
• 服務供應——在我們這邊,OrcaRouter 模型 API 對於 DeepSeek V4.1 Pro 在連字號與加點這兩種拼法下都回傳 404,而 DeepSeek V4.1 Flash 與 DeepSeek V4 Pro 則都能解析。Artificial Analysis 也沒有它的頁面。這些都與 DeepSeek 自家的文件無關,而且它們的說法一致。
這個名稱並非全然陌生——它於九月初在供應商端浮現,出現在圍繞一項將 DeepSeek V4 Pro 流量改道至 V4.1 Flash 的計畫的報導中,而大多數讀者正是透過那則報導首次見到它。DeepSeek 的文件如今所證實的內容則更為有限、也沒那麼令人振奮:V4 Pro 服務會持續至 9 月 14 日之後,而已退役的 Flash 識別碼仍被接受,並由 DeepSeek V4.1 Flash 以 Flash 定價提供服務。計畫並非實際產物。能為此事定論的文件是模型卡,但並不存在這樣一份文件。

那項檢查最犀利的版本,就藏在 DeepSeek Harness 本身裡。這個 harness 透過自家的轉接器與 DeepSeek 的 API 溝通,而那個轉接器隨附一份預設模型目錄——也就是在使用者設定任何項目之前,用戶端所提供的簡短模型清單。它正好有兩個項目:deepseek-flash,顯示為 DeepSeek-V41-Flash,支援文字與圖片輸入,以及 deepseek-v4-pro,顯示為 DeepSeek-V4-Pro。沒有第三個項目。如果 DeepSeek 正在準備一個自家 harness 據以訓練或調校的 Pro 等級,那麼這個檔案——僅有兩個項目,且位於供應商自家的公開儲存庫——就是它最自然會最先出現的地方,而它並不在那裡。
可檢驗的部分:「為代理團隊進一步訓練」
這是值得認真看待的條款,因為它是唯一能對應到 DeepSeek 實際已發表成果的條款,也因為它說明了為何竟會有人期待共同發布。
先從論文開始。9 月 19 日,DeepSeek 向 arXiv(2609.22978)提交了DeepSeek Elastic Compute(DSec):一套用於大規模高效代理式訓練的沙箱基礎設施。文中描述了 DeepSeek 代理訓練與評估背後的平台:四種沙箱後端——FnCall、容器、microVM 與完整 VM——統一由一套 SDK 支援,環境映像檔按需從該公司的分散式檔案系統串流載入,以及與強化學習迴圈共同設計的生命週期管理,讓有狀態的 rollout 執行能在可被搶占的 GPU 訓練中存續。一個生產單元約有 160 個節點,每天服務約三百萬個沙箱,維持超過 38 萬個並行沙箱,每秒建立超過 5,000 個。其中一節專門討論學會走捷徑的代理——偽造內部請求、讀取他們不該讀的日誌,以及藉由遞迴進入 /proc 觸發核心錯誤——以及隨之而來的 AppArmor 與 eBPF 緩解措施。
那是代理訓練基礎設施,公開發表於該推文時間窗口的三天前。這證明 DeepSeek 正在打造「為代理團隊訓練」這類說法所需的機制。這不是關於時程的證據。
接著是 harness 端。Agent Teams 在 DeepSeek Harness 中以四個外掛的形式存在,發佈於實驗性套件名稱之下,首次於 9 月 9 日推送到 npm,目前則跟著 0.1.7 系列走。一份日期為 9 月 18 日的架構說明,將先前兩個開關的配置整併為單一的選用套件,一併包含團隊服務、工具與瀏覽器面板——並讓它預設為停用在外掛頁面中。9 月 23 日的 0.1.7-rc.1 發行說明描述了該面板現在的功能:它會即時顯示團隊成員及其任務,可從工作階段頁面標頭開啟或切換,而團隊工具則以名稱來指定成員。同一份說明也記錄了一項變更:「調整圖片縮放與 token 估算,以配合 DeepSeek V4.1」——這是 harness 針對當前模型進行調校,而非為了未來的模型。
最後,是模型卡。DeepSeek 自家針對 DeepSeek V4.1 Flash 的模型卡指出,其程式碼代理基準——Terminal-Bench、DeepSWE、NL2Repo-Bench、ProgramBench——是在「DeepSeek Harness 的 Minimal 模式與 100 萬 token 脈絡視窗」下執行的。這等於是一家廠商在告訴你,它的代理分數是在自家測試框架內產生的。這也意味著那些數字是由廠商自行回報且未經重現:DS-V4.1-Flash 在 DeepSeek 自家設定下,於 Terminal-Bench 2.1 拿下 90.6 分、於 DeepSWE v1.1 拿下 74.2 分,而 DeepSeek 以外的任何人都未曾重跑過這些測試。獨立觀點則較為單薄,且來自不同日期:OrcaRouter 模型頁面上引用的 Artificial Analysis 數據顯示,DeepSeek V4.1 Flash 的 Intelligence Index 為 39.5(評估於 9 月 10 日),DeepSeek V4 Pro 的 AA Coding Index 為 68.8(評估於 8 月 13 日)。這兩列數據來自相隔數日、分屬不同月份的兩次不同評估,因此並非同基準的對等比較——請把它們讀成兩張快照,而不是同一塊計分板。
為什麼「on Monday」會顯得不同尋常——以及為什麼這種模糊措辭更重要
DeepSeek 的發布歷史公開可見,若按日曆來讀,它會溫和地反駁這則推文的前半段。
• 近期推出的作品多在週四或週五上線 — 2026年9月10日是週四,8月21日是週五,8月13日是週四,7月31日是週五,4月24日是週五。
• 週一並非前所未有,只是相當罕見——整份更新日誌中最後一次在週一發布的紀錄,是 2025 年 12 月 1 日的 DeepSeek V3.2,距今大約十個月。
• 假日規則已寫進價目表中 —— DeepSeek 的尖峰計費時段為 UTC 週一至週五 01:00–04:00 與 06:00–10:00,「不含中國國定假日」,其餘所有時段皆為離峰,假日更是全天如此。一家把國定假日從自家計費行事曆中剔除的公司,等於在告訴你它在這些假日不營運。國慶日是 10 月 1 日。
那就是這則推文第二句話所指向的解讀,也是比較有用的那一半。「至少要到下週四」與「在週一」拉向相反方向:它把可能的時段從推文點名的那一天推開,推向工作週結束的界線,而那正是假期開始的地方。無論作者指的是哪個週一,界定這個窗口的週四都是假期前最後一個普通工作日。DeepSeek 從未在國慶日期間推出過任何東西。
真正的發行會最先出現在哪裡
這部分是值得加入書籤的,因為其中每一項都能在一次頁面載入中查核,而且它們全都不取決於追蹤器的判斷:
• 更新日誌中的第二筆項目。DeepSeek 的 API 更新頁面是模型發布首先出現的地方,也是定義目前兩個可呼叫模型的地方。它今天最新的條目是 9 月 10 日的 Flash 發布。
• deepseek-ai 組織中一個名稱帶有 Pro 的儲存庫。該組織最新的儲存庫是 9 月 10 日的 DeepSeek-V4.1-Flash;若有新的儲存庫會立即顯示。
• harness 模型目錄中的第三行。 上述的配接器檔案在公開儲存庫中只有兩筆條目,而 harness 當初調校所針對的 Pro 等級,顯然就是最順理成章的新增項目。
• 價格列與併發限制。 DeepSeek 在價目表上註明了可用性限制,而旗艦級方案會同時具備這兩者。
• npm 或桌面 feed 上高於 0.1.x 的標籤。就這項說法中 harness 那一半而言,這就是全部的檢驗——而這些 feed 自 9 月 24 日以來一直停在 0.1.7-rc.2 沒有變動。
在此期間該做什麼

這個故事中存在一種實際上的不對稱。大家都在等待的那個模型,沒有東西可呼叫;而兩款確實能用的 DeepSeek 模型今天都在路由——其中一款,DeepSeek V4.1 Flash,正是兩週半前真正推動該系列向前邁進的版本。
兩者都在 OrcaRouter 上,共用一組 API 金鑰,並以供應商的定價原價轉嫁、不加價:DeepSeek V4.1 Flash 每百萬 token 輸入 $0.15、輸出 $0.60,而DeepSeek V4 Pro 則為 $0.66 與 $1.98,這是離峰價,在 DeepSeek 的尖峰時段內則有 2× 的倍率。由於是如實轉嫁,最終落在發票上的就是 DeepSeek 自家的尖峰與離峰倍率,而供應商端的價格變動會在 DeepSeek 調整的當天就反映在我們這裡,而不是等到某份價目表更新時才出現。如果你要把正式環境的路径綁定到其中一個模型,一條自動容錯移轉鏈,就是面對供應商端在發布週出現顛簸時最便宜的防護——那正是 DeepSeek API 最可能繁忙、而且許多人都在改寫自己設定檔的一週。
把限制說清楚:DeepSeek V4.1 Pro 不是我們代管的東西,我們也不會宣稱相反。它沒有可供路由的識別碼。本文沒有任何內容是它的預覽,而一旦它有了價格列與儲存庫,那就是模型頁面的問題,而不是傳聞的問題。
誠實的總結
這則推文中的三項斷言,截至今日有兩項是錯的,嚴格來說,就是它們所需的產物並不存在。DeepSeek Harness 裡沒有 0.2——27 個 npm 版本、22 個 GitHub 預發行版、兩個桌面版發佈管道,全都停留在 0.1.7-rc.2,而且全都是自 9 月 24 日以來如此。沒有 DeepSeek V4.1 Pro——不在更新日誌、價目表、Hugging Face 組織、該 harness 自身的模型目錄中,也不在我們的頁面或 Artificial Analysis 的頁面上。第三項斷言——下一件大事正為了代理團隊接受訓練——才是背後有真正已發表研究支撐的那一項:一篇 9 月 19 日關於 DeepSeek 代理沙箱平台的系統論文;一條自 9 月 9 日起就公開、且在外掛頁面上仍預設為關閉的 Agent Teams 外掛產品線;以及一張模型卡直言,DeepSeek 自家的代理式基準測試數據是在 DeepSeek Harness 內部產生的。這些都不是時程。而這一切正是時程不斷被人猜測的原因。
把日期當作假設,把產出物當作事實。變更紀錄、Hugging Face 組織,以及測試框架的模型目錄,才是釐清這件事的地方,而這三者都只差一次頁面載入。在其中一者有所變動之前,「週一與 V4.1 Pro 一起」只是藏在一句把話留到週四的句中的一廂情願——而那個週四,正是國定假日前的最後一個工作日。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
