
DeepSeek Harness 解析:「Model + Harness = Agent」背後的 Agent Runtime
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百萬 tokens · 84 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
DeepSeek Harness —— dsh(簡稱)——它並不是一個模型。它是 DeepSeek 於 2026 年 8 月 13 日以 MIT 授權條款發布的開源代理執行環境,而且至今仍是 DeepSeek 推出過、採用速度最快的東西:新聞報導指出,它在最初 12 小時內就拿下約 50,000 顆 GitHub 星,而我們今天讀取 GitHub API 時,該儲存庫已有 242,211 顆星、29,059 個 fork。它執行的是 DeepSeek V4.1 Flash,也就是 DeepSeek API 以 deepseek-flash 名稱提供的模型,或者在你指定時,改用更大型的 DeepSeek V4 Pro。它的職責,是介於語言模型與完成任務之間的那層工程:檔案編輯、終端機執行、網頁搜尋、脈絡管理、任務規劃,以及呼叫其他代理。DeepSeek 自家團隊所用的公式是模型 + 執行框架 = 代理——模型負責推理,執行框架負責其餘一切。
這個區別正是本文的重點。搜尋「deepseek harness」的人通常預期會看到模型評測,結果卻落到了發布報導上。所以這裡直接把答案說在前頭:DSH 不是你透過 API 呼叫的模型。它是一套你安裝後執行的程式——npm 套件是 @deepseek-ai/dsh,其 latest 標籤現在指向 0.2.0-rc.2——比本頁最初撰寫時所依據的 0.1.x 版本晚了三個發行系列,也超過上方卡片上的版本標籤——它會把你提供的任何模型(預設為 DeepSeek V4.1 Flash)連接到你的檔案系統、終端機、網路以及其他代理程式。它採用 MIT 授權,建構於名為 Cordis 的外掛框架之上,而且明確標示為開發者預覽版,會警告有破壞性變更。DeepSeek 在 10 月 2 日發表的封裝桌面應用程式——有 macOS 和 Windows 版本,Linux 使用者則被引導使用 npm 套件——是它最上層的最新介面。以下是它實際的功能、今天如何執行它,以及它的不足之處。
「測試夾具實際上做什麼(以及為什麼這個術語令人困惑)」
框架(harness)是讓原始模型在現實世界中實際運作的支架。單靠模型本身只能產生文字。給它一個框架,它就能讀寫檔案、在你的 shell 中執行指令、搜尋網路、維持計畫、呼叫工具、對錯誤做出反應,並判斷任務何時完成。DeepSeek 的公開公式——在發布報導和其自身的職缺公告中反覆出現——是「Model + Harness = Agent」:模型提供推理能力,框架提供其餘一切。
這就是為什麼這次發布的意義超越單一產品。DeepSeek在該測試框架內報告了其最新兩個模型的智能體基準分數:DeepSeek V4 Flash API文件說明其Terminal-Bench 2.1結果為82.7,是在「DeepSeek Harness minimal mode」下產生的。該測試框架是這些數據所來自的參考環境,現已公開,任何人都可以重現——或反駁。
一切都是插件:Cordis 架構
DSH 的核心設計,如其 README 所述,就是「一切皆為外掛程式」。代理迴圈、模型適配器、工具、技能、工作階段儲存、沙箱、排程,甚至 Web UI,全都是 Cordis 外掛程式。沒有需要修補的特權核心:你可以透過在其他外掛程式旁掛載一個外掛程式來擴充框架,而每次註冊都是一個會在外掛程式卸載時自動解除的效果。外掛程式引擎是 Cordis,一個元框架,其設計見於北京大學–DeepSeek 的論文〈A Programming Paradigm for Spatiotemporal Composability〉。
實際結果是關注點被明確劃分:外掛負責新增能力;預設集則決定特定代理能看到哪些能力。這個 monorepo 目前在 packages/ 底下包含 55 個套件——core、llm、mcp、sandbox、context、plan、goal、workspace 等等——而發布時的涵蓋範圍計有超過 100 個第一方外掛,外掛商店也已預留,且在發布後 24 小時內於 GitHub 上蒐集到 288 個社群外掛儲存庫。那是六週前的事。DeepSeek 用來提升外掛可發現性的 dsh-plugin 主題,現在在 GitHub 搜尋中會傳回超過 17,000 個儲存庫,這是我們在 2026 年 10 月 2 日看到的——即使這個框架本身仍停留在發布候選版,生態系仍持續成長。
四種預設模式 — 以及何時該使用哪一種
DSH 隨附四個代理程式預設集,每個預設集會載入不同的外掛程式集。從 Web UI 自身的預設選單:
• Standard — 完整的編碼代理:檔案編輯、Shell、檔案與網頁搜尋、技能、規劃、目標、子代理與工作流程。是大多數工作的正確預設選擇。
• Code — 中文媒體報導稱之為 PTC(「程式化工具呼叫」)— 包含 Standard 的所有功能,外加 Code Mode SDK,讓模型能撰寫 TypeScript 程式,在單一程式中組合多步驟的工具呼叫。更強大,但副作用與工具呼叫的數量也可能倍增。
• 精簡——僅有持久化的 bash 加上 str_replace_editor。專為重現基準測試運行而建置;這是 DeepSeek 用於 V4 Flash Terminal-Bench 82.7 成績的預設。精簡並非無害——shell 存取仍然是 shell 存取。
• Creator — 第四個預設目錄字面上就叫 cordis — 標準版加上執行期檢查、記憶體中的 Cordis 外掛實驗,以及預設集編寫。代理可以在對話中途安裝、替換或銷毀外掛。這是工程環境,而非生產審批層。

你應該選哪一個?如果你是要重現基準測試,選 Minimal。如果你希望代理程式自行編寫多步驟的編排流程,選 Code。如果你正在建置或測試外掛程式,選 Creator。至於其他所有情況,先從 Standard 開始——權限範圍愈廣,你愈需要嚴格的工作區與權限政策。
軌跡:評論家稱之為「代理的 DevTools」的功能
實機評測中最受好評的功能是Trajectory。每次執行都會寫入僅能附加(append-only)的工作階段日誌——以 zstd 壓縮的 JSONL 格式,採用統一的類型、順序、時間與資料事件封套——記錄模型所見的一切:系統提示、推理過程、工具呼叫與結果、子代理排程、上下文注入。Trajectory 檢視支援依來源檢查、繼續、分支(fork)、搜尋與重播。分支是一大亮點:你可以變更一個指令,然後與原始執行並排重播,而不必丟棄追蹤紀錄。
具體而言,在8月15日發布的一項實作測試中,單一檔案寫入任務產生了61個工作階段事件,而一個簡單的「回覆PONG」任務在首次請求時仍消耗了約13,467個輸入token——這些開銷來自預設系統提示、工具結構描述、自動注入的儲存庫規則與技能摘要。這就是一個記錄所有內容的測試框架的真實成本:你為這些輔助架構付出token,而且可以確切看到你為哪些項目付費。

MCP、外掛程式,以及與其他代理對話
MCP 正是炒作熱度超越目前實作的領域。這個 monorepo 包含 mcp 套件,CLI 也隨附 dsh-mcp-client 依賴,但預設並未啟用任何 MCP server,而且架構是透過 Cordis 外掛來整合工具,而非將 MCP 視為一級公民。你可以將 MCP server 連接為工具來源;只是目前這還不是預設路徑。
更令人意外的是子代理提供者清單所顯示的內容。DSH 可以產生其他代理程式作為子代理——根據 capability-seams 文件,其中包括 Codex 提供者和 Claude Code 提供者。對競爭對手而言,這是個不尋常的立場:DSH 是一個可以將工作委派給那些與它一同被評測之產品的框架。
外掛這條故事線才是真正的平台賭注。DeepSeek 已預留外掛商店,社群儲存庫也加上標籤以利探索,而且第三方應用程式內商店早已存在。0.2.0-rc.2 版本說明大半篇幅都用於外掛安裝指引——區分已安裝、不相容與隨附外掛——而工程心力仍持續投入於此。長遠的布局是:成為生態系的是框架,而非模型,這正是為何圍繞 DSH 的定價討論,比任何單一功能都來得重要。
今天如何執行它
你需要 Node.js 22.19 或更新版本 — 套件清單要求 ^22.19.0 或 >=24 — 然後只需一個指令:
npx @deepseek-ai/dsh web
這會啟動 Web UI,預設在 http://127.0.0.1:3080 提供服務。在 UI 中:開啟「設定」→「模型」,貼上 DeepSeek API 金鑰,然後選擇工作區——在你完成這些步驟之前,工作階段編輯器會保持鎖定。預設模型是 DeepSeek V4.1 Flash,預設權限原則為 workspace-write,其他所有操作都會顯示核准提示。
現在有五個進入點:Web UI、打包好的桌面應用程式、無頭一次性執行、透過 JSON-RPC stdio 驅動 DSH 的 Python SDK,以及 --dump-config,它會印出組裝後的外掛樹狀結構(web profile 組裝出 129 行的外掛設定;無頭模式則是 81 行)。本週有變動的是桌面應用程式。DeepSeek 發布了 macOS 與 Windows 的組建版本——包含 Intel Mac,而我們九月的筆記載明當時 Intel 組建會出現 404——而每個桌面版消息來源都回報版本 0.2.0-rc.2,發布日期為 9 月 29 日。0.2 版的說明也把 dsh 指令打包進桌面應用程式以管理外掛,因此這條路徑不再需要另外安裝 Node 或 pnpm。DeepSeek 自家的公告宣稱外掛與 Workspaces 在 0.2 中開箱即支援——這是廠商對一個候選版本的說法,不過應用程式與 CLI 共用的外掛頁面與工作區儲存庫在公開儲存庫中確實可見。Linux 是 DeepSeek 自家公告點名的例外:打包腳本支援的目標組合為 mac-arm64、mac-x64 與 win-x64,DeepSeek 的下載主機底下沒有任何 Linux 成品,而 Linux 使用者被指示執行 npx @deepseek-ai/dsh web。從原始碼建置的路徑不變:git clone、pnpm install、pnpm run build,然後 pnpm dsh web。
誠實的部分:預覽等級,以及 DSH 不適用的地方
DSH 的版本是 0.2.0-rc.2——不是 1.0,甚至還算不上穩定的 0.x:npm 上全部 29 個版本,以及 GitHub 上全部 24 個發行版,都是搶先預覽版,而 README 也寫得很明確:「將會有破壞相容性的變更。」發布初期的評論記錄了各種粗糙的邊角——Windows 上 MSYS2 環境下的無聲失敗、熱重載快取過期、約 200 毫秒的批次持久化延遲拖慢了 UI 進度顯示,以及社群批評:一個被定位為公共基礎設施的儲存庫竟停用了 GitHub Issues。相較於被拿來衡量它的那些精緻 coding agent,預設的產品體驗也仍舊落後;一篇實際試用評論總結道,這個開源版本是代理執行環境的鷹架,還算不上完成品。
DSH 在哪些情況下不是正確的工具?四種情境。第一,如果你想要開箱即用的完善體驗——現今的 Claude Code 和 Codex 更為成熟,而 DSH 是為那些想要骨架並願意自行完成的人所打造。第二,如果你無法稽核所執行的內容:外掛程式來源、設定差異與憑證邊界都需自行提供,生產環境使用需要你提供治理機制。第三,如果你在對模型進行基準測試:你不能用 Standard 模式執行一個模型,再用 Minimal 模式執行另一個模型,然後將差異稱作模型結果——你改變的是測試框架,而不只是模型。第四,如果你對 token 開銷的成本敏感:常駐上下文可能在模型執行任何實際工作之前,就消耗數千個輸入 token。
這對 DeepSeek V4.1 Flash 和 DeepSeek V4 Pro 意味著什麼
DSH 預設採用 DeepSeek V4.1 Flash——也就是 DeepSeek 的 API 以 deepseek-flash 名稱提供的模型——以及旗艦級的 DeepSeek V4 Pro 版本(DeepSeek-V4-Pro-0813),而這正是這套測試框架當初打造來執行的同一模型家族。兩者現在都能透過一般的 API 呼叫取得,無需任何測試框架,而且兩者都hosted在 Orca 上、以 DeepSeek 自家的定價提供,零加成、原價轉供:DeepSeek V4.1 Flash 每百萬權杖 $0.15 輸入、$0.60 輸出,DeepSeek V4 Pro 則為 $0.66/$1.98。這些是離峰費率,DeepSeek 會在平日的 UTC 01:00 至 04:00,以及 06:00 至 10:00 期間加倍計費。那張截圖是 DeepSeek V4 0731 模型頁面的八月快照,上面印的 $0.15/$0.29 是那個版本的價格:DeepSeek 的定價頁面現在只列出單一 Flash 項目,deepseek-flash = DeepSeek-V4.1-Flash,價格為 $0.15/$0.60。請把這張卡片當成一份有日期的存檔紀錄,而不是今天的費率。

誠實的界線:OrcaRouter 是模型路由器,不是代理執行環境,所以我們不代管 DSH——它不是模型。路由器在這裡真正能回答的,是 DSH 所引發的容錯移轉問題。這套測試框架是快速演進中的預覽版——今天還是 0.2.0-rc.2,而疊在其上的桌面應用程式又更年輕——把正式環境流量導向它,等於是在押注供應商自行回報的代理能力評分。透過單一金鑰,讓同一批 DeepSeek 模型經過一層路由,即可測試 DSH 的原生效能數據,同時保有自動容錯移轉跨供應商的能力,以因應必須持續運作的流量。這套測試框架是適合拿來實驗的對象;它所執行的模型則是必須謹慎路由的對象。
底線
DeepSeek Harness 是 DeepSeek 自模型本身以來最具影響力的開源成果,因為它改變了「DeepSeek」的意義:不只是模型,還包括執行這些模型的代理層。對於正在決定該怎麼做的讀者:如果你在打造代理,這週就安裝桌面應用程式或 0.2.0-rc.2 命令列,並執行重現測試——DeepSeek 為其 Flash 模型公布的 Terminal-Bench 82.7 成績,就是在這個框架內產生的,現在你可以自己驗證。但請把它當作它本來的樣子:一個開發者預覽版,未來還會有破壞性變更;一個會回報那些喜歡掌控自己技術堆疊者的外掛系統;以及一個仍比精雕細琢的替代方案更粗糙的框架。如果你使用 Linux,套裝應用程式目前還不是你的選擇——npm 才是。底層的模型是可靠的部分,而這些模型你今天就能放心地進行路由。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
