
DeepSeek Harness 解析:「Model + Harness = Agent」背後的 Agent Runtime
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
DeepSeek Harness(dsh)是其簡稱,它並不是一個模型。它是 DeepSeek 於 2026 年 8 月 13 日以 MIT 授權釋出的開源智能體執行環境,而且就採用速度而言,它是 DeepSeek 有史以來最快被採用的產品:新聞報導稱,它在最初 12 小時內就獲得約 50,000 顆 GitHub 星標,而當我們今天查詢 GitHub API 時,該儲存庫已達 125,922 顆星標與 12,523 個 fork。它的角色是介於語言模型與最終任務之間的工程層:包括檔案編輯、終端機執行、網路搜尋、上下文管理、任務規劃,以及呼叫其他智能體。DeepSeek 自家團隊使用的公式是 模型 + Harness = 智能體——模型負責推理,Harness 負責其餘一切。
這個區別正是本文的重點。搜尋「deepseek harness」的人通常期待看到模型評測,結果卻進到發布報導。所以在此先把答案說清楚:DSH 不是透過 API 呼叫的模型,而是你安裝後執行的程式——npm 套件是 @deepseek-ai/dsh,目前版本 0.1.0-rc.6——它會將你提供給它的任何模型(預設為 DeepSeek V4 Flash)連接到你的檔案系統、終端機、網路,以及其他代理程式。它採用 MIT 授權,建構於名為 Cordis 的外掛框架之上,且明確標示為開發者預覽版,並警告可能會有破壞性變更。以下說明它實際的功能、目前如何執行,以及它的不足之處。
「測試夾具實際上做什麼(以及為什麼這個術語令人困惑)」
框架(harness)是讓原始模型在現實世界中實際運作的支架。單靠模型本身只能產生文字。給它一個框架,它就能讀寫檔案、在你的 shell 中執行指令、搜尋網路、維持計畫、呼叫工具、對錯誤做出反應,並判斷任務何時完成。DeepSeek 的公開公式——在發布報導和其自身的職缺公告中反覆出現——是「Model + Harness = Agent」:模型提供推理能力,框架提供其餘一切。
這就是為什麼這次發布的意義超越單一產品。DeepSeek在該測試框架內報告了其最新兩個模型的智能體基準分數:DeepSeek V4 Flash API文件說明其Terminal-Bench 2.1結果為82.7,是在「DeepSeek Harness minimal mode」下產生的。該測試框架是這些數據所來自的參考環境,現已公開,任何人都可以重現——或反駁。
一切都是插件:Cordis 架構
DSH 的核心設計,如其 README 所述,就是「一切皆為外掛程式」。代理迴圈、模型適配器、工具、技能、工作階段儲存、沙箱、排程,甚至 Web UI,全都是 Cordis 外掛程式。沒有需要修補的特權核心:你可以透過在其他外掛程式旁掛載一個外掛程式來擴充框架,而每次註冊都是一個會在外掛程式卸載時自動解除的效果。外掛程式引擎是 Cordis,一個元框架,其設計見於北京大學–DeepSeek 的論文〈A Programming Paradigm for Spatiotemporal Composability〉。
實際的後果是關注點之間有了明確的分離:外掛程式新增能力;預設組則決定特定代理程式能看到哪些能力。 此 monorepo 在 packages/ 下發布了 49 個套件——core、llm、mcp、sandbox、context、plan、goal 等——發布時涵蓋超過 100 個第一方外掛程式,且外掛程式商店已預留,發布後 24 小時內在 GitHub 上收集了 288 個社群外掛程式儲存庫,可透過 dsh-plugin 主題標籤找到。
四種預設模式 — 以及何時該使用哪一種
DSH 隨附四個代理程式預設集,每個預設集會載入不同的外掛程式集。從 Web UI 自身的預設選單:
• Standard — 完整的編碼代理:檔案編輯、Shell、檔案與網頁搜尋、技能、規劃、目標、子代理與工作流程。是大多數工作的正確預設選擇。
• Code — 中文媒體報導稱之為 PTC(「程式化工具呼叫」)— 包含 Standard 的所有功能,外加 Code Mode SDK,讓模型能撰寫 TypeScript 程式,在單一程式中組合多步驟的工具呼叫。更強大,但副作用與工具呼叫的數量也可能倍增。
• 精簡——僅有持久化的 bash 加上 str_replace_editor。專為重現基準測試運行而建置;這是 DeepSeek 用於 V4 Flash Terminal-Bench 82.7 成績的預設。精簡並非無害——shell 存取仍然是 shell 存取。
• Creator — 第四個預設目錄字面上就叫 cordis — 標準版加上執行期檢查、記憶體中的 Cordis 外掛實驗,以及預設集編寫。代理可以在對話中途安裝、替換或銷毀外掛。這是工程環境,而非生產審批層。

你應該選哪一個?如果你是要重現基準測試,選 Minimal。如果你希望代理程式自行編寫多步驟的編排流程,選 Code。如果你正在建置或測試外掛程式,選 Creator。至於其他所有情況,先從 Standard 開始——權限範圍愈廣,你愈需要嚴格的工作區與權限政策。
軌跡:評論家稱之為「代理的 DevTools」的功能
實機評測中最受好評的功能是Trajectory。每次執行都會寫入僅能附加(append-only)的工作階段日誌——以 zstd 壓縮的 JSONL 格式,採用統一的類型、順序、時間與資料事件封套——記錄模型所見的一切:系統提示、推理過程、工具呼叫與結果、子代理排程、上下文注入。Trajectory 檢視支援依來源檢查、繼續、分支(fork)、搜尋與重播。分支是一大亮點:你可以變更一個指令,然後與原始執行並排重播,而不必丟棄追蹤紀錄。
具體而言,在8月15日發布的一項實作測試中,單一檔案寫入任務產生了61個工作階段事件,而一個簡單的「回覆PONG」任務在首次請求時仍消耗了約13,467個輸入token——這些開銷來自預設系統提示、工具結構描述、自動注入的儲存庫規則與技能摘要。這就是一個記錄所有內容的測試框架的真實成本:你為這些輔助架構付出token,而且可以確切看到你為哪些項目付費。

MCP、外掛程式,以及與其他代理對話
MCP 正是炒作熱度超越目前實作的領域。這個 monorepo 包含 mcp 套件,CLI 也隨附 dsh-mcp-client 依賴,但預設並未啟用任何 MCP server,而且架構是透過 Cordis 外掛來整合工具,而非將 MCP 視為一級公民。你可以將 MCP server 連接為工具來源;只是目前這還不是預設路徑。
更令人意外的是子代理提供者清單所顯示的內容。DSH 可以產生其他代理程式作為子代理——根據 capability-seams 文件,其中包括 Codex 提供者和 Claude Code 提供者。對競爭對手而言,這是個不尋常的立場:DSH 是一個可以將工作委派給那些與它一同被評測之產品的框架。
「外掛程式的佈局才是真正的平台豪賭。DeepSeek 已預留外掛程式商店,社群儲存庫皆加上標籤以利探索,第三方應用程式內商店也早已存在。長遠來看,成為生態系統的是框架(harness),而非模型本身——這就是為什麼圍繞 DSH 的定價討論比任何單一功能都更為重要。」
今天如何執行它
你需要 Node.js 22.19 或更新版本 — 套件清單要求 ^22.19.0 或 >=24 — 然後只需一個指令:
npx @deepseek-ai/dsh web
這會啟動 Web UI,預設服務於 http://127.0.0.1:3080。在 UI 中:開啟 Settings → Models,貼上 DeepSeek API 金鑰,然後選擇工作區——在您完成這些操作之前,會話編輯器會保持鎖定。預設模型為 DeepSeek V4 Flash,預設權限原則為 workspace-write,其他一切操作皆會出現核准提示。
總共有四個進入點:Web UI、無頭單次執行、透過 JSON-RPC stdio 驅動 DSH 的 Python SDK,以及 --dump-config(它會列印組合後的插件樹;web 設定檔會組裝 129 行插件設定,headless 則為 81 行)。從原始碼開始的路徑是 git clone、pnpm install、pnpm run build,然後執行 pnpm dsh web。
誠實的部分:預覽等級,以及 DSH 不適用的地方
DSH 目前是 0.1.0-rc.6 版本,README 中明確寫道:「將會有破壞相容性的變更。」本週發表的評測列出了各種粗糙之處——在 Windows 上的 MSYS2 環境中會靜默失敗、熱重載快取過時、約 200 毫秒的批次持久化延遲拖慢了 UI 進度顯示,以及社群批評在定位為公共基礎設施的儲存庫上停用了 GitHub Issues。預設的產品體驗也仍落後於它所被拿來比較的那些精緻 coding agent;一篇實測評測的結論是,這個開源版本是一個 agent 執行時框架,還不是一個完成的產品。
DSH 在哪些情況下不是正確的工具?四種情境。第一,如果你想要開箱即用的完善體驗——現今的 Claude Code 和 Codex 更為成熟,而 DSH 是為那些想要骨架並願意自行完成的人所打造。第二,如果你無法稽核所執行的內容:外掛程式來源、設定差異與憑證邊界都需自行提供,生產環境使用需要你提供治理機制。第三,如果你在對模型進行基準測試:你不能用 Standard 模式執行一個模型,再用 Minimal 模式執行另一個模型,然後將差異稱作模型結果——你改變的是測試框架,而不只是模型。第四,如果你對 token 開銷的成本敏感:常駐上下文可能在模型執行任何實際工作之前,就消耗數千個輸入 token。
這對 DeepSeek V4 Flash 和 DeepSeek V4 Pro 意味著什麼
DSH 預設使用 DeepSeek V4 Flash,而旗艦版的 DeepSeek V4 Pro 建置(DeepSeek-V4-Pro-0813)正是該測試框架所設計執行的同一個模型系列。兩者現今都可透過一般 API 呼叫取得——無需測試框架——且兩者皆託管於 OrcaRouter,並以 DeepSeek 自身的定價提供:DeepSeek V4 Flash 大約每百萬輸入 token 0.15 美元、每百萬輸出 token 0.29 美元;DeepSeek V4 Pro 則大約為 0.44/0.88 美元,且以 0% 加成轉傳。

誠實的界線:OrcaRouter 是模型路由器,而不是代理執行環境,因此我們不託管 DSH——它不是一個模型。路由器在此真正能回答的,是 DSH 所引發的故障轉移問題。該測試平台是快速變動的預覽版,將生產流量指向它,就等於是在賭廠商回報的代理效能分數。透過單一金鑰在路由層上運行相同的 DeepSeek 模型,你可以測試 DSH 的原生數據,同時為必須持續運作的流量保留跨廠商的自動故障轉移。測試平台是拿來實驗的對象;它所運行的模型,才是需要謹慎路由的對象。
底線
DeepSeek Harness 是 DeepSeek 自模型本身以來開源的最具影響力的項目,因為它改變了「DeepSeek」的意義:不只是模型,更是運行這些模型的代理層。對於正在決定該怎麼做的讀者:如果你在打造代理,這週就安裝它並執行重現測試——DeepSeek 發布的 V4 Flash 與 V4 Pro 分數正是出自這套 harness,現在你可以自行驗證。但請如實看待它:這是一個 0.1.0-rc.6 開發者預覽版,前方有破壞性變更;它的外掛系統獎勵那些喜歡掌控自身技術棧的人;而且它仍比打磨精良的替代方案更為粗糙。底層的模型才是可靠的部分——那些你今天就可以放心地路由。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
