文章「DeepSeek Harness 解析」的 Hero 卡片:大標題為「DeepSeek Harness」,副標題為「Model + Harness = Agent 背後的代理運行環境」,以及三個標籤,內容分別是「MIT 開源」、「2026 年 8 月 13 日」、「v0.1.0-rc.6 預覽版」。OrcaRouter 標誌合成於右下角。
Guides & Insights

DeepSeek Harness 解析:「Model + Harness = Agent」背後的 Agent Runtime

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Deep​Seek Harness(dsh)是其簡稱,它並不是一個模型。它是 Deep​Seek 於 2026 年 8 月 13 日以 MIT 授權釋出的開源智能體執行環境,而且就採用速度而言,它是 Deep​Seek 有史以來最快被採用的產品:新聞報導稱,它在最初 12 小時內就獲得約 50,000 顆 GitHub 星標,而當我們今天查詢 GitHub API 時,該儲存庫已達 125,922 顆星標與 12,523 個 fork。它的角色是介於語言模型與最終任務之間的工程層:包括檔案編輯、終端機執行、網路搜尋、上下文管理、任務規劃,以及呼叫其他智能體。Deep​Seek 自家團隊使用的公式是 模型 + Harness = 智能體——模型負責推理,Harness 負責其餘一切。

這個區別正是本文的重點。搜尋「deepseek harness」的人通常期待看到模型評測,結果卻進到發布報導。所以在此先把答案說清楚:DSH 不是透過 API 呼叫的模型,而是你安裝後執行的程式——npm 套件是 @deepseek-ai/dsh,目前版本 0.1.0-rc.6——它會將你提供給它的任何模型(預設為 DeepSeek V4 Flash)連接到你的檔案系統、終端機、網路,以及其他代理程式。它採用 MIT 授權,建構於名為 Cordis 的外掛框架之上,且明確標示為開發者預覽版,並警告可能會有破壞性變更。以下說明它實際的功能、目前如何執行,以及它的不足之處。

「測試夾具實際上做什麼(以及為什麼這個術語令人困惑)」

框架(harness)是讓原始模型在現實世界中實際運作的支架。單靠模型本身只能產生文字。給它一個框架,它就能讀寫檔案、在你的 shell 中執行指令、搜尋網路、維持計畫、呼叫工具、對錯誤做出反應,並判斷任務何時完成。DeepSeek 的公開公式——在發布報導和其自身的職缺公告中反覆出現——是「Model + Harness = Agent」:模型提供推理能力,框架提供其餘一切。

這就是為什麼這次發布的意義超越單一產品。DeepSeek在該測試框架內報告了其最新兩個模型的智能體基準分數:DeepSeek V4 Flash API文件說明其Terminal-Bench 2.1結果為82.7,是在「DeepSeek Harness minimal mode」下產生的。該測試框架是這些數據所來自的參考環境,現已公開,任何人都可以重現——或反駁。

一切都是插件:Cordis 架構

DSH 的核心設計,如其 README 所述,就是「一切皆為外掛程式」。代理迴圈、模型適配器、工具、技能、工作階段儲存、沙箱、排程,甚至 Web UI,全都是 Cordis 外掛程式。沒有需要修補的特權核心:你可以透過在其他外掛程式旁掛載一個外掛程式來擴充框架,而每次註冊都是一個會在外掛程式卸載時自動解除的效果。外掛程式引擎是 Cordis,一個元框架,其設計見於北京大學–DeepSeek 的論文〈A Programming Paradigm for Spatiotemporal Composability〉。

實際的後果是關注點之間有了明確的分離:外掛程式新增能力;預設組則決定特定代理程式能看到哪些能力。 此 monorepo 在 packages/ 下發布了 49 個套件——core、llm、mcp、sandbox、context、plan、goal 等——發布時涵蓋超過 100 個第一方外掛程式,且外掛程式商店已預留,發布後 24 小時內在 GitHub 上收集了 288 個社群外掛程式儲存庫,可透過 dsh-plugin 主題標籤找到。

四種預設模式 — 以及何時該使用哪一種

DSH 隨附四個代理程式預設集,每個預設集會載入不同的外掛程式集。從 Web UI 自身的預設選單:

Standard — 完整的編碼代理:檔案編輯、Shell、檔案與網頁搜尋、技能、規劃、目標、子代理與工作流程。是大多數工作的正確預設選擇。

Code — 中文媒體報導稱之為 PTC(「程式化工具呼叫」)— 包含 Standard 的所有功能,外加 Code Mode SDK,讓模型能撰寫 TypeScript 程式,在單一程式中組合多步驟的工具呼叫。更強大,但副作用與工具呼叫的數量也可能倍增。

精簡——僅有持久化的 bash 加上 str_replace_editor。專為重現基準測試運行而建置;這是 Deep​Seek 用於 V4 Flash Terminal-Bench 82.7 成績的預設。精簡並非無害——shell 存取仍然是 shell 存取。

Creator — 第四個預設目錄字面上就叫 cordis — 標準版加上執行期檢查、記憶體中的 Cordis 外掛實驗,以及預設集編寫。代理可以在對話中途安裝、替換或銷毀外掛。這是工程環境,而非生產審批層。

Comparison card of the four DSH agent presets: Standard (full coding agent, the default), Code/PTC (programmatic tool calling through a TypeScript Code Mode SDK), Minimal (persistent bash plus str_replace_editor, used for the V4 Flash Terminal-Bench 82.7 run), and Creator/cordis (preset and plugin authoring).

你應該選哪一個?如果你是要重現基準測試,選 Minimal。如果你希望代理程式自行編寫多步驟的編排流程,選 Code。如果你正在建置或測試外掛程式,選 Creator。至於其他所有情況,先從 Standard 開始——權限範圍愈廣,你愈需要嚴格的工作區與權限政策。

軌跡:評論家稱之為「代理的 DevTools」的功能

實機評測中最受好評的功能是Trajectory。每次執行都會寫入僅能附加(append-only)的工作階段日誌——以 zstd 壓縮的 JSONL 格式,採用統一的類型、順序、時間與資料事件封套——記錄模型所見的一切:系統提示、推理過程、工具呼叫與結果、子代理排程、上下文注入。Trajectory 檢視支援依來源檢查、繼續、分支(fork)、搜尋與重播。分支是一大亮點:你可以變更一個指令,然後與原始執行並排重播,而不必丟棄追蹤紀錄。

具體而言,在8月15日發布的一項實作測試中,單一檔案寫入任務產生了61個工作階段事件,而一個簡單的「回覆PONG」任務在首次請求時仍消耗了約13,467個輸入token——這些開銷來自預設系統提示、工具結構描述、自動注入的儲存庫規則與技能摘要。這就是一個記錄所有內容的測試框架的真實成本:你為這些輔助架構付出token,而且可以確切看到你為哪些項目付費。

Trajectory card for DeepSeek Harness: an append-only session event timeline from turn/start through tool/call to turn/end, the JSON event envelope with type, seq, time and data fields, and two statistics — 61 session events for one file-write task and about 13,467 input tokens for a trivial 'reply PONG' first request.

MCP、外掛程式,以及與其他代理對話

MCP 正是炒作熱度超越目前實作的領域。這個 monorepo 包含 mcp 套件,CLI 也隨附 dsh-mcp-client 依賴,但預設並未啟用任何 MCP server,而且架構是透過 Cordis 外掛來整合工具,而非將 MCP 視為一級公民。你可以將 MCP server 連接為工具來源;只是目前這還不是預設路徑。

更令人意外的是子代理提供者清單所顯示的內容。DSH 可以產生其他代理程式作為子代理——根據 capability-seams 文件,其中包括 Codex 提供者和 Claude Code 提供者。對競爭對手而言,這是個不尋常的立場:DSH 是一個可以將工作委派給那些與它一同被評測之產品的框架。

「外掛程式的佈局才是真正的平台豪賭。Deep​Seek 已預留外掛程式商店,社群儲存庫皆加上標籤以利探索,第三方應用程式內商店也早已存在。長遠來看,成為生態系統的是框架(harness),而非模型本身——這就是為什麼圍繞 DSH 的定價討論比任何單一功能都更為重要。」

今天如何執行它

你需要 Node.js 22.19 或更新版本 — 套件清單要求 ^22.19.0 或 >=24 — 然後只需一個指令:

npx @deepseek-ai/dsh web

這會啟動 Web UI,預設服務於 http://127.0.0.1:3080。在 UI 中:開啟 Settings → Models,貼上 DeepSeek API 金鑰,然後選擇工作區——在您完成這些操作之前,會話編輯器會保持鎖定。預設模型為 DeepSeek V4 Flash,預設權限原則為 workspace-write,其他一切操作皆會出現核准提示。

總共有四個進入點:Web UI、無頭單次執行、透過 JSON-RPC stdio 驅動 DSH 的 Python SDK,以及 --dump-config(它會列印組合後的插件樹;web 設定檔會組裝 129 行插件設定,headless 則為 81 行)。從原始碼開始的路徑是 git clone、pnpm install、pnpm run build,然後執行 pnpm dsh web。

誠實的部分:預覽等級,以及 DSH 不適用的地方

DSH 目前是 0.1.0-rc.6 版本,README 中明確寫道:「將會有破壞相容性的變更。」本週發表的評測列出了各種粗糙之處——在 Windows 上的 MSYS2 環境中會靜默失敗、熱重載快取過時、約 200 毫秒的批次持久化延遲拖慢了 UI 進度顯示,以及社群批評在定位為公共基礎設施的儲存庫上停用了 GitHub Issues。預設的產品體驗也仍落後於它所被拿來比較的那些精緻 coding agent;一篇實測評測的結論是,這個開源版本是一個 agent 執行時框架,還不是一個完成的產品。

DSH 在哪些情況下不是正確的工具?四種情境。第一,如果你想要開箱即用的完善體驗——現今的 Claude Code 和 Codex 更為成熟,而 DSH 是為那些想要骨架並願意自行完成的人所打造。第二,如果你無法稽核所執行的內容:外掛程式來源、設定差異與憑證邊界都需自行提供,生產環境使用需要你提供治理機制。第三,如果你在對模型進行基準測試:你不能用 Standard 模式執行一個模型,再用 Minimal 模式執行另一個模型,然後將差異稱作模型結果——你改變的是測試框架,而不只是模型。第四,如果你對 token 開銷的成本敏感:常駐上下文可能在模型執行任何實際工作之前,就消耗數千個輸入 token。

這對 DeepSeek V4 Flash 和 DeepSeek V4 Pro 意味著什麼

DSH 預設使用 DeepSeek V4 Flash,而旗艦版的 DeepSeek V4 Pro 建置(Deep​Seek-V4-Pro-0813)正是該測試框架所設計執行的同一個模型系列。兩者現今都可透過一般 API 呼叫取得——無需測試框架——且兩者皆託管於 OrcaRouter,並以 Deep​Seek 自身的定價提供:DeepSeek V4 Flash 大約每百萬輸入 token 0.15 美元、每百萬輸出 token 0.29 美元;DeepSeek V4 Pro 則大約為 0.44/0.88 美元,且以 0% 加成轉傳。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash 0731: about $0.15 input and $0.29 output per million tokens, a 1M-token context window, 384K max output, 284B total / 13B active parameters, and a Terminal-Bench 2.1 score of 82.7.

誠實的界線:OrcaRouter 是模型路由器,而不是代理執行環境,因此我們不託管 DSH——它不是一個模型。路由器在此真正能回答的,是 DSH 所引發的故障轉移問題。該測試平台是快速變動的預覽版,將生產流量指向它,就等於是在賭廠商回報的代理效能分數。透過單一金鑰在路由層上運行相同的 DeepSeek 模型,你可以測試 DSH 的原生數據,同時為必須持續運作的流量保留跨廠商的自動故障轉移。測試平台是拿來實驗的對象;它所運行的模型,才是需要謹慎路由的對象。

底線

Deep​Seek Harness 是 Deep​Seek 自模型本身以來開源的最具影響力的項目,因為它改變了「Deep​Seek」的意義:不只是模型,更是運行這些模型的代理層。對於正在決定該怎麼做的讀者:如果你在打造代理,這週就安裝它並執行重現測試——Deep​Seek 發布的 V4 Flash 與 V4 Pro 分數正是出自這套 harness,現在你可以自行驗證。但請如實看待它:這是一個 0.1.0-rc.6 開發者預覽版,前方有破壞性變更;它的外掛系統獎勵那些喜歡掌控自身技術棧的人;而且它仍比打磨精良的替代方案更為粗糙。底層的模型才是可靠的部分——那些你今天就可以放心地路由。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube