文章《DeepSeek Harness 详解》的 Hero 卡片:大标题为“DeepSeek Harness”,副标题为“Model + Harness = Agent 背后的智能体运行时”,以及三个标签:“MIT 开源”“2026年8月13日”“v0.1.0-rc.6 预览版”。OrcaRouter 徽标合成于右下角。
Guides & Insights

DeepSeek Harness 解析:“模型 + Harness = 智能体”背后的智能体运行时

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek Harness——dsh是其简称——并不是一个模型。它是 DeepSeek 于 2026 年 8 月 13 日以 MIT 许可证发布的开源智能体运行时,而且按采用速度衡量,它仍是 DeepSeek 发布过的最快产品:媒体报道称,它在最初 12 小时内收获了约 50,000 个 GitHub 星标,而我们今天读取 GitHub API 时,该仓库已有 242,211 个星标和 29,059 个复刻。它运行的是 DeepSeek V4.1 Flash,即 DeepSeek API 以 deepseek-flash 这一名称提供的模型;或者,当你将它指向更大的 DeepSeek V4 Pro 时,它运行的就是后者。它的职责是充当语言模型与已完成任务之间的工程层:文件编辑、终端执行、网页搜索、上下文管理、任务规划,以及调用其他智能体。DeepSeek 自己的团队所用的公式是 模型 + 运行框架 = 智能体——模型负责推理,运行框架负责其余一切。

这一区别正是本文的重点。搜索“deepseek harness”的人通常期待看到的是模型评测,结果却落在了发布报道上。所以先把答案放在前面:DSH 并不是一个通过 API 调用的模型,而是一个你需要安装并运行的程序——对应的 npm 包是@deepseek-ai/dsh,其 latest 标签如今解析为 0.2.0-rc.2——比本页最初撰写时所依据的 0.1.x 构建版晚了三个发布线,也比上方卡片上的版本标签更新——它会把你的任意模型(默认是 DeepSeek V4.1 Flash)连接到你的文件系统、终端、网络以及其他智能体。它采用 MIT 许可,构建在一个名为 Cordis 的插件框架之上,并且明确是一个会警告存在破坏性变更的开发者预览版。DeepSeek 于 10 月 2 日宣布的打包桌面应用——包含 macOS 和 Windows 版本,Linux 用户则被引导使用 npm 包——是它之上的最新界面。下面是它实际能做什么、如今如何运行它,以及它在哪些方面有所不足。

测试夹具(harness)实际上做什么(以及为什么这个术语令人困惑)

框架(harness)是让原始模型在现实世界中开展工作的脚手架。仅靠模型本身只能生成文本。为它配上框架后,它就能读写文件、在你的 shell 中运行命令、搜索网页、维护计划、调用工具、对错误做出反应,并判断任务何时完成。Deep​Seek 公开的公式——在发布报道及其自身招聘信息中反复出现——就是"Model + Harness = Agent":模型提供推理能力,框架提供其余一切。

这就是这次发布的意义远超单一产品的原因。Deep​Seek 在该框架内为其最新两个模型报告了自己的智能体基准测试分数:DeepSeek V4 Flash API 文档指出,其 Terminal-Bench 2.1 的 82.7 分是在“Deep​Seek Harness minimal mode”下得出的。该框架正是这些数字所来源的参考环境,现在它已公开,任何人都可以复现——或反驳。

一切皆插件:Cordis 架构

DSH 的核心设计,如其自己的 README 所述,就是一切皆插件。智能体循环、模型适配器、工具、技能、会话存储、沙箱、调度乃至 Web UI 全都是 Cordis 插件。没有需要修补的特权核心:在其余插件旁边挂载一个插件,就能扩展宿主框架;而每次注册都是一种效应,会在插件卸载时自动解除。插件引擎是 Cordis,一个元框架,其设计见于北京大学–DeepSeek 的论文《面向时空可组合性的编程范式》。

实际结果是关注点的明确分离:插件添加能力;预设决定某个代理能够看到哪些能力。 这个 monorepo 现在在 packages/ 下包含 55 个包——core、llm、mcp、sandbox、context、plan、goal、workspace 等等——发布时覆盖范围统计到 100 多个第一方插件,且已预留一个插件商店,并在发布后 24 小时内在 GitHub 上收集到 288 个社区插件仓库。那是六周前。DeepSeek 用于插件可发现性的 dsh-plugin 主题现在在 GitHub 搜索中返回超过 17,000 个仓库,这是我们在 2026 年 10 月 2 日看到的——即使框架本身仍停留在候选版本上,生态系统仍在持续增长。

四个预设 — 以及何时使用哪一个

DSH 自带四个代理预设,每个预设加载不同的插件集。从 Web UI 自身的预设菜单中:

• 标准 — 一个完整的编码代理:文件编辑、Shell、文件和网页搜索、技能、规划、目标、子代理和工作流。适用于大多数工作的正确默认选择。

• Code——在中国媒体报道中被称为 PTC("程序化工具调用")——包含 Standard 的全部功能,外加一个 Code Mode SDK,可让模型编写 TypeScript 程序,将多步骤工具调用组合到一个程序中。更强大,而且可能成倍增加副作用和工具调用。

• Minimal——仅包含持久化 bash 与 str_replace_editor。专为复现基准测试运行而构建;这正是 Deep​Seek 在 V4 Flash Terminal-Bench 82.7 数据中所用的预设。Minimal 并非无害——拥有 shell 访问权限仍然是 shell 访问权限。

• Creator——第四个预设目录确实就叫 cordis——包含 Standard,以及运行时检查、内存中的 Cordis 插件实验和预设编写。智能体可以在对话中途安装、替换或销毁插件。这是一个工程环境,而非生产审批层。

Comparison card of the four DSH agent presets: Standard (full coding agent, the default), Code/PTC (programmatic tool calling through a TypeScript Code Mode SDK), Minimal (persistent bash plus str_replace_editor, used for the V4 Flash Terminal-Bench 82.7 run), and Creator/cordis (preset and plugin authoring).

你应该选哪一个?如果你是在复现基准测试,选 Minimal。如果你希望智能体自行编写多步骤编排,选 Code。如果你正在构建或测试插件,选 Creator。对于其他所有情况,从 Standard 开始——权限范围广,意味着你同样需要严密的工作区和权限策略。

轨迹:评论者所称的“面向智能体的 DevTools”功能

实操评测中最受称赞的功能是Trajectory。每次运行都会写入一个仅追加的会话日志——采用 zstd 压缩的 JSONL 格式,具有统一的类型、序列、时间和数据事件封装——记录模型看到的所有内容:系统提示、推理、工具调用及结果、子代理调度、上下文注入。Trajectory 视图支持按来源检查、恢复、分支、搜索和重放。分支是最突出的操作:你可以更改一条指令,并与原始运行并排重放,而不是丢弃轨迹。

具体来说,在8月15日发布的一项实操测试中,单个文件写入任务产生了61个会话事件,而一个微不足道的"回复PONG"任务在首次请求时仍消耗了约13,467个输入token——这些开销来自默认系统提示、工具模式、自动注入的仓库规则和技能摘要。这就是一个记录一切的工具框架的真实成本:你为脚手架支付token,并且能确切看到你支付了什么。

Trajectory card for DeepSeek Harness: an append-only session event timeline from turn/start through tool/call to turn/end, the JSON event envelope with type, seq, time and data fields, and two statistics — 61 session events for one file-write task and about 13,467 input tokens for a trivial 'reply PONG' first request.

MCP、插件以及与其他智能体对话

MCP 就是那种炒作超前于当前实现的情况。该 monorepo 包含一个 mcp 包,CLI 附带 dsh-mcp-client 依赖,但默认没有启用任何 MCP 服务器,而且架构通过 Cordis 插件来路由工具集成,而非将 MCP 作为一等公民对待。你可以将 MCP 服务器作为工具源连接;只是这还不是默认路径。

更令人惊讶的是子代理提供商列表所显示的内容。DSH 可以将其他代理作为子代理生成——根据 capability-seams 文档,其中包括 Codex 提供商和 Claude Code 提供商。竞争对手采取这样的立场并不寻常:DSH 是一个框架,可以将工作委托给它所对标的那些产品本身。

插件这块才是真正的平台赌注。Deep​Seek 已经预留了一个插件商店,社区仓库被打上标签以便被发现,第三方应用内商店也已经存在。0.2.0-rc.2 的发布说明把大部分篇幅花在插件安装指南上——区分已安装、不兼容和捆绑插件——工程投入也仍在朝这个方向走。长远来看,成为生态系统的是运行框架,而不是模型,这就是为什么围绕 DSH 的定价讨论比任何单个功能都更重要。

今天如何运行它

你需要 Node.js 22.19 或更高版本 — 包清单要求 ^22.19.0 或 >=24 — 然后只需一条命令:

npx @deepseek-ai/dsh web

这会启动 Web UI,默认在 http://127.0.0.1:3080 提供服务。在 UI 中:打开 Settings → Models,粘贴 DeepSeek API 密钥,然后选择一个工作区——在你完成这一步之前,会话输入框会一直处于锁定状态。默认模型是 DeepSeek V4.1 Flash,默认权限策略为 workspace-write,其他所有操作都需要审批提示。

现在有五个入口点:Web UI、打包好的桌面应用、无头一次性运行、通过 JSON-RPC stdio 驱动 DSH 的 Python SDK,以及 --dump-config——它会打印组装后的插件树(web 配置文件组装出了 129 行插件配置;无头模式为 81 行)。本周发生变化的是桌面应用。DeepSeek 发布了适用于 macOS 和 Windows 的构建版本——包括 Intel Mac,而我们 9 月的记录中曾记载 Intel 构建版本会返回 404——并且每个桌面端 feed 都报告版本为 0.2.0-rc.2,发布日期为 9 月 29 日。0.2 的说明还把 dsh 命令打包进桌面应用以进行插件管理,因此这条路径不再需要单独安装 Node 或 pnpm。DeepSeek 自己的公告称,插件和 Workspaces 在 0.2 中开箱即用——这是一个关于候选版本的厂商说法,不过插件页面以及应用与 CLI 共享的工作区存储都可以在公开仓库中看到。Linux 是 DeepSeek 自己在公告中点名的例外:打包脚本支持的目标集合是 mac-arm64、mac-x64 和 win-x64,DeepSeek 的下载主机下不存在任何 Linux 制品,Linux 用户被告知运行 npx @deepseek-ai/dsh web。从源码构建的路径没有变化:git clone、pnpm install、pnpm run build,然后 pnpm dsh web。

实话实说:预览级,以及DSH并不适用的场景。

DSH 的版本是 0.2.0-rc.2——不是 1.0,甚至也还不是一个稳定的 0.x:npm 上的全部 29 个版本和 GitHub 上的全部 24 个 release 都是预发布版本,而 README 说得很明确:“将会有破坏兼容性的变更。”来自发布期的评测盘点了它的种种粗糙之处——Windows 上 MSYS2 环境中的静默失败、热重载缓存陈旧、约 200 毫秒的批量持久化延迟使 UI 进度显示滞后,以及社区的批评:一个被定位为公共基础设施的仓库却关闭了 GitHub Issues。默认的产品体验也依然落后于作为其衡量标杆的那些打磨精良的编码智能体;一篇上手评测得出的结论是,这次开源发布只是一个智能体运行时脚手架,还不是一款成品。

DSH 在哪些场景下是不合适的工具?四种情况。首先,如果你想要开箱即用的完善体验——如今的 Claude Code 和 Codex 更加成熟,而 DSH 面向那些想要脚手架并愿意自己完善的人。其次,如果你无法审计你所运行的内容:插件来源、配置差异和凭据边界都需要自行提供,生产环境使用需要你自行治理。第三,如果你在评测模型:你不能用一个模型跑 Standard 模式、另一个跑 Minimal 模式,然后声称差异是模型本身的结果——你改变的是测试框架,而不只是模型。第四,如果你对 Token 开销的成本敏感:常驻上下文可能在模型做任何实际工作之前就消耗数千个输入 Token。

这对 DeepSeek V4.1 Flash 和 DeepSeek V4 Pro 意味着什么

DSH 默认使用 DeepSeek V4.1 Flash——即 DeepSeek 的 API 以 deepseek-flash 提供的那个模型——而旗舰级的 DeepSeek V4 Pro 构建(DeepSeek-V4-Pro-0813)正是该测试框架为运行而打造的同一模型系列。两者如今都可以通过普通的 API 调用获得,无需任何测试框架,并且都托管在 OrcaRouter 上,按 DeepSeek 自己的标价提供,以 0% 加价原样传递:DeepSeek V4.1 Flash 为每百万 token 输入 $0.15、输出 $0.60,DeepSeek V4 Pro 为 $0.66/$1.98。这些是低谷时段费率,DeepSeek 会在工作日 UTC 01:00 至 04:00 以及 06:00 至 10:00 之间将其翻倍。下方截图是 DeepSeek V4 Flash 0731 模型页面的 8 月快照,其中显示的 $0.15/$0.29 是那个版本的价格:DeepSeek 的定价页面现在只列出一个 Flash 条目,即 deepseek-flash = DeepSeek-V4.1-Flash,价格为 $0.15/$0.60。请把这张卡片视为一份带日期的存档快照,而不是今天的费率。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash 0731: about $0.15 input and $0.29 output per million tokens, a 1M-token context window, 384K max output, 284B total / 13B active parameters, and a Terminal-Bench 2.1 score of 82.7.

实话实说的边界:OrcaRouter 是模型路由器,不是智能体运行时,所以我们并不托管 DSH——它不是一个模型。路由器在这里真正解决的,是 DSH 所提出的故障转移问题。这个 harness 是一个快速迭代的预览版本——今天是 0.2.0-rc.2,居于其上的桌面应用则更加年轻——把生产流量指向它,就等于押注于厂商自报的智能体评分。通过一个密钥、经由路由层运行同样的 Deep​Seek 模型,让你既能测试 DSH 的原生数据,又能保持自动故障转移在供应商之间,以保障那些必须持续可用的流量。harness 是值得去试验的东西;它所运行的模型则是需要谨慎路由的东西。

最重要的一点

DeepSeek Harness 是 DeepSeek 自模型本身以来开源的最具影响力的事物,因为它改变了“DeepSeek”的含义:不只是模型,还有运行它们的智能体层。对于正在决定该怎么做的读者:如果你构建智能体,本周就安装桌面应用或 0.2.0-rc.2 命令行,并运行复现测试——DeepSeek 为其 Flash 模型发布的 Terminal-Bench 82.7 就是在这个 harness 里产出的,现在你可以自己验证。但要把它当作它本来的样子:一个前方还会有破坏性变更的开发者预览版,一个奖励那些喜欢掌控自己技术栈的人的插件系统,以及一个仍比那些打磨精良的替代方案更粗糙的 harness。如果你使用 Linux,打包好的应用目前还不适合你——npm 才是。底层的模型是可靠的部分,而今天你就可以有信心地路由到它们。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新