
如何使用 DeepSeek DSH:DeepSeek 开源 Agent Harness 实操指南
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 19 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1337 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2276 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
DSH —— DeepSeek Harness —— 是 DeepSeek 于 2026 年 8 月 13 日开源的一个智能体运行时,它并不是一个模型。它是一个位于模型与终端之间的 harness,为语言模型提供文件编辑、Shell、检索、规划和工具调用能力,并记录每一步操作,以便你重放它的行为。简明扼要的回答是:安装 Node.js,运行 npx @deepseek-ai/dsh web,打开 http://127.0.0.1:3080,添加 API 密钥,选择一个预设,然后开始会话。下面是一个你可以实际使用的版本——四个预设、将它作为编码智能体驱动、读取 Trajectory、接入 MCP,以及发布报道略过的预览版注意事项。你最有可能接入的两个模型——DeepSeek V4 Flash 和 DeepSeek V4 Pro——在文中均有提及。
这是一份使用指南,不是发布回顾。泄露脉络和发布日期我们已分别在别的文章中介绍过;这里要谈的是搜索者真正关心的问题——安装好之后如何使用。信息来源随文标注:DeepSeek 自己的代码仓库和文档对应 DSH 声称的内容;注明了日期的中国科技媒体(极客公园、澎湃新闻)以及社区代码仓库,则对应人们实际运行后的反馈。
DSH 是什么(以及它不是什么)
DeepSeek 的内部公式是 Model + Harness = Agent,而 DSH 就是其中的 Harness 部分。模型负责推理;Harness 负责决定何时将工具交给它、读取文件、运行 shell 命令、将错误输出反馈到循环中,并判断任务何时完成。DSH 已于 2026 年 8 月 13 日北京时间晚上 8:30 左右以 MIT 许可证开源,使用 TypeScript 编写,并以 v0.1 开发者预览版形式发布。其 star 历史是大家津津乐道的地方:晚上 9:05 约 7,300 star,晚上 9:51 达到 15,500,公告发布后约两小时内突破 10,000,十二小时内达到 50,000,约 42 小时后达到 100,000——据 GeekPark 和 The Paper 当天的报道,这是 GitHub 有记录以来增长最快的项目。截至今天,该仓库的 star 数约为 126,000。

架构的口号是“一切皆插件”,它构建在 Cordis 框架之上:模型适配器、工具、Skills、会话日志、审批策略,甚至智能体循环本身,都是挂载到共享上下文中的插件。默认安装包含一百多个插件,据 GeekPark 报道,内测阶段在公开发布前已产生了大约三百个社区插件。这就是为什么它被称为智能体运行时而不是应用——你可以用可替换的部件组装出你想要的行为。
DSH 并不是一个模型。没有“DSH 模型”可供基准测试,也没有人托管 DSH 供你调用——它在本地运行,就在你的机器上,而且只按它消耗的模型 token 收费。模型是单独接入的,DeepSeek 为 20 多个提供商和协议提供了适配器,包括 DeepSeek 自己的 API、兼容 OpenAI 的端点和 Anthropic 的端点。实际上,大家都在运行的组合是 DSH 加 DeepSeek V4 Flash,用于便宜的日常编码;而当任务难度足以配得上一个更大的大脑时,则使用 DeepSeek V4 Pro——更多内容见下文。
开始之前:你真正需要什么
前置条件比表面看起来更轻量。你需要 Node.js——该包声明 ^22.19.0 或 >=24.0.0,因此当前 LTS 及任何更新版本都适用——以及一个 API 密钥,用于你打算接入的任何模型。DSH 本身免费且开源;唯一需要付费的是模型 token。你还需要一个允许 agent 操作的目录:DSH 的工作区机制就是安全边界,它会让 agent 只能访问你明确添加的目录。
首次运行时,DSH 会创建一个主目录 — $DSH_HOME,默认位于 ~/.dsh — 其中保存着你的配置文件、会话、存储以及 settings.yaml。API 密钥存放在该目录下的 .credentials.yaml 文件中;Web UI 只显示掩码后的描述符,绝不会显示密钥本身。这个文件值得备份,因为手动重新输入密钥是社区中最常见的设置问题。
安装并启动:四种方式
零安装路径只需一条命令。在已安装 Node.js 的终端中:
• npx @deepseek-ai/dsh web——下载该包并启动 Web UI,访问地址为 http://127.0.0.1:3080。这是最快的途径,也是文档首先介绍的方式。
• npm install -g @deepseek-ai/dsh,然后运行dsh web——如果会重复使用,请进行全局安装。
• 从源码开始:git clone https://github.com/deepseek-ai/deepseek-harness,然后运行 pnpm install、pnpm run build、pnpm dsh web —— 如果你想阅读或修改代码,这是正确的路径,也是插件开发文档所假设的方式。
• Python SDK:pip install deepseek-harness-sdk,用于 CI 脚本和批量自动化,示例位于仓库的 examples 目录下。
还有一个无头 CLI,用于在脚本中执行一次性任务:dsh --profile headless "fix the failing test in this repo" 会运行一次代理,打印最终答案并以退出码 0 结束。dsh 启动器只解析自己的标志(如 --profile、--patch 等),并将其后的所有内容传递给所启动的 profile——这是初次使用时常见的困惑。

Web UI 默认绑定到 127.0.0.1,因此不会向你的网络暴露任何内容——这是一个刻意的默认设置,在你没有理由改变之前应保持如此。会话、日志和凭据都保留在你的机器上;DSH 本身没有任何云组件。
首次运行:密钥、工作区、会话
界面启动后,首次运行流程包含三个步骤。在“设置”中,于“Models”下添加你的 API 密钥,并选择提供商。然后添加一个工作区(workspace)——即你希望代理操作的项目目录。最后,创建一个会话,选择运行时预设,并发送一个小的首个任务,例如“分析此目录的结构并为其编写 README”。从小任务开始很重要:这是确认密钥、工作区边界和沙盒都正常工作的最快方式,然后再将真正的任务交给代理。
即使关闭了规划模式,DSH 也会在指令模糊时主动提出澄清问题,提供建议选项而不是猜测。社区报告称,对于第一天使用的用户来说,这是最出乎意料且最有用的默认行为之一。
四个预设方案 — 以及如何选择
这些预设并不是同一个模型处于不同状态。每一个都是不同的工具目录加上不同的系统提示词,切换预设会改变智能体可以看到和做的事情,而不是改变由哪个模型来回答。出厂自带的四个预设是 Standard、PTC、Minimal 和 Creation。
• Standard — 完整的编码智能体工具箱:文件编辑、持久化 shell、文件和网页检索、Skills、规划模式、目标跟踪、子智能体和工作流。这是 Claude Code / OpenAI Codex 式的默认选项,也是你应该开始的地方。
• PTC(代码模式)——即“编程式工具调用”。它将工具目录打包成 TypeScript SDK,让模型编写一个 TypeScript 程序,在一次 run_code 调用中执行多次工具调用,将中间数据保存在工作线程中,只将摘要返回给模型的上下文。社区报告显示,多步任务可节省约 20 倍的 token 消耗,代价是模型的首次输出变成了一段可供阅读和审计的程序。
• 极简——恰好两个工具:一个持久化的 bash shell 和 str_replace_editor,外加一个朴素的人设提示词。它存在的目的是在最小化脚手架下对模型能力进行基准评测;DeepSeek 将其用于官方 DeepSeek V4 Pro 0813 智能体评估。当你在测试模型时使用它,而不是在试图完成工作时使用。
• Creation — 标准版,外加运行时检查与插件实验:一个 dsh-tool-cordis 工具,可读取实时运行时(已加载的插件、服务、事件),并在内存中挂载或卸载插件,面向构建预设和插件的用户。将其视为拥有 shell 级权限——它可以在运行时更改运行框架。
带主观倾向的版本是:从 Standard 开始;对于重复性的多步骤任务,升级到 PTC,因为往返次数的减少在那里是划算的;在跑基准测试或开发插件之前,先别碰 Minimal 和 Creation。有一条社区建议值得记住:在将 DeepSeek V4 Pro 锚定到简洁的“we need…”式首轮回复上,Minimal 预设的工具模式明显优于条目更全的 Standard 目录——这正是 dsh-anchored-standard 这类实验性预设先暴露一个与 Minimal 对齐的首个请求、之后才解锁 Standard 的原因。这足以说明工具目录本身对行为的影响有多大——如果某个任务从代理那里返回时总是带着错误的语气,这一点值得了解。
将其用作编码代理:一个具体的工作流
以下是从业者所报告的、在标准预设下真实DSH会话的样子:
• 将 DSH 指向一个 git checkout 的工作区,并以结果形式给它一个任务:"为列表端点添加分页,并保留现有的查询参数。"
• 让它规划(或者不规划——代理无论如何都会规划),然后观察它读取相关文件、形成计划,并在进行任何更改之前说明它将更改什么。
该代理会编辑文件、在其持久化 shell 中运行测试套件、读取失败信息并不断迭代。这个循环——编辑、运行、读取错误、再次编辑——是执行框架的核心能力,而持久化 shell 正是其速度的关键:状态在工具调用之间得以保留,因此它无需在每条命令上重启上下文。
• 对于任何需要外部上下文的内容,它都会使用文件检索和网页检索,并能将大型自包含工作交给子代理处理,从而让主循环的上下文保持精简。
• 内置技能涵盖元工作:dsh-code-review 审查拉取请求,dsh-find-simplifications 搜寻可简化的代码,dsh-doc-standards 依据内部规则检查文档。技能以插件形式接入,社区已构建了数百个更多技能。
高权限操作——在工作区之外写入,或执行完全访问权限的命令——在运行前会于 Web UI 中触发审批提示。该沙箱设有只读、工作区可写和完全访问三个权限层级,是阻止混乱的代理接触你整台机器的主要屏障,点击前务必阅读提示内容。
当任务需要在多个步骤之间运行、并在其间做出决策时,工作流会将它们串联起来,并把状态从一步传递到下一步。这种组合——规划、持久化 shell、检索、Skills、子代理、工作流——正是 Standard 预设的全部卖点,它与你在对比的付费编码代理拥有相同的功能覆盖面,并且可运行在你接入的任何模型之上。
轨迹回放:精确查看代理的操作
评审员们反复提及的功能特性是轨迹(Trajectory)。DSH 将会话全程记录为只追加的事件日志——包括系统提示、模型的思维链、每次工具调用及其结果、子代理生命周期以及上下文注入。Web UI 的轨迹视图会逐步重放该事件流,让你能够精确看到代理在每个时刻看到了什么、执行了哪条命令,以及模型接下来做出了哪些决策。
这份日志不仅仅是审计追踪。因为它是事实的唯一来源,会话恢复、分支、检索和重放都源于它:你可以从任意时间点分支出一个会话,恢复一个被中断的会话,而且——团队认为最有价值的部分——当任务运行时间过长时,可以按步骤归因成本。当编码代理悄无声息地做错事时,轨迹(Trajectory)能向你展示它在哪一步偏离了轨道,而不是让你对着最终的差异(diff)凭空猜测。这个工具中没有其他组件具有如此强大的调试杠杆作用。
多智能体编排与 MCP
对于关注“{{1}}如何在此基础上进行构建{{/1}}”的人群来说,有两点架构说明很重要。{{2}}首先{{/2}},DSH 在 harness 层面就是多智能体的,而不仅仅是靠一个长循环:子智能体在自己的上下文中使用自己的工具运行,主智能体负责协调它们,这正是它能让大型任务不撑爆主上下文窗口的原因。{{3}}其次{{/3}},MCP 位于更下一层:Model Context Protocol(模型上下文协议)是将 AI 应用连接到外部数据和工具的开源标准,而 DSH 则是决定何时提供工具以及是否批准其调用的运行时。MCP 服务器以插件形式挂载到 DSH 中,因此社区中数百个 MCP 服务器无需特殊处理即可接入——挂载工具、Skills 和预设所用的正是同一机制。无需启用单独的“{{4}}MCP 模式{{/4}}”;添加服务器后,它就会成为目录中的另一个插件。
模型的来源(及其成本)
DSH 本身免费,但它依赖 token 运行,花多少钱取决于所用模型。大多数人会用到的两个引擎都来自 DeepSeek 自家:DeepSeek V4 Flash,在 OrcaRouter 上每百万输入 token 约 $0.15、每百万输出 token 约 $0.29,上下文 1M token,最大输出 384K——日常使用的廉价选择;以及 DeepSeek V4 Pro,约 $0.44/$0.88,用于处理高难度任务。两者在 OrcaRouter 上均按供应商列表价格计费,以 0% 加价率透传,这意味着 DeepSeek 调整价格后,当天就会同步到我们这边,无需重新谈判。独立报道对 DSH 实际消耗的验证也支持了“便宜”的说法:The Paper 的首日测试通过 DSH 运行多个任务,token 总花费不到 ¥3。

来自同一报道的一个坦诚提醒:第二天的第三方对比发现,同一个 DeepSeek V4 Flash 在另一个开源评测框架("Pi")中完成相同任务时,其 token 消耗仅为 DSH 的三分之一左右。Token 效率取决于评测框架的提示词和上下文处理方式,而不仅仅是模型本身;预览版在这方面显然还未达到最优。如果成本是您的决定因素,请在两个评测框架中对您的实际任务进行基准测试后再做决定。
OrcaRouter真正适合的位置是作为模型层,而不是评估框架。我们不托管DSH——它是一个本地运行时,任何人都不应该向你出售托管的DSH。我们托管的是你接入其中的模型,通过一个密钥在多个提供商之间自动故障转移。这一点之所以重要,是因为DSH是一个0.1开发者预览版:你可以针对真实流量进行评估,同时将相同的模型保留在稳定的端点上,当DSH发生破坏性变更时,你的模型访问不会随之改变。试试评估框架;将模型保留在路由器上。
0.1 预览版的诚实局限
DeepSeek 自己的 README 说得很清楚:DSH 处于开发者预览阶段,迭代迅速,并且会有破坏兼容性的变更。从社区最初接触它的日子来看,这在实践中意味着:
• 升级会破坏现有功能。配置文件、插件兼容性和预设格式在候选版本之间已经发生变动;请预计每次更新后都需要重新验证你的配置。
• 文档不完整。一些高级领域——子代理、工作流、目标跟踪——的文档十分单薄,有数位第一周的贡献者反映,他们需要阅读源代码或 GitHub Discussions 才能解决问题。
• 这是开发者产品,不是消费级产品。 该界面假定你熟悉文件、shell 和 API 密钥。GeekPark 的总结标题——"它能干活,但你必须盯着它"——是准确的。
• 目前 Windows 是二等公民。Shell 集成在多处假设环境为 Unix 风格;Windows 用户反馈需要 pwsh 微调,偶尔会遇到路径 bug。
• 没有桌面应用。 唯一的界面是浏览器 Web UI 和 CLI,在终端中使用没问题,但如果你想要一个停靠的应用程序就不那么理想了。
• Token 效率在规模化应用中尚未得到验证。上述 Pi-harness 对比只是一个数据点,但它警示我们:默认的提示词与上下文处理尚未像成熟产品那样经过调优。
当DSH是错误的选择时
坦率地说说另一面。暂时不要将 DSH 用于生产流水线——破坏性变更的承诺是一道硬性红线,任何无法容忍运行框架更新悄悄改变行为的场景都不适合。也不要为不习惯在终端里调试智能体行为的团队选择它;Trajectory 和插件系统固然强大,但它们预设了使用者具备相应的技术素养。如果你真正需要的是一个稳定、有人维护的编程智能体体验,并且希望由别人来负责那些粘合工作,那么 DSH 的付费竞品仍然是风险更低的选择。DSH 的卖点在于吸引那些想自己掌控运行框架的人——自由切换模型、挂载 MCP 服务器、编写预设,并查看智能体执行的每一步。
底线
关于“如何使用 DeepSeek DSH”的实际答案,自发布以来这几天并没有变:安装 Node.js,运行 npx @deepseek-ai/dsh web,打开 3080 端口,添加 API 密钥,选择 Standard,然后从一个小任务开始。尽早学会 Trajectory 视图,因为它是你的调试工具。把预设看作不同的工具目录,而不是不同的模型;把整个项目看作一个预览版:它足够强大,值得学习,但也足够不稳定,你应该让它所运行的模型保留在你已经信任的端点后面。这正是 OrcaRouter 所在的那一层——DeepSeek V4 Flash 和 DeepSeek V4 Pro 按供应商列表价格、零加价、一个密钥、自动故障转移——因此,底层框架可以在你脚下变化,而模型不会跟着变。DSH 是今年迄今最有趣的开源智能体运行时。它只是尚未完成,而诚实地使用未完成之物的方式是:确保可能出问题的部分,不会把模型访问权限一起拖垮。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
