
DeepSeek Harness 解析:“模型 + Harness = 智能体”背后的智能体运行时
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
DeepSeek Harness——dsh,即其简称——并不是一个模型。它是 DeepSeek 于 2026 年 8 月 13 日以 MIT 许可证发布的开源智能体运行时,也是 DeepSeek 有史以来采用速度最快的产品:媒体报道称其发布后 12 小时内 GitHub 星标数约为 50,000 个,而今天我们读取 GitHub API 时,该仓库已有 125,922 个星标和 12,523 个复刻。它的职责是语言模型与完成任务之间的工程层:文件编辑、终端执行、网页搜索、上下文管理、任务规划,以及调用其他智能体。DeepSeek 自家团队使用的公式是 Model + Harness = Agent——模型负责推理,其余一切由 Harness 完成。
这一区别正是本文的重点。搜索“deepseek harness”的人通常期待看到模型评测,结果却看到了发布报道。所以,直接给出答案:DSH不是一个通过API调用的模型。它是一个需要安装并运行的程序——npm包是@deepseek-ai/dsh,当前版本为0.1.0-rc.6——它能将你提供的任何模型(默认是DeepSeek V4 Flash)连接到你的文件系统、终端、网页和其他智能体。它采用MIT许可证,构建于名为Cordis的插件框架之上,并且明确标注为开发者预览版,警告可能出现破坏性变更。下面来看看它实际能做什么、现在如何运行,以及它的不足之处。
测试夹具(harness)实际上做什么(以及为什么这个术语令人困惑)
框架(harness)是让原始模型在现实世界中开展工作的脚手架。仅靠模型本身只能生成文本。为它配上框架后,它就能读写文件、在你的 shell 中运行命令、搜索网页、维护计划、调用工具、对错误做出反应,并判断任务何时完成。DeepSeek 公开的公式——在发布报道及其自身招聘信息中反复出现——就是"Model + Harness = Agent":模型提供推理能力,框架提供其余一切。
这就是这次发布的意义远超单一产品的原因。DeepSeek 在该框架内为其最新两个模型报告了自己的智能体基准测试分数:DeepSeek V4 Flash API 文档指出,其 Terminal-Bench 2.1 的 82.7 分是在“DeepSeek Harness minimal mode”下得出的。该框架正是这些数字所来源的参考环境,现在它已公开,任何人都可以复现——或反驳。
一切皆插件:Cordis 架构
DSH 的核心设计,如其自己的 README 所述,就是一切皆插件。智能体循环、模型适配器、工具、技能、会话存储、沙箱、调度乃至 Web UI 全都是 Cordis 插件。没有需要修补的特权核心:在其余插件旁边挂载一个插件,就能扩展宿主框架;而每次注册都是一种效应,会在插件卸载时自动解除。插件引擎是 Cordis,一个元框架,其设计见于北京大学–DeepSeek 的论文《面向时空可组合性的编程范式》。
实际结果是关注点的清晰分离:插件添加能力;预设决定给定的智能体可以看到哪些能力。该 monorepo 在 packages/ 下提供了 49 个包——core、llm、mcp、sandbox、context、plan、goal 等——发布覆盖范围包括超过 100 个第一方插件,并已预留了插件商店;发布后 24 小时内,GitHub 上已收集了 288 个社区插件仓库,可通过 dsh-plugin 主题标签发现。
四个预设 — 以及何时使用哪一个
DSH 自带四个代理预设,每个预设加载不同的插件集。从 Web UI 自身的预设菜单中:
• 标准 — 一个完整的编码代理:文件编辑、Shell、文件和网页搜索、技能、规划、目标、子代理和工作流。适用于大多数工作的正确默认选择。
• Code——在中国媒体报道中被称为 PTC("程序化工具调用")——包含 Standard 的全部功能,外加一个 Code Mode SDK,可让模型编写 TypeScript 程序,将多步骤工具调用组合到一个程序中。更强大,而且可能成倍增加副作用和工具调用。
• Minimal——仅包含持久化 bash 与 str_replace_editor。专为复现基准测试运行而构建;这正是 DeepSeek 在 V4 Flash Terminal-Bench 82.7 数据中所用的预设。Minimal 并非无害——拥有 shell 访问权限仍然是 shell 访问权限。
• Creator——第四个预设目录确实就叫 cordis——包含 Standard,以及运行时检查、内存中的 Cordis 插件实验和预设编写。智能体可以在对话中途安装、替换或销毁插件。这是一个工程环境,而非生产审批层。

你应该选哪一个?如果你是在复现基准测试,选 Minimal。如果你希望智能体自行编写多步骤编排,选 Code。如果你正在构建或测试插件,选 Creator。对于其他所有情况,从 Standard 开始——权限范围广,意味着你同样需要严密的工作区和权限策略。
轨迹:评论者所称的“面向智能体的 DevTools”功能
实操评测中最受称赞的功能是Trajectory。每次运行都会写入一个仅追加的会话日志——采用 zstd 压缩的 JSONL 格式,具有统一的类型、序列、时间和数据事件封装——记录模型看到的所有内容:系统提示、推理、工具调用及结果、子代理调度、上下文注入。Trajectory 视图支持按来源检查、恢复、分支、搜索和重放。分支是最突出的操作:你可以更改一条指令,并与原始运行并排重放,而不是丢弃轨迹。
具体来说,在8月15日发布的一项实操测试中,单个文件写入任务产生了61个会话事件,而一个微不足道的"回复PONG"任务在首次请求时仍消耗了约13,467个输入token——这些开销来自默认系统提示、工具模式、自动注入的仓库规则和技能摘要。这就是一个记录一切的工具框架的真实成本:你为脚手架支付token,并且能确切看到你支付了什么。

MCP、插件以及与其他智能体对话
MCP 就是那种炒作超前于当前实现的情况。该 monorepo 包含一个 mcp 包,CLI 附带 dsh-mcp-client 依赖,但默认没有启用任何 MCP 服务器,而且架构通过 Cordis 插件来路由工具集成,而非将 MCP 作为一等公民对待。你可以将 MCP 服务器作为工具源连接;只是这还不是默认路径。
更令人惊讶的是子代理提供商列表所显示的内容。DSH 可以将其他代理作为子代理生成——根据 capability-seams 文档,其中包括 Codex 提供商和 Claude Code 提供商。竞争对手采取这样的立场并不寻常:DSH 是一个框架,可以将工作委托给它所对标的那些产品本身。
插件生态才是真正的平台赌注。DeepSeek 已预留了插件商店,社区仓库被打上可发现性标签,第三方应用内商店也早已存在。长期来看,成为生态系统的将是工具链(harness)而非模型本身——这正是围绕 DSH 的定价讨论比任何单一功能都更重要的原因。
今天如何运行它
你需要 Node.js 22.19 或更高版本 — 包清单要求 ^22.19.0 或 >=24 — 然后只需一条命令:
npx @deepseek-ai/dsh web
这将启动 Web UI,默认通过 http://127.0.0.1:3080 提供访问。在界面中:打开“设置 → 模型”,粘贴 DeepSeek API 密钥,然后选择一个工作区——在完成之前,会话撰写器将保持锁定状态。默认模型为 DeepSeek V4 Flash,默认权限策略为工作区写入,其他所有操作均需审批提示。
总共有四个入口:Web UI、无头单次运行、通过 JSON-RPC stdio 驱动 DSH 的 Python SDK,以及 --dump-config(它打印组装后的插件树;Web 配置文件组装了 129 行插件配置,无头模式为 81 行)。从源码开始,路径是 git clone、pnpm install、pnpm run build,然后运行 pnpm dsh web。
实话实说:预览级,以及DSH并不适用的场景。
DSH 目前是 0.1.0-rc.6 版本,README 中直言不讳地写道:"将会有破坏兼容性的变更。"本周发布的评测罗列了它的各种未完善之处——Windows 上 MSYS2 环境中的静默失败、热重载缓存过期、约 200 毫秒的批量持久化延迟拖慢了 UI 进度显示,以及社区批评一个定位为公共基础设施的仓库却禁用了 GitHub Issues。默认产品体验也仍落后于它所对标的那些打磨完善的编码代理;一篇上手评测的结论是:这个开源发布版只是一个代理运行时脚手架,尚未成为成品。
DSH 在哪些场景下是不合适的工具?四种情况。首先,如果你想要开箱即用的完善体验——如今的 Claude Code 和 Codex 更加成熟,而 DSH 面向那些想要脚手架并愿意自己完善的人。其次,如果你无法审计你所运行的内容:插件来源、配置差异和凭据边界都需要自行提供,生产环境使用需要你自行治理。第三,如果你在评测模型:你不能用一个模型跑 Standard 模式、另一个跑 Minimal 模式,然后声称差异是模型本身的结果——你改变的是测试框架,而不只是模型。第四,如果你对 Token 开销的成本敏感:常驻上下文可能在模型做任何实际工作之前就消耗数千个输入 Token。
这对DeepSeek V4 Flash和DeepSeek V4 Pro意味着什么
DSH 默认使用 DeepSeek V4 Flash,而旗舰版 DeepSeek V4 Pro 构建版(DeepSeek-V4-Pro-0813)正是该测试框架为运行而构建的同一模型系列。两者如今均可通过普通 API 调用获得——无需测试框架——且均托管在 OrcaRouter 上,按 DeepSeek 自身的标价提供:DeepSeek V4 Flash 约每百万输入 token $0.15、每百万输出 token $0.29;DeepSeek V4 Pro 约为 $0.44/$0.88,以 0% 加价转售。

诚实的边界:OrcaRouter 是一个模型路由器,而不是代理运行时,因此我们不托管 DSH——它不是模型。路由器在这里真正能回答的是 DSH 提出的故障转移问题。该测试工具是一个快速迭代的预览版,将生产流量指向它意味着押注于供应商报告的智能体评分。通过一个密钥在路由层运行相同的 DeepSeek 模型,您可以在测试 DSH 原生数据的同时,为必须保持运行的流量保留跨供应商的自动故障转移。测试工具是用来做实验的;它所运行的模型才是需要谨慎路由的对象。
底线
DeepSeek Harness 是 DeepSeek 自模型本身以来开源的最具深远意义的项目,因为它改变了“DeepSeek”的含义:不仅仅是模型,还有运行这些模型的智能体层。对于正在决定下一步行动的读者:如果你在构建智能体,本周就安装它并运行复现测试——DeepSeek 公布的 V4 Flash 和 V4 Pro 分数正是出自这个 Harness,现在你可以亲自核实。但也要如实看待:这是一个 0.1.0-rc.6 开发者预览版,未来会有破坏性变更;其插件系统适合喜欢掌控自己技术栈的人;而且这个 Harness 相比那些打磨成熟的替代方案仍显粗糙。底层的模型才是可靠的部分——这些你今天就可以放心地路由调用。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
