
DeepSeek Harness:黑鲸浮出水面——关于DeepSeek的Claude Code竞品,我们目前所知的信息
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49代码
DeepSeek Harness v0.1 已经发布,而第一份真正重要的实测报告在不到一天后就出现了。8 月 14 日,那个为发布设定倒计时的 X 账号——teortaxesTex——描述了一次看似已死、实则仍在收尾的会话:token 流式输出“指数级”放缓到近乎爬行,界面显示九个待办事项中完成了五个,而刷新页面后才发现九项已全部完成。界面显示的其实是大约五十分钟前的状态。“这就是……你说的时空可组合性?”——这句吐槽很中肯,因为 DeepSeek 构建这个东西所依托的框架,确实有一套关于时间的理论。这篇帖子最初是追踪泄密线索的;线索于 8 月 13 日尘埃落定,当天 DeepSeek 将 harness 开源。以下就是实际发布的内容,以及真实使用第一天所展现出的、围绕 DeepSeek V4 Flash 0731 和 DeepSeek V4 Pro 构建的 agent 层的情况。
自本文首次发布以来,关于此事的表述已经发生了变化。文章最初发布时,名为{{1}}DeepSeek Harness{{/1}}的产品尚未问世,当时的证据只是一堆公开的线索——一个经过认证的微信账号、招聘启事、基准测试脚注、一次内部测试通话。这种情况已不再成立。北京时间8月13日晚,{{2}}DeepSeek{{/2}}在github.com/deepseek-ai/deepseek-harness上以MIT许可证的开发者预览形式发布了该工具的v0.1版本,只需一条npm命令即可运行,仓库在短短数小时内便收获了超过3万个GitHub星标。泄密变成了产品。如今无法证实的不再是该工具是否存在,而是它在真实环境中的表现如何——早期的实际使用报告便是新的证据。
模型 + 框架 = 智能体:“框架”到底是什么
{{1}}DeepSeek{{/1}} 内部使用的公式是 {{2}}模型{{/2}} + {{3}}框架{{/3}} = {{4}}智能体{{/4}}。模型是大脑;框架是其他一切让智能体在实践中正常运转的部分——包括上下文与记忆管理、工具调用、任务规划、文件读写、终端执行、将错误输出反馈回循环中,以及判断任务是否真正完成。
该术语由 Anthropic 推广,成为业界理解“编码智能体为何不仅仅是一个优秀 LLM”的框架。一个在基准测试中得分良好的模型,如果外围机制——如何调用工具、如何记住十分钟前的操作、如何在命令失败时恢复——很薄弱,它仍然可能在智能体循环中失败。DeepSeek 已将该机制转化为其明确的产品策略,而 Harness 团队正是执行这一策略的组织架构。底层模型已经在交付中:DeepSeek V4 Flash 0731 和 DeepSeek V4 Pro 都带有 DeepSeek 在其自身 harness 内生成的、面向智能体调优的基准分数,甚至具体到名称 "DeepSeek Harness minimal mode"。
止于8月13日的泄密线索
这从来不是某一次单一的泄露;而是一堆自三月份以来逐渐累积的公开线索,最终汇聚到一个发布日期上。大致按时间顺序:
• 2026年3月——有报道将崔添翼(浙江大学计算机科学毕业生,曾在Jane Street工作九年的工程师)与DeepSeek的智能体工作联系起来;媒体随后确认他为Harness团队负责人。该消息当时仅为报道,DeepSeek未予证实。
• 2026年4月24日 — DeepSeek V4 发布预览版,明确定位用于智能体任务,并针对 Claude Code 等智能体工具进行了调优。
• 2026年5月 — DeepSeek 在 Moka 上发布了两个 Harness 岗位——一个 Agent Harness 产品经理和一个研究工程师,均位于北京。DeepSeek 研究员陈德利公开写道,目标简而言之就是对标 Claude Code,构建一个“DeepSeek Code Harness”。
• 2026年6月——招聘力度仍在加大;团队负责人称该部门人手不足,肩负着“雄心勃勃的目标和繁重的工作量”。
• 2026年7月6日至7日 — “DeepSeek Harness团队”微信公众号在DeepSeek北京主体下注册并通过认证,使用黑鲸标志。外界尚无人察觉。
• 2026年7月31日 — DeepSeek V4 Flash 的官方 API 进入公开测试阶段,DeepSeek 的 API 文档首次披露,其公共基准测试中的 CodeAgent 任务是在“DeepSeek Harness minimal mode”下运行的,并标注为“即将推出”。
• 2026年8月1日 — Harness团队负责人启动内部测试招募,面向开源智能体-harness项目的开发者。中国科技媒体报道称,共有769名申请者、712个独立仓库,以及累计超过120万个GitHub星标。
• 2026年8月11日 — 有关该账户的报道广泛传播;黑色鲸鱼浮出水面。
• 2026年8月13日 — v0.1 发布:MIT 许可,在 GitHub 开源,可通过 npx @deepseek-ai/dsh web 运行。谜底揭晓。

v0.1 实际发布了什么
开发者预览版是 Node 包命名空间中的桌面与 CLI 代理运行时,基于 Cordis 元框架构建,其宣称的设计原则是“万物皆插件”。模型、工具、技能、会话、沙箱、存储、代理循环、调度和 UI 都是可替换的 Cordis 插件。内置四种预设:Standard(完整的编码代理工具集)、PTC(模型编写 TypeScript 程序来协调多步骤工具调用)、Minimal(一个 shell 工具加一个文件编辑器——V4 基准测试所采用的模式)和 Creation(用于构建自定义预设)。轨迹视图将模型看到的所有内容写入仅追加的会话日志,可逐来源重放——这是 DeepSeek 对“黑盒”抱怨的回应,该抱怨针对的是被摘要化的代理历史。
真正需要关注的警告来自DeepSeek自己:这是开发者预览版,仓库中带有内部测试通知,核心插件和基础API演进期间预计会出现破坏性变更。这一警告在数小时内就被证明是有必要的——以下现场报告正是以此为背景。
首批现场报告所显示的内容
汇总成这次更新的报告来自单一用户的叙述,且应作为单一个例来读:teortaxesTex 于8月14日描述了一次 DeepSeek Harness 会话,其间 token 流式传输逐渐慢如蜗牛,界面显示九个待办事项中已完成五个,而重新加载后显示九个实际上全部完成——界面此前一直在渲染约五十分钟前的状态。这只是一条 X 帖子,并非供应商的确认,也尚未被独立复现。但此类症状在项目自身的公开记录中得到了佐证,这正是它值得认真对待的原因。
{{1}}官方仓库的 GitHub Discussion #483(提交于8月13日)记录的正是这类故障。{{/1}}{{2}}会话内容通过有界写后批处理进行持久化——事件先存放在内存中的待处理队列里,直到200毫秒定时器触发一次持久化写入——而界面只渲染已提交的状态。{{/2}}{{3}}在高并发负载下,这个时间窗口会被严重拉长;非正常关闭后,内存中的尾部数据永远不会被刷新,JSONL 或 SQLite 后端只能重新加载已提交的前缀部分,因此用户输入要么延迟出现,要么根本不出现,之前可见的历史记录也会消失。{{/3}}{{4}}该讨论将这一问题关联到两个未解决的问题:#477(高并发负载下用户文本输入长时间延迟)和 #479(新用户请求完全不出现在会话视图中)。{{/4}}{{5}}现场报告中的“屏幕上5/9,完成9/9”正是已提交与实际状态之间的差距在实时会话中的体现。{{/5}}
更广泛的 v0.1 反馈呈现两极分化,且这种分化恰如其分。一些测试者称赞其插件架构,称与封闭式竞争对手相比,它就像“一台配有通用接口的自组装台式机”;另一些人则罗列了各种粗糙之处——一条硬编码的多模态路径,以及一个已记录的智能体策略 bug:测试框架迫使模型排查每一个非零退出码,而 grep 的退出码 1 表示“无匹配”,这会让通过的测试变成表面上的失败,进而驱动一个自我强化的过度验证循环(在报告所述对比中,同一任务的请求数为 61 对 32,成本为 $0.17 对 $0.05)。发布首日的评测读起来更像是一个既有真正的雄心、又存在真实的状态层问题的开发者预览版,而不是一个成品级的 Claude Code 挑战者。
“时空可组合性”不仅仅是一个笑点。
这份现场报告的结尾笑话背后有一篇论文。DeepSeek Harness 构建在 Cordis 之上,其设计源自《A Programming Paradigm for Spatiotemporal Composability》——一篇由北京大学和 DeepSeek 合作撰写的 88 页正式研究论文,第一作者是 Yifan Shi(Koishi 聊天机器人框架的创建者),合著者包括 Wei Zhang 和 Harness 团队负责人 Cui Tianyi。该论文将动态组合分解为两个正交维度:时间可组合性,即移除一个组件会干净地撤销其副作用,就像它从未存在过一样;以及空间可组合性,即组件声明依赖关系,而运行时在提供者出现和消失时响应式地激活和停用它们。
这个笑话之所以说得通,是因为来自五十分钟前的 UI 渲染状态在最字面意义上构成了一种时间组合失效:运行时持续执行,而可见状态却在它背后完成提交。Discussion #483 中记录的持久化差距——一种可能远滞后于运行循环的写后批量操作——恰恰是论文中的保证本应防止的那类问题。测试框架的状态层在实践中最终是否会兑现这些保证,是本次发布真正悬而未决的问题之一,而发布首日的报告正是验证这一点的第一批证据。
下面的模型
框架是产品;模型是引擎。DeepSeek 大概会置于其下的两个模型目前均已上线,并且现在就可以通过 OrcaRouter 调用:
• DeepSeek V4 Flash 0731 —— DeepSeek 高效 MoE(总计 284B / 激活 13B)的重新后训练官方版本:100 万 token 上下文,最大输出 384K,默认开启思考模式,原生精通 OpenAI Responses API —— 即 Codex 风格智能体所说的语言。DeepSeek 自家公布的 0731 版本智能体基准成绩:Terminal-Bench 2.1 上 82.7,Cybergym 上 76.7,Toolathlon Verified 上 70.3,DSBench-FullStack 上 68.7,DSBench-Hard 上 59.6。这些数字由厂商自行报告、尚未复现,但它们是 DeepSeek 选择用来主打的数据,而且在同一组基准上甚至超过了 DeepSeek V4 Pro Preview。
• DeepSeek V4 Pro — 旗舰级 1.6T 总参数 / 49B 激活参数的 MoE 模型,同样支持 1M token 上下文,开放权重(2026 年 4 月发布),定价为每百万 token $0.44 / $0.87。
在价格方面,核心就在于DeepSeek很便宜。DeepSeek V4 Flash 0731 的运行成本约为每百万输入token 0.147美元、每百万输出token 0.295美元——这是供应商的列表价格,OrcaRouter 以零加价直接透传。等 harness 成熟后,你可以让它指向你今天已经能调用的那些模型,之后换入或换出 harness 只是一个配置变更,而非迁移。现在运行这两种模型都不需要 DeepSeek Harness。

它正在步入的成本战
这不是一个边缘市场。据报道,Claude Code在2026年初的年化收入运行率已超过25亿美元,而智能体编码市场的规模也被估为几十亿美元量级。一家中国实验室的入局者,既在API价格上大幅压价,其模型又已经运行在Claude Code本身内部——正是那种会给整个品类重新定价的举动。
在成本方面,{{1}}测试框架{{/1}}的选择与模型本身同样重要。{{2}}Composio{{/2}}的一项横向测试使用{{3}}DeepSeek V4 Flash{{/3}}在八个测试框架上运行,结果发现最便宜的方案(开源“Pi”框架)每成功任务约花费{{4}}0.028美元{{/4}}的推理成本,而{{5}}Claude Code{{/5}}在同一测试中约为{{6}}0.195美元{{/6}}——同一类工作上差距接近7倍。再加上{{7}}DeepSeek{{/7}}公布的{{8}}前缀缓存折扣{{/8}}以及第三方测试框架报告的{{9}}99.93%{{/9}}缓存命中率,{{10}}DeepSeek{{/10}}驱动的代理其有效单任务成本会迅速降到极低水平。
同样值得记住的是,今天已经存在的事实:DeepSeek 提供了一个兼容 Anthropic 的端点(基础 URL 为 https://api.deepseek.com/anthropic),其官方文档也逐步说明了如何让 Claude Code 指向 DeepSeek V4 模型。这个工具产品实际上就是 DeepSeek 试图拥有那一层,而不是租用它——而且 DeepSeek 已宣布 V4 全线将迎来大幅涨价。由于 OrcaRouter 以零加价的方式直接传递提供商的标价,新费率在发布当天就会在我们这边生效,无需重新谈判。

为什么挽具成为新的战场
焦点正在从模型能力转向任务交付。如今,前沿模型只是入场券;决定一个团队能否真正交付智能体的,是配套机制——以及它产生的数据。包括中信证券在内的分析师在分析DeepSeek的举措时认为,成熟的工具链构成一道护城河,原因有二,二者相辅相成:它打通了从入口到任务完成的商业闭环,并生成用于模型训练的长周期任务轨迹数据。像Pi或DeepSeek-TUI这样的社区工具链证明了需求,但它们不会将数据反馈到模型中。而DeepSeek自己的工具链可以——v0.1中随附的Trajectory功能就是这条数据通路的可视化呈现。
这也是为什么仅仅“对模型进行基准测试”的解读是不完整的。DeepSeek V4 Flash 的智能体得分很强,但 DeepSeek 希望在测试框架上建立持久优势——这使得首发报告中的状态层漏洞不仅仅是表面问题。一个 UI 可能落后循环五十分钟的测试框架,仍然只是开发者预览版;它还不是护城河。
我们现在正在看的
• 状态层是否能跟上。写后滞后(write-behind lag)已有文档记录、可复现,并正在向官方仓库提交 issue;观察刷写路径(flush path)能否被快速修复,以及当会话进行中时,“界面仅显示已提交状态”的设计是否会改变。
• 原生复现测试。这次发布之所以重要,是因为DeepSeek的V4智能体评分是在“DeepSeek Harness minimal mode”上生成的——现在任何人都可以安装预览版并原生运行这些任务。如果82.7 / 87.9这两个数字能够复现,那么最后两个发布就可以看作一个连贯的系统;如果不能,厂商基准测试的差距就变得可量化了。
• 插件生态系统能否站稳脚跟。#dsh 标记的插件界面是真实存在的,但第三方是否会推出值得安装的东西仍是未知数。
• 价格表。DeepSeek 尚未说明测试平台本身的价格,而公布的 V4 API 价格上涨是另一个重大未知数。
• “时空可组合性”究竟会成为一份修复清单,还是一句口号。该论文为 DeepSeek 提供了一套严谨的术语,恰好描述了现场报告所暴露的失败;v0.1 状态层能否收敛到这些保证,就是检验标准。
诚实的解读:DeepSeek 给出的最强预发布信号现在已成为真实产品,但仍是带有已知粗糙之处的开发者预览版。今天扎实的是其下的两个模型——DeepSeek V4 Flash 0731 和 DeepSeek V4 Pro,两者都在 OrcaRouter 上以提供商列表价格上线、零加价,并且都可通过一个标准 API 在代理循环中使用。当测试框架成熟时,在不把生产路径押注在 v0.1 上的情况下对其进行评估的方法是路由:将测试框架放在前面进行评测,将相同的模型保留在同一个端点之后,一旦它出现停滞就故障转移到经过验证的组合。这个切换只需改动一行代码。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
