
DSH 发布日期:DeepSeek 的 Claude Code 竞争对手已上线 — 这对 V4 Flash 和 V4 Pro 意味着什么
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 每百万 tokens · 38 tok/s
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1325 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 2852 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
尽管 DeepSeek V4 Flash 和 DeepSeek V4 Pro 仍是 DeepSeek 最近发布的两款产品,但 X 上关注度最高的 DeepSeek 观察者已经开始为下一款产品倒计时。“现实地说,DSH 大约还要 7 到 9 小时才会发布,”化名 AI 开发者 teortaxesTex 发帖称,“我预测这将重新定义最近两次发布的意义。迷雾已经够多了,我们将看到它本应如何原生表现。”倒计时于今晚揭晓。一个内部测试群告诉 X 账号 op7418,发布时间将是北京时间“20:25 左右”;最终,DeepSeek Harness 开发者预览版于当晚上线——IT之家在 20:52 报道了这一消息,并在随后一个小时内持续跟进。DeepSeek 的 Harness——它是对标 Claude Code 的自家解决方案——现已公开:v0.1 版本,MIT 许可,在 GitHub 上开源,一条 npm 命令即可运行。
这个日期为何重要才是有趣之处,也是这次发布的价值远超一次普通上线的原因。DeepSeek V4 Pro 官方构建版(DeepSeek-V4-Pro-0813)在同一时间窗口登陆 DeepSeek API,而 DeepSeek V4 Flash 则在两周前正式上线。两者都带有 DeepSeek 在其自有测试框架内生成的智能体基准分数——V4 Flash 的 API 文档明确写明了这一点,甚至具体到名称:“DeepSeek Harness minimal mode(DeepSeek 测试框架最小模式)。”DSH 是这一测试框架完整版的公开亮相,意味着最近两次发布背后的数据,现在任何愿意运行的人都能复现。此前通往这一步的所有泄露线索,DeepSeek 均未正式确认为记录,但终点已不再是泄露:开发者预览版已经推出。仍未公开的是价格清单——DeepSeek 对测试框架本身将如何收费只字未提。
拨动时钟的预测
teortaxesTex 不是 DeepSeek 的员工,也不自称是。该账号简介描述其为自称的“2023 年以来 DeepSeek 啦啦队长”,公开记录是基于充分信息的推测,并有一系列精准的猜测——关于 DeepSeek V4 架构的预测市场押注,早期判断 DeepSeek-V4.1 将获得比竞争对手多数倍的强化学习算力,以及社区密切关注的一系列发布解读。请将原始推文视为其本来的样子:一个有充分依据的预测,而非确认。
预测分为两半。第一半是时机:"再过约7-9小时发布"——这一预测落在了北京时间8月12日至13日的夜间,与DeepSeek-V4-Pro-0813版本出现在DeepSeek API文档中的时间窗口相同。它应验了。内部Beta组的"约20:25"估计和实际的~20:52发布都落在该窗口内;泄漏消息偏差约半小时,而非一天。第二半是"重新语境化"这个意味深长的词,只有当你了解DeepSeek如何对其最后两个版本进行基准评测时,这个词才有意义。这一半的赌注现在可以检验了,而这正是这次发布的全部意义所在。
DSH 究竟是什么
DeepSeek 的内部公式——由高级研究员陈德立公开确认——是“模型 + Harness = Agent”。Harness 是模型之外的整个工程层,它让语言模型成为真正能完成工作的工具:包括上下文与记忆管理、工具调用、任务规划、文件读写、终端执行、将错误反馈回循环中,以及判断任务是否真正完成。DeepSeek 的招聘信息将这一目标描述为“将前沿模型能力转化为领先的智能体产品”——而据陈德立自己所说,明确的标杆就是 Claude Code。
该产品也是对社区项目的一个回应。一个名为 DeepSeek-TUI 的粉丝自制终端代理,用 Rust 构建,被戏称为“DeepSeek 版的 Claude Code”,今年早些时候在 GitHub 上走红;官方工具重新夺回了这一终端入口。
泄漏追踪所描述的传闻如今已出现在发布版本中。v0.1 开发者预览版以 MIT 许可证在 github.com/deepseek-ai/deepseek-harness 开源,它是一个位于 Node.js 包命名空间中的桌面与命令行代理运行时——运行 "npx @deepseek-ai/dsh web" 可在 127.0.0.1:3080 启动一个 Web 图形界面——构建于 Cordis 元框架之上,其宣称的设计原则是“一切都是插件”。模型、工具、技能、会话、沙箱、存储、代理循环、调度以及 UI 均为可替换的 Cordis 插件。随附四种代理预设:Standard、PTC(模型编写 TypeScript 程序来串联工具调用)、Minimal(一个 shell 工具加一个文件编辑器,V4 基准测试运行所采用的模式)和 Creation。据传的团队负责人崔天翼——浙江大学毕业生、曾在 Jane Street 任职九年的工程师——已确认担任该职位,并于 8 月 2 日发出了全球内部测试者招募。DeepSeek 自己的告诫是:这属于开发者预览版,快速迭代可能带来破坏性变更。
止于8月13日的泄密线索
以下线索均未经 DeepSeek 正式确认,但目前的记录读起来像是一条在预期日期得到解决的时间线:
• 2026年5月26日——据泄露的群组记录,官方DeepSeek GitHub组织成立。
• 5月至6月——DeepSeek 发布了两个北京 Harness 岗位(一个 agent-harness 产品经理和一个研究工程师);陈德利在社交媒体上确认了这一使命。
• 7月6日至7日——一个名为“DeepSeek Harness团队”、以黑色鲸鱼为标识的微信公众号在DeepSeek北京实体名下注册并通过认证。
• 7月31日 — DeepSeek V4 Flash 官方 API 发布。其文档披露,CodeAgent 基准测试结果是在“DeepSeek Harness 最小模式”下生成的,并注明“(即将发布)”。
• 8月1日 — 面向开源 agent-harness 项目开发者的内测招募;报告显示约有700至960名申请者及700多个候选仓库。
• 8月11日——最终内部测试版本已推送,以便插件开发者完成兼容性工作,据泄露的测试组截图所示。
• 8月13日 — teortaxesTex 启动倒计时;内部测试组告知 op7418 “大约20:25”;开发者预览版 v0.1 于当晚上线,北京时间约20:52 报道,并在 GitHub 上以 MIT 许可证发布。
插件生态是这次泄露中值得注意的一部分,而且是真实存在的。插件仓库带有 #dsh 主题标签(GitHub 仓库在文档中记录了 "dsh-plugin" 以便被发现),而 npm 快速入门意味着任何 Node 开发者都能从首次启动就触达插件层面——这是一场开放市场的赌注:让工具框架本身,而不仅仅是模型,成为一个平台。

为什么“重新情境化最近两次发布”是值得关注的措辞
最近的两个V4版本都是智能体优先模型。DeepSeek V4 Flash官方构建是一个2840亿参数的MoE,激活参数130亿,支持100万token上下文,在Terminal-Bench 2.1上的头号得分82.7——这一数字由DeepSeek在“DeepSeek Harness minimal mode”下报告并生成。DeepSeek V4 Pro官方构建是一个1.6万亿参数的MoE,激活参数490亿,其智能体成绩单(DeepSWE 62.7、Terminal-Bench 2.1 87.9、CyberGym 83.3)同样由DeepSeek报告,且截至撰文时尚未有独立实验室复现。
DSH 是生成这些数字所用的测试框架,现已公开。这就是“我们将看到它原生的表现如何”的含义——不是通过 Claude Code,不是通过第三方框架,也不是通过基准测试框架,而是通过 DeepSeek 自己的技术栈端到端运行。复现测试不再是假设性的:任何人都可以安装预览版,运行供应商跑过的相同代理任务。如果原生数字能够复现,那么最近两个版本就构成了一个连贯的故事——最便宜的严肃代理模型加上一个强大的第一方框架,作为一个系统出售。如果不能复现,怀疑者在 V4 Flash 发布时指出的供应商基准差距就变得具体且可衡量。无论哪种方式,记录都会被改写。
到目前为止,独立的评测结果则是另一番景象。Artificial Analysis已将V4 Pro 0813版本列入其排行榜,智能指数得分53——高于27的中位数,这是一个真正的第三方数据点,但距离“全方位前沿”的说法还相去甚远。DeepSeek自报的智能体数据与第三方评估之间的差距,正是DSH现在能够弥合的差距。

还有一个战略原因,使得工具框架比模型本身更重要。成熟的工具框架能够贯通从入口到任务完成的整个闭环,并在此过程中生成任务轨迹数据,为下一轮模型训练提供输入——这是中信证券在 Harness 招聘公开时发布的分析。DeepSeek 的模型是市场上最便宜的严肃智能体;而工具框架才是护城河与定价权转移之处。付费的第一方智能体栈与开放权重 API 是完全不同的业务。
你仍然不需要DSH来运行V4模型。
DSH 现已上线,但它是一个第一方选项,而非先决条件。DeepSeek 已经为其模型提供了兼容 Anthropic 和 OpenAI 的端点,因此 DeepSeek V4 Flash 和 DeepSeek V4 Pro 已经可以在 Claude Code 及当今其他智能体工具中运行——无需任何适配器。
这两个模型也都在 OrcaRouter 上,按 DeepSeek 自身的标价——deepseek/deepseek-v4-flash-0731 大约每百万输入 token $0.15、每百万输出 token $0.29,deepseek/deepseek-v4-pro 大约 $0.44/$0.88——以 0% 加价转售。这之所以重要,原因有两个。第一,DeepSeek 在八月初宣布,整个 V4 系列即将大幅涨价;由于你支付的就是标价,所以新价格会在发布当天就同步生效,无需重新谈判。第二,DSH 所围绕的核心路由理念——在廉价的 V4 Flash 和旗舰版 V4 Pro 之间调度任务以控制成本——正是路由层在一个 key 下跨供应商所做的事情,并且还带有自动故障转移,因此你可以将真实流量指向新的 V4 构建,同时测试框架及其尚未复现的基准测试仍在验证中。

DSH 上线后现在需要检查什么
随着预览版的推出,以下五件事将决定DSH能否为你带来改变:
复现测试——安装预览版并原生运行 V4 Flash 和 V4 Pro 的智能体任务,然后与 DeepSeek 发布的 82.7 / 87.9 数值进行对比。这就是整个"重新语境化"赌注,而现在它已经可以运行了。
切换决策——DSH 今天是否比在 Claude Code 内部运行同样的模型更胜一筹?第一方工具链必须不仅仅在价格上胜出,才有理由让人迁移一个正在正常工作的方案。
• 插件生态系统——npm 和 GitHub 上的表面情况是真实的,但 #dsh 标签的插件是否真能顺利移植,以及第三方是否推出了值得安装的东西,仍然是一个悬而未决的问题。
• 定价——该工具使用真实token运行,内部测试人员反馈是按任务计量token,而DeepSeek至今未透露该产品的任何定价信息。可以预见这会是一款付费产品;价格表是最后的一大未知项。
• 变更日志:现在以 GitHub 上的官方 README 和发布说明,以及已公布的 V4 涨价为准。
底线
DSH 是 DeepSeek 自 V4 系列以来最具影响力的产品动作,现在它已经正式发布。对于读者来说,实际答案没有变化:DeepSeek V4 Flash 和 DeepSeek V4 Pro 今天就可以通过你已有的端点使用,价格依然是目前最便宜的严肃智能体选项之一——在 OrcaRouter 上按标价,无加价。值得关注的是这个测试框架,不是因为它发布,而是因为它让事情变得可衡量:最后两个版本终于有了公平的原生运行环境,而供应商与独立基准之间的差距要么缩小,要么成为入场费。泄露的时间线在日期和大致时间上是对的;但仍有待验证的是定价、原生评分复现,以及插件生态系统是否可持续。让独立数据——而不是倒计时——来决定你是否将生产级智能体堆栈迁移到原生测试框架上。
本文中的对比2
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
