「DeepSeek Harness:黑鯨浮現」的標題卡:主標題「DeepSeek Harness」,副標題「黑鯨浮現——我們目前對 DeepSeek 的 Claude Code 競爭對手所知的一切」,標語「Model + Harness = Agent」,用於「DeepSeek V4 Flash」和「DeepSeek V4 Pro」的標籤,頁尾「Leak / what-we-know-so-far——目前尚未發布任何產品」。OrcaRouter 標誌合成於右下角。
Guides & Insights

DeepSeek Harness:黑鯨浮出水面——目前我們對 DeepSeek 的 Claude Code 競爭對手所知的一切

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

D​eepSeek Harness v0.1 已發布,不到一天後,第一份重要的實地報告就出現了。8月14日,同一個設定發布時鐘的X帳號——teortaxesTex——描述了一場看似已死但實際上仍在完成的會話:token 串流以「指數級」的速度慢到如爬行般,介面顯示九個待辦事項中完成了五個,而重新載入頁面後才發現九個全部完成了。UI 顯示的是大約五十分鐘前的狀態。「這就是……你所說的『時空組合性』嗎?」——這是個中肯的吐槽,因為 D​eepSeek 建構這個東西所仰賴的框架,確實有一套關於時間的理論。這篇文章最初是追蹤洩漏脈絡的報導;這條脈絡在8月13日畫下句點,當時 D​eepSeek 將此 harness 開源。接下來要講的是實際發布的內容,以及真正使用第一天所顯示的、圍繞 DeepSeek V4 Flash 0731DeepSeek V4 Pro 建構的代理層現況。

{{1}}這篇文章首次發布以來,誠實的表述框架已經改變。發布當時,尚無任何名為「D​eepSeek Harness」的東西正式推出,證據只是一堆公開的蛛絲馬跡——一個認證的微信帳號、職缺公告、一則基準測試的腳註、一次內部測試的邀請。如今這已不再屬實。{{2}}在北京時間8月13日晚間,D​eepSeek以MIT授權的開發者預覽版形式,在github.com/deepseek-ai/deepseek-harness發布了該測試工具的v0.1版本,只需一條npm指令即可執行,且該儲存庫在數小時內便獲得了超過30,000顆GitHub星號。{{3}}洩漏變成了產品。{{4}}如今未經驗證的,不是該測試工具是否存在,而是它在真實環境中的表現如何——而早期的實地回報,正是新的證據。

模型 + 框架 = 智能體:什麼是「框架」的真正含義。

DeepSeek 內部使用的公式是 Model + Harness = Agent。模型是大腦;harness 則是讓 agent 在實際運作中發揮作用的其他一切——包括上下文與記憶管理、工具呼叫、任務規劃、檔案讀寫、終端執行、將錯誤輸出回饋到迴圈中,以及判斷任務是否真正完成。

此術語由Anthropic推廣,並成為業界用以解釋為何編碼代理不只是優秀LLM的框架。一個在基準測試中表現出色的模型,若其配套機制——如何呼叫工具、如何記住十分鐘前的操作、如何在指令失敗時恢復——不夠強健,仍可能在代理循環中失敗。DeepSeek已將這套機制變成其明確的產品策略,而Harness團隊正是組織架構中執行此事者。底層模型早已出貨:DeepSeek V4 Flash 0731和DeepSeek V4 Pro都搭載了DeepSeek在其自有harness中生成的代理調校基準分數,連名稱都是「DeepSeek Harness minimal mode」。

結束於8月13日的洩漏追蹤

這從來不是單一洩漏;而是一堆自三月起累積的公開線索,最終在發佈日期塵埃落定。大致按順序:

• 2026年3月——報導將浙江大學計算機科學系畢業生、曾於 Jane Street 任職工程師九年的崔添翼(Cui Tianyi),與 DeepSeek 的智能體(agent)相關工作聯繫起來;媒體其後指認他為 Harness 團隊負責人。此消息當時僅見於報導,DeepSeek 並未證實。

• 2026年4月24日 — DeepSeek V4 推出預覽版,明確定位於代理任務,並針對 Claude Code 等代理工具進行調校。

• 2026年5月 — D​eepSeek 在 Moka 上發布兩個 Harness 職位——一個 Agent Harness 產品經理和一個研究工程師,均位於北京。D​eepSeek 研究員 Chen Deli 公開表示,目標簡而言之就是對標 Claude Code,打造一個「D​eepSeek Code Harness」。

• 2026年6月 — 招聘行動持續進行;團隊負責人形容部門人手不足,並背負著「遠大的目標和繁重的工作量」。

• 2026年7月6日至7日 — 「D​eepSeek Harness team」的微信帳號在D​eepSeek的北京實體下註冊並完成認證,帶有黑鯨標誌。外界尚無人察覺。

• 2026年7月31日 — DeepSeek V4 Flash 的官方 API 進入公開測試,而 D​eepSeek 的 API 文件 — 首次 — 揭露其公開基準測試中的 CodeAgent 任務是在「D​eepSeek Harness minimal mode」上執行的,並附有「即將推出」的註記。

• 2026年8月1日 — Harness 團隊負責人針對開源 agent-harness 專案的開發者啟動內部測試招募。中國科技媒體報導,共有 769 名申請者、712 個獨立儲存庫,以及累計超過 120 萬的 GitHub 星標。

• 2026年8月11日——該帳號的報導廣為流傳;黑鯨浮出水面。

• 2026年8月13日 — v0.1 正式上線:採用 MIT 授權,於 GitHub 開源,可透過 npx @deepseek-ai/dsh web 執行。謎底揭曉。

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

v0.1 實際上發布了什麼

{{1}}開發者預覽版{{/1}}是 Node 套件命名空間中的一個桌面暨 CLI 代理執行環境,建構於 Cordis 元框架之上,其宣示的設計原則是「{{2}}一切都是外掛程式{{/2}}」。模型、工具、技能、會話、沙盒、儲存、代理迴圈、排程以及 UI,全都可以替換成 Cordis 外掛程式。內建四種預設:{{3}}Standard(標準){{/3}}(完整程式設計代理工具組)、{{4}}PTC{{/4}}(讓模型撰寫 TypeScript 程式以協調多步驟工具呼叫)、{{5}}Minimal(極簡){{/5}}(一個 Shell 工具加上一個檔案編輯器——V4 基準測試所採用的模式),以及{{6}}Creation(建立){{/6}}(用於建構自訂預設)。{{7}}Trajectory(軌跡)檢視{{/7}}會將模型看到的一切寫入僅可附加的會話記錄,可依來源逐一重播——這是 D​eepSeek{{8}}{{/8}} 對「代理歷史摘要淪為黑箱」這類批評的回應。

真正重要的警告來自 D​eepSeek 自身:這是一個開發者預覽版,該儲存庫帶有內部測試通知,且隨著核心外掛與基礎 API 持續演進,預期會出現破壞性變更。這個警告在數小時內便證明其必要性——而它也構成了下方實地報告的框架。

第一批現場報告顯示了什麼

促成這份更新的報告是 {{1}}單一用戶的敘述,也應以此視之{{/1}}:{{2}}teortaxesTex 在 8 月 14 日描述了一場 D​eepSeek Harness 工作階段,其中 token 串流逐漸慢如龜速{{/2}},{{3}}介面顯示九項待辦中已完成五項{{/3}},且 {{4}}重新載入後才發現九項其實已全部完成{{/4}}——{{5}}介面一直呈現的是約五十分鐘前的狀態{{/5}}。{{6}}這只是一則 X 貼文,並非廠商的確認,也尚未被獨立重現{{/6}}。但 {{7}}此類症狀在專案自身的公開紀錄中獲得佐證{{/7}},{{8}}這正是它值得認真看待的原因{{/8}}。

官方儲存庫的 GitHub 討論串 #483,於 8 月 13 日提交,記錄的正是這類失敗。工作階段內容以有上限的延後寫入批次方式持久化——事件會放在記憶體中的待處理佇列,直到 200 毫秒計時器觸發一次持久化寫入——而介面只呈現已提交的狀態。在高並發負載下,這個時間窗會被嚴重拉長;在不正常關機後,記憶體中的尾段資料永遠不會被寫入,JSONL 或 SQLite 後端只會重新載入已提交的前綴部分,因此使用者輸入會延遲顯示或完全不顯示,先前可見的歷史紀錄也會消失。該討論串將此與兩個未解決的問題連結:#477(在高並發負載下,使用者文字輸入延遲很久)和 #479(新的使用者請求完全沒有出現在對話檢視中)。現場報告中的「螢幕上 5/9,已完成 9/9」正是已提交與實際狀態之間的落差在即時工作階段中顯現出來。

更廣泛的 v0.1 回饋呈現兩極化,且這種分歧恰如其分。有些測試人員稱讚其外掛架構,相較於封閉的競爭對手,就像一台「配備通用連接埠的自組裝桌上型電腦」;其他人則列舉了各種粗糙之處——寫死的多模態路徑,以及一個有文件記載的 agent 策略錯誤:測試框架強迫模型調查每一個非零退出碼,而 grep 的退出碼 1 代表「無相符結果」,導致原本通過的測試變成表面上的失敗,進而驅動了自我強化的過度驗證迴圈(在報告的比較中,同一任務產生 61 次請求對比 32 次,以及 0.17 美元對比 0.05 美元的差異)。首日評論讀起來像是一個有真實抱負、但也有實際狀態層問題的開發者預覽版,而不是一個已完成、足以挑戰 Claude Code 的產品。

「時空可組合性」不只是個笑點

這份實地報告的結尾笑話背後有一篇論文。D​eepSeek Harness 建構在 Cordis 之上,而 Cordis 的設計來自 "A Programming Paradigm for Spatiotemporal Composability" — 一份由北京大學和 D​eepSeek 共同撰寫的 88 頁正式研究,第一作者為 Yifan Shi(Koishi 聊天機器人框架的創造者),與 Wei Zhang 及 Harness 團隊負責人 Cui Tianyi 共同撰寫。該論文將動態組合分解為兩個正交軸:時間可組合性(temporal composability),即移除一個元件時,會乾淨地撤銷其副作用,如同它從未存在過;以及空間可組合性(spatial composability),即元件宣告依賴關係,而執行環境會在被依賴的提供者出現與消失時,反應式地啟動與停用這些依賴關係。

這個笑話之所以成立,是因為來自五十分鐘前的 UI 渲染狀態,在最字面的意義上構成了時間組合(temporal-composition)的失敗:執行階段持續運行,而可見狀態卻在其背後被提交。Discussion #483 中所記載的持久化落差——一個可能遠落後於執行迴圈的寫入後批次(write-behind batch)——正是論文中那些保證理應防範的問題。測試框架(harness)的狀態層最終能否在實務上兌現這些保證,是本次發佈中真正懸而未決的問題之一,而上市首日的回報則是支持任一結論的第一批證據。

底下的模型

框架才是產品;模型是引擎。D​eepSeek 大概會放到該框架下的兩個模型都已經上線,而且兩者目前都可以透過 OrcaRouter 呼叫:

• DeepSeek V4 Flash 0731 — 這是 D​eepSeek 重新發布訓練後的高效 MoE(總參數 284B / 啟用參數 13B)官方版本,具備 100 萬 token 上下文、最高 384K 輸出、預設啟用思考模式,並原生流暢支援 O​penAI Responses API——也就是 Codex 風格代理(agent)所說的語言。D​eepSeek 自家公布的 0731 版本代理基準測試數據:Terminal-Bench 2.1 為 82.7、Cybergym 為 76.7、Toolathlon Verified 為 70.3、DSBench-FullStack 為 68.7、DSBench-Hard 為 59.6。這些數字是廠商自行通報且未經複現的,但 D​eepSeek 選擇以它們作為主打指標,而且它們在同一組基準上的得分甚至高於 DeepSeek V4 Pro Preview。

• DeepSeek V4 Pro — 旗艦級 1.6T 總參數 / 49B 活躍參數的 MoE,同樣具備 1M token 上下文長度,開放權重(2026年4月發布),定價為每百萬 tokens $0.44 / $0.87。

關於價格,重點在於 D​eepSeek 很便宜。DeepSeek V4 Flash 0731 的執行成本大約是每百萬輸入 token 0.147 美元、每百萬輸出 token 0.295 美元——這是廠商牌價,OrcaRouter 以零加成直接轉傳。當 harness 成熟後,你就能將它指向你現在已經可以呼叫的相同模型;日後要換入或換出 harness 只是設定變更,而不是遷移。你現在並不需要 D​eepSeek Harness 就能執行任一種模型。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

它正步入的成本戰爭

這不是一個邊緣市場。據報導,Claude Code 在2026年初的年化收入運行率已超過25億美元,而代理式編碼市場的規模則以個位數十億美元計。一個在API價格上削價競爭的中國實驗室新進者——其模型已經在Claude Code內部運行——正是那種會重新定價整個類別的舉動。

在成本方面,選擇哪種執行框架與選擇模型同等重要。Composio 的一項橫向測試讓 DeepSeek V4 Flash 在八種執行框架上執行,結果顯示最便宜的(開源的「Pi」框架)每個成功任務的推論成本約為 0.028 美元,而 Claude Code 在同一個測試中約為 0.195 美元——同類工作幾乎有 7 倍的差距。再加上 DeepSeek 所公布的前綴快取折扣,以及第三方執行框架回報對其達到 99.93% 的快取命中率,由 DeepSeek 驅動的 agent 每個任務的有效成本很快就會變得非常小非常小。

同樣值得記住的是,現況已經如此:D​eepSeek 提供了一個與 A​nthropic 相容的端點(base URL 為 https://api.deepseek.com/anthropic),其官方文件也逐步說明如何將 Claude Code 指向 D​eepSeek V4 模型。這個 harness 產品是 D​eepSeek 試圖擁有那一層而非租用它——而且 D​eepSeek 已宣布 V4 全系列即將迎來大幅漲價。由於 OrcaRouter 以零加價傳遞供應商定價,新費率在推出的當天就會在我們這邊生效,無需重新談判。

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

為何 harness 成為新的戰場

重點已從模型能力轉向任務交付。前線模型現在只是入場券;決定一個團隊能否真正推出代理的,是圍繞其外的機制——以及它所產生的數據。解讀DeepSeek此舉的分析師,包括中信證券,認為成熟的框架是一道護城河,原因有二且相互疊加:它閉合了從入口到任務完成的商業迴路,並產生長期任務軌跡數據,用於模型訓練。像Pi或DeepSeek-TUI這類社群框架證明了需求的存在,但它們並未將這些數據回饋給模型。DeepSeek自家的框架則會如此——而v0.1中搭載的Trajectory功能,正是這條數據路徑的具體展現。

這也是為什麼「只對模型跑基準測試」的評估並不完整。DeepSeek V4 Flash 的智能體分數很亮眼,但 DeepSeek 真正的重點在於評測框架,期望藉此建立持久優勢——這使得發布首日報告中的狀態層錯誤不只是表面問題。一個 UI 可能比處理迴圈落後五十分鐘的評測框架,仍只是開發者預覽版;它還不是護城河。

我們現在正在觀看的內容

• 狀態層是否跟得上。寫入落後(write-behind lag)已有文件記載、可重現,且正針對官方儲存庫提出 issue;觀察 flush 路徑是否會快速獲得修復,以及當 session 進行中時,「UI 僅顯示已提交狀態」的設計是否會有所改變。

• 原生重現測試。此版本之所以重要,在於 D​eepSeek 的 V4 agent 分數是在「D​eepSeek Harness minimal mode」下產生的——現在任何人都能安裝預覽版,並原生執行這些任務。若 82.7 / 87.9 這兩個數字能重現,最近兩個版本便可視為一個連貫的系統;若無法重現,廠商基準差距就會變得可衡量。

• 插件生態系統能否站穩腳跟。標記為 #dsh 的插件介面是真實存在的,但第三方是否會推出值得安裝的內容,仍是未知數。

• 價格表。DeepSeek 尚未說明 harness 本身的成本,而已公佈的 V4 API 漲價則是另一個重大未知數。

• 「時空可組合性」(spatiotemporal composability)究竟會成為一份修正清單,還是淪為口號。該論文為 DeepSeek 提供了嚴謹的詞彙,來精確描述現場報告所浮現的失敗;而 v0.1 狀態層是否收斂於這些保證,便是考驗。

老實說:D​eepSeek 迄今所釋出最強烈的發佈前訊號,如今已是真正的產品,但仍屬開發者預覽版,已知的粗糙之處皆有文件記載。目前真正穩固的是其下的一對模型——DeepSeek V4 Flash 0731 與 DeepSeek V4 Pro——兩者皆已上線 OrcaRouter,以供應商列表價提供且零加價,並都可透過單一標準 API 在 agent 迴圈中使用。當 harness 成熟時,評估它的方式——不必將生產路徑押注在 v0.1 上——就是路由:把 harness 放在前端進行評估,把相同模型留在同一個端點後面,一旦它卡住就立即容錯切換到經過驗證的組合。而這個切換,只是一行程式碼的變更。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新