「DeepSeek Harness: The Black Whale Surfaces」のタイトルカード:見出し「DeepSeek Harness」、サブタイトル「The Black Whale Surfaces — DeepSeekのClaude Code競合について現在判明している情報」、タグライン「Model + Harness = Agent」、「DeepSeek V4 Flash」と「DeepSeek V4 Pro」のチップ、フッター「リーク / 判明情報 — まだ何もリリースされていない」。OrcaRouterロゴは右下に合成。
Guides & Insights

DeepSeek Harness: 黒い鯨が姿を現す — DeepSeekのClaude Code競合製品について現在わかっていること

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

D​eepSeek Harness v0.1がリリースされ、その翌日には重要となる最初のフィールドレポートが届いた。8月14日、リリースの時計をセットしたのと同じXアカウント(teortaxesTex)が、実際には完了処理中なのに死んでいるように見えたセッションについて述べた。トークンのストリーミングが「指数関数的に」遅くなり、インターフェースには9つのTODOのうち5つが完了と表示され、ページをリロードすると9つすべてが完了していた。UIはおよそ50分前の状態を表示していた。「これが……あなたの言う時空間合成可能性という意味ですか?」——これは痛烈な皮肉だ。なぜなら、D​eepSeekがこれを構築したフレームワークには文字通り時間に関する理論があるからだ。この投稿はリークの足跡を追う記事として始まったが、その足跡は8月13日に解決した。D​eepSeekがハーネスをオープンソース化したのだ。以下は、実際に出荷されたものと、DeepSeek V4 Flash 0731およびDeepSeek V4 Proを中心に構築されているエージェント層について、初日の実際の使用が示すものである。

この投稿が初めて掲載されてから、率直な状況説明は変わった。公開当時、『D​eepSeek Harness』と呼ばれるものはまだリリースされておらず、証拠は公開された断片の積み重ねに過ぎなかった——認証済みWeChatアカウント、求人情報、ベンチマークの脚注、社内テストの連絡。それはもはや真実ではない。北京時間8月13日の夜、D​eepSeekはハーネスのv0.1をMITライセンスの開発者プレビューとしてgithub.com/deepseek-ai/deepseek-harnessで公開した。単一のnpmコマンドで実行でき、リポジトリは数時間で30,000以上のGitHubスターを獲得した。リークは製品となった。現在検証されていないのは、ハーネスが存在するかどうかではなく、実環境での挙動だ——そして初期の現場レポートこそが新たな証拠である。

Model + Harness = Agent:「ハーネス」とは実際には何か

DeepSeekが内部的に用いる公式は、Model + Harness = Agentです。モデルは頭脳であり、ハーネスは、エージェントを実際に機能させるその他のすべての要素——コンテキストとメモリの管理、ツール呼び出し、タスク計画、ファイルの読み書き、ターミナルでの実行、エラー出力のループへのフィードバック、そしてタスクが実際に完了したかの判断——を指します。

この用語はA​nthropicによって広められ、コーディングエージェントが単なる優れたLLM以上のものである理由についての業界の枠組みとなった。ベンチマークで良いスコアを出すモデルでも、周囲の仕組み——ツールの呼び出し方、10分前に行ったことをどう記憶しているか、コマンドが失敗したときにどう回復するか——が弱ければ、エージェントループで失敗しうる。D​eepSeekはその仕組みを明確な製品戦略に転換し、Harnessチームがそれを実行する組織上の主体である。基盤となるモデルはすでにリリース済みで、D​eepSeek V4 Flash 0731とD​eepSeek V4 Proの両方が、D​eepSeekが自社のハーネス内で生成したエージェント調整済みベンチマークスコアを備えており、その名称は「D​eepSeek Harness minimal mode」にまで及んでいる。

8月13日で途絶えたリークの痕跡

これは一度きりのリークではありませんでした。3月から積み重なってきた公開情報のパンくずの連なりが、最終的にリリース日の発表へとつながったのです。おおまかな順序で言うと:

• 2026年3月 — 浙江大学でコンピューターサイエンスを学び、ジェーン・ストリートに9年間勤めた元エンジニアである崔添翼(Cui Tianyi)が、DeepSeekのエージェント業務に関与しているとの報道があった。その後、報道は彼をHarnessチームのリーダーとして特定した。これは当時DeepSeekによって確認されておらず、報道のみによるものだった。

• 2026年4月24日 — DeepSeek V4がプレビュー公開。エージェントタスク向けに明確に位置付けられ、Claude Codeなどのエージェントツール向けにチューニングされている。

• 2026年5月 — DeepSeekはMokaで2つのHarness関連の役職を募集 — Agent Harnessプロダクトマネージャーと研究エンジニアで、いずれも北京勤務。DeepSeekの研究者Chen Deliは、その目標は要するにClaude Codeをベンチマークし、"DeepSeek Code Harness"を構築することだと公に記している。

• 2026年6月 — 採用活動は続いており、チームリーダーは部門を「野心的な目標と過重な業務量」を抱える人員不足状態と表現している。

• 2026年7月6日〜7日 — 「D​eepSeek Harness team」WeChatアカウントがDeepSeekの北京法人として登録・認証され、黒いクジラのロゴが付けられている。外部の誰もまだ気づいていない。

• 2026年7月31日 — DeepSeek V4 Flashの公式APIがパブリックベータに移行。D​eepSeekのAPIドキュメントでは初めて、公開ベンチマークのCodeAgentタスクが「D​eepSeek Harness minimal mode」で実行されたことを開示し、「coming soon」という但し書きを添えている。

• 2026年8月1日 — Harnessチームのリーダーが、オープンソースのエージェントハーネスプロジェクトの開発者を対象とした内部テストの募集を開始。中国のテックプレスは、769人の応募者、712の独自リポジトリ、累計120万以上のGitHubスターを報じている。

• 2026年8月11日 — アカウントへの報道が広がり、黒いクジラが浮上する。

• 2026年8月13日 — v0.1リリース: MITライセンス、GitHubで公開、npx @deepseek-ai/dsh webで実行可能。道筋がついた。

A timeline infographic titled 'The DeepSeek Harness leak trail' with five milestones: 'Mar 2026 — Harness team lead joins DeepSeek'; 'May 2026 — Harness team formed; Model + Harness = Agent hiring push'; 'Jul 31 2026 — V4-Flash beta names Harness minimal mode (coming soon)'; 'Aug 1 2026 — Open-source agent-harness testing call draws 769 applicants'; 'Aug 11 2026 — Official DeepSeek Harness account surfaces (black whale)'. Footer: 'Timeline per DeepSeek API docs, job postings, and Chinese tech press — product unconfirmed.' OrcaRouter logo composited bottom-right.

v0.1で実際に出荷されたもの

開発者プレビューは、Nodeパッケージ名前空間におけるデスクトップ/CLIエージェントランタイムであり、Cordisメタフレームワーク上に構築され、「すべてはプラグインである」という明確な設計原則を掲げている。モデル、ツール、スキル、セッション、サンドボックス、ストレージ、エージェントループ、スケジューリング、UIはすべて交換可能なCordisプラグインである。4つのプリセットが同梱されている: Standard(完全なコーディングエージェントツールセット)、PTC(モデルがTypeScriptプログラムを記述してマルチステップのツール呼び出しを調整する)、Minimal(シェルツールとファイルエディタを備えたモードで、V4ベンチマークが実行されたモード)、Creation(カスタムプリセットの構築用)である。Trajectoryビューは、モデルが参照するすべての内容を追加専用のセッションログに書き込み、ソースごとに再生可能である。これは、要約されたエージェント履歴に対する「ブラックボックス」という批判へのD​eepSeekの回答である。

重要な注意点は、D​eepSeek自身のものだ。これは開発者プレビューであり、リポジトリには内部テスト用の注意書きが含まれ、コアプラグインと基本APIが進化するにつれて破壊的な変更が予想される。その警告は数時間のうちに裏付けられ、以下の現場レポートを位置づけている。

最初のフィールドレポートが示すもの

このアップデートをまとめるきっかけとなった報告は、単一ユーザーのアカウントによるものであり、そのように読むべきである。8月14日、teortaxesTex は、D​eepSeek Harness セッションにおいて、トークンストリーミングが次第に遅くなり、UI には9つのTODOのうち5つが完了と表示されたが、リロードすると実際には9つすべてが完了していた——インターフェースは約50分前の状態を描画していた——と述べている。これは1件のX投稿であり、ベンダーの承認でもなく、まだ独立して再現されてもいない。しかし、この症状のクラスはプロジェクト自身の公開記録によって裏付けられており、それこそが真剣に受け止める価値がある理由である。

公式リポジトリのGitHub Discussion #483(8月13日付)は、まさにこの障害ファミリーを記録している。セッション内容は、境界付きのライトビハインドバッチで永続化される。つまり、イベントはインメモリの保留キューに置かれ、200ミリ秒のタイマーが耐久書き込みを発火するまで待機し、インターフェースはコミット済み状態のみを描画する。高負荷の並行処理下では、このウィンドウが大幅に伸びる。異常終了後、インメモリの末尾はフラッシュされず、JSONLまたはSQLiteバックエンドはコミット済みプレフィックスのみを再読み込みするため、ユーザー入力は遅れて表示されるか、まったく表示されず、以前見えていた履歴が消えてしまう。この議論は、2つの未解決問題に結び付けられている。#477(高負荷の並行処理下でユーザーテキスト入力が長時間遅延する)と#479(新しいユーザーリクエストが会話ビューにまったく表示されない)である。現場報告の「5/9 on screen, 9/9 done」は、コミット済みと実際のギャップがライブセッションで現れたものである。

v0.1に関するフィードバックは、見事に合致する形で二極化している。一部のテスターは、クローズドな競合製品と並べて、このプラグインアーキテクチャを「汎用ポートを備えたセルフアセンブル型デスクトップPC」と称賛する一方、他のテスターは粗削りな点を列挙している——ハードコードされたマルチモーダルパス、そして文書化されたエージェントポリシーのバグだ。そのバグとは、ハーネスがモデルにゼロ以外の終了コードをすべて調査させる一方、grepの終了コード1(「一致なし」)が合格テストを見かけ上の失敗に変え、自己増幅型の過剰検証ループを引き起こすというもの(報告された比較では、同じタスクに対してリクエスト数61対32、コスト$0.17対$0.05)。初日レビューは、完成されたClaude Codeの対抗馬というよりも、本物の野心と本物のステート層の問題を抱えた開発者プレビューのように読める。

「時空間合成可能性」は単なるオチではない。

フィールドレポートの締めのジョークには、裏に論文があります。DeepSeek Harness は Cordis 上に構築されており、その設計は「A Programming Paradigm for Spatiotemporal Composability」に由来します。これは、北京大学とDeepSeekが共同執筆した88ページの正式な研究で、筆頭著者は Koishi チャットボットフレームワークの生みの親である Yifan Shi 氏、共著者は Wei Zhang 氏と Harness チームリーダーの Cui Tianyi 氏です。この論文は、動的合成を直交する2つの軸に分解しています。すなわち、時間的合成可能性と空間的合成可能性です。時間的合成可能性では、コンポーネントを削除すると、その副作用がまるで存在しなかったかのようにきれいに取り消されます。空間的合成可能性では、コンポーネントが依存関係を宣言し、ランタイムがプロバイダーの出現と消滅に応じてそれらの依存関係をリアクティブに有効化・無効化します。

このジョークが成立するのは、50分前のUIレンダリング状態が最も文字通りの意味での時間的構成の失敗だからだ。つまり、ランタイムは実行を続けているのに、可視状態はその背後でコミットされていた。Discussion #483で文書化された永続化ギャップ——実行ループから大幅に遅延しうるライトビハインドバッチ——は、まさにこの論文の保証が防ぐはずだった類の問題である。ハーネスの状態層が実際にそれらの保証を運用上守るかどうかは、今回のリリースにおける真に未解決の問いの一つであり、初日のレポートはその答えを示す最初のエビデンスとなる。

下にあるモデル

ハーネスが製品であり、モデルがエンジンです。DeepSeekがその下に置くだろう両方のモデルはすでに稼働しており、どちらも現在OrcaRouter経由で呼び出し可能です:

• DeepSeek V4 Flash 0731 — D​eepSeekの効率的なMoE(総パラメータ284B / アクティブ13B)の再ポストトレーニングされた公式リリース。1Mトークンのコンテキスト、最大出力384K、思考モードのデフォルトオン、そしてO​penAI Responses API(Codexスタイルのエージェントが話す方言)にネイティブ対応。D​eepSeek自身が公開した0731リビジョンのエージェントベンチマーク数値:Terminal-Bench 2.1で82.7、Cybergymで76.7、Toolathlon Verifiedで70.3、DSBench-FullStackで68.7、DSBench-Hardで59.6。これらの数値はベンダー報告によるもので再現はされていないが、D​eepSeekが先頭に掲げることを選んだ数字であり、同じセットではDeepSeek V4 Pro Previewをも上回っている。

• DeepSeek V4 Pro — フラッグシップの1.6T総パラメータ / 49BアクティブMoE、同じ1Mトークンのコンテキスト、オープンウェイト(2026年4月リリース)、価格は100万トークンあたり$0.44 / $0.87。

価格について言えば、そもそものポイントはD​eepSeekが安いということです。DeepSeek V4 Flash 0731は、入力トークン100万件あたり約0.147ドル、出力トークン100万件あたり約0.295ドルで動作します——これはベンダー提示のリスト価格であり、OrcaRouterはマークアップなしでそのまま通過させます。ハーネスが成熟すれば、現在すでに呼び出せるモデルを同じように指定できるようになり、後からハーネスを切り替えるのは移行ではなく設定変更です。どちらのモデルを今実行するにも、D​eepSeek Harnessは必要ありません。

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash: efficient MoE (284B total / 13B active params), 1M-token context, 384K max output, about $0.15 per million input tokens, reasoning and JSON tool support, OpenAI-compatible endpoints.

それは突入しようとしているコスト戦争

これは周辺的な市場ではありません。Claude Codeは2026年初頭には年換算売上額が25億ドルを超えていたと報じられており、エージェンティックコーディング市場は一桁の10億ドル単位で規模が測られています。API価格を下回る価格設定で参入し、しかもそのモデルがすでにClaude Code自体の中で動作している中国の研究所の参入は、カテゴリー全体を再価格設定するような動きです。

コスト面では、ハーネスの選択はモデルと同じくらい重要です。Composioが8つのハーネスでDeepSeek V4 Flashを実行した横断テストでは、最も安価な(オープンソースの「Pi」ハーネス)は、成功タスクあたりの推論コストが約0.028ドルで、同じテストでのClaude Codeの約0.195ドルに対し、同じ種類の作業でほぼ7倍の差がありました。D​eepSeekが報告するプレフィックスキャッシュの割引と、サードパーティのハーネスがD​eepSeekで報告する99.93%のキャッシュヒット率を加えると、D​eepSeekを搭載したエージェントの実効タスクあたりコストは非常に急速に小さくなります。

今日すでに真実であることも覚えておく価値があります。D​eepSeekはA​nthropic互換のエンドポイント(ベースURL: https://api.deepseek.com/anthropic)を公開しており、その公式ドキュメントではClaude CodeをD​eepSeek V4モデルに接続する手順が解説されています。このハーネス製品は、D​eepSeekがそのレイヤーをレンタルするのではなく自社で所有しようとする試みです。そしてD​eepSeekは、V4ライン全体にわたる大幅な値上げが予定されていることを発表しています。OrcaRouterはプロバイダーのリスト価格をゼロマークアップでそのまま通すため、新料金は提供開始当日に当社側でも有効になり、再交渉は不要です。

Screenshot of DeepSeek's API documentation page 'Using the Anthropic API', showing a 'Use DeepSeek in Claude Code' section and the Anthropic-compatible base URL https://api.deepseek.com/anthropic, with the DeepSeek API docs navigation sidebar.

なぜハーネスが新たな戦場なのか

焦点はモデルの能力からタスクの遂行へと移っている。今やフロンティアモデルは最低限の前提条件であり、チームが実際にエージェントをリリースできるかどうかを左右するのは、その周辺の仕組み——そしてそれが生み出すデータ——である。D​eepSeekの動きを分析するアナリストたち——その中にはCITIC Securitiesも含まれる——は、成熟したハーネスは参入障壁になると、2つの相乗的な理由から主張する。すなわち、エントリーポイントからタスク完了までの商業ループを閉じることと、モデル訓練に供給される長期的なタスク軌跡データを生成することだ。PiやD​eepSeek-TUIのようなコミュニティ製ハーネスは需要を証明しているが、それらはそのデータをモデルにフィードバックしない。D​eepSeek自身のハーネスはフィードバックするだろう。そしてv0.1に搭載されるTrajectory機能は、そのデータ経路を可視化したものだ。

「モデルをベンチマークするだけ」という解釈が不十分なのも、そのためだ。DeepSeek V4 Flashのエージェントスコアは強力だが、DeepSeekが永続的な優位性を築こうとしているのはハーネスであり——それゆえ、初日のレポートにあったステート層のバグは、単なる表面的な問題を超えている。UIがループから50分遅れてしまうようなハーネスは、まだ開発者プレビューであり、まだ堀にはなっていない。

私たちが今見ているもの

• 状態レイヤーが追従するかどうか。ライトビハインド遅延は文書化されており、再現可能で、公式リポジトリに対して報告されています。フラッシュパスが迅速に修正されるかどうか、またセッションが進行中の場合に「UIはコミット済み状態のみを表示する」という設計が変更されるかどうかを注視してください。

• ネイティブ再現テスト。今回のリリースが重要だった理由は、D​eepSeekのV4エージェントスコアが「D​eepSeek Harness minimal mode」で生成されたからだ。これで誰でもプレビューをインストールして、それらのタスクをネイティブに実行できる。82.7 / 87.9という数値が再現できれば、直近の2つのリリースは一貫したシステムとして読み取れる。再現できなければ、ベンダーベンチマークのギャップが測定可能になる。

• プラグインエコシステムが軌道に乗るかどうか。#dshタグ付きのプラグインサーフェスは実在するが、サードパーティがインストールする価値のあるものを提供するかどうかはまだ未知数だ。

• 価格リスト。D​eepSeekはハーネス自体の費用について何も述べておらず、発表されたV4 APIの値上げがもう一つの大きな不明点だ。

• 「時空間コンポーザビリティ」が修正リストになるのか、それともスローガンになるのか。この論文は、フィールドレポートが浮き彫りにした失敗を正確に捉えるための厳密な語彙をD​eepSeekに提供する。v0.1ステートレイヤーがそれらの保証に収束するかどうかが試金石である。

正直な評価:D​eepSeekがこれまでに示した最も強力なプレリリースシグナルは、今や実製品となりました。ただし、これは既知の荒い部分が文書化された開発者向けプレビューです。現時点で確かなのは、その下にある2つのモデル、DeepSeek V4 Flash 0731とDeepSeek V4 Proです。どちらもOrcaRouter上でプロバイダー希望小売価格のまま、マークアップなしで稼働しており、1つの標準APIを通じてエージェントループで利用可能です。ハーネスが成熟したとき、v0.1に本番パスを賭けずに評価する方法は、ルーティングです。評価用にハーネスを前面に置き、同じモデルを1つのエンドポイントの背後に維持し、停滞した瞬間に実績のある組み合わせにフェールオーバーするのです。その切り替えは1行の変更で済みます。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新