記事「DeepSeek V4 Pro Benchmarks」のヒーロータイトルカード:大きなゲージを備えたスコアボード、見出し「DeepSeek V4 Pro — ベンチマークスコアカード」、サブタイトル「公式0813スコア、独立した検証、そしてまだ再現されていないもの」、および「TERMINAL-BENCH 2.1: 87.9」「DEEPSWE: 62.7」「AA INDEX: 53」「1M CONTEXT」と表示されたチップ。OrcaRouterのロゴは右下に合成されている。
Guides & Insights

DeepSeek V4 Pro ベンチマーク: 0813 完全スコアカード、すべての独立したチェック、そしてまだ誰も検証していない点

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

一言で言えば、DeepSeek V4 ProはDeep​Seek自身の公表値では確かに強力なエージェント性能スコアカードを記録している——Terminal-Bench 2.1で87.9、DeepSWEで62.7、CyberGymで83.3——しかし、主要な数字のほぼ全てはベンダー報告であり、独立した評価はより冷静だ。 Artificial Analysisは、公式0813ビルドをインテリジェンス指数で53と評価し、GLM 5.2と同水準、GPT-5.6 Terraより4ポイント、Kimi K3より7ポイント低いとしている。Vals AIは12位にランク付けし、前世代のGPT-5.5より下位としている。本記事は、他では誰も書いていない完全な集計である。すなわち、完全な0813スコアカード、テクニカルレポートの拡張コーディングセット、存在する全ての独立検証、そしてどの数値が再現され、どの数値が依然としてDeep​Seekの単独の主張に過ぎないかという正直な台帳である。スコアカード発表から1週間後、サービングの状況も判明し始めている——2026年8月19日、LMSYSとAnt Groupは、バッチサイズ1で271出力トークン/秒を達成するH20サービングスタックを公開した。これについては後述の専用セクションで詳述し、このページのベンダー側の情報すべてと同様に、誰かが再現するまで自己申告として分類する。

公式0813スコアカード — Deep​Seek自身の数字、そのすべて

Deep​Seekの公式発表(APIドキュメント、news260813、2026年8月13日)は、4月のプレビューに対するプロダクションビルドを報告しています。このセクションのすべての数値はベンダー報告によるものであり、2026年8月16日時点で独立して再現されたものはありません:

• Terminal-Bench 2.1 — 87.9(プレビュー: 72.1)。

• DeepSWE — 62.7(プレビュー: 12.8)— カード上で最も際立った主張である、約5倍の飛躍。

• CyberGym — 83.3(プレビュー:52.7)。

• Humanity's Last Exam — ツールなしで42.7、ツールありで60.0(プレビュー: 37.7 / 48.2)。

• Toolathlon-Verified — 74.1(プレビュー:55.9)。

• AutomationBench(公開)— 31.8(プレビュー: 12.8)。

• DSBench-FullStack — 71.1、DSBench-Hard — 67.2(プレビュー: 41.8 / 31.1)。

• NL2Repo — 61.5 (プレビュー: 38.5)。

• Agents' Last Exam — 25.7(プレビュー: 16.5)。

注目すべきパターンは、{{1}}向上が見られる分野がどこに集中しているか、すなわちエージェント型とサイバーセキュリティのベンチマーク{{/1}}です。これはまさに、ラボがエージェントモデルを宣伝したいときに作成する種類のスコアカードであり、本番環境に費用を投じる前に中立な再実行が必要な種類のスコアカードでもあります。

Scoreboard card for DeepSeek V4 Pro's official 0813 benchmarks: rows read Terminal-Bench 2.1 87.9 (preview 72.1), DeepSWE 62.7 (12.8), CyberGym 83.3 (52.7), HLE with tools 60.0 (48.2), DSBench-FullStack 71.1 (41.8), Toolathlon-Verified 74.1 (55.9), with a footer reading 'All figures DeepSeek-reported via API docs news260813, Aug 13 2026 — none independently reproduced.'

DeepSeekの技術報告書からの拡張コーディングセット

エージェントカードに加えて、Deep​Seekのテクニカルレポート(2026年8月16日にBenchLMが集計)は、より広範なコーディングおよび長文コンテキストのセットを追加しています。これもベンダー報告であり、BenchLMによって「Provider exact」とラベル付けされています — 独立したテストはありません:

• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。

• LiveCodeBench Pass@1-CoT — 93.5% — BenchLMのカタログで検証された最高値。

• Codeforces レーティング — 3206 — また、カタログ内でも最高と確認されています。

• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。

• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — いずれもカタログ内最高の100万トークン検索性能であり、100万トークンのコンテキストウィンドウを謳うモデルにとって重要な結果です。

• GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(OrcaRouterのモデルページに掲載)。

独立評価者が実際に測定するもの

3つの独立した情報源がDeepSeek V4 Proを実行し、その評価結果はベンダーカードの下に集中している:

• Artificial Analysis Intelligence Index — 53(SCMPの報道、2026年8月;OrcaRouterのモデルページでは53.2、132モデル中20位)。GLM 5.2と同等、GPT-5.6 Terraより4ポイント低く、Kimi K3より7ポイント低い。

• Artificial Analysis Coding — 68.8、OrcaRouterのモデルページによると130件中24位。

• Vals AI Index — 12位、前世代のGPT-5.5には及ばず、Kimi K3やClaude Opus 5にも大きく後れを取る(SCMP)。Vals AI自身のテストでは、サンドボックス化されたターミナル環境でのタスク完了と、Excelスプレッドシートでの複雑な財務モデル構築という2つの具体的な弱点が指摘された。

• Vibe Code Bench v1.1 — 49.93(Vals AI、セット内で「Benchmark exact」の独立実行は唯一これのみ)。

正直な台帳 — 再現されたもの vs まだDeepSeekの主張にすぎないもの

これは、ベンチマーク記事が存在するために提供されるセクションであり、発表のライブ報道よりもこのページをブックマークする理由です。すべてのスコアを2つのバケットのいずれかに振り分けます:

• 独立に取得したデータ: AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI は12位、Vibe Code Bench 49.93 —そして、独立に取得された Terminal-Bench 2.1 の実行結果は78.7 これは OrcaRouter のモデルページ上で Deep​Seek の87.9 と並ぶものです。ベンダーの数値と独立した実行結果との間の9ポイントの差は、このページ上で最も重要なデータです。つまり、再現ギャップを数値化したものです。

• ベンダー報告のみであり、独立に再現されたものではない: 上記の公式0813カードのすべての数値(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)および拡張コーディングセット全体(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。Deep​Seek自身のドキュメントでは、Terminal-Bench 2.1の数値は「プロバイダー実行」とラベル付けされている。

そう読むと、その説明は一貫している。DeepSeek V4 Proは実際に中位に位置するフロンティアモデルであり、AA 53、ランキングは10位台から20位台。ベンダーのスコアカードでは、エージェント性能とコーディング性能がほぼトップクラスであると主張している。どちらの記述も真実であり、矛盾はない。一方は測定されたものであり、もう一方は主張されたものである。

Verification ledger card for DeepSeek V4 Pro: left column 'Independently sourced' lists AA Intelligence Index 53, AA Coding 68.8, Vals AI rank 12th, and a separate Terminal-Bench 2.1 run of 78.7; right column 'Vendor-reported only' lists Terminal-Bench 2.1 87.9, DeepSWE 62.7, CyberGym 83.3, LiveCodeBench 93.5, Codeforces 3206, SWE-bench Verified 80.6; footer reads 'Independent per Artificial Analysis, Vals AI, SCMP Aug 2026 · Vendor per DeepSeek API docs and technical report.'

スコアカードの費用

DeepSeek V4 Pro は、総パラメータ1.6T / アクティブ49BのMoEフラッグシップであり、1Mトークンのコンテキストウィンドウと384Kの最大出力を備えています。OrcaRouterでは、Deep​Seekのリスト価格で、マークアップなしで提供されています:100万入力トークンあたり$0.435、100万出力トークンあたり$0.87(キャッシュ読み取りは100万トークンあたり$0.060)。これらの料金は、2026年8月15日に確認したディレクトリとライブモデルページで確認済みです。このレートでは、ポイント単価の計算がこのモデルを選ぶ最も有力な根拠になります。独立系インデックスで近いスコアのモデルと比べ、出力価格はおよそ10分の1で、ベンダーの主張が正しければ上位のスコアカードをミッドレンジの価格で入手できることになります。注意点が1つ:Deep​Seekは北京時間8月17日から、ピーク/オフピーク料金体系(オフピークはピークの50%)を導入すると発表しており、料金が変動する可能性があります。ここに記載の数字は、本記事執筆時点のライブリスト価格です。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro 0813: input price about $0.44 and output about $0.88 per million tokens, cache read $0.060, a 1M-token context window and 384K max output, live performance figures of 80.8 tokens per second output speed and 0.16 percent error rate, and an Artificial Analysis Intelligence score of 53.2 ranked 20th of 132.

DeepSeek V4 Pro配信中: H20で271出力トークン/秒

ベンチマークはモデルが何を知っているかを評価する。一方、サービングの数値は、どれほど安価にモデルに思考させられるかを評価する。2026年8月19日、Chatbot Arenaを運営する組織であるLMSYSとAnt Groupのオープンソースチームは、0813ビルドに関する最初の本格的なサービング成果を発表した。それは、LMSYSが維持するオープンソースエンジンSGLang上に構築された「シナリオ固有のサービングスタック」である。その見出しとなる数字はNVIDIA H20上、バッチサイズ1での271出力トークン/秒であり、チームはこれをB300との差1.42倍としており、これはネイティブFP4 Tensor Coresを持たないチップ上で達成された。これらの測定はLMSYSとAnt Group自身によるもので、ブログとXで発表されたが、独立に再現されたものはない。

スタックの残りの数値は、すべてLMSYSとAnt Groupが自社のスタック上で自己報告したものです:

• デコードレイテンシ — 「最適化されたDSpark」コンポーネントは、バッチサイズ1で出力トークンあたりの時間(TPOT)を74.8〜78.0%削減します。

• プリフィル — 100万トークンのプリフィルが43.7秒で完了し、プリフィルスループットが幾何平均で36.5%向上します。

• KVキャッシュ(チームが「Humming MXFP4AFP8 + Online C128」と呼ぶ方式)は、フルトークンのKVキャッシュ容量を10.14倍に拡張し、このクラスのシリコン上で1Mトークンのエージェントワークロードを実用的にする鍵です。

• GPUあたりのデコード— 4Kコンテキストでは、GPUあたりのデコードスループットが319.9から703.2トークン/秒/GPUに向上し、2.20倍の改善となります。

それをもとにフリートのサイズを決める前に、注意事項を読んでください。バッチサイズ1はシングルストリームの領域であり、インタラクティブエージェントやチャットが直面するものであって、高並列APIが直面するものではありません。また、B300比1.42倍という比較は、B300の絶対トークン/秒を公開せずにLMSYSが示した比率であり、その差は主張されているだけで検証できません。この結果はまた、チップではなくスタックを測定したものでもあります。これらの利得は、総パラメータ1.6TのMoEでは非力に見えるハードウェア上でのSGLangレベルの最適化によるものです。参考までに、OrcaRouterのライブモデルページでは、共有APIエンドポイント経由でDeepSeek V4 Proを出力80.8トークン/秒と測定しています。一方、H20の数値は専用スタック上のシングルストリームベンチマークであり、意味が異なる別の数値です。

ワークロードがAPI経由で提供される場合、モデルの呼び出し方法は何も変わりません。DeepSeek V4 Proは、OrcaRouter上のOpenAI互換キーとしてDeep​Seekの定価で利用でき、プロバイダーが停止した場合は自動的にフェイルオーバーします。H20の数値が最も重要になるのは、セルフホストのH20フリートとAPI利用料の支払いを比較検討しているチームの場合です。LMSYSとAnt Groupの取り組みが埋めるギャップは、ハードウェア購入の決定であり、モデル選択の決定ではありません。

この推奨が誤っている場合

DeepSeek V4 Pro が最適ではない、正直なケース:

• 独立に確認されたフロンティア推論が必要です。AA Index 53は中位です — Kimi K3 (60) と GPT-5.6 Terra (57) が先行しており、検証済みです。もしあなたの決定が測定された上限に依存するなら、ベンダーカードはそれを変えません。

• あなたは誰かが DeepSWE 62.7 を再実行する前に、本番運用をそれにかけている。 1回のリリースでの 12.8→62.7 というジャンプは、事実ではなく主張に過ぎない。中立な再現を待て — 87.9 対 78.7 の Terminal-Bench の差は、そこで見つかるかもしれないものを示している。

• あなたのワークロードは、サンドボックス化されたターミナル自動化またはExcelの財務モデリングです。Vals AIによると、これらはまさにモデルが苦手とする領域であり、ベンダースコアとは無関係です。

• あなたはCyberGym 83.3に基づいてサイバーセキュリティの決定を下そうとしています。 つまり、Deep​Seekが自社のベンチマークで自社モデルをテストしているのです。この数値を鵜呑みにして購入するセキュリティベンダーは、監査を受けていないデータを購入していることになります。

• あなたはH20を、271 tokens/sという数字だけで買おうとしている。 その数字はバッチサイズ1における単一スタックの自己申告ベンチマークであり、有望ではあるものの未再現で、コスト曲線上の一点に過ぎない。そのコスト曲線には稼働率、電力、そして実際に運用するサービングスタックも含まれる。

結論

Deep​Seek V4 Pro 0813は、独立した評価記録を上回るベンダースコアカードを備えた、真のフロンティアモデルです。0813リリースは、テキストプレビューを本格的なエージェント型の競争相手に変えました(リリース自体については別途取り上げています)。今日評価したいなら、OpenAI互換のキーがOrcaRouter上でDeep​Seekのリスト価格にて提供され、プロバイダーが停止した場合は自動フェイルオーバーが動作します。スコアカードは、この記事が区分けする通りに読んでください。独立した検証(AA 53、Vals 12位、78.7のTerminal-Bench実行)は今日信頼できるものであり、87.9と62.7は、それらを基に構築する前に検証すべきものです。同じ規律はサービングにも及んでいます。LMSYSとAnt GroupによるH20上の271出力トークン/秒が、私たちが持つ最良のスループット像ですが、中立な実行が確認するまでは、あくまで彼らの主張に過ぎません。購入するなら、価格対性能と1Mトークンのコンテキストのためであり、再現されていない見出しの数字のためではありません。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新