
DeepSeek V4 Pro ベンチマーク: 0813 完全スコアカード、すべての独立したチェック、そしてまだ誰も検証していない点
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1340 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 221 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
一言で言えば、DeepSeek V4 ProはDeepSeek自身の数値では確かに強力なエージェント性能スコアカードを示している——Terminal-Bench 2.1で87.9、DeepSWEで62.7、CyberGymで83.3——しかし、主要な数字のほぼすべてがベンダー報告によるものであり、独立した見方はより冷静だ。Artificial Analysisは公式の0813ビルドをIntelligence Indexで53と評価しており、GLM-5.2と同水準、GPT-5.6 Terraより4ポイント、Kimi K3より7ポイント下に位置づける。Vals AIはこれを12位にランク付けしており、前世代のGPT-5.5より下となる。本記事は他では誰も書いていない完全な集計である:完全な0813スコアカード、テクニカルレポートからの拡張コーディングセット、存在するすべての独立検証、そしてどの数値が再現され、どの数値がまだDeepSeekの主張のみであるかについての正直な台帳である。
公式0813スコアカード — DeepSeek自身の数字、すべて
DeepSeekの公式発表(APIドキュメント、news260813、2026年8月13日)は、4月プレビューに対する本番ビルドを報告しています。このセクションのすべての数値はベンダー報告によるものであり、2026年8月16日時点で独立に再現されたものはありません:
• Terminal-Bench 2.1 — 87.9(プレビュー: 72.1)。
• DeepSWE — 62.7(プレビュー: 12.8)— カード上で最も際立った主張である、約5倍の飛躍。
• CyberGym — 83.3(プレビュー:52.7)。
• Humanity's Last Exam — ツールなしで42.7、ツールありで60.0(プレビュー: 37.7 / 48.2)。
• Toolathlon-Verified — 74.1(プレビュー:55.9)。
• AutomationBench(公開)— 31.8(プレビュー: 12.8)。
• DSBench-FullStack — 71.1、DSBench-Hard — 67.2(プレビュー: 41.8 / 31.1)。
• NL2Repo — 61.5 (プレビュー: 38.5)。
• Agents' Last Exam — 25.7(プレビュー: 16.5)。
注目すべきパターンは、{{1}}向上が見られる分野がどこに集中しているか、すなわちエージェント型とサイバーセキュリティのベンチマーク{{/1}}です。これはまさに、ラボがエージェントモデルを宣伝したいときに作成する種類のスコアカードであり、本番環境に費用を投じる前に中立な再実行が必要な種類のスコアカードでもあります。

DeepSeekの技術レポートからの拡張コーディングセット
エージェンティックカードに加えて、DeepSeek技術レポート(2026年8月16日にBenchLMによって集計されたもの)は、より広範なコーディングと長文コンテキストのセットを追加しています。また、ベンダー報告によるものであり、BenchLMによって「Provider exact」とラベル付けされています — 独立したテストはありません:
• SWE-bench Verified — 80.6%;SWE-bench Pro — 55.4%。
• LiveCodeBench Pass@1-CoT — 93.5% — BenchLMのカタログで検証された最高値。
• Codeforces レーティング — 3206 — また、カタログ内でも最高と確認されています。
• BrowseComp — 83.4%;Terminal-Bench 2.0 — 67.9%。
• MRCR 1M — 83.5%; CorpusQA 1M — 62.0% — いずれもカタログ内最高の100万トークン検索性能であり、100万トークンのコンテキストウィンドウを謳うモデルにとって重要な結果です。
• GPQA Diamond — 92.8、SciCode — 49.2、Long-Context Recall — 75.3(OrcaRouterのモデルページに掲載)。
独立評価者が実際に測定するもの
3つの独立した情報源がDeepSeek V4 Proを実行し、その評価結果はベンダーカードの下に集中している:
• Artificial Analysis Intelligence Index — 53 (SCMPの報道、2026年8月。OrcaRouterのモデルページでは53.2と表示され、132モデル中20位)。GLM-5.2と同等で、GPT-5.6 Terraより4ポイント、Kimi K3より7ポイント低い。
• Artificial Analysis Coding — 68.8、OrcaRouterのモデルページによると130件中24位。
• Vals AI Index — 12位、前世代のGPT-5.5には及ばず、Kimi K3やClaude Opus 5にも大きく後れを取る(SCMP)。Vals AI自身のテストでは、サンドボックス化されたターミナル環境でのタスク完了と、Excelスプレッドシートでの複雑な財務モデル構築という2つの具体的な弱点が指摘された。
• Vibe Code Bench v1.1 — 49.93(Vals AI、セット内で「Benchmark exact」の独立実行は唯一これのみ)。
正直な台帳 — 再現されたもの vs いまだDeepSeekの主張に過ぎないもの
これは、ベンチマーク記事が存在するために提供されるセクションであり、発表のライブ報道よりもこのページをブックマークする理由です。すべてのスコアを2つのバケットのいずれかに振り分けます:
• 独立した情報源による: AA Intelligence Index 53 / 53.2、AA Coding 68.8、Vals AI ランク12位、Vibe Code Bench 49.93 — そして、別の情報源によるTerminal-Bench 2.1の実行結果は 78.7 で、OrcaRouterのモデルページではDeepSeekの87.9と並んでいます。ベンダーの数値と独立した実行結果との間の9ポイントの差が、このページで最も重要なデータです。つまり、再現ギャップを数値化したものです。
• ベンダー報告のみであり、独立に再現されたものではありません: 上記の公式0813カードのすべての数値(Terminal-Bench 2.1 87.9、DeepSWE 62.7、CyberGym 83.3、HLE 42.7/60.0、Toolathlon 74.1、AutomationBench 31.8、DSBench 71.1/67.2、NL2Repo 61.5、Agents' Last Exam 25.7)および拡張コーディングセット全体(SWE-bench Verified 80.6、LiveCodeBench 93.5、Codeforces 3206、BrowseComp 83.4、MRCR 83.5、CorpusQA 62.0、GPQA Diamond 92.8)。DeepSeek自身のドキュメントでは、Terminal-Bench 2.1の数値を「プロバイダーラン」とラベル付けしています。
そう読むと、その説明は一貫している。DeepSeek V4 Proは実際に中位に位置するフロンティアモデルであり、AA 53、ランキングは10位台から20位台。ベンダーのスコアカードでは、エージェント性能とコーディング性能がほぼトップクラスであると主張している。どちらの記述も真実であり、矛盾はない。一方は測定されたものであり、もう一方は主張されたものである。

スコアカードの費用
DeepSeek V4 Pro は、総パラメータ1.6T / アクティブ49BのMoEフラッグシップで、1Mトークンのコンテキストウィンドウと384Kの最大出力を備えています。OrcaRouterでは、DeepSeekの定価でマークアップなしの価格設定です: 入力トークン100万個あたり$0.435、出力トークン100万個あたり$0.87 (キャッシュ読み出しは100万トークンあたり$0.060)。これは、2026年8月15日に確認したディレクトリとライブモデルページで確認された内容に基づいています。このレートでは、価格対ポイントの計算がこのモデルにとって最も有力な論拠となります。独立したインデックスで同程度のスコアのモデルと比べ、出力価格はおよそ10分の1です。つまり、ベンダーの主張が正しければ、トップクラスに近いスコアカードに対してミッドレンジの価格を支払っていることになります。ひとつ注意点: DeepSeekは、北京時間8月17日からピーク/オフピークの料金スケジュール(オフピークはピークの50%)を発表しており、レートは変動する可能性があります。ここに記載されている数字は、本記事時点でのライブ定価です。

この推奨が誤っている場合
DeepSeek V4 Pro が最適ではない、正直なケース:
• 独立に確認されたフロンティア推論が必要です。AA Index 53は中位です — Kimi K3 (60) と GPT-5.6 Terra (57) が先行しており、検証済みです。もしあなたの決定が測定された上限に依存するなら、ベンダーカードはそれを変えません。
• あなたは誰かが DeepSWE 62.7 を再実行する前に、本番運用をそれにかけている。 1回のリリースでの 12.8→62.7 というジャンプは、事実ではなく主張に過ぎない。中立な再現を待て — 87.9 対 78.7 の Terminal-Bench の差は、そこで見つかるかもしれないものを示している。
• あなたのワークロードは、サンドボックス化されたターミナル自動化またはExcelの財務モデリングです。Vals AIによると、これらはまさにモデルが苦手とする領域であり、ベンダースコアとは無関係です。
• あなたはCyberGym 83.3に基づいてサイバーセキュリティの意思決定を行っています。それはDeepSeekが自社のモデルを自社のベンチマークでテストしているものです。この数値に基づいて購入するセキュリティベンダーは、監査されていないデータを購入していることになります。
結論
DeepSeek V4 Pro 0813は、ベンダーのスコアカードが独立した評価記録を上回る、真のフロンティアモデルです。0813リリースは、テキストプレビューを本格的なエージェント型の競争力のあるモデルへと変えました——リリース自体は別途取り上げています——そして今日これを評価したいなら、DeepSeekの定価でOrcaRouter上のOpenAI互換キーとして利用でき、プロバイダーが停止した場合の自動フェイルオーバーも備わっています。この記事が切り分けるようにスコアカードを読んでください。独立した検証結果(AA 53、Vals 12th、78.7のTerminal-Bench実行)は今日信頼できるものであり、87.9や62.7という数字は、それらに基づいて構築する前に検証すべきものです。価格性能比と100万トークンのコンテキストのために購入すべきであり、再現されていない見出しの数字のために購入すべきではありません。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
