ヒーロータイトルカード:DeepSeek V4.1 Flash ベンチマーク — 74.2が証明することと、証明しないこと。2026-09-10に公開、注記は「6日間の独立した結果」。
Guides & Insights

DeepSeek V4.1 Flash ベンチマーク:74.2が証明することと、証明しないこと

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4.1 FlashはDeepSWE v1.1で74.2を記録し、GPT-6 Astraを0.1点上回り、Gemini 3.8 FlashとClaude Opus 5を0.5点上回った。この数字は、世代交代の象徴として一週間ずっと引用されてきた。それが実際に何であるかを正確に述べる価値はある。モデル自体は新しいものではない——DeepSeek V4.1 Flashは2026-09-10、つまり6日前に一般提供が開始された——したがってここにあるのはローンチではない。その期間内に登場したのは測定レイヤーである。最初の独立したインデックスエントリ、最初の独立したアリーナ結果、3つのスタックにわたるday-0の提供サポート、そして自社のフラッグシップをこれに取って代わる形で引退させるというベンダーの決定だ。このページは、実際に測定されたもののまとめであり、すべての数値に出典を明記し、まだ誰も立証していないことを率直に述べるものである。

DeepSWEの数字、そしてそれから0.5ポイント以内に入る4つのモデル

DeepSWE v1.1 は Datacurve による長期的なソフトウェアエンジニアリングベンチマークです — 91 のオープンソースリポジトリ、5 つのプログラミング言語にわたる 113 の独自タスクで、複数ファイルにまたがる変更と振る舞いの正しさを中心に構築されています。DeepSeek 自身のモデルカードでは、ベンダー報告の表は次のようになっています:DeepSeek V4.1 Flash 74.2、Claude Opus 5 74.0、GPT-5.6 Sol 73.0、Kimi K3 67.5、GLM-5.3 66.9、DeepSeek V4-Pro-0813 62.7、DeepSeek V4-Flash 54.4。

同じベンチマークの独立したリーダーボードはその順序を再現しておらず、その違いは見出しよりも重要だ。DatacurveのDeepSWE v1.1 Pass@1リーダーボードでは、Muse Spark 1.3 (FAIR)が75.40で1位となり、DeepSeek V4.1 Flashの74.20を上回っている。それに続くのは、GPT-6 Astraが74.12(エクストラハイ)と74.10(最大)、Gemini 3.8 Flashが73.83(高)、Claude Opus 5が73.65(最大)。

つまり、74.2は実際の第三者リーダーボードに実在するエントリであり、2位であって1位ではない。リリース当日に流布した、これがDeepSWEの最先端だという主張は、そのスコアを掲載するリーダーボードと突き合わせると成立しない。Muse Spark 1.3が1.2ポイント差でリードしている。

さて、省略されがちな部分。このベンチマークでは、4つのフロンティアモデルが互いに0.55ポイント以内に収まっている:74.20、74.12、73.83、73.65。これは測定ノイズよりも狭い幅だ。DeepSWEで公表されている実行ごとの変動は1.4~3.2ポイント程度、つまりトップ4全体の幅の3~6倍の大きさである。GPT-6 Astraに対する0.2ポイントのリードは発見ではない。それは、小数第2位まで表示したときに同点がどう見えるかというだけだ。

スキャフォールド感度は、その数値を軽く受け止めるべき第二の理由であり、ここではベンダー自身のドキュメントが証拠を提供している。DeepSeekは同じリリース資料の中で、8つのスキャフォールドにわたるDeepSWEを報告している。74.2はmini-SWEで達成された。同じモデルはDSH Minimalで72.6、DSH Standardで70.5、Claude Codeで69.8、DSH PTCで67.6、Piで66.2、Codexで65.6、OpenCodeで65.5を記録した。これは1つのモデルと1つのベンチマークにおける8.7ポイントの開きであり、それを取り巻くハーネスだけによって生じている。mini-SWEで得られたDeepSeekの数値を、異なるエージェントループで得られた競合他社の数値と比較する人は、モデルではなくスキャフォールドを比較している。

独立したインデックスが実際にそれをどこに配置するか

Artificial Analysisは、宣言されたエフォート設定で固定スイートを実行するため、そのIntelligence Indexは利用可能な最もクリーンな外部チェックとなる。DeepSeek V4.1 Flashのモデルページでは、推論最大エフォート時、インデックスは40——そのクラスの113モデル中6位で、クラス中央値は18。クローズドな競合モデルはその上に位置する。Claude Opus 5(max)51、GPT-5.6 Sol(max)47、GLM-5.3(max)45、Kimi K3(max)44、Gemini 3.8 Flash(high)41。DeepSeek自身の前回のフラッグシップであるV4-Pro-0813は、36でその下に位置する。

二つのスコアボードを並べて見れば、その不一致は構造的なものであって、間違いではない。DeepSeekが選んだベンチマークでは、適切なスキャフォールドのもとで、このモデルはフロンティアと並ぶ。推論、コーディング、数学、エージェント作業にわたって平均した固定の外部スイートでは、Claude Opus 5より11ポイント遅れ、Gemini 3.8 Flashより1ポイント遅れている。両方とも真であり得る。ベンダーの表は主張であり、インデックスは平均である。

インデックスページには、ルーティングの判断で重要でありながら、めったに見出しを飾ることのない2つの数値も掲載されている。DeepSeek V4.1 Flashは最大エフォート時に毎秒214.4出力トークンで動作する——速い。さらに、Intelligence Indexを完了するまでに2億5000万出力トークンを生成した。これは中央値の1億4000万に対してであり、Artificial Analysisは著しく冗長だと指摘している。冗長性は品質の問題ではない。それは請求書である。競合モデルより79%多いトークンで考えるモデルは、長い推論呼び出しのたびに価格優位性の一部を返上することになる。

Single-column scoreboard for DeepSeek V4.1 Flash: DeepSWE v1.1 74.2, second behind Muse Spark 1.3; Artificial Analysis Intelligence Index 40 against Claude Opus 5 at 51; ProgramBench 20.3 single model; ProgramBench agent team 30.04% at 8 hours; output speed 214.4 tokens per second; off-peak price $0.15 in and $0.60 out per 1M.

ProgramBench:シングルモデルのスコアとマルチエージェントのスコアは、同じ測定ではありません

これは最も誤読されやすい数字なので、注意深く分けておく価値があります。

• 単一モデル、標準構成 — DeepSeek V4.1 Flash は、DeepSeek 自身のモデルカードによると、ProgramBench(Almost@1)で 20.3 を記録しています。それは 以下を下回っています:GPT-5.6 Sol の 23.0。Claude Opus 5 の 37.0 をはるかに下回り、GLM-5.3 の 19.0 と Kimi K3 の 17.5 をわずかに上回るにとどまります。ベンダーによる報告であり、このモデルをよく見せるものではありません。

• マルチエージェントチーム構成 — DeepSeekの技術レポート、DeepSeek-V4.1-Flash: KVキャッシュ圧縮の限界を押し広げるでは、リードエージェントが共有タスクボード上でチームメイトを調整する、予備的なAgent Swarm RLレシピについて説明しています。高信頼度の172タスクからなるProgramBenchサブセット(参照解が95%以上で合格するタスク)において、マルチエージェント構成は1時間の制限時間で13.59%から8時間で最高30.04%まで上昇し、一方シングルエージェントのベースラインは12.79%から20.39%へと上昇します。

30.04% は「30%」という主張の根拠であり、単一モデルのスコアではありません。これは8時間を与えられたエージェントのチームが、フィルタリングされたサブセット上で、ベンダー自身の予備評価において測定されたものです。それが促す比較 —「単一の Sol をはるかに上回り、Kimi K3 のほぼ2倍」— は、Sol の 23.0 と K3 の 17.5 に対して算術的には公平であり、またマルチエージェント構成と、異なるタスクセット上での単一モデルベースラインとの比較でもあります。同じレポートは FrontierSWE v2 への影響も示しています。マルチエージェントは20時間で 32.90% に達し、単一エージェントは 28.20% でした。その差は実在し、期限が延びるにつれて縮まり、それを得るためのトークンコストは小さくありません — ある実践的な記事では、10倍を超えるトークン数と4時間に迫る実行時間が報告されています。

パラメータ数はまだ確定していないため、あらゆるサイズ比較は暫定的なものとして扱ってください。

DeepSeekのリリースノートは「552BパラメータのMoE」と説明している。これはベンダーによる数値であり、ほとんどの報道が繰り返しているものでもある。また、それはアーティファクトの全体像でもない。

DeepSeek自身のモデルカードには、トランスフォーマー基盤と並ぶ第2の構成要素が記載されている:「Engram条件付きメモリ(196Bパラメータ、トークンベースのルックアップで疎にアクセス)」。両者を合計すると748Bになる。これが、リリースから数時間以内にr/LocalLLaMAで広まったコミュニティの解釈の背後にある算術であり、モデルカード自身のsafetensorsインデックスには、そのテンソル型全体で763Bパラメータが列挙されている。約510GBというFP8の数字は、同じ分析の系譜から来ている。実際にダウンロードしてメモリに保持するものを指しているのだ。

つじつまが合うのは、これらがそれぞれ別のものを数えているからだ。552Bは計算のバックボーン、つまりトークンが通過するパラメータだ。196Bは特定の層で参照されるルックアップテーブルで、その上で計算するのではなく、保存された情報を返す。DeepSeekが提示しているアクティベーション値である8Bと16Bは、それぞれプリフィル時とデコード時にアクティブになるトークンごとのスライスだ。この4つの数値はすべて同じモデルを表している。

そんなことは何一つとして、この比較を安全にはしない。「このモデルはサイズの何分の一かでフロンティアモデルに匹敵する」という形の主張はすべて、成果物の5分の1を除外したベンダーの見出しに依拠している。誰かが再現可能なパラメータの内訳を公表するまでは、サイズに基づく議論にはその注意書きをインラインで添えるべきだ。

ARC-AGI: このモデルの結果はありません

DeepSeek V4.1 Flash の ARC-AGI-2 および ARC-AGI-1 スコアは存在しません。ARC Prize の検証済み結果ページにはこのチェックポイントの項目がなく、DeepSeek 自身のベンチマーク表にも ARC の行はありません。ARC Prize が検証した唯一の DeepSeek 結果は、より古い V4 Flash 0731 チェックポイントのもので、最大推論エフォート時の ARC-AGI-2 セミプライベートで 61.4%、ARC-AGI-1 で 89.0%、タスクあたりそれぞれ $0.04 と $0.02 です。それらは別モデルである前身の数値であり、V4.1 Flash の結果として引用するのは誤りです。ARC-AGI があなたの評価にとって重要なら、このモデルは現在スコア未評価です。

ほかに何がウィンドウ内に着地しましたか

このモデルを試してみるかどうかを決めようとしている読者にとって、変わったことが3つあり、そのいずれもこのモデル自体のリリースによるものではありません。

• 独立したアリーナの結果。 OpenDesign Arena は13のモデルに同一のデザインタスク — ウェブアプリ、ダッシュボード、モバイル画面、ランディングページ — を実行させた。DeepSeek V4.1 Flash は100点満点中81.2点を獲得し、GPT-6 Astra の82.7点に対した。完成したデザイン1件あたり$0.023 対 $1.61、完了時間は5.3分 対 11.1分だった。納品率 — 修正なしで使用可能な出力 — は57.7% 対 Astra の60%だった。これは同モデルに関する真に独立した測定の最初の一つであり、一般的な推論やコーディングではなく、デザイン出力を特に対象としている。

• 3つのスタックでDay-0サービングをサポート。 vLLMはDay-0イメージ(2026-09-09)を公開し、NVIDIAとAMDのハードウェアで検証済み。SGLangとMilesは2026-09-10にDay-0の推論およびRLサポートを公開した。これには、4基のGB300でKVキャッシュ容量を36%引き上げたEngramホストオフロード経路や、8基のH200でプリフィルスループットを1.56倍に高めた有界リプレイ最適化が含まれる。Cambriconも同日、vLLMスタックにおけるDay-0適応を発表した。前世代のHBMフットプリントの4分の1、SSDの8分の1という積極的なKVキャッシュ圧縮を売りとするモデルにとって、初日から標準スタックで実行できるかどうかは、実験室の結果と実際にデプロイできるものとの分かれ目となる。

• ベンダーは自社のフラッグシップを廃止した。DeepSeekはV4-Proを段階的に廃止しています。2026-09-14の04:00 UTC以降、「deepseek-v4-pro」を指定するリクエストはV4.1 Flashにルーティングされ、Flashの料金で請求されます。これはV4.1 Proがローンチされるまで続きます。DeepSeek V4.1 Proはリリースされていない — それは将来のモデルであり、このリダイレクトは固定された統合が壊れるのを防ぐための暫定措置です。また廃止されたもの:「deepseek-v4-flash」と「deepseek-v4-flash-vision-exp」で、どちらも互換性のために一時的にV4.1 Flashにルーティングされます。本番環境で固定されたモデルIDを使用している場合、このリダイレクトはこのページで無視できない唯一の運用上の事実です。

価格が意思決定に与える影響

料金設定こそ、このモデルがベンチマークの話ではなくなるところです。DeepSeek自身が公表した料金によれば、2026年9月10日 04:00 UTC発効で、ピーク時間帯は平日の01:00~04:00および06:00~10:00 UTCと定義され、それ以外はすべてオフピークです。

• オフピーク時、100万トークンあたり — キャッシュヒット $0.003、キャッシュミス $0.15、出力 $0.60。

• ピーク時、100万トークンあたり — キャッシュヒット $0.006、キャッシュミス $0.30、出力 $1.20。

• キャッシュされた入力は、フロンティアのクローズドモデルと比較して — 100万トークンあたり0.3セント対約50セント。同じリポジトリをループするエージェントにとって、その階層がトークンの大半を占める。

• 当社自身のカタログで測定 — 100万トークンあたり入力$0.15、出力$0.60、最初のトークンまでの中央値784 ms、過去7日間で毎秒211トークン。

Artificial Analysisは、同じモデルを入力$0.30、出力$1.20、98%のキャッシュ割引、ブレンドで100万あたり$0.18として掲載している。これはピーク階層の料金であり、その2つの数字は1日の異なる時間帯における同じ価格を指している。ベンダーを比較する前に、この区別は内面化しておく価値がある。二段階の時間帯料金を持つモデルは、単一の見出し料金では比較できない。

こうした理由から、ここではパススルー価格設定がいつも以上に重要になります。OrcaRouter はDeepSeek V4.1 Flashをその他のカタログとともにルーティングしで0%のマークアップ提供します — プロバイダーの定価そのまま、変更なし。つまりDeepSeekのピーク帯とオフピーク帯の料金は、DeepSeekが公表するとおりにこちら側へ届き、ベンダーの価格変更は当日に反映されます。平日の朝、4時間だけ料金が倍になるモデルにおいて、料金帯を平坦化するプラットフォームは、あなたに必要な唯一の数字を隠しているのです。

Screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash (Reasoning, Max Effort), showing an Artificial Analysis Intelligence Index score of 40 at rank 6 of 113, output speed 214.4 tokens per second at rank 4 of 113, $0.30 per million input and $1.20 per million output tokens with a 98% cache discount and $0.27 cost per Intelligence Index task, verbosity of 250M output tokens at rank 37 of 113, a 1M token context window, 552B total and 16B active parameters, and an MIT license.Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model identifier, NEW and FEATURED badges, Vision, Tools, JSON and Reasoning capability tags, a release date of 2026-09-10, a 1M token context window, 384K maximum output, text and image input, $0.15 input and $0.60 output per million tokens, and a p50 time to first token of 784 ms.

誰も確立していないこと

このストーリーのギャップは、欠けているベンチマークではない。問題は、DeepSeek V4.1 Flash とその名指しされた競合他社との間で、共通のハーネス上で、結果に利害関係のない人物によって実行された、信頼できる直接対決が存在しないことだ。このページのあらゆる数値は、次の三つのうちのどれかである。ベンダー報告、異なる構成で第三者によって生成されたもの、あるいはこの対決を切り分けるようには設計されていない固定スイート全体の平均。DeepSeek V4.1 Flash と GPT-6 Astra が同じタスク、同じスキャフォールド、同じエフォート設定で評価され、分散とともに公開された実行は存在しない。

具体的な3つのことがあれば状況は一変するだろうが、そのいずれも今日は存在しない。

• スキャフォールドを統制したDeepSWE比較。 DeepSeek自身のスキャフォールド間で生じる8.7ポイントの差は、リーダーボード上位4モデル間のどの差よりも大きい。フロンティアが単一のハーネスで測定されるまでは、あの表の最上位の順序に意味はない。

• ProgramBenchのエージェントチームの結果に対する独立した再現です。 この30.04%という数値は、フィルタリングされた172タスクのサブセットに関するベンダーの技術レポートに基づくもので、予備的な構成での結果であり、そのトークンコストは本番予算向けに特性評価されていません。

• ARC-AGI. このチェックポイントにはスコアが一切存在しません。

実際上の帰結は、見出しが支持するよりも狭い主張である。DeepSeek V4.1 Flash は、ある長期的なコーディングベンチマークでは測定上フロンティアとの差が誤差範囲内にあり、独立した設計タスクでは約1.4%のコストで真に競争力があり、総合指標では約10ポイント劣っている。それだけで、あなた自身のワークロードに対して実行し、あなた自身の評価で決着をつけることを正当化するには十分だ。0.2ポイントを根拠に本番のルーティングテーブルを書き換えることを正当化するには十分ではない — そして、それら両方の記述が真であるという事実こそが、この知見のすべてである。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新