「DeepSeek V4.1 Flash」と表示されたヒーロータイトルカード。サブタイトルは「.1というバージョン番号をまとった、まったく新しいベースモデル」。2つのピルバッジには「GA - 2026年9月10日」と「オープンウェイト - MIT」。フッター行には「ベンダー報告によるアーキテクチャ。独立した評価はまだ行われていない」。左側に圧縮バーのモチーフ、右下隅にOrcaRouterのロゴが合成されている。
Guides & Insights

DeepSeek V4.1 Flash: ポイントリリース番号を冠した真新しいベースモデル

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4.1 Flash は2026年9月10日にリリースされた。MITライセンスのオープンな重み、100万トークンのコンテキスト、まったく新しいCausal Encoder-Decoderアーキテクチャ、そして5520億パラメータのMixture-of-Expertsバックボーンを備え、DeepSeek自身のモデルカードはこれを同社が「新しいアーキテクチャファミリー」と呼ぶ分類に位置づけている。また、この命名を指摘したトラッカーが正しければ、DeepSeekが完全に新しいベースモデルに.1のバージョン番号を付けたのは今回が初めてとなる。このラベルは通常、再構築ではなく調整(チューンアップ)を意味する。その番号が今や示唆するフラッグシップであるDeepSeek V4.1 Proは、まだ存在しない。

その不一致は、単なる命名上の議論以上の重みを持つ。バージョン番号でDeepSeekの世代を比較する人は誰でも、「V4 FlashからV4.1 Flashへ」という変化をパッチ的な小更新と読み解き、それに応じて注目の度合いを調整するだろう。しかし、その背後にあるアーキテクチャはそうではないと示している。さらに、同社自身が1.6兆パラメータのフラッグシップを退役させてFlashモデルを採用した決定は、より一層明確にそうではないと物語っている。

A single-column scoreboard titled 'DeepSeek V4.1 Flash - the scoreboard' listing Released 10 Sep 2026 (web, app, API), Backbone 552B-parameter MoE, Architecture Causal Encoder-Decoder, Active per token 8B prefill / 16B decode, KV cache 890 bytes per token (FP4), and Price $0.15 in / $0.60 out per 1M, with a footer reading 'Figures per DeepSeek's model card and API docs; no independent evaluation has been published.'

9月10日に実際にリリースされたもの

これはリークでもベータでもない。9月8日にモデルID deepseek-v4.1-flash-expires-on-0910 で開始された2日間のAPIテストは、そのサフィックスが示すとおりに終了し、本日、DeepSeekのウェブアプリ、モバイルアプリ、ファーストパーティAPI全体で本リリースが提供されました。ウェイトとテクニカルレポートはHugging Faceの以下のリポジトリで公開されています: deepseek-ai/DeepSeek-V4.1-Flash

実際的な詳細は儀式よりも重要だ:

• モデル名 — deepseek-flash と呼びます。従来の名前 deepseek-v4-flash および deepseek-v4-flash-vision-exp は依然として受け入れられますが、以前と同じモデルには解決されなくなりました。両方とも廃止され、これらの名前を使用するリクエストはDeepSeek V4.1 Flashによって処理され、Flashレートで請求されます。

• 箱の中身 — 552Bのバックボーンパラメータ、1Mトークンのコンテキストウィンドウ、384Kの最大出力、JSON出力、関数呼び出し、そしてデフォルトで有効な思考モード(低・高・最大の努力レベル設定付き)

• ライセンス — MIT。重みも含まれており、リポジトリには推論フォルダと独立したエンコーディングモジュールが含まれています。DeepSeekはオープンソースコミュニティに推論サポートの構築を明示的に呼びかけており、これは主要なランタイムでのデイゼロ対応が数週間ではなく数日のうちに実現することを示す標準的なシグナルです。

ポイントリリースではない.1

この記事の発端となった主張は、匿名ながら多くの人が注目するDeepSeekウォッチャーであるteortaxesTex氏が9月10日に投稿したものだ。その内容は、「DeepSeekが完全に新しいベースモデルに.1のリリースバージョンを付けるのは初めて」であり、V4.1は「例えばLLaMA 1に対するLLaMA 3よりも、V4との違いが大きい」、そしてDeepSeekは「これをV5に値するとは感じていない」— ただし、投稿者はその理由を説明できていない。

因果部分は推測として扱い、構造部分は検証可能なものとして扱うべきだ。その推測——DeepSeekがV5ではなく.1を選んだ理由——は、ひとりの観察者の見解に過ぎない。社外の誰もその決定を説明しておらず、DeepSeek自身の資料もこの点に一切触れていない。検証可能な部分はアーキテクチャであり、それはポイントリリースには見えない。DeepSeekのチェンジログはV4.1 Flashを「当社の新しいアーキテクチャファミリーの中で最小のモデル」と説明しているが、これはバージョンアップについて書くには奇妙な文だ。バージョンアップはファミリーを拡張するものであって、創設するものではない。

曖昧さには実際のコストが伴い、そのコストはDeepSeekではなく買い手にのしかかる。バージョン番号は、開発者にとって「これは新世代なのか、それとも再調整なのか、そしてどれだけの評価予算を割く価値があるのか」という問いに対する最も安価なシグナルだ。DeepSeekは今やそのシグナルを一方向において信頼できないものにした。つまり、アーキテクチャファミリーを確立するモデルは、ポストトレーニングのレシピを変更しただけのモデルと、小数点一桁分しか離れていない。同社はV5のマーカーを温存しておくことができる。移行評価を行う全員が、その混乱の代償を払うことになる。

「新しいアーキテクチャ」が重みにおいて何を意味するか

モデルカードは異常なほど具体的であり、そのため世代に関する主張はベンチマークを一つも使わずに簡単に検証できます。際立っている点が4つあります。

A screenshot of the DeepSeek-V4.1-Flash model card on Hugging Face (captured September 10, 2026) showing the MIT licence tag, Image-Text-to-Text and safetensors tags, 485B parameters in the sidebar, and model-card text describing a multimodal Mixture-of-Experts with 552B backbone parameters, a Causal Encoder-Decoder architecture of a 20-layer causal encoder followed by a 20-layer decoder, activation of 8B parameters per token during prefill and 16B during decode, SWA Bounded Replay, Compressed Sparse Attention 2, and a KV cache footprint of 890 bytes per token.

• 非対称アクティベーション — Causal Encoder-Decoder分割は、20層の因果エンコーダーとそれに続く20層のデコーダーで構成される40層のトランスフォーマーであり、デコーダーのグローバルKVキャッシュは各デコーダー層自身のものから導出されるのではなく、エンコーダーの最終隠れ状態から投影される。この設計の意図は、モデルがプリフィル中はトークンあたりわずか8Bパラメータのみを活性化し、デコード中は16Bを活性化することにある。入力が重いエージェントワークロード(長いドキュメント、長いツールトレース)はモデルの安価な半分を使用し、生成は高価な半分を使用する。

• KVキャッシュ圧縮(トークンあたりで測定)— DeepSeek-V4.1-FlashはFP4メインKVキャッシュをトークンあたり890バイトで実行しており、カードではDeepSeek V4 Flashのおよそ4分の1とされている。中国の報道はさらに踏み込み、初代V4モデルとの比較で437倍の削減として圧縮を位置づけた。この大きな数字はベンダー提供の計算に基づくもので、基準が異なるため、測定値ではなく主張として扱うべきだ。

• SWA Bounded Replay — スライディングウィンドウ・アテンションは通常、コンテキストを再構築するためにKV状態をSSDに永続化する必要があります。これに対し本手法では、最新ウィンドウのトークンのみをリプレイして欠落したSWA KV状態を再構築し、永続KVフットプリントをDeepSeek V4 Flashの約8分の1に削減します。

• Compressed Sparse Attention 2 — 各アテンション層は (Full、Reindex、Reuse) の 3 つの静的モードのいずれかで実行され、KV とインデクサーの状態を層間で共有します。階層型スパースインデクサーは、深い層のコストをコンテキスト長とは無関係に制限します。

これら4つをまとめて読めば、戦略的な全体像は明確になる。これはまずスパース性とキャッシュ効率を重視したアーキテクチャであり、後で同じ構造をスケールアップできるように設計されている。「新しいアーキテクチャファミリー」という言及には実質的な意味がある — すなわち、さらなる展開が控えているという表明なのだ。

ベンチマークはベンダー報告によるものであり、まだ反証されていない。

DeepSeekはリリースと同時にベンチマークセットを公開した。同社自身の数値によると、V4.1 FlashはGPQA Diamondで90.9、Codeforcesレーティング3471、MathArena Apex 65.6、Terminal-Bench 2.1で90.6、DeepSWE v1.1で74.2、ツール使用時のHLEで63.9を記録した。最後の項目には、ベースラインの36.8という数値をそのベンチマークのテキストのみのサブセットに限定する旨の脚注が付いている。

それらが何であるかを明確にすべきだ。それらはベンダーによる報告値であり、独立した評価を伴わずに公開された数字だ。そしてDeepSeekが自社のフラッグシップを退役させる正当化に使った数字でもある——だからこそ、最も検証に値する数字なのだ。9月10日のローンチ時点で、Artificial AnalysisはDeepSeek V4.1 Flashの測定結果を公開しておらず、Hugging Faceのモデルページにも、このモデルが「いかなる推論プロバイダーにもデプロイされていない」という注記が残っていた。今回のリリースの要となる主張——Flashクラスのモデルが1.6Tパラメータのフラッグシップを性能・コスト・速度・総処理時間のすべてにおいて総合的に上回るという主張——は、現時点では外部監査を受けていないベンダーの主張にすぎない。

反対側にも正直な注意点がある。同じベンダーの報告では、V4.1 Flash は Kimi K3 との16件の比較中13件、GLM-5.3 との13件の比較中11件で勝利しているが、新しい Terminal-Bench 3.0 と 4.0 のタスクおよび ProgramBench では GPT-5.6 Sol と Claude Opus 5 に依然として及ばない。これは筋の通った形である——このアーキテクチャが最適化されているコーディング、ターミナル、エージェント自動化の作業では最も強く、フロンティア推論タスクでは弱い——そして、それは真の世代交代が持つであろう形でもある。

価格、そしてカレンダーに登録する価値のあるルーティングスイッチ

新しい価格設定はローンチとともに有効になり、以前と同じFlashレートカードであり、値下げではありません。deepseek-flashでは、キャッシュヒット入力はオフピーク時で100万トークンあたり0.003ドル、ピーク時で0.006ドル、キャッシュミス入力は0.15ドルと0.30ドル、出力は0.60ドルと1.20ドルです。ピーク時はオフピーク時のちょうど2倍で、平日の01:00–04:00と06:00–10:00 UTCに適用されます。

削減の影響は、代わりにProトラフィックに及ぶ。DeepSeek V4 Proは、キャッシュヒット入力が$0.022と$0.044、キャッシュミス入力が$0.66と$1.32、出力が$1.98と$3.96という価格設定である。したがって、Proという名称のリクエストをV4.1 Flashにルーティングすると、出力コストは約70%低下し、しかもDeepSeekの説明によれば、それらに応答する能力は向上する。

A screenshot of DeepSeek's official API Models & Pricing page (captured September 10, 2026) showing columns for deepseek-flash and deepseek-v4-pro, with model versions DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, both at 1M context length and 384K maximum output. Vision is marked supported for deepseek-flash and 'not supported' for deepseek-v4-pro. Pricing shows 1M cache-hit input tokens at $0.003 off-peak and $0.006 at peak for deepseek-flash versus $0.022 and $0.044 for deepseek-v4-pro, and 1M cache-miss input tokens at $0.15 off-peak and $0.3 at peak for deepseek-flash versus $0.66 and $1.32 for deepseek-v4-pro.

その再ルーティングは予定されたものであり、仮説上の話ではありません。2026年9月14日12:00(北京時間)以降、リクエストが指定するのはdeepseek-v4-proであり、そのリクエストは V4.1 Flash に送信され、Flash 料金で請求され、DeepSeek V4.1 Pro がリリースされるまでそのままです。インテグレーションで Pro モデル名をハードコードしていても、何も壊れません。コード変更なしで、出力価格のおおよそ3分の1の価格で別のモデルが提供され、通知はチェンジログの記載のみです。モデル名ではなく能力層でルーティングしている場合は、再テストの日付は9月14日です。

今日DeepSeekを呼び出すなら、これが意味すること

OrcaRouterはまだDeepSeek V4.1 Flashをサポートしていません。本日時点では、deepseek-v4.1-flashのモデルページは「model not found」を返します。私たちはそれを暗に示すより、率直にそう伝えたいと考えています。これに伴い、二点あります。第一に、DeepSeekが発表したリルートはファーストパーティのAPI動作であり、9月14日の切り替えは、どのようにアクセスしてもDeepSeek自身のエンドポイントで発生します。第二に、今日新しいアーキテクチャを利用したい場合は、ベンダーに直接アクセスすることになります。

私たちが1つのキーでルーティングするのは、DeepSeek ラインの残りです: DeepSeek V4 FlashDeepSeek V4 Pro、そして200以上の他のモデルも含みます。そこでの価格は、DeepSeek のプロバイダーリスト価格をマークアップ0%でそのまま透過させたものです。これは今回のようなリリースにとって重要な点です。ベンダーが料金を引き下げた場合、その引き下げは再価格設定サイクルの後ではなく、当日中に当社側でも反映されます。また、V4.1 Flash がカタログに登場した場合、上記のオフピーク半額レートがそのままレートとなり、私たちが交渉するような割引ではありません。

これほど新しいモデルに対するルーティングの論点は、実際には価格ではない。{{1}}独立したベンチマークもサードパーティの提供もない最初の1週間のアーキテクチャ{{/1}}に、プロダクションパスのどれだけを賭けるかという問題だ。新モデルを切り替え可能なティアの背後に置き、{{2}}切り替えるか、プロダクションキーではないキーでテストする{{/2}}——それが評価とインシデントの違いを生む。

命名問題を解決するものは何か

3つのこと。それぞれがあなたに伝える情報量の昇順で。

DeepSeek V4.1 Flashの独立評価は、アーキテクチャに関する主張を他者のハーネスでテストすることになるだろう。それがベンダーの表を事実へと変える唯一の測定であり、最も可能性の高い次のニュースでもある。

DeepSeek V4.1 Proは、ファミリーという主張を検証することになるだろう。ルーティング通知は、それをPro-to-Flashウィンドウのエンドポイントとして指名しており、それにより、このリリース全体がそのモデルを中心に構成されていることになる。そして、それはDeepSeekが最も確かめていないモデルであり続けている:モデルカードも、パラメータ数も、日付も、重みも、価格もない。

そして、地味ながら有用な問いは、DeepSeekがまた同じことをするかどうかだ。別の新しいベースモデルに二度目の「.1」ラベルが付けられれば、それは異例を慣例に変える。そして慣例とは、開発者がそれを前提に計画を立てられるものだ。一つのモデルは好奇心の対象にすぎない。命名が有益な形で誤解を招くようになるのは、パターンができてからのことだ。

今のところ、実用的な解釈は、あなたが誰であるかによって明確に分かれます。DeepSeek V4 Pro を利用しているなら、カレンダーに9月14日を入れ、それまでに評価を再実行してください。なぜなら、その名前の背後にあるモデルは、あなたが求めようと求めまいと変更されるからです。DeepSeek V4 Flash を利用しているなら、あなたはすでに、同じ価格のまま、DeepSeek がスケールするために構築したアーキテクチャへ移行されています。そして、V5 を待っていたなら、正直な答えは、DeepSeek はその世代を出荷したのに名前を付けるのを拒否したように見える——というものです。それは、人々がその数字を信頼しなくなる前に、一度しかできない類のことです。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新