ヒーロータイトルカードには「DeepSeek V4.1 Flash の料金」と表示され、その下に「入力 $0.15、出力 $0.60、キャッシュヒット $0.003」という行、キャプションには「100万トークンあたり、オフピーク時。ピーク時間帯はすべての料金が2倍。」、さらに3枚のカードには「キャッシュヒット:キャッシュミスより50倍安い」「100万トークンのコンテキスト」「オープンウェイト、MITライセンス」と表示されています。
Guides & Insights

DeepSeek V4.1 Flashの料金:全料金表と、請求額を決めるキャッシュヒット数

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

DeepSeek V4.1 Flashは2026年9月10日から一般提供されており、本日時点で公表されている料金表は、モデル市場の最上位層で最も安い。入力100万トークンあたり$0.15、出力100万トークンあたり$0.60、キャッシュヒット時は100万トークンあたり$0.003だ。これら3つの数字はオフピーク欄のものだ。DeepSeekの平日ピーク時間帯には、キャッシュヒットを含め、そのすべてが2倍になる。重要な比較対象は、DeepSeek自身の型落ちフラッグシップ——DeepSeek-V4-Pro-0813はオフピークで100万トークンあたり$0.66 / $1.98なので、Flashは入力で自社の兄弟モデルを約4分の1に値下げしている——ではなく、買い手が実際に価格比較の基準とするクローズドのフロンティア層、すなわちGPT-5.6 SolClaude Opus 5、Gemini 3.8 Flashであり、これらはいずれもトークンあたり1桁多く請求する。

数字の前に、ひとつ訂正です。今回のローンチに先立つリークが、いまだに出回っているからです。GA 前に広まった数字は、値下げが「明日」実施されると述べていました。価格は本物ですが、その見せ方は違いました。V4.1 Flash は 2026-09-10 にリリースされ、これらの料金はすでに有効でした。また DeepSeek 自身の変更履歴では、この値下げは後日行われた値下げではなく、リリースの一部として記録されています。以下はすべて、本日 2026-09-16 時点の DeepSeek のライブ価格ページから読み取ったものです。

2026年9月16日現在の完全な料金表

DeepSeekは、現在のSKUを網羅する1枚のシートを公開しており、各明細項目はピーク時とオフピーク時の列に分かれています。deepseek-flash(DeepSeek-V4.1-Flashを提供)の場合、公開されている料金は次のとおりです:

入力、キャッシュミス — オフピーク時は100万トークンあたり$0.15、ピーク時は100万トークンあたり$0.30

入力、キャッシュヒット — オフピーク時は100万トークンあたり$0.003、ピーク時は100万トークンあたり$0.006

出力 — オフピーク時は100万トークンあたり$0.60、ピーク時は$1.20

コンテキストウィンドウ — 1Mトークン、最大出力384K

同時実行数の上限 — Flash SKU では 2,500 件の同時リクエスト

レガシーモデルIDdeepseek-v4-flashdeepseek-v4-flash-vision-expは個別製品としては廃止されていますが、引き続き V4.1 Flash にルーティングされ、Flash の料金で課金されます

最初の2行の差が、このシートのすべてを物語っている。オフピーク時には、キャッシュヒットのコストはキャッシュミスより50分の1——98%の割引であり、Artificial Analysisがそのコストモデルで示しているのも同じ計算だ。このカード上でほかに請求額をそこまで動かすものはない。

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

ピークは丸め誤差ではなく、北京に合わせて計時されている

DeepSeek のピーク時間帯は月曜日から金曜日の 01:00–04:00 UTC および 06:00–10:00 UTC です。それ以外のすべて — 週末のすべての時間帯を含む — は半額で請求されます。倍額は3つのラインすべてに適用されるため、ピーク時間帯のキャッシュミスは $0.30、ピーク時間帯の出力は $1.20 かかります。

その時間帯がいつになるかは、あなたがどこにいるかによって完全に決まる。北京では09:00–12:00と14:00–18:00 — 2つの勤務ブロックであり、そこが要点だ。ベルリンでは9月、2番目の時間帯は08:00–12:00 CEST:ヨーロッパのチームにとって午前中全体がピークになる。ニューヨークでは同じ時間帯が02:00–06:00 EDTだ。米国拠点のチームが通常の勤務時間で動かしている場合、実質的にピーク時の請求は発生せず、EUのチームは毎朝、昼前に2倍の料金を払うことになる。バッチジョブをいつ実行するか選ぶなら、それは100万トークンあたり0.15ドルに値する判断であり、その判断には何のコストもかからない。

キャッシュヒット課金はエージェントの請求に実際に何をもたらすのか

DeepSeekではキャッシュヒットは自動です — ドキュメントによれば、ディスクキャッシュは全ユーザーに対してデフォルトで有効で、コードの変更は不要 — つまり、割引を受けるために設計を工夫する必要はありません。また、これはベストエフォートであり、保証されたものではありません。DeepSeekは固定のTTLは存在しないと明言しており、使われなかったキャッシュは「通常は数時間から数日のうちに」クリアされ、100%のヒット率は約束されていません。これに基づいて何かをモデル化する前に、レスポンスのprompt_cache_hit_tokensprompt_cache_miss_tokensフィールドを読んでおく価値があります。

形容詞よりも算術のほうが重要だ。40,000トークンの安定したプレフィックス——システムプロンプト、ツールスキーマ、リポジトリコンテキスト——を持つコーディングエージェントを、60ターンのセッションで実行するとする。各ターンで約2,000トークンのツール出力が追加され、モデルは約1,200トークンを出力する。セッション全体の総入力は594万トークン、総出力は72,000トークンである。

キャッシュを一切使わず、オフピークで請求した場合:入力5.94Mが$0.15で$0.891、さらに出力72,000が$0.60で$0.043 — 約$0.93がこのセッションの料金です。

プレフィックスがキャッシュされた状態での課金、つまり実際にデフォルトで起こることだが、その入力トークンのうち5.782Mはキャッシュヒットとして$0.003($0.017)で到着し、158,000はキャッシュミスとして$0.15($0.024)で到着し、同じ72,000の出力トークンは$0.043かかる。約$0.084 — およそ11倍安い。入力は請求額の95%から49%に下がり、キャッシュされた部分だけで21%を占め、出力トークンが最大の単一項目になる。同じモデル、同じセッション、同じ出力 — 変わったのはプレフィックスが再利用されたかどうかだけだ。

ものに注目してくださいない——DeepSeekの料金表には:キャッシュ書き込みの明細項目。Anthropicは5分間のキャッシュを生成するために基本入力の1.25倍を請求し、1時間なら2倍を請求する。DeepSeekの料金表にはヒットとミスのみが記載されており、そのキャッシュガイドには書き込み料金や保管料金について何も説明されていない。見出しのトークン料金ではなく、ベンダー間でキャッシュの経済性を比較しているなら、その不在は、50倍のヒット割引が示唆する以上に価値がある。

これもまた、OrcaRouter上のDeepSeek V4.1 Flashにおけるパススルーの仕組みがここで重要になる理由です。当社はプロバイダー自身の定価で、マークアップを一切加えずに請求しているため、ベンダーの価格変更は再価格設定の処理を待つことなく、当日中に当社側でもそのまま反映されます。そして、上記に表示されているキャッシュヒットおよびピーク/オフピークの各列は、それらを混ぜ合わせた概算ではなく、実際に請求の基準となるものです。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

DeepSeek-V4-Pro-0813 との比較:4倍の差、そして実現しなかった引退

明白な内部比較対象はフラッグシップSKUであり、それは見出しの料率が示唆するほど劇的ではない。モデルID deepseek-v4-proであるDeepSeek-V4-Pro-0813は、キャッシュミス時に100万入力トークンあたり$0.66、オフピーク時に100万出力トークンあたり$1.98で、ピーク時には倍の$1.32と$3.96になる。そのキャッシュヒットはオフピーク時に$0.022で、Flashの7倍以上だ。

キャッシュミス入力 — $0.15 対 $0.66(オフピーク時)、つまり Flash は 4.4倍安い

出力 — オフピーク時 $0.60 対 $1.98、つまり Flash は 3.3 倍安い

キャッシュヒット時の入力 — オフピーク時で $0.003 対 $0.022、つまり Flash は 7.3倍安価

コンテキストと出力の上限 — 両SKUとも1Mと384Kで同一

同時実行数 — Flashでは2,500、V4 Proでは500という5倍の差が、価格表からは完全に消えている

この比較については、間違えやすい点が3つある。第一に、再利用の論拠は、Flash のほうが倍率が大きいにもかかわらず、絶対額ではフラッグシップのほうが強い。100万トークンをキャッシュすると、V4 Pro では $0.638、Flash では $0.147 の節約になる。フラッグシップのミス率がそもそもはるかに高いからだ。第二に、誰もが消えたと思っていたモデルは消えていない。DeepSeek は 2026-09-14 に V4 Pro の提供を停止し、それらのリクエストを Flash に振り向けると発表し、本番ワークフロー下でバックエンドモデルを差し替えることに対して開発者から反発を招き、2026-09-11 に決定を撤回した。V4 Pro は今も提供されており、課金体系も変わっていない。第三に、そしてこれがリーク報道が陥った罠だ——リリースされた V4.1 Pro は存在しない。DeepSeek-V4-Pro-0813 が依然としてフラッグシップ SKU であり、ベンダーはその名前の後継製品を出荷していない。「V4.1 Pro」への移行を見積もっている人は、存在しないモデルを見積もっていることになる。

対 クローズドフロンティアティア

購入者が実際に最終候補に挙げるクローズドモデルと比較すると、倍率が最大の注目点です。以下の数値はすべて、本日時点で各ベンダー自身が公開している価格ページによるものです。

GPT-5.6 Sol — OpenAIのショートコンテキスト階層では、定価は入力100万あたり$5.00、出力100万あたり$30.00で、現在はプロモーション料金の$4.00 / $20.00が適用されており、OpenAIによれば少なくとも2026-11-21までは利用可能とのこと。キャッシュ入力は$0.40。プロモーション料金と比較すると、DeepSeek V4.1 Flashは入力で26.7倍、出力で33.3倍安い。定価と比較すると、33倍と50倍。SolのキャッシュヒットはFlashの133倍のコストがかかる。

Claude Opus 5 — 入力100万トークンあたり5.00ドル、出力100万トークンあたり25.00ドル、Anthropicの公開価格表ではキャッシュヒットが100万トークンあたり0.50ドル。これはFlashの入力料金の33倍、出力料金の42倍、キャッシュヒット料金の167倍にあたる。Anthropicの5分キャッシュの書き込みにはさらに1.25倍が上乗せされ、DeepSeekの価格表にはそれに相当する項目がない。

Gemini 3.8 Flash — 入力100万トークンあたり$0.75、出力100万トークンあたり$3.75、2026-12-31まで。両レートは2027-01-01に2倍になる予定で、キャッシュ済み入力は$0.075、そして — これが実際の請求書で繰り返し出てくる行です — キャッシュストレージは100万トークンあたり1時間$0.50。Flashは入力で5倍、出力で6.25倍、キャッシュヒットで25倍、それと比べて安く、DeepSeekはキャッシュを保持するのに何も請求しない。

これを誠実に保っているのは、能力面の文脈だ。Artificial AnalysisのIntelligence Index v4.3では、DeepSeek V4.1 Flash(reasoning、max effort)は40点で、113モデル中6位につけ、インデックスタスクあたり0.27ドル、毎秒214.4出力トークンとなっている。これは、比較対象のティアより26分の1という価格で、まさにフロンティアに隣接する位置づけだ。しかし同じ測定は、これがAAがテストした中で最も冗長なモデルの一つであり、インデックス実行全体で2億5000万出力トークンを生成し、中央値が1億4000万だったことも示している。冗長さはトークン単価を変えないが、請求額は変える。中央値より62%多くトークンを書くモデルでも、ここでは依然としてはるかに安い。しかし「トークンあたりが安い」と「タスクあたりが安い」は別の主張であり、実際に支払うのは後者のみだ。

無料プランはありますか?

いいえ。DeepSeek自身の料金ページには、無料のAPI枠、無料の月次割当、無料モデルは記載されていません。課金は従量課金制で、チャージ済みまたは付与された残高から支払われ、付与残高から先に消費されます。一般消費者向けチャットアプリは無料ですが、deepseek-flashを支えるAPIは無料ではなく、DeepSeekのプラットフォーム上にそれ用の無料エンドポイントはありません。いくつかのサードパーティのゲートウェイがこのモデルへの無料またはトライアルアクセスを宣伝していますが、当社はそれらをすべて、本番バックエンドではなくプロトタイピング用の場として扱います。なぜなら、そうした条件は予告なく変更され、いずれもベンダー自身の料金表を備えていないからです。

価格の裏にある効率性の主張

この価格は補助金ではない——少なくともDeepSeek自身の説明によれば。ベンダーのモデルカードと技術レポートは、V4.1 Flashを、Causal Encoder-Decoderレイアウト上の552BパラメータのMixture-of-Expertsとして説明している。これはプリフィル時にトークンあたり約8Bパラメータ、デコード時に16Bパラメータを活性化する——設計上非対称であり、読み取りは安価で、書き込みはより高価だ。メモリ面では、DeepSeekはトークンあたり約890バイトのグローバルKVキャッシュを報告している。これはDeepSeek-V4-Flashのおよそ4分の1であり、同一ワークロード下では永続キャッシュのフットプリントはその約8分の1になる。これはスライディングウィンドウ状態を破棄し、ヒット時に直近128トークンをリプレイすることで達成されている。これらはベンダー自身のハードウェア上でベンダーが報告した測定値であり、技術レポートはリプレイ経路について完全な計算との数学的等価性を主張してはいない。

パラメータ数は、今回のリリースで唯一本当に決着していない数値であり、なぜそうなのかを正確に述べておく価値がある。DeepSeekの文章は552Bと報告しており、これがバックボーン、つまり計算を担う部分である。それと並んで存在するのがEngramで、これは条件付きメモリのルックアップテーブルであり、モデルカードでは196Bパラメータとされ、計算によって通されるのではなくトークンのルックアップによってアクセスされる。両者を足すと約748Bになり、これは重みが公開されてから数時間以内にr/LocalLLaMAのある広く読まれたコミュニティ分析が主張した数値であり、Hugging Faceリポジトリ自身のファイルパネルではさらに高く、763B近くまで押し上げられている。コミュニティのデプロイ記事では、チェックポイントを48シャードにわたる約510GBと数えており、FP8の密な重みとFP4のエキスパートとしてネイティブに量子化されて出荷されている。合計値は係争中、バックボーンの数値はベンダーによる申告値として扱うのがよい。 アクティブパラメータ数は速度を左右する数値であり、常駐する重みはモデルがそもそも起動するかどうかを決める数値である。

セルフホスティングは、MIT ライセンスの下で、この価格に代わる現実的な選択肢です。

重みは次にあります: deepseek-ai/DeepSeek-V4.1-FlashMITライセンスの下にあり、同ライセンスは商用利用、改変、再配布を許可しています。そのため、APIの料金表は通行料ではなく選択肢になります。MITでは、ライセンス上のいかなる条項も、このモデルを自分で提供し、トークンではなくコンピュートに対価を支払うことを妨げません。

とはいえ、それは安価に実行できるようにはしない。チェックポイントはキャッシュとアクティベーションを除いて約510GBの常駐ウェイトで、DeepSeekはリポジトリのどこにもGPU要件を明記しておらず、コミュニティのデプロイ記事では実用的な下限はワークステーションではなくマルチGPUノードとされている。2026年9月10日には3つのサービングスタックがday-0サポートを提供した——vLLM、Milesを伴うSGLang、そしてCambriconの自社アクセラレータ向けvLLMベースNeuWare適応——が、リリース当日にはvLLMとSGLangは公式パッケージではなく専用のプレビューイメージを提供し、llama.cppはV4.1アーキテクチャのサポートをマージしていなかった。今日、API価格に代わる選択肢はコンシューマー向けハードウェアでのセルフホスティングではない。レンタルの8GPUノードだ。もしあなたの処理量がそれを償却できるほど多ければ、ライセンスはそれを許す。そうでなければ、100万トークンあたり0.15ドルがより安い答えであり、その差は比べ物にならない。

料金表が実際にあなたに決断を求めていること

金額を動かす額の大きい順に3つ。安定したプロンプト接頭辞を保ち、キャッシュに仕事をさせてください — それは自動で、50倍の割引であり、60ターンのエージェントループでは $0.93 のセッションを $0.084 のセッションに変えます。平日の 01:00–04:00 UTC と 06:00–10:00 UTC を外してバッチトラフィックを実行してください。これは米国のチームにとっては実質何も変わらず、欧州のチームにとっては朝のジョブを午後に移すことを意味します。そして、これを DeepSeek 自身のフラッグシップと価格比較するなら、フラッグシップはまだ販売中であることを忘れないでください — 予定されていた廃止は 2026-09-11 に取り消され、 両方の SKU は1つのキーで利用できます、そしてそれらの間の切り替えは移行ではなく model-id の変更です。

料金表が教えてくれないのは、そのモデルがあなたのワークロードに十分に適しているかどうかであり、そのための数値は価格表よりも新しく、しかも乏しい。Artificial Analysis のインデックス順位は最大推論努力時の単一の測定値にすぎず、ベンダーのベンチマーク行はベンダー申告であり、パラメータ数は議論の的になっている。価格は今回のリリースで確定している部分だ。移行の見積もりはそれに基づいて行い、能力はコミットする前にテストせよ。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新