
DeepSeek V4.1 Flash 対 DeepSeek V4 Flash:同じFlash Rate Card、再トレーニングされたモデル
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123知能49コーディング
DeepSeek V4.1 Flashが、噂の後継モデルから実際に出荷されているFlashモデルになるまでの1週間は、短くて騒がしいものでした。9月8日、このモデルはモデルID「deepseek-v4.1-flash-expires-on-0910」で2日間のAPIテストとして登場しました。これはDeepSeek自身が「中間バージョン」と呼ぶビルドです。9月9日、同社のオープンプラットフォームは、正式リリースであるDeepSeek V4.1 Flashが9月10日頃に登場し、能力、コスト、速度、エンドツーエンドの時間においてDeepSeek V4 Proを「総合的に上回る」と発表しました。9月10日、リリース通知とともに、北京時間12:00に適用される新しいFlashシリーズの料金表が発表されました。これは、DeepSeek V4 Flashが8月の値上げ以来見ていないような内容です。何が真実であれ、テキスト処理の主力であるDeepSeek V4 Flashは、もはやFlashワークロードを実行する最新の方法ではなくなりました。そしてこの記事は、それが今日お使いのアプリにとって実際に何を変えるのかについてのものです。
この時期の比較は一方的になりがちで、数字が出始める前にそのことを述べておく価値がある。DeepSeek V4 Flashは、公開されたスペックカード、DeepSeek-V4-Flash-0731アップデート以降の1か月分の本番トラフィック、オープンウェイト、そしてArtificial Analysisによる独立した測定結果を有している。DeepSeek V4.1 Flashには公式発表と2日分のコミュニティ速度テストがあるものの、公開されたカードも技術レポートも、第三者によるスコアもまだ存在しない。以下では、ベンダーの主張はベンダー主張としてラベル付けされ、コミュニティの数値はコミュニティ測定としてラベル付けされている。
Flash ティアがリセットされたばかり — 3つの変更、1週間
DeepSeek V4 Flash は、284Bパラメータの混合エキスパート(Mixture-of-Experts)モデルで、アクティブなパラメータは13Bであり、7月31日のリフレッシュ以降、本番テキストトラフィックの大部分において低コスト・高スループットの合理的なデフォルトとなっています。3日間で3つの発表があり、その基盤を揺るがしました:
• 9月8日 — DeepSeekは、任意のAPIアカウントに対してV4.1 Flashの期間限定ベータを開始した。同時リクエスト数は20件に制限され、9月10日に期限切れとなる予定で、独自の有効期限を持つモデル名の下で提供された。
• 9月9日 — オープンプラットフォームは、DeepSeek V4.1 Flashを9月10日頃に正式リリースすると発表し、ネイティブのマルチモーダルサポートを備えた新しいモデル構造を説明し、性能、コスト、速度、および総完了時間においてDeepSeek V4 Proを上回ると主張した。
{{1}}9月10日 — 正式リリースにより、新しいFlashシリーズの価格表が北京時間12:00から適用され、DeepSeek V4 Flashが8月17日の値上げ以来請求してきた料金が引き下げられる。この値上げは開発者から激しい批判を招いていた。{{/1}}
その中で最後のものは、それだけで取り上げる価値がある。なぜなら、それは実際の値下げであるという珍しい値下げだからだ。新しい価格表では、オフピーク時のキャッシュヒット入力が100万トークンあたり¥0.05から¥0.02へと60%引き下げられ、キャッシュミス入力は¥1.5から¥1へ、出力は¥4.5から¥4へと変更される。ピーク時間帯の料金はオフピーク時の2倍である。おおよその米ドル換算では、オフピーク時でキャッシュヒット入力が100万件あたり約$0.003、キャッシュミス入力が$0.14、出力が$0.56であり、ピーク時はその2倍となる。8月の値上げから今回の値下げまでの24日間の間隔は、スケジュール上の偶然ではない。この価格改定はV4.1 Flashのローンチの一環である。
同じ階層、異なるモデル
「V4.1 FlashはV4 Flashのスピードダイヤルを上げただけ」という単純な解釈がある。しかし、それは違う。0731リフレッシュは、既存のDeepSeek V4 Flashベースに対するポストトレーニング更新であり、同じアーキテクチャ、同じ284B総パラメータ/13BアクティブのMixture-of-Experts構成を維持している。DeepSeekによるV4.1 Flashの説明は、より大きなものを示唆している。すなわち、新しいモデル構造である。複数の報道機関はこれをファインチューニングではなく、新規のプリトレーニング実行と解釈している。この区別は重要だ。再トレーニングされたモデルは、リフレッシュのように旧モデルの挙動を引き継がないからだ。プロンプティング、ツール呼び出し、出力スタイルはすべて、能力が変わらない場合でも変化し得る。
• アーキテクチャ — DeepSeek V4.1 Flash: 新しいモデル構造で、DeepSeek はネイティブなマルチモーダル入力を備えた新規ビルドと説明しています。DeepSeek V4 Flash: 合計 284B / アクティブ 13B の MoE に対する V4-Flash-0731 のポストトレーニング更新版です。
• 入力 — V4.1 Flash はベースモデルでテキストと画像入力をネイティブに処理します。DeepSeek V4 Flash はテキストのみ対応で、画像には別途アドオンビルドの DeepSeek-V4-Flash-Vision-Exp が必要です。
• コンテキストと出力 — DeepSeek V4 Flashは1Mコンテキストと384K最大出力を公開しています。DeepSeekのローンチ資料によると、V4.1 Flashは百万トークン規模のコンテキストウィンドウを維持していますが、正式なカードは公開されていません。
• 並行性 — DeepSeek V4 Flash は同時接続数 2,500 の上限を挙げており、V4.1 Flash ベータ版は 20 に制限されていた。さらに、DeepSeek のリリースビルドにおける「高並行性」の主張は、執筆時点では公開された数値によって裏付けられていなかった。
• 重み — DeepSeek V4 Flash は MIT ライセンスの下でオープンウェイトですが、V4.1 Flash については何も発表されていません。
• 独立した評価 — DeepSeek V4 Flash は Artificial Analysis によって測定済みです。DeepSeek V4.1 Flash にはまだ第三者によるスコアがありません。
テキスト対マルチモーダルという論点は、テキスト比較の中でも一文を余分に割く価値がある。なぜなら、それがV4.1 Flashが誰向けかを決定づけるからだ。もしパイプラインがテキスト用にDeepSeek V4 Flash、画像用にDeepSeek-V4-Flash-Vision-Expを実行していたなら、V4.1 Flashは両方の経路を単一モデルでカバーする最初のDeepSeekビルドである。つまり、保守すべきエンドポイントは一つで、横にエンコーダーを取り付ける必要もない。

両者が本当に異なる点:スループットと、タスク完了にかかるコスト。
{{1}}同価格帯では、両モデルは速度で明確に差がつく。そして速度こそ、数字が最も際立つ分野である。{{/1}}{{2}}Artificial Analysis は、DeepSeek V4 Flash 0731 について、DeepSeek 自身の API 上で、設定と測定ウィンドウに応じて毎秒約 120~140 出力トークンという測定結果を出している。{{/2}}{{3}}V4.1 Flash を初日にテストしたユーザーは、タスクに応じて毎秒約 280~500 トークンの持続的な生成を報告しており、低並列実行では 500 を超えるピークも記録された。高い方の数値はコミュニティによる測定であり、ベンダーが公表したものではない。また、1 秒あたりのトークン数はモデルの本質的特性では決してない。{{/3}}{{4}}それでも、その方向性はすべての初日レポートで一貫しており、DeepSeek 自身が主張する生成速度の向上と総完了時間の短縮も、同じ方向を示している。{{/4}}
この速度差は、同じレートカードで2つのモデルを比較した場合でも経済性を変えます。なぜなら、トークン単位で課金され、トークンの到着が速くなるからです。V4 Flashで1分かかっていた長文コンテキストの検索やコード生成タスクは、V4.1 Flashでは同じトークン単価で、その数分の一の時間で完了します。実際、初日のテスター数名が、まさにそうしたタスク種別でエンドツーエンドが5〜6倍高速化したと報告しています。ベータ版初期の「お金の消費が速い」という苦情は、同じコインの裏返しでした。トークン単価が変わらなければ、2〜3倍の速さでトークンを生成するモデルは、1分あたりの残高消費もそれだけ速くなるのです。タスクあたりの請求額が実際に下がるかどうかは、新しいモデルがより少ないトークンとより少ないリトライで完了できるかどうかにかかっており、それがまさに誰にもまだ証明できていない点です。
価格カード上では、2つのモデルが横並びになっている。9月10日時点のリストでのオフピーク料金は100万トークンあたり、キャッシュヒット入力が¥0.02、キャッシュミス入力が¥1、出力が¥4で、ピーク時はその2倍となる。値下げ前にFlashティアに適用されていたリストは、¥0.05、¥1.5、¥4.5だった。キャッシュを多用するワークロードにとって、この値下げは最大の見どころだ。¥0.02対¥0.05は、オートコンプリートやエージェントループの入力ストリームの大部分を占めるトークンで60%の削減となる。キャッシュにヒットしない新規取り込みジョブでは、削減率は3分の1に近い。とはいえ、これによってV4.1 FlashがトークンあたりのコストでV4 Flashより安くなるわけではない。両者は同じ価格カードを共有している。しかし、このアーキテクチャの高いスループットが差別化要因であり、追加コストは一切かからない。

領収書はV4 Flash用で、請求はV4.1 Flash用です。
この対決について今最も重要なベンチマークの事実は、新しいモデルにはベンチマークが存在しないということだ。DeepSeek V4.1 Flashのうたう主張——能力・コスト・速度においてDeepSeek V4 Proを包括的に凌ぐというもの——は、ベンダー報告によるものであり、第三者による再現はない。パラメータ数、評価表、技術レポートは一切公開されておらず、執筆時点ではArtificial Analysisによる測定も行われていない。前回のフラッグシップリリースが独立した精査を受けたモデルファミリーに対して、「Proを上回ると信じてください」という主張は、第三者が検証するまで読者が距離を置くべきものだ。
対照的に、DeepSeek V4 Flashには確かな実績がある。Artificial Analysisは、0731 reasoningビルドを同クラスの主要モデルの一つに数え、同等のオープンウェイトモデルの中央値を大幅に上回るスコアを付け、DeepSeek自身のAPIにおける出力スループットを前述の毎秒約120~140トークンと測定している。V4.1 Flashのスコアが発表されたとき、その基準となるのはこれらの数字であり、それらは「高速で安価なFlash」というレッテルが示唆するよりも高いハードルを設定している。新しいビルドが置き換えるモデルは弱いわけではない。それは真に強力なオープンウェイトの実働部隊である。だからこそ、アップグレードの決定は形だけのものではなく、現実的なものになるのだ。
ルーティングが重労働を担っています — DeepSeekの内部でも、そしてあなたのために
{{1}}今回のローンチで最も報じられていない点は、DeepSeekが自社モデル間でトラフィックをルーティングしていることです。{{/1}}{{2}}同社の発表は明確です:{{/2}}{{3}}V4.1 Flashが稼働してからV4.1 Proがリリースされるまで、deepseek-v4-proを対象とするすべてのAPIリクエストはDeepSeek V4.1 Flashが処理し、Flashティアの価格で請求されます。{{/3}}{{4}}V4 Proの利用者は、コードを1行も変更することなく、新しいアーキテクチャとトークンあたりコストの数分の一を手に入れます。{{/4}}{{5}}ルーティングされないものに注目してください:deepseek-v4-flashへの呼び出しです。{{/5}}{{6}}旧Flashモデルは、引き続きそれを指定しているユーザーにサービスを提供し続けます。この比較が存在する理由はまさにそこにあります —{{/6}}{{7}}V4 Proを利用している場合、切り替えは自動的に行われます。V4 Flashを利用している場合、それは自分で下すべき判断です。{{/7}}
あるベンダーが、プレミアムモデル宛てのコールを安価なモデルに処理させることをひそかに決めた。これはV4.1 Flashへの際立った信任表明であり、同時に、ルーティングレイヤーがベンダーをまたいで適用するのと同じ論理でもある。OrcaRouterのようなプラットフォームが埋めるのは、まさにそのギャップだ。200以上のモデルに単一のAPIを提供し、プロバイダーのリスト価格を0%マークアップでそのまま通すため、DeepSeekが9月10日に実施したFlashの値下げは、当日中に当社側でも有効になる。OrcaRouter上のDeepSeek V4 Flashは、実行中の他のすべてのモデルと同じキーで呼び出し可能だ。これにより、リリース初日のモデルを安全に採用する方法が本当に安価になる。トラフィックの一部をDeepSeek自身のAPI上のDeepSeek V4.1 Flashに向け、同じルーティングルールでDeepSeek V4 Flashを自動フォールバックとして維持し、新しいアーキテクチャが働きに見合う価値を生む間、フェイルオーバーにエッジケースを捕捉させればよい。
DeepSeek V4.1 Flash と DeepSeek V4 Flash、どちらを呼び出すべきでしょうか?
正直な答えがどちらか一方のモデルが全員に当てはまるというものであれば、この記事は存在しなかっただろう。現在、この2つは異なるリスクプロファイルに適合しており、その区分けは異例なほど明確である。

今日新しいFlashワークロードを開始する場合、レイテンシとスループットが制約要因である場合、2つ目のモデルを維持せずに画像入力を利用したい場合、またはDeepSeek自身のルーティングにPro層の主張のリスクを軽減させても構わない場合は、DeepSeek V4.1 Flash に移行してください。このモデルはDeepSeekのファーストパーティAPIでdeepseek-v4.1-flashという名前で提供され、置き換え先のモデルと同じFlashカードで価格設定されており、初日のすべてのシグナルによれば大幅に高速です。
DeepSeek V4 Flash を使い続けるべきなのは、公開されている 2,500 同時実行数の上限で本番トラフィックを処理している場合、セルフホスティングやコンプライアンスのためにそのオープンウェイトに依存している場合、またはプロンプト、評価、ツール呼び出しロジックが 0731 の動作に合わせて調整されており、再トレーニングされたモデルの癖を初日から吸収できない場合です。新しい事前トレーニングの実行は、単なる速度の変更ではなく動作の変更であり、0731 ビルドこそが実績のあるバージョンです。
ほとんどのチームにとって、理にかなったデフォルトは中道である。新規ワークロードのデフォルトにはDeepSeek V4.1 Flashを採用し、収益を支えるワークロードのフェイルオーバーにはDeepSeek V4 Flashを維持する。そして、最初の独立スコアカード——公開済みのスペックカードと同時実行数の数字も添えて——に、2日間のベータでは決着できない議論を委ねるのだ。Flashティアは新しいエンジンを手にしたばかりだが、旧エンジンは時代遅れになったわけではない。それがベンチマークなのだ。
DeepSeekがProクラスのトラフィックをFlash価格でV4.1 Flashへルーティングしている間、それがどのようなものか気になりませんか?OrcaRouter上のDeepSeek V4 Pro — どちらも1つのキーで利用でき、DeepSeekの定価で請求されます。
この記事で比較したモデル4
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
