DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
新着注目
ビジョンツールJSON推論
提供 DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash は、DeepSeek の新しいアーキテクチャファミリーの中で最小のモデルであり、2026年9月10日にリリースされ、ネイティブなマルチモーダル視覚理解を備えています。V4 Flash と V4 Flash Vision 実験の両方の本番向け後継モデルです。新しいアーキテクチャは、より高い能力の上限、より高速な推論、より高いスループットを目指しており、DeepSeek は V4.1 Flash がパフォーマンス、コスト、速度、総タスク時間において V4 Pro を包括的に上回ると報告しています。テキストと画像を受け付け、テキストを出力し、100万トークンのコンテキストウィンドウと最大 384K の出力トークンをサポートします。また、思考モード(デフォルト、努力レベルは low / high / max から選択可能)と非思考モードを、Chat Completions、Responses、Anthropic 互換 API でサポートし、JSON 出力、ツール呼び出し、チャットプレフィックス補完にも対応しています。FIM は非思考モードのみで動作します。モデルの重みは Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) で公開されています。 リリース時の公式ベンチマーク: Terminal-Bench 2.1 で 90.6、DeepSWE v1.1 で 74.2、NL2Repo-Bench で 65.4、GPQA Diamond で 90.9、ツール使用時の HLE で 63.9、そして強力なネイティブビジョンエージェントの結果(BabyVision 89.6、ツール使用時の Chartography 78.9)。リリースと同時に価格も引き下げられました: オフピーク料金は、入力 $0.15/M(キャッシュミス)、出力 $0.60/M、キャッシュヒット時 $0.003/M で、平日のピーク時間帯(01:00〜04:00 と 06:00〜10:00 UTC)は 2 倍になります。週末を含むその他の時間帯はすべてオフピークです。

コンテキスト1M トークン
最大出力384K
入力text + image
出力text
p50 TTFT412 ms
入力$0.15/ 100万 tokens
出力$0.60/ 100万 tokens
p50 TTFT412 ms7日
p95 TTFT1.60 s7日
トラフィック299.5Mtokens / 7日

DeepSeek V4.1 Flash は、OpenAI 互換の API ゲートウェイである OrcaRouter を通じて利用できる DeepSeek モデルです。テキストと画像の入力を受け付け、1,048,576 トークンのコンテキストウィンドウを備え、1 回の応答で最大 384,000 トークンを生成できます。OrcaRouter…

DeepSeek V4.1 Flashとは何ですか?

DeepSeek V4.1 Flashは誰向けに作られていますか?

なぜ1,048,576トークンのコンテキストウィンドウが重要なのか?

コードサンプル

あらゆる SDK から呼び出し

OpenAI 互換——今お使いの SDK のまま

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

対応パラメータ

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

料金

料金
入力 / 1M tokens · オフピーク$0.150
出力 / 1M tokens · オフピーク$0.600
キャッシュ読み取り / 1M · オフピーク$0.0030
ピーク時間帯01:00–04:00, 06:00–10:00 ×2 (UTC)
入力 / 1M tokens · ×2$0.300
出力 / 1M tokens · ×2$1.20
キャッシュ読み取り / 1M · ×2$0.0060
通貨USD

料金計算ツール

月間トークン数10MM
入力の割合70%%
月額見積もり $2.85 · プロンプトキャッシュ利用時 $2.34

表示価格に基づく概算

トークン・コスト見積もり

入力トークン: 8リクエストあたりのコスト: $0.000301

見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。

パフォーマンス

p50 TTFT
412 ms
出力速度
215 tok/s
p95 TTFT
1.60 s
エラー率
0.07%

公開ベンチマーク

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
ソース: api-docs.deepseek.com

コミュニティの話題

今週の開発者の声

Hacker News13 件の言及 · 7日間先週比 13 増加

比較

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
入力 $/100万$0.15$0.73$0.24$0.24
出力 $/100万$0.60$2.18$0.73$0.73
コンテキスト1.0M1.0M1.0M1.0M
品質8/108/107/107/10
並べて比較並べて比較並べて比較並べて比較

よくある質問

DeepSeek V4.1 Flash は OrcaRouter でいくらかかりますか?
OrcaRouterは、DeepSeek V4.1 Flashを100万入力トークンあたり$0.15、100万出力トークンあたり$0.60で請求し、プロバイダー料金のままマークアップゼロでパススルーします。コンテキストウィンドウ自体については、別途料金は記載されていません。1,048,576トークンは制限であり、料金ではありません。入力トークンには、送信するテキスト、画像、会話履歴が含まれます。出力トークンは、生成されるすべてのものを対象とし、最大384,000トークンです。
コンテキストウィンドウと最大出力はどのくらいの大きさですか?
DeepSeek V4.1 Flash のコンテキストウィンドウは 1,048,576 トークン、最大出力は 384,000 トークンです。入力ウィンドウを使用すると、文書全体、文字起こし、リポジトリのスナップショットを 1 回の呼び出しで送信できます。一方、出力上限は、仕様書、移行計画、拡張差分などの長い単一パスの成果物をサポートします。
DeepSeek V4.1 Flashは何が一番得意ですか?
これは長い入力・長い出力の作業向けに設計されています。文書全体の分析、大規模リポジトリのコード理解、テキストと画像を組み合わせたマルチモーダルレビュー、そして短い返答ではなく実質的な生成回答を必要とするワークフローなどが該当します。GPQA Diamond での90.9というスコアも、堅実な大学院レベルの科学・技術的推論力を示しています。入力はテキストと画像の両方に対応し、出力はテキストのみです。
それは、より大規模なフロンティアモデルと比べてどうですか?
フロンティアモデルは最も難しい推論ベンチマークでは先行する可能性があり、通常はトークンあたりの料金が高くなります。一方、DeepSeek V4.1 Flash は 1,048,576 トークンのコンテキストウィンドウと 384,000 トークンの出力上限を提供し、入力 1M トークンあたり $0.15、出力 1M トークンあたり $0.60 です。長いコンテキストや大量処理の作業では、しばしば実用的な選択肢です。最も難しい個々の推論ステップについては、それらの呼び出しを OrcaRouter 上のより高価なモデルにルーティングするのが合理的なパターンです。
このモデルを呼び出すと、データはどのように扱われますか?
OrcaRouter はリクエストを DeepSeek の API にルーティングし、プロバイダー料金でマークアップなしで請求します。保持、トレーニング利用、および関連する条件は、ここに記載された別個の取り決めではなくプロバイダーのポリシーによって規定されるため、機密性の高い資料を送信する前にプロバイダーの現在の規約を確認してください。不要な識別子は伏せ、プロンプトはタスクに必要な最小限にとどめてください。コンテキストを小さくすると、100万トークンあたり $0.15 の入力コストも下がります。
OpenAI互換APIを通じてどう呼び出せばいいですか?
クライアントのベース URL を https://api.orcarouter.ai/v1 に設定し、OrcaRouter API キーを使用してモデル ID deepseek/deepseek-v4.1-flash を指定してください。リクエストとレスポンスは OpenAI chat completions スキーマに従うため、既存の SDK、ストリーミングハンドラー、ツール呼び出しの解析はそのまま動作します。移行は通常、ベース URL とモデル文字列の変更と、評価セットの再実行だけです。
DeepSeek V4.1 Flashは画像を受け付けますか?
はい。画像入力は標準のマルチモーダルコンテンツ配列を通じてサポートされており、テキストと画像のパーツを同じユーザーメッセージ内に含めることができます。画像トークンは入力としてカウントされ、OrcaRouterでは100万入力トークンあたり$0.15で課金されます。出力はテキストのみであるため、モデルは画像を生成するのではなく、画像を説明したり、画像から抽出したりします。
GPQA Diamond で 90.9 なら、自分のタスクでそれを信頼するのに十分ですか?
それは有用なシグナルであり、保証ではありません。GPQA Diamond は固定されたプロンプト形式の下で大学院レベルの科学推論を測定します。これは技術的な質問応答には関連しますが、長いコンテキストの想起、トーン、あなたのデータにおける抽出精度についてはほとんど何も示しません。実際の入力から小さな評価セットを構築し、DeepSeek V4.1 Flash および OrcaRouter 上の任意の代替モデルIDに対して実行し、本番トラフィックをルーティングする前にコストと品質を比較してください。

このバッジを埋め込む

DeepSeek: DeepSeek V4.1 Flash$0.15/M in412ms p50OrcaRouter 経由
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="OrcaRouter の DeepSeek: DeepSeek V4.1 Flash" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

モデルカードをデータで取得

GET /api/public/models/deepseek/deepseek-v4.1-flash開く