DeepSeek-V4.1-Flash は、DeepSeek の新しいアーキテクチャファミリーの中で最小のモデルであり、2026年9月10日にリリースされ、ネイティブなマルチモーダル視覚理解を備えています。V4 Flash と V4 Flash Vision 実験の両方の本番向け後継モデルです。新しいアーキテクチャは、より高い能力の上限、より高速な推論、より高いスループットを目指しており、DeepSeek は V4.1 Flash がパフォーマンス、コスト、速度、総タスク時間において V4 Pro を包括的に上回ると報告しています。テキストと画像を受け付け、テキストを出力し、100万トークンのコンテキストウィンドウと最大 384K の出力トークンをサポートします。また、思考モード(デフォルト、努力レベルは low / high / max から選択可能)と非思考モードを、Chat Completions、Responses、Anthropic 互換 API でサポートし、JSON 出力、ツール呼び出し、チャットプレフィックス補完にも対応しています。FIM は非思考モードのみで動作します。モデルの重みは Hugging Face (deepseek-ai/DeepSeek-V4.1-Flash) で公開されています。 リリース時の公式ベンチマーク: Terminal-Bench 2.1 で 90.6、DeepSWE v1.1 で 74.2、NL2Repo-Bench で 65.4、GPQA Diamond で 90.9、ツール使用時の HLE で 63.9、そして強力なネイティブビジョンエージェントの結果(BabyVision 89.6、ツール使用時の Chartography 78.9)。リリースと同時に価格も引き下げられました: オフピーク料金は、入力 $0.15/M(キャッシュミス)、出力 $0.60/M、キャッシュヒット時 $0.003/M で、平日のピーク時間帯(01:00〜04:00 と 06:00〜10:00 UTC)は 2 倍になります。週末を含むその他の時間帯はすべてオフピークです。
DeepSeek V4.1 Flash は、OpenAI 互換の API ゲートウェイである OrcaRouter を通じて利用できる DeepSeek モデルです。テキストと画像の入力を受け付け、1,048,576 トークンのコンテキストウィンドウを備え、1 回の応答で最大 384,000 トークンを生成できます。OrcaRouter…
DeepSeek V4.1 Flashはテキストと画像を入力として受け取り、テキストを返します。実際には、これは3つの広範なパターンをカバーします。1つ目は文書理解です。表やスキャンしたページ、図のスクリーンショットを、書面による指示と一緒に投入します。2つ目は視覚的グラウンディングで、インターフェース、チャート、エラー状態のスクリーンショットが、より長い会話や仕様の文脈で分析されます。3つ目は混合モダリティ推論で、長いテキストコーパスが、質問を方向づけるいくつかの画像と組み合わされます。 出力はテキストのみなので、モデルは画像を生成するのではなく、見たものを記述、抽出、または説明します。画像トークンは入力としてカウントされ、OrcaRouter上のテキスト入力と同じレート、つまり100万入力トークンあたり$0.15で課金されます。テキストだけで十分なワークロードでは、テキスト専用モデルの方が安価な場合がありますが、V4.1 Flashは軽い視覚タスクのために別途ビジョンパイプラインを実行することを避けます。
強く適合する用途は、長い回答を伴う長いコンテキスト分析、大規模リポジトリ全体にわたるコード理解、マルチモーダル文書レビュー、および大量の状態を保持する必要があるエージェントループです。最大出力が384,000トークンに達するため、モデルは短い要約ではなく、完全なレポート、移行メモ、または拡張されたコードを返すことができます。 その他の理にかなった用途には、文字起こしから構造化ノートへのパイプライン、契約比較、完全な履歴がコンテキストに保持されるサポートワークフローが含まれます。90.9 GPQA Diamondスコアは、大学院レベルの科学問題における強さを示唆しており、これは単なる文章ではなく、技術的および研究指向の質問応答に向いていることを示しています。高頻度で小さなリクエストのトラフィックにはあまり明らかに適しているとは言えません。短い分類呼び出しには100万トークンのウィンドウは必要ないためです。また、画像生成を必要とするタスクにも適していません。出力はテキストのみだからです。
多くのモデルは出力を数千トークンで上限設定しているため、長いものにはマルチターンでのつなぎ合わせを余儀なくされます。384,000トークンの上限があれば、DeepSeek V4.1 Flash は成果物全体を1回のパスで出力できます。完全な技術仕様書、長い移行計画、拡張された注釈付き差分、または完全な文字起こしの書き直しなどです。単一パス生成は、多くの短い呼び出しから回答を組み立てるよりも通常は内部整合性をよりよく保ちます。モデルがターン間で話の筋を見失わないからです。 トレードオフはコストです。OrcaRouter では出力は1M出力トークンあたり $0.60 で課金され、入力レートの4倍なので、非常に長い生成はリクエストの中でも高コストな部分になります。一貫した長い回答に真の価値がある場合にこの上限を使い、max_tokens を仕事に合わせて設定し、2段落の回答で十分な場合にモデルを冗長に語らせないようにしてください。
大きなコンテキストと高い出力上限は、対価を払って得られる機能です。意図分類、固有表現抽出、ルーティング、単純な書き換えなど、短いプロンプトと短い回答しか必要としないタスクでは、余分なウィンドウは何も付け加えませんし、OrcaRouter 上の別のより小さいモデルの方が通常は呼び出しあたりのコストが低くなります。入力が設計上すでにチャンク分割されている大量バッチジョブにも同じことが言えます。 そのジョブが本当にウィンドウを必要とする場合 — 文書全体、長いコードコンテキスト、複数画像のレビュー、または長い単一パス回答 — には DeepSeek V4.1 Flash を選びましょう。有用なルールは、まずプロンプトのサイズと予想出力を見積もることです。どちらも控えめなら、合計トークンコストをより小さい選択肢と比較してください。プロンプトが数十万トークンに達する場合、代替は通常 retrieval pipeline であり、それには独自のエンジニアリングコストと情報損失が伴います。
GPQA Diamondは、単純な検索では対応できないように作られた大学院レベルの科学問題のセットであり、スコアは一般的な事実の記憶ではなく、難易度の高い技術的内容についての推論を反映します。DeepSeek V4.1 Flashはこのベンチマークで90.9を記録しています。ここで高い結果が出ることは、モデルが多段階の科学的推論と正確な専門分野の質問を competent に扱えることを示します。 ただし、これはモデルがあらゆるタスクで同等に強いという意味ではありません。GPQA Diamondは対象が狭く、長いコンテキストでの検索、トーン、雑多なプロンプト下での指示追従、大規模なコード品質についてはほとんど何も示しません。90.9を、技術的推論能力を裏付ける1つのデータポイントとして扱い、自分のワークロードで検証してください。実際の入力から小規模な評価セットを作成し、長文書や画像とテキストのプロンプトを含めたうえで、OrcaRouterで本番ルートを確定する前にそのセットで出力を比較してください。
DeepSeek V4.1 Flash のレイテンシは、主にどれだけ生成するよう要求するかによって決まります。最初のトークンまでの時間はプロンプトサイズとプロバイダーの負荷の影響を受け、応答の合計時間は出力長とともに増加します。384,000トークンの上限があるため、最大長の生成は本質的に長時間実行されるリクエストになります。OrcaRouter 上のこのモデルについて公開されたレイテンシ数値はないため、数値を仮定するのではなく、独自のプロンプトで測定してください。 実践的な手順: 対話型の経路では max_tokens を上限設定して応答を制限内に収め、トークンをストリーミングしてユーザーが進行状況を確認できるようにし、非常に長い生成はバックグラウンドジョブ用に確保します。高い同時実行性の下では、プロバイダーのスループット制限が実効レートを左右することを想定し、それに応じてキューイングまたは再試行してください。同じプロンプトを使って現在のモデルと比較し、最初のトークンまでの時間を合計所要時間とは別に追跡してください。
ベンチマークは候補を絞り込むには役立つが、本番環境でモデルをランキングするためのものではない。各テストは、固定されたプロンプト形式のもとで、特定の制約されたスキルを測定する。GPQA Diamond は大学院レベルの科学的推論を評価するが、コーディングのベンチマークはまったく異なる挙動を評価する。ある領域での高いスコアが自動的に別の領域に移るわけではなく、モデル間の小さな差は多くの場合、実行ごとのばらつきの範囲内にある。 役立つ実践が2つある。第一に、そのベンチマークのタスクが自分のタスクに似ているかを確認する。GPQA Diamond の 90.9 は、研究や技術的な質問応答には意味があるが、チャットのトーンや抽出にはあまり当てはまらない。第二に、自分のデータでテストする。代表的なサンプルを集め、採点ルールを定義し、測定する。OrcaRouter では、同じリクエストを異なるモデル ID に、1つの OpenAI 互換 API を通じてルーティングし、出力を直接比較できる。これはリーダーボードの順位だけよりもはるかに有益である。
計画しておく価値のある制限が3つあります。第一に、出力はテキストのみです。モデルは画像入力を受け取りますが、画像を生成することはありません。第二に、長い出力はコストが高くなります。出力100万トークンあたり$0.60で、これは入力レートの4倍であるため、冗長な生成が主なコストリスクです。第三に、大きなコンテキストウィンドウは、すべての詳細が使われることを保証するものではありません。100万トークンにわたるアテンションは、想定するのではなく、自分の文書で検証すべき能力です。 運用上の制約もあります。非常に大きなプロンプトは処理に時間がかかり、レート予算をより早く消費します。このモデルはOrcaRouterを通じてDeepSeekによって提供されるため、可用性はプロバイダーのインフラストラクチャと、プロバイダーが適用するあらゆる制限に従います。高密度のチャート、手書き、低解像度スキャンにおけるマルチモーダル精度は変動します。重要な抽出作業をルーティングする前に、代表的なサンプルで検証してください。
DeepSeek V4.1 Flash の料金は、入力トークン100万個あたり $0.15、出力トークン100万個あたり $0.60 です。OrcaRouter はこれらをプロバイダー料金のままマークアップなしでパススルーするため、表示される金額は再販価格ではなくプロバイダー価格です。入力には送信するすべてが含まれます。テキストトークン、画像トークン、会話の蓄積された履歴です。出力にはモデルが生成するすべてが含まれ、ツール呼び出しの引数やモデルが出力する推論テキストも対象です。 課金はトークンベースであるため、より安価なリクエストは単に使用トークン数が少ないだけです。コンテキストウィンドウ自体に対する別途料金は記載されていません。1,048,576トークンのウィンドウは上限であり、料金ではありません。大きなプロンプトは、より多くの入力トークンを含むため、当然ながらコストが高くなります。実際にそのコストを発生させている機能に支出を紐付けられるように、ルートごとに使用状況を追跡してください。
支出を決める乗数は2つあります。入力されるトークン数と出力されるトークン数です。出力はより高価な側で、100万トークンあたり$0.60、入力トークンは100万トークンあたり$0.15と、4倍の差があります。200,000トークンを読み取り、500トークンを書き出すリクエストは、入力が支配的です。2,000トークンを読み取り、20,000トークンを書き出すリクエストは、出力が支配的です。製品がどちらのパターンに当てはまるかを知れば、どこを最適化すべきかがわかります。 続く3つのレバーがあります。コンテキストを削る:1,048,576トークンが利用可能であっても、タスクに必要なドキュメントと履歴だけを含めます。出力を制限する:上限ではなく実際の要件に max_tokens を設定します。そしてバッチ化:呼び出し回数を減らして大きくすれば、同じコンテキストを繰り返し再送信するのを避けられます。これは長いコンテキストのアプリケーションにおいて、しばしば最も気づきにくい無駄の原因です。
DeepSeek V4.1 Flash は OrcaRouter によって、プロバイダー料金でマークアップゼロで請求されます。そのため、プロバイダー側の割引やキャッシュ入力料金は、吸収されたり上乗せされたりするのではなく、そのまま渡されます。このモデルで割引されたキャッシュ入力が利用できるかどうか、またどのような条件で利用できるかは DeepSeek が定めているため、節約分を予算に織り込む前に、プロバイダーの最新ドキュメントで確認してください。 あなたが直接制御できるのはプロンプト設計です。システム指示、スキーマ、取得したコンテキストなど、安定したプレフィックスを維持し、可変コンテンツは末尾に追加して、プロバイダーがサポートするプレフィックス再利用が適用できるようにします。バッチ内の呼び出し間では同一のコンテキストを再利用し、項目ごとに再送信しないようにします。以前のターンが不要になったら要約するなど、履歴を積極的に短縮します。これらの習慣は入力トークンを削減します。長いコンテキストを扱うワークロードが通常消費するのは、この入力トークンです。
OpenAI互換クライアントを https://api.orcarouter.ai/v1 に向け、モデルを deepseek/deepseek-v4.1-flash に設定します。OrcaRouterはOpenAIチャット補完インターフェースを公開しているため、Python、JavaScript、その他の言語向けの既存SDKは、ベースURLとモデルIDの変更に加えてOrcaRouter APIキーを設定するだけで動作します。 最小限のリクエストでは、systemとuserのターンを含むmessages配列と、max_tokens、temperature、streamなどのオプションパラメータを送信します。画像入力は標準のマルチモーダルコンテンツ形式に従い、同じuserメッセージ内でテキストパートと並んで画像パートが含まれます。レスポンスは通常の形式で返されるため、パース、ストリーミング、ツール呼び出し処理のコードは変更なしでそのまま使えます。OrcaRouterのモデルページでモデルごとのパラメータに関する注意事項を確認し、プロンプトサイズと出力制限を調整している間は、最初の数回の呼び出しで生のレスポンスをログに記録してください。
DeepSeek V4.1 Flash のほとんどのリクエストは、4つのパラメータによって形作られます。max_tokens は出力の上限を設定し、最大384,000トークンという条件下で主要なコスト管理手段となります。タスクに必要な値に設定し、最大値にはしないでください。temperature は変動性を左右するため、抽出、構造化出力、コードでは低くし、下書きでは高めにします。stream を使用すると、長い生成の進捗を表示できます。これは、応答が数万トークンに及ぶ可能性がある場合に重要です。システム指示には、フォーマットと安全性の要件を含める必要があります。 画像の場合、標準のマルチモーダルコンテンツ配列が使用すべき仕組みです。長いプロンプトでは、含めるすべての文書が必要かどうかを検討してください。入力トークンは1Mあたり$0.15で課金されるためです。モデルがOpenAI互換スキーマによるツール呼び出しをサポートしている場合は、広範なツールではなく、狭くて十分に文書化されたツールを定義してください。予想される最長の生成時間に合わせて、クライアント側のタイムアウトを設定してください。
移行は意図的に小規模です。ベースURLを https://api.orcarouter.ai/v1 に変更し、モデル文字列を deepseek/deepseek-v4.1-flash に置き換え、OrcaRouter APIキーを指定します。リクエストとレスポンスのスキーマはOpenAI互換のままなので、メッセージ配列、ストリーミングイベント、ツール呼び出しペイロードに構造的な書き換えは不要です。 作業の本質は配管ではなく、振る舞いにあります。1,048,576トークンのウィンドウと384,000トークンの出力上限を備えたモデルは、以前のモデルでは受け付けられなかったプロンプトを誘います。入力トークンのコストは100万あたり$0.15なので、盲目的にプロンプトサイズを膨らませるのではなく、この機会にコンテキストの品質を高めましょう。max_tokens、temperature、リトライロジックを再調整し、評価セットを再実行してください。トークナイザーとプロンプト分割の前提も見直してください。小さなウィンドウ用に構築されたチャンク化ロジックは今や不要かもしれず、そのままにしておくとコンテキストが断片化する可能性があります。
画像は、OpenAIのマルチモーダル形式に一致するコンテンツパーツとしてユーザーメッセージ内で提供されます。メッセージのcontentはテキストパーツと画像パーツを含む配列になり、各画像にはURLまたはbase64データが与えられます。典型的な呼び出しでは、仕様書、文字起こし、以前の会話などの長いテキスト本文と、1つ以上のスクリーンショットやスキャンページを組み合わせ、その両方に依存する質問をします。 アップロード前にリサイズしてください。非常に大きな画像は入力トークンを増やし、入力は100万トークンあたり$0.15で課金されるため、単純な図のフル解像度キャプチャを送ると、精度を上げることなく予算を浪費します。重要な領域にクロップし、テキストの多い資料には判読可能な解像度を使用してください。タスクで多数の画像が必要な場合は、画像ごとに個別の呼び出しを行うのではなく、論理的に1つのリクエストにまとめてください。個別呼び出しでは毎回テキストコンテキストが再送されます。
フロンティアクラスのモデルは、最難関の推論・コーディングベンチマークでしばしば首位に立ちますが、通常はトークンあたりの料金が大幅に高く、出力上限が DeepSeek V4.1 Flash で可能な範囲をはるかに下回る場合があります。このモデルの GPQA Diamond での 90.9 は、大学院レベルの科学推論において信頼に足る領域に位置づけます。一方、100万入力トークンあたり $0.15、100万出力トークンあたり $0.60 という価格設定により、長いコンテキストの作業を手頃なコストに保ちます。 選択は通常、3つの問いに集約されます。推論タスクはどれほど難しく、精度差はそれにとって重要か? 入力はどれほど長く、1,048,576トークンのウィンドウはパイプラインの複雑さをどれだけ削減するか? 384,000トークンの上限を踏まえると、出力はどれほど長いか? ドキュメント中心の分析、長い単一パス生成、大量のマルチモーダルレビューには、V4.1 Flash がしばしば実用的な選択肢です。最も難しい推論ステップについては、それらの呼び出しを OrcaRouter 上のより高コストなモデルにルーティングすることを検討してください。
OrcaRouterは、1つのOpenAI互換APIの背後に多くのモデルを公開しているため、比較は2つ目のベンダーを統合するのではなく、モデルIDを切り替えるだけの問題である。DeepSeekファミリー内では、意味のある軸は価格、コンテキストウィンドウ、出力上限である。V4.1 Flashは、1,048,576トークンのウィンドウと384,000トークンの出力制限を組み合わせ、1M入力あたり$0.15、1M出力トークンあたり$0.60である。 プロンプトと回答が短く、余分なウィンドウが価値を追加しない場合、より小型または安価なモデルは理にかなっている。画像入力ではなく画像出力が必要な場合、視覚対応の代替モデルが重要になる。専門化されたコードまたは推論モデルは、狭いタスクで優位に立つかもしれない。OrcaRouterはマークアップなしでプロバイダーの料金で価格設定しているため、比較はトークンに関して公平である:同一のプロンプトを両方のIDで実行し、コストと品質を測定し、タスクごとにルーティングする。
タスクの形がモデルの強みに合わない場合は、別のものを選びましょう。短く高頻度の分類、ルーティング、抽出ジョブは、1,048,576トークンウィンドウから何も得られず、より小さいモデルの方が安く済みます。生成画像を必要とするタスクには、まったく別のクラスのモデルが必要です。定理形式の数学や微妙なアルゴリズム設計など、単一の難しい推論ステップが品質を支配する場合、そのステップだけにフロンティアモデルを使うなら、高い料金に見合うかもしれません。 モデルを組み合わせるのも合理的です。DeepSeek V4.1 Flash を使って長い入力の読み取り、証拠の収集、拡張出力の下書きを、入力 100 万トークンあたり $0.15、出力 100 万トークンあたり $0.60 で行い、その後、特定の判断を検証のために、より高価なモデルへエスカレーションします。OrcaRouter の OpenAI 互換 API により、そのルーティングは新しい統合ではなく設定変更で済みます。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokensreasoningreasoning_effortresponse_formatstopstreamstream_optionstemperaturethinkingtool_choicetoolstop_logprobstop_puser_id| 入力 / 1M tokens · オフピーク | $0.150 |
|---|---|
| 出力 / 1M tokens · オフピーク | $0.600 |
| キャッシュ読み取り / 1M · オフピーク | $0.0030 |
| ピーク時間帯 | 01:00–04:00, 06:00–10:00 ×2 (UTC) |
| 入力 / 1M tokens · ×2 | $0.300 |
| 出力 / 1M tokens · ×2 | $1.20 |
| キャッシュ読み取り / 1M · ×2 | $0.0060 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_deepseek_v4_1_flash,
title = {DeepSeek V4.1 Flash API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash}
}DeepSeek. (2026). DeepSeek V4.1 Flash API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash