DeepSeek V4 Flash 0731 は、DeepSeek の効率的な V4 Flash 混合エキスパート(MoE)モデルの再ポストトレーニング版公式リリースです。総パラメータ数 284B / アクティブパラメータ 13B で、アーキテクチャとサイズは 4 月リリースの V4 Flash と同一ですが、ポストトレーニングはゼロから再実施されています。1M トークンのコンテキストウィンドウと最大 384K トークンの出力に対応し、思考モード(デフォルトでオン)と非思考モードの両方をサポート。さらに JSON 出力とツール呼び出しにも対応し、Responses API をネイティブにサポート、Codex スタイルのコーディングエージェント向けに特化した適応が施されています。 0731 リビジョンはエージェント能力において大幅な向上を遂げており、DeepSeek が公開したエージェントベンチマークでは DeepSeek V4 Pro Preview をも上回るスコアを記録しています。Terminal Bench 2.1 で 82.7、Cybergym で 76.7、Toolathlon Verified で 70.3、DeepSWE で 54.4、NL2Repo で 54.2 を達成。DeepSeek ファーストパーティ API では、このリビジョンが現在 deepseek-v4-flash モデル ID として提供されており、日付指定の識別子も同じリビジョンを参照します。コーディングエージェント、ターミナルおよびツール使用のワークロード、そしてフラッシュ層のコストで高スループットなエージェントパイプラインに最適な選択肢です。
DeepSeek V4 Flash 0731 は、プロバイダー deepseek が提供するテキスト専用の言語モデルであり、OrcaRouter を通じてモデル ID deepseek/deepseek-v4-flash-0731 で利用可能です。主要仕様は、1,048,576 トークンのコンテキストウィンドウ、最大 384,000 トークンの出力、および Terminal Bench 2.1…
入力はテキストのみに制限されています。コンテキストウィンドウは1,048,576トークンで、1回の応答あたりの最大出力は384,000トークンです。これは大きな作業領域です。生成前に約100万トークンのコンテンツを読み取ることができ、1回の呼び出しで最大384,000トークンの出力を要求できます。モデルカードではこれらは別々の上限として記載されており、両方をほぼ最大値で使用するリクエストに対する合計制限は明記されていません。実際には、制限内に収めるために、送信前にトークンを数え、max_tokensを出力上限未満に設定してください。テキストのみという制約は、PDF、スプレッドシート、その他のドキュメントをまずプレーンテキストに変換する必要があることも意味します。トークン化は利用可能な情報に明記されていないため、代表的なコンテンツをテストしてプロンプトがどの程度の大きさになるかを確認してください。リクエストが1,048,576入力トークンを超えるとAPI呼び出しは失敗します。384,000トークンを超える出力についても同様です。
記載されている仕様を考慮すると、このモデルは長いテキスト入力、長いテキスト出力、端末指向のエージェント推論を組み合わせたタスクに最適です。82.7のTerminal Bench 2.1スコアは、モデルがシェル出力を読み取り次のコマンドを決定するコマンドラインタスク完了における強みを示しています。1,048,576トークンのコンテキストは、リポジトリ全体の分析、複数ファイルのコードレビュー、長い法務文書や技術文書、広範なチャット履歴をサポートします。384,000トークンの出力は、長い構造化文書、合成データセット、またはステップバイステップの分析を1回のパスで生成することをサポートします。100万トークンあたり入力$0.15、出力$0.29というトークン単位の価格設定により、大量のテキスト処理をコスト面で予測可能にします。このモデルは、画像理解、音声文字起こし、または非常に低いレイテンシーが必要な場合にはあまり適していません。これらはいずれも提供された事実ではカバーされていません。タスクがテキストのみ・大規模コンテキスト・大規模出力のプロファイルに適合する場合、これはOrcaRouterを通じて評価する合理的な候補です。
このモデルはテキスト以外の入力を受け付けません。カタログ登録情報には、ビジョン、オーディオ、ビデオのモダリティはありません。また、利用可能な情報には、公開されたレイテンシやストリーミングの保証もありません。ワークロードに大きなコンテキストや出力上限が必要ない場合は、より安価なモデルを選択すべきです。たとえば、数千トークンを使用する短いチャットボットのやり取りは、同じトークン単価で課金されますが、コンテキストが小さく、100万トークンあたりの価格が低いモデルの方が適している場合があります。利用可能な情報には代替モデルの価格が記載されていないため、OrcaRouterカタログの100万トークンあたりのレートを比較してください。タスクが短い文章の単純な分類や要約であれば、より安価なモデルで十分な場合があります。タスクに完全な1Mコンテキストまたは384K出力が必要な場合、またはコマンドライン作業におけるTerminal Bench 2.1の強みの恩恵を受ける場合は、このモデルの価格が評価の適切な基準となります。
すべての入力はテキストでなければなりません。PDF、画像、スプレッドシート、音声ファイルは、送信する前にプレーンテキストへの変換または文字起こしが必要です。これは必要な前処理ステップですが、同時にリクエスト形式も簡素化します。標準的なOpenAIスタイルのコンテンツフィールドに文字列を含めるだけでよいのです。1,048,576トークンのコンテキストにより、変換済みテキストの長い本文を1つのリクエストで渡すことができ、384,000トークンの出力により、非常に長いテキストを受け取ることができます。トークン数が主な運用上の関心事です。なぜなら、総請求額は入力トークンと出力トークンに依存するからです。OrcaRouterはOpenAI互換のレスポンスで使用状況を報告し、両方の数値を監視できます。トークン化が非効率な言語やコードを扱う場合、トークン数が文字数ではなく上限となるため、実効コンテキストは縮小します。トークナイザーの詳細は提供されていないため、独自のコンテンツで簡単なテストを実行して、典型的なトークン長を把握してください。
Terminal Bench 2.1は、ターミナル環境で作業するモデルの能力を評価します。具体的には、コマンド出力の理解、ディレクトリの移動、コマンドの実行、シェルを通じた現実的なシステム管理またはソフトウェアエンジニアリングタスクの完了です。DeepSeek V4 Flash 0731の主要スコアは82.7で、スコアが高いほど優れていることを示す尺度です。これは、利用可能な事実として提供されている唯一のベンチマーク結果です。このスコアは、シェルコマンドを発行するエージェントループを構築する予定がある場合に有用なシグナルです。このベンチマークは、まさにその種の能力をテストするように設計されているためです。これは、一般的な知識、創造的ライティング、数学、または多言語能力の尺度ではありません。比較ベースラインや他のベンチマーク数値は提供されていないため、82.7は文脈に照らして解釈する必要があります。つまり、ターミナル関連タスクには強い根拠を示す一方で、他の領域についてはいずれの方向の根拠も示しません。ベンチマークスコアは正確なタスク分布に依存するため、自身のターミナルタスクではスコアが異なる可能性があります。本番使用前に独自の評価で検証してください。
DeepSeek V4 Flash 0731 の利用可能なファクトには、1秒あたりのトークン数、最初のトークンまでの時間、p95レイテンシー、スループットは含まれていません。「Flash」という名前は軽量なバリエーションをほのめかしていますが、提供されているファクトは速度を定量化していません。ファクトに含まれているのは、1,048,576トークンの大きなコンテキストウィンドウと、384,000トークンの大きな出力上限です。入力と出力が長いほど本質的に多くの計算を消費するため、フルコンテキストのリクエストのレイテンシーは、高速なモデルであっても短いプロンプトよりも高くなる可能性があります。100万トークンあたり$0.15/$0.29という価格は、コストを示すものであり、速度を示すものではありません。情報に基づいた意思決定を行うには、OrcaRouterのAPIに対して、使用予定のサイズの代表的なプロンプトで独自のロードテストを実行し、カタログ内の他のモデルと最初のトークンまでの時間と合計時間を比較してください。応答時間を測定しないベンチマークスコアからレイテンシーを推定しないでください。
主な制限は、記載された事実から明らかです。テキストのみ対応のため、マルチモーダル入力は対象外です。ベンチマークの根拠は、Terminal Bench 2.1 の82.7という単一のスコアに限られており、これはターミナルベースのタスク完了を対象としたもので、一般的な推論や知識を対象としたものではありません。レイテンシ、可用性、エラー率に関する指標は公開されておらず、負荷時のパフォーマンスは不明です。コンテキストと出力の上限は大きいものの有限であり、リクエストごとに1,048,576トークンの入力と384,000トークンの出力が可能です。これらの上限を超えるリクエストは成功しません。提供された事実には、プロンプトキャッシュの割引に関する記載がないため、繰り返されるプレフィックスは通常の入力トークンとして課金されます。価格はトークン単位では低いものの、絶対的なコストはコンテキストサイズに比例して増加します。アプリケーションでビジョン、低レイテンシ、または非常に高いスループットが必要な場合、このモデルは適切ではない可能性があります。コミットする前に、これらの要件を別途検証してください。
コストはトークン単位で計算され、入力用と出力用にそれぞれ1つのレートが設定されています。入力トークンは100万トークンあたり$0.15、出力トークンは100万トークンあたり$0.29です。OrcaRouterはこれらの料金をプロバイダーレートで請求し、マークアップはゼロです。つまり、deepseekのレートにプラットフォームの追加パーセンテージは加算されません。1回のリクエストのコストは、おおよそ(入力トークン × $0.15 ÷ 1,000,000)+(出力トークン × $0.29 ÷ 1,000,000)です。例えば、完全な1,048,576トークンの入力は約$0.1573、最大長の384,000トークンの出力は約$0.1114かかります(両方の上限を別々のトランザクションで使用した場合)。利用可能な事実にはキャッシュ入力の割引価格は記載されていないため、各入力トークンは標準レートで請求されると想定してください。価格設定は線形であるため、平均プロンプトサイズと出力長が分かれば、バッチコストの見積もりは簡単です。
主なトレードオフは、コンテキストサイズと価格の間です。入力トークン100万あたり0.15ドルの場合、1,048,576トークンのコンテキスト全体を使用するプロンプトは、入力料金だけでおよそ0.157ドルかかります。タスクに必要なコンテキストが数千トークンだけであれば、未使用の容量に対して支払っていることになります。つまり、トークン単価がより低い小規模コンテキストモデルの方が、そのレート次第では安くなる可能性があります。出力100万トークンあたり0.29ドルのレートは、長い出力が個別に特に高価になるわけではないことを意味しますが、ギガバイト単位のテキストを生成するワークロードはコストが蓄積されます。提供された事実には、バッチ割引、予約割引、キャッシュ割引は記載されていません。OrcaRouterのゼロマークアップ請求により、表示される価格はプロバイダーの価格であり、最終的な請求額は送受信されたトークン数の関数にすぎません。大規模なバッチジョブの場合は、総入力トークンと出力トークンを見積もり、2つのレートを掛け合わせ、カタログ内の代替案と比較してください。
OrcaRouterはDeepSeek V4 Flash 0731をプロバイダー料金で明示的に請求し、マークアップは一切ありません。入力トークン100万件あたり0.15ドル、出力トークン100万件あたり0.29ドルはプロバイダーの料金であり、マークアップされたものではありません。提供された情報には、このモデルのプロンプトキャッシュに関する記述はありません。キャッシュされた入力の料金プランは記載されておらず、OrcaRouterがお客様に代わってプロンプトを自動的にキャッシュするという記述もありません。基盤となるプロバイダーがキャッシュを提供している場合でも、その条件はこのカタログエントリに提供された情報には含まれていません。割引があると想定する前に、OrcaRouterの最新のドキュメントを確認してください。APIレスポンスはOpenAIのチャット完了形式に従っているため、請求された入力トークンと出力トークンを検証できる使用状況情報が含まれています。監査の目的で、各レスポンスのusageオブジェクトをログに記録し、期待されるトークン数と比較してください。コスト管理は、ご自身のプロンプトとパラメータの選択によってのみ行う必要があります。
標準的なチャット補完リクエストを OrcaRouter の OpenAI 互換 API に送信します。ベース URL は https://api.orcarouter.ai/v1 で、モデル ID は deepseek/deepseek-v4-flash-0731 です。モデルフィールドをその正確な文字列に設定し、OrcaRouter API キーを Authorization ヘッダーにベアラートークンとして配置します。テキストコンテンツを含む messages 配列を構築してください。モデルは画像や音声コンテンツを受け付けません。レスポンスは OpenAI のチャット補完と同様の形式で、生成されたメッセージと usage オブジェクトが含まれます。モデル ID にはプロバイダープレフィックスが含まれているため、表示されているとおりに正確に保ってください。利用可能な事実から、非標準のヘッダーや特別なトランスポート設定は不要です。OpenAI SDK、curl、または JSON を扱える任意の HTTP クライアントを使用できます。小さなリクエストから始め、返された usage が期待される入力トークン数と出力トークン数に一致することを確認してから、スケールアップしてください。
エンドポイントはOpenAI互換のため、通常のチャット完了パラメータが利用可能です: model、messages、temperature、top_p、max_tokensまたはmax_completion_tokens、stop、stream、および使用するSDKがサポートする類似のオプション。利用可能な事実には、OrcaRouterがこの特定のモデルに対してどのパラメータを尊重するかは列挙されていないため、modelとmessages以外についてはテストが必要です。重要な制限はモデル自体のものです: 入力トークン1,048,576、出力トークン384,000。リクエスト失敗を避けるため、max_tokensを出力上限未満に保ってください。ツールまたは関数呼び出しについては、事実にサポートの記載がないため、エージェントを構築する前に最小限のツール定義をテストしてください。出力形式の制御については、JSONモードや構造化出力の保証に関する言及がないため、信頼できる構造が必要な場合は生成テキストを自分で検証してください。ストリーミングはOpenAI互換エンドポイントで一般的にサポートされていますが、事実はこのモデルについて確認していないため、OrcaRouterのAPIリファレンスを参照してください。
移行はほぼ設定の問題です。ベースURLをhttps://api.orcarouter.ai/v1に変更し、APIキーを自身のOrcaRouterキーに切り替え、モデル名をdeepseek/deepseek-v4-flash-0731に置き換えるだけです。メッセージの構築、チャット完了レスポンスの処理、使用量データの読み取りをすでに行っているコードは、OpenAIの規約に従っている限り、そのまま動作し続けます。注意が必要な違いが2つあります。1つ目は、このモデルはテキストのみ対応であるため、リクエストからimage_urlやaudioフィールドを削除してください。2つ目は、コンテキストと出力の上限が非常に大きいため、384,000トークンの出力上限を尊重するようmax_tokens設定を調整し、時折発生する長いレスポンスに備えてください。コードに429エラーや5xxエラーに対するリトライ処理が含まれている場合は、そのまま維持してください。事実はエラーハンドリングの期待値を変えるものではありません。小さなプロンプトでスモークテストを実行し、100万トークンあたり$0.15/$0.29で課金が表示されることを確認してから、段階的にトラフィックを移行してください。
OrcaRouter の API のベース URL は https://api.orcarouter.ai/v1 です。このエンドポイントへのすべてのリクエストは HTTPS を使用する必要があります。認証は API キーを使用し、Authorization ヘッダーで標準のベアラートークンとして送信されます。利用可能なファクトには代替認証方法は記載されていません。モデル ID は deepseek/deepseek-v4-flash-0731 で、プロバイダー名と 0731 スナップショットのサフィックスが含まれます。指定されたとおりに正確に渡してください。ほとんどの OpenAI 互換 SDK では、base_url と api_key でクライアントを構成し、各呼び出しでモデル名を設定します。レスポンスには、課金に関連するトークン数が usage オブジェクトに含まれます。ファクトにはレート制限、リトライ動作、タイムアウトのガイダンスは記載されていないため、これらの運用上の詳細については OrcaRouter のドキュメントを確認してください。API キーは安全に保管してください。このキーは、OrcaRouter プロジェクト内のすべてのモデルアカウントへのアクセスを決定します。プロキシまたはゲートウェイを使用する場合は、OrcaRouter のベース URL を指すように設定し、完全なモデル ID を保持してください。
提供された事実はこの特定のスナップショットのみをカバーしており、そのため、提示された内容から他のDeepSeekエントリとの行単位の数値比較はできません。DeepSeek V4 Flash 0731について分かっているのは、1,048,576トークンのコンテキスト、384,000トークンの出力上限、テキストのみの入力、100万トークンあたり$0.15/$0.29の価格、そして82.7のTerminal Bench 2.1スコアです。OrcaRouterのカタログにある他のDeepSeekモデルは、これらの軸のいずれにおいても異なる可能性があります。選択する際には、重要な仕様を比較してください:プロンプトが実際に使用するトークン数、出力に必要なトークン数、マルチモーダル入力が必要かどうか、そして候補の100万トークンあたりの価格です。Flashというラベルは、他のDeepSeekリリースと比較してより軽量なバリアントを示唆していますが、事実の中での唯一の客観的なパフォーマンス指標はTerminal Benchスコアです。選択する前に、OrcaRouterのカタログ一覧ページで仕様と現在の価格を並べて比較してください。
1,048,576トークンのコンテキストにおいて、このモデルはロングコンテキスト層に位置します。より小さなコンテキストのモデルは、数十万トークン以下で上限に達する可能性があり、ドキュメントの分割、チャンクの埋め込み、または検索の使用を余儀なくされます。このモデルの利点は、非常に大きなコーパスを1つのプロンプトに配置し、モデルがそれを1回のパスで全て処理できることです。欠点はリクエストごとのコストです。各入力トークンが課金されるため、巨大なコンテキストは入力費用を倍増させます。事実として、これよりも大きなコンテキストウィンドウを持つモデルは記載されていないため、安全に言及できるのはこのモデル自身の限界についてのみです。選択にあたっては、実際のプロンプトサイズを見積もってください。タスクが通常100Kトークン未満を使用する場合、フルコンテキストは無関係であり、より安価で小さなモデルの方が好ましいかもしれません。一般的なコンテキスト制限を定期的に超える場合、このモデルの100万トークンのウィンドウが決定的な機能となります。
タスクがテキストのみで、その仕様を活用できる場合は、DeepSeek V4 Flash 0731を選択してください。リポジトリ全体、ドキュメントセット、または長いトランスクリプトを一度に読み取る必要がある場合は、1,048,576トークンのコンテキストが選択の根拠となります。複数回の往復なしで非常に長い生成回答が必要な場合は、384,000トークンの出力上限が選択の根拠となります。ターミナル自動化およびエージェント型CLIワークフローには、82.7のTerminal Bench 2.1スコアが選択の根拠となります。トークンあたりのコストが支配的な大量バッチテキスト処理には、1Mトークンあたり$0.15/$0.29の価格が選択の根拠となります。画像や音声が必要な場合、コンテキスト要件が小さくより安価なモデルが存在する場合、または未知のレイテンシ特性を受け入れられない場合は、選択しないでください。利用可能な事実にレイテンシの保証はないため、パフォーマンス重視のチームはまず実際のプロンプトでベンチマークを実施すべきです。いずれの場合も、スケーリング前にOrcaRouterでモデルIDと請求内容を確認してください。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| 入力 / 1M tokens | $0.147 |
| 出力 / 1M tokens | $0.295 |
| キャッシュ読み取り / 1M | $0.020 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731