DeepSeek V4 Flash 0731 是 DeepSeek 高效能 V4 Flash 混合專家模型重新進行後訓練後的官方版本——總參數 284B、啟用參數 13B,架構與規模和四月發布的 V4 Flash 版本完全相同,但後訓練從頭重做。它提供 100 萬 token 的上下文視窗,最多可輸出 384K token,支援思考與非思考模式(預設開啟思考),並支援 JSON 輸出與工具呼叫,原生支援 Responses API,並針對 Codex 風格的編碼代理進行了定向適配。 0731 修訂版在代理能力上有重大提升,在 DeepSeek 官方發布的代理基準測試中甚至超越 DeepSeek V4 Pro Preview——Terminal Bench 2.1 達 82.7、Cybergym 達 76.7、Toolathlon Verified 達 70.3、DeepSWE 達 54.4、NL2Repo 達 54.2。在 DeepSeek 第一方 API 上,此修訂版即為 deepseek-v4-flash 模型 ID 目前所提供的版本;帶日期的識別碼則指向相同修訂版,供依日期引用的呼叫端使用。對於編碼代理、終端機與工具使用工作負載,以及需要 flash 級成本的高流量代理管道而言,這是一個強力選擇。
DeepSeek V4 Flash 0731 是來自供應商 deepseek 的純文字語言模型,可透過 OrcaRouter 以模型 ID deepseek/deepseek-v4-flash-0731 使用。其重點規格為 1,048,576 個 token 的上下文視窗、384,000 個 token 的最大輸出,以及在 Terminal Bench 2.1 上獲得 82.7 分。定價為每…
輸入僅限於文字。上下文窗口為 1,048,576 個 token,每次回應的最大輸出為 384,000 個 token。這是一個很大的工作空間:您可以在生成前閱讀約一百萬個 token 的內容,也可以在單次呼叫中請求最多 384,000 個 token 的輸出。模型卡將這些列為兩個獨立的限制;它並未說明同時使用兩者接近上限時是否有合併限制。在實務上,為確保不超出限制,請在發送前計算您的 token 數量,並將 max_tokens 設定在輸出上限以下。僅限文字的限制也意味著您必須先將 PDF、試算表及其他文件轉換為純文字。現有資訊中未詳細說明 tokenization(分詞)機制,因此請測試代表性內容,以了解您的提示會變得多大。如果您的請求超過 1,048,576 個輸入 token,API 呼叫將失敗;輸出超過 384,000 個 token 時亦同。
根據所列出的規格,此模型最適合結合長文本輸入、長文本輸出以及終端導向的代理推理的任務。82.7 的 Terminal Bench 2.1 分數證明了其在命令列任務完成方面的實力,模型會讀取 shell 輸出並決定下一個命令。1,048,576 個 token 的上下文支援整個程式碼庫的分析、多檔案程式碼審查、長篇法律或技術文件,以及大量的聊天記錄。384,000 個 token 的輸出支援在一次生成中產生長篇結構化文件、合成資料集或逐步分析。每百萬個 token 輸入 $0.15、輸出 $0.29 的計價方式,使得大量文字處理在財務上可預測。當你需要影像理解、音訊轉錄或極低延遲時,此模型就較不適合,這些都未被所提供的資訊涵蓋。如果你的任務符合純文字、大上下文、大輸出的特性,那麼這是透過 OrcaRouter 評估的合理候選方案。
此模型無法接受非文字輸入;其目錄條目中沒有視覺、音訊或視訊模態。在可用的事實中,它也沒有已發布的延遲或串流保證。當您的工作負載不需要大型上下文或輸出限制時,您應該選擇較便宜的模型。例如,一個使用幾千個 token 的簡短聊天機器人對話,仍然會以相同的每個 token 費率計費,但可能更適合由上下文較小且每百萬 token 價格較低的模型來服務。可用的事實並未列出替代方案的價格,因此請比較 OrcaRouter 目錄中的每 1M token 費率。如果您的任務是簡單的分類或短段落摘要,較便宜的模型可能就足夠了。如果您的任務需要完整的 1M 上下文或 384K 輸出,或受益於 Terminal Bench 2.1 在命令列工作方面的優勢,那麼此模型的價格就是相關的評估基準。
每個輸入都必須是文字。PDF、圖片、試算表和音訊檔案都必須先轉換為純文字或轉錄,之後才能傳送。這是必要的預處理步驟,但也簡化了請求格式:只需要包含字串的標準 OpenAI 風格內容欄位即可。1,048,576 個 token 的上下文代表你可以在單一請求中傳入大量轉換後的文字;384,000 個 token 的輸出則讓你可以接收非常長的文字回傳。Token 數量是主要營運考量,因為總費用取決於輸入和輸出的 token 數。OrcaRouter 會在相容 OpenAI 的回應中回報使用量,讓你可以監控這兩個數字。如果你使用的是 token 化效率較低的語言或程式碼,你的有效上下文會縮小,因為限制的是 token 數而非字元數。文件中沒有提供 tokenizer 的細節,所以請用你自己的內容快速測試一下,了解典型的 token 長度。
Terminal Bench 2.1 評估模型在終端環境中工作的能力:理解命令輸出、瀏覽目錄、執行命令,以及透過 shell 完成實際的系統管理或軟體工程任務。DeepSeek V4 Flash 0731 的主要得分為 82.7,分數越高表示越好。這是可用資料中提供的唯一基準測試結果。如果您計劃建立會發出 shell 命令的代理迴圈,這個分數是很有用的參考,因為該基準測試正是為測試這類能力而設計的。它並不衡量一般知識、創意寫作、數學或多語言能力。由於未提供比較基準或其他基準測試數據,因此應在上下文中解讀 82.7:它對終端相關任務是強有力的證據,但對其他領域則沒有任何正面或負面證據。基準測試分數取決於確切的任務分佈,因此您自己的終端任務可能得到不同分數;在正式使用前,請以您自己的評估進行驗證。
關於 DeepSeek V4 Flash 0731 的可用資料並未包含每秒 tokens 數、首次 token 回應時間、p95 延遲或吞吐量。Flash 這個名稱暗示其為較輕量的變體,但所提供的資料並未量化速度。這些資料確實包含的是 1,048,576 tokens 的大型上下文窗口,以及 384,000 tokens 的大型輸出上限。較長的輸入和輸出本質上會消耗更多計算資源,因此即使是快速模型,全上下文請求的延遲也可能高於短提示詞。每百萬 token 定價 $0.15/$0.29 描述的是成本,而非速度。若要做出明智的決策,請針對 OrcaRouter 的 API 自行執行負載測試,使用與你打算使用之規模相符的代表性提示詞,並與目錄中其他模型的首次 token 回應時間和總持續時間進行比較。請勿從基準測試分數推斷延遲,因為該分數並不衡量回應時間。
主要限制從所列事實即可看出。它僅支援文字,因此任何多模態輸入都不在範圍內。基準測試證據僅限於一項分數,即 Terminal Bench 2.1 上的 82.7 分,該基準涵蓋終端機型任務完成,而非一般推理或知識。尚未發布延遲、可用性或錯誤率的指標,因此負載下的效能表現未知。上下文與輸出上限很大但有限:每次請求 1,048,576 個輸入 tokens 與 384,000 個輸出 tokens。超出上限的請求將無法成功。在提供的事實中沒有記錄提示詞快取折扣,因此重複的前綴內容會以一般輸入 tokens 計費。定價在單一 token 基礎上很低,但絕對成本會隨上下文大小線性成長。如果您的應用程式需要視覺、低延遲或非常高的吞吐量,此模型可能不是合適的選擇;請在投入前另行驗證這些需求。
費用按每個 token 計算,輸入和輸出各有一個費率。輸入 token 每 1,000,000 個收費 $0.15;輸出 token 每 1,000,000 個收費 $0.29。OrcaRouter 以供應商費率計費,零加成,也就是說在 deepseek 的費率之上不加收任何平台百分比。單次請求的費用大約是輸入 token 數乘以 $0.15 再除以 1,000,000,加上輸出 token 數乘以 $0.29 再除以 1,000,000。例如,完整的 1,048,576 個 token 輸入成本約為 $0.1573,而最大長度 384,000 個 token 的輸出成本約為 $0.1114,前提是這兩個上限分別用於不同的交易。現有資訊並未提及快取輸入的折扣定價,因此假設每個輸入 token 都按標準費率計費。由於定價為線性,只要知道平均提示大小和輸出長度,批次成本估算就很直接。
主要的取捨在於上下文大小與價格之間。以每1M輸入token $0.15的價格計算,使用完整1,048,576 token上下文的提示,光是輸入費用就約為$0.157。如果你的任務只需要幾千個token的上下文,你就在為未使用的容量付費;在某種程度上,一個上下文較小且每token定價較低的模型可能更便宜,這取決於其費率。每1M輸出token $0.29的費率意味著長輸出的單次成本並不特別高,但產生數GB文字的工作負載將累積費用。所提供的資訊中沒有列出批次折扣、預留或快取折扣。OrcaRouter的零加成計費意味著你看到的價格就是提供者的價格;你的最終帳單僅取決於發送和接收的token數量。對於大規模批次作業,請估算總輸入和輸出token,乘以這兩個費率,並與目錄中的其他方案進行比較。
OrcaRouter 明確以供應商原價計費 DeepSeek V4 Flash 0731,不另加價。輸入端每 1M tokens 收費 $0.15、輸出端每 1M tokens 收費 $0.29,皆為供應商費率,並非加成後的價格。所提供的資訊並未描述此模型的 prompt 快取機制。未列出快取輸入的計費層級,也沒有任何陳述表示 OrcaRouter 會自動代你快取 prompts。若底層供應商確有提供快取功能,相關條款亦不屬於本目錄條目所提供之內容,因此在下結論前,你應先查閱 OrcaRouter 的最新文件。API 回應因遵循 OpenAI 的 chat completions 格式,會包含 usage 資訊,讓你得以核對實際計費的輸入與輸出 tokens。為便於稽核,請將每次回應中的 usage 物件記錄下來,並與你預期的 token 數量比對。任何成本控管都必須來自你自身的 prompt 與參數選擇。
將標準聊天完成請求傳送至 OrcaRouter 的 OpenAI 相容 API。Base URL 為 https://api.orcarouter.ai/v1,模型 ID 為 deepseek/deepseek-v4-flash-0731。請將 model 欄位設定為該確切字串,並將您的 OrcaRouter API 金鑰放在 Authorization 標頭中作為 bearer token。建立包含文字內容的 messages 陣列;此模型不接受圖片或音訊內容。回應格式與 OpenAI 聊天完成相同,並包含產生的訊息及 usage 物件。由於模型 ID 包含供應商前綴,請務必保持原樣。目前已知的資訊顯示,此 API 不需要任何非標準標頭或特殊傳輸設定。您可以使用 OpenAI SDK、curl,或任何支援 JSON 的 HTTP client。先從小型請求開始,驗證回傳的 usage 與預期的輸入及輸出 token 數量相符,再逐步擴展。
由於端點與 OpenAI 相容,因此可使用典型的聊天完成參數:model、messages、temperature、top_p、max_tokens 或 max_completion_tokens、stop、stream,以及您所用 SDK 支援的類似選項。可用資訊並未列舉 OrcaRouter 針對此特定模型遵循哪些參數,因此對於 model 和 messages 以外的任何參數,您都應進行測試。關鍵限制在於模型本身:1,048,576 個輸入 token 與 384,000 個輸出 token。請將 max_tokens 保持在輸出上限以下,以避免請求失敗。關於工具或函式呼叫,資訊中未說明是否支援;請先測試最小工具定義,再建置代理程式。關於輸出格式控制,並未提及 JSON 模式或結構化輸出的保證;若您需要可靠的結構,請自行驗證產生的文字。串流通常受到 OpenAI 相容端點支援,但資訊並未確認此模型是否支援,因此請查閱 OrcaRouter 的 API 參考文件。
遷移主要是配置:將 base URL 改為 https://api.orcarouter.ai/v1,將 API 金鑰切換為您的 OrcaRouter 金鑰,並將模型名稱替換為 deepseek/deepseek-v4-flash-0731。只要遵循 OpenAI 慣例,既有的訊息建構、聊天完成回應處理及用量資料讀取程式碼都能繼續運作。有兩項差異需要留意。首先,此模型僅支援文字,因此請從請求中移除任何 image_url 或 audio 欄位。其次,上下文與輸出的上限非常大;請調整您的 max_tokens 設定,以遵守 384,000 token 的輸出上限,並為偶爾較長的回應做好準備。如果您的程式碼包含針對 429 或 5xx 錯誤的重試機制,請保留;上述事實不會改變錯誤處理的預期。使用小型提示詞執行冒煙測試,確認計費顯示為每百萬 token $0.15/$0.29,然後逐步轉移流量。
OrcaRouter API 的基礎 URL 是 https://api.orcarouter.ai/v1。對此端點的所有請求都應使用 HTTPS。驗證方式是 API 金鑰,作為標準的 bearer token 放在 Authorization 標頭中。可用的事實中並未列出其他驗證方法。模型 ID 是 deepseek/deepseek-v4-flash-0731,其中包含提供者名稱和 0731 快照後綴;請完全按照原樣傳遞。在大多數 OpenAI 相容的 SDK 中,您會使用 base_url 和 api_key 設定用戶端,然後在每次呼叫時設定模型名稱。回應會在 usage 物件中包含與計費相關的 token 計數。這些事實並未說明速率限制、重試行為或逾時指引,因此請查閱 OrcaRouter 的文件以了解這些操作細節。請安全地儲存您的 API 金鑰;該金鑰決定了您 OrcaRouter 專案中每個模型帳戶的存取權限。如果您使用代理或閘道,請將其指向 OrcaRouter 的基礎 URL,並保留完整的模型 ID。
所提供的資料僅涵蓋此特定快照,因此無法根據現有資訊與其他 DeepSeek 條目進行逐行數值比較。我們對 DeepSeek V4 Flash 0731 的了解包括:1,048,576 token 的上下文長度、384,000 token 的輸出上限、純文字輸入、每 100 萬 token 0.15/0.29 美元的定價,以及 82.7 的 Terminal Bench 2.1 分數。OrcaRouter 目錄中的其他 DeepSeek 模型可能在這些面向中的任何一項上有所不同。在決策時,請比較重要的規格:你的提示詞實際使用多少 token、你的輸出需要多少 token、你是否需要多模態輸入,以及候選模型的每 100 萬 token 價格。Flash 標籤意味著相對於其他 DeepSeek 版本而言是一個更精簡的變體,但事實中唯一的客觀效能指標是 Terminal Bench 分數。在選擇之前,請使用 OrcaRouter 的目錄列表頁面進行並排規格比較並查看當前定價。
在1,048,576個token的上下文長度下,此模型屬於長上下文級別。較小上下文的模型可能上限僅為數十萬或更少的token,迫使您拆分文件、嵌入區塊或使用檢索。此模型的優勢在於,您可以將非常大的語料庫放入單一提示詞中,讓模型在一次處理中關注所有內容。缺點是每次請求的成本:每個輸入token都會計費,因此巨大的上下文會使輸入花費成倍增加。事實清單中未列出任何具有更大上下文視窗的模型,因此唯一安全的陳述是關於此模型自身的限制。在選擇時,請估計您實際的提示詞大小。如果您的任務通常使用少於100K個token,則完整上下文可能無關緊要,更便宜、更小的模型可能更為合適。如果您經常超過常見的上下文限制,此模型1M個token的視窗便是決定性功能。
當任務僅限於文字,且你能充分利用其規格時,請選擇 DeepSeek V4 Flash 0731。當你需要一次性讀取整個儲存庫、文件集或長篇逐字稿時,1,048,576 個 token 的上下文長度便值得選擇。當你需要非常長的生成答案,且不想多次來回往返時,384,000 個 token 的輸出上限便值得選擇。82.7 的 Terminal Bench 2.1 分數使其成為終端機自動化與代理式 CLI 工作流程的選擇。每 100 萬個 token 0.15/0.29 美元的价格使其成為單一 token 成本主導的高容量批次文字處理的選擇。當你需要影像或音訊、當你的上下文需求極小且存在更便宜的模型、或當你無法接受未知的延遲特性時,請不要選擇它。現有資訊並未提供延遲保證,因此對效能敏感的團隊應先使用真實提示詞進行基準測試。在任何情況下,擴展前請先在 OrcaRouter 上確認模型 ID 與計費方式。
相容 OpenAI——沿用你現有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| 輸入 / 1M tokens | $0.147 |
| 輸出 / 1M tokens | $0.295 |
| 快取讀取 / 1M | $0.020 |
| 貨幣 | USD |
基於標價的估算
僅為估算——實際 Token 數取決於供應商的分詞器。
本週開發者的討論
@misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731