DeepSeek V4 Flash 正式發布:平價、快速、具代理能力的 1M 上下文模型解析
Guides & Insights

DeepSeek V4 Flash 正式發布:平價、快速、具代理能力的 1M 上下文模型解析

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4 Flash是 DeepSeek V4 產品階梯中較便宜的一端,獨立評測數字也終於追上來了:在 MathArena 的 AIME 2026 測試集上,它拿下 95.83%,與 DeepSeek V4 Pro 的 96.67% 在統計上無顯著差異,而每道題的花費約僅為後者的九分之一。官方公開測試版 -0731 於 2026 年 7 月 31 日發布,架構與 4 月預覽版相同——一個 2840 億參數的混合專家(MoE)模型,13B 活躍參數,100 萬 token 的上下文長度——但額外進行了一輪後訓練,大幅提升了其代理(agentic)、程式碼撰寫與工具呼叫能力,此外還加入原生 Responses-API 支援,以及針對 Codex 風格代理的特定調校。本指南涵蓋這次發布實際上改變了什麼、廠商與獨立評測各自怎麼說、考量到它的思考量後實際成本為何,以及如何呼叫它。

準確性說明:以下列出的發布細節與重點 agentic 評分來自 DeepSeek 官方 API 變更日誌(日期為 2026-07-31),屬廠商自行報告,並在 DeepSeek 自家的測試框架上運行——請將這些數據視為方向性參考,並自行運行評測。獨立數據在出現處均有標明出處:Intelligence Index 及其組成部分來自 Artificial Analysis,AIME 2026 來自 MathArena,定價來自 DeepSeek 官方價目表。凡是僅依據單一從業者報告而非已發布評測的內容,文中都會明確說明。規格與價格可能變動;開發前請先核實。

TL;DR。V4 Flash 是大型 DeepSeek V4 Pro 的高成本效益兄弟產品:一個 284B / 13B 啟用參數的 MoE,具有 1M token 的上下文和最高 384K 的輸出,針對高容量、低延遲的代理型工作進行調校。7 月 31 日的正式發布是一次訓練後升級——尺寸相同,但代理能力和程式碼能力顯著提升——同時也新增了原生 Responses-API 和 Codex 支援。DeepSeek 報告了強勁的代理型/程式碼分數(例如 Terminal-Bench 2.1 82.7、Toolathlon 70.3),而 Artificial Analysis 隨後將其 -0731 版本在 Intelligence Index 上評為 50 分:比 4 月預覽版高 10 分,比大得多的 V4 Pro 高 6 分,並與 Gemini 3.6 Flash 持平。其成本約為每百萬輸入/輸出 token 0.15/0.29 美元,約為 V4 Pro 價格的三分之一。只有 Flash API 升級了;V4 Pro 和 DeepSeek 應用程式/網頁保持不變。在 OrcaRouter 上,您可以透過一個 OpenAI 相容的端點以 0% 加成獲得它。

關鍵要點

官方發佈(build -0731,2026年7月31日):預覽版的訓練後升級——架構相同,但智能體、編碼與工具使用能力大幅增強。

• 架構不變:總計 284B / 13B 活躍參數(MoE),1M token 上下文(1,048,576),最多 384K 輸出,僅文字輸入,具備推理、工具與 JSON。

• 新增:原生 Responses API 支援,加上針對 Codex 的特定調適;持續支援 OpenAI ChatCompletions 與 Anthropic 風格介面。模型 ID 為 deepseek-v4-flash

• DeepSeek 報告的代理式/編碼能力成績:Terminal-Bench 2.1 82.7, Toolathlon(已驗證)70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7。

• 非常便宜:每 1M 輸入/輸出 token 約 $0.15 / $0.29——大約是 V4 Pro 的 $0.44 / $0.88 的三分之一——而 DeepSeek 將快取命中定價為每 1M $0.0028,比全新輸入便宜約 98%。只有 Flash API 有變動;Pro 與 app/web 維持不變。

官方發布實際上升級了什麼

V4 Flash 最初於 2026 年 4 月 24 日以預覽版形式推出。2026 年 7 月 31 日正式發佈的版本(依 DeepSeek 的 API 變更日誌,即「-0731」版本)明確不是新的架構:總參數與啟用參數(284B / 13B)以及 1M 上下文均保持不變。改變的是後訓練——DeepSeek 稱,額外的微調顯著提升了核心的代理(agentic)、編碼與工具呼叫能力。有兩項實用新增功能值得關注:V4 Flash 現在原生支援 Responses API,並特別針對 Codex 風格的編碼代理進行了適配,同時仍相容 OpenAI ChatCompletions 與 Anthropic 風格的介面。重要的是,本次發佈僅升級了 Flash API;V4 Pro 與 DeepSeek 應用程式/網頁體驗均未變動。對團隊而言,這代表在相同價格下,代理型工作負載可獲得直接套用的效能提升,無需遷移。

架構:為吞吐量打造的小型活躍 MoE

V4 Flash 是一個專家混合模型,總參數約 2840 億,但每個 token 僅有約 130 億個活躍參數。這個低活躍參數數量的重點在於:它讓推論快速且便宜,同時龐大的專家池保有品質。上下文視窗完整為 1,048,576 個 token(約 1M),最大輸出高達 384K,且模型支援推理(延伸思考)、工具呼叫和結構化 JSON。輸入僅限文字。設計目標——高吞吐量、低延遲、代理型工作——反映在服務數據上:在 OrcaRouter 的量測中,p50 首次輸出時間(time-to-first-token)約 394 毫秒,輸出速度約每秒 184 個 token。

基準測試:官方數據怎麼說

官方發布版高度倚重代理式與程式碼評測,並以DeepSeek自家的測試框架(minimal-mode / max-effort設定)執行。以下是如何解讀這些重點結果,所有數據均由DeepSeek報告:

• Terminal-Bench 2.1:82.7 — 在真實終端機中執行的代理式命令列/軟體任務。此處高分代表模型能真正操作工具與 shell,而不只是回答問題。

• {{1}}Toolathlon(已驗證):70.3{{/1}} 和 {{2}}Automation Bench(公開):25.1{{/2}} — 工具使用的廣度與可靠性,以及端到端自動化。工具呼叫的可靠性是代理成敗的關鍵特質。

• Cybergym:76.7 — 資安/CTF 風格的代理式問題解決。

• DeepSWE:54.4,NL2Repo:54.2,DSBench-FullStack:68.7,DSBench-Hard:59.6 —— 涵蓋軟體工程與全端程式設計,從儲存庫層級的程式碼生成到高難度的資料科學任務。DSBench-FullStack 的強勁表現(68.7)彰顯其實用的多檔案程式設計能力。

• Agent Last Exam: 25.2 —— 一項刻意設計得極其困難的智能體推理考驗,即使頂尖模型也得分偏低;可作為相對信號,而非絕對指標。

作為獨立參考,Artificial Analysis 現在已評估 -0731 版本本身,並在 Artificial Analysis Intelligence Index 上給它打了 50 分——比它所取代的四月預覽版高出十分,比體積大得多的 V4 Pro 高出六分,並與 Gemini 3.6 Flash 平起平坐。其各項組成結果:GPQA Diamond 91%、AA-LCR 66%、Humanity's Last Exam 37%、SciCode 50%、τ³-Bench Banking 31%、CritPt 17%,以及在 GDPval-AA v2 上的 Elo 1559。其中兩項值得再仔細審視。Artificial Analysis 測得 Terminal-Bench 2.1 為 79%,而 DeepSeek 宣稱的數字是 82.7——接近,但較低,而這正是廠商測試框架數字通常漏掉的方向。而在 AA-Omniscience 上,該模型得分為 -16,且測得的幻覺率很高,因此「便宜且代理型」的說法並不適用於無監督的事實回憶。這才是更精確地解讀這個模型的方式:每美元有強推理能力,但每次查詢的知識量薄弱。

競賽數學:Flash 唯一能與 Pro 匹敵的地方

對 V4 Flash 推理能力最實用的獨立評測來自 MathArena,它會針對剛發布的競賽每道題讓每個模型各跑四次,並公布逐題的結果網格。在 AIME 2026 上——兩份試卷、30 道題、每題四次——V4 Flash 在最大推理模式下得分 95.83% ±3.58%,而 DeepSeek V4 Pro 則為 96.67% ±3.21%。這兩個區間幾乎完全重疊:在此基準上,小模型的表現並未顯著遜於旗艦機型。兩者的分野出現在成本欄位。MathArena 顯示 V4 Flash 每道題一次運行要價 0.009 美元,V4 Pro 則為 0.082 美元——相同準確度下便宜約九倍,這比 DeepSeek 自家公告中的任何說法都更能證明效率等級的價值。

這兩點警示必須放在一起說。MathArena 對 DeepSeek 的兩個條目都標記了污染警告——這是它用來標示「模型發布時間晚於競賽出現時間」的標籤——因此部分準確率可能來自記憶而非推理。此外,MathArena 測試的版本日期為 2026-04-24,是四月預覽版,而非 -0731 建置版。截至本文撰寫之時,官方正式發布版尚無獨立的 AIME 2026 成績,而 DeepSeek 自家的模型卡上也完全沒有發布任何數學基準測試,只有代理型(agentic)基準測試。

這張圖表也顯示了效能上限所在。榜上幾乎每個模型都能解出 AIME 2026 的大部分題目;真正分出高下的是第 15 題。只有兩個模型在全部四次運行中都解出該題——GPT-5.5(extra-high 努力設定)與 Claude Opus 4.8(max 設定)。V4 Flash 在該題四次運行中全數落空,V4 Pro 同樣掛零,GLM-5.2、Gemini 3.6 Flash、Kimi K2.6 與 Claude Opus 4.7 也是如此。

最後這個細節,正是讓2026年8月5日的一份報告值得特別標註的原因。AI評論者@teortaxesTex發文指出,-0731版本確實解出了AIME 2026第15題,耗時約1,006秒,輸出約10萬個token,並描述該模型明顯先試圖投機取巧,後來放棄捷徑、老老實實解題。這只是一名實務工作者的一次單次執行,並非基準測試結果:尚未被重現、沒有公開排行榜對-0731版本進行評分,單一一份逐字稿也不能算作評測。能檢驗的是內部一致性,而它確實經得起檢驗——Artificial Analysis測得該模型的輸出速度約為每秒116個token,以此速率計算,1,006秒約等於117,000個token,與報告中的數量大致吻合。10萬token的答案也完全在DeepSeek的預期範圍內,因為DeepSeek建議在高或最高推理強度下,允許最多384K的輸出token。這兩個數字大約是MathArena對該模型實測平均值的3倍(平均每個答案33,588個輸出token、耗時6分50秒),而對全組最難的單一題目來說,這正是預期中的結果。所以:形式上合理、結果未經證實,而如果能夠重現,這將是對預覽版本的一次真正飛躍——預覽版本在該題上四次嘗試、四次全敗。

定價:改變預算的數字

在 OrcaRouter 上,供應商定價以 0% 加價直接傳遞,V4 Flash 大約是每百萬輸入 tokens 0.15 美元、每百萬輸出 tokens 0.29 美元,而 DeepSeek 這次升級維持定價不變。這大約是 DeepSeek V4 Pro 的 0.44/0.88 美元的三分之一。快取命中比多數人想的更便宜:DeepSeek 將快取輸入列為每百萬 0.0028 美元,比一般輸入便宜約 98%,這正是讓具有穩定系統提示詞的 agent 與聊天服務能如此便宜地持續運作的原因。以實際數字來看,每月 1000 萬 tokens、以 70% 輸入/30% 輸出拆分,成本大約是幾美元;若放大到 10 億 tokens,與旗艦模型的差距就會變成財務部門會注意的預算項目。

不過,對推理模型而言,費率表只是帳單中比較不有趣的一半——真正影響預算的是模型選擇花費多少 token。{{1}}Artificial Analysis 在 V4 Flash 上運行完整 Intelligence Index 需要約 2.06 億個輸出 token,大約是其測試模型中位數(約 1 億個)的兩倍,並形容它速度雖快但非常冗長。{{/1}}按價格換算,單次 100,000 token 的回應約需三分錢,而 384K 的輸出上限使單一回應的費用接近十一分錢。以絕對金額來看雖便宜,但卻是簡短回覆成本的數百倍——這就是為什麼推理強度是預算槓桿,而不是你會一直固定在最大值的品質旋鈕。{{2}}Simon Willison 的實作評測從另一個方向說明了同一點:在預設設定下,他的測試生成結果令人失望,而將推理強度調高後則有大幅改善。{{/2}}在假設牌告費率就是你的成本之前,先自行衡量你的困難請求。

Where V4 Flash fits: the DeepSeek V4 ladder

DeepSeek 的 V4 產品線是一道階梯。V4 Pro 是旗艦款——一個規模大得多的頂級推理與編碼模型。V4 Flash 則屬於效率層級:實際啟用的算力少得多、價格僅為其一小部分,而且在這次後訓練升級之後,具備真正強大的智能體能力與編碼能力。DeepSeek 投入資源讓 Flash 成為更好的智能體(Responses API、Codex 適配、工具使用基準測試),這告訴你它預期用量會流向何處。但 AIME 2026 的成績讓那個對 Flash 有利的簡潔敘事變得複雜:在競賽數學上,兩個模型的表現落在彼此的誤差範圍內,所以「把難題送給 Pro」並不一定正確。誠實的分工是:Pro 買到的是知識廣度與最困難的智能體工作,而不是在困難數學題上更有把握——這就是為什麼根據你自己任務的實測難度來分流,會勝過一律預設使用最大的模型。

三個現實世界場景

1. 編碼代理與 Codex 風格的工作流程

「-0731 版本的原生 Responses-API 與 Codex 支援,加上其 Terminal-Bench(82.7)與 DSBench-FullStack(68.7)的分數,使 V4 Flash 成為自主編碼代理的強大、低成本引擎——適用於問題修復、重構、測試生成與多步驟工具使用。」

2. 大量使用工具的代理

快速的首次 token 輸出(約 394 毫秒)、高吞吐量(約 184 tok/s)、100 萬的上下文長度,以及強大的 Toolathlon(70.3)可靠性,適合大規模呼叫工具的生產環境代理程式——涵蓋檢索、自動化與編排。

3. 預算有限下的長文件處理

完整的1M-token上下文和384K輸出,可一次處理摘要、分析或轉換極大型輸入——日誌、程式碼庫、長篇報告——且成本低廉。

如何存取 V4 Flash

您可以直接在DeepSeek的API上呼叫V4 Flash(模型ID為deepseek-v4-flash;它支援Responses API、OpenAI ChatCompletions以及Anthropic風格的介面),或透過與供應商無關的端點。OrcaRouter以0%加價,透過單一OpenAI相容端點(deepseek/deepseek-v4-flash)提供V4 Flash,同時還有200多種其他模型——因此您可以在同一處將它與GPT-5.6 Luna、Gemini 3.6 Flash、GLM-5.2、Qwen3.8-Max和Kimi K3進行基準測試,並將每個請求路由到對該任務最便宜的選項。由於價格是直接傳遞而非加價,DeepSeek的價格變動會在生效當天反映到您的帳單上。而且由於介面是OpenAI相容的,採用V4 Flash——或在衡量一週後改用其他模型——只是設定變更,而非重新整合。

限制與誠實的提醒

V4 Flash 是效率型模型,而非旗艦機種,但獨立數據讓這條界線比「難題表現較差」更具體。在 AIME 2026 上,它與 V4 Pro 的表現落在信心區間內;它明顯落後的是知識廣度——AA-Omniscience -16 與高實測幻覺率——以及最具挑戰性的代理型任務。輸入僅限文字,不支援原生影像輸入。主要的代理型分數是 DeepSeek 在自己測試框架上回報的數據,而獨立實驗室重新跑過的那個數字則較低(Artificial Analysis 測得 Terminal-Bench 2.1 為 79%,對比官方回報的 82.7),因此應將廠商數字視為方向性參考。此外,「每個 token 便宜」不等於「每個任務便宜」:此模型有實測可量的冗長傾向,因此在簡單呼叫上應限制推理強度與工具迭代次數,而非預設維持最大強度。在投入正式環境流量前,請先用自己的工作負載進行驗證。

常見問題

什麼是DeepSeek V4 Flash?

{{1}}DeepSeek V4 系列中的效率模型{{/1}}:{{2}}一個 {{KEEP}}284B / 13B-active{{/KEEP}} 混合專家模型{{/2}},{{3}}具備 1M token 的上下文,輸出最高達 384K{{/3}},{{4}}針對快速、高吞吐量的代理式與程式設計工作進行調校{{/4}}。{{5}}其官方版本(build -0731)於 2026 年 7 月 31 日發布{{/5}}。

官方發布中有什麼改變?

架構保持不變;這是一次訓練後的升級,大幅提升了代理(agentic)、程式編寫與工具呼叫能力,並新增了原生 Responses-API 支援及 Codex 適配。僅 Flash API 進行了升級 — V4 Pro 與應用程式/網頁版本保持不變。

V4 Flash 要多少錢?

關於 OrcaRouter 上每百萬輸入代幣約 $0.15、每百萬輸出代幣約 $0.29(0% 加價)——大約是 V4 Pro 的 $0.44 / $0.88 的三分之一——快取命中價格為每百萬 $0.0028,比全新輸入便宜約 98%。本次發布的定價維持不變。預算需同時考量代幣數量與速率:這是個冗長推理模型,一個 100,000 代幣的回應成本約三美分。

V4 Flash 在代理型任務和編程任務方面的表現如何?

DeepSeek 報告了亮眼的分數:Terminal-Bench 2.1 82.7、Toolathlon(已驗證)70.3、Cybergym 76.7、DeepSWE 54.4、DSBench-FullStack 68.7——這些都是廠商自有的測試數據,因此請在自己的任務上進行驗證。

V4 Flash 在竞赛数学方面表现好吗?

表現優於其價格所暗示的水準。在 MathArena 的 AIME 2026 排行榜上,四月預覽版在四輪各 30 道題目中得分 95.83%——落在 V4 Pro 96.67% 的信賴區間內,而每題成本僅約其九分之一——不過 MathArena 標記這兩個模型可能有污染問題,且尚未對 -0731 版本進行評分。它唯一從未解出的題目是第 15 題,只有 GPT-5.5 在超高強度(extra-high effort)模式下以及 Claude Opus 4.8 在最高強度(max)模式下才能穩定解出。

V4 Flash 與 V4 Pro 相比如何?

Pro 是規模更大的旗艦模型,專為最困難的推理與程式設計而生;Flash 則是以約三分之一的價格提供高效能等級,具備強大的代理式任務處理與程式設計能力。將困難任務交給 Pro,其餘一切交給 Flash。

上下文窗口?

完整的 1,048,576 個 token(約 1M),最多可輸出 384K 個 token。

V4 Flash 是多模態的嗎?

不——輸入僅限文字。它支援推理、工具呼叫和 JSON 輸出。

V4 Flash 是否與 Responses API 和 Codex 相容?

是的 — -0731 版本新增了原生 Responses-API 支援和特定的 Codex 適配,同時也提供 OpenAI ChatCompletions 與 Anthropic 風格介面。

我該如何使用V4 Flash?

直接透過 DeepSeek 的 API,或透過 OrcaRouter 的 OpenAI 相容端點,零加成(deepseek/deepseek-v4-flash),在此您還可以比較並路由至其他競爭模型。

底線

DeepSeek V4 Flash 的正式發表延續了平價、快速的配方,同時讓它成為更出色的 agent:同樣是 284B / 13B 活化參數的 MoE 與 1M 上下文,經過後訓練以強化程式碼撰寫與工具使用能力,原生支援 Responses-API 與 Codex,價格維持在約 $0.15 / $0.29。獨立數據如今也大多支持這些宣稱——Artificial Analysis 將 -0731 版本在智慧表現上與 Gemini 3.6 Flash 並列,而 MathArena 顯示預覽版在 AIME 2026 上的表現與 V4 Pro 相當,但每題成本僅九分之一。低費率買不到的,是知識廣度,也無法在冗長輸出上獲得豁免:這個模型思考時消耗的 token 預算約為一般模型中位數的兩倍,因此你每項任務的費用更多取決於你允許的推理強度,而非標榜的價格。透過像 OrcaRouter 這類 0% 加成、OpenAI 相容的端點來執行,量測你自己的困難請求實際花費多少,只有在量測顯示必要時,才將流量路由到旗艦模型。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新