DeepSeek V4 Flash 正式發布:平價、快速、具代理能力的 1M 上下文模型解析
Guides & Insights

DeepSeek V4 Flash 正式發布:平價、快速、具代理能力的 1M 上下文模型解析

作者

jinhao song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek 的效率模型V4 Flash,已從預覽版畢業,成為正式的公開測試版——這個code>-0731/code> 版本於 2026 年 7 月 31 日發布。架構沒有改變(仍是擁有 2840 億參數的混合專家模型,具備 100 萬 token 的上下文長度),但一輪額外的後續訓練大幅提升了其代理、程式編寫與工具呼叫能力,而且現在原生支援 Responses API,並針對 Codex 風格的代理進行了特定調整。本指南說明 V4 Flash 是什麼、正式發布版實際升級了哪些內容、其(DeepSeek 公布的)基準測試結果如何、使用費用多少,以及如何使用——所有數據皆標明來源。

準確性說明:以下釋出詳情與基準測試分數來自 DeepSeek 官方 API 變更日誌(日期為 2026-07-31);架構、上下文與定價已與 OrcaRouter 的模型頁面交叉核對;Artificial Analysis 的綜合指標則為獨立數據。DeepSeek 回報的基準測試使用其自有測試環境設定——請將其視為廠商數據,並自行執行評估。規格與價格會變動;建置前請先驗證。

TL;DR。V4 Flash 是 DeepSeek V4 Pro 這個巨人的高成本效益兄弟款:一個 284B / 13B 啟用參數的 MoE 模型,具備 1M token 的上下文長度與最高 384K 的輸出長度,專為高吞吐量、低延遲的 agentic 工作負載而調校。7 月 31 日的正式發布是一次後訓練升級——參數規模相同,但 agent 與程式碼能力有顯著提升——同時新增了原生 Responses-API 與 Codex 支援。DeepSeek 報告了強勁的 agentic/程式碼評分成績(例如 Terminal-Bench 2.1 達 82.7、Toolathlon 達 70.3),而成本約為每百萬個輸入/輸出 token 0.15/0.29 美元,大約是 V4 Pro 價格的三分之一。僅有 Flash API 獲得升級;V4 Pro 與 DeepSeek 應用程式/網頁皆維持不變。在 OrcaRouter 上,您可以透過單一 OpenAI 相容端點以 0% 加價取得該模型。

關鍵要點

官方發佈(build -0731,2026年7月31日):預覽版的訓練後升級——架構相同,但智能體、編碼與工具使用能力大幅增強。

• 架構不變:總計 284B / 13B 活躍參數(MoE),1M token 上下文(1,048,576),最多 384K 輸出,僅文字輸入,具備推理、工具與 JSON。

• 新增:原生 Responses API 支援,以及針對 Codex 的特定適配;並繼續支援 OpenAI ChatCompletions 和 Anthropic 風格介面。模型 ID code>deepseek-v4-flash/code>。

• DeepSeek 報告的代理式/編碼能力成績:Terminal-Bench 2.1 82.7, Toolathlon(已驗證)70.3, Cybergym 76.7, DeepSWE 54.4, NL2Repo 54.2, DSBench-FullStack 68.7。

• 非常便宜:每 1M 個輸入/輸出 Token 約 $0.15 / $0.29,快取讀取約 $0.02(OrcaRouter,0% 加成)——大約是 V4 Pro 的 $0.44 / $0.88 的三分之一。只有 Flash API 有變動;Pro 與 App/網頁版則相同。

官方發布實際上升級了什麼

V4 Flash 最初於 2026 年 4 月 24 日以預覽版形式推出。2026 年 7 月 31 日的正式版本(即code>-0731/code> 版本,依據 DeepSeek 的 API 變更日誌)明確地並非全新架構:總參數與啟用參數(284B / 13B)以及 1M 上下文均維持不變。改變的是後訓練(post-training)——DeepSeek 表示,額外的微調顯著提升了核心代理(agentic)、程式編寫與工具呼叫能力。兩項實用的新增功能值得注意:V4 Flash 現在原生支援 Responses API,並特別針對 Codex 風格的編碼代理進行了適配,同時仍相容 OpenAI ChatCompletions 與 Anthropic 風格的介面。重要的是,本次發布僅升級了 Flash API;V4 Pro 與 DeepSeek 應用程式/網頁體驗均未變動。對團隊而言,這代表代理工作負載可在相同價格下直接獲得升級,無需遷移。

架構:為吞吐量打造的小型活躍 MoE

V4 Flash 是一個專家混合模型,總參數約 2840 億,但每個 token 僅有約 130 億個活躍參數。這個低活躍參數數量的重點在於:它讓推論快速且便宜,同時龐大的專家池保有品質。上下文視窗完整為 1,048,576 個 token(約 1M),最大輸出高達 384K,且模型支援推理(延伸思考)、工具呼叫和結構化 JSON。輸入僅限文字。設計目標——高吞吐量、低延遲、代理型工作——反映在服務數據上:在 OrcaRouter 的量測中,p50 首次輸出時間(time-to-first-token)約 394 毫秒,輸出速度約每秒 184 個 token。

基準測試:官方數據怎麼說

官方發布版高度倚重代理式與程式碼評測,並以DeepSeek自家的測試框架(minimal-mode / max-effort設定)執行。以下是如何解讀這些重點結果,所有數據均由DeepSeek報告:

• Terminal-Bench 2.1:82.7 — 在真實終端機中執行的代理式命令列/軟體任務。此處高分代表模型能真正操作工具與 shell,而不只是回答問題。

• {{1}}Toolathlon(已驗證):70.3{{/1}} 和 {{2}}Automation Bench(公開):25.1{{/2}} — 工具使用的廣度與可靠性,以及端到端自動化。工具呼叫的可靠性是代理成敗的關鍵特質。

• Cybergym:76.7 — 資安/CTF 風格的代理式問題解決。

• DeepSWE:54.4,NL2Repo:54.2,DSBench-FullStack:68.7,DSBench-Hard:59.6 —— 涵蓋軟體工程與全端程式設計,從儲存庫層級的程式碼生成到高難度的資料科學任務。DSBench-FullStack 的強勁表現(68.7)彰顯其實用的多檔案程式設計能力。

• Agent Last Exam: 25.2 —— 一項刻意設計得極其困難的智能體推理考驗,即使頂尖模型也得分偏低;可作為相對信號,而非絕對指標。

就獨立脈絡而言,Artificial Analysis(評估日期 2026-06-25,預覽版本)將 V4 Flash 評為約 56.2 AA Coding、40.3 AA Intelligence 與 50.0 AA Math——一個偏重程式設計的通用模型,高於開放模型的中位數。官方後續訓練的提升正是針對代理/程式設計軸線,因此可以預期較新的版本在這些任務上會表現得更強。一如往常,供應商測試框架的數據往往偏樂觀;請在您自己的工作負載上進行驗證。

定價:改變預算的數字

在 OrcaRouter 上,它以 0% 加成轉傳供應商定價,V4 Flash 的價格大約是每百萬輸入代幣 0.15 美元、每百萬輸出代幣 0.29 美元,快取讀取則約為 0.02 美元。而且 DeepSeek 在這次發行中維持低定價(升級未漲價)。這大約是 DeepSeek V4 Pro 的 0.44 / 0.88 美元定價的三分之一。以實際數字來說:每月 1000 萬代幣,以 70% 輸入 / 30% 輸出的比例拆分,在 V4 Flash 上大約只需要幾美元;擴展到 10 億代幣時,與旗艦模型的差距就會成為財務報表上的一筆項目。提示詞快取進一步降低了成本,對於使用穩定系統提示詞的代理和聊天應用來說,因為快取輸入的計費約為新輸入的十分之一。以同樣的低價提供更便宜的代理能力,就是這次發行的全部賣點。

Where V4 Flash fits: the DeepSeek V4 ladder

DeepSeek 的 V4 系列是一道階梯。V4 Pro 是旗艦款——一個體量大得多、頂級的推理與程式設計模型。V4 Flash 則是效率等級:實際運算量少得多、價格僅為其一小部分,而且在這次後訓練升級之後,具備了真正強大的智能體與程式設計能力。DeepSeek 投入資源讓 Flash 成為更好的智能體(Responses API、Codex 適配、工具使用基準測試),這說明了它預期流量會流向何處:日常的智能體與程式設計流量放在 Flash 上,最困難的推理則保留給 Pro。這呼應了整個業界「平價預設+高階旗艦」的模式——也正是為什麼按難度路由會勝過一律預設使用最大的模型。

三個現實世界場景

1. 編碼代理與 Codex 風格的工作流程

「-0731 版本的原生 Responses-API 與 Codex 支援,加上其 Terminal-Bench(82.7)與 DSBench-FullStack(68.7)的分數,使 V4 Flash 成為自主編碼代理的強大、低成本引擎——適用於問題修復、重構、測試生成與多步驟工具使用。」

2. 大量使用工具的代理

快速的首次 token 輸出(約 394 毫秒)、高吞吐量(約 184 tok/s)、100 萬的上下文長度,以及強大的 Toolathlon(70.3)可靠性,適合大規模呼叫工具的生產環境代理程式——涵蓋檢索、自動化與編排。

3. 預算有限下的長文件處理

完整的1M-token上下文和384K輸出,可一次處理摘要、分析或轉換極大型輸入——日誌、程式碼庫、長篇報告——且成本低廉。

如何存取 V4 Flash

您可以直接在 DeepSeek 的 API 上呼叫 V4 Flash(模型 ID code>deepseek-v4-flash/code>;它支援 Responses API、OpenAI ChatCompletions 與 Anthropic 風格的介面),或透過廠商中立的端點。a href="https://www.orcarouter.ai/">OrcaRouter/a> 透過單一 OpenAI 相容端點、以 0% 加價提供 V4 Flash(code>deepseek/deepseek-v4-flash/code>)與其他 185+ 個模型並列——因此您可以在同一處將它與 GPT-5.6 LunaGemini 3.6 Flash、GLM-5.2、Qwen 3.8 和 Kimi K3 進行基準比較,並將每個請求路由到成本最低的那個模型。由於它與 OpenAI 相容,採用 V4 Flash——或切換到其他模型——只是組態變更,而非重新整合。

限制與誠實的提醒

V4 Flash 是效率型模型,並非旗艦級:在最困難的推理任務上,它落後於 V4 Pro 和頂尖西方模型。輸入僅限文字(無原生影像輸入)。此處的基準分數為 DeepSeek 使用自家測試框架所報告,因此請將確切數字視為參考方向,並預期獨立評測結果會略低一些。再者,「每個 token 便宜」並不等於「每個任務便宜」,如果你讓推理或代理迴圈長時間運行——請在簡單呼叫中限制推理努力和工具迭代次數。在投入生產流量前,請先用自己的工作負載驗證。

常見問題

什麼是DeepSeek V4 Flash?

{{1}}DeepSeek V4 系列中的效率模型{{/1}}:{{2}}一個 {{KEEP}}284B / 13B-active{{/KEEP}} 混合專家模型{{/2}},{{3}}具備 1M token 的上下文,輸出最高達 384K{{/3}},{{4}}針對快速、高吞吐量的代理式與程式設計工作進行調校{{/4}}。{{5}}其官方版本(build -0731)於 2026 年 7 月 31 日發布{{/5}}。

官方發布中有什麼改變?

架構保持不變;這是一次訓練後的升級,大幅提升了代理(agentic)、程式編寫與工具呼叫能力,並新增了原生 Responses-API 支援及 Codex 適配。僅 Flash API 進行了升級 — V4 Pro 與應用程式/網頁版本保持不變。

V4 Flash 要多少錢?

在 OrcaRouter 上(0% 加成),每百萬個輸入 token 約 $0.15,每百萬個輸出 token 約 $0.29,快取讀取約 $0.02——約為 V4 Pro 的 $0.44 / $0.88 的三分之一。本次發布的定價維持在低價位。

V4 Flash 在代理型任務和編程任務方面的表現如何?

DeepSeek 報告了亮眼的分數:Terminal-Bench 2.1 82.7、Toolathlon(已驗證)70.3、Cybergym 76.7、DeepSWE 54.4、DSBench-FullStack 68.7——這些都是廠商自有的測試數據,因此請在自己的任務上進行驗證。

V4 Flash 與 V4 Pro 相比如何?

Pro 是規模更大的旗艦模型,專為最困難的推理與程式設計而生;Flash 則是以約三分之一的價格提供高效能等級,具備強大的代理式任務處理與程式設計能力。將困難任務交給 Pro,其餘一切交給 Flash。

上下文窗口?

完整的 1,048,576 個 token(約 1M),最多可輸出 384K 個 token。

V4 Flash 是多模態的嗎?

不——輸入僅限文字。它支援推理、工具呼叫和 JSON 輸出。

V4 Flash 是否與 Responses API 和 Codex 相容?

是的 — -0731 版本新增了原生 Responses-API 支援和特定的 Codex 適配,同時也提供 OpenAI ChatCompletions 與 Anthropic 風格介面。

我該如何使用V4 Flash?

直接透過 DeepSeek 的 API,或透過 OrcaRouter 的 OpenAI 相容端點,以 0% 加價(code>deepseek/deepseek-v4-flash/code>),您也可以在此比較並路由至競爭模型。

底線

DeepSeek V4 Flash 的正式發布延續了平價、快速的配方,並使其成為更優秀的代理模型:同樣採用 284B/13B 活躍參數的 MoE 架構和 1M 上下文,但經過後訓練以強化程式碼與工具使用能力,並原生支援 Responses-API 與 Codex——定價同樣約為 $0.15/$0.29。它不是旗艦模型,也不具備多模態能力,但對絕大多數的代理工作、程式碼撰寫與長文件處理而言,它是 2026 年每 token 性價比最高的選項之一。可以透過 OrcaRouter 這類 0% 加價、OpenAI 相容的端點試用,並將最困難的少數請求路由至旗艦模型——這種組合在成本上幾乎無可比擬。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube