主視覺標題卡寫著「DeepSeek V4.1 Flash 對比 DeepSeek V4 Pro」,副標為「原定的交接,已於 2026-09-11 取消」,兩張卡片分別寫著「DeepSeek V4.1 Flash — AA Index 40,$0.15 / $0.60」與「DeepSeek V4 Pro 0813 — AA Index 36,$0.66 / $1.98」,頁尾則寫著「AA Index 資料來源為 Artificial Analysis;價格資料來源為 DeepSeek,離峰時段,每 100 萬個 token 計。」
Guides & Insights

DeepSeek V4.1 Flash 與 DeepSeek V4 Pro:DeepSeek 原定進行、隨後取消的交接

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 已於 2026-09-10 推出,而 DeepSeek V4 Pro 本來現在就該退場了。這項計畫在 Flash 發布前兩天宣布、並於發布當天定案,內容是:在 2026-09-14 北京時間 12:00,所有對 deepseek-v4-pro的請求都會默默重新路由到更新、更便宜的 deepseek-flash,並按 Flash 費率計費。DeepSeek 在開發者反對後於 2026-09-11 取消了這項計畫;到了 2026-09-14,截止時間已過,V4 Pro 仍舊上線,計費也維持不變。所以這不是一場發布比較——左邊的模型才八天大,右邊的模型則是一歲的旗艦,正處於全面可用(GA)的第四個月。這是在比較兩個模型,其開發商公布了基準測試,聲稱便宜的那個勝出,隨後卻發現使用者並不認同,於是讓步。這整個過程是這個月任何人針對這兩個模型所發布的最有用資訊,因為那正是你即將為自己做出的決定。

按順序,實際發生的事情

這裡的時間軸比任何單一基準都更重要,因為逆轉才是故事本身,而那項公告是刻意保持低調的。

2026-09-09 — DeepSeek 向使用者表示,在 V4.1 Pro 推出之前,V4 Pro 的請求將被導向 V4.1 Flash,並依 Flash 的費率計費。這項訊息傳達的是,Flash 在效能、成本、速度與任務完成時間上已全面超越 Pro。

2026-09-10 — DeepSeek V4.1 Flash 於應用程式、網頁與 API 正式推出(GA)。權重以 MIT 授權在 Hugging Face 上發布。API 模型名稱改為 deepseek-flash。前一代 deepseek-v4-flashdeepseek-v4-flash-vision-exp 直接退役,其舊有 ID 暫時會被路由至 V4.1 Flash。Pro 的關閉時間延後至 2026-09-14 北京時間 12:00(04:00 UTC)。

2026-09-11 — DeepSeek 政策逆轉。為回應使用者需求,該公司表示 V4 Pro API 服務在 2026-09-14 之後將繼續提供,計費方式維持不變,並取消自動切換至 V4.1 Flash 的安排。

2026-09-14 — 截止日期已過。V4 Pro 仍在離峰時段以每百萬個 token $0.66 / $1.98 提供服務。

這段歷程中的不對稱,正是整篇文章的重點。Flash 使用者無論願不願意都被遷移了——舊的 V4 Flash ID 現在會由不同的模型來回應。Pro 使用者則獲得暫緩,原因並不是 V4 Pro 的基準測試表現更好,而是生產系統早已針對它調校:提示詞、代理框架、評估工具鏈,以及可重現性的假設,這些都會因為後端替換而失效,即使呼叫端完全沒有改動任何程式碼。DeepSeek 的比較頁面至今仍將兩個模型並列展示,這告訴你該公司打算同時提供兩者。

並排:這兩個 SKU

以下所有內容除非另有註明來源,否則皆為 DeepSeek 自行發布的規格。價格以每百萬個 token 為單位,均為離峰價,括號內為尖峰費率——DeepSeek 的尖峰時段為 UTC 週一至週五 01:00 至 04:00,以及 06:00 至 10:00,其餘所有時段均為離峰,費率為尖峰的一半。

API 模型名稱deepseek-flash(DeepSeek-V4.1-Flash)與 deepseek-v4-proDeepSeek-V4-Pro-0813)。

輸入,快取未命中 — $0.15($0.30)對比 $0.66($1.32)。

輸入,快取命中 — $0.003($0.006)對比 $0.022($0.044)。

輸出 — $0.60($1.20)對比 $1.98($3.96)。

上下文 / 最大輸出 — 兩者皆為 1M tokens / 384K。完全相同。

圖像輸入 — Flash 原生支援;V4 Pro 則列為不支援。

並行限制 — Flash 為 2,500,V4 Pro 則為 500。

已報告參數 — Flash:總計 552B,為廠商提供的數字,但有具公信力的社群對此提出質疑(詳情見下文)。V4 Pro:總計 1.6T,約 49B 為活躍參數,Artificial Analysis 也列出此數字,vLLM 的 recipe 頁面亦予以確認。

每個 token 的啟動預算 — Flash 在設計上於預填充階段約啟動 8B,在解碼階段約啟動 16B,這正是其架構的重點;Pro 每個 token 約啟動 49B。

授權 — 兩者皆採用 MIT 開放權重。

GA 日期 — Flash 2026-09-10;V4 Pro 0813 2026-08-13,於四月預覽之後。

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

價差就是全部的論據

輸入在 Pro 上貴 4.4 倍。輸出是 3.3 倍。快取命中——在系統提示穩定的長時間代理執行中佔主導地位的那一層——是 7.3 倍。由於兩邊每一層的峰值都加倍,因此峰值時的比率完全相同;這個差距並非折扣造成的假象。

讓它跑一個工作負載。以一個程式設計代理為例,每個月處理 1,000 萬個輸入 token、快取命中率 70%,並產生 200 萬個輸出 token。在離峰時段使用 V4.1 Flash,費用會是 $0.45 的全新輸入、$0.021 的快取輸入,以及 $1.20 的輸出:$1.67。在離峰時段使用 V4 Pro,則是 $1.98、$0.154 和 $3.96:$6.09。大約是 3.6 倍,而且還是在一個刻意平淡無奇的工作負載上。

那是 DeepSeek 自家的價目表,而它正是你實際支付的價格在這裡:OrcaRouter 以 0% 加成將供應商的定價表原樣傳遞,因此 DeepSeek 的價格變動當天就會反映在我們這邊,而不是被重新包裝。兩個模型共用同一把金鑰,這對下方那個段落很重要——也就是關於測試一個你已經不必再做的遷移的那一節。

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

DeepSeek V4.1 Flash 真正勝出之處

Flash 最有力的證據並不是 DeepSeek 的基準測試表,而是 Artificial Analysis;它立場獨立,且資料直接讀取自其模型頁面。

Intelligence Index — Flash(推理,最高強度)得分 40,在 113 個模型中排名第 6。V4 Pro 0813(推理,最高強度)得分 36,排名第 7。同一個指數、相同的強度設定,相差四分,而且較便宜的模型還領先。

輸出速度 — 214.4 tokens/s 對比 94.4 tokens/s。這是 2.3 倍,而且是實測出來的,不是嘴上宣稱的。

首個 Token 時間 — 1.21 秒對比 1.74 秒。

DeepSWE v1.1 — Flash 在追蹤排行榜上拿下 74.2 分,排名第一,領先 GPT-6 Astra 的 74.10、Claude Opus 5 的 74.00 以及 Gemini 3.8 Flash 的 73.70。V4 Pro 0813 在同一項基準測試中的 62.7 分是 DeepSeek 自家公布的數字。榜首的差距僅 0.2 分,這算是平手,而非勝出——但領先 Pro 達 11.5 分的差距可不是平手。

服務效率 — Flash 的解碼器是從編碼器的最終隱藏狀態推導出其全域 KV,而非逐層重新計算,這正是產生非對稱的 8B 預填充/16B 解碼啟動值的原因。SemiAnalysis 的 InferenceX 剖析顯示,其 KV 快取約為每 token 890 位元組——大約是 V4 Flash 的四分之一——而持久性 KV 儲存更降至約八分之一。這就是價格之所以如此的原因,也是為什麼當 Pro 的上限為 500 時,該模型卻能支援 2,500 並行數。

視覺能力體現在實際提供的 API 上——而不只是存在於模型權重裡。DeepSeek 自家的定價頁面將圖像輸入列為 Flash 支援、V4 Pro 不支援,而 DeepSeek 也將其描述為首款具備原生多模態理解的旗艦模型。這是第一款讀取螢幕截圖無須另開端點的 DeepSeek 旗艦。

所有其他你會看到被引用的頭條數字——Terminal-Bench 2.1 的 90.6、GPQA Diamond 的 90.9、Codeforces 的 3471——都是 DeepSeek 自家公布的,我們並未重現,閱讀時應謹記這一點。

在哪些情況下 DeepSeek V4 Pro 仍是正確的選擇

經歷那樣的一週之後,很容易就會把 V4 Pro 判出局。但撤回的棄用聲明可不是這麼說的,規格表也不是這麼說的。

Pro 擁有 1.6T 總參數,每個 token 啟用約 49B,而 Flash 在解碼時則為 16B。無論那個指數怎麼說,每個 token 的容量都是實實在在的資源,而它真正顯現的工作負載是長時程的:數小時的代理執行、大規模重構、以及早期走錯一步就會賠上整條軌跡的任務。四點的指數差距衡量的是十項評估的平均值,而不是你分布曲線的尾部。

Pro 也是已知的確定因素。在四月預覽之後,它自 2026-08-13 起正式推出;而 0813 建置的效能來自後訓練,而非架構——參數量相同、形狀與預覽版相同,但行為不同。這意味著四個月的社群工具、已發表的代理框架、提示模式與失敗模式。Flash 正式推出才八天,其周遭生態系也相應單薄。如果你團隊的可靠性來自確切了解模型如何失敗,那麼 Pro 正是這些知識的所在。

而服務並未停止。DeepSeek 的承諾明確,其計費方式不變,權重採用 MIT,且V4 Pro 仍在我們的目錄中,維持相同的定價。取消的棄用計畫並非暫緩執行——而是表明 DeepSeek 打算繼續服務此層級。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

可以用來批評這兩個模型的三件事

護欄,因為這個決定一旦出錯,代價高昂。

參數量仍有爭議。552B 是 DeepSeek 公布的數字。一份可信的社群分析主張,釋出的 checkpoint 其實是 748B——552B 的 transformer 主幹加上約 196B 的 Engram 條件記憶表,後者是一種查詢結構,只在網路中的兩個位置被查閱,而非訊號流經的層。已發布的下載檔案為 510.3 GB,由 48 個 safetensors 分片組成,內含 FP8 稠密權重與 FP4 路由專家。兩個數字可以同時成立,端看是否把檢索與運算分開計算。請將 552B 視為廠商自報數據,並在規劃部署前先確認磁碟佔用量。

排行榜分數是一道篩選門檻,不是一紙保證。DeepSWE v1.1 的 74.2 是測試框架(harness)的基準分數。EyesTech Systems Lab 自行發布的一份稽核聲稱,這些 Flash 級分數一旦移轉到隔離的真實世界多檔案儲存庫,就會崩落——讓 DeepSeek V4.1 Flash 在 SWE-bench Pro 上只有 31.4%,對比掛頭牌的 74.2%,跌幅大於該報告自身比較中的前沿模型。那份稽核並不獨立——作者販售的工具,正是用來偵測他所描述的那種 harness 濫用——而我們也沒看到任何人複現過它。但這仍是正確的態度:在你遷移之前,先在自己的儲存庫上驗證。

冗長是一項成本項目。Artificial Analysis 在其 Intelligence Index 測試中測得 V4.1 Flash 產生了 2.5 億個輸出 token,而可比的開放權重模型中位數為 1.4 億,並稱其極為冗長。在這張價格表中,輸出是昂貴的方向,因此一個會把思考過程說出來的模型,會蠶食自身的節省。在推理密集型工作負載上,編列預算時要考量 token 數量,而不只是 token 價格。

還有一件事,講明白一點,免得有人照著謠言做規劃:DeepSeek V4.1 Pro 尚未發布。那項已取消的移轉被包裝成「在 V4.1 Pro 推出之前」的權宜之計,而這一點絲毫沒有改變。

如果,就選擇 DeepSeek V4.1 Flash

• 您的工作負載屬於高流量、延遲敏感或成本受限——分類、擷取、路由、摘要、聊天、大多數程式碼生成。

• 你需要在與文字相同的端點上進行圖像輸入。這是首款 DeepSeek 旗艦模型,能做到這點只需一次呼叫,而非另一個模型。

• 你的提示詞可以快取。快取命中時達 7.3 倍,而落差最大的地方,正是代理流量最集中的所在,且穩定的系統提示詞往往占了長時間執行的大部分輸入。

• 你這週從零開始,沒有針對特定模型習性調校過的測試框架。沒有什麼需要保護的。

• 你想要更高的併發上限。2,500 對上 500,這代表在你開始排隊等待之前,能推送的吞吐量差了五倍。

選擇 DeepSeek V4 Pro,如果

• 你的生產環境已經針對它調校好了。這個反轉意味著你有時間——用它來測試,而不是迴避這個問題。

• 你的任務是長期且失敗代價高昂的,而你已經實測出,在你的資料上、而非排行榜上,每 token 約 49B 的活躍參數能為你帶來一些 Flash 的 16B 所沒有的東西。

• 你需要可預測、純文字的行為,且沒有需要推理的視覺路徑,或者你的評估基準會因研究中途更換模型而失效。

• 你的存取模式屬於低流量、高風險型,在這種情況下,小額帳單上的 3.6 倍並非決定性因素。

如果你已經在 DeepSeek V4 Pro 上建構

在 2026 年 9 月 11 日改變的一件有用的事是,你的遷移不再是一個截止期限,而變成了一個決定。這對你來說絕對更好,對你的收件匣來說絕對更糟,因為這個決定仍然必須做出,而現在沒有人會替你做了。

先從定價開始。3.3–4.4 倍的差距,就是你正白白放棄的金額,而上面的計算範例能在大約一分鐘內把它換算成每月數字。接著,用唯一真正算數的方式測試:把一部分正式環境流量鏡像到 Flash,讓 Pro 留在主要路徑上,並在你自己的任務上比對輸出。由於兩個模型都使用同一組金鑰、以供應商牌價回應,並具備自動容錯移轉,那場影子執行是 一項路由變更,而不是第二次整合,而且路由器可以把請求容錯移轉回 Pro,無須由你撰寫備援邏輯。團隊把 token 浪費在他們根本沒要求的遷移上,正是路由層最初存在的原因。

不要假設 Flash 可以直接替換。它是一種不同的架構——具非對稱激活的 40 層因果編碼器–解碼器——而且在推理時更為冗長。提示詞層級的行為無論哪個方向都無法順利移植,因此要用輸出衡量遷移,而不是用指標。

看什麼

有三件事會決定這個組合在一個月後看起來如何。第一,V4.1 Pro 是否會推出,並恢復真正存在的 Pro 層級——那整場被取消的遷移明確就是為它而設的權宜之計,因此 DeepSeek 的產品藍圖上仍留著一個旗艦級的空缺。第二,這道暫緩令能否挺過 DeepSeek 的下一次價格調整;一間曾經願意安排一次無聲改道的公司,學到的是它不能這麼做,而不是它不該這麼做。第三,DeepSeek 以外是否有人能在未經修改的程式碼庫上重現 Flash 的基準測試數據,而這是唯一能終結整場比較所繫的效率與容量之爭的結果。在那之前,誠實的立場正是這次政策逆轉本身所暗示的:對任何新東西而言,Flash 是更好的預設選擇;對任何已經建成的東西而言,Pro 是更好的賭注;而 DeepSeek 才剛告訴你,它會同時服務兩者,讓你去弄清楚自己屬於哪一種。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新