
DeepSeek V4.1 Flash 與 DeepSeek V4 Pro:DeepSeek 原定進行、隨後取消的交接
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
DeepSeek V4.1 Flash 已於 2026-09-10 推出,而 DeepSeek V4 Pro 本來現在就該退場了。這項計畫在 Flash 發布前兩天宣布、並於發布當天定案,內容是:在 2026-09-14 北京時間 12:00,所有對 deepseek-v4-pro的請求都會默默重新路由到更新、更便宜的 deepseek-flash,並按 Flash 費率計費。DeepSeek 在開發者反對後於 2026-09-11 取消了這項計畫;到了 2026-09-14,截止時間已過,V4 Pro 仍舊上線,計費也維持不變。所以這不是一場發布比較——左邊的模型才八天大,右邊的模型則是一歲的旗艦,正處於全面可用(GA)的第四個月。這是在比較兩個模型,其開發商公布了基準測試,聲稱便宜的那個勝出,隨後卻發現使用者並不認同,於是讓步。這整個過程是這個月任何人針對這兩個模型所發布的最有用資訊,因為那正是你即將為自己做出的決定。
按順序,實際發生的事情
這裡的時間軸比任何單一基準都更重要,因為逆轉才是故事本身,而那項公告是刻意保持低調的。
• 2026-09-09 — DeepSeek 向使用者表示,在 V4.1 Pro 推出之前,V4 Pro 的請求將被導向 V4.1 Flash,並依 Flash 的費率計費。這項訊息傳達的是,Flash 在效能、成本、速度與任務完成時間上已全面超越 Pro。
• 2026-09-10 — DeepSeek V4.1 Flash 於應用程式、網頁與 API 正式推出(GA)。權重以 MIT 授權在 Hugging Face 上發布。API 模型名稱改為 deepseek-flash。前一代 deepseek-v4-flash 與 deepseek-v4-flash-vision-exp 直接退役,其舊有 ID 暫時會被路由至 V4.1 Flash。Pro 的關閉時間延後至 2026-09-14 北京時間 12:00(04:00 UTC)。
• 2026-09-11 — DeepSeek 政策逆轉。為回應使用者需求,該公司表示 V4 Pro API 服務在 2026-09-14 之後將繼續提供,計費方式維持不變,並取消自動切換至 V4.1 Flash 的安排。
• 2026-09-14 — 截止日期已過。V4 Pro 仍在離峰時段以每百萬個 token $0.66 / $1.98 提供服務。
這段歷程中的不對稱,正是整篇文章的重點。Flash 使用者無論願不願意都被遷移了——舊的 V4 Flash ID 現在會由不同的模型來回應。Pro 使用者則獲得暫緩,原因並不是 V4 Pro 的基準測試表現更好,而是生產系統早已針對它調校:提示詞、代理框架、評估工具鏈,以及可重現性的假設,這些都會因為後端替換而失效,即使呼叫端完全沒有改動任何程式碼。DeepSeek 的比較頁面至今仍將兩個模型並列展示,這告訴你該公司打算同時提供兩者。
並排:這兩個 SKU
以下所有內容除非另有註明來源,否則皆為 DeepSeek 自行發布的規格。價格以每百萬個 token 為單位,均為離峰價,括號內為尖峰費率——DeepSeek 的尖峰時段為 UTC 週一至週五 01:00 至 04:00,以及 06:00 至 10:00,其餘所有時段均為離峰,費率為尖峰的一半。
• API 模型名稱 — deepseek-flash(DeepSeek-V4.1-Flash)與 deepseek-v4-pro(DeepSeek-V4-Pro-0813)。
• 輸入,快取未命中 — $0.15($0.30)對比 $0.66($1.32)。
• 輸入,快取命中 — $0.003($0.006)對比 $0.022($0.044)。
• 輸出 — $0.60($1.20)對比 $1.98($3.96)。
• 上下文 / 最大輸出 — 兩者皆為 1M tokens / 384K。完全相同。
• 圖像輸入 — Flash 原生支援;V4 Pro 則列為不支援。
• 並行限制 — Flash 為 2,500,V4 Pro 則為 500。
• 已報告參數 — Flash:總計 552B,為廠商提供的數字,但有具公信力的社群對此提出質疑(詳情見下文)。V4 Pro:總計 1.6T,約 49B 為活躍參數,Artificial Analysis 也列出此數字,vLLM 的 recipe 頁面亦予以確認。
• 每個 token 的啟動預算 — Flash 在設計上於預填充階段約啟動 8B,在解碼階段約啟動 16B,這正是其架構的重點;Pro 每個 token 約啟動 49B。
• 授權 — 兩者皆採用 MIT 開放權重。
• GA 日期 — Flash 2026-09-10;V4 Pro 0813 2026-08-13,於四月預覽之後。

價差就是全部的論據
輸入在 Pro 上貴 4.4 倍。輸出是 3.3 倍。快取命中——在系統提示穩定的長時間代理執行中佔主導地位的那一層——是 7.3 倍。由於兩邊每一層的峰值都加倍,因此峰值時的比率完全相同;這個差距並非折扣造成的假象。
讓它跑一個工作負載。以一個程式設計代理為例,每個月處理 1,000 萬個輸入 token、快取命中率 70%,並產生 200 萬個輸出 token。在離峰時段使用 V4.1 Flash,費用會是 $0.45 的全新輸入、$0.021 的快取輸入,以及 $1.20 的輸出:$1.67。在離峰時段使用 V4 Pro,則是 $1.98、$0.154 和 $3.96:$6.09。大約是 3.6 倍,而且還是在一個刻意平淡無奇的工作負載上。
那是 DeepSeek 自家的價目表,而它正是你實際支付的價格在這裡:OrcaRouter 以 0% 加成將供應商的定價表原樣傳遞,因此 DeepSeek 的價格變動當天就會反映在我們這邊,而不是被重新包裝。兩個模型共用同一把金鑰,這對下方那個段落很重要——也就是關於測試一個你已經不必再做的遷移的那一節。

DeepSeek V4.1 Flash 真正勝出之處
Flash 最有力的證據並不是 DeepSeek 的基準測試表,而是 Artificial Analysis;它立場獨立,且資料直接讀取自其模型頁面。
• Intelligence Index — Flash(推理,最高強度)得分 40,在 113 個模型中排名第 6。V4 Pro 0813(推理,最高強度)得分 36,排名第 7。同一個指數、相同的強度設定,相差四分,而且較便宜的模型還領先。
• 輸出速度 — 214.4 tokens/s 對比 94.4 tokens/s。這是 2.3 倍,而且是實測出來的,不是嘴上宣稱的。
• 首個 Token 時間 — 1.21 秒對比 1.74 秒。
• DeepSWE v1.1 — Flash 在追蹤排行榜上拿下 74.2 分,排名第一,領先 GPT-6 Astra 的 74.10、Claude Opus 5 的 74.00 以及 Gemini 3.8 Flash 的 73.70。V4 Pro 0813 在同一項基準測試中的 62.7 分是 DeepSeek 自家公布的數字。榜首的差距僅 0.2 分,這算是平手,而非勝出——但領先 Pro 達 11.5 分的差距可不是平手。
• 服務效率 — Flash 的解碼器是從編碼器的最終隱藏狀態推導出其全域 KV,而非逐層重新計算,這正是產生非對稱的 8B 預填充/16B 解碼啟動值的原因。SemiAnalysis 的 InferenceX 剖析顯示,其 KV 快取約為每 token 890 位元組——大約是 V4 Flash 的四分之一——而持久性 KV 儲存更降至約八分之一。這就是價格之所以如此的原因,也是為什麼當 Pro 的上限為 500 時,該模型卻能支援 2,500 並行數。
• 視覺能力體現在實際提供的 API 上——而不只是存在於模型權重裡。DeepSeek 自家的定價頁面將圖像輸入列為 Flash 支援、V4 Pro 不支援,而 DeepSeek 也將其描述為首款具備原生多模態理解的旗艦模型。這是第一款讀取螢幕截圖無須另開端點的 DeepSeek 旗艦。
所有其他你會看到被引用的頭條數字——Terminal-Bench 2.1 的 90.6、GPQA Diamond 的 90.9、Codeforces 的 3471——都是 DeepSeek 自家公布的,我們並未重現,閱讀時應謹記這一點。
在哪些情況下 DeepSeek V4 Pro 仍是正確的選擇
經歷那樣的一週之後,很容易就會把 V4 Pro 判出局。但撤回的棄用聲明可不是這麼說的,規格表也不是這麼說的。
Pro 擁有 1.6T 總參數,每個 token 啟用約 49B,而 Flash 在解碼時則為 16B。無論那個指數怎麼說,每個 token 的容量都是實實在在的資源,而它真正顯現的工作負載是長時程的:數小時的代理執行、大規模重構、以及早期走錯一步就會賠上整條軌跡的任務。四點的指數差距衡量的是十項評估的平均值,而不是你分布曲線的尾部。
Pro 也是已知的確定因素。在四月預覽之後,它自 2026-08-13 起正式推出;而 0813 建置的效能來自後訓練,而非架構——參數量相同、形狀與預覽版相同,但行為不同。這意味著四個月的社群工具、已發表的代理框架、提示模式與失敗模式。Flash 正式推出才八天,其周遭生態系也相應單薄。如果你團隊的可靠性來自確切了解模型如何失敗,那麼 Pro 正是這些知識的所在。
而服務並未停止。DeepSeek 的承諾明確,其計費方式不變,權重採用 MIT,且V4 Pro 仍在我們的目錄中,維持相同的定價。取消的棄用計畫並非暫緩執行——而是表明 DeepSeek 打算繼續服務此層級。

可以用來批評這兩個模型的三件事
護欄,因為這個決定一旦出錯,代價高昂。
• 參數量仍有爭議。552B 是 DeepSeek 公布的數字。一份可信的社群分析主張,釋出的 checkpoint 其實是 748B——552B 的 transformer 主幹加上約 196B 的 Engram 條件記憶表,後者是一種查詢結構,只在網路中的兩個位置被查閱,而非訊號流經的層。已發布的下載檔案為 510.3 GB,由 48 個 safetensors 分片組成,內含 FP8 稠密權重與 FP4 路由專家。兩個數字可以同時成立,端看是否把檢索與運算分開計算。請將 552B 視為廠商自報數據,並在規劃部署前先確認磁碟佔用量。
• 排行榜分數是一道篩選門檻,不是一紙保證。DeepSWE v1.1 的 74.2 是測試框架(harness)的基準分數。EyesTech Systems Lab 自行發布的一份稽核聲稱,這些 Flash 級分數一旦移轉到隔離的真實世界多檔案儲存庫,就會崩落——讓 DeepSeek V4.1 Flash 在 SWE-bench Pro 上只有 31.4%,對比掛頭牌的 74.2%,跌幅大於該報告自身比較中的前沿模型。那份稽核並不獨立——作者販售的工具,正是用來偵測他所描述的那種 harness 濫用——而我們也沒看到任何人複現過它。但這仍是正確的態度:在你遷移之前,先在自己的儲存庫上驗證。
• 冗長是一項成本項目。Artificial Analysis 在其 Intelligence Index 測試中測得 V4.1 Flash 產生了 2.5 億個輸出 token,而可比的開放權重模型中位數為 1.4 億,並稱其極為冗長。在這張價格表中,輸出是昂貴的方向,因此一個會把思考過程說出來的模型,會蠶食自身的節省。在推理密集型工作負載上,編列預算時要考量 token 數量,而不只是 token 價格。
還有一件事,講明白一點,免得有人照著謠言做規劃:DeepSeek V4.1 Pro 尚未發布。那項已取消的移轉被包裝成「在 V4.1 Pro 推出之前」的權宜之計,而這一點絲毫沒有改變。
如果,就選擇 DeepSeek V4.1 Flash
• 您的工作負載屬於高流量、延遲敏感或成本受限——分類、擷取、路由、摘要、聊天、大多數程式碼生成。
• 你需要在與文字相同的端點上進行圖像輸入。這是首款 DeepSeek 旗艦模型,能做到這點只需一次呼叫,而非另一個模型。
• 你的提示詞可以快取。快取命中時達 7.3 倍,而落差最大的地方,正是代理流量最集中的所在,且穩定的系統提示詞往往占了長時間執行的大部分輸入。
• 你這週從零開始,沒有針對特定模型習性調校過的測試框架。沒有什麼需要保護的。
• 你想要更高的併發上限。2,500 對上 500,這代表在你開始排隊等待之前,能推送的吞吐量差了五倍。
選擇 DeepSeek V4 Pro,如果
• 你的生產環境已經針對它調校好了。這個反轉意味著你有時間——用它來測試,而不是迴避這個問題。
• 你的任務是長期且失敗代價高昂的,而你已經實測出,在你的資料上、而非排行榜上,每 token 約 49B 的活躍參數能為你帶來一些 Flash 的 16B 所沒有的東西。
• 你需要可預測、純文字的行為,且沒有需要推理的視覺路徑,或者你的評估基準會因研究中途更換模型而失效。
• 你的存取模式屬於低流量、高風險型,在這種情況下,小額帳單上的 3.6 倍並非決定性因素。
如果你已經在 DeepSeek V4 Pro 上建構
在 2026 年 9 月 11 日改變的一件有用的事是,你的遷移不再是一個截止期限,而變成了一個決定。這對你來說絕對更好,對你的收件匣來說絕對更糟,因為這個決定仍然必須做出,而現在沒有人會替你做了。
先從定價開始。3.3–4.4 倍的差距,就是你正白白放棄的金額,而上面的計算範例能在大約一分鐘內把它換算成每月數字。接著,用唯一真正算數的方式測試:把一部分正式環境流量鏡像到 Flash,讓 Pro 留在主要路徑上,並在你自己的任務上比對輸出。由於兩個模型都使用同一組金鑰、以供應商牌價回應,並具備自動容錯移轉,那場影子執行是 一項路由變更,而不是第二次整合,而且路由器可以把請求容錯移轉回 Pro,無須由你撰寫備援邏輯。團隊把 token 浪費在他們根本沒要求的遷移上,正是路由層最初存在的原因。
不要假設 Flash 可以直接替換。它是一種不同的架構——具非對稱激活的 40 層因果編碼器–解碼器——而且在推理時更為冗長。提示詞層級的行為無論哪個方向都無法順利移植,因此要用輸出衡量遷移,而不是用指標。
看什麼
有三件事會決定這個組合在一個月後看起來如何。第一,V4.1 Pro 是否會推出,並恢復真正存在的 Pro 層級——那整場被取消的遷移明確就是為它而設的權宜之計,因此 DeepSeek 的產品藍圖上仍留著一個旗艦級的空缺。第二,這道暫緩令能否挺過 DeepSeek 的下一次價格調整;一間曾經願意安排一次無聲改道的公司,學到的是它不能這麼做,而不是它不該這麼做。第三,DeepSeek 以外是否有人能在未經修改的程式碼庫上重現 Flash 的基準測試數據,而這是唯一能終結整場比較所繫的效率與容量之爭的結果。在那之前,誠實的立場正是這次政策逆轉本身所暗示的:對任何新東西而言,Flash 是更好的預設選擇;對任何已經建成的東西而言,Pro 是更好的賭注;而 DeepSeek 才剛告訴你,它會同時服務兩者,讓你去弄清楚自己屬於哪一種。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
