主視覺標題卡:DeepSeek V4.1 Flash 對決 DeepSeek V4 Pro — 同一廠商,不同世代
Guides & Insights

DeepSeek V4.1 Flash 對比 DeepSeek V4 Pro:同一供應商,不同世代

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

有趣的地方在於,把 DeepSeek V4.1 Flash與 DeepSeek V4 Pro放在一起比較,較新的模型並不是較大的那一個。DeepSeek V4 Pro 是擁有 1.6 兆參數的混合專家模型,其中啟用參數為 490 億,而且仍在提供服務。DeepSeek V4.1 Flash 是擁有 5,520 億參數的 MoE,輸入時啟用 80 億參數,輸出時啟用 160 億參數,而它正是 DeepSeek 打造來取代前者的模型。兩者都列在同一家供應商的價目表上,兩者都支援一百萬個 token 的上下文,且兩者都以 MIT 授權發布。在兩者之間做選擇,並不是規模大小的問題,而是你想為什麼樣的架構付費,而答案在 2026 年 9 月 10 日改變了。

實際上差異在哪裡,並排比較

• 參數 — V4.1 Flash 總參數 552B/輸入時 8B 活躍、輸出時 16B 活躍,對比 V4 Pro 總參數 1.6T/49B 活躍。V4 Pro 的總參數量大約是它的三倍,輸入端的活躍數量則是它的六倍。

• 架構 —— V4.1 Flash 是因果編碼器-解碼器(Causal Encoder-Decoder),相較於 V4 Pro 先前的設計,是全新的基礎架構。這是兩者之間的實質差異,也是「.1」並非小版本更新的原因。

• 每 100 萬個 token 的價格 — V4.1 Flash 離峰時段輸入 $0.15 / 輸出 $0.60,相較之下 V4 Pro 為輸入 $0.66 / 輸出 $1.98,資料來源為 OrcaRouter 的價目表。

• 快取輸入 — V4.1 Flash 每 1M $0.003,對比 V4 Pro 每 1M $0.024。

• 每個 token 的 KV 快取 —— V4.1 Flash 為 890 位元組,對比 V4 Pro 更大的佔用量。在百萬 token 的上下文規模下,這正是決定冗長 agent 逐字稿能否常駐記憶體的關鍵細項。

• 上下文與輸出 —— 兩者皆為 1M 上下文與 384K 最大輸出。打成平手。

• 觀察到的首個 token 延遲 — V4.1 Flash 中位數(p50)為 2.63 秒,對比 V4 Pro 中位數(p50)為 3.58 秒,資料來自 OrcaRouter 的 7 天遙測數據,其中 V4 Pro 的 p95 為 10.00 秒。

• 輸入模態 — 在相同的房源資料上,V4.1 Flash 可接受文字與圖片,而 V4 Pro 則僅限文字輸入與文字輸出。這款較新的模型在輸入方面是兩者中涵蓋更廣的,成本也更低。

撇開廠商的包裝來讀這份清單,會發現模式並不尋常。後繼產品在每一項上都更便宜、首個 token 更快、輸入更廣,而且在每一項上都更小。這就是真正的架構變革落地時的樣子,也是為什麼「哪個更好」在這裡有一個簡短答案,而底下還有一個更長的答案。

Two-column scoreboard: DeepSeek V4.1 Flash vs DeepSeek V4 Pro — total parameters 552B vs 1.6T, active parameters 8B input and 16B output vs 49B, architecture Causal Encoder-Decoder vs an earlier design, price per 1M tokens $0.15 input and $0.60 output vs $0.66 and $1.98, max output 384K tokens vs 384K tokens, and release date 2026-09-10 vs still served and not retired

V4 Pro 的時程,因為這對任何仍在使用它的人來說都很重要

DeepSeek V4 Pro 原定即將退役。API 原訂於 2026 年 9 月 14 日北京時間 12:00 關閉,並將流量導向 V4.1 Flash。但這件事並未發生。9 月 11 日,供應商推翻了該決定,表示:「因應用戶需求,我們決定在 2026 年 9 月 14 日之後繼續為 DeepSeek V4 Pro 提供 API 服務,計費方式維持不變。」

由此可得出兩件事,而這兩者都值得精確以對,因為這種情況容易引人過度解讀。

第一點是,V4 Pro 並未被棄用。它仍是受支援的模型,價格維持不變,而且 DeepSeek 自家的通知正是將現有 V4 Pro 流量導向的那個模型。如果你的生產路徑已鎖定使用它,並沒有任何東西被移除。

第二點是,DeepSeek V4.1 Pro 並不存在。該退役通知提到 V4 Pro 的流量將由 V4.1 Flash 承接,「直到 V4.1-Pro 推出為止」,這引發了外界對其更大規模兄弟型號的若干揣測。截至 2026 年 9 月 22 日,並沒有 V4.1 Pro API、沒有模型卡、沒有權重,也沒有任何公告。2026 年 9 月 21 日的一篇報導指出,一款擁有 2 兆參數的模型預計於 10 月中下旬問世,但這僅是關於一款未發表產品的單一消息來源說法,應以此標準看待。任何依據 V4.1 Pro 推出時程來規劃容量的人,都是在依據一則謠言做規劃。

實際上該呼叫哪一個

遷移的理由很直接,而這正是 DeepSeek 自己透過將 V4 Pro 流量導向新模型所做的選擇。就上述數字而言,V4.1 Flash 更便宜、首個 token 更快、穩定狀態下也更快,且每個 token 的 KV 快取更小。如果你的工作負載是 V4 Pro 的工作負載,而且不是在執行只有 49B 活躍參數才能做到的事,那麼在成本與延遲方面,較新的模型是更好的工具,沒有取捨需要權衡。

支持繼續使用 V4 Pro 的論據,在於遠更大的活躍參數量能在困難推理與長時程代理式工作上為你帶來什麼,而這個論據必須靠你自己的評估來提出,而不是靠規格表。原因在於,這兩個模型並未在共同的公開排行榜上,以能將它們獨立區隔開來的方式進行比較:DeepSeek V4.1 Flash 出現在 2026 年 9 月 21 日的 Agents on Rails 評測中,在最大努力設定下為 17%,而 V4 Pro 不在該排行榜上。沒有可直接指出的正面對決數字。存在的只是來自架構的合理論證——六倍的活躍參數代表很大一筆要放棄的容量——而這是論證,不是測量。

給任何在兩者之間轉移流量的人的兩點實用提醒。首先,尖峰時段排程適用於這兩個模型,因此在一天中錯誤的時間進行成本比較,結果會差上兩倍;尖峰時段是平日的 UTC 01:00–04:00 和 06:00–10:00,而週末則完全屬於離峰。其次,這兩個模型共用相同的上下文視窗與輸出上限,因此遷移不會改變你的提示預算——這使得在應用端切換的風險異常低。

將兩者都透過同一個端點執行

你確實兩者都想要的情況,就是過渡期,而這比聽起來更常見:一個團隊想移轉到 V4.1 Flash,但有一條管線在新架構上的行為尚未驗證。透過不同供應商讓兩者並行運作,代表要為一個在模型層級上其實是同一家供應商的東西,簽兩份合約並管理兩套金鑰。

兩者都在 OrcaRouter 上、共用同一把金鑰,這就讓整件事簡化為一個路由決策。OrcaRouter 以 0% 加價原樣轉嫁供應商定價,所以上面的數字是 DeepSeek 自己的費率,而不是我們的;而 DeepSeek 的尖峰與離峰時段排程完全依照 DeepSeek 的定義套用——包括過渡期間的價格變動,這在我們這邊同日上線。你可以把一小部分流量導向新模型並比較輸出,或依任務類型路由,並在新路徑後面加上自動容錯移轉,這樣一來,如果 V4.1 Flash 在你的資料上出現意料之外的行為,請求會落到 V4 Pro,而不是錯誤頁面。

既然供應商對於這些模型中哪一款即將退場,已經改變過一次心意,那麼把兩者都保留在同一個整合之下、皆可存取,就是那個不需要你去預測下一次反覆的選項。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, showing the model id with a flagship badge, 1M-token context, 384K max output, text input and text output, $0.66 input and $1.98 output per 1M tokens, a cache rate of $0.024, and observed time to first token of 3.58 s at p50 and 10.00 s at p95

看什麼

• V4 Pro 的價格或退役狀態是否會再次變動。九月的逆轉已明確表示計費維持不變,而這正是應該要求供應商遵守的承諾。

• V4.1 Pro 是否會成真。在出現模型卡或權重釋出之前,2T 參數的說法只是僅有一個來源的謠言。

• 一項獨立評估,讓兩個模型在同一套評測基準上運行。在這種評估出現之前,這兩者之間誠實的比較,就是成本、延遲與架構——這些是可量測的——再加上對能力的合理推測,而後者並非可量測的。

在第三項出現之前,準確的總結是:DeepSeek V4.1 Flash 是 DeepSeek V4 Pro 更便宜、更快的後繼者,V4 Pro 仍以不變的價格繼續支援,而較新的架構是否犧牲了能力,這個問題目前沒有任何公開基準測試能回答。

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新