
DeepSeek V4.1 Flash 定價:完整費率表,以及決定你帳單的快取命中數字
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
DeepSeek V4.1 Flash 自 2026-09-10 起全面開放使用,而截至今日,其公布的價目表是模型市場最高階層中最便宜的:每百萬輸入 token 為 0.15 美元、每百萬輸出 token 為 0.60 美元,快取命中則為每百萬 0.003 美元。這三個數字是離峰時段的欄位。在 DeepSeek 平日的尖峰時段,這三項費用全都會加倍,快取命中也不例外。真正要緊的比較對象,並不是 DeepSeek 自家日漸過時的旗艦機型——DeepSeek-V4-Pro-0813 的離峰定價為每百萬 0.66 / 1.98 美元,因此 Flash 在輸入價格上比自家兄弟便宜了大約 4 倍——而是買家實際用來比價的封閉式前沿層級:GPT-5.6 Sol、Claude Opus 5 與 Gemini 3.8 Flash,這三者每 token 的收費都高出一個數量級。
在進入數字之前,先做一處更正,因為這次發布之前的外洩消息至今仍在流傳。在 GA 之前散播的數字,聲稱降價會在「明天」上路。價格是真的;說法不是。V4.1 Flash 於 2026-09-10 推出時,這些費率已經生效,而 DeepSeek 自家的更新日誌也將這次降價記錄為該版本發布的一部分,而非日後的降價。以下所有內容均取自 DeepSeek 今天(2026-09-16)的即時定價頁面。
完整費率表,截至 2026-09-16
DeepSeek 發布一份涵蓋目前 SKU 的表,每個項目拆分為尖峰與離峰欄位。對於模型 ID deepseek-flash,其服務 DeepSeek-V4.1-Flash,公布的費率為:
• 輸入,快取未命中 — 離峰每 1M 個 token $0.15;尖峰每 1M 個 token $0.30
• 輸入,快取命中 — 離峰每 1M tokens $0.003;尖峰每 1M $0.006
• 輸出 — 離峰時段每 1M 個 token $0.60;尖峰時段每 1M 個 token $1.20
• 上下文窗口 — 100 萬個 token,最高輸出 384K
• 併發限制 — Flash SKU 上 2,500 個同時請求
• 舊版模型 ID — deepseek-v4-flash與deepseek-v4-flash-vision-exp已作為獨立產品退役,但仍會路由至 V4.1 Flash,並以 Flash 價格計費
前兩行之間的差距,就是這張表的全部重點。在離峰時段,快取命中的成本比快取未命中低 50 倍——也就是 98% 的折扣,而這也正是 Artificial Analysis 在其成本模型中的呈現方式。這張卡片上沒有其他項目能讓帳單變動到這種程度。


Peak 不是四捨五入的誤差,而且它是為北京計時的。
DeepSeek 的高峰時段為週一至週五 UTC 01:00–04:00 及 UTC 06:00–10:00。這些時段以外的所有時間——包括整個週末的所有時段——均以半價計費。加倍計費適用於全部三個計費項目,因此高峰時段的快取未命中費用為 $0.30,高峰輸出費用為 $1.20。
那些時段落在什麼時間,完全取決於你所在的位置。在北京,它們是 09:00–12:00 和 14:00–18:00——兩個工作區塊,而這正是重點。在柏林,九月時,第二個時段是 08:00–12:00 CEST:歐洲團隊的整個上午都是尖峰。在紐約,同樣的時段是 02:00–06:00 EDT。一個按正常工時運作的美國團隊,實際上永遠不會以尖峰費率計費;而歐洲團隊則每天早上、午餐前都得付雙倍。如果你正在選擇何時執行批次工作,這個決定每百萬個 token 就價值 $0.15,而且做出它不費分文。
快取命中定價實際上會如何影響代理帳單
在 DeepSeek 上,快取命中是自動的——文件說明磁碟快取對所有使用者預設啟用,無需修改任何程式碼——因此你不需要為了折扣而特別設計架構。這項機制也是盡力而為,並非保證:DeepSeek 表示沒有固定的 TTL,未使用的快取「通常在幾小時到幾天內」會被清除,且系統不承諾 100% 的命中率。在你根據這點建立任何模型之前,值得先閱讀回應中的prompt_cache_hit_tokens與prompt_cache_miss_tokens欄位。
算術比形容詞更重要。以一個擁有 40,000 個 token 穩定前綴的編碼代理為例——系統提示、工具結構定義、儲存庫上下文——執行為期 60 回合的工作階段,其中每一回合會附加約 2,000 個 token 的工具輸出,而模型會產生約 1,200 個 token。整個工作階段的總輸入為 5.94M 個 token,總輸出為 72,000 個 token。
完全未採用任何快取計費,離峰時段:5.94M 輸入以 $0.15 計算為 $0.891,加上 72,000 輸出以 $0.60 計算為 $0.043——約 $0.93(本次工作階段)。
在前綴已快取的情況下計費,而這正是預設的實際情形:那些輸入 token 中有 5.782M 個以快取命中計費,價格為 $0.003($0.017);158,000 個以快取未命中計費,價格為 $0.15($0.024);而相同的 72,000 個輸出 token 花費 $0.043。約 $0.084——大約便宜 11 倍。輸入占帳單的比例從 95% 降至 49%,光是快取部分就占 21%,而輸出 token 成為最大的單一項目。相同模型、相同工作階段、相同輸出——唯一改變的是前綴是否被重複使用。
注意 DeepSeek 價目表上沒有什麼:快取寫入這一項目。Anthropic 對填入 5 分鐘快取收取基礎輸入的 1.25 倍費用,一小時快取則收 2 倍;DeepSeek 的價目卡只列出命中與未命中,其快取指南也未描述任何寫入或儲存費用。如果你比較的是各廠商的快取經濟效益,而非表面的 token 費率,那麼這個缺席的項目,比 50 倍命中折扣所暗示的更有價值。
這也是為什麼OrcaRouter 上的 DeepSeek V4.1 Flash的直通計價細節在這裡很重要。我們以供應商自身的定價表費率計費,零加成,因此廠商價格變動會在當天即在我們這邊生效,而不必等待重新定價流程——而且你上方看到的快取命中與尖峰/離峰欄位,就是你實際被計費所依據的欄位,而不是它們的混合近似值。

與 DeepSeek-V4-Pro-0813 相比:4 倍的差距,以及一場並未發生的退役
最顯而易見的內部比較對象是旗艦 SKU,而實際情況並不像標題費率所暗示的那麼誇張。DeepSeek-V4-Pro-0813,模型 ID deepseek-v4-pro,在快取未命中時,每 100 萬輸入 token 定價為 $0.66,離峰時段每 100 萬輸出 token 為 $1.98,尖峰時段則加倍至 $1.32 與 $3.96。其快取命中在離峰時段為 $0.022——是 Flash 的 7 倍以上。
• 快取未命中輸入 — 離峰時段 $0.15 對比 $0.66,因此 Flash 便宜 4.4 倍
• 輸出 — 離峰時段 $0.60 對比 $1.98,因此 Flash 便宜 3.3 倍
• 快取命中輸入 — 離峰時段 $0.003 對比 $0.022,因此 Flash 便宜 7.3 倍
• 上下文與輸出上限 — 在兩款 SKU 上,於 1M 和 384K 時完全相同
• 併發 — Flash 上為 2,500,對比 V4 Pro 的 500,這 5 倍的差距在價目表上完全消失
關於這項比較,有三件事很容易搞錯。首先,就絕對金額而言,重複使用的效益在旗艦機型上更大,儘管 Flash 的倍率更高:快取一百萬個 token 在 V4 Pro 上可省下 $0.638,在 Flash 上則省下 $0.147,因為旗艦機型的未命中率原本就高出許多。其次,大家原本以為會消失的那個模型並沒有消失:DeepSeek 宣布將於 2026-09-14 停止供應 V4 Pro,並把這些請求導向 Flash,此舉引發開發者強烈反彈,認為這是在生產工作流程下偷換後端模型,而該公司已於 2026-09-11 撤回這項決定。V4 Pro 仍在供應,計費方式不變。第三,而這正是爆料報導踩進的陷阱——並沒有已發布的 V4.1 Pro。DeepSeek-V4-Pro-0813 仍是旗艦 SKU,而該廠商並未以那個名稱推出後繼產品。任何為遷移至「V4.1 Pro」估價的人,都是在為一個不存在的模型估價。
相較於封閉的前沿層級
面對買家真正會列入候選名單的封閉模型,乘數才是重點。以下所有數據均來自各供應商今日自家公布的定價頁面。
• GPT-5.6 Sol — 在 OpenAI 的短上下文層級中,列表價為每 1M 輸入 $5.00、每 1M 輸出 $30.00,目前正實施 $4.00 / $20.00 的促銷費率,OpenAI 表示此費率至少供應至 2026-11-21,而快取輸入為 $0.40。相較於促銷費率,DeepSeek V4.1 Flash 的輸入便宜 26.7 倍、輸出便宜 33.3 倍;相較於列表價,則為 33 倍與 50 倍。Sol 的快取命中成本是 Flash 的 133 倍。
• Claude Opus 5 — 在 Anthropic 公布的價目表上,每 100 萬個輸入 token 為 5.00 美元、每 100 萬個輸出 token 為 25.00 美元,快取命中則為每 100 萬個 0.50 美元。這相當於 Flash 輸入費率的 33 倍、輸出費率的 42 倍,以及快取命中費率的 167 倍。Anthropic 的 5 分鐘快取寫入還會在此之上再加收 1.25 倍;DeepSeek 的價目表則沒有對應的項目。
• Gemini 3.8 Flash — 每 100 萬輸入 token $0.75,每 100 萬輸出 token $3.75,優惠至 2026-12-31;兩項費率預計於 2027-01-01 翻倍,快取輸入為 $0.075,而且——這正是真實帳單上反覆出現的那一行——快取 儲存 每 100 萬個 token 每小時 $0.50。相較於它,Flash 的輸入便宜 5 倍、輸出便宜 6.25 倍,快取命中則便宜 25 倍,而 DeepSeek 保留快取不收費。
能力脈絡才是讓這一切保持誠實的關鍵。在 Artificial Analysis 的 Intelligence Index v4.3 上,DeepSeek V4.1 Flash(reasoning、max effort)得分 40,在 113 個模型中排名第 6,每項 index 任務為 $0.27,輸出速度為每秒 214.4 個 token。這是真正接近前沿的排名,而價格比它所被拿來比較的層級低 26 倍——但同一項測量顯示,它是 AA 測試過最冗長的模型之一,在整個 index 運行中產生 250M 個輸出 token,而中位數是 140M。冗長不會改變每 token 價格,卻會改變帳單。一個比中位數多寫 62% token 的模型,在這裡仍然便宜得多,但「每 token 便宜」和「每任務便宜」是不同的說法,而你實際支付的是後者。
有免費方案嗎?
不。DeepSeek 自家的定價頁面並未記載任何免費 API 級別、免費每月額度或免費模型——計費方式為按用量付費,扣抵已加值或已獲贈的餘額,且獲贈餘額會優先扣抵。消費者聊天應用程式是免費的;但deepseek-flash背後的 API 並非如此,DeepSeek 平台上也沒有該模型的免費端點。數家第三方閘道宣稱可免費或試用存取此模型,我們會將它們全數視為原型開發用的介面,而非正式生產環境的後端,因為這些條款可能未經通知即變更,且它們都不具備供應商自家的價目表。
價格背後的效率宣稱
這個價格並不是補貼,至少就 DeepSeek 自己的說法而言。該供應商的模型卡與技術報告將 V4.1 Flash 描述為一個 552B 參數的混合專家模型,採用因果編碼器-解碼器架構,在 prefill 階段每個 token 約啟動 8B 參數,在 decode 階段則為 16B——這種設計刻意不對稱,讀取成本低,寫入成本較高。在記憶體方面,DeepSeek 報告每 token 的全域 KV 快取約為 890 位元組,大約是 DeepSeek-V4-Flash 的四分之一,而在相同工作負載下,其常駐快取佔用量約為後者的八分之一;這是透過捨棄滑動視窗狀態,並在命中時重播最後 128 個 token 來達成。這些都是供應商在其自家硬體上回報的測量數據,而該技術報告並未聲稱重播路徑在數學上等同於完整運算。
參數量是本次發布中唯一真正懸而未決的數字,而箇中原因值得精確說明。DeepSeek 的說明文字報告為 552B,那是主幹——負責運算的部分。與之並列的是 Engram,一張條件式記憶查找表,模型卡標示為 196B 參數,透過詞元查找存取,而非經由計算得出。把兩者相加,你會得到接近 748B,這正是 r/LocalLLaMA 上一篇廣為閱讀的社群分析在權重釋出後數小時內所主張的數字,而 Hugging Face 儲存庫自家的檔案面板更把它推高至 763B。社群部署記述則將該檢查點計為約 510 GB、橫跨 48 個分片,原生以 FP8 稠密權重搭配 FP4 專家量化後發布。把總數視為有爭議,並把主幹數字視為廠商自報。活躍參數量是驅動速度的關鍵;常駐權重則決定模型究竟能否啟動。
在 MIT 授權下,自行架設是這個價格的真正替代方案。
權重位於 deepseek-ai/DeepSeek-V4.1-Flash,採用 MIT 授權,允許商業使用、修改與再散布。這使得 API 的價目表成為一種選擇,而非過路費:在 MIT 之下,授權條款中沒有任何內容阻止你自己部署這個模型,並改為支付算力費用,而非按權杖付費。
它並沒有讓這件事變得便宜。在快取與激活值之前,檢查點約有 510 GB 的常駐權重,DeepSeek 在整個儲存庫中都沒有提及任何 GPU 需求,而社群的部署實作文章則指出,實際的下限是多 GPU 節點,而非工作站。三個服務堆疊在 2026-09-10 推出首日支援——vLLM、搭配 Miles 的 SGLang,以及 Cambricon 為自家加速器打造的 vLLM 架構 NeuWare 改編版——但在發布當日,vLLM 和 SGLang 推出的是專用預覽映像檔,而非官方套件,且 llama.cpp 尚未合併 V4.1 架構支援。消費級硬體自架並不是當今 API 價格的替代方案;租用 8-GPU 節點才是。如果你的用量大到足以攤銷這筆成本,授權條款允許你這麼做;如果沒有,每百萬個 token 0.15 美元是更便宜的答案,而且差距相當懸殊。
費率卡實際上要你決定的是什麼
三件事,按它們能帶動多少錢的順序排列。維持穩定的提示前綴,讓快取發揮它的作用——它是自動的,是 50 倍的折扣,而且在 60 輪的代理迴圈中,能把一趟 $0.93 的工作階段變成 $0.084。把批次流量安排在平日的 UTC 01:00–04:00 與 06:00–10:00 之外執行,這對美國團隊來說等於沒差,對歐洲團隊則意味著把早上的工作挪到下午。而如果你是拿這個來跟 DeepSeek 自家的旗艦方案比價,請記住旗艦方案仍在優惠中——原定的下線時程已於 2026-09-11 取消,兩個 SKU 共用同一把金鑰,而兩者之間的切換只是改個 model-id,而不是一次遷移。
費率表沒告訴你的是,這個模型對你的工作負載而言是否夠好,而相關的數據比價目表更新、也更單薄。Artificial Analysis 的指數排名是在最高推理強度下的單次量測,供應商基準測試的各列數據由供應商自行提報,而參數量仍有爭議。價格是這次發布中已經塵埃落定的部分。就依它來規劃你的遷移成本,但在真正投入之前,先測試它的能力。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
