主視覺標題卡寫著「DeepSeek V4.1 Flash 定價」,並有一行「$0.15 輸入、$0.60 輸出、$0.003 快取命中」,圖說為「每 1M 個 token,離峰時段。尖峰時段所有費率加倍。」,另有三張卡片寫著「快取命中:比未命中便宜 50 倍」、「1M token 上下文」以及「開放權重,MIT 授權」。
Guides & Insights

DeepSeek V4.1 Flash 定價:完整費率表,以及決定你帳單的快取命中數字

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 自 2026-09-10 起全面開放使用,而截至今日,其公布的價目表是模型市場最高階層中最便宜的:每百萬輸入 token 為 0.15 美元、每百萬輸出 token 為 0.60 美元,快取命中則為每百萬 0.003 美元。這三個數字是離峰時段的欄位。在 DeepSeek 平日的尖峰時段,這三項費用全都會加倍,快取命中也不例外。真正要緊的比較對象,並不是 DeepSeek 自家日漸過時的旗艦機型——DeepSeek-V4-Pro-0813 的離峰定價為每百萬 0.66 / 1.98 美元,因此 Flash 在輸入價格上比自家兄弟便宜了大約 4 倍——而是買家實際用來比價的封閉式前沿層級:GPT-5.6 SolClaude Opus 5 與 Gemini 3.8 Flash,這三者每 token 的收費都高出一個數量級。

在進入數字之前,先做一處更正,因為這次發布之前的外洩消息至今仍在流傳。在 GA 之前散播的數字,聲稱降價會在「明天」上路。價格是真的;說法不是。V4.1 Flash 於 2026-09-10 推出時,這些費率已經生效,而 DeepSeek 自家的更新日誌也將這次降價記錄為該版本發布的一部分,而非日後的降價。以下所有內容均取自 DeepSeek 今天(2026-09-16)的即時定價頁面。

完整費率表,截至 2026-09-16

DeepSeek 發布一份涵蓋目前 SKU 的表,每個項目拆分為尖峰與離峰欄位。對於模型 ID deepseek-flash,其服務 DeepSeek-V4.1-Flash,公布的費率為:

輸入,快取未命中 — 離峰每 1M 個 token $0.15;尖峰每 1M 個 token $0.30

輸入,快取命中 — 離峰每 1M tokens $0.003;尖峰每 1M $0.006

輸出 — 離峰時段每 1M 個 token $0.60;尖峰時段每 1M 個 token $1.20

上下文窗口 — 100 萬個 token,最高輸出 384K

併發限制 — Flash SKU 上 2,500 個同時請求

舊版模型 IDdeepseek-v4-flashdeepseek-v4-flash-vision-exp已作為獨立產品退役,但仍會路由至 V4.1 Flash,並以 Flash 價格計費

前兩行之間的差距,就是這張表的全部重點。在離峰時段,快取命中的成本比快取未命中低 50 倍——也就是 98% 的折扣,而這也正是 Artificial Analysis 在其成本模型中的呈現方式。這張卡片上沒有其他項目能讓帳單變動到這種程度。

Single-column scoreboard card titled 'DeepSeek V4.1 Flash — the rate card, 2026-09-16', with rows reading 'Off-peak input: $0.15 / 1M tokens', 'Off-peak output: $0.60 / 1M tokens', 'Cache hit: $0.003 / 1M tokens', 'Peak hours: 2x every rate', 'Context window: 1M tokens' and 'Weights: MIT, open', over the footer 'All figures from DeepSeek's published API pricing page, 2026-09-16.'Screenshot of DeepSeek's own Models & Pricing page, showing the deepseek-flash and deepseek-v4-pro columns side by side under MODEL VERSION DeepSeek-V4.1-Flash and DeepSeek-V4-Pro-0813, with 1M context and 384K max output for both, Vision supported on Flash but not on V4 Pro, and the pricing block reading cache-hit input $0.003 off-peak / $0.006 peak against $0.022 / $0.044, cache-miss input $0.15 / $0.3 against $0.66 / $1.32, and output $0.6 / $1.2 against $1.98 / $3.96, above a concurrency limit row of 2500 and 500

Peak 不是四捨五入的誤差,而且它是為北京計時的。

DeepSeek 的高峰時段為週一至週五 UTC 01:00–04:00 及 UTC 06:00–10:00。這些時段以外的所有時間——包括整個週末的所有時段——均以半價計費。加倍計費適用於全部三個計費項目,因此高峰時段的快取未命中費用為 $0.30,高峰輸出費用為 $1.20。

那些時段落在什麼時間,完全取決於你所在的位置。在北京,它們是 09:00–12:00 和 14:00–18:00——兩個工作區塊,而這正是重點。在柏林,九月時,第二個時段是 08:00–12:00 CEST:歐洲團隊的整個上午都是尖峰。在紐約,同樣的時段是 02:00–06:00 EDT。一個按正常工時運作的美國團隊,實際上永遠不會以尖峰費率計費;而歐洲團隊則每天早上、午餐前都得付雙倍。如果你正在選擇何時執行批次工作,這個決定每百萬個 token 就價值 $0.15,而且做出它不費分文。

快取命中定價實際上會如何影響代理帳單

在 DeepSeek 上,快取命中是自動的——文件說明磁碟快取對所有使用者預設啟用,無需修改任何程式碼——因此你不需要為了折扣而特別設計架構。這項機制也是盡力而為,並非保證:DeepSeek 表示沒有固定的 TTL,未使用的快取「通常在幾小時到幾天內」會被清除,且系統不承諾 100% 的命中率。在你根據這點建立任何模型之前,值得先閱讀回應中的prompt_cache_hit_tokensprompt_cache_miss_tokens欄位。

算術比形容詞更重要。以一個擁有 40,000 個 token 穩定前綴的編碼代理為例——系統提示、工具結構定義、儲存庫上下文——執行為期 60 回合的工作階段,其中每一回合會附加約 2,000 個 token 的工具輸出,而模型會產生約 1,200 個 token。整個工作階段的總輸入為 5.94M 個 token,總輸出為 72,000 個 token。

完全未採用任何快取計費,離峰時段:5.94M 輸入以 $0.15 計算為 $0.891,加上 72,000 輸出以 $0.60 計算為 $0.043——約 $0.93(本次工作階段)。

在前綴已快取的情況下計費,而這正是預設的實際情形:那些輸入 token 中有 5.782M 個以快取命中計費,價格為 $0.003($0.017);158,000 個以快取未命中計費,價格為 $0.15($0.024);而相同的 72,000 個輸出 token 花費 $0.043。約 $0.084——大約便宜 11 倍。輸入占帳單的比例從 95% 降至 49%,光是快取部分就占 21%,而輸出 token 成為最大的單一項目。相同模型、相同工作階段、相同輸出——唯一改變的是前綴是否被重複使用。

注意 DeepSeek 價目表上沒有什麼:快取寫入這一項目。Anthropic 對填入 5 分鐘快取收取基礎輸入的 1.25 倍費用,一小時快取則收 2 倍;DeepSeek 的價目卡只列出命中與未命中,其快取指南也未描述任何寫入或儲存費用。如果你比較的是各廠商的快取經濟效益,而非表面的 token 費率,那麼這個缺席的項目,比 50 倍命中折扣所暗示的更有價值。

這也是為什麼OrcaRouter 上的 DeepSeek V4.1 Flash的直通計價細節在這裡很重要。我們以供應商自身的定價表費率計費,零加成,因此廠商價格變動會在當天即在我們這邊生效,而不必等待重新定價流程——而且你上方看到的快取命中與尖峰/離峰欄位,就是你實際被計費所依據的欄位,而不是它們的混合近似值。

Screenshot of the OrcaRouter model page for deepseek/deepseek-v4.1-flash, showing the model id, Vision / Tools / JSON / Reasoning tags, a 2026-09-10 release date, 1M-token context, 384K max output, text + image input, text output, $0.15 input and $0.60 output per 1M tokens, a p50 time to first token of 784 ms, a p95 of 2.95 s, 59,150.9M tokens of traffic over seven days, and body text stating OrcaRouter bills at the provider rate with zero markup added

與 DeepSeek-V4-Pro-0813 相比:4 倍的差距,以及一場並未發生的退役

最顯而易見的內部比較對象是旗艦 SKU,而實際情況並不像標題費率所暗示的那麼誇張。DeepSeek-V4-Pro-0813,模型 ID deepseek-v4-pro,在快取未命中時,每 100 萬輸入 token 定價為 $0.66,離峰時段每 100 萬輸出 token 為 $1.98,尖峰時段則加倍至 $1.32 與 $3.96。其快取命中在離峰時段為 $0.022——是 Flash 的 7 倍以上。

快取未命中輸入 — 離峰時段 $0.15 對比 $0.66,因此 Flash 便宜 4.4 倍

輸出 — 離峰時段 $0.60 對比 $1.98,因此 Flash 便宜 3.3 倍

快取命中輸入 — 離峰時段 $0.003 對比 $0.022,因此 Flash 便宜 7.3 倍

上下文與輸出上限 — 在兩款 SKU 上,於 1M 和 384K 時完全相同

併發 — Flash 上為 2,500,對比 V4 Pro 的 500,這 5 倍的差距在價目表上完全消失

關於這項比較,有三件事很容易搞錯。首先,就絕對金額而言,重複使用的效益在旗艦機型上更大,儘管 Flash 的倍率更高:快取一百萬個 token 在 V4 Pro 上可省下 $0.638,在 Flash 上則省下 $0.147,因為旗艦機型的未命中率原本就高出許多。其次,大家原本以為會消失的那個模型並沒有消失:DeepSeek 宣布將於 2026-09-14 停止供應 V4 Pro,並把這些請求導向 Flash,此舉引發開發者強烈反彈,認為這是在生產工作流程下偷換後端模型,而該公司已於 2026-09-11 撤回這項決定。V4 Pro 仍在供應,計費方式不變。第三,而這正是爆料報導踩進的陷阱——並沒有已發布的 V4.1 Pro。DeepSeek-V4-Pro-0813 仍是旗艦 SKU,而該廠商並未以那個名稱推出後繼產品。任何為遷移至「V4.1 Pro」估價的人,都是在為一個不存在的模型估價。

相較於封閉的前沿層級

面對買家真正會列入候選名單的封閉模型,乘數才是重點。以下所有數據均來自各供應商今日自家公布的定價頁面。

GPT-5.6 Sol — 在 OpenAI 的短上下文層級中,列表價為每 1M 輸入 $5.00、每 1M 輸出 $30.00,目前正實施 $4.00 / $20.00 的促銷費率,OpenAI 表示此費率至少供應至 2026-11-21,而快取輸入為 $0.40。相較於促銷費率,DeepSeek V4.1 Flash 的輸入便宜 26.7 倍、輸出便宜 33.3 倍;相較於列表價,則為 33 倍與 50 倍。Sol 的快取命中成本是 Flash 的 133 倍。

Claude Opus 5 — 在 Anthropic 公布的價目表上,每 100 萬個輸入 token 為 5.00 美元、每 100 萬個輸出 token 為 25.00 美元,快取命中則為每 100 萬個 0.50 美元。這相當於 Flash 輸入費率的 33 倍、輸出費率的 42 倍,以及快取命中費率的 167 倍。Anthropic 的 5 分鐘快取寫入還會在此之上再加收 1.25 倍;DeepSeek 的價目表則沒有對應的項目。

Gemini 3.8 Flash — 每 100 萬輸入 token $0.75,每 100 萬輸出 token $3.75,優惠至 2026-12-31;兩項費率預計於 2027-01-01 翻倍,快取輸入為 $0.075,而且——這正是真實帳單上反覆出現的那一行——快取 儲存 每 100 萬個 token 每小時 $0.50。相較於它,Flash 的輸入便宜 5 倍、輸出便宜 6.25 倍,快取命中則便宜 25 倍,而 DeepSeek 保留快取不收費。

能力脈絡才是讓這一切保持誠實的關鍵。在 Artificial Analysis 的 Intelligence Index v4.3 上,DeepSeek V4.1 Flash(reasoning、max effort)得分 40,在 113 個模型中排名第 6,每項 index 任務為 $0.27,輸出速度為每秒 214.4 個 token。這是真正接近前沿的排名,而價格比它所被拿來比較的層級低 26 倍——但同一項測量顯示,它是 AA 測試過最冗長的模型之一,在整個 index 運行中產生 250M 個輸出 token,而中位數是 140M。冗長不會改變每 token 價格,卻會改變帳單。一個比中位數多寫 62% token 的模型,在這裡仍然便宜得多,但「每 token 便宜」和「每任務便宜」是不同的說法,而你實際支付的是後者。

有免費方案嗎?

不。DeepSeek 自家的定價頁面並未記載任何免費 API 級別、免費每月額度或免費模型——計費方式為按用量付費,扣抵已加值或已獲贈的餘額,且獲贈餘額會優先扣抵。消費者聊天應用程式是免費的;但deepseek-flash背後的 API 並非如此,DeepSeek 平台上也沒有該模型的免費端點。數家第三方閘道宣稱可免費或試用存取此模型,我們會將它們全數視為原型開發用的介面,而非正式生產環境的後端,因為這些條款可能未經通知即變更,且它們都不具備供應商自家的價目表。

價格背後的效率宣稱

這個價格並不是補貼,至少就 DeepSeek 自己的說法而言。該供應商的模型卡與技術報告將 V4.1 Flash 描述為一個 552B 參數的混合專家模型,採用因果編碼器-解碼器架構,在 prefill 階段每個 token 約啟動 8B 參數,在 decode 階段則為 16B——這種設計刻意不對稱,讀取成本低,寫入成本較高。在記憶體方面,DeepSeek 報告每 token 的全域 KV 快取約為 890 位元組,大約是 DeepSeek-V4-Flash 的四分之一,而在相同工作負載下,其常駐快取佔用量約為後者的八分之一;這是透過捨棄滑動視窗狀態,並在命中時重播最後 128 個 token 來達成。這些都是供應商在其自家硬體上回報的測量數據,而該技術報告並未聲稱重播路徑在數學上等同於完整運算。

參數量是本次發布中唯一真正懸而未決的數字,而箇中原因值得精確說明。DeepSeek 的說明文字報告為 552B,那是主幹——負責運算的部分。與之並列的是 Engram,一張條件式記憶查找表,模型卡標示為 196B 參數,透過詞元查找存取,而非經由計算得出。把兩者相加,你會得到接近 748B,這正是 r/LocalLLaMA 上一篇廣為閱讀的社群分析在權重釋出後數小時內所主張的數字,而 Hugging Face 儲存庫自家的檔案面板更把它推高至 763B。社群部署記述則將該檢查點計為約 510 GB、橫跨 48 個分片,原生以 FP8 稠密權重搭配 FP4 專家量化後發布。把總數視為有爭議,並把主幹數字視為廠商自報。活躍參數量是驅動速度的關鍵;常駐權重則決定模型究竟能否啟動。

在 MIT 授權下,自行架設是這個價格的真正替代方案。

權重位於 deepseek-ai/DeepSeek-V4.1-Flash,採用 MIT 授權,允許商業使用、修改與再散布。這使得 API 的價目表成為一種選擇,而非過路費:在 MIT 之下,授權條款中沒有任何內容阻止你自己部署這個模型,並改為支付算力費用,而非按權杖付費。

它並沒有讓這件事變得便宜。在快取與激活值之前,檢查點約有 510 GB 的常駐權重,DeepSeek 在整個儲存庫中都沒有提及任何 GPU 需求,而社群的部署實作文章則指出,實際的下限是多 GPU 節點,而非工作站。三個服務堆疊在 2026-09-10 推出首日支援——vLLM、搭配 Miles 的 SGLang,以及 Cambricon 為自家加速器打造的 vLLM 架構 NeuWare 改編版——但在發布當日,vLLM 和 SGLang 推出的是專用預覽映像檔,而非官方套件,且 llama.cpp 尚未合併 V4.1 架構支援。消費級硬體自架並不是當今 API 價格的替代方案;租用 8-GPU 節點才是。如果你的用量大到足以攤銷這筆成本,授權條款允許你這麼做;如果沒有,每百萬個 token 0.15 美元是更便宜的答案,而且差距相當懸殊。

費率卡實際上要你決定的是什麼

三件事,按它們能帶動多少錢的順序排列。維持穩定的提示前綴,讓快取發揮它的作用——它是自動的,是 50 倍的折扣,而且在 60 輪的代理迴圈中,能把一趟 $0.93 的工作階段變成 $0.084。把批次流量安排在平日的 UTC 01:00–04:00 與 06:00–10:00 之外執行,這對美國團隊來說等於沒差,對歐洲團隊則意味著把早上的工作挪到下午。而如果你是拿這個來跟 DeepSeek 自家的旗艦方案比價,請記住旗艦方案仍在優惠中——原定的下線時程已於 2026-09-11 取消,兩個 SKU 共用同一把金鑰,而兩者之間的切換只是改個 model-id,而不是一次遷移。

費率表沒告訴你的是,這個模型對你的工作負載而言是否夠好,而相關的數據比價目表更新、也更單薄。Artificial Analysis 的指數排名是在最高推理強度下的單次量測,供應商基準測試的各列數據由供應商自行提報,而參數量仍有爭議。價格是這次發布中已經塵埃落定的部分。就依它來規劃你的遷移成本,但在真正投入之前,先測試它的能力。

本文中的比較4

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新