
DeepSeek V4.1 Flash 定价:完整费率表,以及决定你账单的缓存命中数值
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 177 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1323 tok/s
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
DeepSeek V4.1 Flash 自 2026-09-10 起已全面开放,而截至今天,其公布的价目表是模型市场顶级梯队中最便宜的:每百万输入 token 0.15 美元、每百万输出 token 0.60 美元,缓存命中每百万 0.003 美元。这三个数字是低峰时段那一栏。在 DeepSeek 的工作日高峰时段,它们每一个都会翻倍,缓存命中也不例外。真正重要的比较对象,不是 DeepSeek 自家日渐老旧的旗舰——DeepSeek-V4-Pro-0813 低峰时段标价为每百万 0.66 美元 / 1.98 美元,因此 Flash 在输入价格上比自家同门低了约 4 倍——而是买家实际用来比价的闭源前沿梯队:GPT-5.6 Sol、Claude Opus 5 和 Gemini 3.8 Flash,它们每 token 的收费都高出一个数量级。
在列出数字之前先更正一点,因为本次发布前的那则泄露消息仍在流传。正式发布前流传的那些数字称,降价将在“明天”落地。价格是真的;那种说法不是。V4.1 Flash 于 2026-09-10 发布时,这些费率已经生效,而 DeepSeek 自己的变更日志也将此次降价记录为发布的一部分,而不是之后的一次下调。以下所有内容均读取自今天 2026-09-16 的 DeepSeek 实时定价页面。
完整费率卡,截至 2026-09-16
DeepSeek 发布了一份涵盖当前 SKU 的表格,每个行项都分为高峰和非高峰两列。对于模型 ID deepseek-flash,该模型服务于 DeepSeek-V4.1-Flash,其公布的费率为:
• 输入,缓存未命中 — 非高峰时段每 100 万 tokens $0.15;高峰时段每 100 万 $0.30
• 输入,缓存命中 — 非高峰时段每 100 万 tokens 收费 $0.003;高峰时段每 100 万 tokens 收费 $0.006
• 输出 — 非高峰时段每 1M tokens 收费 $0.60;高峰时段每 1M tokens 收费 $1.20
• 上下文窗口 — 100 万 tokens,最大输出 384K
• 并发限制 — 在 Flash SKU 上支持 2,500 个并发请求
• 旧版模型 ID — deepseek-v4-flash 和 deepseek-v4-flash-vision-exp已作为独立产品停用,但仍会路由至 V4.1 Flash,并按 Flash 价格计费
前两行之间的差距,就是这张表的全部重点。在非高峰时段,一次缓存命中的成本比一次缓存未命中低 50 倍——相当于 98% 的折扣,Artificial Analysis 在其成本模型中也是这样呈现的。卡片上再没有别的因素能把账单拉开这么大的差距。


峰值不是舍入误差,而且它是为北京定时的
DeepSeek 的高峰时段为周一至周五 01:00–04:00 UTC 与 06:00–10:00 UTC。除此之外的所有时间——包括整个周末——均按半价计费。翻倍适用于全部三项计费项,因此高峰时段缓存未命中的费用为 $0.30,高峰时段的输出费用为 $1.20。
这些时间窗口落在哪里,完全取决于你在哪里。在北京,它们是 09:00–12:00 和 14:00–18:00——两个工作时段,这正是关键所在。在柏林,9 月时,第二个窗口是 08:00–12:00 CEST:欧洲团队的整个上午都是高峰。在纽约,同一个窗口是 02:00–06:00 EDT。一个按正常工时运行的美国团队实际上从不会被按高峰时段计费,而欧洲团队每天上午午餐前都要支付双倍费用。如果你要选择何时运行批处理作业,这个决定每百万 token 值 0.15 美元,而且做出这个决定没有任何成本。
缓存命中定价对智能体账单究竟有何影响
在 DeepSeek 上,缓存命中是自动的——文档中说明磁盘缓存对所有用户默认启用,无需更改代码——因此你无需为了获得折扣而专门进行架构设计。而且它也是尽力而为,并非保证:DeepSeek 表示没有固定 TTL,未使用的缓存会“通常在几小时到几天内”被清除,并且系统不承诺 100% 的命中率。在对这方面进行任何建模之前,值得先阅读响应中的 prompt_cache_hit_tokens 和 prompt_cache_miss_tokens 字段。
算术比形容词更重要。以一个编码代理为例,它有 40,000 个 token 的稳定前缀——系统提示词、工具 schema、仓库上下文——运行 60 轮会话,每轮追加约 2,000 个 token 的工具输出,模型生成约 1,200 个 token。整个会话的总输入为 5.94M 个 token,总输出为 72,000 个 token。
按完全无缓存计费,非高峰时段:5.94M 输入按 $0.15 计为 $0.891,加上 72,000 输出按 $0.60 计为 $0.043——约 $0.93为本次会话总计。
按默认实际发生的情况,以缓存前缀计费:这 578.2 万输入令牌中有 578.2 万作为缓存命中到达,费用为 $0.003($0.017),15.8 万作为缓存未命中到达,费用为 $0.15($0.024),而同样 7.2 万输出令牌的费用为 $0.043。约 $0.084——大约便宜 11 倍。输入费用占总账单的比例从 95% 降到 49%,仅缓存部分就占 21%,输出令牌成为最大的单项。相同模型、相同会话、相同输出——唯一改变的是前缀是否被复用。
请留意没有一项:缓存写入行项目。Anthropic 为填充 5 分钟缓存按基础输入价的 1.25 倍收费,一小时缓存则为 2 倍;DeepSeek 的价目卡只列出命中与未命中,其缓存指南也未描述任何写入或存储费用。如果你是在跨厂商比较缓存经济性,而不是只看标称的 token 费率,那么这一缺失的意义,比 50 倍命中折扣所暗示的还要大。
这也正是DeepSeek V4.1 Flash on OrcaRouter上的透传细节在此至关重要的原因。我们按服务商自身的标价计费,零加价,因此供应商调价当天即在我们这边生效,无需等待重新定价流程——而且你在上方看到的缓存命中与高峰/非高峰时段列,正是实际计费所依据的列,而不是它们的混合近似值。

与 DeepSeek-V4-Pro-0813 相比:4 倍的差距,以及一次并未发生的退役
最明显的内部对比对象是旗舰 SKU,而实际情况并没有整体费率所暗示的那么悬殊。DeepSeek-V4-Pro-0813,模型 id 为 deepseek-v4-pro,其标价为缓存未命中时每 100 万输入 token 收费 0.66 美元,非高峰时段每 100 万输出 token 收费 1.98 美元,高峰时段则翻倍至 1.32 美元和 3.96 美元。其缓存命中在非高峰时段收费 0.022 美元——是 Flash 的 7 倍多。
• 缓存未命中输入 — 非高峰时段 $0.15 对 $0.66,因此 Flash 便宜 4.4 倍
• 输出 — 非高峰时段 $0.60 对比 $1.98,因此 Flash 便宜 3.3 倍
• 缓存命中输入 — 非高峰时段 $0.003 对比 $0.022,因此 Flash 便宜 7.3 倍
• 上下文与输出上限——两种 SKU 在 1M 和 384K 下均完全相同
• 并发——Flash 上 2,500,对比 V4 Pro 的 500,这 5 倍的差距在价格表上完全消失了
关于这一对比,有三点很容易搞错。第一,尽管 Flash 的倍率更高,但按绝对值计算,旗舰机型上的复用论据更强:缓存一百万 token 在 V4 Pro 上可节省 $0.638,在 Flash 上可节省 $0.147,因为旗舰机型本来的未命中率就高得多。第二,大家都以为会下架的那个模型并没有下架:DeepSeek 曾宣布将于 2026-09-14 停止提供 V4 Pro,并将这些请求转由 Flash 处理,此举因在生产工作流之下更换后端模型而引发开发者强烈反对,公司随后于 2026-09-11 撤销了该决定。V4 Pro 仍在提供服务,计费标准不变。第三,也正是泄密报道所掉进的陷阱——并不存在已发布的 V4.1 Pro。DeepSeek-V4-Pro-0813 仍是旗舰 SKU,厂商并未以该名称推出后继型号。任何为迁移到“V4.1 Pro”而定价的人,都是在为一个并不存在的模型定价。
对比闭源前沿层级
相较于买家实际会列入候选名单的闭源模型,倍数才是关键看点。以下所有数据均来自各厂商今天自己公布的定价页面。
• GPT-5.6 Sol — 在 OpenAI 的短上下文层级上,标价为每 100 万输入 token 5.00 美元、每 100 万输出 token 30.00 美元,目前正实行 4.00 美元 / 20.00 美元的促销价,OpenAI 称该价格至少持续到 2026-11-21,缓存输入为 0.40 美元。相比促销价,DeepSeek V4.1 Flash 的输入费用便宜 26.7 倍,输出费用便宜 33.3 倍;相比标价,则分别便宜 33 倍和 50 倍。Sol 的缓存命中费用是 Flash 的 133 倍。
• Claude Opus 5——每 100 万输入 token 收费 5.00 美元,每 100 万输出 token 收费 25.00 美元,而根据 Anthropic 公布的价格表,缓存命中为每 100 万 0.50 美元。这分别是 Flash 输入价格的 33 倍、输出价格的 42 倍、缓存命中价格的 167 倍。Anthropic 的 5 分钟缓存写入还要在此基础上再增加 1.25 倍;DeepSeek 的价格表中没有对应条目。
• Gemini 3.8 Flash—— 截至 2026-12-31,每 100 万输入 token 收费 $0.75,每 100 万输出 token 收费 $3.75,且这两项费率均定于 2027-01-01 翻倍,缓存输入为 $0.075,而——这正是真实账单上反复出现的那一行——缓存 存储为每 100 万 token 每小时 $0.50。与之相比,Flash 在输入上便宜 5 倍、输出便宜 6.25 倍、缓存命中便宜 25 倍,而 DeepSeek 持有缓存不收费。
能力背景才是让这件事保持诚实的关键。在 Artificial Analysis 的 Intelligence Index v4.3 上,DeepSeek V4.1 Flash(推理,最大努力)得分 40,在 113 个模型中排名第 6,每项指数任务成本 $0.27,每秒输出 214.4 个 token。这是一个真正接近前沿的位置,而价格比它所对比的层级低 26 倍——但同一项测量显示,它是 AA 测试过的最冗长的模型之一,在整个指数运行中生成了 250M 输出 token,而中位数为 140M。冗长不会改变每 token 价格,却会改变账单。一个比中位数多写 62% token 的模型在这里仍然便宜得多,但“每 token 便宜”和“每任务便宜”是不同的说法,而只有后者才是你实际支付的。
有免费套餐吗?
没有。DeepSeek 自己的定价页面没有记录任何免费 API 层级、没有免费月度配额,也没有免费模型——计费是按量付费,从充值或赠送的余额中扣费,且赠送余额优先消耗。消费者聊天应用是免费的;deepseek-flash背后的 API 则不是,而且 DeepSeek 平台上没有它的免费端点。若干第三方网关宣称提供对此模型的免费或试用访问,但我们会将它们全部视为原型验证环境,而非生产后端,因为那些条款可能随时变更,而且它们都不提供供应商自己的价目表。
价格背后的效率声明
这个价格不是补贴,至少按照 DeepSeek 自己的说法不是。厂商的模型卡和技术报告将 V4.1 Flash 描述为采用因果编码器-解码器(Causal Encoder-Decoder)布局的 552B 参数混合专家模型,在预填充(prefill)阶段每个 token 激活约 8B 参数,在解码(decode)阶段激活 16B 参数——这种非对称是设计使然,读取便宜,写入更贵。在内存方面,DeepSeek 报告称全局 KV 缓存约为每个 token 890 字节,大约是 DeepSeek-V4-Flash 的四分之一,而在相同工作负载下,其持久缓存占用约为后者的八分之一;这是通过丢弃滑动窗口状态并在命中时重放最后 128 个 token 实现的。这些是厂商在其自家硬件上报告的测量结果,而且技术报告并未声称重放路径与完整计算在数学上等价。
参数数量是本次发布中唯一真正尚无定论的数字,而值得精确说明其原因。DeepSeek 的文字说明报告为 552B,这是主干——执行计算的部分。与之并列的是 Engram,一个条件记忆查找表,模型卡将其规模标为 196B 参数,通过 token 查找访问,而非经过计算得出。把两者相加,你会得到接近 748B 的数字,这正是 r/LocalLLaMA 上一篇广受阅读的社区分析在权重发布后数小时内所主张的,而 Hugging Face 仓库自身的文件面板则把这个数字推得更高,朝 763B 靠拢。社区部署记录将该检查点计为约 510 GB,分布在 48 个分片,发布时原生量化为 FP8 稠密权重与 FP4 专家。把总数视为有争议,把主干数字视为厂商报告。活跃参数数量决定速度;常驻权重决定模型究竟能否启动。
相对于这个价格,自托管是一个真正的替代方案,在 MIT 许可下
权重位于 deepseek-ai/DeepSeek-V4.1-Flash,采用 MIT 许可证,允许商业使用、修改和再分发。这使得 API 价目表成为一种选择,而非必须缴纳的通行费:在 MIT 许可下,许可证中没有任何条款阻止你自行部署该模型,并按算力而非 token 付费。
它并没有让这件事变得便宜。该 checkpoint 在不计缓存和激活值的情况下,常驻权重约为 510 GB;DeepSeek 在仓库中任何地方都没有说明 GPU 要求;社区部署文章把实际最低门槛定在多 GPU 节点,而不是工作站。三个服务栈于 2026-09-10 提供了首日支持——vLLM、搭配 Miles 的 SGLang,以及 Cambricon 为其自有加速器打造的基于 vLLM 的 NeuWare 适配——但在发布日,vLLM 和 SGLang 提供的是专用预览镜像,而不是官方软件包,而且 llama.cpp 尚未合并 V4.1 架构支持。如今,消费级硬件自托管并不是 API 价格的替代方案;租用一台 8-GPU 节点才是。如果你的用量足够大,能够摊销这笔成本,许可证允许你这么做;如果不够大,每百万 token 0.15 美元就是更便宜的选择,而且差距悬殊。
费率卡实际要求你决定的是什么
三件事,按它们能撬动多少资金为序。保持一个稳定的提示词前缀,让缓存发挥作用——它是自动的,是五十分之一的折扣,而在一个 60 轮的智能体循环中,它能把一次 0.93 美元的会话变成一次 0.084 美元的会话。把批量流量安排在工作日 UTC 01:00–04:00 和 06:00–10:00 之外运行,这对美国团队来说等于什么都没变,对欧洲团队来说则意味着把早上的任务挪到下午。如果你要把这套东西和 DeepSeek 自家的旗舰模型比价,请记住旗舰仍在促销——原定的退役计划已于 2026-09-11 取消,两个 SKU 共用一个密钥,而两者之间的切换不过是改一下模型 ID,而非一次迁移。
价目表没有告诉你的是,这个模型是否好到足以胜任你的工作负载;而关于这一点的数字,比价格表更新、也更单薄。Artificial Analysis 的指数位次只是在最高推理强度下的一次测量,厂商基准测试的条目由厂商自行报告,参数数量也存在争议。价格是这次发布中已经确定的部分。用它来为你的迁移定价,并在真正投入之前测试其能力。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
