
DeepSeek V4.1 Flash 对比 DeepSeek V4 Pro:同一厂商,不同世代
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
有趣的是,将 DeepSeek V4.1 Flash 与 DeepSeek V4 Pro 对比,较新的模型并不是更大的那个。DeepSeek V4 Pro 是一个 1.6 万亿参数的专家混合模型,活跃参数为 490 亿,而且它仍在对外提供服务。DeepSeek V4.1 Flash 是一个 5520 亿参数的 MoE,输入时活跃 80 亿参数,输出时活跃 160 亿参数,它是 DeepSeek 为取代前者而打造的模型。两者都在同一家提供商的价目表上,都支持一百万 token 的上下文,并且都以 MIT 许可发布。在两者之间做选择,并不是一个关于规模的问题。而是一个关于你想为哪种架构付费的问题,而答案在 2026 年 9 月 10 日发生了变化。
并排对比,究竟有什么不同
• 参数 — V4.1 Flash 总参数 552B / 输入端激活 8B、输出端激活 16B,对比 V4 Pro 总参数 1.6T / 激活 49B。V4 Pro 的总参数量约为其三倍,输入端激活数量约为其六倍。
• 架构 — V4.1 Flash 是一种因果编码器-解码器,与 V4 Pro 早先的设计相比,是一种全新的基础架构。这是两者之间的实质性差异,也是“.1”并非小版本发布的原因。
• 每百万 tokens 价格——依据 OrcaRouter 的报价,V4.1 Flash 非高峰时段为 $0.15 输入 / $0.60 输出,而 V4 Pro 为 $0.66 输入 / $1.98 输出。
• 缓存输入 — V4.1 Flash 每 100 万 $0.003,对比 V4 Pro 每 100 万 $0.024。
• 每个 token 的 KV 缓存 — V4.1 Flash 为 890 字节,而 V4 Pro 的占用更大。在百万 token 上下文中,这一项决定了长智能体记录能否保持常驻。
• 上下文与输出 — 两者的上下文均为 1M,最大输出均为 384K。等级。
• 观测到的首 token 延迟——基于 OrcaRouter 为期 7 天的遥测数据,V4.1 Flash 的 p50 为 2.63 秒,而 V4 Pro 的 p50 为 3.58 秒;V4 Pro 的 p95 为 10.00 秒。
• 输入模态——在同一批上架信息上,V4.1 Flash 可接收文本和图像,而 V4 Pro 只支持文本输入和文本输出。这款更新的模型在输入范围上是两者中更广的,成本也更低。
不带厂商的宣传包装去读这份清单,这个规律就显得很不寻常。后继型号在每一档上都更便宜,首 token 速度更快,输入窗口更宽,而且每一档都更小。这正是真正的架构变革落地时的样子,也正是为什么“哪个更好”在这里有一个简短的答案,而在这答案之下还藏着一个更长的答案。

V4 Pro 的时间线,因为它对任何仍在使用它的人都很重要
DeepSeek V4 Pro 原计划退役。该 API 原定于北京时间 2026 年 9 月 14 日 12:00 关闭,流量将转由 V4.1 Flash 承接。但事情并未发生。9 月 11 日,厂商撤销了这一决定,并表示:“应用户需求,我们决定在 2026 年 9 月 14 日之后继续为 DeepSeek V4 Pro 提供 API 服务,计费方式保持不变。”
由此可以得出两点,而这两点都值得精确说明,因为这种情况容易让人过度解读。
第一点是,V4 Pro 并未被弃用。它是一个受支持的模型,价格保持不变,而且它正是 DeepSeek 自己的通知将现有 V4 Pro 流量导向的那个模型。如果你的生产路径锁定在它上面,那么并没有任何东西被拿走。
第二点是,DeepSeek V4.1 Pro 并不存在。那份退役通知称,V4 Pro 的流量将由 V4.1 Flash 承接,"直至 V4.1-Pro 发布",这引发了外界对其是否存在一个更大规模同门模型的一番猜测。截至 2026 年 9 月 22 日,并没有 V4.1 Pro 的 API、模型卡、权重,也没有任何发布公告。2026 年 9 月 21 日的一篇报道称,一款 2 万亿参数的模型预计将于 10 月中下旬推出,但这是关于一款尚未公布产品的单一信源说法,应当据此对待。任何围绕 V4.1 Pro 发布来做容量规划的人,都是在围绕一则传言做规划。
到底该调用哪一个
迁移案例很直接,而且这正是 DeepSeek 自己通过将 V4 Pro 流量路由到新模型所做的。根据上述数字,V4.1 Flash 更便宜、首 token 更快,并且在稳定状态下也更快,每个 token 的 KV 缓存更小。如果你的工作负载是 V4 Pro 工作负载,且没有在做只有 49B 活跃参数才能做的事情,那么更新的模型在成本和延迟上是更好的工具,无需权衡取舍。
继续留在 V4 Pro 的理由,在于大得多的活跃参数量能在困难推理和长时程智能体工作中为你换来什么,而这个理由必须靠你自己的评测来支撑,而不是靠规格表。原因在于,这两个模型并没有在一个能将它们单独区分开来的公共榜单上被直接对比:DeepSeek V4.1 Flash 出现在 2026 年 9 月 21 日的 Agents on Rails 评测中,在最高强度下为 17%,而 V4 Pro 不在该榜单上。没有任何可指的正面对比数字。现有的只是一个基于架构的看似合理的论证——六倍的活跃参数量意味着要放弃很大一块容量——而这是论证,不是实测。
任何要在两者之间迁移流量的人,都有两点实用提示。首先,高峰时段计费对两个模型都适用,因此在一天中错误的时间做成本对比,结果会差一倍;高峰时段为 UTC 01:00–04:00 和 06:00–10:00,仅限工作日,而周末则完全属于非高峰时段。其次,这两个模型共用同一上下文窗口和输出上限,因此迁移不会改变你的提示词预算——这使得此次切换在应用层面的风险低得非同寻常。
将两者都通过一个端点运行
你真正两者都想要的情形是过渡期,而且它比听起来更常见:一个团队想迁移到 V4.1 Flash,但有一条流水线在新架构上的行为尚未得到验证。通过不同的供应商并行运行这两者,意味着要为在模型层面上本就是一个提供商的东西,签两份合同并管理两套密钥。
两者都在 OrcaRouter 上,共用一个密钥,因此这就归结为一个路由决策。OrcaRouter 以 0% 加价将提供商列表价直接传递,所以上面的数字是 DeepSeek 自己的费率,而非我们的费率,并且 DeepSeek 的高峰与低谷时段安排完全按照 DeepSeek 的定义执行——包括中途过渡期的价格变动,我们这边当天就会同步生效。你可以将一小部分流量发送到新模型并比较输出,或按任务类型进行路由,并在新路径后面设置自动故障转移,这样如果 V4.1 Flash 在你的数据上出现意外行为,请求会落到 V4 Pro 上,而不是落到错误页面。
鉴于供应商已经就这些型号中哪一个即将退市改过一次主意,让两者都能通过同一个集成访问,是不需要你预测下一次反转的选择。

看什么
• V4 Pro 的价格或退役状态是否会再次变化。9 月的反转明确表示计费保持不变,而这正是要求供应商恪守的承诺。
• V4.1 Pro 能否成真。在出现模型卡或权重发布之前,关于 2T 参数的说法只是一个单一来源的传言。
• 一项在同一评测平台上同时运行两个模型的独立评估。在这样一项评估出现之前,对这两者诚实的比较只能是成本、延迟和架构——这些是可衡量的——再加上对能力的合理推测,而后者并非可衡量。
在这三者中的第三项到来之前,准确的总结是:DeepSeek V4.1 Flash 是 DeepSeek V4 Pro 更便宜、更快的继任者,V4 Pro 仍在以不变的价格继续获得支持,而新架构是否牺牲了能力,这个问题目前没有任何公开基准测试能给出答案。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
