主视觉标题卡,文字为「DeepSeek V4.1 Flash vs DeepSeek V4 Pro」,副标题为「原定交接,已于 2026-09-11 取消」;两张卡片分别写着「DeepSeek V4.1 Flash — AA Index 40,$0.15 / $0.60」和「DeepSeek V4 Pro 0813 — AA Index 36,$0.66 / $1.98」;页脚写着「AA Index 数据来自 Artificial Analysis;价格来自 DeepSeek,非高峰时段,按每 100 万 tokens 计。」
Guides & Insights

DeepSeek V4.1 Flash 对比 DeepSeek V4 Pro:DeepSeek 曾计划却取消的交接

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 于 2026-09-10 发布,而 DeepSeek V4 Pro 本应现在已经下线。该计划在 Flash 发布前两天宣布,并在发布当天敲定:2026-09-14 北京时间 12:00,所有发往 deepseek-v4-pro 的请求都将悄悄改道到更新、更便宜的 deepseek-flash,并按 Flash 费率计费。DeepSeek 在开发者提出反对后于 2026-09-11 取消了该计划,而到了 2026-09-14,截止时间已过,V4 Pro 仍在运行,其计费方式也未改变。所以这不是一次发布对比——左边的模型才发布八天,右边的模型则是发布已一年的旗舰,正处于全面可用的第四个月。它比较的是两个模型,其制造方公布的基准测试显示便宜的那个胜出,随后却发现用户并不认同,于是退让了。这一经过是本月任何人就这两个模型所发布的最有用的东西,因为它正是你即将亲自做出的那个决定。

实际发生了什么,按顺序来。

这里,时间线比任何单一基准都更重要,因为逆转才是关键,而公告是刻意低调的。

2026-09-09 — DeepSeek 告知用户,在 V4.1 Pro 推出之前,V4 Pro 的请求将被路由至 V4.1 Flash,并按 Flash 的费率计费。其传达的信息是:Flash 在性能、成本、速度和任务完成时间上均已全面超越 Pro。

2026-09-10 — DeepSeek V4.1 Flash 在应用、网页端和 API 上正式发布(GA)。权重以 MIT 许可发布于 Hugging Face。API 模型名称改为 deepseek-flash。上一代的 deepseek-v4-flashdeepseek-v4-flash-vision-exp 将直接退役,其旧版 ID 暂时路由至 V4.1 Flash。Pro 的关停时间推迟至北京时间 2026-09-14 12:00(UTC 04:00)。

2026-09-11 — DeepSeek 反转。应用户要求,其表示,V4 Pro API 服务将在 2026-09-14 之后继续提供,计费不变,并取消自动切换到 V4.1 Flash。

2026-09-14——截止期限已过。V4 Pro 在非高峰时段仍以每百万 token $0.66 / $1.98 的价格提供服务。

这一连串动作中的不对称正是整篇文章的核心。Flash 用户无论是否愿意都被迁移了——旧的 V4 Flash ID 现在会由另一个模型来响应。Pro 用户则被网开一面,原因并不是 V4 Pro 的基准测试表现更好,而是生产系统一直是针对它调优的:提示词、智能体脚手架、评测框架以及可复现性假设——更换后端就会令这些失效,而调用方无需改动任何代码。DeepSeek 的对比页面至今仍将两个模型并排列出,这说明该公司打算同时提供两者。

并排对比:两个 SKU

以下所有内容均为 DeepSeek 自行发布的规格,除非另有注明来源。价格按每百万 token 计算,为非高峰时段价格,括号内为高峰时段价格——DeepSeek 的高峰时段为 UTC 周一至周五 01:00 至 04:00 以及 06:00 至 10:00,其余所有时段均为非高峰时段,按高峰价格的一半计费。

API 模型名称deepseek-flash(DeepSeek-V4.1-Flash)对比 deepseek-v4-proDeepSeek-V4-Pro-0813)。

输入,缓存未命中 — $0.15($0.30)对比 $0.66($1.32)。

输入,缓存命中 — $0.003($0.006)对比 $0.022($0.044)。

输出 — $0.60($1.20)对比 $1.98($3.96)。

上下文 / 最大输出 — 两者均为 1M tokens / 384K。完全相同。

图像输入 — 在 Flash 上原生支持;在 V4 Pro 上列为不支持。

并发限制 — Flash 上为 2,500,而 V4 Pro 上为 500。

报告的参数量——Flash:总计 552B,为厂商公布的数字,社区对此提出了可信的质疑(详见下文)。V4 Pro:总计 1.6T,激活参数约 49B,Artificial Analysis 也列出了该数据,vLLM 的 recipe 页面亦予以确认。

每个 token 的激活预算 —— Flash 的设计是在预填充阶段激活约 8B、在解码阶段激活约 16B,这正是其架构的用意所在;Pro 则每个 token 激活约 49B。

许可证 — 两者均采用 MIT 开放权重。

GA 日期——Flash 2026-09-10;V4 Pro 0813 2026-08-13,此前已于 4 月发布预览版。

Two-column scoreboard comparing DeepSeek V4.1 Flash and DeepSeek V4 Pro 0813 across six dimensions: AA Intelligence Index 40 vs 36, input $0.15 vs $0.66 per 1M off-peak, output $0.60 vs $1.98 per 1M off-peak, output speed 214.4 vs 94.4 tokens/s, image input supported vs not supported, and concurrency limit 2,500 vs 500, with a footer reading 'AA Intelligence Index and output speed per Artificial Analysis; prices, image input and concurrency per DeepSeek, off-peak.'

价格差距就是全部的论据。

在 Pro 上,输入贵 4.4 倍。输出为 3.3 倍。缓存命中——在系统提示词稳定的长时 Agent 运行中占主导地位的那一层级——为 7.3 倍。由于峰值在两边都会让每个层级翻倍,因此在峰值时这一比率完全相同;这一差距并非折扣造成的假象。

拿它跑一个工作负载。假设一个编程智能体每月处理 1000 万输入 token,缓存命中率 70%,并产生 200 万输出 token。在非高峰时段用 V4.1 Flash,这对应 $0.45 的全新输入、$0.021 的缓存输入和 $1.20 的输出:$1.67。在非高峰时段用 V4 Pro,则是 $1.98、$0.154 和 $3.96:$6.09。大约是 3.6 倍,而且是在一个刻意选得平平无奇的工作负载上。

那就是 DeepSeek 自己的价目表,也就是你在这里实际支付的价格:OrcaRouter 以 0% 加价把供应商的标价原样传递过去,所以 DeepSeek 一调价,当天就会落到我们这边,而不会被重新包装。两个模型共用同一个密钥,这对后面那一节很关键——就是关于测试一项你已经不必再做的迁移的那一节。

Screenshot of DeepSeek's official Models & Pricing page showing deepseek-flash and deepseek-v4-pro side by side: vision supported for Flash and 'Not supported' for V4 Pro; cache-hit input $0.003 vs $0.022 off-peak; cache-miss input $0.15 vs $0.66; output $0.60 vs $1.98; concurrency limit 2500 vs 500; and a footnote stating that in response to user demand DeepSeek will continue providing V4 Pro API services after September 14, 2026 with billing unchanged.

DeepSeek V4.1 Flash 真正胜出的地方

Flash 最有力的证据并非 DeepSeek 的基准测试表,而是 Artificial Analysis——它保持独立,且数据直接读自其模型页面。

Intelligence Index — Flash(推理,最大投入)得分为 40,在 113 个模型中排名第 6。V4 Pro 0813(推理,最大投入)得分为 36,排名第 7。同样的指数,同样的投入设置,相差四分,而更便宜的模型反而领先。

输出速度 — 214.4 tokens/s 对比 94.4 tokens/s。这是 2.3 倍,而且是实测得出的,不是口头宣称的。

首令牌时间 — 1.21 秒对 1.74 秒。

DeepSWE v1.1 — Flash 在受追踪排行榜上得分 74.2,排名第一,领先于 GPT-6 Astra 的 74.10、Claude Opus 5 的 74.00 和 Gemini 3.8 Flash 的 73.70。V4 Pro 0813 在同一基准上的 62.7 是 DeepSeek 自己公布的数字。榜首的差距是 0.2 分,这是并列,不是胜利——但领先 Pro 11.5 分的差距可不是并列。

服务效率 — Flash 的解码器从编码器的最终隐藏状态中推导出其全局 KV,而不是逐层重新计算,这正是产生非对称的 8B 预填充 / 16B 解码激活值的原因。SemiAnalysis 的 InferenceX 分析显示,KV 缓存约为每 token 890 字节——约为 V4 Flash 的四分之一——而持久化 KV 存储则降至约八分之一。这就是价格如此的原因,也是该模型能在 2,500 并发量下可用、而 Pro 最高只能到 500 的原因。

视觉能力体现在所提供 API 上——而不只是存在于权重之中。DeepSeek 自家的定价页面将图像输入列为 Flash 支持、V4 Pro 不支持,DeepSeek 也将其描述为首个具备原生多模态理解能力的旗舰模型。这是 DeepSeek 首个读取截图无需单独端点的旗舰模型。

你将看到的所有其他被引用的头条数字——Terminal-Bench 2.1 的 90.6、GPQA Diamond 的 90.9、Codeforces 3471——都是 DeepSeek 自己的数据,我们未能复现,因此解读时应将这一点牢记在心。

DeepSeek V4 Pro 在哪些情况下仍是正确之选

经历那样的一周后,很容易就会看衰 V4 Pro。但撤销弃用的做法表明并非如此,规格表也同样表明并非如此。

Pro 拥有 1.6T 总参数,每个 token 激活约 49B,而 Flash 在解码时为 16B。无论指数怎么说,每 token 容量都是实实在在的资源,而它真正显现价值的,是那些长时程工作负载:数小时的智能体运行、大规模重构,以及早期一步走错就会拖垮整条轨迹的任务。四点指数差距衡量的是十项评估的平均值,而不是你分布的长尾。

Pro 同样是已知量。它经过 4 月预览后,自 2026-08-13 起全面可用,而 0813 构建版的性能提升来自后训练而非架构——参数量相同,形态与预览版相同,行为却不同。这意味着四个月的社区工具、已发布的智能体测试框架、提示模式和失败模式。Flash 已全面可用八天,围绕它的生态相应地还很薄弱。如果你的团队可靠性来自确切知道模型会如何失败,那么这种知识就存在于 Pro 中。

而且服务并未停止。DeepSeek 的承诺明确,计费未变,权重采用 MIT 许可,并且V4 Pro 仍在我们的产品目录中,标价保持不变。取消弃用并非缓期执行——而是表明 DeepSeek 打算继续服务该层级。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro showing the model ID deepseek/deepseek-v4-pro, the description 'DeepSeek V4 Pro flagship MoE — 1.6T total / 49B active params, 1M context', 1M-token context and 384K max output, text-only input, $0.66 per 1M input tokens and $1.98 per 1M output tokens, and p50 TTFT of 5.79 seconds.

可以用来衡量这两个模型的三点

护栏,因为一旦这个决定做错,代价高昂。

参数量存在争议。552B 是 DeepSeek 给出的数字。一项可信的社区分析则认为,已发布的检查点是 748B——552B 的 Transformer 主干加上约 196B 的 Engram 条件记忆表,后者是一种查找结构,在网络中的两个位置被查询,而不是信号流经的一层。已发布的下载文件为 510.3 GB,包含 48 个 safetensors 分片,采用 FP8 稠密权重和 FP4 路由专家。两个数字可以同时成立,取决于你是否将检索与计算分开计数。请将 552B 视为厂商报告的数据,并在规划部署前检查磁盘占用。

排行榜分数只是一道筛选,不是一份契约。 DeepSWE v1.1 的 74.2 是一项评测框架基准成绩。EyesTech Systems Lab 自行发布的一项审计声称,这些 Flash 级成绩在转移到隔离的、真实世界的多文件代码库后就会崩塌——使 DeepSeek V4.1 Flash 在 SWE-bench Pro 上只有 31.4%,而宣传成绩为 74.2%,这一降幅比其自身对比中的前沿模型更大。该审计并不独立——作者出售的工具正是用来检测他所描述的那种利用评测框架的行为——而且我们尚未看到有人复现它。但这仍是正确的姿态:在迁移之前,先在你自己的仓库上验证。

冗长本身就是一条成本项。Artificial Analysis 在其 Intelligence Index 测试中测得 V4.1 Flash 生成了 2.5 亿个输出 token,而同类开放权重模型的中位数为 1.4 亿,因此称其极为啰嗦。在这张价格表中,输出是昂贵的那一端,所以一个会"出声思考"的模型会蚕食自身的节省空间。在推理密集型工作负载上,做预算时要考虑 token 的数量,而不只是 token 的单价。

还有一件事,我直白说明,免得有人依据传言做规划:DeepSeek V4.1 Pro 尚未发布。 被取消的迁移曾被说成是“V4.1 Pro 发布之前”的权宜之计,而这一点没有任何改变。

如果…选择 DeepSeek V4.1 Flash

• 你的工作负载属于高吞吐量、对延迟敏感或有成本限制的场景——分类、抽取、路由、摘要、聊天、大多数代码生成。

• 你需要在与文本相同的端点上获得图像输入。这是首个 DeepSeek 旗舰模型,能做到单次调用,而不是第二个模型。

• 你的提示词可被缓存。缓存命中时可达 7.3 倍,而差距最大的地方恰恰是智能体流量所在之处;一次长时运行的输入中,大部分都来自稳定的系统提示词。

• 你本周从零开始,没有任何针对特定模型脾性调校过的测试框架。没有什么需要保护的。

• 你想要更高的并发上限。2,500 对 500,这在你开始排队之前能承受的负载量上就是五倍的差距。

选择 DeepSeek V4 Pro,如果

• 你的生产环境已经针对它调优过了。这次反转意味着你有时间——用它来测试,而不是回避问题。

• 你的任务是长周期且失败代价高昂的,而你已经在你自己的数据上、而不是在排行榜上测得:每 token 约 49B 激活参数能为你带来 Flash 的 16B 所没有的东西。

• 你需要可预测、仅文本的行为,无需考虑任何视觉路径;或者你有评估基线,而中途更换模型会使其失效。

• 您的访问模式属于低量级、高利害,在这种情况下,小额账单上的 3.6 倍并非决定性因素。

如果你已经基于 DeepSeek V4 Pro 构建了

2026-09-11 发生的有用变化是,你的迁移不再是一个截止期限,而变成了一个决定。这对你本人来说绝对更好,对你的收件箱来说则绝对更糟,因为这个决定仍然必须做出,而现在没有人替你做了。

先给它算一笔账。3.3–4.4× 的差距就是你白白留在桌上的数字,而上面的实操示例能在约一分钟内把它变成一个每月的金额。然后,用唯一真正重要的方式来测试它:把一部分生产流量镜像到 Flash,让 Pro 留在主路径上,并在你自己的任务上对比输出。由于两个模型都以同一个密钥、按提供商标价响应,并具备自动故障转移,那次影子运行只是一次路由变更,而不是第二次集成,而且路由器可以将请求回退到 Pro,而无需你编写回退逻辑。团队白白烧掉 token 去做一场他们本没要求的迁移,这正是路由层存在的首要原因。

不要假设 Flash 是即插即用的。它是一种不同的架构——一个具有非对称激活的 40 层因果编码器–解码器——而且在推理时更冗长。提示层面的行为无法在任一方向上干净地迁移,因此要基于输出来衡量迁移,而不是基于索引。

看什么

三件事将决定一个月后这套组合会是什么样子。第一,V4.1 Pro 是否会发布,并恢复一个真正的 Pro 层级——整个被取消的迁移明确就是为它准备的权宜之计,因此 DeepSeek 的路线图上仍然留着一个旗舰形状的空洞。第二,这次缓刑能否挺过 DeepSeek 的下一步价格动作;一家愿意安排一次静默改道的公司,学到的是它不能这么做,而不是它不该这么做。第三,DeepSeek 之外的任何人能否在未经修改的代码库上复现 Flash 的基准测试数据,这是唯一能了结整场对比所围绕的效率与容量之争的结果。在那之前,诚实的立场正是这次反转本身所暗示的:对于任何新事物,Flash 是更好的默认选择;对于任何已经建成的东西,Pro 是更好的赌注;而 DeepSeek 刚刚告诉你,当你还在弄清自己究竟是哪一种时,它会同时服务两者。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新