
DeepSeek V4.1 Flash 对比 DeepSeek V4 Pro:DeepSeek 曾计划却取消的交接
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
DeepSeek V4.1 Flash 于 2026-09-10 发布,而 DeepSeek V4 Pro 本应现在已经下线。该计划在 Flash 发布前两天宣布,并在发布当天敲定:2026-09-14 北京时间 12:00,所有发往 deepseek-v4-pro 的请求都将悄悄改道到更新、更便宜的 deepseek-flash,并按 Flash 费率计费。DeepSeek 在开发者提出反对后于 2026-09-11 取消了该计划,而到了 2026-09-14,截止时间已过,V4 Pro 仍在运行,其计费方式也未改变。所以这不是一次发布对比——左边的模型才发布八天,右边的模型则是发布已一年的旗舰,正处于全面可用的第四个月。它比较的是两个模型,其制造方公布的基准测试显示便宜的那个胜出,随后却发现用户并不认同,于是退让了。这一经过是本月任何人就这两个模型所发布的最有用的东西,因为它正是你即将亲自做出的那个决定。
实际发生了什么,按顺序来。
这里,时间线比任何单一基准都更重要,因为逆转才是关键,而公告是刻意低调的。
• 2026-09-09 — DeepSeek 告知用户,在 V4.1 Pro 推出之前,V4 Pro 的请求将被路由至 V4.1 Flash,并按 Flash 的费率计费。其传达的信息是:Flash 在性能、成本、速度和任务完成时间上均已全面超越 Pro。
• 2026-09-10 — DeepSeek V4.1 Flash 在应用、网页端和 API 上正式发布(GA)。权重以 MIT 许可发布于 Hugging Face。API 模型名称改为 deepseek-flash。上一代的 deepseek-v4-flash和deepseek-v4-flash-vision-exp 将直接退役,其旧版 ID 暂时路由至 V4.1 Flash。Pro 的关停时间推迟至北京时间 2026-09-14 12:00(UTC 04:00)。
• 2026-09-11 — DeepSeek 反转。应用户要求,其表示,V4 Pro API 服务将在 2026-09-14 之后继续提供,计费不变,并取消自动切换到 V4.1 Flash。
• 2026-09-14——截止期限已过。V4 Pro 在非高峰时段仍以每百万 token $0.66 / $1.98 的价格提供服务。
这一连串动作中的不对称正是整篇文章的核心。Flash 用户无论是否愿意都被迁移了——旧的 V4 Flash ID 现在会由另一个模型来响应。Pro 用户则被网开一面,原因并不是 V4 Pro 的基准测试表现更好,而是生产系统一直是针对它调优的:提示词、智能体脚手架、评测框架以及可复现性假设——更换后端就会令这些失效,而调用方无需改动任何代码。DeepSeek 的对比页面至今仍将两个模型并排列出,这说明该公司打算同时提供两者。
并排对比:两个 SKU
以下所有内容均为 DeepSeek 自行发布的规格,除非另有注明来源。价格按每百万 token 计算,为非高峰时段价格,括号内为高峰时段价格——DeepSeek 的高峰时段为 UTC 周一至周五 01:00 至 04:00 以及 06:00 至 10:00,其余所有时段均为非高峰时段,按高峰价格的一半计费。
• API 模型名称 — deepseek-flash(DeepSeek-V4.1-Flash)对比 deepseek-v4-pro(DeepSeek-V4-Pro-0813)。
• 输入,缓存未命中 — $0.15($0.30)对比 $0.66($1.32)。
• 输入,缓存命中 — $0.003($0.006)对比 $0.022($0.044)。
• 输出 — $0.60($1.20)对比 $1.98($3.96)。
• 上下文 / 最大输出 — 两者均为 1M tokens / 384K。完全相同。
• 图像输入 — 在 Flash 上原生支持;在 V4 Pro 上列为不支持。
• 并发限制 — Flash 上为 2,500,而 V4 Pro 上为 500。
• 报告的参数量——Flash:总计 552B,为厂商公布的数字,社区对此提出了可信的质疑(详见下文)。V4 Pro:总计 1.6T,激活参数约 49B,Artificial Analysis 也列出了该数据,vLLM 的 recipe 页面亦予以确认。
• 每个 token 的激活预算 —— Flash 的设计是在预填充阶段激活约 8B、在解码阶段激活约 16B,这正是其架构的用意所在;Pro 则每个 token 激活约 49B。
• 许可证 — 两者均采用 MIT 开放权重。
• GA 日期——Flash 2026-09-10;V4 Pro 0813 2026-08-13,此前已于 4 月发布预览版。

价格差距就是全部的论据。
在 Pro 上,输入贵 4.4 倍。输出为 3.3 倍。缓存命中——在系统提示词稳定的长时 Agent 运行中占主导地位的那一层级——为 7.3 倍。由于峰值在两边都会让每个层级翻倍,因此在峰值时这一比率完全相同;这一差距并非折扣造成的假象。
拿它跑一个工作负载。假设一个编程智能体每月处理 1000 万输入 token,缓存命中率 70%,并产生 200 万输出 token。在非高峰时段用 V4.1 Flash,这对应 $0.45 的全新输入、$0.021 的缓存输入和 $1.20 的输出:$1.67。在非高峰时段用 V4 Pro,则是 $1.98、$0.154 和 $3.96:$6.09。大约是 3.6 倍,而且是在一个刻意选得平平无奇的工作负载上。
那就是 DeepSeek 自己的价目表,也就是你在这里实际支付的价格:OrcaRouter 以 0% 加价把供应商的标价原样传递过去,所以 DeepSeek 一调价,当天就会落到我们这边,而不会被重新包装。两个模型共用同一个密钥,这对后面那一节很关键——就是关于测试一项你已经不必再做的迁移的那一节。

DeepSeek V4.1 Flash 真正胜出的地方
Flash 最有力的证据并非 DeepSeek 的基准测试表,而是 Artificial Analysis——它保持独立,且数据直接读自其模型页面。
• Intelligence Index — Flash(推理,最大投入)得分为 40,在 113 个模型中排名第 6。V4 Pro 0813(推理,最大投入)得分为 36,排名第 7。同样的指数,同样的投入设置,相差四分,而更便宜的模型反而领先。
• 输出速度 — 214.4 tokens/s 对比 94.4 tokens/s。这是 2.3 倍,而且是实测得出的,不是口头宣称的。
• 首令牌时间 — 1.21 秒对 1.74 秒。
• DeepSWE v1.1 — Flash 在受追踪排行榜上得分 74.2,排名第一,领先于 GPT-6 Astra 的 74.10、Claude Opus 5 的 74.00 和 Gemini 3.8 Flash 的 73.70。V4 Pro 0813 在同一基准上的 62.7 是 DeepSeek 自己公布的数字。榜首的差距是 0.2 分,这是并列,不是胜利——但领先 Pro 11.5 分的差距可不是并列。
• 服务效率 — Flash 的解码器从编码器的最终隐藏状态中推导出其全局 KV,而不是逐层重新计算,这正是产生非对称的 8B 预填充 / 16B 解码激活值的原因。SemiAnalysis 的 InferenceX 分析显示,KV 缓存约为每 token 890 字节——约为 V4 Flash 的四分之一——而持久化 KV 存储则降至约八分之一。这就是价格如此的原因,也是该模型能在 2,500 并发量下可用、而 Pro 最高只能到 500 的原因。
• 视觉能力体现在所提供 API 上——而不只是存在于权重之中。DeepSeek 自家的定价页面将图像输入列为 Flash 支持、V4 Pro 不支持,DeepSeek 也将其描述为首个具备原生多模态理解能力的旗舰模型。这是 DeepSeek 首个读取截图无需单独端点的旗舰模型。
你将看到的所有其他被引用的头条数字——Terminal-Bench 2.1 的 90.6、GPQA Diamond 的 90.9、Codeforces 3471——都是 DeepSeek 自己的数据,我们未能复现,因此解读时应将这一点牢记在心。
DeepSeek V4 Pro 在哪些情况下仍是正确之选
经历那样的一周后,很容易就会看衰 V4 Pro。但撤销弃用的做法表明并非如此,规格表也同样表明并非如此。
Pro 拥有 1.6T 总参数,每个 token 激活约 49B,而 Flash 在解码时为 16B。无论指数怎么说,每 token 容量都是实实在在的资源,而它真正显现价值的,是那些长时程工作负载:数小时的智能体运行、大规模重构,以及早期一步走错就会拖垮整条轨迹的任务。四点指数差距衡量的是十项评估的平均值,而不是你分布的长尾。
Pro 同样是已知量。它经过 4 月预览后,自 2026-08-13 起全面可用,而 0813 构建版的性能提升来自后训练而非架构——参数量相同,形态与预览版相同,行为却不同。这意味着四个月的社区工具、已发布的智能体测试框架、提示模式和失败模式。Flash 已全面可用八天,围绕它的生态相应地还很薄弱。如果你的团队可靠性来自确切知道模型会如何失败,那么这种知识就存在于 Pro 中。
而且服务并未停止。DeepSeek 的承诺明确,计费未变,权重采用 MIT 许可,并且V4 Pro 仍在我们的产品目录中,标价保持不变。取消弃用并非缓期执行——而是表明 DeepSeek 打算继续服务该层级。

可以用来衡量这两个模型的三点
护栏,因为一旦这个决定做错,代价高昂。
• 参数量存在争议。552B 是 DeepSeek 给出的数字。一项可信的社区分析则认为,已发布的检查点是 748B——552B 的 Transformer 主干加上约 196B 的 Engram 条件记忆表,后者是一种查找结构,在网络中的两个位置被查询,而不是信号流经的一层。已发布的下载文件为 510.3 GB,包含 48 个 safetensors 分片,采用 FP8 稠密权重和 FP4 路由专家。两个数字可以同时成立,取决于你是否将检索与计算分开计数。请将 552B 视为厂商报告的数据,并在规划部署前检查磁盘占用。
• 排行榜分数只是一道筛选,不是一份契约。 DeepSWE v1.1 的 74.2 是一项评测框架基准成绩。EyesTech Systems Lab 自行发布的一项审计声称,这些 Flash 级成绩在转移到隔离的、真实世界的多文件代码库后就会崩塌——使 DeepSeek V4.1 Flash 在 SWE-bench Pro 上只有 31.4%,而宣传成绩为 74.2%,这一降幅比其自身对比中的前沿模型更大。该审计并不独立——作者出售的工具正是用来检测他所描述的那种利用评测框架的行为——而且我们尚未看到有人复现它。但这仍是正确的姿态:在迁移之前,先在你自己的仓库上验证。
• 冗长本身就是一条成本项。Artificial Analysis 在其 Intelligence Index 测试中测得 V4.1 Flash 生成了 2.5 亿个输出 token,而同类开放权重模型的中位数为 1.4 亿,因此称其极为啰嗦。在这张价格表中,输出是昂贵的那一端,所以一个会"出声思考"的模型会蚕食自身的节省空间。在推理密集型工作负载上,做预算时要考虑 token 的数量,而不只是 token 的单价。
还有一件事,我直白说明,免得有人依据传言做规划:DeepSeek V4.1 Pro 尚未发布。 被取消的迁移曾被说成是“V4.1 Pro 发布之前”的权宜之计,而这一点没有任何改变。
如果…选择 DeepSeek V4.1 Flash
• 你的工作负载属于高吞吐量、对延迟敏感或有成本限制的场景——分类、抽取、路由、摘要、聊天、大多数代码生成。
• 你需要在与文本相同的端点上获得图像输入。这是首个 DeepSeek 旗舰模型,能做到单次调用,而不是第二个模型。
• 你的提示词可被缓存。缓存命中时可达 7.3 倍,而差距最大的地方恰恰是智能体流量所在之处;一次长时运行的输入中,大部分都来自稳定的系统提示词。
• 你本周从零开始,没有任何针对特定模型脾性调校过的测试框架。没有什么需要保护的。
• 你想要更高的并发上限。2,500 对 500,这在你开始排队之前能承受的负载量上就是五倍的差距。
选择 DeepSeek V4 Pro,如果
• 你的生产环境已经针对它调优过了。这次反转意味着你有时间——用它来测试,而不是回避问题。
• 你的任务是长周期且失败代价高昂的,而你已经在你自己的数据上、而不是在排行榜上测得:每 token 约 49B 激活参数能为你带来 Flash 的 16B 所没有的东西。
• 你需要可预测、仅文本的行为,无需考虑任何视觉路径;或者你有评估基线,而中途更换模型会使其失效。
• 您的访问模式属于低量级、高利害,在这种情况下,小额账单上的 3.6 倍并非决定性因素。
如果你已经基于 DeepSeek V4 Pro 构建了
2026-09-11 发生的有用变化是,你的迁移不再是一个截止期限,而变成了一个决定。这对你本人来说绝对更好,对你的收件箱来说则绝对更糟,因为这个决定仍然必须做出,而现在没有人替你做了。
先给它算一笔账。3.3–4.4× 的差距就是你白白留在桌上的数字,而上面的实操示例能在约一分钟内把它变成一个每月的金额。然后,用唯一真正重要的方式来测试它:把一部分生产流量镜像到 Flash,让 Pro 留在主路径上,并在你自己的任务上对比输出。由于两个模型都以同一个密钥、按提供商标价响应,并具备自动故障转移,那次影子运行只是一次路由变更,而不是第二次集成,而且路由器可以将请求回退到 Pro,而无需你编写回退逻辑。团队白白烧掉 token 去做一场他们本没要求的迁移,这正是路由层存在的首要原因。
不要假设 Flash 是即插即用的。它是一种不同的架构——一个具有非对称激活的 40 层因果编码器–解码器——而且在推理时更冗长。提示层面的行为无法在任一方向上干净地迁移,因此要基于输出来衡量迁移,而不是基于索引。
看什么
三件事将决定一个月后这套组合会是什么样子。第一,V4.1 Pro 是否会发布,并恢复一个真正的 Pro 层级——整个被取消的迁移明确就是为它准备的权宜之计,因此 DeepSeek 的路线图上仍然留着一个旗舰形状的空洞。第二,这次缓刑能否挺过 DeepSeek 的下一步价格动作;一家愿意安排一次静默改道的公司,学到的是它不能这么做,而不是它不该这么做。第三,DeepSeek 之外的任何人能否在未经修改的代码库上复现 Flash 的基准测试数据,这是唯一能了结整场对比所围绕的效率与容量之争的结果。在那之前,诚实的立场正是这次反转本身所暗示的:对于任何新事物,Flash 是更好的默认选择;对于任何已经建成的东西,Pro 是更好的赌注;而 DeepSeek 刚刚告诉你,当你还在弄清自己究竟是哪一种时,它会同时服务两者。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
