DeepSeek V4 Flash vs V4 Pro:效率之选与旗舰之选的全面对比
Guides & Insights

DeepSeek V4 Flash vs V4 Pro:效率之选与旗舰之选的全面对比

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek 的 V4 系列是一个两级的阶梯:V4 Flash,这款廉价且快速的效率模型——现在其官方-0731版本具有更强的智能体——以及V4 Pro,这款面向最艰难推理与编码任务的大型旗舰模型,现已转为官方 GA 版本(0813),于2026年8月12日发布。有趣的是,两者在实际工作上的差距如此之小,而在价格上的差距却如此之大。本指南将从能力、成本、速度和适配性四个方面对两者进行比较,所有数据均标明来源。

准确性说明:V4 Flash 的智能体/编码得分为 DeepSeek 官方报告(官方更新日志,2026-07-31,DeepSeek 测试框架);V4 Pro 的 GA(0813)得分同样由 DeepSeek 在同一测试框架上报告,目前尚无针对 0813 版本的独立评测发表。定价信息截至 2026 年 8 月 12 日;GA 降价已在 OrcaRouter 上以 0% 加价率传递。供应商测试框架的数据往往偏乐观——请在自己的任务上进行验证。

TL;DR。V4 Flash 是一个总参数量 284B、激活参数量 13B 的 MoE 模型,定价为每百万 token $0.08 / $0.18;V4 Pro 是体量大得多的旗舰模型,现已推出正式 GA 版本(0813),定价为 $0.435 / $0.87——约为 Flash 定价的五倍,而八月降价前这一比例约为十四倍。在实际编码任务中,Flash 与 Pro 的差距仅在几个百分点之内(例如,聚合报告显示 SWE-bench Verified 约 79% vs 约 80.6%),并且 -0731 后训练升级使 Flash 本身也成为强大的智能体。最困难的推理和最高要求的多文件编码任务应使用 Pro;绝大多数高调用量场景应使用 Flash——按难度路由,即可用约五分之一的价格获得 Pro 的大部分质量。

关键要点

• 规模与价格:Flash 为 284B / 13B 激活参数,价格为 $0.08 / $0.18;Pro 是规模大得多的旗舰型号,价格为 $0.435 / $0.87 —— Flash 的价格约为其五分之一,而 Pro 的 GA 降价将原先约 14 倍的差距缩小到了约 5 倍。

• 编码差距很小:聚合器 SWE-bench Verified 约 79%(Flash)对比约 80.6%(Pro,预览版时期;GA 版本尚无独立分数);在 DeepSeek 的测试框架上,GA Pro 在 Terminal-Bench 2.1 上取得 87.9,而 Flash 为 82.7。

• 两者都共享 1M-token 的上下文和 384K 的输出;两者都是纯文本,具备推理、工具和 JSON 功能。

• Flash 的推理速度更快且服务成本更低(p50 TTFT 约 394 ms,约 184 tok/s);Pro 则以速度换取峰值性能。

• 最佳实践:按难度路由 — Flash 负责大量任务,Pro 负责少数困难任务。

每个模型是什么

V4 Flash 是效率型层级:一种混合专家模型,总参数 284B,但仅约 13B 激活参数,支持 1M token 上下文,最高 384K 输出,专为高吞吐量、低延迟的智能体工作而调优。其官方 -0731 版本(2026 年 7 月 31 日发布)是一次训练后升级,增强了智能体、编码和工具使用能力,并新增了对原生 Responses-API 和 Codex 的支持。V4 Pro 是 DeepSeek 的旗舰模型——一个规模大得多的模型,专为最困难的推理和编码任务而构建,在这些场景中,最大能力比成本更重要。它从 4 月起以预览版形式运行,随后于 2026 年 8 月 12 日转入正式 GA 版本,价格大幅降低。两者同属 V4 系列,共享 1M 上下文、纯文本输入以及推理/工具/JSON 支持。

能力:Flash 与 Pro 有多接近?

比价格差距所暗示的更接近,至少在实用编码方面是这样。聚合评估将 V4 Flash (Max) 在 SWE-bench Verified 上的得分定在约 79.0%——即解决真实 GitHub 问题——而 V4 Pro 在预览期测试时约为 80.6%。正式版构建(0813)太新,尚未有独立评分公布,因此目前可用的最佳 Pro 对比来自 DeepSeek 自己的测试框架,其中正式版构建在 Terminal-Bench 2.1 上取得 87.9,在 DeepSWE 上取得 62.7,而 Flash 的 -0731 版本分别为 82.7 和 54.4(均为 DeepSeek 报告)。Pro 真正领先的地方在于最难的部分:最复杂的多步推理、最棘手的多文件编码,以及更大活跃参数预算确实有帮助的任务。如果你的大部分工作属于“困难但未达前沿”,Flash 足以覆盖;将 Pro 保留给真正前沿的小部分。

价格与速度:Flash 的决定性优势

这是两者分化最明显的地方——也是定价计算刚刚发生变化的地方。Flash 每百万输入/输出 token 的价格为 $0.08 / $0.18;V4 Pro 官方 GA 版本(0813)为 $0.435 / $0.87——约为 Flash 价格的五倍。这仍然是真正的溢价,但仅是降价前约 14 倍差距的一小部分:旧的 deepseek-v4-pro 报价为 $1.168 / $2.336,因此 GA 版本大约便宜了 63%。在每月 1000 万 token、70% 输入的场景下,Flash 大约需要 $1.10,Pro 大约需要 $5.66——当你扩展到数十亿 token 时,这一比例仍然成立。Flash 还为高吞吐量而设计(p50 TTFT 约 394 ms,约 184 tok/s),因此它更适合延迟敏感、高并发的代理场景。Pro 的溢价买到的是峰值能力,而非速度或成本节省——但随着差距从约 14 倍缩小到约 5 倍,顶级性能余量的价格已经大幅下降。

正确的模式:按难度路由

你不必只选一个。最经济的高质量配置会把大部分简单到中等难度的请求发送给 Flash,只将最难的升级到 Pro。由于两者同属一个系列,拥有相同的上下文和接口,这种路由切换是无缝的——而且 -0731 升级意味着 Flash 现在能处理更多中间层级的请求,之后才需要升级。如果做得好,按难度路由能以接近 Flash 的成本带来 Pro 的大部分质量,而 GA 降价则让偶尔升级到 Pro 的成本比预览期间明显更低。

你该选哪个?

如果……,请选择 V4 Flash

您运行着大量智能体(agentic)、编码或长文档类工作负载,成本与速度至关重要,而“接近旗舰级”的质量就已足够——经过 -0731 升级后,这已覆盖相当广泛的应用场景。

如果……,请选择 V4 Pro

你需要在最困难的推理和最严苛的多文件编码上获得最大能力,并且愿意为这种顶级余量支付约 5 倍于 Flash 的价格——这比预览版时代约 14 倍的溢价要容易接受得多。

通过一个端点同时使用两者

这两款均可在OrcaRouter上以 0% 加价通过一个 OpenAI 兼容端点获取——Flash 对应deepseek/deepseek-v4-flash-0731,Pro 则对应官方deepseek/deepseek-v4-pro-0813 GA 版本——因此你可以将按难度路由作为一种配置选项,在自己的任务上对两者进行基准测试,并无需重新集成即可切换流量。这是既获得 Flash 的成本节省、又让 Pro 随时应对少数难题的最简单方式。

常见问题

V4 Flash 和 V4 Pro 一样好吗?

在实际编码方面,几乎持平——聚合器SWE-bench Verified约为79%对比80.6%(Pro为预览版时期的数据;GA版本尚无独立评分)。在最难的推理和最复杂的编码方面,Pro领先。经过-0731升级后,对于大多数工作负载,Flash已经足够了。

V4 Flash 便宜多少?

Flash 的价格大约是 Pro 的五分之一:每百万 tokens 为 $0.08 / $0.18,而 GA Pro 为 $0.435 / $0.87。在 Pro 八月降价之前,差距约为 14 倍;现在约为 5 倍。

它们共享相同的上下文窗口吗?

是的——两者都提供 1M-token 的上下文(1,048,576)以及高达 384K 的输出。

哪个更快?

Flash,按设计——p50 首 token 时间约 394 毫秒,约 184 token/秒,专为高吞吐量、低延迟使用而调优。

我可以同时使用两者吗?

是的——通过 OrcaRouter 的单一端点按难度路由:Flash 处理高容量任务,Pro 处理最困难的任务。

底线

{{1}}V4 Flash 与 V4 Pro 的对比,本质上是效率与顶尖能力的取舍。Flash 能提供 Pro 大部分实用的编码能力,经过 -0731 升级后还拥有真正强大的智能体,价格约为 Pro 的五分之一,速度也更快;Pro 的正式 GA 版本则是应对最艰巨任务的旗舰之选,其降价幅度——降至 $0.435 / $0.87,约为 Flash 的五倍,而非此前的十四倍——让这一顶级能力变得前所未有的亲民。明智的选择并非二选一——而是像 OrcaRouter 那样按任务难度路由到同一端点,让海量常规请求在 Flash 上低成本运行,只有少数高难度任务才需要为 Pro 付费。{{/1}}

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube