生成的标题卡标题为"Step 5 Preview 对比 DeepSeek V4 Pro——你可以下载到什么",包含两列:Step 5 Preview 在 AA Index 上为 44,总参数 600B / 激活参数 27B,权重承诺于 10 月 15 日发布,而代码仓库中只有一个 .gitattributes 文件;DeepSeek V4 Pro 在 AA Index 上为 36,总参数 1.6T / 激活参数 49B,权重采用 MIT 许可且现在即可下载,并在 Hugging Face 上提供完整检查点。页脚写着"两项指数数据均来自 Artificial Analysis Intelligence Index v4.3.2,在最高推理努力程度下测得。"
Guides & Insights

Step 5 Preview 对比 DeepSeek V4 Pro:一个是承诺,另一个是 MIT 许可证

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这场对比的关键全在于一个与跑分毫无关系的问题:你到底能下载到什么?DeepSeek V4 Pro——即厂商于 2026 年 8 月 13 日以 DeepSeek-V4-Pro-0813 之名发布的版本——是一个采用 MIT 许可证的 1.6 万亿参数混合专家模型,其权重此刻就挂在 Hugging Face 上。Step 5 Preview则是 StepFun 于 2026 年 9 月 20 日发布的 6000 亿参数稀疏 MoE,在同一个独立榜单上高出八分,而它在 Hugging Face 上的代码库中只有一个文件,.gitattributes。StepFun 表示 BF16 检查点将于 10 月 15 日到位。所以,这场比较的真实面貌并不是“哪个模型更好”,而是“这两者中,哪一个是你本季度就能拿来开发的,哪一个是你还在等的”。

这种表述不像基准测试对决那样令人兴奋,却要有用得多,因为八分的差距和二十五天的等待并不是同一类事实。其中一个你今天就能据此做规划。

八个要点,以及其中真正重要的四个

Artificial Analysis 让这两个模型都跑了一遍 Intelligence Index v4.3.2——共十项评估——而这是它们唯一一次由同一方进行衡量的地方。

• 智能指数 — Step 5 Preview 44 对比 DeepSeek V4 Pro 36

• 在该榜单上的排名 — Step 5 Preview 排 200 个中第 24 名,而 DeepSeek V4 Pro 在其类别 113 个中排第 7 名

• Terminal-Bench 4.0 — Step 5 Preview 33.3%;DeepSeek V4 Pro 未列在同一榜单上,因此没有可引用的同类可比 agentic 行

• 输出速度 — Step 5 Preview 99.8 tokens/秒,对比 DeepSeek V4 Pro 88.8 tokens/秒

• 首token时间 — Step 5 Preview 2.96秒 对比 DeepSeek V4 Pro 1.69秒

• 每 100 万 tokens 价格 — Step 5 Preview 输入 $1.00 / 输出 $2.70,对比 DeepSeek V4 Pro 在 DeepSeek 高峰时段输入 $1.32 / 输出 $3.96,非高峰时段减半至 $0.66 / $1.98

• 缓存折扣 — Step 5 Preview 95% 对比 DeepSeek V4 Pro 97%

• 上下文——两者均为 100 万 tokens;DeepSeek 公布了 384,000 token 的输出上限,StepFun 尚未公布

• 权重 — Step 5 Preview 已关闭,BF16 检查点定于 10 月 15 日;DeepSeek V4 Pro MIT,现已可下载

有两行数据与标题结论相抵。DeepSeek V4 Pro 在 1.69 秒内给出首个 token,而 Step 5 Preview 需要 2.96 秒——每次调用都领先 43%,放到漫长的智能体循环里,就会累积成实实在在的实际耗时。而且它的缓存折扣还高出两个百分点,而这恰恰对这两款模型所主打的负载最为关键:一个在每一轮都重发相同系统提示词和代码库上下文的智能体,几乎完全活在这份折扣之中。

八分的综合差距是真实存在的,但它也比八分这个数字听起来要小。一个指数由十项评估复合而成,而两者的构成差异正是两个模型拉开距离的地方。Step 5 Preview 在 Terminal-Bench 4.0 上 33.3% 的成绩是货真价实的智能体结果;DeepSeek V4 Pro 自身的招牌优势则是长时程推理,其价格在开放权重阵营中无出其右。两个榜单都没有发布二者直接对阵的一行,而这正是这场比较无法用单一数字定论的实情所在。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

当供应商改变主意时,“开放”能为你带来什么

这是这场对比中规格表无法承载的部分,而且值得用确切日期来说明,因为它发生在 Step 5 Preview 公布之前十一天。

DeepSeek 曾告知用户将停用 V4 Pro。9 月 9 日,该公司表示请求将被路由到更新的 DeepSeek V4.1 Flash;9 月 10 日,它将日期确定为北京时间 9 月 14 日 12:00。9 月 11 日,它又推翻了这个决定——用 DeepSeek 自己的话说,V4 Pro API 服务在 9 月 14 日之后继续提供,计费不变。模型字符串、100 万 token 上下文和 500 请求并发上限都仍与原来一致,而 DeepSeek 的模型与定价页面将这一反转作为脚注标注在 deepseek-v4-pro 行上。

请把这理解为对以下两点的展示:开放权重实际上能保护你免受什么,以及它们不能保护你免受什么。那个 API 几乎因为一项排期决定而被拿走。而权重不会。一个运行在你自己硬件上的 MIT 许可检查点,没有哪个供应商能宣布它退役,而这与价格承诺是不同性质的保证——它根本就不是承诺。

这正是 Step 5 Preview 眼下所处的缺口。StepFun 已承诺在 10 月 15 日推出 BF16 检查点,而它已经预留的仓库名——stepfun-ai/Step-5-Preview-BF16——正是你据以微调和量化的格式,创建时命名,之后再填充。这是排期信号,而不是偶然产物。只要仓库里除了 .gitattributes之外别无他物,Step 5 Preview 就是一个你租用的模型,按单一厂商的条款提供,没有阅读许可,如果条款变化也没有退路。

成为便宜选项的两种方法

这两款模型的定价都远低于封闭前沿模型,而它们的机制并不相同,这一点关系到价格能维持多久。

DeepSeek V4 Pro 之所以便宜,是因为一家实验室公开了权重,而竞争激烈的推理服务市场把利润挤了出去。这是一个结构性的底价:任何人都可以部署这个检查点来提供服务,所以价格由 GPU 小时成本决定,而不是由某家公司的定价策略决定。DeepSeek 自己的 API 采用两个时段定价——高峰时段为 1.32 美元和 3.96 美元,非高峰时段减半——而高峰时段很窄,只是 UTC 工作日上午的几个小时,因此大多数流量都落在更便宜的费率上,周末则从不会遇到更高那档价格。

Step 5 Preview 之所以便宜,是因为 StepFun 决定如此定价。只有一个端点、一份价目表,没有第二个来源。这并非指控——一个 600B/27B 的稀疏模型,其服务成本确实低于参数量所暗示的水平,而激活参数比例正是原因所在。它只是一种不同性质的价格,而等到 StepFun 决定预览版已完成使命的那一天,这种差异就会显现。

两者之间的价格差距小到不应该决定任何事情:$1.00 和 $2.70 对 $1.32 和 $3.96,在输入上相差 24%,在输出上相差 32%,完全落在缓存折扣、输出长度差异或重试率足以抹平的范围内。在冗长程度上,两者很接近——Step 5 Preview 在索引运行中生成了 160M 输出 token,而中位数为 92M,DeepSeek V4 Pro 自己的运行也处于同一区间。两者都不是省钱的模型,而且它们主打的都是每个 token 便宜,而非每个任务便宜。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs DeepSeek V4 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, TTFT 2.96s, and weights due October 15. The right column gives DeepSeek V4 Pro the rows AA Index 36, parameters 1.6T total / 49B active, price $1.32 / $3.96, cache discount 97%, TTFT 1.69s, and weights MIT-licensed and downloadable now. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort.'

在真实技术栈中,每一项各自应处的位置

如果你需要一个可以微调、量化、托管在自己的 VPC 中,或者交给法务团队时能附上一份他们看得懂的许可证文件的模型,那就无需纠结,也与基准测试无关。DeepSeek V4 Pro 如今已以 MIT 许可证提供。Step 5 Preview 没有许可证、没有配置,也没有参数文件,而且你最早能围绕其做规划的时间是十月中旬。八分的指数差距不会改变这笔账,因为你无法下载的模型就无法部署。

如果你想要的是每百万输入 token 一美元价格下可用的最强智能体表现,那么 Step 5 Preview 在唯一一个同时测评过两者的榜单上处于领先,而且对于占智能体循环大部分时间的试错类工作——抽取、分类、测试脚手架,以及真正重要的那两类调用之间的例行调用——它是更好的默认选择。它每秒 99.8 token 的输出速度也快于 DeepSeek V4 Pro 的 88.8,这不仅缩短了账单,也缩短了循环本身。

棘手的情况恰恰是大多数团队实际所处的境地:你想要 Step 5 Preview 的那个数字,却无法把一个上线首日才开放的预览端点、且尚无公开输出上限,放到生产路径上。这是个路由问题,也正是这次对比最终落脚的地方。通过 OrcaRouter 可以按每百万 token $0.66 和 $1.98 的价格访问 DeepSeek V4 Pro,这是 DeepSeek $1.32 和 $3.96 价目表的非高峰半价,与之相伴的周边文本模型也是如此——一个密钥即可调用 200 多个模型,零加价,因此 DeepSeek 一旦调价,当天就会体现在你的账单上,而不是等到续约时。把探索性流量引向预览版,把生产路径留在有许可证支撑的模型上,同时靠跨提供商的自动故障转移来完成预览端点容量曲线所必然要求的工作。

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro at www.orcarouter.ai/models/deepseek/deepseek-v4-pro, showing the model id deepseek/deepseek-v4-pro, a 1M-token context and 384K max output, input pricing of $0.66 and output pricing of $1.98 per million tokens, a p50 time to first token of 4.01 seconds, 3,730M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

什么能解决这个问题

三件事,而且这三件事都是可核查的,而不是可争辩的。

第一项是许可证。当 BF16 检查点发布时,仓库会说明企业被允许用它做什么?宽松许可证本身就能弥合这一差距的大部分,因为它让这八分的领先优势成为你可以拥有、而非只能租用的东西。限制性许可证则会让 DeepSeek V4 Pro 成为这对模型中唯一一个你真正能用来构建产品的模型。

第二点是输出上限。{{KEEP}}DeepSeek{{/KEEP}} 公布的是 384,000 个 token。{{KEEP}}StepFun{{/KEEP}} 的公告称上下文为 100 万,且未提及输出上限,而泄露期间流传的一份独立的第三方配置则列出 350,000 的上下文与 64,000 的输出上限。对于这两款模型所面向的长周期智能体(agentic)工作而言,这个数字绝非无关紧要的注脚。

第三点是:一旦预览版后缀摘掉,价格还能不能站得住。预览版价格是获客数字;正式发布版价格才是商业模式。DeepSeek V4 Pro 的价格下限由竞争充分的服务市场决定,动不了多少。而 Step 5 Preview 的价格,可能随便哪个周二就变了。

在前两者得到解答之前,务实的解读是:{{1}}DeepSeek V4 Pro{{/1}}是你部署的模型,而{{2}}Step 5 Preview{{/2}}是你用来对标评测的模型——但需要注意,一个才上线几天、却比一个成熟的{{3}}MIT{{/3}}许可旗舰模型高出八分的预览端点,是一个实打实的结果,也正是为什么10月15日值得在日历上记一笔,而不是耸耸肩了事。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新