
Step 5 预览:StepFun 尚未发布的 600B 旗舰模型已登上排行榜
第5步预览拥有排行榜排名、已公布价格、实测输出速度和44分的智能指数得分——与Kimi K3相同,而后者规模约为其五倍。它唯独没有的是正式发布。StepFun尚未宣布它,StepFun自家的平台文档中也未列出它,也没有可供下载的权重。以下所有数据均来自在厂商公开发声之前就已获得访问权限的第三方,因此这是一篇“目前已知”的报道,而非评测。请将这些数字视为即将到来的证据,而非规格表。
泄密本身就是新闻
Step 5 Preview 首次公开露面的痕迹,是一次评测运行。Artificial Analysis 已为其上线了模型页面,通过阶跃星辰自家的 API 以测试标签step-5-preview-b完成评分,平台将该模型的日期标注为 2026 年 9 月 18 日。本文中的 44、定价、速度实测数据以及各项基准测试成绩,均出自该页面。
相比之下,厂商这边却是一片空白。StepFun 的开发者文档列出的模型最高只到 Step 3.7 Flash 和 Step 3.5 Flash 便戛然而止——没有 step-5,也没有预览条目。stepfun-ai 的 Hugging Face 组织下没有 Step 5 仓库,这与闭权重旗舰产品的定位相符,而非疏忽。中国开发者论坛上的社区报告指出,9 月 19 日在上海举行的 AGI Frontier 活动上可能将正式亮相,而这大约是在相关评测出现的一天之后。截至本文撰写时,StepFun 之外的任何人都还没有该正式发布版本的官方规格、官方价格或官方名称。
命名本身就是第一条线索,表明这是一次预览,而非正式发布。StepFun 完全跳过了 Step 4.x 系列,直接进入 Step 5。一款以 Preview 后缀发布的模型,在还没有产品页面时就已经过基准测试,说明厂商仍在对其进行校准——定价、路由和限额在全面可用之前都可能发生变化。
就任何人所能判断的而言,这份规范看起来是什么样子
这些是正在流传的数字,也是该泄密事件中最常被重复的说法——但这与其中最被证实的说法不是一回事:
• 总参数量——约600B,而Kimi K3约为2.8T
• 每次推理激活约 27B,约占总量的 4.5%,这是一个异常稀疏的混合专家比例
• 输入模态——文本和图像;输出仅为文本
• 推理 — 是,启用扩展思考
• 上下文窗口 — 在 Artificial Analysis 上为 100 万 token;另一份在开发者工具中流传的第三方配置列出 350,000,最大输出为 64,000
• 权重可用性 — 已关闭,无仓库
这个上下文窗口的矛盾值得明确指出,因为还没有任何人解决它。1M token 窗口和 350k token 窗口是两种不同的产品,内存成本也不同,而且第二个数字还附带 64k 输出上限,而第一个对此只字未提。如果你正基于 1M 这个数字来规划长文档流水线,那么 350k 配置就是你应该等待厂商页面的原因。参数数量也有类似的模糊性:DataLearner 的追踪器仍将 Step 5 Preview 的 MoE 架构和参数数量记录为不可用,这意味着 600B/27B 这一对数字——关于该模型被引用最多的单一事实——也是官方确认最少的事实之一。
有趣的数字是27B,而不是600B
稀疏混合专家模型只把算力花在 token 实际路由到的专家上,因此真正决定模型在生产环境中行为表现的,是激活参数量。Step 5 Preview 的激活参数约为 27B,其单 token 计算量与体量仅为其零头的模型处于同一区间,而 600B 的总参数量在很大程度上只是一个内存占用问题。
由此产生两个结果,二者都体现在第三方测量中。服务成本与激活参数挂钩,这也是价格处于当前水平的部分原因。而且每 token 速度也从中受益:Artificial Analysis 测得的输出速度为每秒 99.8 个 token,在 200 个模型中排名第 42,而中位数为 64.6。首 token 时间为 2.96 秒,中位数约为 3.57 秒。如果 600B/27B 的拆分是准确的,那么这是一个旨在降低服务成本而非托管成本的模型——如果你付的是 GPU 的钱而不是 token 的钱,这一区别很重要。
它在Intelligence Index上的位置
Artificial Analysis 在 Intelligence Index v4.3 上给 Step 5 Preview 打出 44 分,该指数纳入了十项评估。这在榜单上的 200 个模型中排名第 25 位,远高于该指数所评分模型的中位数,即 25 分。
• Intelligence Index — Step 5 Preview 44 对比 Kimi K3 44
• 正上方 —— GLM-5.3 和 Claude Opus 5,两者均为 45
• 紧随其后 — DeepSeek V4.1 Flash 以 40 分,DeepSeek V4 Pro 以 36 分
• Terminal-Bench 4.0 — Step 5 Preview 为 33.3%,相较 Kimi K3 约为 12.6%,相较 DeepSeek V4.1 Flash 则为 26.8%
• SciCode — Step 5 Preview 为 59%,与 Kimi K3 持平
• 输出速度 — 每秒 99.8 个 token,而同领域中位数为 64.6
标题落在与 Kimi K3 打平这件事上,而诚实的解读比标题所暗示的要更有限。用 600B 总参数在综合指数上追平一个 2.8T 参数的模型,确实是一项实打实的效率成果,但综合指数掩盖了它的形状:Terminal-Bench 4.0 的差距明显偏向 Step 5 Preview,而 SciCode 的结果则是完全不相上下。指数上的综合持平并不等于处处持平,而预览版恰恰是最不该假设这些差距会保持住的时刻。
还有一个值得点名的差异:Artificial Analysis 报告为 44,而 DataLearner 的独立追踪器将同一轮测试记录为 43.6。这是四舍五入造成的差异,而不是对能力判断的分歧,但这类情况恰恰说明了这个模型各项数字的普遍问题——它们是对一个尚未公布的模型的第三方读数,采集时间略有不同,而且没有一项得到 StepFun 的确认。这些基准测试结果都不是厂商报告的,这一点具有两面性:StepFun 没有任何人在这里声称过某个数字,也没有任何 StepFun 的人为某个数字背书。

价格,以及蚕食它的冗长言辞。
定价是这次泄露中最早会影响预算的部分。通过StepFun的API,Artificial Analysis记录了以下内容:
• 输入 — 每百万token $1.00,而同类模型的中位数为 $1.88
• 输出 — 每百万 token $2.70,而中位数为 $10.00
• Cache — 95% 缓存折扣,使缓存命中的成本约为每百万个 token 0.05 美元
• {{1}}综合{{/1}}——在 7:2:1 的缓存命中、输入与输出配比下,每百万 token 约 $0.51
• 每个 Intelligence Index 任务的成本 — $0.71
• 一次完整索引运行的成本 — 总计 $918.34
输出价格 2.70 美元这一项最关键,因为它还不到 Kimi K3 对同样一百万 token 收取 15.00 美元的五分之一。但有一个按 token 对比所掩盖的隐情,而 Artificial Analysis 直接对其进行了衡量:冗长程度。Step 5 Preview 为完成 Intelligence Index 生成了 1.6 亿个输出 token,而该领域的中位数为 9000 万个,且在这一指标上位列 200 个中的第 65 名。
把这件事算清楚。按每百万 $2.70 计算,1.6 亿输出 token 大约是 $432——差不多占整个索引运行总成本 $918.34 的一半,而且这笔钱花在了模型自身的啰嗦上,而不是花在任务上。把同样的 1.6 亿 token 按 Kimi K3 每百万 $15.00 的输出费率跑一遍,你就到了 $2,400,价格优势正是从这里来的。但真正的实用警示,是给那些直接拿另一个模型的 token 数来估算成本的人:Step 5 Preview 的输出量约为中位数的 1.8 倍,所以一个输出密集型的工作负载会同时买到更便宜的费率和更多的 token。折扣依然成立,但没有 $1.00/$2.70 对 $3.00/$15.00 看上去那么大,而折扣的幅度完全取决于你的提示词让模型变得有多能说。
95% 的缓存折扣是另一个杠杆,而且它异常激进。对于提示词高度复用的工作负载——一段很长的系统提示词、一份固定文档、一个共享代码库——其成本会远远更接近混合后的 $0.51,而不是 $1.00 的输入费率。这个混合数字假设了 7:2:1 的比例,这是一种建模假设而非保证,但用这种算术结构来对照你自己的流量进行测算,方向是对的。

早期测试人员遇到了什么问题
这些是泄密事件前后几天内来自开发者论坛和社交帖子的个人报告,并非测量数据,因此应当据此给予相应的权重:
• 工具调用是最常见的抱怨——选错了工具名称,以及未先读取目标文件就尝试编辑
• 据报告,当上下文超过约 340,000 个 token 后会出现错误;如果 1M 窗口最终被证实是真实数值,这就是需要留意的故障模式
• 内容过滤在某些提示词下截断输出
• 能力印象存在分歧:一些测试者将其排在 GLM-5.3 Flash 之上,另一些则将其排在 DeepSeek V4.1 Flash 之下
一个尚未发布的预览版本在工具使用上失败,算不上丑闻——这正是“预览”标签的意义所在。但这确实意味着,44 分不应被解读为对智能体可靠性的承诺,因为 Intelligence Index 并未测试早期测试者抱怨最多的那件事。
实际上你会怎么称呼它——以及在此期间该用什么
OrcaRouter 不路由 Step 5 Preview。目前没有公开端点,也没有权重,因此没有什么可路由的;而且目前也没有任何第三方平台能诚实地声称并非如此。今天任何告诉你到哪里调用它的人,描述的都是一个评估端点,而不是一个产品。
拿来与它比较的模型则是另一回事。Kimi K3、GLM-5.3 和 DeepSeek V4.1 Flash 都可以通过 OrcaRouter 使用,与来自 15 家提供商的 199 个模型一起,仅凭一个 API 密钥和一份账单即可访问。定价按提供商的标价透传,0% 加价,这在像这样一款模型上比平时更重要:如果 Step 5 Preview 的 $1.00/$2.70 在发布时保持不变,之后又发生变动,透传路径会在同一天调整,而不是按别人的重新定价时间表来走。
当它真正变得可调用时,运行一个与未发布版本相邻的模型的明智方式,就是你对待任何尚未信任的模型的方式——把它放在带有自动故障转移的路由之后,这样工具调用失败或长上下文错误就会落到一个能正常工作的模型上,而不是把你的应用一起拖垮。这正是早期报告在此处特别主张的模式:一个据报存在工具调用问题和长上下文错误的预览版本,恰恰是你希望后面有回退的模型,而不是你希望让它独自处在生产路径上的模型。

什么会让这从泄露变成发布
有三件事值得关注,按它们能解决问题的程度排序。第一,StepFun 自家开发者平台上的模型页面和定价——一旦 step-5出现在模型列表中,厂商规格表就会取代本文中所有第三方解读,包括 600B/27B 这对参数和 1M 上下文窗口的说法。第二,1M 与 350k 上下文矛盾的解决情况;在 1M 窗口下 64k 的输出上限对任何构建长文档或智能体流水线的人来说都是实质性差异,而目前这一点尚未解决。第三,这一定价是发布姿态还是永久定价——中国旗舰模型上的预览定价在容量紧张后变动是有先例的,而每百万输出 token 2.70 美元已经激进到足以让人提出这个问题。
至少在其中第一项落地之前,诚实的总结是:Step 5 Preview 看起来是一个真正高效的模型——600B 总参数完成 2.8T 级别的总体工作量,价格却比同行低好几倍——但规格尚未得到验证,存在实实在在的冗长税,工具调用的口碑也还没挣到。值得围绕它做规划,但还不值得把生产路径押在它上面。
本文中的对比4
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
