生成了一张标题卡,标题为“Step 5 Preview — 仓库怎么说”,列出了六行:总参数量 600B,每 token 激活 27B,上下文窗口 1M tokens,输入为文本和图像,AA Intelligence Index 44,价格 $1.00 输入 / $2.70 输出。页脚写着“StepFun 于 2026 年 9 月 20 日公布;权重定于 2026 年 10 月 15 日发布。指数数据来自 Artificial Analysis。”
Engineering & Research

{{1}}第 5 步预览版公布:{{/1}}StepFun 的 600B 旗舰机型实际交付了什么,还有哪些缺失

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

StepFun 宣布Step 5 Preview于 2026 年 9 月 20 日发布——这是一款拥有 6000 亿参数的稀疏专家混合旗舰模型,每个 token 激活 270 亿参数,具有 100 万 token 上下文窗口、原生图像输入,以及 Artificial Analysis Intelligence Index 得分 44。API 同日开放。没有开放的是模型本身:Hugging Face 仓库stepfun-ai/Step-5-Preview-BF16在公告发布当天下午就已存在,并且仅包含一个文件,.gitattributes,没有权重、没有许可证、没有模型卡,也没有配置。StepFun 自己的材料将开放权重发布日期定在 2026 年 10 月 15 日。因此,对这次发布最诚实的一句话总结是:该模型今天即可调用,约三个半星期后可下载,而这是两件不同的事。这也正是本博客今天早些时候作为未经宣布的泄露所报道的同一个模型,当时在 StepFun 发布产品页之前,它在一个测试标签下进行了基准测试——这提醒我们,一次预览可以从泄露变为正式发布,而其中任何数字都无需改变。

这个仓库只是个占位符,事情就是这样。

当供应商发布权重时,仓库就是证据。它包含许可证文件、一个写有参数数量的 config、一份说明预期用途和评估表格的 README,以及总大小能告诉你参数声明是否真实的 safetensors 分片。stepfun-ai/Step-5-Preview-BF16却没有这些。它的 Hugging Face API 记录显示创建时间戳为 2026-09-20T03:52Z,下载量为零,两个点赞,空的 config 对象,没有 pipeline_tag,没有许可证,且只有一个同级文件。StepFun 组织页面列出了它,却没有列出其他任何 Step 5 仓库——没有 FP8 构建,没有 NVFP4 构建,没有 GGUF,也没有六月伴随 Step-3.7-Flash 出现的任何量化变体。

把它理解为排期,而不是什么谜团。仓库名里的 BF16 后缀就是线索:一个打算先发布 bfloat16 检查点的实验室——那是你用来微调和量化的格式,之后才会推出 FP8 和 NVFP4 的推理部署版本——会在创建仓库时就那样命名,之后再往里面填内容。StepFun 在其自己的公告材料中说了 10 月 15 日。在那之前,这个仓库只是一种意图声明,它唯一能证明的,就是 StepFun 已经占用了这个命名空间。

这一点之所以重要,是有实际原因的。Preview后缀以及缺失的权重,是同一个信号,指向同一个方向:模型可以调用,定价已经确定,而你想在自己硬件上运行的产物尚不存在。任何假设在十月中旬之前就能自托管 Step 5 Preview 的计划,都是背后没有产物的计划。

实际上宣布了什么

StepFun 的定位很窄、很具体:Step 5 Preview 是一款面向真实世界 agentic 工作的基础模型——AI 编程、软件工程、专业知识工作与金融——重点在于长上下文、多轮工具调用和持续执行,而非对话质量。该公司完全跳过了 Step 4.x 系列,从 Step-3.7-Flash 直接跳到 Step 5,这本身就是在表明它认为这是一次多大的跨越。

有一个日期细节值得指出,因为这类事情容易打乱采购日程:Artificial Analysis 将这款模型标注为 2026 年 9 月 18 日,比 StepFun 自己的公告早两天。榜单会在能够访问到某个模型时对其进行评分,而这两天的差距,正是模型变得可调用与厂商撰文介绍之间常见的滞后。StepFun 的公告——9 月 20 日,API 和 Studio 同日开放——才是应当引用的日期,而 10 月 15 日的权重日期也来自同样的材料。

已发布的规范:

• 总参数量 — 600B,稀疏专家混合

• 每个 token 的激活参数量 — 27B,约占总量的 4.5%,这是一个异常稀疏的比例

• 上下文窗口 — 1M tokens

• 输入 — 原生支持文本和图像;输出仅为文本

• 推理 — 是,启用扩展思考

• 价格——每百万输入 token 1.00 美元,每百万输出 token 2.70 美元,并享有 95% 的缓存折扣

• 可用性 — API 和 Studio 自 9 月 20 日起开放;权重计划于 10 月 15 日发布

StepFun 主打的效率主张是,600B/27B 的拆分让该模型站上了帕累托前沿——即单位算力所能换来的能力——而公司将其表述为同一追求的三代成果,从 Step-3.5-Flash 到 Step-3.7-Flash,再到这一代。这是一个连贯的故事,而稀疏比例正是其中的机制:在 27B 激活参数下,每 token 的服务成本落在一个小得多的模型区间内,而 600B 总参数则主要是一个内存占用问题。

厂商声称,以及旁边的第三方数据

发布材料中出现了两类数字,它们不应被同等解读。StepFun 自己的评测是第一类:一项单任务成本声明,为 Claude Opus 5 的八分之一;在 ALE-CLI、FrontierFinance 和 DRACO 上位列第二,仅次于 GPT-6 Astra 或 Claude Opus 5;一次 24 小时的 GPU 内核优化运行,将 MLA 内核峰值性能提升至 508 TFLOPS,而 Claude Opus 5 为 493;一项自动化后训练实验,使 Qwen3-30B-A3B 在 AIME24 上从 53.3% 提升至 60%;DeepSWE v1.1 为 67.7%,其自研的 StepCodeBench 为 49.0%。StepCodeBench 由 StepFun 自己构建——553 个代码仓库、九种任务类型、33 种编程语言——这使它成为衡量自家模型的合理工具,而非独立工具。

第二类指标由他人测评,也正是需要据此规划的部分。Artificial Analysis 在 Intelligence Index v4.3.2 上给 Step 5 Preview 打出 44 分,在 200 个模型中排名第 24 位——与 Kimi K3 持平,比 GLM-5.3 低一分,与 Claude Opus 5 的中等推理强度设置持平。在 Terminal-Bench 4.0 上,同一榜单记录其成绩为 33.3%,领先于 DeepSeek V4.1 Flash 的 26.8%,也大幅领先于 Kimi K3 约 12.6% 的成绩。输出速度实测为每秒 99.8 个 token,首 token 延迟为 2.96 秒——两项数据均来自同一次独立测试,而这类数字恰恰决定了智能体循环用起来是否有交互感。

有一个第三方数字则指向相反的方向,值得与价格并列呈现。同一次索引运行中,Step 5 Preview 使用了 1.6 亿输出 token,而所有被评分模型的中位数为 9200 万——这个模型很啰嗦。按每百万输出 token 2.70 美元计算,这种啰嗦并非免费:1.6 亿输出 token 约为 432 美元,占该次运行总成本 922.84 美元的一部分;而在收费高三倍的模型上,它将成为账单上的主导项。低廉的标价与每个任务高昂的 token 用量是同一个数字的两半,而每个索引任务的成本——0.71 美元——正是已经同时包含这两者的那个数字。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

这次泄密说对了什么,以及它唯一没能说清的事

本博客早前的报道基于一次在任何公告发布之前出现的评测运行撰写,并标注了其中无法确认的说法。公告解决了其中大部分问题。600B/27B 这一组合如今是厂商明确给出的,而非推测而来。1M token 的上下文窗口如今已写入 StepFun 自家的规格说明,而不只是出现在第三方榜单上。1.00 美元和 2.70 美元的价格就是实际价格。名称是 Step 5 Preview,而非传闻中的其他名称。

公告没有做到的是,化解泄露报道所引发的上下文窗口矛盾。一份在开发者工具中流传的独立第三方配置将该模型列为具有 350,000 个 token 的上下文,最大输出为 64,000 个 token。100 万窗口和 35 万窗口是不同的产品,内存成本也不同,而 6.4 万输出上限对于这款模型所主打的长时程智能体工作来说,正是一个硬性约束。StepFun 的公告说的是 100 万,并且没有提及输出上限。在你构建依赖这一答案的流水线之前,值得弄清楚你的路由最终会落在哪一个上,而这是应该问供应商文档、而不是问排行榜的问题。

发布没有改变的另一件事是独立复现。上面每一行不是来自 Artificial Analysis 的基准测试结果,都是 StepFun 自己的,运行在 StepFun 的测试框架上,而且没有第三方复现过这些智能体结果。今年中国实验室旗舰模型的模式是:综合指数保持稳定,而厂商的主打数据会漂移;请把综合指数当作规划数字。

今天可以调用什么,以及在此期间应将什么路由

Step 5 Preview 不在我们的目录里,OrcaRouter 也不对它进行路由——StepFun 那边有公开的 API 和 Studio,它就是在那里运行的。我们真正拥有的是它被用来对标的那组模型,一个密钥就能全部调用:DeepSeek V4.1 Flash 输入 $0.15、输出 $0.60(每百万 token),GLM-5.3 为 $1.26 和 $3.96,而 Z.ai 标价为 $1.40 和 $4.40,Claude Opus 5 为 $5.00 和 $25.00,Kimi K3 也在其列。这就是接下来三周的实际格局:一个你可以拿来跑基准测试的预览版,以及一组你真正可以依赖的生产级模型通过一个 API 即可访问 200 多个模型,供应商标价以 0% 加价原样透传——所以如果 StepFun 在十月之前调整价格,你要付的数字当天就会跟着变,而不是等到续费时才变。

在这个窗口期,自动故障转移比平时更有价值,因为预览版的失败模式并不是它很差——而是它受容量限制。一个在发布当天就开放了 API、却还没有权重文件的模型,其服务集群仍在建设中;而一个在凌晨两点性能退化的预览端点,会连带拖垮你的智能体循环。把预览版放在一个以经过验证的模型作为兜底的路由器后面,你就能在自己实际的工作负载上获得质量信号,而无需把生产路径押在一个未经检验的集群上。

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

重要的日期是10月15日

以上一切都只在一个特定意义上仍是暂定的:权重才是让模型变得永久的东西。闭源预览每百万 token 1.00 美元和 2.70 美元,对单一供应商来说是个好价格;而一个以公开许可发布的 BF16 检查点,则是任何单一供应商都已无法掌控的价格。StepFun 已承诺在 10 月 15 日兑现后者,而它已经预留的仓库名以 bfloat16 打头。

从现在到那时,值得关注的事项既有限又可核验。仓库会充实起来吗——采用什么许可证?配置文件会确认总参数 600B、激活参数 27B 吗?StepFun 是否会在公布上下文窗口的同时公布输出上限,从而解答 350k/64k 的疑问?一旦 preview 去掉后缀,价格还能维持吗?这四个答案将决定 Step 5 Preview 会成为你自托管的模型、租用的模型,还是只跑一次基准测试就翻篇的模型。在仓库里除了一个 .gitattributes 之外还有别的东西之前,这份公告只是故事的开端,而不是故事的终点。

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新