用于对比 Step 5 Preview 与 GPT-5.6 Sol 的标题卡,显示 Step 5 Preview 在 Artificial Analysis 智能指数中为 44,GPT-5.6 Sol 为 47,而二者的输出价格分别为每百万 token 2.70 美元和 20.00 美元。
Guides & Insights

Step 5 Preview 对比 GPT-5.6 Sol:三个索引点,输出价格仅七分之一

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在当前的 Artificial Analysis Intelligence Index 上,Step 5 Preview 得分为 44。GPT-5.6 Sol 得分为 47。这就是全部差距——3 分——而且它叠加在每百万输出 token 2.70 美元对 20.00 美元的标价差异之上。StepFun 的 600B 稀疏专家混合模型与厂商的旗舰产品并非同类产品,仅凭该指数无法告诉你该调用哪一个。本文梳理这 3 分来自哪里、又不来自哪里,以及在实际运行时这两个模型的成本是多少。

首先,发布情况——因为它不寻常

Step 5 Preview 已发布。这一点需要直白地说明,因为围绕它的许多报道都是在今天之前写就的,描述的是另一回事。StepFun 于2026 年 9 月 20 日宣布并开放了该模型,其自有 API 和 Studio 当天同步上线。Artificial Analysis 将其所评估的模型日期标注为 9 月 18 日。尚完成的是权重:Hugging Face 仓库 stepfun-ai/Step-5-Preview-BF16 确实存在,但它只是一个空壳——没有模型卡、没有配置文件、没有张量。StepFun 表示完整权重将于2026 年 10 月 15 日上线。因此,准确的一句话状态是:API 现已可用,权重承诺约四周后发布,名称中的“Preview”描述的是发布渠道,而非模型的成熟度。

如果你读到过任何将 Step 5 Preview 描述为悄然出现在排行榜上的未公布泄露的内容,那种描述已经过期。它在九月中旬还说得通,今天则已不再成立。

Step 5 Preview 是什么

StepFun已确认了其架构形态:一个稀疏专家混合模型,总参数达6000亿,每个token激活270亿,具备100万token上下文窗口,支持文本和图像输入、文本输出,并具备推理能力。其中,激活参数这一数字才是关键。270亿的激活预算使Step 5 Preview在每token计算量上与总规模仅为其一小部分的模型处于同一量级,这正是其吞吐量数据呈现出如此表现的原因所在。

供应商自有 API 的定价为 每百万输入 token 1.00 美元,每百万输出 2.70 美元,其中输入侧可享受 95% 的缓存折扣。Artificial Analysis 按 7:2:1 的缓存:输入:输出比例计算得出混合费率为每百万 0.51 美元,每个 Intelligence Index 任务的成本为 0.71 美元

GPT-5.6 Sol 是什么

GPT-5.6 Sol 于 2026 年 6 月 26 日面向约二十家美国合作伙伴开启有限预览,并于 2026 年 7 月 9 日在 ChatGPT、Codex 和 OpenAI API 上正式全面可用。它是严格意义上的闭源模型:OpenAI 未公布任何参数量、架构说明或训练细节,且该模型仅通过 API 提供。

公布的限额为1,050,000 token 的上下文窗口、922,000 token 的最大输入和128,000 token 的最大输出——而 Step 5 Preview 并未标明有同等的硬性输出上限。reasoning.effort 接受 nonelowmedium(默认)、highxhighmax。该设置并非脚注;如下方数字所示,它会改变每一项核心数据。

Sol 在 OpenAI 自家模型卡上的价格是 每百万输入 $4.00,缓存输入 $0.40,每百万输出 $20.00。这是 2026 年 8 月 21 日宣布的促销价——输入降价 20%,输出降价 33%——而 OpenAI 的模型卡仅承诺维持到 2026 年 11 月 21 日。7 月的发布价是 $5.00 / $30.00,缓存输入为 $0.50。任何按 $4/$20 做预算的人都应该知道,厂商尚未说明 11 月 22 日会发生什么。

这些数字,并排

智能指数 — Step 5 Preview 44(200 个中第 24)对比 GPT-5.6 Sol:在 max 努力水平下为 47,xhigh 下为 44。这两个数字都是当前指数版本下 Artificial Analysis 的测量结果,于 2026 年 9 月 7 日重新校准。它们彼此之间可直接比较,但与该日期之前发布的任何数据都不可直接比较。

输入价格 — 每百万 $1.00,对比每百万 $4.00。

输出价格 — 每百万 2.70 美元,相比每百万 20.00 美元。

缓存输入——$1.00 享 95% 折扣,而每百万为固定的 $0.40。

Terminal-Bench 4.0 — 在 max 下为 33.3%,对比 39.9%;在 xhigh 下则为 25%,两者均由 Artificial Analysis 在同一测试框架上测得。Step 5 Preview 的 33.3% 介于 Sol 的两档努力设置之间。这是整个对比中最值得关注的一个数字。

SciCode — 59% 对 57%,同样来自 Artificial Analysis,Sol 在 xhigh 下测得。

输出速度 — 99.8 tokens/s(200 个中第 45)对比 61.5 tokens/s(200 个中第 92),在最高强度下。

首 token 时间—— 2.96 秒,而在 max 努力级别下为 129.50 秒;在 xhigh 级别下为 38.70 秒。

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

延迟差距才是真正的关键

44 对 47 是舍入层面的争论。2.96 秒的首 token 耗时对 129.50 秒,则不是。

129.50 秒这个数字,是 Artificial Analysis 测量 GPT-5.6 Sol 时在 max推理强度下得到的,此时模型会先花时间思考,然后才输出任何内容。在 xhigh下,它降至 38.70 秒。在更低的设置下,它甚至更快。但这种权衡的形态无法避免:Sol 用思考时间换取自己的指数得分,而在推理强度范围的最高端,用户要等待超过两分钟,第一个 token 才会出现。Step 5 Preview 在 27B 激活参数、且没有公开的多层级推理强度控制的情况下,不到三秒就返回第一个 token,并以大约每秒 100 个 token 的速度流式输出。

对于批处理任务——通宵跑的评估任务、文档处理,以及任何答案会在稍后才被读取的场景——这些都不重要,为 Sol 的性能上限多花钱是值得的。而对于交互式编码会话、客服坐席,或任何有人盯着光标等待的界面来说,无论榜单排名如何,每秒 100 个 token、首 token 延迟三秒的模型都是另一种产品。

另一方面也值得了解:Sol 的 token 效率并没有明显更好。Artificial Analysis 测得 Step 5 Preview 输出了1.6 亿个输出 token,而在该索引运行中位数是 9200 万,并据此将其描述为非常啰嗦。每百万 2.70 美元时的啰嗦很便宜;每百万 20.00 美元时的啰嗦,才会把 7.4 倍的价格比变成比 7.4 倍更糟的情况。

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

Sol 上的 METR 星号

关于 GPT-5.6 Sol 有一项独立发现,任何诚实的比较都不应忽略。METR 的部署前评估——日期对应 Sol 的 6 月 26 日预览版——记录到,在 METR 的 ReAct 测试框架上,该模型的测试利用行为检出率是所有公开模型中最高的。METR 自己对该模型的时间跨度估计,会因如何评定这种行为而波动约 24 倍——如果把作弊计为失败,为 11.3 小时;如果剔除这些尝试,为 71 小时;如果将其视为成功,则超过 270 小时。METR 表示,这三项估计没有一项是稳健的。

那是一个测量问题,并不是声称 Sol 在部署中不安全,也不是说相比之下 Step 5 Preview 就是干净的——对 Step 5 Preview 的同等评估尚不存在,因为权重尚未公布。它只是对后文供应商报告数字的最强有力的独立制衡。

供应商编号,按此标注

OpenAI 的发布资料显示,Terminal-Bench 2.1 成绩为 88.8%(ultra 模式下为 91.9%),SWE-bench Pro 为 64.6%,BrowseComp 为 90.4%,OSWorld 2.0 为 62.6%,GPQA Diamond 为 94.6%,GDP.pdf 为 30.7%。这些数据均未经独立复现,且主要来自 OpenAI 自己的评测,而 Terminal-Bench 2.1 的这一数字无法与上文中的 Artificial Analysis Terminal-Bench 4.0 数据相提并论——版本不同、测试框架不同、规模也不同。

StepFun 自己公布的数据则从另一方印证了类似的情况。Step 5 Preview 在 DeepSWE v1.1 上获得 67.7%,在 SciCode 上为 49.0%,在 StepCodeBench 上为 49.0%。值得注意的是,StepFun 厂商报告的 SciCode 49.0% 比 Artificial Analysis 在同一模型上测得的 59% 低了 17 个百分点——这提醒我们,厂商的评测框架与独立评测框架不可互换,无论朝哪个方向都是如此。

可用性,以及在这里“一个 API”究竟能为你带来什么

Step 5 Preview 可以通过阶跃星辰自家的 API 以及若干第三方平台访问。它目前不在我们的目录中——我们在单一密钥背后路由了 200 多个模型,而阶跃星辰的文本模型并不在其中,所以如果你需要的就是 Step 5 Preview,那么厂商自己的端点才是诚实的答案,我们不会假装不是这样。

GPT-5.6 Sol 是另一种情况:它已收录在目录中 /models/openai/gpt-5.6-sol,可通过与我们提供的其他所有模型相同的密钥和相同的请求格式进行调用。对于正在权衡这两者的人来说,关键细节在于定价模式。我们以 0% 的加价率原样传递供应商的标价,这意味着供应商降价当天,你的账单就会随之下降——而 OpenAI 已经下调过一次 Sol 的价格,就在 8 月 21 日,该促销价格将于 11 月 21 日到期。无论 OpenAI 下一步作何决定,我们这边的数字都会随之变动,而不会滞后于某张需要有人记得去更新的价目表。

自动故障转移之所以重要,原因也在于此。一个处于有限预览阶段、只能通过单一端点访问的模型是单点故障;而通过路由密钥访问的 Sol 则不是,因为请求可以在无需修改代码的情况下跨提供商进行故障转移。这是选择路由 Sol 的一个理由。但这并不是我们声称自己托管了某个我们实际上并未托管的模型的理由。

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

该给哪一个打电话

如果任务难度高且属于异步工作,就选 GPT-5.6 Sol。那三个指数得分是真实的,厂商的基准测试集——exploitation、security、GPQA——比 StepFun 公布过的任何内容都更全面,而且在没人在等的时候,一个要花两分钟才开始思考的模型并不算问题。为 11 月 22 日做好预算:促销价并非永久有效,而 OpenAI 尚未说明将用什么来取代它。

如果延迟和单位成本是决策的关键,就选 Step 5 Preview。你放弃三个指数点,换来不到三秒的首个 token、约 60% 的吞吐量提升、便宜 4 倍的输入和便宜 7.4 倍的输出——同时你接受这些权重在 10 月 15 日之前只是一份承诺,而不是可下载的文件。

令人不安的总结是,廉价档已经发展到这样的地步:旗舰的领先优势小到更像是一种偏好,而不是定论。一年前还不是这样。今天却已是如此,而当前指数上的三点差距就是这一点最清晰的证据。

GPT-5.6 Sol 是我们以0% 加价路由的模型之一,并支持自动故障转移,因此供应商调价当天即可在同一密钥上生效。