
Step 5 Preview 对比 Claude Opus 5:七个指数点,换来七倍账单
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun 为 Step 5 Preview发布的宣传材料以一项对比性说法开场:在它上面跑一个任务的花费,只有在 Claude Opus 5上跑同一任务的八分之一。如今两款模型都出现在同一个独立榜单上,所以这一说法可以被核查,而不必再靠争论。Artificial Analysis 分别用 Intelligence Index v4.3.2——共十项评测——对两者进行了测试,并公布了每次运行的耗费,其中 Claude Opus 5 是在其自身最高推理强度设置下评分的。Step 5 Preview:指数得分 44,完成整轮测试花费 922.84 美元。Claude Opus 5:指数得分 51,花费 7,274.74 美元。也就是说,多花 7.9 倍的钱,换来 7 分的得分,而 StepFun 所引用的倍数恰好是准确的。真正有意思的,是这个倍数所掩盖的东西:这一差距主要并不是价格差距。它是一道披着价格差距外衣的啰嗦程度差距,而把这两者区分开来,会改变你应该把哪个模型放在哪种工作负载面前。
两种运行成本,同一块板,以及它们内部究竟是什么
总运行成本是这里能获得的最干净的单一比较,因为两个模型在相同的评测框架下回答了相同的问题,而且这一数字并非出自任何一家厂商。它同时也是最容易被误读的数字,因此值得展开细说。
• 指数得分 — Step 5 Preview 44 对 Claude Opus 5 51,Claude Opus 5 的分数是在其最高推理力度设置下取得的
• 完成该索引的总成本 — Step 5 Preview $922.84,对比 Claude Opus 5 $7,274.74
• 在 7:2:1 的缓存命中 / 输入 / 输出混合比例下,混合价格为每 100 万 tokens 0.51 美元(Step 5 Preview),而 Claude Opus 5 为 3.85 美元
• 索引运行期间生成的输出 token —— Step 5 Preview 160M 对比 Claude Opus 5 140M
• 标价 — Step 5 Preview 输入 $1.00 / 输出 $2.70,对比 Claude Opus 5 输入 $5.00 / 输出 $25.00
把第三行和第五行放在一起看,算术就不再是简单的价格对比了。Step 5 Preview 的综合费率便宜 7.5 倍,标价费率则在输入上便宜 5 倍、在输出上便宜 9.3 倍——可见综合费率起到的作用并非输入价格所能体现。这是因为综合费率向输出端加权,而输出恰恰是两个模型差距最大的地方。Claude Opus 5 的收费是 Step 5 Preview 输出费率的 9.3 倍,而且两个模型的输出量都很大:Claude Opus 5 输出 1.4 亿个 token,而该指数所评分的各模型中位数为 9200 万;Step 5 Preview 则为 1.6 亿个,对照的同样是 9200 万的中位数。
所以,诚实解读比“便宜模型就是划算买卖”要更狭窄。Step 5 Preview 在每个维度上都更便宜,而它并不是一个节俭的模型——相比作为衡量基准的中位数模型,它的输出多出 74%,而这正是定价本该惩罚的行为。Claude Opus 5 比中位数多输出 52%,并对这些 token 中的每一个收取 9.3 倍的费用。限制输出长度的调用方,与不限制输出长度的调用方,得到的比率并不相同。
问题不在于哪个更好,而在于交叉点在哪里。
假设该指数能合理代表你实际发送的工作——长周期智能体任务、代码、多步骤工具调用。那么临界点很容易说清:Claude Opus 5 必须在每个任务上至少有用 7.9 倍,才值得为它付账;而在该指数上,它在 100 分制中高出 7 分。这两个事实未必指向同一个方向,因为指数上 7 分的差距并不等于在每件事上都好 16%。它是十项评估的汇总,而构成比总分更重要。
这就是为什么要在意两个分数的形态,而不是那个头条数字。Step 5 Preview 在 Terminal-Bench 4.0 上的读数是 33.3%——一个真正体现智能体能力的结果,领先于 26.8% 的 DeepSeek V4.1 Flash——但已公布的记录中,尚无任何内容显示它能在 Anthropic 模型最擅长的长时程评估上追平 Claude Opus 5。StepFun 自己的材料在措辞中也承认了这一点:在 ALE-CLI、FrontierFinance 和 DRACO 上,该公司把 Step 5 Preview 排在第二,落后于 GPT-6 Astra 或 Claude Opus 5 中的某一个,并领先于对比中的其他开放模型。以五分之一的价格拿到第二名,确实是个很好的结果。但它也不是第一名,而一个模型排名第二的任务,通常正是那些需要第一名的任务。
另一个不对称之处在于调用失败时会发生什么。一个廉价模型花了四秒和 2,000 个 token 给出的错误答案,代价只是一次重试;而 Claude Opus 5 以每百万输出 token 25 美元的价格给出同样的错误答案,代价则是重试再加上那段深思熟虑。如果你的流水线在失败时会重试——大多数智能体循环都会如此——那么真正重要的是每个成功任务的有效成本,而这个比例与标价并不相同,因为两个模型的失败率不会一样。目前还没有人公布 Step 5 Preview 的这个数字。

规格对比,逐维度进行
• 指数得分 — Step 5 Preview 44 对比 Claude Opus 5 51,两者均基于 Intelligence Index v4.3.2,Claude Opus 5 处于其最高推理力度设置
• 每 100 万 tokens 价格 — Step 5 Preview 输入 $1.00 / 输出 $2.70,对比 Claude Opus 5 输入 $5.00 / 输出 $25.00
• 缓存折扣 — Step 5 Preview 95%,对比 Claude Opus 5 的 90%
• 上下文 — 两者均为 1M tokens;StepFun 尚未公布输出上限,而 Anthropic 的为 128K
• 输入 — 两者均接受文本和图像;两者仅输出文本
• 输出速度 — Step 5 Preview 99.8 tokens/秒 vs Claude Opus 5 55.3 tokens/秒
• 控制面 —— Step 5 Preview 开放扩展思考;Claude Opus 5 以自适应推理力度调节旋钮取代 temperature 和 top_p
• 权重 — Step 5 Preview 今日关闭,BF16 检查点定于 10 月 15 日;Claude Opus 5 全程闭源
• 独立证据——两者均由 Artificial Analysis 评分;StepFun 的智能体基准测试行由供应商自行运行,且未经复现
有两行值得说明一下。速度差距确实存在,而且在实际表现中比表格显示的更大:每秒 99.8 个 token 对 55.3 个 token,意味着在相同输出下完成速度大约快一倍;而在同一榜单上,Step 5 Preview 的首个 token 时间 2.96 秒对 Claude Opus 5 的 56.84 秒,则完全是另一个层面的事——不过第二个数字衡量的是最大努力推理配置,在该配置下,模型会先进行推敲,然后才输出任何内容。这并不是生产环境调用会看到的延迟。对照标准端点,我们自己的目录报告 Claude Opus 5 的 p50 首个 token 时间为 6.73 秒;如果你并非有意要求最大程度的深思熟虑,这就是应当据以做规划的数值。
缓存折扣这一行,才是悄然决定重复工作负载的那一项,而它偏向 Step 5 Preview,95% 对 90%。一个每次调用都重新发送相同系统提示和仓库上下文的智能体循环,几乎完全依赖这一折扣存活,因此五个百分点的差异会在漫长会话中不断累积。

Claude Opus 5 仍然是唯一答案的地方
以上没有任何内容是在反驳 Anthropic 的模型。它之所以是那个价格,是因为它做到了这个指数试图衡量的东西,而且它做到的高度接近榜首——在 Intelligence Index v4.3.2 上得分为 51,领先 Step 5 Preview 七分,并已接近当前一代领先者的水平。那些 7 分的总体差距会低估差异的工作负载,正是容不得第二名答案的场景:耗时数小时的重构,其失败模式是微妙的行为变化;必须让推理链可审计的财务模型;以及一周后才被发现决策错误的迁移。在这些场景里,重试并不便宜,而深思熟虑本身就是产品。
差距无关紧要的工作负载,是那些由许多小决策构成的负载:分类与路由步骤、抽取、摘要、测试脚手架,以及智能体在两次真正重要的调用之间所做的一千次调用。在那些场景中,一个得分为 44 的模型,用一半的时间作答,输入价格只有五分之一,这并不是妥协。它就是正确的默认选择,而昂贵的模型则留给那个必须做对的步骤。
在不运行两个集成的情况下运行拆分
这种对比的实用版本是一条分级流水线,而团队不去搭建它的原因在于采购,而非工程——两家供应商、两份合同、两套 SDK、两个需要轮换的密钥。Claude Opus 5 就在我们的目录里,价格为 $5.00 和 $25.00,而你会放在它前面的那些更便宜的文本模型也在同一个目录里,全部通过一个密钥访问 200 多个模型,按提供商标价以 0% 加价透传。Step 5 Preview 不在该列表中——它运行在 StepFun 自家的 API 上,在权重发布之前,那是它唯一能运行的地方。在我们确实路由的模型之间进行分级组合,只是一个路由 DSL 表达式,而不是代码改动——把常规调用发给小模型,在置信度或复杂度条件满足时升级到昂贵的模型,并让两条链路都位于同一个端点之后。
自动故障转移在这里之所以重要,是出于一个具体原因,而不是作为一个通用功能。Step 5 Preview 在发布当天就开放了其 API,既没有公布权重,也没有披露服务集群;它是一个才上线几天的预览端点,而预览端点在容量上受到的约束,是成熟端点所没有的。Claude Opus 5 由许多独立提供商提供服务,这正是预览版无法提供的冗余。将一个经过验证的模型保留为回退支路——在我们这边,这意味着来自目录的生产模型,而不是预览版——这样你就能在不让生产路径依赖于一个仍在确定规模的集群的情况下,获得自己工作负载上的真实质量信号。

决策规则
如果你面对的是少量极难的任务,那么 Claude Opus 5 并不是昂贵的选择——它反而是便宜的那个,因为次优答案的代价比这点差价更高。如果你的负载是大量普通任务、其中夹杂少量难题,那么 Step 5 Preview 以每百万 token 1.00 美元和 2.70 美元、外加 95% 缓存折扣,才是更合适的默认选择,而那 7 分的差距,对于本就不需要它的工作而言,基本只是四舍五入的误差。
能改变这一推算的,是关于失败率以及长时程 agentic 行的独立证据。StepFun 自己给出的数字使其模型在它围绕发布所构建的评测中位列第二,且尚无第三方复现这些数字。关注 10 月 15 日的检查点上的两件事:许可证是否允许进行微调,从而让你能在自己的数据上缩小 7 个百分点的差距;以及一旦 preview 后缀去掉,这种冗长是否依旧。第一点会改变这一比率;第二点已经让它变动过一次。
