生成的标题卡标题为“Step 5 Preview 对比 GLM-5.3——仅相差一分”,包含两列,中间有一个“1 分”徽章:Step 5 Preview 在 AA Index 上为 44,总量 600B / 激活 27B,价格 $1.00 / $2.70,输出 99.8 tokens/秒,权重将于 10 月 15 日发布;GLM-5.3 在 AA Index 上为 45,总量 753B / 激活 40B,价格 $1.40 / $4.40,输出 72.1 tokens/秒,权重以自定义许可证发布。页脚写着“两者均依据 Artificial Analysis Intelligence Index v4.3.2;GLM-5.3 按 GLM-5.3 (max) 计分。”
Guides & Insights

Step 5 Preview 对比 GLM-5.3:仅相差一分,且只有其中一个拥有许可证文件

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在独立榜单上,Step 5 PreviewGLM-5.3相差一分:在 Artificial Analysis Intelligence Index v4.3.2 上为 44 对 45,其中 GLM-5.3 以 GLM-5.3 (max) 计分,而 Step 5 Preview 完全没有标注 effort 标签。这是本系列中差距最小的一次,却也是这项对比中最没用的数字。真正起决定作用的数字是:GLM-5.3 的权重你今天就能下载——由 Z.ai 以一份并非 MIT 的自定义许可证发布——而 StepFun 于 2026 年 9 月 20 日公布的 Step 5 Preview,其 Hugging Face 仓库中只有一个 .gitattributes,并声明 BF16 checkpoint 的发布日期为 10 月 15 日。StepFun 的发布材料将该模型描述为排名前三的开源成果。它目前还不是开源的。GLM-5.3 则是,而在你围绕它做规划之前,它的许可证才是真正该读的东西。

一个指数点实际上能买到什么

两个模型都由同一家实验室跑完了同样的十项评估,这使得这一对比既异常干净,又同时异常地帮不上忙。

• 智能指数 — Step 5 Preview 44 对比 GLM-5.3 45

• 它处于什么位置——GLM-5.3 比 Step 5 Preview 高一分;Step 5 Preview 与 Kimi K3 持平

• 参数 — Step 5 Preview 总参数 600B / 激活参数 27B,对比 GLM-5.3 总参数 753B / 激活参数 40B

• 输出速度 — Step 5 Preview 99.8 tokens/秒 对比 GLM-5.3 72.1 tokens/秒

• 首 token 延迟 — Step 5 Preview 2.96 秒 vs GLM-5.3 2.99 秒

• 每 100 万 tokens 价格 — Step 5 Preview 输入 $1.00 / 输出 $2.70,对比 GLM-5.3 输入 $1.40 / 输出 $4.40

• 缓存折扣 — Step 5 Preview 95%,GLM-5.3 81%

• 智能指数任务成本 — Step 5 Preview $0.71 vs GLM-5.3 $2.01

• 上下文——两者均为 1M token;我们的目录中列出 GLM-5.3 的输出上限为 131.1K,StepFun 尚未公布

• 权重 — Step 5 Preview 已结束,BF16 检查点计划于 10 月 15 日发布;GLM-5.3 在自定义 Z.ai 许可证下发布

把这些行放在一起看,那一分的差距就不再是头条了。Step 5 Preview 的输入成本低 29%,输出成本低 39%,token 生成速度快 38%,缓存折扣还深了 14 个百分点——而把啰嗦程度和缓存行为折算成单一数字的每索引任务成本,则低了 2.8 倍。它做到这些,总参数量是 600B,而 GLM-5.3 是 753B;激活参数 27B,对手是 40B。在效率这条轴上,这根本不是势均力敌的较量;而在能力上,这已是排行榜上最接近的一次对决。

Step 5 Preview 唯一没有胜出的那一行,也正是最难修复的那一行:GLM-5.3 有许可证文件,而 Step 5 Preview 没有。

许可证就是全部的区别,而且它不是 MIT

人们很容易想当然地认为,中国实验室的开源旗舰模型都会以 MIT 许可证发布,因为确实有好几家都是这样。Z.ai 自家的 GLM-5.2GLM-5.3-Flash 都采用 MIT 许可证。但 GLM-5.3 旗舰版并非如此——它采用的是自定义的“glm-5.3”许可证,允许商业使用,但附带一系列限制。这与较小同门模型所采用的 MIT 条款是实质不同的文件;对于一家其律师会先读许可证、再看 README 的公司来说,这需要一番讨论,而不是走个形式。

Step 5 Preview 目前完全没有许可证,这是另一类问题,而且显然并不更小。限制性许可证会告诉你哪些事可以做,再让你自行判断条款是否可接受。没有许可证则什么也说明不了:没有商业使用授权,没有再分发权,没有微调许可,而且在 10 月 15 日的检查点出现之前,你无从评估它能否用于你的产品。StepFun 预留的仓库名——stepfun-ai/Step-5-Preview-BF16——指向的是 bfloat16 格式,那是你用来微调和量化的产物,而不是你用来对外提供服务的那个。这透露了此次发布的形态,却没有透露它的条款。

所以,诚实的比较是在一份你可以阅读并表示异议的许可证,与一份根本不存在的许可证之间进行的。对于一个需要微调、在受控环境中自托管,或发布衍生产品的团队来说,GLM-5.3 是这两者中唯一给出了答案的一个,而这个答案是法律审查,而不是一路绿灯。

效率差距是站得住脚的那部分

关于效率的说法比关于基准测试的说法更值得怀疑,因为它们更容易提出,却更难核实。这两项比大多数都更站得住脚,而且其机制在架构中清晰可见。

稀疏专家混合模型只把计算花在 token 路由到的专家上,因此激活参数量决定生产环境中的行为,而总参数量主要是个内存问题。在 27B 激活对 GLM-5.3 的 40B 的情况下,Step 5 Preview 每个 token 的工作量大约少三分之一,测量结果也随之印证:每秒 99.8 个输出 token 对 72.1 个,每项索引任务成本 0.71 美元对 2.01 美元。同一个结论以三种方式呈现,这才让它可信,而不是一个孤立的漂亮数字。

缓存折扣是这两款模型所面向的工作负载中最关键的一项。智能体循环每一轮都会重新发送相同的系统提示和仓库上下文,几乎完全落在这项折扣的覆盖范围内,因此 95% 对 81% 的差距会在长时间会话中不断累积,而标价却不会。在 7:2:1 的缓存命中/输入/输出配比下,Step 5 Preview 的混合费率约为每百万 token 0.51 美元,而 GLM-5.3 的混合费率则明显更高——而且循环运行得越久,这一差距就拉得越大。

目前尚无法检验的是,那种效率能否在规模化后依然成立。Step 5 Preview 的 API 在发布当天就开放,而且只有一个端点。GLM-5.3 自八月中旬起便一直承载着生产流量,调用方众多且彼此独立;一个有着五周真实负载经历的模型,其失效模式已被足够多的人知晓,因而会公开暴露出来。而上线仅数日的端点则完全没有这些。效率数字是更讨喜的解读,运营实绩才是更有用的那一个。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

今天你在每一侧可以调用什么

这是比较中唯一一处两者并不对称的地方,值得对此精确说明,而不是笼统地归结为“两者都可用”。

GLM-5.3 已在 OrcaRouter 上线,位于 z-ai/glm-5.3 模型页面,输入 $1.26、输出 $3.96,而模型页面上 Z.ai 的标价是 $1.40 和 $4.40 —— 零加价原样透传,所以你看到的数字是提供商的当前费率,而不是我们自行设定的价格。开放权重已发布在 Hugging Face 上,因此同一个模型可以通过三种方式访问:我们的端点、Z.ai 自己的 API,或你自己的硬件。

Step 5 Preview 不在我们的目录中,我们也不为其提供路由。它运行在 StepFun 自己的 API 和 Studio 上,在权重发布之前,这是它唯一运行的地方。在我们这边,与它并列的是用来衡量它的那组模型,凭一个密钥即可覆盖 200 多个模型GLM-5.3,采用上述折扣费率DeepSeek V4 Pro 为 $0.66 和 $1.98,Claude Opus 5 为 $5.00 和 $25.00。正是这一点让接下来的四周变得可行,而不是被卡住——你可以用同一个密钥拿预览版与生产模型做基准测试,在预览版的容量曲线仍然未知时,跨提供商自动故障转移会维持生产路径,而路由 DSL 会把生产环节组合成一次调用,而不是第二次集成。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GLM-5.3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71, and weights due October 15. The right column gives GLM-5.3 the rows AA Index 45, parameters 753B total / 40B active, price $1.40 / $4.40 list, $1.26 / $3.96 on OrcaRouter, cache discount 81%, cost per index task $2.01, and weights published under a custom licence. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; GLM-5.3 is scored as GLM-5.3 (max).'

在潜力和过往业绩之间做选择

如果你正在进行微调、自托管或构建衍生产品,GLM-5.3 就是答案,而且毫无悬念——不是因为它得分高出一分,而是因为两者之中只有它既有可查阅的许可证,又有可下载的检查点。要为法律审查预留预算,因为其定制条款并非 MIT,而这种差异会在采购审计中暴露,而不是在基准测试中。

如果你通过 API 调用模型,而且你的工作负载是海量的智能体文本,那么 Step 5 Preview 在账单和时钟所关心的一切方面都更胜一筹:每 token 更便宜、每任务更便宜、生成更快,并且对填满智能体循环的重复前缀模式提供更深的缓存折扣。相比之下,一个才上线几天、来源单一、既未公布输出上限也没有许可证的端点,把 Step 5 Preview 设为默认选择的理由,是一个关乎基准测试的理由,而不是关乎合同的理由。

真正会改变结论的,是10月15日的检查点。宽松许可证会让效率优势变成你可以拥有的东西,而不是租来的东西,到那时一分的劣势就不再重要——一个在每个索引任务上便宜2.8倍、生成速度快38%的模型,并不需要在总分上取胜。限制性许可证则会让GLM-5.3成为两者中唯一能用来做产品的那一个,而那一分的差距也就变成了关于两个反正你会以不同方式使用的模型的琐碎谈资。

最值得关注的一项规格是输出上限。两家厂商都宣称支持 100 万 token 的上下文。我们的目录中,GLM-5.3 的最大输出为 131.1K;StepFun 的公告称其上下文为 100 万,却未提及输出上限,而泄露期间流传的一份第三方配置则列出 35 万上下文、最大输出 64,000。对于两款以长周期智能体任务为卖点的模型而言,这个数字决定了你实际能构建什么,而目前只有一方给出了答案。

Screenshot of the OrcaRouter model page for GLM-5.3 at www.orcarouter.ai/models/z-ai/glm-5.3, showing the model id z-ai/glm-5.3, a 1M-token context and 131.1K max output, input pricing of $1.26 and output pricing of $3.96 per million tokens against the crossed-out list rates of $1.40 and $4.40, a cache read rate of $0.25 per million tokens, and the endpoints and SDK snippets behind the OrcaRouter API.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新