
Step 5 Preview 对比 GLM-5.5:一个模型今日发布,另一个仍只是预测
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Step 5 Preview于2026年9月20日开放了其 API,也就是 StepFun 宣布它的同一天;你今天下午就可以通过单个端点调用它,价格为每百万输入 token 1.00 美元、每百万输出 token 2.70 美元。GLM-5.5并不存在。没有模型卡,没有 API 标识符,没有价格,没有检查点,也没有许可证文件,而且 Z.ai 上没有任何页面使用这个名称——因为 GLM-5.5 是社区简称,公司从未采用。这种不对称就是本文的主题。接下来是 StepFun 实际发布的内容、关于 Z.ai 下一代旗舰真正已经确定的信息,以及你今天就能运行的正面对比,用来替代标题中的那场对比。
GLM-5.5 是什么,以及它不是什么
这个名字于2026年年中开始流传,并与一个发布窗口联系在一起,而这个窗口有着可追溯的来源:一份于2026年6月25日转述的分析师预测,将Z.ai的下一款旗舰产品定在8月。这是一个观察窗口,而非厂商的承诺,而8月结束了,它并未出现。Z.ai实际交付的是GLM-5.3,于8月14日发布,其API在8月18日前后上线,开放权重于8月28日释出,随后是8月26日的GLM-5.3-Flash。在厂商自己的Hugging Face组织下,尚未出现任何GLM-5.5检查点,那里最新的仓库仍以GLM-5.3系列为最高。
命名同样尚未确定。GLM-5.3、GLM-5.4、GLM-5.5 和 GLM-6 都曾在同一时间窗口内被提及,而 Z.ai 对它们一个都没有确认。公司方面唯一的信号是一位联合创始人关于“epic plus”发布的说法,那更像是一种氛围,而非明确规格。分析师根据该厂商的发布节奏——大约每 54 到 70 天推出一款旗舰模型——如今将下一款模型预测在 2026 年 10 月 8 日至 11 月 9 日这一窗口期内,并预计其编号会是 GLM-5.4,而非 GLM-5.5。
有三项说法流传甚广,仿佛已被证实,而这三项都值得逐一辨明。参数规模这一项最站不住脚:没有任何官方信息支持“超过1万亿”这一数字,而后来社交媒体上将其夸大到3万亿以上的帖子更是全无出处。100万token上下文是最稳妥的假设,因为GLM-5.2和GLM-5.3都具备这一点。开放权重是一种期待,而非承诺——Z.ai已为其最近几款旗舰模型发布了权重,这是一种规律,而非承诺。
Step 5 Preview 实际交付的内容
StepFun 的模型是本次对比中具体的那一半,其规格非同寻常。它是一个总参数量 600B 的稀疏专家混合模型,每个 token 约激活 27B——激活比例接近 4.5%——基于 92 层窄而深的 transformer 构建,采用稀疏分组查询注意力与逐块 token 合并。上下文窗口为 1M token,输入为文本与图像,输出为文本,并通过扩展思考进行推理。StepFun 跳过了整个 Step 4.x 系列才达到这一步,从 Step-3.7-Flash 直接跃至 Step 5。
• 智能指数——在Artificial Analysis上得分44,在200个评分模型中排名第24,而中位数为24
• 输出速度 — 99.8 tokens/秒,200 个中排名第 45
• 首个令牌时间 — 在同一独立运行中为 2.96 秒
• 价格 — 每 100 万输入 token 1.00 美元,每 100 万输出 token 2.70 美元,并享有 95% 的缓存折扣
• 每个 Intelligence Index 任务的成本 — $0.71,200 个中第 27 位
• 权重——今日无;BF16 检查点定于 2026 年 10 月 15 日
• 许可证——未公布。该模型为专有模型,未声明授予商业使用许可、再分发权或微调许可。
价格是那行引人注目的数据,而另一行对 StepFun 而言也不像乍看之下那么有利:在 Intelligence Index 上输出 160M token,而中位数为 92M,在该指标上于 200 个模型中排第 64 位。该模型话很多,而冗长恰恰在它所主打的智能体工作负载中会成为成本倍增器。每任务 0.71 美元的成本数字已经把这一点算进去了,这正是它比标价更值得引用的原因——它是更诚实的数字。
StepFun 自己的评测结果无法复现,在有人独立运行之前,应将其视为厂商材料。他们给出的模型成绩为:ALE-CLI 上 29.5,FrontierFinance 上 66.4,DRACO 上 83.3,ProgramBench 上 80.5,DeepSWE v1.1 上 67.7,StepCodeBench 上 49.0,Terminal-Bench 4.0 上 33.3%,以及 GDPval-AA v2 上 1571。StepFun 还报告称,在 24 小时 GPU 内核优化任务中,MLA 峰值达到 508 TFLOPS,而 Claude Opus 5 为 493。这些是 StepFun 关于一个 StepFun 尚未开放的模型所给出的数字。

你可以用来代替这个的一对一对比
如果你想要标题所承诺的那种对比,诚实的替代方案就是让 Step 5 Preview 对阵 GLM-5.3——Z.ai 实际发布的模型,至今仍是其当前的开源旗舰,也是任何 GLM-5.5 将会取代的那一个。在独立榜单上,两者仅相差一分。而在几乎其他所有方面,它们并非如此。
• 智能指数 — Step 5 Preview 44 对比 GLM-5.3 45
• 参数 — 总参数600B / 激活参数27B 对比 总参数753B / 激活参数40B
输出速度 — 99.8 tokens/秒 vs 72.1 tokens/秒
• 首个 token 时间 — 2.96 秒 vs 2.99 秒
• 每 100 万 tokens 价格 — 输入 $1.00 / 输出 $2.70,对比输入 $1.40 / 输出 $4.40
• 缓存折扣 — 95% vs 81%
• 每项智能指数任务的成本 — 0.71美元 对比 2.01美元
• 输入模态——文本与图像 对比 纯文本
• 许可证 — 未公布任何许可证,对比一份非 MIT 的定制 Z.ai 许可证
这一形态重复了 Step 5 Preview 发布时、在它被评分的每一款已上线模型身上所确立的情况:决定性的效率领先,以及能力上的统计持平。它生成 token 的速度约快 38%,双向每百万 token 的成本大约只有一半,而面对 GLM-5.3 时,每项索引任务的成本要低 2.8 倍——尽管得分低了一分。在榜单上,那个 44 分也让它与 Kimi K3 持平,这一点值得在把两者中的任何一个当作领跑者之前了解。
Step 5 Preview 毫无疑问落后的那一行,恰恰是你无法进行基准测试的那一行。GLM-5.3 有许可证文件和可下载的权重;而 Step 5 Preview 有一个 Hugging Face 仓库,其中只包含一个 .gitattributes,以及为 BF16 检查点标注的 10 月 15 日日期。如果 Z.ai 的下一代旗舰模型带着开放权重、按照它全年一直使用的相同自定义条款到来,它就会落入 Step 5 Preview 目前唯一无法给出答案的类别——这才是 GLM-5.5 对比值得等待而不是直接跑的真正原因。

为什么等待 GLM-5.5 是代价高昂的选择
一个模型已经连续两个月都“还差两个月”了,由此带来的现实问题是:你的评估工作不可能陪着它一起等。GLM-5.5 没有端点,因此无法做基准测试、价格比较、负载测试,也无法纳入回退规则。围绕它做规划所花掉的每一周,都是仅凭一份预测而推迟决策的一周——而这份预测已经错过了一个窗口期。
相比之下,GLM-5.3 则已在 OrcaRouter 上线,模型标识为 z-ai/glm-5.3,输入价格为 $1.26、输出价格为 $3.96,而 Z.ai 自家页面上的标价则为 $1.40 和 $4.40。该价格以零加价原样透传,也就是说你看到的数字是提供商当前的费率,而非由我们设定的价格;供应商一旦调价,当天就会在我们这边生效,而不必等到下一个计费周期。
Step 5 Preview 不在我们的目录中,我们也不为其提供路由。它运行在 StepFun 自家的 API 和 Studio 上,在 10 月 15 日的检查点落地之前,这是它唯一运行的地方。与此同时,OrcaRouter 为你提供的,是这一对比另一侧的一切通过一个 API 即可访问 200 多个模型:按上述费率提供的 GLM-5.3、GPT-6 Astra、DeepSeek V4 Pro、Claude Opus 5 等等,具备跨供应商的自动故障转移,在预览版的容量曲线尚属未知时让生产路径保持稳定,而路由 DSL 可将其中多个模型组合为单次调用,无需再做一次集成。用同一个密钥将预览版与生产模型进行基准测试;让生产路径保持原样。

什么会改变答案
两个日期将决定这件事。10 月 15 日是 StepFun 所说的 Step 5 Preview 的 BF16 检查点发布之日,而与之同时发布的许可证,是这场比较中最具决定性、也最未知的变量——宽松许可证会让每任务成本 2.8 倍的优势成为你所拥有的东西,而非租来的东西,并会抹去 GLM-5.3 唯一明显领先的那个维度。限制性许可证则会让 GLM-5.3 成为两者中唯一一个你能用来构建产品的一方,并把这一分的差距变成关于两个你本来就会以不同方式使用的模型的无谓细节。
第二个是10月8日至11月9日运行的分析师窗口,针对的是Z.ai的下一代旗舰模型;它可能叫GLM-5.5,也可能不叫,可能像传闻中那样,也可能不像。如果它真能到来,那它会是一个带有许可证和检查点的模型——而这两样正是Step 5 Preview所缺少的——到那时,这场比较才会真正成立。
在两者都有定论之前,真正有用的问题并不是这两者中哪一个更好,因为其中一个根本无法运行。而是:在已经存在的那些模型当中,你现在应该基于哪一个来构建,以及当下一个检查点出现时,答案是否会改变。这个问题本周就有一个可验证的答案,而且它不需要等一个名字变成一个模型。
本文中的对比3
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
