用于 GLM-5.3 与 GLM-5.2 对比的主视觉标题卡片,副标题为“同一大脑,基准翻倍”,两张模型卡片共享一个相连的 743B MoE 基础模块,并有一条标有“仅后训练”的弧形升级箭头从 GLM-5.2 指向 GLM-5.3。
Guides & Insights

GLM-5.3 vs GLM-5.2:同款大脑,基准测试翻倍

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

智谱AI自身对从GLM-5.2升级到G​LM-5.3的定位是坦诚的:课本没有变,变的只是学生的训练。G​LM-5.3于2026年8月14日发布,与GLM-5.2建立在完全相同的7430亿参数MoE基础之上,后者于六月登顶Artificial Analysis Intelligence Index的开放权重领域。架构未变,体量未变,每百万token 1.40美元/4.40美元的定价也未变——然而Z.ai报告称,重新训练的模型在两个版本均公布的几项编码与安全基准上,表现较前代翻倍甚至更高。这是否让G​LM-5.3成为必须升级的选择还是值得观望的对象,取决于你有多信任一个未改变自身架构却提升如此之多的模型,也取决于它新出现的网络攻防能力,是否是一项你希望被放到两周安全窗口期之后才解锁的功能。

同一个大脑,重新训练

让 GLM-5.2 成为实用服务器的一切优势都得以延续:{{1}}约 40B 激活参数的 743B MoE 架构{{/1}}、{{2}}在 1M 上下文下降低 FLOPs 的 IndexShare 稀疏注意力机制{{/2}}、{{3}}MIT 许可证{{/3}}、{{4}}1M 上下文窗口{{/4}},以及{{5}}独立观测中实测约 145–168 token/秒的高效 token 吞吐量{{/5}}。G​LM-5.3 仅在一个维度上有所不同——{{6}}后训练{{/6}}。{{7}}Z.ai 利用 IndexShare、SAO 和 Slime 框架扩展了强化学习阶段,增加了数十倍的长时程任务环境,并将其从代码调试扩展到安全漏洞发现和系统工程{{/7}}。结果是,在相同硬件上模型的行为方式发生了变化——这正是为什么升级的问题不在于{{8}}"我需要新 GPU 吗",而在于"我需要新的行为表现吗"{{/8}}。

基准差异,在两个方向上。

若将 Z.ai 公布的数据视为前后对比,这一跃升是开放权重模型历史上最大的一次。Terminal-Bench 3.0——两者均参与评分的更严格版本——从 4.6 升至 28.3,提升了六倍。DeepSWE v1.1 从 46.2 升至 66.9,这相当于从“优秀的开放模型”跨越到“能与闭源领先者竞争”。Agents' Last Exam 的 CLI 子集从 23.8 升至 28.5。CyberGym 漏洞发现从 77.2 升至 84.5。ExploitBench 翻了一倍多,从 24.4 升至 54.4;ExploitGym 吞吐量从(两小时和六小时的)29 个和 39 个完成任务提升到 105 个和 130 个。Z.ai 将其总结为编码能力约提升 50%,而且收益的分布形态——集中在长周期编码、终端自动化和安全领域——与纯后训练模型的特征一致:底层知识不变,但实际执行多步骤任务的能力得到了增强。

• Terminal-Bench 3.0 — GLM-5.2 4.6 对比 GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 对比 GLM-5.3 66.9

• Agents' Last Exam (CLI) — GLM-5.2 23.8 对比 G​LM-5.3 28.5

• CyberGym 漏洞发现 — GLM-5.2 77.2 对比 GLM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 对比 G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

无人安排的能力

这些安全收益值得单独成段,因为Z.ai表示这并非计划之内。后训练团队添加了漏洞发现环境,原本只预期会有适度改进;但模型却开始串联出完整的漏洞利用链,这种涌现行为迫使Z.ai将权重扣留了大约两周以进行安全加固。在与安全团队的真实世界测试中,G​LM-5.3帮助在269个项目中发现了2,436个漏洞,其中1,097个属于中危或高危,包括一些在广泛部署的软件中潜伏数十年未被察觉的缺陷。GLM-5.2具备普通意义上的安全能力——它能阅读代码找出bug。而G​LM-5.3的能力则是另一种意义:它就是那个安全窗口所要防范的对象。这是本质上的改变,而非程度上的差异,也是为什么即便共享同一基础,仍应将这两个模型视为不同产品的最强理由。

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

一致性注意事项

上文所有数字都需要一个抵消因素:早期的第三方测试显示,GLM-5.3 的不稳定性是 GLM-5.2 所没有的。独立评测者报告称,同一个模型在某些任务上的表现就像一个勉强过关的外包工程师,在另一些任务上却能交出专业级的结果,而差异取决于需求说明的清晰程度。这恰恰是你预料中会出现的那种失败模式——如果一个模型的提升完全来自重度依赖环境的后期训练:它会从训练时见过的任务形态中泛化,而表述不清的提示词就落在这些形态之外。独立测试结果没有一项像 Z.ai 发布的表格那样干净,Z.ai 的数字也尚未被独立复现。对于生产环境而言,这要求在迁移之前先在自己的工作负载上做显式评估——GLM-5.2 时代就已有同样的告诫,只不过现在最佳与最差情况之间的差距更大了。

价格、获取途径和等待问题

{{1}}定价完全相同,消除了常见的升级阻力:两款模型均为每百万 token 1.40 美元 / 4.40 美元,其中 GLM-5.3 需要启用思考模式。{{2}}真正的区别在于访问方式。{{3}}GLM-5.2 现已可在 MIT 许可下下载,可在亚 TB 级 FP8 占用空间内自托管,并可通过 OrcaRouter 按标价调用、无任何加价——这是你现在就能路由使用的模型,稳定且经过独立评分。{{4}}GLM-5.3 目前可通过 Z.ai 的 ZCode / AutoClaw 和 GLM Coding Plan 使用,但公共 API 和权重均因安全窗口期而被限制开放,其基准测试数据全部为厂商自报,尚待第三方复测。{{5}}因此,对“我该不该等”的诚实回答分两部分:对于不能回退的生产流量,GLM-5.2 如今仍是安全可靠的开源权重之选;一旦 GLM-5.3 的 API 开放且独立运行结果验证通过,迁移只是一次路由切换,而非重写代码——你保留同一套一键配置,换一条车道即可。{{6}}对于探索性和安全评估类工作,GLM-5.3 现在值得通过 Z.ai 的工具一试,但要明白:其公布的领先优势尚未得到验证,且其行为比它所取代的模型更具波动性。

诚实的裁决

G​LM-5.3 在 Z.ai 自己公布的数字上是更好的模型——在长周期编码上显著更优,在安全性上更是本质性的不同——而且它对你的工作流是零成本的,因为底座、占用和价格都没有变化。但“在厂商自己的评估中更好”和“在你的流水线中更好”之间,隔着的正是 GLM-5.2 已经具备、而 G​LM-5.3 还没有的两样东西:独立的复现验证和可发布的权重。如果你已经在跑 GLM-5.2,升级路径是开放权重历史上最便宜的——同样的硬件、同样的价格、同样的 API 接口,只需要等两周就能拿到权重。这个决定与其说是关于 G​LM-5.3 是否比 GLM-5.2 更好,不如说是关于你是否愿意把生产环境押注在一个其改进——以及其新出现的安全能力——尚未得到 Z.ai 以外任何人验证的模型上。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube