
GLM-5.3 vs GLM-5.2:同款大脑,基准测试翻倍
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- meta新Meta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
- grokxAI: Grok 4.52026-07-0856智能72代码
- tencentTencent: Hy32026-07-0642智能59代码
智谱AI自身对从GLM-5.2升级到GLM-5.3的定位是坦诚的:课本没有变,变的只是学生的训练。GLM-5.3于2026年8月14日发布,与GLM-5.2建立在完全相同的7430亿参数MoE基础之上,后者于六月登顶Artificial Analysis Intelligence Index的开放权重领域。架构未变,体量未变,每百万token 1.40美元/4.40美元的定价也未变——然而Z.ai报告称,重新训练的模型在两个版本均公布的几项编码与安全基准上,表现较前代翻倍甚至更高。这是否让GLM-5.3成为必须升级的选择还是值得观望的对象,取决于你有多信任一个未改变自身架构却提升如此之多的模型,也取决于它新出现的网络攻防能力,是否是一项你希望被放到两周安全窗口期之后才解锁的功能。
同一个大脑,重新训练
让 GLM-5.2 成为实用服务器的一切优势都得以延续:{{1}}约 40B 激活参数的 743B MoE 架构{{/1}}、{{2}}在 1M 上下文下降低 FLOPs 的 IndexShare 稀疏注意力机制{{/2}}、{{3}}MIT 许可证{{/3}}、{{4}}1M 上下文窗口{{/4}},以及{{5}}独立观测中实测约 145–168 token/秒的高效 token 吞吐量{{/5}}。GLM-5.3 仅在一个维度上有所不同——{{6}}后训练{{/6}}。{{7}}Z.ai 利用 IndexShare、SAO 和 Slime 框架扩展了强化学习阶段,增加了数十倍的长时程任务环境,并将其从代码调试扩展到安全漏洞发现和系统工程{{/7}}。结果是,在相同硬件上模型的行为方式发生了变化——这正是为什么升级的问题不在于{{8}}"我需要新 GPU 吗",而在于"我需要新的行为表现吗"{{/8}}。
基准差异,在两个方向上。
若将 Z.ai 公布的数据视为前后对比,这一跃升是开放权重模型历史上最大的一次。Terminal-Bench 3.0——两者均参与评分的更严格版本——从 4.6 升至 28.3,提升了六倍。DeepSWE v1.1 从 46.2 升至 66.9,这相当于从“优秀的开放模型”跨越到“能与闭源领先者竞争”。Agents' Last Exam 的 CLI 子集从 23.8 升至 28.5。CyberGym 漏洞发现从 77.2 升至 84.5。ExploitBench 翻了一倍多,从 24.4 升至 54.4;ExploitGym 吞吐量从(两小时和六小时的)29 个和 39 个完成任务提升到 105 个和 130 个。Z.ai 将其总结为编码能力约提升 50%,而且收益的分布形态——集中在长周期编码、终端自动化和安全领域——与纯后训练模型的特征一致:底层知识不变,但实际执行多步骤任务的能力得到了增强。
• Terminal-Bench 3.0 — GLM-5.2 4.6 对比 GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 对比 GLM-5.3 66.9
• Agents' Last Exam (CLI) — GLM-5.2 23.8 对比 GLM-5.3 28.5
• CyberGym 漏洞发现 — GLM-5.2 77.2 对比 GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 对比 GLM-5.3 54.4


无人安排的能力
这些安全收益值得单独成段,因为Z.ai表示这并非计划之内。后训练团队添加了漏洞发现环境,原本只预期会有适度改进;但模型却开始串联出完整的漏洞利用链,这种涌现行为迫使Z.ai将权重扣留了大约两周以进行安全加固。在与安全团队的真实世界测试中,GLM-5.3帮助在269个项目中发现了2,436个漏洞,其中1,097个属于中危或高危,包括一些在广泛部署的软件中潜伏数十年未被察觉的缺陷。GLM-5.2具备普通意义上的安全能力——它能阅读代码找出bug。而GLM-5.3的能力则是另一种意义:它就是那个安全窗口所要防范的对象。这是本质上的改变,而非程度上的差异,也是为什么即便共享同一基础,仍应将这两个模型视为不同产品的最强理由。

一致性注意事项
上文所有数字都需要一个抵消因素:早期的第三方测试显示,GLM-5.3 的不稳定性是 GLM-5.2 所没有的。独立评测者报告称,同一个模型在某些任务上的表现就像一个勉强过关的外包工程师,在另一些任务上却能交出专业级的结果,而差异取决于需求说明的清晰程度。这恰恰是你预料中会出现的那种失败模式——如果一个模型的提升完全来自重度依赖环境的后期训练:它会从训练时见过的任务形态中泛化,而表述不清的提示词就落在这些形态之外。独立测试结果没有一项像 Z.ai 发布的表格那样干净,Z.ai 的数字也尚未被独立复现。对于生产环境而言,这要求在迁移之前先在自己的工作负载上做显式评估——GLM-5.2 时代就已有同样的告诫,只不过现在最佳与最差情况之间的差距更大了。
价格、获取途径和等待问题
{{1}}定价完全相同,消除了常见的升级阻力:两款模型均为每百万 token 1.40 美元 / 4.40 美元,其中 GLM-5.3 需要启用思考模式。{{2}}真正的区别在于访问方式。{{3}}GLM-5.2 现已可在 MIT 许可下下载,可在亚 TB 级 FP8 占用空间内自托管,并可通过 OrcaRouter 按标价调用、无任何加价——这是你现在就能路由使用的模型,稳定且经过独立评分。{{4}}GLM-5.3 目前可通过 Z.ai 的 ZCode / AutoClaw 和 GLM Coding Plan 使用,但公共 API 和权重均因安全窗口期而被限制开放,其基准测试数据全部为厂商自报,尚待第三方复测。{{5}}因此,对“我该不该等”的诚实回答分两部分:对于不能回退的生产流量,GLM-5.2 如今仍是安全可靠的开源权重之选;一旦 GLM-5.3 的 API 开放且独立运行结果验证通过,迁移只是一次路由切换,而非重写代码——你保留同一套一键配置,换一条车道即可。{{6}}对于探索性和安全评估类工作,GLM-5.3 现在值得通过 Z.ai 的工具一试,但要明白:其公布的领先优势尚未得到验证,且其行为比它所取代的模型更具波动性。
诚实的裁决
GLM-5.3 在 Z.ai 自己公布的数字上是更好的模型——在长周期编码上显著更优,在安全性上更是本质性的不同——而且它对你的工作流是零成本的,因为底座、占用和价格都没有变化。但“在厂商自己的评估中更好”和“在你的流水线中更好”之间,隔着的正是 GLM-5.2 已经具备、而 GLM-5.3 还没有的两样东西:独立的复现验证和可发布的权重。如果你已经在跑 GLM-5.2,升级路径是开放权重历史上最便宜的——同样的硬件、同样的价格、同样的 API 接口,只需要等两周就能拿到权重。这个决定与其说是关于 GLM-5.3 是否比 GLM-5.2 更好,不如说是关于你是否愿意把生产环境押注在一个其改进——以及其新出现的安全能力——尚未得到 Z.ai 以外任何人验证的模型上。
