GLM-5.3 的主标题卡片,带有“泄露报告”徽章,副标题为“Z.ai 的‘Epic Plus’旗舰机型——目前已知信息”,以及三个标签:“尚未发布”、“泄露线索:8月3日”和“GLM-5.2 的继任者”。
Guides & Insights

GLM-5.3 正式发布:泄露属实——Z.ai 的后训练编程与网络防御旗舰

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

泄露确有其事,发布已然到来,GLM-5.3 如今有了一个可供争论的独立分数。Artificial Analysis 的 Intelligence Index——由实验室测评,而非 Z.ai——将 GLM-5.3 评为 60 分,与 Kimi K3 并列开放权重最高分,领先 GLM-5.2 的 53 分达 7 分。API 已于本周上线,价格与此前版本相同;开放权重确认于 8 月 28 日(周五)发布;Z.ai 自 8 月 14 日公告以来一直宣称的编码与网络防御能力也开始变得可检验。本页最早从 8 月 3 日的泄露痕迹开始追踪 GLM-5.3;这是发布报告,并根据发布、API 以及首个独立基准实际确认的内容进行了就地更新。

从泄露到发布

8月3日浮出水面的四条线索——一个“ZCode for GLM-5.3”评测框架页面、一个大约仅可访问一小时的官方文档页面、一条内容为“GLM-5.3 Official Harness”的Bing索引条目,以及一个向智谱官方Java SDK添加带JSON Schema支持的“glm-5.3”条目的commit——都指向一个真实存在、有名字的版本发布。Z.ai联合创始人唐杰的“sooooooon”回复以及“史诗级+”(epic-level plus)的表述,如今已由实际产品而非传言证实。本页面所验证的“大约一周”时间信号——@teortaxesTex在DeepSeek V4 Pro于8月13日发布后在X上发布——精确到天应验了:Z.ai于8月14日正式发布GLM-5.3,口号为“为编码而生。为网络防御就绪。”后续消息于本周到来:8月19日,Z.ai表示GLM-5.3 API已上线并开放调用,定价与GLM-5.2相同,且该模型已接入ZCode、AutoClaw和GLM Coding Plan。

后训练实际上带来了什么

架构方面的说法是值得厘清的部分,因为泄露信息中最响亮的那个具体细节——参数突破一万亿——是错误的。GLM-5.3 并不是一个更大的模型。Z.ai 表示,它复用了与 GLM-5.2 完全相同的 743B 混合专家(MoE)底座(每个 token 约激活 400 亿参数),保持了相同的 1M token 上下文窗口和约 128K 最大输出,其全部提升都来自扩大规模的后训练:更多的长周期任务环境、更多的环境类型,以及更长时间的训练运行,这些都建立在 IndexShare 长上下文、SAO 异步强化学习和开源 slime 框架之上——正是这些框架产出了 GLM-5.2。这种“不重新训练、全部后训练”的表述是 Z.ai 自己的说法,尚未经过独立审计。规模是另一个头条:GLM-5.3 总参数 743B,每个 token 仅激活约 40B 参数,因此轻量到可以在一个中等规模的集群上自行托管,也便宜到可以大规模提供服务——这正是发布当天评论赋予它的“更小、更便宜、更开放”的定位,也与其被拿来比较的封闭式前沿旗舰模型形成鲜明对比。

编码与智能体:Z.ai声称的数字

在编程方面,Z.ai 报告——所有数据均来自厂商且未经独立复现——Terminal-Bench 3.0 从 4.6 升至 28.3,Z.ai 称这是该测试平台上开源权重的最佳成绩;DeepSWE v1.1 从 46.2 升至 66.9;SWE-Marathon 大致翻倍,从 19.4 升至 42.5;Agents' Last Exam(CLI)从 23.8 升至 28.5。在 Z.ai 的内部代码基准测试中,GLM-5.3 在高强度模式下每个任务约消耗 5 万个输出 token,得分 31.4%,而 Claude Opus 4.8 在约 12 万个 token 下得分 29.5%——Z.ai 的论点是,GLM-5.3 以远更少的输出 token 达到了相近的效果。Claude Fable 5 仍以最高强度模式下 39.5% 的成绩领先该内部评测,Z.ai 也承认 GLM-5.3 在若干难度更高的编码评测中仍落后于 GPT-5.6 Sol 和 Claude Fable 5。在独立测试平台复现这些结果之前,请将这些数据一律视为厂商数据。

网络防御:无人预见的能力

网络安全数据才是真正的新闻,而且这些数据完全是由厂商自行报告的。在CyberGym这个白盒漏洞发现与验证基准上,Z.ai报告GLM-5.3达到84.5%,高于GLM-5.2的77.2%,也领先于Anthropic的Mythos 5(83.8%)和GPT-5.6 Sol(83.6%)。在要求同时进行根因分析和可用漏洞利用的ExploitBench上,GLM-5.3从24.4%翻倍以上至54.4%,不过Mythos 5(78.0%)仍然领先。在ExploitGym上,Z.ai报告在2小时预算内完成105项任务,在6小时内完成130项,而GLM-5.2分别为29项和39项——再次落后于Mythos 5(181项和247项)。Z.ai将这种网络能力描述为规模化后训练中涌现出的特性——用该公司的话说就是“能力随着训练规模的扩大而持续复合增长”——而非刻意追求的目标。

Z.ai 为这些基准测试补充了一项真实世界的声明:在与安全团队进行的测试中,GLM-5.3 在 269 个开源项目中识别出了 2,436 个漏洞,其中 1,097 个被评为严重或高危级别,最早发现的问题可追溯至 1981 年,平均“寿命”为 26.6 年。这是整个公告中最引人注目的数字,也是最难以独立验证的一项。该公司将该能力与安全披露台账(Security Disclosure Ledger)配套用于协调披露,推出了一个“可信访问”计划,将敏感的网络安全功能限制在经核验的用户范围内,并发起了一项“开源盾牌”(Open Source Shield)计划,持续审计关键开源项目。

GLM-5.3 必须击败的基线

GLM-5.2 是整个故事所依托的基准点。它于 2026 年 6 月发布,是一个 743B 参数的专家混合模型,每个 token 约有 40B 激活参数,配备 100 万 token 上下文窗口、128K 最大输出、MIT 许可证,并在 Hugging Face 上开放权重。独立来看,Artificial Analysis 的 Intelligence Index 将 GLM-5.2 评为 53 分——这是该指数上开放权重模型的最高分,直到本周之前。如今 GLM-5.3 以 7 分之差超越它:Artificial Analysis 在同一指数(v4.1.1)上测得 GLM-5.3 为 60 分,与 Kimi K3 并列开放权重模型榜首,并进入前沿地带,与 Claude Fable 5 和 GPT-5.6 Sol 等闭源旗舰模型同列。这是 GLM-5.3 首次获得的独立评测数据,并且与 Z.ai 自身的说法方向一致——尽管并非每个细节都吻合。在长时程编码方面,OrcaRouter 测试框架在 Terminal-Bench 2.1 上测得 77.9 分,而 Z.ai 公布的最佳 GLM-5.2 成绩为 82.7 分——那将是首个突破 80 分的开放权重成绩,但该数据来自厂商自报,尚未被复现。标价分别为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元。

A two-column comparison scoreboard titled "GLM-5.3 vs GLM-5.2 — the scoreboard". Left column GLM-5.3 (rumored): Status "Leaked, not yet released", Size ">1T params (rumored)", Context "unconfirmed", Modality "text-first (rumored)", AA Index "~57-60 (projected)", License "unconfirmed". Right column GLM-5.2 (shipped): Status "Shipped June 2026", Size "753B MoE / 40B active", Context "1M tokens", Modality "text-only", AA Index "53", License "MIT". Footer reads "GLM-5.3 figures are unverified rumors; GLM-5.2 baseline per Artificial Analysis."

上方的记分板是本页在发布前基于泄漏信息所做的预测——">1T 参数(传闻)"一行、未经证实的上下文窗口和许可证、预测的 AA 指数。正式发布纠正了最大的一个格子:GLM-5.3 复用了与 GLM-5.2 相同的 743B 基础模型,因此参数量没有跃升。上下文窗口确认为 1M,许可证仍处于未证实状态,因为开放权重尚未发布。预测的指数格子——本页自己对约 57–60 的猜测——是少数完全命中的预测:实际数字是 60,而现在悬而未决的问题是,当这个分数在实际权重上复现时会发生什么。

A screenshot of the Artificial Analysis page for GLM-5.2 (max) showing an Intelligence Index of 53 (ranked #26), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, and a 1,000,000-token context window.

上面的测试结果是GLM-5.3各项声明所对照的独立基线。GLM-5.2以53分的Artificial Analysis Intelligence Index高居开放权重排行榜榜首。验证GLM-5.3训练后增量能否改变这一数字的首轮测试现已揭晓:Artificial Analysis在同一指数上测得GLM-5.3为60分——与Kimi K3并列开放权重领先,领先GLM-5.2七分,且该实验室报告称这是独立测量的结果。

定价与可用性

GLM-5.3 与 GLM-5.2 定价相同:每百万输入 token 1.40 美元,每百万输出 token 4.40 美元(国内列表为 ¥8 / ¥28),缓存输入读取为每百万 0.26 美元 / ¥2。Z.ai 于 8 月 19 日宣布 API 开放,可通过 Z.ai 自有 API、ZCode、AutoClaw、GLM 编程计划以及多个合作伙伴网关访问。对 API 调用者而言,有一个行为变化值得注意:请求现在需要在三种努力级别(低、高、最大)下启用“思考”,且无法关闭,这对现有集成来说是一个破坏性变更。

相同的价格并不意味着相同的账单。在相同的工作负载下,GLM-5.3 每个任务消耗的 token 数量大约比 GLM-5.2 多 20%,按每任务成本计算,GLM-5.3 约为 0.68 美元,而 GLM-5.2 为 0.44 美元——仍低于 Kimi K3(约 0.84 美元)和 GPT-5.6 Sol(约 1.23 美元)。这一每任务成本的数字是根据观察到的 token 使用量推算出来的估计值,并非厂商数据,但它正是决定统一的 1.40 美元 / 4.40 美元定价表是否真正为你省钱的关键数字。

这次发布将为你带来什么改变

对于已经在使用GLM-5.2的API调用者,实际的操作是修改模型名称,而非改造项目:GLM-5.2与OpenAI兼容,集成可以直接延续,但需要注意上文提到的思考投入(thinking-effort)限制。对于自托管用户,时间表现在是明确日期而非猜测:智谱于8月14日承诺权重"发布后两周"开放,即8月28日(星期五),悬而未决的问题在于许可证是否会继续保持宽松(permissive)。对于在DeepSeek V4 Pro、Qwen3.8-Max、Kimi K3、GPT-5.6 Sol和Claude Fable 5这一梯队中比较各模型的用户,GLM-5.3现在已是该排名中一个活跃的、经过独立评分的变量,而非传言。

GLM-5.3 发布当天的争论焦点是,编程前沿已经趋同:据说,对于大多数日常任务,很少有用户能可靠地区分 GPT-5.6 Sol、Claude Fable 5、Kimi K3、GLM-5.2 和 Qwen3.8-Max。如果这种趋同是真的,那么决定性因素就不再是原始能力,而是价格、开放性和切换成本——这正是 GLM-5.3 所占据的位置:每百万 tokens 1.40 美元 / 4.40 美元,基于可自行托管的 743B 基础模型,权重定于 8 月 28 日。编程模型是否真正可互换是一种观点,而不是基准;价格、参数数量和权重日期则不是。

在路由方面,GLM-5.3 于8月18日在 OrcaRouter 上线,同一天 Z.ai 的 API 开放——按照第一方标价,每百万(token)1.40 美元 / 4.40 美元,零加价透传。下方截图显示的是 GLM-5.2 的页面,其形态与现在的 GLM-5.3 完全一致:同样的价格、同样的 1M token 上下文、同样的 128K 最大输出。将一小部分真实流量路由到 GLM-5.3,并自动故障转移至 GLM-5.2 或另一个经过验证的模型,这只是一次配置更改,而非重写——同一个密钥,无需第二份合同。如果新模型在你的工作负载上出现退化,路由器会在翻页之前自动回退,你得到的是来自你自己流量的质量信号,而不是供应商的幻灯片。对于这样一个旗舰能力宣称仍主要来自供应商自述的模型,这是你亲自去验证的低风险方式。

The OrcaRouter model page for z-ai/glm-5.2 showing the model id, Tools, JSON and Reasoning capability chips, a 1,000,000-token context window, a 128,000-token max output, text input and text output, $1.40 per 1M input tokens and $4.40 per 1M output tokens, and a p50 time-to-first-token of 5.95 seconds.

接下来看什么

权重将于8月28日(星期五)发布,模型卡上的许可证条款则是——类似GLM-5.2的宽松MIT许可,或更严格的条款。智谱以网络安全加固为由推迟了两周,而“可信访问”计划表明,某些功能无论如何都将受到限制。

• {{1}}这些网络安全声明是否在Z.ai自身测试环境之外依然成立{{/1}}。{{2}}关于2,436个漏洞的真实世界声明以及CyberGym的领先优势{{/2}},{{3}}将是独立实验室首先检验的数字{{/3}};{{4}}而AA Intelligence Index衡量的是通用能力,而非安全性{{/4}}。

• 一旦权重公布,指数将落在何处。60 分是依据所提供的 API 评定的;附带许可证的自托管版本才是团队实际会重新部署的那个。

• DeepSeek V4 Flash 宣布提价,这为 GLM-5.3 的评估设定了定价范围,而 GPT-5.6 Sol 以 61 分领先一分。

常见问题

GLM-5.3 是比 GLM-5.2 更大的模型吗?

不是的。Z.ai表示,GLM-5.3使用了与GLM-5.2相同的7430亿参数混合专家(Mixture-of-Experts)基础模型,拥有相同的100万token上下文窗口,每个token约激活400亿参数。所有报告的性能提升均来自扩展的后训练,而非参数增加——这直接纠正了泄露传闻中关于基础模型超过一万亿参数的说法。该架构声明是Z.ai自身的说法,尚未经过独立审计。

GLM-5.3的开放权重何时可用?

8月28日,星期五。智谱在8月14日发布GLM-5.3时承诺权重"发布后两周"上线,并在8月19日API上线时表示"下周五"——两种说法指向同一天。许可证尚未确认,Z.ai表示敏感网络功能将仅限于经过验证用户的"可信访问"计划。

我应该如何处理基准数字?

拆分列表。编码(coding)方面的跃升——Terminal-Bench 3.0 为 28.3,DeepSWE v1.1 为 66.9,SWE-Marathon 为 42.5——以及网络安全结果——CyberGym 84.5%,ExploitBench 54.4%——均来自 Z.ai 自己的公告,并且在独立测试工具复现之前,仍属于供应商报告的数据。Artificial Analysis Intelligence Index 为 60 是第一个独立测量结果,而这个数字才是用来衡量 Z.ai 所有宣称的基准。

这次泄露是真的,发布确认了名称、定位和时机——同时也纠正了传闻最盛的那个具体说法。GLM-5.3 基于同一底座,经过高强度后训练,如今它带着一个独立的分数来支撑厂商的说法:在 Artificial Analysis Intelligence Index 上得 60 分,与 Kimi K3 并列,领先 GLM-5.2 七分。代码与网络安全的数据仍是 Z.ai 自报的,权重于 8 月 28 日开放下载,而许可条款和对安全声明的真正独立检验仍待解决。在此之前,形成自己判断的低风险方式是分出一部分真实流量,并故障切换到经过验证的方案。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube