GLM-5.2 解说页的主视觉卡片,包含一张显示 753B 总参数的卡片、一条显示 1M token 上下文的宽幅上下文横幅,以及一枚显示 MIT 开放权重的徽章,页脚显示 GLM-5.2 - 发布于 2026 年 6 月 16 日 - Z.ai。
Guides & Insights

什么是 GLM-5.2?Z.ai 的 1M 上下文开放权重旗舰模型,两个版本之后

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GLM-5.2 是来自 Z.ai 的开放权重、纯文本大语言模型,Z.ai 是一家位于北京的实验室,前身为智谱 AI,该模型于 2026 年 6 月 16 日在 MIT 许可证下发布。它是一个拥有 7530 亿参数的混合专家模型,上下文窗口为一百万个 token;在大约两个月里,它是任何人都能下载到的最强开放权重编程模型。它如今已不再占据这一位置,因为 Z.ai 此后又在其基础上推出了两个后继模型——而这正是大多数关于 GLM-5.2 的页面所遗漏的部分,也是决定你是否还应该关注它的关键。

本博客存档中有四十三篇文章提到了 GLM-5.2。但直到现在,没有一篇是真正关于它的:这个模型在一次次对比中都以对手的身份出现,成为新模型用来衡量的固定参照点。对于一个连其创造者都已经越过的模型而言,这是一种奇怪的角色,而这正是本页存在的原因——直接说明 GLM-5.2 究竟是什么、成本几何、擅长什么,以及谁仍然应该选择它。

GLM-5.2 在 Z.ai 自家产品线中的位置

Z.ai 会发布带日期的发布日志,这是关于此事最清晰的来源。按顺序读下来,这个系列的轮廓就一目了然:

Z.ai's public release-notes page, listing dated model entries in reverse chronological order: 2026-08-26 GLM-5.3-Flash, 2026-08-18 GLM-5.3, 2026-06-16 GLM-5.2 and 2026-04-07 GLM-5.1, each with its own summary bullet points.

GLM-5 — 2026年2月12日。首款 GLM-5,面向复杂系统工程和长程智能体任务。
GLM-5.1 — 2026年4月7日。长时程工作,可在单次运行中独立运行长达八小时。
• GLM-5.2 — 2026年6月16日。面向长时程任务的 1M 上下文旗舰模型;Z.ai 的日志将其描述为“1M 无损上下文,显著提升长时程任务能力”。
GLM-5.3 — 2026年8月18日。与 GLM-5.2 相同的基础模型,其提升来自后训练。Z.ai 报告称,在其自研 Code Bench 上比 GLM-5.2 提升 50%,并在 Terminal Bench 3.0 上达到开源最先进水平。
GLM-5.3-Flash — 2026年8月26日。一个基于新训练基座构建的不同且更小的模型(总参数 320B,激活 18B),是首个原生多模态 GLM-5。

最重要的条目是 GLM-5.3。GLM-5.3 并不是更大的 GLM-5.2——它使用相同的基础权重,并通过后训练进一步推进。这使得 GLM-5.2 成为该系列中最后一个能力源自架构的模型,也使 GLM-5.3 成为当前的文本旗舰。如果你今天仅凭质量来选择 Z.ai 模型,答案是 GLM-5.3,而不是 GLM-5.2。

GLM-5.3-Flash 并非更便宜的 GLM-5.3,而是一个独立分支:一个更小的原生多模态模型(文本、图像和视频),定价比文本旗舰模型低一个数量级。如果你需要视觉能力,那么无论哪种情况,GLM-5.2 都不是你想要的模型。

规格表

• 参数 — 总计 753B,依据模型卡片 zai-org/GLM-5.2-FP8。Z.ai 并未在该卡片上说明激活参数量;第三方列表给出的数值接近每 token 40B,我们无法从一手来源确认这一数字。
• 上下文窗口 — 1M tokens,卡片上描述为“稳固的 1M token 上下文,可稳定支撑长时程工作”。
• 最大输出 — 128K tokens。
• 模态 — 文本输入,文本输出。无图像输入,无音频。我们自己的目录条目指出该模型“仅支持文本输入”。
• 许可证 — MIT,无地区限制。权重通过 Hugging Face 上的 zai-org 组织以 BF16 和 FP8 变体发布。
• 推理控制 — 一种混合思考模式,由 reasoning_effort 参数驱动,具有 highmax 设置,默认为 max。支持原生工具调用和结构化输出。
• 架构 — IndexShare,它在每四个稀疏注意力层之间复用一个轻量级索引器,据模型卡片称,可在完整上下文下将每 token 的 FLOPs 降低 2.9 倍;此外还有一个改进的多 token 预测层,可将推测解码的接受长度最多提升 20%。
• 训练硬件 — 有关此次发布的媒体报道称,该模型是在华为昇腾加速器上训练的,未使用 Nvidia 硬件。这是新闻报道中的说法,并非来自模型卡片,我们仅按原文转述。

A scoreboard card for GLM-5.2 with six rows: released 16 June 2026, 753B total parameters MoE, 1M-token context with 128K output, MIT licence text only, price $1.40 and $4.40 per million tokens, and an Artificial Analysis Intelligence Index of 34, 11th of 114. The footer reads that vendor benchmarks are from Z.ai and the index is per Artificial Analysis v4.3.2.

GLM-5.2 在哪些方面表现出可量化的优势

GLM-5.2 所擅长的一切几乎都是编程或智能体方面的测量指标,而下面的数字均由厂商自行报告——它们来自 Z.ai 自家模型卡上的基准测试表格,而非独立复现的结果。

• Terminal Bench 2.1(Terminus-2)——81.0,而 GLM-5.1 为 63.5。这是表中单代之间最大的一次跃升。
• SWE-bench Pro——62.1,而 GLM-5.1 为 58.4。
• FrontierSWE(Dominance)——74.4,而 GLM-5.1 为 30.5,GPT-5.5 为 72.6。
• AIME 2026——99.2。GPQA-Diamond——91.2。在 Z.ai 自己的表中,两者都足以与闭源前沿模型一较高下。
• MCP-Atlas(公开集)——76.8,在同一张表上与 Claude Opus 4.8 的 77.8 基本持平。
• 长上下文召回——78.3,这是对于 100 万 token 窗口而言最重要的数字。只有当召回在深度上依然成立时,这个窗口才有用,而 Z.ai 自己的数据表明它大体上确实如此。

独立图景较为单薄,但真实存在。Artificial Analysis 在其 Intelligence Index v4.3.2 上将 GLM-5.2 的 Intelligence Index 分数列为 34,在同类别 114 个模型中排名第 11。这一数字附带两点提醒,且 Artificial Analysis 自身也说明了这两点:该模型在其页面上被标记为已弃用,并且他们“仅继续针对默认 10k 输入 token 工作负载进行性能基准测试”——其他工作负载的结果为历史数据,不再更新。我们自己的模型目录条目中带有 2026 年 6 月 25 日的一份较早评估快照,Intelligence 分数为 33.7;它与实时数字并非同一索引修订版本,不应被解读为该模型发生了变化。

它在哪些方面可衡量地表现不佳

有三件事,值得直说。

• 它仅支持文本。没有图像输入,也没有音频输入。GLM-5.3-Flash 是该系列中的多模态模型,如果你的工作负载涉及截图、PDF 或视频,那 GLM-5.2 完全是错误的分支。
• 在时程最长、难度最高的软件工程测评中,它输得很惨。在 SWE-Marathon 上它得 13.0 分,而 Claude Opus 4.8 为 26.0 分。在 DeepSWE 上它得 46.2 分,Claude Opus 4.8 为 58 分,GPT-5.5 为 70 分。在 NL2Repo 上它得 48.9 分,Opus 4.8 为 69.7 分。这些都是厂商报告的数字,出自同一张表格——而 GLM-5.2 在表中其他项目上却是胜出的,正因如此它们才可信:Z.ai 把它们与自家胜出的成绩并列发布。
• 在那些让它声名鹊起的指标上,它已被取代。GLM-5.3 使用相同的基础模型,并在 Z.ai 自家的 Code Bench 上以 50% 的优势超过它,在 Terminal Bench 3.0 和 Agents' Last Exam 上也是如此。GLM-5.2 在 Artificial Analysis 上也已被标记为弃用。

有一项数据我们无法获取:我们无法从能够打开的来源确认 GLM-5.2 当前的独立吞吐量或延迟测量数据,因此本页不列出任何数据,而不是重复一个我们无法核实的数字。

价格和在哪里运行

Z.ai 自己的费率表,今天查阅显示,GLM-5.2 的价格为:

• 输入 — 每百万 tokens 1.40 美元
• 缓存输入 — 每百万 tokens 0.26 美元
• 输出 — 每百万 tokens 4.40 美元

缓存输入存储被列为限时免费。请注意,GLM-5.3 采用完全相同的三档费率,因此较新的模型在 Z.ai 的价目表上并不更贵——这消除了通常继续使用旧模型的理由。

关于可用性:该模型通过 Z.ai 自有的、兼容 OpenAI 的端点提供服务,地址为 api.z.ai/api/paas/v4/chat/completions,并提供 Python 和 Java 官方 SDK;其权重可从 Hugging Face 下载,以 MIT 许可自行托管。除此之外,它还可在多个第三方推理平台上使用。我们将其接入路由:OrcaRouter 在其模型页面上以 Z.ai 供应商价格零加价提供 GLM-5.2,因此上文的 $1.40 / $4.40 就是通过我们购买时的价格,而不是加价后的版本。同一个密钥还可访问目录中的其余模型,这一点在此处有特定意义——详见下文。

The OrcaRouter model page for z-ai/glm-5.2, showing a Featured badge, a 1M-token context, 128K maximum output, text-only input and output, and rate cards reading $1.40 per million input tokens and $4.40 per million output tokens, alongside measured latency and a seven-day traffic figure.

谁应该选择 GLM-5.2,谁又应该选择其他方案?

选择 GLM-5.2,如果你是在自托管,且你的需求是 1M token 的上下文窗口而非基准测试分数。MIT 许可证没有区域限制,公开发布的 FP8 权重以及 IndexShare 注意力设计,使它成为一款在长上下文场景下真正实用的可运行模型,而深度召回率这一数字正是支撑该窗口的理由。如果你已有一条针对其reasoning_effort行为调优过的流水线,而针对 GLM-5.3 重新验证提示词的成本超过了收益,那么它也是一个合理的选择。

那就改选 GLM-5.3——如果你买的是 token 而非权重,且只以质量为唯一衡量标准。它基于同一个基座模型,后训练更充分,而目录价完全相同。在 Z.ai 自家的价目表上,找不到任何为旧模型辩护的价格理由。

请改用 GLM-5.3-Flash如果你需要视觉能力,或者需要最经济实惠的可用选项:它可处理文本、图像和视频,定价远低于两款文本旗舰模型。

干脆换个完全不同的东西吧——如果你的工作处于长周期软件工程中最难的那一端。在 Z.ai 自己公布的表格上,Claude Opus 4.8 在 SWE-Marathon、DeepSWE、NL2Repo、SWE-bench Pro、ProgramBench 和 Tool-Decathlon 上均胜过 GLM-5.2;GPT-5.5 则在 DeepSWE 和 ProgramBench 上胜过它。GLM-5.2 的胜绩是实打实的,但它们集中在终端式智能体编程与推理上,而非马拉松类任务。如果你的评测场景类似于针对一个陌生的大型代码仓库运行两小时的智能体,那么在这些数字面前,开放权重的价格优势并不能弥合这一差距。

实用摘要

GLM-5.2 是一款拥有 753B 参数、采用 MIT 许可、支持 1M 上下文的纯文本 MoE 模型,于 2026 年 6 月 16 日发布,定价为每百万 token 1.40 美元 / 4.40 美元。据厂商报告,其在 Terminal Bench 2.1 上的得分为 81.0,SWE-bench Pro 为 62.1,而在独立的 Artificial Analysis Intelligence Index 上得分为 34。它是最后一款能力源于架构而非后训练的 GLM 旗舰模型,已被其自家厂商两次取代,并在为其评分的独立指数上被标记为弃用。

这一切都不会让它成为一个糟糕的模型。它使其成为一个已尘埃落定的模型:2026年9月关于GLM-5.2的有趣问题,不是它是否优秀,而是你所需要的那件特定东西——一个长上下文、可自托管、MIT许可的编码模型——对你来说,是否比GLM-5.3在相同权重之上增加的那三个点更有价值。对大多数token买家来说,答案是否定的。对任何下载权重的人来说,答案仍然是肯定的。

如果你想在不把生产路径押上去的情况下亲自验证这一点,路由层是最省事的做法:通过一个端点把同一个请求同时发给 GLM-5.2 和 GLM-5.3,用你自己的提示词做对比,并让自动故障转移来处理较旧模型那一侧的端点恰好宕机的情况。

Call GLM-5.2 through OrcaRouter at the Z.ai provider rate, zero markup. https://www.orcarouter.ai/models/z-ai/glm-5.2 One API key reaches GLM-5.2, GLM-5.3 and 200+ other models, with automatic failover if an endpoint goes down.

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新