GLM-5.2 评测:以开放权重价格接近前沿编码?

GLM-5.2 评测:以开放权重价格接近前沿编码?

作者

Fengya Tian

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Z.ai 于 2026 年 6 月 16 日发布了 GLM-5.2,并将其称为专为长期任务打造的旗舰模型。这一次,这个标签名副其实。GLM-5.2 配备了 1M token 的上下文窗口,该窗口实际上是为长时间的编程代理会话而训练的,同时拥有迄今为止所有开放权重模型中最强的编码分数——并且它立即在所有平台上发布:Z.ai API、GLM 编程计划,以及在 Hugging Face 上提供完全 MIT 许可的权重,没有区域限制。

这份评测回答了大多数团队真正在问的问题:开源权重模型是否终于足够优秀,可以成为你的默认编码模型?封闭前沿的旗舰模型又在哪里仍然值得其溢价?我们将涵盖真正的新内容、GLM-5.2的实际成本(包括大多数文章忽略的缓存输入折扣)、它与GLM-5.1以及封闭前沿的对比,以及谁应该立即切换。

快速裁决

考虑 GLM-5.2 如果你……

运行大量编码或代理工作负载,期望以每百万令牌1.40美元/4.40美元的价格获得接近前沿的质量——仅为旗舰定价的一小部分

- 构建长期运行的编码代理——根据Z.ai发布的FrontierSWE结果,GLM-5.2与Claude Opus 4.8的差距在1分以内,并领先于GPT-5.5

- 需要一个具有100万token上下文窗口、最多128K输出token的模型,专门针对长而杂乱的代理轨迹进行训练,而非仅仅在规格表上声称如此。

- 想要开放权重:MIT许可证,自托管,微调,以及零供应商锁定

如果你……就暂缓(或停留在关闭的旗舰店)

- 在最难的代理工作上需要达到绝对天花板——Claude Opus 4.8 在工具编排和马拉松式自主任务上仍然明显领先

- 需要图像或文件输入:GLM-5.2 仅支持纯文本;视觉功能在 Z.ai 的独立 GLM-V 产品线中。

- 严重受延迟限制——GLM-5.2 是一个思考优先模型,公共网关统计显示中位首令牌时间在数秒范围内

什么是GLM-5.2?

GLM-5.2 是 Z.ai(前身为智谱 AI)旗下 GLM 系列的最新旗舰模型。Z.ai 是少数几个能以前沿规模发布开放权重模型的实验室之一。公开模型文档显示,该模型采用混合专家(Mixture-of-Experts)设计,总参数量约 7500 亿,每个 token 激活约 400 亿参数。模型 ID 为 `glm-5.2`,现已全面开放:你可以在 Z.ai 上直接对话、通过 Z.ai API 调用、在 GLM 编程计划订阅中使用(该订阅比公开发布早几天上线),或从 Hugging Face 下载权重并自行运行。

这一代最值得注意的是其定位。Z.ai 并非将 GLM-5.2 作为更廉价的陪跑产品来销售,而是将其宣传为最强的开源编程模型,并公布了相关数据,表明在开发者当前投入最多的长周期编程和智能体工作负载上,其表现与闭源前沿模型仅差几个百分点。

GLM-5.2 有什么新功能?

这是一个长期编码的跨越式升级,而非小版本更新。 最显著的变化是:在Z.ai发布的基准测试表中,GLM-5.2在Terminal-Bench 2.1上得分为81.0,而GLM-5.1为63.5;在SWE-bench Pro上得分为62.1,对比58.4。最惊人的数字来自FrontierSWE,该测试衡量耗时数小时至数十小时的开放式工程项目:GLM-5.2得分为74.4,而GLM-5.1为30.5。

稳定的1M-token上下文窗口。GLM-5.2 是首个将百万 token 窗口(是 GLM-5.1 的 200K 的五倍)与针对性训练相结合的 GLM 模型:Z.ai 表示,它在代码代理场景下大幅扩展了 1M 上下文训练——涵盖大规模实现、自动化研究、性能优化和复杂调试。每次回复的输出上限为 128K token。

精力级别控制。这一代的新功能:你可以通过设置思考努力级别,明确地在能力与执行速度和计算成本之间进行权衡,而不是为每个请求获得固定的推理深度。

底层架构更经济。Z.ai 的新 IndexShare 技术每四个稀疏注意力层重复使用同一个索引器,在全 1M 上下文长度下将每个 token 的计算量降低 2.9 倍,并且改进的 MTP 层通过将接受长度增加最多 20%,加速了推测解码。

纯粹开源。模型权重在MIT许可证下发布,用Z.ai的话说,没有区域限制——商业使用、微调和私有托管都是允许的。

定价:实际成本

第一方 GLM 5.2 API定价为每百万输入令牌1.40美元,每百万输出令牌4.40美元——与GLM-5.1价格相同,因此如果您已经在使用GLM API,能力升级是免费的。缓存输入降至每百万0.26美元,Z.ai目前限时免除缓存存储费用,这对于需要反复读取相同项目上下文数百次的智能体循环尤为重要。

作为参考:Claude Opus 4.8 的标价是每百万 token $5 / $25。如果 Z.ai 的基准测试表哪怕在方向上正确,GLM-5.2 以不到旗舰输出价格五分之一的价格,提供了前沿模型的大部分长周期编码能力。两点提醒:努力级别决定实际支出(更高的努力意味着更多的思考 token),第三方托管商有自己的定价——有些比第一方更便宜——所以在预算前核实当前价格。

评分

以下分数是基于Z.ai公布的基准和模型文档的编辑部评估——基准表为供应商自有。我们将随着独立结果的发布重新审视。

- 编程: 9/10

- 智能体/工具使用:8/10 — 在MCP-Atlas上接近前沿,但Opus 4.8在工具编排方面明显领先

- 推理能力:8/10 — 精英数学(AIME 2026:99.2,Z.ai表格中的最高分),然而最广泛的推理测试仍然偏向于闭源前沿。

- 成本效率:10/10

上下文和长文档:9/10

- 速度和延迟:7/10 — 一个思考优先模型;对于快速任务,使用较低的努力级别

总体评分:~8.5/10 ——第一个足够接近前沿的开源权重模型,是一个默认选择,而非妥协。

优点

- 接近前沿的长期编码,每百万token价格为1.40美元/4.40美元——与GLM-5.1相同,远低于闭源旗舰模型

- 稳定的100万令牌上下文,具有128K输出,基于真实编程代理轨迹进行训练

通过努力级别控制来调整每请求的成本、延迟与质量的权衡

- MIT开放权重:自行托管、微调或保留私有备用方案——无锁定,无地域限制

- 缓存输入每百万次0.26美元,缓存存储当前免费——对代理循环来说很重要

缺点

Claude Opus 4.8 仍然在最难的智能体基准测试中领先——工具编排和马拉松式任务尚未让 GLM-5.2 摘得桂冠。

- 纯文本模式:无图像输入,因此基于截图的或文档视觉的工作流需要改用其他模型

- 思考优先的设计意味着明显的首token延迟;对延迟敏感的用户体验需要降低努力设置或更快的备用模型。

自托管是一个数据中心项目,而不是一个周末项目——据报道,完整的检查点需要集群规模的GPU内存。

- 基准测试故事目前仅基于Z.ai自己的数据;独立复现的结果尚在陆续发布中

GLM-5.2 对比

对比GLM-5.1。同样的$1.40/$4.40价格标签,上下文窗口扩大五倍,以及一个如同代际跳跃般的长期跃升:FrontierSWE 74.4对30.5,Terminal-Bench 2.1 81.0对63.5,SWE-Marathon 13.0对1.0。如果你正在使用GLM-5.1,这是今年最轻松的升级决定——Z.ai甚至发布了专门的迁移指南。

与封闭前沿的对比(Claude Opus 4.8,GPT-5.5)。 在Z.ai的表格上,GLM-5.2在Terminal-Bench 2.1上与Opus 4.8相差不到4分(81.0对85.0),在FrontierSWE上相差不到1分(74.4对75.1),并且实际在SWE-bench Pro(62.1对58.6)和FrontierSWE(74.4对72.6)上击败了GPT-5.5。在任务最长、工具最密集的场景中,前沿模型仍保持优势:Opus 4.8在SWE-Marathon上的得分是GLM-5.2的两倍(26.0对13.0),并在Tool-Decathlon中以大幅优势领先。实用法则:GLM-5.2用于日常量,旗舰模型用于巅峰。

对比其他开放权重模型。相比Qwen3.7-MaxMiniMax M3和DeepSeek-V4-Pro,GLM-5.2在已发布的表格中位居所有编程行的榜首。截至目前,开放权重编程领域的桂冠属于Z.ai。

谁应该使用GLM-5.2?

- 规模运行编码代理的团队——CI机器人、自主重构、代码审查——每项任务的成本决定了经济上可行的范围。

- 希望获得接近前沿品质但无需前沿账单的开发工具构建者

- 长上下文工作负载:单体仓库分析、多文档工程规范、持续数小时的智能体会话,实际填充了100万token

- 需要开放权重的组织——出于合规性、气隙部署、微调,或仅仅是为了在与API供应商谈判时获得筹码

谁应该坚持使用封闭式旗舰机?

- 那些最困难的任务是马拉松长度的自主运行或繁重工具编排的团队——基准测试表明,前沿溢价在那里仍然真实存在。

- 依赖于视觉的工作流程:GLM-5.2 不接收图像。

- 首Token延迟的每一秒都会让用户付出代价

GLM-5.2 值得吗?

对于大多数编码和智能体工作负载,是的——非常肯定。诚实地讲:GLM-5.2 能以不到五分之一的价格提供前沿模型约90-95%的长周期编码能力,并附带开源权重作为保障。闭源旗舰模型仍然在最难的5%任务中占优。但这并非跳过 GLM-5.2 的理由,而是采取分流策略的依据:将常规任务交给 GLM-5.2,将登顶级难题升级至旗舰模型。

最终裁决

GLM-5.2 是当前可用的最强开源权重编程模型,也是第一个让人感觉是默认首选而非预算妥协的模型——我们的评分:约8.5/10。它虽未能在最高难度区间超越Claude Opus 4.8,但让旗舰模型成为了一款专精工具,而非日常工作的明显答案。如果你正在使用GLM-5.1,请立即升级。如果你正为常规代理任务支付旗舰级别的费用,这就是重新评估的信号。

通过OrcaRouter使用GLM-5.2

因为明智的做法是“GLM-5.2用于大容量,旗舰用于最困难的任务”,你很可能会在生产中使用不止一个模型——来自不止一个提供商。这就是OrcaRouter消除的摩擦。

OrcaRouter已通过一个OpenAI兼容端点为GLM-5.2(模型ID `z-ai/glm-5.2`)提供服务,采用Z.ai自身1.40美元/4.40美元的费率,且零代币加价。将高流量编码和智能体流量路由至GLM-5.2,将最难的推理升级到Claude Opus 4.8或其他旗舰模型,并保持自动故障转移以应对发布窗口的容量峰值——所有这些都无需在每次更换模型时重写集成。

常见问题

GLM-5.2现在可用了吗?

是的。它于2026年6月16日发布,现已普遍可用:在Z.ai的聊天和API(模型ID glm-5.2)上,在GLM编程计划内,通过OrcaRouter等网关,以及作为MIT许可的开源权重在Hugging Face上。

GLM-5.2 的价格是多少?

第一方API定价为每百万输入令牌1.40美元,每百万输出令牌4.40美元——与GLM-5.1保持不变。缓存输入为每百万0.26美元,缓存存储限时免费。

GLM-5.2 比 GLM-5.1 更好吗?

在长期任务上以显著优势领先:Terminal-Bench 2.1 上 81.0 对 63.5,FrontierSWE 上 74.4 对 30.5,以及 1M 上下文对 200K —— 且价格相同。

GLM-5.2 vs Claude Opus 4.8 — 我应该用哪个?

默认对高容量编码和代理工作使用GLM-5.2;将马拉松式的自主任务和繁重的工具编排升级到Opus 4.8,它在这方面仍然领先。在两者之间进行路由比只选一个更好。

什么是上下文窗口?

100万tokens,每次响应最多输出12.8万tokens——Z.ai表示,长上下文窗口是专门针对编码智能体场景训练的,而不仅仅是扩展。

GLM-5.2 真的是开源的吗?

是的——这些权重以MIT许可证发布,没有区域限制,免费用于商业用途和微调。不过,请务实地预算自托管:一个约750B参数的MoE检查点需要集群规模的GPU内存。

GLM-5.2 支持图像输入吗?

不。GLM-5.2 是文本输入、文本输出。对于视觉任务,Z.ai 维护了独立的 GLM-V 模型线,或者你可以将图像请求路由到多模态模型。

我可以通过OrcaRouter使用GLM-5.2吗?

确认——GLM-5.2已在OrcaRouter上以z-ai/glm-5.2的标识上线,采用第一方费率且零加价,与Claude、GPT、Gemini及其他模型一同位于一个兼容OpenAI的端点之后。

准备将GLM-5.2投入生产?几分钟内即可启动——创建您的OrcaRouter账户,通过一个兼容OpenAI的端点调用GLM-5.2、Claude Opus 4.8以及其他所有领先模型。前沿级编码的成本大幅降低;路由层正是您节省成本的方式。



© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube