标题卡写着“Grok 4.7 vs GLM-5.2”,副标题是“许可证的寿命长于模型”,另有三张卡片:AA Index v4.3.2 为 46 对 34,许可证为闭源对 MIT,每百万价格 $2/$6 对 $1.40/$4.40。
Guides & Insights

Grok 4.7 对比 GLM-5.2:许可证比模型存续更久

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

GLM-5.2 最有价值的地方不在于它的基准测试分数,而在于 MIT 这四个字母。Z.ai 于 2026 年 6 月 16 日以标准 MIT 许可证发布了 GLM-5.2,没有地域限制,没有收入门槛,除了保留版权声明外没有商业使用条件——而当 Z.ai 两个月后推出 GLM-5.3 时,它没有再这样做。继任者带有定制的“GLM-5.3 许可证”,其中增加了一项例外条款:任何连续十二个月内收入超过 100 亿美元的模型即服务运营商必须通过安全审查,而该审查的范围“由 Z.AI 合理确定”。GLM-5.2 是 Z.ai 在没有附加这一条款的情况下发布的最后一款文本旗舰模型。与 Grok 4.7——由该厂商于 2026 年 9 月 21 日发布,闭源权重,发布仅一天——相比,这让这场对比成为榜单上最强模型与最自由模型之间的较量。

其中一个你可以完全拥有

GLM-5.2 是一个拥有 7530 亿参数的混合专家模型,每个 token 大约激活 40B 参数,以 BF16 和 FP8 格式在 Hugging Face 上由 zai-org 组织发布。它具备 1M token 的上下文窗口和 128K 的最大输出。它只接受文本输入、输出文本——没有原生视觉能力——并支持函数调用、MCP 集成、结构化 JSON 输出和上下文缓存,以及默认开启的思考模式,并带有推理强度设置。Z.ai 的第一方 API 定价为每百万输入 token 1.40 美元,缓存输入为 0.26 美元,每百万输出为 4.40 美元。

Grok 4.7 是闭源的。它拥有 50 万 token 的上下文,接受文本和图像输入,定价为:在提示词 token 低于 20 万时,输入每百万 token 2.00 美元、输出每百万 token 6.00 美元;超过这一门槛则升至 4.00 美元和 12.00 美元;缓存读取为 0.50 美元和 1.00 美元。它没有权重下载,没有自托管路径,如果 xAI 改变主意,也没有办法继续调用它——这与每一个闭源旗舰模型的结构性处境相同。两个模型都很强;但其中只有一个是可以放进磁盘里的资产。

索引说了什么,以及这里“deprecated”是什么意思

Artificial Analysis 在 Intelligence Index v4.3.2——即 2026 年 9 月 19 日发布的修订版——上给 GLM-5.2 打出了 34 分,在同一修订版上给 Grok 4.7 打出了 46 分。这十二分的差距是真实存在的,而它的形态比大小更重要。GLM-5.2 在其 Artificial Analysis 页面上还带有一个"deprecated"(已弃用)标签,并附有一条说明:已有更新的模型存在,且只有默认的 10k token 工作负载仍在接受基准测试。这个标签关乎的是迭代接替,而非关停:Z.ai 至今仍在提供 glm-5.2 服务,也仍将其列在定价表中。

综合 — Grok 4.7(xhigh):在 Artificial Analysis Intelligence Index v4.3.2 上获得 46 分。GLM-5.2(max):在相同版本上获得 34 分。

智能体终端 — Grok 4.7:Terminal-Bench 4.0 得 26 分。GLM-5.2:1 分。这是本轮对比中最极端的一个单独数字,而它也需要随之而来的那条说明。Z.ai 自家的模型卡显示,GLM-5.2 在 Terminal-Bench 2.1 上为 81.0,最佳测试框架下为 82.7。这两个数字都是真实的;它们出自不同版本的基准测试,而 v4.3.2 指数已弃用 2.1,改用 4.0。厂商在一个已弃用基准测试上的得分,说明的是模型面对旧测试能做什么,而非它现在的表现。

工作流自动化 —— Grok 4.7:AutomationBench-AA 66%。GLM-5.2:28%。两者均在 v4.3.2 上测得,因此这一项无需附加版本说明。

知识诚实度——Grok 4.7:AA-Omniscience 32。GLM-5.2:4。双方再次是同一个版本。

推理与长上下文 —— Grok 4.7:HLE 43,CritPt 18,AA-LCR v1.1 77%,窗口 500k。GLM-5.2:HLE 41,CritPt 21,AA-LCR v1.1 78%,窗口 1M。在这四项指标中,GLM-5.2 赢下其中两项,而上下文窗口则是对方的两倍。

速度 — Grok 4.7:Artificial Analysis 尚未进行测量。GLM-5.2:通过 Z.ai 的 API 达到每秒 73 个 token,首 token 用时 5.98 秒,据称比同量级开放权重模型的平均水平更慢。

价格 — Grok 4.7:每 100 万 token 2.00 美元 / 6.00 美元,提示词达到 20 万 token 后价格翻倍。GLM-5.2:每 100 万 token 1.40 美元 / 4.40 美元,缓存读取为 0.26 美元,自发布以来保持不变。

OrcaRouter model page for GLM-5.2 showing the z-ai/glm-5.2 identifier, a 1M-token context window, a 128K maximum output, text-only input and output, list rates of $1.40 per 1M input and $4.40 per 1M output, and 24.7M tokens of traffic over seven days.

自托管的真正理由在于经济账

按每 token 计算,在短提示词场景下,GLM-5.2 的输入价格比 Grok 4.7 便宜约百分之三十,输出价格便宜百分之二十七——这点折扣本身并不足以决定什么。它之所以重要,是因为每 token 的价格是可选的。GLM-5.2 的权重可依据一份允许商业使用、修改、再分发和再许可的许可证下载,这意味着真正相关的比较不是 1.40 美元对 2.00 美元,而是 1.40 美元对你自己 GPU 每百万 token 的成本。一个 753B 参数、40B 激活的模型不是笔记本电脑级别的工作负载;它是一项严肃的推理部署,而 FP8 检查点正是为此而存在。但这是你可以运行、设定上限并审计的部署——对于受监管的工作负载或气隙环境而言,这根本就不是成本问题。

对应的制衡因素是反方向的继任风险。GLM-5.2 落后两个版本:GLM-5.3 于 8 月 18 日发布,GLM-5.3-Flash 于 8 月 26 日发布,而更新的旗舰模型得分更高——GLM-5.3 在 v4.3.2 上为 45 分,比 Grok 4.7 低一分。所以,诚实的说法是:GLM-5.2 是免费的那个,而不是最好的那个,并且 Z.ai 自家更新的模型既更强,许可限制也更多。如果你需要的是宽松许可,GLM-5.2 就是应当冻结的终点;如果你需要的是开放权重集上的原始能力,那么后继模型才是应当评估的对象,同时要以律师的眼光审视其营收除外条款。

Two-column scoreboard titled “Grok 4.7 vs GLM-5.2 - the scoreboard”: AA Index 46 vs 34, Terminal-Bench 4.0 26 vs 1, context 500k vs 1M, price per 1M $2/$6 vs $1.40/$4.40, and licence “closed” vs “MIT”.

同时运行两者,而不运行两个堆栈

OrcaRouter 已上线 GLM-5.2,在其专属模型页面上标价为输入 $1.40、输出 $4.40,支持 1M 上下文窗口和 128K 最大输出,因为我们以 0% 加价率透传提供商的目录定价。对于开放权重模型,这种透传还有第二种用途:托管价格与自托管方案都是随时可用的选项,而路由器让你可以按请求、而非按合同在两者之间调度流量。自 6 月以来,Z.ai 一直将 GLM-5.2 的目录价格保持不变,而第三方托管商的价格则时有变动,因此当日透传意味着你报出的是今天的费率,而不是上个月抄下来的费率。自动故障转移可应对自托管部署达到饱和、必须由托管端点承接溢出流量的情况——路由 DSL 可将两者组合为一次调用。截至本文撰写时,Grok 4.7 尚未进入 OrcaRouter 的模型目录;要调用它,需通过 xAI 自有 API 以及提供该模型的第三方平台。

从这一切中得出的决策规则异常清晰。如果你需要自己拥有模型——本地部署、可审计、无需收入审查即可获得许可——GLM-5.2 是这两者中唯一能提供这一点的,而十二个点的指数差距就是这种自由的代价。如果你需要的是能完成智能体工作的模型,差距则朝另一个方向,而且并不微妙:在工作流自动化上为 66% 对 28%,在终端智能体上为 26 对 1,在知识诚实度上为 32 对 4。许可问题中的任何东西都无法改变这些数字。

呼叫

Grok 4.7 在能力对比中胜出,而且它胜在那些能预测智能体是否会完成任务的评测上。GLM-5.2 则在两项任何基准测试都无法衡量的东西上胜出:它更便宜,而且它属于你自己。让这件事值得记录下来的细节在于,第二个优势正在失效——Z.ai 更新的旗舰模型放弃了不受限制的 MIT 许可证,因此一个在 2026 年 6 月以不对你提出任何要求的条款发布的模型,如今已是历史遗物,而非一项政策。如果宽松的开源权重是你产品的承重结构,那么这就是一个理由,让你趁 GLM-5.2 仍是廉价的托管选项、仍可下载时,将其作为标准。如果不是,那就买下那十二分。

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新