
Grok 4.7 对比 GLM-5.2:许可证比模型存续更久
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 最有价值的地方不在于它的基准测试分数,而在于 MIT 这四个字母。Z.ai 于 2026 年 6 月 16 日以标准 MIT 许可证发布了 GLM-5.2,没有地域限制,没有收入门槛,除了保留版权声明外没有商业使用条件——而当 Z.ai 两个月后推出 GLM-5.3 时,它没有再这样做。继任者带有定制的“GLM-5.3 许可证”,其中增加了一项例外条款:任何连续十二个月内收入超过 100 亿美元的模型即服务运营商必须通过安全审查,而该审查的范围“由 Z.AI 合理确定”。GLM-5.2 是 Z.ai 在没有附加这一条款的情况下发布的最后一款文本旗舰模型。与 Grok 4.7——由该厂商于 2026 年 9 月 21 日发布,闭源权重,发布仅一天——相比,这让这场对比成为榜单上最强模型与最自由模型之间的较量。
其中一个你可以完全拥有
GLM-5.2 是一个拥有 7530 亿参数的混合专家模型,每个 token 大约激活 40B 参数,以 BF16 和 FP8 格式在 Hugging Face 上由 zai-org 组织发布。它具备 1M token 的上下文窗口和 128K 的最大输出。它只接受文本输入、输出文本——没有原生视觉能力——并支持函数调用、MCP 集成、结构化 JSON 输出和上下文缓存,以及默认开启的思考模式,并带有推理强度设置。Z.ai 的第一方 API 定价为每百万输入 token 1.40 美元,缓存输入为 0.26 美元,每百万输出为 4.40 美元。
Grok 4.7 是闭源的。它拥有 50 万 token 的上下文,接受文本和图像输入,定价为:在提示词 token 低于 20 万时,输入每百万 token 2.00 美元、输出每百万 token 6.00 美元;超过这一门槛则升至 4.00 美元和 12.00 美元;缓存读取为 0.50 美元和 1.00 美元。它没有权重下载,没有自托管路径,如果 xAI 改变主意,也没有办法继续调用它——这与每一个闭源旗舰模型的结构性处境相同。两个模型都很强;但其中只有一个是可以放进磁盘里的资产。
索引说了什么,以及这里“deprecated”是什么意思
Artificial Analysis 在 Intelligence Index v4.3.2——即 2026 年 9 月 19 日发布的修订版——上给 GLM-5.2 打出了 34 分,在同一修订版上给 Grok 4.7 打出了 46 分。这十二分的差距是真实存在的,而它的形态比大小更重要。GLM-5.2 在其 Artificial Analysis 页面上还带有一个"deprecated"(已弃用)标签,并附有一条说明:已有更新的模型存在,且只有默认的 10k token 工作负载仍在接受基准测试。这个标签关乎的是迭代接替,而非关停:Z.ai 至今仍在提供 glm-5.2 服务,也仍将其列在定价表中。
• 综合 — Grok 4.7(xhigh):在 Artificial Analysis Intelligence Index v4.3.2 上获得 46 分。GLM-5.2(max):在相同版本上获得 34 分。
• 智能体终端 — Grok 4.7:Terminal-Bench 4.0 得 26 分。GLM-5.2:1 分。这是本轮对比中最极端的一个单独数字,而它也需要随之而来的那条说明。Z.ai 自家的模型卡显示,GLM-5.2 在 Terminal-Bench 2.1 上为 81.0,最佳测试框架下为 82.7。这两个数字都是真实的;它们出自不同版本的基准测试,而 v4.3.2 指数已弃用 2.1,改用 4.0。厂商在一个已弃用基准测试上的得分,说明的是模型面对旧测试能做什么,而非它现在的表现。
• 工作流自动化 —— Grok 4.7:AutomationBench-AA 66%。GLM-5.2:28%。两者均在 v4.3.2 上测得,因此这一项无需附加版本说明。
• 知识诚实度——Grok 4.7:AA-Omniscience 32。GLM-5.2:4。双方再次是同一个版本。
• 推理与长上下文 —— Grok 4.7:HLE 43,CritPt 18,AA-LCR v1.1 77%,窗口 500k。GLM-5.2:HLE 41,CritPt 21,AA-LCR v1.1 78%,窗口 1M。在这四项指标中,GLM-5.2 赢下其中两项,而上下文窗口则是对方的两倍。
• 速度 — Grok 4.7:Artificial Analysis 尚未进行测量。GLM-5.2:通过 Z.ai 的 API 达到每秒 73 个 token,首 token 用时 5.98 秒,据称比同量级开放权重模型的平均水平更慢。
• 价格 — Grok 4.7:每 100 万 token 2.00 美元 / 6.00 美元,提示词达到 20 万 token 后价格翻倍。GLM-5.2:每 100 万 token 1.40 美元 / 4.40 美元,缓存读取为 0.26 美元,自发布以来保持不变。

自托管的真正理由在于经济账
按每 token 计算,在短提示词场景下,GLM-5.2 的输入价格比 Grok 4.7 便宜约百分之三十,输出价格便宜百分之二十七——这点折扣本身并不足以决定什么。它之所以重要,是因为每 token 的价格是可选的。GLM-5.2 的权重可依据一份允许商业使用、修改、再分发和再许可的许可证下载,这意味着真正相关的比较不是 1.40 美元对 2.00 美元,而是 1.40 美元对你自己 GPU 每百万 token 的成本。一个 753B 参数、40B 激活的模型不是笔记本电脑级别的工作负载;它是一项严肃的推理部署,而 FP8 检查点正是为此而存在。但这是你可以运行、设定上限并审计的部署——对于受监管的工作负载或气隙环境而言,这根本就不是成本问题。
对应的制衡因素是反方向的继任风险。GLM-5.2 落后两个版本:GLM-5.3 于 8 月 18 日发布,GLM-5.3-Flash 于 8 月 26 日发布,而更新的旗舰模型得分更高——GLM-5.3 在 v4.3.2 上为 45 分,比 Grok 4.7 低一分。所以,诚实的说法是:GLM-5.2 是免费的那个,而不是最好的那个,并且 Z.ai 自家更新的模型既更强,许可限制也更多。如果你需要的是宽松许可,GLM-5.2 就是应当冻结的终点;如果你需要的是开放权重集上的原始能力,那么后继模型才是应当评估的对象,同时要以律师的眼光审视其营收除外条款。

同时运行两者,而不运行两个堆栈
OrcaRouter 已上线 GLM-5.2,在其专属模型页面上标价为输入 $1.40、输出 $4.40,支持 1M 上下文窗口和 128K 最大输出,因为我们以 0% 加价率透传提供商的目录定价。对于开放权重模型,这种透传还有第二种用途:托管价格与自托管方案都是随时可用的选项,而路由器让你可以按请求、而非按合同在两者之间调度流量。自 6 月以来,Z.ai 一直将 GLM-5.2 的目录价格保持不变,而第三方托管商的价格则时有变动,因此当日透传意味着你报出的是今天的费率,而不是上个月抄下来的费率。自动故障转移可应对自托管部署达到饱和、必须由托管端点承接溢出流量的情况——路由 DSL 可将两者组合为一次调用。截至本文撰写时,Grok 4.7 尚未进入 OrcaRouter 的模型目录;要调用它,需通过 xAI 自有 API 以及提供该模型的第三方平台。
从这一切中得出的决策规则异常清晰。如果你需要自己拥有模型——本地部署、可审计、无需收入审查即可获得许可——GLM-5.2 是这两者中唯一能提供这一点的,而十二个点的指数差距就是这种自由的代价。如果你需要的是能完成智能体工作的模型,差距则朝另一个方向,而且并不微妙:在工作流自动化上为 66% 对 28%,在终端智能体上为 26 对 1,在知识诚实度上为 32 对 4。许可问题中的任何东西都无法改变这些数字。
呼叫
Grok 4.7 在能力对比中胜出,而且它胜在那些能预测智能体是否会完成任务的评测上。GLM-5.2 则在两项任何基准测试都无法衡量的东西上胜出:它更便宜,而且它属于你自己。让这件事值得记录下来的细节在于,第二个优势正在失效——Z.ai 更新的旗舰模型放弃了不受限制的 MIT 许可证,因此一个在 2026 年 6 月以不对你提出任何要求的条款发布的模型,如今已是历史遗物,而非一项政策。如果宽松的开源权重是你产品的承重结构,那么这就是一个理由,让你趁 GLM-5.2 仍是廉价的托管选项、仍可下载时,将其作为标准。如果不是,那就买下那十二分。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
