Nex-N2.5 Pro 对决 GLM-5.2 的主视觉——一张生成的标题卡片,上面写着“Nex-N2.5 Pro vs GLM-5.2”,副标题为“两款开放权重的智能体模型,一个可疑的巧合:82.7”,并带有眉题“Nex-AGI vs Z.ai——2026年9月”。
Guides & Insights

Nex-N2.5 Pro 对比 GLM-5.2:Terminal-Bench 同为82.7分,两种迥然不同的出身

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个开放权重智能体模型,一个可疑的巧合:Nex-N2.5 Pro 和 GLM-5.2 在 Terminal-Bench 2.1 上双双拿到 82.7 分。Nex-AGI 在其模型卡上为 Nex-N2.5 Pro 标注了 82.7,该成绩是在联盟自家的 NexCUA 评测框架上测得的,而这一框架从未对公众公开。Z.ai 报告的 GLM-5.2 在同一测试套件上的最佳成绩同样也是 82.7——可当独立评测框架重新运行该模型后,分数落在了 77.9,比厂商自报的数字低了约五分。一个无人能够查证的数字,与一个一经查证便缩水的数字,它们之间所谓的完美持平根本算不上持平。这正是最清晰的证明:在读取哪怕一行基准分数之前,“开放权重”与“最终才会存在的权重”之间的差异,就已决定了这场对决的胜负。

这两款模型同处商业赛道,但本质差异可谓天壤之别。Nex-N2.5 Pro 于2026年9月8日发布,是一款多模态计算机使用模型——总参数量3970亿,其中激活参数约170亿,基于Qwen3.5谱系构建,架构上能够读取屏幕,并借助视觉反馈循环驱动浏览器或桌面会话。GLM-5.2 则是智谱AI(Z.ai)基于MIT许可的旗舰模型,面向长程推理与编程——总参数量约7430亿,激活参数约400亿,纯文本,自2026年6月16日起正式GA,并且数月来一直是开放权重档位独立评测分数的中坚力量。一个透过像素观察世界并采取行动;另一个用文本思考并交付代码。两者的许可证都允许你在此基础上开展商业业务;区别在于,其中一份许可证目前还只是一个承诺。

同一编号,两种不同来源

{{1}}先从持平之处说起,因为它能说明整场对比的关键。{{/1}}{{2}}Nex-AGI 的规格表将 Terminal-Bench 2.1 列为 Nex-N2.5 Pro 的 82.7 分,{{/2}}{{3}}同时还有 OSWorld-2 的 56.4、SWE-Bench Pro 的 61.2 和 BrowseComp 的 89.7{{/3}}{{4}}——这些成绩全部出自 NexCUA 测试框架,而在模型发布初期,没有任何一项被独立复现,原因很简单:模型权重无法下载。{{/4}}{{5}}Z.ai 在 Terminal-Bench 2.1 上给 GLM-5.2 报出的 82.7,是该厂商自己上报的最佳数字,{{/5}}{{6}}但它所基于的模型,任何人都可以在今天下午就从 Hugging Face 拉取并重新运行;{{/6}}{{7}}独立框架已经测出了 77.9,比 Z.ai 声称的数字低约五分。{{/7}}{{8}}当厂商数据在独立测试下缩水时,那不是丑闻——而是自我测量的正常代价。{{/8}}{{9}}而当竞争对手的数据根本无法被测试时,缺乏这种代价才是问题所在,并不代表数字洁净无瑕。{{/9}}

A two-column scoreboard titled 'Nex-N2.5 Pro vs GLM-5.2 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; License Apache-2.0 pending; Params 397B / ~17B active; Modality text + image (computer use); Terminal-Bench 2.1 82.7 vendor; Price free hosted / no list. Right column GLM-5.2: GA Jun 16 2026; License MIT live now; Params ~743B / ~40B active; Modality text only; Terminal-Bench 2.1 82.7 claimed / 77.9 independent; Price $1.40 / $4.40 per 1M. Footer: 'Nex and Z.ai figures vendor-reported; 77.9 per the OrcaRouter harness.'

周围的行也作同样解读。GLM-5.2 持有开放阵营迄今产生的最高独立指数读数——在 Artificial Analysis 当前的 Intelligence Index 上约为 50 出头——这正是它虽然算不上最亮眼的新发布,却连续数月成为参考级开放模型的原因。Nex-N2.5 Pro 则根本没有独立的指数条目。在两家厂商都声称有数据的行中,能被验证的是在位者的数据;在只有 Nex-AGI 发布了数据的行中,这些数字均未被复现。这不是在评判哪个模型更聪明,而是在评判哪个模型允许你去验证。

这些规格说明书比你所预期的更为一致

撇开基准测试,这两款模型在基本性能上不相上下:

已发布 — Nex-N2.5 Pro:2026年9月8日(托管端点已上线,权重待发布)。GLM-5.2:2026年6月16日 GA,权重已上线。

许可证 — Nex-N2.5 Pro:Apache-2.0,权重即将发布。GLM-5.2:MIT,现已可下载。

规模 — Nex-N2.5 Pro:总参数397B / 激活约17B。GLM-5.2:总参数约743B / 激活约40B。

模态 — Nex-N2.5 Pro:支持文本与图像输入,文本输出,具备计算机使用的视觉循环。GLM-5.2:纯文本推理模型。

上下文/输出 — Nex-N2.5 Pro:262,144 token 上下文。GLM-5.2:1M token 上下文,128K 输出上限。

推理控制 — Nex-N2.5 Pro:无 / 中(自适应,默认)/ 高。GLM-5.2:通过同一模型字符串进行推理强度控制。

每百万Token的价格—— Nex-N2.5 Pro:提供免费托管层,无标价。GLM-5.2:输入 $1.40 / 输出 $4.40,缓存输入 $0.26。

两种模型的能力包络差异,正对应着它们任务定位的差异:GLM-5.2 为长时工程会话带来完整百万 token 的文本上下文和 128K 输出上限;而 Nex-N2.5 Pro 则以缩减上下文大小为代价,换来视觉通道和面向屏幕级工作负载的较小 262K 窗口。两种规格都没有错——它们本就是为不同任务而设计的。

开放权重,两种不同的含义

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

到这里,这种比较就完全不再是数字层面的问题了。GLM-5.2 的开源方式,是那种可以让你在上面构建一门生意的产品发布方式:MIT 许可证、权重托管在 Hugging Face 上、不限制商业使用、没有数据共享条款、没有供应商在你背后盯着。你可以下载它、微调它、把它部署在你自己的合规边界之内,或者放到任何你喜欢的主机上去——而且因为权重已经公开,它的定价就有了一条任何单一供应商都无法抬高的底线。Nex-N2.5 Pro 承诺采用 Apache-2.0,一种同样宽松的许可证,但它 Hugging Face 卡片上的横幅写着权重"即将推出",并未附上任何日期。对于受数据治理规则约束的团队,或者想在规模扩大时彻底摆脱按 token 计价模式的团队来说,这一差别就是决定性的全部:GLM-5.2 是你今天就能拥有的模型,而 Nex-N2.5 Pro 只是一个被承诺给你的模型。即便等权重最终落地,自托管的账也算得更偏向新来者——在八块 H100 的节点上运行 17B 激活参数,其配置门槛远比 GLM-5.2 那套约 40B 激活参数的低得多——但"等权重落地"这个说法,在这句话里可承载了太多东西。

这些家庭正朝着相反的方向移动。

这两款模型都隶属于快速演进的模型家族,但各自的发展轨迹却指向不同方向。GLM-5.2的谱系透明且呈迭代式发展:Z.ai于8月发布了GLM-5.3,作为同一5.2基座的后训练刷新版本,并于9月初发布了GLM-5.3 Flash。因此,你今天在其之上构建的5.2权重,正是这个家族持续改良的根基——你的架构知识与微调成果都能延续下去。而Nex-AGI的家族则押注于一个全新世代:35B参数的Nex-N2.5 Mini、397B参数的Nex-N2.5 Pro,以及1.6T参数、仅支持文本的Nex-N2.5 Max,其基座为DeepSeek-V4-Pro-Base。然而,本可让任何人验证该家族主张的Pro权重至今仍未公开。一个选择平台来构建应用的团队,实际上是在两条路之间做抉择:一边是拥有已发布刷新路线图的成熟谱系,另一边则是第二幕尚未上演的首发版本。

哪一个配得上你的构建

如果你的要求是“模型必须是我们自己的”——出于数据治理、审计,或是因为你不希望某个产品被单一供应商掌控——那么在这场对比中,GLM-5.2 不是更好的选择;它是唯一的选择,因为它是其中唯一可以下载的模型。它也是唯一有独立评分的模型,定价为 Z.ai 标价的每百万输入 token 1.40 美元、每百万输出 token 4.40 美元。如果你的需求是一个最终可能以更低价格击败闭源领先者的多模态计算机使用智能体,那么 Nex-N2.5 Pro 是更有意思的长期命题——一个来自明确知道自己要构建什么的联盟的 17B 激活视觉操作模型——但命题不等于依赖,免费的托管端点也不是根基。

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), marked FEATURED, showing the header stats $1.40 input and $4.40 output per million tokens and the byline 'by Z.ai - 2026-06-16'.

针对这一切,务实的做法是在现有基础上构建,并在成果落地时衡量其承诺。GLM-5.2 已在 OrcaRouter 上架,按 Z.ai 的标价——同样是 1.40 美元 / 4.40 美元,不加价转售——而且因为它是开放权重模型,如果你希望评估涵盖自己的服务栈,也可以自托管。它是你今天运行真实智能体工作负载的参照基准,而路由 DSL 已经为 Nex-N2.5 Pro 日后以标价出现在某个服务商平台做好了准备:到那时,切换对比对象只是一条路由规则,而不是一次迁移。在权重分片放出、独立测试框架确认或纠正那个 82.7 之前,Nex-N2.5 Pro 与 GLM-5.2 的对决,是一个你可以验证的模型与一个你无法验证的数字之间的较量。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新