一张生成的英雄卡片,标题为“NV-Reason-CT vs GLM-5.2”,副标题为“这两者中有一个已被弃用,而且不是你以为的那一个”。两张相对的卡片由一对蓝色箭头分隔:左侧卡片标注为“NV-Reason-CT”,带有身体扫描图标以及“2026年9月发布 - 当前 - 仅胸部与腹部CT”;右侧卡片标注为“GLM-5.2”,带有芯片图标以及“2026年6月发布 - 已被GLM-5.3取代 - 在Artificial Analysis中已弃用”。OrcaRouter标志合成在右下角。
Guides & Insights

NV-Reason-CT 与 GLM-5.2:其中一个已被弃用,而且不是你认为的那个

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

本次对比中较旧的模型,正是即将被淘汰的那一个。GLM-5.2发布于 2026 年 6 月 16 日;NV-Reason-CT的仓库活动日期介于 2026 年 9 月 2 日至 25 日之间。你大概会以为,9 月发布的那一个是变数,6 月的那个则已是尘埃落定的选择。但在对文本流水线至关重要的那个维度上,事实恰恰相反:GLM-5.2 已被 2026 年 8 月 18 日发布的 GLM-5.3 所取代,如今在发布其数据的独立排行榜上,它已被标记为弃用。而 NV-Reason-CT,无论它还有哪些悬而未决之处,都是其唯一所司之职的当前版本。

这篇文章里第一句有用的话,恰恰是读者最不可能已经知道的那一句:如果你今天要开始做一个文本构建,并且出于习惯伸手去拿 GLM-5.2,那就先停下来,看看 GLM-5.3。它每百万输入 token 收费 1.26 美元,每百万输出 token 收费 3.96 美元,而 GLM-5.2 是 1.40 美元和 4.40 美元——它既更新,也更便宜——它的独立智能指数是 44.8,而 GLM-5.2 是 33.7,这是在同一标尺上向上走了一步,而不是横向平移。这与任何涉及 CT 的事情都是彼此独立的决定,值得单独来做。

两种模型,以及两种不同类型的陈旧

旧模型与被取代的模型之间有着切实的区别,而这一并置使其变得具体。

• 功能说明 — NV-Reason-CT 可读取胸部或腹部 CT 体数据,并按解剖区域输出结构化发现结果;GLM-5.2 是一款纯文本语言模型,适用于推理、代码及长文档处理任务

• 已发布 — NV-Reason-CT 的制品日期为 2026 年 9 月 2 日至 25 日;GLM-5.2 于 2026 年 6 月 16 日发布,GLM-5.3 紧随其后于 2026 年 8 月 18 日发布

• 代际状态 — NV-Reason-CT 为 0.1 版本,属初始发布,尚未公布;GLM-5.2 是某条已上市产品线的上一代

• 独立评测地位——目前不存在针对 NV-Reason-CT 的独立测量;GLM-5.2 在 Artificial Analysis 智能指数上的测得值为 33.7,且带有弃用标记,相比之下 GLM-5.3 为 44.8

• 许可与访问 — 你下载的 OpenMDW-1.1 权重;对比之下,开放权重模型的定价为每百万 token 1.40 美元和 4.40 美元,缓存读取为 0.26 美元

• 上下文 — 每卷 13,824 个视觉 token,无聊天窗口;对比 1,000,000 token 输入和 128,000 token 输出

• 声明用途——仅用于研究和教育用途,非医疗器械;反对通用部署

“deprecated”这个词在这里承担着精确的作用,不应过度解读。排行榜上的弃用标记意味着评估方已不再将该模型视为当前模型,通常是因为已有后继者取代了它的位置。这并不意味着权重已被撤回、API 已关闭,或者模型不再可用。那些针对 GLM-5.2 调优流水线的团队并没有陷入麻烦。它真正意味着的是,其数据是 GLM-5.3 出现之前的快照,而将它们与其他模型的当前数字混在一起,就像拿六月的测量值去和九月的现场比较。

每一方拥有的数字,以及它们的价值

GLM-5.2 的记录异常丰富,且来自两个以颇具启发性的方式相互矛盾的来源。

根据 Z.ai 自己公布的数据,该模型在 τ²-Bench 上取得 99.12 分,在 SWE-bench Pro 上取得 62.1 分,在使用工具的情况下在 Humanity's Last Exam 上取得 54.7 分,并在 Terminal-Bench 2.1 上报告了最高分 82.7 分。在独立评测方面,Artificial Analysis 对同一模型的测量结果为:Terminal-Bench 2.1 上 77.9 分,其 Intelligence Index 上 33.7 分,GPQA Diamond 上 89.5 分,Humanity's Last Exam 上 41.1 分。还有其他厂商数据——AIME 2026 上 99.2 分、HMMT February 2026 上 92.5 分、IMOAnswerBench 上 91 分、FrontierSWE 上 74.4 分、ProgramBench 上 63.7 分、MCP-Atlas 上 76.8 分——这些全都来自 Z.ai。

关于那份列表,有两点值得点明。第一,Terminal-Bench 2.1 上,厂商最佳报告值 82.7 与独立测得的 77.9 之间那 4.8 分的差距并不矛盾。厂商最佳报告值通常是多个测试框架中最好的一个,而 Z.ai 自己在同一基准上的 Terminus-2 成绩是 81——独立测量的结果落在厂商自身的区间之内。第二,Humanity's Last Exam 上的分歧更大:独立成绩为 41.1,而厂商数据是不带工具 40.5、带工具 54.7,这意味着作为标题的 54.7 是工具辅助下的数字,41.1 才是纯模型成绩。把 54.7 与另一个模型的纯模型分数并列引用,会是实打实的错误。

NV-Reason-CT 的记录没有这种双来源结构,而这正是它更薄弱的地方。其 CT-RATE 结果——十八个标签上 0.614 的 F1 和 0.871 的 AUROC,采用固定统一阈值和直接的是/否提示,且没有分类头或任务特定适配——是 NVIDIA 自己的。该论文中与之比较的模型(VoxelFM 0.581、Pillar-0 0.544、ClinFusion-8B 0.442、CT-CLIP 0.398、Merlin 0.358、MedGemma 1.5 0.303)都是影像模型。没有任何结果被独立复现,而该模型已可下载数周。它还报告了基于报告的 0.592 宏 F1,以及一项初步的专家放射科医生研究,将辅助审阅与平均报告解读时间减少 50% 联系起来,作者本人将其标注为严重小样本。

所以来源比对并不偏向更新的那个模型,而这正是值得停下来细想的一点。GLM-5.2 是更早的、已被取代的模型,但它的数字比 NV-Reason-CT 的更可信,因为跑这套测试框架的是公司外部的人。最新并不等于经过验证。

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

为什么弃用这件事比听起来更重要

这个对比旨在防止一种特定的失效,而这种失效与CT毫无关系。

一个团队在搭建临床文本流水线时,开始寻找一个能在自有硬件上运行的开源权重模型,因为数据很敏感。他们找到了 GLM-5.2,它采用 MIT 许可,拥有 7430 亿参数、约 400 亿激活参数,符合要求,并且有详尽记录的基准测试成绩。他们基于它进行调优。六个月后,他们发现当前一代是 GLM-5.3,支持 1M 上下文,输出上限为 128K,价格更低,为 $1.26 和 $3.96,而他们原以为自己在做的决定——要标准化采用哪个开源权重模型——实际上是一个关于哪一代模型的决定,而他们是在无意中做出的。

那是一个到后期才发现就会代价高昂的意外,而只要查一次就能避免。具体建议:

• 检查你即将标准化采用的模型是否为当前一代——排行榜上的弃用标记是最快的信号,而厂商自家的模型列表才是权威依据

• 不要把六月的快照与九月的数字混为一谈——GLM-5.2 的 33.7 指数是在 GLM-5.3 问世之前测得的,把它与当前模型的指数并列,等于是在一个不断变化的领域里比较两个不同的时间点

• 小心名称 —— "GLM-5.3 Prime" 这一条目是一个服务层级,承载着相同的权重,标价却约为其两倍,并非一个独立的模型。在为任何 SKU 支付溢价之前,先核实其背后的权重

• 把更低的标价当成一个疑问,而不是答案——GLM-5.3 比前代更便宜并不寻常,值得对照你自己的实际工作负载加以验证,而不是想当然

这一切都不会让 GLM-5.2 成为一个糟糕的选择。一个以 1.40 美元和 4.40 美元定价、采用 MIT 许可的 743B 模型,而且团队已经针对它做过调优,继续运行它完全是合理的;而一个有着稳定过往记录的中间代模型,有时正是受监管工作流程所需要的。关键在于,这应该是一个经过深思熟虑的选择,而不是从一份七月还适用的清单中继承下来的默认项。

将文本模型与CT模型进行比较的陷阱

这种配对之所以看上去还算合理,是因为两者都是 2026 年发布的开放权重模型,而浏览目录的读者会看到两个可比的条目。它们并不可比,而这种错配有其特定的形态。

GLM-5.2 可容纳 1,000,000 个 token。NV-Reason-CT 的单个 CT 体积需要 13,824 个视觉 token。按此算术,GLM-5.2 可以容纳七十项 CT 检查,并且仍有空间,这容易让人得出这样的结论:一个上下文足够长的文本模型使影像模型变得多余。这个结论并不成立,原因在于接口,而不是预算。

那 13,824 个 token 并不是摘要。它们是一个 384 毫米的立方体,经重采样为 2 毫米各向同性,在 24 x 24 x 24 网格上切成 8 x 8 x 8 的 patch,送入一个没有空间下采样、也没有合并层的语言主干——这就是为什么活跃通路在 4.69B 总参数中占 4.35B 参数,也是为什么算力被用于保持分辨率,而不是将其压缩掉。GLM-5.2 仅支持文本。它完全没有视觉通路,因此它要如何处理扫描的问题根本不会出现;答案是,无论如何都无法向它提供扫描数据。两份模型卡所描述的 token 预算六百倍差异,与这项比较毫无关系,因为其中一个根本无法接收该输入。

反向的错误同样存在。NV-Reason-CT 支持胸部和腹部,接收的是 NIfTI 文件而非提示词,不具备工具使用能力,其模型卡将其用途限制为研究与教育,并声明它不是医疗器械,输出可能不正确。它无法对报告语料进行规范化,无法编写评估框架,也无法基于指南文档进行推理。一个 4.7B 的影像模型并不能替代 743B 的文本模型,反之亦然。

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

把文本那一半放在一个按键上

如果问题是要用哪个文本模型来跑流水线工作,那么今天的答案大概是 GLM-5.3 而非 GLM-5.2——而且两者都在我们的目录里,用同一个密钥即可调用。z-ai/glm-5.2按 Z.ai 的供应商标价费率提供,零加价,GLM-5.3 也同样如此,它们同处一个覆盖 200 多个模型的单一 API 之中。在换代期间,让两者都保持可用比平时更为重要:你可以在正式投入之前,先用自己的语料库衡量继任者的表现,同时把在任模型留作回退方案,最后无需第二份合同或改动代码即可完成切换。

透传费率值得用一句话说明,原因和它在任何由供应商重新定价的模型上一样重要。中间没有加价层,供应商的费率变动当天就会落到我们这边。自动故障转移可以应对供应商在批次处理中途性能下降的情况,对于长时间的抽取任务来说,这才是真正会让你损失一整晚的故障;而路由 DSL 让你能把单个请求发送给理应处理它的模型,而不是把所有请求都指向同一个端点。

NV-Reason-CT 不在我们的平台上,任何 NVIDIA 模型也都不在。这一点值得直说,而不该留给读者去推断:该架构中的 CT 部分是你自行在本地硬件上下载的权重,所依据的许可证允许这样做,而模型卡则禁止将其用于临床。我们不托管它,也不会写出任何暗示相反的句子。

做出这些决定的顺序

临床构建的正确顺序,并不是那项对比所暗示的顺序。

先从文本生成这个问题入手,并且一开始就确认哪一代是当前版本——是 GLM-5.3 而不是 GLM-5.2,无论是在价格上还是在实测能力上,除非你有理由维持现状。然后在自己的硬件上测量 CT 模型每项研究的延迟,因为这个数字尚未公布,却决定着预算的其余部分。然后设计流水线,让两者可以独立替换,因为其中一个处于接近预览版的生命周期,另一个则处于 0.1 版。

唯一不该做的事,就是把两者当成一种选择。一个已被取代的 743B 文本模型和一个当前的 4.69B CT 模型没有任何共同任务。进行比较之所以值得,只在于它揭示出的东西:较新的产物背后的证据反而更弱,较旧的那个已悄然不再属于当前一代,而这两个事实,对于任何阅读产品目录中一行的人来说都不可见——那一行把它们并排列出,仿佛它们是可相互替代的选项。

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新