
NV-Reason-CT 与 GLM-5.2:其中一个已被弃用,而且不是你认为的那个
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 97 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
本次对比中较旧的模型,正是即将被淘汰的那一个。GLM-5.2发布于 2026 年 6 月 16 日;NV-Reason-CT的仓库活动日期介于 2026 年 9 月 2 日至 25 日之间。你大概会以为,9 月发布的那一个是变数,6 月的那个则已是尘埃落定的选择。但在对文本流水线至关重要的那个维度上,事实恰恰相反:GLM-5.2 已被 2026 年 8 月 18 日发布的 GLM-5.3 所取代,如今在发布其数据的独立排行榜上,它已被标记为弃用。而 NV-Reason-CT,无论它还有哪些悬而未决之处,都是其唯一所司之职的当前版本。
这篇文章里第一句有用的话,恰恰是读者最不可能已经知道的那一句:如果你今天要开始做一个文本构建,并且出于习惯伸手去拿 GLM-5.2,那就先停下来,看看 GLM-5.3。它每百万输入 token 收费 1.26 美元,每百万输出 token 收费 3.96 美元,而 GLM-5.2 是 1.40 美元和 4.40 美元——它既更新,也更便宜——它的独立智能指数是 44.8,而 GLM-5.2 是 33.7,这是在同一标尺上向上走了一步,而不是横向平移。这与任何涉及 CT 的事情都是彼此独立的决定,值得单独来做。
两种模型,以及两种不同类型的陈旧
旧模型与被取代的模型之间有着切实的区别,而这一并置使其变得具体。
• 功能说明 — NV-Reason-CT 可读取胸部或腹部 CT 体数据,并按解剖区域输出结构化发现结果;GLM-5.2 是一款纯文本语言模型,适用于推理、代码及长文档处理任务
• 已发布 — NV-Reason-CT 的制品日期为 2026 年 9 月 2 日至 25 日;GLM-5.2 于 2026 年 6 月 16 日发布,GLM-5.3 紧随其后于 2026 年 8 月 18 日发布
• 代际状态 — NV-Reason-CT 为 0.1 版本,属初始发布,尚未公布;GLM-5.2 是某条已上市产品线的上一代
• 独立评测地位——目前不存在针对 NV-Reason-CT 的独立测量;GLM-5.2 在 Artificial Analysis 智能指数上的测得值为 33.7,且带有弃用标记,相比之下 GLM-5.3 为 44.8
• 许可与访问 — 你下载的 OpenMDW-1.1 权重;对比之下,开放权重模型的定价为每百万 token 1.40 美元和 4.40 美元,缓存读取为 0.26 美元
• 上下文 — 每卷 13,824 个视觉 token,无聊天窗口;对比 1,000,000 token 输入和 128,000 token 输出
• 声明用途——仅用于研究和教育用途,非医疗器械;反对通用部署
“deprecated”这个词在这里承担着精确的作用,不应过度解读。排行榜上的弃用标记意味着评估方已不再将该模型视为当前模型,通常是因为已有后继者取代了它的位置。这并不意味着权重已被撤回、API 已关闭,或者模型不再可用。那些针对 GLM-5.2 调优流水线的团队并没有陷入麻烦。它真正意味着的是,其数据是 GLM-5.3 出现之前的快照,而将它们与其他模型的当前数字混在一起,就像拿六月的测量值去和九月的现场比较。
每一方拥有的数字,以及它们的价值
GLM-5.2 的记录异常丰富,且来自两个以颇具启发性的方式相互矛盾的来源。
根据 Z.ai 自己公布的数据,该模型在 τ²-Bench 上取得 99.12 分,在 SWE-bench Pro 上取得 62.1 分,在使用工具的情况下在 Humanity's Last Exam 上取得 54.7 分,并在 Terminal-Bench 2.1 上报告了最高分 82.7 分。在独立评测方面,Artificial Analysis 对同一模型的测量结果为:Terminal-Bench 2.1 上 77.9 分,其 Intelligence Index 上 33.7 分,GPQA Diamond 上 89.5 分,Humanity's Last Exam 上 41.1 分。还有其他厂商数据——AIME 2026 上 99.2 分、HMMT February 2026 上 92.5 分、IMOAnswerBench 上 91 分、FrontierSWE 上 74.4 分、ProgramBench 上 63.7 分、MCP-Atlas 上 76.8 分——这些全都来自 Z.ai。
关于那份列表,有两点值得点明。第一,Terminal-Bench 2.1 上,厂商最佳报告值 82.7 与独立测得的 77.9 之间那 4.8 分的差距并不矛盾。厂商最佳报告值通常是多个测试框架中最好的一个,而 Z.ai 自己在同一基准上的 Terminus-2 成绩是 81——独立测量的结果落在厂商自身的区间之内。第二,Humanity's Last Exam 上的分歧更大:独立成绩为 41.1,而厂商数据是不带工具 40.5、带工具 54.7,这意味着作为标题的 54.7 是工具辅助下的数字,41.1 才是纯模型成绩。把 54.7 与另一个模型的纯模型分数并列引用,会是实打实的错误。
NV-Reason-CT 的记录没有这种双来源结构,而这正是它更薄弱的地方。其 CT-RATE 结果——十八个标签上 0.614 的 F1 和 0.871 的 AUROC,采用固定统一阈值和直接的是/否提示,且没有分类头或任务特定适配——是 NVIDIA 自己的。该论文中与之比较的模型(VoxelFM 0.581、Pillar-0 0.544、ClinFusion-8B 0.442、CT-CLIP 0.398、Merlin 0.358、MedGemma 1.5 0.303)都是影像模型。没有任何结果被独立复现,而该模型已可下载数周。它还报告了基于报告的 0.592 宏 F1,以及一项初步的专家放射科医生研究,将辅助审阅与平均报告解读时间减少 50% 联系起来,作者本人将其标注为严重小样本。
所以来源比对并不偏向更新的那个模型,而这正是值得停下来细想的一点。GLM-5.2 是更早的、已被取代的模型,但它的数字比 NV-Reason-CT 的更可信,因为跑这套测试框架的是公司外部的人。最新并不等于经过验证。

为什么弃用这件事比听起来更重要
这个对比旨在防止一种特定的失效,而这种失效与CT毫无关系。
一个团队在搭建临床文本流水线时,开始寻找一个能在自有硬件上运行的开源权重模型,因为数据很敏感。他们找到了 GLM-5.2,它采用 MIT 许可,拥有 7430 亿参数、约 400 亿激活参数,符合要求,并且有详尽记录的基准测试成绩。他们基于它进行调优。六个月后,他们发现当前一代是 GLM-5.3,支持 1M 上下文,输出上限为 128K,价格更低,为 $1.26 和 $3.96,而他们原以为自己在做的决定——要标准化采用哪个开源权重模型——实际上是一个关于哪一代模型的决定,而他们是在无意中做出的。
那是一个到后期才发现就会代价高昂的意外,而只要查一次就能避免。具体建议:
• 检查你即将标准化采用的模型是否为当前一代——排行榜上的弃用标记是最快的信号,而厂商自家的模型列表才是权威依据
• 不要把六月的快照与九月的数字混为一谈——GLM-5.2 的 33.7 指数是在 GLM-5.3 问世之前测得的,把它与当前模型的指数并列,等于是在一个不断变化的领域里比较两个不同的时间点
• 小心名称 —— "GLM-5.3 Prime" 这一条目是一个服务层级,承载着相同的权重,标价却约为其两倍,并非一个独立的模型。在为任何 SKU 支付溢价之前,先核实其背后的权重
• 把更低的标价当成一个疑问,而不是答案——GLM-5.3 比前代更便宜并不寻常,值得对照你自己的实际工作负载加以验证,而不是想当然
这一切都不会让 GLM-5.2 成为一个糟糕的选择。一个以 1.40 美元和 4.40 美元定价、采用 MIT 许可的 743B 模型,而且团队已经针对它做过调优,继续运行它完全是合理的;而一个有着稳定过往记录的中间代模型,有时正是受监管工作流程所需要的。关键在于,这应该是一个经过深思熟虑的选择,而不是从一份七月还适用的清单中继承下来的默认项。
将文本模型与CT模型进行比较的陷阱
这种配对之所以看上去还算合理,是因为两者都是 2026 年发布的开放权重模型,而浏览目录的读者会看到两个可比的条目。它们并不可比,而这种错配有其特定的形态。
GLM-5.2 可容纳 1,000,000 个 token。NV-Reason-CT 的单个 CT 体积需要 13,824 个视觉 token。按此算术,GLM-5.2 可以容纳七十项 CT 检查,并且仍有空间,这容易让人得出这样的结论:一个上下文足够长的文本模型使影像模型变得多余。这个结论并不成立,原因在于接口,而不是预算。
那 13,824 个 token 并不是摘要。它们是一个 384 毫米的立方体,经重采样为 2 毫米各向同性,在 24 x 24 x 24 网格上切成 8 x 8 x 8 的 patch,送入一个没有空间下采样、也没有合并层的语言主干——这就是为什么活跃通路在 4.69B 总参数中占 4.35B 参数,也是为什么算力被用于保持分辨率,而不是将其压缩掉。GLM-5.2 仅支持文本。它完全没有视觉通路,因此它要如何处理扫描的问题根本不会出现;答案是,无论如何都无法向它提供扫描数据。两份模型卡所描述的 token 预算六百倍差异,与这项比较毫无关系,因为其中一个根本无法接收该输入。
反向的错误同样存在。NV-Reason-CT 支持胸部和腹部,接收的是 NIfTI 文件而非提示词,不具备工具使用能力,其模型卡将其用途限制为研究与教育,并声明它不是医疗器械,输出可能不正确。它无法对报告语料进行规范化,无法编写评估框架,也无法基于指南文档进行推理。一个 4.7B 的影像模型并不能替代 743B 的文本模型,反之亦然。

把文本那一半放在一个按键上
如果问题是要用哪个文本模型来跑流水线工作,那么今天的答案大概是 GLM-5.3 而非 GLM-5.2——而且两者都在我们的目录里,用同一个密钥即可调用。z-ai/glm-5.2按 Z.ai 的供应商标价费率提供,零加价,GLM-5.3 也同样如此,它们同处一个覆盖 200 多个模型的单一 API 之中。在换代期间,让两者都保持可用比平时更为重要:你可以在正式投入之前,先用自己的语料库衡量继任者的表现,同时把在任模型留作回退方案,最后无需第二份合同或改动代码即可完成切换。
透传费率值得用一句话说明,原因和它在任何由供应商重新定价的模型上一样重要。中间没有加价层,供应商的费率变动当天就会落到我们这边。自动故障转移可以应对供应商在批次处理中途性能下降的情况,对于长时间的抽取任务来说,这才是真正会让你损失一整晚的故障;而路由 DSL 让你能把单个请求发送给理应处理它的模型,而不是把所有请求都指向同一个端点。
NV-Reason-CT 不在我们的平台上,任何 NVIDIA 模型也都不在。这一点值得直说,而不该留给读者去推断:该架构中的 CT 部分是你自行在本地硬件上下载的权重,所依据的许可证允许这样做,而模型卡则禁止将其用于临床。我们不托管它,也不会写出任何暗示相反的句子。
做出这些决定的顺序
临床构建的正确顺序,并不是那项对比所暗示的顺序。
先从文本生成这个问题入手,并且一开始就确认哪一代是当前版本——是 GLM-5.3 而不是 GLM-5.2,无论是在价格上还是在实测能力上,除非你有理由维持现状。然后在自己的硬件上测量 CT 模型每项研究的延迟,因为这个数字尚未公布,却决定着预算的其余部分。然后设计流水线,让两者可以独立替换,因为其中一个处于接近预览版的生命周期,另一个则处于 0.1 版。
唯一不该做的事,就是把两者当成一种选择。一个已被取代的 743B 文本模型和一个当前的 4.69B CT 模型没有任何共同任务。进行比较之所以值得,只在于它揭示出的东西:较新的产物背后的证据反而更弱,较旧的那个已悄然不再属于当前一代,而这两个事实,对于任何阅读产品目录中一行的人来说都不可见——那一行把它们并排列出,仿佛它们是可相互替代的选项。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
