一張生成的主視覺卡片,標題為「NV-Reason-CT vs GLM-5.2」,副標題為「其中一個已被棄用,而且不是你以為的那一個」。兩張相對的卡片由一對藍色箭頭隔開:左側卡片標示為「NV-Reason-CT」,帶有身體掃描圖示,以及「2026 年 9 月發布 - 現行 - 僅限胸部與腹部 CT」;右側卡片標示為「GLM-5.2」,帶有晶片圖示,以及「2026 年 6 月發布 - 已被 GLM-5.3 取代 - 在 Artificial Analysis 已棄用」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT 對比 GLM-5.2:其中一個已被棄用,而且不是你想的那一個

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在這項比較中,較舊的模型正是即將被淘汰的那一個。GLM-5.2 於 2026 年 6 月 16 日發布;NV-Reason-CT 的儲存庫活動日期介於 2026 年 9 月 2 日至 25 日之間。你可能會預期九月的那個才是未定之數,而六月的那個是已底定的選擇。但在對文字處理流程至關重要的那條軸線上,實情恰恰相反:GLM-5.2 已被於 2026 年 8 月 18 日推出的 GLM-5.3 取代,而它如今在公布其數據的獨立排行榜上帶有棄用標記。NV-Reason-CT 無論還有什麼未解決之處,都是它所做的那唯一一件事的當前版本。

所以,這篇文章第一句有用的話,是最不可能已經在讀者腦中的那句:如果你今天要開始做一個文字建置,而且出於習慣就伸手去拿 GLM-5.2,先停下來看看 GLM-5.3。它的價格是每百萬輸入 token $1.26、每百萬輸出 token $3.96,對比 GLM-5.2 的 $1.40 和 $4.40——它既更新又更便宜——而它的獨立智慧指數是 44.8,對比 33.7,這是在同一把尺規上往上走一步,而不是橫向平移。那是與任何跟 CT 有關的事情都分開的決定,而且值得分開來做。

這兩個模型,以及兩種不同的過時類型

老舊的模型和被取代的模型之間有真正的區別,而這種配對讓這一點變得具體。

• 功能 — NV-Reason-CT 可讀取胸部或腹部 CT 影像,並依解剖區域輸出結構化發現;GLM-5.2 是一款純文字語言模型,適用於推理、程式碼撰寫與長文件處理

• 已發布 — NV-Reason-CT 的產物日期為 2026 年 9 月 2 日至 25 日;GLM-5.2 於 2026 年 6 月 16 日,GLM-5.3 則隨後於 2026 年 8 月 18 日推出

• 世代狀態 — NV-Reason-CT 為 0.1 版,屬初始發布,尚未對外公布;GLM-5.2 是已上市產品線的上一代

• 獨立地位 — 目前並無針對 NV-Reason-CT 的獨立測量數據;GLM-5.2 在 Artificial Analysis Intelligence Index 上的測量值為 33.7,並帶有棄用標記,相較之下 GLM-5.3 為 44.8

• 授權與存取 — 你可下載的 OpenMDW-1.1 權重;相較於以每百萬個詞元 $1.40 與 $4.40 提供服務、快取讀取為 $0.26 的開放權重模型

• 上下文 — 每卷 13,824 個視覺 token,無聊天視窗;相較之下,輸入為 1,000,000 個 token,輸出為 128,000 個

• 標示用途 — 僅供研究與教育使用,並非醫療器材;反對通用型部署

「deprecated」這個詞在這裡有精確的作用,值得我們不要過度解讀。排行榜上的淘汰標記意味著評測者已不再把該模型視為現行版本,通常是因為已有後繼版本取而代之。這並不表示權重已被撤回、API 已被關閉,或模型已停止運作。管線針對 GLM-5.2 調校過的團隊並沒有麻煩。它真正意味的是,那些數字是 GLM-5.3 存在之前的快照,而把它們與其他模型的當前數字混在一起,就像拿六月的量測去比九月的賽場。

雙方各自擁有的數字,以及它們的價值

GLM-5.2 的紀錄異常豐富,而它來自兩個以深具啟發性的方式彼此矛盾的來源。

根據 Z.ai 自家的報告,該模型在 τ²-Bench 上取得 99.12,在 SWE-bench Pro 上取得 62.1,在搭配工具的 Humanity's Last Exam 上取得 54.7,而在 Terminal-Bench 2.1 上報告的最佳成績為 82.7。在獨立評測方面,Artificial Analysis 對同一模型的測量結果為:Terminal-Bench 2.1 上 77.9、其 Intelligence Index 上 33.7、GPQA Diamond 上 89.5,以及 Humanity's Last Exam 上 41.1。還有其他廠商數據——AIME 2026 上 99.2、2026 年 2 月 HMMT 上 92.5、IMOAnswerBench 上 91、FrontierSWE 上 74.4、ProgramBench 上 63.7、MCP-Atlas 上 76.8——而這些全都是 Z.ai 的數據。

關於那份清單,有兩件事值得點名。首先,Terminal-Bench 2.1 上,廠商最佳回報的 82.7 與獨立測得的 77.9 之間那 4.8 分的差距並非矛盾。廠商最佳回報數字通常是多個測試框架中最好的一個,而 Z.ai 自己在同一項基準上的 Terminus-2 數字是 81——獨立測量結果落在廠商自家的範圍內。其次,Humanity's Last Exam 的落差更大:獨立測得 41.1,而廠商數字在不使用工具時為 40.5、使用工具時為 54.7,這意味著掛頭牌的 54.7 是工具輔助下的數字,41.1 才是純粹無工具的數字。把 54.7 與另一個模型的裸分並列引用,會是實實在在的錯誤。

NV-Reason-CT 的表現紀錄並沒有這種雙來源結構,而這正是它較弱的地方。它在 CT-RATE 的結果——在十八個標籤上達到 0.614 F1 與 0.871 AUROC,使用固定均一閾值與直接的「是/否」提示,且沒有分類頭或任務特定調適——是 NVIDIA 自家的。該論文中與它比較的模型(VoxelFM 0.581、Pillar-0 0.544、ClinFusion-8B 0.442、CT-CLIP 0.398、Merlin 0.358、MedGemma 1.5 0.303)全都是影像模型。沒有任何結果被獨立重現,而該模型已可供下載數週。它另外報告了由報告衍生的 0.592 macro-F1,以及一項初步的專家放射科醫師研究,將輔助審閱與平均回報判讀時間減少 50% 連結起來,而作者自己標明這有嚴重的小樣本問題。

所以,來源比較並不偏袒較新的模型,而這一點值得好好深思。GLM-5.2 是較舊、已被取代的模型,而它的數字比 NV-Reason-CT 的更可信,因為有公司外部的人跑過那套測試框架。跟上最新並不等于通過驗證。

A generated scoreboard titled 'Provenance, not recency, decides what to trust' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; independent checks, none; model status, version 0.1, unannounced, current; licence, OpenMDW-1.1, research and education only. The right column, headed 'GLM-5.2', lists five rows: AA Intelligence 33.7, GPQA Diamond 89.5; provenance, vendor and Artificial Analysis; independent checks, yes, with a 4.8-point vendor-versus-independent gap on Terminal-Bench 2.1; model status, superseded by GLM-5.3 and deprecated by the evaluator; licence, open weights at $1.40 and $4.40 per million. A footer reads 'The superseded model is the better-verified one. Recency is not the same as evidence.'

為什麼棄用比聽起來更重要

這個比較旨在防止某種特定的失敗,而這與 CT 完全無關。

一個正在建構臨床文本管線的團隊,因為資料敏感,開始尋找能在自家硬體上執行的開放權重模型。他們找到了 GLM-5.2,它採用 MIT 授權,擁有 7,430 億個參數、其中約 400 億個為活躍參數,符合需求,且有著記錄詳盡的基準測試成績。他們以它為對象進行調校。六個月後,他們發現當前世代是 GLM-5.3,具備 100 萬上下文與 128K 輸出上限,價格更便宜,為 $1.26 與 $3.96,而且他們以為自己正在做的決定——要標準化採用哪個開放權重模型——實際上是一個關於哪個世代的決定,而他們是在無意間做出了這個決定。

那是一旦太晚發現就會付出高昂代價的意外,而只要查一次就能避免。具體指引:

• 檢查你即將作為標準採用的模型是否屬於當前世代——排行榜的淘汰標記是最快的訊號,而供應商自家的模型清單才是最權威的依據

• 別把六月的快照與九月的數據混為一談——GLM-5.2 的 33.7 指數是在 GLM-5.3 問世之前測得的,將它與現行模型的指數並列,等於在一個持續變動的領域中比較兩個不同的時間點

• 請留意名稱——「GLM-5.3 Prime」是一種服務層級,搭載相同的權重,價格卻約為定價的兩倍,並非獨立的模型。在為任何 SKU 支付溢價之前,請先確認其背後的權重

• 把較低的公告價格當成一個問題,而不是答案——GLM-5.3 比其前代更便宜並不尋常,值得用自身的工作負載來驗證,而不是憑假設

這些都不會讓 GLM-5.2 成為糟糕的選擇。一個以 MIT 授權、擁有 743B 參數、定價為 $1.40 與 $4.40,而且團隊已經針對它調校過的模型,繼續運行它完全合情合理;而一個已有穩定實績的中世代模型,有時正是受監管工作流程所需要的。重點在於,它應該是一個刻意做出的選擇,而不是從一份七月時還算最新的清單中沿襲下來的預設值。

將文本與 CT 進行比較的陷阱

這個配對之所以還顯得有幾分合理,原因是兩者都是 2026 年發布的開放權重模型,而翻閱型錄的讀者會看到兩個看似可相比的品項。它們其實無從相比,而且這種不相配有其特定的形態。

GLM-5.2 可容納 1,000,000 個 token。NV-Reason-CT 的單一 CT 體積需要 13,824 個視覺 token。依此推算,GLM-5.2 能裝下七十份 CT 檢查,還綽綽有餘,這便容易讓人得出結論:上下文夠長的文字模型會使影像模型顯得多餘。這個結論並不成立,而原因在於介面,而非預算。

那些 13,824 個詞元不是摘要。它們是一個 384 毫米的立方體,重新取樣為 2 毫米等向性,在 24 x 24 x 24 網格上切成 8 x 8 x 8 個圖塊,交給一個沒有空間降取樣、也沒有合併層的語言骨幹——這就是為什麼作用中的路徑是總計 4.69B 之中的 4.35B 參數,也是為什麼運算資源花在維持解析度,而不是把它壓縮掉。GLM-5.2 是文字模型。它完全沒有視覺路徑,因此它會如何處理掃描這個問題根本不會出現;答案是,它無法以任何形式被給予掃描。這兩份模型卡描述了詞元預算上六百倍的差異,而這與這項比較毫無關係,因為其中一個模型根本無法接收輸入。

反向的錯誤也同樣可能發生。NV-Reason-CT 支援胸腔與腹部,接受的是 NIfTI 檔案而非提示詞,不具備工具使用能力,其模型卡將其限制於研究與教育用途,並聲明它不是醫療器材,且輸出可能有誤。它無法將報告語料庫正規化、撰寫評估框架,或對指引文件進行推理。4.7B 的影像模型無法取代 743B 的文字模型,反過來也一樣。

A generated scoreboard titled 'Two open-weight models, two different jobs' listing six paired rows. Row one: what it reads, one-channel NIfTI volumes in Hounsfield units against text only. Row two: context, 13,824 visual tokens per volume against 1,000,000 tokens in and 128,000 out. Row three: parameters, 4.69B total and 4.35B active against 743B total and about 40B active. Row four: generation status, version 0.1 current, unannounced against superseded by GLM-5.3. Row five: price, self-hosted with no rate card against $1.40 and $4.40 per million, or $1.26 and $3.96 for the successor. Row six: stated use, research and education, not a medical device against general purpose. A footer reads 'GLM-5.2 figures per the provider and Artificial Analysis; NV-Reason-CT figures per the authors paper.'

將文字的一半放在一個按鍵上

如果問題是要用哪個文字模型來執行這條管線的工作,今天的答案很可能是 GLM-5.3,而不是 GLM-5.2——而且兩者都收錄在我們的目錄中,共用同一把金鑰。z-ai/glm-5.2以 Z.ai 供應商列表價提供,零加成,GLM-5.3 也同樣如此,全都涵蓋在一個支援超過 200 個模型的單一 API 裡。在世代交替期間,同時保留兩者比平常更為重要:你可以在正式投入之前,先用自己的語料庫衡量後繼模型,並在過程中把現行模型留作備援,之後不必再簽一份合約或改動程式碼就能切換。

直通費率值得用一句話說明,理由就和任何會因供應商調價而重新定價的模型一樣。由於中間沒有加價層,供應商的費率變動當天就會反映在我們這邊。自動容錯移轉能因應供應商在批次處理中途效能退化的情況,對長時間的擷取工作而言,這正是真正會耗掉一整晚的那種故障;而路由 DSL 讓你將個別請求送往應該處理它們的模型,而不是把所有請求都指向單一端點。

NV-Reason-CT 不在我們的平台上,NVIDIA 的模型也一樣不在。這一點值得明白說清楚,而不是任人自行推斷:這套架構的 CT 部分,是在你自己的硬體上下載的權重,其依據是允許這麼做的授權條款,以及一份禁止臨床使用的模型卡。我們並不託管它,也不會寫出任何暗示並非如此的句子。

做出這些決定的順序

臨床建置的正確順序,並不是比較所暗示的那個。

先從文字生成這個問題著手,而且一開始就檢查目前是哪一個世代——是 GLM-5.3 而不是 GLM-5.2,無論在價格或實測能力上皆然,除非你有理由維持原狀。接著在你自己的硬體上測量 CT 模型每項研究的延遲,因為那個數字並未公開,而且會決定其餘預算。然後設計管線,讓這兩個部分可以獨立替換,因為其中一個處於接近預覽版的生命週期,另一個則還在 0.1 版。

唯一不該做的事,就是把這兩者當成二選一。一個已被取代的 743B 文字模型,和一個現行的 4.69B CT 模型,兩者沒有任何共同的任務。這項比較值得做,只因為它揭露了:較新的產物背後的證據反而較薄弱,較舊的那個已悄悄不屬於當前世代,而對任何讀到一條把它們並排列出、彷彿它們是可替代選項的目錄列的人來說,這兩個事實都隱而不見。

A screenshot of the OrcaRouter model page for GLM 5.2, showing the identifier z-ai/glm-5.2 with a Featured badge and tags for Tools, JSON and Reasoning, the description of it as Z.ai's flagship model for long-horizon tasks with a 1M-token context window and up to 128K output tokens, a side panel listing a 1M-token context window and 128K maximum output with text input and text output, and a stat strip reading $1.40 per million input tokens, $4.40 per million output tokens, and a p50 time to first token under five seconds.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新