
NV-Reason-CT 對決 Claude Opus 5:一個值得認真看待的範疇錯誤
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 506 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
把 NV-Reason-CT與Claude Opus 5放進同一個句子裡,是一種範疇錯誤,但無論如何還是值得這麼做,因為這個錯誤具有啟發性。NV-Reason-CT 是 NVIDIA 的一個 46.9 億參數原生 3D 視覺語言模型,能接收以 Hounsfield 單位表示的胸部或腹部 CT 容積,並產出結構化、逐項發現的報告。它不是醫療器材,而它自家的模型卡也這麼說。Claude Opus 5 是該廠商的通用前沿文字與視覺模型,於 2026 年 7 月 24 日發布,具有一百萬個 token 的上下文視窗、128,000 個 token 的輸出上限,以及公布的費率:每百萬個輸入 token 五美元、每百萬個輸出 token 二十五美元。其中一個讀的是 CT,另一個讀的則是其他一切。
這種比較之所以一再出現——而且每次有人看到新的醫療 VLM、伸手去拿熟悉的尺規時,都會如此——是因為兩者都會針對一張影像產出文字。這種表面上的相似,正嚴重損害人們對這兩者的思考方式,因此值得詳細拆解。
他們實際共享的那條軸線,以及他們並不共享的那一條
它們恰好只在一處重疊,而那一處比看起來還要窄。
• 輸入模態——NV-Reason-CT 透過專用的三維處理器接收以 Hounsfield 單位表示的單通道 NIfTI 容積;Claude Opus 5 接收文字、圖像與檔案,這是第二代的圖像介面,無法原生讀取容積 CT 檢查
• 回傳的內容 — 由 NV-Reason-CT 依解剖區域整理的發現清單,對比 Claude Opus 5 的一般敘述文字、結構化 JSON 或工具呼叫
• 工作量單位 — 一個 CT 容積,重新取樣為 2 mm 等向性,裁切至解剖構造,切成 8 x 8 x 8 區塊;對照你在 token 預算中投入的任何內容
• 上下文 — NV-Reason-CT 完全沒有聊天視窗;單一容積會變成 13,824 個視覺 token,且不進行任何降採樣。Claude Opus 5 可容納 1,000,000 個 token 的輸入,並輸出最多 128,000
• 授權條款 — OpenMDW-1.1,可下載並在自有硬體上執行的模型;相對於託管 API
• 聲明用途——僅供研究與教育使用,明確非醫療器材,適用於 NV-Reason-CT;不適用於 Claude Opus 5 的通用型協助
• 價格 — 沒有定價,因為沒有東西可買,只有可供運行的權重;相較於每百萬個 token 收費 5 美元和 25 美元,快取讀取為 0.50 美元
「modality in」這一列正是類別錯誤的根源。兩者都接受影像,因此看起來都像影像模型,讀者自然會問哪一個更擅長處理影像。然而,CT 檢查並不是一張影像。它是一個體積陣列,具有以毫米為單位的物理尺度、經校正的密度單位,以及只有在三維中才有意義的解剖構造。Claude Opus 5 的視覺能力確實很強,也能合理地討論一張 X 光片或病理切片。但那是有別於以 2 毫米解析度整合一個邊長 384 毫米、由 Hounsfield 值構成的立方體,並回報結節分葉狀況的一項不同任務。
兩側的數字實際上衡量的是什麼
這兩款模型的基準測試紀錄從未交集,而並排閱讀它們卻沒察覺到這一點,正是糟糕採購決策產生的原因。
NV-Reason-CT 在 CT-RATE 公開胸部 CT 基準上報告其結果,涵蓋十八個標籤,採用固定統一的閾值,並使用直接的是/否提示,沒有分類頭,也沒有針對特定任務的調適。它取得 0.614 的 F1 與 0.871 的 AUROC,領先 VoxelFM 的 0.581 與 0.870、Pillar-0 的 0.544 與 0.861、ClinFusion-8B 的 0.442 F1、CT-CLIP 的 0.398 與 0.733、Merlin 的 0.358 與 0.662,以及在輸入最多 85 張軸向切片時 MedGemma 1.5 的 0.303 F1。此外還有一項由報告推導出的 0.592 macro-F1。這些數字每一個都出自 NVIDIA 自己的論文。沒有任何一個曾被其他人重現,而該模型已經可供下載數週了。
Claude Opus 5 的紀錄是通用型的,且在很大程度上獨立。Artificial Analysis 在其 Intelligence Index 上測得 50.8,在其 Coding Index 上測得 78,在 GPQA Diamond 上測得 93.2,在 Humanity's Last Exam 上測得 54.9,長上下文回憶分數則為 79.33。那些是關於一般推理、程式碼與知識任務的第三方數據。那組數據中沒有臨床影像基準測試,而且在 Claude Opus 5 已公布的紀錄中,任何地方都沒有 CT-RATE 這一列。
所以,誠實的說法並不是其中一個領先。而是從來沒有人在同一項任務上測量過這兩個模型。任何以「NV-Reason-CT 在醫學影像上比 Claude Opus 5 更好」這種形式出現的句子,就字面而言都不可證偽,因為沒有人做過這個實驗。NVIDIA 自家的比較表裡也不含任何通用前沿模型。

人們對介面問題的誤解在哪裡
唯一真正有趣的技術交集,是沒有人會爭論的那一個:CT 模型與文字模型之間的介面應該是什麼樣子。
一個合理的直覺,是餵給 Claude Opus 5 一組 CT 影像或降採樣體積,然後要它進行推理。在 1,000,000 個 token 的上下文下,這聽起來很寬裕;而相對於一項僅有 13,824 個視覺 token 的研究,聽起來更是空間綽綽有餘。空間並不是問題。Claude Opus 5 的視覺處理管線把影像當成帶有像素尺度的二維圖片。以那種方式呈現的胸部 CT,會失去讓病灶得以量測的層間間距,也會失去讓「毛玻璃」成為門檻而非描述的密度校正。你可以交給它一組軸向切片的拼貼,然後得到一段聽起來連貫的文字。你得不到的,是一個量測值。
這正是 NV-Reason-CT 的設計把算力花在哪裡。來自 384 毫米體積的 24 x 24 x 24 網格,以完整解析度交給語言模型,沒有空間降採樣,也沒有合併層,這就是為什麼其作用中的路徑是 4.35B 參數,而不是小得多的規模。這個架構是一項賭注:保留空間細節值得付出這樣的詞元成本。這是一項關於表徵的賭注,而不是關於語言能力的賭注,而 Claude Opus 5 並不是這項賭注的參與者。
真正有生產力的模式其實很無聊:用 CT 模型做容積判讀,其餘周邊一切則交給文字模型。報告生成與正規化、世代摘要、評估框架、大規模將 DICOM 檔案庫轉換為 NIfTI,以及分診哪些檢查人類該先看。這些都是長文件與程式碼工作,而這正是 1M 上下文模型值得其收費的地方。
成本,以兩種無法互相換算的單位計
Claude Opus 5 採按用量計費。每百萬輸入 token 五美元,每百萬輸出 token 二十五美元,快取讀取為五十美分,快取寫入為十美元。對於一條將報告語料庫正規化,或撰寫並反覆改寫評估程式碼的管線而言,這會產生一份你可以建立的預測:輸入 token、輸出 token、快取讀取,而且只要快取處理得當,帳單就會便宜許多。
NV-Reason-CT 沒有標價。你下載 46.9 億個參數,並以電力、GPU 時數和工程時間來支付。對於一項完整的 13,824 個 token 研究,沒有公布任何吞吐量數據,也沒有提供量化版本,因此執行它的每次研究成本,是你必須自己測量出來的數字。這對研究權重來說很正常,而這也是兩者之間最大的實務差異:一個有價目表,另一個則有一張在你已經付清之前都看不到的帳單。
真正重要的比較是以每項檢查為單位,而不是以每個 token 為單位。一次 CT 判讀是一單位的工作。對同一病例做一次報告正規化,則是以數千個 token 計量的文字工作。要為前者估算出金額,代表你必須了解自己的硬體;要為後者估算出金額,則只是算術。
比較中間的陷阱
有一個特定的錯誤值得特別點名,因為這正是這個對局會引人犯下的錯誤。那就是把 NV-Reason-CT 當成通用模型的專門微調版,因而假設通用模型在多數情況下已經夠接近,而且靈活得多。
這不是微調。這是一個名為 Primus 的 3D 視覺 transformer,以 COLIPRI 初始化,接上一個 Qwen3.5-4B 語言主幹並搭載 3D 多軸旋轉位置嵌入,以約 55 萬筆結構化問答範例訓練而成,這些範例取自 CT-RATE、CancerVerse 以及 NIH 內部資料集的 70,111 個 CT 影像體積,接著再以 GRPO 針對一項獎勵進行調校,該獎勵將異常集合 F1 加權為 2.0、區域特定報告結構分數加權為 0.5,並將軟性長度懲罰加權為 1.0。三維編碼器才是這個模型的重點。二維或以切片為基礎的前端是另一種不同的工具,而論文自身的比較說明了這項差異價值幾何:MedGemma 1.5 在餵入最多 85 張軸向切片時 F1 為 0.303,而原生體積模型則為 0.614。
反向的錯誤同樣常見,代價也一樣高昂:因為 NV-Reason-CT 是專門化的,就假設所有臨床工作都該用它。它只支援胸部與腹部,別無其他;它的叫用方式是一個 NIfTI 檔案,而不是一則聊天訊息;而且它的授權條款載明僅供研究與教育用途。它不會讀取病理玻片、回答有關指引的問題,或撰寫幫你批次轉換 DICOM 的程式碼。拿 CT 模型來做文字工作,就跟拿文字模型來做體積量測一樣,是同一種範疇錯誤,只是方向相反。

這兩半如何融入同一個系統
這兩個模型都不會取代彼此,而合理的架構會同時包含兩者——這就帶出一個實務問題:你要如何呼叫它們。
Claude Opus 5 透過 OrcaRouter 提供,型號為 anthropic/claude-opus-5,採用 Anthropic 供應商價目表定價,零加成,涵蓋於單一 API 之中,支援超過 200 個模型。這件事對單次呼叫的意義,不如對整體流程管線來得重大:當臨床建置的文字部分只是眾多候選模型中的一員時,將它們全置於同一把金鑰之後,意味著你可以用自己的語料庫進行比較,無須簽署第二份合約或修改程式碼,而路由 DSL 讓你將個別請求送往應該處理它們的模型,同時在供應商效能衰退時,自動容錯移轉會為你提供保障。
NV-Reason-CT 不在我們的平台上,NVIDIA 的任何模型也都不在。它是你自己下載、在自己的硬體上執行的權重,而這正是授權條款允許你做的事;而且,既然輸入是源自病患的體積資料,這大概本來也就是你想要的作法。我們不會暗示我們會路由一個我們並未託管的模型。這個建置的文字端才是我們能派上用場的地方;體積端則得靠你自己,搭配一個 4.69B 模型和一張 GPU。

經得起檢驗的裁決
如果你需要把 CT 體積讀取成結構化發現,有一個模型可以做到,它出自 NVIDIA 的研究團隊,而且是下載而非 API 呼叫。如果你需要將報告語料庫正規化、撰寫評估框架、把 DICOM 轉換工作寫成腳本,或將一個世代群體彙整摘要,也有一個模型可以做到,而且它有價目表。
要守住的界線是:由於實驗尚未進行,因此尚未證明兩者在任何事情上孰優孰劣。已被證明的是:原生三維介面在公開胸部 CT 基準測試上勝過以切片為基礎的介面,作者估計差距約為三個 F1 分;以及一個通用前沿模型在推理、程式碼與長上下文工作上的獨立評測中位居該領域頂尖。這些是關於兩項不同工作的兩項陳述。把它們解讀為排名,就是犯了範疇錯誤,而這個錯誤會一直存在,直到有人發表那場至今無人發表的正面對決。
