一張生成的 hero card,標題為「NV-Reason-CT vs Nemotron 3 Ultra」,副標題為「一個標誌,兩種發布哲學」。底部排列著三個標籤:「4.69B vs 550B 總參數 / 55B 活躍參數」、「~10.6 GB BF16 vs 數百 GB」,以及「2026 年 9 月 8 日 vs 6 月 4 日發布」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT 對比 Nemotron 3 Ultra:同一個標誌,兩種發布哲學

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

NVIDIA 今年發布了兩個開放權重模型,卻對其中一個隻字未提。Nemotron 3 Ultra 於 2026 年 6 月 4 日登上 Hugging Face,是總參數 550B、啟用參數 55B 的旗艦模型,背後有技術報告、OpenMDW-1.1 授權制度,以及整套開放的預訓練與後訓練資料集發布。NV-Reason-CT 於 2026 年 9 月 8 日登場,是擁有 46.9 億參數的 CT 專科模型,附帶一個儲存庫、一個示範 Space,以及兩週後的一篇 arXiv 預印本,在引用區塊中提到這次發布。第二個模型完全沒有發布公告。把它們放在一起比較,你比較的其實不是能力——550B 的通用旗艦與 4.69B 的醫學專科模型並不重疊。你比較的是兩種不同的模型發布理論,由同一家公司操作,相隔三個月。

每個儲存庫實際上包含什麼

Nemotron 3 Ultra 的發布是一套完整的開放式流程。Hugging Face 上的 NVFP4 檢查點已吸引 249,746 次下載與 338 個讚;BF16 版本、基礎檢查點以及後訓練資料集也都一併發布。它支援十二種語言、僅處理文字,建構於具備多詞元預測的潛在混合專家 Mamba2-Transformer 混合架構之上,並採用 openmdw-1.1 授權條款。Artificial Analysis 將其置於 Intelligence Index 47.7(以出貨的 NVFP4 精度計)與 48.2(全精度)——根據該榜單,這是所有美國開放權重模型中最高者。我們先前對 Nemotron 教師模型的報導記錄到,供應商價格中位數約為每百萬輸入詞元 0.60 美元、每百萬輸出詞元 2.60 美元,以及 NVIDIA 在第三方量測中每秒 183 個輸出詞元的輸送量數據。

NV-Reason-CT 是一個小得多、也封閉得多的產物。10.6 GB 的 BF16 權重、10 KB 的 model.py、26 KB 的 processor.py、一個聊天模板,以及一個 inference.py。一個示範 Space。一篇論文。截至本週,有兩百一十次下載。沒有資料集發布。沒有技術報告。除了單一磁碟區範例之外,沒有服務配置。

這個對比無關規模——重點在於下游工程師能用這個產物做什麼。Ultra 的發布旨在讓其他人能夠重現訓練。NV-Reason-CT 的發布則旨在讓其他人能夠執行推論。這些是不同的承諾。

其中只有一個是建立在 NVIDIA 自家的技術堆疊之上

以下是令人驚訝的細節,而且這可從模型卡的 frontmatter 獲得驗證:NV-Reason-CT 的基礎模型是Qwen/Qwen3.5-4B,屬於微調關係,而非 Nemotron 檢查點。NVIDIA 將一個 Primus 3D 視覺 Transformer——以 COLIPRI 權重初始化——接上一套 Qwen 語言模型,並以監督式微調(supervised fine-tuning)接著進行群組相對策略優化(Group Relative Policy Optimization),對兩者進行端到端訓練。

那不是批評,也不是醜聞。這是視覺語言領域工作的業界常規,而 NVIDIA 在儲存庫中介資料裡明白揭露了這一點。但這確實意味著,關於這場對決最自然的那個假設——NV-Reason-CT 是 Nemotron 的衍生品——是錯的。本頁面上的這兩個模型只共享一個標誌和一個授權條款家族,除此之外基本上別無共同點。沒有共享的架構,沒有共享的 tokenizer,沒有共享的訓練資料,沒有共享的 serving path。

尺寸,體現在決定其運行位置的數字中

• 參數 — NV-Reason-CT 總計 4.69B/CT 路徑中 4.35B 啟用,對比 Nemotron 3 Ultra 總計 550B/55B 啟用的稀疏 LatentMoE • 磁碟上的檢查點 — NV-Reason-CT 約 10.6 GB BF16,對比 Nemotron 3 Ultra 在 BF16 下達數百 GB,另以 NVFP4 發布 • 輸入 — NV-Reason-CT 為以 Hounsfield 單位表示的 3D NIfTI CT 體積,僅限胸部或腹部,一個 13,824-token 的體積前綴,對比 Nemotron 3 Ultra 文字,最高 1M token 的上下文,輸出上限為 65K • 上下文 — NV-Reason-CT 不適用於一般意義,對比 Nemotron 3 Ultra 1,000,000 token • 授權 — 兩者皆為 OpenMDW-1.1 • 硬體 — NV-Reason-CT Ampere / Hopper / Lovelace,已在 H100 與 L40S 上測試,對比 Nemotron 3 Ultra 以 55B 啟用參數進行多 GPU 服務 • 獨立評分 — NV-Reason-CT 未公布任何分數,對比 Nemotron 3 Ultra AA Intelligence Index 47.7 NVFP4 / 48.2 全精度

A generated scoreboard titled 'NV-Reason-CT vs Nemotron 3 Ultra - the scoreboard'. Left column 'NV-Reason-CT': Parameters 4.69B total / 4.35B active CT pathway; Checkpoint on disk ~10.6 GB BF16; Input 3D NIfTI CT, chest or abdomen; Context one 13,824-token volume prefix; Licence OpenMDW-1.1; Independent score none published. Right column 'Nemotron 3 Ultra': Parameters 550B total / 55B active LatentMoE; Checkpoint on disk hundreds of GB BF16, also NVFP4; Input text, up to 1M tokens; Context 1,000,000 in / 65,000 out; Licence OpenMDW-1.1; Independent score AA Index 47.7 NVFP4 / 48.2 full. A footer reads 'NV-Reason-CT figures from NVIDIA's model card; Nemotron 3 Ultra Intelligence Index per Artificial Analysis.'

實務上的分界線是記憶體那條線。一個具備 3D 編碼器的 4.69B 模型能放進單張卡,而研究團隊也負擔得起這樣的配置。一個總參數 550B、活躍參數 55B 的模型,即使經過量化,也需要真正的推論服務基礎設施。兩者都不是週末實驗,但它們在這個問題上屬於不同的數量級。

兩種無法平均的評估制度

Ultra 的證據在於通用能力:Artificial Analysis Intelligence Index 達到四十幾接近五十,基準測試涵蓋推理、程式編寫與代理任務,以及廠商報告的該系列數據,包括 SWE-Bench Verified 71.9、MMLU-Pro 86.8 與 LiveCodeBench v6 89.0——後三項是 NVIDIA 自家數據,且已如此標示。

NV-Reason-CT 的證據只有一張表。在 CT-RATE 的 18 標籤分類任務上,採用固定的統一閾值、直接使用 Yes/No 提示、且不設分類頭的情況下,Macro-F1 為 0.614、Macro-AUROC 為 0.871;相較之下,VoxelFM 為 0.581/0.870,Pillar-0 為 0.544/0.861,ClinFusion-8B 為 0.442,CT-CLIP 為 0.398/0.733,Merlin 為 0.358/0.662,MedGemma 1.5 則為 0.303。這些又是 NVIDIA 自己公布在模型卡上的數字,目前仍未有獨立重現。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

AA Intelligence Index 47.7 與 CT-RATE Macro-F1 0.614 並不是同一件事的兩種量測,而是兩件事的量測。沒有任何站得住腳的方式可以說 Ultra 比 NV-Reason-CT「更好」,原因不在於評分偏好,而是這些量測工具根本毫無重疊。在這組配對中,唯一誠實的比較,是比較各模型被認證能勝任什麼——就字面意義而言,即有哪些證據顯示它能做好它的工作。

為什麼靜默發布才是理性的選擇

想像你是醫療影像團隊的一員。你有一個可運作的 3D CT 模型。你希望放射科醫師、醫學生和研究人員使用它。一場主題演講能為你帶來什麼?

一場發表會會拉高對支援、路線圖與長久維護的期待,而這是一個研究團隊無法兌現的。它會招來針對通用基準的評測,而在那些基準上,一個 4.69B 的單一模態模型會因為結構上毫不相關的理由而顯得平淡無奇。而且它會把一個明文寫著「不得取代專業臨床判斷」的模型,推到根本不看授權條款的觀眾面前。一份儲存庫、一篇論文和一個示範 Space,觸及的正是會把三者都讀完的那群人,也讓這件成品以自己的步調說話。版本字串是「0.1」。模型卡上寫著僅限研究與教育用途。那是一種為了被引用、而非被購買而設計的發布。

Ultra 的發布則恰恰相反,且同樣合理——旗艦產品需要通路、價目表與生態系支援,這就是為什麼它隨附了資料集與一份報告。

路由器適用於何處,以及不適用於何處

這兩款模型都不在 OrcaRouter 上,我也不打算暗示並非如此:NV-Reason-CT 是大小 10.6 GB 的檢查點,搭配由你自己託管的自訂模型程式碼;而 Nemotron 3 Ultra 以 55B 活躍參數,透過 NVIDIA 自家的 API 及多個第三方平台提供服務。

A screenshot of the Hugging Face model card for NVIDIA Nemotron 3 Ultra, showing the Model Summary block listing 550B total and 55B active parameters, a LatentMoE architecture, 1M context, OpenMDW-1.1 licence and a release date of June 4, 2026, followed by the Model Overview and evaluation rows.

對同時使用這兩者的團隊來說,路由層能發揮的作用較為狹窄,但依然實用。一條臨床研究流程若以 NV-Reason-CT 處理大量資料,並用通用模型處理周邊文字,就需要有個地方能替換那個通用模型而不必另簽一份合約,而一個涵蓋 200+ 個模型的 OpenAI 相容端點具備跨供應商的自動容錯移轉正是這樣的地方。它讓自架的專門模型與託管的通用模型共用一組金鑰,而不是兩套整合。

從這次搭配中能學到什麼

若以競爭對手視之,這兩個模型是個範疇錯誤。若以案例研究視之,它們則異常清晰。同一家廠商、同一授權家族、同一年——以及兩種為了配合兩種截然不同的下游意圖而選擇的發布策略。一個是附帶生態系的基礎設施。另一個則是附帶權重的論文,其發布是為了讓某一小群特定受眾能夠執行並引用它。

如果你在尋找通用的開放權重模型,NV-Reason-CT 不是候選,也從來無意如此。如果你以程式方式讀取胸部與腹部 CT 容積,Nemotron 3 Ultra 無法幫助你,也從來無意如此。兩者之間唯一真正的重疊是標誌,而唯一真正的教訓是:當受眾規模小且技術性足夠,足以自行找到該儲存庫時,NVIDIA 願意悄悄發布。