
NV-Reason-CT vs GPT-5.6 Sol:在你輸入任何字之前,先有 13,824 個視覺 Token
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 45 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
你送進NV-Reason-CT的每一份胸部 CT,在提示詞開始之前就先花掉 13,824 個視覺 token。這不是什麼怪癖,也不是調校上的取捨——這就是整體設計本身。該模型原生的 3D 視覺編碼器接收一個 384×384×384 毫米的體積,並將其轉換成 24×24×24 的網格,而模型卡明確指出,全部 13,824 個 token 及其三維座標會「不經空間降採樣」地送達語言模型。把這跟你很可能已經在付費使用的東西比較一下。GPT-5.6 Sol接受文字、圖像與檔案,而送給它的圖像是一張 2D 圖片——一個切片、一張 DICOM 檢視器的截圖、一張從 PDF 貼出來的放射學圖像。這兩個模型中,有一個具備容積式路徑。另一個則只有上下文視窗。它們之間大多數的比較都在這個區別上崩解,而這個崩解本身才是有趣的地方。
無人宣布的發行
NVIDIA 在其新聞室中對 NV-Reason-CT 隻字未提。沒有發布貼文,沒有主題演講投影片,也沒有新聞稿。實際存在的是 2026 年 9 月 8 日建立的 Hugging Face 儲存庫、9 月 2 日在 NVIDIA-Medtech 組織下建立的 GitHub 儲存庫、一個 Gradio 示範 Space,以及一篇 arXiv 預印本——NV-Reason-CT:用於 CT 分析的 3D 視覺語言模型——於 2026 年 9 月 23 日由 NVIDIA 一支十六位作者的團隊提交,共同作者分別來自 NIH 和蘇黎世大學。
這是一個真實的模式,值得精確地命名,而不是把它當成謎團來看待。NVIDIA 的醫學影像團隊低調地發布權重,讓論文和儲存庫來負責公告。前身 NV-Reason-CXR-3B 於 2025 年 10 月也以同樣方式推出。這裡的差別在於規模:這是該團隊首次把這套做法從 2D X 光延伸到原生 3D 體積,而且這篇論文才發布兩天。
從該儲存庫可得知的事項有:架構、授權條款、訓練資料、基準測試表。尚未確認的事項有:NVIDIA 是否打算將其作為受支援的產品線、是否會推出更多檢查點,以及在作者以外任何人的評估下表現如何。該儲存庫版本為 0.1,並自述僅供研究與教育用途。
每個模型實際上接受什麼
這正是正面交鋒很快就能見真章的地方。這兩個模型並不共享輸入介面。
NV-Reason-CT 會讀取 NIfTI 體積 — .nii 或 .nii.gz — 其體素強度以 Hounsfield 單位表示。它會使用肺部 Hounsfield 單位與 3D 形態學啟發式方法,自動裁切至胸部或腹部,重新取樣為 2-mm 等向性解析度,且僅接受 "chest" 或 "abdomen" 作為解剖部位值。它會輸出文字:結構化報告、答案,或逐步推理軌跡,並可透過開關關閉推理以產生簡短答案。
GPT-5.6 Sol 可讀取文字、圖像與檔案,具備 1,050,000 個詞元的上下文視窗,單次回應最多可輸出 128,000 個詞元。它沒有容積編碼器。餵給它一份 CT,你得先決定如何把三百多張切面攤平成一種二維影像編碼器能接受的東西——拼貼圖、幾張關鍵切面,或算繪出的最大強度投影。這些選擇每一個都會丟掉三維路徑原本要保留下來的空間關係。
所以,誠實的定位並不是「哪個模型更聰明」。而是 Sol 的影像路徑和 NV-Reason-CT 的 3D 路徑正在回答不同的問題。Sol 能對放射科醫師的掃描描述進行推理。NV-Reason-CT 則能對掃描本身進行推理。
只有一個基準存在,而它們之中只有一個上面有數字。
NV-Reason-CT 在 CT-RATE 的 18 標籤分類任務上報告 Macro-F1 0.614 與 Macro-AUROC 0.871,使用的是直接的 Yes/No 提示,沒有分類頭,也沒有任務特定調適。那些是作者自己在模型卡上提供的數字,而比較列才是有用的部分:VoxelFM 為 0.581 Macro-F1、Pillar-0 為 0.544、ClinFusion-8B 為 0.442、CT-CLIP 為 0.398、Merlin 為 0.358、MedGemma 1.5 為 0.303。在相同的固定均勻閾值下,生成式 3D 模型勝過 3D 對比式預訓練基線與基於切片的尖端模型。
那張表中有個數字值得質疑,而非照搬複述:AUROC 差距。NV-Reason-CT 報告 0.871,VoxelFM 則為 0.870。在由廠商自行執行的評估中,千分之一點算不上勝利——而是在該評估所帶有的任何雜訊範圍內的一場平局。0.033 的 Macro-F1 差距才是有憑據的主張。
GPT-5.6 Sol 沒有 CT-RATE 數值,因為 CT-RATE 並不是它能接受評測的基準。它的 Artificial Analysis Intelligence Index 為 47,由 AA 測得的 GPQA Diamond 分數為 94.1,Humanity's Last Exam 分數為 49.5——這些全都是通用推理工具。把 0.614 的 Macro-F1 放在 AA Index 上的 47 旁邊,無異於用兩把不同的尺做算術。我不會這麼做,而你也該不信任任何這麼做的人。
推理軌跡,兩個不同的產品
兩個模型都會輸出推理。這是唯一真正在哲學層面上的交集,而其中的差異則頗具啟發性。
GPT-5.6 Sol 提供可設定的推理強度,因此你可以針對每次請求,在延遲與成本之間換取推理深度,並且可以透過 include_reasoning 取回推理內容。這是一項通用能力,會套用於你傳送的任何內容。
NV-Reason-CT 的推理刻意狹窄。訓練語料庫約有 550,000 個結構化 QA 範例,取自 70,111 個獨特的 CT 容積,其中一部分是放射科醫師撰寫的推理,蒐集自專家判讀的錄音與轉錄內容。接在 SFT 之後的 GRPO 階段,會針對胸部與腹部異常集合使用可驗證的獎勵——這表示獎勵訊號取決於所陳述的發現是否確實存在於該容積中,而非取決於文句是否通順。模型卡將輸出描述為「可審查的觀察、鑑別診斷與不確定性」,並明確警示:生成的推理「不保證能代表模型的內部計算」。那項警示確實發揮了作用。它正是你能對照資料查核的軌跡,與你只能欣賞的軌跡之間的差別。
尺寸和授權,一次搞定
• 參數 — NV-Reason-CT 總計 4.69B / CT 路徑中 4.35B 為作用參數,由 Qwen3.5-4B 主幹加上 Primus 3D ViT 組成,對比 GPT-5.6 Sol 未公開 • 檢查點大小 — NV-Reason-CT 約 10.6 GB BF16 safetensors,可在 Ampere/Hopper/Lovelace 上執行,對比 GPT-5.6 Sol 僅提供 API • 輸入 — 以 Hounsfield unit 表示的 3D NIfTI CT 容積,對比文字、圖像、檔案 • 上下文 — NV-Reason-CT 不適用,一個容積即為一個固定的 13,824-token 前綴,對比 Sol 輸入 1,050,000 tokens、輸出 128,000 • 授權 — OpenMDW-1.1,權重可下載,對比專有、僅限 API 存取 • 可用性 — 廠商儲存庫及其自有權重,對比 在 OrcaRouter 上路由,每百萬 $4.00 / $20.00,且 Sol 在輸入超過 272K tokens 時費率加倍至 $8.00 / $30.00

分手真正讓你付出的代價
成本比較唯有在你承認工作負載不同之後才說得通,所以以下是確實說得通的版本。
Sol 按 token 計費,且價格有斷崖:輸入每百萬 4.00 美元、輸出每百萬 20.00 美元,適用於最多 272K token 的提示,之後變為 8.00 美元與 30.00 美元。在 OrcaRouter 上,它以 OpenAI 自身的定價提供,零加成,這比聽起來更重要——你看到的費率就是 OpenAI 公布的費率,因此任何價格變動都會在同一天反映到你的帳單,而不是等到下一次合約續約。其快取讀取費率為每百萬 0.40 美元,是輸入的十分之一,這正是讓具有大量固定前綴的長時間代理迴圈在算術上得以存續的關鍵。
NV-Reason-CT 完全沒有按 token 計價。你下載 10.6 GB,然後付 GPU 的錢。這是資本支出與營運支出的問題,而它只有一個答案:在用量夠高時,自行託管一個 4.35B 活躍參數的模型在成本上會勝出。低於那個用量就不會,而交叉點完全取決於你的 GPU 使用率。目前 NVIDIA 以外還沒有人發表過這個檢查點的吞吐量數字,所以任何跟你報交叉點的人都是在猜。

路由器在這裡能幫上忙的,是工作流程中不屬於掃描的那個部分。正式生產環境的臨床研究流程很少只靠一個模型——它包含擷取、推理步驟、摘要步驟,有時還需要第二意見。OrcaRouter 提供 200+ 個模型,皆位於單一 OpenAI 相容端點之後,並具備跨供應商自動容錯移轉,因此該流程中通用用途的那一半可以替換或重新路由,而無需另訂合約。NV-Reason-CT 不是我們所路由的模型之一;它是你自己執行的檢查點。流程的兩半仍然可以共用同一把金鑰。

未解決的問題
NV-Reason-CT 作為論文問世僅兩天,作為程式碼儲存庫則已十七天,而它所屬的領域小到足以讓下一個資料點具有參考價值。留意三件事:一項獨立的 CT-RATE 重現、該系列中的第二個檢查點,以及任何顯示 NVIDIA 醫療團隊將其視為一條產品線而非一篇論文的跡象。在那之前,站得住腳的立場狹窄而明確——這是目前可下載、最強的原生 3D CT 推理檢查點,以作者自己的表格來評判,而且除了判讀 CT 之外,它在任何事情上都不是通用前沿模型的替代品。
