一張生成的主視覺卡片,標題為「NV-Reason-CT vs Grok 4.6」,副標題為「誰解讀掃描影像,誰解讀報告」。底部橫向排列三個標籤:「單一 CT 體積 vs 500,000 個 token」、「0.871 vs 0.870 打成平手」,以及「Grok 4.6:每百萬 $2.00 / $6.00」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT 對比 Grok 4.6:誰讀掃描,誰讀報告

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

要把 AI 放進 CT 管線有兩種方式,而其中只有一種跟影像有關。 NV-Reason-CT 是第一種:一個 4.69B 參數的 3D 視覺語言模型,可直接讀取 NIfTI 體積,並於 2026 年 9 月 8 日發布到 Hugging Face,而 NVIDIA 並未發布任何發布公告。 Grok 4.6 是第二種:一個 500,000 token 的文字與影像模型,於 2026 年 8 月 12 日推出,每百萬個輸入 token 收費 2.00 美元,而且非常擅長處理在某個人已經把發現寫下來之後才發生的那部分工作。把它們放在一起比較,通常的那個問題——哪一個比較好——結果證明是問錯了。它們不是在競爭管線中的同一個位置,而是在競爭同一個預算項目。

每一方實際上交付了什麼

NV-Reason-CT 以一個儲存庫、一篇論文和一個示範 Space 的形式登場,而非以產品形式推出。NVIDIA-Medtech 底下的 GitHub 儲存庫建立於 2026 年 9 月 2 日;Hugging Face 權重接著在 9 月 8 日發布;arXiv 預印本,NV-Reason-CT:用於 CT 分析的 3D 視覺語言模型,於 9 月 23 日問世,作者共有十六位,來自 NVIDIA、NIH 與蘇黎世大學。NVIDIA 的新聞室對其隻字未提。模型卡描述版本 0.1,並將用途限制於研究與教育。

Grok 4.6 屬於截然不同的發布類型。它是一流的商業端點,在供應商的開發者文件中被列為「Latest」,依公開的價目表定價,並可作為 OpenAI 相容模型使用,現有整合只需變更基礎 URL 即可採用。它接替 Grok 4.5,具有相同的上下文視窗、相同的輸入介面,以及相同的基礎定價。

那種不對稱正是這個比較的全部關鍵。一個是剛好可以下載的研究產物。另一個則是基礎設施。將兩者相互對照來讀,會讓你看出目前在醫學影像領域裡,「研究產物」與「基礎設施」之間的界線究竟落在何處——而那並不是你會猜到的地方。

勞動分工,在投入與產出方面

• 體積輸入 — NV-Reason-CT 讀取以 Hounsfield 單位表示的 .nii/.nii.gz NIfTI 體積,僅限胸部或腹部;相較之下,Grok 4.6 讀取文字、圖像與檔案,沒有體積資料路徑 • 空間處理 — NV-Reason-CT 將 384×384×384 公釐的體積轉換為 24×24×24 網格、共 13,824 個 token,並使用 3D MRoPE,不進行降採樣;相較之下,Grok 4.6 將圖像視為 2D 圖片 • 上下文 — NV-Reason-CT 一個體積就是一個固定前綴,沒有通常意義上的上下文視窗;相較之下,Grok 4.6 為 500,000 個 token • 輸出 — NV-Reason-CT 結構化報告、答案,或可停用思考的推理軌跡;相較之下,Grok 4.6 提供文字,並支援結構化輸出與工具呼叫 • 授權 — NV-Reason-CT OpenMDW-1.1,10.6 GB BF16 權重;相較之下,Grok 4.6 為專有,僅提供 API • 價格 — NV-Reason-CT 為 GPU 資本支出,沒有按 token 計費;相較之下,Grok 4.6 每百萬 token 為 $2.00 / $6.00,輸入超過 200K 時價格加倍

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

這一組合讀起來像一次自然的交接。NV-Reason-CT 從影像體積中產生發現;Grok 4.6 則是那種你會把上千筆這類發現交到它手上的模型,在單一上下文視窗裡尋找整個世代中的模式。沒有人發表過那條管線。這是顯而易見的架構,而值得直白地說:它尚未經過測試。

Grok 4.6 的數字,以及那些數字究竟是誰的

關於 Grok 4.6 的兩個數字同時流傳,但它們並非同一類事物。GPQA Diamond 分數 94.9 是由 Artificial Analysis 測得的,而非由供應商自行報告——這正是兩類數據中較可信的一類,因為它是由第三方進行的。Artificial Analysis Intelligence Index 分數 44(指數修訂版 v4.3.2)將 Grok 4.6 在其類別中 211 個模型裡排在第 28 名。Artificial Analysis 也將該模型記錄為專有:權重並未公開。

在同一份排行榜上,AA 測得 Terminal-Bench 2.1 為 88.4、SciCode 為 56.5、Humanity's Last Exam 為 42.9、𝜏²-banking 為 50.7,長上下文召回則為 80.3。這些都是通用推理的評量工具。它們沒有一個能在 3D CT 體積上執行,而這並不是在貶低 Grok 4.6 —— 這是在說明這套基準測試究竟衡量了什麼。

CT 側恰好只有一個表格,而且那是作者們的。

NV-Reason-CT 的全部公開證據基礎,是 CT-RATE 18 個標籤上的一張分類表,採用固定統一閾值、直接的 Yes/No 提示,且沒有分類頭。它報告 Macro-F1 0.614 與 Macro-AUROC 0.871,相較之下 VoxelFM 為 0.581/0.870、Pillar-0 為 0.544/0.861、ClinFusion-8B 為 0.442、CT-CLIP 為 0.398/0.733、Merlin 為 0.358/0.662,而 MedGemma 1.5 為 0.303。

這些是廠商回報的,出自模型卡,我之所以這樣標註,是因為目前還沒有任何獨立第三方重現過。表格裡有兩件事值得注意。相較於 VoxelFM,F1 的領先幅度是 0.033,在固定閾值下的 18 個標籤上,這是實質差距。與同一模型相比,AUROC 的領先幅度是 0.001,這算是平手。這兩個數字出現在同一張表格的同一列,而只有其中一個被拿來提出主張。

這張表還告訴你的是關於論文自身的框架設定。比較模型包括 3D 對比預訓練系統、一個融合 2D/3D 的生成式 MLLM,以及一個基於切片的尖端模型。作者選擇以能攝入體積資料的系統作為基準,因為這裡唯一有意義的主張是:生成式 3D 模型能在不使用分類頭的情況下,於分類任務上勝過判別式 3D 模型。這完全沒有說明 NV-Reason-CT 在任何方面與通用前沿模型相比如何,因為該比較並不存在於這個軸線上。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

資金的去向,以及為何分級界線很重要

Grok 4.6 的價目表有一個細節,悄悄決定了許多架構:超過 200K 輸入權杖的提示,會以基本費率的兩倍計費——輸入 $4.00、輸出 $12.00,而快取讀取費率從 $0.50 升至 $1.00。一項會把發現累積在單一長上下文中的世代審查作業,正是會跨越那條界線的工作負載。在那條界線之下,每百萬 $0.50 的快取讀取費率是輸入價格的四分之一,這正是讓大型固定前綴在數千份報告上反覆循環變得可負擔、而不只是可行的原因。

透過 OrcaRouter,Grok 4.6 以該供應商的定價提供,零加價,因此上述的方案層級計算就是你實際支付的計算,而未來對它的任何調整都會在同一天反映到你的帳單上,而不是等到下次續約。像這樣的工作之所以要透過路由而非硬編碼單一端點,是因為臨床流程中的世代審查部分,正是你會想先試三種不同模型再定案的地方——而在一個與 OpenAI 相容的金鑰上,搭配跨供應商的自動容錯移轉,那個實驗只需付出改一個模型名稱的代價。

管線的 CT 那一半沒有這類選項。NV-Reason-CT 並未託管於 OrcaRouter——它是 10.6 GB 的檢查點,帶有自訂模型程式碼,由你自己在 Ampere、Hopper 或 Lovelace 晶片上執行,並設定 trust_remote_code=True。我們不會暗示其他情況。如果你正在建構這條管線,你是在為其中一半購買 GPU,為另一半購買 token,而兩半至少能從同一個主控台管理,這是唯一值得提出的整合主張。

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

{{1}}第二讀者{{/1}}究竟價值幾何

NV-Reason-CT 論文包含一項初步的專家放射科醫師研究,報告「對 AI 輔助判讀的正面信心評分」,以及平均回報的判讀與報告時間減少 50%。這些數字很亮眼,但論文本身也提出了但書:這是初步研究,而且是作者自己的研究設計。目前尚無已發表的獨立重現,而在受控判讀研究中縮短 50% 時間,正是那種在重現時會縮水的結果。它值得持續關注,但不值得當成已確立的結論來引用。

對照來看,Grok 4.6 對放射科工作流程的貢獻根本不在於診斷。它是負責讀取報告的那一層——分診佇列、追蹤信函、醫療編碼、事前授權申請文件包。這類工作是文字,量大,單位成本低,而且弄錯時的失效模式屬於行政層面,而非臨床層面。這也正是 500K 上下文視窗與 0.50 美元快取讀取真正證明自身價值的地方。

所以,這項比較最終得出的分野很直白:NV-Reason-CT 有真正的 3D 路徑,卻沒有通路、沒有定價,也沒有獨立驗證。Grok 4.6 有通路、有定價、有獨立基準測試的涵蓋,卻完全沒有容積路徑。如果你需要判讀掃描,只有前者做得到。如果你需要處理掃描周邊的文書作業,只有後者才算得上是一項產品。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新