
NV-Reason-CT 對比 DeepSeek V4 Pro:判讀一次掃描的成本,以及何時執行批次
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 506 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
以下這項營運事實,比任何基準都更能左右臨床流程預算:DeepSeek V4 Pro 的費用是每百萬輸入 token 0.66 美元、每百萬輸出 token 1.98 美元,而這些費率每天會在兩個時段加倍:UTC 01:00 至 04:00 以及 06:00 至 10:00。在這些時段外執行的批次工作,成本是時段內的一半。同時,NV-Reason-CT,NVIDIA 的 46.9 億參數 3D CT 推理器,根本沒有費率表——它是一組你下載後執行的權重,且未公布單一 13,824-token 研究的吞吐量數字。這兩個模型中,有一個你可以排程;另一個則必須先測量,才能編列預算。
這種不對稱正是切入這項比較的實用角度,因為這兩個模型分別位於流程的相反兩端,而且在財務上以相反的方式失敗。NV-Reason-CT 是固定成本工具:硬體一旦購入,邊際研究幾乎免費,但硬體決策本身很重大,且每項研究的延遲時間沒有公開記錄。DeepSeek V4 Pro 則是變動成本引擎:沒有東西要買,一切都按用量計費,而且計費錶有一套你可以直接從日曆讀出來的時程。
每一項是什麼,各以一行說明
• 工作 — NV-Reason-CT 讀取胸部或腹部 CT 影像並輸出結構化發現;DeepSeek V4 Pro 讀寫文字
• 架構 — 一個名為 Primus 的 3D 視覺 Transformer,從 COLIPRI 初始化,搭配 Qwen3.5-4B 語言主幹以及 3D 多軸旋轉位置嵌入,具有 4.69B 參數,其中 4.35B 為活躍參數;對比一個 1.6 兆參數的專家混合模型,每個 token 有 490 億活躍參數
• 輸入 — 單通道 NIfTI 體積(.nii、.nii.gz),以 Hounsfield 單位表示、LPS 定向、重新取樣為 2 mm 等向性並裁切至解剖構造;與文字對比
• 脈絡 — 單一體積在 24 x 24 x 24 的網格中會變成 13,824 個視覺 token,沒有空間降取樣,也沒有合併層;相較之下,輸入為 1,048,576 個 token,輸出為 384,000 個
• 支援的解剖構造——胸部與腹部,別無其他;有別於文字所能描述的一切
• 價格 — 無標價、自行託管、未公布每項研究的吞吐量;相較於每百萬個詞元 $0.66 / $1.98,於上述兩個 UTC 時段內倍增,快取讀取為 $0.022
• 實測延遲——未公布;相較之下,首符元時間中位數為 3,483 毫秒,每秒輸出 96.01 個符元,錯誤率為 0.75%
那裡有兩列,各自值得用超過一行來表達。上下文列是最明顯的那一列——一百萬個 token 對上 13,824 個——但兩者的單位無法相比,把它們解讀成任一方向的能力差距都是錯誤。13,824 個 token,是忠實呈現一次 CT 檢查所需的代價。一百萬個 token,則是你所能容納的周遭文字量。第一個數字是在說明解析度;第二個數字是在說明記憶。
延遲那一列正是被略過的那一列。DeepSeek V4 Pro 首個 token 的中位數 3.48 秒、每秒 96 個 token,都是經過實測並公開發表的數字,讓你可以在紙上估算一項文字工作的規模。NV-Reason-CT 缺乏任何對應數字,這並不是對該模型的批評;這正是 CT 流程在有人實際跑過之前無法估算成本的原因。一個 4.69B 模型處理 13,824 個視覺 token 並非小運算,在你於自己的硬體上實際計時之前,你都只是在猜。
閱讀兩筆基準紀錄而不自欺
DeepSeek V4 Pro 的紀錄混合了獨立量測與廠商報告,而這種混合富有啟發性,因為其中包含一個看似令人擔憂、實則不然的數字。
• Artificial Analysis Intelligence Index — 36,在受測模型中位居第 72.4 百分位
• GPQA Diamond—— 92.8,接近該領域的頂尖水準
• 人類最後的考試 — 41,以及在 MMLU-Pro 上 41 分、數學指數 62.51
• τ²-Bench — 96.20,其中 IFBench 為 76.46,tau_banking 為 39.59
• 長上下文召回 — 80.33
• SciCode 與 Terminal-Bench — 在第二版 Terminal-Bench 上分別為 51 與 78.65
一個 36 的綜合指數與 92.8 的 GPQA Diamond 並列,讀起來像是矛盾,直到你注意到指數是什麼。它是橫跨許多評估的彙總,而一個在少數評估中表現優異、在其他評估中僅算尚可的模型,會在總和上位居中游,卻在個別排行榜上名列前茅。任何僅引用 36 來主張 DeepSeek V4 Pro 屬於中階的人,都是把平均值當成最大值在引用。任何僅引用 92.8 來主張它領先群倫的人,都是把最大值當成平均值在引用。這兩個數字都來自 Artificial Analysis,且兩者皆為真。
NV-Reason-CT 的紀錄沒有這種混合情況,而這正是它最誠實的問題所在。它的 CT-RATE 數據——在十八個標籤上達到 0.614 F1 和 0.871 AUROC,採用固定的統一閾值與直接的 yes/no 提示,既沒有分類頭,也沒有針對特定任務的調適——僅來自 NVIDIA 自家的論文,別無其他出處。該論文中的比較對象(VoxelFM 為 0.581、Pillar-0 為 0.544、ClinFusion-8B 為 0.442、CT-CLIP 為 0.398、Merlin 為 0.358、MedGemma 1.5 為 0.303)全是其他影像模型。其中沒有任何一個通用文字模型,也沒有任何第三方重現過這些數字。

排程問題,完整解析
DeepSeek V4 Pro 的分時定價,是這兩款模型中在營運上最可付諸實行的一點,因此值得具體地逐步說明。
對一個 CT 計畫來說,貼近現實的文本端工作負載並不光鮮亮麗。它是從一批歷史報告的語料庫中擷取結構化欄位,好讓你有標籤可以拿來訓練;是大規模地把 DICOM 目錄樹轉成 NIfTI;是反覆撰寫又改寫評估框架;是統一四個資料集之間的單位與術語;以及彙整各世代的摘要。就說一個中型計畫要用掉一億個輸入 token 和一千萬個輸出 token 吧——這是刻意取整的數字,用來代表「大量的文本工作」。
• 在加倍的視窗內 — 每百萬 $1.32 與 $3.96,因此在這些用量下為 $132 加上 $39.60
• 在那些區間之外 — 每百萬 $0.66 和 $1.98,所以是 $66 加 $19.80
• 差額——大約 86 美元,相當於離峰帳單的 49%,只為了移動一項本質上可批次處理的工作
• 快取讀取 — 每百萬 $0.022,為輸入費率的六十分之一,因此你在語料庫中重複使用的任何提示前綴幾乎等同免費
那不是捨入誤差,而且它之所以可用,是因為工作是非同步的。報告擷取不需要在 14:00 發生。DICOM 轉換工作完全不在乎現在幾點。定價結構直接邀請你進行排程,而忽略它的管線等於為了隨心所欲執行的特權支付 49% 的溢價。快取讀取也基於同樣的理由而重要:一個共享的系統提示或固定的擷取結構描述,在數千份報告中重複使用,其價格是輸入費率的六十分之一。
NV-Reason-CT 沒有對等的槓桿,因為它沒有計量器。讀取一次掃描的成本,就是你的 GPU 每小時費用除以你每小時能推進多少掃描,而第二個數字是沒有人發表過的。如果單一研究需要兩秒,單張 L40S 就能輕鬆處理一個大型計畫。如果需要二十秒,硬體運算就完全改變。NVIDIA 在 H100 和 L40S 上測試過,這告訴你的是顯卡等級,而不是速率。
假設它們可以被取代的陷阱
這場對決所招致的錯誤,比尋常的範疇謬誤更為微妙,因為它有一種版本擺在投影片上看起來很合理。
DeepSeek V4 Pro 可容納 1,048,576 個 token,並可輸出最多 384,000 個。一個 CT 容積,若由能正確解讀它的模型來估算,只有 13,824 個 token。因此,一個具備百萬 token 脈絡窗的文本模型,在該 token 數量下,可以容納七十多個 CT 檢查。這套算術是正確的,而結論——你可以把 CT 資料餵給文本模型,省下影像基礎設施——卻是錯的,原因正是 13,824 這個數字最初之所以存在的那個理由。
那個數字不是一次掃描的壓縮摘要。它就是那次掃描本身:以 2 公釐等向解析度涵蓋 384 公釐立方體,切成 8 x 8 x 8 個區塊,在沒有空間降採樣、也沒有合併層的情況下,直接交給語言模型。符元數量之所以很高,正是因為什麼都沒被丟掉:讓結節得以量測的層間距,以及讓紋理成為閾值而非形容詞的密度值。文字模型無法把那些符元當作體積來吸收,正如文件也無法做到。它有預算。它沒有介面。
論文自身的內部比較為這項差異給出了具體數字。MedGemma 1.5 在最多可輸入 85 張軸向切片——這已是二維或切片堆疊前端合理所能達到的極限——時,得分為 0.303 F1,而原生體積模型則為 0.614。這道差距正是三維編碼器的價值所在,再大的上下文視窗也無法彌補。
反向替換不成立,理由更直白。NV-Reason-CT 支援胸腔與腹部,接受的是 NIfTI 檔案而非提示詞,不具備工具使用能力,而且其模型卡將其限制於研究與教育用途,並聲明它並非醫療器材且輸出可能不正確。它無法從報告中擷取欄位,也無法撰寫用來建置你的語料庫的指令碼。

我們適合什麼,以及我們刻意不適合什麼
DeepSeek V4 Pro 透過 OrcaRouter 提供,形式為 deepseek/deepseek-v4-pro,採用供應商的牌價、零加成,收錄在一個涵蓋超過 200 個模型的單一 API 之中。對於採用分時價格的模型來說,這種直通定價比平常更為重要:當供應商調整費率或時段,我們這邊的費率當天就會同步變動,因為中間沒有加成層卡著舊的數字。自動容錯移轉能因應供應商在批次處理中途效能退化的情況,對長時間無人看管的擷取工作而言,這正是真正會讓你損失一整晚的故障模式;而路由 DSL 讓你能把個別請求送往最適合處理它們的模型,而不是讓所有流量都經過同一個端點。
NV-Reason-CT 並不在我們的平台上。任何 NVIDIA 模型都不在。這套架構的 CT 部分,靠的是你自己的硬體與你自己下載的權重,而我們不會寫出任何讓讀者產生其他理解的句子。有鑑於輸入資料是來自病患的體積資料,且授權條款為 OpenMDW-1.1,並未附帶任何託管服務,無論如何,本地執行才是該模型該待的地方。
配對實際上告訴了你什麼
這兩個模型並不互相競爭,而把它們拿來比較的意義在於:它們失敗的方式不同。NV-Reason-CT 提供了開放領域中其他任何東西都無法給予的能力——以研究完整解析度進行的原生三維 CT 推理——但要求你接受每項研究未編列預算的成本、未公開的吞吐量,以及一份禁止臨床部署的授權條款。DeepSeek V4 Pro 則提供一台計量收費的引擎,具備公開的延遲、公開的錯誤率、獨立測量數據,以及只要看一眼時鐘就能砍半的價格,而它完全看不到掃描影像。
如果你是自己打造這個東西,而不是買現成的,那麼在實際接觸後仍能存活的形態,就是那個無聊的形態。在本機執行 CT 讀取,用測量而不是用報價來編列它的預算,並把周遭所有文字性的東西安排去和離峰時段會合。最不該被任何人複製的排程,就是那個在 02:00 UTC 執行一億個 token 擷取、只因為那時批次剛好準備好的排程。

