一張生成的 hero card,標題為「NV-Reason-CT vs DeepSeek V4 Pro」,副標題為「讀取一次掃描的成本,以及何時執行批次」。兩張相對的卡片由一對藍色箭頭分隔:左側卡片標示為「NV-Reason-CT」,帶有身體掃描圖示與「一個 CT 體積 — 13,824 個視覺 token — 未公布吞吐量」;右側卡片標示為「DeepSeek V4 Pro」,帶有晶片圖示與「1.6T 總參數 / 49B 活躍 MoE — 1M 上下文 — 每 M $0.66 / $1.98,在兩個 UTC 時段內加倍」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT 對比 DeepSeek V4 Pro:判讀一次掃描的成本,以及何時執行批次

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

以下這項營運事實,比任何基準都更能左右臨床流程預算:DeepSeek V4 Pro 的費用是每百萬輸入 token 0.66 美元、每百萬輸出 token 1.98 美元,而這些費率每天會在兩個時段加倍:UTC 01:00 至 04:00 以及 06:00 至 10:00。在這些時段外執行的批次工作,成本是時段內的一半。同時,NV-Reason-CT,NVIDIA 的 46.9 億參數 3D CT 推理器,根本沒有費率表——它是一組你下載後執行的權重,且未公布單一 13,824-token 研究的吞吐量數字。這兩個模型中,有一個你可以排程;另一個則必須先測量,才能編列預算。

這種不對稱正是切入這項比較的實用角度,因為這兩個模型分別位於流程的相反兩端,而且在財務上以相反的方式失敗。NV-Reason-CT 是固定成本工具:硬體一旦購入,邊際研究幾乎免費,但硬體決策本身很重大,且每項研究的延遲時間沒有公開記錄。DeepSeek V4 Pro 則是變動成本引擎:沒有東西要買,一切都按用量計費,而且計費錶有一套你可以直接從日曆讀出來的時程。

每一項是什麼,各以一行說明

• 工作 — NV-Reason-CT 讀取胸部或腹部 CT 影像並輸出結構化發現;DeepSeek V4 Pro 讀寫文字

• 架構 — 一個名為 Primus 的 3D 視覺 Transformer,從 COLIPRI 初始化,搭配 Qwen3.5-4B 語言主幹以及 3D 多軸旋轉位置嵌入,具有 4.69B 參數,其中 4.35B 為活躍參數;對比一個 1.6 兆參數的專家混合模型,每個 token 有 490 億活躍參數

• 輸入 — 單通道 NIfTI 體積(.nii、.nii.gz),以 Hounsfield 單位表示、LPS 定向、重新取樣為 2 mm 等向性並裁切至解剖構造;與文字對比

• 脈絡 — 單一體積在 24 x 24 x 24 的網格中會變成 13,824 個視覺 token,沒有空間降取樣,也沒有合併層;相較之下,輸入為 1,048,576 個 token,輸出為 384,000 個

• 支援的解剖構造——胸部與腹部,別無其他;有別於文字所能描述的一切

• 價格 — 無標價、自行託管、未公布每項研究的吞吐量;相較於每百萬個詞元 $0.66 / $1.98,於上述兩個 UTC 時段內倍增,快取讀取為 $0.022

• 實測延遲——未公布;相較之下,首符元時間中位數為 3,483 毫秒,每秒輸出 96.01 個符元,錯誤率為 0.75%

那裡有兩列,各自值得用超過一行來表達。上下文列是最明顯的那一列——一百萬個 token 對上 13,824 個——但兩者的單位無法相比,把它們解讀成任一方向的能力差距都是錯誤。13,824 個 token,是忠實呈現一次 CT 檢查所需的代價。一百萬個 token,則是你所能容納的周遭文字量。第一個數字是在說明解析度;第二個數字是在說明記憶。

延遲那一列正是被略過的那一列。DeepSeek V4 Pro 首個 token 的中位數 3.48 秒、每秒 96 個 token,都是經過實測並公開發表的數字,讓你可以在紙上估算一項文字工作的規模。NV-Reason-CT 缺乏任何對應數字,這並不是對該模型的批評;這正是 CT 流程在有人實際跑過之前無法估算成本的原因。一個 4.69B 模型處理 13,824 個視覺 token 並非小運算,在你於自己的硬體上實際計時之前,你都只是在猜。

閱讀兩筆基準紀錄而不自欺

DeepSeek V4 Pro 的紀錄混合了獨立量測與廠商報告,而這種混合富有啟發性,因為其中包含一個看似令人擔憂、實則不然的數字。

• Artificial Analysis Intelligence Index — 36,在受測模型中位居第 72.4 百分位

• GPQA Diamond—— 92.8,接近該領域的頂尖水準

• 人類最後的考試 — 41,以及在 MMLU-Pro 上 41 分、數學指數 62.51

• τ²-Bench — 96.20,其中 IFBench 為 76.46,tau_banking 為 39.59

• 長上下文召回 — 80.33

• SciCode 與 Terminal-Bench — 在第二版 Terminal-Bench 上分別為 51 與 78.65

一個 36 的綜合指數與 92.8 的 GPQA Diamond 並列,讀起來像是矛盾,直到你注意到指數是什麼。它是橫跨許多評估的彙總,而一個在少數評估中表現優異、在其他評估中僅算尚可的模型,會在總和上位居中游,卻在個別排行榜上名列前茅。任何僅引用 36 來主張 DeepSeek V4 Pro 屬於中階的人,都是把平均值當成最大值在引用。任何僅引用 92.8 來主張它領先群倫的人,都是把最大值當成平均值在引用。這兩個數字都來自 Artificial Analysis,且兩者皆為真。

NV-Reason-CT 的紀錄沒有這種混合情況,而這正是它最誠實的問題所在。它的 CT-RATE 數據——在十八個標籤上達到 0.614 F1 和 0.871 AUROC,採用固定的統一閾值與直接的 yes/no 提示,既沒有分類頭,也沒有針對特定任務的調適——僅來自 NVIDIA 自家的論文,別無其他出處。該論文中的比較對象(VoxelFM 為 0.581、Pillar-0 為 0.544、ClinFusion-8B 為 0.442、CT-CLIP 為 0.398、Merlin 為 0.358、MedGemma 1.5 為 0.303)全是其他影像模型。其中沒有任何一個通用文字模型,也沒有任何第三方重現過這些數字。

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

排程問題,完整解析

DeepSeek V4 Pro 的分時定價,是這兩款模型中在營運上最可付諸實行的一點,因此值得具體地逐步說明。

對一個 CT 計畫來說,貼近現實的文本端工作負載並不光鮮亮麗。它是從一批歷史報告的語料庫中擷取結構化欄位,好讓你有標籤可以拿來訓練;是大規模地把 DICOM 目錄樹轉成 NIfTI;是反覆撰寫又改寫評估框架;是統一四個資料集之間的單位與術語;以及彙整各世代的摘要。就說一個中型計畫要用掉一億個輸入 token 和一千萬個輸出 token 吧——這是刻意取整的數字,用來代表「大量的文本工作」。

• 在加倍的視窗內 — 每百萬 $1.32 與 $3.96,因此在這些用量下為 $132 加上 $39.60

• 在那些區間之外 — 每百萬 $0.66 和 $1.98,所以是 $66 加 $19.80

• 差額——大約 86 美元,相當於離峰帳單的 49%,只為了移動一項本質上可批次處理的工作

• 快取讀取 — 每百萬 $0.022,為輸入費率的六十分之一,因此你在語料庫中重複使用的任何提示前綴幾乎等同免費

那不是捨入誤差,而且它之所以可用,是因為工作是非同步的。報告擷取不需要在 14:00 發生。DICOM 轉換工作完全不在乎現在幾點。定價結構直接邀請你進行排程,而忽略它的管線等於為了隨心所欲執行的特權支付 49% 的溢價。快取讀取也基於同樣的理由而重要:一個共享的系統提示或固定的擷取結構描述,在數千份報告中重複使用,其價格是輸入費率的六十分之一。

NV-Reason-CT 沒有對等的槓桿,因為它沒有計量器。讀取一次掃描的成本,就是你的 GPU 每小時費用除以你每小時能推進多少掃描,而第二個數字是沒有人發表過的。如果單一研究需要兩秒,單張 L40S 就能輕鬆處理一個大型計畫。如果需要二十秒,硬體運算就完全改變。NVIDIA 在 H100 和 L40S 上測試過,這告訴你的是顯卡等級,而不是速率。

假設它們可以被取代的陷阱

這場對決所招致的錯誤,比尋常的範疇謬誤更為微妙,因為它有一種版本擺在投影片上看起來很合理。

DeepSeek V4 Pro 可容納 1,048,576 個 token,並可輸出最多 384,000 個。一個 CT 容積,若由能正確解讀它的模型來估算,只有 13,824 個 token。因此,一個具備百萬 token 脈絡窗的文本模型,在該 token 數量下,可以容納七十多個 CT 檢查。這套算術是正確的,而結論——你可以把 CT 資料餵給文本模型,省下影像基礎設施——卻是錯的,原因正是 13,824 這個數字最初之所以存在的那個理由。

那個數字不是一次掃描的壓縮摘要。它就是那次掃描本身:以 2 公釐等向解析度涵蓋 384 公釐立方體,切成 8 x 8 x 8 個區塊,在沒有空間降採樣、也沒有合併層的情況下,直接交給語言模型。符元數量之所以很高,正是因為什麼都沒被丟掉:讓結節得以量測的層間距,以及讓紋理成為閾值而非形容詞的密度值。文字模型無法把那些符元當作體積來吸收,正如文件也無法做到。它有預算。它沒有介面。

論文自身的內部比較為這項差異給出了具體數字。MedGemma 1.5 在最多可輸入 85 張軸向切片——這已是二維或切片堆疊前端合理所能達到的極限——時,得分為 0.303 F1,而原生體積模型則為 0.614。這道差距正是三維編碼器的價值所在,再大的上下文視窗也無法彌補。

反向替換不成立,理由更直白。NV-Reason-CT 支援胸腔與腹部,接受的是 NIfTI 檔案而非提示詞,不具備工具使用能力,而且其模型卡將其限制於研究與教育用途,並聲明它並非醫療器材且輸出可能不正確。它無法從報告中擷取欄位,也無法撰寫用來建置你的語料庫的指令碼。

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

我們適合什麼,以及我們刻意不適合什麼

DeepSeek V4 Pro 透過 OrcaRouter 提供,形式為 deepseek/deepseek-v4-pro,採用供應商的牌價、零加成,收錄在一個涵蓋超過 200 個模型的單一 API 之中。對於採用分時價格的模型來說,這種直通定價比平常更為重要:當供應商調整費率或時段,我們這邊的費率當天就會同步變動,因為中間沒有加成層卡著舊的數字。自動容錯移轉能因應供應商在批次處理中途效能退化的情況,對長時間無人看管的擷取工作而言,這正是真正會讓你損失一整晚的故障模式;而路由 DSL 讓你能把個別請求送往最適合處理它們的模型,而不是讓所有流量都經過同一個端點。

NV-Reason-CT 並不在我們的平台上。任何 NVIDIA 模型都不在。這套架構的 CT 部分,靠的是你自己的硬體與你自己下載的權重,而我們不會寫出任何讓讀者產生其他理解的句子。有鑑於輸入資料是來自病患的體積資料,且授權條款為 OpenMDW-1.1,並未附帶任何託管服務,無論如何,本地執行才是該模型該待的地方。

配對實際上告訴了你什麼

這兩個模型並不互相競爭,而把它們拿來比較的意義在於:它們失敗的方式不同。NV-Reason-CT 提供了開放領域中其他任何東西都無法給予的能力——以研究完整解析度進行的原生三維 CT 推理——但要求你接受每項研究未編列預算的成本、未公開的吞吐量,以及一份禁止臨床部署的授權條款。DeepSeek V4 Pro 則提供一台計量收費的引擎,具備公開的延遲、公開的錯誤率、獨立測量數據,以及只要看一眼時鐘就能砍半的價格,而它完全看不到掃描影像。

如果你是自己打造這個東西,而不是買現成的,那麼在實際接觸後仍能存活的形態,就是那個無聊的形態。在本機執行 CT 讀取,用測量而不是用報價來編列它的預算,並把周遭所有文字性的東西安排去和離峰時段會合。最不該被任何人複製的排程,就是那個在 02:00 UTC 執行一億個 token 擷取、只因為那時批次剛好準備好的排程。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.