一張生成的 hero card,標題為「NV-Reason-CT vs Kimi K3」,副標題為「210 次下載與 5.88 億個 token」。底部沿著排列三個 chip:「210 次 HF 下載 vs 587.8M tokens / 7d」、「在我們的網路上測得 0.21% 誤差」,以及「一個 volume vs 1,048,576 個 token」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT 對比 Kimi K3:210 次下載與 5.88 億個 Token

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩款模型中,有一款已從 Hugging Face 下載了 210 次。另一款在過去七天內透過我們自家的 playground 處理了 5.88 億個 token。兩者都是開放權重,現在都可下載,而這兩個數字之間的落差,是這篇比較中最有用的地方。NV-Reason-CT是 NVIDIA 的 46.9 億參數 3D 視覺語言模型,用於胸腔與腹部 CT,於 2026 年 9 月 8 日發布到 Hugging Face,沒有任何公告。Kimi K3是 MoonshotAI 的 1,048,576-token 旗艦模型,於 2026 年 7 月 15 日推出,現在是我們網路上最繁忙的模型之一。若就採購表單所重視的意義而言,它們都算「開放」。但它們開放的方式根本完全不同。

{{1}}「你可以下載它」的{{2}}兩種意思{{/2}}{{/1}}

先從每次下載實際上在你磁碟上留下什麼開始,因為大多數開放權重模型的比較,正是在這一點上變得含糊。

NV-Reason-CT 提供你 model.safetensors,BF16 格式下大約 10.6 GB,外加一個 model.py,以及一份相當可觀的 processor.py——26 KB 的自訂處理程式碼,實作了解剖感知裁切、2-mm 重新取樣與 3D 切塊化。你可以用 trust_remote_code=True 載入,這表示你會在自身行程內執行 NVIDIA 的儲存庫程式碼。推論需要 CUDA PyTorch,而規格表列出 Ampere、Hopper 與 Lovelace,並在 H100 與 L40S 上測試過。輸入一次是一個 NIfTI 體積。目前沒有發布任何批次處理方案、沒有吞吐量數字,儲存庫中除了 inference.py 範例之外,也沒有任何服務配置。

Kimi K3 為你提供一款通用推理模型,具備 1,048,576 詞元的上下文視窗、文字與圖像輸入、原生工具呼叫、結構化輸出,以及可設定的推理強度。當你需要一次讀取上百份臨床指引,或某個部門長達十年的報告時,它就是你会採用的模型。其 Artificial Analysis 長上下文召回分數為 88.7——是本系列模型中最高,且比 Grok 4.6 的 80.3 整整高出 8.4 分。

直白地說:NV-Reason-CT 是一個專用檢查點,輸入面狹窄,且帶有你必須信任並維護的自訂程式碼。Kimi K3 則是通用模型,輸入面寬廣,行為有如基礎設施。兩者都可下載。但只有其中一個能直接無縫替換。

CT 證據,完整呈現,而且篇幅簡短。

關於{{1}}NV-Reason-CT{{/1}}品質的一切公開已知資訊,都取決於其自家模型卡中的單一表格:{{2}}CT-RATE{{/2}}的 18 標籤分類任務,在固定統一閾值下、直接 Yes/No 提示、沒有分類頭、沒有任務特定調適。Macro-F1 0.614,Macro-AUROC 0.871。

比較列為 VoxelFM 的 0.581/0.870、Pillar-0 的 0.544/0.861、ClinFusion-8B 的 0.442、CT-CLIP 的 0.398/0.733、Merlin 的 0.358/0.662,以及 MedGemma 1.5 的 0.303。這些全部都是 NVIDIA 卡上廠商自行回報的數字,目前尚未有任何一項經過獨立重現——這篇論文才發表兩天。

這張表所確立的事很狹隘,值得精確說明:一個沒有任務專用頭的生成式 3D 模型,在 18 標籤 CT 分類上勝過 3D 對比預訓練基線與基於切片的前沿模型。它未能確立的是任何關於一般推理的事、任何關於胸部與腹部 CT 以外模態的事,以及任何關於 AUROC 優勢的事——0.871 對上 0.870 只是披著小數點的平手。

Kimi K3 的數據,以及開放權重排行榜的注意事項

Artificial Analysis 測得 Kimi K3 的 Intelligence Index 為 43.6,在我們模型 API 排行榜快照中,於該榜 145 個模型裡名列第 19。其 GPQA Diamond 分數為 93.5,Humanity's Last Exam 為 46.9,SciCode 為 59.5,Terminal-Bench 2.1 為 85.0,AA Coding 為 76.2、排名第 9,而 𝜏²-banking 為 46.0。

有一項排名說法需要謹慎處理,因為它很容易被弄錯,而且過去也曾被弄錯。Kimi K3 的 AA Intelligence Index 為 44,在開放權重榜單的開放權重模型中排名第三,落後於 46 的 MiMo-V2.6-Pro 與 45 的 GLM-5.3。它並非該榜單的領先者,也不是與 Grok 4.6 在同一榜單上競爭——Artificial Analysis 將 Grok 4.6 記錄為專有模型,因此其 44 屬於一般排名,而非開放權重排名。這兩個指數看起來一模一樣,但其實並不相同。

操作員實際看到的內容

這就是 5.88 億這個數字的來源,而它值得詳細說明,因為它是本文中唯一一項屬於我們、而非任何人的行銷宣傳的證據。

在過去七天內,Kimi K3 透過 OrcaRouter 的 playground 處理了 5.878 億個 token。它的首個 token 時間中位數為 7.8 秒,每秒產生 42.9 個輸出 token,而在該期間的錯誤率為 0.21%——大約每 480 次請求中有一次失敗。這個實測錯誤率是無法從模型卡上取得的資訊,而這個數字決定了模型是否適合用於批次作業。

對 NV-Reason-CT 而言並沒有對應的東西,因為它並不是在任何地方託管的端點——它是一個由你自己執行的檢查點。沒有 p50、沒有錯誤率、沒有運作時間,也沒有任何可容錯移轉的對象。這不是在貶低它;這是自架的一個結構性事實,也正是為什麼研究團隊可以在某個週二就採用 NV-Reason-CT,而正式環境團隊通常做不到。

如果你同時運行這兩半——Kimi K3 作為託管的通用層,而 NV-Reason-CT 在你自己的 GPU 機器上——路由這一側正是託管那一半獲得韌性的地方。Kimi K3 以 Moonshot 自家的標價提供服務:每百萬輸入 $3.00,每百萬輸出 $15.00,且零加成;其快取讀取費率為每百萬 $0.30,是輸入的十分之一,而由於價格原樣傳遞,供應商降價當天就會反映到你的帳單上。跨供應商的自動容錯移轉正是讓批次工作在某個上游端點出現波動時仍能存活的關鍵——而在 0.21% 的錯誤率下,波動罕見到很容易讓人忘記它的存在,直到它不再是罕見為止。

成本形狀彼此不相似。

• 價格 — NV-Reason-CT GPU 資本支出加上你自己的服務堆疊,對比 Kimi K3 每百萬 $3.00 / $15.00,$0.30 快取讀取

• 最低可行支出 — NV-Reason-CT 無限期持有一張 Ampere 或更新世代的 GPU vs Kimi K3 一次請求

• 上下文 — NV-Reason-CT 單一容量為固定 13,824 個 token,對比 Kimi K3 的 1,048,576 個 token

• 第一千次請求的邊際成本——一旦付清 GPU 成本,NV-Reason-CT 實際上為零,而 Kimi K3 則與 token 數量呈線性關係

• 首先在哪裡出問題——NV-Reason-CT 未經證實的吞吐量,以及缺乏批次處理方案,對比 Kimi K3 在每次請求 100 萬個 token 時的長上下文成本

• 模態 — NV-Reason-CT 3D NIfTI、胸部或腹部,對比 Kimi K3 的文字與圖像、任何內容

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

經濟效益會隨規模而反轉。Kimi K3 起步零成本,且呈線性擴展。NV-Reason-CT 起步就需要一張 GPU,之後的擴展幾乎持平——這就是為什麼 210 次下載並不是失敗的訊號。對於一個其受眾是那些早已擁有硬體、且根本永遠不會出現在 token 吞吐量統計中的機構的檢查點而言,這個數字是正確的。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

你實際上選的是哪一個

如果任務是讀取 CT 容積並產出帶有推理軌跡的結構化發現,Kimi K3 做不到,而 NV-Reason-CT 可以。不是「做得比較差」——而是根本做不到,因為它裡面完全沒有容積編碼器,而且先把掃描攤平成影像,會丟棄 3D 路徑原本要保留的空間關係。

如果這項工作是讀取 400 頁的轉介紀錄、將它們與一份協定文件比對,並產生結構化輸出,那麼 NV-Reason-CT 根本不在討論範圍內,而 Kimi K3 是現有較好的解答之一,在我們網路上測得的錯誤率低於四分之一個百分點。

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

真正的抉擇並不在這兩者之間。而在於你的問題是量的問題,還是文字的問題,而 2.1 億與 5.88 億之間的落差,不過是這項區別從外部看起來的模樣。其中一個模型是一篇帶著權重的論文。另一個則是一套基礎設施。兩者都值得擁有;但誰也無法取代誰。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新