一張生成的 hero 卡片,標題為「NV-Reason-CT vs Qwen3.8 Max」,副標為「微調後的模型,以及它所源自的家族」。底部橫向排列三個標籤:「骨幹:Qwen/Qwen3.5-4B」、「13,824 tokens 對 1,000,000」,以及「3.5% 對 0.21% 的實測誤差」。OrcaRouter 標誌合成於右下角。
Guides & Insights

NV-Reason-CT vs Qwen3.8 Max:那個微調模型,以及它出自的家族

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

看一眼NV-Reason-CT模型卡的第一行,就會發現一件大多數人都略過的事。基礎模型是 Qwen/Qwen3.5-4B,在儲存庫的中繼資料中被列為微調關係。所以當 NVIDIA 需要一個語言模型來掛上 Primus 3D 視覺 Transformer 時,它選了一個 Qwen。把那個檢查點拿來和 Qwen3.8 Max——阿里巴巴自家的 1,000,000-token 旗艦模型,於 2026 年 8 月 3 日推出——相比,你看到的是一個微調版本和這門家族事業。一個是 4.69B 的專門模型,能讀取胸腔與腹部 CT 影像,並於 2026 年 9 月 8 日悄無聲息地發布到 Hugging Face。另一個是通用旗艦模型,支援文字、圖像與影片輸入,有公開的價目表,過去一週在我們的網路上測得 3,720 萬 token 的流量。有趣的問題不是哪一個勝出。而是 4B 的微調能做到什麼它家族的旗艦做不到的事,以及為什麼答案比你想像的更加具體。

微調具體換來了什麼

NVIDIA 本身對這個落差的表述異常精確,而且是該儲存庫中最有用的一句話:大多數視覺語言系統「不是在 2D 影像上運作,就是在語言解碼前壓縮體積特徵」。這是對一整類模型的描述,而且涵蓋市場上每一款通用多模態旗艦。

這項修正屬於架構層級,而非規模問題。一個 384×384×384 毫米的體積會變成 24×24×24 的網格,共 13,824 個 token。這些 token 與其三維 MRoPE 會在解碼器內部保留空間關係。輸入體積會以解剖感知方式裁切至胸部或腹部肺部的 Hounsfield 單位,然後重新取樣至 2 毫米解析度。

把這一點對照 Qwen3.8 Max 所接受的內容來看。文字、圖像和影片——而在這系列中,影片是最接近體積輸入的東西,這讓它成為誠實的比較點,而不是修辭上的比較點。一部影片是一疊按時間排序的二維影格。CT 體積則是一疊沿 z 軸按物理位置排序的二維切片,以亨氏單位表示,並具有已知的毫米間距。兩者都是三維陣列。只有其中一種具有物理座標系統,能讓放射科醫師的發現定位到具體位置;也只有其中一種是以在影像感測器之外仍具意義的單位來量測。以影片訓練的模型學到的是時間連續性。以 CT 體積訓練的模型學到的是:某一張切片中的腫塊,就是低八毫米的下一張切片中的同一腫塊。

訓練語料庫才是真正的差異。

這正是兩個模型完全不再能相提並論的地方,而這也是規格表所隱藏的部分。

NV-Reason-CT 以端到端方式訓練,先進行監督式微調,接著對約 550,000 個結構化 QA 範例執行 Group Relative Policy Optimization;這些範例取自 70,111 個不重複的 CT 體積影像。來源包括 CT-RATE——來自伊斯坦堡 Medipol 大學 Mega 醫院的 47,149 例,附有配對的放射科報告——以及 NIH 內部一個包含 15,991 例的資料集,還有 CancerVerse 的 22,720 例,涵蓋四種對比期相與十三種惡性腫瘤類型。語料庫包含標準化報告、聚焦異常的 QA、多輪對話,以及放射科醫師撰寫、轉錄自專家判讀錄音的推理。GRPO 階段對胸部與腹部異常集合使用可驗證獎勵,這表示獎勵訊號會檢查所述發現是否存在於該 CT 體積中,而不是檢查文句是否聽起來具有臨床專業感。

Qwen3.8 Max 的訓練語料並未以如此詳盡的程度公開,而就算公開了也於事無補,因為目標能力是通用性的。相反地,其 Artificial Analysis 數據才是相關證據:智慧指數 45.4,在我們 API 快照的 145 個模型中排名第 15;AA Coding 76.2,排名第 9;Terminal-Bench 2.1 為 88.8;GPQA Diamond 92.8;Humanity's Last Exam 43.1;SciCode 52.1;長脈絡回憶 80.3。這些是第三方測量結果,而非供應商的主張,這使它們成為本頁雙方最值得信賴的數字。

推理輸出,兩份不同的合約

兩個模型都會輸出推理軌跡,也都讓你把它們關掉。相似之處僅止於介面。

Qwen3.8 Max 提供enable_thinking 與 reasoning_effort,以及完整的取樣參數面向——temperature、top_p、seed、penalties、結構化輸出、工具呼叫。它是一種通用推理能力,你可以用它處理手邊的任何內容。它的思考品質取決於你交給它的問題,而除了當初提供給它的文字之外,它無法依據任何其他東西來驗證某項主張。

NV-Reason-CT 的推理與讀者之間有更狹隘的約定,而模型卡明確說明了這項限制:生成的推理是「可供審查的模型輸出,且不保證代表模型內部的運算過程」。這項但書確實在發揮實際作用,而這種句子只會在團隊思考過臨床醫師會如何處理一段聽起來合理的推理軌跡時才會出現。模型卡將輸出描述為可供審查的觀察、鑑別診斷與不確定性。換句話說,這是一段可以對照影像體積核查的軌跡,而不是只能閱讀的軌跡。

吞吐量,來自我們唯一能測量它的地方

Qwen3.8 Max 在過去七天內透過 OrcaRouter 自家的 playground 處理了 3,720 萬個 token。它的首個 token 中位數時間為 1.96 秒——輕鬆是這系列模型中最快的——輸出速度為每秒 53.3 個 token。它在該期間的錯誤率為 3.5%。

這兩個數字往相反方向拉扯,而且兩者都很重要。延遲表現極佳,讓這個模型在反覆迭代時很順手。錯誤率大約是 Kimi K3 在同一期間 0.21% 的十七倍,而這個數字決定了你該把它放在同步、面向使用者的呼叫後面,還是放在帶有重試機制的批次工作後面。這是我們網路上實測的行為,不是基準測試,而這種事價目表永遠不會告訴你。

NV-Reason-CT 沒有對等方案。它是個 10.6 GB 的 BF16 檢查點,附帶自訂模型程式碼,載入時需搭配 trust_remote_code=True,可在 Ampere、Hopper 或 Lovelace 硬體上執行,並由 NVIDIA 在 H100 與 L40S 上測試。官方沒有公布 p50、錯誤率,也沒有輸送量數據。任何人告訴你自行代管這個模型能在哪個交叉用量上勝過按 token 付費,都只是在瞎猜。

價格與形狀,並排顯示

• 價格 — NV-Reason-CT 的 GPU 資本支出,沒有按 token 計費;相較於 Qwen3.8 Max 每百萬個 token $2.00 / $6.00,快取讀取 $0.25,快取寫入 $2.50

• 輸入 — 以亨氏單位(Hounsfield units)表示的 NV-Reason-CT 3D NIfTI CT 體積,僅限胸部或腹部,對比 Qwen3.8 Max 的文字、圖像與影片

• 上下文 — NV-Reason-CT 單一容量,固定 13,824 個 token 的前綴,對比 Qwen3.8 Max 的 1,000,000 個 token

• 參數 — NV-Reason-CT 總計 4.69B/在 CT 路徑中啟用 4.35B,對比 Qwen3.8 Max 未披露

• 授權條款 — NV-Reason-CT OpenMDW-1.1,權重已公開;相較於 Qwen3.8 Max 為專有,僅限 API 存取

• 獨立評分 — NV-Reason-CT 無,對比 Qwen3.8 Max:AA 智慧指數 45.4、GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

Qwen3.8 Max 的快取經濟學獎勵一種特定形態:$0.25 的快取讀取對上 $2.00 的全新輸入,是八倍的折扣,而 $2.50 的快取寫入意味著一段可重複使用的長前綴很快就能回本。那正是系統提示加上一份協定文件、在數千次請求中重複使用的工作負載。NV-Reason-CT 的成本結構則恰恰相反——一旦買了 GPU,每次掃描的邊際成本幾乎為零,而且有一道硬底線:一張 GPU 被無限期持有。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

共同經營家庭

這裡順理成章的架構——值得一提的是,還沒有人發表過——就是用微調模型來處理量大的工作,並用旗艦模型處理其周邊的一切。NV-Reason-CT 產生結構化發現;Qwen3.8 Max 則處理轉介文字、方案匹配、編碼、隨訪信——這些高產量文字工作,正是百萬 token 視窗與八倍快取折扣真正發揮價值的地方。

如果那就是你的管線,其中一半是你自己託管的檢查點,另一半是你購買的權杖,而後者正是路由器能做出單一供應商端點做不到之事的地方。Qwen3.8 Max 透過 OrcaRouter 以 Alibaba 的定價提供,零加成,所以上面的 $2.00 / $6.00 就是你實際支付的價格,而任何未來的價格變動都會當天反映到你的帳單上,而不是等到續約時才調整。跨供應商的自動容錯移轉比平常更為重要,尤其當模型自身測得的錯誤率是 3.5% 時——重試時改送往另一個健康的端點,就是短暫小故障與整批失敗之間的差別。而且因為管線中一般性的那一半,只是 OpenAI 相容端點背後的一個模型名稱,涵蓋 200+ 個模型,所以換上別的東西做一週的實驗只需改一個字串,而不是一次整合工程。

NV-Reason-CT,說清楚一點,並不在 OrcaRouter 上,而且也不會上——它是你自己執行的自訂程式碼 3D 推論。整合故事的誠實版本是:自架專家模型與經路由的通用模型可以放在同一組金鑰之下,而這就是這項說法的全部。

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

真正站得住腳的判決

這種配對被歸入「哪個更好」的類別,但其實不該如此。Qwen3.8 Max 由第三方在通用推理上進行評測,並擊敗了大多數對手;NV-Reason-CT 只有一張在某一 CT 基準上的自家數據表,以及一個在任何通用比較中都不足為奇的 4.69B 參數數量。在任何通用基準上,旗艦型號都會勝出,而原因在於通用基準正是它被打造來應對的領域。

在 NV-Reason-CT 專為之打造的那一項任務上——讀取胸腔或腹部 CT 體積並說出裡面有什麼,並附上可供他人查核的軌跡——Qwen3.8 Max 並不是較弱的競爭者。它沒有體積編碼器,因此在沒有先由某人決定如何把掃描攤平成影像的情況下,根本無法對這樣的輸入執行。那個決定就是空間資訊的去處。這正是具有原生 3D 路徑與 13,824 個 token 固定前綴的 4B 微調模型的重點所在,也正是為什麼這個模型有趣之處在於其主幹的小,而不是它的規模。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新