
NV-Reason-CT 与 DeepSeek V4 Pro 对比:读取一次扫描的代价,以及何时运行批处理
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 506 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
这里有一个运营事实,它比任何基准测试都更能左右临床管线预算:DeepSeek V4 Pro每百万输入 token 收费 0.66 美元,每百万输出 token 收费 1.98 美元,而这两个费率每天会在两个时段翻倍,即 UTC 01:00 至 04:00 和 06:00 至 10:00。在这些时段之外运行的批处理任务,成本是时段内的一半。与此同时,NV-Reason-CT——NVIDIA 的 46.9 亿参数 3D CT 推理模型——完全没有价目表:它是一组你下载并运行的权重,且没有公布针对单次 13,824 token 检查的吞吐量数据。其中一个模型,你可以安排调度。另一个则必须先测量,然后才能为它做预算。
这种不对称是切入这项比较的有效方式,因为这两个模型位于流水线的两端,并在财务上以相反的方式失效。NV-Reason-CT 是一种固定成本工具:硬件一旦购买,边际研究几乎免费,但硬件决策很大,而且每项研究的延迟没有文档记录。DeepSeek V4 Pro 是一台可变成本引擎:无需购买任何东西,一切都按量计费,而计费表有一个可以直接从日历上读出的时间表。
每一项是什么,各用一行说明
• 工作 — NV-Reason-CT 读取胸部或腹部 CT 影像并输出结构化发现;DeepSeek V4 Pro 读取和写入文本
• 架构 — 一种名为 Primus 的 3D 视觉 Transformer,从 COLIPRI 初始化而来,采用 Qwen3.5-4B 语言主干和 3D 多轴旋转位置编码,参数量为 4.69B,其中 4.35B 处于激活状态;相比之下,一个拥有 1.6 万亿参数的专家混合模型每个 token 激活 490 亿参数
• 输入 — 单通道 NIfTI 体数据(.nii、.nii.gz),以亨斯菲尔德单位表示,LPS 方向,重采样至 2 mm 各向同性并裁剪至解剖结构;与文本对照
• 上下文 — 单个体数据在 24 x 24 x 24 的网格中会变成 13,824 个视觉 token,既没有空间下采样,也没有合并层;相比之下,输入为 1,048,576 个 token,输出为 384,000 个 token
• 支持的解剖部位——仅限胸部与腹部,别无其他;与文本所能描述的一切相对
• 价格 — 无标价,自托管,未公布每项研究的吞吐量;相较每百万 token 0.66 美元 / 1.98 美元,在上述两个 UTC 时间窗口内翻倍,缓存读取为 0.022 美元
• 实测延迟 — 未公开;对照 3,483 毫秒的首 token 中位耗时、每秒 96.01 个输出 token,以及 0.75% 的错误率
那里的两行都值得各用不止一行来写。上下文这一行最明显——一百万 token 对 13,824——但两者的单位不可比,把它们解读为任一方向上的能力差距都是错误的。13,824 个 token 是忠实表示一次 CT 研究所需要的量。一百万 token 则是你能容纳的周边文本量。第一个数字说的是分辨率;第二个数字说的是记忆。
延迟那一行往往是被跳过的。DeepSeek V4 Pro 首 token 中位延迟 3.48 秒、每秒 96 个 token,都是经过实测并公开发布的数字,能让你在纸面上估算一个文本任务的规模。NV-Reason-CT 缺乏任何同等数据,这并不是对该模型的批评;而是 CT 流水线在有人实际跑起来之前无法进行成本核算的原因。一个 4.69B 模型处理 13,824 个视觉 token 并不是小计算量,在你用自己的硬件实测过之前,你只是在猜。
不自欺地阅读这两条基准记录
DeepSeek V4 Pro 的记录由独立测量与厂商报告混合而成,而这种混合很能说明问题,因为其中有一个数字看似惊人,实则不然。
• Artificial Analysis Intelligence Index — 36,在被测量的模型中处于第 72.4 百分位
• GPQA Diamond — 92.8,接近该领域的最高水平
• Humanity's Last Exam — 41,MMLU-Pro 上为 41,数学指数为 62.51
• τ²-Bench — 96.20,IFBench 为 76.46,tau_banking 为 39.59
• 长上下文召回 — 80.33
• SciCode 和 Terminal-Bench — 在 Terminal-Bench 第二版上分别达到 51 和 78.65
一个36的综合指数与一个92.8的GPQA Diamond并列放在一起,读起来像矛盾,直到你注意到指数是什么。它是许多评估的汇总,而一个在少数评估中表现出色、在其他评估中仅算合格的模型,会在总和上排在中游,却在单项榜单上名列前茅。任何仅引用36来论证DeepSeek V4 Pro属于中端的人,都是在把平均值当作最大值来引用。任何仅引用92.8来论证它领先该领域的人,都是在把最大值当作平均值来引用。这两个数字都来自Artificial Analysis,而且都是真实的。
NV-Reason-CT 的记录没有这种混合,而这恰恰是它真正的问题所在。其在十八个标签上的 CT-RATE 数值——0.614 F1 和 0.871 AUROC,使用固定的统一阈值和直接的“是/否”提示,没有分类头,也没有针对特定任务的适配——来自 NVIDIA 自己的论文,别无他处。该论文中的对比集(VoxelFM 为 0.581,Pillar-0 为 0.544,ClinFusion-8B 为 0.442,CT-CLIP 为 0.398,Merlin 为 0.358,MedGemma 1.5 为 0.303)完全由其他影像模型组成。其中没有出现任何一个通用文本模型,也没有任何第三方复现过其中任何一个数字。

调度问题,已逐步解决
DeepSeek V4 Pro 的限时定价是这两款模型中最具操作可行性的部分,因此值得具体展开说明。
CT 项目现实中文本侧的工作量并不光鲜。它意味着从历史报告语料库中抽取结构化字段,以便有可用于训练的标签;大规模地将 DICOM 目录树转换为 NIfTI;编写并反复重写评估工具链;在四个数据集之间统一单位和术语;以及汇总队列。对于中型项目,可以说是一亿输入 token 和一千万输出 token,这是一个刻意取的整数,用来代表“大量文本工作”。
• 在翻倍的窗口期内 — 每百万 $1.32 和 $3.96,因此在那些用量上为 $132 加 $39.60
• 在这些窗口之外——每百万 0.66 美元和 1.98 美元,即 66 美元加 19.80 美元
• 差额——大约86美元,相当于非高峰时段账单的49%,仅仅是为了挪动一个本质上可批量处理的作业
• 缓存读取 — 每百万 $0.022,仅为输入费率的六十分之一,因此你在整个语料库中复用的任何提示前缀几乎都是免费的
这不是舍入误差,而且它之所以可用,是因为工作是异步的。报告提取不需要在14:00进行。DICOM转换任务根本不关心现在是什么时间。定价结构直接鼓励调度,而忽略这一点的流水线则要为随心所欲运行的特权支付49%的溢价。缓存读取之所以重要,也是出于同样的原因:一个共享的系统提示或固定的提取模式,在数千份报告中重复使用,其费用仅为输入费率的六十分之一。
NV-Reason-CT 没有对等的调节杠杆,因为它没有计量表。读取一次扫描的成本,等于你的 GPU 每小时成本除以你每小时能推进的扫描数量,而第二个数字是没人公布过的。如果单次检查耗时两秒,一块 L40S 就能轻松应对一个大型项目。如果耗时二十秒,硬件这笔账就完全变了。NVIDIA 在 H100 和 L40S 上做了测试,这只能告诉你卡属于哪个级别,而不是速率。
假定它们可以被替换的陷阱
这种对局容易引发的错误,比通常的范畴错误更微妙,因为它的某个版本在幻灯片上看起来还挺合理。
DeepSeek V4 Pro 可容纳 1,048,576 个 token,最多可输出 384,000 个 token。一个 CT 体数据,按照真正能正确读取它的模型的估算,只有 13,824 个 token。因此,一个拥有百万 token 窗口的文本模型,在那个 token 数下,能放得下七十多项 CT 检查。算术没错,但结论——你可以把 CT 数据喂给文本模型,从而省去影像基础设施——是错的,原因恰恰在于 13,824 这个数字当初为何会存在。
那个数字不是扫描的压缩摘要。它就是扫描本身:在 384 毫米的立方体上以 2 毫米各向同性分辨率采集,切成 8 x 8 x 8 个图像块,交给语言模型,没有空间下采样,也没有合并层。token 数量之所以高,恰恰是因为什么都没有被丢弃:让结节变得可测量的层间距,让纹理成为阈值而非形容词的密度值。文本模型不能把这些 token 当作体数据来摄取,文档也同样不能。它有预算。它没有接口。
论文自身的内部对比为这一差距给出了具体数字。MedGemma 1.5 在最多输入 85 个轴位切片——这是二维或切片堆叠式前端所能合理达到的最佳水平——时得分为 0.303 F1,而原生三维体数据模型为 0.614。这一差距正是三维编码器的价值所在,再大的上下文窗口也无法弥合。
反向替换因更简单的原因而不成立。NV-Reason-CT 支持胸部和腹部,接收的是 NIfTI 文件而不是提示词,不具备工具调用能力,而且其模型卡将其限制在研究和教育用途,并声明它不是医疗器械,输出可能不正确。它无法从报告中提取字段,也无法编写构建你的语料库的脚本。

我们适合何处,以及我们刻意不适合何处
DeepSeek V4 Pro 通过 OrcaRouter 提供服务,模型标识为 deepseek/deepseek-v4-pro,按提供商的挂牌价计费、零加价,并纳入一个覆盖 200 多个模型的单一 API 之中。这种直通式计费对按时段定价的模型来说比平时更为重要:当供应商调整费率或时段时,我们这边的费率当天就会同步变化,因为中间没有一层加价环节固守着旧数字。自动故障转移可应对提供商在批处理中途性能下降的情况,而对于长时间无人值守的抽取任务来说,这正是真正让你损失一整夜的故障模式;路由 DSL 还让你可以把单个请求发送给应当处理它的模型,而不是让所有请求都经过同一个端点。
NV-Reason-CT 不在我们的平台上。NVIDIA 的模型也都不在。该架构的 CT 一侧是你自己的硬件,搭配你自己下载的权重,我们不会写出让读者以为不是这样的句子。鉴于输入是源自患者的容积数据,且许可证是未附带任何托管服务的 OpenMDW-1.1,无论如何,本地执行才是该模型应有的运行方式。
配对实际上告诉了你什么
这两个模型并不相互竞争,比较它们的意义在于:它们以不同的方式失败。NV-Reason-CT 为你提供了一种开放领域中其他任何东西都不具备的能力——以检查的完整分辨率进行原生三维 CT 推理——同时要求你接受一项未纳入预算的每例检查成本、一个未公开的吞吐量,以及一份禁止临床部署的许可证。DeepSeek V4 Pro 为你提供了一个按量计费的引擎,它具有已公布的延迟、已公布的错误率、独立测量结果,以及一个只要瞄一眼时钟就能减半的价格,而它根本看不到扫描影像。
如果你是在自己造这套东西而不是买现成的,那么真正经得起实战考验的形态,往往是那种乏味的方案。把 CT 读取放在本地跑,做预算时靠实测而非照搬报价,并把围绕它的所有文本处理都安排去与非高峰窗口会合。唯一不该被任何人照抄的排期,就是那种因为在 UTC 02:00 批处理恰好就绪,于是在 UTC 02:00 跑一亿 token 抽取的排期。

