一张生成的主视觉卡片,标题为“NV-Reason-CT vs GPT-5.6 Sol”,副标题为“输入第一个字之前,已有 13,824 个视觉 token”。底部横向排列着三个标签:“4.69B 的 CT 专家模型 vs 未披露”、“输入 3D NIfTI,输出检查所见”,以及“Sol:输入 1,050,000 / 输出 128,000”。OrcaRouter 标志合成于右下角。
Guides & Insights

NV-Reason-CT vs GPT-5.6 Sol:在你键入任何文字之前,先消耗13,824个视觉Token

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

你发送给NV-Reason-CT的每一份胸部CT,在提示词开始之前都要消耗13,824个视觉token。这不是什么怪癖或调参选择——这就是整个设计。该模型原生的3D视觉编码器接收一个384×384×384毫米的体数据,并将其转换为24×24×24的网格,而模型卡明确说明,全部13,824个token及其三维坐标都会“未经空间下采样”到达语言模型。把这和你可能已经在为之付费的东西比一比。GPT-5.6 Sol接受文本、图像和文件,而发送给它的图像是一张2D图片——一个切片、一张DICOM查看器的截图、一幅从PDF里粘出来的放射学图。其中一个模型有体数据通路。另一个则有上下文窗口。它们之间的大多数比较都会在这个区别上崩塌,而崩塌本身就是有趣的部分。

无人宣布的发布

NVIDIA 尚未在其新闻中心发布任何关于 NV-Reason-CT 的只言片语。没有发布文章,没有主题演讲幻灯片,也没有新闻稿。存在的只有:一个创建于 2026 年 9 月 8 日的 Hugging Face 仓库、一个位于 NVIDIA-Medtech 组织下、创建于 9 月 2 日的 GitHub 仓库、一个 Gradio 演示 Space,以及一篇 arXiv 预印本——NV-Reason-CT:用于 CT 分析的 3D 视觉语言模型——该预印本于 2026 年 9 月 23 日由来自 NVIDIA 的十六人作者团队提交,合著者来自 NIH 和苏黎世大学。

这是一个真实存在的模式,值得被精确命名,而不是被当作谜团来对待。NVIDIA 的医学影像团队会低调地发布权重,让论文和代码仓库来完成宣告。前代模型 NV-Reason-CXR-3B 也以同样的方式在 2025 年 10 月发布。这里的区别在于规模:这是该团队首次将这套方法从二维 X 光片扩展到原生三维体数据,而且论文才发布两天。

从该仓库中可以得知的是:架构、许可协议、训练数据、基准测试表。尚未确认的是:NVIDIA 是否打算将其作为受支持的产品线、是否会有更多检查点跟进,以及它在作者以外任何人评估下的表现如何。该仓库版本为 0.1,并自述仅用于研究和教育。

每个模型实际接受的内容

这就是正面较量很快见真章的地方。这两个模型并不共用同一个输入面。

NV-Reason-CT 读取 NIfTI 体数据——.nii或 .nii.gz——其体素强度以亨斯菲尔德单位(Hounsfield units)表示。它会利用肺部亨斯菲尔德单位和三维形态学启发式方法,自动裁剪至胸部或腹部,重采样为 2 毫米各向同性分辨率,并且只接受 "chest"或 "abdomen" 作为解剖部位取值。它输出文本:结构化报告、答案或逐步推理轨迹,并配有开关,可在需要简短答案时关闭推理。

GPT-5.6 Sol 可读取文本、图像和文件,上下文窗口为 1,050,000 个 token,单次响应最多可输出 128,000 个 token。它没有体数据编码器。把一张 CT 喂给它,你必须先决定如何把三百多张切片压平成 2D 图像编码器能接受的东西——一张拼接图、几张关键切片,还是一幅渲染出的最大强度投影。这些选择中的每一个,都会丢弃 3D 路径当初就是为了保留的空间关系。

所以,诚实的表述不是“哪个模型更聪明”。而是 Sol 的图像通路和 NV-Reason-CT 的 3D 通路在回答不同的问题。Sol 能基于放射科医生对扫描的描述进行推理。NV-Reason-CT 能对扫描本身进行推理。

存在一个基准,而其中只有一个上面带有数字

NV-Reason-CT 在 CT-RATE 的 18 标签分类任务上报告了 Macro-F1 0.614 和 Macro-AUROC 0.871,使用直接的 Yes/No 提示,不使用分类头,也不进行任务特定适配。这些是作者在模型卡中给出的自己的数字,而对比那一行才是有用的部分:VoxelFM 为 0.581 Macro-F1,Pillar-0 为 0.544,ClinFusion-8B 为 0.442,CT-CLIP 为 0.398,Merlin 为 0.358,MedGemma 1.5 为 0.303。在相同的固定统一阈值下,一个生成式 3D 模型击败了 3D 对比预训练基线和基于切片的前沿模型。

那张表中的一个数字值得质疑,而不是照搬:AUROC 差距。NV-Reason-CT 报告为 0.871,而 VoxelFM 为 0.870。在厂商自行开展的评估中,千分之一个点算不上胜利——它只是评估本身所带噪声范围内的平局。0.033 的 Macro-F1 差距才是有依据的论断。

GPT-5.6 Sol 没有 CT-RATE 数值,因为 CT-RATE 并不是它能够运行的基准测试。它的 Artificial Analysis Intelligence Index 为 47,由 AA 测得的 GPQA Diamond 分数为 94.1,Humanity's Last Exam 分数为 49.5——这些都是通用推理测评工具。把 0.614 的 Macro-F1 与 AA Index 上的 47 并列,就像用两把不同的尺子做算术。我不会这么做,而且任何这么做的人,你都应该怀疑。

推理轨迹,两个不同的产品

两个模型都会输出推理。这是二者唯一真正的哲学交集,而其间的差异颇具启发性。

GPT-5.6 Sol 提供可配置的推理强度,因此你可以在每次请求中用延迟和成本换取推理深度,还可以通过 include_reasoning 取回推理过程。这是一项通用能力,适用于你发送的任何内容。

NV-Reason-CT 的推理之所以狭窄,是刻意为之。训练语料大约包含 550,000 个结构化 QA 示例,取自 70,111 个独特的 CT 体积,其中一部分是由放射科医生撰写的推理,采集自录制并转写的专家解读。SFT 之后的 GRPO 阶段,针对胸部与腹部异常集使用可验证奖励——这意味着奖励信号依据的是所陈述的发现是否确实存在于该体积中,而不是行文是否流畅。模型卡将输出描述为“可复核的观察、鉴别诊断与不确定性”,并明确警示:生成的推理“并不保证代表模型的内部计算”。这条告诫并非虚设。它区分开的是:一条可以对照数据核查的轨迹,与一条只能令人欣赏的轨迹。

大小和许可证,一次搞定

• 参数 — NV-Reason-CT 总计 4.69B / CT 通路中激活 4.35B,基于 Qwen3.5-4B 主干加上一个 Primus 3D ViT,对比 GPT-5.6 Sol 未披露 • 检查点大小 — NV-Reason-CT 约 10.6 GB BF16 safetensors,可在 Ampere/Hopper/Lovelace 上运行,对比 GPT-5.6 Sol 仅 API • 输入 — 以 Hounsfield 单位表示的 3D NIfTI CT 体数据,对比文本、图像、文件 • 上下文 — NV-Reason-CT 不适用,一个体数据就是一个固定的 13,824 token 前缀,对比 Sol 输入 1,050,000 tokens、输出 128,000 • 许可 — OpenMDW-1.1,权重可下载,对比专有、仅 API 访问 • 可用性 — 供应商仓库及其自有权重,对比 在 OrcaRouter 上路由,每百万 $4.00 / $20.00,而 Sol 的费率在输入超过 272K tokens 时翻倍至 $8.00 / $30.00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

这次拆分实际上让你付出了什么代价?

只有当你承认这些工作负载并不相同之后,成本对比才有意义,所以下面这个版本才是真正说得通的。

Sol 按 token 计费,其价格存在断崖式分档:提示最多 272K token 时,每百万输入 $4.00、每百万输出 $20.00;超过后则为 $8.00 和 $30.00。在 OrcaRouter 上,它按 OpenAI 自身的标价提供,零加价,这一点比听起来更重要——你看到的费率就是 OpenAI 公布的费率,因此任何价格变动都会当天反映到你的账单上,而不是等到下一次合同续签。其缓存读取费率为每百万 $0.40,是输入价格的十分之一,正是这一点让带有大量固定前缀的长智能体循环在算术上变得可行。

NV-Reason-CT 完全没有按 token 计价的价格。你要下载 10.6 GB,然后为 GPU 付费。这是一个资本支出与运营支出对比的问题,而它只有一个答案:在足够高的使用量下,自行托管一个 4.35B 活跃参数的模型在成本上胜出。低于这个使用量就不行,而盈亏平衡点完全取决于你的 GPU 利用率。目前 NVIDIA 之外还没有人公布过这个检查点的吞吐量数据,所以任何向你报出盈亏平衡点的人都是在猜。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

路由器在这里能帮上忙的,是工作流中不属于扫描的那一部分。生产级的临床研究流水线很少只靠一个模型——它包含抽取、一个推理步骤、一个摘要步骤,有时还需要一份第二意见。OrcaRouter 在一个兼容 OpenAI 的端点背后提供 200 多个模型,并支持跨供应商的自动故障转移,因此这条流水线中通用性的那一半可以被替换或重新路由,而无需再签一份合同。NV-Reason-CT 并不是我们所路由的模型之一;它是你自己运行的检查点。这条流水线的两半仍然可以共用同一个密钥。

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

悬而未决的问题

NV-Reason-CT 作为论文问世才两天,作为代码仓库则已有十七天,而它所属的领域足够小,因此下一个数据点就会很有信息量。请留意三件事:一项独立的 CT-RATE 复现、该系列中的第二个检查点,以及任何表明 NVIDIA 医疗团队将其视为一条产品线而非一篇论文的迹象。在此之前,可站得住脚的立场既狭窄又明确——以作者自己的表格为评判依据,这是目前可下载的最强原生 3D CT 推理检查点,而且除了阅读 CT 之外,它在任何方面都不能替代通用前沿模型。