一张生成的 hero 卡片,标题为“NV-Reason-CT vs Grok 4.6”,副标题为“谁读扫描,谁读报告”。底部沿边排列着三个标签:“一个 CT 容积 vs 500,000 个 token”、“0.871 vs 0.870 是平局”,以及“Grok 4.6:$2.00 / $6.00 每 M”。OrcaRouter 徽标合成在右下角。
Guides & Insights

NV-Reason-CT vs Grok 4.6:谁读扫描影像,谁读报告

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

将 AI 接入 CT 流程有两种方式,而其中只有一种与图像本身有关。 NV-Reason-CT是第一种:一个 4.69B 参数的 3D 视觉语言模型,可直接读取 NIfTI 体数据,并于 2026 年 9 月 8 日发布到 Hugging Face,而 NVIDIA 并未发布任何上线公告。 Grok 4.6是第二种:一个 500,000 token 的文本与图像模型,于 2026 年 8 月 12 日推出,每百万输入 token 收费 $2.00,并且非常擅长任务中“有人已经写下发现之后”才发生的那部分工作。把它们放在一起比较,那个常见的问题——哪个更好——结果却是个不成立的问法。它们争夺的并不是流程中的同一个位置。它们争夺的是同一个预算条目。

各方实际交付了什么

NV-Reason-CT 是以仓库、论文和演示 Space 的形式出现的,而非作为产品。NVIDIA-Medtech 下的 GitHub 仓库创建于 2026 年 9 月 2 日;Hugging Face 上的权重于 9 月 8 日紧随其后发布;arXiv 预印本,NV-Reason-CT:用于 CT 分析的 3D 视觉语言模型,于 9 月 23 日发布,共有来自 NVIDIA、NIH 和苏黎世大学的十六位作者。NVIDIA 的新闻编辑室对此只字未提。模型卡描述的是 0.1 版,并将用途限制于研究和教育。

Grok 4.6 则是另一类发布。它是一流的商业端点,在厂商的开发者文档中被列为“Latest”,依据公开的价目表定价,并可作为 OpenAI 兼容模型使用,现有集成只需更改基础 URL 即可接入。它接替 Grok 4.5,拥有相同的上下文窗口、相同的输入接口面和相同的基础定价。

这种不对称正是这一对比的全部关键。一个是碰巧可以下载的研究产物。另一个是基础设施。将二者相互对照来读,就能看出在医学影像领域,“研究产物”与“基础设施”之间的界线目前落在哪里——而它并不在你以为的地方。

投入与产出方面的分工

• 体积输入 — NV-Reason-CT 读取以亨斯菲尔德单位表示的 .nii/.nii.gz NIfTI 体积,仅限胸部或腹部,而 Grok 4.6 读取文本、图像和文件,无体积处理路径 • 空间处理 — NV-Reason-CT 将 384×384×384 毫米的体积转换为 24×24×24 的网格、共 13,824 个 token,并采用 3D MRoPE,无下采样,而 Grok 4.6 将图像视为二维图片 • 上下文 — NV-Reason-CT 一个体积就是一个固定前缀,没有通常意义上的上下文窗口,而 Grok 4.6 为 500,000 个 token • 输出 — NV-Reason-CT 结构化报告、答案或可禁用思考的推理轨迹,而 Grok 4.6 为文本,支持结构化输出和工具调用 • 许可 — NV-Reason-CT OpenMDW-1.1,10.6 GB BF16 权重,而 Grok 4.6 为专有,仅 API • 价格 — NV-Reason-CT 为 GPU 资本支出,无按 token 计费,而 Grok 4.6 为每百万 $2.00 / $6.00,输入超过 200K 时翻倍

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

这两者读起来像一次自然的分工交接。NV-Reason-CT 从影像中得出发现;Grok 4.6 则是你会把上千条这样的发现一次性放进同一个上下文窗口、交给它去寻找整个队列中规律的那个模型。还没有人公开过这条流水线。这是显而易见的架构,而且值得直说:它尚未经过验证。

Grok 4.6 的数字,以及它们是谁的

关于 Grok 4.6 的两个数字一起流传,但它们并非同一类东西。94.9 的 GPQA Diamond 分数由 Artificial Analysis 测得,而非由厂商报告——这恰恰因为是由第三方运行,所以在这两类中更可信。在指数修订版 v4.3.2 上,Artificial Analysis Intelligence Index 分数为 44,使 Grok 4.6 在其类别中 211 个模型里位列第 28。Artificial Analysis 还记录该模型为专有:权重不公开可用。

在同一榜单上,AA 测得 Terminal-Bench 2.1 为 88.4,SciCode 为 56.5,Humanity's Last Exam 为 42.9,𝜏²-banking 为 50.7,长上下文召回为 80.3。这些都是通用推理测评工具。它们没有一个能跑在 3D CT 体数据上——这并不是在贬低 Grok 4.6,而是在说明这套基准测试套件衡量的是什么。

CT 侧恰好只有一张表,而且它是作者的

NV-Reason-CT 的整个公开证据基础,就是 CT-RATE 18 个标签上的一张分类表,采用固定统一阈值,使用直接 Yes/No 提示,且没有分类头。它报告 Macro-F1 为 0.614、Macro-AUROC 为 0.871,而 VoxelFM 为 0.581/0.870,Pillar-0 为 0.544/0.861,ClinFusion-8B 为 0.442,CT-CLIP 为 0.398/0.733,Merlin 为 0.358/0.662,MedGemma 1.5 为 0.303。

这些是厂商报告的,来自模型卡,我之所以这样标注,是因为尚无独立第三方复现它们。表中有两点值得注意。相对 VoxelFM 的 F1 优势为 0.033,在固定阈值下的 18 个标签上,这是一个真实的差距。相对同一模型的 AUROC 优势为 0.001,这相当于平局。这两个数字出现在同一张表的同一行中,而只有其中一个承载着主张。

表格还告诉你有关论文自身框架设定的另一件事。对比模型是3D对比预训练系统、一个融合2D/3D的生成式MLLM,以及一个基于切片的尖端模型。作者选择以摄入体数据的系统作为基准,因为这里唯一有意义的论断是:生成式3D模型能够在无需分类头的情况下,在分类任务上击败判别式3D模型。这完全没有说明NV-Reason-CT在任何方面与通用尖端模型相比如何,因为这一比较在这个维度上并不存在。

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

资金流向何处,以及为什么层级边界很重要

Grok 4.6 的价目表里有一个细节,它悄无声息地决定了许多架构选择:输入 token 超过 200K 的提示按基础费率的两倍计费——输入 $4.00,输出 $12.00,缓存读取费率则从 $0.50 涨到 $1.00。一个在单一长上下文中累积发现的群组审查任务,正是会越过这条线的那类工作负载。在这条线以下,每百万 $0.50 的缓存读取费率仅为输入价格的四分之一,正是这一点,让把一大段固定前缀在数千份报告上循环复用变得负担得起,而不仅仅是理论上可行。

通过 OrcaRouter,Grok 4.6 按该提供商的原价提供,零加价,因此上面的阶梯算价就是你实际支付的算价,而且未来对它的任何调整都会当天反映到你的账单上,而不是等到下一次续费。之所以要对这类任务做路由,而不是硬编码某一个端点,是因为临床流水线中的队列复核环节,正是你会想先试三种不同模型再做决定的地方——而在一个兼容 OpenAI 的密钥上,借助跨提供商自动故障转移,这个实验的成本不过是改一下模型名称。

流水线的 CT 那一半没有这样的选项。NV-Reason-CT 并没有托管在 OrcaRouter 上——它是一个 10.6 GB 的检查点,带有自定义模型代码,需要你自己在 Ampere、Hopper 或 Lovelace 芯片上运行,并设置 trust_remote_code=True。我们不会暗示并非如此。如果你在搭建这条流水线,你就是在为其中一半购置 GPU,为另一半购买 token,而两半至少都能从同一个控制台进行管理——这是唯一值得拿出手的集成说法。

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

第二位读者究竟价值几何

NV-Reason-CT 论文包含一项初步的专家放射科医师研究,报告称“对人工智能辅助阅片的信心评分良好”,且平均报告的判读与报告时间缩短了 50%。这些数字很亮眼,但它们附带一个论文本身已说明的限定条件:属于初步研究,且研究设计出自作者本人。目前尚无已发表的独立重复验证,而在受控阅片研究中,50% 的时间缩短恰恰是那种在重复验证中会缩水的结果。它值得持续关注,但不值得当作已确立的结论来引用。

对照这一点来看,Grok 4.6 对放射学工作流程的贡献根本不是诊断。它是读取报告的那一层——分诊队列、随访信、编码、事先授权资料包。那项工作是文本,量大,单位成本低,而且出错的失败模式是行政性的,而非临床性的。这也正是 500K 上下文窗口和 0.50 美元缓存读取真正体现价值的地方。

所以这个对比得出的分野很直接:NV-Reason-CT 有一条真正的三维通路,却没有分发渠道、没有定价,也没有独立验证。Grok 4.6 有分发渠道、有定价、有独立的基准测试覆盖,却完全没有体成像通路。如果你需要把扫描结果读出来,这两者中只有一个能做到。如果你需要把围绕扫描的那套文书流程处理妥当,只有另一个才算得上是产品。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新