
NV-Reason-CT 对比 Kimi K3:210 次下载与 5.88 亿 Token
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 45 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
其中一个模型已从 Hugging Face 被下载了 210 次。另一个则在过去七天里通过我们自己的 playground 处理了 5.88 亿个 token。两者都是开放权重,两者现在都可下载,而这两个数字之间的差距正是这次对比中最有价值的部分。NV-Reason-CT是 NVIDIA 的 46.9 亿参数三维视觉语言模型,用于胸部与腹部 CT,于 2026 年 9 月 8 日发布到 Hugging Face,没有任何公告。Kimi K3是 MoonshotAI 的 1,048,576 token 旗舰模型,于 2026 年 7 月 15 日上线,如今是我们网络上最繁忙的模型之一。就对采购表单而言重要的那层意义来说,它们都是“开放”的。但它们开放的方式完全不是一回事。
“你可以下载它”的两种含义
先从每次下载实际在你磁盘上留下了什么说起,因为大多数开放权重的比较恰恰在这一点上变得含糊。
NV-Reason-CT 为你提供 model.safetensors,约 10.6 GB(BF16),外加一个 model.py和一个内容可观的 processor.py——26 KB 的自定义处理代码,实现了解剖感知裁剪、2 毫米重采样和 3D 分块。你通过 trust_remote_code=True加载它,这意味着你正在自己的进程中执行 NVIDIA 的仓库代码。推理需要 CUDA PyTorch,而模型卡列出了 Ampere、Hopper 和 Lovelace,并已在 H100 和 L40S 上测试。输入一次为一个 NIfTI 卷。仓库中未发布批处理方案,没有吞吐量数据,也没有服务配置,除了一个 inference.py 示例。
Kimi K3 为你提供通用推理模型,拥有 1,048,576 token 的上下文窗口,支持文本与图像输入、原生工具调用、结构化输出以及可配置的推理强度。当你需要一次请求就读完上百份临床指南,或一个部门十年的报告时,它就是你会选择的模型。其 Artificial Analysis 长上下文召回得分为 88.7——在本系列模型中最高,比 Grok 4.6 的 80.3 高出整整 8.4 分。
说白了,{{1}}NV-Reason-CT{{/1}}是一个专门化的检查点,输入面窄,还带有你必须信任并维护的自定义代码。{{2}}Kimi K3{{/2}}是一个通用模型,输入面广,表现得像基础设施。两者都可下载。但只有一个是开箱即用的。
CT 证据,完整呈现,而且它很短
关于 NV-Reason-CT 质量的一切公开已知信息,都只依赖于其自身模型卡中的一张表:CT-RATE 的 18 标签分类任务,固定统一阈值,直接 Yes/No 提示,无分类头,无任务特定适配。Macro-F1 0.614,Macro-AUROC 0.871。
对比行包括 VoxelFM 为 0.581/0.870,Pillar-0 为 0.544/0.861,ClinFusion-8B 为 0.442,CT-CLIP 为 0.398/0.733,Merlin 为 0.358/0.662,以及 MedGemma 1.5 为 0.303。其中每一个都是来自 NVIDIA 模型卡的厂商报告数字,且尚未有任何一个被独立复现——这篇论文才发表两天。
这张表所确立的内容有限,值得准确说明:一个没有任务专用头的生成式 3D 模型,在 18 标签 CT 分类上胜过 3D 对比预训练基线以及一个基于切片的前沿模型。它没有确立的是任何关于通用推理的内容,任何关于胸部与腹部 CT 之外其他模态的内容,以及任何关于 AUROC 优势的内容——0.871 对 0.870,不过是一个戴着小数点的平局。
Kimi K3 的成绩,以及开放权重榜单的注意事项
Artificial Analysis 测得 Kimi K3 的 Intelligence Index 为 43.6,在我们模型 API 的排行榜快照中,这使其在该榜单的 145 个模型中位列第 19。其 GPQA Diamond 得分为 93.5,Humanity's Last Exam 为 46.9,SciCode 为 59.5,Terminal-Bench 2.1 为 85.0,AA Coding 为 76.2,排名第 9,𝜏²-banking 为 46.0。
有一项排名说法需要谨慎对待,因为它很容易被弄错,而且以前就曾被弄错。Kimi K3 的 AA Intelligence Index 为 44,在开放权重榜单的开放权重模型中位列第三,落后于 46 的 MiMo-V2.6-Pro 和 45 的 GLM-5.3。它并非该榜单的领先者,也不与 Grok 4.6 在同一榜单上竞争——Artificial Analysis 将 Grok 4.6 记录为专有模型,因此其 44 属于通用排名,而非开放权重排名。这两个指数看起来一模一样,实则并非如此。
操作员实际看到的内容
这就是 5.88 亿这个数字的由来,值得详细说明,因为它是本文中唯一一项属于我们、而非任何人的营销宣传的证据。
过去七天里,Kimi K3 通过 OrcaRouter 的 playground 处理了 5.878 亿个 token。它的首 token 时间中位数为 7.8 秒,每秒生成 42.9 个输出 token,而该时间窗口内的错误率为 0.21%——大约每 480 次请求出现一次失败。这个实测错误率是模型卡上无法获得的信息,也是决定一个模型能否安全用于批处理作业背后的数字。
对于 NV-Reason-CT,没有对应的等价指标,因为它并非任何地方的托管端点——它是你自己运行的检查点。没有 p50,没有错误率,没有正常运行时间,也没有可故障转移到的对象。这并不是贬低;这是自托管的结构性事实,也正是研究团队能在某个周二就采用 NV-Reason-CT,而生产团队通常做不到的原因。
如果你同时运行这套方案的两半 —— Kimi K3 作为托管的通用层、NV-Reason-CT 跑在你自己 的 GPU 机器上 —— 那么路由这一侧正是托管的那一半获得韧性的地方。 Kimi K3 按 Moonshot 自身的标价计费,每百万输入 token 3.00 美元、每百万输出 token 15.00 美元,零加价;其每百万 0.30 美元的缓存读取价格仅为输入价的十分之一;而且由于价格是原样透传的,供应商一旦降价,你的账单当天就能体现。 跨供应商的自动故障转移正是当某个上游端点出现抖动时让批处理任务继续存活的关键 —— 而在 0.21% 的错误率下,抖动足够罕见,以至于人们很容易把它忘在脑后,直到它不再罕见。
成本形态彼此不相似
• 价格 — NV-Reason-CT GPU 资本支出加上你自己的推理服务栈,对比 Kimi K3 每百万 $3.00 / $15.00,缓存读取 $0.30
• 最低可行支出 — NV-Reason-CT 需持有一块 Ampere 或更新架构的 GPU 且无限期保留,而 Kimi K3 仅需一次请求
• 上下文 — NV-Reason-CT 单卷,固定 13,824 个 token,而 Kimi K3 为 1,048,576 个 token
• 第一千次请求的边际成本——一旦GPU的成本已收回,NV-Reason-CT实际上为零,而Kimi K3则随词元数线性增长
• 它最先在哪里出问题——NV-Reason-CT 未经证实的吞吐量且没有批处理方案,对比 Kimi K3 在每次请求 1M token 时的长上下文成本
• 模态 — NV-Reason-CT 3D NIfTI、胸部或腹部,对比 Kimi K3 的文本和图像,任意内容

经济学逻辑会因规模而反转。Kimi K3 启动成本为零,并呈线性扩展。NV-Reason-CT 启动需要一块 GPU,之后几乎平摊成本——这正是为什么 210 次下载并不是一个失败信号。对于一个受众是那些已经拥有硬件的机构、而且这些机构根本不会出现在 token 吞吐量统计中的检查点来说,这才是一个正确的数字。

你实际上选择的是哪一个?
如果任务是读取 CT 体数据,并生成带有推理轨迹的结构化发现,那么 Kimi K3 做不到,而 NV-Reason-CT 能做到。不是“它做得更差”——而是根本做不到,因为它内部任何地方都没有体数据编码器,而先把扫描展平成图像,就会丢弃 3D 通路本应保留的空间关系。
如果任务是阅读400页转诊记录,将其与一份方案文档进行比对,并输出结构化结果,那么 NV-Reason-CT 根本不在考虑之列,而 Kimi K3 是现有较好的选择之一,在我们网络上的实测错误率低于四分之一个百分点。

真正的抉择并不在这两者之间。而在于你的问题是数据量问题还是文本问题,2.1亿对5.88亿的差距,不过是这种区分从外部看起来的样子。一个模型是一篇附带权重的论文。另一个是一套基础设施。两者都值得拥有;彼此不可替代。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
