
NV-Reason-CT vs Nemotron 3 Ultra:同一个 Logo,两种发布理念
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 45 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 182 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
英伟达今年发布了两款开放权重模型,其中一款却无人知晓。Nemotron 3 Ultra于 2026 年 6 月 4 日登陆 Hugging Face,是一款总参数 550B、激活参数 55B 的旗舰模型,还附带了技术报告、OpenMDW-1.1 许可制度,以及背后整套开放的预训练与后训练数据集发布。NV-Reason-CT则于 2026 年 9 月 8 日发布,是一款 4.69B 参数的 CT 专科模型,配有代码仓库、演示 Space,以及两周后出现的一篇 arXiv 预印本——该预印本在引用信息块中提到了这次发布。第二款模型没有任何公告。把二者放在一起比较,你比较的其实并不是能力——一个 550B 的通用旗舰与一个 4.69B 的医疗专科模型毫无交集。你比较的是两种截然不同的模型发布理念,二者出自同一家公司,相隔仅三个月。
每个仓库实际包含的内容
Nemotron 3 Ultra 的发布是一套完整的开放流水线。Hugging Face 上的 NVFP4 检查点已获得 249,746 次下载和 338 个点赞;其 BF16 版本、基础检查点以及后训练数据集也都一同发布。它支持十二种语言,仅处理文本,基于潜在混合专家 Mamba2-Transformer 混合架构并具备多 token 预测能力,采用 openmdw-1.1 许可证。Artificial Analysis 将其在发布的 NVFP4 精度下评为智能指数 47.7,在全精度下为 48.2——据该榜单,这是所有美国开放权重模型中最高的。我们此前对 Nemotron 教师模型的报道记录了供应商价格中位数约为每百万输入 token 0.60 美元、每百万输出 token 2.60 美元,以及 NVIDIA 在第三方测量中每秒 183 个输出 token 的吞吐量数据。
NV-Reason-CT 是一个小得多、也封闭得多的产物。10.6 GB 的 BF16 权重、一个 10 KB 的 model.py、一个 26 KB 的 processor.py、一个聊天模板,以及一个 inference.py。一个演示 Space。一篇论文。截至本周,下载量为 210 次。没有数据集发布。没有技术报告。除了单卷示例之外,没有任何服务配置。
这种对比不在于规模——而在于下游工程师能用该产物做什么。Ultra 的发布旨在让他人能够复现训练过程。NV-Reason-CT 的发布旨在让他人能够运行推理。这是两种不同的承诺。
其中只有一个建立在 NVIDIA 自己的技术栈上
这里有一个令人惊讶的细节,而且它可以从模型卡片的 frontmatter 中得到验证:NV-Reason-CT 的基础模型是Qwen/Qwen3.5-4B,两者之间是微调关系,而不是 Nemotron 检查点。NVIDIA 把一个 Primus 3D 视觉 Transformer——用 COLIPRI 权重初始化——嫁接到了一个 Qwen 语言模型上,并通过监督微调、随后是组相对策略优化(Group Relative Policy Optimization),对这一组合进行了端到端训练。
这不是批评,也不是丑闻。这是视觉-语言工作的行业惯例,NVIDIA 在仓库元数据中明确披露了这一点。但这确实意味着,关于这一组合最自然不过的假设——即 NV-Reason-CT 是 Nemotron 的衍生产品——是错误的。本页面上的两个模型共用一个标识和一个许可证家族,除此之外基本没有共同点。没有共享的架构,没有共享的分词器,没有共享的训练数据,没有共享的服务路径。
大小,以决定其运行位置的数字计
• 参数 — NV-Reason-CT 总计 4.69B / CT 路径中激活 4.35B,对比 Nemotron 3 Ultra 总计 550B / 激活 55B 的稀疏 LatentMoE • 磁盘上的检查点 — NV-Reason-CT 约 10.6 GB BF16,对比 Nemotron 3 Ultra 的 BF16 数百 GB,并额外以 NVFP4 发布 • 输入 — NV-Reason-CT 为以 Hounsfield 单位表示的 3D NIfTI CT 体积,仅胸部或腹部,一个 13,824 token 的体积前缀,对比 Nemotron 3 Ultra 的文本,最多 1M token 上下文,输出上限 65K • 上下文 — NV-Reason-CT 在通常意义上不适用,对比 Nemotron 3 Ultra 的 1,000,000 token • 许可证 — 两者均为 OpenMDW-1.1 • 硬件 — NV-Reason-CT 支持 Ampere / Hopper / Lovelace,已在 H100 和 L40S 上测试,对比 Nemotron 3 Ultra 以 55B 激活进行多 GPU 服务 • 独立评分 — NV-Reason-CT 未发布任何评分,对比 Nemotron 3 Ultra 的 AA Intelligence Index 47.7 NVFP4 / 48.2 全精度

实际的界限在于内存。一个带有3D编码器的4.69B模型能放在单张卡上,研究小组也能证明其合理性。一个总参数550B、激活参数55B的模型,即使量化后,也需要真正的服务基础设施。两者都不是周末实验,但它们在该问题上处于不同的数量级。
两种无法取平均的评估机制
Ultra 的证据是通用能力:Artificial Analysis 智能指数处于四十多的高位,基准测试覆盖推理、编程和智能体任务,以及厂商报告的该系列数据,包括 SWE-Bench Verified 71.9、MMLU-Pro 86.8 和 LiveCodeBench v6 89.0 —— 后三项为 NVIDIA 自家数据,并已如此标注。
NV-Reason-CT 的证据只有一张表。在 CT-RATE 的 18 标签分类任务上,采用固定统一阈值、直接的 Yes/No 提示、且没有分类头,宏 F1 为 0.614,宏 AUROC 为 0.871,对比 VoxelFM 的 0.581/0.870、Pillar-0 的 0.544/0.861、ClinFusion-8B 的 0.442、CT-CLIP 的 0.398/0.733、Merlin 的 0.358/0.662 以及 MedGemma 1.5 的 0.303。又是 NVIDIA 自己的数字,写在模型卡上,尚无独立复现。

AA 智能指数 47.7 和 CT-RATE Macro-F1 0.614 并不是对同一件事的两项测量,而是对两件事的测量。无论如何都无法站得住脚地说 Ultra 比 NV-Reason-CT“更好”,原因不在于评分偏好——而在于这两套测量工具根本不存在重叠。在这一配对中,唯一诚实的比较,是就每个模型究竟为何者而获得认证——也就是从字面意义上说,究竟存在哪些证据表明它能胜任其本职工作。
为什么静默发布才是理性之举
设想你是医学影像团队的一员。你有一个可用的三维CT模型。你希望放射科医生、医学生和研究人员都能用上它。一场主题演讲能给你带来什么?
一场发布会会抬高人们对支持、路线图和长期生命力的期待,而研究团队根本无法满足这些期待。它还会招来在基准测试上的通用评估,而在这些测试中,一个 4.69B 的锁定模态模型会因为结构上无关紧要的原因而显得平平无奇。而且它还会把一个明确标注"不得用作专业临床判断的替代品"的模型,推到根本不看许可条款的受众面前。而一个代码仓库、一篇论文和一个演示空间,恰好能触达会读完这三者的受众,并让成果物以自己的节奏发声。版本号是"0.1"。模型卡上写明仅供研究和教育使用。这是一种为被引用、而非为被购买而设计的发布。
Ultra 的发布则截然相反,但同样理性——旗舰产品需要分销渠道、价目表和生态支持,因此它附带了数据集和一份报告。
路由器适用于何处,以及不适用于何处
这两个模型都不在 OrcaRouter 上,我也不会说它们在上面:NV-Reason-CT 是一个 10.6 GB 的检查点,带有需要你自行托管的自定义模型代码,而激活参数为 55B 的 Nemotron 3 Ultra 则通过 NVIDIA 自家的 API 以及多个第三方平台提供服务。

对于一个同时使用这两类模型的团队来说,路由层所做的事情范围更窄,但依然有用。一条临床研究流水线,用 NV-Reason-CT 承担处理量、用通用模型处理周边文本,它需要一个地方来替换那个通用模型,而不必再签一份合同;而一个兼容 OpenAI 的端点,覆盖 200 多个模型,并具备跨提供商的自动故障转移,正是这样一个地方。它让自托管的专家模型和托管的通用模型共用一把密钥,而不是两套集成。
从搭配中能获得什么
如果把这两个模型当作竞争对手来解读,那是个范畴错误。如果把它们当作案例研究来解读,它们则异常清晰。同一家供应商,同一个许可证家族,同一年份——却选用了两种发布策略,以匹配两种截然不同的下游意图。一个是附带了生态系统的基础设施。另一个是附带了权重的论文,其发布是为了让某个特定的小受众群体能够运行它并引用它。
如果你在寻找一个通用的开放权重模型,NV-Reason-CT 并不是候选,也从来无意成为候选。如果你以编程方式读取胸部和腹部 CT 体数据,Nemotron 3 Ultra 帮不了你,也从来无意如此。它们之间唯一真正的重叠是那个标志,而唯一真正的教训是:当受众足够小众且足够技术化,以至于会自己找到这个仓库时,NVIDIA 愿意悄无声息地发布它。
