
Nemotron-3-Labs-Ultra-Math-RL:NVIDIA 悄然开源其 IMO 2026 参赛方案背后的强化学习检查点
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
英伟达发布的Nemotron-3-Labs-Ultra-Math-RL于2026年9月2日至3日出现在Hugging Face上——没有博客文章、没有X上的公告,也没有新闻稿。模型卡只是那样出现,日期标注为9月3日,并用一句话说明了自己:它是强化学习检查点,在NVIDIA随附的技术报告中被称为“Nemotron-3-Ultra-RL”,并且“作为集成系统的一部分被部署,该系统在2026年国际数学奥林匹克竞赛中取得了金牌水平的得分”。该系统的官方得分——42分中的30分,高于29分的金牌门槛——早在7月底就被广泛报道,当时基础模型的权重自6月起就已公开。而当时无法下载的,是那次竞赛实际使用的那两个后训练专家模型。如今,其中一个正静静地待在一个公开的Hugging Face仓库里,零点赞,下载量也几乎为零。
这次发布很低调,因此有必要精确界定哪些是已知的、哪些是未知的。从代码库和报告中可以确定的是:该检查点的架构、训练方案、它在 IMO 2026 提交中所扮演的角色,以及 NVIDIA 同步发布的数据集和基准测试。目前尚未确认的是:任何供应商公告、任何独立第三方对该检查点的基准测试,以及任何托管 API——这是一次依据 OpenMDW-1.1 许可进行的自托管权重发布,运行它意味着需要部署约 1.5 TB 的 Blackwell 级 HBM。
本周实际上发布了什么
仓库nvidia/Nemotron-3-Labs-Ultra-Math-RL于2026年9月2日(19:11 UTC)在Hugging Face上创建,并于9月8日最后修改。它是归集在nvidia/nemotron-labs-imo-2026下的协调发布中的一项,其中包含:
• 两个后训练的竞赛检查点——Nemotron-3-Labs-Ultra-Math-RL(本主题)及其监督微调的同类模型Nemotron-3-Labs-Ultra-Math-SFT,均属于 OpenMDW-1.1。
• 它们背后的两个训练语料库——Nemotron-Math-Proofs-v3-SFT 和 Nemotron-Math-Proofs-v3-RL,均为 CC-BY-4.0。
• Nemotron-IMO-Bench,一个包含200道未公开的奥林匹克级问题(50道代数、50道组合、50道几何、50道数论)的新评估基准,每道题都配有人工精选的参考证明,由数学家Titu Andreescu参与创建,专门确保这些问题不会出现在任何训练集中。
• 它们全部都是从基础检查点 NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 微调而来的。
该集合描述指向将其串联在一起的技术报告:《An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics》(NVIDIA NeMo-Skills 仓库中的该 PDF 标注日期为 2026 年 9 月 8 日)。除检查点之外,NVIDIA 还发布了推理流水线、已提交的证明、RL 训练配方,以及此次竞赛运行的完整计算量核算。其定位明确就是“可复现科学”——这是 NVIDIA 在说:重建该系统所需的一切,都在这里。
Nemotron-3-Labs-Ultra-Math-RL是什么
从架构上看,这并不是一个新的基础模型,而是对公开可用版本NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16的微调——这是 NVIDIA 于 2026 年 6 月 4 日首次发布的 Mamba2–Transformer 混合潜在专家混合(Latent Mixture-of-Experts)检查点。Math-RL 检查点保持了同样的架构与规模:总参数 550B、激活参数 55B、多 token 预测,并支持最高 1M token 的上下文窗口。RL 训练改变的是专精方向,而且是刻意收窄的专精方向:
• 目的 — 解决困难的竞赛数学问题 并充当证明评判者:该模型经过训练,可生成严谨的解答,依据 0 / 0.5 / 1 评分标准进行自我评估,并找出证明中的错误。
• 它不是一个通用聊天机器人——该卡片和报告描述的是证明搜索流水线中的专业工作者,而非遵循指令的助手。
• 许可证 — OpenMDW-1.1,NVIDIA 的宽松开源模型许可证,允许商业和非商业使用,与基础模型及早期 Nemotron Labs 教师版发布相同。
• 部署 — 没有托管的列表价格;你下载 safetensors 并自行托管。NVIDIA 的参考配置是单节点 8× B200(约 1.5 TB 聚合 HBM),并提供跨 H100/H200/GB200/GB300 的多节点选项。vLLM 是推荐的运行时,卡片中特别指出了推理解析器、Qwen3-Coder 工具调用解析器、Mamba SSM 缓存设置,以及 5 个 token 上的 MTP 投机解码。

这个检查点为何重要:它位于 IMO 2026 系统内部
IMO 2026 的成绩是人们关注该模型的原因,所以真正关键的区别是:30/42 是系统得分,而非单一模型的得分。NVIDIA 提交的是一个两阶段、多检查点的流水线,Nemotron-3-Labs-Ultra-Math-RL 在其中只是承担两项任务的组件。
根据报告,第一阶段对每个问题进行了最多八轮的迭代式生成–验证–精炼搜索。第一轮采样了384个证明尝试——来自三个检查点(通用可用模型、SFT专家模型和RL专家模型)各自对应的八种不同解题策略提示,每种提示16个。搜索时使用RL和SFT检查点作为双模型专家组进行验证:每个模型提供八次独立判断,只有当全部16次判断都评分为1时,该证明才被接受。随后一个高计算量阶段使用所有三个检查点对每个入围者重新评分(每个检查点按0–7分制给出16次IMO风格判断),并为每个问题选出唯一提交。
官方结果(如论文中所报告,与七月下旬的报道一致)是:在IMO 2026试卷42分中取得30分,高于29分的金牌分数线;其中第1、2、4、5题获得满分,第3题和第6题各得1分,由IMO官方评分员评定。NVIDIA自身的资源核算显示,全部六个已提交的证明是在约7.07亿个生成token和1,464个GB200 GPU小时内找到的;将进行中的轮次完成后,整个运行总计约23.1亿个token和4,800个GB200 GPU小时。
报告中的两个内部数字足以说明该RL检查点为何能在集成模型中赢得一席之地。在NVIDIA的30题开发集上,由GPT-5.5、Gemini 3.1 Pro和Claude Opus 4.8组成的独立评审团按照MathArena式流程进行评分,RL专家模型是端到端表现最佳的单检查点流水线(在210个评审团评分点中获得180分,而SFT专家模型为165分,基础模型为162分),尽管SFT检查点在第一轮解决了更多问题。而在一个含300条证明的审计集上,已部署的RL+SFT验证小组将误接受率——即搜索在无效证明上终止的失败情形——降至约1.1%;相比之下,仅由RL检查点独立评判时为12.4%,基础模型则为31.6%。该报告的要点在于:在全体一致规则下,这两个选择性专家模型能相互发现对方的错误。
这些是NVIDIA在自家开发集上开展的消融实验,并报告于NVIDIA的论文中——应视为厂商自述的证据,说明该设计为何有效,而非独立的评分结果。该开发集本身只有30道题,且目前尚无外部实验室运行过这一检查点。
RL 配方简述
训练数据和方法完全开源,这对任何从事数学推理强化学习研究的人来说才是真正的新闻。以下是报告中的要点:
• 数据——问题取自 Nemotron-Math-Proofs-v1 的 AoPS 子集,并筛选出基础 Ultra 模型在四次尝试中能解决一到三次的问题(由 DeepSeek-V3.2-Speciale 判定)——即困难但可驾驭的课程问题。该筛选产生 9,597 个证明生成提示,发布为 Nemotron-Math-Proofs-v3-RL。
• 奖励 — 沿用 DeepSeekMath-V2 的设计,但移除了自我分析奖励项;训练期间的评判信号来自证明评判服务。
• 算法——一种基于 NeMo-RL 构建的异步 RL,思路与 PipelineRL 类似:固定一个提示词池以保持持续处理;当批次填满时,将完成的序列送入训练器;采用截断重要性采样;并在熵升高时,对正样本中的低概率 token 进行掩码。该配置使用了 131,072 token 的上下文,约 128 个训练节点、128 个推理节点,以及 16 个裁判节点,每个节点配备 4× GB200。
作为对比,同系列的SFT检查点是在相同基础模型上,基于经质量筛选的语料库进行的长上下文监督微调,该语料库包含414,890条覆盖15,818个问题的证明、细化、验证与元验证轨迹,并在512块GB200 GPU上运行。

尚不清楚的内容
在这里,诚实的消息来源是一把双刃剑,而决定是否关心此次发布的读者应当记住四个注意事项:
• 没有公告。截至撰写本文时,NVIDIA 尚未正式宣布该合集,但它已出现在 Hugging Face 上。技术报告 PDF 的日期为 9 月 8 日,因此书面配方实际上也于本周发布。
• 没有独立的基准测试。与此检查点相关的每项性能数据——开发集消融实验、验证器审计、IMO 2026 系统得分——均来自 NVIDIA 自己的报告。IMO 得分本身是这些数据中来源最可靠的,因为它是在官方竞赛条件下评分的,但这是系统级结果,而该检查点对其的贡献尚未有外部实验室复现。
• 无托管 API,无官方定价。这是一个自托管版本。任何想要调用它的人都需要相应硬件。七月关于“NVIDIA Nemotron 3 Ultra 在 IMO 2026 夺得金牌”的报道很容易被误读为“下载它即可解决奥赛题”——但更诚实的说法是“下载的是完成解题的那个系统的组件”。
• “金牌”的提法。NVIDIA自己的措辞是“达到金牌门槛”,而论文则谨慎地指出,该模型只是集成(ensemble)的一部分。任何声称仅凭这一个检查点(checkpoint)本身就已达到“金牌水平”的说法,都应视为缺乏依据。
适用对象
本次发布针对的是特定读者:从事数学推理、证明生成或基于可验证奖励的强化学习(RL)研究的实验室或研究人员。他们希望获得一个参考实现——该系统不借助形式化证明器、不使用工具、不联网,仅凭自然语言就达到了奥赛金牌门槛。对这类读者而言,价值在于整套方案:模型权重、SFT 与 RL 语料库、NeMo-Gym 格式的提示词、推理流水线、提交的证明,以及一份说明一次真实竞赛运行实际需要多少 GPU 小时的算力核算。
对其他人来说,实际建议是,奥林匹克级别的证明搜索对于大多数真实数学工作负载来说属于杀鸡用牛刀。AIME和竞赛级别的问题,以及基本上所有代码中的应用数学工作,远 smaller models 就能轻松处理——这一点很重要,因为 550B checkpoint 不是你能为批处理任务随便启动的东西。较小的开源数学模型和前沿 API 模型可以通过 OrcaRouter 上的单一 API 以提供商的列表价格访问(我们这边不加价,因此供应商降价当天即生效),如果你想在不用生产路径押注的情况下尝试一个未经验证的模型,还有自动故障转移功能。从那里开始;只有当工作负载真正需要前沿规模的证明搜索时,才去自行托管一个 550B模型。
值得关注的开放问题是:这次悄无声息的发布是否会得到官方公告和正式发布说明,以及是否有NVIDIA以外的人端到端运行该方案并报告独立的IMO-Bench分数。该基准测试——200道全新的、未公开的奥赛题——可以说是整个合集中最有价值的产物:它正是该领域一直缺失的那种抗污染评估。如果该方案能够复现,本周在Hugging Face上的悄然上传将成为今年最具影响力的开源模型发布之一。即便无法复现,这份合集仍然是对一次前沿规模的“生成—验证—精炼”运行实际所需条件的详尽而诚实的记录。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
