
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning:Nemotron 3 Ultra 背后的 550B 推理教师模型刚刚开放权重
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
2026年8月14日,NVIDIA在Hugging Face上发布了NVIDIA-Nemotron-Labs-Teacher-General-Reasoning——一个550B参数规模的推理模型,直到昨天,它还只存在于其旗舰产品Nemotron 3 Ultra的训练流程之中。它是NVIDIA用于训练550B-A55B Ultra学生模型的"多教师策略蒸馏"(Multi-Teacher On-Policy Distillation,MOPD)方案中的"通用推理"教师模型。此次发布意义重大,原因很简单:在NVIDIA今年6月发布的Nemotron 3 Ultra技术报告中,训练方案明确写明各个教师模型的检查点不会开源。而这一次开源了——包括权重、分词器、聊天模板和服务配置,并采用对商业友好的OpenMDW-1.1许可证。同日还发布了姊妹模型NVIDIA-Nemotron-Labs-Teacher-STEM,这看起来不像是偶然的一次性发布,而更像是教师模型阵容开始逐步公开。
教师模型实际上是什么
MOPD 是一种后训练技术,赋予 Nemotron 3 Ultra 智能体推理能力。NVIDIA 没有将单个大型教师模型蒸馏到学生模型中,而是训练了十多个领域专家教师模型——覆盖推理、研究、法律分析、软件工程、工具使用等领域——然后让学生模型自行生成 rollout,并由每位教师在其专业领域内对这些 rollout 进行评分。由于评分基于学生模型自身的同策略(on-policy)输出,而非固定的离线数据集,训练信号始终与学生模型在推理时实际产生的内容保持一致。NVIDIA 将这一循环称为共同进化(co-evolution):新的教师轮次从更新后的学生模型检查点初始化,因此双方都在持续提升。
该检查点是该模型组中的通用推理成员。它由经过后训练的 Nemotron 3 Ultra 学生模型,通过额外一轮推理密集型 SFT 和强化学习产生;模型卡将其描述为针对数学、逻辑和抽象推理(包括形式化证明和竞争性编程)中最难的多步问题,优化生成扩展的高质量推理轨迹。在 MOPD 内部,它同时扮演多个角色——一个检查点,多种角色:推理轨迹生成、数学评判,以及将自由形式的简短答案与参考答案进行评分的等价性评判者。NVIDIA 也将其单独发布,因为它本身就是一个强大的推理者——旨在用于长视野推理轨迹生成、解决难题,以及在您自己的蒸馏流程中充当教师或评分者。
一次通过的规格
• 参数 — 总计 550B / 激活 55B,稀疏 LatentMoE
• 架构 — Mamba2-Transformer 混合架构的潜在混合专家(MoE),并支持多词元预测(MTP)
• 上下文窗口 — 最多 1M tokens;参考服务配置中默认为 256K
• 语言 — 10:英语、法语、西班牙语、意大利语、德语、日语、印地语、韩语、巴西葡萄牙语、中文
• 许可证 — OpenMDW-1.1,允许商业和非商业用途
• 最低硬件配置 — 4×B200(NVFP4 权重);同时也支持 GB200/GB300 和 H100 级别
该架构与 Nemotron 3 Ultra 本身属于同一家族:550B-A55B 形态,采用交错排列的 Mamba-2 与 MoE 层、选择性注意力层,以及用于原生投机解码的 MTP 头。教师模型并非更小的学生模型——它是同一技术栈的不同训练变体,专为长程推理而非通用智能体任务而优化。

为什么将教师开源很重要
教师检查点是最罕见的开放模型发布形式。公司总是发布学生模型——也就是你所部署的模型——以及数据集;它们几乎从不发布那些为学生作业评分的模型。正因如此,六月报告中关于每个教师检查点不会被发布的那句话,被解读为关上了端到端复现 MOPD 流水线的大门。而这次发布把那扇门推开了一条缝,至少对于推理教师来说是这样。
对于构建自家推理模型的团队来说,这是实实在在的价值。塑造 Nemotron 3 Ultra 推理能力的奖励信号部分由这一检查点编写,现在可以直接研究它、将其用作评判器,或用于为 SFT 数据生成长程推理轨迹。结合已经开放的后训练数据(nvidia/nemotron-post-training-v3)和已发布的训练方案,它缩小了“NVIDIA 训练出了好模型”与“我们也能训练出类似模型”之间的差距。

思考表盘
从 Nemotron 3 系列延续下来的一个独特特性是:推理是一个开关,而不是默认设置。聊天模板接受 enable_thinking=true/false、medium_effort 选项以及 reasoning_budget token 上限,因此调用方可以在问题需要时强制进行深度长程推理,而在不需要时获得直接答案——更快也更便宜。对教师模型来说,这一点比看上去更重要:蒸馏任务需要在简单样本上做低成本的评分遍历,在困难样本上做昂贵的推理轨迹,而一个同时支持两种模式的单一检查点就免去了在流水线中途切换模型的需要。
运行它
这不是一个你可以随便调用的模型。最低合理的部署配置为 4×B200,搭配 NVFP4 权重和 fp8 KV 缓存;参考配置还涵盖多节点 GB200/GB300 以及 H100 级服务器。NVIDIA 为三种引擎发布了部署指南——vLLM (0.22)、SGLang (0.5.13) 和 TensorRT-LLM (1.3.0rc17)——这些引擎均在 8000 端口提供 OpenAI 兼容 API,并支持 MTP 或 EAGLE 推测解码以及 flashinfer Mamba 后端。1M-token 上下文需要在各引擎中显式设置 allow-flag(VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 及等价配置);默认上限为 256K。
截至撰写本文时,该模型尚未由任何推理提供商部署在 Hugging Face 上,NVIDIA 也尚未宣布 NIM 托管计划——这只是一个仅发布权重的版本。因此,它适合那些已经运行大规模 GPU 集群的实验室,或者那些蒸馏流程中确实需要精确教师信号的团队。当它最终上线到托管 API 时,定价逻辑很简单:这是一个 55B 激活参数的 MoE 模型,任何托管方都会按 GPU 的实际成本收费。在零加价的路由层上,你只需支付提供商的标价,无需额外平台费用——而且同一个密钥既能访问这个模型,也能访问你用来对比其输出的前沿模型,如果某个托管节点下线,还能自动故障转移。这正是像 OrcaRouter 这样的路由器存在的意义;而教师模型本身则是需要你自行托管的部分。
诚实的告诫
这是一个发布仅24小时的检查点,模型卡上没有任何基准数字。这并非本文的疏漏——而是该版本当前的发布状态。NVIDIA 公开了架构和训练细节,但没有提供评估表,也没有独立实验室来得及运行它。最接近的参考点是学生模型由厂商报告的分数:Nemotron 3 Ultra 在 SWE-Bench Verified 上为 71.9,在 MMLU-Pro 上为 86.8,在 LiveCodeBench v6 上为 89.0,在 1M 上下文下的 RULER 上约为 95。这些描述的是 Ultra 学生模型,而非这个教师模型,并且是 NVIDIA 自己的数据。任何计划基于此检查点进行蒸馏运行的人,在独立评分出现之前,都应将其推理质量视为未经证实。
这张卡片中还内置了两个额外注意事项。后训练语料库严重偏向英语——大约有860万个英语样本,而其余九种语言每种仅约13.8万个样本——因此不应仅凭10语言标签就假定多语言推理质量。此外,该卡片本身也指出了基础训练数据中的代表性偏差,并建议在下游使用前进行偏见审计。
谁应该关心
这里有三类群体能获得实实在在的价值{{1}}:蒸馏研究人员终于有了一个可以剖析的实际 MOPD 教师模型,而不只是一份描述它的配方;训练自家推理模型的实验室,获得了一个长程轨迹生成器和一个评判模型,而这两者与它们试图对齐的模型出自同一套后训练谱系;任何运行基于策略的强化学习的人,都可以像 NVIDIA 那样使用它——为最困难的问题打分,只在能带来回报的地方开启思考模式{{/1}}。
如果你不属于这些群体,这个版本今天对你的影响不大:模型庞大、未经充分验证、且仅支持自托管;应对底层趋势——更多开放推理教师出现——的最快方法,是让你的流水线模型层保持可通过统一接口替换,而不是绑定在任何单一检查点上。

接下来看什么
三件事将判断这是一次性发布还是系列模型的集体亮相。第一,同门教师模型是否会遵循相同路径——NVIDIA-Nemotron-Labs-Teacher-STEM 已在同一天落地,因此关键在于接下来会出现哪些领域专家模型,以及它们的权重设置是否一致。第二,NVIDIA NIM 或托管服务是否会开始提供这些模型,这将把一个仅限实验室的发布变成整个行业都能实际调用的东西。第三,独立基准测试是否会现身——Artificial Analysis 的评测条目或 LMArena 的运行,将成为首次真正检验教师模型推理质量是否与其所训练的学生模型相匹配的验证。
