新聞文章「NVIDIA-Nemotron-Labs-Teacher-General-Reasoning」的標題主視覺卡片,標題文字為「Nemotron 3 Ultra 背後的 550B 推理教師現已開放權重」,包含一個開放權重盒狀圖示、一個 GPU 晶片圖形、引擎標籤 vLLM / SGLang / TensorRT-LLM、一個「發布於 2026 年 8 月 14 日」的日期徽章,以及合成在右下角的 OrcaRouter 標誌。
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning:Nemotron 3 Ultra 背後的 550B 推理教師模型剛開放權重

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年8月14日,NVIDIA 在 Hugging Face 上發布了 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning——這是一個 550B 參數的推理模型,直到昨天為止,它只存在於旗艦級 Nemotron 3 Ultra 的訓練管線之中。它是 NVIDIA 用來訓練 550B-A55B Ultra 學生模型的「多教師同策略蒸餾」(MOPD)配方中的「通用推理」教師模型。這次發布之所以意義重大,原因很簡單:在 NVIDIA 於六月發布的 Nemotron 3 Ultra 技術報告中,訓練配方明確表示每個教師模型的檢查點不會開源。而現在這個模型開源了——包含權重、tokenizer、聊天模板與服務配置,採用商業友善的 OpenMDW-1.1 授權。同一天,姊妹模型 NVIDIA-Nemotron-Labs-Teacher-STEM 也發布了,這與其說是一次性事件,更像是教師模型陣容開始浮出檯面。

教師模型實際上究竟是什麼

MOPD 是一種後訓練技術,賦予 Nemotron 3 Ultra 具備代理式推理能力。NVIDIA 並非將單一大型教師模型蒸餾到學生模型,而是訓練了十多個領域專精的教師模型,涵蓋推理、研究、法律分析、軟體工程、工具使用等領域,然後讓學生模型自行生成軌跡(rollouts),並讓每個教師模型在其專業領域內為這些軌跡評分。由於評分是基於學生模型自身的在策略(on-policy)輸出,而非固定的離線資料集,因此訓練訊號能持續與學生模型在推論時實際產出的結果保持一致。NVIDIA 將此迴圈稱為「共同演化」(co-evolution):新一輪的教師模型會從更新後的學生模型檢查點初始化,因此雙方持續進步。

這個檢查點是該評審小組中的通用推理成員。它是由後訓練的 Nemotron 3 Ultra 學生模型,經過額外一輪推理密集型的 SFT 與強化學習所產出;模型卡將其描述為針對數學、邏輯與抽象推理(包括形式化證明與競賽程式設計)中最困難的多步驟問題,最佳化其長篇高品質推理軌跡的生成。在 MOPD 中,它同時身兼多職——單一檢查點,多重角色:推理軌跡生成、數學評判,以及將自由作答的簡答題與參考答案進行比對評分的等價性評分器。NVIDIA 也將其獨立發布,因為它本身就是一個強大的推理模型——適用於長時程推理軌跡生成、困難問題求解,以及在您自己的蒸餾管線中擔任教師或評分者的角色。

一次遍歷的規格

• 參數 — 總計 550B / 55B 活躍,稀疏 LatentMoE

• 架構 — Mamba2-Transformer 混合式潛在混合專家,支援多令牌預測(MTP)

上下文視窗 — 最多可達 1M tokens;參考服務設定中的預設值為 256K

• 語言 — 10:英文、法文、西班牙文、義大利文、德文、日文、印地文、韓文、巴西葡萄牙文、中文

• 授權 — OpenMDW-1.1,允許商業和非商業使用

• 最低硬體需求 — 4×B200(NVFP4 權重);同時支援 GB200/GB300 與 H100 等級

此架構與 Nemotron 3 Ultra 本身屬於同一家族:550B-A55B 形態,採用交錯的 Mamba-2 與 MoE 層、特定注意力層,以及用於原生投機解碼的 MTP 頭。教師模型並非較小的學生模型——而是同一技術堆疊的不同訓練變體,{{1}}專門針對長程推理而非一般代理(agentic)任務{{/1}}。

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

為什麼將教師開源很重要

教師檢查點是最罕見的開放模型發布類型。公司經常發布學生模型——即你部署的模型——以及數據集;但他們幾乎從不發布用來評分學生工作的模型。這就是為什麼六月報告中關於「每個教師的檢查點不會發布」的陳述,被視為關閉了端到端重現 MOPD 管線的大門。這次發布把門撬開了一條縫,至少對推理教師模型而言。

對於自行建構推理模型的團隊而言,這是有實質價值的。塑造 Nemotron 3 Ultra 推理能力的獎勵信號,有一部分就出自這個檢查點;如今,它既能被直接研究,也能作為評判模型(judge)運行,或用於為 SFT 資料生成長程推理軌跡。再加上已經公開的後訓練資料(nvidia/nemotron-post-training-v3)與已發表的訓練配方,這縮短了「NVIDIA 訓練出了優秀模型」與「我們也能訓練出類似模型」之間的差距。

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

思考轉盤

Nemotron 3 系列延續了一項獨特功能:推理是一個開關,而不是預設行為。聊天模板接受 enable_thinking=true/false、medium_effort 選項,以及 reasoning_budget 的 token 上限,因此呼叫端可以在問題需要時強制進行深度長程推理,並在不需要時獲得直接答案——更快且更便宜。對於教師模型而言,這點比表面上看起來更重要:蒸餾執行希望對簡單樣本進行低成本評分,對困難樣本進行高成本推理軌跡,而單一檢查點若能支援兩種模式,就不需要在流程中途更換模型。

運行中

這不是一個你會隨意調用的模型。合理的服務部署最低配備是 4×B200,搭配 NVFP4 權重和 fp8 KV 快取;參考配置也涵蓋多節點 GB200/GB300 以及 H100 級別的設備。NVIDIA 發布了三個引擎的烹飪指南:vLLM (0.22)、SGLang (0.5.13) 和 TensorRT-LLM (1.3.0rc17),全部在連接埠 8000 上提供 OpenAI 相容的 API,並支援 MTP 或 EAGLE 推測解碼,以及 flashinfer Mamba 後端。1M token 的上下文長度需要在每個引擎中明確設定 allow-flag(VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 及等效設定);預設上限為 256K。

{{1}}截至撰寫本文時,該模型尚未由 Hugging Face 上的任何推論供應商部署,NVIDIA 也未宣布 NIM 託管服務——這是一次僅發布權重的版本。這使其成為適合已運行大型 GPU 機群的實驗室,或是其蒸餾管線特別需要精確教師訊號的團隊所使用的模型。{{/1}}{{2}}當它確實登上受管 API 時,定價算法很簡單:這是一個 55B 活躍參數的 MoE,無論誰託管它,收取的就是 GPU 的成本。在一個以 0% 加成運作的路由層上,你支付供應商的牌價,無需額外平台費用——而且,能觸達此模型的同一把金鑰,也能觸達你用於比對其軌跡的前沿模型,若某個主機失效則自動故障轉移。{{/2}}{{3}}這就是像 OrcaRouter 這樣的路由器存在的意義;而教師模型本身,則是你自行託管的部分。{{/3}}

誠實的告誡

這是一個24小時前的檢查點,模型卡中完全沒有任何基準測試數字。這不是這份文件中的遺漏——而是本次發布的實際狀態。NVIDIA公布了架構和訓練細節,但沒有提供評測表格,目前也沒有任何獨立實驗室有時間運行它。最接近的參考點是學生模型由供應商報告的數字:Nemotron 3 Ultra 在 SWE-Bench Verified 上報告 71.9,在 MMLU-Pro 上為 86.8,在 LiveCodeBench v6 上為 89.0,在 1M 上下文下 RULER 約為 95。那些數據描述的是 Ultra 學生模型,而不是這個教師模型,而且是 NVIDIA 自己的數據。任何計劃在此檢查點上進行蒸餾運行的人,都應在獨立分數出現之前,將其推理品質視為未經驗證。

這張模型卡中還內建了兩個額外的注意事項。後訓練語料庫嚴重偏重英文——約860萬個英文樣本,相對於其他九種語言每種約13.8萬個樣本——因此不應僅憑「10種語言」的標籤就假定其多語言推理品質。此外,模型卡本身也指出了基礎訓練資料中的代表性偏差,並建議在下游使用前進行偏差審計。

誰應該關心

這裡有三個群體能獲得真正的價值。蒸餾研究人員終於有了一個實際的 MOPD 教師可供剖析,而不只是描述其做法的食譜。訓練自家推理模型的實驗室,獲得一個長程軌跡生成器,以及一個與他們試圖匹配的模型出自同一後訓練血統的評判器。而任何執行 on-policy RL 的人,都可以像 NVIDIA 那樣使用它——作為最難問題的評分器,只在能回收成本的地方開啟思考。

如果你不屬於這些群體中的任何一個,這次發布對你今天的影響不大:模型龐大、尚未經過充分驗證,而且僅限自架部署。要跟上這股底層趨勢——越來越多的開放式推理教師出現——最快的方法是讓你的管線模型層保持在單一介面之後可隨時替換,而不是焊死在單一檢查點上。

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

接下來要看什麼

有三件事可以判斷這是一次性事件,還是整個系列即將登場。首先,{{1}}同系列的教師模型是否會循相同路徑推出——NVIDIA-Nemotron-Labs-Teacher-STEM 已在同一天登場,因此接下來的問題是哪些領域專家模型會相繼推出,以及它們是否以相同方式加權{{/1}}。其次,{{2}}NVIDIA NIM 或託管主機是否會開始提供服務,這將把僅限實驗室的發布變成整個業界真正可以調用的東西{{/2}}。第三,{{3}}獨立基準測試是否會出現——Artificial Analysis 的條目或 LMArena 的評測將是第一次真正的檢驗,用以確認教師模型的推理品質是否與它所訓練的學生模型相匹配{{/3}}。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube