
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning:Nemotron 3 Ultra 背後的 550B 推理教師模型剛開放權重
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72程式
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grokSpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
2026年8月14日,NVIDIA 在 Hugging Face 上發布了 NVIDIA-Nemotron-Labs-Teacher-General-Reasoning——這是一個 550B 參數的推理模型,直到昨天為止,它只存在於旗艦級 Nemotron 3 Ultra 的訓練管線之中。它是 NVIDIA 用來訓練 550B-A55B Ultra 學生模型的「多教師同策略蒸餾」(MOPD)配方中的「通用推理」教師模型。這次發布之所以意義重大,原因很簡單:在 NVIDIA 於六月發布的 Nemotron 3 Ultra 技術報告中,訓練配方明確表示每個教師模型的檢查點不會開源。而現在這個模型開源了——包含權重、tokenizer、聊天模板與服務配置,採用商業友善的 OpenMDW-1.1 授權。同一天,姊妹模型 NVIDIA-Nemotron-Labs-Teacher-STEM 也發布了,這與其說是一次性事件,更像是教師模型陣容開始浮出檯面。
教師模型實際上究竟是什麼
MOPD 是一種後訓練技術,賦予 Nemotron 3 Ultra 具備代理式推理能力。NVIDIA 並非將單一大型教師模型蒸餾到學生模型,而是訓練了十多個領域專精的教師模型,涵蓋推理、研究、法律分析、軟體工程、工具使用等領域,然後讓學生模型自行生成軌跡(rollouts),並讓每個教師模型在其專業領域內為這些軌跡評分。由於評分是基於學生模型自身的在策略(on-policy)輸出,而非固定的離線資料集,因此訓練訊號能持續與學生模型在推論時實際產出的結果保持一致。NVIDIA 將此迴圈稱為「共同演化」(co-evolution):新一輪的教師模型會從更新後的學生模型檢查點初始化,因此雙方持續進步。
這個檢查點是該評審小組中的通用推理成員。它是由後訓練的 Nemotron 3 Ultra 學生模型,經過額外一輪推理密集型的 SFT 與強化學習所產出;模型卡將其描述為針對數學、邏輯與抽象推理(包括形式化證明與競賽程式設計)中最困難的多步驟問題,最佳化其長篇高品質推理軌跡的生成。在 MOPD 中,它同時身兼多職——單一檢查點,多重角色:推理軌跡生成、數學評判,以及將自由作答的簡答題與參考答案進行比對評分的等價性評分器。NVIDIA 也將其獨立發布,因為它本身就是一個強大的推理模型——適用於長時程推理軌跡生成、困難問題求解,以及在您自己的蒸餾管線中擔任教師或評分者的角色。
一次遍歷的規格
• 參數 — 總計 550B / 55B 活躍,稀疏 LatentMoE
• 架構 — Mamba2-Transformer 混合式潛在混合專家,支援多令牌預測(MTP)
上下文視窗 — 最多可達 1M tokens;參考服務設定中的預設值為 256K
• 語言 — 10:英文、法文、西班牙文、義大利文、德文、日文、印地文、韓文、巴西葡萄牙文、中文
• 授權 — OpenMDW-1.1,允許商業和非商業使用
• 最低硬體需求 — 4×B200(NVFP4 權重);同時支援 GB200/GB300 與 H100 等級
此架構與 Nemotron 3 Ultra 本身屬於同一家族:550B-A55B 形態,採用交錯的 Mamba-2 與 MoE 層、特定注意力層,以及用於原生投機解碼的 MTP 頭。教師模型並非較小的學生模型——而是同一技術堆疊的不同訓練變體,{{1}}專門針對長程推理而非一般代理(agentic)任務{{/1}}。

為什麼將教師開源很重要
教師檢查點是最罕見的開放模型發布類型。公司經常發布學生模型——即你部署的模型——以及數據集;但他們幾乎從不發布用來評分學生工作的模型。這就是為什麼六月報告中關於「每個教師的檢查點不會發布」的陳述,被視為關閉了端到端重現 MOPD 管線的大門。這次發布把門撬開了一條縫,至少對推理教師模型而言。
對於自行建構推理模型的團隊而言,這是有實質價值的。塑造 Nemotron 3 Ultra 推理能力的獎勵信號,有一部分就出自這個檢查點;如今,它既能被直接研究,也能作為評判模型(judge)運行,或用於為 SFT 資料生成長程推理軌跡。再加上已經公開的後訓練資料(nvidia/nemotron-post-training-v3)與已發表的訓練配方,這縮短了「NVIDIA 訓練出了優秀模型」與「我們也能訓練出類似模型」之間的差距。

思考轉盤
Nemotron 3 系列延續了一項獨特功能:推理是一個開關,而不是預設行為。聊天模板接受 enable_thinking=true/false、medium_effort 選項,以及 reasoning_budget 的 token 上限,因此呼叫端可以在問題需要時強制進行深度長程推理,並在不需要時獲得直接答案——更快且更便宜。對於教師模型而言,這點比表面上看起來更重要:蒸餾執行希望對簡單樣本進行低成本評分,對困難樣本進行高成本推理軌跡,而單一檢查點若能支援兩種模式,就不需要在流程中途更換模型。
運行中
這不是一個你會隨意調用的模型。合理的服務部署最低配備是 4×B200,搭配 NVFP4 權重和 fp8 KV 快取;參考配置也涵蓋多節點 GB200/GB300 以及 H100 級別的設備。NVIDIA 發布了三個引擎的烹飪指南:vLLM (0.22)、SGLang (0.5.13) 和 TensorRT-LLM (1.3.0rc17),全部在連接埠 8000 上提供 OpenAI 相容的 API,並支援 MTP 或 EAGLE 推測解碼,以及 flashinfer Mamba 後端。1M token 的上下文長度需要在每個引擎中明確設定 allow-flag(VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 及等效設定);預設上限為 256K。
{{1}}截至撰寫本文時,該模型尚未由 Hugging Face 上的任何推論供應商部署,NVIDIA 也未宣布 NIM 託管服務——這是一次僅發布權重的版本。這使其成為適合已運行大型 GPU 機群的實驗室,或是其蒸餾管線特別需要精確教師訊號的團隊所使用的模型。{{/1}}{{2}}當它確實登上受管 API 時,定價算法很簡單:這是一個 55B 活躍參數的 MoE,無論誰託管它,收取的就是 GPU 的成本。在一個以 0% 加成運作的路由層上,你支付供應商的牌價,無需額外平台費用——而且,能觸達此模型的同一把金鑰,也能觸達你用於比對其軌跡的前沿模型,若某個主機失效則自動故障轉移。{{/2}}{{3}}這就是像 OrcaRouter 這樣的路由器存在的意義;而教師模型本身,則是你自行託管的部分。{{/3}}
誠實的告誡
這是一個24小時前的檢查點,模型卡中完全沒有任何基準測試數字。這不是這份文件中的遺漏——而是本次發布的實際狀態。NVIDIA公布了架構和訓練細節,但沒有提供評測表格,目前也沒有任何獨立實驗室有時間運行它。最接近的參考點是學生模型由供應商報告的數字:Nemotron 3 Ultra 在 SWE-Bench Verified 上報告 71.9,在 MMLU-Pro 上為 86.8,在 LiveCodeBench v6 上為 89.0,在 1M 上下文下 RULER 約為 95。那些數據描述的是 Ultra 學生模型,而不是這個教師模型,而且是 NVIDIA 自己的數據。任何計劃在此檢查點上進行蒸餾運行的人,都應在獨立分數出現之前,將其推理品質視為未經驗證。
這張模型卡中還內建了兩個額外的注意事項。後訓練語料庫嚴重偏重英文——約860萬個英文樣本,相對於其他九種語言每種約13.8萬個樣本——因此不應僅憑「10種語言」的標籤就假定其多語言推理品質。此外,模型卡本身也指出了基礎訓練資料中的代表性偏差,並建議在下游使用前進行偏差審計。
誰應該關心
這裡有三個群體能獲得真正的價值。蒸餾研究人員終於有了一個實際的 MOPD 教師可供剖析,而不只是描述其做法的食譜。訓練自家推理模型的實驗室,獲得一個長程軌跡生成器,以及一個與他們試圖匹配的模型出自同一後訓練血統的評判器。而任何執行 on-policy RL 的人,都可以像 NVIDIA 那樣使用它——作為最難問題的評分器,只在能回收成本的地方開啟思考。
如果你不屬於這些群體中的任何一個,這次發布對你今天的影響不大:模型龐大、尚未經過充分驗證,而且僅限自架部署。要跟上這股底層趨勢——越來越多的開放式推理教師出現——最快的方法是讓你的管線模型層保持在單一介面之後可隨時替換,而不是焊死在單一檢查點上。

接下來要看什麼
有三件事可以判斷這是一次性事件,還是整個系列即將登場。首先,{{1}}同系列的教師模型是否會循相同路徑推出——NVIDIA-Nemotron-Labs-Teacher-STEM 已在同一天登場,因此接下來的問題是哪些領域專家模型會相繼推出,以及它們是否以相同方式加權{{/1}}。其次,{{2}}NVIDIA NIM 或託管主機是否會開始提供服務,這將把僅限實驗室的發布變成整個業界真正可以調用的東西{{/2}}。第三,{{3}}獨立基準測試是否會出現——Artificial Analysis 的條目或 LMArena 的評測將是第一次真正的檢驗,用以確認教師模型的推理品質是否與它所訓練的學生模型相匹配{{/3}}。
