
Nemotron-3-Labs-Ultra-Math-RL:NVIDIA 低調開源其 IMO 2026 參賽背後的 RL 檢查點
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
NVIDIA 發布了 Nemotron-3-Labs-Ultra-Math-RL到 Hugging Face,時間是 2026 年 9 月 2–3 日,沒有部落格文章、X 公告或新聞稿——模型卡就這麼出現,日期為 9 月 3 日,並以一行文字說明自身:它是強化學習檢查點,NVIDIA 隨附的技術報告中稱其為「Nemotron-3-Ultra-RL」,且「作為整合系統的一部分部署,該系統在 2026 年國際數學奧林匹亞中獲得金牌等級分數」。該系統的官方成績——42 分中得 30 分,高於 29 分的金牌門檻——早在 7 月底就被廣為報導,當時基礎模型的權重自 6 月起就已公開。當時無法下載的,是競賽實際執行時所用的那一對後訓練專家模型。其中一個現在就放在公開的 Hugging Face 儲存庫中,讚數為零,下載次數也接近零。
這是一個低調發布的故事,所以值得精確區分哪些是已知的、哪些不是。從儲存庫與報告中可以得知:檢查點的架構、其訓練配方、它在 IMO 2026 提交中所扮演的角色,以及 NVIDIA 隨之發布的資料集與基準。尚未確認的則有:任何廠商公告、任何針對此檢查點的獨立第三方基準測試,以及任何託管 API——這是在 OpenMDW-1.1 授權下的自託管權重發布,要運行它意味著需要部署約 1.5 TB 的 Blackwell 級 HBM。
本週實際發布了什麼
nvidia/Nemotron-3-Labs-Ultra-Math-RL 這個儲存庫於 2026 年 9 月 2 日(19:11 UTC)在 Hugging Face 上建立,最後修改於 9 月 8 日。它是收錄於 nvidia/nemotron-labs-imo-2026 之下的協調發布中的一項,該集合包含:
• 這兩個經後訓練的競賽檢查點 — Nemotron-3-Labs-Ultra-Math-RL(本主題)及其監督式微調的同源模型 Nemotron-3-Labs-Ultra-Math-SFT,兩者皆屬於 OpenMDW-1.1。
• 其背後的兩個訓練語料庫 — Nemotron-Math-Proofs-v3-SFT 與 Nemotron-Math-Proofs-v3-RL,皆採用 CC-BY-4.0 授權。
「Nemotron-IMO-Bench」,一個新的評測基準,包含200道未曾公開的奧林匹亞等級題目(50道代數、50道組合數學、50道幾何、50道數論),每一道題均配有經人工精心編寫的參考證明,由數學家Titu Andreescu共同創建,目的在確保這些題目不會出現在任何訓練資料集中。
• 它們全都是以 NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 基礎檢查點進行微調的。
該集合的描述指向了那份統整一切的技術報告:《為奧林匹亞數學訓練 Nemotron:IMO 金牌的開放配方》(NVIDIA 的 NeMo-Skills 儲存庫中的 PDF 標註日期為 2026 年 9 月 8 日)。除了檢查點之外,NVIDIA 還發布了推論管線、所提交的證明、強化學習訓練配方,以及此次競賽運作的完整算力核算。這套框架明確以可重現科學為宗旨:NVIDIA 等於是在說——重建該系統所需的一切都在這裡。
Nemotron-3-Labs-Ultra-Math-RL是什麼
就架構而言,這不是一個新的基礎模型——它微調自通用版 NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16,也就是 NVIDIA 於 2026 年 6 月 4 日首次發布的 Mamba2–Transformer 混合式 Latent Mixture-of-Experts(潛在混合專家)檢查點。Math-RL 檢查點保留了該架構與規模:550B 總參數(其中 55B 活躍)、多 token 預測,以及對最多 1M token 上下文窗口的支援。RL 訓練所改變的是專門化,而這種專門化是刻意收窄的:
• 目的 — 解決困難的數學競賽題並擔任證明評判者:模型經訓練後能產出嚴謹的解法、依 0 / 0.5 / 1 的評分標準自我評估,並找出證明中的錯誤。
• 它並非一般的聊天機器人——卡片與報告描述的是針對證明搜尋管線(proof-search pipeline)的專業工作者,而非遵循指令的助手。
• 授權 — OpenMDW-1.1,NVIDIA 的寬鬆開放模型授權,允許商業與非商業用途,與基礎模型及先前的 Nemotron Labs 教師版本相同。
• 部署 — 任何地方都沒有公開的託管定價;你下載 safetensors 並自行託管。NVIDIA 的參考配置是單一節點、配備 8× B200(總計約 1.5 TB HBM),並提供橫跨 H100/H200/GB200/GB300 的多節點選項。vLLM 是建議的執行環境,其中推理解析器、Qwen3-Coder 工具呼叫解析器、Mamba SSM 快取設定,以及在 5 個 token 上執行的 MTP 推測解碼,都已在模型卡中明確標示。

為什麼這個檢查點很重要:它位於 IMO 2026 系統內部
IMO 2026 的成績正是大家關注這款模型的原因,所以真正重要的區別在於:30/42 是系統分數,而不是單一模型的分數。NVIDIA 提交的方案是一套兩階段、多檢查點的管線,而 Nemotron-3-Labs-Ultra-Math-RL 是其中肩負兩項任務的組成部分。
根據報告,第一階段針對每個問題執行了最多八輪的疊代式「生成–驗證–精煉」搜尋。第一輪抽樣了384個證明嘗試——來自八種不同解題策略提示的各16個,並分別取自三個檢查點:通用可用性模型、SFT專精模型與RL專精模型。搜尋時的驗證採用RL與SFT檢查點作為雙模型評審小組:每個檢查點提供八個獨立判斷,且只有在全部16個判斷都將其評為1分時,該證明才會被接受。後續的高算力階段則以全部三個檢查點重新評分每個入圍最終證明(每個檢查點給出16個IMO式評判,採0–7分制),並為每個問題選出唯一的提交。
論文所報告的官方結果,與七月下旬的報導一致:在IMO 2026試卷中獲得42分中的30分,高於29分的金牌門檻,其中第1、2、4、5題滿分,第3、6題各得1分,並由IMO官方評分員評定。NVIDIA自身的資源核算顯示,所有六個已提交的證明都在約7.07億個生成token與1,464個GB200 GPU小時內完成;而完成進行中的回合後,整個執行過程約耗費23.1億個token與4,800個GB200 GPU小時。
報告中的兩個內部數字說明了為什麼 RL checkpoint 能在整體組合中佔有一席之地。在 NVIDIA 的 30 題開發集上,由 GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.8 組成的獨立評審團依照 MathArena 風格程序評分,RL 專家是端到端表現最佳的單一 checkpoint 管線(在可能的 210 分中獲得 180 分,而 SFT 專家為 165 分,基礎模型為 162 分),儘管 SFT checkpoint 在第一輪解決了更多問題。在 300 個證明的審核集中,部署的 RL+SFT 驗證小組將誤接受率——即導致搜尋終止於無效證明的失敗——降至約 1.1%,而 RL checkpoint 單獨判斷為 12.4%,基礎模型為 31.6%。報告的觀點是,這兩個選擇性專家在全體一致規則下能互相捕捉彼此的錯誤。
這些是NVIDIA在自家開發集上進行的消融實驗,載於NVIDIA的論文中——值得視為廠商自述的證據,用以說明此設計為何有效,而非獨立評測分數。該開發集本身僅有30道題目,且目前尚無外部實驗室對這個檢查點進行過測試。
強化學習配方,簡述
訓練資料與方法完全開源,這對任何從事數學推理強化學習(RL)研究的人來說,才是真正的新聞。報告中的重點如下:
• 資料 — 問題取自 Nemotron-Math-Proofs-v1 的 AoPS 子集,篩選出基礎 Ultra 模型在四次嘗試中能解出一至三次的問題(由 DeepSeek-V3.2-Speciale 評判)——即困難但可掌握的課程問題。此篩選流程產生 9,597 個證明生成提示,以 Nemotron-Math-Proofs-v3-RL 之名發布。
• 獎勵 — 遵循 DeepSeekMath-V2 的設計,但移除了自我分析獎勵項;評判信號在訓練期間來自證明評判服務。
• 演算法 — 基於 NeMo-RL 建構的非同步強化學習,精神上與 PipelineRL 相似:維持固定數量的 prompt 同時處理中,當批次填滿時將完成的序列饋送給訓練器,採用截斷式重要性採樣,並在熵值攀升時於正樣本上遮罩低機率 token。該配置使用 131,072 token 的上下文,以及約 128 個訓練節點、128 個推論節點與 16 個各配備 4× GB200 的評判節點。
作為對照,同源的 SFT 檢查點是從相同基礎模型進行長上下文監督式微調,使用經品質篩選的語料庫,涵蓋 15,818 個問題上的 414,890 條證明、精煉、驗證及元驗證軌跡,並在 512 顆 GB200 GPU 上執行。

尚不清楚的是什麼
誠實的資訊來源在此是一體兩面,讀者在決定是否重視這項發布時,應抱持四點保留:
• 尚未有正式公告。截至撰寫本文時,NVIDIA 尚未正式公告這套合集;它只是出現在 Hugging Face 上。技術報告 PDF 的標註日期為 9 月 8 日,因此這份書面配方實際上也是本週才對外發布。
• 沒有獨立的基準測試。與此檢查點相關的每一項效能數據——開發集消融實驗、驗證者稽核、IMO 2026 系統分數——皆出自 NVIDIA 自己的報告。IMO 分數本身在這些數據中出處最為可信,因為它是在官方競賽條件下評分的;但它是系統層級的結果,而此檢查點對該分數的貢獻,尚未有任何外部實驗室重現。
• 沒有託管 API,也沒有定價。這是自架(self-host)發布版。任何想要使用它的人都必須有相應的硬體。七月那篇「NVIDIA Nemotron 3 Ultra 在 IMO 2026 奪金」的報導很容易被誤讀為「下載這個就能解奧林匹亞題」——但老實說法是「下載的是達成此事系統的組件」。
• 金牌論述。 NVIDIA 自己的措辭是「達到金牌門檻」,而該論文也審慎地指出,該模型是集成模型的一部分。任何宣稱單憑這一個檢查點就達到「金牌級」水準的說法,都應視為缺乏依據。
適用對象
本次發布針對特定的讀者:在數學推理、證明生成,或帶有可驗證獎勵的強化學習(RL)領域工作的實驗室或研究人員。他們想要一套參考實作,了解一個系統如何在自然語言中跨越奧林匹亞金牌門檻——沒有形式化證明器、沒有工具、沒有網路。對這類讀者而言,價值在於整個套件:權重、SFT 與 RL 語料庫、NeMo-Gym 格式的提示詞、推論管線、提交的證明,以及一份說明競賽實際運行耗費多少 GPU 小時的計算帳目。
對其他人來說,實際的建議是:奧林匹亞等級的證明搜索,對大多數真實數學工作負載來說是殺雞用牛刀。AIME 與競賽等級的問題,以及基本上所有在程式碼中的應用數學工作,用遠小得多的模型就能輕鬆應付——這點很重要,因為一個 550B 的檢查點不是你能為了跑批次作業就隨便啟動的東西。較小的開源數學模型與前沿 API 模型,可以透過 OrcaRouter 上的單一 API 以提供商的列表價格使用(我們這邊不加價,所以供應商降價當天就會生效),而且具備自動容錯轉移——如果你想試用未經驗證的模型,又不想把生產路徑押在它上面,這就很有用。從那裡開始;只有當工作負載確實需要前沿規模的證明搜索時,才自行託管 550B。
值得關注的開放問題是:這次悄然的發布是否會伴隨官方公告與正式版本說明,以及是否有 NVIDIA 以外的人能端到端執行該配方,並回報獨立的 IMO-Bench 分數。該基準——200 道全新、未公開的奧林匹亞題目——可以說是這套資料集中最有用的成果:它正是這個領域一直缺少的那種抗污染評估。如果配方可以重現,那麼本週 Hugging Face 上悄無聲息的上傳,最終會成為今年意義較重大的開放模型發布之一。如果無法重現,這套資料集仍然是一份詳實且誠實的紀錄,說明了在一次前沿規模的「生成—驗證—精煉」執行中,實際需要的是什麼。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
