Nemotron-3-Labs-Ultra-Math-RL용 히어로 타이틀 카드. 부제: '조용히 오픈소스로 공개된 IMO 2026 RL 체크포인트'. '총 550B / 활성 55B', 'OpenMDW-1.1 라이선스', '2026년 9월 출시'를 표시하는 스펙 칩 포함.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA가 IMO 2026 도전의 배후에 있던 RL 체크포인트를 조용히 오픈소스로 공개했다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

NVIDIA dropped Nemotron-3-Labs-Ultra-Math-RL on Hugging Face on September 2–3, 2026, with no blog post, no X announcement and no press release — the model card simply appears, dated September 3, and explains itself in one line: it is the reinforcement-learning checkpoint, referred to as "Nemotron-3-Ultra-RL" in NVIDIA's accompanying technical report, that was "deployed as part of an ensemble system that achieved a gold-medal level score at the International Mathematical Olympiad 2026." That system's official score — 30 out of 42 points, above the 29-point gold threshold — was widely reported back in late July, when the base model's weights had been public since June. What was not downloadable then was the pair of post-trained specialists the competition run actually used. One of them is now sitting in a public Hugging Face repo with zero likes and a near-zero download count.

이번 공개는 조용히 이루어진 릴리스(quiet release)에 관한 이야기이므로, 무엇을 알 수 있고 무엇을 알 수 없는지를 정확히 구분하는 것이 중요하다. 저장소와 보고서에서 알 수 있는 것은 체크포인트의 아키텍처, 학습 레시피, IMO 2026 제출물에서 수행한 역할, 그리고 NVIDIA가 함께 공개한 데이터셋과 벤치마크이다. 아직 확인되지 않은 것은 벤더의 공식 발표, 이 체크포인트에 대한 독립적인 제3자 벤치마크, 그리고 호스팅형 API이다. 이는 OpenMDW-1.1 라이선스에 따른 자체 호스팅 가중치 공개이며, 이를 실행하려면 약 1.5TB의 Blackwell급 HBM을 구축해야 한다.

이번 주에 실제로 출시된 것들

nvidia/Nemotron-3-Labs-Ultra-Math-RL 저장소는 2026년 9월 2일(19:11 UTC)에 Hugging Face에서 생성되었고, 9월 8일에 마지막으로 수정되었습니다. 이 저장소는 nvidia/nemotron-labs-imo-2026에 함께 등록된 조정 릴리스의 한 항목이며, 여기에는 다음이 포함됩니다:

• 포스트 트레이닝된 두 경쟁 체크포인트 — Nemotron-3-Labs-Ultra-Math-RL(본 주제) 및 지도 미세 조정된 형제 모델인 Nemotron-3-Labs-Ultra-Math-SFT, 둘 다 OpenMDW-1.1에 속합니다.

• 그 뒤에 있는 두 개의 훈련 코퍼스 — Nemotron-Math-Proofs-v3-SFT 및 Nemotron-Math-Proofs-v3-RL, 둘 다 CC-BY-4.0.

• Nemotron-IMO-Bench, 200개의 미공개 올림피아드 수준 문제(대수 50개, 조합론 50개, 기하 50개, 정수론 50개)로 구성된 새로운 평가 벤치마크로, 각 문제는 인간이 엄선한 참조 증명과 함께 제공되며, 수학자 Titu Andreescu와 함께 문제가 어떤 훈련 데이터셋에도 포함될 수 없도록 특별히 제작되었습니다.

• 모두 파인튜닝된 기본 체크포인트 NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16

컬렉션 설명은 모든 것을 하나로 묶어 주는 기술 보고서를 가리킨다: "An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics"(NVIDIA의 NeMo-Skills 저장소에 있는 PDF는 2026년 9월 8일자이다). NVIDIA는 체크포인트와 함께 추론 파이프라인, 제출된 증명, RL 훈련 레시피, 그리고 대회 실행에 대한 전체 컴퓨팅 사용 내역도 공개했다. 이러한 구성은 명시적으로 재현 가능한 과학을 표방한다. 즉, NVIDIA가 시스템을 재구축하는 데 필요한 모든 것이 여기에 있다고 말하는 것이다.

Nemotron-3-Labs-Ultra-Math-RL이란 무엇인가

구조적으로 이는 새로운 기본 모델이 아니라, 일반 공급(GA) 버전인 NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, 즉 NVIDIA가 2026년 6월 4일에 처음 출시한 Mamba2–Transformer 하이브리드 Latent Mixture-of-Experts 체크포인트의 파인튜닝입니다. Math-RL 체크포인트는 그 구조와 규모를 유지합니다: 총 550B 파라미터 중 55B가 활성이고, 다중 토큰 예측을 지원하며, 최대 1M 토큰의 컨텍스트 창을 지원합니다. RL 훈련이 바꾸는 것은 전문화이며, 이는 의도적으로 좁게 설정되어 있습니다:

• 목적 — 어려운 수학 경시대회 문제를 푸는 것 증명 심사자 역할을 하는 것: 모델은 엄밀한 풀이를 제시하고, 이를 0 / 0.5 / 1 채점 기준으로 스스로 평가하며, 증명에서 오류를 찾아내도록 훈련된다.

• 일반적인 챗봇이 아닙니다 — 카드와 보고서는 지시를 따르는 보조자가 아니라 증명 검색 파이프라인을 위한 전문 작업자를 설명합니다.

• 라이선스 — OpenMDW-1.1, 상업적 및 비상업적 사용을 허용하는 NVIDIA의 관대한 오픈 모델 라이선스로, 기본 모델 및 이전 Nemotron Labs 교사 릴리스와 동일합니다.

• 배포 — 호스팅된 가격 목록은 어디에도 없습니다. safetensors를 다운로드하여 자체 호스팅합니다. NVIDIA의 참조 구성은 8× B200 단일 노드(총 약 1.5TB HBM)이며, H100/H200/GB200/GB300에 걸친 멀티 노드 옵션도 제공됩니다. vLLM이 권장 런타임이며, 추론 파서, Qwen3-Coder 도구 호출 파서, Mamba SSM 캐시 설정, 그리고 5개 토큰에 대한 MTP 추측 디코딩이 카드에 모두 명시되어 있습니다.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

이 체크포인트가 중요한 이유: 그것은 IMO 2026 시스템 내부에 있었기 때문입니다.

IMO 2026 결과가 사람들이 이 모델을 주목하는 이유이므로, 중요한 구분은 다음과 같습니다: 30/42는 단일 모델 점수가 아니라 시스템 점수입니다. NVIDIA의 제출물은 2단계 다중 체크포인트 파이프라인이었고, Nemotron-3-Labs-Ultra-Math-RL은 그 안에서 두 가지 역할을 수행하는 구성 요소였습니다.

보고서에 따르면 첫 번째 단계는 문제당 최대 8라운드까지 생성-검증-정제(generate–verify–refine) 반복 탐색을 실행했다. 1라운드에서는 384개의 증명 시도를 샘플링했는데, 이는 세 가지 체크포인트(일반 공개 모델, SFT 전문가, RL 전문가) 각각에서 8개의 서로 다른 해법 전략 프롬프트로부터 각각 16개씩 추출한 것이다. 검색 시점의 검증은 RL 및 SFT 체크포인트를 두 모델 패널로 활용했다. 각 패널에서 8개의 독립적 판정을 내렸고, 총 16개 판정 모두가 1점을 부여한 경우에만 증명이 채택되었다. 이후의 고연산 단계에서는 모든 최종 후보를 세 가지 체크포인트 모두로 재채점했으며(각각 16개의 IMO 스타일 판정, 0~7점 척도), 문제당 하나의 제출물을 선택했다.

공식 결과는 논문에 보고되고 7월 말 보도와 일치하는 바에 따르면, IMO 2026 시험지에서 42점 만점에 30점을 획득하여 금메달 기준선인 29점을 초과했다. 문제 1, 2, 4, 5에서 만점을, 문제 3과 6에서 각각 1점을 받았으며, 공식 IMO 채점관들이 채점했다. NVIDIA 자체 리소스 계산에 따르면 제출된 6개의 증명은 모두 약 7억 700만 개의 생성 토큰과 1,464 GB200 GPU 시간 안에 발견되었다. 진행 중이던 라운드를 마무리함으로써 전체 실행은 약 23억 1천만 개의 토큰과 4,800 GB200 GPU 시간으로 늘어났다.

보고서에 나온 두 가지 내부 수치를 보면 RL 체크포인트가 앙상블에서 자리를 차지한 이유를 짐작할 수 있다. NVIDIA의 30문제 개발 세트에서 GPT-5.5, Gemini 3.1 Pro, Claude Opus 4.8로 구성된 독립 심사단이 MathArena 방식의 절차에 따라 평가한 결과, RL 전문 모델은 단일 체크포인트 파이프라인 중 종단 간 최고 성능을 보였다(가능한 총 210점 중 180점, SFT 전문 모델은 165점, 기본 모델은 162점). 다만 SFT 체크포인트는 1라운드에서 더 많은 문제를 풀었다. 또한 300개 증명으로 구성된 감사 세트에서 배포된 RL+SFT 검증 패널은 잘못된 증명에서 탐색을 종료시키는 오류인 오수락률을 약 1.1%로 낮췄는데, 이는 RL 체크포인트 단독 판정의 12.4%, 기본 모델의 31.6%와 대비된다. 보고서의 핵심은 이 두 선택적 전문 모델이 만장일치 규칙 아래에서 서로의 오류를 잡아낸다는 것이다.

이것들은 NVIDIA가 자체 개발 세트를 대상으로 직접 수행한 절제 실험 결과이며, NVIDIA 논문에 보고된 내용입니다. 즉, 설계가 작동하는 이유에 대한 공급업체 보고 증거로 취급해야지, 독립적인 점수로 간주해서는 안 됩니다. 개발 세트 자체는 30개 문제에 불과하며, 아직 어떤 외부 연구실도 이 체크포인트를 실행한 적이 없습니다.

RL 레시피, 간단히

훈련 데이터와 방법이 완전히 공개되었다는 것이 수학 추론 강화학습 연구를 하는 모든 이에게 실제 뉴스입니다. 보고서의 핵심 요점은 다음과 같습니다:

• 데이터 — 문제는 Nemotron-Math-Proofs-v1의 AoPS 하위 집합에서 가져온 것으로, 기본 Ultra 모델이 4회 시도 중 1~3회 내에 해결하는 문제들(DeepSeek-V3.2-Speciale의 판정 기준)로 필터링된, 어렵지만 해결 가능한 커리큘럼 문제입니다. 이 필터를 통해 9,597개의 증명 생성 프롬프트가 생성되며, Nemotron-Math-Proofs-v3-RL로 출시되었습니다.

• 보상 — DeepSeekMath-V2 설계를 따르지만 자기 분석 보상 항목은 제외합니다. 판정 신호는 학습 중 증명 판정 서비스에서 제공됩니다.

• 알고리즘 — NeMo-RL 기반의 비동기 강화 학습(RL)으로, 기본 개념은 PipelineRL과 유사하다. 즉, 고정된 프롬프트 풀을 처리 중인 상태로 계속 유지하고, 배치가 채워지면 완료된 시퀀스를 트레이너에 전달하며, 절단된 중요도 샘플링(truncated importance sampling)을 사용한다. 또한 엔트로피가 높아지면 양성 샘플에서 낮은 확률의 토큰을 마스킹한다. 이 구성은 131,072-토큰 컨텍스트와 약 128개의 트레이너 노드, 128개의 추론 노드, 각각 4× GB200 사양의 judge 노드 16개를 사용했다.

대조적으로, 형제 SFT 체크포인트는 동일한 기본 모델로부터 장문맥 지도 미세조정을 수행한 것으로, 15,818개 문제를 다루는 414,890개의 증명, 정제, 검증 및 메타-검증 추적으로 구성된 품질 필터링 말뭉치를 사용하여 512개의 GB200 GPU에서 실행되었습니다.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

아직 알려지지 않은 것은 무엇인가?

정직한 소싱은 여기서 양쪽에 모두 적용된다. 이번 출시에 관심을 가질지 결정하는 독자라면 네 가지 유의사항을 염두에 두어야 한다.

발표 없음. 글 작성 시점 기준으로 NVIDIA는 이 컬렉션을 공식적으로 발표하지 않았으며, Hugging Face에 등장했습니다. 기술 보고서 PDF는 9월 8일자이므로, 문서화된 레시피도 사실상 이번 주에 함께 공개되는 셈입니다.

독립적인 벤치마크는 없습니다. 이 체크포인트에 대한 모든 성능 수치(개발 세트 절제 실험, 검증기 감사, IMO 2026 시스템 점수)는 NVIDIA 자체 보고서에서 비롯되었습니다. IMO 점수 자체는 공식 대회 조건에서 채점되었기에 이 수치들 중 출처가 가장 확실하지만, 이는 시스템 수준의 결과이며, 이 체크포인트가 그 결과에 기여한 부분은 외부 연구소가 재현한 바 없습니다.

호스팅 API도, 정가도 없습니다. 이것은 자체 호스팅 릴리스입니다. 이를 호출하려면 하드웨어가 필요합니다. 7월의 "NVIDIA Nemotron 3 Ultra가 IMO 2026에서 금메달을 획득했다"는 보도는 "이것을 다운로드하면 올림피아드 문제를 푼다"로 쉽게 오독될 수 있습니다. 정직한 버전은 "실제로 그 문제를 풀었던 시스템의 구성 요소를 다운로드하는 것"입니다.

금메달 프레이밍. NVIDIA 자체 표현은 “금메달 기준 도달”이며, 논문은 해당 모델이 앙상블의 일부였다는 점을 조심스럽게 언급한다. 이 단일 체크포인트만으로 “금메달 수준”이라는 주장은 근거가 없는 것으로 간주하라.

이 문서는 누구를 위한 것인가

이 릴리스는 특정 독자를 대상으로 한다. 수학적 추론, 증명 생성, 또는 검증 가능한 보상을 통한 강화 학습(RL)을 연구하는 연구소나 연구자로서, 자연어로 올림피아드 금상 기준을 통과한 시스템의 레퍼런스 구현을 원하는 독자 말이다. — 형식적 증명기 없이, 도구 없이, 인터넷 없이. 그런 독자에게 가치는 전체 패키지에 있다. 가중치, SFT 및 RL 코퍼스, NeMo-Gym 형식의 프롬프트, 추론 파이프라인, 제출된 증명들, 그리고 실제 대회 실행이 GPU 시간으로 얼마의 비용이 드는지를 보여주는 컴퓨팅 비용 정산까지.

다른 모든 이들을 위한 실용적인 참고사항은, 올림피아드 수준의 증명 탐색은 대부분의 실제 수학 작업에는 과하다는 것입니다. AIME 및 경시대회 수준의 문제들과, 실질적으로 코드 내 응용 수학 작업은 훨씬 더 작은 모델로도 충분히 처리됩니다. 이는 550B 체크포인트가 배치 작업을 위해 간단히 띄울 수 있는 대상이 아니기 때문에 중요한 점입니다. 더 작은 오픈 수학 모델과 최첨단 API 모델은 OrcaRouter에서 단일 API를 통해 제공업체의 공시 가격 그대로 접근할 수 있습니다(저희 측 마크업은 없으므로, 공급업체의 가격 인하가 같은 날 바로 적용됩니다). 또한 검증되지 않은 모델을 프로덕션 경로에 걸지 않고 시험해보고 싶다면 자동 장애 조치(failover)가 지원됩니다. 거기서부터 시작하세요. 워크로드가 정말로 최전선 규모의 증명 탐색을 요구하는 경우에만 550B를 자체 호스팅하세요.

지켜봐야 할 미해결 과제는 이번의 조용한 공개가 공식 발표와 정식 릴리스 노트로 이어질지, 그리고 NVIDIA 외부의 누군가가 그 레시피를 처음부터 끝까지 실행해 독립적인 IMO-Bench 점수를 보고할지 여부다. 그 벤치마크 — 공개된 적 없는 새로운 올림피아드 문제 200개 — 는 이 컬렉션에서 가장 유용한 산출물이라고 볼 수 있다. 이는 이 분야에 그동안 빠져 있던 오염 저항성 평가 방식에 정확히 해당하기 때문이다. 레시피가 재현된다면, 이번 주의 조용한 Hugging Face 업로드는 올해 가장 영향력 있는 오픈 모델 공개 중 하나로 판명될 것이다. 그렇지 않더라도 이 컬렉션은 generate–verify–refine을 프런티어 규모로 한 차례 실행하는 데 실제로 무엇이 요구되었는지를 상세하고 정직하게 기록한 문서로 남는다.

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트