Kartu judul hero untuk Nemotron-3-Labs-Ultra-Math-RL, dengan subjudul 'Checkpoint RL IMO 2026 yang dirilis open-source secara senyap', serta chip spesifikasi bertuliskan '550B total / 55B aktif', 'Lisensi OpenMDW-1.1', 'Dirilis Sep 2026'.
Engineering & Research

Nemotron-3-Labs-Ultra-Math-RL: NVIDIA Diam-diam Membuka Sumber Checkpoint RL di Balik Larinya di IMO 2026

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

NVIDIA merilis Nemotron-3-Labs-Ultra-Math-RL di Hugging Face pada 2–3 September 2026, tanpa postingan blog, tanpa pengumuman di X, dan tanpa siaran pers — kartu modelnya muncul begitu saja, bertanggal 3 September, dan menjelaskan dirinya dalam satu baris: ia adalah checkpoint hasil reinforcement learning yang disebut sebagai "Nemotron-3-Ultra-RL" dalam laporan teknis pendamping NVIDIA dan "digunakan sebagai bagian dari sistem ansambel yang meraih skor setingkat medali emas pada Olimpiade Matematika Internasional 2026." Skor resmi sistem tersebut — 30 dari 42 poin, melampaui ambang medali emas 29 poin — banyak diberitakan pada akhir Juli, ketika base model telah membuka bobotnya untuk publik sejak Juni. Yang tidak dapat diunduh saat itu adalah sepasang spesialis pasca-pelatihan yang sebenarnya digunakan dalam pelaksanaan kompetisi tersebut. Salah satunya kini berada di repositori publik Hugging Face dengan nol suka dan jumlah unduhan yang hampir nol.

Ini adalah kisah rilis yang senyap, jadi ada baiknya bersikap presisi tentang apa yang dapat diketahui dan apa yang tidak. Dari repositori dan laporan, dapat diketahui: arsitektur checkpoint, resep pelatihannya, peran yang dimainkannya dalam pengajuan IMO 2026, serta dataset dan benchmark yang dirilis NVIDIA bersamanya. Belum dapat dikonfirmasi: pengumuman vendor mana pun, benchmark pihak ketiga independen mana pun atas checkpoint ini, dan API yang dihosting mana pun — ini adalah rilis bobot yang dihosting sendiri di bawah lisensi OpenMDW-1.1, dan menjalankannya berarti menyiapkan sekitar 1,5 TB HBM kelas Blackwell.

Apa yang benar-benar dirilis minggu ini

Repositori nvidia/Nemotron-3-Labs-Ultra-Math-RL dibuat di Hugging Face pada 2 September 2026 (19:11 UTC) dan terakhir dimodifikasi pada 8 September. Repositori ini adalah salah satu item dalam rilis terkoordinasi yang dikumpulkan di bawah nvidia/nemotron-labs-imo-2026, yang berisi:

• Kedua checkpoint kompetisi pasca-pelatihan — Nemotron-3-Labs-Ultra-Math-RL (subjek ini) dan saudaranya yang merupakan hasil fine-tuning terawasi Nemotron-3-Labs-Ultra-Math-SFT, keduanya di bawah OpenMDW-1.1.

• Dua korpus pelatihan di belakangnya — Nemotron-Math-Proofs-v3-SFT dan Nemotron-Math-Proofs-v3-RL, keduanya CC-BY-4.0.

• Nemotron-IMO-Bench, sebuah tolok ukur evaluasi baru yang berisi 200 soal tingkat olimpiade yang belum dipublikasikan (50 aljabar, 50 kombinatorika, 50 geometri, 50 teori bilangan), masing-masing dilengkapi dengan bukti referensi yang dikurasi manusia, dibuat bersama matematikawan Titu Andreescu secara khusus agar soal-soal tersebut tidak muncul di dalam set pelatihan mana pun.

• Checkpoint dasar NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, yang merupakan dasar dari mana semua model tersebut di-fine-tune.

Deskripsi koleksi merujuk pada laporan teknis yang menyatukan semuanya: “An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics” (PDF di repositori NeMo-Skills NVIDIA bertanggal 8 September 2026). Selain checkpoint-nya, NVIDIA merilis pipeline inferensi, bukti-bukti yang diserahkan, resep pelatihan RL, serta akuntansi komputasi lengkap atas jalannya kompetisi. Pendekatan ini secara eksplisit mengusung sains yang dapat direproduksi: ini adalah pernyataan NVIDIA bahwa semua yang dibutuhkan untuk membangun kembali sistem tersedia di sini.

Apa itu Nemotron-3-Labs-Ultra-Math-RL

Secara arsitektural, ini bukan model dasar baru — ini adalah fine-tune dari versi ketersediaan umum NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, checkpoint Mamba2–Transformer hibrida Latent Mixture-of-Experts yang pertama kali dirilis oleh NVIDIA pada 4 Juni 2026. Checkpoint Math-RL mempertahankan arsitektur dan skala tersebut: 550B total parameter dengan 55B aktif, prediksi multi-token, dan dukungan untuk jendela konteks hingga 1M token. Yang diubah oleh pelatihan RL adalah spesialisasinya, dan spesialisasi itu sengaja dibuat sempit:

• Tujuan — memecahkan soal-soal matematika kompetisi yang sulit dan bertindak sebagai penilai pembuktian: model dilatih untuk menghasilkan solusi yang ketat, menilai sendiri solusi tersebut berdasarkan rubrik 0 / 0,5 / 1, dan mengidentifikasi kesalahan dalam pembuktian.

• Ini bukan chatbot umum — kartu dan laporan tersebut menggambarkan pekerja spesialis untuk pipeline pencarian bukti, bukan asisten yang mengikuti instruksi.

• Lisensi — OpenMDW-1.1, lisensi model terbuka yang permisif dari NVIDIA yang memungkinkan penggunaan komersial dan non-komersial, sama seperti model dasar dan rilis teacher Nemotron Labs sebelumnya.

• Deployment — tidak ada harga list yang di-host di mana pun; Anda mengunduh safetensors dan melakukan self-host. Konfigurasi referensi NVIDIA adalah satu node dengan 8× B200 (~1,5 TB HBM agregat), dengan opsi multi-node di seluruh H100/H200/GB200/GB300. vLLM adalah runtime yang direkomendasikan, dengan parser penalaran, parser panggilan alat Qwen3-Coder, pengaturan cache Mamba SSM, dan decoding spekulatif MTP pada 5 token semuanya disebutkan dalam kartu tersebut.

Single-column scoreboard for Nemotron-3-Labs-Ultra-Math-RL: Released Sep 2026 quiet drop; Base Nemotron-3-Ultra-550B-A55B; 550B total / 55B active; IMO 2026 system 30/42 with gold cutoff 29; RL data 9,597 proof prompts; License OpenMDW-1.1. Footer: the IMO 2026 score is NVIDIA's system result, not this checkpoint alone; no independent scores yet.

Mengapa checkpoint ini penting: ia berada di dalam sistem IMO 2026

Hasil IMO 2026 adalah alasan mengapa orang melihat model ini, jadi perbedaan yang penting adalah: 30/42 adalah skor sistem, bukan skor model tunggal. Pengajuan NVIDIA adalah pipeline dua tahap dengan banyak checkpoint, dan Nemotron-3-Labs-Ultra-Math-RL adalah komponen yang memiliki dua tugas di dalamnya.

Menurut laporan, tahap pertama menjalankan pencarian generasi–verifikasi–penyempurnaan secara iteratif hingga delapan putaran per soal. Putaran pertama mengambil sampel 384 upaya pembuktian — masing-masing 16 dari delapan prompt strategi solusi yang berbeda, di masing-masing dari tiga titik pemeriksaan: model ketersediaan umum, spesialis SFT, dan spesialis RL. Verifikasi saat pencarian menggunakan titik pemeriksaan RL dan SFT sebagai panel dua model: delapan penilaian independen dari masing-masing, dan sebuah bukti diterima hanya jika semua 16 penilaian memberinya skor 1. Tahap komputasi tinggi berikutnya menilai ulang setiap finalis dengan ketiga titik pemeriksaan (masing-masing 16 penilaian ala IMO, pada skala 0–7) dan memilih satu kiriman per soal.

Hasil resminya, sebagaimana dilaporkan dalam makalah tersebut dan sesuai dengan liputan akhir Juli: 30 dari 42 poin pada kertas soal IMO 2026, melampaui batas perolehan medali emas 29 poin, dengan nilai sempurna pada Soal 1, 2, 4, dan 5 serta satu poin masing-masing pada Soal 3 dan 6, yang dinilai oleh penilai resmi IMO. Perhitungan sumber daya NVIDIA sendiri menunjukkan bahwa keenam bukti yang dikirimkan ditemukan dalam sekitar 707 juta token yang dihasilkan dan 1.464 GB200 GPU-jam; penyelesaian putaran yang sedang berlangsung membuat keseluruhan proses menjadi sekitar 2,31 miliar token dan 4.800 GB200 GPU-jam.

Dua angka internal dari laporan tersebut memberikan gambaran mengapa checkpoint RL layak menempati posisinya dalam ensemble. Pada set pengembangan berisi 30 soal milik NVIDIA, yang dinilai oleh juri independen GPT-5.5, Gemini 3.1 Pro, dan Claude Opus 4.8 mengikuti prosedur ala MathArena, spesialis RL merupakan pipeline satu-checkpoint terbaik secara end-to-end (180 dari 210 poin juri yang mungkin, dibandingkan 165 untuk spesialis SFT dan 162 untuk model dasar), meskipun checkpoint SFT memecahkan lebih banyak soal di putaran pertama. Selain itu, pada set audit berisi 300 bukti, panel verifikasi RL+SFT yang diterapkan menurunkan tingkat false-accept — kegagalan yang mengakhiri penelusuran pada bukti invalid — menjadi sekitar 1,1%, dibandingkan 12,4% untuk checkpoint RL yang menilai sendirian dan 31,6% untuk model dasar. Poin laporan tersebut adalah bahwa kedua spesialis selektif itu saling menangkap kesalahan satu sama lain di bawah aturan suara bulat.

Ini adalah ablasi yang dilakukan NVIDIA sendiri pada development set milik NVIDIA sendiri, sebagaimana dilaporkan dalam paper NVIDIA — patut diperlakukan sebagai bukti yang dilaporkan vendor tentang mengapa desain ini bekerja, bukan sebagai skor independen. Development set itu sendiri hanya berisi 30 soal, dan belum ada laboratorium luar yang menjalankan checkpoint ini.

Resep RL, secara singkat

Data pelatihan dan metodenya sepenuhnya terbuka, yang merupakan berita sebenarnya bagi siapa pun yang melakukan penelitian RL untuk penalaran matematika. Poin-poin penting dari laporan tersebut:

• Data — soal-soal diambil dari subset AoPS dari Nemotron-Math-Proofs-v1, disaring hingga yang berhasil dipecahkan oleh model Ultra dasar dalam satu hingga tiga dari empat percobaan (sesuai penilaian DeepSeek-V3.2-Speciale) — soal kurikulum yang menantang namun tetap dapat dikerjakan. Penyaringan tersebut menghasilkan 9.597 prompt pembuatan bukti, dirilis sebagai Nemotron-Math-Proofs-v3-RL.

• Reward — mengikuti desain DeepSeekMath-V2 tetapi menghilangkan istilah reward analisis-diri; sinyal penilai berasal dari layanan penilai bukti selama pelatihan.

• Algoritma — RL asinkron yang dibangun di atas NeMo-RL, serupa semangatnya dengan PipelineRL: kumpulan prompt tetap yang dipertahankan dalam proses, sekuens yang selesai diumpankan ke trainer saat batch terisi, importance sampling yang dipangkas (truncated), dan token berprobabilitas rendah yang dimasking pada sampel positif saat entropi meningkat. Konfigurasi tersebut menggunakan konteks 131.072 token dengan sekitar 128 node trainer, 128 node inferensi, dan 16 node judge yang masing-masing berisi 4× GB200.

Sebagai perbandingan, checkpoint SFT saudaranya adalah hasil fine-tune terawasi berkonteks panjang dari model dasar yang sama, menggunakan korpus hasil filter kualitas yang memuat 414.890 jejak pembuktian, penyempurnaan, verifikasi, dan meta-verifikasi untuk 15.818 masalah, dan dilatih pada 512 GPU GB200.

Screenshot of NVIDIA's NeMo-Skills GitHub repository at recipes/nemotron-imo-tts, showing the released contents: configs, imo-proofs, nemotron_imo_tts, prompts, scripts, README.md, paper.pdf and run.py.

Apa yang belum diketahui

Sumber yang jujur berlaku dua arah di sini, dan seorang pembaca yang memutuskan apakah akan peduli dengan rilis ini harus mengingat empat peringatan:

Tidak ada pengumuman. Pada saat tulisan ini dibuat, NVIDIA belum secara resmi mengumumkan koleksi tersebut; koleksi itu muncul di Hugging Face. PDF laporan teknisnya bertanggal 8 September, jadi resep tertulisnya secara efektif juga diterbitkan minggu ini.

Tidak ada benchmark independen. Setiap angka performa yang melekat pada checkpoint ini — ablasi dev-set, audit verifier, skor sistem IMO 2026 — berasal dari laporan NVIDIA sendiri. Skor IMO itu sendiri memiliki asal-usul terkuat di antara semua data tersebut karena dinilai dalam kondisi kompetisi resmi, tetapi itu adalah hasil tingkat sistem, dan kontribusi checkpoint terhadapnya bukanlah hal yang telah direproduksi oleh laboratorium eksternal.

Tidak ada API yang dihosting, tidak ada harga yang tercantum. Ini adalah rilis self-host. Siapa pun yang ingin memanggilnya memerlukan perangkat keras. Liputan bulan Juli tentang "NVIDIA Nemotron 3 Ultra meraih emas di IMO 2026" dapat dengan mudah disalahpahami sebagai "unduh ini dan ia memecahkan masalah olimpiade" — versi yang jujur adalah "unduh komponen-komponen sistem yang melakukannya."

Pembingkaian 'medali emas'-nya. Istilah yang dipakai NVIDIA sendiri adalah "mencapai ambang batas medali emas", dan makalah itu dengan cermat menyebutkan bahwa model tersebut merupakan bagian dari sebuah ansambel. Anggap semua klaim bahwa satu checkpoint ini sendirian "setingkat medali emas" sebagai tidak berdasar.

Untuk siapa ini

Rilis ini ditujukan untuk pembaca spesifik: laboratorium atau peneliti yang bekerja pada penalaran matematis, pembuatan bukti, atau RL dengan imbalan yang dapat diverifikasi, yang menginginkan implementasi referensi dari sebuah sistem yang menembus ambang emas olimpiade dalam bahasa alami — tanpa prover formal, tanpa alat, tanpa internet. Bagi pembaca tersebut, nilainya adalah keseluruhan paket: bobot, korpora SFT dan RL, prompt berformat NeMo-Gym, pipa inferensi, bukti yang diajukan, dan perhitungan komputasi yang menunjukkan biaya sebenarnya dari sebuah kompetisi dalam jam GPU.

Bagi yang lain, catatan praktisnya adalah bahwa pencarian pembuktian tingkat olimpiade itu berlebihan untuk sebagian besar beban kerja matematika nyata. Soal-soal tingkat AIME dan kontes, serta pada dasarnya semua pekerjaan matematika terapan dalam kode, dapat ditangani dengan nyaman oleh model yang jauh lebih kecil — yang ini penting karena checkpoint 550B bukanlah sesuatu yang bisa Anda jalankan untuk pekerjaan batch. Model matematika terbuka yang lebih kecil dan model API frontier dapat diakses melalui satu API di OrcaRouter dengan harga sesuai daftar harga penyedia (tanpa markup dari pihak kami, jadi penurunan harga vendor langsung berlaku di hari yang sama), dengan failover otomatis jika Anda ingin mencoba model yang belum terbukti tanpa mempertaruhkan jalur produksi padanya. Mulailah dari sana; lakukan self-host untuk 550B hanya ketika beban kerja benar-benar menuntut pencarian pembuktian skala frontier.

Pertanyaan terbuka yang perlu diperhatikan adalah apakah penurunan yang tenang ini akan mendapat pengumuman resmi dan catatan rilis formal, dan apakah ada orang di luar NVIDIA yang menjalankan resep tersebut dari awal hingga akhir dan melaporkan skor IMO-Bench independen. Tolok ukur itu — 200 soal olimpiade baru yang belum dipublikasikan — bisa dibilang artefak paling berguna dalam koleksi tersebut: ini persis jenis evaluasi yang tahan kontaminasi yang selama ini kurang di bidang ini. Jika resep tersebut dapat direproduksi, unggahan senyap Hugging Face minggu ini akan menjadi salah satu rilis model terbuka paling berpengaruh tahun ini. Jika tidak, koleksi tersebut tetap merupakan catatan terperinci dan jujur tentang apa yang sebenarnya dibutuhkan oleh satu proses generate–verify–refine berskala frontier.

Screenshot of the Hugging Face collection page 'Nemotron Labs IMO 2026' listing the six released artifacts: the Nemotron-3-Labs-Ultra-Math-SFT and Nemotron-3-Labs-Ultra-Math-RL checkpoints, the NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 base model, the Nemotron-Math-Proofs-v3-SFT and Nemotron-Math-Proofs-v3-RL datasets, and the Nemotron-IMO-Bench benchmark.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari