
Nemotron-3-Labs-Ultra-Math-RL: NVIDIA Diam-diam Membuka Sumber Checkpoint RL di Balik Larinya di IMO 2026
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Kecerdasan49Koding
NVIDIA merilis Nemotron-3-Labs-Ultra-Math-RL di Hugging Face pada 2–3 September 2026, tanpa postingan blog, tanpa pengumuman di X, dan tanpa siaran pers — kartu modelnya muncul begitu saja, bertanggal 3 September, dan menjelaskan dirinya dalam satu baris: ia adalah checkpoint hasil reinforcement learning yang disebut sebagai "Nemotron-3-Ultra-RL" dalam laporan teknis pendamping NVIDIA dan "digunakan sebagai bagian dari sistem ansambel yang meraih skor setingkat medali emas pada Olimpiade Matematika Internasional 2026." Skor resmi sistem tersebut — 30 dari 42 poin, melampaui ambang medali emas 29 poin — banyak diberitakan pada akhir Juli, ketika base model telah membuka bobotnya untuk publik sejak Juni. Yang tidak dapat diunduh saat itu adalah sepasang spesialis pasca-pelatihan yang sebenarnya digunakan dalam pelaksanaan kompetisi tersebut. Salah satunya kini berada di repositori publik Hugging Face dengan nol suka dan jumlah unduhan yang hampir nol.
Ini adalah kisah rilis yang senyap, jadi ada baiknya bersikap presisi tentang apa yang dapat diketahui dan apa yang tidak. Dari repositori dan laporan, dapat diketahui: arsitektur checkpoint, resep pelatihannya, peran yang dimainkannya dalam pengajuan IMO 2026, serta dataset dan benchmark yang dirilis NVIDIA bersamanya. Belum dapat dikonfirmasi: pengumuman vendor mana pun, benchmark pihak ketiga independen mana pun atas checkpoint ini, dan API yang dihosting mana pun — ini adalah rilis bobot yang dihosting sendiri di bawah lisensi OpenMDW-1.1, dan menjalankannya berarti menyiapkan sekitar 1,5 TB HBM kelas Blackwell.
Apa yang benar-benar dirilis minggu ini
Repositori nvidia/Nemotron-3-Labs-Ultra-Math-RL dibuat di Hugging Face pada 2 September 2026 (19:11 UTC) dan terakhir dimodifikasi pada 8 September. Repositori ini adalah salah satu item dalam rilis terkoordinasi yang dikumpulkan di bawah nvidia/nemotron-labs-imo-2026, yang berisi:
• Kedua checkpoint kompetisi pasca-pelatihan — Nemotron-3-Labs-Ultra-Math-RL (subjek ini) dan saudaranya yang merupakan hasil fine-tuning terawasi Nemotron-3-Labs-Ultra-Math-SFT, keduanya di bawah OpenMDW-1.1.
• Dua korpus pelatihan di belakangnya — Nemotron-Math-Proofs-v3-SFT dan Nemotron-Math-Proofs-v3-RL, keduanya CC-BY-4.0.
• Nemotron-IMO-Bench, sebuah tolok ukur evaluasi baru yang berisi 200 soal tingkat olimpiade yang belum dipublikasikan (50 aljabar, 50 kombinatorika, 50 geometri, 50 teori bilangan), masing-masing dilengkapi dengan bukti referensi yang dikurasi manusia, dibuat bersama matematikawan Titu Andreescu secara khusus agar soal-soal tersebut tidak muncul di dalam set pelatihan mana pun.
• Checkpoint dasar NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, yang merupakan dasar dari mana semua model tersebut di-fine-tune.
Deskripsi koleksi merujuk pada laporan teknis yang menyatukan semuanya: “An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics” (PDF di repositori NeMo-Skills NVIDIA bertanggal 8 September 2026). Selain checkpoint-nya, NVIDIA merilis pipeline inferensi, bukti-bukti yang diserahkan, resep pelatihan RL, serta akuntansi komputasi lengkap atas jalannya kompetisi. Pendekatan ini secara eksplisit mengusung sains yang dapat direproduksi: ini adalah pernyataan NVIDIA bahwa semua yang dibutuhkan untuk membangun kembali sistem tersedia di sini.
Apa itu Nemotron-3-Labs-Ultra-Math-RL
Secara arsitektural, ini bukan model dasar baru — ini adalah fine-tune dari versi ketersediaan umum NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16, checkpoint Mamba2–Transformer hibrida Latent Mixture-of-Experts yang pertama kali dirilis oleh NVIDIA pada 4 Juni 2026. Checkpoint Math-RL mempertahankan arsitektur dan skala tersebut: 550B total parameter dengan 55B aktif, prediksi multi-token, dan dukungan untuk jendela konteks hingga 1M token. Yang diubah oleh pelatihan RL adalah spesialisasinya, dan spesialisasi itu sengaja dibuat sempit:
• Tujuan — memecahkan soal-soal matematika kompetisi yang sulit dan bertindak sebagai penilai pembuktian: model dilatih untuk menghasilkan solusi yang ketat, menilai sendiri solusi tersebut berdasarkan rubrik 0 / 0,5 / 1, dan mengidentifikasi kesalahan dalam pembuktian.
• Ini bukan chatbot umum — kartu dan laporan tersebut menggambarkan pekerja spesialis untuk pipeline pencarian bukti, bukan asisten yang mengikuti instruksi.
• Lisensi — OpenMDW-1.1, lisensi model terbuka yang permisif dari NVIDIA yang memungkinkan penggunaan komersial dan non-komersial, sama seperti model dasar dan rilis teacher Nemotron Labs sebelumnya.
• Deployment — tidak ada harga list yang di-host di mana pun; Anda mengunduh safetensors dan melakukan self-host. Konfigurasi referensi NVIDIA adalah satu node dengan 8× B200 (~1,5 TB HBM agregat), dengan opsi multi-node di seluruh H100/H200/GB200/GB300. vLLM adalah runtime yang direkomendasikan, dengan parser penalaran, parser panggilan alat Qwen3-Coder, pengaturan cache Mamba SSM, dan decoding spekulatif MTP pada 5 token semuanya disebutkan dalam kartu tersebut.

Mengapa checkpoint ini penting: ia berada di dalam sistem IMO 2026
Hasil IMO 2026 adalah alasan mengapa orang melihat model ini, jadi perbedaan yang penting adalah: 30/42 adalah skor sistem, bukan skor model tunggal. Pengajuan NVIDIA adalah pipeline dua tahap dengan banyak checkpoint, dan Nemotron-3-Labs-Ultra-Math-RL adalah komponen yang memiliki dua tugas di dalamnya.
Menurut laporan, tahap pertama menjalankan pencarian generasi–verifikasi–penyempurnaan secara iteratif hingga delapan putaran per soal. Putaran pertama mengambil sampel 384 upaya pembuktian — masing-masing 16 dari delapan prompt strategi solusi yang berbeda, di masing-masing dari tiga titik pemeriksaan: model ketersediaan umum, spesialis SFT, dan spesialis RL. Verifikasi saat pencarian menggunakan titik pemeriksaan RL dan SFT sebagai panel dua model: delapan penilaian independen dari masing-masing, dan sebuah bukti diterima hanya jika semua 16 penilaian memberinya skor 1. Tahap komputasi tinggi berikutnya menilai ulang setiap finalis dengan ketiga titik pemeriksaan (masing-masing 16 penilaian ala IMO, pada skala 0–7) dan memilih satu kiriman per soal.
Hasil resminya, sebagaimana dilaporkan dalam makalah tersebut dan sesuai dengan liputan akhir Juli: 30 dari 42 poin pada kertas soal IMO 2026, melampaui batas perolehan medali emas 29 poin, dengan nilai sempurna pada Soal 1, 2, 4, dan 5 serta satu poin masing-masing pada Soal 3 dan 6, yang dinilai oleh penilai resmi IMO. Perhitungan sumber daya NVIDIA sendiri menunjukkan bahwa keenam bukti yang dikirimkan ditemukan dalam sekitar 707 juta token yang dihasilkan dan 1.464 GB200 GPU-jam; penyelesaian putaran yang sedang berlangsung membuat keseluruhan proses menjadi sekitar 2,31 miliar token dan 4.800 GB200 GPU-jam.
Dua angka internal dari laporan tersebut memberikan gambaran mengapa checkpoint RL layak menempati posisinya dalam ensemble. Pada set pengembangan berisi 30 soal milik NVIDIA, yang dinilai oleh juri independen GPT-5.5, Gemini 3.1 Pro, dan Claude Opus 4.8 mengikuti prosedur ala MathArena, spesialis RL merupakan pipeline satu-checkpoint terbaik secara end-to-end (180 dari 210 poin juri yang mungkin, dibandingkan 165 untuk spesialis SFT dan 162 untuk model dasar), meskipun checkpoint SFT memecahkan lebih banyak soal di putaran pertama. Selain itu, pada set audit berisi 300 bukti, panel verifikasi RL+SFT yang diterapkan menurunkan tingkat false-accept — kegagalan yang mengakhiri penelusuran pada bukti invalid — menjadi sekitar 1,1%, dibandingkan 12,4% untuk checkpoint RL yang menilai sendirian dan 31,6% untuk model dasar. Poin laporan tersebut adalah bahwa kedua spesialis selektif itu saling menangkap kesalahan satu sama lain di bawah aturan suara bulat.
Ini adalah ablasi yang dilakukan NVIDIA sendiri pada development set milik NVIDIA sendiri, sebagaimana dilaporkan dalam paper NVIDIA — patut diperlakukan sebagai bukti yang dilaporkan vendor tentang mengapa desain ini bekerja, bukan sebagai skor independen. Development set itu sendiri hanya berisi 30 soal, dan belum ada laboratorium luar yang menjalankan checkpoint ini.
Resep RL, secara singkat
Data pelatihan dan metodenya sepenuhnya terbuka, yang merupakan berita sebenarnya bagi siapa pun yang melakukan penelitian RL untuk penalaran matematika. Poin-poin penting dari laporan tersebut:
• Data — soal-soal diambil dari subset AoPS dari Nemotron-Math-Proofs-v1, disaring hingga yang berhasil dipecahkan oleh model Ultra dasar dalam satu hingga tiga dari empat percobaan (sesuai penilaian DeepSeek-V3.2-Speciale) — soal kurikulum yang menantang namun tetap dapat dikerjakan. Penyaringan tersebut menghasilkan 9.597 prompt pembuatan bukti, dirilis sebagai Nemotron-Math-Proofs-v3-RL.
• Reward — mengikuti desain DeepSeekMath-V2 tetapi menghilangkan istilah reward analisis-diri; sinyal penilai berasal dari layanan penilai bukti selama pelatihan.
• Algoritma — RL asinkron yang dibangun di atas NeMo-RL, serupa semangatnya dengan PipelineRL: kumpulan prompt tetap yang dipertahankan dalam proses, sekuens yang selesai diumpankan ke trainer saat batch terisi, importance sampling yang dipangkas (truncated), dan token berprobabilitas rendah yang dimasking pada sampel positif saat entropi meningkat. Konfigurasi tersebut menggunakan konteks 131.072 token dengan sekitar 128 node trainer, 128 node inferensi, dan 16 node judge yang masing-masing berisi 4× GB200.
Sebagai perbandingan, checkpoint SFT saudaranya adalah hasil fine-tune terawasi berkonteks panjang dari model dasar yang sama, menggunakan korpus hasil filter kualitas yang memuat 414.890 jejak pembuktian, penyempurnaan, verifikasi, dan meta-verifikasi untuk 15.818 masalah, dan dilatih pada 512 GPU GB200.

Apa yang belum diketahui
Sumber yang jujur berlaku dua arah di sini, dan seorang pembaca yang memutuskan apakah akan peduli dengan rilis ini harus mengingat empat peringatan:
• Tidak ada pengumuman. Pada saat tulisan ini dibuat, NVIDIA belum secara resmi mengumumkan koleksi tersebut; koleksi itu muncul di Hugging Face. PDF laporan teknisnya bertanggal 8 September, jadi resep tertulisnya secara efektif juga diterbitkan minggu ini.
• Tidak ada benchmark independen. Setiap angka performa yang melekat pada checkpoint ini — ablasi dev-set, audit verifier, skor sistem IMO 2026 — berasal dari laporan NVIDIA sendiri. Skor IMO itu sendiri memiliki asal-usul terkuat di antara semua data tersebut karena dinilai dalam kondisi kompetisi resmi, tetapi itu adalah hasil tingkat sistem, dan kontribusi checkpoint terhadapnya bukanlah hal yang telah direproduksi oleh laboratorium eksternal.
• Tidak ada API yang dihosting, tidak ada harga yang tercantum. Ini adalah rilis self-host. Siapa pun yang ingin memanggilnya memerlukan perangkat keras. Liputan bulan Juli tentang "NVIDIA Nemotron 3 Ultra meraih emas di IMO 2026" dapat dengan mudah disalahpahami sebagai "unduh ini dan ia memecahkan masalah olimpiade" — versi yang jujur adalah "unduh komponen-komponen sistem yang melakukannya."
• Pembingkaian 'medali emas'-nya. Istilah yang dipakai NVIDIA sendiri adalah "mencapai ambang batas medali emas", dan makalah itu dengan cermat menyebutkan bahwa model tersebut merupakan bagian dari sebuah ansambel. Anggap semua klaim bahwa satu checkpoint ini sendirian "setingkat medali emas" sebagai tidak berdasar.
Untuk siapa ini
Rilis ini ditujukan untuk pembaca spesifik: laboratorium atau peneliti yang bekerja pada penalaran matematis, pembuatan bukti, atau RL dengan imbalan yang dapat diverifikasi, yang menginginkan implementasi referensi dari sebuah sistem yang menembus ambang emas olimpiade dalam bahasa alami — tanpa prover formal, tanpa alat, tanpa internet. Bagi pembaca tersebut, nilainya adalah keseluruhan paket: bobot, korpora SFT dan RL, prompt berformat NeMo-Gym, pipa inferensi, bukti yang diajukan, dan perhitungan komputasi yang menunjukkan biaya sebenarnya dari sebuah kompetisi dalam jam GPU.
Bagi yang lain, catatan praktisnya adalah bahwa pencarian pembuktian tingkat olimpiade itu berlebihan untuk sebagian besar beban kerja matematika nyata. Soal-soal tingkat AIME dan kontes, serta pada dasarnya semua pekerjaan matematika terapan dalam kode, dapat ditangani dengan nyaman oleh model yang jauh lebih kecil — yang ini penting karena checkpoint 550B bukanlah sesuatu yang bisa Anda jalankan untuk pekerjaan batch. Model matematika terbuka yang lebih kecil dan model API frontier dapat diakses melalui satu API di OrcaRouter dengan harga sesuai daftar harga penyedia (tanpa markup dari pihak kami, jadi penurunan harga vendor langsung berlaku di hari yang sama), dengan failover otomatis jika Anda ingin mencoba model yang belum terbukti tanpa mempertaruhkan jalur produksi padanya. Mulailah dari sana; lakukan self-host untuk 550B hanya ketika beban kerja benar-benar menuntut pencarian pembuktian skala frontier.
Pertanyaan terbuka yang perlu diperhatikan adalah apakah penurunan yang tenang ini akan mendapat pengumuman resmi dan catatan rilis formal, dan apakah ada orang di luar NVIDIA yang menjalankan resep tersebut dari awal hingga akhir dan melaporkan skor IMO-Bench independen. Tolok ukur itu — 200 soal olimpiade baru yang belum dipublikasikan — bisa dibilang artefak paling berguna dalam koleksi tersebut: ini persis jenis evaluasi yang tahan kontaminasi yang selama ini kurang di bidang ini. Jika resep tersebut dapat direproduksi, unggahan senyap Hugging Face minggu ini akan menjadi salah satu rilis model terbuka paling berpengaruh tahun ini. Jika tidak, koleksi tersebut tetap merupakan catatan terperinci dan jujur tentang apa yang sebenarnya dibutuhkan oleh satu proses generate–verify–refine berskala frontier.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
