Kartu judul hero untuk artikel berita 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning' yang bertuliskan 'Guru penalaran 550B di balik Nemotron 3 Ultra kini bersifat open weights', dengan ikon kotak open-weights, glif chip GPU, tag mesin vLLM / SGLang / TensorRT-LLM, lencana tanggal 'Dirilis 14 Agu 2026', dan logo OrcaRouter yang dipadukan di sudut kanan bawah.
Engineering & Research

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning: Guru Penalaran 550B di Balik Nemotron 3 Ultra Baru Saja Membuka Bobotnya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada tanggal 14 Agustus 2026, NVIDIA menerbitkan NVIDIA-Nemotron-Labs-Teacher-General-Reasoning di Hugging Face — sebuah model penalaran dengan 550B parameter yang, hingga kemarin, hanya ada di dalam pipeline pelatihan Nemotron 3 Ultra unggulannya. Model ini adalah teacher "general reasoning" dari resep Multi-Teacher On-Policy Distillation (MOPD) yang digunakan NVIDIA untuk melatih student 550B-A55B Ultra, dan perilisan ini penting karena alasan sederhana: dalam laporan teknis Nemotron 3 Ultra yang dirilis NVIDIA pada bulan Juni, resep pelatihan tersebut dengan jelas menyatakan bahwa checkpoint per-teacher tidak akan diopen-source. Yang satu ini sekarang dirilis — termasuk weights, tokenizer, chat template, dan konfigurasi serving — di bawah lisensi OpenMDW-1.1 yang ramah komersial. Sebuah saudaranya, NVIDIA-Nemotron-Labs-Teacher-STEM, dirilis pada hari yang sama, yang terlihat bukan sebagai rilis satu kali, melainkan awal dari panel teacher yang mulai dipublikasikan.

Apa sebenarnya model guru itu

{{1}}MOPD{{/1}} adalah teknik pasca-pelatihan yang memberikan penalaran agenik pada {{2}}Nemotron 3 Ultra{{/2}}. Alih-alih mendistilasi satu model guru besar ke dalam model siswa, NVIDIA melatih lebih dari sepuluh model guru yang terspesialisasi per domain — untuk penalaran, riset, analisis hukum, rekayasa perangkat lunak, penggunaan alat, dan bidang lainnya — lalu membiarkan model siswa menghasilkan rollout-nya sendiri dan menggunakan setiap model guru untuk menilai rollout tersebut di bidang keahliannya. Karena penilaian dilakukan pada keluaran on-policy milik siswa itu sendiri, bukan pada dataset offline yang statis, sinyal pelatihan tetap selaras dengan apa yang sebenarnya dihasilkan siswa pada saat inferensi. NVIDIA menyebut siklus ini sebagai {{3}}co-evolution{{/3}}: putaran guru baru diinisialisasi dari checkpoint siswa yang diperbarui, sehingga kedua sisi terus meningkat.

Checkpoint ini adalah anggota penalaran umum dari panel tersebut. Checkpoint ini dihasilkan dari siswa Nemotron 3 Ultra yang telah melalui pasca-pelatihan melalui putaran tambahan SFT berbasis penalaran dan pembelajaran penguatan, dan kartu model menggambarkannya sebagai yang dioptimalkan untuk jejak penalaran berkualitas tinggi yang diperluas pada masalah multi-langkah tersulit di bidang matematika, logika, dan penalaran abstrak — termasuk pembuktian formal dan pengodean kompetitif. Di dalam MOPD, ia memainkan beberapa peran sekaligus, satu checkpoint, banyak peran: pembuatan jejak penalaran, penilai matematika, dan penilai kesetaraan yang menilai jawaban singkat bentuk bebas terhadap referensi. NVIDIA juga mengirimkannya secara mandiri karena ia adalah penalar yang kuat dengan sendirinya — dimaksudkan untuk pembuatan jejak penalaran jangka panjang, pemecahan masalah sulit, dan bertindak sebagai guru atau penilai dalam pipa distilasi Anda sendiri.

Spesifikasi dalam satu kali proses

• Parameter — total 550B / 55B aktif, LatentMoE sparse

• Arsitektur — Mamba2-Transformer hibrida dengan mixture-of-experts laten dan Multi-Token Prediction (MTP)

Jendela konteks — hingga 1 juta token; default 256K pada konfigurasi serving referensi

• Bahasa — 10: Inggris, Prancis, Spanyol, Italia, Jerman, Jepang, Hindi, Korea, Portugis Brasil, Cina

• Lisensi — OpenMDW-1.1, penggunaan komersial dan non-komersial diperbolehkan

• Perangkat keras minimum — 4×B200 (bobot NVFP4); GB200/GB300 dan kelas H100 juga didukung

Arsitekturnya berada dalam keluarga yang sama dengan Nemotron 3 Ultra itu sendiri: bentuk 550B-A55B dengan lapisan Mamba-2 dan MoE yang terselang, lapisan attention yang dipilih, serta MTP heads untuk dekoding spekulatif native. Model gurunya bukanlah student yang lebih kecil — melainkan varian dari tumpukan yang sama yang dilatih secara berbeda, dikhususkan untuk penalaran horizon panjang, bukan untuk pekerjaan agen umum.

A single-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning listing 550B total / 55B active parameters, LatentMoE Mamba2-Transformer hybrid + MTP architecture, up to 1M token context, 10 languages, OpenMDW-1.1 commercial license, and vLLM / SGLang / TensorRT-LLM serving, with a footer noting the specs are per NVIDIA's model card and no independent benchmarks exist yet, and the OrcaRouter logo composited in the corner.

Mengapa Open-Source Seorang Guru Itu Penting

Checkpoint guru adalah jenis rilis model terbuka yang paling langka. Perusahaan menerbitkan siswa — model yang Anda gunakan — dan dataset sepanjang waktu; mereka hampir tidak pernah menerbitkan model yang menilai pekerjaan siswa. Itulah sebabnya baris laporan Juni bahwa checkpoint per guru tidak akan dirilis dibaca sebagai menutup pintu untuk mereproduksi pipeline MOPD dari awal hingga akhir. Rilis ini membuka pintu itu, setidaknya untuk guru penalaran.

Bagi tim yang membangun model penalaran mereka sendiri, itu adalah nilai yang nyata. Sinyal reward yang membentuk penalaran Nemotron 3 Ultra sebagian ditulis oleh checkpoint ini, dan kini dapat dipelajari secara langsung, dijalankan sebagai juri, atau digunakan untuk menghasilkan jejak penalaran jangka panjang untuk data SFT. Dikombinasikan dengan data pasca-pelatihan yang sudah terbuka (nvidia/nemotron-post-training-v3) dan resep pelatihan yang dipublikasikan, ini mempersempit kesenjangan antara "NVIDIA melatih model yang hebat" dan "kita bisa melatih model seperti itu."

A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card summary: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP architecture, up to 1M token context, minimum GPU requirements, supported languages, the openmdw-1.1 license tag, and the files and versions listing.

Dial berpikir

Satu fitur khas yang diwarisi dari keluarga Nemotron 3: penalaran adalah sebuah saklar, bukan pengaturan bawaan. Template obrolan menerima enable_thinking=true/false, opsi medium_effort, dan batas token reasoning_budget, sehingga pemanggil dapat memaksa penalaran mendalam berjangka panjang ketika suatu masalah membutuhkannya dan mendapatkan jawaban langsung — lebih cepat dan lebih murah — ketika tidak membutuhkannya. Bagi model guru, hal ini lebih penting daripada yang terlihat: proses distilasi menginginkan proses penilaian yang murah untuk sampel mudah dan jejak penalaran yang mahal untuk sampel sulit, dan satu checkpoint yang mendukung kedua mode menghilangkan kebutuhan untuk menukar model di tengah pipeline.

Menjalankannya

Ini bukan model yang akan Anda panggil dengan sembarangan. Pengaturan penyajian minimum yang masuk akal adalah 4×B200 dengan bobot NVFP4 dan cache KV fp8; konfigurasi referensi juga mencakup kotak multi-node GB200/GB300 dan kelas H100. NVIDIA menerbitkan panduan memasak untuk tiga mesin — vLLM (0.22), SGLang (0.5.13), dan TensorRT-LLM (1.3.0rc17) — semuanya mengekspos API yang kompatibel dengan OpenAI pada port 8000, dengan decoding spekulatif MTP atau EAGLE dan backend Mamba flashinfer. Konteks 1M token memerlukan flag izin eksplisit di setiap mesin (VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 dan yang setara); batas defaultnya adalah 256K.

Pada saat penulisan, model ini belum di-deploy oleh penyedia inferensi mana pun di Hugging Face dan NVIDIA belum mengumumkan hosting NIM — ini adalah rilis yang hanya berisi bobot (weights-only). Itu menjadikannya model untuk laboratorium yang sudah menjalankan armada GPU besar, atau untuk tim yang pipeline distilasinya secara khusus membutuhkan sinyal guru (teacher signal) yang tepat. Ketika model ini akhirnya tersedia di API terkelola, perhitungan harganya sederhana: ini adalah MoE 55B-aktif, dan siapa pun yang menghostingnya membebankan biaya sesuai harga GPU. Pada lapisan routing yang bekerja dengan markup 0%, Anda membayar harga daftar penyedia tanpa biaya platform tambahan — dan kunci (key) yang sama yang menjangkau model ini juga menjangkau model-model frontier yang Anda bandingkan trace-nya, dengan failover otomatis jika host mati. Itulah peran router seperti OrcaRouter; teacher itu sendiri adalah bagian yang Anda host sendiri.

Peringatan yang jujur

Ini adalah checkpoint yang baru berusia 24 jam, dan kartu modelnya tidak memuat angka tolok ukur sama sekali. Itu bukan kelalaian dalam tulisan ini — melainkan kondisi rilis tersebut. NVIDIA memublikasikan detail arsitektur dan pelatihan, tetapi tanpa tabel evaluasi, dan belum ada laboratorium independen yang sempat menjalankannya. Titik referensi terdekat adalah angka yang dilaporkan vendor dari model murid: Nemotron 3 Ultra melaporkan 71.9 pada SWE-Bench Verified, 86.8 pada MMLU-Pro, 89.0 pada LiveCodeBench v6, dan sekitar 95 pada RULER dengan konteks 1M. Angka-angka tersebut menggambarkan murid Ultra, bukan model guru ini, dan itu adalah angka milik NVIDIA sendiri. Siapa pun yang berencana menjalankan distilasi pada checkpoint ini harus menganggap kualitas penalarannya belum terverifikasi hingga muncul skor dari pihak independen.

Dua peringatan tambahan tertanam di dalam kartu tersebut. Korpus pasca-pelatihan sangat didominasi bahasa Inggris — sekitar 8,6 juta sampel bahasa Inggris berbanding sekitar 138.000 untuk masing-masing dari sembilan bahasa lainnya — sehingga kualitas penalaran multibahasa tidak boleh diasumsikan dari label 10 bahasa tersebut. Dan kartu tersebut sendiri menyoroti kemiringan representasi dalam data pelatihan dasar dan merekomendasikan audit bias sebelum digunakan di hilir.

Siapa yang harus peduli

Tiga kelompok mendapatkan nilai nyata di sini. Para peneliti distilasi akhirnya memiliki guru MOPD yang nyata untuk dibedah, bukan hanya resep yang menggambarkannya. Laboratorium yang melatih model penalaran mereka sendiri mendapatkan generator jejak horizon panjang dan penilai yang berasal dari silsilah pasca-pelatihan yang sama dengan model yang ingin mereka samakan. Dan siapa pun yang menjalankan RL on-policy dapat menggunakannya seperti yang dilakukan NVIDIA — sebagai penilai untuk masalah-masalah tersulit, dengan pemikiran yang diaktifkan hanya di tempat yang sepadan.

Jika Anda tidak termasuk dalam kelompok-kelompok tersebut, rilis ini hanya sedikit mengubah keadaan bagi Anda hari ini: modelnya besar, belum teruji, dan hanya dapat di-host sendiri, dan cara tercepat untuk merespons tren yang mendasarinya — semakin banyaknya guru penalaran terbuka yang bermunculan — adalah menjaga lapisan model pipeline Anda tetap dapat ditukar di balik satu antarmuka, bukan terpaku pada satu checkpoint tertentu.

A flow diagram titled 'How Multi-Teacher On-Policy Distillation works' showing a Student (Nemotron 3 Ultra) node sending rollouts to a Teacher panel of 10+ domain specialist cards, one highlighted as the General Reasoning teacher released Aug 14, 2026, with reward signals flowing back to the student, and the OrcaRouter logo composited in the corner.

Tontonan Berikutnya

Tiga hal akan menentukan apakah ini peristiwa satu kali atau panel yang akan keluar. Pertama, apakah guru-guru sejenis mengikuti jalur yang sama — NVIDIA-Nemotron-Labs-Teacher-STEM sudah dirilis pada hari yang sama, jadi pertanyaannya adalah spesialis domain mana yang muncul berikutnya dan apakah mereka diberi bobot dengan cara yang sama. Kedua, apakah NVIDIA NIM atau host terkelola mulai melayani mereka, yang akan mengubah rilis khusus lab menjadi sesuatu yang benar-benar dapat dipanggil oleh industri lainnya. Ketiga, apakah benchmark independen muncul — entri Artificial Analysis atau percobaan LMArena akan menjadi pemeriksaan nyata pertama apakah kualitas penalaran guru cocok dengan siswa yang dilatihnya.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

providers@orcarouter.ai

Gabung komunitas kami

Discordsupport@orcarouter.aiXGitHubYouTube