Kartu judul utama untuk artikel perbandingan 'NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max' yang bertuliskan 'Minggu ketika open weights mulai serius', dengan ikon topi kelulusan kotak terbuka di kiri, ikon globe dan chip di kanan, lencana PERBANDINGAN MODEL, dan logo OrcaRouter yang dikompositkan di kanan bawah.
Guides & Insights

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: Minggu Saat Bobot Terbuka Menjadi Serius

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Model open-weight baru saja melewati pekan yang penting. Pada atau sekitar 12 Agustus 2026, Alibaba merilis Qwen kelas Max pertama dengan bobot terbuka — Qwen3.8 Max, model unggulan dengan 2,4 triliun parameter, diterbitkan sebagai Qwen3.8-2.4T-A95B di Hugging Face dan ModelScope. Dua hari kemudian, pada 14 Agustus, NVIDIA menerbitkan NVIDIA-Nemotron-Labs-Teacher-General-Reasoning, sebuah model guru penalaran dengan 550B parameter dan 55B aktif dari jalur pelatihan Nemotron 3 Ultra, juga di Hugging Face. Keduanya adalah checkpoint yang sangat besar dan baru dibuka dari laboratorium garis depan, dan kemiripannya hanya sampai di situ. Qwen3.8 Max terbuka sehingga Anda dapat menjalankan model garis depan sendiri; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning terbuka sehingga Anda dapat melatih dengannya. Membandingkan keduanya sama saja dengan menanyakan tipe tim seperti apa Anda — tetapi fakta bahwa keduanya muncul dalam 72 jam adalah sinyal ke mana industri ini bergerak.

Apa yang sebenarnya terkandung dalam setiap rilis

Qwen3.8 Max adalah model yang dapat diterapkan. Model ini merupakan sparse mixture-of-experts dengan total 2,4 triliun parameter, sekitar 95 miliar aktif per token di seluruh 512 expert, dibangun di atas arsitektur hibrida keluarga Qwen3.5. Dalam bentuk bobot terbuka, model ini hanya mendukung teks dengan konteks asli 262K token (dapat diperluas melebihi 1M), dan — perlu dicatat — pemikiran bersifat wajib: model mengeluarkan konten penalaran di antara tag <think> dan tidak dapat dimatikan. Versi API yang di-hosting yang diluncurkan Alibaba pada 3 Agustus menambahkan input gambar dan video, konteks default 1M, serta pemikiran opsional. Lisensi bobot terbuka adalah Lisensi Qwen3.8 Max khusus, bersifat permisif tetapi dengan ketentuan berbasis pendapatan untuk penerapan komersial yang sangat besar. Jika Anda memiliki perangkat keras multi-node, Anda bisa menjalankan model kelas frontier di infrastruktur Anda sendiri.

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning adalah model untuk masa pelatihan. Model ini merupakan salah satu dari lebih dari sepuluh guru khusus domain dari resep Distilasi On-Policy Multi-Guru (MOPD) di balik Nemotron 3 Ultra, yang diturunkan dari siswa Ultra yang telah melewati pasca-pelatihan melalui tahap SFT yang dikhususkan untuk penalaran dan pembelajaran penguatan tambahan. Perannya dalam alur kerja tersebut adalah untuk menghasilkan jejak penalaran yang panjang pada masalah matematika, logika, dan penalaran abstrak yang paling sulit serta bertindak sebagai juri yang menilai jawaban bentuk bebas. Model ini dirilis di bawah lisensi OpenMDW-1.1 yang ramah komersial dengan data pasca-pelatihan yang diungkapkan, dan tidak membawa angka tolok ukur apa pun — NVIDIA menunjuk pada plot akurasi dan laporan teknis Ultra sebagai gantinya. Pelanggannya adalah proses distilasi, bukan lalu lintas produksi.

Qwen3.8 Max, flagship kelas Max pertama yang terbuka.

Rilis Alibaba penting karena model kelas Max Qwen secara historis hanya tersedia melalui API. Qwen3.8 Max mengubah hal itu: bobotnya dapat diunduh, dan modelnya benar-benar kelas frontier — Artificial Analysis memberinya Indeks Intelijen 58 dan Indeks Agentik 58, sejajar dengan generalis tertutup teratas dalam pengaturan agentik. Sorotan yang dilaporkan vendor sangat kuat: 93,0 pada PaperBench (di depan GPT-5.6 Sol dan Fable 5), 92,6 pada GPQA Diamond, 86,1 pada OSWorld-Verified. Titik lemahnya juga nyata — 67,7 pada SWE-bench Pro dan 43,6 pada Ujian Terakhir Manusia (Humanity's Last Exam) tertinggal dari para pemimpin, dan pengujian independen menemukan bahwa model ini mahal per tugas yang diselesaikan, rata-rata 64 giliran per tugas pada proses agentik. Di API Alibaba, harganya $2,00 per juta token input, $6,00 per juta token output, dan $0,25 per juta token input ter-cache, potongan 20% dari harga pratinjau.

Guru: infrastruktur pelatihan dengan model card

NVIDIA-Nemotron-Labs-Teacher-General-Reasoning tidak bersaing dalam angka-angka tersebut karena belum menerbitkan angka apa pun. Yang ditawarkannya justru arsitektur hibrida LatentMoE Mamba-2 + Transformer yang sama dengan student Ultra, konteks hingga 1 juta token, dan dial penalaran — enable_thinking true/false, mode medium_effort, dan batas keras reasoning_budget — yang dibutuhkan pipeline distilasi untuk melakukan penalaran mendalam pada sampel sulit dan melewatkannya pada sampel mudah. Kebutuhan hardware minimum adalah 4×B200 (atau 8×H100), dengan serving melalui vLLM, SGLang, atau TensorRT-LLM, dan checkpoint-nya adalah unduhan sebesar 1,12 terabyte. Model ini tidak di-deploy oleh penyedia inferensi mana pun, dan NVIDIA belum mengumumkan hosting NIM. Ini adalah rilis khusus bobot yang ditujukan bagi laboratorium yang sudah menjalankan armada GPU besar.

Spesifikasi, Berdampingan

• Tujuan — Guru: spesialis penalaran saat pelatihan dan penilai. Qwen3.8 Max: andalan terdepan yang dapat digunakan.

• Skala — Guru: 550B total / 55B aktif, LatentMoE dengan MTP. Qwen3.8 Max: 2.4T total / ~95B aktif, 512 ahli, Qwen3.5 hibrida.

• Konteks — Teacher: hingga 1M token, default 256K. Qwen3.8 Max: konteks native open-weights 262K, dapat diperluas melebihi 1M; versi API default 1M.

• Bobot — Guru: OpenMDW-1.1, dirilis 14 Agu 2026. Qwen3.8 Max: Lisensi Qwen3.8 Max, dirilis sekitar 12 Agu 2026.

• Bukti independen — Teacher: belum ada. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.

• Berpikir — Guru: toggle enable_thinking, medium_effort, batas atas reasoning_budget. Qwen3.8 Max: wajib aktif di open weights, tidak dapat dinonaktifkan.

• Harga — Teacher: tidak ada harga daftar, capex self-hosted. Qwen3.8 Max: $2.00 / $6.00 per juta token, $0.25 input cache.

A two-column scoreboard for NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max. Left column (Nemotron Teacher): training-time reasoning teacher, 55B active (550B total), up to 1M context, OpenMDW-1.1 weights, no independent score yet, self-hosted capex. Right column (Qwen3.8-Max): deployable frontier, 95B active (2.4T total), 262K native context extendable past 1M, Qwen3.8-Max License weights, AA Intelligence Index 58, $2.00/$6.00 per million tokens. Footer notes Qwen figures per Alibaba (vendor-reported) + Artificial Analysis and teacher specs unaudited. OrcaRouter logo composited bottom-right.A screenshot of the Hugging Face model page for nvidia/NVIDIA-Nemotron-Labs-Teacher-General-Reasoning showing the model card: 550B total / 55B active parameters, LatentMoE hybrid Mamba-2 + MoE + Attention with MTP, up to 1M token context, 10 languages, the OpenMDW-1.1 license tag, and the files and versions listing.

Asimetri bukti adalah inti dari segalanya.

Qwen3.8 Max telah diuji; model gurunya belum. Itu sebagian karena usia — Qwen3.8 Max dirilis pada 3 Agustus dan sudah dua minggu menjalani papan peringkat, sementara model guru baru dirilis kemarin — dan sebagian karena niat, karena kartu model guru memang tidak pernah dimaksudkan untuk bersaing dalam hal skor. Tetapi asimetri ini memiliki konsekuensi nyata bagi perbandingan: setiap angka konkret di halaman ini yang memiliki sumber terlampir adalah milik Qwen3.8 Max, dan setiap angka yang melekat pada model guru adalah spesifikasi arsitektur. Kualitas penalaran model guru belum diverifikasi oleh siapa pun di luar NVIDIA, dan angka tingkat keluarganya (SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0 yang dilaporkan vendor untuk siswa Ultra) menggambarkan model yang berbeda. Siapa pun yang membangun keputusan berdasarkan "mana yang skornya lebih baik" harus menunggu pengujian independen terhadap model guru — dan itulah celah yang seharusnya ditutup dalam beberapa minggu ke depan.

Dua dial pemikiran, diatur berbeda.

Kontras teknis paling menarik antara kedua rilis ini adalah apa yang terjadi ketika Anda meminta keduanya untuk bernalar. Qwen3.8 Max dalam bentuk open-weights-nya tidak punya pilihan: thinking selalu aktif, dan jejak penalaran menjadi bagian dari setiap jawaban. Itu bagus untuk kualitas jawaban dan transparansi, tetapi mahal untuk generasi massal. Model guru memperlakukan penalaran sebagai kenop: enable_thinking mengaktifkannya, medium_effort mengaturnya, dan batas reasoning_budget membatasinya. Untuk pipeline distilasi, perbedaannya sangat menentukan — menghasilkan jutaan jejak penalaran dengan model yang selalu berpikir akan melipatgandakan tagihan token Anda, sementara sakelar model guru memungkinkan Anda membayar penalaran mendalam hanya ketika sampel yang sulit membutuhkannya. Ini bukan filosofi desain yang saling bersaing; keduanya adalah dua alat yang dioptimalkan untuk ujung yang berlawanan dari masalah yang sama, dan masing-masing adalah alat yang tepat untuk ujungnya.

A screenshot of the OrcaRouter model page for Qwen3.8-Max (Qwen) showing the model header, the qwen/qwen3.8-max slug, and the pricing, performance, and public-benchmarks tabs.

Intinya

Jika Anda ingin menjalankan model frontier di perangkat keras Anda sendiri — atau memanggilnya dengan harga yang wajar — Qwen3.8 Max adalah rilis yang paling penting, dan tersedia di OrcaRouter dengan harga daftar Alibaba, diteruskan dengan markup 0%, sehingga penurunan harga yang diumumkan Alibaba saat peluncuran langsung aktif di pihak kami pada hari yang sama. Jika Anda ingin melatih atau mendistilasi model penalaran — atau mengaudit sinyal yang membentuk Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning adalah rilis yang paling penting, dan untuk saat ini hanya tersedia secara self-host. Kabar yang lebih besar adalah bahwa keduanya hadir di minggu yang sama: open weights baru saja bergerak dari "cukup terbuka untuk dilihat" menjadi "cukup terbuka untuk dibangun," di dua titik berbeda dalam rantai pasokan model. Tim yang menjaga lapisan model mereka tetap dapat ditukar di balik satu antarmuka — pelatihan self-host di satu sisi, inferensi frontier terkelola di sisi lain — adalah pihak yang berada dalam posisi untuk menggunakan keduanya.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari