Kartu judul hero dengan judul utama 'GDN-2-3B' dan subjudul 'Hibrida Nemotron-3 Nano dengan Mamba-2 yang ditukar dengan Gated DeltaNet-2 - satu tweet, tanpa bobot', tiga chip status bertuliskan 'belum dirilis', 'sumber tunggal', dan 'tanpa benchmark', serta baris footer 'Kandidat rilis yang belum diverifikasi yang disebutkan dalam satu unggahan X pada 2026-09-26.' Logo OrcaRouter di kanan bawah.
Guides & Insights

Bocoran GDN-2-3B: Nemotron-3 Nano hibrida dengan Gated DeltaNet-2 sebagai pengganti Mamba-2

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Satu kalimat yang diposting di X pada 26 September 2026 adalah seluruh catatan publik tentang GDN-2-3B sejauh ini. Akun @teortaxesTex menulis bahwa "salah satu kandidat rilis jangka pendek adalah GDN-2-3B latent MoE hibrida, yang mengikuti arsitektur Nemotron-3 Nano tetapi menggantikan lapisan Mamba-2 dengan GDN-2." Itu saja — tidak ada repositori Hugging Face, tidak ada file konfigurasi, tidak ada tabel parameter, tidak ada pembangun yang dinamai, tidak ada tanggal. GDN-2-3B belum dirilis, dan tidak ada apa pun di bawah ini yang boleh dibaca seolah-olah sudah dirilis. Yang membuat kalimat itu tetap layak dibedah adalah bahwa kedua bagiannya menyebut sesuatu yang nyata dan dapat diperiksa: Gated DeltaNet-2 adalah arsitektur linear-attention terbitan NVIDIA dengan implementasi PyTorch publik dan jejak porting yang sibuk melalui perkakas TPU, Triton, dan ONNX, dan Nemotron-3 Nano adalah hibrida Mamba-2 open-weights yang sudah dirilis NVIDIA, tempat model yang dirumorkan itu dicangkokkan. Ini adalah tulisan tentang apa yang kita ketahui sejauh ini: arsitekturnya terdokumentasi, modelnya adalah rumor, dan perbedaan antara kedua hal itu adalah keseluruhan ceritanya.

Versi singkatnya: Gated DeltaNet-2 mengubah cara model linear-attention mengedit memori terkompresinya, dan keuntungan yang terukur paling mengena justru pada pekerjaan pengambilan konteks panjang yang menjadi alasan dibelinya hybrid kecil. Nemotron-3 Nano adalah tier terkecil dalam keluarga hybrid NVIDIA saat ini dan yang paling mungkin dipotong ulang dengan rekurensi yang lebih murah. Gabungkan keduanya dan Anda punya kandidat rilis yang masuk akal — dan tepat satu orang yang mengatakan demikian.

Apa yang dikatakan dan tidak dikatakan oleh tweet tersebut

Baca kalimat ini dengan cermat, karena kalimat ini luar biasa padat sekaligus luar biasa tipis. Kalimat itu menyatakan bahwa kandidat tersebut adalah hibrida (jadi, lebih dari satu jenis lapisan), 3B (jumlah parameter yang cukup kecil untuk dijalankan di satu GPU konsumen), dan MoE laten (desain perutean pakar NVIDIA di mana token diproyeksikan ke dimensi laten yang lebih kecil sebelum mencapai para pakar, yang digunakan oleh tier Super 120B dan Ultra 550B dan tidak digunakan oleh tier Nano yang dikirimkan). Kalimat itu menyatakan bahwa pola lapisannya mengikuti Nemotron-3 Nano. Dan kalimat itu menyatakan bahwa lapisan Mamba-2 digantikan dengan GDN-2.

Apa yang tidak dikatakannya: siapa yang membangunnya. "Satu kandidat rilis jangka pendek" tidak memiliki subjek. Mengaitkan NVIDIA ke dalamnya memang menggoda — GDN-2 adalah riset NVIDIA dan Nemotron-3 Nano adalah model NVIDIA, sehingga pasangan itu tampak seperti eksperimen internal — tetapi twit itu tidak mengatakan demikian, dan pihak ketiga dapat secara legal menggabungkan keduanya hari ini, karena bobot Nemotron-3 Nano terbuka dan kode referensi Gated DeltaNet-2 bersifat publik. Anggap pembangunnya tidak diketahui.

Tidak disebutkan pula kapan. “Jangka pendek” adalah satu-satunya sinyal waktu, dan itu bukan tanggal. Tidak ada checkpoint untuk diunduh, tidak ada mesin inferensi yang mengklaim dapat menyajikannya, dan tidak ada benchmark dari model itu sendiri di mana pun. Setiap angka dalam artikel ini adalah milik Gated DeltaNet-2 atau Nemotron-3 Nano sebagaimana dipublikasikan secara terpisah. Tidak satu pun dari angka-angka itu milik GDN-2-3B.

Dua bagian dari nama itu, dan mengapa keduanya cocok

Gated DeltaNet-2 dalam satu menit

Attention linear menggantikan cache KV tak terbatas dari attention softmax dengan state rekuren berukuran tetap. Bagian tersulitnya bukanlah memutuskan apa yang harus dilupakan — melainkan menyunting state itu tanpa mengacak asosiasi yang sudah tersimpan di dalamnya. Model aturan delta mengurangi hasil baca saat ini sebelum menulis nilai baru; Kimi Delta Attention mempertajam pelupaan dengan peluruhan per kanal. Namun, keduanya masih mengendalikan dua keputusan berbeda dari satu gerbang skalar: berapa banyak konten lama yang harus dihapus di sisi key, dan berapa banyak konten baru yang harus dikomit di sisi value.

Gated DeltaNet-2, yang diterbitkan oleh peneliti NVIDIA Ali Hatamizadeh, Yejin Choi, dan Jan Kautz (arXiv 2605.22791, kode referensi di repositori NVlabs), membagi skalar tersebut menjadi dua gerbang per kanal — gerbang hapus pada koordinat sisi kunci dan gerbang tulis pada koordinat sisi nilai — dan mempertahankan peluruhan per kanal. Kerangka dalam makalah tersebut adalah bahwa desain ini secara ketat menggeneralisasi apa yang telah ada sebelumnya: ciutkan kedua gerbang menjadi skalar yang sama dan Anda akan mendapatkan kembali Kimi Delta Attention; ciutkan pula peluruhannya dan Anda akan mendapatkan kembali Gated DeltaNet sebelumnya. Dalam ablasi, NVIDIA melaporkan bahwa gerbang hapus menyumbang sebagian besar peningkatan tersebut, yang sesuai dengan perannya dalam melindungi asosiasi sisi kunci agar tidak ditimpa.

Buktinya adalah studi dengan parameter yang disamakan, bukan sebuah produk: setiap model dilatih dengan 1,3B parameter pada 100B token FineWeb-Edu, dengan ukuran state rekuren dijaga sama di antara Mamba-2, Gated DeltaNet, KDA, dan Mamba-3. Dalam pengaturan rekuren, Gated DeltaNet-2 mencatat perplexity WikiText terbaik di kelompok ini pada 15,90 dibandingkan 16,79 milik Mamba-2, dan akurasi rata-rata commonsense terbaik pada 53,11 dibandingkan 52,39 milik Mamba-3. Dalam pengaturan hibrida — yang sebenarnya menyerupai pola interleaved Nemotron-3 Nano — perplexity WikiText-nya adalah 15,62 dan akurasi rata-ratanya 53,97, unggul dari Mamba-3 (15,81 / 52,72) dan jauh lebih unggul dari baseline Transformer biasa (19,22 / 50,86).

Titik di mana keunggulannya terkonsentrasi adalah bagian yang penting bagi model long-context berukuran kecil. Pada uji jarum-dalam-tumpukan-jerami multi-kunci berulang RULER pada 4K, Gated DeltaNet-2 mencetak 37,8 berbanding 27,8 untuk Gated DeltaNet yang lebih lama dan 28,0 untuk KDA; pada jarum-tunggal-pada-2K ia mencetak 89,8 berbanding 54,2. Jika dirata-ratakan pada enam set pengambilan nyata (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), model ini memimpin batas terdepan rekuren pada 29,88 berbanding 26,84 milik Mamba-2, dan batas terdepan hibrida pada 42,28 berbanding 40,14 untuk KDA. NVIDIA juga melaporkan penskalaan throughput yang nyaris datar terhadap panjang sekuens pada satu H100, dengan hanya sedikit overhead konstan dibanding KDA untuk gerbang tambahan tersebut. Ini adalah angka dari vendor yang berasal dari tabel paper itu sendiri, tidak kami reproduksi.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Cetak biru Nemotron-3 Nano

Nemotron-3 Nano adalah Mixture-of-Experts hybrid Mamba-Transformer, dan yang dipinjam adalah arsitekturnya, bukan modelnya. Rilis 30B-A3B memiliki 52 lapisan: 23 lapisan Mamba-2, 23 lapisan MoE, dan enam lapisan grouped-query attention, dengan 128 routed expert plus satu shared expert per blok MoE dan enam expert aktif per token. Model ini membawa 3,5B parameter aktif dibandingkan 30B total, dilatih awal pada 25 triliun token, dan mendukung jendela konteks hingga 1M token; laporan teknis NVIDIA sendiri mengklaim throughput inferensi hingga 3,3x lebih tinggi daripada model terbuka berukuran serupa seperti GPT-OSS-20B dan Qwen3-30B-A3B-Thinking-2507. Model ini dirilis di bawah NVIDIA Nemotron Open Model License dan secara eksplisit diizinkan untuk penggunaan komersial.

Ada saudara yang lebih kecil yang layak diketahui, karena "3B" dalam nama yang dirumorkan mendekati ukurannya: Nemotron-3 Nano 4B, yang dikompresi dari NVIDIA-Nemotron-Nano-9B-v2 menggunakan kerangka Elastic dari NVIDIA, "terutama terdiri dari lapisan Mamba-2 dan MLP yang dikombinasikan dengan hanya empat lapisan Attention." Jadi tier Nano sudah menjadi bagian dari keluarga yang diperas dan dipotong ulang. Itulah alasan paling masuk akal mengapa varian eksperimental 3B bisa ada sama sekali.

Dua ketidakcocokan layak ditandai alih-alih dihaluskan. Pertama, dalam keluarga yang dirilis, justru large tier — Nemotron-3 Super 120B-A12B dan Nemotron-3 Ultra 550B-A55B — yang menggunakan MoE laten; tier Nano tidak. Oleh karena itu, "MoE laten berbentuk Nano" bukan port langsung dari konfigurasi NVIDIA yang ada, melainkan rekombinasi gagasan dua tier, yang persis merupakan jenis hal yang muncul dalam checkpoint riset sebelum muncul dalam produk. Kedua, blok MoE keluarga Nano dirutekan dengan pakar padat; beralih ke routing laten mengubah profil FLOP setiap lapisan pakar, sehingga label 3B tidak akan memberi tahu Anda banyak tentang berapa biaya sebenarnya untuk melayani model sampai file konfigurasi muncul.

Jejak porting itu nyata — modelnya tidak

Yang dapat diverifikasi adalah bahwa Gated DeltaNet-2 sedang dipasang ke runtime produksi dengan cepat. Pada 23 September 2026, sebuah pull request ke repositori Tokamax milik OpenXLA menambahkan kernel dan operator Pallas Gated Delta Net 2 untuk TPU, termasuk pass backward autograd pada enam input dan angka benchmark pada Cloud TPU v7x. Flash Linear Attention telah membawa kernel prefill GDN-2 yang difusikan sejak akhir Juni — pull request di sana melaporkan percepatan prefill rata-rata 2,48x dan kasus terbaik 5,13x pada H100 — dengan tindak lanjut pada September yang memperbaiki bug urutan gate dan mengoptimalkan jalur pelatihan chunk. ONNX memiliki celah spesifikasi terbuka yang diajukan terhadapnya, karena operator LinearAttention pada opset 27 tidak dapat mengekspresikan gate hapus per-kanal milik GDN-2. Dan Megatron-Bridge milik NVIDIA sendiri menambahkan penghitungan FLOPs untuk lapisan GDN hibrida dan kompresi latent-MoE pada Maret.

Tidak ada dari semua itu yang merupakan rilis model, dan akan menjadi kesalahan untuk membacanya sebagai rilis model. Pekerjaan kernel adalah infrastruktur; itu menunjukkan bahwa sebuah arsitektur sedang ditanggapi dengan serius, bukan bahwa sebuah checkpoint sudah ada. Yang diberikannya kepada Anda adalah hal konkret untuk dipantau: jika sebuah hibrida GDN-2 benar-benar hadir ke publik, ia akan datang lebih dulu sebagai dukungan yang mendarat di serving engine, dan baru kemudian sebagai pengumuman, dan dukungan engine-nya sudah sebagian tersedia. Pekerjaan Tokamax dan Flash Linear Attention juga merupakan argumen terkuat bahwa pasangan dalam tweet itu koheren secara teknis, bukan dibuat-buat — komponen-komponen yang diperlukan untuk melayani sebuah hibrida GDN-2 sedang dibangun oleh orang-orang yang bukan orang yang menulis tweet tersebut.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Mengapa hibrida GDN-2 3B akan penting jika dirilis

Alasan untuk kombinasi ini bersifat ekonomis, bukan didorong oleh benchmark. Hibrida kelas 3B dengan state rekuren berukuran tetap adalah model yang dapat Anda jalankan di satu GPU konsumen tanpa KV cache yang membesar seiring panjang prompt Anda, yang merupakan kompromi yang sama seperti yang sudah diambil Nemotron-3 Nano 4B. Mengganti lapisan Mamba-2 dengan GDN-2 menghasilkan, menurut angka dalam makalah tersebut, pengambilan multi-kunci yang lebih baik dan rata-rata pengambilan di dunia nyata yang lebih baik pada ukuran state yang setara — dua area tempat keluarga delta-rule yang lebih lama paling lemah. Ini adalah peningkatan yang tertarget, bukan peningkatan generasional, dan inilah jenis perubahan yang layak untuk 3B parameter.

Ini juga menjadi pengingat bahwa kompetisi yang menarik dalam model kecil telah bergeser dari jumlah parameter ke desain memori. Model 3B yang status rekurennya adalah tensor tetap berperilaku berbeda pada prompt panjang dibandingkan transformer 3B dengan cache KV terkuantisasi: memorinya datar, tetapi model memiliki anggaran tetap untuk apa yang dapat diingatnya, dan seberapa anggun ia melupakan kini menjadi spesifikasi. Seluruh kontribusi Gated DeltaNet-2 adalah aturan melupakan yang lebih baik. Itu menjadikannya desain yang layak diperhatikan atas dasar pertimbangannya sendiri bahkan jika GDN-2-3B tidak pernah muncul dengan nama itu.

Bagaimana Anda sebenarnya akan menguji hal seperti ini

Ketika arsitektur yang belum terbukti mencapai runtime penyajian, penghambat bagi sebagian besar tim bukanlah tabel benchmark — melainkan bahwa mengadopsinya berarti integrasi baru, kontrak baru, dan mode kegagalan baru, semuanya terhadap model tanpa riwayat produksi. Itu masalah perutean sebelum menjadi masalah model. Agregator yang menempatkan endpoint baru di balik kunci yang sama yang sudah Anda gunakan berarti Anda dapat mengirim sebagian trafik nyata ke sana, mempertahankan model yang ada sebagai fallback, dan membiarkan failover otomatis menangkap error selagi rute baru masih belum stabil — satu API untuk 200+ model dengan harga daftar penyedia dengan markup 0%, sehingga harga yang dikutip adalah harga yang Anda bayar dan potongan vendor muncul pada hari yang sama alih-alih pada invoice berikutnya. GDN-2-3B sendiri tidak dihosting di mana pun, oleh kami atau siapa pun; itulah arti "unreleased". Intinya adalah pola yang akan Anda gunakan pada hari itu tiba.

Jika Anda ingin melihat model hybrid dan konteks panjang mana yang dapat dirutekan saat ini, katalog model langsung adalah daftar yang jujur — daftar itu menandai apa yang benar-benar dapat dilayani, bukan apa yang telah diumumkan.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

Apa yang harus diperhatikan, dan apa yang akan memfalsifikasi ini

Kebocoran itu diselesaikan dengan salah satu dari tiga cara, dan masing-masing memiliki tanda pengenalnya:

• File konfigurasi — konfirmasi terkuat satu-satunya adalah konfigurasi bergaya Nemotron-H yang mencantumkan tipe lapisan GDN-2 dalam pola override hibrida. Sampai config.json seperti itu ada, semuanya hanyalah inferensi dari sebuah kalimat.

• Dukungan engine untuk checkpoint tertentu — kernel GDN-2 sudah ada; yang belum ada adalah engine mana pun yang mengklaim melayani GDN-2 hybrid bernama. Menutupnya celah itu adalah sinyal yang sebenarnya.

• Perubahan lisensi — yang ini mudah terlewat. Kode referensi Gated DeltaNet-2 dirilis di bawah NVIDIA Source Code License-NC, yang bersifat non-komersial, sedangkan bobot model Nemotron dikirim di bawah NVIDIA Nemotron Open Model License, yang tidak bersifat demikian. Hibrida yang menggabungkan keduanya harus menyelesaikan ketegangan tersebut, dan cara penyelesaiannya memberi tahu Anda apakah hasilnya merupakan artefak penelitian atau sesuatu yang dapat Anda terapkan.

Dua hal akan membuktikan bahwa kerangka berpikir di sini salah. Jika "3B" dalam nama itu ternyata berarti sesuatu selain total parameter — parameter aktif, atau jumlah layer, atau sekadar nama kode — maka perhitungan ekonominya berubah total. Dan jika frasa "latent MoE" ternyata menggambarkan blok MoE biasa, maka ini adalah ide yang jauh lebih kecil daripada kelihatannya: potongan ulang Nano dengan linear layer yang berbeda, bukan bentuk yang baru.

Pertanyaan yang ditimbulkan ini

Bagaimana Gated DeltaNet-2 berbeda dari Gated DeltaNet yang sudah ada di dalam Qwen3.8?

Gated DeltaNet sebelumnya menggunakan satu gerbang skalar tunggal untuk penghapusan maupun penulisan; Gated DeltaNet-2 memecahnya menjadi dua gerbang per kanal dan menambahkan peluruhan per kanal yang dipinjam dari Kimi Delta Attention. Jadi ini merupakan generalisasi ketat, bukan pengganti, dan perbedaan praktisnya terlihat pada retrieval, bukan pada perplexity — kesenjangan pada needle-in-a-haystack multi-kunci jauh lebih besar daripada kesenjangan pada WikiText.

Mengapa ada orang yang mau menukar Mamba-2 dengan GDN-2 alih-alih hanya merilis lebih banyak lapisan Mamba-2?

Karena pada ukuran state berulang yang disamakan, makalah ini mengukur Gated DeltaNet-2 lebih unggul pada tugas-tugas retrieval yang benar-benar dijalankan oleh beban kerja agentik konteks panjang, dengan konsekuensi berupa overhead konstan kecil pada throughput. Jika beban kerja Anda padat retrieval, pertukaran itu menguntungkan; jika beban kerja Anda terikat throughput pada konteks pendek, baseline Mamba-2 adalah jawaban yang lebih murah. Testbed 3B adalah cara yang masuk akal untuk mencari tahu trafik Anda lebih menyerupai yang mana.

Apakah status open-source dari komponen-komponen tersebut berarti modelnya juga akan terbuka?

Tidak. Bobot Nemotron-3 Nano terbuka dan kode referensi Gated DeltaNet-2 bersifat publik, tetapi tidak satu pun dari fakta itu mewajibkan siapa pun untuk menerbitkan checkpoint yang dibangun dari keduanya — dan lisensi non-komersial pada kode GDN-2 berarti rilis komersial akan memerlukan pengaturan yang berbeda. Hasil yang mungkin berkisar dari rilis riset NVIDIA di bawah Nemotron Open Model License hingga sesuatu yang tidak pernah meninggalkan klaster internal.

Apakah ada yang bisa dicoba hari ini?

Ya, tapi bukan GDN-2-3B. Checkpoint makalah Gated DeltaNet-2 dapat direproduksi dari repositori NVlabs pada 1,3B di FineWeb-Edu, dan Nemotron-3 Nano 30B-A3B serta 4B berjalan di vLLM, SGLang, TensorRT-LLM, dan llama.cpp saat ini. Menguji salah satu bagian memberi tahu Anda apa yang kemungkinan akan dilakukan bagian lainnya — yang merupakan informasi lebih banyak daripada yang diberikan tweet tersebut.

Tidak ada dari semua ini yang membuat GDN-2-3B nyata. Semua ini membuatnya dapat difalsifikasi, yang merupakan hal maksimal yang bisa ditawarkan oleh satu kalimat: hanya berjarak satu file konfigurasi, satu klaim engine, atau satu repositori dari menjadi entah rilis jangka pendek yang asli atau rekombinasi yang terdengar masuk akal yang tidak pernah dibangun.