Karta tytułowa hero z nagłówkiem 'GDN-2-3B' i podtytułem 'Hybryda Nemotron-3 Nano z Mamba-2 zastąpionym przez Gated DeltaNet-2 – jeden tweet, brak wag', trzy znaczniki statusu o treści 'niewydane', 'z jednego źródła' i 'brak benchmarków' oraz linia stopki 'Niezweryfikowany kandydat do wydania nazwany w jednym poście na X z 2026-09-26.' Logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Wyciek GDN-2-3B: hybryda Nemotron-3 Nano z Gated DeltaNet-2 w miejsce Mamba-2

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pojedyncze zdanie opublikowane na X 26 września 2026 r. to cały publiczny zapis GDN-2-3B jak dotąd. Konto @teortaxesTex napisało, że „jednym bliskoterminowym kandydatem do wydania jest hybrydowy GDN-2-3B latent MoE, który podąża za architekturą Nemotron-3 Nano, ale zastępuje warstwy Mamba-2 przez GDN-2”. To wszystko — żadnego repozytorium Hugging Face, żadnego pliku konfiguracyjnego, żadnej tabeli parametrów, żadnego nazwanego twórcy, żadnej daty. GDN-2-3B nie został wydany i nic z poniższych informacji nie powinno być czytane tak, jakby został. To, co sprawia, że ta wypowiedź jest jednak warta rozwinięcia, to fakt, że obie jej połowy nazywają coś realnego i weryfikowalnego: Gated DeltaNet-2 to opublikowana przez NVIDIA architektura liniowej uwagi z publiczną implementacją w PyTorch i intensywnym szlakiem portowania przez narzędzia TPU, Triton i ONNX, a Nemotron-3 Nano to wydana przez NVIDIA hybryda Mamba-2 z otwartymi wagami, na którą przeszczepiany jest domniemany model. To tekst w stylu „co wiemy do tej pory”: architektura jest udokumentowana, model jest pogłoską, a różnica między tymi dwoma rzeczami to cała historia.

Krótka wersja: Gated DeltaNet-2 zmienia sposób, w jaki model z liniową uwagą edytuje swoją skompresowaną pamięć, a jego zmierzone zyski najmocniej odbijają się dokładnie na zadaniach wyszukiwania w długim kontekście, dla których kupuje się mały model hybrydowy. Nemotron-3 Nano to najniższy poziom w obecnej rodzinie hybrydowej NVIDIA i ten, który najprawdopodobniej zostanie ponownie przycięty z tańszą rekurencją. Połącz to wszystko, a masz prawdopodobnego kandydata do wydania — i dokładnie jedną osobę, która tak twierdzi.

Co tweet mówi, a czego nie mówi

Przeczytaj to zdanie uważnie, ponieważ jest ono jednocześnie nietypowo gęste i nietypowo cienkie. Mówi ono, że kandydat jest hybrydowy (czyli ma więcej niż jeden typ warstwy), 3B (liczba parametrów wystarczająco mała, by uruchomić go na jednym konsumenckim GPU), i utajonym MoE (projekt routingu ekspertów firmy NVIDIA, w którym tokeny są rzutowane na mniejszy wymiar utajony, zanim dotrą do ekspertów, co jest stosowane w poziomach Super 120B i Ultra 550B, a czego nie stosuje dostarczany poziom Nano). Mówi też, że wzorzec warstw podąża za Nemotron-3 Nano. I mówi, że warstwy Mamba-2 są zastąpione przez GDN-2.

Czego w nim nie ma: kto go buduje. „Jeden bliski wydania kandydat” nie ma podmiotu. Kuszące jest dopatrywanie się w tym NVIDIA — GDN-2 to badania NVIDIA, a Nemotron-3 Nano to model NVIDIA, więc to zestawienie wygląda na eksperyment wewnętrzny — ale tweet tego nie mówi, a osoba trzecia może dziś legalnie połączyć oba elementy, bo wagi Nemotron-3 Nano są otwarte, a kod referencyjny Gated DeltaNet-2 jest publiczny. Twórcę należy uznać za nieznanego.

Nie mówi też, kiedy. „Near-term” to jedyny sygnał czasowy i nie jest to data. Nie ma żadnego checkpointu do pobrania, żadnego silnika wnioskowania, który deklarowałby, że go obsługuje, ani nigdzie żadnego benchmarku samego modelu. Każda wartość liczbowa w tym artykule należy do Gated DeltaNet-2 albo do Nemotron-3 Nano w wersjach opublikowanych osobno. Żadna z nich nie należy do GDN-2-3B.

Dwie połówki nazwy i dlaczego do siebie pasują

Gated DeltaNet-2 w jedną minutę

Uwaga liniowa zastępuje nieograniczoną pamięć podręczną KV uwagi softmax rekurencyjnym stanem o stałym rozmiarze. Najtrudniejsze nie jest decydowanie, co zapomnieć — lecz edytowanie tego stanu bez zaburzania skojarzeń, które są już w nim przechowywane. Modele z regułą delta odejmują bieżący odczyt przed zapisaniem nowej wartości; Kimi Delta Attention wyostrzyła zapominanie za pomocą zaniku kanałowego. Jednak oba nadal opierają dwie różne decyzje na jednej bramce skalarnej: ile starej treści wymazać po stronie klucza i ile nowej treści zatwierdzić po stronie wartości.

Gated DeltaNet-2, opublikowany przez badaczy z NVIDIA Alego Hatamizadeha, Yejin Choi i Jana Kautza (arXiv 2605.22791, kod referencyjny w repozytorium NVlabs), rozdziela ten skalar na dwie bramki kanałowe — bramkę usuwania nad współrzędnymi po stronie klucza i bramkę zapisu nad współrzędnymi po stronie wartości — oraz zachowuje zanik kanałowy. W ujęciu artykułu projekt ten ściśle uogólnia to, co było wcześniej: sprowadzenie obu bramek do tego samego skalaru pozwala odzyskać Kimi Delta Attention; sprowadzenie także zaniku pozwala odzyskać wcześniejszy Gated DeltaNet. W badaniach ablacyjnych NVIDIA podaje, że bramka usuwania odpowiada za większość zysku, co pasuje do jej roli w ochronie skojarzeń po stronie klucza przed nadpisaniem.

Dowody pochodzą z badania z dopasowanymi parametrami, a nie z produktu: każdy model trenowany przy 1,3 mld parametrów na 100 mld tokenów FineWeb-Edu, z rozmiarem stanu rekurencyjnego utrzymywanym na równym poziomie w przypadku Mamba-2, Gated DeltaNet, KDA i Mamba-3. W ustawieniu rekurencyjnym Gated DeltaNet-2 osiąga najlepszą perplexity WikiText w grupie na poziomie 15,90 w porównaniu do 16,79 Mamba-2 oraz najlepszą średnią dokładność w zakresie zdrowego rozsądku na poziomie 53,11 w porównaniu do 52,39 Mamba-3. W ustawieniu hybrydowym — tym, które faktycznie przypomina przeplatany wzorzec Nemotron-3 Nano — wynosi 15,62 perplexity WikiText i 53,97 średniej dokładności, wyprzedzając Mamba-3 (15,81 / 52,72) i znacznie wyprzedzając zwykły baseline Transformer (19,22 / 50,86).

To, gdzie koncentruje się przewaga, ma znaczenie dla małego modelu z długim kontekstem. W rekurencyjnym teście needle-in-a-haystack z wieloma kluczami RULER przy 4K Gated DeltaNet-2 uzyskuje 37,8 w porównaniu do 27,8 dla starszego Gated DeltaNet i 28,0 dla KDA; w teście single-needle przy 2K uzyskuje 89,8 w porównaniu do 54,2. Uśredniając po sześciu rzeczywistych zbiorach wyszukiwania (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP), prowadzi na rekurencyjnym froncie z wynikiem 29,88 w porównaniu do 26,84 Mamba-2, a na froncie hybrydowym z 42,28 w porównaniu do 40,14 dla KDA. NVIDIA również raportuje niemal płaskie skalowanie przepustowości wraz z długością sekwencji na pojedynczym H100, z jedynie niewielkim stałym narzutem w porównaniu do KDA za dodatkowe bramki. Są to dane producenta z tabel w artykule, niepowtórzone przez nas.

Two-column comparison scoreboard titled 'Mamba-2 vs Gated DeltaNet-2 - the scoreboard'. Left column 'Mamba-2': Decay scalar; Erase gate none; Write gate scalar; WikiText ppl 16.79; LMB ppl 12.38; Retrieval avg 26.84. Right column 'Gated DeltaNet-2': Decay channel-wise; Erase gate channel-wise b; Write gate channel-wise w; WikiText ppl 15.90; LMB ppl 11.41; Retrieval avg 29.88. Footer: both recurrent-only, 1.3B params, 100B FineWeb-Edu tokens, figures per NVIDIA's Gated DeltaNet-2 paper, not independently reproduced. OrcaRouter logo bottom-right.

Plan Nemotron-3 Nano

Nemotron-3 Nano to hybryda Mamba-Transformer typu Mixture-of-Experts, a zapożyczana jest architektura, a nie sam model. Wydanie 30B-A3B składa się z 52 warstw: 23 warstw Mamba-2, 23 warstw MoE i sześciu warstw uwagi z grupowanymi zapytaniami (grouped-query attention), ze 128 ekspertami routowanymi plus jednym wspólnym ekspertem na blok MoE i sześcioma aktywnymi ekspertami na token. Ma 3,5 mld aktywnych parametrów przy łącznej liczbie 30 mld, został wstępnie wytrenowany na 25 bilionach tokenów i obsługuje okna kontekstowe o długości do 1 mln tokenów; własny raport techniczny NVIDIA twierdzi, że przepustowość wnioskowania jest do 3,3 razy wyższa niż w podobnych rozmiarowo otwartych modelach, takich jak GPT-OSS-20B i Qwen3-30B-A3B-Thinking-2507. Jest udostępniany na licencji NVIDIA Nemotron Open Model License i jest wyraźnie dopuszczony do użytku komercyjnego.

Jest mniejsze rodzeństwo, o którym warto wiedzieć, ponieważ „3B” z krążącej nazwy jest bardzo blisko niego: Nemotron-3 Nano 4B, skompresowany z NVIDIA-Nemotron-Nano-9B-v2 przy użyciu frameworka Elastic firmy NVIDIA, to „głównie warstwy Mamba-2 i MLP w połączeniu z zaledwie czterema warstwami Attention”. Poziom Nano jest więc już tą częścią rodziny, która bywa ściskana i przycinana na nowo. To najbardziej przekonujący powód, dla którego eksperymentalny wariant 3B w ogóle mógłby istnieć.

Dwie niezgodności zasługują na zwrócenie uwagi, a nie na wygładzenie. Po pierwsze, w wydanej rodzinie to duże tiery — Nemotron-3 Super 120B-A12B i Nemotron-3 Ultra 550B-A55B — używają latent MoE; tier Nano nie. „Latent MoE w kształcie Nano" nie jest więc prostym przeniesieniem istniejącej konfiguracji NVIDIA, lecz rekombinacją pomysłów z dwóch tierów, a to dokładnie ten rodzaj rozwiązania, który pojawia się w checkpointach badawczych, zanim trafi do produktu. Po drugie, bloki MoE w rodzinie Nano opierają się na routingu do gęstych ekspertów; przejście na routing latentny zmienia profil FLOP każdej warstwy eksperckiej, więc etykieta 3B powiedziałaby bardzo niewiele o tym, ile faktycznie kosztuje obsługa modelu, dopóki nie pojawi się plik konfiguracyjny.

Ścieżka portowania jest prawdziwa — model nie.

Można zweryfikować, że Gated DeltaNet-2 jest w szybkim tempie dopasowywany do produkcyjnych środowisk uruchomieniowych. 23 września 2026 r. pull request do repozytorium Tokamax w OpenXLA dodał kernel i operator Pallas dla Gated Delta Net 2 na TPU, w tym przebieg wsteczny autogradu obejmujący sześć wejść oraz wyniki benchmarków na Cloud TPU v7x. Flash Linear Attention ma sfuzjowane kernele prefill GDN-2 od końca czerwca — tamtejszy pull request podaje średnie przyspieszenie prefill o 2,48x i najlepszy wynik 5,13x na H100 — a we wrześniu pojawiły się kolejne zmiany, które naprawiły błąd kolejności bramek i zoptymalizowały ścieżkę treningu chunkowego. Wobec ONNX zgłoszono otwartą lukę w specyfikacji, ponieważ operator LinearAttention z opset 27 nie potrafi wyrazić kanałowej bramki kasowania GDN-2. A własny Megatron-Bridge firmy NVIDIA dodał w marcu obliczanie FLOPs zarówno dla hybrydowych warstw GDN, jak i dla kompresji latent-MoE.

Nic z tego nie jest wydaniem modelu i błędem byłoby odczytywać to jako takie. Prace nad kernelami to infrastruktura; mówią, że architektura jest traktowana poważnie, a nie że istnieje checkpoint. Daje ci to jednak konkretny punkt do obserwacji: jeśli hybryda GDN-2 rzeczywiście ujrzy światło dzienne, pojawi się najpierw jako wsparcie trafiające do silnika serwującego, a dopiero potem jako ogłoszenie, a wsparcie w silniku jest już częściowo gotowe. Prace Tokamax i Flash Linear Attention to również najsilniejszy argument, że połączenie z tweeta jest technicznie spójne, a nie wymyślone — elementy potrzebne do obsługi hybrydy GDN-2 budują osoby, które nie są autorem tweeta.

Screenshot of the NVlabs/GatedDeltaNet-2 GitHub repository page in English: the title 'Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention', the file list with README.md, LICENSE, SECURITY.md and lit_gpt/scripts directories, and the About panel showing 317 stars, 33 forks and a last commit from last month.

Dlaczego hybryda 3B GDN-2 miałaby znaczenie, gdyby została wydana

Argument za tym połączeniem jest ekonomiczny, a nie benchmarkowy. Hybryda klasy 3B o stałym rozmiarze stanu rekurencyjnego to model, który można uruchomić na jednym konsumenckim GPU bez KV cache rosnącego wraz z promptem — ten sam kompromis, na jaki już zdecydował się Nemotron-3 Nano 4B. Zamiana warstw Mamba-2 na GDN-2 daje, według liczb z artykułu, lepsze wyszukiwanie wielokluczowe i lepsze średnie wyszukiwania w rzeczywistych warunkach przy takim samym rozmiarze stanu — dwa obszary, w których starsza rodzina reguł delta była najsłabsza. To ukierunkowane ulepszenie, a nie zmiana pokoleniowa, i właśnie tego rodzaju zmiana byłaby warta 3B parametrów.

To także przypomnienie, że ciekawa rywalizacja wśród małych modeli przeniosła się z liczby parametrów na projektowanie pamięci. Model 3B, którego stan rekurencyjny jest stałym tensorem, zachowuje się inaczej przy długich promptach niż transformer 3B ze skwantyzowanym cachem KV: pamięć jest stała, ale model ma ustalony budżet na to, co może zapamiętać, a to, jak elegancko zapomina, jest teraz specyfikacją. Cały wkład Gated DeltaNet-2 to lepsza reguła zapominania. To czyni go projektem wartym obserwowania na jego własnych zasadach, nawet jeśli GDN-2-3B nigdy nie pojawi się pod tą nazwą.

Jak właściwie przetestowałbyś coś takiego

Gdy niesprawdzona architektura trafia do środowiska uruchomieniowego do serwowania modeli, blokadą dla większości zespołów nie jest tabela z benchmarkami — jest nią to, że jej wdrożenie oznacza nową integrację, nową umowę i nowy tryb awarii, a wszystko to w przypadku modelu bez historii produkcyjnej. To problem routingu, zanim stanie się problemem modelu. Agregator, który stawia nowy endpoint za tym samym kluczem, którego już używasz, sprawia, że możesz skierować na niego część rzeczywistego ruchu, zachować obecny model jako fallback i pozwolić automatycznemu przełączaniu awaryjnemu przechwycić błędy, gdy nowa trasa jest jeszcze niestabilna — jedno API dla ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc cena, którą ci podano, jest ceną, którą płacisz, a obniżka od dostawcy pojawia się tego samego dnia, a nie na następnej fakturze. Sam GDN-2-3B nie jest hostowany nigdzie — ani przez nas, ani przez nikogo innego; to właśnie oznacza „unreleased”. Chodzi o wzorzec, którego użyłbyś w dniu, w którym to nastąpi.

Jeśli chcesz zobaczyć, które modele hybrydowe i modele z długim kontekstem są dziś dostępne w routingu, katalog modeli na żywo jest uczciwą listą — oznacza to, co faktycznie można udostępnić, a nie to, co zostało zapowiedziane.

Screenshot of the OrcaRouter model catalogue at orcarouter.ai/models, headline '204 models - 16 providers - one API key, one bill', with the filter rail for input modalities, context length, input price, status and series, the Models / Leaderboard / Offers / playground tabs, and a 'How to call any model' panel.

Na co uważać i co by to sfalsyfikowało

Wyciek kończy się na jeden z trzech sposobów, a każdy ma swoją oznakę:

• Plik konfiguracyjny — najsilniejszym pojedynczym potwierdzeniem byłaby konfiguracja w stylu Nemotron-H wymieniająca typy warstw GDN-2 w hybrydowym wzorcu nadpisywania. Dopóki nie istnieje taki config.json, wszystko jest wnioskiem z jednego zdania.

• Wsparcie silnika dla konkretnego checkpointu — jądra GDN-2 już istnieją; nie istnieje natomiast żaden silnik, który twierdziłby, że obsługuje nazwany hybrydowy model GDN-2. Zamknięcie tej luki jest prawdziwym sygnałem.

• Zmiana licencji — ten szczegół łatwo przeoczyć. Kod referencyjny Gated DeltaNet-2 jest udostępniony na licencji NVIDIA Source Code License-NC, która ma charakter niekomercyjny, natomiast wagi modelu Nemotron są dostarczane na licencji NVIDIA Nemotron Open Model License, która nie ma charakteru niekomercyjnego. Hybryda łącząca oba te elementy musiałaby rozwiązać ten konflikt, a sposób jego rozwiązania mówi, czy wynik jest artefaktem badawczym, czy czymś, co można wdrożyć.

Dwie rzeczy podważyłyby to ujęcie. Jeśli „3B” w nazwie okaże się oznaczać coś innego niż całkowitą liczbę parametrów — parametry aktywne, liczbę warstw albo po prostu nazwę kodową — kalkulacja ekonomiczna zmienia się całkowicie. A jeśli sformułowanie „latent MoE” okaże się opisywać zwykły blok MoE, to jest to znacznie mniejszy pomysł, niż się wydaje: Nano re-cut z inną warstwą liniową, a nie nowy kształt.

Pytania, które to nasuwa

Czym różni się Gated DeltaNet-2 od Gated DeltaNet, który już znajduje się w Qwen3.8?

Wcześniejszy Gated DeltaNet wykorzystuje pojedynczą skalarną bramkę zarówno do wymazywania, jak i zapisywania; Gated DeltaNet-2 rozdziela ją na dwie bramki kanałowe i dodaje kanałowy zanik zapożyczony z Kimi Delta Attention. Jest to więc ścisłe uogólnienie, a nie zamiennik, a praktyczna różnica ujawnia się w wyszukiwaniu, a nie w perplexity — luka w przypadku multi-key needle-in-a-haystack jest znacznie większa niż luka w przypadku WikiText.

Dlaczego ktokolwiek miałby zamieniać Mamba-2 na GDN-2, zamiast po prostu wypuszczać więcej warstw Mamba-2?

Ponieważ przy dopasowanym rozmiarze stanu rekurencyjnego artykuł wykazuje, że Gated DeltaNet-2 wypada lepiej w zadaniach wyszukiwania, które faktycznie ćwiczą długokontekstowe obciążenia agentowe, kosztem niewielkiego stałego narzutu na przepustowość. Jeśli w Twoim obciążeniu dominuje wyszukiwanie, ten kompromis jest korzystny; jeśli jest ograniczone przepustowością przy krótkim kontekście, tańszą odpowiedzią jest baseline Mamba-2. Środowisko testowe 3B to rozsądny sposób, aby sprawdzić, do którego z nich bardziej przypomina Twój ruch.

Czy status open-source tych elementów oznacza, że model również byłby otwarty?

Nie. Wagi Nemotron-3 Nano są otwarte, a kod referencyjny Gated DeltaNet-2 jest publiczny, ale żaden z tych faktów nie zobowiązuje nikogo do opublikowania checkpointu zbudowanego na ich podstawie — a niekomercyjna licencja na kod GDN-2 oznacza, że komercyjne wydanie wymagałoby innego porozumienia. Prawdopodobne wyniki rozciągają się od wydania badawczego NVIDIA na licencji Nemotron Open Model License po coś, co nigdy nie opuści wewnętrznego klastra.

Czy jest dziś coś do wypróbowania?

Tak, ale nie GDN-2-3B. Checkpointy z pracy o Gated DeltaNet-2 można odtworzyć z repozytorium NVlabs dla 1.3B na FineWeb-Edu, a Nemotron-3 Nano 30B-A3B i 4B działają dziś na vLLM, SGLang, TensorRT-LLM i llama.cpp. Przetestowanie którejkolwiek z połówek mówi ci, co prawdopodobnie zrobiłaby druga połowa — co daje ci więcej niż tweet.

Nic z tego nie czyni GDN-2-3B rzeczywistym. Czyni go falsyfikowalnym, co jest maksimum, jakie może zaoferować jedno zdanie: o jeden plik konfiguracyjny, jedno twierdzenie o silniku albo jedno repozytorium od tego, by być albo autentycznym wydaniem w niedalekiej przyszłości, albo wiarygodnie brzmiącą rekombinacją, która nigdy nie zostanie zbudowana.