
GDN-2-3B lek: een Nemotron-3 Nano-hybride met Gated DeltaNet-2 in plaats van Mamba-2
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 477 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Een enkele zin die op 26 september 2026 op X is geplaatst, is het volledige openbare dossier van GDN-2-3B tot nu toe. Het account @teortaxesTex schreef dat "een van de eerstvolgende releasekandidaten de hybride GDN-2-3B latent MoE is, die de Nemotron-3 Nano-architectuur volgt maar de Mamba-2-lagen vervangt door GDN-2." Dat is alles — geen Hugging Face-repository, geen configuratiebestand, geen parametertabel, geen genoemde ontwikkelaar, geen datum. GDN-2-3B is niet uitgebracht, en niets hieronder mag worden gelezen alsof dat wel zo was. Wat de uitspraak toch de moeite waard maakt om uit te pakken, is dat beide helften ervan iets reëels en controleerbaars noemen: Gated DeltaNet-2 is een door NVIDIA gepubliceerde linear-attentionarchitectuur met een publieke PyTorch-implementatie en een drukke porting-activiteit rond TPU-, Triton- en ONNX-tooling, en Nemotron-3 Nano is NVIDIA's uitgebrachte open-weights Mamba-2-hybride waarop het model waarover geruchten de ronde doen wordt geënt. Dit is een stuk over wat we tot nu toe weten: de architectuur is gedocumenteerd, het model is een gerucht, en het verschil tussen die twee is het hele verhaal.
De korte versie: Gated DeltaNet-2 verandert hoe een linear-attention-model wijzigingen aanbrengt in zijn gecomprimeerde geheugen, en de gemeten winsten slaan het hardst neer op precies het long-context-retrievalwerk waarvoor een kleine hybride wordt gekocht. Nemotron-3 Nano is de kleinste tier in NVIDIA's huidige hybride familie en degene die het waarschijnlijkst opnieuw wordt vormgegeven met een goedkopere recurrentie. Zet die twee bij elkaar en je hebt een plausibele releasekandidaat — en precies één persoon die dat zegt.
Wat de tweet wel en niet zegt
Lees de zin aandachtig, want die is tegelijkertijd ongewoon dicht en ongewoon dun. Er staat dat de kandidaat hybride (dus meer dan één type laag), 3B (een parameteraantal dat klein genoeg is om op één consumenten-GPU te draaien), en een latente MoE (een NVIDIA-ontwerp voor expertroutering waarbij tokens naar een kleinere latente dimensie worden geprojecteerd voordat ze de experts bereiken; dat is wat de Super 120B- en Ultra 550B-tiers gebruiken en wat de uitgeleverde Nano-tier niet doet). Er staat dat het laagpatroon Nemotron-3 Nano volgt. En er staat dat de Mamba-2-lagen worden vervangen door GDN-2.
Wat het niet zegt: wie het bouwt. "One near-term release candidate" heeft geen onderwerp. Het is verleidelijk om NVIDIA erin te lezen — GDN-2 is NVIDIA-onderzoek en Nemotron-3 Nano is een NVIDIA-model, dus de combinatie lijkt op een experiment in eigen huis — maar de tweet zegt dat niet, en een derde partij kan de twee vandaag legaal combineren, omdat de gewichten van Nemotron-3 Nano open zijn en de referentiecode van Gated DeltaNet-2 openbaar is. Beschouw de bouwer als onbekend.
Ook wordt niet gezegd wanneer. "Near-term" is het enige timing-signaal, en het is geen datum. Er is geen checkpoint om te downloaden, geen inference-engine die claimt het te kunnen serveren, en nergens een benchmark van het model zelf. Elk cijfer in dit artikel hoort bij Gated DeltaNet-2 of bij Nemotron-3 Nano zoals afzonderlijk gepubliceerd. Geen ervan hoort bij GDN-2-3B.
De twee helften van de naam, en waarom ze bij elkaar passen
Gated DeltaNet-2 in één minuut
Lineaire attention vervangt de onbegrensde KV-cache van softmax-attention door een recursieve toestand met vaste grootte. Het moeilijke deel is niet beslissen wat je moet vergeten — het is die toestand bewerken zonder de associaties die er al in zijn opgeslagen door elkaar te halen. Delta-regel-modellen trekken de huidige uitlezing af voordat ze een nieuwe waarde schrijven; Kimi Delta Attention verscherpte het vergeten met kanaalsgewijze decay. Beide sturen echter nog steeds twee verschillende beslissingen aan met één scalaire poort: hoeveel oude inhoud aan de sleutelzijde moet worden gewist, en hoeveel nieuwe inhoud aan de waardezijde moet worden vastgelegd.
Gated DeltaNet-2, gepubliceerd door NVIDIA-onderzoekers Ali Hatamizadeh, Yejin Choi en Jan Kautz (arXiv 2605.22791, referentiecode in de NVlabs-repository), splitst die scalair in twee kanaalsgewijze gates — een erase-gate over coördinaten aan de sleutelzijde en een write-gate over coördinaten aan de waardezijde — en behoudt de kanaalsgewijze decay. De insteek van de paper is dat het ontwerp strikt generaliseert wat daarvoor kwam: reduceer beide gates tot dezelfde scalair en je krijgt Gated DeltaNet; reduceer ook de decay en je krijgt de eerdere Gated DeltaNet. In ablatieonderzoek rapporteert NVIDIA dat de erase-gate het grootste deel van de winst verklaart, wat past bij zijn rol bij het beschermen van associaties aan de sleutelzijde tegen overschrijven.
Het bewijs is een studie met gematchte parameters, geen product: elk model is getraind met 1,3B parameters op 100B FineWeb-Edu-tokens, waarbij de grootte van de recurrente toestand gelijk is gehouden voor Mamba-2, Gated DeltaNet, KDA en Mamba-3. In de recurrente opzet scoort Gated DeltaNet-2 de beste WikiText-perplexiteit van de groep met 15,90 tegenover 16,79 van Mamba-2, en de beste gemiddelde commonsense-nauwkeurigheid met 53,11 tegenover 52,39 van Mamba-3. In de hybride opzet — degene die daadwerkelijk lijkt op het interleaved patroon van Nemotron-3 Nano — bedraagt het 15,62 WikiText-perplexiteit en 53,97 gemiddelde nauwkeurigheid, beter dan Mamba-3 (15,81 / 52,72) en ruim beter dan een gewone Transformer-baseline (19,22 / 50,86).
Waar de voorsprong zich concentreert, is het deel dat ertoe doet voor een klein model met een lange context. Op de recurrente multi-key needle-in-a-haystack-test van RULER bij 4K scoort Gated DeltaNet-2 37,8 tegenover 27,8 voor de oudere Gated DeltaNet en 28,0 voor KDA; op single-needle-at-2K scoort het 89,8 tegenover 54,2. Gemiddeld over zes echte retrievalsets (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) voert het de recurrent frontier aan met 29,88 tegenover 26,84 voor Mamba-2, en de hybride frontier met 42,28 tegenover 40,14 voor KDA. NVIDIA rapporteert ook een bijna vlakke throughput-schaling met de sequentielengte op een enkele H100, met slechts een kleine constante overhead ten opzichte van KDA voor de extra poorten. Dit zijn leverancierscijfers uit de eigen tabellen van het artikel, niet door ons gereproduceerd.

De blauwdruk van Nemotron-3 Nano
Nemotron-3 Nano is een hybride Mamba-Transformer met Mixture-of-Experts, en het is de architectuur die wordt geleend, niet het model. De 30B-A3B-release telt 52 lagen: 23 Mamba-2-lagen, 23 MoE-lagen en zes grouped-query attention-lagen, met 128 gerouteerde experts plus één gedeelde expert per MoE-blok en zes actieve experts per token. Hij heeft 3,5B actieve parameters tegenover 30B in totaal, is voorgetraind op 25 biljoen tokens en ondersteunt contextvensters tot 1M tokens; NVIDIA's eigen technische rapport claimt tot 3,3x hogere inferentiedoorvoer dan vergelijkbaar grote open modellen zoals GPT-OSS-20B en Qwen3-30B-A3B-Thinking-2507. Het is uitgebracht onder de NVIDIA Nemotron Open Model License en is expliciet vrijgegeven voor commercieel gebruik.
Er is een kleinere broer die het waard is om te kennen, want de "3B" in de geruchtennaam ligt daar dicht bij: Nemotron-3 Nano 4B, gecomprimeerd uit NVIDIA-Nemotron-Nano-9B-v2 met behulp van NVIDIA's Elastic-framework, bestaat "voornamelijk uit Mamba-2- en MLP-lagen, gecombineerd met slechts vier Attention-lagen." De Nano-tier is dus al het deel van de familie dat wordt samengeperst en opnieuw gesneden. Dat is de meest plausibele reden waarom een experimentele 3B-variant überhaupt zou bestaan.
Twee discrepanties zijn het vermelden waard in plaats van ze te verdoezelen. Ten eerste zijn het in de uitgebrachte familie de grote tiers — Nemotron-3 Super 120B-A12B en Nemotron-3 Ultra 550B-A55B — die latente MoE gebruiken; de Nano-tier doet dat niet. Een "Nano-shaped latent MoE" is dus geen directe port van een bestaande NVIDIA-config, maar een recombinatie van de ideeën van twee tiers, precies het soort ding dat in onderzoekscheckpoints opduikt voordat het in een product opduikt. Ten tweede gebruiken de MoE-blokken van de Nano-familie dense-expert-routing; overstappen op latente routing verandert het FLOP-profiel van elke expertlaag, dus een 3B-label zou je heel weinig vertellen over wat het model daadwerkelijk kost om te serveren totdat er een configuratiebestand verschijnt.
Het portspoor is echt — het model niet.
Wat kan worden geverifieerd, is dat Gated DeltaNet-2 in hoog tempo wordt ingepast in productieruntimes. Op 23 september 2026 voegde een pull request voor de Tokamax-repository van OpenXLA een Gated Delta Net 2 Pallas-kernel en -operator voor TPU toe, inclusief een autograd-backwardpass over zes inputs en benchmarkcijfers op Cloud TPU v7x. Flash Linear Attention heeft sinds eind juni fused GDN-2-prefillkernels — de pull request daar meldt een gemiddelde prefill-versnelling van 2,48x en een best-case van 5,13x op een H100 — met follow-ups in september die een gate-orderingbug oplosten en het chunk-trainingspad optimaliseerden. Bij ONNX is een open specificatiehiaat gemeld, omdat de LinearAttention-operator van opset 27 de channel-wise erase gate van GDN-2 niet kan uitdrukken. En NVIDIA's eigen Megatron-Bridge voegde in maart FLOPs-accounting toe voor zowel hybride GDN-lagen als latent-MoE-compressie.
Niets daarvan is een modelrelease, en het zou een vergissing zijn om het als zodanig te lezen. Kernelwerk is infrastructuur; het zegt dat een architectuur serieus wordt genomen, niet dat er een checkpoint bestaat. Wat het je wel geeft, is iets concreets om in de gaten te houden: als een GDN-2-hybride daadwerkelijk het licht ziet, zal die eerst verschijnen als ondersteuning die in een serving-engine terechtkomt en pas daarna als aankondiging, en de engine-ondersteuning is al gedeeltelijk aanwezig. Het werk aan Tokamax en Flash Linear Attention is ook het sterkste argument dat de combinatie in de tweet technisch coherent is in plaats van verzonnen — de onderdelen die nodig zijn om een GDN-2-hybride te serveren, worden gebouwd door mensen die niet de persoon zijn die de tweet schreef.

Waarom een 3B GDN-2-hybride van belang zou zijn als die wordt uitgebracht
Het argument voor de combinatie is economisch van aard, niet benchmarkgedreven. Een hybride van de 3B-klasse met een recurrente toestand van vaste grootte is een model dat je op één consumenten-GPU kunt draaien zonder een KV-cache die met je prompt meegroeit — dezelfde afweging die Nemotron-3 Nano 4B al maakt. Het vervangen van de Mamba-2-lagen door GDN-2 levert, volgens de cijfers in het paper, betere multi-key retrieval en betere retrievalgemiddelden in de praktijk op bij een gelijke toestandsgrootte — de twee plekken waar de oudere delta-regel-familie het zwakst was. Dat is een gerichte upgrade, niet een generatie-upgrade, en het is het soort verandering dat 3B aan parameters waard zou zijn.
Het is ook een herinnering dat de interessante competitie in kleine modellen is verschoven van parameteraantallen naar geheugenontwerp. Een 3B-model waarvan de recurrente toestand een vaste tensor is, gedraagt zich bij lange prompts anders dan een 3B-transformer met een gekwantiseerde KV-cache: het geheugen is vlak, maar het model heeft een vast budget voor wat het zich kan herinneren, en hoe elegant het vergeet is nu de specificatie. De hele bijdrage van Gated DeltaNet-2 is een betere vergeetregel. Dat maakt het een ontwerp dat de moeite waard is om op zijn eigen merites te volgen, zelfs als GDN-2-3B nooit onder die naam verschijnt.
Hoe je zoiets eigenlijk zou testen
Wanneer een onbewezen architectuur een serving runtime bereikt, is het struikelblok voor de meeste teams niet de benchmarktabel — het is dat het adopteren ervan een nieuwe integratie, een nieuw contract en een nieuwe faalmodus betekent, allemaal tegen een model zonder productiegeschiedenis. Dat is een routeringsprobleem voordat het een modelprobleem is. Een aggregator die een nieuw endpoint achter dezelfde sleutel zet die je al gebruikt, betekent dat je een deel van het echte verkeer erop kunt sturen, je bestaande model als fallback kunt houden, en automatische failover de fouten laat opvangen terwijl de nieuwe route nog onstabiel is — één API voor 200+ modellen tegen de lijstprijs van de provider, met 0% opslag, dus de prijs die je geoffreerd kreeg is de prijs die je betaalt, en een prijsverlaging van een leverancier zie je dezelfde dag terug in plaats van pas op de volgende factuur. GDN-2-3B zelf wordt nergens gehost, niet door ons of iemand anders; dat is wat "unreleased" betekent. Het punt is het patroon dat je zou gebruiken op de dag dat het wel zo ver is.
Als je wilt zien welke hybride en long-contextmodellen vandaag routeerbaar zijn, is de live modelcatalogus de eerlijke lijst — die markeert wat daadwerkelijk serveerbaar is in plaats van wat is aangekondigd.

Waarop te letten, en wat dit zou weerleggen
Het lek wordt op een van drie manieren opgelost, en elk heeft een verraderlijk teken:
• Een configuratiebestand — de allersterkste bevestiging zou een configuratie in Nemotron-H-stijl zijn die GDN-2-laagtypen vermeldt in een hybride overridepatroon. Zolang een dergelijke config.json niet bestaat, is alles een gevolgtrekking uit één zin.
• Engine-ondersteuning voor een specifieke checkpoint — GDN-2-kernels bestaan al; wat niet bestaat, is een engine die beweert een benoemde GDN-2-hybride te serveren. Dat dat gat gedicht wordt, is het echte signaal.
• Een licentiewijziging — deze is gemakkelijk te missen. De referentiecode van Gated DeltaNet-2 wordt vrijgegeven onder de NVIDIA Source Code License-NC, die niet-commercieel is, terwijl de modelgewichten van Nemotron onder de NVIDIA Nemotron Open Model License vallen, wat niet het geval is. Een hybride die de twee combineerde, zou die spanning moeten oplossen, en hoe die dat oplost, vertelt je of het resultaat een onderzoeksartefact is of iets dat je zou kunnen deployen.
Twee dingen zouden de framing hier weerleggen. Als de "3B" in de naam iets anders blijkt te betekenen dan het totale aantal parameters — actieve parameters, of een aantal lagen, of simpelweg een codenaam — verandert de economische realiteit volledig. En als de uitdrukking "latent MoE" een gewoon MoE-blok blijkt te beschrijven, dan is dit een veel kleiner idee dan het lijkt: een Nano-herbewerking met een andere lineaire laag, geen nieuwe vorm.
Vragen die dit oproept
Hoe verschilt Gated DeltaNet-2 van de Gated DeltaNet die al in Qwen3.8 zit?
De eerdere Gated DeltaNet gebruikt één scalaire poort voor zowel wissen als schrijven; Gated DeltaNet-2 splitst deze in twee kanaalsgewijze poorten en voegt kanaalsgewijze decay toe, geleend van Kimi Delta Attention. Het is dus een strikte generalisatie in plaats van een vervanging, en het praktische verschil komt tot uiting bij retrieval, niet bij perplexiteit — het verschil op multi-key needle-in-a-haystack is veel groter dan het verschil op WikiText.
Waarom zou iemand Mamba-2 vervangen door GDN-2 in plaats van gewoon meer Mamba-2-lagen uit te brengen?
Omdat bij een gelijke grootte van de recurrente toestand de paper Gated DeltaNet-2 voorop meet op de retrievalltaken die long-context agentic workloads daadwerkelijk benutten, ten koste van een kleine constante overhead in doorvoer. Als je workload retrieval-intensief is, is die afweging gunstig; als die throughput-gebonden is bij korte context, is de Mamba-2-baseline het goedkopere antwoord. Een 3B-testbed is een verstandige manier om erachter te komen op welke van de twee je verkeer lijkt.
Betekent de open-sourcestatus van de onderdelen dat het model ook open zou zijn?
Nee. De gewichten van Nemotron-3 Nano zijn open en de referentiecode van Gated DeltaNet-2 is openbaar, maar geen van beide feiten verplicht iemand om een checkpoint te publiceren dat daaruit is gebouwd — en de niet-commerciële licentie op de GDN-2-code betekent dat een commerciële release een andere regeling zou vereisen. De plausibele uitkomsten variëren van een NVIDIA-onderzoeksrelease onder de Nemotron Open Model License tot iets dat nooit een intern cluster verlaat.
Is er iets om vandaag te proberen?
Ja, maar niet GDN-2-3B. De checkpoints van de Gated DeltaNet-2-paper zijn reproduceerbaar vanuit de NVlabs-repository op 1,3B op FineWeb-Edu, en Nemotron-3 Nano 30B-A3B en 4B draaien vandaag op vLLM, SGLang, TensorRT-LLM en llama.cpp. Als je een van beide helften test, weet je wat de andere helft waarschijnlijk zou doen — wat meer is dan wat de tweet je geeft.
Niets hiervan maakt GDN-2-3B echt. Het maakt het falsifieerbaar, wat het maximale is dat een enkele zin kan bieden: één configuratiebestand, één claim over een engine of één repository verwijderd van ofwel een echte release op korte termijn ofwel een plausibel klinkende recombinatie die nooit wordt gebouwd.
