
GDN-2-3B-läcka: en Nemotron-3 Nano-hybrid med Gated DeltaNet-2 i stället för Mamba-2
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 477 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
En enda mening som publicerades på X den 26 september 2026 utgör hela den offentliga dokumentationen av GDN-2-3B så här långt. Kontot @teortaxesTex skrev att "en releasekandidat på kort sikt är den hybrida latenta MoE-modellen GDN-2-3B, som följer Nemotron-3 Nano-arkitekturen men ersätter Mamba-2-lagren med GDN-2." Det är allt — inget Hugging Face-arkiv, ingen konfigurationsfil, ingen parametertabell, ingen namngiven byggare, inget datum. GDN-2-3B har inte släppts, och inget nedan bör läsas som om det hade släppts. Det som ändå gör raden värd att nysta i är att båda dess halvor nämner något verkligt och kontrollerbart: Gated DeltaNet-2 är en NVIDIA-publicerad linjär attention-arkitektur med en offentlig PyTorch-implementering och en omfattande portningshistorik genom TPU-, Triton- och ONNX-verktyg, och Nemotron-3 Nano är NVIDIAs levererade Mamba-2-hybrid med öppna vikter som den ryktade modellen ympas in på. Det här är en text om vad vi vet så här långt: arkitekturen är dokumenterad, modellen är ett rykte, och skillnaden mellan dessa två saker är hela historien.
Den korta versionen: Gated DeltaNet-2 ändrar hur en linjär-attentionsmodell redigerar sitt komprimerade minne, och dess uppmätta vinster slår hårdast mot exakt det långkontextsåtervinningsarbete som en liten hybrid köps in för. Nemotron-3 Nano är den minsta nivån i NVIDIAs nuvarande hybridfamilj och den som mest sannolikt skärs om med en billigare rekurrens. Lägg ihop dem och du har en trovärdig releasekandidat – och exakt en person som säger det.
Vad tweeten säger och inte säger
Läs meningen noga, för den är ovanligt tät och ovanligt tunn samtidigt. Den säger att kandidaten är hybrid (alltså mer än en lagertyp), 3B (ett parameterantal tillräckligt litet för att kunna köras på en konsument-GPU), och en latent MoE (en NVIDIA-expertroutningsdesign där tokens projiceras till en mindre latent dimension innan de når experterna, vilket är vad Super 120B- och Ultra 550B-nivåerna använder och vad den levererade Nano-nivån inte gör). Den säger att lagermönstret följer Nemotron-3 Nano. Och den säger att Mamba-2-lagren ersätts med GDN-2.
Vad den inte säger: vem som bygger den. "En nära förestående releasekandidat" har inget subjekt. Det är frestande att läsa in NVIDIA i det – GDN-2 är NVIDIA-forskning och Nemotron-3 Nano är en NVIDIA-modell, så kombinationen ser ut som ett internt experiment – men tweeten säger inte det, och en tredje part kan lagligt kombinera de två idag, eftersom vikterna för Nemotron-3 Nano är öppna och referenskoden för Gated DeltaNet-2 är offentlig. Betrakta byggaren som okänd.
Den säger inte heller när. ”Nära framtid” är den enda tidsangivelsen, och det är inte ett datum. Det finns ingen checkpoint att ladda ner, ingen inferensmotor som påstår sig betjäna den, och ingen benchmark för själva modellen någonstans. Varje siffra i den här artikeln tillhör Gated DeltaNet-2 eller Nemotron-3 Nano så som de publicerats separat. Ingen av dem tillhör GDN-2-3B.
Namnets två halvor, och varför de passar ihop
Gated DeltaNet-2 på en minut
Linjär attention ersätter den obegränsade KV-cachen i softmax-attention med ett återkommande tillstånd av fast storlek. Det svåra är inte att avgöra vad som ska glömmas — det är att redigera tillståndet utan att blanda ihop associationer som redan finns lagrade i det. Delta-regelmodeller subtraherar den aktuella läsningen innan de skriver ett nytt värde; Kimi Delta Attention skärpte glömmandet med kanalvis avklingning. Båda driver dock fortfarande två olika beslut utifrån en enda skalär grind: hur mycket gammalt innehåll som ska raderas på nyckelsidan, och hur mycket nytt innehåll som ska skrivas på värdesidan.
Gated DeltaNet-2, publicerad av NVIDIA-forskarna Ali Hatamizadeh, Yejin Choi och Jan Kautz (arXiv 2605.22791, referenskod i NVlabs-repositoriet), delar upp den skalären i två kanalvisa grindar – en raderingsgrind över nyckelsidiga koordinater och en skrivgrind över värdesidiga koordinater – och behåller den kanalvisa avklingningen. Artikelns inramning är att designen strikt generaliserar det som kom före: slår man ihop båda grindarna till samma skalär återfår man Kimi Delta Attention; slår man även ihop avklingningen återfår man den tidigare Gated DeltaNet. I ablation rapporterar NVIDIA att raderingsgrinden står för större delen av vinsten, vilket passar dess roll att skydda nyckelsidiga associationer från att skrivas över.
Beviset är en studie med matchade parametrar, inte en produkt: varje modell tränades med 1,3B parametrar på 100B FineWeb-Edu-tokens, med återkommande tillståndsstorlek hållen lika över Mamba-2, Gated DeltaNet, KDA och Mamba-3. I det återkommande upplägget uppnår Gated DeltaNet-2 gruppens bästa WikiText-perplexitet på 15,90 mot Mamba-2:s 16,79, och bästa genomsnittliga common sense-noggrannhet på 53,11 mot Mamba-3:s 52,39. I hybridupplägget – det som faktiskt liknar Nemotron-3 Nanos interleaved-mönster – är det 15,62 i WikiText-perplexitet och 53,97 i genomsnittlig noggrannhet, före Mamba-3 (15,81 / 52,72) och klart före en vanlig Transformer-baslinje (19,22 / 50,86).
Var fördelen koncentreras är den del som spelar roll för en liten modell med lång kontext. I RULER:s återkommande flernyckel-nål-i-höstack-test vid 4K får Gated DeltaNet-2 37,8 mot 27,8 för den äldre Gated DeltaNet och 28,0 för KDA; i enkelnålstestet vid 2K får den 89,8 mot 54,2. I genomsnitt över sex verkliga hämtningsset (SWDE, SQuAD, FDA, TriviaQA, NQ, DROP) står den i spetsen för den återkommande frontlinjen med 29,88 mot Mamba-2:s 26,84, och för hybridfrontlinjen med 42,28 mot 40,14 för KDA. NVIDIA rapporterar också nästan platt skalning av genomströmningen med sekvenslängden på en enda H100, med bara en liten konstant overhead jämfört med KDA för de extra grindarna. Det här är leverantörssiffror från artikelns egna tabeller, inte reproducerade av oss.

Nemotron-3 Nano-ritningen
Nemotron-3 Nano är en hybrid av Mamba-Transformer och Mixture-of-Experts, och det är arkitekturen som lånas, inte modellen. Versionen 30B-A3B har 52 lager: 23 Mamba-2-lager, 23 MoE-lager och sex lager för grouped-query attention, med 128 routade experter plus en delad expert per MoE-block och sex aktiva experter per token. Den har 3,5B aktiva parametrar mot 30B totalt, förtränades på 25 biljoner tokens och stöder kontextfönster på upp till 1M tokens; NVIDIA:s egen tekniska rapport hävdar upp till 3,3x högre inferensgenomströmning än öppna modeller av liknande storlek, såsom GPT-OSS-20B och Qwen3-30B-A3B-Thinking-2507. Den släpps under NVIDIA Nemotron Open Model License och är uttryckligen godkänd för kommersiellt bruk.
Det finns ett mindre syskon värt att känna till, eftersom "3B" i det ryktade namnet ligger nära det: Nemotron-3 Nano 4B, komprimerad från NVIDIA-Nemotron-Nano-9B-v2 med hjälp av NVIDIAs Elastic-ramverk, är "i första hand Mamba-2- och MLP-lager kombinerade med bara fyra Attention-lager." Så Nano-nivån är redan den del av familjen som pressas och skärs om. Det är den enskilt mest troliga anledningen till att en experimentell 3B-variant överhuvudtaget skulle existera.
Två diskrepanser är värda att påpeka snarare än att släta över. För det första är det i den levererade familjen de stora nivåerna — Nemotron-3 Super 120B-A12B och Nemotron-3 Ultra 550B-A55B — som använder latent MoE; Nano-nivån gör det inte. En "Nano-formad MoE" är därför inte en direkt portning av en befintlig nivås idéer, utan en rekombination av två nivåers idéer, vilket är precis den typ av sak som dyker upp i forskningscheckpoints innan den dyker upp i en produkt. För det andra är Nano-familjens MoE-block dense-expert-routade; att gå över till latent routing förändrar FLOP-profilen för varje expertlager, så en 3B-beteckning skulle säga dig väldigt lite om vad modellen faktiskt kostar att köra förrän en konfigfil dyker upp.
Porteringsspåret är verkligt — modellen är det inte.
Det som kan verifieras är att Gated DeltaNet-2 snabbt anpassas till produktionskörtidsmiljöer. Den 23 september 2026 lade en pull request till OpenXLAs Tokamax-repositorium till en Gated Delta Net 2 Pallas-kernel och operator för TPU, inklusive en autograd-bakåtpassning över sex indata och benchmarkresultat på Cloud TPU v7x. Flash Linear Attention har haft fusionerade GDN-2-prefill-kernels sedan slutet av juni – pull requesten där rapporterar en genomsnittlig prefill-acceleration på 2,48x och ett bästa fall på 5,13x på en H100 – med uppföljningar i september som åtgärdade en gate-ordningsbugg och optimerade chunk-träningsvägen. ONNX har en öppen specifikationslucka registrerad mot sig, eftersom opset 27:s LinearAttention-operator inte kan uttrycka GDN-2:s kanalvisa raderingsgate. Och NVIDIAs egen Megatron-Bridge lade till FLOPs-redovisning för både hybrida GDN-lager och latent-MoE-komprimering i mars.
Inget av det är en modellrelease, och det vore ett misstag att läsa det som en. Kernelarbete är infrastruktur; det säger att en arkitektur tas på allvar, inte att en checkpoint finns. Vad det däremot ger dig är en konkret sak att hålla koll på: om en GDN-2-hybrid verkligen når världen, kommer den att dyka upp som stöd i en serveringsmotor först och som ett tillkännagivande sedan, och motorstödet finns redan delvis på plats. Arbetet med Tokamax och Flash Linear Attention är också det starkaste argumentet för att kombinationen i tweeten är tekniskt sammanhängande snarare än påhittad – de delar som behövs för att serva en GDN-2-hybrid byggs av personer som inte är personen som skrev tweeten.

Varför en 3B GDN-2-hybrid skulle ha betydelse om den släpps
Argumentet för kombinationen är ekonomiskt snarare än benchmarkdrivet. En hybrid i 3B-klassen med ett återkommande tillstånd av fast storlek är en modell som du kan köra på en enda konsument-GPU utan en KV-cache som växer med din prompt, vilket är samma avvägning som Nemotron-3 Nano 4B redan gör. Att byta ut Mamba-2-lagren mot GDN-2 ger, enligt artikelns siffror, bättre multi-key-retrieval och bättre genomsnitt för retrieval i verkliga scenarier vid matchad tillståndsstorlek – de två områden där den äldre delta-regelfamiljen var svagast. Det är en riktad uppgradering, inte en generationsuppgradering, och det är en sådan förändring som skulle vara värd 3B parametrar.
Det är också en påminnelse om att den intressanta konkurrensen bland små modeller har flyttats från parameterantal till minnesdesign. En 3B-modell vars rekurrenta tillstånd är en fixerad tensor beter sig annorlunda vid långa prompter än en 3B-transformer med en kvantiserad KV-cache: minnet är konstant, men modellen har en fast budget för vad den kan komma ihåg, och hur elegant den glömmer är nu specifikationen. Gated DeltaNet-2:s hela bidrag är en bättre glömskeregel. Det gör den till en design som är värd att följa på sina egna villkor, även om GDN-2-3B aldrig dyker upp under det namnet.
Hur du faktiskt skulle testa något sådant här
När en obeprövad arkitektur når en serving-runtime är hindret för de flesta team inte benchmark-tabellen – det är att ett införande innebär en ny integration, ett nytt kontrakt och ett nytt felläge, allt mot en modell utan produktionshistorik. Det är ett routingproblem innan det är ett modellproblem. En aggregator som lägger en ny endpoint bakom samma nyckel som du redan använder gör att du kan skicka en del av den verkliga trafiken till den, behålla din befintliga modell som fallback och låta automatisk failover fånga felen medan den nya rutten fortfarande är ostadig – ett API över 200+ modeller till leverantörens listpris med 0 % påslag, så priset du fick är priset du betalar och en leverantörsprissänkning syns samma dag i stället för på nästa faktura. GDN-2-3B hostas inte någonstans, varken av oss eller någon annan; det är vad "unreleased" betyder. Poängen är mönstret du skulle använda den dag det väl är.
Om du vill se vilka hybrid- och långkontextmodeller som går att routa i dag, live-modellkatalogen är den ärliga listan – den markerar vad som faktiskt går att serva snarare än vad som har annonserats.

Vad man bör hålla utkik efter, och vad som skulle falsifiera detta
Läckan löses på ett av tre sätt, och vart och ett har ett avslöjande tecken:
• En konfigurationsfil — den enskilt starkaste bekräftelsen skulle vara en konfiguration i Nemotron-H-stil som listar GDN-2-lagertyper i ett hybrid-överstyrningsmönster. Tills en sådan config.json finns är allt en slutledning från en mening.
• Motorstöd för en specifik checkpoint — GDN-2-kärnor finns redan; vad som inte finns är någon motor som påstår sig betjäna en namngiven GDN-2-hybrid. Att gapet stängs är den verkliga signalen.
• En licensändring — den här är lätt att missa. Referenskoden för Gated DeltaNet-2 släpps under NVIDIA Source Code License-NC, som är icke-kommersiell, medan Nemotron-modellvikter distribueras under NVIDIA Nemotron Open Model License, som inte är det. En hybrid som kombinerade de två skulle behöva lösa den motsättningen, och hur den löser den avgör om resultatet är en forskningsartefakt eller något du skulle kunna driftsätta.
Två saker skulle motbevisa inramningen här. Om "3B" i namnet visar sig betyda något annat än totala parametrar – aktiva parametrar, eller ett lagerantal, eller helt enkelt ett kodnamn – förändras ekonomin helt. Och om frasen "latent MoE" visar sig beskriva ett vanligt MoE-block, då är detta en mycket mindre idé än den verkar: en omklippt Nano med ett annat linjärt lager, inte en ny form.
Frågor detta väcker
Hur skiljer sig Gated DeltaNet-2 från Gated DeltaNet som redan finns i Qwen3.8?
Den tidigare Gated DeltaNet använder en enda skalär grind för både radering och skrivning; Gated DeltaNet-2 delar upp den i två kanalvisa grindar och lägger till kanalvis avklingning lånad från Kimi Delta Attention. Så det är en strikt generalisering snarare än en ersättning, och den praktiska skillnaden visar sig i hämtning, inte i perplexitet — gapet på multi-key needle-in-a-haystack är mycket bredare än gapet på WikiText.
Varför skulle någon byta ut Mamba-2 mot GDN-2 i stället för att bara släppa fler Mamba-2-lager?
Eftersom Gated DeltaNet-2 vid matchad återkommande tillståndsstorlek enligt artikeln mäts ligga före på de hämtningsuppgifter som långkontextiga agentiska arbetsbelastningar faktiskt använder, till priset av en liten konstant overhead i genomströmning. Om din arbetsbelastning är hämtningstung är den avvägningen fördelaktig; om den är genomströmningsbegränsad vid kort kontext är Mamba-2-baslinjen det billigare svaret. En 3B-testbädd är ett förnuftigt sätt att ta reda på vilken av dem din trafik liknar.
Innebär delarnas status som öppen källkod att även modellen skulle vara öppen?
Nej. Vikterna för Nemotron-3 Nano är öppna och referenskoden för Gated DeltaNet-2 är offentlig, men inget av detta tvingar någon att publicera en checkpoint byggd utifrån dem – och den icke-kommersiella licensen för GDN-2-koden innebär att en kommersiell utgivning skulle kräva en annan överenskommelse. De tänkbara utfallen sträcker sig från en forskningsrelease från NVIDIA under Nemotron Open Model License till något som aldrig lämnar ett internt kluster.
Finns det något att prova idag?
Ja, men inte GDN-2-3B. Gated DeltaNet-2-artikelns checkpoints kan reproduceras från NVlabs-repositoriet vid 1,3B på FineWeb-Edu, och Nemotron-3 Nano 30B-A3B och 4B körs på vLLM, SGLang, TensorRT-LLM och llama.cpp idag. Att testa endera halvan säger dig vad den andra halvan förmodligen skulle göra — vilket är mer än vad tweeten ger dig.
Inget av detta gör GDN-2-3B verkligt. Det gör det falsifierbart, vilket är det mesta en enda mening kan erbjuda: en konfigurationsfil, ett motorpåstående eller ett repository bort från att antingen vara en genuin release inom kort eller en trovärdigt klingande rekombination som aldrig blir byggd.
